Pruébalo: voz a texto
Graba o sube un audio corto y recibe una transcripción de Parakeet, un modelo abierto de voz a texto que se ejecuta en directo en nuestra propia máquina.
Pruébalo: voz a texto
Graba o sube un audio corto y recibe una transcripción de Parakeet, un modelo abierto de voz a texto que se ejecuta en directo en nuestra propia máquina.
Ejecutar voz a texto en tu propia máquina
La demo en vivo ejecuta Parakeet en un servidor pequeño, así que a veces está fuera de línea. Parakeet es un modelo abierto de reconocimiento de voz de NVIDIA que funciona con una CPU normal. Un script lo instala y transcribe un archivo WAV en tu ordenador.
Qué necesitas
- Python
- Versión 3.10 o superior. Descárgala de python.org si no la tienes.
- Hardware
- Solo CPU. No hace falta tarjeta gráfica.
- Espacio en disco
- Unos 640 MB para el modelo, más los paquetes de Python.
- Entrada
- Un archivo WAV. Graba uno con cualquier grabadora de voz o expórtalo desde tu editor de audio.
- Internet
- Solo la primera vez, para instalar los paquetes y descargar el modelo.
- Probado en
- Windows 11 con Python 3.13. Escrito para Windows, Mac y Linux, pero de momento solo se ha ejecutado en Windows.
Instala Python
Sáltate este paso si ya tienes Python 3.10 o superior. Compruébalo con el comando de abajo e instálalo desde python.org si falla. En Mac y Linux el comando puede ser python3.
python --versionDescarga el script
Usa el botón de arriba y guarda el archivo en la carpeta que contiene tu grabación.
Ejecuta un comando
Abre una terminal en esa carpeta y pásale tu grabación. La primera vez instala onnx-asr en un entorno privado y descarga el modelo Parakeet (una versión int8), así que dale unos minutos.
python setup_speech_to_text.py recording.wavLee la transcripción
La transcripción se muestra en la terminal y se guarda junto al audio como recording.txt.
Qué hace bien Parakeet y qué no
Parakeet TDT 0.6B v3 es el modelo abierto de reconocimiento de voz de NVIDIA. El script ejecuta una versión int8 a través del paquete onnx-asr, que funciona con una CPU y devuelve una transcripción con puntuación.
Detecta el idioma por sí solo y cubre idiomas europeos. El inglés y el español son donde mejor rinde. Otros idiomas europeos funcionan pero con menos fiabilidad, y el mandarín no está soportado.
El script espera un archivo WAV. Si tu grabación es un MP3, M4A o WebM, conviértela antes a WAV con una herramienta gratuita como ffmpeg o Audacity.
Nada sale de tu máquina tras la instalación, lo que encaja con grabaciones privadas como entrevistas o notas de voz.
Preguntas frecuentes
- ¿Este voz a texto es gratis?
- Sí. Parakeet es de código abierto y funciona en tu ordenador, así que no hay cuenta, suscripción ni límite de minutos.
- ¿Qué idiomas soporta?
- Detecta el idioma automáticamente y cubre idiomas europeos. El inglés y el español funcionan mejor, otros idiomas europeos son menos fiables y el mandarín no está soportado.
- ¿Mi audio se sube a algún sitio?
- No. La transcripción se ejecuta en local. Solo la primera vez se usa internet, para instalar paquetes y descargar el modelo.
- ¿Cómo transcribo un MP3?
- Conviértelo antes a WAV, por ejemplo con ffmpeg (ffmpeg -i talk.mp3 talk.wav), y ejecuta el script sobre el archivo WAV.
- ¿Cómo lo desinstalo?
- Borra la carpeta genlovers-tools/speech-to-text de tu directorio personal. El modelo en sí se guarda en tu carpeta de caché de Hugging Face (.cache/huggingface).
