Saltar al contenido
GenLovers

Pruébalo: voz a texto

Graba o sube un audio corto y recibe una transcripción de Parakeet, un modelo abierto de voz a texto que se ejecuta en directo en nuestra propia máquina.

Pruébalo: voz a texto

Graba o sube un audio corto y recibe una transcripción de Parakeet, un modelo abierto de voz a texto que se ejecuta en directo en nuestra propia máquina.

Comprobando el servidor
o sube un archivo

Detecta mejor inglés y español; otros idiomas europeos funcionan pero con menos fiabilidad, y no admite mandarín.

Ejecutar voz a texto en tu propia máquina

La demo en vivo ejecuta Parakeet en un servidor pequeño, así que a veces está fuera de línea. Parakeet es un modelo abierto de reconocimiento de voz de NVIDIA que funciona con una CPU normal. Un script lo instala y transcribe un archivo WAV en tu ordenador.

Qué necesitas

Python
Versión 3.10 o superior. Descárgala de python.org si no la tienes.
Hardware
Solo CPU. No hace falta tarjeta gráfica.
Espacio en disco
Unos 640 MB para el modelo, más los paquetes de Python.
Entrada
Un archivo WAV. Graba uno con cualquier grabadora de voz o expórtalo desde tu editor de audio.
Internet
Solo la primera vez, para instalar los paquetes y descargar el modelo.
Probado en
Windows 11 con Python 3.13. Escrito para Windows, Mac y Linux, pero de momento solo se ha ejecutado en Windows.
Descargar setup_speech_to_text.py
  1. Instala Python

    Sáltate este paso si ya tienes Python 3.10 o superior. Compruébalo con el comando de abajo e instálalo desde python.org si falla. En Mac y Linux el comando puede ser python3.

    python --version
  2. Descarga el script

    Usa el botón de arriba y guarda el archivo en la carpeta que contiene tu grabación.

  3. Ejecuta un comando

    Abre una terminal en esa carpeta y pásale tu grabación. La primera vez instala onnx-asr en un entorno privado y descarga el modelo Parakeet (una versión int8), así que dale unos minutos.

    python setup_speech_to_text.py recording.wav
  4. Lee la transcripción

    La transcripción se muestra en la terminal y se guarda junto al audio como recording.txt.

Qué hace bien Parakeet y qué no

Parakeet TDT 0.6B v3 es el modelo abierto de reconocimiento de voz de NVIDIA. El script ejecuta una versión int8 a través del paquete onnx-asr, que funciona con una CPU y devuelve una transcripción con puntuación.

Detecta el idioma por sí solo y cubre idiomas europeos. El inglés y el español son donde mejor rinde. Otros idiomas europeos funcionan pero con menos fiabilidad, y el mandarín no está soportado.

El script espera un archivo WAV. Si tu grabación es un MP3, M4A o WebM, conviértela antes a WAV con una herramienta gratuita como ffmpeg o Audacity.

Nada sale de tu máquina tras la instalación, lo que encaja con grabaciones privadas como entrevistas o notas de voz.

Preguntas frecuentes

¿Este voz a texto es gratis?
Sí. Parakeet es de código abierto y funciona en tu ordenador, así que no hay cuenta, suscripción ni límite de minutos.
¿Qué idiomas soporta?
Detecta el idioma automáticamente y cubre idiomas europeos. El inglés y el español funcionan mejor, otros idiomas europeos son menos fiables y el mandarín no está soportado.
¿Mi audio se sube a algún sitio?
No. La transcripción se ejecuta en local. Solo la primera vez se usa internet, para instalar paquetes y descargar el modelo.
¿Cómo transcribo un MP3?
Conviértelo antes a WAV, por ejemplo con ffmpeg (ffmpeg -i talk.mp3 talk.wav), y ejecuta el script sobre el archivo WAV.
¿Cómo lo desinstalo?
Borra la carpeta genlovers-tools/speech-to-text de tu directorio personal. El modelo en sí se guarda en tu carpeta de caché de Hugging Face (.cache/huggingface).