Pruébalo: texto a voz
Escribe una frase corta y escúchala leída por Kokoro, un modelo de voz abierto. Gratis, en nuestra propia máquina y sin cuenta.
Pruébalo: texto a voz
Escribe una frase corta y escúchala leída por Kokoro, un modelo de voz abierto. Gratis, en nuestra propia máquina y sin cuenta.
Ejecutar texto a voz en tu propia máquina
La demo en vivo ejecuta Kokoro en un servidor pequeño, así que a veces está fuera de línea. Kokoro es un modelo abierto de texto a voz que funciona con una CPU normal. Un script lo descarga y convierte una línea de texto en un archivo WAV en tu ordenador.
Qué necesitas
- Python
- Versión 3.10 o superior. Descárgala de python.org si no la tienes.
- Hardware
- Solo CPU. No hace falta tarjeta gráfica.
- Espacio en disco
- Unos 325 MB para los archivos del modelo Kokoro, más los paquetes de Python.
- Internet
- Solo la primera vez, para instalar los paquetes y descargar los archivos del modelo.
- Probado en
- Windows 11 con Python 3.13. Escrito para Windows, Mac y Linux, pero de momento solo se ha ejecutado en Windows.
Instala Python
Sáltate este paso si ya tienes Python 3.10 o superior. Compruébalo con el comando de abajo e instálalo desde python.org si falla. En Mac y Linux el comando puede ser python3.
python --versionDescarga el script
Usa el botón de arriba y guarda el archivo en cualquier carpeta.
Ejecuta un comando
Abre una terminal en esa carpeta y dale una frase para decir. La primera vez instala kokoro-onnx en un entorno privado y descarga los archivos del modelo, así que dale unos minutos.
python setup_text_to_speech.py "Hola desde mi máquina" --lang es --voice ef_doraEscucha el resultado
El audio se guarda como speech.wav en la misma carpeta. Ábrelo con cualquier reproductor.
Cambia la voz, el idioma o la velocidad
Añade opciones para elegir una voz, un código de idioma (en-us, en-gb, fr-fr, es, it, pt-br o hi), una velocidad de 0,5 a 2,0 y un nombre de archivo de salida.
python setup_text_to_speech.py "Hello there" --lang en-gb --voice bf_emma --speed 1.1 --out hello.wav
Qué te da Kokoro y cuáles son sus límites
Kokoro es un modelo de texto a voz de pesos abiertos que funciona con una CPU. El script usa su versión ONNX a través del paquete kokoro-onnx. Cubre inglés (EE. UU. y Reino Unido), español, francés, hindi, italiano y portugués de Brasil, con un conjunto de voces distinto para cada idioma.
Limita cada ejecución a unas pocas frases. La demo alojada limita el texto a 300 caracteres. Para un guion largo, divídelo en párrafos y ejecuta el comando una vez por párrafo.
El japonés y el chino no están cubiertos por este script. Necesitan paquetes de idioma adicionales que no instala. En algunas configuraciones de Linux, Kokoro también necesita el paquete del sistema espeak-ng.
Preguntas frecuentes
- ¿Este texto a voz es gratis?
- Sí. Kokoro es de código abierto y funciona en tu propio ordenador, así que no hay cuenta, suscripción ni cuota de caracteres.
- ¿El audio sale de mi ordenador?
- No. El texto se convierte en voz en local. Solo la primera vez se usa internet, para instalar paquetes y descargar los archivos del modelo.
- ¿Qué voces e idiomas puedo usar?
- Inglés (EE. UU. y Reino Unido), español, francés, hindi, italiano y portugués de Brasil. Elige el idioma con --lang y la voz con --voice. La demo en vivo lista los nombres de voz de cada idioma.
- ¿Cómo lo desinstalo?
- Borra la carpeta genlovers-tools/text-to-speech de tu directorio personal. Contiene el entorno privado y los archivos del modelo.
