Saltar al contenido
GenLovers

Pruébalo: texto a voz

Escribe una frase corta y escúchala leída por Kokoro, un modelo de voz abierto. Gratis, en nuestra propia máquina y sin cuenta.

Pruébalo: texto a voz

Escribe una frase corta y escúchala leída por Kokoro, un modelo de voz abierto. Gratis, en nuestra propia máquina y sin cuenta.

Comprobando el servidor
1.00×

Hasta 300 caracteres. El audio se borra en menos de una hora.

0/300

Ejecutar texto a voz en tu propia máquina

La demo en vivo ejecuta Kokoro en un servidor pequeño, así que a veces está fuera de línea. Kokoro es un modelo abierto de texto a voz que funciona con una CPU normal. Un script lo descarga y convierte una línea de texto en un archivo WAV en tu ordenador.

Qué necesitas

Python
Versión 3.10 o superior. Descárgala de python.org si no la tienes.
Hardware
Solo CPU. No hace falta tarjeta gráfica.
Espacio en disco
Unos 325 MB para los archivos del modelo Kokoro, más los paquetes de Python.
Internet
Solo la primera vez, para instalar los paquetes y descargar los archivos del modelo.
Probado en
Windows 11 con Python 3.13. Escrito para Windows, Mac y Linux, pero de momento solo se ha ejecutado en Windows.
Descargar setup_text_to_speech.py
  1. Instala Python

    Sáltate este paso si ya tienes Python 3.10 o superior. Compruébalo con el comando de abajo e instálalo desde python.org si falla. En Mac y Linux el comando puede ser python3.

    python --version
  2. Descarga el script

    Usa el botón de arriba y guarda el archivo en cualquier carpeta.

  3. Ejecuta un comando

    Abre una terminal en esa carpeta y dale una frase para decir. La primera vez instala kokoro-onnx en un entorno privado y descarga los archivos del modelo, así que dale unos minutos.

    python setup_text_to_speech.py "Hola desde mi máquina" --lang es --voice ef_dora
  4. Escucha el resultado

    El audio se guarda como speech.wav en la misma carpeta. Ábrelo con cualquier reproductor.

  5. Cambia la voz, el idioma o la velocidad

    Añade opciones para elegir una voz, un código de idioma (en-us, en-gb, fr-fr, es, it, pt-br o hi), una velocidad de 0,5 a 2,0 y un nombre de archivo de salida.

    python setup_text_to_speech.py "Hello there" --lang en-gb --voice bf_emma --speed 1.1 --out hello.wav

Qué te da Kokoro y cuáles son sus límites

Kokoro es un modelo de texto a voz de pesos abiertos que funciona con una CPU. El script usa su versión ONNX a través del paquete kokoro-onnx. Cubre inglés (EE. UU. y Reino Unido), español, francés, hindi, italiano y portugués de Brasil, con un conjunto de voces distinto para cada idioma.

Limita cada ejecución a unas pocas frases. La demo alojada limita el texto a 300 caracteres. Para un guion largo, divídelo en párrafos y ejecuta el comando una vez por párrafo.

El japonés y el chino no están cubiertos por este script. Necesitan paquetes de idioma adicionales que no instala. En algunas configuraciones de Linux, Kokoro también necesita el paquete del sistema espeak-ng.

Preguntas frecuentes

¿Este texto a voz es gratis?
Sí. Kokoro es de código abierto y funciona en tu propio ordenador, así que no hay cuenta, suscripción ni cuota de caracteres.
¿El audio sale de mi ordenador?
No. El texto se convierte en voz en local. Solo la primera vez se usa internet, para instalar paquetes y descargar los archivos del modelo.
¿Qué voces e idiomas puedo usar?
Inglés (EE. UU. y Reino Unido), español, francés, hindi, italiano y portugués de Brasil. Elige el idioma con --lang y la voz con --voice. La demo en vivo lista los nombres de voz de cada idioma.
¿Cómo lo desinstalo?
Borra la carpeta genlovers-tools/text-to-speech de tu directorio personal. Contiene el entorno privado y los archivos del modelo.