Aller au contenu
GenLovers

Essayez : texte vers parole

Tapez une courte phrase et écoutez-la lue par Kokoro, un modèle de synthèse vocale ouvert. Gratuit, sur notre propre machine, sans compte.

Essayez : texte vers parole

Tapez une courte phrase et écoutez-la lue par Kokoro, un modèle de synthèse vocale ouvert. Gratuit, sur notre propre machine, sans compte.

Vérification du serveur
1.00×

300 caractères maximum. L'audio est supprimé sous une heure.

0/300

Lancer la synthèse vocale sur votre propre machine

La démo en ligne fait tourner Kokoro sur un petit serveur, elle est donc parfois hors ligne. Kokoro est un modèle ouvert de synthèse vocale qui tourne sur un processeur ordinaire. Un script le télécharge et transforme une ligne de texte en fichier WAV sur votre ordinateur.

Ce qu'il vous faut

Python
Version 3.10 ou plus récente. Téléchargez-la sur python.org si besoin.
Matériel
Processeur seul. Aucune carte graphique nécessaire.
Espace disque
Environ 325 Mo pour les fichiers du modèle Kokoro, plus les paquets Python.
Internet
Seulement au premier lancement, pour installer les paquets et récupérer les fichiers du modèle.
Testé sur
Windows 11 avec Python 3.13. Écrit pour Windows, Mac et Linux, mais lancé uniquement sur Windows pour l'instant.
Télécharger setup_text_to_speech.py
  1. Installer Python

    Passez cette étape si vous avez déjà Python 3.10 ou plus récent. Vérifiez avec la commande ci-dessous, et installez-le depuis python.org si elle échoue. Sur Mac et Linux, la commande peut être python3.

    python --version
  2. Télécharger le script

    Utilisez le bouton ci-dessus et enregistrez le fichier dans le dossier de votre choix.

  3. Lancer une commande

    Ouvrez un terminal dans ce dossier et donnez-lui une phrase à dire. Le premier lancement installe kokoro-onnx dans un environnement privé et télécharge les fichiers du modèle, prévoyez donc quelques minutes.

    python setup_text_to_speech.py "Bonjour depuis ma machine" --lang fr-fr --voice ff_siwis
  4. Écouter le résultat

    L'audio est enregistré sous le nom speech.wav dans le même dossier. Ouvrez-le avec n'importe quel lecteur.

  5. Changer la voix, la langue ou la vitesse

    Ajoutez des options pour choisir une voix, un code de langue (en-us, en-gb, fr-fr, es, it, pt-br ou hi), une vitesse de 0,5 à 2,0 et un nom de fichier de sortie.

    python setup_text_to_speech.py "Hello there" --lang en-gb --voice bf_emma --speed 1.1 --out hello.wav

Ce que Kokoro apporte, et ses limites

Kokoro est un modèle de synthèse vocale à poids ouverts qui tourne sur un processeur. Le script utilise sa version ONNX via le paquet kokoro-onnx. Il couvre l'anglais (américain et britannique), l'espagnol, le français, l'hindi, l'italien et le portugais du Brésil, avec un jeu de voix différent pour chaque langue.

Limitez chaque lancement à quelques phrases. La démo en ligne plafonne le texte à 300 caractères. Pour un long script, découpez-le en paragraphes et lancez la commande une fois par paragraphe.

Le japonais et le chinois ne sont pas couverts par ce script. Ils demandent des paquets de langue supplémentaires qu'il n'installe pas. Sur certaines configurations Linux, Kokoro a aussi besoin du paquet système espeak-ng.

Questions fréquentes

Cette synthèse vocale est-elle gratuite ?
Oui. Kokoro est open source et tourne sur votre propre ordinateur, donc pas de compte, pas d'abonnement, pas de quota de caractères.
L'audio quitte-t-il mon ordinateur ?
Non. Le texte est transformé en voix en local. Seul le premier lancement utilise internet, pour installer les paquets et récupérer les fichiers du modèle.
Quelles voix et quelles langues puis-je utiliser ?
Anglais (américain et britannique), espagnol, français, hindi, italien et portugais du Brésil. Choisissez la langue avec --lang et la voix avec --voice. La démo en ligne liste les noms de voix de chaque langue.
Comment le désinstaller ?
Supprimez le dossier genlovers-tools/text-to-speech de votre répertoire personnel. Il contient l'environnement privé et les fichiers du modèle.