Essayez : parole vers texte
Enregistrez ou envoyez un court extrait et obtenez sa transcription via Parakeet, un modèle ouvert de reconnaissance vocale exécuté en direct sur notre propre machine.
Essayez : parole vers texte
Enregistrez ou envoyez un court extrait et obtenez sa transcription via Parakeet, un modèle ouvert de reconnaissance vocale exécuté en direct sur notre propre machine.
Lancer la transcription vocale sur votre propre machine
La démo en ligne fait tourner Parakeet sur un petit serveur, elle est donc parfois hors ligne. Parakeet est un modèle ouvert de reconnaissance vocale de NVIDIA qui tourne sur un processeur ordinaire. Un script l'installe et transcrit un fichier WAV sur votre ordinateur.
Ce qu'il vous faut
- Python
- Version 3.10 ou plus récente. Téléchargez-la sur python.org si besoin.
- Matériel
- Processeur seul. Aucune carte graphique nécessaire.
- Espace disque
- Environ 640 Mo pour le modèle, plus les paquets Python.
- Entrée
- Un fichier WAV. Enregistrez-en un avec n'importe quel enregistreur vocal, ou exportez-en un depuis votre éditeur audio.
- Internet
- Seulement au premier lancement, pour installer les paquets et télécharger le modèle.
- Testé sur
- Windows 11 avec Python 3.13. Écrit pour Windows, Mac et Linux, mais lancé uniquement sur Windows pour l'instant.
Installer Python
Passez cette étape si vous avez déjà Python 3.10 ou plus récent. Vérifiez avec la commande ci-dessous, et installez-le depuis python.org si elle échoue. Sur Mac et Linux, la commande peut être python3.
python --versionTélécharger le script
Utilisez le bouton ci-dessus et enregistrez le fichier dans le dossier qui contient votre enregistrement.
Lancer une commande
Ouvrez un terminal dans ce dossier et donnez-lui votre enregistrement. Le premier lancement installe onnx-asr dans un environnement privé et télécharge le modèle Parakeet (une version int8), prévoyez donc quelques minutes.
python setup_speech_to_text.py recording.wavLire la transcription
La transcription s'affiche dans le terminal et est enregistrée à côté de l'audio sous le nom recording.txt.
Ce que Parakeet fait bien, et ses limites
Parakeet TDT 0.6B v3 est le modèle ouvert de reconnaissance vocale de NVIDIA. Le script en exécute une version int8 via le paquet onnx-asr, qui fonctionne sur un processeur et renvoie une transcription ponctuée.
Il détecte la langue tout seul et couvre les langues européennes. L'anglais et l'espagnol sont ses points forts. Les autres langues européennes fonctionnent mais moins fiablement, et le mandarin n'est pas pris en charge.
Le script attend un fichier WAV. Si votre enregistrement est un MP3, M4A ou WebM, convertissez-le d'abord en WAV avec un outil gratuit comme ffmpeg ou Audacity.
Rien ne quitte votre machine après l'installation, ce qui convient aux enregistrements privés comme des entretiens ou des mémos vocaux.
Questions fréquentes
- Cette transcription vocale est-elle gratuite ?
- Oui. Parakeet est open source et tourne sur votre ordinateur, donc pas de compte, pas d'abonnement, pas de limite de minutes.
- Quelles langues prend-il en charge ?
- Il détecte la langue automatiquement et couvre les langues européennes. L'anglais et l'espagnol donnent les meilleurs résultats, les autres langues européennes sont moins fiables, et le mandarin n'est pas pris en charge.
- Mon audio est-il envoyé quelque part ?
- Non. La transcription tourne en local. Seul le premier lancement utilise internet, pour installer les paquets et télécharger le modèle.
- Comment transcrire un MP3 ?
- Convertissez-le d'abord en WAV, par exemple avec ffmpeg (ffmpeg -i talk.mp3 talk.wav), puis lancez le script sur le fichier WAV.
- Comment le désinstaller ?
- Supprimez le dossier genlovers-tools/speech-to-text de votre répertoire personnel. Le modèle lui-même est stocké dans votre dossier de cache Hugging Face (.cache/huggingface).
