|

POCKET TTS : une voix locale rapide, sans GPU ni API distante

https://github.com/kyutai-labs/pocket-tts

https://kyutai.org/blog/2026-01-13-pocket-tts

📌 Pocket TTS est un moteur de synthèse vocale qui tourne sur CPU, avec clonage de voix, streaming audio et faible latence. Si vous cherchez un TTS local qui se comporte comme un composant sérieux, pas comme une démo fragile, c’est clairement un projet à regarder.

Ce que Kyutai propose ici est assez net: un modèle d’environ 100 millions de paramètres, une première tranche audio en environ 200 ms, et un débit annoncé autour de 6x le temps réel sur un MacBook Air M4. Pour un usage local, c’est très convaincant. On ne parle pas d’une brique lourde qui exige une GPU farm, mais d’un modèle pensé pour rester utilisable sur une machine normale.

Le point important, c’est l’accès. Vous pouvez tester la synthèse directement dans le navigateur, lancer pocket-tts generate en CLI, ou garder le modèle chargé avec pocket-tts serve. Il existe aussi une API Python, ce qui ouvre la porte aux scripts, assistants locaux, outils d’accessibilité ou produits qui ont besoin de voix sans appeler un service tiers à chaque requête.

  • ⚡ CPU natif, sans version GPU de PyTorch requise
  • 🎙️ Clonage de voix à partir d’un échantillon audio ou d’un fichier
  • 🌍 Support multilingue: anglais, français, allemand, portugais, italien, espagnol
  • 🧵 Streaming audio pour commencer à parler vite
  • 🛠️ CLI, serveur local, API Python et export de voix

Je trouve l’approche très saine. Pocket TTS ne cherche pas à être une plateforme vocale complète. Il fait une chose et il la fait bien: transformer du texte en parole avec un modèle compact, réutilisable, et facile à intégrer. Les commandes sont claires, le serveur local garde le modèle en mémoire, et l’export d’état de voix en safetensors montre que le projet pense aussi aux usages répétés.

La liste des voix prêtes à l’emploi est longue, et vous pouvez aussi fournir votre propre sample pour du voice cloning. Kyutai précise d’ailleurs que la qualité du résultat dépend aussi de la qualité de l’audio source, ce qui est honnête. Le projet va même jusqu’à documenter les usages interdits, notamment l’usurpation vocale sans consentement. C’est essentiel sur ce type de techno.

Ce qui me plaît surtout, c’est la place que Pocket TTS occupe entre recherche et produit. Ce n’est pas juste un modèle publié. C’est une base réutilisable, déjà exploitée dans des ports navigateur, des serveurs OpenAI-compatible, des apps macOS et des outils d’accessibilité. Quand un modèle inspire déjà autant de variantes, c’est généralement qu’il répond à un vrai besoin.

Si vous construisez un assistant local, un outil de lecture, un pipeline de contenu audio ou une interface vocale, Pocket TTS mérite une place dans votre boîte à outils. Pas pour faire du bruit marketing. Pour sortir une voix utile, vite, sur une machine normale.

Sources

Publications similaires

Laisser un commentaire