VOICEBOX : clonez des voix et parlez à vos agents, en local
https://github.com/jamiepine/voicebox
📌 Voicebox est un studio vocal IA open source, local-first, qui permet de cloner des voix, générer du speech, dicter dans n’importe quelle app et faire parler vos agents en voix clonée.
On a longtemps séparé les outils vocaux en deux camps. D’un côté, la synthèse vocale. De l’autre, la dictée. Voicebox réunit les deux, puis ajoute un troisième niveau: les agents IA qui parlent avec votre voix, sur votre machine, sans envoyer vos données dans le cloud.
Le produit est plus ambitieux qu’un simple TTS. Voicebox embarque 7 moteurs de voix, la transcription Whisper, un éditeur d’histoires multi-voix, des effets audio, des profils vocaux, et même un serveur MCP pour piloter tout ça depuis Claude Code, Cursor ou Cline.
- 🎙️ Clonage vocal à partir de quelques secondes d’audio
- 🧠 7 moteurs TTS et dictée Whisper locale
- 🔒 Tout tourne sur votre machine, sans clés API
- 🤖 MCP + REST API pour brancher apps et agents
- 🎛️ Éditeur d’histoires, effets audio et personnalités de voix
Ce qui me plaît, c’est le côté stack complète. Vous enregistrez une voix, vous la recyclez en profil, vous appliquez une personnalité, puis vous la réutilisez pour lire un script, dicter du texte ou faire répondre un agent. Le tout avec une vraie logique produit, pas juste un démo de clonage vocal.
Voicebox tourne sur macOS, Windows et Linux, avec des backends adaptés au matériel: MLX/Metal sur Mac Apple Silicon, CUDA sur Windows et Linux, ROCm pour AMD, DirectML, Intel Arc, ou CPU si besoin. C’est rare de voir une app vocale aussi sérieuse sur la compatibilité.
Voicebox ressemble à l’alternative open source la plus complète à ElevenLabs et WisprFlow réunie. Si vous voulez de la voix locale, programmable et agent-ready, c’est très fort.
Sources :

