|

VOICESTUDIO : cloner des voix et doubler des vidéos sans envoyer son audio dans le cloud

https://voicestudio.sh

📌 VOICESTUDIO est un studio vocal open source et local qui regroupe clonage de voix, synthèse, doublage vidéo, dictée, transcription et création d’audiobooks dans une seule application desktop.

Les outils vocaux en ligne sont pratiques jusqu’au moment où vous leur confiez une voix, un script ou plusieurs heures d’enregistrement. VoiceStudio prend l’option inverse : les modèles tournent sur votre machine, sans compte, clé API, abonnement ni compteur d’utilisation pour le workflow principal. Vous fournissez le matériel ; le logiciel vous laisse choisir les moteurs.

Le point d’entrée le plus immédiat est le clonage. Un extrait propre de trois secondes suffit pour essayer, même si cinq à quinze secondes donnent généralement un meilleur résultat. Vous choisissez ensuite le texte et la langue avant de lancer la génération. Si vous ne partez pas d’une voix existante, Voice Design permet d’en décrire une avec un âge, un accent, une hauteur, un style et une intention de diction.

  • 🎙️ Cloner une voix depuis un court extrait audio
  • 🎛️ Concevoir une voix avec des paramètres de style et de diction
  • 🎬 Transcrire, traduire et redoubler une vidéo en conservant les intervenants
  • 📚 Transformer un script ou un EPUB en audiobook chapitré
  • 🗣️ Dicter dans n’importe quelle application avec un raccourci système
  • 🔌 Utiliser une API locale compatible OpenAI ou un serveur MCP

Le doublage est probablement le workflow le plus complet. VoiceStudio transcrit la vidéo, sépare les locuteurs, traduit le texte, resynthétise chaque voix et recale les lignes sur le timing original. La diarisation s’appuie notamment sur Pyannote et WhisperX. Pour un créateur qui veut adapter une vidéo dans une autre langue sans envoyer le fichier sur un service externe, l’intérêt est évident.

L’application ne repose pas sur un seul moteur. Elle propose 16 moteurs de synthèse et 11 moteurs de reconnaissance vocale, avec des couvertures différentes. Le catalogue annonce 646 langues pour la synthèse, mais ce nombre ne signifie pas que chaque moteur les parle avec la même qualité. Le choix dépend aussi de votre plateforme : Apple Silicon peut utiliser MPS ou MLX, les cartes NVIDIA CUDA, Linux peut ajouter ROCm, et le CPU reste disponible.

Je trouve cette architecture plus intéressante qu’un simple clone local d’ElevenLabs. VoiceStudio expose un catalogue, permet d’installer et de retirer les modèles, propose une file de traitements, une isolation vocale avec Demucs et une API pour automatiser la génération. Vous pouvez même inscrire des workers distants, mais ce choix fait alors sortir les données de la machine et doit rester explicite.

La contrepartie est concrète : il faut télécharger les modèles, prévoir au moins 10 Go libres et accepter que les performances dépendent du matériel. Apple Silicon est supporté à partir de macOS 13.3 ; les Mac Intel ne peuvent pas exécuter le backend local actuel et doivent passer par un backend distant. Le projet est encore en beta active.

VoiceStudio est publié sous AGPL-3.0. Les moteurs et modèles optionnels gardent leurs propres licences, et l’analytics reste désactivé par défaut. Pour qui veut produire de la voix sans louer une infrastructure à la minute, c’est une proposition sérieuse : moins immédiate qu’un SaaS, mais beaucoup plus contrôlable.

Sources

Publications similaires

Laisser un commentaire