VOICE-PRO : télécharger, séparer, transcrire, traduire et doubler une vidéo YouTube en 100+ langues, 100 % en local

https://github.com/abus-aikorea/voice-pro

📌 VOICE-PRO est un outil open source qui télécharge une vidéo YouTube, isole la voix, la transcrit, la traduit dans plus de 100 langues, clone la voix originale et génère un doublage — le tout localement, gratuitement, sans envoi de données vers un serveur.

L’outil s’installe via deux scripts batch (configure + start) sous Windows, Linux ou Mac avec un GPU NVIDIA. L’interface est une web app Gradio accessible dans le navigateur. Le flux de traitement est entièrement intégré : on colle une URL YouTube, l’audio est extrait automatiquement, puis la voix est séparée de la musique et des effets via Demucs.

La transcription repose sur les modèles Whisper — Whisper, Faster-Whisper, Whisper-Timestamped ou WhisperX — avec reconnaissance dans plus de 100 langues. La traduction instantanée utilise Deep-Translator. Chaque étape est visible et ajustable dans l’interface.

  • 📥 Téléchargement YouTube + extraction audio (yt-dlp)
  • 🎤 Séparation voix/musique (Demucs)
  • 📝 Transcription (Whisper, Faster-Whisper, WhisperX)
  • 🌍 Traduction instantanée 100+ langues (Deep-Translator)
  • 🗣️ Clonage vocal zéro-shot (F5-TTS, E2-TTS, CosyVoice)
  • 🔊 Synthèse multilingue (Edge-TTS, kokoro)
  • 🎬 Sous-titres et doublage intégrés
  • 🔒 100 % local, LGPL, gratuit

Le clonage vocal fonctionne en zéro-shot : pas besoin d’entraîner un modèle sur la voix cible. F5-TTS, E2-TTS et CosyVoice analysent un court échantillon de la voix originale et reproduisent son timbre pour prononcer le texte traduit. L’outil intègre aussi des voix de référence pré-entraînées pour de nombreuses personnalités publiques.

La synthèse vocale multilingue utilise Edge-TTS (400+ voix dans plus de 100 langues) et kokoro, classé n°2 sur le TTS Arena de Hugging Face. Les paramètres de vitesse, volume et hauteur sont ajustables pour chaque voix.

Le module de sous-titres génère des fichiers ASS, SSA, SRT compatibles avec tout lecteur. Le mode temps réel affiche la transcription et la traduction en direct pendant la lecture. L’export audio se fait en WAV, FLAC ou MP3.

L’ensemble tourne sur GPU NVIDIA avec CUDA 12.4, 4 Go de VRAM minimum, 20 Go de stockage. Le code est ouvert sous licence LGPL, publié par ABUS, une équipe coréenne qui le positionne comme alternative à ElevenLabs.

Concrètement, VOICE-PRO s’inscrit dans une logique de pipeline vocal souverain plutôt que de service cloud : chaque étape du traitement — du téléchargement au doublage — s’exécute sur la machine locale, sans dépendre d’une API payante ni transmettre de données à un tiers.

Publications similaires

Laisser un commentaire