MLXaudio
|

MLX-AUDIO : synthèse vocale, transcription et clonage de voix en local sur votre Mac

https://github.com/Blaizzy/mlx-audio

📌 MLX-AUDIO est une bibliothèque Python construite sur le framework MLX d’Apple qui fait tourner synthèse vocale, transcription et clonage de voix directement sur les puces Apple Silicon. Aucun octet ne part dans le cloud : le texte et l’audio restent sur la machine, et la licence MIT rend l’ensemble gratuit.

Si vous enchaînez aujourd’hui une API en ligne pour lire un texte à voix haute, un service de transcription pour vos réunions et un troisième outil pour nettoyer un enregistrement, l’idée d’un seul pip install mlx-audio qui fait tout cela hors ligne a de quoi faire réfléchir. Le projet dépasse les 7 900 étoiles sur GitHub, avec une documentation complète, guides et référence d’API compris.

Côté synthèse, le catalogue fait tourner les têtes. Kokoro, le plus léger avec 82 millions de paramètres, parle français, anglais, japonais, chinois ou espagnol. Chatterbox couvre 23 langues, Dia se spécialise dans les dialogues, OmniVoice annonce 646 langues avec clonage zéro-shot. Une commande dans le terminal suffit pour faire parler la machine :

bash
mlx_audio.tts.generate --model mlx-community/Kokoro-82M-bf16 --text "Bonjour à tous" --lang_code f --play

Le clonage de voix passe par CSM : on fournit un fichier audio de référence, le modèle reproduit le timbre et la diction. Troublant au premier essai, bluffant ensuite quand le résultat reste naturel. Pour le sens inverse, Whisper reconnaît plus de 99 langues, Parakeet de NVIDIA en couvre 25 européennes, et VibeVoice-ASR de Microsoft ajoute la diarization, précieuse pour retranscrire une réunion à plusieurs voix.

  • 🎙️ Une vingtaine de modèles TTS, du léger Kokoro 82M au mastodonte Ming Omni 16.8B
  • 🧬 Clonage de voix avec CSM à partir d’un simple fichier de référence
  • 📝 Transcription avec Whisper, Parakeet et VibeVoice-ASR, avec timestamps et diarization
  • 🔌 API REST compatible OpenAI : on bascule du cloud au local sans réécrire son application
  • 🧊 Quantization de 3 à 8 bits pour loger les modèles dans la mémoire unifiée du Mac
  • 🌐 Interface web avec visualisation 3D de l’audio, et package Swift pour iOS et macOS

Je trouve l’API compatible OpenAI particulièrement maligne : les applications qui discutent déjà avec elle continuent de fonctionner en changeant juste l’URL vers localhost. La contrepartie tient en deux mots : mémoire et matériel. Ming Omni, un mixture-of-experts de 16,8 milliards de paramètres dont 3 milliards actifs à la fois, demande une machine bien dotée en RAM. Et ffmpeg reste nécessaire pour exporter en MP3 ou OGG, le WAV sortant sans dépendance.

Pour un Mac récent, l’équation reste simple : c’est open source, c’est gratuit, et vos enregistrements ne quittent jamais le disque. De quoi donner une voix à un assistant, transcrire des réunions ou nettoyer une prise de son, sans abonnement ni compte.

Sources

L’image actuelle n’a pas de texte alternatif. Le nom du fichier est : mlxaudio-synthese-vocale-transcription-et-clonage-.png

Publications similaires

Laisser un commentaire