OLLAMA 0.19 : Enfin une prise en charge des modèles MLX optimisés Apple Silicon
📌 OLLAMA 0.19 propose le support des modèles MLX, le framework d’apprentissage automatique d’Apple, pour exécuter des modèles IA sur Apple Silicon. Le backend MLX exploite l’architecture de mémoire unifiée des puces Apple et les GPU Neural Accelerators des M5, M5 Pro et M5 Max, avec des gains de performance significatifs. La version 0.19 supporte le format NVFP4 de NVIDIA pour maintenir la précision des modèles tout en réduisant la consommation de mémoire et le stockage.
Les benchmarks sur Qwen3.5-35B-A3B quantisé en NVFP4 montrent une accélération notable : prefill à 1810 tokens/s contre 1154 pour Ollama 0.18, et décodage à 112 tokens/s contre 58. Les modèles avec tags NVFP4, MXFP8 ou MLXBF16 utilisent automatiquement le backend MLX, tandis que les autres modèles restent sur le backend llama.cpp. La prise en charge actuelle concerne principalement Qwen 3.5 et 3.6, avec des futures extensions prévues.
- ⚡ Backend MLX pour Apple Silicon (M5/M5 Pro/M5 Max avec GPU Neural Accelerators)
- 🎯 Format NVFP4 : précision maintenue, moins de mémoire, stockage réduit
- 📊 Benchmarks : 2x plus rapide que Ollama 0.18 (prefill et décodage)
- 🚀 Tags spécifiques : NVFP4, MXFP8, MLXBF16 pour routage MLX automatique
- 💾 Cache amélioré : réutilisation entre conversations, checkpoints intelligents
Le cache a été amélioré pour les tâches de coding et agents IA. Ollama réutilise désormais le cache entre conversations, ce qui réduit l’utilisation mémoire et augmente les cache hits lors de branchements avec des outils comme Claude Code. Les checkpoints intelligents stockent des instantanés du cache à des positions stratégiques dans le prompt, ce qui réduit le traitement et accélère les réponses. L’éviction plus intelligente permet aux préfixes partagés de survivre plus longtemps même lors de la suppression des anciennes branches.
Pour utiliser les modèles MLX, mettre à jour Ollama vers 0.19, puis tirer le tag spécifique : ollama pull qwen3.5:35b-a3b-coding-nvfp4 et ollama run qwen3.5:35b-a3b-coding-nvfp4. Le verbose (-v) donne des métriques détaillées dont le taux de décodage réel. Le blog Ollama MLX reste la source de vérité pour les modèles supportés, car la recherche sur la page models ne les indexe pas encore correctement. Les requêtes futures concernent l’importation simplifiée de modèles custom et l’extension de la liste des architectures supportées. Requiert Mac avec plus de 32GB de mémoire unifiée.
Sources
