| |

OMLX : Vos IA locales optimisées pour Apple Silicon

https://github.com/jundot/omlx

📌 OMLX est un outil qui permet de faire tourner des modèles d’IA plus vite sur votre Mac, en utilisant MLX, le framework spécial d’Apple pour ses puces Apple Silicon. Contrairement aux autres outils comme LM Studio qui gardent tout en mémoire vive, OMLX utilise un système intelligent : il garde le contexte immédiat en mémoire pour la vitesse, mais déplace les anciennes parties de votre conversation (les gros system prompts, les définitions d’outils) sur votre SSD quand la mémoire commence à saturer. C’est comme un système d’exploitation moderne qui sait quoi garder dans le « cerveau » et quoi mettre de côté.

Pour l’installer, téléchargez l’application depuis GitHub et glissez-la dans Applications. Au lancement, une fenêtre s’ouvre pour configurer votre serveur (là où tourne l’IA), entrer votre clé API, et télécharger votre premier modèle. L’interface affiche en temps réel combien de tokens sont produits, combien sont mis en cache, et la vitesse moyenne en tokens par seconde.

– ⚡ Accélère les IA sur Mac en utilisant MLX, le framework d’Apple
– 💾 Gère intelligemment la mémoire : RAM pour la vitesse, SSD pour le stockage
– 🚀 Benchmarks : 3 fois plus rapide que LM Studio sur le même modèle
– 🔄 Si vous effacez la session, l’IA se souvient quand même de ce qu’elle a écrit
– 🌐 Compatible avec Claude Code, OpenClaw, Cursor

Dans un test sur un MacBook Pro M2 avec le modèle Qwen 3.6 (35 milliards de paramètres), OMLX a terminé la tâche en 20 minutes à une vitesse de 47 tokens par seconde, contre 35 minutes à 16 tokens par seconde pour LM Studio. Avec OMLX, vous pouvez continuer à utiliser votre Mac normalement — naviguer sur le web, regarder des vidéos — pendant que l’IA tourne en arrière-plan. Avec LM Studio, tout est saturé, impossible même de regarder une vidéo sur un deuxième écran.

Le gros avantage d’OMLX c’est la gestion intelligente de la mémoire. Quand vous atteignez la limite du contexte (généralement 30k tokens sur un M2), d’autres outils lancent une erreur et effacent tout. OMLX peut aussi lancer une erreur, mais comme il a sauvegardé l’état sur votre SSD, vous pouvez redémarrer la session et l’IA reprend exactement là où elle en était, sans oublier ce qu’elle a écrit avant.

Pour utiliser OMLX, lancez l’application, configurez votre serveur (choisissez où le faire tourner), entrez votre clé API (c’est demandé au démarrage), puis téléchargez votre premier modèle depuis le dashboard. OMLX réutilise les modèles que vous avez déjà téléchargés avec LM Studio, donc pas besoin de tout retélécharger. Compatible avec les Mac Apple Silicon (M1, M2, M3, M4) et macOS 15 ou plus récent. Il faut au minimum 16GB de RAM, mais 64GB ou plus c’est mieux pour les gros modèles.

Sources :
https://omlx.ai/
https://github.com/jundot/omlx
https://youtube.com/watch?v=EsLwzxTz-A4

Publications similaires

Laisser un commentaire