|

GEMMA 4 12B : l’IA agentic de Google tourne entièrement en local sur votre ordinateur portable

https://developers.googleblog.com/bringing-gemma-4-12b-to-your-laptop-unlocking-local-agentic-workflows-with-google-ai-edge/

📌 GEMMA 4 12B est le dernier modèle ouvert de Google DeepMind, conçu pour exécuter des workflows agentic et multimodaux directement sur un ordinateur portable, sans connexion ni cloud. Avec 12 milliards de paramètres et une empreinte mémoire compatible avec 16 Go de VRAM, il s’inscrit entre les modèles mobiles ultra-légers et les architectures massives.

L’architecture est unifiée : pas d’encodeur externe pour la vision ou l’audio. Les tokens multimodaux transitent directement dans le corps du modèle, ce qui simplifie le pipeline et réduit la consommation mémoire. Les benchmarks le placent à un niveau de performance proche du modèle 26B de Google, mais avec moins de la moitié de l’empreinte mémoire — ce qui le rend exploitable sur des machines ordinaires.

Le modèle est distribué sous licence Apache 2.0 et compatible avec les principaux runtimes du marché : Ollama, LM Studio, llama.cpp, MLX, vLLM, UnslothAI et SGLang. Cette compatibilité élargie permet de l’intégrer dans n’importe quel workflow existant sans verrouillage.

Google AI Edge accompagne le lancement avec trois outils locaux pour macOS. Le premier, AI Edge Gallery, transforme une consigne en langage naturel en code exécutable : on décrit un objectif d’analyse de données, l’application génère le script Python, l’exécute localement et produit des visualisations. Le modèle est capable d’autocorrection en un seul tour — y compris pour des tâches complexes comme le rendu 3D.

Le deuxième outil, AI Edge Eloquent, est une application de dictée et d’édition vocale entièrement hors ligne. Une nouvelle fonctionnalité, Voice Edit, permet de sélectionner du texte n’importe où sur le bureau et de le reformuler, résumer ou traduire par commande vocale. Gemma 4 12B améliore le suivi d’instructions de plus de 60 % par rapport aux modèles précédents.

  • 🧠 Architecture unifiée sans encodeur externe — vision et texte dans un seul modèle
  • 💻 Fonctionne sur 16 Go de VRAM, directement sur un portable standard
  • 📊 Performance proche du modèle 26B, avec moins de la moitié de la mémoire requise
  • 🔒 100 % local et hors ligne — aucune donnée ne quitte la machine
  • 🔧 Compatible Ollama, LM Studio, llama.cpp, MLX, vLLM, SGLang, UnslothAI
  • 🤖 Workflows agentic multi-étapes entièrement en local
  • 📜 Licence Apache 2.0

Le troisième outil, LiteRT-LM CLI, permet de lancer un endpoint local compatible OpenAI directement depuis le terminal. En deux commandes, le modèle est importé depuis Hugging Face et servi sur un port local. N’importe quel outil tiers — interface de chat, extension d’éditeur, framework d’agents — peut s’y connecter comme il le ferait avec un endpoint cloud.

La promesse centrale est celle de la souveraineté : les données restent sur la machine, la latence disparaît, les coûts d’API aussi. Gemma 4 12B s’inscrit dans une logique où l’IA agentic n’a plus besoin du réseau pour fonctionner — elle vit dans la machine.

Sources

Publications similaires

Laisser un commentaire