ORNITH-1.5 : un modèle qui s’améliore en créant ses propres exercices
https://ornith.ai/ornith_1_5.html
📌 ORNITH-1.5 est une famille de modèles open source (397B, 35B, 9B) qui apprend en se fixant elle-même des tâches, en construisant les évaluations, et en résolvant ses propres problèmes. Le plus gros égale Claude Opus 4.8, le plus petit tourne sur iPhone.
L’approche est fascinante. Plutôt que de gonfler un dataset d’entraînement avec des milliers de tâches humaines, ORNITH-1.5 génère ses propres exercices. Le modèle propose une tâche, construit un scaffold pour l’évaluer, produit des solutions, mesure la difficulté, et recommence. La boucle est fermée : plus le modèle s’améliore, plus les tâches qu’il génère sont difficiles, plus l’entraînement est utile.
Trois signaux contrôlent la qualité des tâches générées : validité (est-ce que la tâche est bien définie et vérifiable ?), difficulté frontalière (est-ce que le modèle la résout dans 20% des cas, le sweet spot pour apprendre ?), et nouveauté (est-ce que c’est différent de ce qui a déjà été fait ?). Les trois se combinent multiplicativement — une tâche invalide reçoit une récompense zéro, même si elle paraît difficile.
Les résultats sont solides. Le 397B MoE atteint 86.1 sur Terminal-Bench 2.1 et 56.0 sur DeepSWE, au niveau de Claude Opus 4.8 (85.0 et 59.0) et devant GLM-5.2 (82.7 et 46.2). Le 35B MoE, avec seulement 3B de paramètres activés par token, surpasse des modèles denses bien plus gros — Gemma 4-31B et Muse Glimmer-30B — sur le code agentic.
Ce qui m’étonne le plus : le 9B. Un modèle qui tient sur iPhone et Android, qui bat Gemma 4-31B et Qwen 3.6-35B sur SWE-bench Verified (70.6 vs 52.0 et 73.4). La version Mobile quantifiée est disponible sur Hugging Face. On est loin de l’idée qu’il faut un modèle géant pour faire du code agentic.
La famille est basée sur Qwen3.5 et Gemma 4 avec du continued pretraining, du mid-training, et du post-training. Les poids sont en MIT sur Hugging Face — 2k stars sur GitHub, 153 upvotes sur la collection HF. Pas de restriction d’usage.
Ce que je retiens : l’auto-amélioration par tâches générées commence à donner des résultats concrets. Ce n’est plus un concept de recherche, c’est un modèle qu’on peut télécharger et faire tourner. Le 9B sur mobile, c’est la preuve que l’approche est efficace même à petite échelle.
- 🔄 Boucle d’auto-amélioration complète : tâches, scaffolds, solutions, récompenses
- 📊 397B égale Claude Opus 4.8 sur Terminal-Bench 2.1 et DeepSWE
- 📱 9B tient sur iPhone et bat des modèles 3x plus gros
- 🧪 Tâches générées avec triple critère : validité, difficulté frontalière, nouveauté
- 🔓 Poids MIT sur Hugging Face, zéro restriction
- ⚡ Trois échelles : 397B MoE, 35B MoE (3B activés/token), 9B Dense
Sources
