| |

LAYA : l’alternative open source à Jev qui tranche en 21 millisecondes

https://brainfunctioncollapse.com/laya

📌 LAYA est un petit modèle de décision open source qui répond à des questions typées avec de vraies probabilités, en 21 ms, sur votre propre machine. Là où un LLM génère du texte qu’il faut ensuite parser, Laya se contente de trancher : choix, score ou oui/non, en une seule passe. Zéro token généré, rien à halluciner.

Le comparatif qui structure toute la page l’assume : TypeSafe Jev fait le même travail, mais en API hébergée, poids fermés, accès anticipé. Laya publie ses poids sous Apache-2.0 avec trois checkpoints — un anglais (421M de paramètres), un multilingue (322M, plus de 100 langues) et un spécialisé décisions typées — plus un routeur qui choisit le bon checkpoint avant chaque passe. Vos données, elles, ne vont nulle part.

Pour s’en convaincre, la page fait jouer le modèle en direct. Flappy Bird vole à environ 30 décisions par seconde, le runner lit le couloir libre en 27 ms, et le Tetris enregistré a enchaîné 1 799 décisions et 52 lignes en une minute, sans top-out. Rien n’est scripté : le jeu décrit sa situation en une phrase, Laya renvoie une probabilité, le code agit.

Côté chiffres mesurés, sur 500 exemples identiques, Jev reste globalement plus précis (0,764 contre 0,668) mais Laya fait jeu égal sur les tâches simples — actualité 0,93 contre 0,92, spam 0,96 des deux côtés — avec une latence médiane de 45 ms contre 278 ms, mesurée depuis le même bureau. Sur un T4, le README annonce 32,8 ms par question, 7,2 ms en lot, et un checkpoint affiné qui dépasse le Jev publié sur typed-decisions (0,766 contre 0,727).

Les limites sont énoncées franchement, c’est rare et sain. Laya ne lit pas les nombres : faites l’arithmétique dans votre code et donnez-lui la conclusion en mots. La formulation pèse lourd — « blocked by a barrier » sépare les couloirs à 0,75, « blocked by a train » plafonne à 0,45. Les checkpoints de base restent proches du hasard zéro-shot, la vraie valeur est dans le fine-tuning sur vos étiquettes. Et au-delà d’une vingtaine d’options, Jev garde l’avantage.

  • ⚡ Une décision en 21 ms sur GPU de laptop, 0 token généré, 650 Mo sur disque
  • 🔒 Poids ouverts Apache-2.0, exécution locale, aucune donnée envoyée chez un vendeur
  • 🎮 Flappy, runner et Tetris joués en direct par le modèle, rien de scripté
  • 🧩 Six usages prêts : routage, garde anti-injection, score, filtre, surveillance, cascade
  • 🤖 Un SKILL.md à déposer dans .claude/skills pour brancher votre agent de code

Côté pratique : uv pip install laya, un server.py, et le playground s’ouvre sur 127.0.0.1:8770. Premier démarrage : 2,3 Go de poids à télécharger, 90 secondes de chargement, puis ça tourne sur Apple Silicon, NVIDIA ou simple CPU. Un email de phishing, cinq questions, 59 ms : voilà le genre de quota que le modèle tient.

Je trouve l’approche saine : distinguer décider de générer rend soudain évident le prix payé à un LLM pour router un ticket ou filtrer un spam. On pilote ses seuils, on calibre une température sur ses données, on garde l’incertain pour un humain. Jev pour la précision brute d’aujourd’hui, Laya pour la latence, le local et le contrôle.

Sources

L’image actuelle n’a pas de texte alternatif. Le nom du fichier est : laya-lalternative-open-source-a-jev-qui-tranche-en.png

Publications similaires

Laisser un commentaire