Auteur/autrice : Laurent Dosdat

  • Jev et les « System One Models »

    Jev et les « System One Models »

    TypeSafe AI vient de sortir de l’ombre avec un modèle qui ne génère pas de texte. Au-delà des multiplicateurs spectaculaires (« 200× plus rapide », …), il y a une approche à contre-sens originale et surtout complémentaire.

    Quelques éléments techniques

    Une décision plutôt qu’une phrase

    Un LLM classique produit une suite de tokens, un à la fois, chaque token dépendant du précédent. Pour lui demander une décision (« ce ticket relève-t-il de la facturation ? »), il va reformuler, raisonner, parfois hésiter pour au final répondre oui ou non de façon assez coûteuse.

    Jev renverse le contrat. L’appelant fournit un état (texte brut ou JSON, jusqu’à ~32 000 tokens) et un ensemble de questions typées de trois formes :

    • Choice : une option parmi une liste fermée (255 au maximum), avec une distribution de probabilité sur toutes ;
    • Score : une valeur sur une échelle ordinale définie par l’appelant ;
    • Noul (contraction de boolean) : une probabilité oui/non.

    Le modèle ne peut pas répondre en dehors de cet espace. C’est le sens strict — et le seul — de leur slogan « zéro hallucination » : aucune sortie hors schéma. Une réponse peut rester valide et fausse.

    Traitement parallèle

    Puisque l’espace des réponses est fini et connu à l’avance, il devient possible de calculer toutes les probabilités en un seul passage. C’est de là que viennent des gains impressionnants en vitesse et en coût et l’intérêt de poser plusieurs questions sur un même état dans une seule requête : un appel groupé de 10 questions sur les mêmes données revient nettement moins cher et plus vite que 10 appels séquentiels.

    Un objectif d’entraînement différent : la calibration

    La méthode d’entraînement diffère particulièrement. TypeSafe oppose sa méthode, Reinforcement Learning for Calibrated Decisions (RLCD), aux deux familles dominantes :

    MéthodeCe qu’elle optimiseCe qu’elle produit
    RLHFLa préférence humaineDes assistants conversationnels
    RLVRDes récompenses vérifiables (tests, maths)Des modèles de raisonnement
    RLCDLa justesse des probabilitésDes décisions accompagnées d’une confiance exploitable

    Un modèle bien calibré est un modèle dont les événements annoncés à 0,8 se produisent environ 80 % du temps, en moyenne sur beaucoup de prédictions. Ce n’est pas une garantie sur une réponse isolée. Mais c’est ce qui permet au code de fixer un seuil : agir seul au-dessus, escalader en dessous.

    Les usages les mieux adaptés

    Le critère de tri est simple : la sortie attendue est-elle un choix, un score ou un booléen — ou un contenu textuel ? 

    Routage et classification à volume. Orienter des tickets, trier des alertes, qualifier des leads, attribuer une catégorie à des documents entrants. Des millions de petites décisions répétées où un appel LLM est disproportionné en coût et en latence.

    Garde-fous et vérification. Utiliser une question booléenne (Noul pour Jev) comme second regard sur la sortie d’un autre modèle : « cette réponse contient-elle une promesse contractuelle ? », « cette requête ressemble-t-elle à une tentative de jailbreak ? ».

    Map-reduce sur de gros corpus. Scorer ou étiqueter des centaines de milliers d’enregistrements selon un schéma fixe sans avoir forcément besoin d’entraîner un modèle spécifique préalablement.

    Là où un classifieur classique suffisait déjà. C’est le concurrent historique de Jev : un sytème type encodeur BERT-like qu’il fallait entraîner ou fine-tuner. L’utilisation de LLM à des fins de classification s’est répandue car elle évite d’entrainer mais il faut en accepter la latence et surtout le coût financier et énergétique. Jev apporte la généralité sans entraînement et une compréhension de niveau Claude Sonnet 5 / GPT 5.6 Terra tout en gommant les coûts d’exploitation. C’est le meilleur des cas pour démarrer.

    En complément d’un LLM

    Au delà des effets d’annonce, c’est la promesse de complémentarité qui est intéressante.

    Un LLM excelle à trois choses que Jev ne fait pas : explorer un problème mal posé, générer du texte ou du code, et raisonner longuement. Jev fait une chose que le LLM fait mal : trancher vite, souvent, à coût marginal quasi nul, avec une probabilité que du code peut lire. Mais attention, Jev ne connaît que l’état qu’on lui passe, il n’est pas capable d’aller chercher de l’information en ligne ou appeler un outil, c’est une contrainte essentielle en production.

    Un motif d’architecture qui en découle :

    1. Concevoir avec le LLM. En interactif, on découvre les catégories pertinentes, on écrit les critères de chaque option, on définit les seuils. Le LLM est l’outil du concepteur.
    2. Figer la logique en questions typées. Le résultat de cette exploration devient un schéma Choice / Score / Noul — un contrat que le logiciel comprend.
    3. Exécuter en production avec le modèle de décision. Chaque requête passe par des décisions rapides et bon marché. Le code garde la main sur les seuils, les permissions et les effets de bord.
    4. Escalader vers le LLM quand la confiance est basse ou quand il faut des mots. Une réponse à rédiger, une explication à fournir, un cas ambigu : c’est là que le modèle génératif revient, sur une fraction du trafic.

    Ce découpage a une vertu qui dépasse la question du prix : il place la frontière entre jugement incertain et logique déterministe à un endroit explicite et auditable, plutôt que de laisser un seul modèle décider et agir dans le même flux de texte. C’est une architecture plus disciplinée — et c’est probablement ce qui survivra de cette annonce, quel que soit le sort du modèle lui-même.

    Cas d’application

    Nous avons mis en oeuvre des agents de contrôle de cohérence ou de classification thématique qui auraient bénéficié grandement de cette complémentarité LLM/Jev.

    Comme nous avons obtenu un accès restreint au modèle, si vous avez un cas d’usage à tester, contactez nous pour comparer l’impact dans la mise en oeuvre et le gain obtenu, en temps/token mais surtout en design d’une solution plus adaptée à votre besoin.

    Sources

    Documents de TypeSafe

    Analyses et tests indépendants

    Littérature

    • Daniel Kahneman (2011) — Thinking, Fast and Slow