Jev
Jev est un modèle d'intelligence artificielle propriétaire conçu par TypeSafe AI, une jeune entreprise de San Francisco fondée en 2024. Il est ouvert en accès anticipé le , le jour où l'entreprise annonce un tour d'amorçage de 40 millions de dollars mené par le fonds de capital risque DCVC[1][2].
| Développé par | TypeSafe AI |
|---|---|
| Première version | |
| Dernière version | jev-1.13.0 |
| Environnement | Service en ligne (API) |
| Langues | Anglais (principale), autres langues partiellement prises en charge |
| Type | Modèle d'intelligence artificielle (classifieur) |
| Politique de distribution | Facturation à l'usage (jetons en entrée) |
| Licence | Propriétaire |
| Documentation | docs.typesafe.ai |
| Site web | typesafe.ai |
À la différence d'un grand modèle de langage (LLM), Jev n'écrit pas. On lui soumet un « état » (un courriel, un ticket d'assistance, une trace d'agent…) et des questions dont les réponses possibles sont fixées d'avance ; il renvoie des valeurs typées, assorties de probabilités et, selon le type de question, d'un indice de confiance, que le programme appelant peut exploiter directement[3][4]. TypeSafe AI en fait le premier représentant d'une catégorie qu'elle baptise « modèles System One », en référence aux deux systèmes de pensée décrits par Daniel Kahneman[5][6].
Le lancement a rencontré un vif intérêt chez les développeurs[7]. Il a aussi attiré des critiques : les gains de vitesse et de coût annoncés reposent sur les propres évaluations de l'entreprise[8][2][9], et l'affirmation selon laquelle le modèle « ne peut pas halluciner » est contestée[3][10].
Historique
modifierDiogo Almeida, Erik Gafni et Sasha Sheng fondent TypeSafe AI en 2024[1]. Almeida, qui dirige l'entreprise, vient d'OpenAI, où il a travaillé sur l'apprentissage par renforcement à partir de rétroaction humaine (RLHF), InstructGPT, ChatGPT et GPT-4[2][7]. TypeSafe le présente comme « co-inventeur du RLHF et de ChatGPT »[1] ; le site Next trouve le second titre exagéré et le décrit plutôt comme l'un des auteurs d'un article fondateur sur le RLHF[10]. Almeida explique le projet par sa déception devant les modèles conversationnels : la technologie, dit-il à TechCrunch, « n'est pas utile pour l'automatisation, parce que les ordinateurs parlent une autre langue »[7],[N 1].
Le modèle est mis au point pendant environ deux ans sans annonce publique[5][7][8]. Le , TypeSafe sort de ce mode furtif : Jev est proposé en accès anticipé, sur liste d'attente, et l'entreprise annonce un financement d'amorçage de 40 millions de dollars mené par DCVC[1][11]. D'après Forbes, qui cite une personne proche de l'opération, ce tour valorise TypeSafe à 200 millions de dollars[12]. Parmi les démonstrations publiées au lancement figure un programme qui joue à Doom à partir d'une description structurée de l'état du jeu[5][3].
La demande dépasse les capacités de l'entreprise : selon TechCrunch, l'API cesse brièvement de répondre[7]. La liste d'attente est levée le [10].
Fonctionnement
modifierUne requête à Jev se compose d'un « état » (une chaîne de caractères, un objet JSON ou un tableau de textes) et d'une ou plusieurs « questions » typées. Toutes les questions sont évaluées d'un coup, en parallèle, là où un LLM autorégressif produit sa réponse jeton après jeton[4][3]. Trois types de questions, que TypeSafe appelle « primitives », sont proposés[4] :
- Choice : choisir une option dans un ensemble défini. La réponse comprend l'option retenue, une probabilité par option et un indice de confiance.
- Score : situer l'état sur une échelle ordonnée. La réponse comprend le score, une probabilité par niveau et un indice de confiance.
- Noul : évaluer une affirmation vrai/faux. La réponse est une probabilité entre 0 et 1.
Comme les réponses possibles sont fixées à l'avance, le modèle ne peut pas sortir du schéma fourni. TypeSafe en tire l'argument que Jev ne commet ni erreur de type ni hallucination[5].
Selon Almeida, Jev repose sur une architecture de type transformeur et est entraîné uniquement sur des données synthétiques, avec une méthode que l'entreprise nomme Reinforcement Learning for Calibrated Decisions (RLCD)[7][13]. Là où le RLHF récompense les réponses que préfèrent des évaluateurs humains, le RLCD optimise les probabilités par rapport aux résultats observés : une confiance élevée doit correspondre à une exactitude élevée[13][5]. La documentation précise que cette calibration se vérifie sur des groupes de prédictions et ne garantit rien pour une réponse prise isolément[6]. L'architecture exacte, la configuration d'entraînement et la taille du modèle n'ont pas été détaillées publiquement[9][11] ; des observateurs extérieurs supposent qu'il s'appuie sur un LLM à poids ouverts[7].
En septembre 2026, la version en service est jev-1.13.0. Elle n'accepte que du texte, dans la limite de 64 000 jetons par requête, dont 32 000 pour l'état et la question la plus longue. L'anglais est la langue principale d'entraînement ; les autres langues sont prises en charge, « mais pas aussi bien », d'après la documentation. Les clients ne peuvent pas ajuster le modèle : les mêmes poids servent tous les comptes[14]. Le tarif est de 0,042 dollar par million de jetons en entrée ; la sortie n'est pas facturée[5][14][15].
Performances revendiquées
modifierTypeSafe annonce un temps de réponse de 70 à 500 millisecondes de bout en bout, soit, selon elle, 40 à 200 fois moins qu'un LLM de pointe sur des requêtes de même nature[5][8][10]. Sa page d'accueil affiche des pics de 193,6 fois plus rapide et 444,6 fois moins cher, mesurés sur quatre chaînes de traitement internes : réponse aux incidents de sécurité, observation de traces d'agents, traitement de factures et service client[16][5][10].
Ces mesures viennent de l'entreprise, qui en expose elle-même les limites. Les modèles ne sont pas comparés à une vérité de référence, mais à la moyenne des réponses de deux grands modèles externes[5][8]. Les LLM concurrents sont interrogés à travers un adaptateur, publié par TypeSafe sous licence MIT, qui les contraint à produire des décisions structurées compatibles avec son API ; l'entreprise juge cette méthode la plus exacte pour obtenir des décisions d'un LLM, tout en reconnaissant qu'elle le ralentit et le rend plus coûteux[5][17]. Elle indique enfin que les quatre chaînes de traitement ont été conçues par sa propre équipe, admet un biais possible et situe les gains publiés plutôt dans le haut de la fourchette des résultats réels[5]. SiliconANGLE souligne que ces résultats n'ont pas été vérifiés de façon indépendante et dépendent de la charge de travail, de l'emplacement réseau et de la méthode de comparaison[2] ; IT for Business parle de chiffres « obtenus en conditions optimales »[17].
Limites
modifierLa documentation de TypeSafe consacre une page aux faiblesses connues de jev-1.13. Le modèle lit les consignes au pied de la lettre et répond à la question posée plutôt qu'à celle que l'on voulait poser. Il compte et calcule mal, compare mal les dates, et perd en précision quand l'état contient beaucoup d'informations sans rapport avec la décision. Il reste sensible aux contenus rédigés pour le tromper, et il ne peut rien générer. TypeSafe recommande de garder l'arithmétique dans le code et de ne lui envoyer que les champs utiles à la décision[18].
Réception
modifierTechCrunch décrit un accueil enthousiaste chez les développeurs. Chez Vercel, un ingénieur explique avoir remplacé un LLM par Jev pour vérifier l'innocuité de commandes : les réponses arrivent cinq à dix-huit fois plus vite, avec une meilleure exactitude[7]. Le directeur technique de Bryo AI, qui a comparé Jev à Gemini pour trier des courriels professionnels, trouve Gemini un peu plus exact mais dix à vingt fois plus cher ; il retient surtout que Jev renvoie une vraie probabilité[7]. Armin Ronacher, directeur technique d'Earendil, nuance : le modèle « délègue un peu le problème de l'hallucination à l'utilisateur », à qui il revient de fixer le seuil de confiance en dessous duquel une réponse est écartée[7].
Le « zéro hallucination » revendiqué par TypeSafe revient dans la plupart des analyses. The Register estime la comparaison inéquitable, puisque la sortie n'est pas du langage naturel, et rappelle qu'une réponse structurée assortie de probabilités peut très bien être fausse[3]. Next résume : le modèle garantit le format, pas la justesse ; il ne peut rien inventer, mais peut se tromper de catégorie[10]. Futura et IT for Business font la même remarque[15][17], et ce dernier relève que le taux de 0 % affiché dans les graphiques de l'entreprise n'est pas mesuré mais déduit de la contrainte de schéma, ce que TypeSafe écrit d'ailleurs dans son billet de lancement[17][5]. Next juge par ailleurs « délicate » la comparaison de vitesse et de coût avec les LLM, tant que le modèle n'est ouvert à tous que depuis quelques jours[10].
heise online soulève une autre question, celle de la transparence : Jev ne fournit pas d'explication détaillée de ses décisions, et plus de tels systèmes trancheront au sein d'autres logiciels, plus il importera de comprendre et de contrôler leur comportement[8].
La nouveauté de l'approche est elle aussi relativisée. Pour KDnuggets, une bonne part de ce que fait Jev ressemble aux classifieurs, notamment zero-shot, qui existent depuis des années, même si TypeSafe paraît avoir bâti une architecture et un entraînement propres autour de ce problème[9]. Nandakishor Mukkunnoth, fondateur de ConvAI Innovations, va plus loin : il affirme être à l'origine des recherches qui ont mené à cette technique et reproche à TypeSafe de ne pas avoir cité de travaux antérieurs, sans l'accuser d'avoir copié du code. Il publie une alternative libre, Laya[10], dont la version anglaise repose sur un encodeur ModernBERT-large de 421 millions de paramètres[19]. D'autres modèles libres apparaissent dans les jours qui suivent. Selon les premiers tests indépendants rapportés par Next, ils obtiennent entre 0,5 et 0,7 lorsque Jev sert de référence à 1[10].
Nom
modifierJev doit son nom à l'économiste anglais du XIXe siècle William Stanley Jevons, dont le paradoxe de Jevons veut qu'un usage plus efficace d'une ressource en accroisse la consommation au lieu de la réduire. Almeida y voit une analogie : chaque baisse du coût de l'intelligence artificielle devrait ouvrir bien plus d'usages[5][7]. Quant à « System One », l'expression renvoie à Système 1 / Système 2 : Les deux vitesses de la pensée de Daniel Kahneman, qui oppose la pensée rapide et intuitive (système 1) à la pensée lente et délibérée (système 2)[5][6].
Notes et références
modifierNotes
modifier- ↑ « it's not useful for automation because computers speak a different language ».
Références
modifier- 1 2 3 4 (en) « TypeSafe AI Emerges From Stealth With $40M in Funding With New Model for Composable AI », sur morningstar.com, Business Wire, (consulté le )
- 1 2 3 4 (en) Paul Gillin, « TypeSafe AI exits stealth with $40M to build AI for use by software », sur SiliconANGLE, (consulté le )
- 1 2 3 4 5 (en) Thomas Claburn, « TypeSafe AI debuts model for machines that plays Doom », sur The Register, (consulté le )
- 1 2 3 (en) « Introduction », sur docs.typesafe.ai, TypeSafe AI (consulté le )
- 1 2 3 4 5 6 7 8 9 10 11 12 13 14 (en) Diogo Almeida, « Introducing System One Models & Jev », sur typesafe.ai, TypeSafe AI, (consulté le )
- 1 2 3 (en) « System One », sur docs.typesafe.ai, TypeSafe AI (consulté le )
- 1 2 3 4 5 6 7 8 9 10 11 (en) Tim Fernholz, « A new kind of AI model from a ChatGPT inventor is thrilling developers », sur TechCrunch, (consulté le )
- 1 2 3 4 5 (en) Tomislav Bezmalinović, « AI model "Jev" to make machines decide faster », sur heise online, (consulté le )
- 1 2 3 (en) Abid Ali Awan, « What Everyone Is Getting Wrong About TypeSafe AI's Jev », sur KDnuggets, (consulté le )
- 1 2 3 4 5 6 7 8 9 Vincent Hermann, « IA : le nouveau modèle Jev se veut le champion des « décisions typées » », sur Next, (consulté le )
- 1 2 Benjamin Polge, « Jev : 5 prompts pour cette IA… 400 fois moins chère que les autres », sur Journal du Net, (consulté le )
- ↑ (en) Rashi Shrivastava, « This $200 Million Startup Wants To Fix AI's Overconfidence Problem » [archive du ], sur Forbes, (consulté le )
- 1 2 (en) « AI primer », sur docs.typesafe.ai, TypeSafe AI (consulté le )
- 1 2 (en) « Models », sur docs.typesafe.ai, TypeSafe AI (consulté le )
- 1 2 Edward Back, « Pourquoi Jev fait parler de lui : cette IA annonce être bien plus rapide et bien moins chère que les grands modèles », sur Futura, (consulté le )
- ↑ (en) « TypeSafe AI », sur typesafe.ai, TypeSafe AI (consulté le )
- 1 2 3 4 Laurent Delattre, « Jev, le modèle IA qui fait le buzz sans savoir écrire », sur IT for Business, (consulté le )
- ↑ (en) « Jev 1.13 jaggedness », sur docs.typesafe.ai, TypeSafe AI, (consulté le )
- ↑ (en) « convaiinnovations/laya », sur Hugging Face, ConvAI Innovations (consulté le )