Claude Opus 5.5, GPT-6 Sol et Luna, Jev : l'IA baisse ses prix et vise les agents
Anthropic a lancé Claude Opus 5.5 le 22 septembre, peu avant GPT-6 Sol et Luna, dont OpenAI divise les tarifs d'API par deux. TypeSafe AI ouvrait une semaine plus tôt Jev, un modèle qui rend des décisions chiffrées sans écrire de texte.
Anthropic a présenté mardi 22 septembre 2026 Claude Opus 5.5, un modèle conçu pour les longues tâches d'agents en programmation et en travail intellectuel. Le même jour, peu après, OpenAI a lancé GPT-6 Sol et GPT-6 Luna, dont les tarifs d'API baissent de moitié par rapport aux prix promotionnels de la génération GPT-5.6. Le 15 septembre, la jeune société TypeSafe AI avait ouvert en accès anticipé Jev, un modèle qui ne rédige aucun texte et renvoie des décisions assorties de probabilités.
Les trois annonces visent le même objectif : réduire le coût d'une tâche confiée à un logiciel, qu'il s'agisse d'un agent qui travaille seul pendant des heures ou de milliers de petites décisions prises chaque seconde. Ce coût dépend du prix du jeton (l'unité de texte facturée par les éditeurs) et du nombre de jetons consommés. Les mesures indépendantes publiées depuis mardi montrent que ces deux variables n'évoluent pas toujours dans le même sens.
Opus 5.5 : un tarif en baisse de 20 % pour les agents de longue durée
Opus 5.5 coûte 4 dollars par million de jetons en entrée et 20 dollars en sortie, contre 5 et 25 dollars pour Opus 5, sorti le 24 juillet. La lecture du cache (le contexte déjà transmis au modèle et réutilisé) passe de 0,50 à 0,20 dollar par million de jetons, soit une baisse de 60 %. Selon Anthropic, ces lectures représentent la majorité du coût des agents et des travaux de programmation. L'éditeur estime que le modèle revient 40 % moins cher qu'Opus 5 sur des charges de travail courantes et qu'il produit ses réponses plus de 30 % plus vite.
Anthropic affirme qu'Opus 5.5 atteint le niveau de Claude Fable 5.1, son modèle le plus cher, facturé 10 et 50 dollars, sur la plupart des travaux. Sean Heintz, développeur chez Clio, raconte lui avoir confié une tâche répartie sur six dépôts de code pendant une nuit : « Il est resté sur la tâche plus de 18 heures. » Chez la société de trading Optiver, Noyan Tokgozoglu indique que le modèle a égalé la qualité d'Opus 5 sur des tâches de programmation avec environ deux fois moins d'échanges, de temps et de jetons, ce qui a réduit le coût de cette charge de travail « de 40 à 50 % ».
Le modèle écrit de façon plus lisible, selon Anthropic : il place l'information principale en tête, emploie moins de jargon et respecte les règles de rédaction fixées par l'utilisateur. Le style d'Opus 5 figurait parmi les critiques les plus fréquentes reçues par l'éditeur. Opus 5.5 est le premier modèle publié par Anthropic depuis que son directeur général, Dario Amodei, a appelé début septembre à ralentir la course aux capacités (notre article du 14 septembre).
La migration demande du travail aux clients d'Opus 5. Anthropic recense quatre changements incompatibles avec le code existant : le raisonnement du modèle ne peut plus être désactivé, l'appel forcé d'un outil renvoie une erreur, les blocs de raisonnement restent liés au modèle qui les a produits et l'ancien outil de pilotage d'ordinateur est refusé sur l'API d'Anthropic et sur Google Cloud. Le niveau d'effort par défaut passe de « high » à « medium ».
Un tarif par jeton en baisse, un coût par tâche stable
Le cabinet de mesure indépendant Artificial Analysis place Opus 5.5 en tête de son indice d'intelligence avec un score de 58, « le plus élevé que nous ayons mesuré, de plusieurs points ». Au niveau d'effort maximal, le modèle consomme toutefois environ 119 000 jetons de sortie par tâche de l'indice, contre 73 000 pour Opus 5. Son coût par tâche reste de ce fait au niveau de celui d'Opus 5, malgré la baisse du tarif. Quatre de ses cinq niveaux d'effort figurent sur la frontière d'efficacité entre score et coût par tâche établie par le cabinet.
Le développeur Simon Willison, qui teste chaque nouveau modèle, a obtenu deux échecs au niveau d'effort maximal sur une consigne simple : dessiner une image vectorielle. Le modèle a atteint sa limite de 128 000 jetons de sortie sans rendre de réponse. Chaque essai lui a coûté 2,56 dollars. Simon Willison soupçonne ce réglage d'être « en pratique inutile ».
GPT-6 Sol et Luna : OpenAI divise ses tarifs d'API par deux
GPT-6 Sol passe à 2 dollars par million de jetons en entrée et 10 dollars en sortie, contre 4 et 20 dollars pour GPT-5.6 Sol. GPT-6 Luna, le moins cher des modèles GPT-6, tombe à 0,10 et 0,50 dollar, contre 0,20 et 1,20 dollar. OpenAI dit avoir entraîné les deux modèles avec des méthodes proches de celles de GPT-6 Astra, son modèle haut de gamme lancé le 3 septembre et facturé 10 et 50 dollars.
OpenAI met en avant AutomationBench, un test conçu par Zapier qui mesure la capacité d'un agent à mener un processus métier complet avec 47 outils, de la vente aux ressources humaines en passant par la finance. Selon l'éditeur, GPT-6 Sol y obtient 33,2 % de réussite pour 0,27 dollar par tâche, contre 26,9 % pour Claude Opus 5 à un coût par tâche 11,1 fois supérieur. La comparaison d'OpenAI ne porte pas sur Opus 5.5. Anthropic publie pour Opus 5.5 un score de 40,0 % sur ce test, mesuré par Zapier pendant l'accès anticipé. Les deux éditeurs attribuent le même score de 26,9 % à Opus 5.
Les mesures d'Artificial Analysis nuancent ces annonces. Le coût par tâche de son indice recule d'environ moitié : 1,06 dollar pour GPT-6 Sol contre 1,99 dollar pour GPT-5.6 Sol, 0,07 dollar pour Luna contre 0,18 dollar. Les scores d'intelligence restent au niveau de la génération précédente. Sur l'indice de programmation du cabinet, Sol gagne deux points et Luna en perd deux. Sol se trompe moins souvent sur les questions de connaissance : son taux d'hallucination passe de 92 % à 60 %, surtout parce qu'il refuse plus souvent de répondre, et son taux de bonnes réponses recule de 59 % à 54 %. Sur GDPval-AA, un test de tâches professionnelles réparties sur 44 métiers, Sol perd environ 100 points Elo et Luna environ 75. Le cabinet attribue ce recul à des livrables plus courts qui omettent plus souvent des éléments demandés.
OpenAI annonce pour Sol et Luna des réponses plus claires, avec moins de jargon et une longueur légèrement réduite. L'entreprise a amélioré la mise en cache des requêtes. La relecture du contexte en cache est facturée avec une remise de 90 %. Les deux modèles sont disponibles dans l'API ainsi que dans ChatGPT Work et Codex pour les abonnés Plus, Pro, Business, Enterprise et Edu. Les utilisateurs des offres Free et Go accèdent à Luna dans l'application de bureau. Aucun des deux modèles n'est encore proposé dans la conversation classique de ChatGPT. Dans ChatGPT Work et Codex, OpenAI a prévu un déploiement progressif au cours de la journée de lancement.
Jev, un modèle qui décide sans écrire
Diogo Almeida, ancien chercheur d'OpenAI qui a participé aux travaux à l'origine de ChatGPT, a fondé TypeSafe AI. Jev reçoit un état (un texte, une fiche client, un enregistrement) et une série de questions définies à l'avance. Pour chaque question, il renvoie une probabilité : oui ou non, un choix parmi des options ou une note sur une échelle. Il ne produit aucune phrase. TypeSafe le destine au classement, au routage, à la notation, à l'extraction et à la vérification, par exemple pour trier des courriels ou contrôler les actions d'un autre agent.
TypeSafe facture 0,042 dollar par million de jetons en entrée et ne facture pas la sortie. L'entreprise annonce un temps de réponse de 70 à 500 millisecondes et, sur ses propres tests, des gains de 193,6 fois en vitesse et de 444,6 fois en coût. Elle reconnaît que ces chiffres se situent « dans le haut de la fourchette » des gains réels, que ses équipes ont conçu les tests et qu'elle ne peut pas prouver que ses tarifs ne sont pas subventionnés.
Des développeurs ont testé le modèle. Pranit Sharma, ingénieur chez Vercel, a indiqué à TechCrunch que son entreprise a remplacé le modèle Luna 5.6 d'OpenAI par Jev pour vérifier la sûreté de commandes informatiques et obtenu des résultats 5 à 18 fois plus rapides, avec une meilleure précision. Nikhil Mudholkar, directeur technique de Bryo AI, a trouvé Gemini un peu plus précis sur le tri de courriels professionnels, pour un coût 10 à 20 fois supérieur. « Si le résultat revient avec 50 % de probabilité, c'est probablement un pile ou face, et je l'écarte. Mais à 95 %, je peux en faire quelque chose », résume Armin Ronacher, directeur technique d'Earendil.
Simon Willison relève que la documentation de Jev le décrit comme peu performant sur les nombres, les dates et les contenus malveillants. Il s'inquiète de l'opacité d'un modèle qui ne livre qu'un nombre, sans justification. Selon lui, ce nombre peut masquer des biais : « J'espère vraiment que personne n'utilise Jev pour classer des candidats à un emploi. »
Le coût des processus automatisés en entreprise
Pour une banque, un assureur ou un gérant d'actifs, le tarif affiché par million de jetons ne donne qu'une partie du coût. Un agent qui travaille plusieurs heures relit son contexte à chaque étape. Simon Willison estime que plus de 90 % des jetons d'entrée d'une longue session d'agent sont facturés au tarif du cache. Les mesures d'Artificial Analysis montrent qu'un tarif réduit de 20 % peut aboutir à un coût par tâche inchangé si le modèle raisonne plus longtemps. Elles montrent qu'une baisse de moitié peut s'accompagner de reculs sur certaines tâches professionnelles.
Plusieurs sociétés financières ont testé Opus 5.5 avant son lancement. Selon Strib Walker, responsable produit de Rogo, le modèle réglé au niveau d'effort le plus bas a battu Opus 5 réglé au niveau élevé sur le test BigFinance Bench, avec environ 60 % de jetons de sortie en moins. La société d'investissement Walleye Capital rapporte que le modèle a repéré une erreur d'indexation dans les consignes de son propre test de recherche quantitative. Ces témoignages proviennent de clients sélectionnés par Anthropic pour son annonce.
Jev cible une autre partie de la chaîne : les décisions simples et répétées, comme l'orientation d'une demande vers le bon modèle ou la surveillance des actions d'un agent. Son nom renvoie à William Stanley Jevons, l'économiste du XIXe siècle qui a observé que les progrès d'efficacité des machines à vapeur avaient fait augmenter la consommation de charbon. TypeSafe parie que chaque baisse d'un ordre de grandeur du coût de l'intelligence artificielle ouvre beaucoup plus d'usages.
Les prochaines étapes
Anthropic annonce Claude Sonnet 5.5 et Claude Haiku 5.5 dans les semaines à venir. Simon Willison note que Haiku 4.5, facturé 1 et 5 dollars par million de jetons, coûte dix fois plus que GPT-6 Luna. Selon lui, les tarifs promotionnels de GPT-5.6 doivent augmenter de 25 % en novembre. TypeSafe fait sortir au fil de l'eau les développeurs de sa liste d'attente et prépare d'autres versions de Jev.
Sources
- Anthropic, « Introducing Claude Opus 5.5 », 22 septembre 2026
- Anthropic, documentation « What’s new in Claude Opus 5.5 »
- OpenAI, « Introducing GPT-6 Sol and Luna », 22 septembre 2026
- TypeSafe AI, « Introducing System One Models & Jev », 15 septembre 2026
- Artificial Analysis, évaluation de Claude Opus 5.5
- Artificial Analysis, évaluation de GPT-6 Sol et Luna
- Simon Willison, « Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price war »
- Simon Willison, « Jev introduces a new shape of LLM »
- TechCrunch, sur Jev et TypeSafe AI, 18 septembre 2026
- TechCrunch, sur le lancement d’Opus 5.5, 22 septembre 2026
- Decrypt, sur GPT-6 Sol et Luna, 22 septembre 2026
- Reuters via Boursorama, « Anthropic dévoile Claude Opus 5.5 »
Vous exposer aux marchés actions
Sur un même marché, un ETF indiciel prélève entre 0,05 et 0,50 % de frais par an. Un OPCVM géré activement en prélève 1,5 à 2,5 %. Le simulateur situe l’enveloppe adaptée à votre projet.
Ouvrir le simulateurOrientation en 1 minute