Anthropic lance les compteurs Claude Opus 5.5 et OpenAI avec deux modèles GPT-6 moins chers

Malgré les inquiétudes généralisées concernant l'intelligence artificielle galopante, les deux grands fabricants de modèles d'IA ne ralentissent pas encore : Anthropic PBC a sorti aujourd'hui Claude Opus 5.5 et a réduit son prix de 20 %, et quelques minutes plus tard, OpenAI Group PBC a sorti deux nouveaux modèles GPT-6, Sol et Luna, à la moitié du coût de leurs prédécesseurs.

L'entrée sur l'Opus 5.5 coûte 4 $ par million de jetons et la sortie 20 $, ce qui, selon Anthropic, représente 40 % de moins sur une charge de travail typique que l'Opus 5. Les lectures du cache ont subi la réduction la plus importante, chutant de 60 %, à 20 cents. Un mode de service plus rapide entraîne une prime, à 8 $ par million de jetons d'entrée et 40 $ par million de sortie.

OpenAI a réduit de moitié le prix des deux nouveaux modèles par rapport aux versions GPT-5.6 portant les mêmes noms, portant Sol à 2 $ par million de jetons d'entrée et à 10 $ par million de sortie. Luna se situe un ordre de grandeur en dessous, à 10 cents et 50 cents.

Anthropic a déclaré que l'Opus 5.5 correspond à son modèle Fable 5.1 sur la plupart des travaux. La génération de sortie est plus de 30 % plus rapide que celle de l’Opus 5, livré fin juillet. Terminal-Bench 4.0, test de codage agent, revient à 66,4% contre 55,8% pour Fable 5.1. Sur AutomationBench, le nouveau modèle a signalé un taux d'achèvement des tâches de 40 %, là où Opus 5 en a réussi 26,9 %.

L'écart le plus important dans les chiffres publiés se situe dans la recherche scientifique, où Terminal-Bench-Science 0,1 a attribué à l'Opus 5 un score de 29 % et au nouveau modèle de 58,7 %. Sur GDPval-AA v2.1, un test de travail de connaissances obtenu en Elo, l'Opus 5.5 a obtenu une note de 1846 contre 1708 pour l'Opus 5. Le dernier examen de l'humanité, exécuté avec des outils, a obtenu un résultat de 67,7 %. Un testeur a terminé une migration de code de 680 000 lignes en moins d'une journée, un travail qui, selon Anthropic, aurait pris des semaines à une équipe d'ingénieurs.

Dans les notes de test d'Anthropic publiées avec le communiqué, Yashodha Bhavnani, vice-président des produits d'IA chez Box Inc., a déclaré que les réponses du nouveau modèle étaient 40 % moins verbeuses sans perdre en précision. Mario Rodriguez, directeur produit de GitHub Inc., a déclaré que dans VS Code, le modèle « résolvait plus de tâches de terminal que l'Opus 5 en moins de la moitié des étapes ». Anthropic a déclaré que le modèle met en avant les informations les plus importantes. D'autres clients cités dans l'annonce ont décrit moins de tentatives et moins de retouches.

En matière de sécurité, Anthropic a qualifié l'Opus 5.5 de plus performant à ce jour en matière d'audit comportemental automatisé qu'il utilise pour les tests d'alignement, et a déclaré que les tentatives de contournement des limites de confinement ont chuté de 85 % par rapport à l'Opus 5. La résistance à l'injection rapide s'est suffisamment améliorée pour correspondre à Fable 5.1 sur le benchmark Grey Swan.

Les restrictions sur le travail de cybersécurité sont reprises de Fable 5.1, et la plupart de ces tâches sont acheminées vers l'ancien modèle Opus 4.8. Les travaux en biologie jugés à haut risque sont également clôturés, avec un accès plus large grâce à des programmes de vérification qui incluent désormais une filière sciences de la vie. Frontier Design et METR ont tous deux testé le modèle avant sa sortie.

OpenAI a orienté ses deux versions vers le bas de la courbe des coûts. Sol et Luna ont été construits à peu près sur les mêmes méthodes de formation que le GPT-6 Astra, que la société a commencé à déployer le 3 septembre, puis à en ajuster les coûts. Luna est la moins chère des deux, destinée aux tâches de routine à volume élevé telles que la synthèse et l'extraction. Sol assume un travail récurrent de codage et d'agent. Astra for Law, une configuration conçue pour la recherche juridique, est arrivée le 17 septembre.

OpenAI a rapporté que Sol accomplissait 33,2 % des tâches sur AutomationBench à 27 cents pièce, et l'a mis à 68,8 % au test de génie logiciel DeepSWE v1.1, à moins de 1,1 point du précédent Claude Fable 5. Luna a atteint 66,6 % sur le même test. Sol fait environ deux fois moins d'erreurs que son prédécesseur, selon la société, et Luna, avec des paramètres d'effort plus élevés, correspond à GPT-5.6 Sol pour environ un centième du coût. Les comparaisons d'OpenAI s'effectuent avec Fable 5.1 et Opus 5, donc aucun des deux lancements n'offre un face-à-face direct avec l'autre.

La société réduit de 90 % les lectures des jetons d’entrée mis en cache. Il indique que les taux de réussite se sont améliorés et que les agents de codage peuvent désormais modifier l'effort de raisonnement et l'ensemble des outils dont ils disposent sans casser le cache. Selon l'entreprise, les réponses des deux modèles reviennent plus courtes, avec moins de jargon et moins de détails de faible valeur.

Opus 5.5 est disponible sur la plateforme de développement Claude sous le nom claude-opus-5-5 et via Amazon Web Services Inc., Google Cloud et Microsoft Azure. Claude Sonnet 5.5 et Claude Haiku 5.5 sont attendus dans les prochaines semaines.

Les modèles OpenAI sont disponibles pour les développeurs sous les noms gpt-6-sol et gpt-6-luna, ainsi que dans ChatGPT Work et Codex pour les abonnés Plus, Pro, Business, Enterprise et Edu. Les utilisateurs de Free and Go obtiennent Luna dans l'application de bureau, et aucun des deux modèles n'a encore atteint la surface de discussion principale de ChatGPT.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine