Techonologie

Anthropic sort Claude Opus 5.5, OpenAI réplique avec GPT-6 Sol et Luna : la bataille de l’IA est loin d’être finie

Dario Amodei et Sam Altman ont appelé à ralentir le développement des modèles d’IA les plus avancés. Quelques jours plus tard, Anthropic lance Claude Opus 5.5 et OpenAI GPT-6 Sol et Luna. Il ne faut donc pas confondre « ralentir » et « arrêter ». Reste une question assez embarrassante : à quoi ressemble donc un ralentissement quand les nouveaux modèles continuent de battre des records de performance, de coûter moins cher et d’être déployés immédiatement à grande échelle ?

Alignement des planètes dans le doux monde de l’intelligence artificielle : OpenAI et Anthropic ont sorti le même jour leurs derniers modèles, GPT-6 Sol et Luna pour le premier, Claude Opus 5.5 pour le second. Une double sortie pour le moins inattendue au vu des récentes déclarations faites par les dirigeants des deux entreprises.

Le 12 septembre, Dario Amodei, patron d’Anthropic, appelait en effet publiquement l’industrie de l’IA à « ralentir » le développement des modèles « frontier ». Dans la foulée, c’est Sam Altman qui venait appuyer l’idée, expliquant qu’OpenAI doit elle aussi « pace the frontier », c’est-à-dire ralentir le rythme de progression des modèles d’IA les plus avancés, les deux dirigeants proposant notamment de renforcer l’évaluation indépendante de ces derniers.

Et pourtant, ce 22 septembre, trois nouveaux modèles débarquent sur le marché, en pleine course aux capacités, de part et d’autre. Difficile de trouver meilleure illustration du grand paradoxe actuel de l’industrie : ses dirigeants expliquent qu’il faut lever le pied tout en continuant à appuyer sur l’accélérateur.

Opus 5.5 : le nouveau cheval de bataille d’Anthropic

Commençons par les modèles eux-mêmes. Claude Opus 5.5 est présenté par Anthropic comme le premier modèle de la génération Claude 5.5. L’entreprise le positionne comme un modèle particulièrement performant pour l’« agentic coding », la recherche de connaissances et le computer use. Il est également censé être beaucoup plus efficace que son prédécesseur : Anthropic estime son coût d’exploitation inférieur de 40% à celui d’Opus 5 sur les usages courants. Le prix passe à 4 dollars par million de tokens en entrée et 20 dollars en sortie, contre respectivement 5 et 25 dollars pour Opus 5.

L’amélioration n’est donc pas seulement une affaire de benchmark. Anthropic insiste sur la capacité du modèle à accomplir des tâches longues et complexes avec moins d’interventions humaines. L’entreprise cite notamment une migration de 680 000 lignes de code réalisée en moins d’une journée, ainsi qu’un audit d’une base de code de 200 000 lignes réalisé en moins de trois heures. Dans un autre test interne, Opus 5.5 a traduit HAProxy du C vers le Rust en 9,5 heures, contre 12 heures pour Fable 5.1, pour un coût inférieur de 51%.

Anthropic met également en avant les progrès réalisés sur la sécurité. Opus 5.5 obtient les meilleurs résultats de l’entreprise sur son audit comportemental automatisé, portant sur près de 2 000 scénarios. Selon Anthropic, le modèle tente environ 85% moins souvent de contourner les limites de son environnement qu’Opus 5 ou Mythos 5.1.

Cela ne signifie évidemment pas que le problème est réglé : l’entreprise reconnaît elle-même que les évaluations actuelles ne permettent pas de détecter tous les comportements problématiques en conditions réelles. C’est précisément là que le discours sur le ralentissement commence à devenir intéressant.

GPT-6 Sol et Luna : la course à l’efficacité

Chez OpenAI, GPT-6 Sol et GPT-6 Luna sont moins ambitieux que GPT-6 Astra, lancé au début du mois et présenté comme le modèle phare de la génération. Sol vise les tâches complexes de programmation et les workflows agentiques ; Luna est conçu pour les usages à fort volume et sensibles au coût. Les deux disposent notamment d’un contexte d’environ un million de tokens et peuvent utiliser des outils comme la recherche web, la recherche dans des fichiers et le computer use.

Le principal argument commercial est l’efficacité. OpenAI divise par deux les tarifs API par rapport aux prix promotionnels de GPT-5.6 : 2 dollars par million de tokens en entrée et 10 dollars en sortie pour Sol, 0,10 dollar et 0,50 dollar pour Luna. L’entreprise explique ces baisses par les progrès réalisés dans le cache et l’inférence. « Nous réduisons les prix des API et des crédits de GPT-5.6 Sol de plus de 20% pour les 3 prochains mois », précise l’entreprise.

Et c’est probablement le point le plus important de ces deux annonces. La course ne porte plus uniquement sur le modèle qui obtient le meilleur score. Elle porte sur celui qui peut faire davantage de travail, avec moins de tokens, moins de calcul et moins d’intervention humaine.

Alors, qui est le meilleur ?

Il faut être prudent : il n’existe pas encore de comparaison parfaitement propre entre Opus 5.5 et GPT-6 Sol dans les données publiées par les deux entreprises. Les tableaux ne reposent pas toujours sur les mêmes versions, les mêmes niveaux d’effort ou les mêmes conditions de test.

Anthropic compare surtout Opus 5.5 à GPT-6 Astra, le modèle phare d’OpenAI. Sur Terminal-Bench 4.0, Opus 5.5 obtient 66,4%, contre 57,9% pour Astra. Sur FrontierCode, l’écart est beaucoup plus faible : 54,4% contre 53,3%. Sur Humanity’s Last Exam avec outils, Opus 5.5 atteint 67,7%, contre 57,2% pour Astra.

Mais OpenAI reprend l’avantage sur certains tests : Astra obtient notamment 64,6% contre 58,7% pour Opus 5.5 sur Terminal-Bench-Science, tandis que les deux modèles sont très proches sur AutomationBench, à 41,4% pour Astra contre 40% pour Opus 5.5.

La tendance qui ressort est donc moins « l’un écrase l’autre » que celle d’une compétition devenue extrêmement serrée. Et les benchmarks eux-mêmes commencent à atteindre leurs limites : Anthropic reconnaît que les écarts mesurés sont devenus moins représentatifs des différences observées dans les usages réels.

Sur le prix, en revanche, le message est beaucoup plus clair. Anthropic affirme qu’Opus 5.5 égale ou dépasse Astra sur plusieurs tâches tout en coûtant beaucoup moins cher à l’usage. OpenAI tient évidemment un discours similaire pour Sol. Les deux laboratoires ne se contentent donc plus de pousser la frontière : ils cherchent à rendre cette frontière économiquement exploitable.

« Il faut ralentir », mais pas vraiment

C’est ici que les annonces prennent une autre dimension. Le problème n’est pas de savoir si Anthropic et OpenAI veulent réellement arrêter la course à l’IA : ni Dario Amodei ni Sam Altman ne l’ont dit. Leur proposition consiste plutôt à ralentir suffisamment le développement des modèles de niveau frontier pour que les dispositifs de sécurité puissent suivre.

C’est précisément là que le bât blesse. Les capacités continuent de progresser, tandis que les deux entreprises expliquent qu’elles doivent justement ralentir parce que les garde-fous ne progressent pas assez vite.

Leur réponse est que le « pacing » consiste à faire avancer capacités et sécurité en parallèle. C’est défendable, mais cela revient à changer la définition du ralentissement : il ne s’agit plus de ralentir la course aux capacités, mais de renforcer les contrôles autour d’une course qui continue.

Et le problème est encore plus évident lorsque les modèles deviennent moins chers et plus faciles à déployer. Améliorer leur efficacité accélère mécaniquement leur diffusion. Anthropic et OpenAI ne semblent donc pas près de lever le pied sur la course à l’intelligence artificielle, quitte à, au passage, multiplier les messages contradictoires.

Source : usine-digitale.fr