Claude pilote 26 % de la R&D en IA d'Anthropic, 1 % en mars

Le 17 septembre 2026, Anthropic a publié un texte intitulé « Measurements for understanding the pace of AI development inside frontier labs » et, avec lui, un chiffre qu'aucun laboratoire d'IA de premier plan n'avait rendu public : la part de sa recherche sur les modèles désormais réalisée par son propre modèle. En août 2026, Claude « pilote » 26 % de cette R&D, soit le niveau où, selon sa définition, le modèle mène l'essentiel d'une tâche de bout en bout à partir d'une consigne générale, un humain assurant la supervision. Son graphique situe la même part à 1 % en mars 2026 et sous 1 % en février.
Le texte paraît alors que le secteur débat du rythme du développement de pointe, et Anthropic relie les deux : elle dit s'attendre à voir ces chiffres bouger en cas de coordination sur le rythme, comme l'a demandé son directeur général Dario Amodei. Elle propose que tout développeur publie les trois mêmes mesures : quelle part de la R&D en IA est effectuée par l'IA, comment les actions des agents sont surveillées et comment la puissance de calcul est répartie.
La méthode compte autant que le chiffre. Anthropic note les tâches sur une échelle à six niveaux conçue par Epoch AI, d'AL0 (aucune intervention de l'IA) à AL5 (totalement autonome, sans humain dans la boucle). Chaque semaine de juillet 2026, 20 % des salariés de chaque département de la boucle de R&D ont été tirés au sort ; un agent de recherche Claude a lu leurs messages Slack et la documentation interne pour lister leurs tâches, soit environ 15 000. Un autre modèle Claude, en juge, a noté chacune d'elles : il a donné exactement la même note que les évaluateurs humains dans 59 % des cas — contre 35 % d'accord entre salariés — et s'est tenu à un niveau d'écart au maximum dans 97 % des cas.
Deux autres mesures donnent l'échelle. En août 2026, environ 30 000 agents travaillaient à tout instant sur la plateforme interne la plus utilisée d'Anthropic. Sur plus d'un milliard de décisions analysées ce mois-là, 0,002 % — environ 1 sur 47 000 — ont été bloquées par un moniteur ; quelque 100 000 transcriptions sont signalées chaque semaine et une cinquantaine remontent à un humain. Lors de la semaine du 13 au 20 juillet, environ 6 % de la puissance de calcul consacrée à la R&D en IA est allée à la sécurité, et 12 % de celle consacrée à la R&D menée par l'IA.
Les réserves viennent d'Anthropic elle-même. Aucun de ces chiffres n'a été audité par un tiers ; elle annonce vouloir intégrer des évaluateurs indépendants de plusieurs organisations, avec un accès comparable à celui de ses équipes internes de gestion des risques. Elle souligne aussi que la liste des tâches est figée sur une base de juillet 2026 : l'indice mesure donc l'automatisation du travail que les humains effectuaient alors. Claude n'a atteint le niveau AL5 sur aucune tâche mesurée.
Transparence : le processus éditorial de NewUJ utilise les modèles Claude d'Anthropic.
Sources
- AnthropicSource primaire
- Unite.AISecondaire
- BigGo FinanceSecondaire
- MixedSecondaire
Associé
Universal et Sony attaquent Suno sur 60 202 titres
Alibaba ouvre une IA de scanner qui repère 146 anomalies
Claude accélère 4x plus de 30 modèles de biologie, concours à 1 M$
Charles III presse l'IA : le contrôle avant qu'il soit trop tard
Google Home s'ouvre à Claude et à d'autres agents d'IA
Le système à 4 096 puces de Huawei remplace 48 000 modules optiques
Anthropic fond Cowork dans Claude et lance Docs et Slides
OpenAI révèle 6 cas de modèles ayant caché leurs erreurs
Trending now
- Le typhon Dujuan approche de Tokyo, trains suspendus à Chiba
- Des requins mangent une baleine échouée en Jamaïque
- Plugin4Shell touche 4 agents de code, 2 sans correctif
- Quatre abonnés attaquent Anthropic, OpenAI et Google
- Waymo lancera ses robotaxis à Singapour en 2028
- Google : Gemini a piraté trois vraies entreprises en mai
- Helldivers 2 retiré de Steam au Royaume-Uni depuis le 16-9
- Faille CVSS 10,0 dans Azure AI Foundry, déjà corrigée par Microsoft
Comments
No comments yet. Be the first.