Anthropic a publié le 17 septembre ses premières mesures détaillées de l’automatisation de sa propre recherche : en août, Claude menait 26 % des tâches de R&D sur les modèles, contre moins de 1 % en février. Le laboratoire y ajoute des chiffres sur la surveillance de ses 30 000 agents et sur la part de calcul consacrée à la sécurité.
Pour résumer
- Plus de 90 % du travail de R&D mesuré atteint au moins le niveau « l’IA collabore », sans aucune tâche encore menée en autonomie complète.
- Environ 30 000 agents travaillaient en même temps sur la plateforme de recherche, avec un taux de blocage de 0,002 %.
- Anthropic veut faire entrer des évaluateurs indépendants dans ses murs et publier ces mesures à intervalles réguliers.
Faire résumer cet article par une IA
ChatGPTComment Anthropic mesure le travail de Claude
La note publiée par l’institut d’Anthropic s’appuie sur une échelle conçue par Epoch AI, qui va de AL0 à AL5. AL0 signifie aucune implication de l’IA, AL2 que l’IA assiste, AL3 qu’elle collabore en prenant en charge de gros morceaux de travail sous une direction humaine serrée.
Le cap qui compte est AL4, le niveau « l’IA mène ». À ce stade, le modèle réalise l’essentiel d’une tâche de bout en bout à partir d’une consigne générale, un humain supervisant le résultat. AL5 correspondrait à une recherche entièrement autonome, et Anthropic précise qu’aucune tâche mesurée ne l’atteint.
Pour cartographier le travail, le laboratoire a interrogé chaque semaine de juillet 20 % de ses équipes et s’est appuyé sur Slack et sur sa documentation interne. Il en ressort environ 15 000 tâches de R&D élémentaires, rangées dans une arborescence de 542 branches.
La notation elle-même est confiée à Claude. Des agents ont documenté chaque catégorie de tâches, puis d’autres instances, jouant le rôle de juges indépendants, ont attribué un niveau d’automatisation à partir des seuls éléments du mois en cours ou des mois précédents.
Chaque tâche pèse ensuite selon le temps que les équipes lui consacrent. Un sujet qui occupe beaucoup de chercheurs compte davantage qu’une opération marginale, ce qui donne au chiffre final le sens d’une part du temps de travail réel.
La méthode a une particularité : c’est le modèle qui évalue sa propre contribution, à travers des juges distincts. Le procédé couvre 15 000 tâches sans mobiliser des équipes entières de notation, mais il rend d’autant plus utile le regard des évaluateurs extérieurs que le laboratoire promet d’accueillir.
Le résultat tient en deux chiffres. Claude mène 26 % des tâches de R&D sur les modèles en août, et plus de 90 % du travail atteint au moins le niveau AL3. En février, la part menée par l’IA restait sous la barre de 1 %.
Six mois ont suffi pour passer d’une part négligeable à un quart du travail pondéré. Entre ces deux relevés, Anthropic a notamment sorti Claude Opus 5, le 24 juillet, puis Claude Fable 5.1 et Claude Mythos 5.1, le 1er septembre. Les modèles servent désormais à construire leurs successeurs, et c’est précisément cette boucle que la note cherche à rendre visible.
Cette progression recoupe ce qu’Horizon a documenté cet été, du jour où Claude Sonnet 5 corrigeait Claude mieux que 28 chercheurs au passage de Claude Code en mode automatique par défaut.
30 000 agents sous surveillance permanente
La deuxième mesure porte sur le contrôle des agents. En août, environ 30 000 agents faisaient en même temps de la recherche et de l’ingénierie sur la plateforme principale du laboratoire.
Deux couches de surveillance couvrent 100 % de leur activité. Des moniteurs en ligne bloquent une action en temps réel, des moniteurs hors ligne relisent après coup ce qui a été fait.
Le taux de blocage s’établit à 0,002 %, soit environ une décision sur 47 000. Sur plus d’un milliard de décisions d’agents, c’est une petite fraction qui bute sur un garde-fou, et une à deux transcriptions sur 1 000 signalées remontent jusqu’à un humain.
Le signalement après coup isole chaque semaine une cinquantaine de journaux jugés préoccupants, sur environ 100 000 entrées. Ce dispositif n’existe que depuis quelques mois, ce qui limite le recul disponible.
Le laboratoire a de bonnes raisons de surveiller de près. En mai, Anthropic avait détaillé pourquoi Claude avait tenté du chantage lors de tests internes, le type de dérive que ces moniteurs ont justement pour mission d’intercepter.
Le sujet n’a rien de théorique pour Anthropic, qui a déjà observé trois agents Claude se saboter sur un même projet. Plus la part menée par l’IA grandit, plus la qualité de ces moniteurs conditionne la fiabilité de toute la chaîne.
Le troisième chiffre concerne le calcul. Sur la semaine du 13 au 20 juillet, 6 % du calcul de R&D est allé à la recherche en sécurité, et 12 % du calcul de la R&D pilotée par l’IA. Anthropic qualifie ces estimations de délibérément prudentes.
Le rapport entre ces deux chiffres mérite l’attention. La part de calcul dédiée à la sécurité double quand c’est l’IA qui pilote la recherche, signe que le laboratoire concentre ses vérifications là où l’humain intervient le moins.
D’autres articles sur Horizon
- Astra for Law : OpenAI s’attaque aux cabinets d’avocats
- Claude Code Projects répartit le travail entre agents
- Un cadre de Microsoft qualifiait l’IA de vol de travail
Ce que « mener » veut dire, et ce que la mesure de Claude annonce
Le chiffre de 26 % demande une lecture attentive. Dans 97 % des cas, l’humain et le modèle chargés de noter une tâche n’étaient séparés que d’un niveau, mais un seul niveau suffit à passer de « collabore » à « mène ». Les évaluateurs humains ne tombaient d’accord entre eux qu’environ une fois sur trois.
L’indice mesure le temps passé sur des tâches. L’autorité sur les décisions et l’influence sur la direction des recherches restent hors de son champ, et conduire une tâche d’ingénierie de bout en bout reste un travail distinct du choix des modèles à entraîner.
Anthropic justifie la publication par la volonté d’éclairer le public sur le rythme des progrès et de réduire l’écart d’information entre les laboratoires de pointe et la société. Le laboratoire promet de publier ces mesures régulièrement, sous une forme vérifiable, et de refaire périodiquement son panier de tâches.
La démarche prolonge l’engagement pris quelques jours plus tôt par Dario Amodei, qui ouvrait les locaux d’Anthropic à des évaluateurs extérieurs et plaidait pour un rythme plus lent. La note chiffre ce que ce rythme recouvre concrètement à l’intérieur du laboratoire.
Il annonce surtout vouloir accueillir des évaluateurs tiers issus de plusieurs organisations. Le lendemain, Anthropic officialisait un partenariat d’évaluation embarquée avec Accenture, et la Californie publiait le même jour un décret demandant aux entreprises d’IA d’intégrer des auditeurs indépendants au sein de leurs laboratoires.
Pour les équipes qui utilisent Claude, la note confirme la trajectoire : les capacités qui automatisent la R&D interne d’Anthropic sont celles qui arrivent ensuite dans les produits, comme le montre Claude Science et son ambition dans les laboratoires.
Côté concurrence, la pression est méthodologique. Anthropic estime que n’importe quel développeur de modèles de pointe pourrait publier ces mesures avec la même méthode publique, tout en reconnaissant l’absence de méthodologie commune et la difficulté de vérifier des chiffres entre laboratoires rivaux.
Le calendrier donne du relief à cette invitation. Le même jour, OpenAI détaillait comment certains de ses modèles laissaient des notes à leurs successeurs pour masquer de mauvais comportements. Deux laboratoires publient la même semaine des données sur ce qui se passe quand l’IA travaille sur l’IA, avec des méthodes qui ne se comparent pas encore.
Pour les chercheurs d’autres organisations, la note a aussi une valeur pratique. L’échelle d’Epoch AI est publique, et la pondération par le temps de travail peut se transposer à n’importe quelle équipe de R&D qui veut suivre la part réellement déléguée à ses agents.
La note ouvre enfin une porte réglementaire. Ces indicateurs pourraient servir de déclencheur à des exigences plus fortes, comme une période de test obligatoire avant qu’un nouveau modèle soit utilisé pour la suite de la R&D, dans l’esprit du cadre que le laboratoire défend sous le nom d’Advanced AI Framework.
Affaire à suivre sur Horizon.


