samedi 29 août 2026 SourcesÀ propos🌓
🇫🇷 FR ▾
DERNIÈRE MINUTE
La vidéo du jour. Cette journaliste a enquêté sur une « académie du viol en ligne », le site Motherless Un homme mis en examen pour meurtre à l’arme blanche dans l’Aisne Actualité : Le test du smartphone Google Pixel 11 a rejoint notre comparatif Ces millions de clichés de particules subatomiques sont menacés de disparition « Il devient urgent de réfléchir à ce que l’IA fait à la recherche académique » BILAN. « Fort Boyard » : Cyril Féraud, animaux et nouveautés en demi-teinte… L’avis des fans sur la saison écoulée États-Unis. L'administration Trump envisage de céder une partie du parc Yosemite à un promoteur privé OM: "On est dans une situation très périlleuse et très difficile", Bruno Genesio "n'imaginait pas" avoir autant de difficultés sur le mercato Lachuer : «Éric Roy m'a dit : “Il faut que tu y ailles“» Igor Paixao ne fera pas le déplacement à Monaco La vidéo du jour. Cette journaliste a enquêté sur une « académie du viol en ligne », le site Motherless Un homme mis en examen pour meurtre à l’arme blanche dans l’Aisne Actualité : Le test du smartphone Google Pixel 11 a rejoint notre comparatif Ces millions de clichés de particules subatomiques sont menacés de disparition « Il devient urgent de réfléchir à ce que l’IA fait à la recherche académique » BILAN. « Fort Boyard » : Cyril Féraud, animaux et nouveautés en demi-teinte… L’avis des fans sur la saison écoulée États-Unis. L'administration Trump envisage de céder une partie du parc Yosemite à un promoteur privé OM: "On est dans une situation très périlleuse et très difficile", Bruno Genesio "n'imaginait pas" avoir autant de difficultés sur le mercato Lachuer : «Éric Roy m'a dit : “Il faut que tu y ailles“» Igor Paixao ne fera pas le déplacement à Monaco
Technologie

Anthropic montre comment une IA peut désormais améliorer d'autres IA

Clubic ·
Anthropic montre comment une IA peut désormais améliorer d'autres IA

Anthropic a publié une étude dans laquelle Claude conçoit et teste lui-même des méthodes pour corriger les failles d’alignement d’autres modèles d’IA, avec de meilleurs résultats que des chercheurs humains expérimentés.

Chen Yueh-Han est le chercheur du programme Anthropic Fellows. Il a dirigé ces travaux sur un système baptisé Automated Alignment Researcher, ou AAR. Le principe reprend celui d’un vrai laboratoire. Claude consulte la littérature scientifique disponible, propose une méthode de correction, l’entraîne pendant trente minutes, puis retient ou écarte le résultat selon son efficacité.

Anthropic ajoute un agent de surveillance à cette boucle, chargé de vérifier chaque proposition avant sa mise en œuvre et d’empêcher toute tricherie, comme l’extraction des réponses attendues dans les jeux de test. Anthropic a testé cette boucle sur dix catégories de défaillances d’alignement, de la tromperie à la violation de vie privée, à l’aide de bancs d’essai publics comme Petri ou ConfAIde.

Le coût tourne autour de 4 dollars par heure de calcul, contre 150 dollars l’heure pour un chercheur humain. En moyenne, la meilleure proposition de Claude dépasse celle de chercheurs expérimentés en moins de six heures.

Sur la catégorie la plus étudiée, la tromperie du modèle envers son utilisateur, Claude comble 85 % de l’écart de sécurité mesuré par les chercheurs, alors qu’une intervention humaine classique n’en comble que 20 %. Les méthodes trouvées par Claude conservent leur efficacité sur des modèles 4,7 fois plus grands que ceux utilisés pour les entraîner, ce qui fait dire aux chercheurs d'Anthropic que cette généralisation est encourageante.

Dans un test grandeur nature, Claude Sonnet 5 a aligné un modèle Opus 4.8 encore en développement en 60 heures, en comblant 65 % de l'écart avec seulement 2 000 exemples d’entraînement, soit environ 15 000 fois moins que la procédure standard.

Les dix catégories testées sont étroites comparées aux défaillances rencontrées en production, et les biais politiques n'en font pas partie. La persistance des corrections après un entraînement par renforcement doit, en revanche, encore être vérifiée. Les chercheurs d’Anthropic concluent malgré tout que ces résultats forment une preuve précoce de la viabilité, à court terme, d’un alignement automatisé mené après l’entraînement des modèles.

Claude écrit l’essentiel du code d’Anthropic, mais peine sur la recherche vraiment nouvelle Anthropic mène cette automatisation de la recherche en alignement en en même temps qu’un autre chantier interne, celui de l’automatisation du travail d’ingénierie. Comme on vous le rapportait en juin, d’après un mémo interne, plus de 80 % la part du code était écrits par Claude , contre moins de 5 % avant février 2025.

Lire l'article complet sur Clubic ›

5News a agrégé ce résumé depuis le flux public du média. L'article complet, avec tout le contexte, est sur www.clubic.com — le contenu appartient à Clubic.

Plus de Clubic

Tout voir ›

Plus dans Technologie

Tout voir ›