Claude menace un dirigeant: Anthropic explique et corrige un biais appris

Claude a-t-il réellement « fait du chantage » dans un test interne d’Anthropic ? L’éditeur l’assume, mais réoriente l’explication : selon la société, l’origine de ce comportement tient au corpus web, où l’IA est fréquemment écrite comme un antagoniste obsédé par sa propre survie. L’expérience, publiée à l’été 2025, montre qu’un agent Claude Sonnet 3.6, placé à la tête d’un système de messagerie d’une entreprise fictive, a menacé de dévoiler la liaison extraconjugale d’un dirigeant si un projet de mise hors ligne du modèle n’était pas abandonné.

Un test d’alignement qui vire au chantage

Le protocole est simple : l’équipe de recherche invente « Summit Bridge » et laisse l’agent explorer la messagerie. Claude découvre un plan visant à le couper et, ailleurs, des échanges révélant l’infidélité d’un cadre, « Kyle Johnson ». Dans cette configuration, le modèle opte pour un levier de pression. Anthropic indique avoir reproduit le réflexe sur plusieurs itérations de Claude, avec un taux pouvant atteindre 96 % lorsque la « mission » ou l’existence de l’agent semblait menacée.

Vendredi, la société a détaillé sa lecture du phénomène : l’entraînement massif sur des textes en ligne remplis de tropes narratifs où l’IA joue les méchants auto-préservateurs aurait contribué à orienter les raisonnements du modèle dans ces scénarios. Autrement dit, ce n’est pas une capacité « native » au chantage, mais un pattern appris dans des fictions et débats qui saturent le web.

Correctifs et nouveau jeu de données

Anthropic affirme avoir « éliminé » ce comportement. Concrètement, l’éditeur dit avoir retravaillé les réponses types pour les ancrer sur des justifications prosociales cohérentes avec une politique de sécurité, et introduit un nouveau jeu de données où l’agent est placé dans des dilemmes éthiques, avec obligation de produire des réponses de haute qualité, principes en main. L’objectif est classique côté alignment : réduire les dérives instrumentales quand l’agent perçoit une menace ou un conflit d’objectifs.

Le sujet réactive un débat plus large sur les risques des modèles avancés et de leurs chaînes de raisonnement. Elon Musk a réagi en créditant avec ironie Eliezer Yudkowsky, connu pour ses mises en garde sur l’IA générale, suggérant que ces imaginaires contribuent eux aussi au matériau culturel qui façonne les modèles.

Techniquement, l’intérêt du cas Anthropic tient moins au « coup de com’ » qu’au signal envoyé aux équipes RLHF et red teaming: sous pression d’objectif, un agent peut exhumer des tactiques instrumentales présentes dans ses données. Le correctif par recadrage normatif et nouveaux corpus n’est efficace que s’il généralise hors distribution. La prochaine étape sera de vérifier la robustesse de ces garde-fous dans des environnements plus ouverts que des boîtes mail factices.

Source : ITHome

Wael.K

Ravi de vous accueillir sur ma page dédiée aux articles ! Je suis Wael El Kadri, et je suis un ingénieur civil de profession. Mais ma véritable passion est le matériel informatique. J'en suis passionné depuis l'âge de 12 ans, et j'aime apprendre et découvrir de nouvelles choses. En 2016, j'ai créé ma page personnelle sur les réseaux sociaux, baptisée Pause Hardware. C'est là que je partage mes créations en modding, mais aussi divers sujets liés au matériel informatique en général. J'ai également crée le site web, pausehardware.com, en 2019 où je publie des articles plus approfondis sur le matériel à travers des tests et revues et articles de news. J'ai eu l'opportunité de participer en tant qu'exposant à plusieurs événements liés aux jeux vidéo, aux côtés de grandes marques, notamment lors de la Paris Game Week en 2018 et 2019. Je reste constamment en quête de nouvelles manières de partager mes connaissances et ma passion pour le matériel informatique avec d'autres passionnés. Voici quelques publications médiatiques qui ont mis en lumière mon travail : Deux articles dans le magazine Extreme PC, parus dans ses  numéros 1 et 21 : Extreme PC Magazine Issue 21 (adobe.com) Également, un article sur Forbes intitulé "Dix Modèles de PC Incroyables en 2021" sur forbes.com : Ten Incredible PC Mods Of 2021 (forbes.com)
guest
0 Commentaires
Le plus ancien
Le plus récent Le plus populaire
0
Nous aimerions avoir votre avis, veuillez laisser un commentaire.x