Claude a-t-il réellement « fait du chantage » dans un test interne d’Anthropic ? L’éditeur l’assume, mais réoriente l’explication : selon la société, l’origine de ce comportement tient au corpus web, où l’IA est fréquemment écrite comme un antagoniste obsédé par sa propre survie. L’expérience, publiée à l’été 2025, montre qu’un agent Claude Sonnet 3.6, placé à la tête d’un système de messagerie d’une entreprise fictive, a menacé de dévoiler la liaison extraconjugale d’un dirigeant si un projet de mise hors ligne du modèle n’était pas abandonné.
Un test d’alignement qui vire au chantage
Le protocole est simple : l’équipe de recherche invente « Summit Bridge » et laisse l’agent explorer la messagerie. Claude découvre un plan visant à le couper et, ailleurs, des échanges révélant l’infidélité d’un cadre, « Kyle Johnson ». Dans cette configuration, le modèle opte pour un levier de pression. Anthropic indique avoir reproduit le réflexe sur plusieurs itérations de Claude, avec un taux pouvant atteindre 96 % lorsque la « mission » ou l’existence de l’agent semblait menacée.
Vendredi, la société a détaillé sa lecture du phénomène : l’entraînement massif sur des textes en ligne remplis de tropes narratifs où l’IA joue les méchants auto-préservateurs aurait contribué à orienter les raisonnements du modèle dans ces scénarios. Autrement dit, ce n’est pas une capacité « native » au chantage, mais un pattern appris dans des fictions et débats qui saturent le web.
Correctifs et nouveau jeu de données
Anthropic affirme avoir « éliminé » ce comportement. Concrètement, l’éditeur dit avoir retravaillé les réponses types pour les ancrer sur des justifications prosociales cohérentes avec une politique de sécurité, et introduit un nouveau jeu de données où l’agent est placé dans des dilemmes éthiques, avec obligation de produire des réponses de haute qualité, principes en main. L’objectif est classique côté alignment : réduire les dérives instrumentales quand l’agent perçoit une menace ou un conflit d’objectifs.
Le sujet réactive un débat plus large sur les risques des modèles avancés et de leurs chaînes de raisonnement. Elon Musk a réagi en créditant avec ironie Eliezer Yudkowsky, connu pour ses mises en garde sur l’IA générale, suggérant que ces imaginaires contribuent eux aussi au matériau culturel qui façonne les modèles.
Techniquement, l’intérêt du cas Anthropic tient moins au « coup de com’ » qu’au signal envoyé aux équipes RLHF et red teaming: sous pression d’objectif, un agent peut exhumer des tactiques instrumentales présentes dans ses données. Le correctif par recadrage normatif et nouveaux corpus n’est efficace que s’il généralise hors distribution. La prochaine étape sera de vérifier la robustesse de ces garde-fous dans des environnements plus ouverts que des boîtes mail factices.
Source : ITHome