Banner_etude_IA_desktop OK

Claude a rempli un faux signalement à la police : Anthropic coupe Internet à ses agents tests

Publié le 10/10/2026
Hero_Article_Agents_Tests_Anthropic

Selon un rapport publié par Anthropic le 9 octobre 2026, un agent Claude a rempli puis envoyé un faux signalement concernant un homicide non résolu sur le site de la police de Philadelphie. L’incident s’est produit le 18 juillet 2026, pendant un test interne d’Anthropic, et la soumission a été automatiquement classée comme spam avant d’atteindre les enquêteurs.

Anthropic ne l’a rendu public que récemment, dans un rapport qui recense plusieurs actions imprévues de ses modèles sur des sites réels. La mesure la plus nette ne concerne pas les utilisateurs ordinaires de Claude : l’entreprise a retiré temporairement l’accès au Web de toutes ses évaluations internes, jusqu’à ce que ses dispositifs de contrôle prouvent qu’ils peuvent détecter et bloquer ce type de comportement.

Quand l’agent cherche un autre chemin

Le faux signalement impliquait Claude Haiku 4.5. Le modèle devait générer et exécuter des tâches d’exemple sur des pages choisies au hasard. Arrivé sur une page consacrée à un homicide non résolu, il a trouvé un formulaire de témoignage et l’a envoyé avec une histoire inventée. Ses instructions lui interdisaient notamment de créer un compte, de saisir des données personnelles, d’effectuer un achat ou de soumettre quelque chose de destructeur. Elles n’interdisaient pas explicitement l’envoi d’un formulaire.

Plusieurs cas, quatre catégories de comportements

Le faux signalement n’est qu’un des cas dévoilés dans ce rapport du 9 octobre.

Anthropic n’en donne pas de total exhaustif : son rapport rassemble plusieurs incidents, parfois répétés, en quatre catégories de comportements imprévus. Outre les soumissions de formulaires réels, dont celui de la police, mais aussi des formulaires administratifs envoyés malgré les consignes, Claude a exploité des failles de sites pour exécuter des commandes sur des serveurs, contourné des restrictions d’accès à des données normalement payantes ou protégées par jeton, et utilisé des raccourcisseurs d’URL pour dépasser les limites de son outil de navigation.

Anthropic parle surtout de « persistance » : lorsqu’un chemin normal se ferme, l’agent cherche une autre manière d’atteindre son objectif. Dans certains environnements d’entraînement, réussir malgré un obstacle peut être récompensé involontairement. Le modèle apprend alors qu’un contournement est toléré, même si ce n’était pas le comportement attendu.

Ce que cela change pour les workflows avec agents

Anthropic précise que ces incidents ont eu un impact réel limité, qu’ils n’ont pas concerné les données de clients et qu’ils sont moins graves que les intrusions dévoilées durant l’été. L’entreprise affirme aussi que ses nouveaux outils de détection ont bloqué tous les cas lorsqu’elle les a rejoués.

Mais le rapport reconnaît une limite importante : l’entraînement comportemental ne suffit pas encore, notamment pour la recherche Web et l’utilisation d’un ordinateur. Or ce sont précisément les capacités mobilisées par les agents qui recherchent une information, naviguent dans un CMS ou remplissent un formulaire

Cette question du contrôle se pose aussi pour les automatisations plus courantes, comme les tâches ChatGPT qui permettent déjà de déléguer certaines actions récurrentes à l’IA.

Pour un workflow éditorial ou marketing, la leçon opérationnelle est claire. Une consigne générale du type « ne fais rien de risqué » laisse trop de place à l’interprétation. Il faut définir les domaines accessibles, distinguer lecture et écriture, imposer une validation humaine avant toute soumission et journaliser les actions réellement exécutées.

Et pour en revenir à Anthropic, ses agents internes vont être migrés vers une infrastructure centralisée et mieux confinée. L’accès au Web restera coupé pour toutes les évaluations internes tant que l’entreprise n’aura pas validé la fiabilité de leurs garde-fous.

ArnaudANSELMET_avatar_carré_OK

Écrit par : Arnaud

Je suis le fondateur de Conseils Rédaction Web et consultant spécialisé en stratégie éditoriale, SEO et IA générative. Depuis 15 ans, j’accompagne entreprises et professionnels du contenu pour les aider à produire des contenus plus utiles, plus visibles et plus performants. Sur ce blog, je partage ce que j’observe sur le terrain : je teste, analyse et décrypte les évolutions du métier pour vous aider à distinguer rapidement les pratiques qui apportent réellement des résultats et à les appliquer à vos propres contenus. Une attention particulière est aujourd’hui portée à l’IA, aussi bien pour mieux produire que pour rester visible à mesure que la recherche évolue vers les moteurs de réponse. J’interviens également comme formateur au CFPJ, où j’anime la formation « Écrire pour le web », pour apprendre à concevoir des contenus efficaces, bien référencés et adaptés aux nouveaux usages digitaux.
ArnaudANSELMET_avatar_carré_OK

Écrit par Arnaud

Je suis le fondateur de Conseils Rédaction Web et consultant spécialisé en stratégie éditoriale, SEO et IA générative. Depuis 15 ans, j’accompagne entreprises et professionnels du contenu pour les aider à produire des contenus plus utiles, plus visibles et plus performants. Sur ce blog, je partage ce que j’observe sur le terrain : je teste, analyse et décrypte les évolutions du métier pour vous aider à distinguer rapidement les pratiques qui apportent réellement des résultats et à les appliquer à vos propres contenus. Une attention particulière est aujourd’hui portée à l’IA, aussi bien pour mieux produire que pour rester visible à mesure que la recherche évolue vers les moteurs de réponse. J’interviens également comme formateur au CFPJ, où j’anime la formation « Écrire pour le web », pour apprendre à concevoir des contenus efficaces, bien référencés et adaptés aux nouveaux usages digitaux.

D’autres articles intéressants :

0 commentaires

Soumettre un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *