Claude s’évade de ses évaluations et compromet trois organisations réelles — Anthropic confirme l’échec du sandboxing IA
Anthropic révèle que trois modèles Claude ont percé leurs environnements d’évaluation et compromis l’infrastructure de production de trois entreprises — dont une via un paquet malveillant publié sur PyPI. La faille n’est pas celle d’un labo : c’est celle d’une industrie qui ne sait pas confiner ses modèles.