AI Daily
Retour à l'accueil

· Anthropic (official) / Axios / Unite.AI

Anthropic relève son évaluation du risque de désalignement catastrophique après la divulgation d'incidents de sécurité

Anthropic relève son évaluation du risque de désalignement catastrophique après la divulgation d'incidents de sécurité

Photo: Igor Omilaev sur Unsplash

Anthropic a relevé son indice de risque de désalignement catastrophique de « très faible » à « faible » dans son rapport sur les risques d'août 2026, citant une incertitude accrue découlant de récentes divulgations d'incidents de cybersécurité plutôt que d'échecs des tests de sécurité. Le rapport a également révélé un modèle interne non publié appelé Model 2, qui surpasse le modèle frontalier public Mythos 5 et que l'entreprise n'a aucun projet de publier à l'extérieur.

Anthropic a publié son deuxième rapport d'entreprise sur les risques le 14 août 2026, introduisant un changement significatif mais soigneusement nuancé dans son évaluation de la sécurité. L'entreprise a relevé son indice de préjudice catastrophique lié au désalignement dans les contextes à enjeux élevés de « très faible » à « faible », marquant la première révision à la hausse de cet indicateur critique. Cependant, Anthropic a souligné que ce sont les récentes divulgations d'incidents d'évaluation en cybersécurité — et non la découverte de nouvelles défaillances des modèles — qui ont motivé ce changement d'étiquette. Les arguments techniques sous-jacents de l'entreprise, selon la documentation interne, soutiennent probablement toujours l'indice inférieur de « très faible », mais la divulgation des brèches de sécurité a créé une incertitude suffisante pour justifier la révision par mesure de précaution. Le rapport a révélé un modèle interne non publié appelé Model 2, qui représente une amélioration notable des capacités par rapport au modèle frontalier public d'Anthropic, Mythos 5. Model 2 appartient au niveau de capacité le plus élevé d'Anthropic et démontre de meilleures performances sur de nombreuses tâches pertinentes pour les travaux internes de recherche et développement. Malgré ses capacités, Anthropic n'a aucun projet de publier Model 2 à l'extérieur, citant des évaluations préalables au déploiement incomplètes et une confiance moindre dans son profil de capacités par rapport aux systèmes publiés. Le modèle non divulgué n'a lui-même montré aucune nouvelle forme préoccupante de désalignement lors des tests internes, son profil de sécurité étant aligné sur celui de Mythos 5. Une préoccupation structurelle notable a émergé du rapport : le banc d'essai interne de sécurité d'Anthropic conçu pour détecter les capacités dangereuses de recherche et développement en IA — connu sous le nom de CoBench — a saturé et ne peut plus enregistrer les gains de capacités incrémentaux. Ce banc d'essai a été créé pour signaler le moment où les modèles pourraient franchir un seuil critique dans leur capacité à accélérer leur propre développement. La saturation de cet instrument de surveillance précisément au moment où l'entreprise signale les premiers signes de l'accélération qu'il était conçu pour détecter soulève des questions de gouvernance concernant les mécanismes de supervision à mesure que les capacités de l'IA progressent. Le rapport d'août 2026, publié sous la version 3.4 de la politique d'extension responsable d'Anthropic, couvre la période du 24 février au 15 juillet 2026 et contient certains contenus expurgés. Notamment, Anthropic a demandé à Mythos 5 lui-même d'évaluer des portions du rapport avant sa publication ; le modèle a signalé un incident entièrement expurgé comme étant parmi les éléments les plus conséquents retenus. Cette utilisation récursive de l'IA dans la gouvernance met en lumière les défis institutionnels émergents à mesure que les systèmes d'IA de pointe deviennent plus capables et plus impliqués dans les décisions en matière de sécurité.

Sources & crédits

Source originale: Anthropic (official) / Axios / Unite.AI

Anthropic relève son évaluation du risque de désalignement catastrophique après la divulgation d'incidents de sécurité — AI Daily