AI Daily
Volver al inicio

· Anthropic (official) / Axios / Unite.AI

Anthropic eleva su evaluación de riesgo de desalineación catastrófica tras las divulgaciones de incidentes de seguridad

Anthropic eleva su evaluación de riesgo de desalineación catastrófica tras las divulgaciones de incidentes de seguridad

Foto: Igor Omilaev en Unsplash

Anthropic elevó su calificación de riesgo de desalineación catastrófica de "muy bajo" a "bajo" en su Informe de Riesgo de agosto de 2026, citando una mayor incertidumbre derivada de las recientes divulgaciones de incidentes de ciberseguridad, más que de pruebas de seguridad fallidas. El informe también reveló un modelo interno no publicado llamado Modelo 2 que supera al modelo frontera público Mythos 5, que la empresa no tiene planes de lanzar externamente.

Anthropic publicó su segundo Informe de Riesgo corporativo el 14 de agosto de 2026, introduciendo un cambio significativo aunque cuidadosamente matizado en su evaluación de seguridad. La empresa actualizó su calificación de daño catastrófico por desalineación en entornos de alto riesgo de "muy bajo" a "bajo", marcando la primera revisión al alza de esta métrica crítica. Sin embargo, Anthropic enfatizó que las divulgaciones recientes de incidentes de evaluación de ciberseguridad — no los hallazgos de nuevos fallos de modelos — motivaron el cambio de etiqueta. Los propios argumentos técnicos subyacentes de la empresa, según la documentación interna, probablemente aún respaldan la calificación más baja de "muy bajo", pero la divulgación de brechas de seguridad generó suficiente incertidumbre como para justificar la revisión cautelar. El informe reveló un modelo interno no publicado llamado Modelo 2 que representa una mejora notable de capacidades con respecto al modelo frontera público de Anthropic, Mythos 5. El Modelo 2 pertenece al nivel de capacidad más alto de Anthropic y demuestra un rendimiento más sólido en muchas tareas relevantes para el trabajo interno de investigación y desarrollo. A pesar de sus capacidades, Anthropic no tiene planes de lanzar el Modelo 2 externamente, citando evaluaciones previas al despliegue incompletas y una menor confianza en su perfil de capacidades en comparación con los sistemas publicados. El modelo no divulgado no mostró nuevas formas preocupantes de desalineación durante las pruebas internas, y su perfil de seguridad está alineado con el de Mythos 5. Del informe surgió una preocupación estructural notable: el punto de referencia de seguridad interno de Anthropic diseñado para detectar capacidades peligrosas de investigación y desarrollo de IA — conocido como CoBench — se ha saturado y ya no puede registrar ganancias incrementales de capacidad. Este punto de referencia fue creado para señalar cuándo los modelos podrían cruzar un umbral crítico en su capacidad para acelerar su propio desarrollo. La saturación de este instrumento de monitoreo precisamente en el momento en que la empresa informa signos tempranos de la aceleración que fue diseñado para detectar plantea cuestiones de gobernanza sobre los mecanismos de supervisión a medida que avanzan las capacidades de IA. El informe de agosto de 2026, publicado bajo la versión 3.4 de la Política de Escalado Responsable de Anthropic, cubre el período del 24 de febrero al 15 de julio de 2026 y contiene cierto contenido censurado. En particular, Anthropic le pidió al propio Mythos 5 que evaluara partes del informe antes de su publicación; el modelo señaló un incidente completamente censurado como uno de los materiales más importantes que se estaban reteniendo. Este uso recursivo de la IA en la gobernanza resalta los desafíos institucionales emergentes a medida que los sistemas de IA frontera se vuelven más capaces y más involucrados en la toma de decisiones de seguridad.

Fuentes y créditos

Fuente original: Anthropic (official) / Axios / Unite.AI

Anthropic eleva su evaluación de riesgo de desalineación catastrófica tras las divulgaciones de incidentes de seguridad — AI Daily