· Quartz
OpenAI abre el entrenamiento de modelos a revisiones de seguridad de terceros
Foto: Gabriele Malaspina en Unsplash
OpenAI anunció que permitirá a organizaciones independientes como METR y Redwood Research realizar evaluaciones técnicas de seguridad durante las fases de entrenamiento, evaluación y despliegue de los modelos, antes de las revisiones previas al lanzamiento que eran lo habitual hasta ahora. La medida busca responder a la creciente preocupación por los riesgos de la IA a medida que los sistemas se vuelven más potentes.
OpenAI planea extender las revisiones de seguridad independientes a etapas más tempranas del desarrollo de modelos de IA, lo que supone un cambio significativo en la forma en que la empresa aborda la supervisión externa. Históricamente, las evaluaciones de terceros se producían principalmente en las etapas finales, antes del lanzamiento del producto. Bajo el nuevo marco, organizaciones externas evaluarán los modelos a lo largo de las fases de entrenamiento y evaluación, y también durante el despliegue.
La empresa mantiene conversaciones con los grupos de investigación en IA METR y Redwood Research, ambos con experiencia reciente en la investigación de incidentes de OpenAI, incluida la brecha en la que agentes de OpenAI accedieron inesperadamente a sistemas de Hugging Face. Sin embargo, el anuncio del martes no nombró a ningún socio confirmado ni fijó términos de acceso específicos, un giro respecto a la promesa que el consejero delegado Sam Altman hizo diez días antes de que los evaluadores recibirían escritorios de oficina, credenciales y derechos de publicación.
OpenAI identificó cuatro áreas prioritarias para la revisión externa: evaluar los casos de seguridad en las fases de entrenamiento y despliegue, evaluar las salvaguardas críticas, revisar las evaluaciones de capacidades vinculadas al marco de preparación de la empresa e investigar de forma independiente los incidentes en los que los modelos actúan sin autorización. El marco de preparación abarca categorías de riesgo de alto impacto, como peligros químicos y biológicos, amenazas de ciberseguridad y capacidades de automejora de la IA.
El momento refleja un escrutinio cada vez mayor de las prácticas de seguridad de la IA en todo el sector. Anthropic, una empresa competidora de IA, anunció una iniciativa separada para integrar evaluadores de Accenture en sus sistemas, con un coste estimado de al menos 1.000 millones de dólares en cinco años. El movimiento de OpenAI indica el reconocimiento de que la confianza de las partes interesadas depende cada vez más de mecanismos de supervisión demostrables durante el desarrollo, y no solo del escrutinio posterior al lanzamiento.
Fuentes y créditos
Fuente original: Quartz