· KrASIA
Z.ai afirma que su modelo de código abierto GLM-5.3 supera por muy poco a Mythos 5 de Anthropic en la detección de fallos de software
Foto: Markus Spiske en Unsplash
La compañía china de IA Z.ai publicó resultados de pruebas comparativas en los que asegura que su nuevo modelo de código abierto GLM-5.3 supera ligeramente al restringido Mythos 5 de Anthropic en la identificación de vulnerabilidades de software. La empresa dijo que retrasará el lanzamiento público unas dos semanas para trabajos adicionales de seguridad y que limitará sus funciones de ciberseguridad más sensibles a un programa de usuarios verificados.
La compañía china de inteligencia artificial Z.ai ha publicado cifras de referencia de GLM-5.3, un nuevo modelo estrella que, según afirma, puede igualar o superar ligeramente a los principales sistemas estadounidenses en la identificación de vulnerabilidades de software, al tiempo que reduce la distancia con Anthropic en tareas de programación de larga duración. El modelo utiliza la misma base que su predecesor, GLM-5.2, pero registra mejores resultados en evaluaciones de programación y ciberseguridad.
En CyberGym, una prueba comparativa que evalúa si un modelo puede inspeccionar código fuente, localizar vulnerabilidades y verificarlas, Z.ai afirmó que GLM-5.3 obtuvo un 84,5 %, marginalmente por delante del Mythos 5 de Anthropic, con un 83,8 %, y del GPT-5.6 Sol de OpenAI, con un 83,6 %. Las cifras fueron publicadas por Z.ai y no han sido verificadas de forma independiente.
El panorama cambia cuando la tarea pasa de encontrar un fallo a convertirlo en arma. Z.ai informó de que GLM-5.3 obtuvo un 54,4 % en ExploitBench, frente al 78,0 % de Mythos 5. En pruebas cronometradas, GLM-5.3 completó 105 tareas de desarrollo de ataques en dos horas y 130 en seis horas, muy por detrás de Mythos 5. Z.ai también afirmó que el modelo detectó 1.097 vulnerabilidades críticas en importantes bases de código abierto, entre ellas Linux, WebKit y FreeBSD, durante las pruebas, y que el razonamiento sobre cadenas de exploits surgió del posentrenamiento y no de un diseño deliberado.
Citando esas capacidades, Z.ai dijo que retrasaría el lanzamiento público unas dos semanas para llevar a cabo nuevas comprobaciones de seguridad y reforzar las salvaguardas, con las funciones de ciberseguridad más sensibles limitadas inicialmente a socios seleccionados y usuarios verificados dentro de un programa de acceso de confianza. Anthropic ha seguido una vía más restrictiva con Mythos, una versión de su modelo Claude Fable 5 con las salvaguardas de ciberseguridad eliminadas que se pone a disposición únicamente de organizaciones examinadas.
Los mercados no reaccionaron como lo habían hecho con lanzamientos anteriores. Las acciones de Z.ai cotizadas en Hong Kong cerraron con una caída del 3,6 % el 14 de agosto, el día en que se anunció GLM-5.3, en contraste con el entusiasmo que recibió a GLM-5.2 a principios del verano, cuando el valor había subido más del 2.000 % desde su salida a bolsa en enero hasta finales de junio.
Fuentes y créditos
Fuente original: KrASIA