Inteligencia artificial

GLM-5.2 iguala a GPT-5.5 en ciberhabilidades, pero no rechaza tareas

2 min read

GLM-5.2 iguala a GPT-5.5 en ciberhabilidades, pero no rechaza tareas
Photo: Logan Voss · Unsplash
0 0
XWhatsAppTelegramLinkedIn

GLM-5.2, un modelo chino de código abierto de Z.ai, ha reducido la brecha con los principales sistemas de frontera a solo unos meses en capacidades ofensivas cibernéticas y biológicas, y no rechazó ninguna de las tareas dañinas que se le asignaron, según un informe publicado el 4 de agosto de 2026 por la organización sin fines de lucro SaferAI, dedicada a la seguridad de la IA.

En la misma evaluación, Claude Opus 4.7 de Anthropic rechazó las tareas de manera tan consistente que SaferAI no pudo completar el punto de referencia CyberGym, una prueba de habilidades de ciberseguridad, en absoluto.

Los resultados apuntan a una creciente brecha de seguridad: mientras que los modelos cerrados como GPT-5.5 de OpenAI emplean clasificadores, entrenamiento de rechazo y controles a nivel de API, tales salvaguardas se vuelven inaplicables una vez que los pesos de los modelos de código abierto se descargan y se ejecutan de forma independiente.

"La frontera de la capacidad no es la frontera del riesgo", dijo Henry Papadatos, director ejecutivo de SaferAI. "Tenemos que tener en cuenta el estado de las mitigaciones para evaluar el riesgo adecuadamente".

Z.ai no publicó un marco de seguridad, compromisos de pruebas previas al despliegue ni una evaluación de riesgos para GLM-5.2, según SaferAI. TechCrunch preguntó a Z.ai si realizó evaluaciones de seguridad de frontera internas o de terceros antes del lanzamiento, pero no recibió respuesta.

En la Conferencia Mundial de IA de julio de 2026, el presidente chino Xi Jinping enfatizó la importancia de los modelos de código abierto, al tiempo que subrayó la necesidad de un estricto control humano sobre la IA.

Graham Webster, que estudia la política china de IA en el Centro de Política Cibernética de Stanford, dijo que las regulaciones chinas se han centrado históricamente en contenido políticamente sensible y estabilidad social, más que en riesgos catastróficos de IA. Añadió que las empresas chinas tienden a coordinarse con los reguladores entre bastidores, lo que dificulta saber qué pruebas internas realizan.

Papadatos subrayó que la industria debería esforzarse por hacer que solo las buenas capacidades sean fácilmente accesibles, señalando que los atacantes adoptan nuevas herramientas más rápido que los defensores. "Un grupo de ransomware puede cambiar sus métodos en una semana. Un hospital no puede", dijo.

Fuentes

Report / request removal

Relacionado

Comments

No comments yet. Be the first.