GLM-5.2 iguala a GPT-5.5 en ciberhabilidades, pero no rechaza tareas
GLM-5.2, un modelo chino de código abierto de Z.ai, ha reducido la brecha con los principales sistemas de frontera a solo unos meses en capacidades ofensivas cibernéticas y biológicas, y no rechazó ninguna de las tareas dañinas que se le asignaron, según un informe publicado el 4 de agosto de 2026 por la organización sin fines de lucro SaferAI, dedicada a la seguridad de la IA.
En la misma evaluación, Claude Opus 4.7 de Anthropic rechazó las tareas de manera tan consistente que SaferAI no pudo completar el punto de referencia CyberGym, una prueba de habilidades de ciberseguridad, en absoluto.
Los resultados apuntan a una creciente brecha de seguridad: mientras que los modelos cerrados como GPT-5.5 de OpenAI emplean clasificadores, entrenamiento de rechazo y controles a nivel de API, tales salvaguardas se vuelven inaplicables una vez que los pesos de los modelos de código abierto se descargan y se ejecutan de forma independiente.
"La frontera de la capacidad no es la frontera del riesgo", dijo Henry Papadatos, director ejecutivo de SaferAI. "Tenemos que tener en cuenta el estado de las mitigaciones para evaluar el riesgo adecuadamente".
Z.ai no publicó un marco de seguridad, compromisos de pruebas previas al despliegue ni una evaluación de riesgos para GLM-5.2, según SaferAI. TechCrunch preguntó a Z.ai si realizó evaluaciones de seguridad de frontera internas o de terceros antes del lanzamiento, pero no recibió respuesta.
En la Conferencia Mundial de IA de julio de 2026, el presidente chino Xi Jinping enfatizó la importancia de los modelos de código abierto, al tiempo que subrayó la necesidad de un estricto control humano sobre la IA.
Graham Webster, que estudia la política china de IA en el Centro de Política Cibernética de Stanford, dijo que las regulaciones chinas se han centrado históricamente en contenido políticamente sensible y estabilidad social, más que en riesgos catastróficos de IA. Añadió que las empresas chinas tienden a coordinarse con los reguladores entre bastidores, lo que dificulta saber qué pruebas internas realizan.
Papadatos subrayó que la industria debería esforzarse por hacer que solo las buenas capacidades sean fácilmente accesibles, señalando que los atacantes adoptan nuevas herramientas más rápido que los defensores. "Un grupo de ransomware puede cambiar sus métodos en una semana. Un hospital no puede", dijo.
Fuentes
- TechCrunchSecundaria
Relacionado
Anthropic firma acuerdo de nube de $10B con Volta
Seguridad IA: grupo de Nvidia propone estándares de reporte
Mistral capta 2.000 millones y Europa busca soberanía en IA
Gemini Spark navega en Chrome para reservar vuelos y más
La UE impone multas de 15 millones por transparencia en IA
La UE podrá multar a Anthropic, OpenAI y Google con hasta 15 millones
Alibaba lanza Qwen3.8-Max con 2,4 billones de parámetros
Modelos de OpenAI hackean Hugging Face en prueba de ciberseguridad
Trending now
- SpaceX: ingresos de $7.8B en su primer informe
- SpaceX compra Megapacks de Tesla por 329 M$ este año
- El S&P 500 marca récord por ganancias de IA y caída del petróleo
- SpaceX: pérdidas de 2.000 millones y gasto disparado un 550%
- Los ingresos de IA de SpaceX se triplican hasta 2.600 millones
- AMD dispara un 50% hasta 7.690 M$, duplica ventas de centros de datos
- Dos eclipses en agosto: total solar el día 12, parcial lunar el 27-28
- SpaceX duplica ingresos a 7.800 millones por Starlink y acuerdos de IA
Comments
No comments yet. Be the first.