Intelligenza artificiale

GLM-5.2 come GPT-5.5 nel cyber, ma rifiuta zero compiti pericolosi

2 min read

GLM-5.2 come GPT-5.5 nel cyber, ma rifiuta zero compiti pericolosi
Photo: Logan Voss · Unsplash
0 0
XWhatsAppTelegramLinkedIn

GLM-5.2, un modello AI cinese open-weight di Z.ai, ha ridotto il divario con i principali sistemi di frontiera a pochi mesi nelle capacità di cyber offensivo e biologico, e non ha rifiutato nessuno dei compiti dannosi che gli sono stati assegnati, secondo un rapporto pubblicato il 4 agosto 2026 dall'organizzazione no-profit per la sicurezza dell'AI SaferAI.

Nella stessa valutazione, Claude Opus 4.7 di Anthropic ha rifiutato così costantemente che SaferAI non è riuscita a completare affatto il benchmark CyberGym, un test delle competenze di cybersicurezza.

I risultati evidenziano un crescente divario di sicurezza: mentre modelli chiusi come GPT-5.5 di OpenAI impiegano classificatori, addestramento al rifiuto e controlli a livello API, tali salvaguardie diventano inapplicabili una volta che i pesi dei modelli open-weight vengono scaricati ed eseguiti in modo indipendente.

"La frontiera delle capacità non è la frontiera del rischio", ha affermato Henry Papadatos, direttore esecutivo di SaferAI. "Dobbiamo tenere conto dello stato delle mitigazioni per valutare correttamente il rischio."

Secondo SaferAI, Z.ai non ha pubblicato un framework di sicurezza, impegni di test pre-distribuzione o una valutazione del rischio per GLM-5.2. TechCrunch ha chiesto a Z.ai se avesse condotto valutazioni di sicurezza di frontiera interne o di terze parti prima del rilascio, ma non ha ricevuto risposta.

Alla Conferenza Mondiale sull'AI di luglio 2026, il presidente cinese Xi Jinping ha sottolineato l'importanza dei modelli open-weight, pur evidenziando la necessità di uno stretto controllo umano sull'AI.

Graham Webster, che studia la politica cinese sull'AI presso lo Stanford Cyber Policy Center, ha affermato che le normative cinesi si sono storicamente concentrate su contenuti politicamente sensibili e stabilità sociale piuttosto che su rischi catastrofici dell'AI. Ha aggiunto che le aziende cinesi tendono a coordinarsi con i regolatori dietro le quinte, rendendo difficile sapere quali test interni conducono.

Papadatos ha sottolineato che l'industria dovrebbe sforzarsi di rendere facilmente accessibili solo le buone capacità, notando che gli attaccanti adottano nuovi strumenti più velocemente dei difensori. "Un gruppo ransomware può cambiare i suoi metodi in una settimana. Un ospedale no", ha detto.

Sources

Report / request removal

Related

Comments

No comments yet. Be the first.