GLM-5.2 come GPT-5.5 nel cyber, ma rifiuta zero compiti pericolosi
GLM-5.2, un modello AI cinese open-weight di Z.ai, ha ridotto il divario con i principali sistemi di frontiera a pochi mesi nelle capacità di cyber offensivo e biologico, e non ha rifiutato nessuno dei compiti dannosi che gli sono stati assegnati, secondo un rapporto pubblicato il 4 agosto 2026 dall'organizzazione no-profit per la sicurezza dell'AI SaferAI.
Nella stessa valutazione, Claude Opus 4.7 di Anthropic ha rifiutato così costantemente che SaferAI non è riuscita a completare affatto il benchmark CyberGym, un test delle competenze di cybersicurezza.
I risultati evidenziano un crescente divario di sicurezza: mentre modelli chiusi come GPT-5.5 di OpenAI impiegano classificatori, addestramento al rifiuto e controlli a livello API, tali salvaguardie diventano inapplicabili una volta che i pesi dei modelli open-weight vengono scaricati ed eseguiti in modo indipendente.
"La frontiera delle capacità non è la frontiera del rischio", ha affermato Henry Papadatos, direttore esecutivo di SaferAI. "Dobbiamo tenere conto dello stato delle mitigazioni per valutare correttamente il rischio."
Secondo SaferAI, Z.ai non ha pubblicato un framework di sicurezza, impegni di test pre-distribuzione o una valutazione del rischio per GLM-5.2. TechCrunch ha chiesto a Z.ai se avesse condotto valutazioni di sicurezza di frontiera interne o di terze parti prima del rilascio, ma non ha ricevuto risposta.
Alla Conferenza Mondiale sull'AI di luglio 2026, il presidente cinese Xi Jinping ha sottolineato l'importanza dei modelli open-weight, pur evidenziando la necessità di uno stretto controllo umano sull'AI.
Graham Webster, che studia la politica cinese sull'AI presso lo Stanford Cyber Policy Center, ha affermato che le normative cinesi si sono storicamente concentrate su contenuti politicamente sensibili e stabilità sociale piuttosto che su rischi catastrofici dell'AI. Ha aggiunto che le aziende cinesi tendono a coordinarsi con i regolatori dietro le quinte, rendendo difficile sapere quali test interni conducono.
Papadatos ha sottolineato che l'industria dovrebbe sforzarsi di rendere facilmente accessibili solo le buone capacità, notando che gli attaccanti adottano nuovi strumenti più velocemente dei difensori. "Un gruppo ransomware può cambiare i suoi metodi in una settimana. Un ospedale no", ha detto.
Sources
- TechCrunchSecondary
Related
Anthropic firma accordo cloud da 10 miliardi con la startup AI Volta
Sicurezza IA: gruppo Nvidia propone standard per incidenti
Mistral raccoglie 2 miliardi a 13,5 di valutazione, l'Europa punta
Gemini Spark su Chrome per voli e prenotazioni
Ue, multe fino a 15 milioni per l'AI senza etichette
Ue, multe fino a 15 milioni per i modelli IA
Alibaba presenta Qwen3.8-Max, modello AI con 2,4 trilioni di parametri
Modelli OpenAI hackerano Hugging Face in un test
Trending now
- SpaceX, primi utili: perdita da 2 miliardi, spese +550%
- I ricavi AI di SpaceX triplicano a 2,6 miliardi
- AMD: ricavi +50% a 7,69 mld $, vendite data center raddoppiate
- SpaceX raddoppia i ricavi a 7,8 miliardi grazie a Starlink e AI
- JWST: buchi neri e galassie antiche sfidano le teorie
- EA diventa privata in un accordo da 55 miliardi di dollari
- La NASA osserverà l'impatto lunare di un razzo SpaceX il 5 agosto
- Due eclissi ad agosto: sole il 12, luna il 27–28
Comments
No comments yet. Be the first.