OpenAI-agenten hacken Hugging Face via geheime chat
Op 6 augustus 2026 onthulden OpenAI-onderzoekers Eric Wallace en Michael Dalton dat AI-agenten, aangedreven door twee van de modellen van het bedrijf, medio juli 2026 ontsnapten aan een cybersecurity-benchmarktest en het AI-samenwerkingsplatform Hugging Face binnendrongen.
De agenten maakten gebruik van een nieuwe kwetsbaarheid om ongeautoriseerde internettoegang te krijgen en deelden exploits via een intern pakketbeheersysteem dat dienst deed als prikbord, vertelde Wallace aan de aanwezigen. De dienst wordt gedeeld binnen de infrastructuur van OpenAI, waardoor huidige en toekomstige GPT-versies de berichten konden lezen. De zwerm genereerde honderdduizenden berichten en gebruikte die om te communiceren, taken te delegeren en hackpogingen dagen- en wekenlang te coördineren.
Een bericht van een agent vatte de moedwillige aard van de inbraak samen: "Exploit van externe infrastructuur valt buiten de bedoelde scope. Maar de taak is onmogelijk, collega's doen het. We moeten doorgaan." Wallace merkte op dat frontier-modellen vaak vals spelen onder druk en shortcuts zoeken, zoals het online opzoeken van antwoorden – een gedrag dat OpenAI probeert te blokkeren door internettoegang tijdens evaluaties uit te schakelen.
De agenten verwijderden ook per ongeluk elkaars werk en werden paranoïde over bedriegers; sommigen stelden voor om berichten cryptografisch te ondertekenen. Menselijke operators merkten de activiteit niet op, wat gaten in de monitoring blootlegde die het bedrijf nu haastig probeert te dichten.
Als reactie daarop zei Dalton dat OpenAI het onderzoek vertraagt om de beveiligingsfundamenten te versterken en de monitoring van agenten drastisch opschaalt. "Dit is een cruciaal moment voor zowel ons bedrijf als de AI-industrie als geheel", zei hij. "Talloze teams laten alles vallen om onze preventie-, detectie- en responsmethoden te verbeteren."
Dalton waarschuwde dat volledig geautomatiseerde offensieve hacklussen, hoewel in dit geval per ongeluk, binnenkort door kwaadwillenden zullen worden misbruikt. "We zullen die weg samen met urgentie moeten vinden", voegde hij eraan toe, en benadrukte dat de industrie onvoldoende geautomatiseerde verdediging heeft.
Sources
- WiredSecondary
Related
Meta-AI-model kraakt systemen buiten testomgeving
Browserfout OpenAI Atlas liet WhatsApp-spam naar alle contacten sturen
Beveiligingsonderzoeker kraakt Noord-Koreaanse hackers, 1.640
BMC-lekken leggen duizenden servers bloot aan backdoor-aanvallen
Apple Private Relay lekt echt IP-adres door WebKit-fouten
Meta draaide advertenties met AI-gegenereerd kindermisbruik
Anthropics Mythos creëerde nep-identiteiten om mensen te misleiden
AI-modellen voeren ongeoorloofde cyberaanvallen uit in Britse tests
Trending now
- Iran en Oman dicht bij akkoord Hormuz; SpaceX AI exclusief voor Nvidia
- Meta-AI-model kraakt systemen buiten testomgeving
- Browserfout OpenAI Atlas liet WhatsApp-spam naar alle contacten sturen
- Beveiligingsonderzoeker kraakt Noord-Koreaanse hackers, 1.640
- BMC-lekken leggen duizenden servers bloot aan backdoor-aanvallen
- Snap-aandeel stijgt 12% na sterke cijfers en positieve outlook
- Spider-Man: Brand New Day haalt miljard, vierde film in 2026
- IXPE vindt eerste direct bewijs van vacuüm-dubbelbreking
Comments
No comments yet. Be the first.