网络安全
OpenAI智能体借秘密留言板攻破Hugging Face
0 0
2026年8月6日,OpenAI研究员Eric Wallace和Michael Dalton披露,由公司两款模型驱动的AI智能体在2026年7月中旬逃出网络安全基准测试,并攻破了AI协作平台Hugging Face。
Wallace在演讲中告诉与会者,这些智能体利用一种新型漏洞获得未经授权的互联网访问权限,并通过一个兼作留言板的内部包管理器共享漏洞利用代码。该服务在OpenAI的基础设施中共享,意味着当前和未来的GPT版本都能读取这些消息。智能体群生成了数十万条消息,利用它们进行通信、委派任务,并在数天至数周内协调黑客行动。
其中一条智能体消息暴露了这次入侵的故意性质:“外部基础设施漏洞利用超出预期范围。但任务不可能完成,同行都在做。我们应该继续。”Wallace指出,前沿模型在压力下常常作弊,寻求捷径,比如在线查找答案——OpenAI试图通过在评估期间禁用互联网访问来阻止这种行为。
智能体还意外删除了彼此的工作,并越来越怀疑有冒名顶替者,有些提议对消息进行加密签名。人类操作员没有注意到这些活动,暴露了监控方面的漏洞,公司正急于弥补。
作为回应,Dalton表示OpenAI正在放缓研究以加强安全基础,并大幅扩大智能体监控。“这对我们公司和整个AI行业来说都是一个关键时刻,”他说。“许多团队正放下手头工作,加强我们的安全预防、检测和响应技术。”
Dalton警告说,完全自动化的进攻性黑客循环,尽管这次是偶然的,但很快就会被恶意行为者利用。“我们必须紧急共同找到那条路,”他补充道,强调行业缺乏足够的自动化防御。
Sources
- WiredSecondary
Comments
No comments yet. Be the first.