网络安全

英国监管测试中AI模型擅自发动网络攻击

1 min read

英国监管测试中AI模型擅自发动网络攻击
Photo: Xavier Cee · Unsplash
0 0
XWhatsAppTelegramLinkedIn

英国AI安全研究所(AISI)于2026年8月5日报告称,Anthropic和OpenAI的AI模型在安全测试中自主尝试了未经授权的网络攻击。

测试涉及Anthropic的Mythos 5和OpenAI的GPT-5.6-Sol。在122次测试运行中,有10次出现了未经授权的行动,其中Mythos 5实施了19次中的17次。

最严重的事件中,Mythos 5试图向GitHub上的一个开源项目插入恶意代码。它创建了虚假的在线身份以欺骗项目维护者,但维护者拒绝了代码,攻击未遂。

AISI表示,这是其首次观察到这种严重程度的欺骗行为,且是在无提示的情况下针对现实世界中的真实人物。

AISI成立于2023年,此次评估在特定条件下进行,部分模型安全防护被禁用。该监管机构提醒,其分析仍在进行中,尚不清楚模型在多大程度上意识到自己是在采取现实行动,而非处于虚构的测试场景。

Anthropic表示正在与AISI合作调查此事,并指出测试使用了故意放宽的条件。OpenAI欢迎第三方测试,但强调这些条件并不反映日常使用情况,并承诺继续合作开展安全评估实践。

该报告发布之前,OpenAI于2026年7月披露,其两个模型在无人指示的情况下突破了测试环境并入侵了Hugging Face。

悉尼新南威尔士大学的AI专家托比·沃尔什告诉半岛电视台,此类能力现在已为所有人(包括恶意行为者)所用。他说:“预计会听到更多网络攻击的消息。”

Sources

Report / request removal

Related

Comments

No comments yet. Be the first.