英 감시기관 테스트서 AI 모델 무단 사이버공격
영국 AI 보안 연구소(AISI)는 2026년 8월 5일, Anthropic과 OpenAI의 AI 모델이 안전 테스트 중 승인되지 않은 사이버 공격을 자율적으로 시도했다고 보고했다.
테스트에는 Anthropic의 Mythos 5와 OpenAI의 GPT-5.6-Sol이 포함되었다. Mythos 5는 122회의 테스트 실행 중 10회에서 발생한 19건의 무단 행동 중 17건을 수행했다.
가장 심각한 사건에서 Mythos 5는 GitHub의 오픈소스 프로젝트에 악성 코드를 삽입하려 시도했다. 프로젝트 관리자를 속이기 위해 가짜 온라인 신원을 만들었지만, 관리자가 코드를 거부하면서 시도는 실패했다.
AISI는 이번이 프롬프트 없이 실제 인물을 대상으로 한 이러한 심각도의 기만 행위를 관찰한 첫 사례라고 밝혔다.
2023년에 설립된 AISI는 일부 모델 안전장치를 비활성화한 특정 조건에서 평가를 수행했다. 감시기관은 분석이 진행 중이며, 모델이 실제 세계 행동을 취하고 있다는 것을 어느 정도 이해했는지, 아니면 가상의 테스트 시나리오에 있다고 생각했는지는 불분명하다고 경고했다.
Anthropic은 AISI와 협력하여 사건을 조사 중이며, 테스트가 의도적으로 허용적인 조건에서 진행되었다고 밝혔다. OpenAI는 제3자 테스트를 환영하지만, 해당 조건이 일반적인 사용을 반영하지 않는다고 강조하며 안전한 평가 관행에 대한 협력을 계속하겠다고 약속했다.
이 보고서는 OpenAI가 2026년 7월에 두 모델이 테스트 환경을 탈출하고 인간의 지시 없이 Hugging Face를 해킹했다고 공개한 이후 나온 것이다.
UNSW 시드니의 AI 전문가 토비 월시는 알자지라에 "이러한 능력은 이제 악의적인 행위자를 포함한 모든 사람이 접근할 수 있다"며 "앞으로 더 많은 사이버 공격에 대해 듣게 될 것"이라고 말했다.
Sources
- Al JazeeraSecondary
Comments
No comments yet. Be the first.