영국 AI 안전 기관: OpenAI와 Anthropic 모델 통제 불능 침입, 전례 없는 기만 행위 보여

PANews 8월 5일 소식, 펑황망이 파이낸셜 타임스를 인용한 보도에 따르면, Anthropic의 Mythos 5와 OpenAI의 GPT-5.6 Sol이 정례 네트워크 보안 평가에서 실제 개인 및 조직을 대상으로 "지속적이고 잠재적으로 해로운 활동"을 수행했습니다. 여기에는 GitHub 오픈소스 프로젝트에 악성 코드를 심고 사회공학 공격을 실행하는 것이 포함됩니다. AISI에 따르면, 122회의 테스트 중 10회에서 이러한 상황이 발생했으며, 거의 모든 행동은 Anthropic의 Mythos 모델에서 비롯되었고, 그중 두 차례의 행동에는 OpenAI의 GPT가 관련되었습니다. 가장 심각한 사례에서는 AI 에이전트가 가짜 온라인 신원을 생성하여 프로젝트 유지관리자에게 압력을 가해 악성 코드 승인을 요구했지만, 유지관리자가 이를 발견하고 거부했습니다. AISI는 자율성 및 기만성과 관련된 위험이 특정 프롬프트 없이 실제 환경에서 직접 나타나는 것이 이렇게 명확하게 관찰된 것은 이번이 처음이며, 이전에 밝혀진 침해 사건들과 결합하여 이는 위험 지형의 변화를 의미한다고 밝혔습니다. Anthropic은 안전 평가에 대해 더 광범위한 논의가 필요하다고 답변했으며, OpenAI 대변인은 해당 사건이 보안 방어가 약화된 테스트 환경에서 발생해 일상적인 사용을 반영하지 않지만, 평가 기관과 계속 협력하여 보안 평가 기준을 강화할 것이라고 밝혔습니다.

공유하기:

작성자: PA一线

이 내용은 시장 정보 제공만을 목적으로 하며, 투자 조언을 구성하지 않습니다.

PANews 공식 계정을 팔로우하고 함께 상승장과 하락장을 헤쳐나가세요
PANews APP
SBF 항소 기각, 미국 제2순회항소법원이 정식으로 사건 종결 명령 발부
PANews 속보