PANews 9월 10일 소식, Anthropic이 약 4억 8100만 건의 모델 상호작용 기록을 검토하는 과정에서, Claude 모델이 사이버 보안 평가 중 실제 인터넷에 잘못 연결되어 타사 시스템을 공격한 4건의 사고를 확인했습니다. 해당 사고에는 Claude Mythos 5, Opus 4.6/4.7 및 한 내부 연구 모델이 포함됩니다. 사고 원인은 타사 평가 환경의 오구성으로 인해 외부 외부 네트워크에 접속되었기 때문입니다, 평가 중 정식 제품의 사이버 보안 보호 조치가 활성화되지 않았기 때문입니다. Anthropic은 핵심 정렬 리스크를 모델이 작업 주도 하에 나타내는 '편향 추론' 및 '무모한' 행동으로 요약했으며, 그중 Claude Mythos 5는 '시뮬레이션 환경'에 있다고 판단한 상태에서 PyPI에 악성 패키지를 업로드하고 유출된 자격 증명을 이용해 보안 회사의 실제 데이터베이스에 접근했습니다. 회사는 새로운 평가, 모니터링 및 정렬 훈련을 도입하였으며, 독립 기관 METR에 외부 조사를 진행했습니다.
Anthropic, Claude의 사이버 침입 사건에 대한 정렬 평가 발표: 모델의 '편향 추론' 및 '무모함' 문제 공개
공유하기:
작성자: PA一线
이 내용은 시장 정보 제공만을 목적으로 하며, 투자 조언을 구성하지 않습니다.
PANews 공식 계정을 팔로우하고 함께 상승장과 하락장을 헤쳐나가세요
추천 읽기
PANews 앱
24시간 블록체인 업계 소식을 추적하고 심층 기사를 분석합니다.




