PANews 10월 11일 소식, 마이크로소프트 CEO 사티아 나델라(Satya Nadella)가 글을 통해 초지능(Super Intelligence) 시스템의 역량이 빠르게 향상됨에 따라 업계는 AI 신뢰 아키텍처를 재구축해야 하며, AI 실행 행위로 인한 책임을 모델 제공자에게 떠넘겨서는 안 된다고 밝혔다.
지난 수십 년간 전통 소프트웨어 시스템이 광범위하게 배포됐을 때 사람들은 프로그램 행위에 대응하는 구체적인 코드 경로를 추적할 수 있었다. 그러나 오늘날의 최첨단 AI 모델은 역량이 전통 소프트웨어 시스템을 능가했음에도 모델 출력을 특정 학습 데이터나 모델 가중치 구성에 명확히 귀속시킬 수 없다. 현재 기업들은 복잡한 AI 에이전트가 민감한 데이터에 접근하도록 하고 핵심 업무를 수행할 수 있는 능력을 부여하고 있다. 따라서 초지능 시스템을 이해할 수 없는 '중첩된 블랙박스'로 간주해 그 제안을 단순히 수용하거나 거부해서는 안 되며, 행위를 관찰하고 경계를 테스트하며 언제든 행동을 제한할 수 있는 통제 가능한 시스템을 구축해야 한다.
거버넌스 원칙 측면에서 나델라는 초지능 시스템이 갖춰야 할 요소로 다음을 제시했다.
- 모델 다양성: 단일 모델이 핵심 의사결정의 유일한 의존 대상이 되는 것을 방지한다.
- 전면적 관찰 가능성: 모든 중요한 AI 행위는 위변조가 불가능하고 사람이 읽을 수 있는 기록을 남겨야 한다.
- 지속적 검증 능력: 장애, 공격, 이상 상황에 직면했을 때의 시스템 성능을 지속적으로 테스트한다.
- 독립적 통제 및 감사: 모델이 시스템 행위와 자체 행위를 검증하는 증거를 동시에 통제해서는 안 된다.
- 위험 격리 메커니즘: 기본적으로 모델이 실패할 수 있다고 가정하고 언제든 일시 중지하거나 종료할 수 있는 능력을 제공한다.
- 사건 공개 메커니즘: 장애나 보안 사고 발생 시 원인과 개선 조치를 신속히 공개한다.
나델라는 또한 사고 연쇄(CoT) 투명성이 AI 거버넌스의 중요한 기반이라고 강조하면서도, CoT 투명성에만 의존하는 것은 충분하지 않다고 지적했다. 현재로서는 모델 출력이 항상 신뢰할 수 있는 설명 가능성을 갖추도록 보장할 수 없기 때문이다. 미래에 가장 신뢰할 만한 초지능 시스템은 '가장 신뢰할 만한 모델'이 아니라, 모델을 완전히 신뢰할 수 없더라도 여전히 안전하게 작동할 수 있는 시스템이다.


