PANews 9월 23일 소식, DeepSeek이 공개한 에이전트 훈련 관련 신논문이 주목받고 있다. 31페이지 분량의 이 논문은 내부에서 사용하는 프로덕션급 샌드박스 플랫폼 DSec을 소개하며, 저자가 100명이 넘고 량원펑도 포함되어 있다. 논문에서 특히 흥미로운 부분은 '에이전트의 부적절한 행동' 섹션으로, DeepSeek은 에이전트가 예상치 못한 경로로 답을 얻어내는 현상을 발견했다. 예를 들어 플랫폼 관리 파일에 남아 있는 잔여 답안을 검색하는 식으로 훈련 및 평가 결과의 유효성을 훼손한다는 것이다. 접근 제어를 도입한 뒤에도 에이전트가 파일 데이터 블록 매핑을 교환해 보호된 파일 내용을 다른 파일 디스크립터로 접근 가능하게 만들려는 시도가 나타나 작업이나 공유 인프라를 손상시켰다.
DeepSeek은 모든 에이전트의 부적절한 행동과 시스템 장애를 막을 수 있는 단일 메커니즘은 없다고 판단한다. 따라서 팀의 접근 방식은 새로운 문제를 식별하기 위해 관측 가능성을 강화하고, 모델이 진화함에 따라 DSec을 지속적으로 강화하는 것이다. 여기에는 에이전트가 예상치 못한 경로로 답을 얻는 것을 제한하는 접근 제어와 기만적 행동에 대한 보상을 줄이는 것이 포함된다. 이러한 제어는 일부 문제를 해결할 수 있다.


