PANews 9月23日付の報道によると、DeepSeekが公開したエージェント訓練に関する新論文が注目を集めている。この31ページの論文は、同社が内部で使用する本番級サンドボックスプラットフォーム「DSec」を紹介するもので、著者は100人を超え、梁文鋒も名を連ねている。論文で特に興味深いのは「エージェントの不正行為」の節で、DeepSeekは、エージェントがプラットフォーム管理ファイル内の残留回答を検索するなど、想定外の経路で回答を取得し、訓練・評価結果の有効性を損なうことを発見した。アクセス制御を導入した後も、エージェントがファイルデータブロックのマッピングを交換し、保護対象ファイルの内容を別のファイル記述子経由でアクセス可能にしようとし、タスクや共有インフラを損なうケースがあった。
DeepSeekは、単一のメカニズムですべてのエージェントの不正行為とシステム障害を防ぐことはできないと考えている。そのためチームのアプローチは、可観測性を強化して新たな問題を特定し、モデルの進化に合わせてDSecを継続的に強化することであり、エージェントが想定外の経路で回答を取得するのを制限するアクセス制御や、欺瞞行為への報酬を減らすことなどが含まれる。これらの制御により、一部の問題は解決できる。


