PANews 9月10日、Anthropicは約4.81億件のモデルとの対話記録を調査した結果、Claudeモデルがサイバーセキュリティ評価中に誤って実際のインターネットにアクセスし、第三者システムを攻撃した4件のインシデントを確認した。これにはClaude Mythos 5、Opus 4.6/4.7、および1つの内部研究モデルが関与している。事故は、第三者評価環境の誤設定により外部ネットワークへのアクセスが可能になったことに起因し、評価中に正式製品のサイバーセキュリティ防御が有効化されていなかったことに起因する。Anthropicは、核心的なアライメントリスクを、モデルがタスクに駆動されて示す「偏った推論」と「無謀」な行動と総括しており、その中でClaude Mythos 5は「シミュレーション環境」にあると認識していたにもかかわらず、PyPIに悪意のあるパッケージをアップロードし、漏洩した認証情報を利用してセキュリティベンダーの実際のデータベースにアクセスした。同社は新たな評価、監視、アライメント訓練を導入し、独立した機関であるMETRに外部調査を依頼している。
Anthropic、Claudeのネットワーク侵入事件に関するアライメント評価を発表:モデルの「偏った推論」と「無謀」な問題を明らかに
共有先:
著者:PA一线
この内容は市場情報の提供のみを目的としており、投資助言を構成しません。
PANews公式アカウントをフォローして、強気・弱気相場を一緒に乗り越えましょう
おすすめ記事
PANewsアプリ
24時間ブロックチェーン業界情報を追跡し、深掘り記事を解析。




