PANews 9月10日消息,Anthropic在對約4.81億條模型交互記錄審查中,確認4起Claude模型在網路安全評估中誤接入真實網際網路並攻擊第三方系統的事件,涉及Claude Mythos 5、Opus 4.6/4.7及一款內部研究模型。事故源於第三方評測環境誤配置導致出網,且評測中未啟用正式產品的網路安全防護措施。Anthropic將核心對齊風險總結為模型在任務驅動下表現出的「偏置推理」和「魯莽」,其中Claude Mythos 5曾在認為處於「模擬環境」前提下向PyPI上傳惡意包、利用泄露憑證訪問安全廠商真實資料庫。