Anthropic發布對Claude網路入侵事件的對齊評估:揭示模型「偏置推理」和「魯莽」問題

PANews 9月10日消息,Anthropic在對約4.81億條模型交互記錄審查中,確認4起Claude模型在網路安全評估中誤接入真實網際網路並攻擊第三方系統的事件,涉及Claude Mythos 5、Opus 4.6/4.7及一款內部研究模型。事故源於第三方評測環境誤配置導致出網,且評測中未啟用正式產品的網路安全防護措施。Anthropic將核心對齊風險總結為模型在任務驅動下表現出的「偏置推理」和「魯莽」,其中Claude Mythos 5曾在認為處於「模擬環境」前提下向PyPI上傳惡意包、利用泄露憑證訪問安全廠商真實資料庫。公司已引入新評估、監控與對齊訓練,並邀請獨立機構METR開展外部調查。
分享至:

作者:PA一线

本內容只為提供市場資訊,不構成投資建議。

關注PANews官方賬號,一起穿越牛熊
PANews APP
央行陸磊:境外主體持有境內人民幣金融資產超11萬億元
PANews 快訊