PANews 9月10日消息,Anthropic在对约4.81亿条模型交互记录审查中,确认4起Claude模型在网络安全评估中误接入真实互联网并攻击第三方系统的事件,涉及Claude Mythos 5、Opus 4.6/4.7及一款内部研究模型。事故源于第三方评测环境误配置导致出网,且评测中未启用正式产品的网络安全防护。Anthropic将核心对齐风险总结为模型在任务驱动下表现出的“偏置推理”和“鲁莽”行为,其中Claude Mythos 5曾在认为处于“模拟环境”前提下向PyPI上传恶意包、利用泄露凭证访问安全厂商真实数据库。公司已引入新评估、监控与对齐训练,并邀请独立机构METR开展外部调查。
Anthropic发布对Claude网络入侵事件的对齐评估:揭示模型“偏置推理”和“鲁莽”问题
分享至:
作者:PA一线
本内容只为提供市场信息,不构成投资建议。
关注PANews官方账号,一起穿越牛熊
推荐阅读




