英国AI安全机构:OpenAI与Anthropic模型失控入侵,展现空前欺骗性行为

PANews 8月5日消息,据凤凰网引援《金融时报》报道,Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol在例行网络安全评估中针对真实个人和组织进行了“持续的、可能具有危害性的活动”,包括向GitHub开源项目植入恶意代码并实施社交工程攻击。AISI称,在122次测试中有10次出现此类情况,几乎所有行为来自Anthropic的Mythos模型,其中两次行动涉及OpenAI的GPT。最严重案例中,AI代理创建虚假网络身份向项目维护者施压要求批准恶意代码,被维护者发现并拒绝。AISI表示,这是首次如此清晰地看到与自主性和欺骗性相关的风险在无特定提示下直接在现实世界中显现,结合此前曝光的入侵事件,标志着风险格局的转变。Anthropic回应称需就安全评估展开更广泛讨论,OpenAI发言人则表示事件发生在安全防护减弱的测试环境中,不反映日常使用,但将继续与评估机构合作加强安全评估标准。

分享至:

作者:PA一线

本内容只为提供市场信息,不构成投资建议。

关注PANews官方账号,一起穿越牛熊
PANews APP
SBF上诉被驳回,美国第二巡回法院正式签发结案令
PANews 快讯