Fable 5.1到底升级了什么?AI模型竞争正在从“智商”转向“系统能力”

Claude Fable 5.1在ARC-AGI-2基准上取得90%高分,但更值得关注的是其推理成本下降32%。模型已从单纯问答转向复杂任务执行,内置工具从30个增至46个,功能涵盖图表展示、网页预览等,并在生成黑洞视频测试中表现出接近初级工程团队的工作流程。在破解370年密码的案例中,模型耗时44分钟、17.6万Token完成历史密码分析,体现了假设验证的研究能力。27万字符系统提示词泄露事件揭示AI能力已不仅由模型权重决定,而是包含工具调度、记忆管理、安全规则等复杂系统工程。安全设计从简单拒绝回答转向在边界内提供有效帮助。不过用户仍抱怨Token消耗快、未降价,这表明能力提升与成本存在矛盾,AI产品需解决单位成本创造可验证价值的问题。行业竞争正从模型跑分转向系统能力,未来AI可能从问答工具进化为数字工作系统,关键在于模型能否像研究员一样自主拆解问题、调用工具并交付结果。

总结

作者:QQLink

一、90%的ARC-AGI-2之外,更值得看的是推理成本

据相关公开测试信息,Claude Fable 5.1在ARC-AGI-2上的成绩达到90.0%,单任务成本约为3.12美元;在ARC-AGI-1上的成绩达到97.5%,单任务成本约为1.40美元。与此同时,相关信息显示,Fable 5.1通过提升Token效率,使平均推理成本较上一代降低约32%。

这些数字之所以重要,并不只是因为分数更高。

过去几年,大模型竞争很容易被压缩成几个简单指标:参数规模有多大、跑分有多高、上下文有多长。但当模型逐渐进入真实工作场景后,企业真正关心的问题开始发生变化:一个任务究竟需要多少Token?需要调用多少次工具?完成一次复杂工作到底需要多少钱?如果模型能够持续执行几十分钟甚至更长时间,成本能不能控制在可接受范围?

这也是Fable 5.1此次表现值得关注的地方。

一个模型即使在基准测试中取得不错成绩,如果完成真实任务需要消耗大量Token,或者频繁触发使用上限,那么它距离大规模商业应用仍然存在距离。反过来,如果模型能够在保持能力的同时降低单位任务成本,那么开发者才更有动力把它接入代码开发、数据分析、内容生产以及自动化工作流。

换句话说,AI竞争正在从“模型有多聪明”,逐渐转向“模型能以多低的成本完成多少工作”。

二、真正的变化,是Claude越来越像一套“工作系统”

从公开的系统提示词和相关测试来看,Fable 5.1此次升级并不只是模型权重层面的变化。

据相关信息,其内置工具数量从此前的30个增加到46个,新增能力涉及图表展示、轮播内容、地点信息、网页预览以及历史对话读取等。单独看,这些功能并不算令人意外,但放在一起后,意义就不同了。

过去的AI助手更多是在“回答”。

用户提出问题,模型生成文字;用户要求代码,模型输出代码;用户需要分析,模型提供分析。

而现在的模型越来越需要完成一个完整任务链:理解需求、检索信息、调用工具、生成内容、检查结果,再根据执行反馈进行修改。

素材中关于Fable 5.1生成黑洞视频的测试,就是一个比较典型的例子。

相关测试显示,模型没有直接生成一个视觉上“看起来像黑洞”的动画,而是先根据广义相对论构建光线追踪渲染器,再处理相对论多普勒效应、引力红移等因素,并通过低分辨率测试发现问题后继续修改,最终再进行完整渲染。

这里最值得注意的不是最后生成了一段视频,而是模型表现出的工作方式。

它开始接近一个初级工程团队的工作流程:先制定方案,再执行,再发现问题,然后修正,最后验证结果。

这也是Agent类AI正在改变软件形态的原因。

当模型能够持续调用工具并根据中间结果调整策略,它的价值就不再局限于“生成一段文本”,而是开始向“完成一项工作”转移。

三、370年密码案例,说明AI开始改变解决问题的路径

Fable 5.1被用于破解“Cyphral Distich”经典密码的案例,也值得单独观察。

据Vals AI相关信息,该模型耗时约44分钟、使用约17.6万个Token,在没有人类持续干预的情况下完成了对这段历史密码的分析,并进一步推导出另一组密码的解法。

真正有意思的并不是“44分钟”这个数字,而是它采用的方法。

相关测试显示,模型并没有简单地对64个数字进行暴力枚举,而是回到密码所在的历史文本,从作者此前的32篇短文、数字结构以及诗歌内容中寻找关联,再提出“数字对应文本索引”的假设,并通过解码结果与作者历史背景进行交叉验证。

如果这一过程能够被独立重复验证,那么它体现的并非单纯计算能力,而是一种更加接近研究工作的能力:提出假设、寻找证据、验证假设,再根据结果调整方向。

这也是当前AI能力进化中非常值得关注的一条线。

很多现实问题并不存在一个明确的“标准答案”,甚至连正确的问题都需要研究者自己定义。历史研究、科研、程序调试、商业分析都属于这一类型。

未来AI的价值,或许越来越不是替人完成已经定义好的任务,而是帮助人从大量碎片信息中找到隐藏的关系。

Fable 5.1到底升级了什么?AI模型竞争正在从“智商”转向“系统能力”

四、27万字符系统提示词泄露,暴露的是另一场竞争

Fable 5.1发布后不久,知名越狱研究者Pliny the Liberator公开了一份据称超过27万字符的系统提示词,引发大量讨论。

需要强调的是,相关内容来自第三方公开材料,并不意味着其中所有内容都已经得到Anthropic官方确认。

但无论具体内容是否完整,这件事情本身仍然值得关注。

原因在于,超长系统提示词已经说明,现代AI产品的能力越来越不是单纯由模型权重决定的。

系统需要告诉模型如何使用工具、如何处理版权内容、什么时候拒绝请求、如何管理记忆、如何处理敏感信息,以及不同工具之间应该如何协同。

也就是说,今天的“大模型”实际上越来越像一个复杂的软件系统。

其中模型权重是核心,但系统提示词、工具路由、记忆机制、安全规则、检索能力以及执行环境同样决定最终体验。

这也解释了为什么Fable 5.1与Mythos 5.1即便共享相同模型权重,也可以面向不同用户群体采取不同的能力边界。

一个更开放的研究版本与一个面向普通用户的产品版本,并不一定需要两个完全不同的模型。

真正决定它们差异的,可以是模型之外的那一整套控制系统。

五、安全不再只是“拒绝回答”,而是模型产品的一部分

从公开的系统指令信息来看,Fable 5.1对版权、心理健康、毒品以及记忆数据等领域设置了较为细致的限制。

例如,在版权内容方面,系统不仅限制直接复现受版权保护的歌曲、书籍和诗歌,也进一步约束视觉创作中对知名角色、Logo和其他受保护元素的直接再现。

在心理健康场景中,模型需要避免对用户进行未经依据的诊断或者直接判断其心理状态;在高风险化学品和毒品相关问题上,则更强调风险提示与伤害降低,而不是提供具体操作方案。

这些规则看起来像“限制模型能力”,但从商业产品角度看,它们其实也是模型能力的一部分。

模型越强,错误使用的潜在影响就越大。

因此,未来大模型之间的竞争不会只是“谁拒绝得少”,而是“谁能在安全边界内提供更多有效帮助”。

对于企业来说,这甚至可能比单纯的Benchmark成绩更加重要。

六、问题也很现实:能力提升,为什么用户没有感觉更便宜?

Fable 5.1的另一个讨论焦点,是Token消耗和使用限制。

尽管相关信息显示模型效率有所提高,但部分付费用户仍反馈其消耗Token较快,并对速率限制以及自动继续功能提出质疑。与此同时,据素材信息,官方并未同步宣布降低价格或者提高部分订阅层级的使用上限。

这实际上揭示了AI商业化中的一个矛盾。

模型能力越强,能够处理的任务越复杂,而复杂任务又意味着更长的上下文、更频繁的工具调用以及更多推理步骤。

因此,“单Token更便宜”并不意味着“用户最终支付的账单更低”。

如果一个模型能够完成过去需要半小时人工操作的任务,即使它消耗更多Token,用户仍然可能愿意付费;但如果模型只是把简单任务做得更复杂,成本提升却没有带来对应价值,用户自然会产生不满。

所以,AI产品最终需要解决的不是单纯的Token效率,而是单位成本能够创造多少可验证的工作价值

七、下一场竞争,可能已经不是Fable对OpenAI这么简单

随着Anthropic持续推进模型能力,OpenAI的新一代模型也成为市场关注焦点。素材中提到的Astra尚未形成足够完整的公开信息,因此目前更适合把它视为市场正在等待的下一张牌,而不是提前判断谁将成为最终赢家。

但竞争方向已经越来越清晰。

一边是模型推理能力继续提升,另一边是工具调用、代码执行、视觉生成、记忆和Agent能力不断整合。

这意味着AI行业可能正在经历一次产品范式变化。

过去用户购买的是“一个更聪明的聊天机器人”。

未来用户购买的可能是一套能够理解需求、调用工具、执行任务、检查结果并持续迭代的数字工作系统。

对于普通用户而言,这意味着AI可能逐渐从“问答工具”变成工作入口;对于开发者而言,则意味着应用层的机会正在扩大,因为真正决定产品差异化的部分,很可能越来越集中在模型之上的工作流设计。

而对于整个AI产业来说,Fable 5.1这类模型释放出的信号其实非常明确:大模型竞争的下半场,拼的已经不仅是参数和跑分,而是模型能否真正完成复杂工作,以及完成这些工作的成本是否足够低。

如果这一趋势继续发展,未来最值得关注的也许不是哪一个模型又刷新了某项Benchmark,而是当一个AI系统面对一个没有标准答案的问题时,它能不能像一个真正的研究员、工程师或者分析师一样,自己拆解问题、寻找线索、调用工具、验证假设并最终交付结果。

这才可能是下一阶段AI从“会回答”走向“会做事”的关键分水岭。

分享至:

作者:QQlink

本文为PANews入驻专栏作者的观点,不代表PANews立场,不承担法律责任。

文章及观点也不构成投资意见

图片来源:QQlink如有侵权,请联系作者删除。

关注PANews官方账号,一起穿越牛熊
PANews APP
USDC Treasury在Solana链上新增铸造2.5亿枚USDC
PANews 快讯