一、90%的ARC-AGI-2之外,更值得看的是推理成本
据相关公开测试信息,Claude Fable 5.1在ARC-AGI-2上的成绩达到90.0%,单任务成本约为3.12美元;在ARC-AGI-1上的成绩达到97.5%,单任务成本约为1.40美元。与此同时,相关信息显示,Fable 5.1通过提升Token效率,使平均推理成本较上一代降低约32%。
这些数字之所以重要,并不只是因为分数更高。
过去几年,大模型竞争很容易被压缩成几个简单指标:参数规模有多大、跑分有多高、上下文有多长。但当模型逐渐进入真实工作场景后,企业真正关心的问题开始发生变化:一个任务究竟需要多少Token?需要调用多少次工具?完成一次复杂工作到底需要多少钱?如果模型能够持续执行几十分钟甚至更长时间,成本能不能控制在可接受范围?
这也是Fable 5.1此次表现值得关注的地方。
一个模型即使在基准测试中取得不错成绩,如果完成真实任务需要消耗大量Token,或者频繁触发使用上限,那么它距离大规模商业应用仍然存在距离。反过来,如果模型能够在保持能力的同时降低单位任务成本,那么开发者才更有动力把它接入代码开发、数据分析、内容生产以及自动化工作流。
换句话说,AI竞争正在从“模型有多聪明”,逐渐转向“模型能以多低的成本完成多少工作”。
二、真正的变化,是Claude越来越像一套“工作系统”
从公开的系统提示词和相关测试来看,Fable 5.1此次升级并不只是模型权重层面的变化。
据相关信息,其内置工具数量从此前的30个增加到46个,新增能力涉及图表展示、轮播内容、地点信息、网页预览以及历史对话读取等。单独看,这些功能并不算令人意外,但放在一起后,意义就不同了。
过去的AI助手更多是在“回答”。
用户提出问题,模型生成文字;用户要求代码,模型输出代码;用户需要分析,模型提供分析。
而现在的模型越来越需要完成一个完整任务链:理解需求、检索信息、调用工具、生成内容、检查结果,再根据执行反馈进行修改。
素材中关于Fable 5.1生成黑洞视频的测试,就是一个比较典型的例子。
相关测试显示,模型没有直接生成一个视觉上“看起来像黑洞”的动画,而是先根据广义相对论构建光线追踪渲染器,再处理相对论多普勒效应、引力红移等因素,并通过低分辨率测试发现问题后继续修改,最终再进行完整渲染。
这里最值得注意的不是最后生成了一段视频,而是模型表现出的工作方式。
它开始接近一个初级工程团队的工作流程:先制定方案,再执行,再发现问题,然后修正,最后验证结果。
这也是Agent类AI正在改变软件形态的原因。
当模型能够持续调用工具并根据中间结果调整策略,它的价值就不再局限于“生成一段文本”,而是开始向“完成一项工作”转移。
三、370年密码案例,说明AI开始改变解决问题的路径
Fable 5.1被用于破解“Cyphral Distich”经典密码的案例,也值得单独观察。
据Vals AI相关信息,该模型耗时约44分钟、使用约17.6万个Token,在没有人类持续干预的情况下完成了对这段历史密码的分析,并进一步推导出另一组密码的解法。
真正有意思的并不是“44分钟”这个数字,而是它采用的方法。
相关测试显示,模型并没有简单地对64个数字进行暴力枚举,而是回到密码所在的历史文本,从作者此前的32篇短文、数字结构以及诗歌内容中寻找关联,再提出“数字对应文本索引”的假设,并通过解码结果与作者历史背景进行交叉验证。
如果这一过程能够被独立重复验证,那么它体现的并非单纯计算能力,而是一种更加接近研究工作的能力:提出假设、寻找证据、验证假设,再根据结果调整方向。
这也是当前AI能力进化中非常值得关注的一条线。
很多现实问题并不存在一个明确的“标准答案”,甚至连正确的问题都需要研究者自己定义。历史研究、科研、程序调试、商业分析都属于这一类型。
未来AI的价值,或许越来越不是替人完成已经定义好的任务,而是帮助人从大量碎片信息中找到隐藏的关系。
四、27万字符系统提示词泄露,暴露的是另一场竞争
Fable 5.1发布后不久,知名越狱研究者Pliny the Liberator公开了一份据称超过27万字符的系统提示词,引发大量讨论。
需要强调的是,相关内容来自第三方公开材料,并不意味着其中所有内容都已经得到Anthropic官方确认。
但无论具体内容是否完整,这件事情本身仍然值得关注。
原因在于,超长系统提示词已经说明,现代AI产品的能力越来越不是单纯由模型权重决定的。
系统需要告诉模型如何使用工具、如何处理版权内容、什么时候拒绝请求、如何管理记忆、如何处理敏感信息,以及不同工具之间应该如何协同。
也就是说,今天的“大模型”实际上越来越像一个复杂的软件系统。
其中模型权重是核心,但系统提示词、工具路由、记忆机制、安全规则、检索能力以及执行环境同样决定最终体验。
这也解释了为什么Fable 5.1与Mythos 5.1即便共享相同模型权重,也可以面向不同用户群体采取不同的能力边界。
一个更开放的研究版本与一个面向普通用户的产品版本,并不一定需要两个完全不同的模型。
真正决定它们差异的,可以是模型之外的那一整套控制系统。
五、安全不再只是“拒绝回答”,而是模型产品的一部分
从公开的系统指令信息来看,Fable 5.1对版权、心理健康、毒品以及记忆数据等领域设置了较为细致的限制。
例如,在版权内容方面,系统不仅限制直接复现受版权保护的歌曲、书籍和诗歌,也进一步约束视觉创作中对知名角色、Logo和其他受保护元素的直接再现。
在心理健康场景中,模型需要避免对用户进行未经依据的诊断或者直接判断其心理状态;在高风险化学品和毒品相关问题上,则更强调风险提示与伤害降低,而不是提供具体操作方案。
这些规则看起来像“限制模型能力”,但从商业产品角度看,它们其实也是模型能力的一部分。
模型越强,错误使用的潜在影响就越大。
因此,未来大模型之间的竞争不会只是“谁拒绝得少”,而是“谁能在安全边界内提供更多有效帮助”。
对于企业来说,这甚至可能比单纯的Benchmark成绩更加重要。
六、问题也很现实:能力提升,为什么用户没有感觉更便宜?
Fable 5.1的另一个讨论焦点,是Token消耗和使用限制。
尽管相关信息显示模型效率有所提高,但部分付费用户仍反馈其消耗Token较快,并对速率限制以及自动继续功能提出质疑。与此同时,据素材信息,官方并未同步宣布降低价格或者提高部分订阅层级的使用上限。
这实际上揭示了AI商业化中的一个矛盾。
模型能力越强,能够处理的任务越复杂,而复杂任务又意味着更长的上下文、更频繁的工具调用以及更多推理步骤。
因此,“单Token更便宜”并不意味着“用户最终支付的账单更低”。
如果一个模型能够完成过去需要半小时人工操作的任务,即使它消耗更多Token,用户仍然可能愿意付费;但如果模型只是把简单任务做得更复杂,成本提升却没有带来对应价值,用户自然会产生不满。
所以,AI产品最终需要解决的不是单纯的Token效率,而是单位成本能够创造多少可验证的工作价值。
七、下一场竞争,可能已经不是Fable对OpenAI这么简单
随着Anthropic持续推进模型能力,OpenAI的新一代模型也成为市场关注焦点。素材中提到的Astra尚未形成足够完整的公开信息,因此目前更适合把它视为市场正在等待的下一张牌,而不是提前判断谁将成为最终赢家。
但竞争方向已经越来越清晰。
一边是模型推理能力继续提升,另一边是工具调用、代码执行、视觉生成、记忆和Agent能力不断整合。
这意味着AI行业可能正在经历一次产品范式变化。
过去用户购买的是“一个更聪明的聊天机器人”。
未来用户购买的可能是一套能够理解需求、调用工具、执行任务、检查结果并持续迭代的数字工作系统。
对于普通用户而言,这意味着AI可能逐渐从“问答工具”变成工作入口;对于开发者而言,则意味着应用层的机会正在扩大,因为真正决定产品差异化的部分,很可能越来越集中在模型之上的工作流设计。
而对于整个AI产业来说,Fable 5.1这类模型释放出的信号其实非常明确:大模型竞争的下半场,拼的已经不仅是参数和跑分,而是模型能否真正完成复杂工作,以及完成这些工作的成本是否足够低。
如果这一趋势继续发展,未来最值得关注的也许不是哪一个模型又刷新了某项Benchmark,而是当一个AI系统面对一个没有标准答案的问题时,它能不能像一个真正的研究员、工程师或者分析师一样,自己拆解问题、寻找线索、调用工具、验证假设并最终交付结果。
这才可能是下一阶段AI从“会回答”走向“会做事”的关键分水岭。




