說好的放慢呢?OpenAI與Anthropic同日互毆,打響AI價格戰

OpenAI 和 Anthropic 同日发布了新模型,引发 AI 圈热议。Anthropic 推出 Claude Opus 5.5,号称是 Fable 5.1 的“蒸馏版”,大幅降低成本(较上一代降 40%),速度提升 30%,在编程任务上达到顶尖水准,但高难任务仍需旗舰模型。OpenAI 则发布了 GPT-6 Sol 和 Luna,定位为 Astra 的平价替代版,成本比前代低 50%,其中 Luna 甚至比 Deepseek 便宜,适合大规模自动化任务。文章指出,两家公司竞争策略不同:Anthropic 侧重编程与审美,OpenAI 更注重 Agent 和推理能力。作者建议,若能用 Claude 且不被封号,推荐订阅;否则可订阅 ChatGPT,搭配不同模型分层使用。整体而言,AI 智能正在快速降价,未来有望成为人人用得起的资源。

總結

作者:數字生命卡茲克

人麻了,前幾天不是都喊著模型要放慢嗎。怎麼這模型跟不要錢一樣往外扔啊。昨天Grok 4.7 PK MiMo v2.6,是給今天這兩大哥演個前戲是吧。今天凌晨,OpenAI的GPT-6 Sol和GPT-6 Luna,以及Anthropic的Claude Opus 5.5,都正式發布。

圖片

我真的挺想問問,天天一個個說著放慢,放慢在哪了這都是。全是渣男。而且這個劇情,我總感覺莫名眼熟,然後翻了一下歷史文章。

圖片

上一次,GPT-5.3 Codex對轟Claude Opus 4.6,今天直接歷史重演了。。。只不過,Claude Opus 4.6,變成了Claude Opus 5.5。

GPT-5.3 Codex,變成了GPT-6 Sol。

兩家公司還是這兩家公司,還是那個不服就幹的死對頭。

一個一個說吧。

一. Claude Opus 5.5

先說Claude。

坦率的講,我再怎麼討厭Anthropic,再怎麼覺得這家公司是個傻逼,他們在再怎麼封我號,客觀的講,Claude依然是我心中最好、最全面的那一檔模型。

我至今依然記得我用Claude Fable 5給我帶來的震撼。

而這次Claude Opus 5.5,是Anthropic全新的Claude 5.5系列裡的第一個模型,而且我印象中,很少Claude會一次性跨這麼多的版本號。

並且我自己臨時體驗下來(不要問我為啥封號了還能用,直接買的次拋號,用個2小時就會被封的那種。。。),Opus 5.5在整個的溝通上,讓我有一種,回到了Opus 4.6的感覺,活人感很強。

雖然他們給這玩意的定位,其實就是Claude系列的性價比模型,但是確實有一種讓我想起了當年的白月光。

基本信息我總結了一下,大概是這樣的:

模型名 claude-opus-5-5
上下文 1M Token
最大輸出 128K Token
可靠知識截止 2026年6月
思考 Adaptive Thinking,始終開啟
默認努力等級 medium
輸入價格 4美元 / 百萬Token
輸出價格 20美元 / 百萬Token
緩存讀取 0.2美元 / 百萬Token
5分鐘緩存寫入 5美元 / 百萬Token
1小時緩存寫入 8美元 / 百萬Token

相比上一代Opus 5,整體的工作成本,可以直接下降40%。

同時,輸出速度相比Opus 5還快了30%以上。

目前在一些非大型的工作上,Opus 5.5已經可以做到Fable 5.1級別的表現,大型高難工作,依然需要Fable級模型上場。

圖像

在Coding任務上,基本就是現在的SOTA了。

比如Terminal-Bench 4.0這種反映在真實終端環境裡完成複雜、多步任務的能力,Opus 5.5刷新了最高分66.4%。

只要涉及到Coding的,基本上都SOTA了,很像最開始Opus 5出來的時候,在Coding的執行上全面超越Fable 5一樣。

但是有兩個東西不太一樣,Terminal-Bench-Science這個任務是偏科研任務,Opus 5.5是58.7%,這裡Astra反而更高,64.6%。

AutomationBench也一樣,這個任務其實就是跨軟件工作,Opus 5.5是40.0%,GPT-6 Astra是41.4%。

還有那個Computer Use,雖然GPT-6 Astra沒分,但是所有人都知道這玩意不可能會差,它是絕對的SOTA。

從這些地方也能看出來Anthropic和OpenAI這兩家公司卷的一些差異化發展方向,Anthropic更偏向於Coding能力,同時審美極強,他們也相信Coding才是通往AGI之路的基石,但是OpenAI更加專注的是全面的Agent能力,包括推理、軟件操作、科研等等。

但坦率的講,單純的去看某一個維度的評測集,我覺得是完全無法去評估一個模型真正的質量的。

就像你知道,即使是開發產品,還有一個很核心的東西,是你最前面的規劃和架構設計能力,這玩意Fable就是神,它依賴於你的大參數,依賴於你的世界知識,依賴於你的智能湧現。

你說Opus 5.5確實是能在某些特定的執行上面超過Fable,但是你整體說Opus 5.5要比Fable強?那我覺得你不如信我是秦始皇。

整體上Claude Opus 5.5,基本上就是Fable 5.1自家的官方蒸餾模型了。

在很多垂直的場景裡面可能會更強,並且參數量更小,速度更快,更加便宜,但同時也會帶來Token的浪費,這裡其實是一個陷阱,一旦在高難任務上,一些非旗艦模型反而會持續不斷的瘋狂思考,瘋狂嘗試,但是又出不去一直解決不了問題,反而會比旗艦模型更加燒錢。

就像Opus 5.5確實很強,但是他的每任務輸出Token數直接爆炸了,所以其實他的很多的智力是靠用超長的推理來去換來的,這個弊端就是,一旦陷入困境,就原地爆炸。

所以Anthropic也是如此提示的。

當你的結果很重要的時候,一定要用最高級的模型。

然後可以看看X上大佬們跑的Claude Opus 5.5的case,還是蠻驚艷的,特別是在審美和細節上,有了巨幅加強。

來自@notjazii的對比GPT-6 Astra和Claude Opus 5.5的測試,在部分場景下,甚至比GPT-6 Astra更加精細一點:

但代價就是,相比於GPT-6 Astra,更慢更貴。

圖片

不過對於Opus 5.5來說,將其與GPT-6 Astra相比,這本身就是一種讚譽了。

Opus 5.5這次還強化了溝通。

Anthropic說他們收到Opus 5最多的反饋之一,就是,有時候寫東西比較繞、術語多、表達不夠直接。

5.5會把最重要的信息放在前面,減少奇怪措辭和沒必要的解釋。

同時在創作上,也有Claude 4.6的感覺了。

所以呢,總結來說,Claude Opus 5.5是一個我覺得非常棒的模型。

Anthropic把很多過去只有旗艦模型才能幹的活,下放到了一個終於可以常駐使用的價位上,估計也是過去OpenAI給的壓力太大了。

他們自己的成本指南直接建議:

日常你盯著幹的Feature、Debug、Code Review,用Opus 5.5。

真正結果比Token價格更重要、長時間無人監督、或者Opus 5.5連續失敗的,再切Fable 5.1。

Fable開始越來越像專家級顧問。

Opus 5.5更像主力員工。

這就是Claude今天的新模型。

二. GPT-6 Sol和Luna

終於到我能正常用的東西了。

GPT-6 Sol和Luna。

因為你claude再怎麼好,我也就是一個次拋,也不是常年能用的東西,沒有用啊。

所以呢,沒有辦法,主力依然還是GPT-6。

特別巧的是,我前幾天寫GPT-6 Pro+MCP那篇文章的時候,還專門寫了一句:

「GPT-6 Sol大概率馬上就上了,上了以後執行這塊,我可能會無腦切GPT-6 Sol,只有高難任務才切GPT-6 Astra。」

然後,終於來了。

目前,Codex中已經上線,直接可用。

圖片

過去GPT-6 Astra最被人詬病的就是太貴,額度完全不夠用。

那這次,GPT-6 Sol和Luna,就是直接奔著降成本來的。

Astra依然是OpenAI最強的模型。

最困難、最重要、不想做任何妥協的工作,繼續用Astra。

但是現實世界裡的工作,有不同的規模、節奏和預算。

所以GPT-6 Sol和Luna存在的意義,跟Fable 5.1和Claude Opus 5.5的關係一樣:

把Astra這代訓練方法帶來的能力,下放到更快、更便宜的模型。

和Claude幾乎是在同一天,講同一件事情。

誰能用更少的錢,買到更多智能。

這就是帕累托前沿。

價格上面,新一代定價如下。

圖片

Sol和Luna,比GPT-5.6的同款模型,還要便宜50%。

圖片

最離譜的是這個Luna,如果我們單看輸入和輸出價格,其實已經比Deepseek還要便宜了。

當然我們都知道,真正的大頭其實是緩存,嗯,可以看到這個緩存的價格還是要比Deepseek高了3倍左右。

圖片

不過Luna最適用的場景,我覺得其實是各種應用背後的自動化任務,就像我的AIHOT背後掛著的十幾個需要大模型的信息處理任務一樣,每天請求都是上萬次。

這種場景下,其實緩存有時候的命中率不是特別高,綜合來看能到30%就不錯了,那在我看來,Luna的優勢就會變得比較明顯了。

其他的基本信息如下。

圖片

這些知識截止日期居然都不一樣。

Luna最新,到了5月18號。

然後就是大家最關心的GPT-6 Sol了,坦率的講,在能力上,比我預期的會差一些,但是在成本的降幅上,又比我預期的強一些。

圖片

可以看到,在AA上,它只比GPT-5.6 Sol強了一點,但是Opus 5.5,是直接斷崖式拿下了第一。

雖然說AA現在的基準有的時候也被很多人詬病,在很多的細節上沒有那麼準,但是大的方向不會差特別多。

所以GPT-6 Sol更多的還是基於新模型新架構,盡量保持比GPT-5.6 Sol好一點,然後大幅度降成本。

比如這個AutomationBench,就是在上面我們說Claude的時候,比Claude那邊要強的那個基準,這個Benchmark測的是Agent跨47種工具,去執行銷售、營銷、運營、客服、財務、HR這些真實業務流程。

GPT-6 Sol xhigh:

33.2%。

每個任務平均成本:

0.27美元。

GPT-6 Astra low是30.3%,但是任務成本是Sol的3.9倍。

圖像

Fable 5.1加Opus 5 fallback是31.4%,成本至少是Sol的8.9倍。

注意這裡對比的還是Claude Opus 5,因為Opus 5.5跟GPT-6 Sol幾乎同一時間發布,所以OpenAI的圖裡根本來不及放進去,放進去,其實也不是很好看,對於OpenAI來說不是很有利。

但是這張圖已經非常清楚地解釋了Sol的定位。

不過GPT的強悍就在於它的Token效率實在是太離譜了,說是省錢,那是真的能省下來。

圖片

而且這一次相比於之前,有一個我覺得很棒的更新點,就還是事實錯誤率,我自己一直說,GPT都快成為我的事實核查器了,就是它是真的幾乎沒什麼幻覺,在這個點上還是太強了,過去我一直覺得5.6已經很不錯了,那這一次他們又進行了大幅的優化,基本都已經處於GPT-6 Astra的級別了,在這裡其實也可以看到推理等級,如果你開的是輕度或者是中的話,很多時候會犯一些事實錯誤的,這也是為什麼我一直推薦大家在日常裡面開的是高,甚至如果你是Luna,你得開最高才可以。

圖片

然後我自己也實測了一下,在審美和一些細節上,是有明顯降級的。

比如操控Blender建摩托車,這個就能看到,在細節的完成度上,是差的非常遠的。

圖片

這是GPT-6 Astra的天壇。

圖片

而這,是GPT-6 Sol的天壇,很多細節都是有問題的,門直接就出bug了。

圖片

但是成本上,大概降了70%,所以整體也可以接受吧。

我寫稿的時候,GPT-6 Sol和GPT-6 Luna已經開始在ChatGPT Work和Codex推送。

圖片

但是比較尷尬的是,OpenAI居然說這些模型尚未在Chat上提供,也就是說,聊天模式下,還是給大家提供的是GPT-5.6 Sol。

這一塊是我有點不理解的,明明你的成本都已經大幅下降了,那你為什麼不在聊天上面也給大家換成本更低的模型呢?

寫在最後

我知道,大家看到這裡,最後肯定還是會問一個問題。

所以到底我要怎麼選?

現在模型實在是太多太多太多太多了,每天都有新模型發,真的好累啊。

我只能說,盡可能的給大家描述我的選擇。

1. 如果你可以訂閱Claude不會被封號。

從情理上來說,我真的很討厭Anthropic這個XX公司。但是從用戶體驗角度來說,如果你可以訂閱Claude,且不會被封號,能長久使用。我還是推薦你訂閱Claude。

複雜規劃和計劃使用Claude Fable 5.1去做,任務執行用Opus 5.5,這可能是目前確實是最好的組合。

2. 如果你被Claude封號,但可以訂閱海外模型。

那就無腦訂閱ChatGPT,GPT在模型層面,坦誠地講,還是比claude要差那麼一小截,無論是創作,還是認知洞察,還是coding。

但它有幾乎最好的C端體驗,有無限額度的聊天模式,有最好用的客戶端Codex,並且GPT-6在這個世界上還是T0級別的強。

複雜規劃和計劃使用GPT-6 Astra或者邪修GPT-6 Pro去做,使用GPT-6 Astra high或者GPT-6 Sol xhigh去執行,GPT-6 luna用來跑大規模的批量自動化任務,會非常的香。

3. 如果你只能訂閱國產模型。

坦率的講,Qwen、Kimi、GLM、MiMo、DeepSeek這幾家,都沒有那種說斷代的區別,用的習慣哪家就用哪家吧,唯一麻煩的是模型梯隊沒有那兩家強,Kimi K3和Qwen 3.8 Max更加適合做規劃和方案,GLM-5.3和Mimo v2.6 Pro、DeepSeek V4.1 Flash更加適合做執行。

只是謹記,永遠只訂閱1個月就行,不要太長,最多買季卡,千萬不要買年卡。

OpenAI和Anthropic還是太成熟了,現在的環境跟之前還不太一樣。

以前呢,是這兩家負責做前沿的智能上線,換句話說,就是做高端。

然後呢,國產模型來去做中端和性價比。

但是現在,人家供應鏈好像更加成熟了,就跟蘋果一樣,也開始全域通吃,你的中端,甚至你的超低端,我全都要。

不過,對於所有用戶來說,這也是一種好事吧。

因為現在的智能終於好像變得越來越便宜了。

過去我們同等的AI性能,它的成本幾乎是每季度會下降47%,智能,再過幾個月到半年時間,它可能真的就會像煤水電一樣,成為每一個人都能用得起的資產。

那時候,可能就是真正的,大繁榮時代了。

分享至:

作者:数字生命卡兹克

本文為PANews入駐專欄作者的觀點,不代表PANews立場,不承擔法律責任。

文章及觀點也不構成投資意見

圖片來源:数字生命卡兹克如有侵權,請聯絡作者刪除。

關注PANews官方賬號,一起穿越牛熊
PANews APP
港股AI應用板塊午後持續走低,智譜跌超10%
PANews 快訊