作者:數字生命卡茲克
人麻了,前幾天不是都喊著模型要放慢嗎。怎麼這模型跟不要錢一樣往外扔啊。昨天Grok 4.7 PK MiMo v2.6,是給今天這兩大哥演個前戲是吧。今天凌晨,OpenAI的GPT-6 Sol和GPT-6 Luna,以及Anthropic的Claude Opus 5.5,都正式發布。
我真的挺想問問,天天一個個說著放慢,放慢在哪了這都是。全是渣男。而且這個劇情,我總感覺莫名眼熟,然後翻了一下歷史文章。
上一次,GPT-5.3 Codex對轟Claude Opus 4.6,今天直接歷史重演了。。。只不過,Claude Opus 4.6,變成了Claude Opus 5.5。
GPT-5.3 Codex,變成了GPT-6 Sol。
兩家公司還是這兩家公司,還是那個不服就幹的死對頭。
一個一個說吧。
一. Claude Opus 5.5
先說Claude。
坦率的講,我再怎麼討厭Anthropic,再怎麼覺得這家公司是個傻逼,他們在再怎麼封我號,客觀的講,Claude依然是我心中最好、最全面的那一檔模型。
我至今依然記得我用Claude Fable 5給我帶來的震撼。
而這次Claude Opus 5.5,是Anthropic全新的Claude 5.5系列裡的第一個模型,而且我印象中,很少Claude會一次性跨這麼多的版本號。
並且我自己臨時體驗下來(不要問我為啥封號了還能用,直接買的次拋號,用個2小時就會被封的那種。。。),Opus 5.5在整個的溝通上,讓我有一種,回到了Opus 4.6的感覺,活人感很強。
雖然他們給這玩意的定位,其實就是Claude系列的性價比模型,但是確實有一種讓我想起了當年的白月光。
基本信息我總結了一下,大概是這樣的:
| 模型名 | claude-opus-5-5 |
|---|---|
| 上下文 | 1M Token |
| 最大輸出 | 128K Token |
| 可靠知識截止 | 2026年6月 |
| 思考 | Adaptive Thinking,始終開啟 |
| 默認努力等級 | medium |
| 輸入價格 | 4美元 / 百萬Token |
| 輸出價格 | 20美元 / 百萬Token |
| 緩存讀取 | 0.2美元 / 百萬Token |
| 5分鐘緩存寫入 | 5美元 / 百萬Token |
| 1小時緩存寫入 | 8美元 / 百萬Token |
相比上一代Opus 5,整體的工作成本,可以直接下降40%。
同時,輸出速度相比Opus 5還快了30%以上。
目前在一些非大型的工作上,Opus 5.5已經可以做到Fable 5.1級別的表現,大型高難工作,依然需要Fable級模型上場。
在Coding任務上,基本就是現在的SOTA了。
比如Terminal-Bench 4.0這種反映在真實終端環境裡完成複雜、多步任務的能力,Opus 5.5刷新了最高分66.4%。
只要涉及到Coding的,基本上都SOTA了,很像最開始Opus 5出來的時候,在Coding的執行上全面超越Fable 5一樣。
但是有兩個東西不太一樣,Terminal-Bench-Science這個任務是偏科研任務,Opus 5.5是58.7%,這裡Astra反而更高,64.6%。
AutomationBench也一樣,這個任務其實就是跨軟件工作,Opus 5.5是40.0%,GPT-6 Astra是41.4%。
還有那個Computer Use,雖然GPT-6 Astra沒分,但是所有人都知道這玩意不可能會差,它是絕對的SOTA。
從這些地方也能看出來Anthropic和OpenAI這兩家公司卷的一些差異化發展方向,Anthropic更偏向於Coding能力,同時審美極強,他們也相信Coding才是通往AGI之路的基石,但是OpenAI更加專注的是全面的Agent能力,包括推理、軟件操作、科研等等。
但坦率的講,單純的去看某一個維度的評測集,我覺得是完全無法去評估一個模型真正的質量的。
就像你知道,即使是開發產品,還有一個很核心的東西,是你最前面的規劃和架構設計能力,這玩意Fable就是神,它依賴於你的大參數,依賴於你的世界知識,依賴於你的智能湧現。
你說Opus 5.5確實是能在某些特定的執行上面超過Fable,但是你整體說Opus 5.5要比Fable強?那我覺得你不如信我是秦始皇。
整體上Claude Opus 5.5,基本上就是Fable 5.1自家的官方蒸餾模型了。
在很多垂直的場景裡面可能會更強,並且參數量更小,速度更快,更加便宜,但同時也會帶來Token的浪費,這裡其實是一個陷阱,一旦在高難任務上,一些非旗艦模型反而會持續不斷的瘋狂思考,瘋狂嘗試,但是又出不去一直解決不了問題,反而會比旗艦模型更加燒錢。
就像Opus 5.5確實很強,但是他的每任務輸出Token數直接爆炸了,所以其實他的很多的智力是靠用超長的推理來去換來的,這個弊端就是,一旦陷入困境,就原地爆炸。
所以Anthropic也是如此提示的。
當你的結果很重要的時候,一定要用最高級的模型。
然後可以看看X上大佬們跑的Claude Opus 5.5的case,還是蠻驚艷的,特別是在審美和細節上,有了巨幅加強。
來自@notjazii的對比GPT-6 Astra和Claude Opus 5.5的測試,在部分場景下,甚至比GPT-6 Astra更加精細一點:
但代價就是,相比於GPT-6 Astra,更慢更貴。
不過對於Opus 5.5來說,將其與GPT-6 Astra相比,這本身就是一種讚譽了。
Opus 5.5這次還強化了溝通。
Anthropic說他們收到Opus 5最多的反饋之一,就是,有時候寫東西比較繞、術語多、表達不夠直接。
5.5會把最重要的信息放在前面,減少奇怪措辭和沒必要的解釋。
同時在創作上,也有Claude 4.6的感覺了。
所以呢,總結來說,Claude Opus 5.5是一個我覺得非常棒的模型。
Anthropic把很多過去只有旗艦模型才能幹的活,下放到了一個終於可以常駐使用的價位上,估計也是過去OpenAI給的壓力太大了。
他們自己的成本指南直接建議:
日常你盯著幹的Feature、Debug、Code Review,用Opus 5.5。
真正結果比Token價格更重要、長時間無人監督、或者Opus 5.5連續失敗的,再切Fable 5.1。
Fable開始越來越像專家級顧問。
Opus 5.5更像主力員工。
這就是Claude今天的新模型。
二. GPT-6 Sol和Luna
終於到我能正常用的東西了。
GPT-6 Sol和Luna。
因為你claude再怎麼好,我也就是一個次拋,也不是常年能用的東西,沒有用啊。
所以呢,沒有辦法,主力依然還是GPT-6。
特別巧的是,我前幾天寫GPT-6 Pro+MCP那篇文章的時候,還專門寫了一句:
「GPT-6 Sol大概率馬上就上了,上了以後執行這塊,我可能會無腦切GPT-6 Sol,只有高難任務才切GPT-6 Astra。」
然後,終於來了。
目前,Codex中已經上線,直接可用。
過去GPT-6 Astra最被人詬病的就是太貴,額度完全不夠用。
那這次,GPT-6 Sol和Luna,就是直接奔著降成本來的。
Astra依然是OpenAI最強的模型。
最困難、最重要、不想做任何妥協的工作,繼續用Astra。
但是現實世界裡的工作,有不同的規模、節奏和預算。
所以GPT-6 Sol和Luna存在的意義,跟Fable 5.1和Claude Opus 5.5的關係一樣:
把Astra這代訓練方法帶來的能力,下放到更快、更便宜的模型。
和Claude幾乎是在同一天,講同一件事情。
誰能用更少的錢,買到更多智能。
這就是帕累托前沿。
價格上面,新一代定價如下。
Sol和Luna,比GPT-5.6的同款模型,還要便宜50%。
最離譜的是這個Luna,如果我們單看輸入和輸出價格,其實已經比Deepseek還要便宜了。
當然我們都知道,真正的大頭其實是緩存,嗯,可以看到這個緩存的價格還是要比Deepseek高了3倍左右。
不過Luna最適用的場景,我覺得其實是各種應用背後的自動化任務,就像我的AIHOT背後掛著的十幾個需要大模型的信息處理任務一樣,每天請求都是上萬次。
這種場景下,其實緩存有時候的命中率不是特別高,綜合來看能到30%就不錯了,那在我看來,Luna的優勢就會變得比較明顯了。
其他的基本信息如下。
這些知識截止日期居然都不一樣。
Luna最新,到了5月18號。
然後就是大家最關心的GPT-6 Sol了,坦率的講,在能力上,比我預期的會差一些,但是在成本的降幅上,又比我預期的強一些。
可以看到,在AA上,它只比GPT-5.6 Sol強了一點,但是Opus 5.5,是直接斷崖式拿下了第一。
雖然說AA現在的基準有的時候也被很多人詬病,在很多的細節上沒有那麼準,但是大的方向不會差特別多。
所以GPT-6 Sol更多的還是基於新模型新架構,盡量保持比GPT-5.6 Sol好一點,然後大幅度降成本。
比如這個AutomationBench,就是在上面我們說Claude的時候,比Claude那邊要強的那個基準,這個Benchmark測的是Agent跨47種工具,去執行銷售、營銷、運營、客服、財務、HR這些真實業務流程。
GPT-6 Sol xhigh:
33.2%。
每個任務平均成本:
0.27美元。
GPT-6 Astra low是30.3%,但是任務成本是Sol的3.9倍。
Fable 5.1加Opus 5 fallback是31.4%,成本至少是Sol的8.9倍。
注意這裡對比的還是Claude Opus 5,因為Opus 5.5跟GPT-6 Sol幾乎同一時間發布,所以OpenAI的圖裡根本來不及放進去,放進去,其實也不是很好看,對於OpenAI來說不是很有利。
但是這張圖已經非常清楚地解釋了Sol的定位。
不過GPT的強悍就在於它的Token效率實在是太離譜了,說是省錢,那是真的能省下來。
而且這一次相比於之前,有一個我覺得很棒的更新點,就還是事實錯誤率,我自己一直說,GPT都快成為我的事實核查器了,就是它是真的幾乎沒什麼幻覺,在這個點上還是太強了,過去我一直覺得5.6已經很不錯了,那這一次他們又進行了大幅的優化,基本都已經處於GPT-6 Astra的級別了,在這裡其實也可以看到推理等級,如果你開的是輕度或者是中的話,很多時候會犯一些事實錯誤的,這也是為什麼我一直推薦大家在日常裡面開的是高,甚至如果你是Luna,你得開最高才可以。
然後我自己也實測了一下,在審美和一些細節上,是有明顯降級的。
比如操控Blender建摩托車,這個就能看到,在細節的完成度上,是差的非常遠的。
這是GPT-6 Astra的天壇。
而這,是GPT-6 Sol的天壇,很多細節都是有問題的,門直接就出bug了。
但是成本上,大概降了70%,所以整體也可以接受吧。
我寫稿的時候,GPT-6 Sol和GPT-6 Luna已經開始在ChatGPT Work和Codex推送。
但是比較尷尬的是,OpenAI居然說這些模型尚未在Chat上提供,也就是說,聊天模式下,還是給大家提供的是GPT-5.6 Sol。
這一塊是我有點不理解的,明明你的成本都已經大幅下降了,那你為什麼不在聊天上面也給大家換成本更低的模型呢?
寫在最後
我知道,大家看到這裡,最後肯定還是會問一個問題。
所以到底我要怎麼選?
現在模型實在是太多太多太多太多了,每天都有新模型發,真的好累啊。
我只能說,盡可能的給大家描述我的選擇。
1. 如果你可以訂閱Claude不會被封號。
從情理上來說,我真的很討厭Anthropic這個XX公司。但是從用戶體驗角度來說,如果你可以訂閱Claude,且不會被封號,能長久使用。我還是推薦你訂閱Claude。
複雜規劃和計劃使用Claude Fable 5.1去做,任務執行用Opus 5.5,這可能是目前確實是最好的組合。
2. 如果你被Claude封號,但可以訂閱海外模型。
那就無腦訂閱ChatGPT,GPT在模型層面,坦誠地講,還是比claude要差那麼一小截,無論是創作,還是認知洞察,還是coding。
但它有幾乎最好的C端體驗,有無限額度的聊天模式,有最好用的客戶端Codex,並且GPT-6在這個世界上還是T0級別的強。
複雜規劃和計劃使用GPT-6 Astra或者邪修GPT-6 Pro去做,使用GPT-6 Astra high或者GPT-6 Sol xhigh去執行,GPT-6 luna用來跑大規模的批量自動化任務,會非常的香。
3. 如果你只能訂閱國產模型。
坦率的講,Qwen、Kimi、GLM、MiMo、DeepSeek這幾家,都沒有那種說斷代的區別,用的習慣哪家就用哪家吧,唯一麻煩的是模型梯隊沒有那兩家強,Kimi K3和Qwen 3.8 Max更加適合做規劃和方案,GLM-5.3和Mimo v2.6 Pro、DeepSeek V4.1 Flash更加適合做執行。
只是謹記,永遠只訂閱1個月就行,不要太長,最多買季卡,千萬不要買年卡。
OpenAI和Anthropic還是太成熟了,現在的環境跟之前還不太一樣。
以前呢,是這兩家負責做前沿的智能上線,換句話說,就是做高端。
然後呢,國產模型來去做中端和性價比。
但是現在,人家供應鏈好像更加成熟了,就跟蘋果一樣,也開始全域通吃,你的中端,甚至你的超低端,我全都要。
不過,對於所有用戶來說,這也是一種好事吧。
因為現在的智能終於好像變得越來越便宜了。
過去我們同等的AI性能,它的成本幾乎是每季度會下降47%,智能,再過幾個月到半年時間,它可能真的就會像煤水電一樣,成為每一個人都能用得起的資產。
那時候,可能就是真正的,大繁榮時代了。



