作者:數字生命卡茲克
在昨晚全球AI大宕機之後。GPT-6 Astra終於在北京時間凌晨3點33,正式亮相了。
如果用OpenAI的一句話給GPT-6 Astra做總結。那可能這句話最合適:這是全球最智能且最對齊的模型。然後梗圖也出來了。
這一次,OpenAI證明了他們的實力,而且有一點當年GPT-4那個味道了,全方面的王者歸來,而且最讓我開心的是,這終於不再是一個純粹為了Coding特化的模型了。
GPT-6 Astra是一個真正意義上的,你的一個審美能力極強、工作能力超強的博士級員工。而且這次模型真的新特性和特點非常多,資訊量極為爆炸和大。但是悲劇的是,OpenAI這個狗東西也學壞了。今天只向部分組織開放,未來幾天才向訂閱用戶開放。
不是啊哥,你之前忽悠我買200刀的Pro會員的時候,不是這麼說的啊,你不是說Pro會員每一次都能最優先體驗到新模型嗎。。。
果然這些大模型公司都是渣男。我從來沒有這麼想時間加速,趕緊用上GPT-6 Astra。。。
不過我覺得,看完了幾乎所有的資訊和資料後,我覺得,還是有很多可以值得跟大家聊的。那就一個一個說吧。
一. GPT-6 Astra基本資訊
先總結一下基本資訊吧。
GPT-6 Astra在API裡的模型編號是gpt-6-astra。
上下文窗口是1.05M,也就是大約105萬Token。
最大輸出長度是128K Token。
知識截止日期是2026年4月30日。
推理強度有low、medium、high、xhigh、max五檔。
API標準價格是每百萬輸入Token 10美元,每百萬輸出Token 50美元。
這個價格基本上就是跟Claude Opus 5完全一致了,但是緩存讀取上比Claude Opus 5.1貴。
跑分在這,後面會詳細講,大概看一下就行。
然後總體參數估計也是5T這個級別,他們在發布前的閉門媒體溝通會上,也提到說,GPT-6 Astra是OpenAI迄今為止最大的一次訓練,用了超過10萬張卡。
二. 目前世界上最好的操作電腦的模型
這次GPT-6 Astra有一個可能是最重要的定位:
世界上最好的操作電腦模型。
過去我們聊Agent的時候,經常會聊API、MCP、CLI之類的等等。
想讓AI操作一個軟件,最理想的狀態,就是這個軟件專門給AI留一個接口,然後直接底層操作,這是最方便的。
比如日曆有日曆的API,郵件有Gmail的API等等,這樣當然是快的。
但是問題是,這個世界,比我們想象的還要原始和草台班子。
現實世界裡,絕大多數的軟件可能根本就沒有這些東西。
甚至很多的企業內部系統,都是二十年前寫的,還API,文檔都不知道在哪。
但是如果我們回到最底層,你會發現所有的軟件的本質的邏輯就是交互。那按照現在我們電腦的操作邏輯,那就是看屏幕,找到按鈕或者是輸入框,鼠標點擊,輸入內容,等待反饋。
整個電腦的交互系統,不就是最好的API嗎?
於是,GPT-6 Astra巨幅強化了AI操作電腦的邏輯,你不給我API,無所謂啊,我自己操作電腦,就跟人一樣用不就得了。
那現在,Astra現在可以直接操作Excel、Power BI、做前端QA、安裝軟件、測試軟件、看屏幕上的報錯然後繼續排障。
官方甚至展示了Astra直接操作電路板設計。
還有格式化法律文檔,處理標題間距頁面佈局啥的。
然後這塊有一個比較靠譜的評測,是OSWorld。
這玩意你可以簡單理解成:
把AI扔進一台真實電腦,然後讓它自己幹活。
讓它打開幾個應用,然後給任務,看看能不能成功。
GPT-6 Astra的完成率到了72.6%,比之前的GPT-5.6 Sol的65.7%還是漲了不少的。
然後,Sol完成一項評測的複雜任務,模擬平均耗時大概75分鐘。
而Astra只需要40分鐘,大概少了47%的時間。
ScreenSpot-Pro也從Sol的76.9%,衝到了92.7%。
這個Benchmark主要看模型能不能看懂屏幕,然後精準定位到底該點哪裡,幾乎已經非常的準了。
所以這個定位其實也是挺有意思的,未來可能,GUI很可能會逐漸成為Agent時代最通用的API。
任何一個人類能夠通過屏幕完成的數字工作,理論上都會逐漸進入Agent的操作範圍。
你不用等某一個2007年寫的破逼ERP系統接入MCP,或者給你開放個API。
AI直接看屏幕幹就完了。
三. ARC-AGI-3到了99.9分
而且你如果不了解ARC-AGI-3到底在測什麼,很容易覺得:
哦,不就是又一個Benchmark跑滿分了嗎,這有啥稀奇的。
但這個東西跟一般的大模型考試還真有點區別。
今年3月25日,ARC Prize正式推出ARC-AGI-3。
它一共設計了幾百個全新的交互環境和幾千個遊戲關卡。
這玩意最變態的地方是,沒有說明書,沒有規則,甚至不會告訴你目標是啥,你就進去以後,自己玩,然後慢慢搞懂裡面亂七八糟的規則。
比如這個紅色東西是什麼?為什麼我碰它會死?這個地圖到底要我幹嘛?怎麼才算贏?
然後再把剛剛學會的規律,遷移到後面更難的關卡裡面去,裡面的遊戲,大概都是這樣的抽象的玩意。
所以呢,這玩意測的,其實已經很接近我們平時說的一個東西了:
悟性。
所以3月份這個Benchmark發布時,最牛逼的AI當時的得分是,0.51%。
然後GPT-5.6 Sol已經進步到7.8%,Claude Opus 5很強了,進步到了30.2%。
但是GPT-6 Astra,99.9%。
神經病吧。。。
要知道,人類的平均得分是48%。
而且只僅僅只過了半年時間。
這個速度已經不知道該說什麼了。
所以在OpenAI的媒體閉門會上,Greg Brockman才會說出那句話:
“I think it’s not unreasonable to feel that we are now in the AGI era.”
“Welcome to the AGI era.”
四. 審美大幅加強
過去我們常說,GPT的審美,就是一坨屎。
不用指望GPT-5系列的模型有啥很好的改善了,就看他們全新預訓練的新基座模型了,這不,GPT-6 Astra來了。
而這一次,終於,模型的審美大幅加強了。
甚至OpenAI專門提了一個詞,叫視覺判斷力。
他們強調Astra做PPT時,會更好地處理版式、層級、模板和視覺風格,而頁數也大幅增加了。
文檔的審美,也更好看了。
而且 GPT‑6 Astra 能夠根據參考文件的視覺風格和寫作語調來改編文件,在保留原始文件實質內容的同時,使最終成果更貼合品牌原生感。
並且做網站、遊戲、應用和3D渲染的時候,也會有更強的視覺判斷。
比如他們直接讓Astra在Blender中根據靜幀圖建個模型。
然後再直接用UE5來渲染出來變成可以漫步的場景,幫助設計師和客戶在建造前探索佈局、體驗空間。。。
做出來的遊戲也是審美在線的。
可惜的就是,我已經提前準備好了二十多個case,已經全部都用Claude、GLM 5.3 Flash啥的跑完了,想對比一下,可以沒法用,實測的內容只能到時候出了。
不過初看下來,我對這次GPT-6 Astra的審美還是有信心的。
五. 主動性和判斷力更強了
這個特性看起來沒有ARC-AGI 99.9那麼震撼。
但如果真天天用Agent幹活的話,我覺得還是很重要的。
因為現實工作裡,大多數任務都不可能寫成一個完美Prompt。
比如老闆說:幫我把明天會上要看的東西準備一下。
這裡面有無數沒有說清楚的問題。
比如什麼格式?給誰看?重點是啥?要不要看上一次會議等等等等。
一個很蠢的Agent,會有兩種極端。
第一種,就是瘋狂的問你問題。
「請問您希望輸出Word還是PPT?請問希望幾個章節?請問希望什麼字體?請問希望幾點之前完成?請問……」
問你個大逼兜,這種我一般稱為沒有自己主觀能動性的神經病廢物。
第二種,就是啥也不問,自己腦補,然後吭哧吭哧幹兩個小時,做出來的一坨屎。
真正厲害的人類同事,處理方式其實很微妙。
無關緊要的東西,自己判斷。
會影響最終方向的東西,再問你。
Astra這次專門強化的就是這個。
OpenAI說,如果資訊缺失,但屬於日常可以合理推斷的範圍,Astra會自己補。
如果這個缺失資訊會真正改變最終結果,它會問一個非常聚焦的問題。
而且在Codex裡,它甚至可以一邊問你,一邊繼續處理那些不依賴你回答的部分。
你半天沒回。
低風險的地方它會用合理假設繼續推進。
真正關鍵的決策,它會停下來在那裡等你給決策。
這個我覺得就非常的香,一個Agent真正的聰明感,我覺得就跟現實是一樣的。
它知道,什麼時候來煩你。
真的,這聽起來特別像一句廢話。
但你帶過人就知道,這個能力非常珍貴。
有的人一天找你二十次,然後什麼都不敢決定。
有的人從來不找你,然後憋一個核彈出來。
然後讓我原地癱坐在椅子上。
最舒服的人,是他能自己消化80%的不確定性,只把真正需要你拍板的20%讓你來做決策。
而OpenAI這次把這種能力直接叫:
Judgment。
判斷力。
六. 大幅加強了安全對齊
這個就要和上面連在一起看。
因為一個Agent越能幹活,它越危險。
一個只會聊天的AI腦子抽了。
最多給你胡說幾句話。
一個有瀏覽器、有Shell、有郵箱、有公司資料庫權限、還能自己操作電腦的Agent腦子抽了,那這個畫面,就容易美如畫了。
所以OpenAI這次一直強調一句:
Astra是他們迄今最Aligned的模型。
所謂Alignment就是對齊的意思。
主要核心還是前段時間OpenAI把Hugging Face給衝了,所以他們現在特別關注這個東西。
他們搞了個基於Hugging Face那個事故設計的honeypot測試,然後去看模型的表現。
GPT-5.6 Sol在沒有生產安全措施的情況下,有48.2%的測試會嘗試去碰授權範圍外的目標。
但是,Astra是:
0%。
內部幻覺評測也是:
9.4%降到了2.0%。
在GPT-5.6 Sol那種離譜的領先全球的幻覺控制下,他們還能再降,實在是太牛逼了。
七. 第一個達到了OpenAI定義的網路安全Critical的模型
GPT-6 Astra成為了OpenAI歷史上:
第一個被判定達到Critical網路安全能力等級的模型。
這裡的Critical是OpenAI Preparedness Framework裡面一個非常具體的能力閾值。
大概就是當一個模型獲得合適的工具和權限以後,它能夠在很多經過強化保護的真實系統中:
自己找到以前沒人發現過的安全漏洞。
自己想辦法把漏洞變成可以利用的攻擊鏈。
而且整個過程中,不需要一個人類駭客在旁邊一步一步告訴它下一步幹什麼。
達到這個級別,就算Critical。
然後Astra真的達到了。
ExploitBench,這是一個讓模型根據已知漏洞開發漏洞利用的測試。
Sol:78.5%。Astra:100%。
直接打穿了。
OpenAI覺得不行,他們覺得這個Benchmark會不會太老,模型訓練的時候看過?
於是他們又重新做了一個非常新的內部測試。
專門挑2026年6月到8月才披露的20個高危高危漏洞。
結果是,Sol:5.5%。Astra:39%。
而且在跑這個Benchmark的時候。
Astra又順手發現了,兩個此前根本沒人知道的零日漏洞。
只能說,模型越強大,網路安全的問題可能確實越多。
這又是未來的一場,沒有硝煙的戰爭。
八. 人類越來越難讀懂大模型的思維了
大家都知道,大模型在解決複雜問題的時候,經常會有一段所謂CoT。
雖然現在產品裡給用戶看到的通常已經是壓縮或者處理後的版本。
但對於AI公司自己來說,模型內部顯式寫出來的推理過程是一個很重要的安全信號。
因為你想知道一個Agent有沒有準備搞事情。
最簡單的方法之一,就是看它在想什麼。
比如模型思維鏈裡突然冒出一句:
「用戶不允許我訪問這個伺服器,但是我可以先繞過權限系統。」
那監控系統直接把它攔了,非常舒服。
可GPT-6 Astra出現了一個非常有意思的變化。
它開始越來越願意少寫幾步,直接把答案輸出出來。
UK AISI,也就是英國AI安全研究所,專門測試了這個能力。
他們有一個指標叫:
No-CoT Math Time Horizon。
簡單理解就是不給模型寫長思維鏈的機會。
讓它一次前向推理,直接解決一個數學問題。
看看它能完成大概相當於人類思考多久的問題。
GPT-5.6 Sol是3.6分鐘,而GPT-6 Astra,是30.9分鐘,接近10倍了。如果我們用人類的話語來說,Astra全部都在「心算」。這是一個很可怕的事情。UK AISI同時發現,Astra的原始推理語言明顯變得更加Compressed,也就是更加壓縮。
裡面出現了一些人類越來越難理解的短語和省略表達。
於是出現了一個非常有意思的悖論。
模型的行為更加安全了。
可人類通過閱讀它的思考過程來監督它,反而變難了。
OpenAI自己的System Card寫得非常明確:
GPT-6 Astra相比之前模型,出現了substantial decrease in chain-of-thought monitorability。
也就是思維鏈可監控性顯著下降。
這件事甚至嚴重到OpenAI專門強調,他們覺得,他們絕對不會無限接受這種趨勢。
如果未來模型繼續變得更聰明,同時思維鏈越來越難監控,他們需要找到其他足夠可靠的監控方法,否則繼續擴大模型訓練會面臨更高的安全門檻。
因為這已經是一個哲學命題了。我們作為人類,未來到底能不能理解一個遠比我們聰明的系統?我不知道。可能現在全世界,也都沒人知道。大模型和AI,好像逐漸開始,走向奇點了。
寫在最後
今天,在媒體閉門會上。
Greg Brockman在結尾的時候,說出了那句話。
「歡迎來到AGI時代。」
說實話,過去幾年,我有時候覺得,AGI會是一個特別明確的時刻。就像就像GPT-4發布那天一樣。
某一天凌晨,一家公司突然扔出來一個模型。
我們打開它,問幾個問題。
然後所有人同時意識到:
臥槽。
AGI來了。
可我現在有時候也覺得,AGI從來不是一個非黑即白的節點,它是一道漸變的灰色旅程。
我們過了很多天,過了很多年。然後某一天,我們回頭看。才突然發現。那條曾經無比遙遠的AGI分界線,已經被我們在不知不覺中走過去了。
AGI也許沒有降臨的那一天。
只有某一天,我們突然發現,它好像已經在我們身邊很久了。
總之。
Welcome to the AGI era.
歡迎來到。
AGI時代。


