作者:Max,01Founder
編輯|Max
前幾天,著名海外AI應用 Genspark 幹了一件以前不太像它會幹的事。
它開始自己訓模型了。
9 月 10 日,Genspark 發佈了一個專門做 PPT 的模型 Gen-1 Slides。底座是 MiniMax M3,訓練這件事則找了 Fireworks 一起做。
現在,這個模型已經成了 Genspark AI Slides 標準模式的默認選項。
Genspark 過去一直是很典型的 AI 應用公司。
模型是誰家的不重要,誰好用就用誰。
今天 Claude Opus 4.8強一點,就多調一點 Claude;明天GPT-5.6更便宜,就重新把請求都切過去。
應用公司最擅長的事情,本來就是不對模型公司產生感情。
所以看到 Genspark 自己下場訓練模型,我停了一下。
因為這已經不是這個 API 好不好用的問題了。
調 API 不好用,最多改個配置。
自己訓練,先得交 GPU 的錢。
行業裡誇模型的人很多。
願意為了這句誇獎,自己買單繼續訓練的人,就沒那麼多了。
這也是我後來重新去看 MiniMax 的原因。
PART.01、開源模型準備好了
先說 Genspark 為什麼選 M3。
現在開放模型很多,甚至有些模型在榜單上的成績比 M3 更好。
但還有一個前提:
現在這批開放模型,本身已經跨過了可用線。
放在前幾年,應用公司拿到權重以後,可能還得先補 Coding、Agent、長任務這些基礎能力。
現在像 M3 這樣的模型,底子已經夠用了,應用團隊才有資格把資源集中到自己的業務上。
但對一家準備繼續做後訓練的應用公司來說,選基座模型並不是簡單從排行榜第一名往下挑。
Genspark 做的是 PPT。
一份複雜 PPT,要讀很長的參考資料,規劃頁面,寫程式碼,呼叫工具渲染,再自己檢查和修改,跑幾十輪很正常。
所以它需要的底座,最好同時具備原生多模態、長上下文、不錯的Coding和Agent能力,而且還得開放權重。
M3 基本把這些條件湊齊了。
但我覺得還有一個很現實的原因:
它的模型大小也剛剛好。
M3 大約有 428B 總參數,每個 Token 激活約 23B。
400 多 B 當然不能叫小模型,但放在今天前沿的開放模型裡,又沒有大到完全脫離應用公司的訓練和部署範圍。
市面上確實還有一些跑分更高的模型,但模型越大,後面強化學習、部署、推理、持續迭代的成本都會跟著上去。
對模型公司來說,可能更關心誰是最強的。
但對應用公司來說,選基座模型不是找最聰明的那個,而是在能力、成本和可訓練性之間,找性價比最高的那個。
能力已經足夠覆蓋自己的任務,模型規模又沒有大到讓後訓練失去商業意義。
所以 Genspark 選 M3,我覺得本質上 M3 是在這個區間裡找到了一個平衡點。
Genspark 自己也說,因為有 M3 這樣的開放底座,他們才能直接跳過預訓練,把預算花在 Slides 這件事上。
這句話其實把事情說得很清楚。
應用公司真正需要的,不是再造一個最強基礎模型。
而是找到一個已經足夠好的模型,然後把有限的錢和工程資源,花在自己真正懂的業務上。
PART.02、為什麼要訓模型
但有一個合適的底座,不代表 Genspark 就一定要自己訓。
真正的問題是這件事值不值得。
答案首先藏在 Genspark 自己的呼叫規模裡。
Fireworks 披露,Genspark Slides 每個月消耗的 Token 已經超過 1 兆。
到了這個量級,模型成本就不再隻是技術團隊關心的事情了。
哪怕每百萬 Token 隻便宜一點,乘上每月上兆 Token 的消耗,最後都會變成一筆很具體的成本。
所以 Genspark 真正要算的是:如果把最常用、最穩定的一部分任務自己做專項訓練,能不能把效果留下來,同時把成本壓下去。
他們做了一組測試。
Gen-1 Slides 完成一份 PPT,平均模型呼叫成本是 0.44 美元。
而用之前行業主力模型 Opus 5 的成本是 4.16 美元。
這是接近十倍差距。
這時候,Genspark 為什麼願意自己訓,就比較容易理解了。
更重要的是,成本降下來以後,效果並沒有明顯打折。
Gen-1 Slides 的平均評分是 4.25,略高於 Opus 5 的 4.23;下載率也達到 33.1%,高於後者的 31.5%。
這時候,Genspark 為什麼願意自己訓,就比較容易理解了。
它不需要做一個全面超過所有通用模型的新模型。
它隻需要在 PPT 這件高頻、穩定、自己又足夠熟悉的任務上,做出一個更合適的版本。
效果夠好,成本能降,而且還能圍繞自己的產品繼續迭代,這筆帳就開始成立。
PART.03、為什麼能訓模型
訓練過程中,Genspark 遇到過一個很典型的問題。
他們不希望 PPT 裡的文字溢出,於是給模型設計了一條規則:文字超過頁面邊界,就扣分。
模型訓練一段時間以後,很快找到了解法:
把字體縮小。
從評測器來看,問題解決得非常漂亮。
文字確實沒有溢出。
隻是用戶也快看不見了。
這個例子其實剛好解釋了,為什麼 Genspark 這種應用公司有必要自己參與模型訓練。
因為模型公司可以把模型訓練得很聰明,卻很難替每一個應用定義:到底什麼叫把活幹好了。
對於 PPT 來說,沒有文字溢出隻是一個指標。
真正交到用戶手裡,還要考慮字號能不能看清、資訊密度是不是合適、頁面結構順不順、用戶會不會拿到結果以後又自己重做一遍。
這些東西沒有一個通用 Benchmark 能完全告訴你。
它們來自產品每天和真實用戶打交道。
Genspark 做了這麼久 Slides,它手裡真正值錢的,不隻是呼叫量,還有大量關於什麼結果用戶會接受的經驗。
哪些錯誤用戶最敏感,哪些問題可以忍,哪些頁面看起來沒報錯但根本不能交付,這些判斷,模型公司很難憑空獲得。
以前,這些經驗主要被用來改 Prompt、改 Workflow、改產品。
現在多了一條路:
把它們變成 Reward、評測器和訓練數據,直接參與模型本身的調整。
這也是 Genspark 能參與這次訓練的原因。
MiniMax 負責把 M3 的通用能力做好,Fireworks 負責把訓練工程跑通,而 Genspark 手裡有另一類東西:
真實用戶,以及這些年做 PPT 累積下來的產品判斷。
它最清楚什麼樣的 PPT 用戶願意留下,哪些錯誤會讓人直接重做,哪些頁面看起來沒報錯,實際上根本沒法交付。
這些東西,模型公司很難憑空知道。
所以應用公司開始訓模型,不是因為它們突然更會訓練一個通用模型了。
而是當開源基模的能力過線以後,它們終於可以把原本停留在產品層的經驗,繼續往模型裡壓。
說到底,Genspark 不需要比 MiniMax 更懂模型。
它隻需要比 MiniMax 更懂 PPT 這門生意。
PART.04、不隻是文本模型
看到 Genspark 這次拿 M3 去做後訓練,我突然想起了一個月前的 H3。
8 月 3 日,MiniMax H3 正式開放權重。
這是一個可以同時理解文本、圖片、影片和音訊的通用影片模型,能生成最長 15 秒、最高 2K、帶原生立體聲音訊的影片。
然後社區很快就熱鬧起來了。
H3 開放權重當天,ComfyUI 就做了 Day-0 支援。官方甚至專門寫了一篇部落格,介紹怎麼把 H3 跑在本地消費級顯示卡上。
接下來的事情就很有網際網路開源社群的味道了。
有人嫌 15 秒不夠長,就自己寫 ComfyUI 節點,把 H3 一段一段接起來,做長影片和多鏡頭連續生成。
還有人純粹拿它玩梗。H3 開源當天,Stable Diffusion 社群裡就有人用本機 ComfyUI 做各種文字生成影片,光一個貼文就拿了幾百個讚。下面討論的已經不是這個模型能不能跑,而是還能拿它幹什麼。
再往後,事情開始從網友玩模型變成公司改模型。
8 月 26 日,fal 發布了 H3 Max,直接在 H3 的開放權重上繼續後訓練,加入新的訓練數據,重點優化提示詞遵循、畫面審美和推理速度。
fal 給出的數據裡,5 秒影片可以在不到 3 秒裡生成。
FastVideo 則往另一個方向走,做了 FastH3,用四步蒸餾和稀疏注意力去壓推理成本和生成時間。
甚至還有研究團隊把 H3 改成了一個可以用鍵盤控制的互動式世界模型 H3-World。
他們隻訓練了大約 0.2% 的骨幹參數,就讓影片模型開始響應玩家動作。
所以看到 Genspark 這次做 Gen-1 Slides,我再回頭看 H3 開源之後發生的那些事情,感覺就不太一樣了。
當時大家看到的是熱鬧。
有人拿 H3 做廣告,有人做長影片,有人優化推理速度,還有人乾脆把它往世界模型上改。
但現在回頭看,這些項目其實都在做同一件事:
把一個開源通用模型,繼續往自己的具體問題上推。
MiniMax 可以把 H3 的基礎能力做好,但它不可能同時知道,廣告團隊最在意什麼,影片平台最想壓哪一部分成本,做互動世界的人又需要什麼樣的響應能力。
這些問題,反而是下游最清楚。
Genspark 也是一樣。
它不需要比 MiniMax 更懂怎麼訓練一個通用模型,它隻需要比 MiniMax 更懂 PPT 用戶。
fal 也不需要重新造一個影片模型,它隻需要知道自己的推理系統和客戶,到底還缺什麼。
所以開放權重真正改變的,不隻是大家都可以下載模型。
它其實重新分了一部分研發工作。
基礎模型公司負責把通用能力做到足夠高,下游公司負責把它繼續訓練成更適合自己業務的東西。
這樣一來,MiniMax 不需要自己提前猜中所有應用場景。
模型放出去以後,外面的公司會帶著自己的數據、用戶和問題,繼續往不同方向走。
有些方向 MiniMax 自己可能根本不會做。
但隻要底座足夠好,這些探索仍然可以從它這裡開始。
我覺得這才是 H3 開源之後那陣狂歡更值得看的地方。
表面上是大家在玩同一個模型。
實際上,是很多團隊開始替這個模型尋找不同的去處。
PART.05、對 MiniMax 的價值是什麼
但開放權重還有一個繞不開的問題:
這些下游的探索,最後和 MiniMax 自己有什麼關係?
前面講 H3 的時候,其實已經能看到第一層價值。
MiniMax 不需要自己去研究廣告、長影片、世界模型或者 PPT。模型放出去以後,下游會帶著自己的數據、用戶和業務問題,替這個底座不斷試新的方向。
有人做成了,就等於又多了一個案例,告訴市場:這個模型不隻是 Benchmark 上能跑,它真的可以被拿去做產品。
這種價值未必馬上出現在收入裡,但會影響下一批開發者的選型。
而 MiniMax 顯然也沒有把後面的商業關係完全放掉。
我後來去翻了 M3 的 License,發現它並不是權重一開,後面隨便用。
M3 使用的是自己的社群許可。
協議裡明確寫到,基於 M3 做後訓練、微調之後形成的商業部署,依然屬於商業使用;如果相關產品和服務的年收入超過 2000 萬美元,需要再取得 MiniMax 的單獨書面授權。
這套設計其實挺容易理解。
前期先把模型開放出來,讓更多團隊願意嘗試。誰適合拿它做什麼,不需要 MiniMax 自己提前猜完。
如果一個項目最後隻是實驗,社群至少替它探索了一個方向。
如果真的跑成了一門生意,雙方又有機會重新建立商業關係。
所以開放權重並不等於 MiniMax 把後面的價值全部讓掉了。
它更像是先把開發邊界打開,讓更多人幫它把模型帶進不同場景;等某些場景真正長大以後,再透過授權、API 或其他服務把關係接回來。
現在 Comfy 已經在公開銷售 MiniMax 模型的商業許可,Professional 檔從每月 5000 美元起。
當然,這裡面有個先後順序不能搞反。
不是因為 License 寫得聰明,所以開發者會來。
還是得先有一個足夠好的模型,才會有人願意下載、繼續訓練,甚至把自己的產品押在它上面。
License 能做的,隻是在模型已經創造價值以後,讓其中一部分價值有機會再回到 MiniMax。
這樣看,開源本身不是商業模式。
它更像是在擴大模型能夠抵達的地方。
而商業模式,要等這些地方真的長出東西以後,才開始有意義。
PART.06、核心是有多少人願意用你
過去評價一個基礎模型,最常看的還是 Benchmark。
數學多少分,Coding 排第幾,Agent 榜單有沒有漲,這些當然重要。
但對 MiniMax 來說,現在還可以多看一個指標:
有多少團隊,願意拿它的模型繼續訓練,並真正放進自己的業務裡。
這比下載一次模型重得多。
因為一旦決定做後訓練,就意味著團隊願意投入工程師、算力、時間,還要把自己的任務環境和評價體系接進去,最後拿真實用戶來檢驗結果。
沒人會為了證明開源生態很繁榮,主動燒一筆算不過來的錢。
所以 Genspark 選擇 M3,本身就是一次很實際的驗證。
Genspark 有足夠大的業務規模,也有長期累積下來的 PPT 產品經驗;但另一邊,MiniMax 也得先提供一個基礎能力足夠、值得繼續訓練的底座。
少任何一邊,這件事都很難成立。
所以,應用公司開始往模型層走,並不意味著基礎模型公司的價值變小了。
反過來看,隻有底座足夠成熟,下游才敢把自己的業務、工程資源和用戶一起壓上去。
Genspark 把 M3 訓練成 PPT 模型,fal 和 FastVideo 沿著 H3 繼續往下改。它們解決的都不是 MiniMax 自己定義的問題,卻都在驗證同一件事:這個底座值不值得繼續開發。
所以以後評價 MiniMax,除了看 Benchmark、API 和自己的產品,我還會多看一個指標:
有多少公司,願意把自己的生意建在它的模型上。
下載一個模型很容易。
願意投入工程師、GPU 和真實用戶繼續往下做,難得多。
模型發布以後,還有多少人願意接著往下做,這件事比發布會上的掌聲難得多。



