是時候重新評估 MiniMax 了

Genspark 自研模型 Gen-1 Slides,基於 MiniMax M3 底座後訓練,PPT 生成成本大幅降低,效果反超 Opus 5。開源模型價值爆發,應用公司開始親自下場訓模型。

作者:Max,01Founder

編輯|Max

前幾天,著名海外AI應用 Genspark 幹了一件以前不太像它會幹的事。

它開始自己訓模型了。

9 月 10 日,Genspark 發佈了一個專門做 PPT 的模型 Gen-1 Slides。底座是 MiniMax M3,訓練這件事則找了 Fireworks 一起做。

現在,這個模型已經成了 Genspark AI Slides 標準模式的默認選項。

Image

Genspark 過去一直是很典型的 AI 應用公司。

模型是誰家的不重要,誰好用就用誰。

今天 Claude Opus 4.8強一點,就多調一點 Claude;明天GPT-5.6更便宜,就重新把請求都切過去。

應用公司最擅長的事情,本來就是不對模型公司產生感情。

所以看到 Genspark 自己下場訓練模型,我停了一下。

因為這已經不是這個 API 好不好用的問題了。

調 API 不好用,最多改個配置。

自己訓練,先得交 GPU 的錢。

行業裡誇模型的人很多。

願意為了這句誇獎,自己買單繼續訓練的人,就沒那麼多了。

這也是我後來重新去看 MiniMax 的原因。

PART.01、開源模型準備好了

先說 Genspark 為什麼選 M3。

現在開放模型很多,甚至有些模型在榜單上的成績比 M3 更好。

但還有一個前提:

現在這批開放模型,本身已經跨過了可用線。

放在前幾年,應用公司拿到權重以後,可能還得先補 Coding、Agent、長任務這些基礎能力。

現在像 M3 這樣的模型,底子已經夠用了,應用團隊才有資格把資源集中到自己的業務上。

但對一家準備繼續做後訓練的應用公司來說,選基座模型並不是簡單從排行榜第一名往下挑。

Genspark 做的是 PPT。

一份複雜 PPT,要讀很長的參考資料,規劃頁面,寫程式碼,呼叫工具渲染,再自己檢查和修改,跑幾十輪很正常。

所以它需要的底座,最好同時具備原生多模態、長上下文、不錯的Coding和Agent能力,而且還得開放權重。

M3 基本把這些條件湊齊了。

但我覺得還有一個很現實的原因:

它的模型大小也剛剛好。

M3 大約有 428B 總參數,每個 Token 激活約 23B。

400 多 B 當然不能叫小模型,但放在今天前沿的開放模型裡,又沒有大到完全脫離應用公司的訓練和部署範圍。

市面上確實還有一些跑分更高的模型,但模型越大,後面強化學習、部署、推理、持續迭代的成本都會跟著上去。

對模型公司來說,可能更關心誰是最強的。

但對應用公司來說,選基座模型不是找最聰明的那個,而是在能力、成本和可訓練性之間,找性價比最高的那個。

能力已經足夠覆蓋自己的任務,模型規模又沒有大到讓後訓練失去商業意義。

所以 Genspark 選 M3,我覺得本質上 M3 是在這個區間裡找到了一個平衡點。

Genspark 自己也說,因為有 M3 這樣的開放底座,他們才能直接跳過預訓練,把預算花在 Slides 這件事上。

Image

這句話其實把事情說得很清楚。

應用公司真正需要的,不是再造一個最強基礎模型。

而是找到一個已經足夠好的模型,然後把有限的錢和工程資源,花在自己真正懂的業務上。

PART.02、為什麼要訓模型

但有一個合適的底座,不代表 Genspark 就一定要自己訓。

真正的問題是這件事值不值得。

答案首先藏在 Genspark 自己的呼叫規模裡。

Fireworks 披露,Genspark Slides 每個月消耗的 Token 已經超過 1 兆。

Image

到了這個量級,模型成本就不再隻是技術團隊關心的事情了。

哪怕每百萬 Token 隻便宜一點,乘上每月上兆 Token 的消耗,最後都會變成一筆很具體的成本。

所以 Genspark 真正要算的是:如果把最常用、最穩定的一部分任務自己做專項訓練,能不能把效果留下來,同時把成本壓下去。

他們做了一組測試。

Gen-1 Slides 完成一份 PPT,平均模型呼叫成本是 0.44 美元。

而用之前行業主力模型 Opus 5 的成本是 4.16 美元。

這是接近十倍差距。

這時候,Genspark 為什麼願意自己訓,就比較容易理解了。

更重要的是,成本降下來以後,效果並沒有明顯打折。

Gen-1 Slides 的平均評分是 4.25,略高於 Opus 5 的 4.23;下載率也達到 33.1%,高於後者的 31.5%。

Image

這時候,Genspark 為什麼願意自己訓,就比較容易理解了。

它不需要做一個全面超過所有通用模型的新模型。

它隻需要在 PPT 這件高頻、穩定、自己又足夠熟悉的任務上,做出一個更合適的版本。

效果夠好,成本能降,而且還能圍繞自己的產品繼續迭代,這筆帳就開始成立。

PART.03、為什麼能訓模型

訓練過程中,Genspark 遇到過一個很典型的問題。

他們不希望 PPT 裡的文字溢出,於是給模型設計了一條規則:文字超過頁面邊界,就扣分。

模型訓練一段時間以後,很快找到了解法:

把字體縮小。

Image

從評測器來看,問題解決得非常漂亮。

文字確實沒有溢出。

隻是用戶也快看不見了。

這個例子其實剛好解釋了,為什麼 Genspark 這種應用公司有必要自己參與模型訓練。

因為模型公司可以把模型訓練得很聰明,卻很難替每一個應用定義:到底什麼叫把活幹好了。

對於 PPT 來說,沒有文字溢出隻是一個指標。

真正交到用戶手裡,還要考慮字號能不能看清、資訊密度是不是合適、頁面結構順不順、用戶會不會拿到結果以後又自己重做一遍。

這些東西沒有一個通用 Benchmark 能完全告訴你。

它們來自產品每天和真實用戶打交道。

Genspark 做了這麼久 Slides,它手裡真正值錢的,不隻是呼叫量,還有大量關於什麼結果用戶會接受的經驗。

哪些錯誤用戶最敏感,哪些問題可以忍,哪些頁面看起來沒報錯但根本不能交付,這些判斷,模型公司很難憑空獲得。

以前,這些經驗主要被用來改 Prompt、改 Workflow、改產品。

現在多了一條路:

把它們變成 Reward、評測器和訓練數據,直接參與模型本身的調整。

這也是 Genspark 能參與這次訓練的原因。

MiniMax 負責把 M3 的通用能力做好,Fireworks 負責把訓練工程跑通,而 Genspark 手裡有另一類東西:

真實用戶,以及這些年做 PPT 累積下來的產品判斷。

它最清楚什麼樣的 PPT 用戶願意留下,哪些錯誤會讓人直接重做,哪些頁面看起來沒報錯,實際上根本沒法交付。

這些東西,模型公司很難憑空知道。

所以應用公司開始訓模型,不是因為它們突然更會訓練一個通用模型了。

而是當開源基模的能力過線以後,它們終於可以把原本停留在產品層的經驗,繼續往模型裡壓。

說到底,Genspark 不需要比 MiniMax 更懂模型。

它隻需要比 MiniMax 更懂 PPT 這門生意。

PART.04、不隻是文本模型

看到 Genspark 這次拿 M3 去做後訓練,我突然想起了一個月前的 H3。

8 月 3 日,MiniMax H3 正式開放權重。

這是一個可以同時理解文本、圖片、影片和音訊的通用影片模型,能生成最長 15 秒、最高 2K、帶原生立體聲音訊的影片。

然後社區很快就熱鬧起來了。

H3 開放權重當天,ComfyUI 就做了 Day-0 支援。官方甚至專門寫了一篇部落格,介紹怎麼把 H3 跑在本地消費級顯示卡上。

Image

接下來的事情就很有網際網路開源社群的味道了。

有人嫌 15 秒不夠長,就自己寫 ComfyUI 節點,把 H3 一段一段接起來,做長影片和多鏡頭連續生成。

還有人純粹拿它玩梗。H3 開源當天,Stable Diffusion 社群裡就有人用本機 ComfyUI 做各種文字生成影片,光一個貼文就拿了幾百個讚。下面討論的已經不是這個模型能不能跑,而是還能拿它幹什麼。

再往後,事情開始從網友玩模型變成公司改模型。

8 月 26 日,fal 發布了 H3 Max,直接在 H3 的開放權重上繼續後訓練,加入新的訓練數據,重點優化提示詞遵循、畫面審美和推理速度。

fal 給出的數據裡,5 秒影片可以在不到 3 秒裡生成。

Image

FastVideo 則往另一個方向走,做了 FastH3,用四步蒸餾和稀疏注意力去壓推理成本和生成時間。

甚至還有研究團隊把 H3 改成了一個可以用鍵盤控制的互動式世界模型 H3-World。

他們隻訓練了大約 0.2% 的骨幹參數,就讓影片模型開始響應玩家動作。

所以看到 Genspark 這次做 Gen-1 Slides,我再回頭看 H3 開源之後發生的那些事情,感覺就不太一樣了。

當時大家看到的是熱鬧。

有人拿 H3 做廣告,有人做長影片,有人優化推理速度,還有人乾脆把它往世界模型上改。

但現在回頭看,這些項目其實都在做同一件事:

把一個開源通用模型,繼續往自己的具體問題上推。

Image

MiniMax 可以把 H3 的基礎能力做好,但它不可能同時知道,廣告團隊最在意什麼,影片平台最想壓哪一部分成本,做互動世界的人又需要什麼樣的響應能力。

這些問題,反而是下游最清楚。

Genspark 也是一樣。

它不需要比 MiniMax 更懂怎麼訓練一個通用模型,它隻需要比 MiniMax 更懂 PPT 用戶。

fal 也不需要重新造一個影片模型,它隻需要知道自己的推理系統和客戶,到底還缺什麼。

所以開放權重真正改變的,不隻是大家都可以下載模型。

它其實重新分了一部分研發工作。

基礎模型公司負責把通用能力做到足夠高,下游公司負責把它繼續訓練成更適合自己業務的東西。

這樣一來,MiniMax 不需要自己提前猜中所有應用場景。

模型放出去以後,外面的公司會帶著自己的數據、用戶和問題,繼續往不同方向走。

有些方向 MiniMax 自己可能根本不會做。

但隻要底座足夠好,這些探索仍然可以從它這裡開始。

我覺得這才是 H3 開源之後那陣狂歡更值得看的地方。

表面上是大家在玩同一個模型。

實際上,是很多團隊開始替這個模型尋找不同的去處。

PART.05、對 MiniMax 的價值是什麼

但開放權重還有一個繞不開的問題:

這些下游的探索,最後和 MiniMax 自己有什麼關係?

前面講 H3 的時候,其實已經能看到第一層價值。

MiniMax 不需要自己去研究廣告、長影片、世界模型或者 PPT。模型放出去以後,下游會帶著自己的數據、用戶和業務問題,替這個底座不斷試新的方向。

有人做成了,就等於又多了一個案例,告訴市場:這個模型不隻是 Benchmark 上能跑,它真的可以被拿去做產品。

這種價值未必馬上出現在收入裡,但會影響下一批開發者的選型。

而 MiniMax 顯然也沒有把後面的商業關係完全放掉。

我後來去翻了 M3 的 License,發現它並不是權重一開,後面隨便用。

M3 使用的是自己的社群許可。

協議裡明確寫到,基於 M3 做後訓練、微調之後形成的商業部署,依然屬於商業使用;如果相關產品和服務的年收入超過 2000 萬美元,需要再取得 MiniMax 的單獨書面授權。

Image

這套設計其實挺容易理解。

前期先把模型開放出來,讓更多團隊願意嘗試。誰適合拿它做什麼,不需要 MiniMax 自己提前猜完。

如果一個項目最後隻是實驗,社群至少替它探索了一個方向。

如果真的跑成了一門生意,雙方又有機會重新建立商業關係。

所以開放權重並不等於 MiniMax 把後面的價值全部讓掉了。

它更像是先把開發邊界打開,讓更多人幫它把模型帶進不同場景;等某些場景真正長大以後,再透過授權、API 或其他服務把關係接回來。

現在 Comfy 已經在公開銷售 MiniMax 模型的商業許可,Professional 檔從每月 5000 美元起。

Image

當然,這裡面有個先後順序不能搞反。

不是因為 License 寫得聰明,所以開發者會來。

還是得先有一個足夠好的模型,才會有人願意下載、繼續訓練,甚至把自己的產品押在它上面。

License 能做的,隻是在模型已經創造價值以後,讓其中一部分價值有機會再回到 MiniMax。

這樣看,開源本身不是商業模式。

它更像是在擴大模型能夠抵達的地方。

而商業模式,要等這些地方真的長出東西以後,才開始有意義。

PART.06、核心是有多少人願意用你

過去評價一個基礎模型,最常看的還是 Benchmark。

數學多少分,Coding 排第幾,Agent 榜單有沒有漲,這些當然重要。

但對 MiniMax 來說,現在還可以多看一個指標:

有多少團隊,願意拿它的模型繼續訓練,並真正放進自己的業務裡。

這比下載一次模型重得多。

因為一旦決定做後訓練,就意味著團隊願意投入工程師、算力、時間,還要把自己的任務環境和評價體系接進去,最後拿真實用戶來檢驗結果。

沒人會為了證明開源生態很繁榮,主動燒一筆算不過來的錢。

所以 Genspark 選擇 M3,本身就是一次很實際的驗證。

Genspark 有足夠大的業務規模,也有長期累積下來的 PPT 產品經驗;但另一邊,MiniMax 也得先提供一個基礎能力足夠、值得繼續訓練的底座。

少任何一邊,這件事都很難成立。

所以,應用公司開始往模型層走,並不意味著基礎模型公司的價值變小了。

反過來看,隻有底座足夠成熟,下游才敢把自己的業務、工程資源和用戶一起壓上去。

Genspark 把 M3 訓練成 PPT 模型,fal 和 FastVideo 沿著 H3 繼續往下改。它們解決的都不是 MiniMax 自己定義的問題,卻都在驗證同一件事:這個底座值不值得繼續開發。

所以以後評價 MiniMax,除了看 Benchmark、API 和自己的產品,我還會多看一個指標:

有多少公司,願意把自己的生意建在它的模型上。

下載一個模型很容易。

願意投入工程師、GPU 和真實用戶繼續往下做,難得多。

模型發布以後,還有多少人願意接著往下做,這件事比發布會上的掌聲難得多。

分享至:

作者:01Founder

本文為PANews入駐專欄作者的觀點,不代表PANews立場,不承擔法律責任。

文章及觀點也不構成投資意見

圖片來源:01Founder如有侵權,請聯絡作者刪除。

關注PANews官方賬號,一起穿越牛熊
PANews APP
趙長鵬回應「BNB Chain在DeFi TVL上已反超Solana」:距反超ETH還很遠
PANews 快訊