作者:Max,01Founder
编辑|Max
前几天,著名外宾AI应用 Genspark 干了一件以前不太像它会干的事。
它开始自己训模型了。
9 月 10 日,Genspark 发布了一个专门做 PPT 的模型 Gen-1 Slides。底座是 MiniMax M3,训练这件事则找了 Fireworks 一起做。
现在,这个模型已经成了 Genspark AI Slides 标准模式的默认选项。
Genspark 过去一直是很典型的 AI 应用公司。
模型是谁家的不重要,谁好用就用谁。
今天 Claude Opus 4.8强一点,就多调一点 Claude;明天GPT-5.6更便宜,就重新把请求都切过去。
应用公司最擅长的事情,本来就是不对模型公司产生感情。
所以看到 Genspark 自己下场训练模型,我停了一下。
因为这已经不是这个 API 好不好用的问题了。
调 API 不好用,最多改个配置。
自己训练,先得交 GPU 的钱。
行业里夸模型的人很多。
愿意为了这句夸奖,自己买单继续训练的人,就没那么多了。
这也是我后来重新去看 MiniMax 的原因。
PART.01、开源模型准备好了
先说 Genspark 为什么选 M3。
现在开放模型很多,甚至有些模型在榜单上的成绩比 M3 更好。
但还有一个前提:
现在这批开放模型,本身已经跨过了可用线。
放在前几年,应用公司拿到权重以后,可能还得先补 Coding、Agent、长任务这些基础能力。
现在像 M3 这样的模型,底子已经够用了,应用团队才有资格把资源集中到自己的业务上。
但对一家准备继续做后训练的应用公司来说,选基座模型并不是简单从排行榜第一名往下挑。
Genspark 做的是 PPT。
一份复杂 PPT,要读很长的参考资料,规划页面,写代码,调用工具渲染,再自己检查和修改,跑几十轮很正常。
所以它需要的底座,最好同时具备原生多模态、长上下文、不错的Coding和Agent能力,而且还得开放权重。
M3 基本把这些条件凑齐了。
但我觉得还有一个很现实的原因:
它的模型大小也刚刚好。
M3 大约有 428B 总参数,每个 Token 激活约 23B。
400 多 B 当然不能叫小模型,但放在今天前沿的开放模型里,又没有大到完全脱离应用公司的训练和部署范围。
市面上确实还有一些跑分更高的模型,但模型越大,后面强化学习、部署、推理、持续迭代的成本都会跟着上去。
对模型公司来说,可能更关心谁是最强的。
但对应用公司来说,选基座模型不是找最聪明的那个,而是在能力、成本和可训练性之间,找性价比最高的那个。
能力已经足够覆盖自己的任务,模型规模又没有大到让后训练失去商业意义。
所以 Genspark 选 M3,我觉得本质上 M3 是在这个区间里找到了一个平衡点。
Genspark 自己也说,因为有 M3 这样的开放底座,他们才能直接跳过预训练,把预算花在 Slides 这件事上。
这句话其实把事情说得很清楚。
应用公司真正需要的,不是再造一个最强基础模型。
而是找到一个已经足够好的模型,然后把有限的钱和工程资源,花在自己真正懂的业务上。
PART.02、为什么要训模型
但有一个合适的底座,不代表 Genspark 就一定要自己训。
真正的问题是这件事值不值得。
答案首先藏在 Genspark 自己的调用规模里。
Fireworks 披露,Genspark Slides 每个月消耗的 Token 已经超过 1 万亿。
到了这个量级,模型成本就不再只是技术团队关心的事情了。
哪怕每百万 Token 只便宜一点,乘上每月上万亿 Token 的消耗,最后都会变成一笔很具体的成本。
所以 Genspark 真正要算的是:如果把最常用、最稳定的一部分任务自己做专项训练,能不能把效果留下来,同时把成本压下去。
他们做了一组测试。
Gen-1 Slides 完成一份 PPT,平均模型调用成本是 0.44 美元。
而用之前行业主力模型 Opus 5 的成本是 4.16 美元。
这是接近十倍差距。
这时候,Genspark 为什么愿意自己训,就比较容易理解了。
更重要的是,成本降下来以后,效果并没有明显打折。
Gen-1 Slides 的平均评分是 4.25,略高于 Opus 5 的 4.23;下载率也达到 33.1%,高于后者的 31.5%。
这时候,Genspark 为什么愿意自己训,就比较容易理解了。
它不需要做一个全面超过所有通用模型的新模型。
它只需要在 PPT 这件高频、稳定、自己又足够熟悉的任务上,做出一个更合适的版本。
效果够好,成本能降,而且还能围绕自己的产品继续迭代,这笔账就开始成立。
PART.03、为什么能训模型
训练过程中,Genspark 遇到过一个很典型的问题。
他们不希望 PPT 里的文字溢出,于是给模型设计了一条规则:文字超过页面边界,就扣分。
模型训练一段时间以后,很快找到了解法:
把字体缩小。
从评测器来看,问题解决得非常漂亮。
文字确实没有溢出。
只是用户也快看不见了。
这个例子其实刚好解释了,为什么 Genspark 这种应用公司有必要自己参与模型训练。
因为模型公司可以把模型训练得很聪明,却很难替每一个应用定义:到底什么叫把活干好了。
对于 PPT 来说,没有文字溢出只是一个指标。
真正交到用户手里,还要考虑字号能不能看清、信息密度是不是合适、页面结构顺不顺、用户会不会拿到结果以后又自己重做一遍。
这些东西没有一个通用 Benchmark 能完全告诉你。
它们来自产品每天和真实用户打交道。
Genspark 做了这么久 Slides,它手里真正值钱的,不只是调用量,还有大量关于什么结果用户会接受的经验。
哪些错误用户最敏感,哪些问题可以忍,哪些页面看起来没报错但根本不能交付,这些判断,模型公司很难凭空获得。
以前,这些经验主要被用来改 Prompt、改 Workflow、改产品。
现在多了一条路:
把它们变成 Reward、评测器和训练数据,直接参与模型本身的调整。
这也是 Genspark 能参与这次训练的原因。
MiniMax 负责把 M3 的通用能力做好,Fireworks 负责把训练工程跑通,而 Genspark 手里有另一类东西:
真实用户,以及这些年做 PPT 积累下来的产品判断。
它最清楚什么样的 PPT 用户愿意留下,哪些错误会让人直接重做,哪些页面看起来没报错,实际上根本没法交付。
这些东西,模型公司很难凭空知道。
所以应用公司开始训模型,不是因为它们突然更会训练一个通用模型了。
而是当开源基模的能力过线以后,它们终于可以把原本停留在产品层的经验,继续往模型里压。
说到底,Genspark 不需要比 MiniMax 更懂模型。
它只需要比 MiniMax 更懂 PPT 这门生意。
PART.04、不只是文本模型
看到 Genspark 这次拿 M3 去做后训练,我突然想起了一个月前的 H3。
8 月 3 日,MiniMax H3 正式开放权重。
这是一个可以同时理解文本、图片、视频和音频的通用视频模型,能生成最长 15 秒、最高 2K、带原生立体声音频的视频。
然后社区很快就热闹起来了。
H3 开放权重当天,ComfyUI 就做了 Day-0 支持。官方甚至专门写了一篇博客,介绍怎么把 H3 跑在本地消费级显卡上。
接下来的事情就很有互联网开源社区的味道了。
有人嫌 15 秒不够长,就自己写 ComfyUI 节点,把 H3 一段一段接起来,做长视频和多镜头连续生成。
还有人纯粹拿它玩梗。H3 开源当天,Stable Diffusion 社区里就有人用本地 ComfyUI 做各种文字生成视频,光一个帖子就拿了几百个赞。下面讨论的已经不是这个模型能不能跑,而是还能拿它干什么。
再往后,事情开始从网友玩模型变成公司改模型。
8 月 26 日,fal 发布了 H3 Max,直接在 H3 的开放权重上继续后训练,加入新的训练数据,重点优化提示词遵循、画面审美和推理速度。
fal 给出的数据里,5 秒视频可以在不到 3 秒里生成。
FastVideo 则往另一个方向走,做了 FastH3,用四步蒸馏和稀疏注意力去压推理成本和生成时间。
甚至还有研究团队把 H3 改成了一个可以用键盘控制的交互式世界模型 H3-World。
他们只训练了大约 0.2% 的骨干参数,就让视频模型开始响应玩家动作。
所以看到 Genspark 这次做 Gen-1 Slides,我再回头看 H3 开源之后发生的那些事情,感觉就不太一样了。
当时大家看到的是热闹。
有人拿 H3 做广告,有人做长视频,有人优化推理速度,还有人干脆把它往世界模型上改。
但现在回头看,这些项目其实都在做同一件事:
把一个开源通用模型,继续往自己的具体问题上推。
MiniMax 可以把 H3 的基础能力做好,但它不可能同时知道,广告团队最在意什么,视频平台最想压哪一部分成本,做交互世界的人又需要什么样的响应能力。
这些问题,反而是下游最清楚。
Genspark 也是一样。
它不需要比 MiniMax 更懂怎么训练一个通用模型,它只需要比 MiniMax 更懂 PPT 用户。
fal 也不需要重新造一个视频模型,它只需要知道自己的推理系统和客户,到底还缺什么。
所以开放权重真正改变的,不只是大家都可以下载模型。
它其实重新分了一部分研发工作。
基础模型公司负责把通用能力做到足够高,下游公司负责把它继续训练成更适合自己业务的东西。
这样一来,MiniMax 不需要自己提前猜中所有应用场景。
模型放出去以后,外面的公司会带着自己的数据、用户和问题,继续往不同方向走。
有些方向 MiniMax 自己可能根本不会做。
但只要底座足够好,这些探索仍然可以从它这里开始。
我觉得这才是 H3 开源之后那阵狂欢更值得看的地方。
表面上是大家在玩同一个模型。
实际上,是很多团队开始替这个模型寻找不同的去处。
PART.05、对MiniMax的价值是什么
但开放权重还有一个绕不开的问题:
这些下游的探索,最后和 MiniMax 自己有什么关系?
前面讲 H3 的时候,其实已经能看到第一层价值。
MiniMax 不需要自己去研究广告、长视频、世界模型或者 PPT。模型放出去以后,下游会带着自己的数据、用户和业务问题,替这个底座不断试新的方向。
有人做成了,就等于又多了一个案例,告诉市场:这个模型不只是 Benchmark 上能跑,它真的可以被拿去做产品。
这种价值未必马上出现在收入里,但会影响下一批开发者的选型。
而 MiniMax 显然也没有把后面的商业关系完全放掉。
我后来去翻了 M3 的 License,发现它并不是权重一开,后面随便用。
M3 使用的是自己的社区许可。
协议里明确写到,基于 M3 做后训练、微调之后形成的商业部署,依然属于商业使用;如果相关产品和服务的年收入超过 2000 万美元,需要再取得 MiniMax 的单独书面授权。
这套设计其实挺容易理解。
前期先把模型开放出来,让更多团队愿意尝试。谁适合拿它做什么,不需要 MiniMax 自己提前猜完。
如果一个项目最后只是实验,社区至少替它探索了一个方向。
如果真的跑成了一门生意,双方又有机会重新建立商业关系。
所以开放权重并不等于 MiniMax 把后面的价值全部让掉了。
它更像是先把开发边界打开,让更多人帮它把模型带进不同场景;等某些场景真正长大以后,再通过授权、API 或其他服务把关系接回来。
现在 Comfy 已经在公开销售 MiniMax 模型的商业许可,Professional 档从每月 5000 美元起。
当然,这里面有个先后顺序不能搞反。
不是因为 License 写得聪明,所以开发者会来。
还是得先有一个足够好的模型,才会有人愿意下载、继续训练,甚至把自己的产品押在它上面。
License 能做的,只是在模型已经创造价值以后,让其中一部分价值有机会再回到 MiniMax。
这样看,开源本身不是商业模式。
它更像是在扩大模型能够抵达的地方。
而商业模式,要等这些地方真的长出东西以后,才开始有意义。
PART.06、核心是有多少人愿意用你
过去评价一个基础模型,最常看的还是 Benchmark。
数学多少分,Coding 排第几,Agent 榜单有没有涨,这些当然重要。
但对 MiniMax 来说,现在还可以多看一个指标:
有多少团队,愿意拿它的模型继续训练,并真正放进自己的业务里。
这比下载一次模型重得多。
因为一旦决定做后训练,就意味着团队愿意投入工程师、算力、时间,还要把自己的任务环境和评价体系接进去,最后拿真实用户来检验结果。
没人会为了证明开源生态很繁荣,主动烧一笔算不过来的钱。
所以 Genspark 选择 M3,本身就是一次很实际的验证。
Genspark 有足够大的业务规模,也有长期积累下来的 PPT 产品经验;但另一边,MiniMax 也得先提供一个基础能力足够、值得继续训练的底座。
少任何一边,这件事都很难成立。
所以,应用公司开始往模型层走,并不意味着基础模型公司的价值变小了。
反过来看,只有底座足够成熟,下游才敢把自己的业务、工程资源和用户一起压上去。
Genspark 把 M3 训练成 PPT 模型,fal 和 FastVideo 沿着 H3 继续往下改。它们解决的都不是 MiniMax 自己定义的问题,却都在验证同一件事:这个底座值不值得继续开发。
所以以后评价 MiniMax,除了看 Benchmark、API 和自己的产品,我还会多看一个指标:
有多少公司,愿意把自己的生意建在它的模型上。
下载一个模型很容易。
愿意投入工程师、GPU 和真实用户继续往下做,难得多。
模型发布以后,还有多少人愿意接着往下做,这件事比发布会上的掌声难得多。



