H3 已经足够强,为什么我们还需要 MiniMax Design?
作者|Cynthia
编辑|靖宇
7 月 31 日,MiniMax H3 发布当天,我们就做了实测。
屏幕上的进度指示走到尽头,一段最高 2K 分辨率的视频出现在屏幕:画面、运动、声音被协调地装在同一个结果里。无论流畅度、画面精细程度,还是后期的视频修改操作便捷度,这无疑都是当前行业的 SOTA 级模型。
榜单成果也验证了我们的猜想。截至 8 月中旬,Artificial Analysis 的视频编辑榜上,H3 位列第一;在文生视频与图生视频榜单中,它同样处于第一梯队,全球前三。模型发布的同一时间,MiniMax 还顺便官宣了 H3 加量不加价,定价仅为同级别产品的三分之一,每秒 8 毛,一杯奶茶钱,就能完成一轮视频素材的 A/B/C 测试。
然后,新的问题来了:模型生成质量越来越高,成本越来越低,老板们想要一周发它个七八十条视频的宏伟商业构想也开始变得势不可挡。
但老板们似乎忘记了,写一条视频片段的提示词,仍需要老师傅非遗式古法手敲几千字;要保证片段间的风格一致性,也依然需要手动抽卡,赛博祈愿模型能够稳定发挥。
这部分真正费时费力的地方,效率并没有提升。
于是,仅仅过了 4 天,8 月 3 日,贴心的 MiniMax 就宣布 MiniMax Hub 产品升级为 MiniMax Design,并开始小范围内测。
这下,左手是 SOTA 级视频模型,右手是与模型深度结合的 Agent 产品,MiniMax 想成为视频领域 Claude Code 的野心,已经彻底藏不住了。
01
MiniMax H3,
如何靠三段式架构设计成为后期任务之王?
Minimax H3 到底有多厉害?说一个例子你就懂了。
H3 刚一发布,字节剪映海外版 CapCut, 就迅速接入上线了,甚至还煞有介事地发了一条 X 官宣,生怕用户错过来一次对家生态的好东西。
不仅是视频质量没得说,在视觉包装与后期特效方面,Minimax H3 的表现堪称独树一帜。
比如这里,在 H3 已经生成了一段动画电影版奶牛猫+环尾狐猴打魁地奇的视频后,我突发奇想,把画面中的奶牛猫换成奶牛,并且生成一段米高梅风格带字体特效的狐猴怒吼片头。
H3 不仅理解到了其他任何元素不变的潜台词,甚至还贴心地考虑到了片头与视频正片里的狐猴应当保持一致的细节,修改的效果如下:
