首页 / 资讯详情

MiniMax,做视频领域的 Claude Code 的野心已经藏不住了

极客公园 2026-08-21 10:58 中文

摘要

作者|Cynthia 编辑|靖宇 7 月 31 日,MiniMax H3 发布当天,我们就做了实测。 屏幕上的进度指示走到尽头,一段最高 2K 分辨率的视频出现在屏幕:画面、运动、声音被协调地装在同一个结果里。无论流畅度、画面精细程度,还是后期的视频修改操作便捷度,这无疑都是当前行业的 SOTA 级模型。 榜单成果也验证了我们的猜想。截至 8 月中旬,Artificial Analysis 的视频编辑榜上,H3 位列第一;在文生视频与图生视频榜单中,它同样处于第一梯队,全球前三。模型发布的同一时间,MiniMax 还顺便官宣了 H3 加量不加价,定价仅为同级别产品的三分之一,每秒 8 毛,一杯奶茶钱,就能完成一轮视频素材的 A/B/C 测试。 然后,新的问题来了:模型生成质量越来越高,成本越来越低,老板们想要一周发它个七八十条视频的宏伟商业构想也开始变得势不可挡。 但老板们似乎忘记了,写一条视频片段的提示词,仍需要老师傅非遗式古法手敲几千字;要保证片段间的风格一致性,也依然需要手动抽卡,赛博祈愿模型能够稳定发挥。 这部分真正费时费力的地方,效率并没有提升。 于是,仅仅过了 4 天,8 月 3 日,贴心的 MiniMax 就宣布 MiniMax Hub 产品升级为 MiniMax Design,并开始小范围内测。 这下,左手是 SOTA 级视频模型,右手是与模型深度结合的 Agent 产品,MiniMax 想成为视频领域 Claude Code 的野心,已经彻底藏不住了。 01 MiniMax H3, 如何靠三段式架构设计成为后期任务之王? Minimax H3 到底有多厉害?说一个例子你就懂了。 H3 刚一发布,字节剪映海外版 CapCut, 就迅速接入上线了,甚至还煞有介事地发了一条 X 官宣,生怕用户错过来一次对家生态的好东西。 不仅是视频质量没得说,在视觉包装与后期特效方面,Minimax H3 的表现堪称独树一帜。 比如这里,在 H3 已经生成了一段动画电影版奶牛猫+环尾狐猴打魁地奇的视频后,我突发奇想,把画面中的奶牛猫换成奶牛,并且生成一段米高梅风格带字体特效的狐猴怒吼片头。 H3 不仅理解到了其他任何元素不变的潜台词,甚至还贴心地考虑到了片头与视频正片里的狐猴应当保持一致的细节,修改的效果如下: 更进一步深挖,则会发现这种精细的后期能力与指令理解能力,其实离不开 MiniMax H3 的三段式模型构建。 如果把大多数视频生成模型想象成一台黑盒,它们的工作逻辑大致可以理解成:Prompt 输进去,视频出来,至于中间模型究竟如何理解 Prompt,最终又会产出怎样的成果,整个过程的可控性并不算高。 于是,抽卡也成为了相当长一段时间里关于 AI 视频生成的关键词。 而 H3 的不同之处就在于,通过三段式架构设计,它让这个黑盒变得更加可控。在这个架构中,第一段是 H3-Context-IR,负责语义理解与任务编排;第二段是 330 亿参数的 H3-Base,负责视频内容生成;第三段 H3-Regenerate-2K,则主要负责高分辨率重生成。 这其中,在生成上起到决定性作用的是 H3-Base。 但理解能力的进步也同样功不可没。独立的 Context-IR 模块,在 H3 中的作用类似于一个导播台。借助它,用户可以一次上传 9 张图 +3 段视频 +3 段音频作为上下文,然后由它来负责理解复杂多模态输入之间的关系,并把用户到底想干什么翻译成模型可执行的结构化指令。 从此,即使是视频小白,在完全不知道什么叫伦勃朗光,什么叫正反打,什

阅读原文(极客公园)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。