8月7日晚,MiniMax H3团队来到Reddit的r/StableDiffusion社区举行了一场AMA,针对开放权重之后开发者最关心的几个问题给出官方答复。参与交流的包括H3研究负责人、多位研究员、系统工程师以及开发者关系负责人,讨论覆盖模型架构与训练、视频生成、参考生成、推理优化以及未来计划,帖子最终累积超过300条评论。从提问分布看,社区关注的重心已经从"H3在某个榜单上超过了谁",转向2K能否本地跑、稀疏注意力何时开放、有没有低步数版本这类落地细节——对开放权重模型来说,放出权重只是第一步。

一、2K不是超分:再生成检查点将开放
社区最集中的问题首先指向H3的2K能力。发布时,MiniMax把2K输出背后的方案称为In-context Regeneration(上下文内再生成),它没有走视频模型常见的独立超分路线,而是让模型结合原有的多模态上下文,对低分辨率结果再次生成高分辨率版本,目的是让模型重新"生成"文字与纹理,而不是从低分辨率像素里猜细节。
问题在于,开放权重后社区拿到的版本还无法完整复现线上2K效果。对于"用于最终2K输出的模型会不会发布",官方答复很简短:会,而且不会太久。研究员补充了技术解释:H3-Regenerate-2K本质上是第二阶段的条件生成过程,并不是把已发布的Base检查点再跑一遍,更不是传统意义上的Upscaler,而是使用了一个面向更高目标分辨率的潜空间DiT再生成检查点,基础模型此前生成的内容会作为额外上下文输入。
二、稀疏注意力与低步数版本:先保质量再谈提速
第二个高频问题是速度和显存。H3在训练后期已使用稀疏注意力,但目前开放版本仍以全注意力推理,随着分辨率和时长提高,显存开销会快速膨胀。团队明确回应,H3没有沿用文本模型上的MSA,而是采用更接近MoBA风格的块选择方案:利用相邻视觉Token高度相关的特性,对一组Token做均值池化得到块表示,再判断哪些块更重要,从而减少不必要的注意力计算,且不需要额外训练索引器。目前该方案只对视频Token做了三维稀疏化。
MiniMax表示,计划近期给社区提供一个相对保守的稀疏注意力参考实现,第一目标不是夸张的加速数字,而是没有可感知的质量损失。至于官方4步或8步版本,团队称正在积极考虑,但暂时无法承诺时间表。这与社区现状形成反差:第三方Turbo LoRA已迅速出现,甚至有4步预览版,但测试中人体结构、运动质量乃至音频都出现明显退化。不急着宣布"4步H3",问题不是做不到,而是加速与质量损失之间的账要先算清楚。
三、图像模型在路上,许可证或转向Apache-2.0
AMA后半程出现了一个此前没有披露的信息。不少开发者发现H3本身已隐约具备图像生成和编辑能力,社区甚至摸索出让H3只生成5帧视频、再取第一帧当作文生图使用的取巧办法。团队透露,正在从H3谱系中的共同祖先模型出发,派生一个专门的图像生成模型,目前处于训练后阶段的完善与优化中,该模型会沿用H3的VAE编码器架构。
团队也划出了能力边界:H3并非流式视频生成模型,无法先生成"预览首帧"再在同一次生成中无缝续成视频;建议工作流是先用图像模型生成首帧,再交给H3的图生视频模式。此外,官方承认参考生成画质弱于图生视频与后训练策略差异有关,远景小主体容易"融化"也是待改进的系统级问题。
关于开放策略,面对"未来模型是否继续开源"的提问,团队回复"希望一直开放到AGI到来"。许可证方面,H3目前并未采用Apache-2.0或MIT,官方称随着版权文件处理完成、法律环境进一步清晰,会考虑采用Apache-2.0协议。


