8月3日,多家媒体援引智东西等信源称,MiniMax开源新一代通用视频生成模型H3。与常见的「画面生成后再配乐」不同,H3直接产出最长15秒、最高2K分辨率、并带原生立体声音频的视频,在Artificial Analysis有声视频编辑(Audio-Bearing Video Editing)榜单上以1130分Elo位居首位。更值得注意的是生态侧:华为昇腾、摩尔线程、沐曦等16家国产芯片及平台厂商在发布首日即完成适配,模型同步在Hugging Face开放下载。这意味着视频生成这条赛道,正从「谁的画面更真」快进到「谁的音画一体、谁能被国产算力跑起来」。
一、H3的能力坐标:原生立体声是差异点
视频生成模型过去两年的军备竞赛,多半围绕分辨率、时长、动作连贯与文本对齐展开,音频往往作为事后补救措施——要么静音,要么用单独的TTS或配乐模型贴上去,常出现「嘴型对不上、环境音缺失、立体声位错乱」的割裂感。H3的卖点是「原生立体声音频」:声音不是后期拼接,而是与画面在同一生成过程中一并产出,理论上更能保证声画同步、空间感一致与情境贴合。15秒时长与2K分辨率在当下属于主流偏上的规格,而把「有声」做成生成的一等公民,恰好踩中了短视频、广告、影视预可视化等真实生产场景的痛点——这些场景要的不是无声片段,而是能直接用的成片素材。
二、榜单登顶与开源:把「最强」变成「可用」
Artificial Analysis的有声视频编辑榜单以Elo评分衡量模型在带音频视频生成上的综合表现,H3以1130分登顶,是其能力被第三方评测认可的标志。但比登顶更关键的是「开源」:模型已在Hugging Face开放下载,意味着开发者、创作者与研究机构可以本地部署、二次训练、接入自有工作流,而不必受限于闭源API的配额、价格与合规边界。对视频生成这类对算力与数据高度敏感的方向而言,开源往往是生态爆发的前置条件——更多人在上面做工具、做插件、做微调,模型的真实使用面才会铺开。MiniMax在视频模型上的连续投入,也显示其把多模态内容生产作为核心阵地。
三、16家国产芯片首日适配:国产算力闭环的信号
H3发布首日,华为昇腾、摩尔线程、沐曦等16家芯片及平台厂商完成适配,这件事的信号价值不亚于模型本身。过去国产视频模型的一大落地障碍,是「模型强、但能跑的国产卡少、适配慢」,导致先进模型要么依赖进口算力、要么在国产硬件上性能打折。16家厂商同日适配,说明国内「模型—芯片—平台」的协同正在提速:模型方在发布节点就拉通算力伙伴,把「能在国产硬件上跑起来」作为发布的一部分而非事后补救。对关注供应链安全与成本可控的国内企业与机构而言,一个开源、登顶且国产算力即日可跑的视频模型,降低了把生成式视频引入生产的门槛。
四、客观看:视频生成的拐点与未解项
价值在于,H3把「音画一体生成+开源+国产算力即日适配」三件事打包呈现,为AIGC视频从演示走向生产提供了一条更顺滑的路径,也把国内视频模型的竞争维度从单看画面拉到了「声画、生态与算力」的综合比拼。但边界需如实说明:其一,15秒时长仍偏短,长视频的连贯性、叙事一致性与成本,尚未由H3回答;其二,Elo榜单登顶反映的是评测集上的综合表现,真实创作场景的可用性还要看细节保真、版权与可控编辑等工程问题;其三,开源模型的商业使用边界、训练数据合规与生成内容的版权责任,仍是行业共性议题,需以官方许可与属地法规为准。H3是一记响亮的开场,而视频生成要真正替代部分人工产线,仍需在时长、可控性、成本与合规上继续交出答卷。