近日,MiniMax(稀宇科技)正式发布全模态生成模型MiniMax H3,支持对文本、图像、视频、声音组成的多模态上下文进行统一理解,并可生成具备原生双声道的音视频内容,最高支持15秒、2K分辨率的视频输出。据官方透露,MiniMax H3将在未来几天开放模型权重。

据了解,MiniMax H3面向广告、电商、品牌、产品设计、UI/UX、游戏等内容创作场景,可实现多模态内容的编辑与生成。官方公布的信息显示,该模型在指令遵循、文字及品牌信息呈现、视频到视频动作迁移(V2V Motion Transfer)等方面进行了优化。
技术层面,MiniMax H3此次新增Caption能力,并配备专属模型和全模态理解管线,大部分素材需要约100K Token进行推理,并最终压缩至约4K Token。此外,其2K视频输出并未采用传统超分模块,而是借助H3基础模型对低分辨率结果进行重新生成,以完成高分辨率视频输出。
近年来,MiniMax持续推进大模型能力的建设。此前在2025年,其发布并开源MiniMax-01系列模型,覆盖基础语言模型和视觉多模态模型,参数量高达4560亿,其中单次激活459亿。该模型的综合性能比肩海外顶尖模型,同时能够高效处理全球最长400万token的上下文,是GPT-4o的32倍,Claude-3.5-Sonnet的20倍。
随后MiniMax相继推出image-01图像生成模型、Hailuo 02视频生成模型、speech-02语音模型以及推理模型MiniMax-M1,进一步完善文本、图像、视频、语音等多模态产品的布局。
今年6月,MiniMax发布并开源推理模型MiniMax-M3,其基于自研MSA(MiniMax Sparse Attention)架构,可将上下文窗口扩展至1M级别,并在BrowseComp、SWE-Bench Pro等国际权威评测中达到前沿水平。作为原生多模态模型,M3重构了整个数据管线,从第零步开始多模态训练,使文本和视觉语义空间高度对齐。
【本文图片来自网络】
