新闻中心

小米新推出MiMo-V2.6系列模型,创新工程挑战超越DeepSeek R1

datetime

2026-09-23

阅读数量

1993

小米公司于9月22日发布了其最新的MiMo-V2.6系列,包括高端推理模型MiMo-V2.6-Pro和更加注重效率的MiMo-V2.6-Flash。此外,还推出了MiMo-V2.6-Pro-UltraSpeed,声称在维持模型质量的同时,可以实现最高20倍于Pro版本的输出速度。MiMo-V2.6-Pro是一个拥有万亿参数的模型,能够处理文本、图像、视频和音频输入,具备100万Token的上下文长度和12.8万Token的最大输出长度。Flash版本则具有大约3090亿参数和150亿激活参数,同样支持100万Token的上下文。

小米的首席研究员罗福莉在9月17日通过社交媒体分享了MiMo-V2.6的训练过程,并实时更新了两款模型的训练数据,包括训练步数、Token消耗、任务通过率等,创造了一场面向全网的直播。根据计算显示,两轮训练的费用达到了347万美元,折合人民币约为2328万元。

在发布当天,罗福莉表示,MiMo-V2.6可能是迄今为止开源模型团队中计算量最大的单一强化学习运行,并称其为当前第一的开源模型。她鼓励大家阅读相关技术报告,并表示该模型的创新研究和工程挑战超越了她参与过的DeepSeek R1。 龙8头号玩家国际

小米并未专注于“更大模型”的发展,而是提出了《Scaling Reinforcement Learning Towards Self-Improvement》的技术报告,总结了在强化学习规模扩大的同时,作为模型自我改进的路径。初步结果显示,MiMo-V2.6完成了显著的技术跃升,Pro在人工智能评估指标上得分46.32,超越了多个竞争对手。

在各项基准测试中,Pro在DeepSWE v1.1中获得71.9分,在Toolathlon-verified中得到了76.9分。Pro是一个以稀疏MoE模型为基础的单一结构,同时采用了局部和全局注意力机制,以减少计算和显存压力。模型的多模态处理整合了文本、图像、视频和音频,使其工作在同一模型体系内而非独立运作。

在推理速度方面,MiMo-V2.6采用了多Token预测机制,加入了SWA结构的MTP推测解码器,能够在每次前向推理中同时生成多个Token。尽管小米承认MiMo-V2.6与顶级闭源模型仍有差距,但其性价比却相当出色,适应了日益复杂的任务需求。 龙8头号玩家国际

小米在此次训练中同时扩大了三个方面的规模,包括训练本身、样本的数量和尝试次数,以更好地应对复杂的推理能力挑战。