观点网讯:小米MiMo团队负责人罗福莉在X平台发文,首次公开小米新模型MiMo-V2.6的强化学习训练进展。
罗福莉表示,过去近半年团队一直围绕强化学习还能扩展到什么程度这一问题展开研究。目前MiMo-V2.6正处于强化学习训练过程中,团队正在扩大三个方向的规模,包括计算资源、训练环境与任务体系,以及奖励评估机制。
罗福莉同时分享了MiMo-V2.6的实时训练页面。从页面来看,MiMo-V2.6当前正在进行一次大规模Agent强化学习实验,页面展示了模型训练进度、Token消耗、训练成本、样本数量以及多个内部指标变化。
训练页面中包含两个版本,分别是MiMo-V2.6-Pro和MiMo-V2.6-Flash。其中,MiMo-V2.6-Pro当前处于step 12阶段,累计训练样本达到约301K,训练成本约80.63万美元,累计消耗Token达到25.1B。
MiMo-V2.6-Flash当前处于step 17阶段,累计训练样本达到约426K,训练成本约35.45万美元,累计消耗Token达到40.5B。
两个版本当前累计训练成本已经超过116万美元,平均每小时计算成本约达到3.09万美元(折合人民币20.72万元)。
罗福莉公开的训练页面还显示,MiMo-V2.6-Pro当前平均上下文长度已经接近10万Token,Flash版本也超过这一规模。
未来几周,小米MiMo团队将陆续公开更多技术细节。
免责声明:本文内容与数据由观点根据公开信息整理,不构成投资建议,使用前请核实。
【免责声明】本文仅代表作者本人观点,与和讯网无关。和讯网站对文中陈述、观点判断保持中立,不对所包含内容的准确性、可靠性或完整性提供任何明示或暗示的保证。请读者仅作参考,并请自行承担全部责任。邮箱:zbb@staff.hexun.com
最新评论