小米大模型6天训练烧掉347万美元 罗福莉在发文中将问题归结为“强化学习究竟能扩展到多远”。她表示,强化学习是模型自我提升路径中可扩展性较强的方向之一。小米将本次发布定义为探索RSI(递归自我改进)路径的关键一步。Desktop桌面客户端正式版,后者同步推出会员订阅方案。
据小米方面披露,本轮强化学习的后训练耗时不到六天,Pro版本训练成本约262万美元,Flash版本约85万美元,各完成30步,累计约75万条轨迹。罗福莉在发文中称,这六天背后,是长达半年的基础研究积累和工程试错。训练中途,公开页面显示的数据是另一个量级。9月17日下午,两个版本累计成本已超过135万美元,每小时成本约3.1万美元。
成本曲线之外,页面同时披露了训练配置。罗福莉介绍,本次训练从三个方面扩展规模:算力上,采用大Batch与全异步架构,单次更新使用1568个样本,支持百万级上下文长度训练,单步训练Token达2.7B至3.7B;环境与工具上,构建覆盖代码、通用、视觉、安全等方向的多任务训练体系,并混合多个Harness框架运行;评估计算上,通过组内相对比较,为长程任务提供更精准、多样的奖励信号。
结果显示,训练任务平均通过率分别相对提升25%和12%。在样本外的长程软件工程评测基准DeepSWE v1.1中,Flash版本得分由48.8升至65.68,Pro版本由58.4升至72.57。罗福莉称,MiMo-V2.6可能是目前国产开源模型中投入算力最多的模型之一。
投行测算提供了另一个观察角度。高盛研报称,按avg罗福莉在发文中将问题归结为“强化学习究竟能扩展到多远”。她表示,强化学习是模型自我提升路径中可扩展性较强的方向之一。小米将本次发布定义为探索RSI(递归自我改进)路径的关键一步。(21世纪经济报道)
