DC娱乐网

苹果新研究:打破偏见,GRPO不必只用英文

最近读到了来自 Apple、Hasso Plattner 研究所等机构的最新预印本论文 《GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings》 。

论文对非英文及多语言环境下的 GRPO / RLVR(基于可验证奖励的强化学习) 进行了大规模的系统性探究,结论非常具有实操参考价值 。

在 9 个模型、11 种训练语言上做 GRPO(Group Relative Policy Optimization)强化学习,比较“奖励英文推理”与“奖励按提示语言推理”。结论是:让模型用母语推理,并不必然付出巨大精度代价。

对训练中出现的语言,英文推理平均仍领先 1.3–4.1 个百分点,但此前常见的两位数落差并非必然;中文、日语、德语、法语的差距尤其较小。

更有价值的发现是跨语言迁移,只在一种语言上做 GRPO,提升常会迁移到其他语言;例如西班牙语训练对法语任务几乎追回直接法语训练的收益。

但“平均分变高”不等于没有风险:某些模型-语言组合会让未见过的英文内容任务或高难数学任务明显退化,斯瓦希里语、泰卢固语训练在部分 Qwen3 模型上尤其值得警惕。

多语种推理后训练不应只问“总分涨了吗”,还要问“哪种语言、哪类未见任务掉了吗”。

对做中文或全球化 Reasoning Model 的团队,它给出的工程建议很直接:母语 CoT 可以认真做,但训练语言、推理语言与评测语言也得一起设计。

如果你正在做大模型的 RL 强化学习、CoT 逻辑推理优化或多语言 Post-training,强烈推荐阅读这篇论文 !给大家上传附件了,有需要的自取哈~

#apple #论文 #大模型 #GRPO #RLVR #多语种推理 #ChainOfThought #强化学习 #中文大模型