Apple · ML Research

GRPO超越英语:GRPO在非英语及多语言环境下的大规模研究

GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings

二〇二六年八月十九日 · 英文原文

基于可验证奖励的强化学习(RLVR)经组相对策略优化(GRPO)优化,已成为提升预训练语言模型推理能力的核心方法,但现有研究以英语为中心。本研究针对多种基础模型、训练语言及不同推理语言奖励,开展大规模多语言和非英语GRPO实证研究。结果显示,母语推理训练与英语推理训练间的差距通常较小。

基于可验证奖励的强化学习(RLVR),通常通过组相对策略优化(GRPO)进行优化,已成为提升预训练语言模型推理能力的核心方法,但当前研究仍高度以英语为中心。我们针对多种基础模型、训练语言及不同推理语言奖励,开展了一项大规模的多语言和非英语GRPO实证研究。研究发现,以母语进行推理的训练与英语推理训练之间的差距往往很小。我们进一步观察到,……

译自 Apple · ML Research · 录于 二〇二六年八月十九日