RL微调VLM的鲁棒性与思维链一致性研究
On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs
摘要
强化学习(RL)微调被用于增强大型语言模型(LLM)在推理密集型任务上的表现,并扩展至视觉语言模型(VLM)。实验表明,经RL微调的VLM在视觉推理benchmark上虽有提升,但仍易受弱视觉锚定、幻觉及过度依赖文本线索的影响。通过引入误导性标题或错误思维链(CoT)轨迹等简单文本扰动,模型鲁棒性和置信度显著下降,且CoT一致性降低时影响加剧。
强化学习(RL)微调已成为在推理密集型任务上增强大型语言模型(LLM)的关键技术,并推动其向视觉语言模型(VLM)扩展。尽管经过RL微调的VLM在视觉推理基准上有所提升,但它们仍然容易受到弱视觉锚定、幻觉以及过度依赖文本线索的影响。我们证明,简单且受控的文本扰动——误导性标题或错误的思维链(CoT)轨迹——会导致鲁棒性和置信度大幅下降,并且当CoT一致性……时,这些影响更为显著。
译自 Apple · ML Research · 录于 二〇二六年七月三日