超越视觉CoT:内化视觉思维实现主动视频推理
Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
摘要
多模态大语言模型采用视觉思维链(Visual CoT)进行空间、时间及具身环境推理,通过生成中间推理图像实现视觉预见,但带来显著推理开销,尤其影响主动视频推理。研究者提出内化视觉思考(IVT)后训练框架,联合优化文本预测与视觉推理过程,使模型在训练期间学习视觉思考,推理时直接输出结果,以降低开销。
多模态大语言模型越来越多地使用视觉思维链(Visual CoT)来推理空间、时间和具身环境。通过生成中间推理图像,Visual CoT 为视觉预见提供了一种直观机制,但引入了显著的推理开销,这对主动视频推理尤为不利。我们探讨模型是否能在训练期间学会视觉思考,同时在推理时直接进行推理。我们引入了内化视觉思考(IVT),一种联合优化文本预测和……的后训练框架。
译自 Apple · ML Research · 录于 二〇二六年八月二十五日