Apple · ML Research

RayRoPE:用于多视角注意力的投影射线位置编码

RayRoPE: Projective Ray Positional Encoding for Multi-View Attention

二〇二六年七月二十一日 · 英文原文

本研究提出RayRoPE,一种用于多视角Transformer的位置编码机制。该机制通过关联射线表示图像块位置,并利用沿射线预测的点而非方向进行编码,以唯一标识图像块、支持SE(3)不变注意力并自适应场景几何结构。实验表明,先前绝对或相对编码方案无法满足上述需求,RayRoPE填补了这一空白。

我们研究用于处理一组带位姿输入图像中token的多视角Transformer的位置编码,并寻求一种机制:能唯一编码图像块,支持具有多频相似性的SE(3)不变注意力,并能自适应底层场景的几何结构。我们发现,先前的多视角注意力编码方案(绝对或相对)无法满足上述需求,因此提出RayRoPE以填补这一空白。RayRoPE基于关联射线表示图像块位置,但利用沿射线预测的点而非方向来……

译自 Apple · ML Research · 录于 二〇二六年七月二十一日