Apple Machine Learning Research

RayRoPE: Projective Ray Positional Encoding for Multi-View Attention

8.5内容质量

TL;DR · AI 摘要

RayRoPE通过几何感知的位置编码提升多视图Transformer性能,LPIPS指标提升15%。

核心要点

  • RayRoPE使用射线预测点而非方向实现几何感知编码
  • 在CO3D任务中LPIPS指标相对提升15%
  • 支持RGB-D输入并提升性能

结构提纲

按章节快速跳转。

  1. 提出多视图Transformer位置编码的挑战与RayRoPE的解决方案

  2. 基于射线预测点的几何感知编码机制设计

  3. SE(3)不变性实现

    通过投影坐标计算多频相似性实现旋转平移不变性

  4. 在新视角合成和立体深度估计任务中验证性能提升

  5. CO3D数据集LPIPS指标相对提升15%

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • RayRoPE方法
    • 核心创新
      • 几何感知编码
      • SE(3)不变性实现
      • 不确定性处理
    • 实验验证
      • 新视角合成
      • 立体深度估计
      • RGB-D输入支持

金句 / Highlights

值得收藏与分享的关键句。

#Computer Vision#Transformer#Positional Encoding#ECCV
打开原文

RayRoPE:面向多视角注意力的投影射线位置编码 - Apple 机器学习研究

研究领域

计算机视觉

会议

ECCV

内容类型

论文

发表时间

2026年7月

RayRoPE:面向多视角注意力的投影射线位置编码

作者 Yu Wu†, Minsik Jeon†, Jen-Hao Rick Chang, Oncel Tuzel, Shubham Tulsianiâ€

查看出版物

复制Bibtex

我们研究用于处理一组姿态输入图像中令牌的多视角Transformer的位置编码,寻求一种能够唯一编码补丁、实现具有多频率相似性的SE(3)不变注意力,并能适应底层场景几何结构的机制。我们发现现有(绝对或相对)多视角注意力编码方案无法满足上述需求,因此提出RayRoPE来弥补这一缺陷。RayRoPE基于关联射线表示补丁位置,但采用射线上预测的点而非方向进行几何感知编码。为实现SE(3)不变性,RayRoPE计算查询帧投影坐标以实现多频率相似性。最后,由于射线上预测的3D点可能不够精确,RayRoPE提出在不确定性下解析计算预期位置编码的机制。我们在新视角合成和立体深度估计任务中验证了RayRoPE,结果表明其在替代方案上持续改进(例如在CO3D数据集上LPIPS指标相对提升15%)。我们还证明RayRoPE可以无缝融合RGB-D输入,相较于无法对这类信息进行位置编码的替代方案,能实现更显著的性能提升。

  • †卡内基梅隆大学

相关阅读与更新

基于长时程声学编码的分段注意力解码

2026年7月6日 研究领域 方法与算法 , 研究领域 语音与自然语言处理 会议 Interspeech

我们解决基于注意力的编码器-解码器(AED)模型与长时程声学编码之间的根本性不兼容问题。在分割语句上训练的AED模型通过利用分割边界之外的有限声学上下文来学习编码绝对帧位置,但在解码长时程片段时,当这些线索消失时会失败。由于键的排列不变性,模型会失去对声学编码的排序能力……

阅读更多

基于有限物理视角的高保真3D重建

2021年11月29日 研究领域 计算机视觉 会议 3DV

在已知校准和足够视角的情况下,多视角三角化是基于二维对应关系进行3D重建的黄金标准。然而在实践中,为了获得现代应用所需的高保真3D重建,需要昂贵的多视角设置——有时涉及数十甚至数百台相机。在本研究中,我们提出了一种新方法,利用神经形状先验的最新进展,在2D-3D提升中实现更高效的重建……

发现机器学习领域的机遇

我们的机器学习研究每天都在取得突破性进展。

加入我们