RayRoPE: Projective Ray Positional Encoding for Multi-View Attention
TL;DR · AI 摘要
RayRoPE通过几何感知的位置编码提升多视图Transformer性能,LPIPS指标提升15%。
核心要点
- RayRoPE使用射线预测点而非方向实现几何感知编码
- 在CO3D任务中LPIPS指标相对提升15%
- 支持RGB-D输入并提升性能
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- RayRoPE方法
- 核心创新
- 几何感知编码
- SE(3)不变性实现
- 不确定性处理
- 实验验证
- 新视角合成
- 立体深度估计
- RGB-D输入支持
金句 / Highlights
值得收藏与分享的关键句。
RayRoPE通过预测射线上的3D点而非方向实现更精确的几何编码
SE(3)不变性通过查询帧投影坐标计算多频相似性实现
在CO3D任务中LPIPS指标相对提升15%,RGB-D输入带来更大增益
RayRoPE:面向多视角注意力的投影射线位置编码 - Apple 机器学习研究
研究领域
计算机视觉
会议
ECCV
内容类型
论文
发表时间
2026年7月
RayRoPE:面向多视角注意力的投影射线位置编码
作者 Yu Wuâ , Minsik Jeonâ , Jen-Hao Rick Chang, Oncel Tuzel, Shubham Tulsianiâ
查看出版物
复制Bibtex
我们研究用于处理一组姿态输入图像中令牌的多视角Transformer的位置编码,寻求一种能够唯一编码补丁、实现具有多频率相似性的SE(3)不变注意力,并能适应底层场景几何结构的机制。我们发现现有(绝对或相对)多视角注意力编码方案无法满足上述需求,因此提出RayRoPE来弥补这一缺陷。RayRoPE基于关联射线表示补丁位置,但采用射线上预测的点而非方向进行几何感知编码。为实现SE(3)不变性,RayRoPE计算查询帧投影坐标以实现多频率相似性。最后,由于射线上预测的3D点可能不够精确,RayRoPE提出在不确定性下解析计算预期位置编码的机制。我们在新视角合成和立体深度估计任务中验证了RayRoPE,结果表明其在替代方案上持续改进(例如在CO3D数据集上LPIPS指标相对提升15%)。我们还证明RayRoPE可以无缝融合RGB-D输入,相较于无法对这类信息进行位置编码的替代方案,能实现更显著的性能提升。
- â 卡内基梅隆大学
相关阅读与更新
基于长时程声学编码的分段注意力解码
2026年7月6日 研究领域 方法与算法 , 研究领域 语音与自然语言处理 会议 Interspeech
我们解决基于注意力的编码器-解码器(AED)模型与长时程声学编码之间的根本性不兼容问题。在分割语句上训练的AED模型通过利用分割边界之外的有限声学上下文来学习编码绝对帧位置,但在解码长时程片段时,当这些线索消失时会失败。由于键的排列不变性,模型会失去对声学编码的排序能力……
阅读更多
基于有限物理视角的高保真3D重建
2021年11月29日 研究领域 计算机视觉 会议 3DV
在已知校准和足够视角的情况下,多视角三角化是基于二维对应关系进行3D重建的黄金标准。然而在实践中,为了获得现代应用所需的高保真3D重建,需要昂贵的多视角设置——有时涉及数十甚至数百台相机。在本研究中,我们提出了一种新方法,利用神经形状先验的最新进展,在2D-3D提升中实现更高效的重建……
发现机器学习领域的机遇
我们的机器学习研究每天都在取得突破性进展。
加入我们