ECCV 2024 oral | 首次基于深度聚类的多模态融合,上交、伯克利提出双向结构对齐的融合网络新SOTA!
来源:机器之心
时间:2024-10-04 09:03:54 247浏览 收藏
偷偷努力,悄无声息地变强,然后惊艳所有人!哈哈,小伙伴们又来学习啦~今天我将给大家介绍《ECCV 2024 oral | 首次基于深度聚类的多模态融合,上交、伯克利提出双向结构对齐的融合网络新SOTA!》,这篇文章主要会讲到等等知识点,不知道大家对其都有多少了解,下面我们就一起来看一吧!当然,非常希望大家能多多评论,给出合理的建议,我们一起学习,一起进步!
本文的主要作者来自上海交通大学智能机器人与机器视觉(IRMV)实验室。本文第一作者是实验室硕士生刘久铭,主要研究方向为点云配准,雷达里程计,多模态融合,nerf/3DGS 渲染,3D生成等。曾在CVPR,ICCV,ECCV,AAAI等会议发表论文多篇。

论文链接:https://arxiv.org/pdf/2403.18274
代码仓库:https://github.com/IRMVLab/DVLO


,及其对应的来自一对连续帧的单目相机图像
,里程计目标是估计两个帧之间的相对位姿,包括旋转四元数
和平移向量
。 


,利用 [17] 中基于卷积的特征金字塔提取图像特征
。其中,
、
是特征图的高度和宽度。C 是图像特征的通道数。
后,首先将其重塑为伪点集合
,其中
为伪点个数。在这种情况下,图像具有与激光雷达点相同的数据结构,这有利于建立局部像素与点的对应关系,并进一步进行基于聚类的特征聚合。
进行双线性插值,计算出中心特。
和伪点特征
的成对余弦相似度,将所有伪点划分为若干个聚类。在此,将每个伪点分配到最相似的聚类中心,从而得到 N 个聚类。为了提高效率,按照 Swin Transformer,在计算相似度时使用区域分割。
的计算公式为:

和点(伪图像)特征
之间引入了全局自适应融合机制。
的大小为
。这一过程将原本稀疏的非结构化点重组为密集的结构化伪图像,从而实现了下面的密集特征图与图像特征的融合。
和点特征
,按以下方式进行自适应全局融合:


和
是点(伪图像)特征和局部融合特征的自适应权重,由 sigmoid 函数和 MLP 层获得。⊙表示元素与元素之间的乘积。然后,将全局融合特征
重塑为 N ×D 的大小,作为迭代姿态估计的输入。
和
联系起来,利用代价卷生成粗嵌入特征
。嵌入特征包含两个连续帧之间的相关信息。
是可学习的掩码。
是源帧中的全局融合特征。然后,通过对嵌入特征和 FC 层加权,生成四元数
和平移向量
:

和平移矢量
的计算公式为:

和
可根据论文中的公式在最粗糙层中通过类似过程获得。
和
将用于计算监督损失
。第 l 层的训练损失函数为:
和
是可学习的标量,用于缩放损失。
和
分别是 L1 和 L2 准则。那么,总训练损失为
是代表第 l 层权重的超参数。

表 3:在 KITTI 09-10 序列上与基于学习的多模态里程计的比较。








以上就是本文的全部内容了,是否有顺利帮助你解决问题?若是能给你带来学习上的帮助,请大家多多支持golang学习网!更多关于科技周边的相关知识,也可关注golang学习网公众号。
声明:本文转载于:机器之心 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
-
501 收藏
-
501 收藏
-
501 收藏
-
501 收藏
-
501 收藏
最新阅读
更多>
-
273 收藏
-
251 收藏
-
205 收藏
-
323 收藏
-
457 收藏
-
314 收藏
-
370 收藏
-
132 收藏
-
339 收藏
-
413 收藏
-
394 收藏
-
436 收藏
课程推荐
更多>
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 立即学习 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 立即学习 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 立即学习 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 立即学习 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 立即学习 485次学习