当前位置：首页 > news >正文

Paper速读-[Visual Prompt Multi-Modal Tracking]-Dlut.edu-CVPR2023

news 2026/3/14 23:24:54

文章目录

简介
关于具体的思路
问题描述
- 算法细节
实验结果
- 模型的潜力
- 模型结果

论文链接：Visual Prompt Multi-Modal Tracking

开源代码：Official implementation of ViPT

简介

这篇文章说了个什么事情呢，来咱们先看简单的介绍图
在这里插入图片描述
简单来说，这篇文章主要干了这么一个事情：
以前的多模态呢，都是直接提取特征然后拼接到一起。这个文章不一样，我把所有的模态分开主次，其中只有一个主要模态，剩下的都是附加的。这些附加的模态可就不要再提取特征了，而是通过他们来提取prompt出来。并且使用这些prompt来帮助我的模型更好的在主要模态上提取特征。除此之外，还有一个不一样的点就是在主要模态上提取特征的时候，backbone，这里叫fundation model的模型参数是不更新的。
OK，你已经看完这篇文章了。。当然啦，如果还想知道知道更多的技术细节，咱们接着往下看。

关于具体的思路

咱们来看第二张图，模型的详细介绍
在这里插入图片描述
这个图其实画的很好，过程非常直观。接下来咱们只需要展开说说其中的细节就可以了

问题描述

首先，我们想要得到的是追踪器，单模态的方法中，假如说叫做 $F_{RGB} : \{X_{RGB}, B_0\} \rightarrow B$ ，那么 $B$ 就是目标的box， $B_0$ 就是这个框的初始值， $X_{RGB}$ 就是需要搜索的帧。那么接下来，在多模态的方法中，加入了一个啥呢 $F_{RGB} : \{X_{RGB}, X_{A},B_0\} \rightarrow B$ ，变成这个样子了。其中这个 $A$ 代表的就是其他的模态，比如说深度图，热力图之类的东西。
接下来，我们把问题拆成两个部分，首先是 $f_1 : {X_{RGB}, X_{A},B_0\}} \rightarrow H_{RGB}$ 。这个部分表示的是特征提取和交互的部分，之后我们紧跟 $f_2 : H_{RGB} \rightarrow B$ ，这个部分也就是最后的预测头。

算法细节

在这里会将一些细节，但是也不会那么细。简单来说是这样的

使用类似ViT之类的模型从最初的 $X_{RGB}$ 得到 $H^0_{RGB}$ ，接下来就可以进行后续的迭代编码：
然后的公式其实就很直观了哈，咱们紧接上一步，接着往下看。首先我们可以知道，通过RGB和补充模态A，我们可以得到两个初始化的值 $H^0_{RGB}$ 和 $H^0_{A}$ 。接下来， $H^0_{RGB}$ 通入我们的解码器，或者叫Foundation model，而 $H^0_{RGB}$ 和 $H^0_{A}$ 被送到一个叫做MCP (modality-complementaryprompter) 的模块里面，这个模块咱们之后细讲。接下来，从MCP学到的prompt就被按照这样的方式使用起来了：

这个其中的P其实就是我们的prompt，H就是我们需要送入下一层解码器的输入。那么这个具体怎么得到呢？咱们再往下看
简单来说，MCP就是这个样子：
展开来说呢， $H^0 = H^0_{RGB}$ ， $P^0 = H^0_{A}$ 。然后 $P^l$ 表示第l个MCP模块，这个MCP模块具体长成这样：
OK，细节基本就是这样，再具体的可以去看一下原来的论文。

实验结果

模型的潜力

better adaptability than full fine-tuning
a closer association between RGB and RGB+auxiliary modality tracking, as well as learning about the modal complementarities
其实说白了就是更好的适应性和更好的学习能力

模型结果

在这里插入图片描述

OK，那么以上就是本篇文章的全部内容了，感兴趣的小伙伴可以点击开头的链接阅读原文哦

关于更多的文章，请看这里哦文章分享专栏 Paper sharing Blog

Paper速读-[Visual Prompt Multi-Modal Tracking]-Dlut.edu-CVPR2023

文章目录

简介

关于具体的思路

问题描述

算法细节

实验结果

模型的潜力

模型结果

相关文章：

Paper速读-[Visual Prompt Multi-Modal Tracking]-Dlut.edu-CVPR2023

memory动态内存管理学习之unique_ptr

1、项目介绍：为什么要做此项目。

2024年6月7日第十五周下午学习英语六级大纲

每日5题Day19 - LeetCode 91 - 95

wordpress里面嵌入哔哩哔哩视频的方法

Linux系统管理磁盘管理004

Flink窗口理论到实践

279 基于matlab的粒子群集法对铁路电能质量控制系统的容量避行优化设计

46-3 护网溯源 - 溯源报告编写

微服务之基本介绍

嘉立创面板制作不规则图案技巧

如何使用Python中的collections模块提供的数据结构，如deque、Counter、OrderedDict等

2024年道路安全员考试题库

自建 Docker 镜像

php实现抖音小程序支付

代码审计(1)：CVE-2022-4957分析及复现

问题：设备管理指标为完好率不低于( )，待修率不高于5%，事故率不高于1%。 #知识分享#经验分享#经验分享

【Linux】（六）—— vim编辑器

06016传感器原理与应用202207

PTA 树与二叉树 3 中序+后序序列构建二叉树

从手动发推到自动化运营：我用这套方案把Twitter运营效率提升了10倍

多模型聚合的AI图像生成工作台——椒图AI深度评测与实战：低成本实现无痕改字与8K高清放大

Z-Image-Turbo-辉夜巫女完整指南：开源可部署+GPU显存优化+Gradio开箱即用

工具与方法 - 高效二进制文件编辑软件推荐与实战技巧

【APP测试】uiautomator2与atx框架实战：从安装到多设备操控

建筑领域三维点云数据处理的关键技术与实践应用

uniapp 蓝牙条码枪HID模式实战：从原理到代码实现

避坑指南：Cyclone IV FPGA操作S29GL064N时遇到的23位地址线问题解决方案

Llama-3.2V-11B-cot 多轮对话实战：实现基于历史图像的连续问答