news 2026/8/26 15:08:36

CVPR 2025 | JTD-UAV: MLLM-Enhanced Joint Tracking and Description Framework for Anti-UAV Systems

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
CVPR 2025 | JTD-UAV: MLLM-Enhanced Joint Tracking and Description Framework for Anti-UAV Systems

CVPR 2025 | JTD-UAV:面向反无人机系统的多模态大语言模型增强型联合跟踪与描述框架

01.论文信息

  • 论文题目:JTD-UAV: MLLM-Enhanced Joint Tracking and Description Framework for Anti-UAV Systems

  • 论文作者: Yifan Wang,Jian Zhao等

  • 发表单位:北京未来区块链与隐私计算高精尖创新中心,北京航空航天大学人工智能学院等

  • 发表会议\期刊:CVPR 2025

  • 代码链接:无

02.论文创新点

  1. 提出无人机跟踪与意图理解新任务(UTIU)
    首次提出 UAV Tracking and Intent Understanding(UTIU) 任务,将传统 Anti-UAV 中的目标定位跟踪扩展到运动状态理解和行为意图推理。不仅关注无人机“在哪里”,还进一步理解:无人机运动状态(悬停、快速机动、改变方向等);无人机行为意图(是否接近建筑、人群等)。实现从 目标定位(Tracking) → 行为理解(Understanding) 的任务升级。

  2. 提出 MLLM 增强的联合跟踪与描述框架 JTD-UAV
    设计 JTD-UAV(Joint Tracking and Description Framework),将无人机跟踪算法与多模态大语言模型(MLLM)结合。通过轨迹信息增强 MLLM 的时序理解能力,使模型能够生成无人机运动状态描述和回答行为相关问题。

  3. 构建首个无人机跟踪与意图理解数据集 TDUAV
    提出 TDUAV 数据集,用于支持 UAV Tracking and Intent Understanding 任务。数据集包含:1328 个无人机视频序列,超过 163K 帧热成像标注数据,3000 个视觉问答(VQA)样本。同时提供:边界框跟踪标注;UAV motion caption(无人机运动描述);UAV Motion VQA(无人机运动视觉问答)。填补了现有 Anti-UAV 数据集只能提供目标位置,而缺少高层行为理解标注的问题。

  4. 提出面向无人机运动理解的视觉特征压缩与建模方法
    针对无人机目标尺寸小、运动速度快以及视频序列较长的问题,设计:自适应分辨率编码;特征压缩与投影模块。将长视频中的无人机运动信息压缩为适合 LLM 输入的视觉 token,降低计算成本,同时保留关键运动语义。

03.方法

如图所示, JTD-UAV框架可划分为三个阶段。

  • 首先,采用目标检测与跟踪算法获取目标的的位置信息。
  • 随后,将该位置信息与视频数据融合进行编码。为了更有效地对无人机的运动状态进行建模,同时减少冗余信息并降低计算复杂度,引入了一种特征压缩与无人机运动建模机制。该机制利用可学习的查询(Learnable Queries)从视频中提取无人机的运动信息。
  • 最后,将提取出的特征输入至大语言模型中,以生成有关无人机运动状态的描述与交互。

P(t)P(t)P(t)为时间ttt处目标的位置信息,V(t)V(t)V(t)为时间ttt处的视频数据,QQQ为可学习的查询,LLL为大语言模型,可以将融合后的数据I(t)I(t)I(t)定义为:I(t)=fencode(P(t),V(t))I(t) = f_{\text{encode}}(P(t), V(t))I(t)=fencode(P(t),V(t))其中fencode(⋅)f_{\text{encode}}(\cdot)fencode()为编码函数。
特征压缩与无人机运动建模机制可表示为:M(t)=fextract(fcompress(fencode(P(t),V(t))),Q)M(t) = f_{\text{extract}}(f_{\text{compress}}(f_{\text{encode}}(P(t), V(t))), Q)M(t)=fextract(fcompress(fencode(P(t),V(t))),Q)其中fcompress(⋅)f_{\text{compress}}(\cdot)fcompress()为特征压缩函数,fextract(⋅)f_{\text{extract}}(\cdot)fextract()为提取函数。
最终,生成的有关无人机运动状态的描述与交互表示为:D(t)=L(fextract(fcompress(fencode(P(t),V(t))),Q))D(t) = L(f_{\text{extract}}(f_{\text{compress}}(f_{\text{encode}}(P(t), V(t))), Q))D(t)=L(fextract(fcompress(fencode(P(t),V(t))),Q))

3.1. 无人机检测与跟踪

采用目标跟踪算法来获取无人机在视频中的位置信息。该无人机跟踪算法由全局检测分支(用于检测无人机目标)和局部跟踪分支(用于在视频流中持续定位目标)组成。利用无人机目标检测算法(具体为 YOLOv8 )对整段视频中的无人机进行全局检测。一旦检测到无人机目标,该算法就会启动局部跟踪,对已检测到的无人机保持连续监视,直至其不再可见。如果局部跟踪器失配并返回拒绝跟踪的结果,模型会自动重新激活全局检测器,以便在后续视频帧中继续检测无人机。

局部跟踪框架由一个主干网络构成,并辅以多级关联解耦模块。多阶段主干网络负责提取并融合模板区域(Template Area)与搜索区域(Search Area)的特征。在主干网络的每个阶段,利用卷积层生成图块嵌入,将图像图块映射为特征 Token。将源自模板与搜索区域的 Token 进行拼接,并输入至关联解耦模块中进行特征提取与匹配。最终,该框架实现对目标位置与尺度的估计。

3.2. 特征压缩与建模

受限于模型的上下文窗口以及视频序列的较长时间跨度,原始视频数据不适合直接输入模型。为应对这一挑战,设计了一种以自适应分辨率编码与压缩为核心特征的创新机制。该机制擅长从无人机运动视频中提取信息,从而在语言特征空间中实现更高阶的语义视觉表示。
采用自适应分辨率编码来处理不同尺度的无人机特征,以确保准确的特征表示。通过从无人机运动视频中提取并自适应压缩特征,增强模型描述无人机运动行为的能力。

3.3. 无人机运动行为的描述文本生成

在通过特征压缩与学习层处理后,获得了相应的无人机运动行为特征。随后,将这些特征与编码后的指令信息进行拼接,输入至大语言模型(LLM)中,LLM 最终输出无人机的运动状态,表示为:
L=Concat(Fu,Φenc(Fc))L = \text{Concat}(F_u, \Phi_{\text{enc}}(F_c))L=Concat(Fu,Φenc(Fc))
其中,Φenc(⋅)\Phi_{\text{enc}}(\cdot)Φenc()表示指令编码过程,FuF_uFuFcF_cFc分别代表压缩后的特征与指令编码特征。
跟踪与描述生成的联合训练方法。在单次推理阶段,目标跟踪算法首先获取无人机的位置信息。该信息经过特征压缩与建模后输入至 LLM 中。随后计算 LLM 的损失与目标跟踪损失,并将两者结合。最终的损失函数公式为:
L=αLLLM+βLOT\mathcal{L} = \alpha \mathcal{L}_{\text{LLM}} + \beta \mathcal{L}_{\text{OT}}L=αLLLM+βLOT
α\alphaαβ\betaβ分别为平衡大语言模型(LLM)损失与目标跟踪(Object Tracking)损失贡献度的权重系数。总损失由两部分组成:目标框回归损失(跟踪损失)与 LLM 损失。LLM 损失函数公式如下:LLLM=−1N∑i=1NyLLM,ilog⁡(y^LLM,i)\mathcal{L}_{\text{LLM}} = -\frac{1}{N} \sum_{i=1}^{N} y_{\text{LLM},i} \log(\hat{y}_{\text{LLM},i})LLLM=N1i=1NyLLM,ilog(y^LLM,i)其中,yLLM,iy_{\text{LLM},i}yLLM,i表示位置iii处的真实标签(Ground Truth),y^LLM,i\hat{y}_{\text{LLM},i}y^LLM,i表示位置iii处的预测概率分布,NNN为描述文本的长度。

04. TDUAV:全新基准

TDUAV,是目前用于无人机检测、跟踪与意图理解的最全面的数据集。如表 1 所示,TDUAV 在规模和复杂度上均超越了现有数据集,包含 1,328 个序列和 16.3 万帧图像。无人机的平均尺寸仅为 32×21 像素(占 26),较小的目标尺寸使得检测和跟踪更具挑战性。

如图所示,展示了 TDUAV 在丘陵、城镇、森林和建筑物等场景下的具体案例。

基于现有的反无人机数据集(如 Anti-UAV 系列 )构建数据集。如图 所示,通过聚焦于无人机运动和环境的不同方面(如背景设定、运动方向、速度以及整体总结)的多个阶段,显著提升了描述文本(Captions)和视觉问答(VQA)回答的准确性与质量。通过结合 GPT-4 等大语言模型以及人工审核,确保了高质量的数据输出,大幅改善了无人机行为描述的精确度与交互性,为高级反无人机应用提供了有力支持。

首个用于联合跟踪与意图理解的数据集:TDUAV 是首个专门针对无人机跟踪与意图理解双重任务设计的数据集。它独到地聚焦于复杂环境中无人机行为的预测,而这一任务在此前的机制中被普遍忽视。该数据集涵盖了意图识别、场景识别以及包含无人机形态与意图在内的综合运动状态描述等任务。这使得 TDUAV 成为在各种场景下理解与预测无人机意图的宝贵资源。

与现有数据集的对比:虽然像 USC Drone和 MAV-VID这类数据集仅专注于跟踪,但 TDUAV 提供了意图预测所需的标注。即便是像 Anti-UAV这样全面的数据集,也缺乏高阶行为分析所需的深度。TDUAV 填补了这一空白,同时提供跟踪与意图数据,使其成为实际应用场景下的理想选择。

多模态提高鲁棒性。除了 RGB(可见光)数据外,TDUAV 还包含了热成像(红外)模态,这对于夜间作业等低能见度条件至关重要。这种多模态特性增强了数据集的通用性,使其能够支持更广泛的无人机相关任务,涵盖从安全监控到自主导航的多个领域。

结论:无人机研究的新基准。TDUAV 通过为联合跟踪与意图理解提供全面的解决方案,树立了全新的基准。其庞大的规模、精细的标注以及对多模态的支持,使其成为推动无人机研究及实际应用发展的宝贵资源。

05. 实验分析

5.1. 实现细节

目标检测与跟踪分支的 YOLOv8s模型在 AntiUAV 训练集上进行训练;而跟踪模型则在 AntiUAV数据集以及四个通用跟踪数据集(包括 LaSOT、TrackingNet 、GOT10K 和 COCO)上共同训练。随后,在 TDUAV 数据集上对目标检测与跟踪分支以及多模态大语言模型进行联合训练。对于多模态大语言模型,冻结了视觉编码器的权重,并对特征压缩与建模层以及大语言模型层的权重进行训练。在训练过程中,我们使用 AdamW 优化器 ,将学习率设置为 1e-5,并配合余弦学习率调度策略。模型的性能展示如图所示。

5.2. 对比实验

在 DTUAV 数据集上的定量分析: DTUAV 数据集上评估了多模态大语言模型(MLLMs)的性能,重点关注无人机检测与跟踪任务。如表所示,JTD-UAV 在所有三个子集上的表现均持续优于其他模型。BLEU 得分用于衡量生成的描述文本与人工参考文本的匹配程度,它在评估 n-gram 精确度的同时引入了简短惩罚(Brevity Penalty)。JTD-UAV 在所有 BLEU 级别(BLEU-1 至 BLEU-4)上均持续取得更优的评估结果,这表明即使在复杂场景下,该模型也具备生成准确且符合上下文语义的无人机行为描述的卓越能力。

在表 4 中,使用 SPICE(基于语义命题的图像描述评估)和 ACC(准确率)指标对模型进行了进一步对比。与侧重于 n-gram 重合度的 BLEU 不同,SPICE 通过将生成文本和参考描述均转换为场景图(Scene Graphs),进而比较这些场景图的相似度,从而衡量图像描述与参考描述之间的语义一致性。

在其他无人机数据集上的对比:为了进一步验证其有效性,在两个主流的反无人机数据集(即 DUT Anti-UAV [76] 和 Anti-UAV [32])上对 JTD-UAV 进行了评估。DUT Anti-UAV 数据集包含 20 段视频,而 Anti-UAV 数据集包含 91 段热成像视频,重点关注 RGB(可见光)数据可能不足的场景。在通用跟踪数据集上训练的基线 JTD-UAV 方法,在 DUT Anti-UAV 数据集上达到了 0.612 的准确率;在 Anti-UAV 数据集上,JTD-UAV 则取得了 0.633 的准确率。

5.3. 消融实验

这些实验对模型进行了系统化评估,提供了对其贡献的全面理解。实验结果表明,与基线模型相比,方法在性能以及无人机运动行为描述和视觉问答(VQA)任务中均取得了显著提升。在无人机运动行为描述任务中,BLEU 得分提高了 2.43%,SPICE 得分提升了 3%,展现出了更强的文本生成与描述能力。在视觉问答(VQA)任务中,观察到了 7.73% 的平均性能提升,这表明模型在理解力与回答准确性方面取得了大幅突破。

06. 个人声明

本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/26 15:06:19

HookPHP项目目录结构全解析:看懂9大目录,理清热插拔架构设计思路

HookPHP项目目录结构全解析:看懂9大目录,理清热插拔架构设计思路 【免费下载链接】HookPHP HookPHP基于C扩展搭建内置AI编程的架构系统-支持微服务部署|热插拔业务组件-集成业务模型|权限模型|UI组件库|多模板|多平台|多域名|多终端|多语言-含常驻内存|前…

作者头像 李华
网站建设 2026/8/26 15:06:14

LHDC V5 手机到耳机音乐传输链路详解

以手机本地播放 test1.mp3 通过 LHDC V5 编码传输到蓝牙耳机并播放为例,详细说明从文件到声音的完整技术链路。 LHDC V5 三部曲导航: LHDC V5 编解码流程与原理详解LHDC V5 手机到耳机音乐传输链路详解LHDC V5 算法深度解析 一、整体链路概览 ┌────…

作者头像 李华
网站建设 2026/8/26 15:05:06

3步接入PingFangSC字体:从克隆到网页生效,TTF和WOFF2怎么选

3步接入PingFangSC字体:从克隆到网页生效,TTF和WOFF2怎么选 【免费下载链接】PingFangSC PingFangSC字体包文件、苹果平方字体文件,包含ttf和woff2格式 项目地址: https://gitcode.com/gh_mirrors/pi/PingFangSC PingFangSC是一个字体…

作者头像 李华
网站建设 2026/8/26 15:01:03

Maka Agent诊断日志系统怎么运作?AI助手故障排查完全指南

Maka Agent诊断日志系统怎么运作?AI助手故障排查完全指南 【免费下载链接】maka Apache Maka (Incubating) is a local-first AI agent workspace. Model messages, tool calls, tool results, permission decisions, and termination events are recorded as an ap…

作者头像 李华
网站建设 2026/8/26 14:58:29

PUBG压枪宏3步搞定:5分钟用罗技鼠标压住枪

PUBG压枪宏3步搞定:5分钟用罗技鼠标压住枪 【免费下载链接】logitech-pubg PUBG no recoil script for Logitech gaming mouse / 绝地求生 罗技 鼠标宏 项目地址: https://gitcode.com/gh_mirrors/lo/logitech-pubg 瞄准敌人胸口按住扳机,前两发打…

作者头像 李华