多目标跟踪(MOT)简介 (1) 本人在学习多目标跟踪过程中在寻找有关总结多目标跟踪模型的文章或博客时虽然作者们写的都很好但是自己总是感觉理解的不透彻于是我就想自己写一篇关于多目标跟踪模型或者说总结一下来加深一下自己的理解如有不妥指出请各位读者朋友们批评指正。1.目标检测与目标跟踪我在学习目标跟踪之前是学习目标检测的由于需要跟踪的一些作用所以开始学习目标跟踪。因此我先介绍一下目标跟踪和目标检测的联系和区别不单单是因为我学习检测也是因为跟踪与检测密切相关。1.1 目标检测目标检测是指在单张静态图像中识别出特定类别的物体如人、车、狗、猫并确定它们的位置和范围通常用一个矩形框表示称为边界框以及类别标签的任务。识别的具体类别取决于你的模型在训练时你让他学习了什么比如你想获得一个能够识别人和车的模型那么在训练阶段你就需要为他准备包含车、人的图片作为模型训练时的数据集完成训练之后就可以实现对车和人的识别。简单来说目标检测解决了两个核心问题“图像中有哪些物体”和“物体在图中哪里”1.2 目标跟踪目标跟踪通常是指在连续的视频帧序列中持续定位一个特定目标通常在第一帧中给出其初始位置的运动轨迹并赋予其特定的ID的任务。但是在不连续的帧中也可以进行跟踪只是这样以来其跟踪轨迹可能会变短跟踪效果可能不如连续帧更佳。在前面强调连续性的原因是连续帧是最典型的场景但同时也要明确并非是唯一场景。目标跟踪解决的核心问题是“特定目标在某一帧第一次出现之后在后续每一帧中它在哪里”1.3 目标跟踪与目标检测通过上述两个小节我么了解到目标检测的目的是在某一特定图片中找到特定目标的位置、确定类别并用边界框将其标注出来他对图片的连续性没有明确要求而目标跟踪是对出现这同一目标的所有图片中或者视频序列中找出目标的位置并赋予ID目标跟踪对图片的连续性要求高。这就简单介绍一下我们这篇文章重点还是在于下文的多目标跟踪MOT。2.目标跟踪2.1 目标跟踪的分类这里列举了比较常见的的分类方式。2.1.1 按跟踪对象数量分类1单目标跟踪SOTSingle Object Tracking每次只跟踪一个目标2多目标跟踪MOTMultiple Object Tracking同时跟踪多个目标。这通常需要结合目标检测技术在每一帧检测出所有目标和数据关联技术将不同帧的检测结果关联到同一个目标轨迹上。2.1.2 按是否使用深度学习分类1基于传统方式的跟踪基于传统方法的目标跟踪主要依赖于图像处理技术和手工设计特征利用目标在连续帧之间的变化规律来实现跟踪。这类方法不依赖深度学习模型适用于计算资源有限的场景。2基于深度学习的跟踪利用卷积神经网络CNN等深度模型学习目标的高层次语义特征增强了对目标变形、光照变化、遮挡等问题的鲁棒性。2.1.3 按初始化方式先验信息分类1基于检测的跟踪Detection Based Tracking每一帧先使用目标检测器定位目标再进行跟踪和关联。检测与跟踪分离将目标检测器如 YOLO、Faster R-CNN与跟踪器如 SORT、DeepSORT分开执行。每一帧先进行目标检测再对检测结果做关联匹配、ID分配等操作。检测与跟踪一体化在同一个网络中同时输出检测框和对应的ID或特征信息即检测和跟踪是端到端联合优化的一个主干网络输出检测框 嵌入特征Embedding或 ID 分类结果。2不基于检测的跟踪Detection Free Tracking生成式跟踪是否在第一帧给定目标位置后仅通过建模目标自身的外观特征如模板、颜色直方图、纹理来在后续帧中搜索最相似的区域。判别式跟踪构建一个分类器用来区分“目标”和“非目标”区域背景。2.1.4 按是否访问未来帧是否使用整段视频的所有帧信息分类1在线跟踪Online只使用当前帧和过去帧的信息来进行跟踪不能访问未来帧。适用于实时系统如果一帧中目标被遮挡可能错误匹配无法利用未来信息修正错误。2离线跟踪Offline可以访问整段视频即当前帧的处理可以参考未来帧的信息。能处理遮挡、目标丢失等复杂情况精度高轨迹更平滑时延高无法实时运行。3.基于深度学习的多目标跟踪因为本人主要使用多目标跟踪并且与YOLO相结合所以下面主要介绍基于深度学习的多目标跟踪模型会尽量总结相关的模型以及他们的优缺点。基于深度学习的多目标跟踪Multi-Object TrackingMOT技术是近年来计算机视觉领域的重要研究方向之一由于近年来算力的增强以及深度学习的蓬勃发展多目标跟踪领域在2015年前后引入深度学习。目前广泛应用于智能交通、安防监控、自动驾驶、体育分析等多个实际场景。下面介绍一些典型的模型3.1 2016年1SORT论文SIMPLE ONLINE AND REALTIME TRACKING (SORT)是否基于检测是依赖外部检测器如Faster R-CNN检测与跟踪分离是核心机制卡尔曼滤波预测 匈牙利算法关联仅用位置IOU优点速度快简单易实现。缺点ID切换频繁无外观特征处理遮挡。适用场景实时性要求高、遮挡少的场景如交通监控。3.2 20171DeepSORTDeepSORT通过融合运动与外观信息在保持SORT实时性的同时显著减少遮挡导致的身份切换ID Switches ↓45%。论文Simple Online and Realtime Tracking with a Deep Association Metric是否基于检测是检测与跟踪分离是优点可与任意检测器如YOLO、Faster R-CNN结合速度快适合实时跟踪使用ReID特征提升遮挡鲁棒性。缺点无端到端训练遮挡严重时仍易丢失目标。适用场景实时监控智能交通系统简单或中等密度人群场景。3.3 20191Tracktor论文Tracking without bells and whistles是否基于检测是检测与跟踪分离 不完全分离检测器同时用于跟踪优点无需独立的运动预测器直接利用检测器进行目标回归简洁、易集成。缺点对遮挡敏感移动目标预测能力较弱。适用场景行人追踪低速目标、非拥挤场景。3.3 2020年1CenterTrack论文CenterTrack: Tracking Objects as Points是否基于检测是检测与跟踪分离是端到端优点端到端模型易于部署快速适合实时应用。缺点精度略低于SOTA模型对快速运动、遮挡鲁棒性差。适用场景实时交通监控移动机器人视觉。2FairMOT论文FairMOT: On the Fairness of Detection and Re-Identification in Multiple Object Tracking是否基于检测是检测与跟踪分离合一端到端优点检测与ReID共享特征速度与精度平衡良好实时性强准确率高。缺点相比DeepSORT精度略低于强ReID方法如MOTR。适用场景行人跟踪实时监控系统如商场、地铁。3JDE (Joint Detection and Embedding, 2020)论文Towards Real-Time Multi-Object Tracking是否基于检测端到端联合学习检测外观嵌入检测与跟踪分离否核心机制单网络输出检测框ReID特征如YOLOv3ReID分支。优点速度较快兼顾检测与ID一致性。缺点检测与ReID任务存在优化冲突。场景实时跟踪系统如无人机监控。4TransTrack论文TransTrack: Multiple Object Tracking with Transformer是否基于检测端到端基于Transformer检测与跟踪分离否核心机制Query机制关联当前帧检测与历史轨迹。优点全局关系建模抗遮挡强。缺点计算资源需求高。场景复杂遮挡场景如体育赛事。3.4 2021年1TraDeS论文Track To Detect and Segment: An Online Multi-Object Tracker是否基于检测是检测与跟踪分离 分离优点利用图结构保持目标连贯性更好地处理遮挡与ID切换问题缺点推理速度较慢适用场景拥挤场景如人群分析、体育比赛2MOTR论文MOTR: End-to-End Multiple-Object Tracking with Transformer是否基于检测 非基于独立检测器使用DETR结构检测与跟踪分离 合一端到端优点Transformer架构处理长时间依赖强无需关联模块直接输出ID。缺点训练复杂推理较慢对边缘目标不敏感。适用场景高精度场景离线处理需求如视频分析、智能分析后台。3ByteTrack论文ByteTrack: Multi-Object Tracking by Associating Every Detection Box是否基于检测是检测与跟踪分离 分离优点引入低置信度框进行关联显著提升Recall速度快、精度高简洁、易于部署。缺点对ReID支持较弱在大遮挡场景精度下降。适用场景自动驾驶高速场景中的目标跟踪。3.5 2022年1OC-SORT论文Observation-Centric SORT: Rethinking SORT for Robust Multi-Object Tracking是否基于检测是检测与跟踪分离 分离优点利用轨迹一致性提升遮挡处理能力对曲线运动处理优良。缺点高速目标处理有限ReID特征需额外训练。适用场景曲线轨迹目标如球类运动行人及交通目标追踪。2StrongSORT基于DeepSORT结合GNN与改进ReID模型论文StrongSORT: Make DeepSORT Great Again是否基于检测是检测与跟踪分离是优点精度比DeepSORT高遮挡处理更好集成多个特征提升关联能力。缺点推理速度略慢参数调优复杂。适用场景中高精度场景如无人超市、城市安防。3.6 2023年及以后近几年多目标跟踪的发展迅猛推出了很多新的模型但是本人学习速度实在有限所以本篇文章先总结到此后续会继续总结新的模型。本想使用多目标跟踪技术实现在交通标志的较高质量的实时跟踪如果各位读者有合适的方法或模型推荐欢迎各位在评论区留言。感谢感谢