[论文阅读 2020 ECCV 目标跟踪]TAO: A Large-Scale Benchmark for Tracking Any Object_tap-vid: a benchmark for tracking any point in a v-程序员宅基地

技术标签: 论文阅读  计算机视觉  深度学习  人工智能  目标跟踪  

简介

paper:TAO: A Large-Scale Benchmark for Tracking Any Object

code:TAO-Dataset/tao

这篇论文关注到了跟踪数据集普遍存在的一个问题就是:现有的跟踪数据集中的跟踪对象普遍是personvehicle(如下图所示,作者统计了主流的跟踪数据集中样本种类的占比情况)。

在这里插入图片描述

这篇论文提出了一种样本种类更加丰富的可用于多目标跟踪任务和单目标跟踪任务的数据集TAO和与之匹配的评测工具。

主要内容

TAO数据集特征

在这里插入图片描述

这篇论文提出的数据集TAO包含833个类别,其中488个类别是LVIS这个数据集中已有的标签,而另外345个类别是LVIS这个数据集之外的标签。

数据集TAO中的数据来源于六个其他数据集:ArgoVerse,BDD,Charades,LaSOT,YFCC100M,HACS.

TAO数据集中的标签类别大部分(95%)属于LVIS这个数据集的类别(关于LVIS数据集:LVIS: A Dataset for Large Vocabulary Instance Segmentation)

TAO数据集标签制作流程

TAO数据集标签制作的流程不同于传统的标签制作:

在这里插入图片描述

如上图所示,TAO标签的标注分为三步:

  1. 对象挖掘和跟踪(Object mininig and tracking): 对于每个视频帧序列的标注,要求打标签的人将视频帧中所有运动的对象都标注出来
  2. 对象分类(Object categrorization): 标注程序给出LVIS数据集已有的类别,让打标签的人给标注的对象分配类别,标注程序允许打标签的人给对象分配LVIS数据集中不存在的类别
  3. 联合标签(Federated "exhaustive" labeling): 标注完一组视频帧序列后,标注程序列出没有标注完整的帧,并提示该帧中哪些标签没有标注
TAO数据集标签格式

TAO数据集标签格式如下(摘自源码),大部分标签的格式与MS COCO类似。

Annotation file format:
{
    
    "info" : info,
    "images" : [image],     #图像相关属性
    "videos": [video],      #视频帧相关属性
    "tracks": [track],      # {'category_id': 805, 'id': 72, 'video_id': 11}
    "annotations" : [annotation],
    "categories": [category], # { 'id': 1, 'name': 'acorn',  'synset': 'acorn.n.01',....}
    "licenses" : [license],
}

info: As in MS COCO
image: {
    
    "id" : int,
    "video_id": int,
    "file_name" : str,
    "license" : int,
    # Redundant fields for COCO-compatibility
    "width": int,
    "height": int,
    "frame_index": int
}
video: {
    
    "id": int,
    "name": str,            #记录视频的相对位置 比如 'train/YFCC100M/v_f69ebe5b731d3e87c1a3992ee39c3b7e'
    "width" : int,          #视频中的图像width
    "height" : int,         #视频中的图像height
    "neg_category_ids": [int],
    "not_exhaustive_category_ids": [int],
    "metadata": dict,  # Metadata about the video
}
track: {
    
    "id": int,              #跟踪任务ID
    "category_id": int,     #类别ID
    "video_id": int         #video ID
}
annotation: {
    
    "image_id": int,
    "track_id": int,
    "bbox": [x,y,width,height],     #[左上角x,左上角y,width,height]
    "area": float,
    # Redundant field for compatibility with COCO scripts
    "category_id": int
}
category: {
    
    #...
}
license: {
    
    #...
}
评测细节
Oracles的设置

为了分析单目标跟踪算法与多目标跟踪算法在TAO数据集上的表现,这篇论文提出了两种Oracles

  • first oracle

The first, a class oracle, computes the best matching between predicted and groundtruth tracks in each video. Predicted tracks that match to a groundtruth track with 3D IoU > 0.5 are assigned the category of their matched groundtruth track.

  • second oracle

The second oracle computes the best possible assignment of per-frame detections to tracks, by comparing them with groundtruth. When doing so, class predictions for each detection are held constant.

Init firstInit biggest两种初始方式

Init firstInit biggest两种方式不同之处体现在两点:

  1. 跟踪器的初始化不同: 对于Init first,输入第一帧图像的bbox对跟踪器进行初始化;对于Init biggest,输入视频帧序列中最大的bbox对跟踪器进行初始化;
  2. 跟踪器的执行过程不同:对于Init first,跟踪器正常执行,即从第一帧依次跟踪到最后一帧;对于Init biggest,跟踪器分两段跟踪,假设视频帧序列中最大的bbox出现在第k帧,对于前k帧是从后往前逆序输入跟踪(Track backward),对于第k帧至最后一帧是从前往后顺序输入跟踪(Track forward).
# Track forward
try:
    if show_progress:
        logging.info('Tracking forward')
    #对于后半段,从前往后跟踪(Track forward)
    boxes = do_track(frames[sot_init_frame:], output_forward_video)
except (ValueError, subprocess.CalledProcessError):
    continue

# Track backward
if do_track_backward:       #当使用biggest的时候为true
    if show_progress:
        logging.info('Tracking backward')
    #对于前半段,从后往前跟踪(track backward)
    track_frames = frames[first_annotated_frame:sot_init_frame+1][::-1]
    try:
        backward_boxes = do_track(track_frames, output_backward_video)
    except ValueError:
        continue
    backward_boxes = backward_boxes[::-1]
    assert np.all(backward_boxes[-1] == boxes[0])
    boxes = np.vstack((backward_boxes[:-1], boxes))
TAO评测流程

TAO评测程序的执行流程可以分为两步:

  1. 在跟踪器上跑TAO测试集:首先读取TAO的数据集,读取图片路径、bbox等数据,之后借助pysot定义跟踪器并根据Init的两种方式对跟踪器进行初始化,之后通过pysot跑完所有数据,并将跟踪器的预测结果保存到文件results.json
  2. 对预测结果进行评测:首先读取预测结果results.json,并根据预先设置的oraclethreshold等对预测结果进行适当处理,最后计算相关的评测指标(APmAP等)
TAO实验结果

在这里插入图片描述

这里,我对SiamRPN++的结果进行了复现,采用pysot中提供的SiamRPN++siamrpn_r50_l234_dwxcorrval数据集上进行了测试(使用THRESHOLD 0.7),结果如下:

AP AR
Init first 30.15 33.49
Init biggest 36.08 37.67

论文中采用THRESHOLD 0.7 Init firstAP值是29.7,复现结果是30.15结果比较接近。

版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
本文链接:https://blog.csdn.net/qq_39621037/article/details/114935432

智能推荐

c# 调用c++ lib静态库_c#调用lib-程序员宅基地

文章浏览阅读2w次,点赞7次,收藏51次。四个步骤1.创建C++ Win32项目动态库dll 2.在Win32项目动态库中添加 外部依赖项 lib头文件和lib库3.导出C接口4.c#调用c++动态库开始你的表演...①创建一个空白的解决方案,在解决方案中添加 Visual C++ , Win32 项目空白解决方案的创建:添加Visual C++ , Win32 项目这......_c#调用lib

deepin/ubuntu安装苹方字体-程序员宅基地

文章浏览阅读4.6k次。苹方字体是苹果系统上的黑体,挺好看的。注重颜值的网站都会使用,例如知乎:font-family: -apple-system, BlinkMacSystemFont, Helvetica Neue, PingFang SC, Microsoft YaHei, Source Han Sans SC, Noto Sans CJK SC, W..._ubuntu pingfang

html表单常见操作汇总_html表单的处理程序有那些-程序员宅基地

文章浏览阅读159次。表单表单概述表单标签表单域按钮控件demo表单标签表单标签基本语法结构<form action="处理数据程序的url地址“ method=”get|post“ name="表单名称”></form><!--action,当提交表单时,向何处发送表单中的数据,地址可以是相对地址也可以是绝对地址--><!--method将表单中的数据传送给服务器处理,get方式直接显示在url地址中,数据可以被缓存,且长度有限制;而post方式数据隐藏传输,_html表单的处理程序有那些

PHP设置谷歌验证器(Google Authenticator)实现操作二步验证_php otp 验证器-程序员宅基地

文章浏览阅读1.2k次。使用说明:开启Google的登陆二步验证(即Google Authenticator服务)后用户登陆时需要输入额外由手机客户端生成的一次性密码。实现Google Authenticator功能需要服务器端和客户端的支持。服务器端负责密钥的生成、验证一次性密码是否正确。客户端记录密钥后生成一次性密码。下载谷歌验证类库文件放到项目合适位置(我这边放在项目Vender下面)https://github.com/PHPGangsta/GoogleAuthenticatorPHP代码示例://引入谷_php otp 验证器

【Python】matplotlib.plot画图横坐标混乱及间隔处理_matplotlib更改横轴间距-程序员宅基地

文章浏览阅读4.3k次,点赞5次,收藏11次。matplotlib.plot画图横坐标混乱及间隔处理_matplotlib更改横轴间距

docker — 容器存储_docker 保存容器-程序员宅基地

文章浏览阅读2.2k次。①Storage driver 处理各镜像层及容器层的处理细节,实现了多层数据的堆叠,为用户 提供了多层数据合并后的统一视图②所有 Storage driver 都使用可堆叠图像层和写时复制(CoW)策略③docker info 命令可查看当系统上的 storage driver主要用于测试目的,不建议用于生成环境。_docker 保存容器

随便推点

网络拓扑结构_网络拓扑csdn-程序员宅基地

文章浏览阅读834次,点赞27次,收藏13次。网络拓扑结构是指计算机网络中各组件(如计算机、服务器、打印机、路由器、交换机等设备)及其连接线路在物理布局或逻辑构型上的排列形式。这种布局不仅描述了设备间的实际物理连接方式,也决定了数据在网络中流动的路径和方式。不同的网络拓扑结构影响着网络的性能、可靠性、可扩展性及管理维护的难易程度。_网络拓扑csdn

JS重写Date函数,兼容IOS系统_date.prototype 将所有 ios-程序员宅基地

文章浏览阅读1.8k次,点赞5次,收藏8次。IOS系统Date的坑要创建一个指定时间的new Date对象时,通常的做法是:new Date("2020-09-21 11:11:00")这行代码在 PC 端和安卓端都是正常的,而在 iOS 端则会提示 Invalid Date 无效日期。在IOS年月日中间的横岗许换成斜杠,也就是new Date("2020/09/21 11:11:00")通常为了兼容IOS的这个坑,需要做一些额外的特殊处理,笔者在开发的时候经常会忘了兼容IOS系统。所以就想试着重写Date函数,一劳永逸,避免每次ne_date.prototype 将所有 ios

如何将EXCEL表导入plsql数据库中-程序员宅基地

文章浏览阅读5.3k次。方法一:用PLSQL Developer工具。 1 在PLSQL Developer的sql window里输入select * from test for update; 2 按F8执行 3 打开锁, 再按一下加号. 鼠标点到第一列的列头,使全列成选中状态,然后粘贴,最后commit提交即可。(前提..._excel导入pl/sql

Git常用命令速查手册-程序员宅基地

文章浏览阅读83次。Git常用命令速查手册1、初始化仓库git init2、将文件添加到仓库git add 文件名 # 将工作区的某个文件添加到暂存区 git add -u # 添加所有被tracked文件中被修改或删除的文件信息到暂存区,不处理untracked的文件git add -A # 添加所有被tracked文件中被修改或删除的文件信息到暂存区,包括untracked的文件...

分享119个ASP.NET源码总有一个是你想要的_千博二手车源码v2023 build 1120-程序员宅基地

文章浏览阅读202次。分享119个ASP.NET源码总有一个是你想要的_千博二手车源码v2023 build 1120

【C++缺省函数】 空类默认产生的6个类成员函数_空类默认产生哪些类成员函数-程序员宅基地

文章浏览阅读1.8k次。版权声明:转载请注明出处 http://blog.csdn.net/irean_lau。目录(?)[+]1、缺省构造函数。2、缺省拷贝构造函数。3、 缺省析构函数。4、缺省赋值运算符。5、缺省取址运算符。6、 缺省取址运算符 const。[cpp] view plain copy_空类默认产生哪些类成员函数

推荐文章

热门文章

相关标签