2021-03-31

18 篇热帖

1. 盖楼抽奖|为拿下算法 “奥斯卡”,阿里团队设计了一个冠军方案

被誉为计算机视觉领域 “奥斯卡” 的 CVPR 刚刚落下帷幕,2021 年首届 “新内容 新交互” 全球视频云创新挑战赛正火热进行中,这两场大赛都不约而同地将关注点放在了视频目标分割领域,本文将详细分享来自阿里达摩院的团队在 CVPR DAVIS 视频目标分割比赛夺冠背后的技术经验,为本届大赛参赛选手提供 “他山之石”。

作者|负天

与图像识别不同,AI 分析理解视频的技术门槛较高。长期以来,业界在视频 AI 技术的研究上鲜有重大突破。以 CVPR 会议难度最高的比赛之一 DAVIS ( Densely Annotated Video Segmentation )为例,该比赛需要参赛团队精准处理复杂视频中物体快速运动、外观变化、遮挡等信息,过去几年,全球顶级科技在该比赛中的成绩从未突破 80 分,而达摩院的模型最终在 test-challenge 上取得了 84.1 的成绩。

DAVIS 的数据集经过精心挑选和标注,视频分割中比较难的点都有体现,比如:快速运动、遮挡、消失与重现、形变等。DAVIS 的数据分为 train ( 60 个视频序列),val ( 30 个视频序列),test-dev ( 30 个视频序列),test-challenge ( 30 个视频序列)。其中 train 和 val 是可以下载的,且提供了每一帧的标注信息。对于半监督任务,test-dev 和 test-challenge,每一帧的 RGB 图片可以下载,且第一帧的标注信息也提供了。算法需要根据第一帧的标注 mask,来对后续帧进行分割。分割本身是 instance 级别的。

阿里达摩院:像素级视频分割

阿里达摩院提供了一种全新的空间约束方法,打破了传统 STM 方法缺乏时序性的瓶颈,可以让系统基于视频前一帧的画面预测目标物体下一帧的位置;此外,阿里还引入了语义分割中的精细化分割微调模块,大幅提高了分割的精细程度。最终,精准识别动态目标的轮廓边界,并且与背景进行分离,实现像素级目标分割。

基本框架

达摩院的算法基于 2019 年 CVPR 的 STM 做了进一步改进。STM 的主要思想在于,对于历史帧,每一帧都编码为 key-value 形式的 feature 。预测当前帧的时候,以当前帧的 key 去和历史帧的 key 做匹配。匹配的方式是 non-local 的。这种 non-local 的匹配,可以看做将当前 key,每个坐标上的 C 维特征,和历史每一帧在这个坐标上的 C 维特征做匹配。匹配得到的结果,作为一个 soft 的 index,去读取历史 value 的信息。读取的特征和当前帧的 value 拼接起来,用于后续的预测。

三大技术创新

1. 空间约束

STM 的特征匹配方式,提供了一种空间上的长依赖, 类似于 Transformer 中,通过 self-attention 来做序列关联。这种机制,能够很好地处理物体运动、外观变化、遮挡等。但也有一个问题,就是缺乏时序性,缺少短时依赖。当某一帧突然出现和目标相似的物体时,容易产生误召回。在视频场景中,很多情况下,当前帧临近的几帧,对当前帧的影响要大于更早的帧。基于这一点,达摩院提出依靠前一帧结果,计算 attention 来约束当前帧目标预测的位置,相当于对短期依赖的建模。

具体的方法如下图所示:

  1. 当前帧的特征和前一帧的预测 mask 在 channel 维度上做 concat,得到 HxWx (c+1) 的特征;
  2. 通过卷积将特征压缩为 HxW ;
  3. 用 sigmoid 函数将 HxW 的特征,压缩范围,作为空间 attention ;
  4. 把 attention 乘到原特征上,作为空间约束。

下图为空间 attention 的可视化结果,可以看到大致对应了前景的位置。

2. 增强 decoder

达摩院引入了语义分割中的感受野增强技术 ASPP 和精细化分割的微调( refinement )模块。ASPP 作用于 memory 读取后的特征,用于融合不同感受野的信息,提升对不同尺度物体的处理能力。

3. 训练策略

达摩院提出了一个简单但是有效的训练策略,减少了训练阶段和测试阶段存在的差异,提升了最终效果。

原始 STM 训练时,会随机从视频中采样 3 帧。这三帧之间的跳帧间隔,随着训练逐渐增大,目的是增强模型鲁棒性。但达摩院发现,这样会导致训练时和测试时不一致,因为测试时,是逐帧处理的。为此,在训练的最后阶段,达摩院将跳帧间隔重新减小,以保证和测试时一致。

其他

backbone: 达摩院使用了 ResNeST 这个比较新的 backbone,它可以无痛替换掉原 STM 的 resnet 。在结果上有比较明显提升。

测试策略: 达摩院使用了多尺度测试和 model ensemble 。不同尺度和不同 model 的结果,在最终预测的 map 上,做了简单的等权重平均。

显存优化: 达摩院做了一些显存优化方面的工作,使得 STM 在多目标模式下,可以支持大尺度的训练、测试,以及支持较大的 memory 容量。

数据: 训练数据上,达摩院使用了 DAVIS 、Youtube-VOS,以及 STM 原文用到的静态图像数据库。没有其他数据。

结果

达摩院的模型,最终在 test-challenge 上取得了 84.1 的成绩。

在 test-dev 上的消融实验。达摩院复现的 STM 达到了和原文一致的结果。在各种 trick 的加持下, 得到了 11 个点的提升。

随着互联网技术、5G 技术等的发展,短视频、视频会议、直播的场景越来越多,视频分割技术也将成为不可或缺的一环。比如,在视频会议中,视频分割可以精确区分前背景,从而对背景进行虚化或替换;在直播中,用户只需要站在绿幕前,算法就实时替换背景,实现一秒钟换新直播间;在视频编辑领域,可以辅助进行后期制作。

参考

  1. Oh SW, Lee JY, Xu N, Kim SJ. Video object segmentation using space-time memory networks. InProceedings of the IEEE International Conference on Computer Vision 2019
  2. Wang X, Girshick R, Gupta A, He K. Non-local neural networks. InProceedings of the IEEE conference on computer vision and pattern recognition 2018

“新内容 新交互” 全球视频云创新挑战赛算法挑战赛道

本届全球视频云创新挑战赛是由阿里云联手英特尔主办,与优酷战略技术合作,面向企业以及个人开发者的音视频领域的挑战赛。算法挑战赛道聚焦视频人像分割领域,视频分割将传统图像分割问题延伸到视频领域,可服务于视频理解处理和编辑等任务。

算法赛道描述

本次大赛提供一个大规模高精度视频人像分割数据集,供参赛选手训练模型。不同于传统的二值分割目标(即人像区域标注为 1,其他区域标注为 0 ),本竞赛重点关注分割各个不同的人象实例,目标是从视频中精确、稳定分割出显著的(单个或多个)人体实例,以及其相应附属物、手持物。

本次比赛分为初赛数据集和复赛数据集。复赛数据集等初赛结束后公布,复赛中也可以使用初赛数据集。

初赛环节提供训练集供选手下载,训练数据集共 1650 段视频。训练集中每个样本由 RGB 图像序列和掩码图像序列组成,RGB 图像序列为原始视频图像序列,格式为 jpg 文件;掩码图像为人体分割的真值 (ground-truth),格式为 png 文件,掩码图像中不同的像素值表示不同的人体实例,0 为背景区域,非 0 为前景区域(例如 1 为人像 1,2 为人像 2 )。RGB 和 png 文件是一一对应关系。数据集每个视频的长度为 80 帧~ 150 帧,每个视频的分辨率不完全相同。预赛的测试数据为 48 段视频。测试集只提供 RGB 图像序列。如出现多个人像实例,每个人像可以任意顺序标注,评测时将被独立计算。

本次比赛允许参数选手使用其他公开数据集和公开模型,但参赛选手的模型必须满足能在限定时间内复现的要求,复现精度小于规定误差。

评估标准

对于算法恢复的视频结果,本次比赛采用 Mean J And F 做为评价指标。J 为描述分割人体区域精度的 Jaccard Index,F 为描述分割人体的边界精确度。具体请参照参考文献 1 。每个视频允许选手最多输出 8 个人物分割结果,选手分割结果与真值先进行 IOU 匹配,找到对应的人物后,根据该结果进行评分。多余的分割结果,没有惩罚。如果超过 8 个区域,整个视频结果无效。

奖项设置

冠军:1 支队伍,奖金 9 万人民币,颁发获奖证书

亚军:2 支队伍,奖金 3 万人民币,颁发获奖证书

季军:3 支队伍,奖金 1 万人民币,颁发获奖证书

Cooper Lake 最佳实践:3 支队伍,奖金 2 万人民币,颁发获奖证书

此外,复赛审核通过的排名前 12 队伍,可进入阿里云校招绿色通道。

视频云大赛正在火热报名中 扫码或点击下方链接,一起驱动下一代浪潮! https://tianchi.aliyun.com/competition/entrance/531873/introduction


楼层抽奖规则

  • 评论回复内容不限,可以是视频云大赛相关提问、期望
  • 抽十个人,每人送一个保温杯
  • 截止日期为:2021.4.2 12:00
  • 从回复楼层中随机抽取
  • 中奖结果会以附言形式公布于本帖,并 @ 各位中奖用户
function createRandom(num,from,to)
{
    var arr=[]; 
    var json={};  
    while(arr.length<num)
    {
        var ranNum=Math.round(Math.random()*(to-from))+from;
        if(!json[ranNum])
        {
            json[ranNum]=1;
            arr.push(ranNum); 
        }
    }
    return arr;
}

createRandom(10,0,回复楼层) //抽奖

源码引自 yedanbo/createRandom().js

礼物图片 盖楼超 100 层,下次活动送电脑包~

2. 女朋友想在一线买房,我想在老家省会买房,如何处理?
如题。我和她都是一线普通的打工人,普通家庭。她很好,我们很相爱。但是在一起了就必须得面对买房以及定居这个现实的问题。

我是码农,她是产品经理,目前我们两收入持平,收入曲线呈上升趋势,但是 35 岁以后收入必然呈断崖式下跌。她认为却高收入是可持续的,想之后掏空所有储蓄以及未来的收入在一线买房。

本来我自己的打算就是躺平,完全没有在一线买房的打算。因为认识到自己是个普通人,掏空家底加自己出钱,能在老家省会买个房,找个班上着,生活也能过得有滋有味。

而她一直以来的想法就是在一线买房,很希望在大城市立足。就算没遇到我,她也打算自己在一线买,现在买不起就三十岁四十岁再买,认为房贷占自己收入的 50%都没关系。并且考虑到要持续工作还房贷,她以后也没有要小孩的打算。

但我的想法是,现在一线房价和打工人都卷成什么样子了,就算我们两咬咬牙付个首付买个老破小,将来还有沉重的房贷和各种生活开支等着我们,而且也没有什么抗风险能力,有个小病小灾,或者遇到失业危机,生活基本就维持不下去了。而且在一线也买不到多好的地段,都是偏远的郊区,各方面基础设施虽然不会差,但也不会多好,上下班通勤花的时间估计也很久。诶,何苦为了一套老破小承担这么大的生活压力和未来的风险呢?

难得遇到喜欢的人,却被现实按倒在地上,现在不知道该如何处理。或许是我没有能力吧。
3. 小米官网的前端有点敷衍呀!
小米换新 LOGO,虽然变化不大但好歹是请原研哉设计的,我看小米官网左上角 LOGO 就加了一个 border-radius: 19px;的样式,这也太敷衍了🐕



4. 有没有送过媳妇香水的,什么牌子推荐一下, 1000 以内吧,不要太刺鼻那种
5. 假如回到十年前,你会搞什么产品
十年前,iPhone4 精典上市
微博正热、微信还没出来
那时小米手机刚上市
手机行业进入全民升级换代的时候
手机 app 也如雨后春笋般萌牙

感叹时代的巨变,又觉得错过了好多
如果回到十年前,能做好什么产品,开发什么能成功
6. iphone11 不到 3 个月时间 电池能从 93%降到 80 以下吗?

如题 去年 618 买的手机 一直供着用 前段时间买了 anker 带散热的无线充电器发现电池寿命搜搜降 现在已经降到 93 了 还有不到 3 个月过保 请问有没有可能在过保之前将电池用到 80 以下然后去免费换新电池呢

7. 讨论 | 小米公司此次新 LOGO 事件对于公司方面是一次有利的宣传还是不利的影响?

前因:今天群内和微博几个地方讨论比较多的就是小米公司花重金请原研哉设计 LOGO 所引起的几个话题了。对于这个 LOGO 设计其实看法并不一致,所以稍微总结了下各方不同看法。

有利方的观点:你看这个 LOGO 所引发的话题讨论热度远胜于一次投资宣传,相当于花钱做了一次营销,看现在圈内圈外都在讨论小米这个 LOGO 了,对小米品牌宣传具有非常大的影响。这其实就是一次变相的宣传营销,营造话题,现在圈内圈外帮你做宣传,这钱反而投得很值。

不利方的观点:衡量这钱是否花得值,在于这东西所造成的宣传效果对于公司形象提升是否有利,如果有利,那么是一次成功的消费。如果是让别人看笑话,甚至可能拉低公司形象,那么这钱花得不值。目前来说,小米公司新 LOGO 属于后者,并且不少圈外看戏认为“这 XX (言辞激烈)公司花重金请知名设计师花 3 年结果做出了这样一个东西。”

中立方的观点:其实就是花钱请原研哉站台宣传,如果小米要做中国的无印良品,那么请原研哉站台再合适不过。小米团队内部做不出这样的设计吗?当然做得出。但是毕加索随便画一条直线和普通人随便画一条直线带来的价值从一开始就不一样,哪怕这条直线完全一致。

各位 V 友怎么看?

8. 关于 iPhone 选择, 11 还是 12?
因为最近刚订了车,一方面看网上写 CarPlay 很香想尝试一下,一方面烦了手里的粗粮。所以准备换个 iPhone,但是不知道换 11 还是 12 。
去年中奖一台 11 给家人用了,我自己偶尔用一下的感受是硬件的质感和系统流畅度感觉非常好,但是相比安卓缺少一些很实用的功能(主要是骚扰拦截)。
平时手机算是轻度使用,不玩游戏,视频看的也少,但是每天使用时间比较长一些。习惯手边有充电器就插上,不管电量还有多少。
对于选择 11 还是 12 有一些问题请教下
1 )性能差距。我估计日常使用差别不会很大,但是在 CarPlay 上会比较明显吗?(迫于丰田,需要用 CarPlay 盒子转接)
2 )拍照差距。下半年要添小宝宝,估计以后日常随手拍会变多。11 和 12 的拍照差距是否明显?
3 )续航差距。鉴于电量不满会死,续航能力好一些能让自己舒服一些(😂。
9. 大家都是怎么认识那么多车牌的?

如题,从小对车就不是很感冒,导致现在都工作了车牌也不认识几个,就认识宝马大众奔驰一些。

看身边朋友基本都是能街上来一辆报一个牌子,有的甚至还能报出型号。

有没有汽车入门科普之类的推荐?在网上搜入门一般都在科普发动机啥的,就想多认识几个牌子,以后买车也不用像无头苍蝇一样

10. RDP 安全吗?
好像 TLS 最高支持 1.0 版本,而且经常看到窃听 RDP 连接的文章( https://www.jianshu.com/p/dcf0cce5857b Google 上随便搜索的,和我无关)是否说明 RDP 不安全?那么如何安全的远程连接公网 Windows 机器办公呢?
11. AOC 卢瓦尔 4K 显示器入手体验

迫于装了黑苹果 原来的 2k 显示器颗粒感太强 就琢磨换了 4k 显示器 考虑了几款 最后选了 AOC LV273HUPR 因为之前 1080p 和 2k 显示器用的都是 AOC 的 感觉很好 就直接下单了
优点:
1.性价比高,27 寸 4K HDR 2199
2.接口丰富 ,HDMI DP type C 支持 kvm
缺点:
1.默认是暖色模式,修改为正常之后,感觉颜色有点淡,亮度也不高,观感还没有之前的 2K 好。
2.做工有点 low,尤其是底座,真的无法接受金属拉丝这种工艺,还不如中端的塑料材质。

我在考虑要不要退掉 实在接受不了那个底座 有差不多价位的产品推荐吗?
V2erForiOS

12. 谷歌收集用户数据是苹果的 20 倍

调查显示,安卓用户被收集的用户数据是苹果的 20 倍

13. 海外留学生想入 Java 的坑,请各位大佬给给建议

我的本科是重庆一普通 211 (计算机科学与技术专业),现在在新西兰奥克兰大学(比较垃圾,QS 排名 83 )读数据科学硕士,预计今年 12 月完成课程和毕设,明年 6 月拿毕业证(对于大部分公司应该会算成 22 届吧?)。

本科的时候混了 4 年,最后勉强考了个雅思出国读研。不过现在才发现自己完全学不懂数据科学这个专业的东西,因为数学不好,统计、算法相关的课程都是煎熬着硬学。另外听说现在算法相关岗位都是神仙打架,我自认为自己的在数学这方面完全没有和别人竞争的资本和实力,所以基本已经放弃毕业后走算法这条路了。

有个学霸同学建议我毕业过后转 Java,但是我只在本科毕设在半抄半瞎写的状况下做过一个很简单的 CRUD 项目,Java 相关知识以及计网、操作系统、数据库相关的知识都忘掉了许多。现在买了几本书( java 核心技术卷一、Head First Servlets & JSP 、深入理解 Java 虚拟机)在看,感觉知识点很零散,看了过后很容易就会忘记,学习效率很差。

想过去找实习,然而按照我现在掌握的水平,估计连外包都不会要我。另外按照校招的时间安排来说,今年 7 月我应该就得去参加秋招了。。。

说了这么多废话,其实还是想请各位能就下面问题给我一点点参考建议:

  1. 实习对于之后秋招的影响大吗?如果只是普通小厂甚至是外包的实习,有必要去吗?(其实如果有小厂要我就已经谢天谢地了)
  2. 各位有什么好的项目教程可以推荐吗?我觉得有一个项目把之前的知识点串起来应该能对知识的理解吸收有很大帮助
  3. 各位还有其他的岗位发展路线可以推荐的吗?(虽然算法岗干不了,但是数据分析或者大数据开发这种数学要求低一点的说不定还可以试试?我另一个同学认为我把研究生学的东西全扔了去卷 Java 并不明智。。。不过我对其他岗位的工作内容还有发展方向都不是很熟,希望各位赐教)

谢谢各位啦

PS:我们研究生的课程主要包括用 R 语言进行各种模型拟合、数据分析,也会涉及到各种机器学习的东西。

14. 话题探讨:如何定义”努力“

最近上班路上,和媳妇儿探讨到了此话题(为了避免性别影响大家的讨论,以下匿名为 A 与 B )。

A 表示:一个人为此事花费的时间越长,就越“努力”。 B 表示:一个人成功了(达到了既定目的),才能倒推为其“努力”了。否则就并不算努力。

A 的论据主要在于:努力和成功,并没有因果性,甚至没有严谨的相关性。所以不能依靠成功来定义努力。而为此沉浸的时间,是量化的,更能准确的定义“努力”。

B 的论据主要在于:努力是过程,不是结果。努力存在的前提其实是方向正确。换句话说,主观的定义应该遵从“果因论”。既成功了,才配谈努力。

由此就可以引申出很多现实问题。 比如情侣、夫妻批判对方“不努力”,是不是自己贪婪的物欲不能从对方身上得到满足的“遮羞布”?等等。

不知道 v 友们有没有自己的见解,或者你支持哪方?

15. 落地 20-30w 里注重舒适 隔音好 安全好的车

如题,兄弟们有啥好的推荐

17. 入职两天就离职跑路,对简历有影响吗,或者会不会被后面的背调查到

29 号入职了某某厂,入职以后发现和说好的工作时长不一样,( 1075 实际 1095 )项目又乱,技术架构老套,团队技术也一般。所以决定跑路,但是怕后面会不会被查到。 有没有资深大厂 hr 出来说一下啊

18. JingOS v0.8 发布了
各位关注 JingOS 的小伙伴们,

我们在一月份发布了 JingOS v0.6 。这个版本的主要目的是给用户一个 JingOS 想做的事情的初步概念,但也确实有很多需要改进的。
今天我们发布最新版本比较完善的 JingOS v0.8 。这个版本相较于 v0.6 提升了很多。

JingOS v0.8 主要改进包括:
1. 预置鲸鲮设置应用,支持 WiFi, 音量,亮度等基础功能
2. 预置鲸鲮文件管理器
3. 预置鲸鲮应用商店
4. 支持系统在线升级
5. 装机引导加入密码设置及网络配置
6. 任务管理器功能完善和体验优化
7. 支持桌面图标拖拽排序
8. 实现非 HD 应用自动拉伸以适应高分屏使用(是否合入最后版本待定)
9. 修复已知系统 bug

此外,我们还将在 6 月之前开始 JingPad A1 的众筹销售,也会在 6 月底发布 JingOS v1.0 。
欢迎加入我们的社区获取最新资讯,以及与其他用户交流。

下载请访问:JingOS.com