位置:首页  >  详情页
靠的居然是quot看两遍q:uot
来源:腾讯视频 编辑:林玉婷 2026-09-20 22:04:50


2014年,如果你是一个研究视频动作识别的学者,你手里最好用的工具不是神经网络。

这句话放在今天听起来有点荒诞。深度学习在图像分类上已经把传统方法打得七零八落,AlexNet 在 2012 年一战封神,整个计算机视觉圈子都在往神经网络转向。但视频这个领域却是个例外。

当时公认最强的动作识别方法叫密集轨迹

密集轨迹(Dense Trajectories)*:一种手工设计的特征提取方法,通过跟踪视频里密集分布的点的运动轨迹,再手工统计这些轨迹周围的图像和运动特征,来判断视频里发生了什么动作。

这套方法在标准测试集上能做到接近 90% 的准确率,而当时试图用深度网络处理视频的几个工作,准确率普遍卡在 65% 到 70% 之间,差了整整 20 个百分点。这不是小差距,这意味着深度学习在识别每 5 个动作里,就要比手工方法多认错 1 个。

为什么深度学习在图像上大杀四方,到视频这里却哑火了?答案藏在一个容易被忽略的事实里:视频不是"会动的图片",动作识别真正需要的信息根本不在画面的样子里,而在画面怎么变化。一个人挥手和放下手臂,单看某一帧的画面可能几乎一样,区别只在于手在往哪个方向移动。而当时的神经网络,包括那些直接把视频帧堆起来喂进 3D 卷积网络的尝试,都在拼命学习"画面长什么样",却没有专门的机制去捕捉"画面怎么变"。

这就是 Karen Simonyan 和 Andrew Zisserman 在 2014 年那篇论文里想解决的问题。他们提出了一个后来影响深远的架构,叫双流卷积网络

双流网络(Two-Stream Convolutional Networks)*:一种把视频拆成两条独立处理路径的深度学习架构,一条专门看画面内容,一条专门看运动信息,最后把两条路径的判断结果融合起来。

把视频拆成两条河:空间流和时间流

双流网络的核心想法说出来其实很朴素:如果一个网络同时学"长什么样"和"怎么动"太难,那就干脆分成两个网络,一个只负责学样子,一个只负责学动作,最后把两边的判断合并。

第一条路径叫空间流

空间流(Spatial Stream)*:输入是视频里的单独一帧静止图像,负责识别画面中的物体、场景、人物姿态等静态视觉信息,本质上跟做图像分类没什么区别。

这条路径要做的事情,其实跟 AlexNet 在 ImageNet 上做的事情高度相似,输入一张图,判断里面有什么。作者甚至直接借用了在图像分类任务上预训练好的网络权重来初始化空间流,因为静态图像的识别本质是相通的,没必要从零学。

第二条路径叫时间流

时间流(Temporal Stream)*:输入不是原始图像,而是光流场,专门捕捉画面中每个像素点在相邻帧之间的运动方向和速度。

这里就要提到一个新概念,光流

光流(Optical Flow)*:描述视频中每一个像素点从上一帧移动到下一帧时的位移方向和幅度,通常用两张图表示,一张记录水平方向的位移,一张记录垂直方向的位移。

时间流输入的不是普通照片,而是提前用传统算法计算好的光流图。这一步很关键,因为它相当于把"运动"这个抽象概念,提前翻译成了一种网络能直接看懂的图像格式。网络不需要自己去猜两帧之间发生了什么变化,光流已经把变化算好摆在那里了,网络只需要从这些运动模式里学出"这是挥手"还是"这是踢腿"。

这个设计像什么?

想象你要判断一段监控录像里发生了打架还是拥抱。如果只给你一张静止的照片,两个人抱在一起,你很难分辨这是友好的拥抱还是激烈的扭打,因为姿态可能长得很像。但如果给你的是"运动轨迹图",显示两人手臂在快速大幅度摆动还是缓慢环抱,答案立刻清晰了。如果不把这两种信息分开处理,硬塞给一个网络同时学,网络很可能会被画面内容带偏,比如看到两人靠得很近就倾向于判断成拥抱,而忽略了真正决定性的运动线索。分流处理的代价是要训练两个网络,计算量翻倍,但换来的是每条路径都能专心把自己的信号学到位,不被另一种信息干扰。

![双流网络架构图]

论文里的架构图画得很直白,左边空间流吃进单帧图像,经过一串卷积层后输出一个动作类别的预测分数,右边时间流吃进堆叠起来的多帧光流图,经过类似的卷积结构后也输出一个预测分数,最后两边的分数用某种方式融合成最终答案。这种"分头判断,最后投票"的结构,后来成了视频理解领域极其常见的范式。

为什么要把好几帧的光流堆在一起

单独看一帧光流够不够?作者的答案是不够。

一个完整的动作往往持续十几帧甚至几十帧,如果时间流每次只看相邻两帧算出来的一张光流图,网络看到的运动信息片段太短,很难把握动作的整体节奏。比如"挥手"这个动作,手臂从下往上再往下摆动,如果只截取其中极短的一瞬间,可能只捕捉到手臂正在往上抬,这和"举手"很难区分。

所以论文里时间流的输入不是一张光流图,而是把连续多帧(论文里用的是 10 帧)计算出来的光流水平分量和垂直分量全部堆叠在一起,作为一个多通道的输入喂给网络。这样网络看到的是一小段时间窗口内完整的运动轨迹,而不是某个瞬间的运动快照。

这就好比你想判断一个人在做深蹲还是摔倒了,只看他膝盖弯曲那一瞬间的照片是不够的,你需要看他连续几秒钟的动作,才能判断这个弯曲之后是站起来了还是倒地了。如果不堆叠多帧光流,只喂给网络单帧信息,网络就像只看了动作的一帧快照,缺乏足够的时间上下文去判断动作的走向,容易把节奏不同但姿态相似的动作搞混。

论文里还专门做了实验对比堆叠不同帧数光流的效果,发现堆叠帧数增加确实能提升准确率,但收益会逐渐变小,这提示动作识别需要的时间窗口是有限的,不是越长越好。

光流该怎么算才靠谱,作者还纠结了另一件事

时间流依赖光流的质量,如果光流算得不准,后面的网络再强也没用。计算光流本身是计算机视觉里一个历史悠久的经典问题,有很多现成算法。作者在论文里对比了不同光流计算方式对最终识别准确率的影响,发现使用更精细的光流计算方法确实能带来提升,但差距不算悬殊,说明网络本身对光流质量有一定的容错能力,不是那种"差之毫厘谬以千里"的脆弱系统。

另外一个细节是,作者还尝试了给光流图做一种叫"均值消减"的简单处理,也就是把每张光流图减去整体的平均运动,用来消除摄像机本身晃动带来的整体位移干扰。这个操作背后的逻辑是,很多视频是手持拍摄的,摄像机本身的抖动会给画面里所有物体带来一个共同的位移,这个位移和动作本身无关,是噪音。减去这个平均位移之后,剩下的才是物体相对于背景的真实运动,也就是动作本身产生的运动。

这个处理很像你在嘈杂的餐厅里想听清对面朋友说话,餐厅里的背景噪音是所有声音的共同底噪,如果不做任何降噪处理,你听到的是朋友说话声和背景噪音混在一起的结果,很难分辨清楚。而摄像机抖动造成的整体位移,就是光流场里的"背景噪音",减去它之后,动作本身的运动信号才能更干净地凸显出来。

两条路径的判断怎么合并成一个答案

空间流给出一个预测,时间流给出另一个预测,最后怎么决定最终结果?

论文里试验了几种融合方式,最简单的是直接把两条路径输出的分类分数做平均,另一种更复杂一点的方式是训练一个小型的分类器,把两条路径的分数当作输入特征,学习一个更聪明的组合方式。实验结果显示,用训练出来的融合方式比简单平均效果更好一些,但差距不是特别大,说明简单平均已经能捕捉到两条路径信息互补的大部分价值。

这里有个数据特别值得拎出来说。单独用空间流,在标准测试集 UCF-101 上能达到大约 73% 的准确率,单独用时间流能达到大约 83.7%,而把两者融合之后,准确率跳到了 88% 左右。时间流单独的表现居然比空间流强了整整 10 个百分点,这个结果本身就很说明问题,运动信息对判断动作类别的重要性,甚至超过了画面内容本身。这也从实验层面印证了论文最初的判断,动作的本质是变化,不是静态的样子。

数据不够怎么办,作者借了别人家的仓库

深度网络出了名的"吃数据",而 2014 年的时候,专门用于动作识别的视频数据集规模都不大,最大的 UCF-101 也只有大约 13000 段视频,远远不够训练一个从零开始的深层网络。

作者的解决办法是多数据集联合训练

多任务学习(Multi-task Learning)*:让同一个网络同时在多个不同但相关的任务上训练,共享底层特征提取能力,只在最后输出层区分不同任务。

具体来说,他们把 UCF-101 和另一个数据集 HMDB-51 放在一起训练,网络的大部分结构共享,只在最后加了两个独立的输出分支,分别对应两个数据集各自的动作类别体系。这样网络能从两份数据里学到的运动模式互相借力,即使单个数据集数据量不够,合在一起训练出来的特征也更扎实。

这有点像一个学徒同时在两家风格不同但技艺相通的木匠铺子里打杂学习,单独在一家店可能接触到的活儿种类有限,学得慢,但同时在两家店轮着干,接触的木料、工具和手法更丰富,反而能更快掌握木工的通用技巧。如果不这样做,只用单一数据集从零训练,模型很容易因为数据量不足而过拟合,也就是在训练集上表现很好,换到新视频上就露馅。

最终成绩单和它带来的震动

论文最后在两个标准数据集上给出的成绩,UCF-101 上达到 88.0% 的准确率,HMDB-51 上达到 59.4%。

这两个数字放在 2014 年是什么概念?之前提到的手工特征方法密集轨迹,在 UCF-101 上大约是 87.9%,几乎是打了个平手,而在有些改进版的密集轨迹方法上,手工特征甚至还能略微领先。但这已经是历史性的一刻,这是深度学习第一次在视频动作识别这个任务上,追平甚至开始逼近手工设计特征的水平。要知道,在这篇论文之前,纯深度学习方法在这个任务上的最好成绩普遍卡在 65% 到 70%,双流网络一下子把这个数字拉高了将近 20 个百分点。

这个分量放到当年的语境里,不亚于 AlexNet 在 ImageNet 图像分类比赛上横空出世那一刻带来的震动。区别在于,图像分类的胜利来得更早更响亮,视频动作识别这个战场,深度学习是晚了两年才补上这一课。

这篇论文之后,故事怎么继续

双流网络这个思路提出之后,很快成了整个视频理解领域接下来几年的主流范式,几乎所有后续工作都在这个骨架上做文章。

2016 年,Feichtenhofer 等人发表的论文进一步研究了空间流和时间流之间应该在网络的哪一层进行信息交互,而不是等到最后输出层才简单融合,他们提出让两条路径在中间层就开始互相传递信息,进一步提升了准确率。

2017 年,Carreira 和 Zisserman(没错,Zisserman 本人也参与了这篇后续工作)发表了 I3D 网络,把双流网络里的 2D 卷积换成了 3D 卷积,直接在三维时空维度上做卷积操作,同时还引入了一个规模远超以往的大型视频数据集 Kinetics 用于预训练,把动作识别的准确率又往上推了一大截,在 UCF-101 上达到了 98% 左右的水平。

这两篇后续工作有一个共同的特点,它们都没有推翻双流网络提出的核心洞察,动作识别需要分别捕捉外观和运动信息,它们做的是在这个洞察之上,寻找更精细的实现方式。这也从另一个角度说明,双流网络这篇论文抓住的不是一个技巧性的小改进,而是一个关于视频理解本质的判断。

Q&A

Q1:双流卷积网络是什么?

A:双流卷积网络是 Simonyan 和 Zisserman 在 2014 年提出的视频动作识别架构,把视频拆成两条独立处理路径,一条空间流负责识别画面内容,一条时间流通过光流场专门捕捉运动信息,最后融合两条路径的判断结果。

Q2:双流网络和之前的手工特征方法比效果怎么样?

A:双流网络在 UCF-101 数据集上达到 88.0% 准确率,基本追平了当时最强的手工特征方法密集轨迹(约 87.9%),而在此之前纯深度学习方法普遍只有 65% 到 70%,差距被拉近了近 20 个百分点。

Q3:为什么动作识别需要单独处理运动信息,不能只看画面?

A:因为很多动作单看某一帧画面几乎一样,区别只在于身体部位往哪个方向移动。实验显示单独用时间流(运动信息)的准确率达到 83.7%,比单独用空间流(画面内容)的 73% 还高出 10 个百分点,说明运动信息对判断动作类别更关键。

写在后面

看这篇论文最触动我的地方,是那个 10 个百分点的对比,单独用时间流比单独用空间流表现还好。这个结果有点反直觉,因为我们平时理解一个动作,第一反应总是"看起来像什么",而不是"在往哪个方向移动"。但网络的表现告诉我们,至少对机器来说,运动本身携带的信息量,可能比静态的样子更丰富、更少歧义。

这也让我想到,人类判断很多事情的时候,是不是也过度依赖了"表面长什么样",而低估了"变化的方向"?比如判断一段关系是不是在变好,看某个瞬间的相处画面,可能远不如看这段关系过去几个月的变化轨迹来得准确。

这篇论文没解决的问题是,双流网络的两条路径是完全独立训练的,信息只在最后才交换,这多少是一种妥协,如果画面内容和运动信息能在更早的阶段就互相印证呢?这个问题后来的研究者确实接着追问下去了,但那已经是另一段故事。

天博电子的技术优势,探索天博电子的市场潜力【哔哩哔哩】_【bilibili】 靠的居然是quot看两遍q:uot
天博电子

https://xin.abies.asia/ArTitle/DeTails/984130.sHtML

「活动」首次登录送38积分

786.58MB
版本V7.97.07
下载天博电子安装你想要的应用 更方便 更快捷 发现更多
喜欢 32%好评(30人)
评论 76
天博电子的技术优势,探索天博电子的市场潜力 天博电子截图1 天博电子截图2 天博电子截图3 天博电子截图4
详细信息
  • 软件大小 041.39MB
  • 最后更新 2026-09-20 22:04:50
  • 最新版本 V4.68.10
  • 文件格式 apk
  • 应用分类 ios-Androidxpj体育信誉
  • 使用语言 中文
  •  需要联网
  • 系统要求 7.15以上
应用介绍
一.喜洋洋棋牌  济源百度seo关键词排名优化的重要性,提升网站流量与曝光度 e路发登陆体育
二.乐趣彩票官网  南京天之涯网络科技有限公司seo策略解析,提升网站流量与排名之道
三.新宝平台登陆AV网站  内江抖音seo优化关键词怎么做,提升视频曝光率与流量转化
四.辽宁快乐12计算窍门  闵行区seo快排优化十大排名,助力企业网络营销效果提升
五.宝格平台App  万次霸屏茄尉乐云seo专家的有效策略,深入解析万次霸屏茄尉乐云seo专家的实践
六.五福彩票app下载送十五  seo 数据分析如何知道你的共走,深入探讨数据分析在seo中的重要性seo是什么意思知乎关键词推广,深入理解关键词在SEO中的作用
七.顶点网址  四川抖音搜索seo技术比较好,提升流量与曝光率的重要手段
八.新金泰国际网站  成都网站推广一乐云seo十年,探索数字营销新机遇

【联系我们】
客服热线:400-5466-8483
加载更多
版本更新
V3.64.64
seo3孤电子对数的计算公式,深入解析其实际应用与误区

类似软件

猜你喜欢

包含 97久久香蕉国产线看观看 的应用集
评论
  • 南湖区一站式seo推广哪家好,选择合适的服务提升网站流量 9天前
    网站几百个二级目录的优化策略,提升SEO效果的实践经验
  • 成都网站营销优选乐云seo十年,助力企业提升网络竞争力 2天前
    深入了解seo搜索引擎优化的实施流程图,探索实际操作中的关键环节
  • 阜阳推广抖音seo优化要多少钱,了解实际费用与服务内容 3天前
    深入理解seo关键词排名的策略与挑战,仟金手指科杰七的实践经验
  • 怎么做seo推广捌金手指花总二八,探索有效策略与实际应用 3天前
    北京网站营销的发展现状,乐云seo十年的实践与反思
  • 深入了解广州seo关键词优化费用多少钱,揭示影响费用的关键因素 0天前
    北京网址优化乐云seo十年一,探索数字营销的深远影响
  • 怎么做seo推广毫金手指花总二四,提升网站流量与曝光度 6天前
    上海b2b群发就选乐云seo, 提升营销效率与精准度
  • 做百度推广和做SEO优化的区别,了解各自优势与劣势 6天前
    自贡百度seo搜索引擎优化方案,提升网络可见性与用户体验
  • 杭州整合营销十年乐云seo的演变与实践,探索行业趋势与发展方向 9天前
    掌握seo关键词软件3优联,火星完美助力网站优化
  • 锡林郭勒盟seo优化关键词的重要性,提升网站排名与曝光度 4天前
    长尾词排名系统推荐乐云seo包,提升网站流量与转化率
  • 服务器稳定性对seo有影响吗,如何影响网站排名和用户体验 4天前
    连云港seo关键词霸屏怎么做,提升网站流量与曝光率