跳转到主要内容

视频反向搜索:从视频里找到一个人

没有任何人脸搜索引擎会直接搜索视频文件,FaceSearch 也只接受 JPEG、PNG 和 WebP 图片。要找到出现在视频里的人,请暂停在面部清晰且大致正对镜头的一帧,把这一帧保存为图片,再对它运行人脸反向搜索。

最后审校

要点

  • 视频本身不是可搜索的输入,从中取出的一帧才是。
  • 挑选人物面向镜头且没有在移动的一帧,然后裁剪到头部和肩膀。
  • 暂停帧通常比照片更软,所以要选安静的瞬间而不是最精彩的瞬间。
  • 在视频里找到这个人,和找到视频的出处,是两件不同的事,用的工具也不同。
  • 来自高压缩或弱光素材的帧经常失败。换一帧再试,比把同一帧再跑一次更划算。

可以对视频做反向搜索吗?

以视频的形式不可以。没有任何引擎接受视频文件并返回其中的人物,FaceSearch 也不例外:它的上传只接受 JPEG、PNG 和 WebP 图片。人们所说的视频反向搜索,实际上是一个两步操作。先取出单独一帧,再把这一帧当作普通图片来搜索。决定这次搜索成败的一切,都在挑选这一帧的时候就已经定了。

如何从视频里取出一帧可用于搜索的画面?

每个平台都提供某种截取静帧的方式,不需要专门的软件。方式本身不重要,重要的是挑哪个瞬间。

  • 播放视频,暂停在面部静止、有光、并且大致朝向镜头的瞬间。
  • 如果播放器支持,就逐帧微调。许多网页播放器在暂停时可以用逗号和句号键前后移动一帧。
  • 截图,然后裁剪到头部和肩膀,让面部成为画面中最大的元素。
  • 把裁剪结果保存为 PNG 而不是重新压缩的 JPEG,这样可以避免叠加第二轮压缩痕迹。
  • 上传前把保存的图片放大到原始尺寸检查一遍。如果眼睛和嘴角的边缘看起来糊成一团,就换一帧。

该挑哪一帧?

最好的一帧是安静的瞬间,而不是精彩的瞬间。运动是人脸匹配的天敌,因为移动中的面部会在曝光时间里拖出模糊,匹配所依赖的精细几何结构会被抹掉。一个人在倾听时的画面,比同一个人说到一半时的画面更好用。

优先选择尽量避免原因
停顿或保持住的表情动作中或说话中运动模糊会彻底抹掉五官细节
面部转向镜头侧脸或目光转开侧脸会遮住一半用于比对的几何结构
稳定均匀的光线逆光或频闪场景剪影和偏色会让五官变平
近景或放大的镜头远景或人群画面小小一张脸经不起压缩
原始上传画质对播放中的视频录屏每一次重新编码都会让瑕疵叠加

为什么视频帧比照片更难匹配?

视频的一帧,本来就是比照片更差的照片。视频压缩把细节分配给帧与帧之间的变化,而不是任何单独一帧的清晰度,因此暂停下来的一帧会带有肉眼可见的方块和涂抹,而同一场景的静态照片不会有。果冻效应会让移动的面部变形,弱光素材比弱光照片噪点更多,因为每一帧的曝光时间都很短,而任何一次重新上传又会把整段再压缩一遍。这就是为什么同一个人用头像照片很容易匹配上,用那张头像所出自的视频里的一帧却可能失败。

如何找到视频的出处而不是其中的人?

找到视频从哪里来,是另一件事,需要另一种工具。人脸搜索回答的是画面里是谁,因此它对一段没有署名的片段、一次被转发的直播,或者一个疑似深度伪造内容的源头都帮不上忙。要追溯出处,请取一个关键帧或封面图,用通用的以图搜图跑一遍,它会在全网寻找该文件的副本和视觉上相似的场景。当两个问题都重要时,就先后各跑一次:用图片搜索找这段素材被发布在哪里,用人脸搜索找出现在里面的是谁。

直播和录屏怎么办?

规则相同,只是要多考虑一层画质损失。录屏是对已经为传输而压缩过的素材再编码一次,因此从直播录屏里取出的一帧,距离原始素材已经隔了两代,通常是能拿到的最差输入。如果平台提供直接截图的功能,就用它,而不要先录屏再从中取帧;同时尽量挑直播没有为了跟上带宽而降低画质的那段。