视频反向搜索:从视频里找到一个人
没有任何人脸搜索引擎会直接搜索视频文件,FaceSearch 也只接受 JPEG、PNG 和 WebP 图片。要找到出现在视频里的人,请暂停在面部清晰且大致正对镜头的一帧,把这一帧保存为图片,再对它运行人脸反向搜索。
最后审校
要点
- 视频本身不是可搜索的输入,从中取出的一帧才是。
- 挑选人物面向镜头且没有在移动的一帧,然后裁剪到头部和肩膀。
- 暂停帧通常比照片更软,所以要选安静的瞬间而不是最精彩的瞬间。
- 在视频里找到这个人,和找到视频的出处,是两件不同的事,用的工具也不同。
- 来自高压缩或弱光素材的帧经常失败。换一帧再试,比把同一帧再跑一次更划算。
可以对视频做反向搜索吗?
以视频的形式不可以。没有任何引擎接受视频文件并返回其中的人物,FaceSearch 也不例外:它的上传只接受 JPEG、PNG 和 WebP 图片。人们所说的视频反向搜索,实际上是一个两步操作。先取出单独一帧,再把这一帧当作普通图片来搜索。决定这次搜索成败的一切,都在挑选这一帧的时候就已经定了。
如何从视频里取出一帧可用于搜索的画面?
每个平台都提供某种截取静帧的方式,不需要专门的软件。方式本身不重要,重要的是挑哪个瞬间。
- 播放视频,暂停在面部静止、有光、并且大致朝向镜头的瞬间。
- 如果播放器支持,就逐帧微调。许多网页播放器在暂停时可以用逗号和句号键前后移动一帧。
- 截图,然后裁剪到头部和肩膀,让面部成为画面中最大的元素。
- 把裁剪结果保存为 PNG 而不是重新压缩的 JPEG,这样可以避免叠加第二轮压缩痕迹。
- 上传前把保存的图片放大到原始尺寸检查一遍。如果眼睛和嘴角的边缘看起来糊成一团,就换一帧。
该挑哪一帧?
最好的一帧是安静的瞬间,而不是精彩的瞬间。运动是人脸匹配的天敌,因为移动中的面部会在曝光时间里拖出模糊,匹配所依赖的精细几何结构会被抹掉。一个人在倾听时的画面,比同一个人说到一半时的画面更好用。
| 优先选择 | 尽量避免 | 原因 |
|---|---|---|
| 停顿或保持住的表情 | 动作中或说话中 | 运动模糊会彻底抹掉五官细节 |
| 面部转向镜头 | 侧脸或目光转开 | 侧脸会遮住一半用于比对的几何结构 |
| 稳定均匀的光线 | 逆光或频闪场景 | 剪影和偏色会让五官变平 |
| 近景或放大的镜头 | 远景或人群画面 | 小小一张脸经不起压缩 |
| 原始上传画质 | 对播放中的视频录屏 | 每一次重新编码都会让瑕疵叠加 |
为什么视频帧比照片更难匹配?
视频的一帧,本来就是比照片更差的照片。视频压缩把细节分配给帧与帧之间的变化,而不是任何单独一帧的清晰度,因此暂停下来的一帧会带有肉眼可见的方块和涂抹,而同一场景的静态照片不会有。果冻效应会让移动的面部变形,弱光素材比弱光照片噪点更多,因为每一帧的曝光时间都很短,而任何一次重新上传又会把整段再压缩一遍。这就是为什么同一个人用头像照片很容易匹配上,用那张头像所出自的视频里的一帧却可能失败。
如何找到视频的出处而不是其中的人?
找到视频从哪里来,是另一件事,需要另一种工具。人脸搜索回答的是画面里是谁,因此它对一段没有署名的片段、一次被转发的直播,或者一个疑似深度伪造内容的源头都帮不上忙。要追溯出处,请取一个关键帧或封面图,用通用的以图搜图跑一遍,它会在全网寻找该文件的副本和视觉上相似的场景。当两个问题都重要时,就先后各跑一次:用图片搜索找这段素材被发布在哪里,用人脸搜索找出现在里面的是谁。
直播和录屏怎么办?
规则相同,只是要多考虑一层画质损失。录屏是对已经为传输而压缩过的素材再编码一次,因此从直播录屏里取出的一帧,距离原始素材已经隔了两代,通常是能拿到的最差输入。如果平台提供直接截图的功能,就用它,而不要先录屏再从中取帧;同时尽量挑直播没有为了跟上带宽而降低画质的那段。