跳转到主要内容

人脸搜索术语表

人脸反向搜索的词汇一半来自机器学习,一半来自隐私法,而这两个领域对某些相同的词的用法并不一致。以下是你在阅读搜索结果或阅读相关法规时会遇到的术语,用通俗语言解释,并附上它在实践中为何重要。

最后审校

最常被误解的

  • 嵌入向量是对一张脸的「描述」,而不是这张脸的图片,且无法还原成照片。
  • 置信度分数衡量的是两张脸的相似度,而不是「你判断正确」的概率。
  • 误报是指两个不同的人被判为匹配,这正是会造成伤害的那类错误。
  • 生物识别标识符是一个法律概念,多数人脸隐私法规规范的正是它。
  • 以图搜图与人脸反向搜索,是对同一个文件执行的两种不同操作。

什么是人脸嵌入向量?

嵌入向量是模型从一张人脸中提取出的数值描述:一组定长数字,刻画五官之间的几何关系。它不是被压缩的照片,也无法反向还原成照片。同一个人的两张照片,其嵌入向量在这个数值空间中彼此靠近;不同人的两张照片,其嵌入向量则相距较远。人脸搜索所做的一切,本质上就是在测量这个距离。

什么是置信度分数?

置信度分数表达的是两张脸有多相似,量表由系统自行定义。它很容易被误读为「这次匹配正确的概率」,但它不是。90 分并不意味着有 90% 的可能是同一个人,而是意味着按模型的度量方式,这两个嵌入向量非常接近。在高质量照片中这是强证据,在劣质照片中则弱得多。照片质量已经内含在「一个分数值多少」这件事里。

什么是误报?

误报是指两个不同的人被判定为匹配。这是真正会造成伤害的错误,因为它把陌生人的身份安在了某人头上。长相相似的人、兄弟姐妹以及低质量图片,都会提高误报率。这正是为什么匹配结果应被视为「需要用其他证据加以核实的线索」而非结论,也正是为什么任何人脸反向搜索引擎都无法诚实地声称自己能确认身份。

什么是漏报?

漏报是指同一个人确实存在于索引中,却没有被作为匹配返回。它是更安静的一类失败,也是日常使用中更常见的一类,成因包括角度不佳、滤镜、遮挡,或者这张脸根本不在任何已索引的公开页面上。正因为漏报很常见,空结果只能非常微弱地支持「此人没有网络踪迹」这一判断。

什么是生物识别标识符?

生物识别标识符是一个法律概念而非技术概念:指从身体特征中提取、能够单独识别出某一个人的数据。人脸嵌入向量通常属于这一范畴。这一点之所以重要,是因为多数人脸隐私法规(包括 GDPR 第 9 条和伊利诺伊州 BIPA)规范的是对生物识别标识符的「处理」,而非「查看照片」这一动作,因此仅仅计算出嵌入向量就可能触发相关规则。

以图搜图和人脸反向搜索有什么区别?

它们是对同一个文件执行的两种不同操作。以图搜图为图片建立指纹并寻找它的副本:同一文件被转发、裁剪或缩放后的版本。人脸反向搜索则丢弃图片本身,只保留对人脸的描述,进而寻找这个人的其他照片,而这些照片可能毫不相似。选错其中之一,正是「搜索似乎一无所获」的常见原因。

什么是活体检测?

活体检测判断的是:摄像头前的究竟是一个真实在场的人,还是被举到镜头前的照片、屏幕或面具。它属于身份验证和解锁的范畴,而不属于人脸反向搜索。FaceSearch 不进行活体检测,因为它处理的是你提供的图片,而非实时摄像头画面。阅读隐私政策时这个区别很重要,因为两者常被放在一起讨论和监管,实际功能却截然不同。

这里说的「索引」是什么?

索引是指从公开可访问网页构建出的、可供检索的人脸嵌入向量集合。一次搜索就是把你的嵌入向量与该索引进行比对,因此索引界定了「可能被找到的范围」。需要登录的页面、屏蔽爬虫的页面,以及从未被抓取过的页面都不在其中,这正是无论照片多好、私密账户依然不可见的原因。

参考来源