Перейти к основному содержимому

Как работает распознавание лиц?

Распознавание лиц преобразует лицо в набор чисел фиксированной длины — вектор — и затем измеряет расстояние между одним вектором и другим. Лица, дающие близкие числа, признаются одним и тем же человеком. Само изображение при этом не сохраняется и не сравнивается.

Последняя проверка

Коротко

  • Лицо становится вектором чисел; сравнение — это арифметика над этими числами, а не над пикселями.
  • Совпадение — это расстояние ниже порога, а порог — решение, а не факт.
  • Понижение порога находит больше настоящих совпадений и больше ошибочных. Всегда и то и другое.
  • Поиск среди миллионов лиц — другая задача, чем сравнение двух фотографий, и измеряется отдельно.
  • Технология читает геометрию. Она не знает имени и не может его подтвердить.

Как распознавание лиц работает по шагам?

Распознавание лиц проходит одни и те же четыре шага независимо от того, какая система его выполняет. Только третий шаг связан с тем, что выучено из данных; остальное — подготовка и арифметика.

  • Обнаружение: система находит область изображения с лицом и отбрасывает снимки, где лица нет.
  • Выравнивание: лицо поворачивается и масштабируется к стандартному положению, чтобы два снимка под разными углами стали сопоставимы.
  • Векторизация: обученная модель переводит выровненное лицо в набор чисел фиксированной длины, обычно от 128 до 512.
  • Сравнение: измеряется расстояние между двумя векторами, и расстояние ниже выбранного порога считается совпадением.

Что такое вектор лица и что в нём содержится?

Вектор — это набор чисел, описывающий геометрию, которую модель научилась считать опознавательной: относительные пропорции и структуру лица, а не его пиксели. Это не сжатая фотография, и восстановить из него лицо сколько-нибудь осмысленно нельзя. Он также не читается человеком: ни одно число из набора не соответствует носу или глазу. Полезен он лишь тем, что две фотографии одного человека обычно дают близкие векторы, а разные люди — обычно нет.

Что решает, считать ли два лица совпадением?

Решает порог, и его задаёт оператор системы, а не находит сама модель в данных. Любой порог разменивает два типа ошибок друг на друга, и настройки, убирающей оба, не существует.

  • Более строгий порог сообщает меньше совпадений и чаще пропускает настоящие.
  • Более мягкий порог находит больше настоящих совпадений и возвращает больше посторонних.
  • Верное значение зависит от цены каждой ошибки, а она разная при разблокировке телефона и при поиске в открытой сети.

Почему искать среди миллионов лиц труднее, чем сравнить два?

Это разные задачи, и измеряются они отдельно. Сравнение двух фотографий — верификация, записывается как 1:1. Поиск лица в большой коллекции — идентификация, записывается как 1:N, и именно поэтому NIST оценивает их в разных испытаниях. Каждое дополнительное лицо в коллекции — ещё одна возможность для постороннего попасть внутрь порога, так что доля ошибок, пренебрежимая при одном сравнении, перестаёт быть таковой, когда сравнение повторяется миллионы раз.

Что распознаванию лиц нужно от фотографии?

Модель обучалась на лицах, которые могла выровнять, поэтому извлекаемый сигнал почти полностью зависит от исходного снимка. Проблемы качества — не небольшой штраф: обычно они и решают исход.

  • Лицо должно занимать в кадре достаточно места, чтобы его структура пережила сжатие.
  • Оно должно быть повёрнуто примерно к камере: крайние ракурсы скрывают геометрию, на которую опирается модель.
  • Освещение должно быть ровным, поскольку резкая тень с одной стороны меняет то, что измеряет модель.
  • Всё, что закрывает глаза и переносицу, убирает самую информативную область.

Чем поиск по лицу отличается от видеонаблюдения с распознаванием?

У них общая математика и почти ничего больше. Поиск сравнивает предоставленную вами фотографию со страницами, которые уже общедоступны, и возвращает ссылки на них. Системы наблюдения непрерывно сверяют лица с заранее внесённым списком в живом видеопотоке, и обычно человек ничего для этого не предоставляет. FaceSearch делает первое и не делает второго: принимает одно загруженное изображение, ищет по открытым источникам и возвращает страницы, где встречается похожее лицо. Он не подключён ни к одной камере и не ведёт никаких списков.

Чего распознавание лиц сказать не может?

Оно не может сказать, кто перед вами. Оно сообщает, что два изображения геометрически похожи, а всё остальное — имя, аккаунт, утверждение, что на обоих снимках один и тот же живой человек — берётся со страницы, где найдено совпадение, а не из модели. Уверенное совпадение на странице с неверной подписью остаётся неверным ответом, поэтому результат — отправная точка для проверки, а не вывод.

Источники