Saltar al contenido principal

¿Cómo funciona el reconocimiento facial?

El reconocimiento facial convierte un rostro en una lista fija de números llamada vector o embedding, y luego mide la distancia entre un vector y otro. Los rostros que producen números cercanos se reportan como la misma persona. En ningún momento se almacena ni se compara la imagen en sí.

Última revisión

En resumen

  • Un rostro se convierte en un vector de números; la comparación es aritmética sobre esos números, no sobre píxeles.
  • Una coincidencia es una distancia por debajo de un umbral, y ese umbral es una decisión, no un hecho.
  • Bajar el umbral encuentra más coincidencias reales y también más erróneas, siempre ambas.
  • Buscar en una base de millones es una tarea distinta de comparar dos fotos, y se mide por separado.
  • La tecnología lee geometría. No conoce un nombre y no puede confirmarlo.

¿Cómo funciona el reconocimiento facial, paso a paso?

El reconocimiento facial ejecuta los mismos cuatro pasos sin importar qué sistema lo realice. Solo el tercer paso implica algo aprendido de datos; el resto es preparación y aritmética.

  • Detección: el sistema localiza la región de la imagen que contiene un rostro y descarta las imágenes donde no encuentra ninguno.
  • Alineación: el rostro se rota y escala a una posición estándar para que dos fotos tomadas en ángulos distintos sean comparables.
  • Vectorización: un modelo entrenado convierte el rostro alineado en una lista fija de números, normalmente entre 128 y 512.
  • Comparación: se mide la distancia entre dos vectores, y una distancia por debajo del umbral elegido se reporta como coincidencia.

¿Qué es un vector facial y qué contiene?

Un vector es una lista de números que describe la geometría que el modelo aprendió a tratar como identificativa: las proporciones y la estructura relativas de un rostro, no sus píxeles. No es una fotografía comprimida, y de él no puede reconstruirse un rostro de forma útil. Tampoco es interpretable por una persona: ningún número de la lista corresponde a una nariz o a un ojo. Su utilidad se limita a que dos fotos de la misma persona tienden a producir vectores cercanos, y dos personas distintas tienden a no hacerlo.

¿Qué decide que dos rostros se consideren una coincidencia?

Lo decide un umbral, fijado por quien opera el sistema y no descubierto en los datos. Todo umbral intercambia los dos tipos de error entre sí, y no existe un ajuste que elimine ambos.

  • Un umbral más estricto reporta menos coincidencias y pierde más reales.
  • Un umbral más laxo captura más coincidencias reales y devuelve más desconocidos.
  • El ajuste correcto depende del coste de cada error, que no es el mismo al desbloquear un teléfono que al buscar en la web abierta.

¿Por qué buscar entre millones de rostros es más difícil que comparar dos?

Son tareas distintas y se miden por separado. Comparar dos fotos es verificación, escrita 1:1. Buscar un rostro en una colección grande es identificación, escrita 1:N, y el NIST evalúa ambas en pruebas separadas por ese motivo. Cada rostro adicional de la colección es otra oportunidad para que un desconocido caiga dentro del umbral, así que una tasa de error insignificante en una comparación deja de serlo cuando la comparación se repite millones de veces.

¿Qué necesita el reconocimiento facial de una foto?

El modelo fue entrenado con rostros que podía alinear, así que la señal recuperable depende casi por completo de la imagen de entrada. Los problemas de calidad no son una penalización menor: normalmente deciden el resultado.

  • El rostro debe ocupar suficiente encuadre para que su estructura sobreviva a la compresión.
  • Debe mirar aproximadamente hacia la cámara, porque los ángulos extremos ocultan la geometría de la que depende el modelo.
  • La iluminación debe ser uniforme, ya que una sombra dura en un lado cambia lo que el modelo mide.
  • Cualquier cosa que cubra los ojos y el puente de la nariz elimina la región más informativa.

¿En qué se diferencia la búsqueda facial de la vigilancia facial?

Comparten las mismas matemáticas y casi nada más. Una búsqueda compara una foto que tú aportas contra páginas que ya son públicas, y devuelve enlaces a esas páginas. Los sistemas de vigilancia cotejan rostros contra una lista registrada en una señal de cámara en vivo, de forma continua y normalmente sin que el sujeto aporte nada. FaceSearch hace lo primero y no lo segundo: toma una única imagen subida, busca en fuentes públicas y devuelve las páginas donde aparece un rostro similar. No está conectado a ninguna cámara y no mantiene ninguna lista.

¿Qué no puede decirte el reconocimiento facial?

No puede decirte quién es alguien. Informa de que dos imágenes son geométricamente similares, y todo lo demás — el nombre, la cuenta, la afirmación de que ambas fotos muestran a la misma persona real — proviene de la página donde se encontró la coincidencia, no del modelo. Una coincidencia segura en una página con un pie de foto equivocado sigue siendo una respuesta equivocada, y por eso un resultado es un punto de partida para verificar y no una conclusión.

Fuentes