본문으로 건너뛰기

얼굴 인식은 어떻게 작동하나요?

얼굴 인식은 얼굴을 특징 벡터라고 부르는 고정 길이의 숫자 목록으로 변환한 뒤, 한 벡터와 다른 벡터 사이의 거리를 측정합니다. 가까운 숫자를 만들어내는 얼굴이 같은 사람으로 보고됩니다. 이 과정에서 이미지 자체가 저장되거나 비교되는 일은 없습니다.

최종 검토

요약

  • 얼굴은 숫자 벡터가 되며, 비교는 픽셀이 아니라 그 숫자에 대한 연산입니다.
  • 일치란 거리가 임계값보다 작다는 뜻이고, 임계값은 사실이 아니라 선택입니다.
  • 임계값을 낮추면 진짜 일치도 늘고 잘못된 일치도 늘어납니다. 언제나 둘 다입니다.
  • 수백만 건에서 찾는 일은 사진 두 장을 비교하는 일과 다른 과제이며, 평가도 따로 이뤄집니다.
  • 이 기술이 읽는 것은 기하 구조입니다. 이름을 알지 못하고, 확인할 수도 없습니다.

얼굴 인식은 단계별로 어떻게 진행되나요?

어떤 시스템이 수행하든 얼굴 인식은 같은 네 단계를 거칩니다. 데이터에서 학습한 요소가 개입하는 것은 세 번째 단계뿐이며, 나머지는 전처리와 연산입니다.

  • 검출: 이미지에서 얼굴이 있는 영역을 찾고, 얼굴이 없는 이미지는 제외합니다.
  • 정렬: 얼굴을 회전·확대축소해 표준 위치로 맞춰, 서로 다른 각도의 사진 두 장을 비교할 수 있게 합니다.
  • 벡터화: 학습된 모델이 정렬된 얼굴을 고정 길이 숫자 목록으로 바꿉니다. 보통 128~512개입니다.
  • 비교: 두 벡터의 거리를 재고, 선택한 임계값보다 작으면 일치로 보고합니다.

얼굴 특징 벡터란 무엇이고 무엇이 담기나요?

특징 벡터는 모델이 신원을 나타내는 것으로 학습한 기하 정보, 즉 얼굴 각 부분의 상대적 비율과 구조를 담은 숫자 목록이며 픽셀 자체가 아닙니다. 압축된 사진이 아니고, 여기서 얼굴을 의미 있게 되돌릴 수도 없습니다. 사람이 읽을 수 있는 형식도 아니어서 특정 숫자가 코나 눈에 대응하지도 않습니다. 쓸모가 있는 이유는 단 하나, 같은 사람의 사진 두 장은 가까운 벡터를 만들고 다른 사람은 그렇지 않은 경향이 있다는 점뿐입니다.

두 얼굴이 일치로 판정되는 기준은 무엇인가요?

임계값이 결정하며, 이는 시스템 운영자가 정하는 값이지 데이터에서 발견되는 값이 아닙니다. 모든 임계값은 두 종류의 오류를 맞바꾸며, 둘 다 없애는 설정은 존재하지 않습니다.

  • 더 엄격하면 보고되는 일치가 줄고 진짜 일치를 더 많이 놓칩니다.
  • 더 느슨하면 진짜 일치를 더 찾지만 남의 얼굴도 더 많이 돌려줍니다.
  • 적절한 값은 각 오류의 비용에 달려 있으며, 휴대폰 잠금 해제와 공개 웹 검색은 그 비용이 다릅니다.

왜 수백만 얼굴에서 찾는 것이 두 장을 비교하는 것보다 어려운가요?

서로 다른 과제이고 평가도 분리되어 있습니다. 사진 두 장을 비교하는 것은 검증(1:1)입니다. 큰 집합에서 얼굴을 찾는 것은 식별(1:N)이며, NIST가 두 가지를 별도 시험으로 평가하는 이유도 여기에 있습니다. 집합에 얼굴이 하나 늘 때마다 남이 임계값 안으로 들어올 기회도 하나 늘어납니다. 한 번의 비교에서 무시할 수 있던 오류율은 수백만 번 반복되면 더 이상 무시할 수 없습니다.

얼굴 인식은 사진에서 무엇을 필요로 하나요?

모델은 정렬할 수 있는 얼굴로 학습되었기 때문에, 얻을 수 있는 정보는 거의 전적으로 입력 이미지에 달려 있습니다. 화질 문제는 작은 감점이 아니라 대개 결과 자체를 좌우합니다.

  • 압축 후에도 구조가 남을 만큼 얼굴이 화면에서 충분히 커야 합니다.
  • 극단적인 각도는 모델이 의존하는 기하 구조를 가리므로, 대략 카메라를 향해야 합니다.
  • 한쪽의 짙은 그림자는 측정 대상을 바꾸므로 조명이 고르게 들어야 합니다.
  • 눈과 콧대를 가리는 것은 정보량이 가장 많은 영역을 없앱니다.

얼굴 검색과 얼굴 감시는 어떻게 다른가요?

같은 수학을 쓴다는 점 외에는 거의 다릅니다. 검색은 여러분이 제공한 사진 한 장을 이미 공개된 페이지와 대조하고 그 페이지 링크를 돌려줍니다. 감시 시스템은 실시간 영상 속 얼굴을 등록된 목록과 지속적으로 대조하며, 보통 당사자가 무언가를 제공하지 않습니다. FaceSearch는 앞의 것을 하고 뒤의 것은 하지 않습니다. 업로드된 이미지 한 장을 받아 공개 출처를 검색하고, 비슷한 얼굴이 나타나는 페이지를 돌려줍니다. 어떤 카메라에도 연결되어 있지 않고, 어떤 목록도 보관하지 않습니다.

얼굴 인식이 알려줄 수 없는 것은 무엇인가요?

그 사람이 누구인지는 알려줄 수 없습니다. 알 수 있는 것은 두 이미지가 기하적으로 비슷하다는 사실뿐이며, 그 밖의 모든 것 — 이름, 계정, 두 사진이 같은 실제 인물이라는 판단 — 은 일치가 발견된 페이지에서 오는 것이지 모델에서 오는 것이 아닙니다. 설명이 잘못된 페이지에서의 높은 일치도는 여전히 틀린 답입니다. 그래서 결과는 확인의 출발점이지 결론이 아닙니다.

출처