Viés demográfico em reconhecimento facial: o que a avaliação do NIST mediu

AnáliseUNIFOKAL7 min de leituraAntifraude
Ver em Markdown

O relatório NIST IR 8280 testou 189 algoritmos e separou falso positivo de falso negativo por sexo, idade e origem. Os números, o efeito do limiar fixo e o que o estudo não fez.

A discussão pública sobre viés em reconhecimento facial costuma parar na pergunta errada, que é se o sistema é enviesado ou não. A pergunta com resposta mensurável é outra: qual erro, medido sobre qual população, em qual limiar. Erro de reconhecimento facial tem dois tipos, eles não se comportam do mesmo jeito entre grupos demográficos, e confundir os dois produz tanto alarme falso quanto falsa tranquilidade.

Existe uma medição pública e grande dessa questão. Em dezembro de 2019 o NIST, instituto de padrões dos Estados Unidos, publicou o relatório NIST IR 8280, "Face Recognition Vendor Test (FRVT) Part 3: Demographic Effects", assinado por Patrick Grother, Mei Ngan e Kayee Hanaoka. Vale ler os números antes de repetir a impressão geral.

O que foi medido, e com qual material

O NIST processou 18,27 milhões de imagens de 8,49 milhões de pessoas em 189 algoritmos, em sua maioria comerciais, de 99 desenvolvedores. As imagens vieram de quatro bases governamentais dos Estados Unidos em operação: fotos de prontuário policial coletadas no país, fotos de formulário de solicitantes de benefícios de imigração, fotos de solicitação de visto e fotos de travessia de fronteira.

Os metadados limitaram o recorte, e o relatório é transparente sobre isso. Sexo e idade acompanhavam todas as bases. Raça só existia nas fotos de prontuário; nas demais, o que havia era o país de nascimento, e a análise foi restringida a 24 países, em 7 regiões distintas do mundo, com níveis mais baixos de imigração de longa distância. País de nascimento é tratado ali como aproximação imperfeita, e também como variável relevante por si só em aplicações de viagem.

Foram avaliados tanto algoritmos de verificação, um rosto contra um rosto, quanto de identificação, um rosto contra uma base inteira. A régua do confronto 1:1 está no artigo sobre como ler FMR e FNMR, e a da busca numa base inteira, no artigo sobre como medir uma busca facial 1:N.

Falso positivo e falso negativo não se comportam igual

O resultado principal do relatório é uma assimetria. Os diferenciais de falso positivo são muito maiores que os de falso negativo. Segundo o texto, as taxas de falso positivo variam frequentemente por fatores de 10 a mais de 100 entre grupos. Já os efeitos de falso negativo variam, em geral, por fatores bem abaixo de 3.

Os recortes específicos, no vocabulário do próprio relatório:

  • Falso positivo entre 2 e 5 vezes maior em mulheres do que em homens, com o múltiplo variando conforme algoritmo, origem e idade. O efeito aparece na maioria dos algoritmos e bases, e é menor que o efeito ligado à raça.
  • Nas fotos de formulário, de qualidade mais alta, as taxas de falso positivo são mais altas em pessoas da África Ocidental e Oriental e do Leste Asiático, e mais baixas em pessoas do Leste Europeu. Em vários algoritmos desenvolvidos na China o efeito se inverte, com falso positivo baixo em rostos do Leste Asiático.
  • Falso positivo elevado em idosos e em crianças, com efeito maior nos extremos e menor em adultos de meia-idade.
  • Nas fotos de prontuário, os falsos positivos mais altos aparecem em indígenas americanos, com taxas elevadas também em populações afro-americanas e asiáticas, e a ordem relativa depende do sexo e do algoritmo.

Do lado do falso negativo, o relatório registra que a taxa varia fortemente por algoritmo, de abaixo de 0,5% a acima de 10%, e conclui que algoritmo impreciso aumenta o tamanho dos diferenciais de falso negativo. Nas fotos de prontuário, o falso negativo é maior em pessoas asiáticas e indígenas americanas; o NIST pondera que isso pode não estar relacionado à raça e sim ao tempo decorrido entre as fotos, porque envelhecimento influencia muito o falso negativo. Nas imagens de travessia de fronteira, de qualidade menor, o falso negativo é maior em pessoas nascidas na África e no Caribe, com efeito mais forte entre os mais velhos.

Por que o limiar fixo é o centro do problema

O ponto metodológico do relatório é o que mais interessa a quem opera um sistema. O NIST observa que a imensa maioria dos sistemas biométricos roda com um limiar fixo, o mesmo para todas as comparações, sem ajuste por câmera, por condição ambiental ou, principalmente, por demografia. E critica a maioria dos estudos acadêmicos, que reporta taxa de falso negativo a uma taxa de falso positivo fixa, em vez de a um limiar fixo, porque esse formato esconde as excursões da taxa de falso positivo e distorce a de falso negativo.

A consequência prática é simples de enunciar e desconfortável de aceitar: um limiar único produz taxas de erro diferentes para grupos diferentes, e essa diferença só aparece se você medir os dois erros no limiar que de fato está em produção. O relatório insiste que, com limiar fixo, é necessário reportar falso positivo e falso negativo para cada grupo, e observa que isso raramente é feito.

Qualidade de imagem mudou o resultado

Um achado atravessa todo o relatório. Nas comparações entre fotos de formulário de alta qualidade, as taxas de erro são muito baixas e medir diferencial de falso negativo fica difícil, o que o NIST lê como evidência de que melhor qualidade de imagem reduz tanto o falso negativo quanto os diferenciais. As fotos de prontuário foram coletadas com montagem fotográfica padronizada para produzir imagem de boa qualidade entre raças, enquanto as imagens de fronteira se afastam dos padrões de qualidade de imagem facial, e os resultados diferem de acordo.

Isso desloca parte do problema da escolha do modelo para a etapa de captura, assunto do artigo sobre qualidade de imagem facial. Não resolve o diferencial de falso positivo, que o relatório observa mesmo em imagens de alta qualidade, mas muda o que compensa priorizar primeiro.

O que o estudo não fez

A honestidade do relatório sobre os próprios limites é parte do valor dele, e vale repetir. O NIST não treinou nem adaptou os algoritmos, rodou os protótipos como foram submetidos. Não construiu modelo explicativo de causa e efeito, e diz expressamente que não tentou relacionar os erros a tom de pele ou a outro fenótipo, entre outros motivos porque estimar tom de pele exigiria um algoritmo que também pode ter diferenciais próprios. Não avaliou o efeito da câmera nem a interação entre pessoa e câmera. E não usou imagens da internet nem de videovigilância, de modo que o relatório não descreve o que acontece nesse tipo de foto.

A recomendação que o NIST tira disso é a parte acionável: como cada implementação usa um algoritmo específico, cabe ao dono do sistema conhecer o seu, e costuma ser informativo medir a acurácia do algoritmo em operação sobre os dados de imagem daquela operação, se preciso com apoio de laboratório de teste biométrico.

O que isso significa para quem opera no Brasil

Duas consequências práticas. A primeira é de produto: se o limiar é fixo e os erros não são iguais entre grupos, a fila de revisão manual herda essa desigualdade, e o custo silencioso recai sobre clientes legítimos, exatamente o mecanismo descrito no texto sobre falso positivo em verificação. Medir aprovação por segmento deixa de ser luxo analítico.

A segunda é jurídica. A Lei 13.709/2018, a LGPD, assegura no artigo 20 o direito de solicitar revisão de decisões tomadas unicamente com base em tratamento automatizado que afetem os interesses do titular. Reprovar um cadastro por comparação facial é decisão desse tipo, e o que a Agência Nacional de Proteção de Dados tem exigido de quem usa reconhecimento facial caminha na mesma direção. Guardar o limiar vigente, a versão do modelo e a evidência de cada decisão é o que permite responder. Uma esteira de verificação de identidade que não registra esses três campos não tem como explicar a própria recusa.

Fontes citadas

  • NIST IR 8280, Face Recognition Vendor Test (FRVT) Part 3: Demographic Effects, Patrick Grother, Mei Ngan e Kayee Hanaoka, dezembro de 2019: nvlpubs.nist.gov
  • NIST IR 8280, sumário executivo e sumário técnico, de onde vêm os fatores de 10 e 100, o intervalo de 2 a 5 vezes entre mulheres e homens e as faixas de falso negativo por algoritmo
  • NIST IR 8280, seção sobre operação com limiar fixo e sobre o que o estudo não fez
  • Lei 13.709/2018 (LGPD), artigo 20, sobre revisão de decisão automatizada