Taxa de aprovação de KYC: por que o número de dois fornecedores não se compara
A taxa de aprovação depende da população, do limiar e do que entra no denominador. O que o NIST mediu sobre isso e como montar uma comparação entre fornecedores que realmente vale.
Foto: Chris Ried, Unsplash
Em quase toda concorrência de verificação de identidade aparece um slide com a taxa de aprovação do fornecedor. É um número limpo, fácil de colocar lado a lado com o do concorrente, e é ali que a avaliação costuma descarrilar. Taxa de aprovação não é propriedade do fornecedor. É propriedade conjunta do sistema, da população que passou por ele e da política de decisão que alguém escolheu.
Dois números medidos em bases diferentes não se comparam, do mesmo jeito que a média de duas escolas não se compara quando a prova e os alunos foram outros. Este texto mostra de onde vem essa dependência e o que fazer no lugar de comparar os dois números. O termo KYC, sigla em inglês para conheça seu cliente, aparece aqui no sentido amplo do funil: documento, biometria, consulta cadastral e a regra de decisão.
As três variáveis livres por trás do número
A taxa de aprovação é aprovados divididos por submetidos, num período. Três coisas ficam livres nessa conta, e cada uma move o resultado sozinha.
A primeira é quem submeteu. Público recrutado por campanha de cashback não se parece com público que chegou por indicação, e celular de entrada em luz ruim não se parece com notebook em escritório. A segunda é onde está o limiar, o ponto de corte que separa aprovar de recusar. A terceira é o que entra no numerador e no denominador: tentativa ou sessão, quem desistiu no meio, quem foi para revisão manual, quem falhou antes de a comparação acontecer. Com as três livres, o mesmo software produz taxas diferentes sem que nenhuma linha de código mude.
Limiar: aprovar mais é uma escolha, não uma virtude
A publicação NIST SP 800-63B, do instituto de padrões dos Estados Unidos, descreve o mecanismo. A comparação biométrica parte de uma medida do sensor, sujeita a ruído e a variação de apresentação, o que exige fixar um limiar de aceitação. Disso decorrem duas probabilidades: a de uma comparação legítima não dar casamento, a taxa de falso não casamento, e a de uma comparação de impostor dar casamento, a taxa de falso casamento. O documento observa que o limiar escolhido normalmente privilegia uma taxa de falso casamento baixa, porque o falso não casamento pode ser mitigado repetindo a medição ou oferecendo outro método.
No mesmo trecho, a norma fixa requisitos para uso em autenticação: taxa de falso casamento de uma em dez mil ou melhor para todos os grupos demográficos, taxa de falso não casamento abaixo de 5 por cento como recomendação, limiar fixo, e desempenho testado conforme a ISO/IEC 19795-1.
A consequência é simples. Qualquer fornecedor pode subir a taxa de aprovação movendo o limiar. Uma taxa de aprovação sem a taxa de erro correspondente é metade de um par, e é a metade que favorece quem apresenta. É a mesma lógica de falso positivo em verificação e da régua de como medir uma busca facial 1:N; aqui o recorte é a verificação um para um e o funil em volta dela.
População: o mesmo algoritmo, resultado diferente
A demonstração empírica disso está no relatório NIST IR 8280, de dezembro de 2019, terceira parte da avaliação de fornecedores de reconhecimento facial do NIST, dedicada a efeitos demográficos. O estudo usou quatro conjuntos de imagens, entre eles fotos de identificação criminal produzidas nos Estados Unidos e fotos de travessia de fronteira.
O achado que interessa aqui não é qual grupo teve mais erro, é que a resposta muda com o conjunto. Com as fotos de identificação, os falsos negativos foram mais altos em determinados grupos; com as fotos de fronteira, de qualidade mais baixa, o padrão passa a ser outro. O relatório atribui a diferença à qualidade de imagem: as primeiras vieram de um arranjo fotográfico padronizado, enquanto as de fronteira se afastam dos padrões de qualidade de imagem facial.
O mesmo documento faz uma advertência metodológica que vale para qualquer comitê de compras: como a maioria dos sistemas opera com limiar fixo, é necessário reportar a taxa de falso negativo e a de falso positivo para cada grupo naquele limiar, e isso raramente é feito; reportar falso negativo a uma taxa fixa de falso positivo, em vez de a limiar fixo, esconde as excursões de falso positivo.
Traduzindo: um número medido em captura cooperativa no desktop e um número medido em celular de entrada não descrevem o mesmo fenômeno, ainda que a coluna da planilha se chame igual.
O denominador é onde a conta se perde
O NIST IR 8280 também explicita como trata as falhas de extração, quando o algoritmo não consegue gerar o modelo a partir da imagem. Na verificação, o relatório trata qualquer comparação envolvida numa falha dessas como tendo escore de similaridade zero, e registra o efeito: isso aumenta a taxa de falso não casamento e diminui a de falso casamento. A decisão de como contabilizar a falha muda o número publicado, sem que nada tenha mudado no reconhecimento. A mesma armadilha reaparece no funil comercial, em três lugares:
- Recaptura. Se o fornecedor conta como aprovada a sessão em que a terceira tentativa deu certo e você conta tentativas, os dois números divergem por definição. A segunda chance depois de uma rejeição técnica é escolha de produto, não constante.
- Abandono. Quem sai antes de terminar some do denominador em muitas contagens, e excluir abandono faz a taxa subir sem que ninguém a mais tenha sido aprovado. É por isso que o funil que exclui também reprova.
- Revisão manual. Se o caso enviado ao analista conta como aprovado quando ele aprova, a taxa mede o time de operações junto com o software.
O papel da ISO/IEC 19795-1
A norma ISO/IEC 19795-1:2021, intitulada Biometric performance testing and reporting, Part 1: Principles and framework, é a referência internacional de protocolo de avaliação de desempenho biométrico, e é ela que o NIST SP 800-63B manda seguir. O nome da parte já diz a função: princípios e arcabouço, ou seja, as regras de como medir e de como reportar, não um número de referência.
O uso prático dela numa avaliação de fornecedor é transformar cada elemento do protocolo numa pergunta com resposta escrita antes de qualquer comparação:
- Qual população foi usada, e como ela foi obtida.
- Em que condições de captura e em quais dispositivos.
- Qual limiar, e se ele era fixo para todos os casos.
- O que conta como uma transação, e como tentativas repetidas foram tratadas.
- Como as falhas de captura e de extração entraram no cálculo.
- Qual a taxa de erro emparelhada com a taxa de aprovação.
Sem essas seis respostas, o número que chegou até você não tem unidade de medida.
A única comparação que vale
Comparar promessa com promessa é gastar tempo. A comparação com significado roda os candidatos sobre a sua população, no seu período, com a sua política de decisão e as suas definições de numerador e denominador. Na prática isso vira um piloto em fatia de tráfego ou uma execução em paralelo com o fornecedor atual, com as definições escritas antes de os números existirem.
A sequência importa: defina primeiro qual taxa de aprovação você quer, em função do apetite de risco do produto, como no método de abordagem baseada em risco, e só depois pergunte a cada candidato qual taxa de erro ele entrega naquele ponto. É o roteiro complementar ao de como avaliar um fornecedor de KYC.
Perguntas frequentes
Taxa de aprovação alta é sinal de bom fornecedor?
Sozinha, não. O limiar é ajustável, e afrouxá-lo aumenta a aprovação e a taxa de falso casamento ao mesmo tempo. Uma taxa de aprovação só informa algo quando vem com a taxa de erro no mesmo ponto de operação e com a população em que foi medida.
Como comparar dois fornecedores de forma justa?
Submetendo os dois à mesma população, no mesmo período, com a mesma definição de tentativa, de sessão e de aprovado. Piloto em fatia de tráfego ou execução em paralelo entregam isso; slides de fornecedor, não.
Por que a taxa cai quando muda a origem do tráfego?
Porque a população mudou. O NIST IR 8280 documenta que o padrão de erro dos mesmos algoritmos muda entre conjuntos de imagens, e atribui parte da diferença à qualidade de imagem de cada conjunto.
Fontes citadas
- NIST SP 800-63B, Digital Identity Guidelines: Authentication and Lifecycle Management, seção 3.2.3, sobre limiar, taxas de erro e teste conforme a ISO/IEC 19795-1: pages.nist.gov
- NIST IR 8280, Face Recognition Vendor Test Part 3: Demographic Effects, Grother, Ngan e Hanaoka, dezembro de 2019, sumário executivo, seção 1 e seção 3.4: nvlpubs.nist.gov
- ISO/IEC 19795-1:2021, Biometric performance testing and reporting, Part 1: Principles and framework, citada por nome porque o texto da norma não é de acesso público
