# Medir a acurácia de um OCR de documento: CER, acerto por campo e o que engana

<https://unifokal.com/blog/medir-a-acuracia-de-um-ocr>

Análise · UNIFOKAL · 12 de setembro de 2026 · 8 min de leitura · Produto e integração

Taxa de erro por caractere e acerto por campo medem coisas diferentes. Como cada uma é construída, por que um OCR com CER baixa erra justamente o número do documento e o que o dígito verificador resolve.

Alguém pergunta qual é a acurácia do seu OCR de documento, o reconhecimento óptico de caracteres, e a resposta sai como um número só. O número não significa nada sem o protocolo que o produziu, e pior: ele pode estar alto justamente enquanto o sistema erra o campo do qual depende a decisão inteira, o número do documento.

Não é paradoxo, é aritmética. Medir acurácia de OCR por caractere e medir acerto por campo são duas réguas diferentes, sobre a mesma extração, e elas divergem de propósito. Uma mede quanto do texto saiu certo. A outra mede quantas vezes o campo saiu utilizável. Um documento tem centenas de caracteres e meia dúzia de campos que importam.

Este artigo mostra como cada régua é construída, por que a média da primeira esconde o comportamento da segunda, e qual é a única medida que continua funcionando depois que o sistema entra em produção e você não tem mais gabarito.

## Três réguas, três números

A régua de caractere parte de uma distância entre duas sequências. O dicionário de algoritmos e estruturas de dados mantido pelo NIST, o instituto de padrões e tecnologia dos Estados Unidos, define distância de Levenshtein, também chamada distância de edição, como o menor número de inserções, remoções e substituições necessárias para transformar uma sequência em outra. A taxa de erro por caractere, a CER, se constrói dividindo essa distância pelo número de caracteres do texto de referência. É uma métrica de quanto o texto reconhecido se afasta do gabarito, agregada sobre tudo o que foi lido.

A régua de palavra compara unidades maiores. Na competição ICDAR 2019 sobre OCR de recibos digitalizados, o protocolo de avaliação da tarefa de reconhecimento casa todas as palavras entregues contra as palavras do gabarito, calcula precisão como a proporção de acertos sobre as palavras detectadas e revocação como a proporção de acertos sobre as palavras do gabarito, e usa a métrica F1 para ranquear.

A régua de campo é a mais dura e a que menos aparece em material comercial. Na mesma competição, na tarefa de extração de informação-chave, o texto extraído é marcado como correto somente se o conteúdo e a categoria batem com o gabarito. Caso contrário, incorreto. Não existe crédito parcial: um dígito trocado no valor total derruba o campo inteiro, exatamente como derrubaria na sua esteira.

As três réguas respondem perguntas diferentes. Perguntar "qual é a acurácia" sem dizer qual delas foi usada é pedir um número que não decide nada.

## Por que a média esconde o campo que decide

Faça a conta com hipóteses explícitas. Imagine um leiaute cujo texto de referência tem 300 caracteres somando todos os campos impressos, e suponha que o número do documento ocupe 11 desses caracteres. Um sistema que erra um único dígito do número, e acerta o resto da página, tem distância de edição 1 sobre 300, ou seja, CER de aproximadamente 0,33%. Pelo acerto por campo, esse mesmo documento tem o campo decisivo errado, e a taxa de acerto naquele campo é 0%.

Agora inverta. Um sistema que troca 9 caracteres espalhados em órgão expedidor, categoria e observações, e acerta os 11 dígitos do número, tem CER de 3%, nove vezes maior que a do primeiro, e entrega o campo que a decisão usa. Pela primeira régua ele é o pior dos dois. Pela segunda, é o único que serve.

O problema não é a CER estar errada. Ela está certa para o que mede. O problema é usá-la como proxy do que você precisa saber. E isso se agrava porque o erro de OCR se concentra em caracteres visualmente ambíguos, e é justamente uma sequência numérica isolada, sem contexto linguístico que ajude a desambiguar, que absorve essa confusão.

Daí a regra prática: reporte por campo, sempre. Um painel de OCR com um número agregado só não sabe quando quebrou. Vale a disciplina de [escolher as métricas que importam numa integração](https://unifokal.com/blog/monitoramento-de-integracao-de-kyc).

## O protocolo define o número tanto quanto o modelo

A mesma competição ICDAR 2019 deixa isso visível na descrição do conjunto de dados: mil imagens de recibos digitalizados, divididas entre 600 para treino e validação e 400 para teste, com desafios declarados de qualidade de papel e de tinta, resolução baixa de digitalização, distorção e documentos dobrados. Trocar esse conjunto por outro, mais limpo, muda o número sem que uma linha de modelo mude.

Três decisões de protocolo determinam o resultado antes de qualquer algoritmo rodar:

1. Quem está no conjunto de teste. Tipo de documento, versão do leiaute, estado de conservação, condição de captura. Um conjunto feito só com fotos de scanner não prevê nada sobre foto de celular em ambiente escuro.
2. Como o gabarito foi produzido. Quem transcreveu, como resolveu ambiguidade e o que fez com campo ilegível. Gabarito gerado pelo próprio sistema que está sendo medido produz número bonito e sem valor.
3. O que conta como erro. Diferença de acentuação, espaço extra, zero à esquerda e maiúscula contra minúscula precisam de uma regra escrita antes da medição, senão cada rodada mede uma coisa.

Sem essas três definições publicadas junto, comparar a acurácia de dois fornecedores é comparar dois exames diferentes pela nota. O mesmo raciocínio que vale para [avaliar um fornecedor de KYC com perguntas objetivas](https://unifokal.com/blog/como-avaliar-fornecedor-de-kyc) vale aqui: peça o protocolo antes de pedir o número.

## A medida que continua rodando em produção

Em produção não existe gabarito. O que existe é estrutura interna do próprio dado, e é ela que sobra como verificação contínua.

Boa parte dos identificadores brasileiros carrega dígito verificador, e conferi-lo é conferência local, instantânea e sem consulta externa. A Resolução CONTRAN nº 886, de 13 de dezembro de 2021, descreve no artigo 4º as numerações da Carteira Nacional de Habilitação: o Número do Registro Nacional, com nove caracteres mais dois dígitos verificadores, e o Número do Espelho, com nove caracteres mais um dígito. O parágrafo 1º manda calcular o dígito pela rotina módulo 11, com a regra de que resto 0 ou 1 produz dígito 0. A faixa de leitura mecânica do padrão ICAO tem a sua própria aritmética, descrita em [o que os dígitos verificadores do padrão ICAO 9303 provam](https://unifokal.com/blog/mrz-digitos-verificadores-icao-9303), e o identificador de empresa ganhou regra nova em [CNPJ alfanumérico](https://unifokal.com/blog/cnpj-alfanumerico-2026).

Um dígito verificador não diz que o número existe nem que pertence àquela pessoa. Ele diz que a sequência lida é internamente consistente, o que já captura a classe de erro mais comum do OCR: um caractere trocado. É por isso que ele é o teste mais barato que se pode colocar entre a [extração do documento](https://unifokal.com/produto/identidade) e qualquer decisão.

Duas cautelas fecham o assunto. Primeiro, número que não fecha o dígito é evidência de leitura ruim antes de ser evidência de fraude, e o caminho natural é recaptura, não recusa. Segundo, separe "não extraiu" de "extraiu errado" no painel: são falhas com causas diferentes, e somá-las num único indicador apaga a informação que faria você consertar a coisa certa.

## Perguntas frequentes

### O que é CER em OCR?

CER é a taxa de erro por caractere. Ela se apoia na distância de edição, definida no dicionário do NIST como o menor número de inserções, remoções e substituições que transforma uma sequência em outra, e normaliza essa distância pelo tamanho do texto de referência. É uma medida agregada do texto inteiro, não do campo que decide.

### Por que um OCR com acurácia alta erra o número do documento?

Porque a acurácia agregada dilui o erro no volume de caracteres da página. Errar um dígito num documento com centenas de caracteres move pouco a CER e derruba por completo o acerto naquele campo, já que a avaliação por campo não dá crédito parcial.

### Como medir um OCR sem ter um conjunto de teste rotulado?

Sem gabarito não dá para medir acurácia, mas dá para medir consistência: taxa de campos vazios, taxa de dígito verificador que não fecha e taxa de recaptura por tipo de documento. São indicadores operacionais que apontam degradação mesmo sem rótulo, e servem de gatilho para montar a medição com gabarito.

## Fontes citadas

- NIST, Dictionary of Algorithms and Data Structures, verbete "Levenshtein distance", definição de distância de edição: [xlinux.nist.gov](https://xlinux.nist.gov/dads/HTML/Levenshtein.html)
- Huang, Chen, He, Bai, Karatzas, Lu e Jawahar, ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction, ICDAR 2019, protocolos de avaliação das tarefas 2 e 3 e descrição do conjunto de dados: [arxiv.org/abs/2103.10213](https://arxiv.org/abs/2103.10213)
- Resolução CONTRAN nº 886, de 13 de dezembro de 2021, artigo 4º, incisos I e II e parágrafo 1º, no portal do Ministério dos Transportes: [gov.br](https://www.gov.br/transportes/pt-br/assuntos/transito/conteudo-contran/resolucoes/Resolucao8862021F.pdf)
