Impressão digital de dispositivo colide e envelhece: o que os estudos medem e o que isso muda na regra

AnáliseUNIFOKAL8 min de leituraAntifraude
Ver em Markdown

Dois aparelhos com a mesma assinatura e um aparelho com assinatura nova depois de uma atualização. O que cinco estudos revisados por pares mediram e por que igualdade exata erra nos dois sentidos.

A impressão digital de dispositivo, o device fingerprint, costuma entrar numa política de risco como se fosse um número de série: o mesmo valor em duas sessões seria o mesmo aparelho, e valores diferentes seriam aparelhos diferentes. As duas metades dessa frase falham com frequência conhecida, e a literatura revisada por pares mede cada uma delas há mais de quinze anos.

A primeira falha é a colisão: aparelhos distintos, de pessoas distintas, produzem a mesma assinatura. A segunda é o envelhecimento: o mesmo aparelho, da mesma pessoa, produz uma assinatura nova depois de uma atualização de navegador ou de uma troca de monitor. Os cinco estudos abaixo medem as duas, cada um com o recorte da própria amostra.

O número famoso e a amostra que o produziu

O ponto de partida é o artigo de Peter Eckersley, da Electronic Frontier Foundation, How Unique Is Your Web Browser?, publicado no Privacy Enhancing Technologies Symposium de 2010. Numa amostra de 470.161 navegadores, 83,6% tinham uma impressão digital instantaneamente única, e entre os que tinham Flash ou Java habilitados a proporção chegava a 94,2%.

O próprio autor faz a ressalva que costuma sumir quando o número é repetido: a amostra é "quite biased", formada por participantes informados que visitaram o site do experimento, e provavelmente representa o público que presta atenção à privacidade, não a internet inteira. É um resultado sobre aquela população, com os atributos daquela época, e os plugins que mais pesavam nele são justamente os que o estudo de 2018 registra como removidos.

Em escala, a multidão esconde

Oito anos depois, Alejandro Gómez-Boix, Pierre Laperdrix e Benoit Baudry repetiram a pergunta numa base muito maior, coletada num site de grande audiência. No artigo Hiding in the Crowd, apresentado na conferência WWW 2018 da ACM (Association for Computing Machinery), eles analisaram 2.067.942 impressões digitais coletadas em um dos quinze maiores sites franceses ao longo de alguns meses. A conclusão do resumo é direta: só 33,6% das impressões digitais eram únicas, contra mais de 80% em estudos anteriores. Os autores registram que a evolução das tecnologias web tem favorecido a privacidade, porque a remoção dos plugins reduziu substancialmente a taxa de computadores de mesa únicos.

Para quem escreve regra antifraude, o número que importa é o complementar. Se cerca de dois terços das assinaturas daquela base não eram únicas, a maior parte delas era compartilhada com pelo menos outro navegador. Uma regra do tipo "mesmo aparelho em várias contas" aplicada a esse tipo de assinatura mede, em boa parte, o tamanho da multidão que usa o mesmo modelo de celular com o mesmo navegador atualizado, e não a reincidência de um operador. É o mesmo mecanismo que transforma família e escritório em quadrilha no artigo sobre rede de fraude e falso positivo.

O estudo de Laperdrix, Rudametkin e Baudry, Beauty and the Beast, apresentado no IEEE Symposium on Security and Privacy de 2016 (o IEEE é o Institute of Electrical and Electronics Engineers), ajuda a ver por que o número depende dos atributos coletados. Com 118.934 impressões digitais de 17 atributos, os autores concluem que inovações do HTML5, a quinta geração da linguagem de marcação das páginas web, dão acesso a atributos muito discriminantes, em especial pela interface de programação de aplicações (API) Canvas, e que a técnica é tão eficaz em celulares quanto em computadores, "albeit for radically different reasons", por causa do ambiente de hardware e software mais restrito dos aparelhos móveis. A distintividade não é uma propriedade do aparelho: é do par aparelho e conjunto de atributos que alguém decidiu ler.

O resumo do Hiding in the Crowd registra ainda uma propriedade menos citada: as impressões digitais não únicas tendem a ser frágeis, e se alguns atributos mudam é muito provável que a assinatura passe a ser única. Quem estava escondido na multidão reaparece, depois de mudar alguns atributos, com um valor que ninguém mais tem.

Envelhecimento: o mesmo aparelho, outra assinatura

Eckersley já tinha medido o fenômeno em 2010. Entre 8.833 usuários que aceitavam cookies e voltaram ao site mais de uma vez num intervalo superior a 24 horas, 37,4% exibiram pelo menos uma mudança de impressão digital. O autor avisa que o número provavelmente superestima a taxa real, porque o site mostrava a cada visitante o quão única era a sua assinatura e incentivava experimentar alterações. E atribui as mudanças a eventos corriqueiros da vida de um usuário legítimo, como atualizar o navegador ou um plugin.

O FP-STALKER, de Antoine Vastel, Pierre Laperdrix, Walter Rudametkin e Romain Rouvoy, apresentado no IEEE Symposium on Security and Privacy de 2018, mediu a mesma coisa com mais cuidado. Com 98.598 impressões digitais de 1.905 instâncias de navegador, o resumo afirma que as assinaturas tendem a mudar com frequência, de algumas horas a alguns dias, por atualização de software ou mudança de configuração. O mesmo trabalho mostra que, apesar disso, versões sucessivas podem ser ligadas: o método rastreou navegadores por 54,48 dias em média, e 26% deles por mais de 100 dias. Ligar exige comparar por semelhança, e não por igualdade.

O estudo de Nampoina Andriamilanto, Tristan Allard, Gaëtan Le Guelvouit e Alexandre Garel, publicado na ACM Transactions on the Web em 2021, avaliou a impressão digital como fator de autenticação, com 4.145.408 assinaturas de 216 atributos vindas de 1.989.365 navegadores. Particionando a base no tempo, mais de 81,3% das assinaturas pertenciam a um único navegador, e em média 91% dos atributos ficavam idênticos entre duas observações, mesmo separadas por quase seis meses. O número convive com o da WWW 2018 porque mede outra base, com outro conjunto de atributos e outro propósito: mais uma razão para não transportar percentual de um estudo para a sua população.

O que isso muda na regra

Lidos juntos, os estudos sustentam quatro consequências de desenho:

  • Igualdade exata erra para os dois lados. Ela junta pessoas diferentes que caíram no mesmo valor e separa a mesma pessoa depois de uma atualização. Comparar por semelhança reduz a segunda falha e introduz uma decisão de limiar que precisa ser medida, não estimada.
  • Percentual de literatura não é parâmetro. A unicidade variou de 33,6% a mais de 80% conforme base, época e atributos. O que vale para a sua regra é o que a sua própria base mostra, medido com o mesmo conjunto de atributos que a regra usa.
  • O sinal tem prazo. Se o aparelho muda de assinatura em horas ou dias, uma associação antiga entre assinatura e conta descreve um aparelho que talvez nem exista mais naquela forma. Isso conversa com o prazo de retenção do sinal à luz do princípio da necessidade da Lei Geral de Proteção de Dados (LGPD), detalhado em device fingerprinting e LGPD.
  • Colisão é a hipótese padrão de um valor comum. Antes de ligar contas por um valor compartilhado, vale perguntar quantas pessoas legítimas produzem aquele mesmo valor.

Nada disso aposenta o sinal, que continua informativo quando compõe o risco com outros elementos. O que o navegador entrega e o que só um aplicativo nativo alcança está separado em sinais de dispositivo sem SDK nativo.

Perguntas frequentes

Impressão digital de navegador identifica uma pessoa?

Identifica, no melhor caso, um navegador numa configuração específica, por tempo limitado. Os estudos citados mostram bases em que a maior parte das assinaturas é única e bases em que não é.

Por que a mesma pessoa aparece como aparelho novo?

Porque a assinatura nasce de atributos que mudam com o uso normal do aparelho, como a versão do navegador depois de uma atualização. O FP-STALKER mediu mudanças em intervalos de horas a dias.

Fontes citadas

  • Peter Eckersley, Electronic Frontier Foundation, How Unique Is Your Web Browser?, Privacy Enhancing Technologies Symposium, 2010, DOI 10.1007/978-3-642-14527-8_1: coveryourtracks.eff.org
  • Alejandro Gómez-Boix, Pierre Laperdrix e Benoit Baudry, Hiding in the Crowd: an Analysis of the Effectiveness of Browser Fingerprinting at Large Scale, WWW 2018 (ACM), DOI 10.1145/3178876.3186097, resumo no HAL: inria.hal.science
  • Pierre Laperdrix, Walter Rudametkin e Benoit Baudry, Beauty and the Beast: Diverting Modern Web Browsers to Build Unique Browser Fingerprints, IEEE Symposium on Security and Privacy, 2016, DOI 10.1109/SP.2016.57, resumo no HAL: inria.hal.science
  • Antoine Vastel, Pierre Laperdrix, Walter Rudametkin e Romain Rouvoy, FP-STALKER: Tracking Browser Fingerprint Evolutions, IEEE Symposium on Security and Privacy, 2018, DOI 10.1109/SP.2018.00008, resumo no HAL: inria.hal.science
  • Nampoina Andriamilanto, Tristan Allard, Gaëtan Le Guelvouit e Alexandre Garel, A Large-scale Empirical Analysis of Browser Fingerprints Properties for Web Authentication, ACM Transactions on the Web, vol. 16, n. 1, 2021, DOI 10.1145/3478026: api.crossref.org