Resumo: Esta pesquisa apresenta uma aplicação do processo de vinculação de registros entre as bases do SAEB e do Censo Escolar, propondo o uso do algoritmo de agrupamento Euler Implícito Estocástico na etapa de decisão. O desafio central não está em erros de digitação nos dados, mas na ausência de rótulos e na alta incompletude das variáveis identificadoras, um cenário em que os métodos tradicionais de vinculação enfrentam limitações importantes.
O pipeline proposto segue três etapas: primeiro, uma adaptação do algoritmo Fisher Disjunctive Blocking para reduzir o espaço de comparações; em seguida, uma representação por escores ternários com ponderação das variáveis conforme sua importância; e, por fim, a etapa de decisão, em que o método baseado em Euler Implícito Estocástico foi comparado ao k-means.
Os resultados mostram que no contexto dessa aplicação o esquema de ponderação das variáveis se demonstrou determinante para o desempenho dos métodos, e que abordagens não supervisionadas são viáveis mesmo em cenários de alta incompletude ainda que a recuperação das correspondências dependa da quantidade de informação discriminativa disponível nos registros.