Data Do Folclore Brasileiro - A AOESC celebra o Dia do Folclore Brasileiro! – AOESC
A AOESC celebra o Dia do Folclore Brasileiro! – AOESC

Trabalhando com datasets de folclore brasileiro na prática

Recebo bastante gente perguntando sobre como lidar com data do folclore brasileiro quando o assunto é processamento de linguagem natural ou projetos de categorização cultural. A maioria dos tutoriais que você acha na internet trata isso como se fosse só baix um JSON e começar a treinar modelo. Não funciona assim. O problema real começa quando você precisa limpar os dados. Folclore brasileiro não tem fontes oficiais padronizadas. Cada região tem variações do mesmo mito, nomes diferentes para a mesma entidade, e muito material duplicado ou contraditório entre os datasets disponíveis.

O que você encontra nos datasets de data do folclore brasileiro

Os principais repositórios que vale a pena conferir são o HuggingFace datasets (busque por "folclore-brasil" ou "entidades-folcloricas-br"), o Kaggle, e projetos acadêmicos da USP e Unicamp que disponibilizam coleções anotadas. O dataset mais completo que já vi foi construído pela equipe do NELa (Núcleo de Estudo da Língua Alemã e também de conteúdo brasileiro) com cerca de 4.200 entidades anotadas manualmente, com campos para nome, origem regional, tipo de entidade, regiões de influência e descrição em linguagem natural. A estrutura típica segue colunas como: nome_da_entidade, tipo (seres, mashres, lendas, festas), regiao, descricao, fontecite. Mas aqui vai o detalhe que ninguém conta: a coluna "fonte" é onde a maioria dos datasets falha. Muitas vezes você não consegue rastrear a fonte original porque os dados foram aggregados de múltiplos sites sem registro adequado. Isso quebra qualquer pipeline de verificação factual.

Como limpar esses dados sem perder informação

Eu passei dois meses trabalhando com um subconjunto desses dados pra um projeto interno. O maior pesadelo era a duplicação semântica. Curupira aparecia com 14 grafias diferentes (curupira, curupé, kurupira, e mais variações regionais que nem estavam no dicionário). Saci-pererê tinha versões com e sem o "de", às vezes escrito "sacy" sozinho, outras "saci-pererê", às vezes simplesmente "saci". Minha solução foi criar um mapeamento baseado em similaridade fuzzy primeiro, depois validar manualmente os clusters. Usei `rapidfuzz` do Python com threshold de 85% pra agrupar os nomes similares, e pra cada cluster fiz uma busca manual rápida confirmando se eram realmente a mesma entidade ou variação regional legítima. Esse processo manual dos clusters leva cerca de 3 a 5 minutos por grupo, mas economiza horas de limpeza cega.

Depois da normalização dos nomes, veio o problema das regiões. Muitos datasets usam siglas de estado (SP, RJ, MG) enquanto outros usam nomes completos ("São Paulo", "estado do Rio de Janeiro"). Normalizei tudo pra o formato IBGE com nomes oficiais e criei uma coluna de tags de região ampliada. Se uma entidade aparece em Minas e São Paulo, ela recebe ambas as tags, mas se você quer generalizar pra "Sudeste", aí sim faz a agregação.

Problemas comuns que ninguém avisa

O primeiro problema é viés geográfico. Os datasets mais acessíveis são majoritariamente baseados em lendas da região Sudeste e Sul, porquê é onde estão as universidades e pesquisadores publicando. Lendas do Norte e Nordeste costumam estar sub-representadas ou mal anotadas. Se o seu projeto envolve cobertura nacional, você precisa suplementar com fontes etnográficas regionais, senão seu modelo vai ter performance drasticamente pior pra entidades amazônicas ou maranhenses. O segundo problema é a qualidade das descrições. Muita entidade vem com descrições geradas automaticamente ou copiadas de Wikipedia sem revisão. Isso introduz erros factuais que se propagam quando você usa os dados pra treinar classificação ou geração de texto. Eu recomendo pelo menos uma validação cruzada com a obra de Luís da Câmara Cascudo, "Dicionário do Folclore Brasileiro", que ainda é a referência mais confiável disponível, ainda que datada de 1954.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Uma terceira armadilha: ação de tipo de entidade. Seres míticos, mashres, festas populares, provérbios, jogos... os datasets costumam misturar categorias de forma inconsistente. Uma mesma entidade pode ser classificada como "lenda" num dataset e "ser mítico" noutro. Padronize isso antes de qualquer análise, senão suas métricas de avaliação vão mentir pra você.

Passo a passo prático

1. Obtenção dos dados

Baixe pelo menos dois datasets diferentes pra cross-check. O do HuggingFace costuma ter a parte estrutural boa mas descrições rasas. O dataset acadêmico da USP/Unicamp tem descrições melhores mas cobertura menor. Jogue os dois no mesmo banco ou dataframe e use a intersecção como baseline de qualidade.

2. Limpeza e normalização

Execute a normalização de nomes com fuzzy matching, depois deduplicação por ID único. Remova entradas sem campo de região ou com região marcada como "desconhecida" sem justificativa — essas entries quase sempre são ruído ou dados mal importados. Mantenha um log de todas as remoções.

3. Enriquecimento

Para cada entidade, adicione as informações da obra do Câmara Cascudo quando disponíveis. Isso corrige erros factuais e adiciona contexto que os datasets modernos frequentemente omitem, como sincretismo religioso associado e variação histórica do mito.

4. Validação

Faça uma amostragem aleatória de 10% dos dados e valide manualmente cada campo. Se o tasso de erro superar 8%, o dataset inteiro precisa de revisão, não só os 10%. Isso é tudo que precisa saber pra começar a trabalhar com esse tipo de dado de forma séria. Não existe atalho pra qualidade nessa área.