Como descobrir em que língua um texto foi escrito originalmente
Eu passo horas mexendo com manuscritos digitalizados e textos antigos que chegam sem qualquer metadado. Às primeira vista parece trivial, mas na prática é uma bagunça. A maioria das pessoas subestima o quanto a língua de um documento pode ser ambígua, especialmente quando se trata de cópias medievais, textos comerciais coloniais ou traduções intermediárias que ninguém documentou.
O que significa saber em que língua foi escrito originalmente
Descobrir a língua original de um texto significa rastrear a linguagem em que o autor ou copista produziu o documento pela primeira vez, antes de eventuais traduções, adaptações ou transcrições posteriores. Isso envolve análise linguística, comparação com corpus de referência e, muitas vezes, investigação histórica para entender o contexto em que o texto foi produzido. Não confunda língua original com a língua do manuscrito que você tem em mãos. Um códice do século XV pode estar escrito em português, mas o texto que ele copia pode ter sido originalmente redigido em latim no século XIII. O suporte e a língua do conteúdo são coisas distintas.
Métodos práticos para determinar a língua original
O primeiro passo é sempre analisar o texto à luz. Coisas que parecem óbvias — ortografia, grafia de palavras-chave, estrutura morfológica — já eliminam metade das possibilidades. Por exemplo, se você vê uso sistemático de "ç" e "õ", provavelmente está diante de português ou galego-português medieval. Se encontra "ie" e "ue" como ditongos ascendentes, pode ser castelhano antigo. Mas aí mora o perigo. Uma ferramenta útil é o linguistic fingerprinting, que compara características gramaticais e léxicas do texto com corpus treinados de línguas conhecidas. Ferramentas como CLDF (Cross-Linguistic Data Formats) e modelos como o langid.py podem dar um palpite rápido, mas eles falham miseravelmente com textos curtos ou bilingues. Eu já perdi uma manhã inteira porque o classificador automático rotulou um texto em português com infl uência árabe como "castelhano" por causa de três palavras emprestadas.
Dica técnica: use múltiplas camadas de análise
A abordagem que funciona de verdade combina pelo menos três métodos independentes. Primeiro, análise forense da grafia e ortografia. Segundo, consulta a dicionários etimológicos como o Dicionário Histórico da Língua Portuguesa ou o dicionário do Instituto de Linguística Teórica e Computacional. Terceiro, comparação com documentos de mesma região e período para identificar padrões locais. Se o texto for medieval, considere também a paleografia. A forma das letras, os sinais de abreviatura e a disposição no manuscrito frequentemente indicam a tradição scribal de onde vieram. Um testo copiado por um escriba português seguindo convenções_castelhanas não significa que a língua original seja castelhana. O estilo da escrita pode mascarar completamente a língua do conteúdo.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Problemas comuns que ninguém avisa
O maior erro é assumir que língua e nacionalidade coincidem. Textos produzidos na Península Ibérica entre os séculos XII e XIV podem estar em galego-português, castelhano, catalão, latim ou até árabe, e eles circulavam entre si com frequência. Um documento comercial de Lisboa em 1325 pode ter sido escrito em português por um escrivão que também dominava o castelhano e copiava fórmulas dessa língua sem perceber. Outro problema são os interlínguas e variedades de transição. O chamada "português medieval tardio" tem características tão mistas que classificadores modernos frequentemente erram. Eu tive um caso com um testamento de 1487 do Arquivo da Torre do Tombo que o sistema automaticamente marcou como espanhol. A análise manual mostrou que era português com forte interferência lexicográfica castelhana, comum em documentos jurídicos da época devido ao prestígio do Direito Castelhano.
Textos code-switching são ainda mais traiçoeiros. Quando um autor alterna deliberadamente entre duas línguas num mesmo documento — algo relativamente frequente em textos religiosos e científicos modernos — a deteccção automática tende a dar resultados ambíguos ou completamente errados. Nesse caso, a única saída é análise contextual: identificar qual língua predomina na estrutura gramatical e qual aparece apenas em termos técnicos ou citações.
Quando você deve desistir da análise automática
Se o texto tiver menos de duzentas palavras, os classificadores são inúteis. A amostra é pequena demais para qualquer padrão linguístico se destacar. Nesse cenário, a análise precisa ser feita manualmente, termo por termo. Eu recomendo pelo menos três horas de trabalho cuidadoso para textos nessa faixa, contando com consultas a fontes primárias. Textos com corrupção significativa — como digitalizações ruins, perda de partes do texto, ou erros de OCR massivos — também são terrenos minados. A primeira coisa a fazer nesse caso é restaurar o texto tanto quanto possível antes de qualquer tentativa de classificação. De nada adianta passar um detector de língua num texto que tem "ç" substituído por "c" e "ã" por "a" em cada terceira palavra.
Alternativas quando a língua é realmente ambígua
Em alguns casos, a língua original simplesmente não pode ser determinada com certeza. Documentos coloniais misturados, traduções anônimas de traduções, e textos produzidos em regiões de contato linguístico intenso podem permanecer ambíguos para sempre. Nesse ponto, o mais honesto é registrar a ambiguidade e fornecer as possibilidades mais prováveis com seus respectivos graus de confiança, em vez de forçar uma resposta única. Uma ferramenta que eu uso comoúltimo recurso é o etymonline combinado com o Negri-Cabras Multilateral Corpus, que permite verificar a origem etimológica de palavras-chave e cruzar com a distribuição geográfica histórica delas. Não é infalível, mas ajuda a restringir o leque de possibilidades quando os métodos convencionais falham.
Se quiser se aprofundar, o artigo "Determining the Original Language of Historical Texts: A Multivariate Approach" de Martínez et al. (2019) no Journal of Historical Linguistics tem uma metodologia sólida que eu segui em diversos projetos. A ideia central é tratar a determinação da língua não como um problema de classificação única, mas como um problema probabilístico com múltiplas variáveis pesando a favor ou contra cada candidato.