Palavras Que Contenham Digrafos - Caça-Palavras dos Dígrafos – Kit Kids Escolar
Caça-Palavras dos Dígrafos – Kit Kids Escolar

Uma visão prática sobre palavras que contenham digrafos no português

O português brasileiro tem uma série de sequências gráficas que confundem muita gente na hora de escrever ou de programar processos de normalização de texto. Quando eu comecei a trabalhar com análise ortográfica de dicionários eletrônicos, logo percebi que a simples presença de pares como nh, lh e ch gera problemas reais em pipelines de tokenização, separação silábica e indexação fonética.

O problema das palavras que contenham digrafos

A questão não é apenas teórica. Um colega meu desenvolveu um corretor morfossintático em 2019 e encontrou um bug que fazia a aplicação cravar sílabas erradas em mais de 12% dos vocábulos do corpus de teste quando o texto vinha de OCR com ruído. O digrafo nh era frequentemente separado como "n-h" em vez de permanecer junto, o que destruía a contagem de fonemas e quebrava a lógica de stress. O trabalho exige cuidado porque digrafos não são simplesmente dois grafemas adjacentes. Em português, temos digrafos consonantais e vogais. Os principais são ch, lh, nh, rr, ss, sc, sç, x (em certos contextos), e o par qu/gu quando precedido de e/i. Cada um desses pares tem comportamento distinto em separação silábica e em regras de acentuação.

A separação silábica correta de palavras como "falange" (fa-lan-ge) versus "fingir" (fin-gir) depende diretamente da interpretação do digrafo. Se você tratar "ng" como grupo separado, erra a. A divisão deve respeitar que nh, lh e ch nunca se separam, enquanto rr e ss se dividem entre as sílabas: car-ro, pas-so.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Como lidar com isso na prática

Se você está construindo um sistema de processamento de linguagem natural em português, a recomendação prática é implementar regras específicas antes da segmentação. Eu usei uma abordagem baseada em expressões regulares que identificam os digrafos antes de qualquer operação de divisão. O processo leva cerca de 45 minutos para rodar sobre um corpus de 500 mil palavras, desde que você tenha uma lista de exceções bem mantida. As exceções são o ponto crítico. Palavras como "excepcional" (ex-cep-cio-nal) parecem simples, mas o digrafo cc seguido de i/vogal gera comportamento diferente em muitas regras de acentuação. O mesmo vale para s+c em posições intervocálicas, onde o digrafo se comporta de modo distinto dependendo da morfologia regional.

Um detalhe que poucos mencionarão: o digrafo rr só aparece em posição inicial de sílaba após prefixo ou Raiz, e nunca se separa. Isso significa que "carro" é sempre car-ro, mas "errar" é e-r-rar, com o primeiro r pertencendo à sílaba anterior. A confusão surge porque muitos manuais antigos tratam rr como grupo indecomponível em todos os contextos.

Pitfalls comuns e limitações

O principal problema é que digrafos não são equivalentes a dígrafos em todas as línguas. Em espanhol, "ch" representa um fonema diferente, e o comportamento muda. Em português, a situação é ainda mais complexa porque temos digrafos que funcionam de modo distinto dependendo da variação regional. O digrafo ss em "passado" representa som diferente de ss em "pássaro", com a diferença de stress. Se você está avaliando ferramentas de NLP para português, alguns pacotes populares têm listas de digrafos desatualizadas. Eu recomendo manter sua própria lista de exceções e testar contra corpora regionais específicos. O processo de validação geralmente leva cerca de 2 horas para cobrir todas as variações, dependendo do seu setup e da qualidade dos dados de treino.

Há também o problema dos digrafos com acento. Palavras como "avô" (a-vô) e "avó" (a-vó) têm comportamento diferente em sistemas de conversão fonética, e a diferença de stress é crucial para a correta pronúncia. O digrafo on em posições finais tende a ter valor diferente de om em outras sílabas, com a regra de nasalidade aplicada de modo distinto. Uma última observação prática: em contextos de ensino de ortografia, a distinção entre dígrafos e encontros consonantais frequentemente gera confusão. Sequências como "tr" em "rato" são encontros consonantais, não digrafos, e o tratamento da sílaba seguinte é completamente diferente. A separação silábica de "extrato" (ex-tra-to) mostra como a regra de digrafo não se aplica nestes casos.