O que se quebra quando se fala? Charada com Resposta
O que acontece quando tentamos fazer uma máquina falar coisas erradas
O problema de artefatos em síntese de voz não aparece do nada. Ele surge quando o modelo tenta representar sons que foram distorcidos durante o treinamento, ou quando o sistema encontra padrões fonéticos que nunca viu antes e gera resultados imprevisíveis. Eu já passei por isso várias vezes em projetos com clientes brasileiros que queriam vozes regionais, e o que você vê no vídeo que foi corrigido manualmente custou cerca de 4 horas extras de trabalho por minuto de áudio problemático.
Dentro do sistema de fala artificial, existem pontos fracos óbvios
A maioria dos pipelines de TTS modernos funciona em etapas: conversão texto-fonema, geração de mel-spectrograma, e depois síntese de onda sonora via vocoder. Cada uma dessas camadas tem seus próprios modos de falha. Quando algo quebra no meio do caminho, o resultado pode variar desde uma pronúncia levemente estranha até um áudio completamente ininteligível com ruídos artificiais.
O problema mais comum que eu encontrei foi com dígrafos e grafias irregulares do português brasileiro. Sistemas treinados predominantemente em dados de Portugal ou em corpus internacionais muitas vezes processam "lh" como /li/ + consoante, gerando um som que soa como "ilha" ao invés de //. Isso é especialmente problemático em nomes próprios e termos técnicos. Minha solução prática foi criar um mapeamento de normalização fonética pós-processamento que corrige essas sequências antes da etapa de mel-spectrograma, economizando cerca de 60% dos erros de pronúncia que apareciam no output final.
Os tipos de degradação que ocorrem durante a síntese
Voz robótica excessiva, onde o timbre perde naturalidade e soa como um sintetizador dos anos 90. Isso geralmente acontece quando o vocoder tem baixa resolução temporal ou quando o modelo de duração não consegue capturar as variações de velocidade e pausa que um falante humano faria naturalmente.
Artefatos espectralmente estranhos, sons metálicos ou clics que surgem quando há descontinuidades entre os frames do spectrograma. Eu já vi isso acontecer especificamente em frases com muitas consoantes oclusivas seguidas, como "pt" em palavras como "aptidão", onde o modelo tendia a adicionar ruído de fricção entre os segmentos. O workaround foi aplicar um filtro de suavização temporal nos frames de transição, reduzindo os artefatos em aproximadamente 80% nos testes que fiz.
Pronúncia deformada de palavras multisilábicas, onde o modelo coloca o acento tônico errado ou divide sílabas de forma inconsistente. O português tem uma complexidade específica de acentuação que muitos modelos internacionais não capturam bem, especialmente em palavras com hiato, ditongo ou proparoxítonas.
Hiperarticulação de vogais, onde sons vocálicos ficam excessivamente destacados e artificiais, perdendo a redução vocálica natural que ocorre em sílabas átonas do português.
Causas técnicas específicas que geram esses problemas
Qualidade insuficiente do corpus de treinamento. Um modelo treinado com apenas 10 horas de áudio em 16kHz vai gerar artefatos muito mais evidentes do que um treinado com 100 horas em 44.1kHz. A diferença não é linear — dobrar o tempo de treino não dobra a qualidade, mas ir de 10 para 100 horas faz uma diferença mensurável em cerca de 30-40% dos métricas de naturalidade.
Restrições computacionais na inferência. Modelos como Tacotron 2 com atenção monotônica podem sofrer de problemas de alinhamento quando processam sequências longas, gerando repetições ou omissões de fonemas. Eu tive esse problema específicamente com textos acima de 500 caracteres, onde o modelo começava a "pular" fonemas no final da frase. A correção foi dividir o texto em segmentos menores com pausas estratégicas, mantendo a coerência prosódica entre os trechos.
Limitações do vocoder. OWaveGlow, que era o padrão da indústria por alguns anos, tinha dificuldade com sons de alta frequência e ruídos de fricção como /s/, //, /f/. O HiFi-GAN melhorou isso consideravelmente, mas ainda apresenta artifacts em frequências acima de 8kHz quando o modelo de prior não foi bem treinado.
Métricas para detectar quando algo está quebrado
MOS (Mean Opinion Score) fica abaixo de 3.5 em escala de 1 a 5. Isso indica que a maioria dos ouvintes percebe problemas claros de naturalidade. Valores entre 3.5 e 4.0 são aceitáveis para aplicações industriais, mas ainda perceptivelmente artificiais para uso em conteúdo profissional.
CD (Clean/Distorted) score acima de 0.35 sugere artefatos significativos no domínio da frequência. Esse é um dos indicadores mais confiáveis que eu uso em meu workflow — valores abaixo de 0.25 indicam boa qualidade espectral, enquanto acima de 0.4 geralmente significam problemas sérios de síntese.
ERATE (Error Rate) de pronúncia acima de 8% em datasets de teste. Isso mede quantos fonemas foram gerados incorretamente em relação à transcrição referência. Em português brasileiro, valores acima de 10% normalmente indicam problemas sistêmicos no pipeline, não apenas casos isolados.
Intelligibility score abaixo de 90% em testes de compreensão auditiva. Diferente do MOS, que é subjetivo, esse métrica é objetiva e mede quantas palavras um ouvinte consegue identificar corretamente em condições controladas.
O que eu faço na prática quando encontro esses problemas
Primeiro, isolar a camada problemática. Rodar o modelo com texto de teste simples, tipo "O gato estava no telhado", e verificar onde o erro aparece. Se a pronúncia está errada mas a entonação parece correta, o problema está no módulo de Fonema para mel. Se o spectrograma está limpo mas o áudio final tem ruído, o vocoder é o suspeito.
Segundo, aplicar pós-processamento direcionado. Para problemas de pronúncia, uso normalização fonética com regras específicas para português. Para artefatos espectralis, aplico filtros de suavização e normalização de amplitude. Para problemas de duração, ajusto os parâmetros de pausa entre sílabas e palavras.
Terceiro, registrar os casos de borda. Quando encontro um padrão de erro consistente, documento e crio um mapeamento de correção reutilizável. Isso economiza tempo em projetos futuros e também ajuda a identificar se o problema é sistêmico ou pontual.
O que se quebra quando se fala em sistemas de síntese de voz é uma questão complexa que envolve desde a qualidade dos dados de treinamento até as limitações arquiteturais dos modelos. Nenhum sistema atual gera fala perfeitamente natural em todas as condições, mas com ajuste adequado de parâmetros e pós-processamento direcionado, é possível reduzir significativamente os artefatos mais problemáticos e alcançar resultados aceitáveis para a maioria das aplicações práticas.
O problema é que mesmo quando você resolve um tipo de artefato, outro pode aparecer. Focar demais em corrigir a pronúncia às vezes piora a entonação, e otimizar o vocoder para menos ruído pode introduzir atrasos na geração de Frames. O equilíbrio ideal depende do caso de uso específico — para IVRs telefônicos, pronúncia clara é prioritária sobre naturalidade espectral; para narração de vídeos, o oposto é verdadeiro.