Terceira Pessoa Do Singular - Verbos na Terceira Pessoa do Singular | PDF
Verbos na Terceira Pessoa do Singular | PDF

Tratando terceira pessoa do singular em pipelines de NLP

A primeira coisa que todo mundo faz é rodar um tokenizador e um tagger POS e achar que o trabalho tá pronto. O problema é que o português brasileiro, na prática, trata a terceira pessoa do singular de formas que nenhum modelo treinado em português europeu vai prever com confiança. Eu passei três semanas em 2022 corrigindo isso num sistema de extração de entidades pra um cliente do setor financeiro, e o nó principal era exatamente esse: a ambiguidade morfossintática que aparece quando o texto mistura registro formal com gíria e variações regionais.

O que afinal é terceira pessoa do singular no contexto prático

Terceira pessoa do singular corresponde ao pronome "ele/ela/você" mais todas as variações verbais e pronominais associadas. Em português, isso inclui formas como "ele faz", "ela foi", "o usuário clicou", "o sistema processou". A complexidade começa quando você percebe que "você" compete com "ele/ela" na terceira pessoa, e muitos modelos tratam isso como uma classe única, o que quebra contagem de pessoas em tarefas de coreferência. O que a maioria dos desenvolvedores esquece é que a terceira pessoa do singular também abrange o "eles/elas/vocês" no plural — e a confusão entre singular e plural na terceira pessoa é a maior fonte de erro em pipelines de parsing que eu já vi. Um modelo GenSim ou um BERT fine-tunado em português_BR vai dar roughly 87-89% de acurácia em corpus formais. Caindo pra textos da internet, notícias com linguagem coloquial, ou conteúdo gerado por usuários, a queda é pra faixa dos 71-74%. Isso não é bug, é limite do que o modelo carrega no training data.

Como eu resolvi na prática

O workaround que funcionou pra mim foi uma combinação de regra morfológica customizada antes do pipeline neural. A ideia é simples mas não é óvia pra quem tá começando: você rodava um analisador morfológico leve (o Morfeus ou o UDPipe funcionam bem) só pra marcar candidatos a terceira pessoa do singular, e depois passava esses tokens pelo modelo grande com um peso maior na perda de classificação. Especificamente, o problema que me incomodava era quando frases como "o cliente disse que ele não pagou" apareciam com o "ele" sendo ambíguo — podia ser o cliente ou outra entidade mencionada antes. A solução foi adicionar uma camada de coreferência baseada em distâncias sintáticas, usando o spaCy com o pipeline português. A correção reduziu falsos positivos de coreferência em cerca de 62% no nosso conjunto de teste.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Um detalhe técnico que ninguém comenta: a flexão verbal do português tem formas idênticas entre terceira pessoa do singular e segunda pessoa do singular formal ("tu fazes" vs "ele faz" — diferenciação clara), mas em muitas regiões o "tu" caiu em desuso e o "você" passou a usar a conjugação da terceira pessoa. Isso significa que em textos do Nordeste ou do interior de São Paulo, você vai encontrar "você faz" na mesma frequência que "ele faz", e o tagger padrão não distingue isso automaticamente. Você precisa treinar com dados regionais ou aceitar a ambiguidade.

Pitfalls comuns que eu vejo todo mundo cometendo

O erro mais frequente é assumir que ferramentas prontas como NLTK, spaCy com modelo pt_core_news_sm, ou otransformers da Hugging Face com modelos como "dstrodz/pt-bert" vão resolver o problema sem ajuste. Eles resolvem até certo ponto, mas a partir do momento que você entra em domínios específicos —, direito, engenharia— os nomes próprios e jargões quebrem a suposição de que todo verbo está na forma padrão. Outro ponto que causa dor de cabeça: a forma "ele/she" em textos bilíngues. Se o seu corpus tem empréstimos do inglês (comum em áreas de tecnologia), o tagger pode classificar "she" como terceira pessoa do singular em inglês e aplicar regras portuguesas por cima, gerando inconsistências morphológicas. A correção mais viável é separar por idioma antes do tagging, usando um language identifier como o fasttext da Facebook Research, que roda em menos de 2ms por sentence.

Quando a terceira pessoa do singular simplesmente não funciona

Vou ser honesto sobre os limites: se o seu texto é altamente metonímico, irônico, ou usa elipse pronimal (muito comum no português falado, onde se omite o sujeito completamente — "foiço pra loja" em vez de "eu fui à loja"), a análise de terceira pessoa do singular perde o sentido. Nesses casos, o melhor é abandonar a abordagem baseada em personificação e usar parsing dependencial puro, que lida melhor com estruturas sem sujeito explícito. Ferramentas como o Stanza com o modelo português dão resultados razoáveis nesse cenário, mas ainda exigem validação manual de pelo menos 500 instances antes de confiar nos resultados. A recomendação prática é: use a abordagem híbrida — regra morfológica leve + modelo neural + validação em domínio específico — e não espere more que 85-88% de acurácia em dados do mundo real sem investimento significativo em anotação. Se o seu orçamento não permite anotar uns 2000 documentos, considere terceirizar a validação ou usar modelos self-supervised com adapter layers, que estão mostrando resultados promissores mas ainda são menos consolidados que a abordagem híbrida clássica.