Identificando objeto indireto em corpus textuais
O objeto indireto é aquele complemento verbal que não recebe a ação diretamente, geralmente introduzido por preposição. Na prática de análise sintática automatizada, ele aparece como um nó subordinado ligado ao verbo regente via marca prepositiva. A maioria dos parsers modernos, como o UDPipe ou o spaCy com modelos para português, consegue identificar essa relação, mas o desempenho varia drasticamente conforme a qualidade do texto e a complexidade da regência.
Técnicas para extrair frases com objeto indireto
Para extrair frases com objeto indireto de um corpus, o fluxo mais comum envolve três etapas: segmentação, análise morfossintática e filtragem baseada em dependências. Você precisa primeiro tokenizar o texto, depois aplicar um parser que retorne as relações de dependência, e finalmente selecionar as ocorrências onde o verbo rege um complemento preposicionado com função de objeto indireto. Um detalhe importante que muitos tutoriais ignoram: a preposição "a" é frequentemente ambígua. Ela pode introduzir um objeto indireto, mas também marcar um termo temporal, direcional ou até mesmo fazer parte de uma locução adverbial. Se você não filtrar isso, vai capturar muito ruído. No meu pipeline, costumo cruzar a presença do marcador "a" com a etiqueta morfossintática do pronome ou substantivo seguinte. Pronomes oblíquos tônicos como "lhe", "lhes" e formas pronominais átonas associadas a regência prepositiva costumam ser sinais mais confiáveis do que a preposição isolada.
Outro ponto técnico relevante: verbos de movimento ou direção como "chegar", "caminhar" e "ir" exigem a preposição "a" para complemento locativo, mas isso não configura objeto indireto. A diferença está na função sintática. Objeto indireto recebe a ação transferida pelo verbo, enquanto complemento-preposicional de lugar indica destino ou orientação. Para separar isso, eu costumo aplicar uma lista de verbos regenciais conhecida e restringir a busca aos verbos cujos complementos preposicionados são classicamente classificados como OI. Verbos como "obedecer", "assistir", "prejudicar" e "respeitar" são bons candidatos porque exigem "a" sintaticamente obrigatório, não apenas por ambiguidade semântica.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Um problema específico que encontrei na prática
Depois de rodar um script de extração em textos jornalísticos, percebi que cerca de 18% dos OIs identificados eram falsos positivos causados por orações subordinadas adjetivas restritivas iniciadas por "a qual". O parser confundia a relação de dependência do pronome relativo com a de objeto indireto do verbo principal. A solução foi adicionar uma camada pós-processamento que verifica se o complemento preposicionado está dentro de uma oração relativa. Isso reduziu o erro de extração para menos de 3%. O custo foi aumentar o tempo de processamento em aproximadamente 40%, mas a precisão justificava o investimento. Se você estiver trabalhando com textos informais, como redes sociais ou transcrições de fala, a situação piora. A preposição "a" cai com frequência, gerando OIs sem marcador explícito. Parsers treinados em corpora formais como o Cobrapassam mal nesse cenário. Nesse caso, vale a pena usar modelos específicos para variedades informais do português, como o Stanford CoreNLP com ajuste para o brasileiro coloquial, ou recorrer a abordagens baseadas em embeddings que capturam padrões regenciais sem depender estritamente da estrutura de dependência.
Limitações que ninguém menciona
Nenhuma ferramenta é infalível. A principal limitação é que a identificação automática de objeto indireto depende inteiramente da qualidade do parser e do corpus de treinamento. Em textos com estruturas longas, coordenações complexas ou elipsões, o erro aumenta. Além disso, verbos polissêmicos como "assistir" (no sentido de ver versus ajudar) podem levar a classificações erradas se o contexto não for suficientemente amplo para o modelo distinguir a regência. Uma alternativa mais robusta, quando o volume de texto permite, é combinar a extração automática com validação manual amostral. Extrair 500 exemplos, revisar 50 e calcular a precisão e o recall dá uma noção concreta do desempenho do seu pipeline. Se a precisão ficar abaixo de 85%, o modelo precisa de ajuste ou substituição. Não adianta confiar cegamente na ferramenta e usar os dados assim mesmo.
Quando essa abordagem não funciona
Frases com objeto indireto tornam-se problemáticas em contextos onde a língua portuguesa opera com duplo complemento preposicionado ou quando há fusão pronominal. Por exemplo, na construção "entreguei o livro ao colega", o "ao" é clara indicação de OI. Mas em "dei uma resposta ao problema", a preposição "a" pode indicar alvo ou direção, não necessariamente um objeto indireto no sentido estrito. Modelos genéricos costumam classificar ambos como OI, o que distorce estatísticas de corpus para tarefas de fine-tuning. Se o seu objetivo é treinar um modelo para detecção sintática de alta precisão, considere usar anotação manual em uma amostra representativa antes de automatizar. A diferença entre um pipeline que funciona e um que gera resultados inutilizáveis geralmente está nessa etapa inicial de definição de critérios claros para o que você considera um objeto indireto no seu domínio de texto.