Por que os valores semânticos das preposições nunca são fixos
Achei que isso era resolvido uma vez por todas na faculdade. Li os manuais, memorizei as tabelas, passei na prova. Aí entrou no mundo real e percebi que preposição é coisa de arquitecto: o mesmo tijolo, o mesmo cimento, mas dependendo de onde você coloca, ora segura uma parede, ora vira adorno decorativo. O conceito de valor semântico da preposição existe porque as preposições em português não têm um único significado. Elas carregam relações que mudam conforme o contexto sintático e semântico da frase. "De" indica posse num caso, origem noutro, assunto em outro ainda. "Em" pode ser lugar, tempo, situação, modo. A regra geral é: olhe o que a preposição conecta com o que, e pergunte-se qual relação lógica ela estabelece entre os termos.
Como identificar o valor semântico da preposição na prática
A técnica mais directa é substituir o termo regido por um pronome ou reformular a oração. Se eu digo "estou cansado de trabalhar", o "de" funciona como marca de complemento nominal. Mas se troco para "estou cansado do esforço", o "do" passa a ser apenas indicação de causa. A preposição não mudou, a estrutura mudou, o valor também. Outro método é isolar o sintagma preposicional e testar equivalentes. "Fui a Lisboa ontem" versus "Fui ao mercado ontem". O "a" é direcção no primeiro caso, mas no segundo ele já opera mais como marca de regime verbal do que propriamente como indicação espacial. Preposição é flexible. Aceite isso logo no início para não gastar duas horas tentando enquadrar tudo numa caixinha rígida.
Tipos de valor semântico que aparecem com mais frequência
Se você precisa de um mapa mental rápido, aqui vai. Os valores mais recorrentes são os seguintes. Finalidade — "Fizeste isso para quê?" A preposição "para" indica objectivo. Exemplo: "Trouxe este livro para estudar." O "para" liga o acto de trazer ao propósito de estudar. Simples, mas preguiçoso demais para ser sempre tão claro. "Dei o recado para ele avisar" também tem valor de finalidade, só que aqui o sujeito da infinitiva não é o mesmo de quem deu o recado. Isso gera ambiguidade fácil.
Causa — "Morreu de velhice", "Estava tremendo de frio". O "de" introduz a razão. É um dos usos mais produtivos do "de" e também um dos mais traiçoeiros porque o mesmo "de" aparece em valoração temporal ("há dez anos"), posse ("o carro do João"), matéria ("feito de madeira"). O contexto decide. Sempre. Companhia — "Vou ao cinema contigo". O "com" é quase sempre identidade temática, mas já vi aluno confundir com instrumento: "Escreveu com caneta" não é companhia, é instrumento. Essa distinção parece elementar mas em redacções formais aparece todo o dia.
Instrumento — "Cortou com faca". Aqui o "com" marca o meio, não o parceiro. A confusão entre companhia e instrumento é talvez o erro mais persistente em análise sintáctica de nível introdutório. A regra prática: se dá pra trocar por "por meio de" sem mudar o sentido, é instrumento. "Cortou por meio de faca" funciona. "Vou ao cinema por meio de ti" não funciona. Teste rápido resolve. Concessão — "Embora tenha chovido" já usa conjunção, mas "apesar de chover" emprega a preposição "de" após a locução conjuntiva. O valor concessivo está no conjunto, não na preposição isolada. Isso é importante porque muita gente tenta analisar o "de" como se fosse autónomo e acaba chegando a conclusões esquisitas.
Tempo — "Em 2023", "Às nove horas". O "em" indica momento temporal. O "a" também pode, quando combinado com hora certa: "Encontrei-o às quinze horas". O "a" temporal exige o artigo definido plural. Se faltar o artigo, a análise muda. Lugar — "Na cozinha", "Em casa", "Ao hotel". O "em" com ideia de localização. O "a" com ideia de movimento dirigido a um ponto. A distinção lugar estático versus lugar dinâmico é a base, mas não o limite. "Estou a pensar" não é movimento literal, é uso figurado do "a" + infinitivo que funciona como perífrase verboidal, não como preposição literal de lugar. Cuidado com analistas que tentam forçar tudo para dentro de caixas espaciais.
👉 Clique no botão abaixo para saber mais sobre o assunto!
O problema que eu encontrei e como resolvi
Há alguns anos, num projecto de analyse de texto para uma editora, precisei classificar automaticamente os valores prepositivos de um corpus de cerca de cento e cinquenta mil ocorrências. Usei um rule-based system inicial baseado em padrões textuais, com regras como: "a + [locativo] valor de lugar". Funcionou bem para oitenta por cento dos casos. O resto era o famoso lixo contextual. O problema específico veio com frases como "confiou na sorte" versus "chegou à conclusão de que errara". O "a" e o "em" apareciam na mesma posição superficial, mas o valor semântico era completamente distinto. A minha primeira tentativa foi criar regras baseadas nos lemas seguintes à preposição. "Sorte" seria abstrato, "conclusão" seria abstrato também. A diferença estava no verbo rector.
A solução que funcionou foi adicionar o contexto do verbo no window de três palavras à esquerda da preposição. Criei um pequeno classificador bayesiano simples com features de POS tagging e lema verbal. O modelo treinou em cerca de quatro horas num notebook comum e atingiu cerca de noventa e dois por cento de accuracy no set de teste. Para os casos residuais que o modelo não classificava com confiança acima de oitenta por cento, passei para revisão manual. Foram cerca de cinco por cento do total. Em produção, esse pipeline reduziu o tempo de annotation de algo como sessenta horas homem para aproximadamente oito horas homem, dependendo da qualidade do corpus de treino.
O que os manuais não contam sobre preposição
Aqui vai uma coisa que poucos explicam de forma honesta: preposição é função, não classe lexical em si mesma. Quando eu digo "de" em "livro de história" versus "de" em "casa de madeira", não é a mesma partícula tendo dois significados arbitrários. São funções diferentes que a mesma forma fonológica carrega. Isso explica por que a análise tradicional às vezes falha: ela trata as preposições como palavras com dicionário próprio, quando na verdade elas operam como marcadores de relação sintáctica que se semanticizam por uso frequente. Outro ponto negligenciado: preposições átonas em português competem com outras estratégias gramaticais. A linguagem formal prefere a preposição exigida pelo regime verbal. A linguagem informal frequentemente elide ou substitui. "Falei sobre o assunto" vs. "Falei o assunto". O "sobre" cai, o significado persiste. Em análise automática, essa variação registral gera ruído significativo se você não stratificar o corpus por registos.
Também é importante notar que algumas construções com preposição são verdadeiramente idiomáticas. "Ter medo de" — o "de" não acrescenta valor preposicional livre, é parte do léxico do verbo. "Chegar a" no sentido de alcançar um estado — o "a" já quase operou como parte de um marcador aspectual. Distinguir regência prepositiva lexical de regência estrutural é essencial para qualquer aplicação prática, seja análise linguística, tradução automática, ou desenvolvimento de gramáticas computacionais.
Quando a análise de valor semântico da preposição falha
Não minta para si mesmo achando que existe um método perfeito. Regras baseadas em contexto imediato funcionam bem para textos normativos, literatura padrão, manuais técnicos. Elas desmoronam em poesia, em transcrições de fala espontânea, em dialectos regionais onde o regime verbal difere do padrão. Em fala cotidiana ouvida em gravações de campo, a taxa de erro do meu rule-based system subiu para algo perto de trinta e cinco por cento. Aí o recomendável é combinar a abordagem automática com análise qualitativa, ou usar modelos de linguagem treinados em corpora representativos do registo alvo. Se o seu objectivo é classificação puramente automática e você trabalha com português brasileiro contemporâneo, considere usar embeddings contextuais em vez de regras manuais. Modelos como o BERT fine-tunado para annotated corpus sintáctico produzem resultados consistentemente melhores do que sistemas rule-based, especialmente para os casos fronteira. O custo é maior: você precisa de dados anotados de qualidade e de capacidade computacional que um notebook não fornece. Para produção em escala pequena ou média, o combo rule-based + classifier bayesiano ainda é eficiente. Para produção industrial, vá de transformer.
Na prática, a escolha depende do volume, do registo, e da tolerância a erro que o seu projecto admite. Não existe resposta universal. Eu já tentei impor uma solução única e gastei três semanas refazendo trabalho que poderia ter sido feito em dois dias com a abordagem correcta desde o início. A lição foi cara mas directa: calibre a complexidade da análise ao complexity do dados que você realmente tem em mãos.