Substantivos em português: a diferença prática entre comum e próprio
O tratamento de texto que eu usava num projeto editorial precisava destacar automaticamente todos os substantivos próprios num texto grande, mas o script pegava também palavras como "Brasil" dentro de nomes compostos e classificava "rio" como próprio só porque aparecia no início da frase. A correção foi simples: adicionar uma lista de stop words de nomes próprios reconhecíveis e fazer uma verificação de capitalização contextual, não só a primeira letra do termo.
o que e substantivo proprio e comum
Substantivo é a classe gramatical que nomeia seres, coisas, sentimentos, lugares, ações ou ideias. Ele se divide em dois grandes grupos, e a distinção entre substantivo próprio e substantivo comum é uma das mais básicas, mas também das mais problemáticas na prática, porque os limites nem sempre são claros. Substantivo comum é o nome genérico de tudo que pertence a uma categoria. Ele não identifica um indivíduo único, apenas um tipo. Quando você escreve "cidade", "criança", "cachorro", "mesa" ou "coragem", você está usando substantivos comuns. Eles podem ser usados no plural, podem receber artigos, podem ser modificados por adjetivos. "O cachorro", "uma mesa bonita", "as crianças" são construções perfeitamente normais com substantivos comuns.
Substantivo próprio é o nome que identifica um indivíduo específico dentro de uma categoria. "São Paulo", "Frida Kahlo", "Júpiter", "Amazonas" são substantivos próprios. Eles recebem letra maiúscula no início na língua portuguesa e, em geral, não variam no plural da mesma forma. Você não diz "os São Paulos" para se referir a várias cidades-estado com esse nome no mesmo contexto, a menos que esteja fazendo um jogo de palavras intencional. A regra do livro didático é fácil: comum = genérico, próprio = específico. O problema é que o uso real quebra essa simplicidade rapidamente. Eu tive um caso numa revisão de manual técnico onde o autor usava "Universidade" com letra maiúscula sem motivo gráfico, apenas por tradição institucional, e o corretor automático marcava como erro de ortografia. A solução foi manter a norma culta para o documento padrão, mas criar uma exception list na ferramenta de revisão para os casos de uso institucional legítimo.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Existem nuances que poucos manuais citam com a clareza que merecem. Um substantivo comum pode virar próprio quando é apropriado para nomear algo específico. "Vou comprar um ipad" — aqui "ipad" é comum, pois refere-se a um produto. "Vou comprar um Apple iPad" — o uso da marca como próprio mantém a capitalização, mas o substantivo "ipad" sozinho, usado como marca, já foi fossilizado em maiúscula pelo uso informal. A norma culta exige "iPad", mas o dicionário já registra a forma com inicial maiúscula por Uso consolidado. Outro ponto delicado são os nomes geográficos compostos. "Rio de Janeiro" é um substantivo próprio composto, mas "rio" dentro dele é um substantivo comum que perdeu a função genérica por estar parte de um todo nomeado. Isso significa que, numa análise automática, você não pode tratar "rio" isoladamente como próprio só porque aparece no início de "Rio de Janeiro". A tokenização precisa respeitar a unidade do nome próprio, não cada morfema individual.
Há também a questão dos substantivos comuns que funcionam como próprios em contextos específicos. "O Correios", "a Petrobras" — quando se usa artigo definido diante de nome próprio, o artigo passa a fazer parte da referência, mas não altera a classificação gramatical do substantivo. Alguns gramáticos tratam isso como uso pronominal do substantivo próprio, mas na prática analítica o resultado é o mesmo: o núcleo continua sendo um substantivo próprio, e o artigo é um determinante externo a ele. Se você precisa classificar substantivos num processamento de linguagem, o caminho mais direto é combinar três sinais: capitalização, posição no input e frequency dictionary. Nomes próprios aparecem com frequência baixa em textos gerais, enquanto substantivos comuns dominam o vocabulário. Uma lista de nomes próprios conhecidos (pessoas, lugares, marcas) resolve a maior parte dos casos, mas nomes de rua, de bairros e topônimos locais exigem fontes específicas, como bases geográficas abertas do IBGE ou APIs de endereços. Sem essas fontes, a taxa de erro em nomes próprios sobe para algo em torno de 15% a 20% em textos regionais.
A desvantagem desse método híbrido é que nomes próprios pouco conhecidos, neologismos de marcas e nomes de pessoas reais fora do corpus de treinamento não serão identificados corretamente. Se o seu cenário exige alta precisão em nomes próprios desconhecidos, a alternativa é treinar um modelo de NER com dados anotados do domínio específico, o que geralmente dobra o tempo de desenvolvimento, mas reduz a taxa de erro para menos de 5% em textos do mesmo domínio. O que importa para o dia a dia é saber que a diferença entre substantivo próprio e comum não é apenas uma regra de maiúscula. Ela carrega implicações reais na escrita formal, na indexação de documentos, na busca semântica e na análise automática de texto. Reconhecer essa distinção com critério evita erros de formatação e de processamento que parecem pequenos no começo, mas se acumulam rapidamente em projetos maiores.