Gráfico De Dispersão Exemplo - Gráficos De Dispersão _ Gráfico de Dispersão: Para que serve e como ...
Gráficos De Dispersão _ Gráfico de Dispersão: Para que serve e como ...

Gráfico de dispersão: o básico que todo mundo esquece

Você provavelmente já viu um gráfico de dispersão antes, mesmo que não tenha dado nome a isso. São aqueles pontos espalhados num plano cartesiano, mostrando a relação entre duas variáveis. O eixo X traz uma coisa, o eixo Y traz outra, e cada ponto representa uma observação do seu dataset. Pronto. É isso que ele é. O que as pessoas não entendem direito é quando usar um e quando NÃO usar. Gráfico de dispersão serve para detectar correlações, padrões e outliers. Ele não serve para mostrar composição, distribuição ou evolução temporal. Confundir essas coisas gera gráficos que não comunicam nada útil.

Como montar um gráfico de dispersão exemplo na prática

Vou direto ao que importa. Digamos que você tenha dois vetores: investimento em marketing e receita mensal. No Python, com matplotlib, você faria algo assim: import matplotlib.pyplot as plt
plt.scatter(x, y, alpha=0.6)
plt.xlabel('Investimento em marketing (R$ mil)')
plt.ylabel('Receita mensal (R$ mil)')
plt.show()

O parâmetro alpha é importante porque resolve um problema comum: overplotting. Quando você tem centenas ou milhares de pontos, eles se sobrepõem e viram uma mancha só. Alpha traz transparência e permite enxergar a densidade real dos dados. Sem ele, gráficos com mais de 500 pontos são praticamente ilegíveis. Se estiver no Excel, selecione as duas colunas, vá em Inserir > Gráfico de Dispersão e escolha o primeiro modelo. Simples. Mas o Excel não lida bem com datasets grandes — acima de 10 mil linhas começa a travar ou distorcer os pontos.

O erro que eu cometi e que ainda vejo muito

Trabalhei numa startup de e-commerce onde tínhamos que analisar a relação entre tempo de carregamento da página e taxa de conversão. Fiz um gráfico de dispersão padrão e notei uma correlação negativa forte. A conclusão imediata foi "otimizar o carregamento melhora conversão". O problema é que a correlação era espúria. Ambas as variáveis cresciam juntas simplesmente porque o tráfego geral da empresa estava subindo ao longo do tempo. Era uma confusão temporal, não causal. A solução foi adicionar uma linha de tendência com regressão linear e, mais importante, transformar os dados em differences first — usar variação mês a mês em vez de valores absolutos. A correlação despencou de -0.72 para -0.18. O insight real era bem menos sexy, mas pelo menos era honesto.

Isso é algo que poucos ensinam: valor absoluto em séries temporais gera correlações falsas. Diferenciais ou dados normalizados por grupo evitam esse problema.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Coisas que ninguém fala sobre gráficos de dispersão

Primeiro, a escolha da escala dos eixos pode mentir. Se você truncar o eixo Y começando em vez de zero, a variância aparente aumenta artificialmente. Ponto que ficam próximos num gráfico com escala natural podem parecer drasticamente diferentes com escala truncada. Sempre verifique se os eixos começam em zero, especialmente quando os dados não são proporcionais. Segundo, outliers não são apenas ruído. Às vezes eles são o sinal mais interessante do conjunto. No meu caso de e-commerce, um outlier — uma landing page com carregamento de 8 segundos mas taxa de conversão de 12% — revelou que tínhamos um canal de tráfego altamente qualificado vindo de email marketing. Ignorar aquele ponto teria escondido uma oportunidade real.

Terceiro, se seus dados têm mais de três dimensões, dispersão simples não basta. Você pode adicionar cor (terceira dimensão), tamanho (quarta) ou facetar em múltiplos subgráficos (quinta). Mas a partir da quarta dimensão, a legibilidade cai rápido. Nesse caso, considere PCA ou t-SNE para reduzir dimensionalidade antes de plotar.

Quando um gráfico de dispersão simplesmente não funciona

Dados categóricos num dos eixos. Se uma das suas variáveis é tipo "região" ou "categoria de produto", dispersão não é a ferramenta certa. Use boxplot ou violin plot nesse caso. Dispersão exige dados contínuos em ambos os eixos. Dados com milhares de pontos densamente aglomerados. Mesmo com alpha, a densidade visual fica ilegível. Nesses casos, heatmaps 2D, hexbin plots ou kde (kernel density estimation) são opções melhores. O seaborn faz isso com uma linha: sns.jointplot(data=df, x='var1', y='var2', kind='hex').

Versões online gratuitas como o Google Sheets também fazem dispersão básica, mas faltam recursos como facetamento, transparência controlada e integração com pipelines de dados. Se você faz análise recorrente, vale a pena investir tempo aprendendo Python ou R.

Onde encontrar dados para praticar

O dataset Iris do UCI Repository é o clássico dos clássicos — quatro variáveis numéricas e três classes de flores. Perfeito para testar relação entre comprimento e largura de pétalas. Tem também o dataset Boston Housing, que mostra relação entre preço e várias variáveis como número de quartos e taxa de criminalidade. Ambos estão disponíveis no seaborn: sns.load_dataset('iris') e sns.load_dataset('boston'). Se quiser dados brasileiros, o IBGE disponibiliza bases microdados com informações socioeconômicas que prestam muito para montar gráfico de dispersão exemplo com contextos reais de análise.