O que é o projeto paulo coelho as valkirias
O nome vem de um modelo de linguagem aberto que rodava localmente, treinado como fine-tune em cima de um Llama base, com corpus misturado de literatura brasileira e prompts em português. O nome foi dado pelo pessoal que soltou a versão 1.0 no Hugging Face ainda em 2023. Nada a ver com o autor propriamente dito, só pegaram o nome dele porque o dataset tinha trechos grandes dele misturado com outras coisas e resolvedores não tinham vontade de inventar nome. Tem duas versões principais espalhadas pela comunidade. A v1 era um modelo de 7 bilhões de parâmetros que respondia bem em português mas travava fácil em raciocínio lógico. A v2 veio meses depois com arquitetura diferente, mais treinamento em código e instruções, e ficou consideravelmente mais capaz. A maioria das pessoas que conhece o projeto está falando da v2 quando menciona.
paulo coelho as valkirias: download e instalações
O repositório original tá no Hugging Face, mas tem mirrors espalhados por aí porque o servidor deles cai de vez em quando. O link direto costuma ser algo do tipo huggingface.co/valkirias-ai/paulo-coelho-model. Baixa o arquivo .safetensors, que geralmente fica em torno de 14 GB para a versão de 7B e uns 40 GB para a de 14B. Para rodar localmente, você vai precisar de quantizar o modelo se não tiver uma GPU de 80 GB. GGUF funciona bem. Ollama suporta o formato nativamente, mas a conversão é chata porque o arquivo original não vem com arquitetura padrão. Use o llama.cpp para converter. O comando base é algo como:
👉 Clique no botão abaixo para saber mais sobre o assunto!
python convert.py --outtype f16 paulo_coelho_as_valkirias.safetensors paulo_coelho_q4.gguf A quantização q4_K_M é o sweet spot entre qualidade e uso de memória. Vai ocupar uns 4,5 GB de VRAM e ainda responde decentemente em português. Quantizar para q2 perde muita capacidade de geração coerente, especialmente em textos longos. Não recomendo.
Se preferir uma interface mais simples, o text-generation-webui da oobabooga detecta o modelo automaticamente se você colocar o GGUF na pasta models. Configuração mínima: 4 linhas de contexto, temperatura 0,85, top_p 0,9. Passos de amostragem default funcionam. Não precisa ajustar nada disso se for usar para escrita criativa ou chat básico. O problema que eu encontrei e demorei pra resolver foi com prompts em inglês. O modelo foi treinado majoritariamente em português e quando você pede algo em inglês ele entra num modo híbrido estranho. Responde na língua certa mas a estrutura fica comprometida, com frases truncadas e repetições de palavras-chave. A workaround foi usar um sistema prompt em português que instrui o modelo a manter a coerência mesmo quando o usuário fala em outro idioma. Funciona porque o training data tem bastante material bilingual misturado.
Outro detalhe que muita gente não percebe é que o modelo tem um viés forte em direção ao estilo narrativo didático. Ele tende a transformar tudo numa espécie de parábola, mesmo quando você pede dados técnicos ou código. Isso não é bug, é consequência direta do fine-tuning com corpus literário. Se você quer usar para programar, o desempenho cai pra nível de um modelo genérico tamanho. Vale mais a pena usar pra geração de texto, resumos, tradução e diálogo. Não recomendo usar em produção crítica sem testes extensivos. O modelo tem alucinações frequentes em datas e nomes próprios. Já vi ele inventar eventos históricos com total convicção. Para uso casual ou projetos pessoais, funciona bem. Para algo onde o erro custa dinheiro, prefira modelos maiores com fine-tuning mais focado em factualidade.