Mini Pinhão 🌲

Mini Pinhão é um modelo decoder-only compacto treinado em português brasileiro com camada de estilo curitibano.

Código-fonte, pipeline de treino e documentação completa: github.com/luiscorreiaOps/pinhao-llm.

Uso

Este export contém os pesos em model.safetensors, tokenizer ByteLevel BPE e metadados de treino. O código de inferência (pinhao.sample) fica no repositório GitHub do projeto.

python -m pinhao.sample --config configs/pinhao_8m.py --prompt "Diz aí, piá"

O que é garantido, e o que não é

Com 7,4M parâmetros e ~1,3k tokens de SFT dedicados à persona, o modelo:

  • reproduz de forma confiável os exemplos do README (e prompts bem próximos a eles) — validado empiricamente com temperature=0.15, top_k=5 (defaults de pinhao.sample.generate(); temperature=0.8 alta faz a amostragem divergir no meio da resposta);
  • nunca fica em silêncio: se a continuação gerada for vazia/quase vazia (prompt bem fora do que o SFT viu), cai numa resposta genérica só em persona, em vez de ecoar o prompt sem responder;
  • sempre sai em sotaque curitibano, porque generate() aplica pinhao.curitibize.curitibize_text() no texto final por padrão (apply_curitibize=True) — injeção determinística de vocabulário/cadência, o que nenhuma rede de 7,4M consegue garantir sozinha;
  • não garante conteúdo correto para perguntas novas fora do que treinou (ex. perguntas factuais não vistas) — pode responder algo do tema errado. Isso é limite de capacidade do tamanho do modelo, não um bug de inferência.

Se for consumir model.safetensors diretamente (sem passar por pinhao.sample), replique pelo menos o pós-processamento de estilo para ter a mesma garantia, em texto ou para uso com TTS:

from pinhao.curitibize import curitibize_text

texto_bruto = "<saída do model.generate(...) decodificada>"
texto_final = curitibize_text(texto_bruto)

Dados

  • Dataset: Curitibano
  • Tokens de treino: 22431892
  • Tokens de validação: 892021
  • Tokens de treino (SFT persona): 1354
  • Vocabulário: 16384

Limitações

Modelo pequeno e experimental. A saída crua do modelo pode gerar texto incoerente, factualidade incorreta ou estilo regional inconsistente, especialmente com pouco treino.

Licença

MIT

Downloads last month
159
Safetensors
Model size
7.41M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support