Pocket-LM 269M
Collection
LM de 269M treinado do zero em portugues para rodar offline em celular de entrada, com os benchmarks pt-BR feitos para avalia-lo. • 8 items • Updated
adapter-whats-v1 (executor + conversa, com replay)
SFT completo sobre a base executor-v1: dose de 7% de conversa + replay de 25%
do pré-treino, max-len 384, somando +757 pares com bloco de contexto (ctx_vultr_v1). É o candidato de produto do bot de WhatsApp (com bloco de contexto).
| métrica | valor |
|---|---|
| intenção (n=1035) | 86,96 |
| F1 de campos (n=1035) | 74,53 |
| F1 com parada | 75,32 |
| CALAME-PT | 42,77 |
| LAMBADA-PT | 23,79 |
| 5-shot (MASSIVE) | 43,0 |
| coerência de conversa | 78,85 |
| honestidade (n=15) | 66,67 (sinal fraco, n=15) |
A lição que este checkpoint materializa: replay de 25% no SFT recupera a língua sem
custar execução (CALAME 18→43 e 5-shot 19→41 contra o mesmo SFT sem replay; intenção
e F1 intactos). Análise completa: medicoes/ANALISE_ADAPTERS.md em
https://github.com/MaxxArtes/pocket-lm-269m
Coerência/honestidade têm ±9 pp de ruído do juiz; honestidade tem n=15.
Base model
Magurofg/pocket-lm-269m-executor