HuggingFaceFW/fineweb
Viewer • Updated • 52.5B • 419k • 3.27k
Лучший чекпойнт тестового задания T-LAB, направление Looped Models.
Уменьшенный Qwen3: четыре физических блока, d=384, 6 query heads, 3 KV heads,
head dim 128, d_ff=1152, RoPE, QK-norm, GQA, SwiGLU, pre-norm RMSNorm, tied
embeddings. Схема Huginn: prelude 1 блок, recurrent core 2 блока, coda 1 блок,
concat-adapter, независимый случайный s_0, core-end RMSNorm, 16 повторов,
truncated backprop через последние четыре.
| метрика | значение |
|---|---|
| selection perplexity на срезе 24 584 192 токенов | 115.65 |
| тот же срез, обычный Qwen3 в один проход | 128.48 |
| non-embedding параметров | 9 147 136 |
| повторов | 16 |
| применений блока | 32 |
Данные: HuggingFaceFW/fineweb, subset sample-10BT, revision 9bb295d.
Токенизатор — 16k ByteLevel-BPE, обученный только на train-документах, лежит в
tokenizer/. Один сид, bf16 autocast, A100.
import torch
blob = torch.load("best.pt", weights_only=False)
print(blob["model_config"], blob["selection_loss"])
Код обучения и эвала, а также отчёт со всеми экспериментами и отрицательными результатами — в репозитории проекта.