Looped Qwen3 (Huginn), FineWeb, 9.15M non-embedding параметров

Лучший чекпойнт тестового задания T-LAB, направление Looped Models.

Уменьшенный Qwen3: четыре физических блока, d=384, 6 query heads, 3 KV heads, head dim 128, d_ff=1152, RoPE, QK-norm, GQA, SwiGLU, pre-norm RMSNorm, tied embeddings. Схема Huginn: prelude 1 блок, recurrent core 2 блока, coda 1 блок, concat-adapter, независимый случайный s_0, core-end RMSNorm, 16 повторов, truncated backprop через последние четыре.

метрика значение
selection perplexity на срезе 24 584 192 токенов 115.65
тот же срез, обычный Qwen3 в один проход 128.48
non-embedding параметров 9 147 136
повторов 16
применений блока 32

Данные: HuggingFaceFW/fineweb, subset sample-10BT, revision 9bb295d. Токенизатор — 16k ByteLevel-BPE, обученный только на train-документах, лежит в tokenizer/. Один сид, bf16 autocast, A100.

Загрузка

import torch
blob = torch.load("best.pt", weights_only=False)
print(blob["model_config"], blob["selection_loss"])

Код обучения и эвала, а также отчёт со всеми экспериментами и отрицательными результатами — в репозитории проекта.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Dataset used to train vladotpad/looped-qwen3-huginn-fineweb