{ "schema_version": 2, "revision": 4, "revision_id": "r004", "release": "Pollock 1.2", "model_id": "SlayerLab/pollock-mini-lm-125m", "source_checkpoint": { "path_in_training_workspace": "runs/pollock-r004-shape/checkpoints/ckpt-final.pt", "sha256": "4e38589ca422597ff808bc93cc17ddcc441f734a4e0f671ee6d4527c545972e0", "iteration": 22004, "tokens_seen": 10815406080, "native_nanogpt_parameters": 126541376, "native_unique_trainable_parameters": 127393344 }, "architecture": { "n_layer": 14, "n_head": 13, "n_embd": 832, "block_size": 1024, "vocab_size": 12288, "dropout": 0.0, "bias": false, "tied_word_embeddings": true }, "training": { "dataset": "SlayerLab/minimal-en-corpus-2.5b", "init_from": "scratch", "micro_batch_per_gpu": 12, "gradient_accumulation_global": 40, "ddp_world_size": 1, "effective_batch_tokens": 491520, "optimizer": "fused AdamW", "learning_rate": 0.0004, "min_learning_rate": 0.00004, "schedule": "cosine", "warmup_iters": 440, "lr_decay_iters": 22003, "beta1": 0.9, "beta2": 0.95, "weight_decay": 0.1, "grad_clip": 1.0, "precision": "bfloat16", "compile": true, "backend": "nccl", "seed": 1337, "evaluation_seed": 1337, "hardware": "1x NVIDIA GeForce RTX 5090", "nanogpt_commit": "3adf61e154c3fe3fca428ad6bc3818b27a3b8291" }, "evaluation": { "protocol": "fixed sampled subset", "subset_tokens_per_split": 1228800, "final_train_loss": 2.4665083193778994, "final_validation_loss": 2.535205955505371, "best_validation_loss": 2.5350550031661987, "best_validation_step": 22000, "final_validation_perplexity": 12.61902953902636, "benchmark_harness": "lm-evaluation-harness 0.4.12", "benchmark_num_fewshot": 0, "benchmark_batch_size": 8, "truncated_benchmark_requests": 80, "results_file": "benchmarks/english.json" }, "conversion": { "target_class": "GPT2LMHeadModel", "transformers_version": "5.15.1", "unique_serialized_parameters": 127522304, "compatibility_zero_bias_parameters": 128960, "validation_probe_shape": [2, 64], "max_absolute_logit_error": 0.0 }, "artifacts": { "README.md": {"sha256": "64513cc6cf3cdc52544a02010293c97b58683c815ef952815954b44fa2b15a0f"}, "CHANGELOG.md": {"sha256": "5203517a875ca3f04747305a80f732aca54a05ca132a4a4b4fb1453d9d2557ea"}, "training-history/r004.md": {"sha256": "d9893a5a9f998cfc93e986d63eb36c9a39f519e1cb74f7a6bf6ac4d3cf6f6f12"}, "benchmarks/english.json": {"sha256": "ffe1e417bef440b1e6a84e05beccb96aa191f6f22141b388cc7ed08297318a7d"}, "config.json": {"sha256": "296c495f22edddb9828ff9c9ca486cddbacff510742f4aff6a04552d2da3b8d4"}, "generation_config.json": {"sha256": "435beb27be51f0ed054f4a011e5109d125cdadc118b8799b18b155cc798d94d2"}, "model.safetensors": {"sha256": "3c453f22d4bb70228e5cca79e183a425e0f0221e54bd782d12027c42c943c880"}, "special_tokens_map.json": {"sha256": "8b2257a17ea997bb038f43b133aefec82344ad2b8abc2b8a02a6c0a994ed624e"}, "tokenizer.json": {"sha256": "6cda4e5ec8293f3b821e02253f9c0e88e43ad4f7c6e1324763e1fb91749fef51"}, "tokenizer_config.json": {"sha256": "4cdabe37dbdc1adfcc017ee9a1f86ab89bdf184827d2d9f05181cae0f8af19bf"} } }