vinoku89 commited on
Commit
9e39e42
Β·
verified Β·
1 Parent(s): aa2303e

Training log (success)

Browse files
Files changed (1) hide show
  1. logs/training_20260113_063547.log +645 -0
logs/training_20260113_063547.log ADDED
@@ -0,0 +1,645 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /venv/main/lib/python3.12/site-packages/trl/__init__.py:203: UserWarning: TRL currently supports vLLM versions: 0.10.2, 0.11.0, 0.11.1, 0.11.2. You have version 0.13.0 installed. We recommend installing a supported version to avoid compatibility issues.
2
+ if is_vllm_available():
3
+ Loading config from: configs/runtime_config.yaml
4
+ Random seed set to: 42
5
+ ============================================================
6
+ Training Configuration:
7
+ Framework: accelerate
8
+ Method: sft
9
+ ============================================================
10
+ W&B Project: aimo3-exp-1-train
11
+ W&B Run: qwen3-0.6b-sft-lora-20260113_063547-003
12
+ wandb: Currently logged in as: vinoku (vinokuteam) to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
13
+ wandb: WARNING Using a boolean value for 'reinit' is deprecated. Use 'return_previous' or 'finish_previous' instead.
14
+ wandb: setting up run 0pkyx3cq
15
+ wandb: Tracking run with wandb version 0.23.1
16
+ wandb: Run data is saved locally in /workspace/distributed-sft-rl-inference-pipeline/wandb/run-20260112_223606-0pkyx3cq
17
+ wandb: Run `wandb offline` to turn off syncing.
18
+ wandb: Syncing run qwen3-0.6b-sft-lora-20260113_063547-003
19
+ wandb: ⭐️ View project at https://wandb.ai/vinokuteam/aimo3-exp-1-train
20
+ wandb: πŸš€ View run at https://wandb.ai/vinokuteam/aimo3-exp-1-train/runs/0pkyx3cq
21
+ wandb: Detected [openai] in use.
22
+ wandb: Use W&B Weave for improved LLM call tracing. Install Weave with `pip install weave` then add `import weave` to the top of your script.
23
+ wandb: For more information, check out the docs at: https://weave-docs.wandb.ai/
24
+ W&B Run: qwen3-0.6b-sft-lora-20260113_063547-003
25
+ W&B URL: https://wandb.ai/vinokuteam/aimo3-exp-1-train/runs/0pkyx3cq
26
+ W&B logging enabled (ID: 0pkyx3cq)
27
+ Loading model: Qwen/Qwen3-0.6B
28
+ ZeRO-0 mode (no HfDeepSpeedConfig needed)
29
+ `torch_dtype` is deprecated! Use `dtype` instead!
30
+ Building datasets...
31
+ Loading dataset from HuggingFace: HAD653/GSM8K-OpenMath-MathReason-13k
32
+ Train size: 13857, Test size: 416
33
+ Dataset size after dropping NaN: 13857
34
+ Dataset size after dropping NaN: 416
35
+ Final train size: 13857, test size: 416
36
+
37
+ ============================================================
38
+ SAMPLE TRAINING DATA (first example):
39
+ ============================================================
40
+ <|im_start|>system
41
+ You are a helpful and reflective maths assistant. Please reason step by step to put the answer in \boxed{}.<|im_end|>
42
+ <|im_start|>user
43
+ Albert is wondering how much pizza he can eat in one day. He buys 2 large pizzas and 2 small pizzas. A large pizza has 16 slices and a small pizza has 8 slices. If he eats it all, how many pieces does he eat that day?<|im_end|>
44
+ <|im_start|>assistant
45
+ <think>
46
+ Problem:
47
+ Albert buys 2 large pizzas (16 slices each) and 2 small pizzas (8 slices each). Find total slices eaten.
48
+
49
+ Reasoning:
50
+ 1. Large pizza slices = 2*16 = 32.
51
+ 2. Small pizza slices = 2*8 = 16.
52
+ 3. Total slices = 32+16 = 48.
53
+
54
+ Answer:
55
+ 48
56
+ </think>
57
+
58
+ \boxed{48}<|im_end|>
59
+ ============================================================
60
+
61
+ Creating LoRA configuration...
62
+ Using Accelerate + SFT training pipeline
63
+ Initializing SFTTrainer...
64
+
65
+ Adding EOS to train dataset: 0%| | 0/13857 [00:00<?, ? examples/s]
66
+ Adding EOS to train dataset: 29%|β–ˆβ–ˆβ–‰ | 4000/13857 [00:00<00:00, 39763.60 examples/s]
67
+ Adding EOS to train dataset: 60%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 8359/13857 [00:00<00:00, 42001.96 examples/s]
68
+ Adding EOS to train dataset: 91%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 12594/13857 [00:00<00:00, 42156.41 examples/s]
69
+ Adding EOS to train dataset: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 13857/13857 [00:00<00:00, 41823.49 examples/s]
70
+
71
+ Tokenizing train dataset: 0%| | 0/13857 [00:00<?, ? examples/s]
72
+ Tokenizing train dataset: 1%|▏ | 191/13857 [00:00<00:07, 1890.51 examples/s]
73
+ Tokenizing train dataset: 3%|β–Ž | 389/13857 [00:00<00:06, 1940.43 examples/s]
74
+ Tokenizing train dataset: 4%|▍ | 596/13857 [00:00<00:06, 1995.13 examples/s]
75
+ Tokenizing train dataset: 6%|β–Œ | 809/13857 [00:00<00:06, 2044.60 examples/s]
76
+ Tokenizing train dataset: 8%|β–Š | 1102/13857 [00:00<00:06, 1846.58 examples/s]
77
+ Tokenizing train dataset: 9%|β–‰ | 1308/13857 [00:00<00:06, 1904.63 examples/s]
78
+ Tokenizing train dataset: 11%|β–ˆ | 1506/13857 [00:00<00:06, 1922.84 examples/s]
79
+ Tokenizing train dataset: 12%|β–ˆβ– | 1715/13857 [00:00<00:06, 1968.12 examples/s]
80
+ Tokenizing train dataset: 14%|β–ˆβ– | 1917/13857 [00:00<00:06, 1981.04 examples/s]
81
+ Tokenizing train dataset: 16%|β–ˆβ–Œ | 2179/13857 [00:01<00:06, 1760.60 examples/s]
82
+ Tokenizing train dataset: 17%|β–ˆβ–‹ | 2383/13857 [00:01<00:06, 1830.22 examples/s]
83
+ Tokenizing train dataset: 19%|β–ˆβ–Š | 2589/13857 [00:01<00:05, 1889.05 examples/s]
84
+ Tokenizing train dataset: 20%|β–ˆβ–ˆ | 2797/13857 [00:01<00:05, 1940.31 examples/s]
85
+ Tokenizing train dataset: 22%|β–ˆβ–ˆβ– | 3000/13857 [00:01<00:05, 1813.69 examples/s]
86
+ Tokenizing train dataset: 23%|β–ˆβ–ˆβ–Ž | 3199/13857 [00:01<00:05, 1859.46 examples/s]
87
+ Tokenizing train dataset: 25%|β–ˆβ–ˆβ– | 3402/13857 [00:01<00:05, 1902.25 examples/s]
88
+ Tokenizing train dataset: 26%|β–ˆβ–ˆβ–Œ | 3607/13857 [00:01<00:05, 1940.17 examples/s]
89
+ Tokenizing train dataset: 27%|β–ˆβ–ˆβ–‹ | 3809/13857 [00:01<00:05, 1961.99 examples/s]
90
+ Tokenizing train dataset: 30%|β–ˆβ–ˆβ–‰ | 4096/13857 [00:02<00:05, 1832.11 examples/s]
91
+ Tokenizing train dataset: 31%|β–ˆβ–ˆβ–ˆ | 4297/13857 [00:02<00:05, 1874.63 examples/s]
92
+ Tokenizing train dataset: 32%|β–ˆβ–ˆβ–ˆβ– | 4496/13857 [00:02<00:04, 1902.27 examples/s]
93
+ Tokenizing train dataset: 34%|β–ˆβ–ˆβ–ˆβ– | 4701/13857 [00:02<00:04, 1939.24 examples/s]
94
+ Tokenizing train dataset: 35%|β–ˆβ–ˆβ–ˆβ–Œ | 4901/13857 [00:02<00:04, 1954.40 examples/s]
95
+ Tokenizing train dataset: 37%|β–ˆβ–ˆβ–ˆβ–‹ | 5105/13857 [00:02<00:04, 1797.40 examples/s]
96
+ Tokenizing train dataset: 38%|β–ˆβ–ˆβ–ˆβ–Š | 5309/13857 [00:02<00:04, 1861.65 examples/s]
97
+ Tokenizing train dataset: 40%|β–ˆβ–ˆβ–ˆβ–‰ | 5507/13857 [00:02<00:04, 1891.21 examples/s]
98
+ Tokenizing train dataset: 41%|β–ˆβ–ˆβ–ˆβ–ˆ | 5714/13857 [00:03<00:04, 1937.16 examples/s]
99
+ Tokenizing train dataset: 43%|β–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 5912/13857 [00:03<00:04, 1946.11 examples/s]
100
+ Tokenizing train dataset: 45%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 6205/13857 [00:03<00:04, 1812.33 examples/s]
101
+ Tokenizing train dataset: 46%|β–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 6401/13857 [00:03<00:04, 1847.31 examples/s]
102
+ Tokenizing train dataset: 48%|β–ˆβ–ˆβ–ˆβ–ˆβ–Š | 6595/13857 [00:03<00:03, 1870.17 examples/s]
103
+ Tokenizing train dataset: 49%|β–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 6797/13857 [00:03<00:03, 1907.11 examples/s]
104
+ Tokenizing train dataset: 51%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 6998/13857 [00:03<00:03, 1932.64 examples/s]
105
+ Tokenizing train dataset: 52%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 7235/13857 [00:03<00:03, 1795.00 examples/s]
106
+ Tokenizing train dataset: 54%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 7459/13857 [00:03<00:03, 1685.28 examples/s]
107
+ Tokenizing train dataset: 55%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 7687/13857 [00:04<00:03, 1627.60 examples/s]
108
+ Tokenizing train dataset: 57%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 7927/13857 [00:04<00:03, 1614.76 examples/s]
109
+ Tokenizing train dataset: 59%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 8158/13857 [00:04<00:03, 1455.26 examples/s]
110
+ Tokenizing train dataset: 60%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 8380/13857 [00:04<00:03, 1460.88 examples/s]
111
+ Tokenizing train dataset: 62%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 8532/13857 [00:04<00:03, 1470.97 examples/s]
112
+ Tokenizing train dataset: 63%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 8684/13857 [00:04<00:03, 1480.53 examples/s]
113
+ Tokenizing train dataset: 64%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 8839/13857 [00:04<00:03, 1493.90 examples/s]
114
+ Tokenizing train dataset: 65%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 8997/13857 [00:05<00:03, 1514.36 examples/s]
115
+ Tokenizing train dataset: 66%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 9159/13857 [00:05<00:03, 1352.37 examples/s]
116
+ Tokenizing train dataset: 67%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 9315/13857 [00:05<00:03, 1403.67 examples/s]
117
+ Tokenizing train dataset: 69%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 9531/13857 [00:05<00:03, 1412.98 examples/s]
118
+ Tokenizing train dataset: 70%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 9689/13857 [00:05<00:02, 1452.32 examples/s]
119
+ Tokenizing train dataset: 71%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 9842/13857 [00:05<00:02, 1470.22 examples/s]
120
+ Tokenizing train dataset: 72%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 10000/13857 [00:05<00:03, 1238.11 examples/s]
121
+ Tokenizing train dataset: 73%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 10156/13857 [00:05<00:02, 1313.97 examples/s]
122
+ Tokenizing train dataset: 74%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 10308/13857 [00:06<00:02, 1362.84 examples/s]
123
+ Tokenizing train dataset: 75%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 10462/13857 [00:06<00:02, 1407.76 examples/s]
124
+ Tokenizing train dataset: 77%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 10615/13857 [00:06<00:02, 1438.19 examples/s]
125
+ Tokenizing train dataset: 78%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 10772/13857 [00:06<00:02, 1470.99 examples/s]
126
+ Tokenizing train dataset: 79%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 10925/13857 [00:06<00:01, 1483.63 examples/s]
127
+ Tokenizing train dataset: 80%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 11076/13857 [00:06<00:02, 1320.95 examples/s]
128
+ Tokenizing train dataset: 81%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 11247/13857 [00:06<00:01, 1422.45 examples/s]
129
+ Tokenizing train dataset: 82%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 11405/13857 [00:06<00:01, 1462.65 examples/s]
130
+ Tokenizing train dataset: 83%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 11562/13857 [00:06<00:01, 1490.55 examples/s]
131
+ Tokenizing train dataset: 85%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 11788/13857 [00:07<00:01, 1492.53 examples/s]
132
+ Tokenizing train dataset: 86%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 11944/13857 [00:07<00:01, 1508.49 examples/s]
133
+ Tokenizing train dataset: 88%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 12170/13857 [00:07<00:01, 1386.13 examples/s]
134
+ Tokenizing train dataset: 89%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 12320/13857 [00:07<00:01, 1412.79 examples/s]
135
+ Tokenizing train dataset: 90%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 12473/13857 [00:07<00:00, 1438.11 examples/s]
136
+ Tokenizing train dataset: 91%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 12631/13857 [00:07<00:00, 1473.12 examples/s]
137
+ Tokenizing train dataset: 92%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 12781/13857 [00:07<00:00, 1477.85 examples/s]
138
+ Tokenizing train dataset: 94%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 13000/13857 [00:07<00:00, 1325.28 examples/s]
139
+ Tokenizing train dataset: 95%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 13154/13857 [00:08<00:00, 1374.38 examples/s]
140
+ Tokenizing train dataset: 96%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ| 13313/13857 [00:08<00:00, 1426.68 examples/s]
141
+ Tokenizing train dataset: 97%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹| 13466/13857 [00:08<00:00, 1448.56 examples/s]
142
+ Tokenizing train dataset: 98%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š| 13625/13857 [00:08<00:00, 1483.41 examples/s]
143
+ Tokenizing train dataset: 99%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰| 13778/13857 [00:08<00:00, 1494.49 examples/s]
144
+ Tokenizing train dataset: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 13857/13857 [00:08<00:00, 1626.11 examples/s]
145
+
146
+ Truncating train dataset: 0%| | 0/13857 [00:00<?, ? examples/s]
147
+ Truncating train dataset: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 13857/13857 [00:00<00:00, 342437.05 examples/s]
148
+
149
+ Adding EOS to eval dataset: 0%| | 0/416 [00:00<?, ? examples/s]
150
+ Adding EOS to eval dataset: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 416/416 [00:00<00:00, 38467.98 examples/s]
151
+
152
+ Tokenizing eval dataset: 0%| | 0/416 [00:00<?, ? examples/s]
153
+ Tokenizing eval dataset: 43%|β–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 177/416 [00:00<00:00, 1753.62 examples/s]
154
+ Tokenizing eval dataset: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 416/416 [00:00<00:00, 1568.02 examples/s]
155
+ Tokenizing eval dataset: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 416/416 [00:00<00:00, 1580.56 examples/s]
156
+
157
+ Truncating eval dataset: 0%| | 0/416 [00:00<?, ? examples/s]
158
+ Truncating eval dataset: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 416/416 [00:00<00:00, 217777.14 examples/s]
159
+ Starting training...
160
+ The tokenizer has new PAD/BOS/EOS tokens that differ from the model config and generation config. The model config and generation config were aligned accordingly, being updated with the tokenizer's values. Updated tokens: {'bos_token_id': None, 'pad_token_id': 151643}.
161
+ [2026-01-12 22:36:44] WARNING accelerator.py:2164: Gradient accumulation steps mismatch: GradientAccumulationPlugin has 1, DeepSpeed config has 4. Using DeepSpeed's value.
162
+
163
+ 0%| | 0/10 [00:00<?, ?it/s]
164
+ 10%|β–ˆ | 1/10 [00:01<00:15, 1.67s/it]
165
+ 20%|β–ˆβ–ˆ | 2/10 [00:02<00:10, 1.34s/it]
166
+ 30%|β–ˆβ–ˆβ–ˆ | 3/10 [00:03<00:08, 1.24s/it]
167
+ 40%|β–ˆβ–ˆβ–ˆβ–ˆ | 4/10 [00:05<00:07, 1.19s/it]
168
+ 50%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 5/10 [00:06<00:05, 1.16s/it]
169
+ 60%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 6/10 [00:07<00:04, 1.14s/it]
170
+ 70%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 7/10 [00:08<00:03, 1.12s/it]
171
+ 80%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 8/10 [00:09<00:02, 1.11s/it]
172
+ 90%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 9/10 [00:10<00:01, 1.10s/it]
173
+ 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 10/10 [00:11<00:00, 1.10s/it]
174
+
175
+ {'loss': 2.0744, 'grad_norm': 0.12263150345158981, 'learning_rate': 4.000000000000001e-06, 'entropy': 0.9474609375, 'num_tokens': 21152.0, 'mean_token_accuracy': 0.6660121768712998, 'epoch': 0.01}
176
+
177
+ 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 10/10 [00:11<00:00, 1.10s/it]
178
+
179
+ 0%| | 0/208 [00:00<?, ?it/s]
180
+
181
+ 1%|▏ | 3/208 [00:00<00:09, 22.78it/s]
182
+
183
+ 3%|β–Ž | 6/208 [00:00<00:11, 17.53it/s]
184
+
185
+ 4%|▍ | 8/208 [00:00<00:12, 16.51it/s]
186
+
187
+ 5%|▍ | 10/208 [00:00<00:12, 15.75it/s]
188
+
189
+ 6%|β–Œ | 12/208 [00:00<00:12, 15.41it/s]
190
+
191
+ 7%|β–‹ | 14/208 [00:00<00:12, 15.61it/s]
192
+
193
+ 8%|β–Š | 16/208 [00:00<00:12, 15.55it/s]
194
+
195
+ 9%|β–Š | 18/208 [00:01<00:12, 15.62it/s]
196
+
197
+ 10%|β–‰ | 20/208 [00:01<00:12, 15.58it/s]
198
+
199
+ 11%|β–ˆ | 22/208 [00:01<00:11, 15.69it/s]
200
+
201
+ 12%|β–ˆβ– | 24/208 [00:01<00:11, 15.95it/s]
202
+
203
+ 12%|β–ˆβ–Ž | 26/208 [00:01<00:11, 16.03it/s]
204
+
205
+ 13%|β–ˆβ–Ž | 28/208 [00:01<00:11, 15.68it/s]
206
+
207
+ 14%|β–ˆβ– | 30/208 [00:01<00:11, 15.51it/s]
208
+
209
+ 15%|β–ˆβ–Œ | 32/208 [00:02<00:11, 15.46it/s]
210
+
211
+ 16%|β–ˆβ–‹ | 34/208 [00:02<00:11, 15.43it/s]
212
+
213
+ 17%|β–ˆβ–‹ | 36/208 [00:02<00:11, 15.41it/s]
214
+
215
+ 18%|β–ˆβ–Š | 38/208 [00:02<00:11, 15.42it/s]
216
+
217
+ 19%|β–ˆβ–‰ | 40/208 [00:02<00:10, 15.41it/s]
218
+
219
+ 20%|β–ˆβ–ˆ | 42/208 [00:02<00:10, 15.25it/s]
220
+
221
+ 21%|β–ˆβ–ˆ | 44/208 [00:02<00:10, 15.26it/s]
222
+
223
+ 22%|β–ˆβ–ˆβ– | 46/208 [00:02<00:10, 15.33it/s]
224
+
225
+ 23%|β–ˆβ–ˆβ–Ž | 48/208 [00:03<00:10, 15.15it/s]
226
+
227
+ 24%|β–ˆβ–ˆβ– | 50/208 [00:03<00:10, 15.32it/s]
228
+
229
+ 25%|β–ˆβ–ˆβ–Œ | 52/208 [00:03<00:10, 15.22it/s]
230
+
231
+ 26%|β–ˆβ–ˆβ–Œ | 54/208 [00:03<00:10, 15.31it/s]
232
+
233
+ 27%|β–ˆβ–ˆβ–‹ | 56/208 [00:03<00:09, 15.27it/s]
234
+
235
+ 28%|β–ˆβ–ˆβ–Š | 58/208 [00:03<00:09, 15.30it/s]
236
+
237
+ 29%|β–ˆβ–ˆβ–‰ | 60/208 [00:03<00:09, 15.28it/s]
238
+
239
+ 30%|β–ˆβ–ˆβ–‰ | 62/208 [00:03<00:09, 15.53it/s]
240
+
241
+ 31%|β–ˆβ–ˆβ–ˆ | 64/208 [00:04<00:09, 15.59it/s]
242
+
243
+ 32%|β–ˆβ–ˆβ–ˆβ– | 66/208 [00:04<00:09, 15.02it/s]
244
+
245
+ 33%|β–ˆβ–ˆβ–ˆβ–Ž | 68/208 [00:04<00:09, 14.82it/s]
246
+
247
+ 34%|β–ˆβ–ˆβ–ˆβ–Ž | 70/208 [00:04<00:09, 14.82it/s]
248
+
249
+ 35%|β–ˆβ–ˆβ–ˆβ– | 72/208 [00:04<00:09, 14.82it/s]
250
+
251
+ 36%|β–ˆβ–ˆβ–ˆβ–Œ | 74/208 [00:04<00:09, 14.87it/s]
252
+
253
+ 37%|β–ˆβ–ˆβ–ˆβ–‹ | 76/208 [00:04<00:08, 14.95it/s]
254
+
255
+ 38%|β–ˆβ–ˆβ–ˆβ–Š | 78/208 [00:05<00:08, 14.97it/s]
256
+
257
+ 38%|β–ˆβ–ˆβ–ˆβ–Š | 80/208 [00:05<00:08, 15.02it/s]
258
+
259
+ 39%|β–ˆβ–ˆβ–ˆβ–‰ | 82/208 [00:05<00:08, 15.07it/s]
260
+
261
+ 40%|β–ˆβ–ˆβ–ˆβ–ˆ | 84/208 [00:05<00:08, 15.13it/s]
262
+
263
+ 41%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 86/208 [00:05<00:07, 15.28it/s]
264
+
265
+ 42%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 88/208 [00:05<00:07, 15.36it/s]
266
+
267
+ 43%|β–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 90/208 [00:05<00:07, 15.22it/s]
268
+
269
+ 44%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 92/208 [00:05<00:07, 15.30it/s]
270
+
271
+ 45%|β–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 94/208 [00:06<00:07, 15.19it/s]
272
+
273
+ 46%|β–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 96/208 [00:06<00:07, 15.19it/s]
274
+
275
+ 47%|β–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 98/208 [00:06<00:07, 15.42it/s]
276
+
277
+ 48%|β–ˆβ–ˆβ–ˆβ–ˆβ–Š | 100/208 [00:06<00:07, 15.43it/s]
278
+
279
+ 49%|β–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 102/208 [00:06<00:06, 15.51it/s]
280
+
281
+ 50%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 104/208 [00:06<00:06, 15.57it/s]
282
+
283
+ 51%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 106/208 [00:06<00:06, 15.32it/s]
284
+
285
+ 52%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 108/208 [00:07<00:06, 15.22it/s]
286
+
287
+ 53%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 110/208 [00:07<00:06, 15.25it/s]
288
+
289
+ 54%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 112/208 [00:07<00:06, 15.31it/s]
290
+
291
+ 55%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 114/208 [00:07<00:06, 15.18it/s]
292
+
293
+ 56%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 116/208 [00:07<00:06, 15.14it/s]
294
+
295
+ 57%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 118/208 [00:07<00:05, 15.15it/s]
296
+
297
+ 58%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 120/208 [00:07<00:05, 15.26it/s]
298
+
299
+ 59%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 122/208 [00:07<00:05, 15.42it/s]
300
+
301
+ 60%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 124/208 [00:08<00:05, 15.58it/s]
302
+
303
+ 61%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 126/208 [00:08<00:05, 15.48it/s]
304
+
305
+ 62%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 128/208 [00:08<00:05, 15.67it/s]
306
+
307
+ 62%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 130/208 [00:08<00:04, 15.61it/s]
308
+
309
+ 63%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 132/208 [00:08<00:04, 15.48it/s]
310
+
311
+ 64%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 134/208 [00:08<00:04, 15.52it/s]
312
+
313
+ 65%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 136/208 [00:08<00:04, 15.40it/s]
314
+
315
+ 66%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 138/208 [00:08<00:04, 15.47it/s]
316
+
317
+ 67%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 140/208 [00:09<00:04, 15.65it/s]
318
+
319
+ 68%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 142/208 [00:09<00:04, 15.62it/s]
320
+
321
+ 69%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 144/208 [00:09<00:04, 15.55it/s]
322
+
323
+ 70%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 146/208 [00:09<00:03, 15.71it/s]
324
+
325
+ 71%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 148/208 [00:09<00:03, 15.65it/s]
326
+
327
+ 72%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 150/208 [00:09<00:03, 15.64it/s]
328
+
329
+ 73%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 152/208 [00:09<00:03, 15.66it/s]
330
+
331
+ 74%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 154/208 [00:09<00:03, 15.69it/s]
332
+
333
+ 75%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 156/208 [00:10<00:03, 15.53it/s]
334
+
335
+ 76%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 158/208 [00:10<00:03, 15.50it/s]
336
+
337
+ 77%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 160/208 [00:10<00:03, 15.50it/s]
338
+
339
+ 78%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 162/208 [00:10<00:02, 15.52it/s]
340
+
341
+ 79%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 164/208 [00:10<00:02, 15.53it/s]
342
+
343
+ 80%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 166/208 [00:10<00:02, 15.57it/s]
344
+
345
+ 81%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 168/208 [00:10<00:02, 15.74it/s]
346
+
347
+ 82%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 170/208 [00:11<00:02, 15.59it/s]
348
+
349
+ 83%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 172/208 [00:11<00:02, 15.50it/s]
350
+
351
+ 84%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 174/208 [00:11<00:02, 15.56it/s]
352
+
353
+ 85%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 176/208 [00:11<00:02, 15.62it/s]
354
+
355
+ 86%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 178/208 [00:11<00:01, 15.40it/s]
356
+
357
+ 87%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 180/208 [00:11<00:01, 15.37it/s]
358
+
359
+ 88%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 182/208 [00:11<00:01, 15.45it/s]
360
+
361
+ 88%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 184/208 [00:11<00:01, 15.39it/s]
362
+
363
+ 89%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 186/208 [00:12<00:01, 15.26it/s]
364
+
365
+ 90%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 188/208 [00:12<00:01, 15.30it/s]
366
+
367
+ 91%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 190/208 [00:12<00:01, 15.37it/s]
368
+
369
+ 92%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 192/208 [00:12<00:01, 15.34it/s]
370
+
371
+ 93%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž| 194/208 [00:12<00:00, 15.58it/s]
372
+
373
+ 94%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 196/208 [00:12<00:00, 15.48it/s]
374
+
375
+ 95%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ| 198/208 [00:12<00:00, 15.41it/s]
376
+
377
+ 96%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ| 200/208 [00:12<00:00, 15.51it/s]
378
+
379
+ 97%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹| 202/208 [00:13<00:00, 15.12it/s]
380
+
381
+ 98%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š| 204/208 [00:13<00:00, 14.83it/s]
382
+
383
+ 99%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰| 206/208 [00:13<00:00, 14.90it/s]
384
+
385
+ 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 208/208 [00:13<00:00, 14.85it/s]
386
+
387
+
388
+
389
+ {'eval_loss': 2.0531225204467773, 'eval_runtime': 13.5735, 'eval_samples_per_second': 30.648, 'eval_steps_per_second': 15.324, 'eval_entropy': 0.9273212139423077, 'eval_num_tokens': 21152.0, 'eval_mean_token_accuracy': 0.6695072605059698, 'epoch': 0.01}
390
+
391
+ 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 10/10 [00:25<00:00, 1.10s/it]
392
+
393
+ 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 208/208 [00:13<00:00, 14.85it/s]
394
+
395
+ 
396
+
397
+ {'train_runtime': 27.5135, 'train_samples_per_second': 2.908, 'train_steps_per_second': 0.363, 'train_loss': 2.074407958984375, 'epoch': 0.01}
398
+
399
+ 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 10/10 [00:27<00:00, 1.10s/it]
400
+ 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 10/10 [00:27<00:00, 2.75s/it]
401
+ Saving final model to: ./checkpoints/final_model
402
+ Training metrics: {'val_loss': 2.0531225204467773, 'train_loss': 2.0744}
403
+ Number of training samples: 13857
404
+ Saved metrics.json to checkpoints/final_model/metrics.json
405
+ Uploading to vinoku89/aimo3-exp-1 (main branch)...
406
+
407
+ Processing Files (0 / 0) : | | 0.00B / 0.00B
408
+
409
+ New Data Upload : | | 0.00B / 0.00B 
410
+
411
+
412
+ ...adapter_model.safetensors: 2%|▏ | 343kB / 20.2MB 
413
+
414
+
415
+
416
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
417
+
418
+
419
+ ...adapter_model.safetensors: 2%|▏ | 343kB / 20.2MB 
420
+
421
+
422
+
423
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
424
+ Processing Files (1 / 2) : 37%|β–ˆβ–ˆβ–ˆβ–‹ | 11.8MB / 31.7MB, ???B/s
425
+
426
+
427
+ ...adapter_model.safetensors: 2%|▏ | 343kB / 20.2MB 
428
+
429
+
430
+
431
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
432
+
433
+
434
+ ...adapter_model.safetensors: 2%|▏ | 343kB / 20.2MB 
435
+
436
+
437
+
438
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
439
+
440
+
441
+ ...adapter_model.safetensors: 7%|β–‹ | 1.45MB / 20.2MB 
442
+
443
+
444
+
445
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
446
+ Processing Files (1 / 2) : 41%|β–ˆβ–ˆβ–ˆβ–ˆ | 12.9MB / 31.7MB, 1.84MB/s
447
+
448
+ New Data Upload : 3%|β–Ž | 608kB / 19.4MB, 1.01MB/s 
449
+
450
+
451
+ ...adapter_model.safetensors: 7%|β–‹ | 1.45MB / 20.2MB 
452
+
453
+
454
+
455
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
456
+
457
+
458
+ ...adapter_model.safetensors: 7%|β–‹ | 1.45MB / 20.2MB 
459
+
460
+
461
+
462
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
463
+
464
+
465
+ ...adapter_model.safetensors: 7%|β–‹ | 1.45MB / 20.2MB 
466
+
467
+
468
+
469
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
470
+
471
+
472
+ ...adapter_model.safetensors: 16%|β–ˆβ–Œ | 3.27MB / 20.2MB 
473
+
474
+
475
+
476
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
477
+ Processing Files (1 / 2) : 46%|β–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 14.7MB / 31.7MB, 2.09MB/s
478
+
479
+ New Data Upload : 13%|β–ˆβ–Ž | 2.43MB / 19.4MB, 1.74MB/s 
480
+
481
+
482
+ ...adapter_model.safetensors: 28%|β–ˆβ–ˆβ–Š | 5.71MB / 20.2MB 
483
+
484
+
485
+
486
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
487
+ Processing Files (1 / 2) : 54%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 17.1MB / 31.7MB, 3.35MB/s
488
+
489
+ New Data Upload : 25%|β–ˆβ–ˆβ–Œ | 4.87MB / 19.4MB, 3.04MB/s 
490
+
491
+
492
+ ...adapter_model.safetensors: 61%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 12.4MB / 20.2MB 
493
+
494
+
495
+
496
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
497
+ Processing Files (1 / 2) : 75%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 23.8MB / 31.7MB, 6.70MB/s
498
+
499
+ New Data Upload : 60%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 11.6MB / 19.4MB, 6.42MB/s 
500
+
501
+
502
+ ...adapter_model.safetensors: 97%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹| 19.7MB / 20.2MB 
503
+
504
+
505
+
506
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
507
+ Processing Files (1 / 2) : 98%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š| 31.1MB / 31.7MB, 9.68MB/s
508
+
509
+ New Data Upload : 97%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹| 18.9MB / 19.4MB, 9.43MB/s 
510
+
511
+
512
+ ...adapter_model.safetensors: 97%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹| 19.7MB / 20.2MB 
513
+
514
+
515
+
516
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
517
+
518
+
519
+ ...adapter_model.safetensors: 97%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹| 19.7MB / 20.2MB 
520
+
521
+
522
+
523
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
524
+
525
+
526
+ ...adapter_model.safetensors: 97%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹| 19.7MB / 20.2MB 
527
+
528
+
529
+
530
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
531
+
532
+
533
+ ...adapter_model.safetensors: 97%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹| 19.7MB / 20.2MB 
534
+
535
+
536
+
537
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
538
+
539
+
540
+ ...adapter_model.safetensors: 97%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹| 19.7MB / 20.2MB 
541
+
542
+
543
+
544
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
545
+
546
+
547
+ ...adapter_model.safetensors: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 20.2MB / 20.2MB 
548
+
549
+
550
+
551
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
552
+ Processing Files (2 / 2) : 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 31.7MB / 31.7MB, 6.22MB/s
553
+
554
+ New Data Upload : 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 19.4MB / 19.4MB, 6.06MB/s 
555
+
556
+
557
+ ...adapter_model.safetensors: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 20.2MB / 20.2MB 
558
+
559
+
560
+
561
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
562
+
563
+
564
+ ...adapter_model.safetensors: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 20.2MB / 20.2MB 
565
+
566
+
567
+
568
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
569
+
570
+
571
+ ...adapter_model.safetensors: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 20.2MB / 20.2MB 
572
+
573
+
574
+
575
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
576
+ Processing Files (2 / 2) : 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 31.7MB / 31.7MB, 5.53MB/s
577
+
578
+ New Data Upload : 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 19.4MB / 19.4MB, 5.39MB/s
579
+
580
+ ...adapter_model.safetensors: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 20.2MB / 20.2MB
581
+
582
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB
583
+ Created tag: qwen0.6b-sft-e1-13.9k-loss2.05-20260112-003
584
+ Updated 'latest' tag
585
+ Kept existing 'best' tag (current: 2.0531 >= best: 2.0518)
586
+ Upload complete: https://huggingface.co/vinoku89/aimo3-exp-1
587
+ Uploaded logs/runtime_config_20260113_063547.yaml to vinoku89/aimo3-exp-1 (main branch)
588
+
589
+ ============================================================
590
+ Model pushed successfully!
591
+ ============================================================
592
+ URL: https://huggingface.co/vinoku89/aimo3-exp-1
593
+ Run Tag: qwen0.6b-sft-e1-13.9k-loss2.05-20260112-003
594
+ Tags: qwen0.6b-sft-e1-13.9k-loss2.05-20260112-003, latest, best (if lowest loss)
595
+
596
+ To load this specific run:
597
+ from peft import PeftModel
598
+ model = PeftModel.from_pretrained('base_model', 'vinoku89/aimo3-exp-1', revision='qwen0.6b-sft-e1-13.9k-loss2.05-20260112-003')
599
+
600
+ To load the best run:
601
+ model = PeftModel.from_pretrained('base_model', 'vinoku89/aimo3-exp-1', revision='best')
602
+
603
+ To load the latest run:
604
+ model = PeftModel.from_pretrained('base_model', 'vinoku89/aimo3-exp-1', revision='latest')
605
+ ============================================================
606
+
607
+ wandb: updating run metadata
608
+ wandb: uploading output.log; uploading wandb-summary.json
609
+ wandb: uploading output.log
610
+ wandb: uploading config.yaml
611
+ wandb: uploading summary, console lines 54-87
612
+ wandb:
613
+ wandb: Run history:
614
+ wandb: eval/entropy ▁
615
+ wandb: eval/loss ▁
616
+ wandb: eval/mean_token_accuracy ▁
617
+ wandb: eval/num_tokens ▁
618
+ wandb: eval/runtime ▁
619
+ wandb: eval/samples_per_second ▁
620
+ wandb: eval/steps_per_second ▁
621
+ wandb: train/entropy ▁
622
+ wandb: train/epoch ▁▁▁
623
+ wandb: train/global_step ▁▁▁
624
+ wandb: +5 ...
625
+ wandb:
626
+ wandb: Run summary:
627
+ wandb: eval/entropy 0.92732
628
+ wandb: eval/loss 2.05312
629
+ wandb: eval/mean_token_accuracy 0.66951
630
+ wandb: eval/num_tokens 21152
631
+ wandb: eval/runtime 13.5735
632
+ wandb: eval/samples_per_second 30.648
633
+ wandb: eval/steps_per_second 15.324
634
+ wandb: total_flos 67838115053568.0
635
+ wandb: train/entropy 0.94746
636
+ wandb: train/epoch 0.00577
637
+ wandb: +10 ...
638
+ wandb:
639
+ wandb: πŸš€ View run qwen3-0.6b-sft-lora-20260113_063547-003 at: https://wandb.ai/vinokuteam/aimo3-exp-1-train/runs/0pkyx3cq
640
+ wandb: ⭐️ View project at: https://wandb.ai/vinokuteam/aimo3-exp-1-train
641
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
642
+ wandb: Find logs at: ./wandb/run-20260112_223606-0pkyx3cq/logs
643
+ Training completed successfully!
644
+ [W112 22:37:40.785124394 AllocatorConfig.cpp:28] Warning: PYTORCH_CUDA_ALLOC_CONF is deprecated, use PYTORCH_ALLOC_CONF instead (function operator())
645
+ [W112 22:37:42.435659668 AllocatorConfig.cpp:28] Warning: PYTORCH_CUDA_ALLOC_CONF is deprecated, use PYTORCH_ALLOC_CONF instead (function operator())