vinoku89 commited on
Commit
13745d4
Β·
verified Β·
1 Parent(s): 4373a6d

Training log (success)

Browse files
Files changed (1) hide show
  1. logs/training_20260113_061956.log +624 -0
logs/training_20260113_061956.log ADDED
@@ -0,0 +1,624 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /venv/main/lib/python3.12/site-packages/trl/__init__.py:203: UserWarning: TRL currently supports vLLM versions: 0.10.2, 0.11.0, 0.11.1, 0.11.2. You have version 0.13.0 installed. We recommend installing a supported version to avoid compatibility issues.
2
+ if is_vllm_available():
3
+ Loading config from: configs/runtime_config.yaml
4
+ Random seed set to: 42
5
+ ============================================================
6
+ Training Configuration:
7
+ Framework: accelerate
8
+ Method: sft
9
+ ============================================================
10
+ W&B Project: aimo3-exp-1-train
11
+ W&B Run: qwen3-0.6b-sft-lora-20260113_061956-001
12
+ wandb: Currently logged in as: vinoku (vinokuteam) to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
13
+ wandb: WARNING Using a boolean value for 'reinit' is deprecated. Use 'return_previous' or 'finish_previous' instead.
14
+ wandb: setting up run 3fkbe45r
15
+ wandb: Tracking run with wandb version 0.23.1
16
+ wandb: Run data is saved locally in /workspace/distributed-sft-rl-inference-pipeline/wandb/run-20260112_222013-3fkbe45r
17
+ wandb: Run `wandb offline` to turn off syncing.
18
+ wandb: Syncing run qwen3-0.6b-sft-lora-20260113_061956-001
19
+ wandb: ⭐️ View project at https://wandb.ai/vinokuteam/aimo3-exp-1-train
20
+ wandb: πŸš€ View run at https://wandb.ai/vinokuteam/aimo3-exp-1-train/runs/3fkbe45r
21
+ wandb: Detected [openai] in use.
22
+ wandb: Use W&B Weave for improved LLM call tracing. Install Weave with `pip install weave` then add `import weave` to the top of your script.
23
+ wandb: For more information, check out the docs at: https://weave-docs.wandb.ai/
24
+ W&B Run: qwen3-0.6b-sft-lora-20260113_061956-001
25
+ W&B URL: https://wandb.ai/vinokuteam/aimo3-exp-1-train/runs/3fkbe45r
26
+ W&B logging enabled (ID: 3fkbe45r)
27
+ Loading model: Qwen/Qwen3-0.6B
28
+ ZeRO-0 mode (no HfDeepSpeedConfig needed)
29
+ `torch_dtype` is deprecated! Use `dtype` instead!
30
+ Building datasets...
31
+ Loading dataset from HuggingFace: HAD653/GSM8K-OpenMath-MathReason-13k
32
+ Train size: 13857, Test size: 416
33
+ Dataset size after dropping NaN: 13857
34
+ Dataset size after dropping NaN: 416
35
+ Final train size: 13857, test size: 416
36
+
37
+ ============================================================
38
+ SAMPLE TRAINING DATA (first example):
39
+ ============================================================
40
+ <|im_start|>system
41
+ You are a helpful and reflective maths assistant. Please reason step by step to put the answer in \boxed{}.<|im_end|>
42
+ <|im_start|>user
43
+ Albert is wondering how much pizza he can eat in one day. He buys 2 large pizzas and 2 small pizzas. A large pizza has 16 slices and a small pizza has 8 slices. If he eats it all, how many pieces does he eat that day?<|im_end|>
44
+ <|im_start|>assistant
45
+ <think>
46
+ Problem:
47
+ Albert buys 2 large pizzas (16 slices each) and 2 small pizzas (8 slices each). Find total slices eaten.
48
+
49
+ Reasoning:
50
+ 1. Large pizza slices = 2*16 = 32.
51
+ 2. Small pizza slices = 2*8 = 16.
52
+ 3. Total slices = 32+16 = 48.
53
+
54
+ Answer:
55
+ 48
56
+ </think>
57
+
58
+ \boxed{48}<|im_end|>
59
+ ============================================================
60
+
61
+ Creating LoRA configuration...
62
+ Using Accelerate + SFT training pipeline
63
+ Initializing SFTTrainer...
64
+
65
+ Adding EOS to train dataset: 0%| | 0/13857 [00:00<?, ? examples/s]
66
+ Adding EOS to train dataset: 30%|β–ˆβ–ˆβ–‰ | 4112/13857 [00:00<00:00, 39716.06 examples/s]
67
+ Adding EOS to train dataset: 60%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 8353/13857 [00:00<00:00, 41271.86 examples/s]
68
+ Adding EOS to train dataset: 90%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 12523/13857 [00:00<00:00, 41465.24 examples/s]
69
+ Adding EOS to train dataset: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 13857/13857 [00:00<00:00, 41056.84 examples/s]
70
+
71
+ Tokenizing train dataset: 0%| | 0/13857 [00:00<?, ? examples/s]
72
+ Tokenizing train dataset: 1%|▏ | 187/13857 [00:00<00:07, 1852.55 examples/s]
73
+ Tokenizing train dataset: 3%|β–Ž | 378/13857 [00:00<00:07, 1877.99 examples/s]
74
+ Tokenizing train dataset: 4%|▍ | 573/13857 [00:00<00:06, 1902.48 examples/s]
75
+ Tokenizing train dataset: 6%|β–Œ | 772/13857 [00:00<00:06, 1933.09 examples/s]
76
+ Tokenizing train dataset: 7%|β–‹ | 977/13857 [00:00<00:06, 1971.70 examples/s]
77
+ Tokenizing train dataset: 9%|β–Š | 1208/13857 [00:00<00:07, 1780.65 examples/s]
78
+ Tokenizing train dataset: 10%|β–ˆ | 1402/13857 [00:00<00:06, 1822.62 examples/s]
79
+ Tokenizing train dataset: 12%|β–ˆβ– | 1598/13857 [00:00<00:06, 1859.51 examples/s]
80
+ Tokenizing train dataset: 13%|β–ˆβ–Ž | 1801/13857 [00:00<00:06, 1905.53 examples/s]
81
+ Tokenizing train dataset: 14%|β–ˆβ– | 1999/13857 [00:01<00:06, 1925.89 examples/s]
82
+ Tokenizing train dataset: 16%|β–ˆβ–Œ | 2232/13857 [00:01<00:06, 1779.53 examples/s]
83
+ Tokenizing train dataset: 18%|β–ˆβ–Š | 2439/13857 [00:01<00:06, 1854.49 examples/s]
84
+ Tokenizing train dataset: 19%|β–ˆβ–‰ | 2643/13857 [00:01<00:05, 1902.63 examples/s]
85
+ Tokenizing train dataset: 21%|β–ˆβ–ˆ | 2850/13857 [00:01<00:05, 1946.52 examples/s]
86
+ Tokenizing train dataset: 22%|β–ˆβ–ˆβ– | 3093/13857 [00:01<00:06, 1793.63 examples/s]
87
+ Tokenizing train dataset: 24%|β–ˆβ–ˆβ–Ž | 3279/13857 [00:01<00:05, 1809.71 examples/s]
88
+ Tokenizing train dataset: 25%|β–ˆβ–ˆβ–Œ | 3471/13857 [00:01<00:05, 1837.39 examples/s]
89
+ Tokenizing train dataset: 26%|β–ˆβ–ˆβ–‹ | 3663/13857 [00:01<00:05, 1856.62 examples/s]
90
+ Tokenizing train dataset: 28%|β–ˆβ–ˆβ–Š | 3932/13857 [00:02<00:05, 1830.47 examples/s]
91
+ Tokenizing train dataset: 30%|β–ˆβ–ˆβ–ˆ | 4196/13857 [00:02<00:05, 1729.06 examples/s]
92
+ Tokenizing train dataset: 32%|β–ˆβ–ˆβ–ˆβ– | 4392/13857 [00:02<00:05, 1781.85 examples/s]
93
+ Tokenizing train dataset: 33%|β–ˆβ–ˆβ–ˆβ–Ž | 4595/13857 [00:02<00:05, 1842.05 examples/s]
94
+ Tokenizing train dataset: 35%|β–ˆβ–ˆβ–ˆβ– | 4798/13857 [00:02<00:04, 1888.49 examples/s]
95
+ Tokenizing train dataset: 36%|β–ˆβ–ˆβ–ˆβ–Œ | 5000/13857 [00:02<00:05, 1750.89 examples/s]
96
+ Tokenizing train dataset: 38%|β–ˆβ–ˆβ–ˆβ–Š | 5208/13857 [00:02<00:04, 1835.53 examples/s]
97
+ Tokenizing train dataset: 39%|β–ˆβ–ˆβ–ˆβ–‰ | 5415/13857 [00:02<00:04, 1896.83 examples/s]
98
+ Tokenizing train dataset: 41%|β–ˆβ–ˆβ–ˆβ–ˆ | 5625/13857 [00:03<00:04, 1951.48 examples/s]
99
+ Tokenizing train dataset: 42%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 5830/13857 [00:03<00:04, 1977.78 examples/s]
100
+ Tokenizing train dataset: 44%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 6102/13857 [00:03<00:04, 1852.31 examples/s]
101
+ Tokenizing train dataset: 46%|β–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 6307/13857 [00:03<00:03, 1901.90 examples/s]
102
+ Tokenizing train dataset: 48%|β–ˆβ–ˆβ–ˆβ–ˆβ–Š | 6601/13857 [00:03<00:03, 1919.99 examples/s]
103
+ Tokenizing train dataset: 49%|β–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 6803/13857 [00:03<00:03, 1942.15 examples/s]
104
+ Tokenizing train dataset: 51%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 7000/13857 [00:03<00:03, 1805.41 examples/s]
105
+ Tokenizing train dataset: 52%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 7206/13857 [00:03<00:03, 1870.01 examples/s]
106
+ Tokenizing train dataset: 54%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 7451/13857 [00:04<00:03, 1783.37 examples/s]
107
+ Tokenizing train dataset: 55%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 7683/13857 [00:04<00:03, 1700.33 examples/s]
108
+ Tokenizing train dataset: 57%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 7926/13857 [00:04<00:03, 1668.62 examples/s]
109
+ Tokenizing train dataset: 59%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 8145/13857 [00:04<00:03, 1481.19 examples/s]
110
+ Tokenizing train dataset: 60%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 8359/13857 [00:04<00:03, 1457.07 examples/s]
111
+ Tokenizing train dataset: 61%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 8511/13857 [00:04<00:03, 1469.17 examples/s]
112
+ Tokenizing train dataset: 63%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 8666/13857 [00:04<00:03, 1486.34 examples/s]
113
+ Tokenizing train dataset: 64%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 8897/13857 [00:05<00:03, 1500.20 examples/s]
114
+ Tokenizing train dataset: 66%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 9080/13857 [00:05<00:03, 1382.65 examples/s]
115
+ Tokenizing train dataset: 67%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 9241/13857 [00:05<00:03, 1432.59 examples/s]
116
+ Tokenizing train dataset: 68%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 9404/13857 [00:05<00:03, 1478.86 examples/s]
117
+ Tokenizing train dataset: 69%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 9558/13857 [00:05<00:02, 1493.16 examples/s]
118
+ Tokenizing train dataset: 70%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 9721/13857 [00:05<00:02, 1527.97 examples/s]
119
+ Tokenizing train dataset: 71%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 9881/13857 [00:05<00:02, 1544.61 examples/s]
120
+ Tokenizing train dataset: 73%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 10079/13857 [00:05<00:02, 1331.48 examples/s]
121
+ Tokenizing train dataset: 74%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 10234/13857 [00:05<00:02, 1379.87 examples/s]
122
+ Tokenizing train dataset: 75%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 10401/13857 [00:06<00:02, 1453.78 examples/s]
123
+ Tokenizing train dataset: 76%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 10559/13857 [00:06<00:02, 1484.99 examples/s]
124
+ Tokenizing train dataset: 77%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 10719/13857 [00:06<00:02, 1515.15 examples/s]
125
+ Tokenizing train dataset: 79%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 10882/13857 [00:06<00:01, 1543.14 examples/s]
126
+ Tokenizing train dataset: 80%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 11074/13857 [00:06<00:02, 1366.29 examples/s]
127
+ Tokenizing train dataset: 81%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 11246/13857 [00:06<00:01, 1454.07 examples/s]
128
+ Tokenizing train dataset: 82%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 11402/13857 [00:06<00:01, 1480.89 examples/s]
129
+ Tokenizing train dataset: 84%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 11631/13857 [00:06<00:01, 1482.48 examples/s]
130
+ Tokenizing train dataset: 85%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 11793/13857 [00:07<00:01, 1512.29 examples/s]
131
+ Tokenizing train dataset: 86%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 11951/13857 [00:07<00:01, 1528.71 examples/s]
132
+ Tokenizing train dataset: 88%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 12164/13857 [00:07<00:01, 1403.81 examples/s]
133
+ Tokenizing train dataset: 89%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 12318/13857 [00:07<00:01, 1434.06 examples/s]
134
+ Tokenizing train dataset: 90%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 12470/13857 [00:07<00:00, 1453.17 examples/s]
135
+ Tokenizing train dataset: 91%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 12628/13857 [00:07<00:00, 1486.39 examples/s]
136
+ Tokenizing train dataset: 92%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 12783/13857 [00:07<00:00, 1500.55 examples/s]
137
+ Tokenizing train dataset: 94%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 13000/13857 [00:07<00:00, 1349.52 examples/s]
138
+ Tokenizing train dataset: 95%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 13162/13857 [00:07<00:00, 1413.09 examples/s]
139
+ Tokenizing train dataset: 96%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ| 13322/13857 [00:08<00:00, 1458.65 examples/s]
140
+ Tokenizing train dataset: 97%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹| 13479/13857 [00:08<00:00, 1488.47 examples/s]
141
+ Tokenizing train dataset: 98%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š| 13645/13857 [00:08<00:00, 1532.14 examples/s]
142
+ Tokenizing train dataset: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 13857/13857 [00:08<00:00, 1397.86 examples/s]
143
+ Tokenizing train dataset: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 13857/13857 [00:08<00:00, 1639.61 examples/s]
144
+
145
+ Truncating train dataset: 0%| | 0/13857 [00:00<?, ? examples/s]
146
+ Truncating train dataset: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 13857/13857 [00:00<00:00, 437489.43 examples/s]
147
+
148
+ Adding EOS to eval dataset: 0%| | 0/416 [00:00<?, ? examples/s]
149
+ Adding EOS to eval dataset: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 416/416 [00:00<00:00, 37833.22 examples/s]
150
+
151
+ Tokenizing eval dataset: 0%| | 0/416 [00:00<?, ? examples/s]
152
+ Tokenizing eval dataset: 44%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 184/416 [00:00<00:00, 1813.09 examples/s]
153
+ Tokenizing eval dataset: 89%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 371/416 [00:00<00:00, 1839.65 examples/s]
154
+ Tokenizing eval dataset: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 416/416 [00:00<00:00, 1703.92 examples/s]
155
+
156
+ Truncating eval dataset: 0%| | 0/416 [00:00<?, ? examples/s]
157
+ Truncating eval dataset: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 416/416 [00:00<00:00, 211034.16 examples/s]
158
+ Starting training...
159
+ The tokenizer has new PAD/BOS/EOS tokens that differ from the model config and generation config. The model config and generation config were aligned accordingly, being updated with the tokenizer's values. Updated tokens: {'bos_token_id': None, 'pad_token_id': 151643}.
160
+ [2026-01-12 22:20:47] WARNING accelerator.py:2164: Gradient accumulation steps mismatch: GradientAccumulationPlugin has 1, DeepSpeed config has 4. Using DeepSpeed's value.
161
+
162
+ 0%| | 0/10 [00:00<?, ?it/s]
163
+ 10%|β–ˆ | 1/10 [00:01<00:14, 1.65s/it]
164
+ 20%|β–ˆβ–ˆ | 2/10 [00:02<00:10, 1.31s/it]
165
+ 30%|β–ˆβ–ˆβ–ˆ | 3/10 [00:03<00:08, 1.21s/it]
166
+ 40%|β–ˆβ–ˆβ–ˆβ–ˆ | 4/10 [00:04<00:06, 1.17s/it]
167
+ 50%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 5/10 [00:06<00:05, 1.14s/it]
168
+ 60%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 6/10 [00:07<00:04, 1.12s/it]
169
+ 70%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 7/10 [00:08<00:03, 1.11s/it]
170
+ 80%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 8/10 [00:09<00:02, 1.10s/it]
171
+ 90%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 9/10 [00:10<00:01, 1.10s/it]
172
+ 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 10/10 [00:11<00:00, 1.09s/it]
173
+
174
+ {'loss': 2.0751, 'grad_norm': 0.1237564780666222, 'learning_rate': 4.000000000000001e-06, 'entropy': 0.94697265625, 'num_tokens': 21152.0, 'mean_token_accuracy': 0.66548752784729, 'epoch': 0.01}
175
+
176
+ 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 10/10 [00:11<00:00, 1.09s/it]
177
+
178
+ 0%| | 0/208 [00:00<?, ?it/s]
179
+
180
+ 1%|▏ | 3/208 [00:00<00:09, 22.64it/s]
181
+
182
+ 3%|β–Ž | 6/208 [00:00<00:11, 17.45it/s]
183
+
184
+ 4%|▍ | 8/208 [00:00<00:11, 16.70it/s]
185
+
186
+ 5%|▍ | 10/208 [00:00<00:12, 15.79it/s]
187
+
188
+ 6%|β–Œ | 12/208 [00:00<00:13, 15.02it/s]
189
+
190
+ 7%|β–‹ | 14/208 [00:00<00:13, 14.57it/s]
191
+
192
+ 8%|β–Š | 16/208 [00:01<00:13, 14.26it/s]
193
+
194
+ 9%|β–Š | 18/208 [00:01<00:13, 14.28it/s]
195
+
196
+ 10%|β–‰ | 20/208 [00:01<00:13, 14.30it/s]
197
+
198
+ 11%|β–ˆ | 22/208 [00:01<00:12, 14.31it/s]
199
+
200
+ 12%|β–ˆβ– | 24/208 [00:01<00:12, 14.32it/s]
201
+
202
+ 12%|β–ˆβ–Ž | 26/208 [00:01<00:12, 14.09it/s]
203
+
204
+ 13%|β–ˆβ–Ž | 28/208 [00:01<00:12, 14.11it/s]
205
+
206
+ 14%|β–ˆβ– | 30/208 [00:02<00:12, 13.94it/s]
207
+
208
+ 15%|β–ˆβ–Œ | 32/208 [00:02<00:12, 13.75it/s]
209
+
210
+ 16%|β–ˆβ–‹ | 34/208 [00:02<00:12, 13.85it/s]
211
+
212
+ 17%|β–ˆβ–‹ | 36/208 [00:02<00:12, 13.90it/s]
213
+
214
+ 18%|β–ˆβ–Š | 38/208 [00:02<00:12, 13.82it/s]
215
+
216
+ 19%|β–ˆβ–‰ | 40/208 [00:02<00:12, 13.94it/s]
217
+
218
+ 20%|β–ˆβ–ˆ | 42/208 [00:02<00:11, 13.94it/s]
219
+
220
+ 21%|β–ˆβ–ˆ | 44/208 [00:03<00:11, 13.95it/s]
221
+
222
+ 22%|β–ˆβ–ˆβ– | 46/208 [00:03<00:11, 14.14it/s]
223
+
224
+ 23%|β–ˆβ–ˆβ–Ž | 48/208 [00:03<00:11, 13.99it/s]
225
+
226
+ 24%|β–ˆβ–ˆβ– | 50/208 [00:03<00:11, 14.01it/s]
227
+
228
+ 25%|β–ˆβ–ˆβ–Œ | 52/208 [00:03<00:11, 13.84it/s]
229
+
230
+ 26%|β–ˆβ–ˆβ–Œ | 54/208 [00:03<00:11, 13.98it/s]
231
+
232
+ 27%|β–ˆβ–ˆβ–‹ | 56/208 [00:03<00:10, 13.95it/s]
233
+
234
+ 28%|β–ˆβ–ˆβ–Š | 58/208 [00:04<00:10, 14.36it/s]
235
+
236
+ 29%|β–ˆβ–ˆβ–‰ | 60/208 [00:04<00:10, 14.56it/s]
237
+
238
+ 30%|β–ˆβ–ˆβ–‰ | 62/208 [00:04<00:09, 15.04it/s]
239
+
240
+ 31%|β–ˆβ–ˆβ–ˆ | 64/208 [00:04<00:09, 15.22it/s]
241
+
242
+ 32%|β–ˆβ–ˆβ–ˆβ– | 66/208 [00:04<00:09, 15.40it/s]
243
+
244
+ 33%|β–ˆβ–ˆβ–ˆβ–Ž | 68/208 [00:04<00:09, 15.34it/s]
245
+
246
+ 34%|β–ˆβ–ˆβ–ˆβ–Ž | 70/208 [00:04<00:08, 15.40it/s]
247
+
248
+ 35%|β–ˆβ–ˆβ–ˆβ– | 72/208 [00:04<00:08, 15.34it/s]
249
+
250
+ 36%|β–ˆβ–ˆβ–ˆβ–Œ | 74/208 [00:05<00:08, 15.54it/s]
251
+
252
+ 37%|β–ˆβ–ˆβ–ˆβ–‹ | 76/208 [00:05<00:08, 15.59it/s]
253
+
254
+ 38%|β–ˆβ–ˆβ–ˆβ–Š | 78/208 [00:05<00:08, 15.54it/s]
255
+
256
+ 38%|β–ˆβ–ˆβ–ˆβ–Š | 80/208 [00:05<00:08, 15.50it/s]
257
+
258
+ 39%|β–ˆβ–ˆβ–ˆβ–‰ | 82/208 [00:05<00:08, 15.50it/s]
259
+
260
+ 40%|β–ˆβ–ˆβ–ˆβ–ˆ | 84/208 [00:05<00:07, 15.54it/s]
261
+
262
+ 41%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 86/208 [00:05<00:07, 15.72it/s]
263
+
264
+ 42%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 88/208 [00:05<00:07, 15.67it/s]
265
+
266
+ 43%|β–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 90/208 [00:06<00:07, 15.47it/s]
267
+
268
+ 44%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 92/208 [00:06<00:07, 15.43it/s]
269
+
270
+ 45%|β–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 94/208 [00:06<00:07, 15.54it/s]
271
+
272
+ 46%|β–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 96/208 [00:06<00:07, 15.28it/s]
273
+
274
+ 47%|β–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 98/208 [00:06<00:07, 15.26it/s]
275
+
276
+ 48%|β–ˆβ–ˆβ–ˆβ–ˆβ–Š | 100/208 [00:06<00:07, 15.30it/s]
277
+
278
+ 49%|β–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 102/208 [00:06<00:06, 15.40it/s]
279
+
280
+ 50%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 104/208 [00:06<00:06, 15.42it/s]
281
+
282
+ 51%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 106/208 [00:07<00:06, 15.34it/s]
283
+
284
+ 52%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 108/208 [00:07<00:06, 15.20it/s]
285
+
286
+ 53%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 110/208 [00:07<00:06, 15.37it/s]
287
+
288
+ 54%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 112/208 [00:07<00:06, 15.37it/s]
289
+
290
+ 55%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 114/208 [00:07<00:06, 15.26it/s]
291
+
292
+ 56%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 116/208 [00:07<00:06, 15.31it/s]
293
+
294
+ 57%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 118/208 [00:07<00:05, 15.36it/s]
295
+
296
+ 58%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 120/208 [00:08<00:05, 15.59it/s]
297
+
298
+ 59%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 122/208 [00:08<00:05, 15.74it/s]
299
+
300
+ 60%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 124/208 [00:08<00:05, 15.95it/s]
301
+
302
+ 61%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 126/208 [00:08<00:05, 15.91it/s]
303
+
304
+ 62%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 128/208 [00:08<00:05, 15.92it/s]
305
+
306
+ 62%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 130/208 [00:08<00:04, 15.84it/s]
307
+
308
+ 63%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 132/208 [00:08<00:04, 15.69it/s]
309
+
310
+ 64%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 134/208 [00:08<00:04, 15.77it/s]
311
+
312
+ 65%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 136/208 [00:09<00:04, 15.69it/s]
313
+
314
+ 66%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 138/208 [00:09<00:04, 15.52it/s]
315
+
316
+ 67%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 140/208 [00:09<00:04, 15.59it/s]
317
+
318
+ 68%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 142/208 [00:09<00:04, 15.64it/s]
319
+
320
+ 69%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 144/208 [00:09<00:04, 15.57it/s]
321
+
322
+ 70%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 146/208 [00:09<00:03, 15.62it/s]
323
+
324
+ 71%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 148/208 [00:09<00:03, 15.52it/s]
325
+
326
+ 72%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 150/208 [00:09<00:03, 15.50it/s]
327
+
328
+ 73%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 152/208 [00:10<00:03, 15.43it/s]
329
+
330
+ 74%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 154/208 [00:10<00:03, 15.49it/s]
331
+
332
+ 75%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 156/208 [00:10<00:03, 15.32it/s]
333
+
334
+ 76%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 158/208 [00:10<00:03, 15.13it/s]
335
+
336
+ 77%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 160/208 [00:10<00:03, 15.22it/s]
337
+
338
+ 78%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 162/208 [00:10<00:02, 15.40it/s]
339
+
340
+ 79%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 164/208 [00:10<00:02, 15.52it/s]
341
+
342
+ 80%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 166/208 [00:10<00:02, 15.65it/s]
343
+
344
+ 81%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 168/208 [00:11<00:02, 15.87it/s]
345
+
346
+ 82%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 170/208 [00:11<00:02, 15.81it/s]
347
+
348
+ 83%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 172/208 [00:11<00:02, 15.72it/s]
349
+
350
+ 84%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 174/208 [00:11<00:02, 15.80it/s]
351
+
352
+ 85%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 176/208 [00:11<00:02, 15.86it/s]
353
+
354
+ 86%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 178/208 [00:11<00:01, 15.57it/s]
355
+
356
+ 87%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 180/208 [00:11<00:01, 15.54it/s]
357
+
358
+ 88%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 182/208 [00:12<00:01, 15.37it/s]
359
+
360
+ 88%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 184/208 [00:12<00:01, 15.29it/s]
361
+
362
+ 89%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 186/208 [00:12<00:01, 15.37it/s]
363
+
364
+ 90%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 188/208 [00:12<00:01, 15.36it/s]
365
+
366
+ 91%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 190/208 [00:12<00:01, 15.28it/s]
367
+
368
+ 92%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 192/208 [00:12<00:01, 15.38it/s]
369
+
370
+ 93%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž| 194/208 [00:12<00:00, 15.66it/s]
371
+
372
+ 94%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 196/208 [00:12<00:00, 15.59it/s]
373
+
374
+ 95%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ| 198/208 [00:13<00:00, 15.06it/s]
375
+
376
+ 96%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ| 200/208 [00:13<00:00, 15.14it/s]
377
+
378
+ 97%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹| 202/208 [00:13<00:00, 15.13it/s]
379
+
380
+ 98%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š| 204/208 [00:13<00:00, 14.80it/s]
381
+
382
+ 99%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰| 206/208 [00:13<00:00, 14.49it/s]
383
+
384
+ 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 208/208 [00:13<00:00, 14.51it/s]
385
+
386
+
387
+
388
+ {'eval_loss': 2.0517611503601074, 'eval_runtime': 13.824, 'eval_samples_per_second': 30.093, 'eval_steps_per_second': 15.046, 'eval_entropy': 0.9272273137019231, 'eval_num_tokens': 21152.0, 'eval_mean_token_accuracy': 0.6686571506926646, 'epoch': 0.01}
389
+
390
+ 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 10/10 [00:25<00:00, 1.09s/it]
391
+
392
+ 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 208/208 [00:13<00:00, 14.51it/s]
393
+
394
+ 
395
+
396
+ {'train_runtime': 27.5551, 'train_samples_per_second': 2.903, 'train_steps_per_second': 0.363, 'train_loss': 2.0750574111938476, 'epoch': 0.01}
397
+
398
+ 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 10/10 [00:27<00:00, 1.09s/it]
399
+ 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 10/10 [00:27<00:00, 2.75s/it]
400
+ Saving final model to: ./checkpoints/final_model
401
+ Training metrics: {'val_loss': 2.0517611503601074, 'train_loss': 2.0751}
402
+ Number of training samples: 13857
403
+ Saved metrics.json to checkpoints/final_model/metrics.json
404
+ Uploading to vinoku89/aimo3-exp-1 (main branch)...
405
+
406
+ Processing Files (0 / 0) : | | 0.00B / 0.00B
407
+
408
+ New Data Upload : | | 0.00B / 0.00B 
409
+
410
+
411
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
412
+
413
+
414
+
415
+ ...adapter_model.safetensors: 2%|▏ | 433kB / 20.2MB 
416
+
417
+
418
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
419
+
420
+
421
+
422
+ ...adapter_model.safetensors: 2%|▏ | 433kB / 20.2MB 
423
+ Processing Files (1 / 2) : 37%|β–ˆβ–ˆβ–ˆβ–‹ | 11.9MB / 31.7MB, ???B/s
424
+
425
+
426
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
427
+
428
+
429
+
430
+ ...adapter_model.safetensors: 2%|▏ | 433kB / 20.2MB 
431
+
432
+
433
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
434
+
435
+
436
+
437
+ ...adapter_model.safetensors: 2%|▏ | 433kB / 20.2MB 
438
+
439
+
440
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
441
+
442
+
443
+
444
+ ...adapter_model.safetensors: 7%|β–‹ | 1.50MB / 20.2MB 
445
+ Processing Files (1 / 2) : 41%|β–ˆβ–ˆβ–ˆβ–ˆ | 12.9MB / 31.7MB, 1.78MB/s
446
+
447
+ New Data Upload : 3%|β–Ž | 608kB / 19.3MB, 1.01MB/s 
448
+
449
+
450
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
451
+
452
+
453
+
454
+ ...adapter_model.safetensors: 7%|β–‹ | 1.50MB / 20.2MB 
455
+
456
+
457
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
458
+
459
+
460
+
461
+ ...adapter_model.safetensors: 7%|β–‹ | 1.50MB / 20.2MB 
462
+
463
+
464
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
465
+
466
+
467
+
468
+ ...adapter_model.safetensors: 16%|β–ˆβ–‹ | 3.33MB / 20.2MB 
469
+ Processing Files (1 / 2) : 47%|β–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 14.7MB / 31.7MB, 2.41MB/s
470
+
471
+ New Data Upload : 13%|β–ˆβ–Ž | 2.43MB / 19.3MB, 2.03MB/s 
472
+
473
+
474
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
475
+
476
+
477
+
478
+ ...adapter_model.safetensors: 34%|β–ˆβ–ˆβ–ˆβ– | 6.97MB / 20.2MB 
479
+ Processing Files (1 / 2) : 58%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 18.4MB / 31.7MB, 4.67MB/s
480
+
481
+ New Data Upload : 31%|β–ˆβ–ˆβ–ˆβ– | 6.08MB / 19.3MB, 4.34MB/s 
482
+
483
+
484
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
485
+
486
+
487
+
488
+ ...adapter_model.safetensors: 86%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 17.3MB / 20.2MB 
489
+ Processing Files (1 / 2) : 91%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 28.7MB / 31.7MB, 10.6MB/s
490
+
491
+ New Data Upload : 85%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 16.4MB / 19.3MB, 10.3MB/s 
492
+
493
+
494
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
495
+
496
+
497
+
498
+ ...adapter_model.safetensors: 98%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š| 19.7MB / 20.2MB 
499
+ Processing Files (1 / 2) : 98%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š| 31.2MB / 31.7MB, 10.7MB/s
500
+
501
+ New Data Upload : 97%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹| 18.8MB / 19.3MB, 10.5MB/s 
502
+
503
+
504
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
505
+
506
+
507
+
508
+ ...adapter_model.safetensors: 98%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š| 19.7MB / 20.2MB 
509
+
510
+
511
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
512
+
513
+
514
+
515
+ ...adapter_model.safetensors: 98%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š| 19.7MB / 20.2MB 
516
+
517
+
518
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
519
+
520
+
521
+
522
+ ...adapter_model.safetensors: 98%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š| 19.7MB / 20.2MB 
523
+
524
+
525
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
526
+
527
+
528
+
529
+ ...adapter_model.safetensors: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 20.2MB / 20.2MB 
530
+ Processing Files (2 / 2) : 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 31.7MB / 31.7MB, 7.62MB/s
531
+
532
+ New Data Upload : 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 19.3MB / 19.3MB, 7.44MB/s 
533
+
534
+
535
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
536
+
537
+
538
+
539
+ ...adapter_model.safetensors: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 20.2MB / 20.2MB 
540
+
541
+
542
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
543
+
544
+
545
+
546
+ ...adapter_model.safetensors: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 20.2MB / 20.2MB 
547
+
548
+
549
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB 
550
+
551
+
552
+
553
+ ...adapter_model.safetensors: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 20.2MB / 20.2MB 
554
+ Processing Files (2 / 2) : 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 31.7MB / 31.7MB, 6.60MB/s
555
+
556
+ New Data Upload : 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 19.3MB / 19.3MB, 6.45MB/s
557
+
558
+ ...inal_model/tokenizer.json: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 11.4MB / 11.4MB
559
+
560
+ ...adapter_model.safetensors: 100%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ| 20.2MB / 20.2MB
561
+ Warning: Could not create run tag: 409 Client Error: Conflict for url: https://huggingface.co/api/models/vinoku89/aimo3-exp-1/tag/main (Request ID: Root=1-696573e6-143cc58e016376b56072dfc8;2c01acd5-4334-4a67-912b-ea1bd7169a04)
562
+
563
+ Tag reference exists already
564
+ Updated 'latest' tag
565
+ Updated 'best' tag (val_loss: 2.0518 < 2.0519)
566
+ Upload complete: https://huggingface.co/vinoku89/aimo3-exp-1
567
+ Uploaded logs/runtime_config_20260113_061956.yaml to vinoku89/aimo3-exp-1 (main branch)
568
+
569
+ ============================================================
570
+ Model pushed successfully!
571
+ ============================================================
572
+ URL: https://huggingface.co/vinoku89/aimo3-exp-1
573
+ Run Tag: qwen0.6b-sft-e1-13.9k-loss2.05-20260112-001
574
+ Tags: qwen0.6b-sft-e1-13.9k-loss2.05-20260112-001, latest, best (if lowest loss)
575
+
576
+ To load this specific run:
577
+ from peft import PeftModel
578
+ model = PeftModel.from_pretrained('base_model', 'vinoku89/aimo3-exp-1', revision='qwen0.6b-sft-e1-13.9k-loss2.05-20260112-001')
579
+
580
+ To load the best run:
581
+ model = PeftModel.from_pretrained('base_model', 'vinoku89/aimo3-exp-1', revision='best')
582
+
583
+ To load the latest run:
584
+ model = PeftModel.from_pretrained('base_model', 'vinoku89/aimo3-exp-1', revision='latest')
585
+ ============================================================
586
+
587
+ wandb: updating run metadata
588
+ wandb: uploading history steps 1-2, summary, console lines 52-52; uploading output.log; uploading wandb-summary.json
589
+ wandb: uploading output.log; uploading config.yaml
590
+ wandb: uploading console lines 54-89
591
+ wandb:
592
+ wandb: Run history:
593
+ wandb: eval/entropy ▁
594
+ wandb: eval/loss ▁
595
+ wandb: eval/mean_token_accuracy ▁
596
+ wandb: eval/num_tokens ▁
597
+ wandb: eval/runtime ▁
598
+ wandb: eval/samples_per_second ▁
599
+ wandb: eval/steps_per_second ▁
600
+ wandb: train/entropy ▁
601
+ wandb: train/epoch ▁▁▁
602
+ wandb: train/global_step ▁▁▁
603
+ wandb: +5 ...
604
+ wandb:
605
+ wandb: Run summary:
606
+ wandb: eval/entropy 0.92723
607
+ wandb: eval/loss 2.05176
608
+ wandb: eval/mean_token_accuracy 0.66866
609
+ wandb: eval/num_tokens 21152
610
+ wandb: eval/runtime 13.824
611
+ wandb: eval/samples_per_second 30.093
612
+ wandb: eval/steps_per_second 15.046
613
+ wandb: total_flos 67838115053568.0
614
+ wandb: train/entropy 0.94697
615
+ wandb: train/epoch 0.00577
616
+ wandb: +10 ...
617
+ wandb:
618
+ wandb: πŸš€ View run qwen3-0.6b-sft-lora-20260113_061956-001 at: https://wandb.ai/vinokuteam/aimo3-exp-1-train/runs/3fkbe45r
619
+ wandb: ⭐️ View project at: https://wandb.ai/vinokuteam/aimo3-exp-1-train
620
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
621
+ wandb: Find logs at: ./wandb/run-20260112_222013-3fkbe45r/logs
622
+ Training completed successfully!
623
+ [W112 22:21:34.601229775 AllocatorConfig.cpp:28] Warning: PYTORCH_CUDA_ALLOC_CONF is deprecated, use PYTORCH_ALLOC_CONF instead (function operator())
624
+ [W112 22:21:36.393460385 AllocatorConfig.cpp:28] Warning: PYTORCH_CUDA_ALLOC_CONF is deprecated, use PYTORCH_ALLOC_CONF instead (function operator())