Instructions to use vinoku89/aimo3-exp-1 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use vinoku89/aimo3-exp-1 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-0.6B") model = PeftModel.from_pretrained(base_model, "vinoku89/aimo3-exp-1") - Transformers
How to use vinoku89/aimo3-exp-1 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="vinoku89/aimo3-exp-1") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("vinoku89/aimo3-exp-1", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use vinoku89/aimo3-exp-1 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "vinoku89/aimo3-exp-1" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "vinoku89/aimo3-exp-1", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/vinoku89/aimo3-exp-1
- SGLang
How to use vinoku89/aimo3-exp-1 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "vinoku89/aimo3-exp-1" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "vinoku89/aimo3-exp-1", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "vinoku89/aimo3-exp-1" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "vinoku89/aimo3-exp-1", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use vinoku89/aimo3-exp-1 with Docker Model Runner:
docker model run hf.co/vinoku89/aimo3-exp-1
Training log (success)
Browse files
logs/training_20260113_061956.log
ADDED
|
@@ -0,0 +1,624 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/venv/main/lib/python3.12/site-packages/trl/__init__.py:203: UserWarning: TRL currently supports vLLM versions: 0.10.2, 0.11.0, 0.11.1, 0.11.2. You have version 0.13.0 installed. We recommend installing a supported version to avoid compatibility issues.
|
| 2 |
+
if is_vllm_available():
|
| 3 |
+
Loading config from: configs/runtime_config.yaml
|
| 4 |
+
Random seed set to: 42
|
| 5 |
+
============================================================
|
| 6 |
+
Training Configuration:
|
| 7 |
+
Framework: accelerate
|
| 8 |
+
Method: sft
|
| 9 |
+
============================================================
|
| 10 |
+
W&B Project: aimo3-exp-1-train
|
| 11 |
+
W&B Run: qwen3-0.6b-sft-lora-20260113_061956-001
|
| 12 |
+
wandb: Currently logged in as: vinoku (vinokuteam) to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 13 |
+
wandb: WARNING Using a boolean value for 'reinit' is deprecated. Use 'return_previous' or 'finish_previous' instead.
|
| 14 |
+
wandb: setting up run 3fkbe45r
|
| 15 |
+
wandb: Tracking run with wandb version 0.23.1
|
| 16 |
+
wandb: Run data is saved locally in /workspace/distributed-sft-rl-inference-pipeline/wandb/run-20260112_222013-3fkbe45r
|
| 17 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 18 |
+
wandb: Syncing run qwen3-0.6b-sft-lora-20260113_061956-001
|
| 19 |
+
wandb: βοΈ View project at https://wandb.ai/vinokuteam/aimo3-exp-1-train
|
| 20 |
+
wandb: π View run at https://wandb.ai/vinokuteam/aimo3-exp-1-train/runs/3fkbe45r
|
| 21 |
+
wandb: Detected [openai] in use.
|
| 22 |
+
wandb: Use W&B Weave for improved LLM call tracing. Install Weave with `pip install weave` then add `import weave` to the top of your script.
|
| 23 |
+
wandb: For more information, check out the docs at: https://weave-docs.wandb.ai/
|
| 24 |
+
W&B Run: qwen3-0.6b-sft-lora-20260113_061956-001
|
| 25 |
+
W&B URL: https://wandb.ai/vinokuteam/aimo3-exp-1-train/runs/3fkbe45r
|
| 26 |
+
W&B logging enabled (ID: 3fkbe45r)
|
| 27 |
+
Loading model: Qwen/Qwen3-0.6B
|
| 28 |
+
ZeRO-0 mode (no HfDeepSpeedConfig needed)
|
| 29 |
+
`torch_dtype` is deprecated! Use `dtype` instead!
|
| 30 |
+
Building datasets...
|
| 31 |
+
Loading dataset from HuggingFace: HAD653/GSM8K-OpenMath-MathReason-13k
|
| 32 |
+
Train size: 13857, Test size: 416
|
| 33 |
+
Dataset size after dropping NaN: 13857
|
| 34 |
+
Dataset size after dropping NaN: 416
|
| 35 |
+
Final train size: 13857, test size: 416
|
| 36 |
+
|
| 37 |
+
============================================================
|
| 38 |
+
SAMPLE TRAINING DATA (first example):
|
| 39 |
+
============================================================
|
| 40 |
+
<|im_start|>system
|
| 41 |
+
You are a helpful and reflective maths assistant. Please reason step by step to put the answer in \boxed{}.<|im_end|>
|
| 42 |
+
<|im_start|>user
|
| 43 |
+
Albert is wondering how much pizza he can eat in one day. He buys 2 large pizzas and 2 small pizzas. A large pizza has 16 slices and a small pizza has 8 slices. If he eats it all, how many pieces does he eat that day?<|im_end|>
|
| 44 |
+
<|im_start|>assistant
|
| 45 |
+
<think>
|
| 46 |
+
Problem:
|
| 47 |
+
Albert buys 2 large pizzas (16 slices each) and 2 small pizzas (8 slices each). Find total slices eaten.
|
| 48 |
+
|
| 49 |
+
Reasoning:
|
| 50 |
+
1. Large pizza slices = 2*16 = 32.
|
| 51 |
+
2. Small pizza slices = 2*8 = 16.
|
| 52 |
+
3. Total slices = 32+16 = 48.
|
| 53 |
+
|
| 54 |
+
Answer:
|
| 55 |
+
48
|
| 56 |
+
</think>
|
| 57 |
+
|
| 58 |
+
\boxed{48}<|im_end|>
|
| 59 |
+
============================================================
|
| 60 |
+
|
| 61 |
+
Creating LoRA configuration...
|
| 62 |
+
Using Accelerate + SFT training pipeline
|
| 63 |
+
Initializing SFTTrainer...
|
| 64 |
+
|
| 65 |
+
Adding EOS to train dataset: 0%| | 0/13857 [00:00<?, ? examples/s]
|
| 66 |
+
Adding EOS to train dataset: 30%|βββ | 4112/13857 [00:00<00:00, 39716.06 examples/s]
|
| 67 |
+
Adding EOS to train dataset: 60%|ββββββ | 8353/13857 [00:00<00:00, 41271.86 examples/s]
|
| 68 |
+
Adding EOS to train dataset: 90%|βββββββββ | 12523/13857 [00:00<00:00, 41465.24 examples/s]
|
| 69 |
+
Adding EOS to train dataset: 100%|ββββββββββ| 13857/13857 [00:00<00:00, 41056.84 examples/s]
|
| 70 |
+
|
| 71 |
+
Tokenizing train dataset: 0%| | 0/13857 [00:00<?, ? examples/s]
|
| 72 |
+
Tokenizing train dataset: 1%|β | 187/13857 [00:00<00:07, 1852.55 examples/s]
|
| 73 |
+
Tokenizing train dataset: 3%|β | 378/13857 [00:00<00:07, 1877.99 examples/s]
|
| 74 |
+
Tokenizing train dataset: 4%|β | 573/13857 [00:00<00:06, 1902.48 examples/s]
|
| 75 |
+
Tokenizing train dataset: 6%|β | 772/13857 [00:00<00:06, 1933.09 examples/s]
|
| 76 |
+
Tokenizing train dataset: 7%|β | 977/13857 [00:00<00:06, 1971.70 examples/s]
|
| 77 |
+
Tokenizing train dataset: 9%|β | 1208/13857 [00:00<00:07, 1780.65 examples/s]
|
| 78 |
+
Tokenizing train dataset: 10%|β | 1402/13857 [00:00<00:06, 1822.62 examples/s]
|
| 79 |
+
Tokenizing train dataset: 12%|ββ | 1598/13857 [00:00<00:06, 1859.51 examples/s]
|
| 80 |
+
Tokenizing train dataset: 13%|ββ | 1801/13857 [00:00<00:06, 1905.53 examples/s]
|
| 81 |
+
Tokenizing train dataset: 14%|ββ | 1999/13857 [00:01<00:06, 1925.89 examples/s]
|
| 82 |
+
Tokenizing train dataset: 16%|ββ | 2232/13857 [00:01<00:06, 1779.53 examples/s]
|
| 83 |
+
Tokenizing train dataset: 18%|ββ | 2439/13857 [00:01<00:06, 1854.49 examples/s]
|
| 84 |
+
Tokenizing train dataset: 19%|ββ | 2643/13857 [00:01<00:05, 1902.63 examples/s]
|
| 85 |
+
Tokenizing train dataset: 21%|ββ | 2850/13857 [00:01<00:05, 1946.52 examples/s]
|
| 86 |
+
Tokenizing train dataset: 22%|βββ | 3093/13857 [00:01<00:06, 1793.63 examples/s]
|
| 87 |
+
Tokenizing train dataset: 24%|βββ | 3279/13857 [00:01<00:05, 1809.71 examples/s]
|
| 88 |
+
Tokenizing train dataset: 25%|βββ | 3471/13857 [00:01<00:05, 1837.39 examples/s]
|
| 89 |
+
Tokenizing train dataset: 26%|βββ | 3663/13857 [00:01<00:05, 1856.62 examples/s]
|
| 90 |
+
Tokenizing train dataset: 28%|βββ | 3932/13857 [00:02<00:05, 1830.47 examples/s]
|
| 91 |
+
Tokenizing train dataset: 30%|βββ | 4196/13857 [00:02<00:05, 1729.06 examples/s]
|
| 92 |
+
Tokenizing train dataset: 32%|ββββ | 4392/13857 [00:02<00:05, 1781.85 examples/s]
|
| 93 |
+
Tokenizing train dataset: 33%|ββββ | 4595/13857 [00:02<00:05, 1842.05 examples/s]
|
| 94 |
+
Tokenizing train dataset: 35%|ββββ | 4798/13857 [00:02<00:04, 1888.49 examples/s]
|
| 95 |
+
Tokenizing train dataset: 36%|ββββ | 5000/13857 [00:02<00:05, 1750.89 examples/s]
|
| 96 |
+
Tokenizing train dataset: 38%|ββββ | 5208/13857 [00:02<00:04, 1835.53 examples/s]
|
| 97 |
+
Tokenizing train dataset: 39%|ββββ | 5415/13857 [00:02<00:04, 1896.83 examples/s]
|
| 98 |
+
Tokenizing train dataset: 41%|ββββ | 5625/13857 [00:03<00:04, 1951.48 examples/s]
|
| 99 |
+
Tokenizing train dataset: 42%|βββββ | 5830/13857 [00:03<00:04, 1977.78 examples/s]
|
| 100 |
+
Tokenizing train dataset: 44%|βββββ | 6102/13857 [00:03<00:04, 1852.31 examples/s]
|
| 101 |
+
Tokenizing train dataset: 46%|βββββ | 6307/13857 [00:03<00:03, 1901.90 examples/s]
|
| 102 |
+
Tokenizing train dataset: 48%|βββββ | 6601/13857 [00:03<00:03, 1919.99 examples/s]
|
| 103 |
+
Tokenizing train dataset: 49%|βββββ | 6803/13857 [00:03<00:03, 1942.15 examples/s]
|
| 104 |
+
Tokenizing train dataset: 51%|βββββ | 7000/13857 [00:03<00:03, 1805.41 examples/s]
|
| 105 |
+
Tokenizing train dataset: 52%|ββββββ | 7206/13857 [00:03<00:03, 1870.01 examples/s]
|
| 106 |
+
Tokenizing train dataset: 54%|ββββββ | 7451/13857 [00:04<00:03, 1783.37 examples/s]
|
| 107 |
+
Tokenizing train dataset: 55%|ββββββ | 7683/13857 [00:04<00:03, 1700.33 examples/s]
|
| 108 |
+
Tokenizing train dataset: 57%|ββββββ | 7926/13857 [00:04<00:03, 1668.62 examples/s]
|
| 109 |
+
Tokenizing train dataset: 59%|ββββββ | 8145/13857 [00:04<00:03, 1481.19 examples/s]
|
| 110 |
+
Tokenizing train dataset: 60%|ββββββ | 8359/13857 [00:04<00:03, 1457.07 examples/s]
|
| 111 |
+
Tokenizing train dataset: 61%|βββββββ | 8511/13857 [00:04<00:03, 1469.17 examples/s]
|
| 112 |
+
Tokenizing train dataset: 63%|βββββββ | 8666/13857 [00:04<00:03, 1486.34 examples/s]
|
| 113 |
+
Tokenizing train dataset: 64%|βββββββ | 8897/13857 [00:05<00:03, 1500.20 examples/s]
|
| 114 |
+
Tokenizing train dataset: 66%|βββββββ | 9080/13857 [00:05<00:03, 1382.65 examples/s]
|
| 115 |
+
Tokenizing train dataset: 67%|βββββββ | 9241/13857 [00:05<00:03, 1432.59 examples/s]
|
| 116 |
+
Tokenizing train dataset: 68%|βββββββ | 9404/13857 [00:05<00:03, 1478.86 examples/s]
|
| 117 |
+
Tokenizing train dataset: 69%|βββββββ | 9558/13857 [00:05<00:02, 1493.16 examples/s]
|
| 118 |
+
Tokenizing train dataset: 70%|βββββββ | 9721/13857 [00:05<00:02, 1527.97 examples/s]
|
| 119 |
+
Tokenizing train dataset: 71%|ββββββββ | 9881/13857 [00:05<00:02, 1544.61 examples/s]
|
| 120 |
+
Tokenizing train dataset: 73%|ββββββββ | 10079/13857 [00:05<00:02, 1331.48 examples/s]
|
| 121 |
+
Tokenizing train dataset: 74%|ββββββββ | 10234/13857 [00:05<00:02, 1379.87 examples/s]
|
| 122 |
+
Tokenizing train dataset: 75%|ββββββββ | 10401/13857 [00:06<00:02, 1453.78 examples/s]
|
| 123 |
+
Tokenizing train dataset: 76%|ββββββββ | 10559/13857 [00:06<00:02, 1484.99 examples/s]
|
| 124 |
+
Tokenizing train dataset: 77%|ββββββββ | 10719/13857 [00:06<00:02, 1515.15 examples/s]
|
| 125 |
+
Tokenizing train dataset: 79%|ββββββββ | 10882/13857 [00:06<00:01, 1543.14 examples/s]
|
| 126 |
+
Tokenizing train dataset: 80%|ββββββββ | 11074/13857 [00:06<00:02, 1366.29 examples/s]
|
| 127 |
+
Tokenizing train dataset: 81%|ββββββββ | 11246/13857 [00:06<00:01, 1454.07 examples/s]
|
| 128 |
+
Tokenizing train dataset: 82%|βββββββββ | 11402/13857 [00:06<00:01, 1480.89 examples/s]
|
| 129 |
+
Tokenizing train dataset: 84%|βββββββββ | 11631/13857 [00:06<00:01, 1482.48 examples/s]
|
| 130 |
+
Tokenizing train dataset: 85%|βββββββββ | 11793/13857 [00:07<00:01, 1512.29 examples/s]
|
| 131 |
+
Tokenizing train dataset: 86%|βββββββββ | 11951/13857 [00:07<00:01, 1528.71 examples/s]
|
| 132 |
+
Tokenizing train dataset: 88%|βββββββββ | 12164/13857 [00:07<00:01, 1403.81 examples/s]
|
| 133 |
+
Tokenizing train dataset: 89%|βββββββββ | 12318/13857 [00:07<00:01, 1434.06 examples/s]
|
| 134 |
+
Tokenizing train dataset: 90%|βββββββββ | 12470/13857 [00:07<00:00, 1453.17 examples/s]
|
| 135 |
+
Tokenizing train dataset: 91%|βββββββββ | 12628/13857 [00:07<00:00, 1486.39 examples/s]
|
| 136 |
+
Tokenizing train dataset: 92%|ββββββββββ| 12783/13857 [00:07<00:00, 1500.55 examples/s]
|
| 137 |
+
Tokenizing train dataset: 94%|ββββββββββ| 13000/13857 [00:07<00:00, 1349.52 examples/s]
|
| 138 |
+
Tokenizing train dataset: 95%|ββββββββββ| 13162/13857 [00:07<00:00, 1413.09 examples/s]
|
| 139 |
+
Tokenizing train dataset: 96%|ββββββββββ| 13322/13857 [00:08<00:00, 1458.65 examples/s]
|
| 140 |
+
Tokenizing train dataset: 97%|ββββββββββ| 13479/13857 [00:08<00:00, 1488.47 examples/s]
|
| 141 |
+
Tokenizing train dataset: 98%|ββββββββββ| 13645/13857 [00:08<00:00, 1532.14 examples/s]
|
| 142 |
+
Tokenizing train dataset: 100%|ββββββββββ| 13857/13857 [00:08<00:00, 1397.86 examples/s]
|
| 143 |
+
Tokenizing train dataset: 100%|ββββββββββ| 13857/13857 [00:08<00:00, 1639.61 examples/s]
|
| 144 |
+
|
| 145 |
+
Truncating train dataset: 0%| | 0/13857 [00:00<?, ? examples/s]
|
| 146 |
+
Truncating train dataset: 100%|ββββββββββ| 13857/13857 [00:00<00:00, 437489.43 examples/s]
|
| 147 |
+
|
| 148 |
+
Adding EOS to eval dataset: 0%| | 0/416 [00:00<?, ? examples/s]
|
| 149 |
+
Adding EOS to eval dataset: 100%|ββββββββββ| 416/416 [00:00<00:00, 37833.22 examples/s]
|
| 150 |
+
|
| 151 |
+
Tokenizing eval dataset: 0%| | 0/416 [00:00<?, ? examples/s]
|
| 152 |
+
Tokenizing eval dataset: 44%|βββββ | 184/416 [00:00<00:00, 1813.09 examples/s]
|
| 153 |
+
Tokenizing eval dataset: 89%|βββββββββ | 371/416 [00:00<00:00, 1839.65 examples/s]
|
| 154 |
+
Tokenizing eval dataset: 100%|ββββββββββ| 416/416 [00:00<00:00, 1703.92 examples/s]
|
| 155 |
+
|
| 156 |
+
Truncating eval dataset: 0%| | 0/416 [00:00<?, ? examples/s]
|
| 157 |
+
Truncating eval dataset: 100%|ββββββββββ| 416/416 [00:00<00:00, 211034.16 examples/s]
|
| 158 |
+
Starting training...
|
| 159 |
+
The tokenizer has new PAD/BOS/EOS tokens that differ from the model config and generation config. The model config and generation config were aligned accordingly, being updated with the tokenizer's values. Updated tokens: {'bos_token_id': None, 'pad_token_id': 151643}.
|
| 160 |
+
[2026-01-12 22:20:47] WARNING accelerator.py:2164: Gradient accumulation steps mismatch: GradientAccumulationPlugin has 1, DeepSpeed config has 4. Using DeepSpeed's value.
|
| 161 |
+
|
| 162 |
+
0%| | 0/10 [00:00<?, ?it/s]
|
| 163 |
+
10%|β | 1/10 [00:01<00:14, 1.65s/it]
|
| 164 |
+
20%|ββ | 2/10 [00:02<00:10, 1.31s/it]
|
| 165 |
+
30%|βββ | 3/10 [00:03<00:08, 1.21s/it]
|
| 166 |
+
40%|ββββ | 4/10 [00:04<00:06, 1.17s/it]
|
| 167 |
+
50%|βββββ | 5/10 [00:06<00:05, 1.14s/it]
|
| 168 |
+
60%|ββββββ | 6/10 [00:07<00:04, 1.12s/it]
|
| 169 |
+
70%|βββββββ | 7/10 [00:08<00:03, 1.11s/it]
|
| 170 |
+
80%|ββββββββ | 8/10 [00:09<00:02, 1.10s/it]
|
| 171 |
+
90%|βββββββββ | 9/10 [00:10<00:01, 1.10s/it]
|
| 172 |
+
100%|ββββββββββ| 10/10 [00:11<00:00, 1.09s/it]
|
| 173 |
+
|
| 174 |
+
{'loss': 2.0751, 'grad_norm': 0.1237564780666222, 'learning_rate': 4.000000000000001e-06, 'entropy': 0.94697265625, 'num_tokens': 21152.0, 'mean_token_accuracy': 0.66548752784729, 'epoch': 0.01}
|
| 175 |
+
|
| 176 |
+
100%|ββββββββββ| 10/10 [00:11<00:00, 1.09s/it]
|
| 177 |
+
|
| 178 |
+
0%| | 0/208 [00:00<?, ?it/s][A
|
| 179 |
+
|
| 180 |
+
1%|β | 3/208 [00:00<00:09, 22.64it/s][A
|
| 181 |
+
|
| 182 |
+
3%|β | 6/208 [00:00<00:11, 17.45it/s][A
|
| 183 |
+
|
| 184 |
+
4%|β | 8/208 [00:00<00:11, 16.70it/s][A
|
| 185 |
+
|
| 186 |
+
5%|β | 10/208 [00:00<00:12, 15.79it/s][A
|
| 187 |
+
|
| 188 |
+
6%|β | 12/208 [00:00<00:13, 15.02it/s][A
|
| 189 |
+
|
| 190 |
+
7%|β | 14/208 [00:00<00:13, 14.57it/s][A
|
| 191 |
+
|
| 192 |
+
8%|β | 16/208 [00:01<00:13, 14.26it/s][A
|
| 193 |
+
|
| 194 |
+
9%|β | 18/208 [00:01<00:13, 14.28it/s][A
|
| 195 |
+
|
| 196 |
+
10%|β | 20/208 [00:01<00:13, 14.30it/s][A
|
| 197 |
+
|
| 198 |
+
11%|β | 22/208 [00:01<00:12, 14.31it/s][A
|
| 199 |
+
|
| 200 |
+
12%|ββ | 24/208 [00:01<00:12, 14.32it/s][A
|
| 201 |
+
|
| 202 |
+
12%|ββ | 26/208 [00:01<00:12, 14.09it/s][A
|
| 203 |
+
|
| 204 |
+
13%|ββ | 28/208 [00:01<00:12, 14.11it/s][A
|
| 205 |
+
|
| 206 |
+
14%|ββ | 30/208 [00:02<00:12, 13.94it/s][A
|
| 207 |
+
|
| 208 |
+
15%|ββ | 32/208 [00:02<00:12, 13.75it/s][A
|
| 209 |
+
|
| 210 |
+
16%|ββ | 34/208 [00:02<00:12, 13.85it/s][A
|
| 211 |
+
|
| 212 |
+
17%|ββ | 36/208 [00:02<00:12, 13.90it/s][A
|
| 213 |
+
|
| 214 |
+
18%|ββ | 38/208 [00:02<00:12, 13.82it/s][A
|
| 215 |
+
|
| 216 |
+
19%|ββ | 40/208 [00:02<00:12, 13.94it/s][A
|
| 217 |
+
|
| 218 |
+
20%|ββ | 42/208 [00:02<00:11, 13.94it/s][A
|
| 219 |
+
|
| 220 |
+
21%|ββ | 44/208 [00:03<00:11, 13.95it/s][A
|
| 221 |
+
|
| 222 |
+
22%|βββ | 46/208 [00:03<00:11, 14.14it/s][A
|
| 223 |
+
|
| 224 |
+
23%|βββ | 48/208 [00:03<00:11, 13.99it/s][A
|
| 225 |
+
|
| 226 |
+
24%|βββ | 50/208 [00:03<00:11, 14.01it/s][A
|
| 227 |
+
|
| 228 |
+
25%|βββ | 52/208 [00:03<00:11, 13.84it/s][A
|
| 229 |
+
|
| 230 |
+
26%|βββ | 54/208 [00:03<00:11, 13.98it/s][A
|
| 231 |
+
|
| 232 |
+
27%|βββ | 56/208 [00:03<00:10, 13.95it/s][A
|
| 233 |
+
|
| 234 |
+
28%|βββ | 58/208 [00:04<00:10, 14.36it/s][A
|
| 235 |
+
|
| 236 |
+
29%|βββ | 60/208 [00:04<00:10, 14.56it/s][A
|
| 237 |
+
|
| 238 |
+
30%|βββ | 62/208 [00:04<00:09, 15.04it/s][A
|
| 239 |
+
|
| 240 |
+
31%|βββ | 64/208 [00:04<00:09, 15.22it/s][A
|
| 241 |
+
|
| 242 |
+
32%|ββββ | 66/208 [00:04<00:09, 15.40it/s][A
|
| 243 |
+
|
| 244 |
+
33%|ββββ | 68/208 [00:04<00:09, 15.34it/s][A
|
| 245 |
+
|
| 246 |
+
34%|ββββ | 70/208 [00:04<00:08, 15.40it/s][A
|
| 247 |
+
|
| 248 |
+
35%|ββββ | 72/208 [00:04<00:08, 15.34it/s][A
|
| 249 |
+
|
| 250 |
+
36%|ββββ | 74/208 [00:05<00:08, 15.54it/s][A
|
| 251 |
+
|
| 252 |
+
37%|ββββ | 76/208 [00:05<00:08, 15.59it/s][A
|
| 253 |
+
|
| 254 |
+
38%|ββββ | 78/208 [00:05<00:08, 15.54it/s][A
|
| 255 |
+
|
| 256 |
+
38%|ββββ | 80/208 [00:05<00:08, 15.50it/s][A
|
| 257 |
+
|
| 258 |
+
39%|ββββ | 82/208 [00:05<00:08, 15.50it/s][A
|
| 259 |
+
|
| 260 |
+
40%|ββββ | 84/208 [00:05<00:07, 15.54it/s][A
|
| 261 |
+
|
| 262 |
+
41%|βββββ | 86/208 [00:05<00:07, 15.72it/s][A
|
| 263 |
+
|
| 264 |
+
42%|βββββ | 88/208 [00:05<00:07, 15.67it/s][A
|
| 265 |
+
|
| 266 |
+
43%|βββββ | 90/208 [00:06<00:07, 15.47it/s][A
|
| 267 |
+
|
| 268 |
+
44%|βββββ | 92/208 [00:06<00:07, 15.43it/s][A
|
| 269 |
+
|
| 270 |
+
45%|βββββ | 94/208 [00:06<00:07, 15.54it/s][A
|
| 271 |
+
|
| 272 |
+
46%|βββββ | 96/208 [00:06<00:07, 15.28it/s][A
|
| 273 |
+
|
| 274 |
+
47%|βββββ | 98/208 [00:06<00:07, 15.26it/s][A
|
| 275 |
+
|
| 276 |
+
48%|βββββ | 100/208 [00:06<00:07, 15.30it/s][A
|
| 277 |
+
|
| 278 |
+
49%|βββββ | 102/208 [00:06<00:06, 15.40it/s][A
|
| 279 |
+
|
| 280 |
+
50%|βββββ | 104/208 [00:06<00:06, 15.42it/s][A
|
| 281 |
+
|
| 282 |
+
51%|βββββ | 106/208 [00:07<00:06, 15.34it/s][A
|
| 283 |
+
|
| 284 |
+
52%|ββββββ | 108/208 [00:07<00:06, 15.20it/s][A
|
| 285 |
+
|
| 286 |
+
53%|ββββββ | 110/208 [00:07<00:06, 15.37it/s][A
|
| 287 |
+
|
| 288 |
+
54%|ββββββ | 112/208 [00:07<00:06, 15.37it/s][A
|
| 289 |
+
|
| 290 |
+
55%|ββββββ | 114/208 [00:07<00:06, 15.26it/s][A
|
| 291 |
+
|
| 292 |
+
56%|ββββββ | 116/208 [00:07<00:06, 15.31it/s][A
|
| 293 |
+
|
| 294 |
+
57%|ββββββ | 118/208 [00:07<00:05, 15.36it/s][A
|
| 295 |
+
|
| 296 |
+
58%|ββββββ | 120/208 [00:08<00:05, 15.59it/s][A
|
| 297 |
+
|
| 298 |
+
59%|ββββββ | 122/208 [00:08<00:05, 15.74it/s][A
|
| 299 |
+
|
| 300 |
+
60%|ββββββ | 124/208 [00:08<00:05, 15.95it/s][A
|
| 301 |
+
|
| 302 |
+
61%|ββββββ | 126/208 [00:08<00:05, 15.91it/s][A
|
| 303 |
+
|
| 304 |
+
62%|βββββββ | 128/208 [00:08<00:05, 15.92it/s][A
|
| 305 |
+
|
| 306 |
+
62%|βββββββ | 130/208 [00:08<00:04, 15.84it/s][A
|
| 307 |
+
|
| 308 |
+
63%|βββββββ | 132/208 [00:08<00:04, 15.69it/s][A
|
| 309 |
+
|
| 310 |
+
64%|βββββββ | 134/208 [00:08<00:04, 15.77it/s][A
|
| 311 |
+
|
| 312 |
+
65%|βββββββ | 136/208 [00:09<00:04, 15.69it/s][A
|
| 313 |
+
|
| 314 |
+
66%|βββββββ | 138/208 [00:09<00:04, 15.52it/s][A
|
| 315 |
+
|
| 316 |
+
67%|βββββββ | 140/208 [00:09<00:04, 15.59it/s][A
|
| 317 |
+
|
| 318 |
+
68%|βββββββ | 142/208 [00:09<00:04, 15.64it/s][A
|
| 319 |
+
|
| 320 |
+
69%|βββββββ | 144/208 [00:09<00:04, 15.57it/s][A
|
| 321 |
+
|
| 322 |
+
70%|βββββββ | 146/208 [00:09<00:03, 15.62it/s][A
|
| 323 |
+
|
| 324 |
+
71%|βββββββ | 148/208 [00:09<00:03, 15.52it/s][A
|
| 325 |
+
|
| 326 |
+
72%|ββββββββ | 150/208 [00:09<00:03, 15.50it/s][A
|
| 327 |
+
|
| 328 |
+
73%|ββββββββ | 152/208 [00:10<00:03, 15.43it/s][A
|
| 329 |
+
|
| 330 |
+
74%|ββββββββ | 154/208 [00:10<00:03, 15.49it/s][A
|
| 331 |
+
|
| 332 |
+
75%|ββββββββ | 156/208 [00:10<00:03, 15.32it/s][A
|
| 333 |
+
|
| 334 |
+
76%|ββββββββ | 158/208 [00:10<00:03, 15.13it/s][A
|
| 335 |
+
|
| 336 |
+
77%|ββββββββ | 160/208 [00:10<00:03, 15.22it/s][A
|
| 337 |
+
|
| 338 |
+
78%|ββββββββ | 162/208 [00:10<00:02, 15.40it/s][A
|
| 339 |
+
|
| 340 |
+
79%|ββββββββ | 164/208 [00:10<00:02, 15.52it/s][A
|
| 341 |
+
|
| 342 |
+
80%|ββββββββ | 166/208 [00:10<00:02, 15.65it/s][A
|
| 343 |
+
|
| 344 |
+
81%|ββββββββ | 168/208 [00:11<00:02, 15.87it/s][A
|
| 345 |
+
|
| 346 |
+
82%|βββββββββ | 170/208 [00:11<00:02, 15.81it/s][A
|
| 347 |
+
|
| 348 |
+
83%|βββββββββ | 172/208 [00:11<00:02, 15.72it/s][A
|
| 349 |
+
|
| 350 |
+
84%|βββββββββ | 174/208 [00:11<00:02, 15.80it/s][A
|
| 351 |
+
|
| 352 |
+
85%|βββββββββ | 176/208 [00:11<00:02, 15.86it/s][A
|
| 353 |
+
|
| 354 |
+
86%|βββββββββ | 178/208 [00:11<00:01, 15.57it/s][A
|
| 355 |
+
|
| 356 |
+
87%|βββββββββ | 180/208 [00:11<00:01, 15.54it/s][A
|
| 357 |
+
|
| 358 |
+
88%|βββββββββ | 182/208 [00:12<00:01, 15.37it/s][A
|
| 359 |
+
|
| 360 |
+
88%|βββββββββ | 184/208 [00:12<00:01, 15.29it/s][A
|
| 361 |
+
|
| 362 |
+
89%|βββββββββ | 186/208 [00:12<00:01, 15.37it/s][A
|
| 363 |
+
|
| 364 |
+
90%|βββββββββ | 188/208 [00:12<00:01, 15.36it/s][A
|
| 365 |
+
|
| 366 |
+
91%|ββββββββββ| 190/208 [00:12<00:01, 15.28it/s][A
|
| 367 |
+
|
| 368 |
+
92%|ββββββββββ| 192/208 [00:12<00:01, 15.38it/s][A
|
| 369 |
+
|
| 370 |
+
93%|ββββββββββ| 194/208 [00:12<00:00, 15.66it/s][A
|
| 371 |
+
|
| 372 |
+
94%|ββββββββββ| 196/208 [00:12<00:00, 15.59it/s][A
|
| 373 |
+
|
| 374 |
+
95%|ββββββββββ| 198/208 [00:13<00:00, 15.06it/s][A
|
| 375 |
+
|
| 376 |
+
96%|ββββββββββ| 200/208 [00:13<00:00, 15.14it/s][A
|
| 377 |
+
|
| 378 |
+
97%|ββββββββββ| 202/208 [00:13<00:00, 15.13it/s][A
|
| 379 |
+
|
| 380 |
+
98%|ββββββββββ| 204/208 [00:13<00:00, 14.80it/s][A
|
| 381 |
+
|
| 382 |
+
99%|ββββββββββ| 206/208 [00:13<00:00, 14.49it/s][A
|
| 383 |
+
|
| 384 |
+
100%|ββββββββββ| 208/208 [00:13<00:00, 14.51it/s][A
|
| 385 |
+
|
| 386 |
+
|
| 387 |
+
|
| 388 |
+
[A{'eval_loss': 2.0517611503601074, 'eval_runtime': 13.824, 'eval_samples_per_second': 30.093, 'eval_steps_per_second': 15.046, 'eval_entropy': 0.9272273137019231, 'eval_num_tokens': 21152.0, 'eval_mean_token_accuracy': 0.6686571506926646, 'epoch': 0.01}
|
| 389 |
+
|
| 390 |
+
100%|ββββββββββ| 10/10 [00:25<00:00, 1.09s/it]
|
| 391 |
+
|
| 392 |
+
100%|ββββββββββ| 208/208 [00:13<00:00, 14.51it/s][A
|
| 393 |
+
|
| 394 |
+
[A
|
| 395 |
+
|
| 396 |
+
{'train_runtime': 27.5551, 'train_samples_per_second': 2.903, 'train_steps_per_second': 0.363, 'train_loss': 2.0750574111938476, 'epoch': 0.01}
|
| 397 |
+
|
| 398 |
+
100%|ββββββββββ| 10/10 [00:27<00:00, 1.09s/it]
|
| 399 |
+
100%|ββββββββββ| 10/10 [00:27<00:00, 2.75s/it]
|
| 400 |
+
Saving final model to: ./checkpoints/final_model
|
| 401 |
+
Training metrics: {'val_loss': 2.0517611503601074, 'train_loss': 2.0751}
|
| 402 |
+
Number of training samples: 13857
|
| 403 |
+
Saved metrics.json to checkpoints/final_model/metrics.json
|
| 404 |
+
Uploading to vinoku89/aimo3-exp-1 (main branch)...
|
| 405 |
+
|
| 406 |
+
Processing Files (0 / 0) : | | 0.00B / 0.00B
|
| 407 |
+
|
| 408 |
+
New Data Upload : | | 0.00B / 0.00B [A
|
| 409 |
+
|
| 410 |
+
|
| 411 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 412 |
+
|
| 413 |
+
|
| 414 |
+
|
| 415 |
+
...adapter_model.safetensors: 2%|β | 433kB / 20.2MB [A[A[A
|
| 416 |
+
|
| 417 |
+
|
| 418 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 419 |
+
|
| 420 |
+
|
| 421 |
+
|
| 422 |
+
...adapter_model.safetensors: 2%|β | 433kB / 20.2MB [A[A[A
|
| 423 |
+
Processing Files (1 / 2) : 37%|ββββ | 11.9MB / 31.7MB, ???B/s
|
| 424 |
+
|
| 425 |
+
|
| 426 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 427 |
+
|
| 428 |
+
|
| 429 |
+
|
| 430 |
+
...adapter_model.safetensors: 2%|β | 433kB / 20.2MB [A[A[A
|
| 431 |
+
|
| 432 |
+
|
| 433 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 434 |
+
|
| 435 |
+
|
| 436 |
+
|
| 437 |
+
...adapter_model.safetensors: 2%|β | 433kB / 20.2MB [A[A[A
|
| 438 |
+
|
| 439 |
+
|
| 440 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 441 |
+
|
| 442 |
+
|
| 443 |
+
|
| 444 |
+
...adapter_model.safetensors: 7%|β | 1.50MB / 20.2MB [A[A[A
|
| 445 |
+
Processing Files (1 / 2) : 41%|ββββ | 12.9MB / 31.7MB, 1.78MB/s
|
| 446 |
+
|
| 447 |
+
New Data Upload : 3%|β | 608kB / 19.3MB, 1.01MB/s [A
|
| 448 |
+
|
| 449 |
+
|
| 450 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 451 |
+
|
| 452 |
+
|
| 453 |
+
|
| 454 |
+
...adapter_model.safetensors: 7%|β | 1.50MB / 20.2MB [A[A[A
|
| 455 |
+
|
| 456 |
+
|
| 457 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 458 |
+
|
| 459 |
+
|
| 460 |
+
|
| 461 |
+
...adapter_model.safetensors: 7%|β | 1.50MB / 20.2MB [A[A[A
|
| 462 |
+
|
| 463 |
+
|
| 464 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 465 |
+
|
| 466 |
+
|
| 467 |
+
|
| 468 |
+
...adapter_model.safetensors: 16%|ββ | 3.33MB / 20.2MB [A[A[A
|
| 469 |
+
Processing Files (1 / 2) : 47%|βββββ | 14.7MB / 31.7MB, 2.41MB/s
|
| 470 |
+
|
| 471 |
+
New Data Upload : 13%|ββ | 2.43MB / 19.3MB, 2.03MB/s [A
|
| 472 |
+
|
| 473 |
+
|
| 474 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 475 |
+
|
| 476 |
+
|
| 477 |
+
|
| 478 |
+
...adapter_model.safetensors: 34%|ββββ | 6.97MB / 20.2MB [A[A[A
|
| 479 |
+
Processing Files (1 / 2) : 58%|ββββββ | 18.4MB / 31.7MB, 4.67MB/s
|
| 480 |
+
|
| 481 |
+
New Data Upload : 31%|ββββ | 6.08MB / 19.3MB, 4.34MB/s [A
|
| 482 |
+
|
| 483 |
+
|
| 484 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 485 |
+
|
| 486 |
+
|
| 487 |
+
|
| 488 |
+
...adapter_model.safetensors: 86%|βββββββββ | 17.3MB / 20.2MB [A[A[A
|
| 489 |
+
Processing Files (1 / 2) : 91%|βββββββββ | 28.7MB / 31.7MB, 10.6MB/s
|
| 490 |
+
|
| 491 |
+
New Data Upload : 85%|βββββββββ | 16.4MB / 19.3MB, 10.3MB/s [A
|
| 492 |
+
|
| 493 |
+
|
| 494 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 495 |
+
|
| 496 |
+
|
| 497 |
+
|
| 498 |
+
...adapter_model.safetensors: 98%|ββββββββββ| 19.7MB / 20.2MB [A[A[A
|
| 499 |
+
Processing Files (1 / 2) : 98%|ββββββββββ| 31.2MB / 31.7MB, 10.7MB/s
|
| 500 |
+
|
| 501 |
+
New Data Upload : 97%|ββββββββββ| 18.8MB / 19.3MB, 10.5MB/s [A
|
| 502 |
+
|
| 503 |
+
|
| 504 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 505 |
+
|
| 506 |
+
|
| 507 |
+
|
| 508 |
+
...adapter_model.safetensors: 98%|ββββββββββ| 19.7MB / 20.2MB [A[A[A
|
| 509 |
+
|
| 510 |
+
|
| 511 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 512 |
+
|
| 513 |
+
|
| 514 |
+
|
| 515 |
+
...adapter_model.safetensors: 98%|ββββββββββ| 19.7MB / 20.2MB [A[A[A
|
| 516 |
+
|
| 517 |
+
|
| 518 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 519 |
+
|
| 520 |
+
|
| 521 |
+
|
| 522 |
+
...adapter_model.safetensors: 98%|ββββββββββ| 19.7MB / 20.2MB [A[A[A
|
| 523 |
+
|
| 524 |
+
|
| 525 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 526 |
+
|
| 527 |
+
|
| 528 |
+
|
| 529 |
+
...adapter_model.safetensors: 100%|ββββββββββ| 20.2MB / 20.2MB [A[A[A
|
| 530 |
+
Processing Files (2 / 2) : 100%|ββββββββββ| 31.7MB / 31.7MB, 7.62MB/s
|
| 531 |
+
|
| 532 |
+
New Data Upload : 100%|ββββββββββ| 19.3MB / 19.3MB, 7.44MB/s [A
|
| 533 |
+
|
| 534 |
+
|
| 535 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 536 |
+
|
| 537 |
+
|
| 538 |
+
|
| 539 |
+
...adapter_model.safetensors: 100%|ββββββββββ| 20.2MB / 20.2MB [A[A[A
|
| 540 |
+
|
| 541 |
+
|
| 542 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 543 |
+
|
| 544 |
+
|
| 545 |
+
|
| 546 |
+
...adapter_model.safetensors: 100%|ββββββββββ| 20.2MB / 20.2MB [A[A[A
|
| 547 |
+
|
| 548 |
+
|
| 549 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB [A[A
|
| 550 |
+
|
| 551 |
+
|
| 552 |
+
|
| 553 |
+
...adapter_model.safetensors: 100%|ββββββββββ| 20.2MB / 20.2MB [A[A[A
|
| 554 |
+
Processing Files (2 / 2) : 100%|ββββββββββ| 31.7MB / 31.7MB, 6.60MB/s
|
| 555 |
+
|
| 556 |
+
New Data Upload : 100%|ββββββββββ| 19.3MB / 19.3MB, 6.45MB/s
|
| 557 |
+
|
| 558 |
+
...inal_model/tokenizer.json: 100%|ββββββββββ| 11.4MB / 11.4MB
|
| 559 |
+
|
| 560 |
+
...adapter_model.safetensors: 100%|ββββββββββ| 20.2MB / 20.2MB
|
| 561 |
+
Warning: Could not create run tag: 409 Client Error: Conflict for url: https://huggingface.co/api/models/vinoku89/aimo3-exp-1/tag/main (Request ID: Root=1-696573e6-143cc58e016376b56072dfc8;2c01acd5-4334-4a67-912b-ea1bd7169a04)
|
| 562 |
+
|
| 563 |
+
Tag reference exists already
|
| 564 |
+
Updated 'latest' tag
|
| 565 |
+
Updated 'best' tag (val_loss: 2.0518 < 2.0519)
|
| 566 |
+
Upload complete: https://huggingface.co/vinoku89/aimo3-exp-1
|
| 567 |
+
Uploaded logs/runtime_config_20260113_061956.yaml to vinoku89/aimo3-exp-1 (main branch)
|
| 568 |
+
|
| 569 |
+
============================================================
|
| 570 |
+
Model pushed successfully!
|
| 571 |
+
============================================================
|
| 572 |
+
URL: https://huggingface.co/vinoku89/aimo3-exp-1
|
| 573 |
+
Run Tag: qwen0.6b-sft-e1-13.9k-loss2.05-20260112-001
|
| 574 |
+
Tags: qwen0.6b-sft-e1-13.9k-loss2.05-20260112-001, latest, best (if lowest loss)
|
| 575 |
+
|
| 576 |
+
To load this specific run:
|
| 577 |
+
from peft import PeftModel
|
| 578 |
+
model = PeftModel.from_pretrained('base_model', 'vinoku89/aimo3-exp-1', revision='qwen0.6b-sft-e1-13.9k-loss2.05-20260112-001')
|
| 579 |
+
|
| 580 |
+
To load the best run:
|
| 581 |
+
model = PeftModel.from_pretrained('base_model', 'vinoku89/aimo3-exp-1', revision='best')
|
| 582 |
+
|
| 583 |
+
To load the latest run:
|
| 584 |
+
model = PeftModel.from_pretrained('base_model', 'vinoku89/aimo3-exp-1', revision='latest')
|
| 585 |
+
============================================================
|
| 586 |
+
|
| 587 |
+
wandb: updating run metadata
|
| 588 |
+
wandb: uploading history steps 1-2, summary, console lines 52-52; uploading output.log; uploading wandb-summary.json
|
| 589 |
+
wandb: uploading output.log; uploading config.yaml
|
| 590 |
+
wandb: uploading console lines 54-89
|
| 591 |
+
wandb:
|
| 592 |
+
wandb: Run history:
|
| 593 |
+
wandb: eval/entropy β
|
| 594 |
+
wandb: eval/loss β
|
| 595 |
+
wandb: eval/mean_token_accuracy β
|
| 596 |
+
wandb: eval/num_tokens β
|
| 597 |
+
wandb: eval/runtime β
|
| 598 |
+
wandb: eval/samples_per_second β
|
| 599 |
+
wandb: eval/steps_per_second β
|
| 600 |
+
wandb: train/entropy β
|
| 601 |
+
wandb: train/epoch βββ
|
| 602 |
+
wandb: train/global_step βββ
|
| 603 |
+
wandb: +5 ...
|
| 604 |
+
wandb:
|
| 605 |
+
wandb: Run summary:
|
| 606 |
+
wandb: eval/entropy 0.92723
|
| 607 |
+
wandb: eval/loss 2.05176
|
| 608 |
+
wandb: eval/mean_token_accuracy 0.66866
|
| 609 |
+
wandb: eval/num_tokens 21152
|
| 610 |
+
wandb: eval/runtime 13.824
|
| 611 |
+
wandb: eval/samples_per_second 30.093
|
| 612 |
+
wandb: eval/steps_per_second 15.046
|
| 613 |
+
wandb: total_flos 67838115053568.0
|
| 614 |
+
wandb: train/entropy 0.94697
|
| 615 |
+
wandb: train/epoch 0.00577
|
| 616 |
+
wandb: +10 ...
|
| 617 |
+
wandb:
|
| 618 |
+
wandb: π View run qwen3-0.6b-sft-lora-20260113_061956-001 at: https://wandb.ai/vinokuteam/aimo3-exp-1-train/runs/3fkbe45r
|
| 619 |
+
wandb: βοΈ View project at: https://wandb.ai/vinokuteam/aimo3-exp-1-train
|
| 620 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 621 |
+
wandb: Find logs at: ./wandb/run-20260112_222013-3fkbe45r/logs
|
| 622 |
+
Training completed successfully!
|
| 623 |
+
[W112 22:21:34.601229775 AllocatorConfig.cpp:28] Warning: PYTORCH_CUDA_ALLOC_CONF is deprecated, use PYTORCH_ALLOC_CONF instead (function operator())
|
| 624 |
+
[W112 22:21:36.393460385 AllocatorConfig.cpp:28] Warning: PYTORCH_CUDA_ALLOC_CONF is deprecated, use PYTORCH_ALLOC_CONF instead (function operator())
|