{ "dataset": "smoltalk", "model_path": "/data/checkpoints/final", "training_args": { "model_path": "/data/checkpoints/final", "dataset": "smoltalk", "seq_len": 2048, "per_device_batch_size": 4, "gradient_accumulation_steps": 4, "learning_rate": 2e-05, "min_lr_ratio": 0.0, "warmup_ratio": 0.05, "weight_decay": 0.01, "max_grad_norm": 1.0, "adam_beta1": 0.9, "adam_beta2": 0.999, "adam_eps": 1e-08, "num_epochs": 1, "log_interval": 10, "save_interval": 500, "seed": 42, "bf16": true, "output_dir": "/data/checkpoints", "tensorboard_dir": "/data/sft-logs", "hf_repo": "soyrsoyr/erebus-v2-1.5b-instruct", "max_samples": 0 }, "total_steps": 16245, "num_examples": 1039630, "param_count": 1720028160, "gpu_count": 4 }