{ "best_metric": 0.6828035712242126, "best_model_checkpoint": "/data/models/v3.1.2/no-lora/multitask/granite-3.2-8b-instruct-2025-03-30-10-00-45/checkpoint-400", "epoch": 1.1693631669535285, "eval_steps": 50, "global_step": 850, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.027538726333907058, "grad_norm": 2.072109826668444, "learning_rate": 2.1683833261066357e-05, "loss": 1.2781, "step": 20 }, { "epoch": 0.055077452667814115, "grad_norm": 1.8862926260699768, "learning_rate": 2.6700999855466042e-05, "loss": 1.0509, "step": 40 }, { "epoch": 0.06884681583476764, "eval_loss": 1.021646499633789, "eval_runtime": 28.6813, "eval_samples_per_second": 57.982, "eval_steps_per_second": 0.907, "step": 50 }, { "epoch": 0.08261617900172118, "grad_norm": 2.1748080635162124, "learning_rate": 2.963585417306073e-05, "loss": 0.9407, "step": 60 }, { "epoch": 0.11015490533562823, "grad_norm": 1.8974498033546006, "learning_rate": 3.171816644986573e-05, "loss": 0.8109, "step": 80 }, { "epoch": 0.13769363166953527, "grad_norm": 1.7934323218296222, "learning_rate": 3.333333333333334e-05, "loss": 0.7336, "step": 100 }, { "epoch": 0.13769363166953527, "eval_loss": 0.8868263363838196, "eval_runtime": 28.6866, "eval_samples_per_second": 57.971, "eval_steps_per_second": 0.906, "step": 100 }, { "epoch": 0.16523235800344235, "grad_norm": 2.020847367537311, "learning_rate": 3.465302076746041e-05, "loss": 0.6602, "step": 120 }, { "epoch": 0.1927710843373494, "grad_norm": 1.8437951461388182, "learning_rate": 3.5768800594637304e-05, "loss": 0.5891, "step": 140 }, { "epoch": 0.20654044750430292, "eval_loss": 0.8127080202102661, "eval_runtime": 28.6855, "eval_samples_per_second": 57.974, "eval_steps_per_second": 0.906, "step": 150 }, { "epoch": 0.22030981067125646, "grad_norm": 2.1177812508140983, "learning_rate": 3.673533304426541e-05, "loss": 0.5384, "step": 160 }, { "epoch": 0.24784853700516352, "grad_norm": 1.8971916725244924, "learning_rate": 3.75878750850551e-05, "loss": 0.5076, "step": 180 }, { "epoch": 0.27538726333907054, "grad_norm": 1.6483131931913475, "learning_rate": 3.835049992773302e-05, "loss": 0.428, "step": 200 }, { "epoch": 0.27538726333907054, "eval_loss": 0.747828483581543, "eval_runtime": 28.6563, "eval_samples_per_second": 58.033, "eval_steps_per_second": 0.907, "step": 200 }, { "epoch": 0.3029259896729776, "grad_norm": 1.7094199073127136, "learning_rate": 3.904037801370344e-05, "loss": 0.3992, "step": 220 }, { "epoch": 0.3304647160068847, "grad_norm": 1.6345135884362374, "learning_rate": 3.96701873618601e-05, "loss": 0.3695, "step": 240 }, { "epoch": 0.3442340791738382, "eval_loss": 0.7195882797241211, "eval_runtime": 28.6774, "eval_samples_per_second": 57.99, "eval_steps_per_second": 0.907, "step": 250 }, { "epoch": 0.35800344234079173, "grad_norm": 1.4346580877740036, "learning_rate": 4.024955579951363e-05, "loss": 0.3515, "step": 260 }, { "epoch": 0.3855421686746988, "grad_norm": 1.5309494006780702, "learning_rate": 4.0785967189036986e-05, "loss": 0.2985, "step": 280 }, { "epoch": 0.41308089500860584, "grad_norm": 1.5312633172335828, "learning_rate": 4.1285354245327715e-05, "loss": 0.2835, "step": 300 }, { "epoch": 0.41308089500860584, "eval_loss": 0.6964643001556396, "eval_runtime": 28.6805, "eval_samples_per_second": 57.984, "eval_steps_per_second": 0.907, "step": 300 }, { "epoch": 0.4406196213425129, "grad_norm": 1.5647852629258407, "learning_rate": 4.17524996386651e-05, "loss": 0.2734, "step": 320 }, { "epoch": 0.46815834767641995, "grad_norm": 1.5340790131657163, "learning_rate": 4.219131528403759e-05, "loss": 0.2411, "step": 340 }, { "epoch": 0.4819277108433735, "eval_loss": 0.6934902667999268, "eval_runtime": 28.6427, "eval_samples_per_second": 58.06, "eval_steps_per_second": 0.908, "step": 350 }, { "epoch": 0.49569707401032703, "grad_norm": 1.498512753525891, "learning_rate": 4.260504167945479e-05, "loss": 0.2262, "step": 360 }, { "epoch": 0.5232358003442341, "grad_norm": 1.3585281973815286, "learning_rate": 4.299639327694684e-05, "loss": 0.204, "step": 380 }, { "epoch": 0.5507745266781411, "grad_norm": 1.465810557561199, "learning_rate": 4.336766652213271e-05, "loss": 0.1884, "step": 400 }, { "epoch": 0.5507745266781411, "eval_loss": 0.6828035712242126, "eval_runtime": 28.6351, "eval_samples_per_second": 58.076, "eval_steps_per_second": 0.908, "step": 400 }, { "epoch": 0.5783132530120482, "grad_norm": 1.4456895605154982, "learning_rate": 4.372082150663168e-05, "loss": 0.1778, "step": 420 }, { "epoch": 0.6058519793459552, "grad_norm": 1.2769309375450901, "learning_rate": 4.405754460810312e-05, "loss": 0.1652, "step": 440 }, { "epoch": 0.6196213425129088, "eval_loss": 0.7195386290550232, "eval_runtime": 28.6548, "eval_samples_per_second": 58.036, "eval_steps_per_second": 0.907, "step": 450 }, { "epoch": 0.6333907056798623, "grad_norm": 1.499724674279771, "learning_rate": 4.437929719469291e-05, "loss": 0.1529, "step": 460 }, { "epoch": 0.6609294320137694, "grad_norm": 1.329658442082348, "learning_rate": 4.468735395625979e-05, "loss": 0.1517, "step": 480 }, { "epoch": 0.6884681583476764, "grad_norm": 1.4651796729920221, "learning_rate": 4.498283340560031e-05, "loss": 0.1494, "step": 500 }, { "epoch": 0.6884681583476764, "eval_loss": 0.7042670249938965, "eval_runtime": 28.709, "eval_samples_per_second": 57.926, "eval_steps_per_second": 0.906, "step": 500 }, { "epoch": 0.7160068846815835, "grad_norm": 1.1818360959102638, "learning_rate": 4.526672239391333e-05, "loss": 0.1277, "step": 520 }, { "epoch": 0.7435456110154905, "grad_norm": 1.069536949096091, "learning_rate": 4.553989599704948e-05, "loss": 0.1205, "step": 540 }, { "epoch": 0.7573149741824441, "eval_loss": 0.7115510702133179, "eval_runtime": 28.6768, "eval_samples_per_second": 57.991, "eval_steps_per_second": 0.907, "step": 550 }, { "epoch": 0.7710843373493976, "grad_norm": 1.0335626569454888, "learning_rate": 4.5803133783436676e-05, "loss": 0.1265, "step": 560 }, { "epoch": 0.7986230636833046, "grad_norm": 0.9639495947016691, "learning_rate": 4.605713322604896e-05, "loss": 0.1148, "step": 580 }, { "epoch": 0.8261617900172117, "grad_norm": 1.2178122279779189, "learning_rate": 4.63025208397274e-05, "loss": 0.1105, "step": 600 }, { "epoch": 0.8261617900172117, "eval_loss": 0.7276355028152466, "eval_runtime": 28.6233, "eval_samples_per_second": 58.099, "eval_steps_per_second": 0.908, "step": 600 }, { "epoch": 0.8537005163511188, "grad_norm": 0.9591989006893769, "learning_rate": 4.653986149163757e-05, "loss": 0.1103, "step": 620 }, { "epoch": 0.8812392426850258, "grad_norm": 0.9640633434513526, "learning_rate": 4.676966623306479e-05, "loss": 0.103, "step": 640 }, { "epoch": 0.8950086058519794, "eval_loss": 0.7412395477294922, "eval_runtime": 28.6538, "eval_samples_per_second": 58.038, "eval_steps_per_second": 0.907, "step": 650 }, { "epoch": 0.9087779690189329, "grad_norm": 1.3247181203636382, "learning_rate": 4.6992398925697814e-05, "loss": 0.1002, "step": 660 }, { "epoch": 0.9363166953528399, "grad_norm": 1.0831580794776108, "learning_rate": 4.720848187843727e-05, "loss": 0.0915, "step": 680 }, { "epoch": 0.963855421686747, "grad_norm": 0.8957875356610676, "learning_rate": 4.741830066690428e-05, "loss": 0.0907, "step": 700 }, { "epoch": 0.963855421686747, "eval_loss": 0.7684317827224731, "eval_runtime": 28.5852, "eval_samples_per_second": 58.177, "eval_steps_per_second": 0.91, "step": 700 }, { "epoch": 0.9913941480206541, "grad_norm": 1.015624872082201, "learning_rate": 4.762220827385448e-05, "loss": 0.0905, "step": 720 }, { "epoch": 1.0179001721170395, "grad_norm": 0.8616491119321129, "learning_rate": 4.781074063991376e-05, "loss": 0.0828, "step": 740 }, { "epoch": 1.031669535283993, "eval_loss": 0.7811098098754883, "eval_runtime": 28.6012, "eval_samples_per_second": 58.144, "eval_steps_per_second": 0.909, "step": 750 }, { "epoch": 1.0454388984509466, "grad_norm": 1.0135352103191346, "learning_rate": 4.800402959825802e-05, "loss": 0.0755, "step": 760 }, { "epoch": 1.0729776247848537, "grad_norm": 0.8860613118174453, "learning_rate": 4.819229096120941e-05, "loss": 0.0777, "step": 780 }, { "epoch": 1.1005163511187608, "grad_norm": 0.9329506643292693, "learning_rate": 4.837577965523319e-05, "loss": 0.0735, "step": 800 }, { "epoch": 1.1005163511187608, "eval_loss": 0.7805448770523071, "eval_runtime": 28.5975, "eval_samples_per_second": 58.152, "eval_steps_per_second": 0.909, "step": 800 }, { "epoch": 1.1280550774526679, "grad_norm": 0.77495266305849, "learning_rate": 4.855473169600698e-05, "loss": 0.0696, "step": 820 }, { "epoch": 1.155593803786575, "grad_norm": 0.888813437077165, "learning_rate": 4.8729366013811674e-05, "loss": 0.0685, "step": 840 }, { "epoch": 1.1693631669535285, "eval_loss": 0.7928237318992615, "eval_runtime": 28.6318, "eval_samples_per_second": 58.082, "eval_steps_per_second": 0.908, "step": 850 } ], "logging_steps": 20, "max_steps": 14520, "num_input_tokens_seen": 0, "num_train_epochs": 20, "save_steps": 50, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 9, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 9 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 39763805536256.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }