| { |
| "best_metric": 0.6828035712242126, |
| "best_model_checkpoint": "/data/models/v3.1.2/no-lora/multitask/granite-3.2-8b-instruct-2025-03-30-10-00-45/checkpoint-400", |
| "epoch": 1.1693631669535285, |
| "eval_steps": 50, |
| "global_step": 850, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.027538726333907058, |
| "grad_norm": 2.072109826668444, |
| "learning_rate": 2.1683833261066357e-05, |
| "loss": 1.2781, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.055077452667814115, |
| "grad_norm": 1.8862926260699768, |
| "learning_rate": 2.6700999855466042e-05, |
| "loss": 1.0509, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.06884681583476764, |
| "eval_loss": 1.021646499633789, |
| "eval_runtime": 28.6813, |
| "eval_samples_per_second": 57.982, |
| "eval_steps_per_second": 0.907, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.08261617900172118, |
| "grad_norm": 2.1748080635162124, |
| "learning_rate": 2.963585417306073e-05, |
| "loss": 0.9407, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.11015490533562823, |
| "grad_norm": 1.8974498033546006, |
| "learning_rate": 3.171816644986573e-05, |
| "loss": 0.8109, |
| "step": 80 |
| }, |
| { |
| "epoch": 0.13769363166953527, |
| "grad_norm": 1.7934323218296222, |
| "learning_rate": 3.333333333333334e-05, |
| "loss": 0.7336, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.13769363166953527, |
| "eval_loss": 0.8868263363838196, |
| "eval_runtime": 28.6866, |
| "eval_samples_per_second": 57.971, |
| "eval_steps_per_second": 0.906, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.16523235800344235, |
| "grad_norm": 2.020847367537311, |
| "learning_rate": 3.465302076746041e-05, |
| "loss": 0.6602, |
| "step": 120 |
| }, |
| { |
| "epoch": 0.1927710843373494, |
| "grad_norm": 1.8437951461388182, |
| "learning_rate": 3.5768800594637304e-05, |
| "loss": 0.5891, |
| "step": 140 |
| }, |
| { |
| "epoch": 0.20654044750430292, |
| "eval_loss": 0.8127080202102661, |
| "eval_runtime": 28.6855, |
| "eval_samples_per_second": 57.974, |
| "eval_steps_per_second": 0.906, |
| "step": 150 |
| }, |
| { |
| "epoch": 0.22030981067125646, |
| "grad_norm": 2.1177812508140983, |
| "learning_rate": 3.673533304426541e-05, |
| "loss": 0.5384, |
| "step": 160 |
| }, |
| { |
| "epoch": 0.24784853700516352, |
| "grad_norm": 1.8971916725244924, |
| "learning_rate": 3.75878750850551e-05, |
| "loss": 0.5076, |
| "step": 180 |
| }, |
| { |
| "epoch": 0.27538726333907054, |
| "grad_norm": 1.6483131931913475, |
| "learning_rate": 3.835049992773302e-05, |
| "loss": 0.428, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.27538726333907054, |
| "eval_loss": 0.747828483581543, |
| "eval_runtime": 28.6563, |
| "eval_samples_per_second": 58.033, |
| "eval_steps_per_second": 0.907, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.3029259896729776, |
| "grad_norm": 1.7094199073127136, |
| "learning_rate": 3.904037801370344e-05, |
| "loss": 0.3992, |
| "step": 220 |
| }, |
| { |
| "epoch": 0.3304647160068847, |
| "grad_norm": 1.6345135884362374, |
| "learning_rate": 3.96701873618601e-05, |
| "loss": 0.3695, |
| "step": 240 |
| }, |
| { |
| "epoch": 0.3442340791738382, |
| "eval_loss": 0.7195882797241211, |
| "eval_runtime": 28.6774, |
| "eval_samples_per_second": 57.99, |
| "eval_steps_per_second": 0.907, |
| "step": 250 |
| }, |
| { |
| "epoch": 0.35800344234079173, |
| "grad_norm": 1.4346580877740036, |
| "learning_rate": 4.024955579951363e-05, |
| "loss": 0.3515, |
| "step": 260 |
| }, |
| { |
| "epoch": 0.3855421686746988, |
| "grad_norm": 1.5309494006780702, |
| "learning_rate": 4.0785967189036986e-05, |
| "loss": 0.2985, |
| "step": 280 |
| }, |
| { |
| "epoch": 0.41308089500860584, |
| "grad_norm": 1.5312633172335828, |
| "learning_rate": 4.1285354245327715e-05, |
| "loss": 0.2835, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.41308089500860584, |
| "eval_loss": 0.6964643001556396, |
| "eval_runtime": 28.6805, |
| "eval_samples_per_second": 57.984, |
| "eval_steps_per_second": 0.907, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.4406196213425129, |
| "grad_norm": 1.5647852629258407, |
| "learning_rate": 4.17524996386651e-05, |
| "loss": 0.2734, |
| "step": 320 |
| }, |
| { |
| "epoch": 0.46815834767641995, |
| "grad_norm": 1.5340790131657163, |
| "learning_rate": 4.219131528403759e-05, |
| "loss": 0.2411, |
| "step": 340 |
| }, |
| { |
| "epoch": 0.4819277108433735, |
| "eval_loss": 0.6934902667999268, |
| "eval_runtime": 28.6427, |
| "eval_samples_per_second": 58.06, |
| "eval_steps_per_second": 0.908, |
| "step": 350 |
| }, |
| { |
| "epoch": 0.49569707401032703, |
| "grad_norm": 1.498512753525891, |
| "learning_rate": 4.260504167945479e-05, |
| "loss": 0.2262, |
| "step": 360 |
| }, |
| { |
| "epoch": 0.5232358003442341, |
| "grad_norm": 1.3585281973815286, |
| "learning_rate": 4.299639327694684e-05, |
| "loss": 0.204, |
| "step": 380 |
| }, |
| { |
| "epoch": 0.5507745266781411, |
| "grad_norm": 1.465810557561199, |
| "learning_rate": 4.336766652213271e-05, |
| "loss": 0.1884, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.5507745266781411, |
| "eval_loss": 0.6828035712242126, |
| "eval_runtime": 28.6351, |
| "eval_samples_per_second": 58.076, |
| "eval_steps_per_second": 0.908, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.5783132530120482, |
| "grad_norm": 1.4456895605154982, |
| "learning_rate": 4.372082150663168e-05, |
| "loss": 0.1778, |
| "step": 420 |
| }, |
| { |
| "epoch": 0.6058519793459552, |
| "grad_norm": 1.2769309375450901, |
| "learning_rate": 4.405754460810312e-05, |
| "loss": 0.1652, |
| "step": 440 |
| }, |
| { |
| "epoch": 0.6196213425129088, |
| "eval_loss": 0.7195386290550232, |
| "eval_runtime": 28.6548, |
| "eval_samples_per_second": 58.036, |
| "eval_steps_per_second": 0.907, |
| "step": 450 |
| }, |
| { |
| "epoch": 0.6333907056798623, |
| "grad_norm": 1.499724674279771, |
| "learning_rate": 4.437929719469291e-05, |
| "loss": 0.1529, |
| "step": 460 |
| }, |
| { |
| "epoch": 0.6609294320137694, |
| "grad_norm": 1.329658442082348, |
| "learning_rate": 4.468735395625979e-05, |
| "loss": 0.1517, |
| "step": 480 |
| }, |
| { |
| "epoch": 0.6884681583476764, |
| "grad_norm": 1.4651796729920221, |
| "learning_rate": 4.498283340560031e-05, |
| "loss": 0.1494, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.6884681583476764, |
| "eval_loss": 0.7042670249938965, |
| "eval_runtime": 28.709, |
| "eval_samples_per_second": 57.926, |
| "eval_steps_per_second": 0.906, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.7160068846815835, |
| "grad_norm": 1.1818360959102638, |
| "learning_rate": 4.526672239391333e-05, |
| "loss": 0.1277, |
| "step": 520 |
| }, |
| { |
| "epoch": 0.7435456110154905, |
| "grad_norm": 1.069536949096091, |
| "learning_rate": 4.553989599704948e-05, |
| "loss": 0.1205, |
| "step": 540 |
| }, |
| { |
| "epoch": 0.7573149741824441, |
| "eval_loss": 0.7115510702133179, |
| "eval_runtime": 28.6768, |
| "eval_samples_per_second": 57.991, |
| "eval_steps_per_second": 0.907, |
| "step": 550 |
| }, |
| { |
| "epoch": 0.7710843373493976, |
| "grad_norm": 1.0335626569454888, |
| "learning_rate": 4.5803133783436676e-05, |
| "loss": 0.1265, |
| "step": 560 |
| }, |
| { |
| "epoch": 0.7986230636833046, |
| "grad_norm": 0.9639495947016691, |
| "learning_rate": 4.605713322604896e-05, |
| "loss": 0.1148, |
| "step": 580 |
| }, |
| { |
| "epoch": 0.8261617900172117, |
| "grad_norm": 1.2178122279779189, |
| "learning_rate": 4.63025208397274e-05, |
| "loss": 0.1105, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.8261617900172117, |
| "eval_loss": 0.7276355028152466, |
| "eval_runtime": 28.6233, |
| "eval_samples_per_second": 58.099, |
| "eval_steps_per_second": 0.908, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.8537005163511188, |
| "grad_norm": 0.9591989006893769, |
| "learning_rate": 4.653986149163757e-05, |
| "loss": 0.1103, |
| "step": 620 |
| }, |
| { |
| "epoch": 0.8812392426850258, |
| "grad_norm": 0.9640633434513526, |
| "learning_rate": 4.676966623306479e-05, |
| "loss": 0.103, |
| "step": 640 |
| }, |
| { |
| "epoch": 0.8950086058519794, |
| "eval_loss": 0.7412395477294922, |
| "eval_runtime": 28.6538, |
| "eval_samples_per_second": 58.038, |
| "eval_steps_per_second": 0.907, |
| "step": 650 |
| }, |
| { |
| "epoch": 0.9087779690189329, |
| "grad_norm": 1.3247181203636382, |
| "learning_rate": 4.6992398925697814e-05, |
| "loss": 0.1002, |
| "step": 660 |
| }, |
| { |
| "epoch": 0.9363166953528399, |
| "grad_norm": 1.0831580794776108, |
| "learning_rate": 4.720848187843727e-05, |
| "loss": 0.0915, |
| "step": 680 |
| }, |
| { |
| "epoch": 0.963855421686747, |
| "grad_norm": 0.8957875356610676, |
| "learning_rate": 4.741830066690428e-05, |
| "loss": 0.0907, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.963855421686747, |
| "eval_loss": 0.7684317827224731, |
| "eval_runtime": 28.5852, |
| "eval_samples_per_second": 58.177, |
| "eval_steps_per_second": 0.91, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.9913941480206541, |
| "grad_norm": 1.015624872082201, |
| "learning_rate": 4.762220827385448e-05, |
| "loss": 0.0905, |
| "step": 720 |
| }, |
| { |
| "epoch": 1.0179001721170395, |
| "grad_norm": 0.8616491119321129, |
| "learning_rate": 4.781074063991376e-05, |
| "loss": 0.0828, |
| "step": 740 |
| }, |
| { |
| "epoch": 1.031669535283993, |
| "eval_loss": 0.7811098098754883, |
| "eval_runtime": 28.6012, |
| "eval_samples_per_second": 58.144, |
| "eval_steps_per_second": 0.909, |
| "step": 750 |
| }, |
| { |
| "epoch": 1.0454388984509466, |
| "grad_norm": 1.0135352103191346, |
| "learning_rate": 4.800402959825802e-05, |
| "loss": 0.0755, |
| "step": 760 |
| }, |
| { |
| "epoch": 1.0729776247848537, |
| "grad_norm": 0.8860613118174453, |
| "learning_rate": 4.819229096120941e-05, |
| "loss": 0.0777, |
| "step": 780 |
| }, |
| { |
| "epoch": 1.1005163511187608, |
| "grad_norm": 0.9329506643292693, |
| "learning_rate": 4.837577965523319e-05, |
| "loss": 0.0735, |
| "step": 800 |
| }, |
| { |
| "epoch": 1.1005163511187608, |
| "eval_loss": 0.7805448770523071, |
| "eval_runtime": 28.5975, |
| "eval_samples_per_second": 58.152, |
| "eval_steps_per_second": 0.909, |
| "step": 800 |
| }, |
| { |
| "epoch": 1.1280550774526679, |
| "grad_norm": 0.77495266305849, |
| "learning_rate": 4.855473169600698e-05, |
| "loss": 0.0696, |
| "step": 820 |
| }, |
| { |
| "epoch": 1.155593803786575, |
| "grad_norm": 0.888813437077165, |
| "learning_rate": 4.8729366013811674e-05, |
| "loss": 0.0685, |
| "step": 840 |
| }, |
| { |
| "epoch": 1.1693631669535285, |
| "eval_loss": 0.7928237318992615, |
| "eval_runtime": 28.6318, |
| "eval_samples_per_second": 58.082, |
| "eval_steps_per_second": 0.908, |
| "step": 850 |
| } |
| ], |
| "logging_steps": 20, |
| "max_steps": 14520, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 20, |
| "save_steps": 50, |
| "stateful_callbacks": { |
| "EarlyStoppingCallback": { |
| "args": { |
| "early_stopping_patience": 9, |
| "early_stopping_threshold": 0.0 |
| }, |
| "attributes": { |
| "early_stopping_patience_counter": 9 |
| } |
| }, |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 39763805536256.0, |
| "train_batch_size": 1, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|