sac-llm-ft-multitask / trainer_state.json
drugilsberg's picture
Upload folder using huggingface_hub
a2b784e verified
Raw
History Blame Contribute Delete
12 kB
{
"best_metric": 0.6828035712242126,
"best_model_checkpoint": "/data/models/v3.1.2/no-lora/multitask/granite-3.2-8b-instruct-2025-03-30-10-00-45/checkpoint-400",
"epoch": 1.1693631669535285,
"eval_steps": 50,
"global_step": 850,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.027538726333907058,
"grad_norm": 2.072109826668444,
"learning_rate": 2.1683833261066357e-05,
"loss": 1.2781,
"step": 20
},
{
"epoch": 0.055077452667814115,
"grad_norm": 1.8862926260699768,
"learning_rate": 2.6700999855466042e-05,
"loss": 1.0509,
"step": 40
},
{
"epoch": 0.06884681583476764,
"eval_loss": 1.021646499633789,
"eval_runtime": 28.6813,
"eval_samples_per_second": 57.982,
"eval_steps_per_second": 0.907,
"step": 50
},
{
"epoch": 0.08261617900172118,
"grad_norm": 2.1748080635162124,
"learning_rate": 2.963585417306073e-05,
"loss": 0.9407,
"step": 60
},
{
"epoch": 0.11015490533562823,
"grad_norm": 1.8974498033546006,
"learning_rate": 3.171816644986573e-05,
"loss": 0.8109,
"step": 80
},
{
"epoch": 0.13769363166953527,
"grad_norm": 1.7934323218296222,
"learning_rate": 3.333333333333334e-05,
"loss": 0.7336,
"step": 100
},
{
"epoch": 0.13769363166953527,
"eval_loss": 0.8868263363838196,
"eval_runtime": 28.6866,
"eval_samples_per_second": 57.971,
"eval_steps_per_second": 0.906,
"step": 100
},
{
"epoch": 0.16523235800344235,
"grad_norm": 2.020847367537311,
"learning_rate": 3.465302076746041e-05,
"loss": 0.6602,
"step": 120
},
{
"epoch": 0.1927710843373494,
"grad_norm": 1.8437951461388182,
"learning_rate": 3.5768800594637304e-05,
"loss": 0.5891,
"step": 140
},
{
"epoch": 0.20654044750430292,
"eval_loss": 0.8127080202102661,
"eval_runtime": 28.6855,
"eval_samples_per_second": 57.974,
"eval_steps_per_second": 0.906,
"step": 150
},
{
"epoch": 0.22030981067125646,
"grad_norm": 2.1177812508140983,
"learning_rate": 3.673533304426541e-05,
"loss": 0.5384,
"step": 160
},
{
"epoch": 0.24784853700516352,
"grad_norm": 1.8971916725244924,
"learning_rate": 3.75878750850551e-05,
"loss": 0.5076,
"step": 180
},
{
"epoch": 0.27538726333907054,
"grad_norm": 1.6483131931913475,
"learning_rate": 3.835049992773302e-05,
"loss": 0.428,
"step": 200
},
{
"epoch": 0.27538726333907054,
"eval_loss": 0.747828483581543,
"eval_runtime": 28.6563,
"eval_samples_per_second": 58.033,
"eval_steps_per_second": 0.907,
"step": 200
},
{
"epoch": 0.3029259896729776,
"grad_norm": 1.7094199073127136,
"learning_rate": 3.904037801370344e-05,
"loss": 0.3992,
"step": 220
},
{
"epoch": 0.3304647160068847,
"grad_norm": 1.6345135884362374,
"learning_rate": 3.96701873618601e-05,
"loss": 0.3695,
"step": 240
},
{
"epoch": 0.3442340791738382,
"eval_loss": 0.7195882797241211,
"eval_runtime": 28.6774,
"eval_samples_per_second": 57.99,
"eval_steps_per_second": 0.907,
"step": 250
},
{
"epoch": 0.35800344234079173,
"grad_norm": 1.4346580877740036,
"learning_rate": 4.024955579951363e-05,
"loss": 0.3515,
"step": 260
},
{
"epoch": 0.3855421686746988,
"grad_norm": 1.5309494006780702,
"learning_rate": 4.0785967189036986e-05,
"loss": 0.2985,
"step": 280
},
{
"epoch": 0.41308089500860584,
"grad_norm": 1.5312633172335828,
"learning_rate": 4.1285354245327715e-05,
"loss": 0.2835,
"step": 300
},
{
"epoch": 0.41308089500860584,
"eval_loss": 0.6964643001556396,
"eval_runtime": 28.6805,
"eval_samples_per_second": 57.984,
"eval_steps_per_second": 0.907,
"step": 300
},
{
"epoch": 0.4406196213425129,
"grad_norm": 1.5647852629258407,
"learning_rate": 4.17524996386651e-05,
"loss": 0.2734,
"step": 320
},
{
"epoch": 0.46815834767641995,
"grad_norm": 1.5340790131657163,
"learning_rate": 4.219131528403759e-05,
"loss": 0.2411,
"step": 340
},
{
"epoch": 0.4819277108433735,
"eval_loss": 0.6934902667999268,
"eval_runtime": 28.6427,
"eval_samples_per_second": 58.06,
"eval_steps_per_second": 0.908,
"step": 350
},
{
"epoch": 0.49569707401032703,
"grad_norm": 1.498512753525891,
"learning_rate": 4.260504167945479e-05,
"loss": 0.2262,
"step": 360
},
{
"epoch": 0.5232358003442341,
"grad_norm": 1.3585281973815286,
"learning_rate": 4.299639327694684e-05,
"loss": 0.204,
"step": 380
},
{
"epoch": 0.5507745266781411,
"grad_norm": 1.465810557561199,
"learning_rate": 4.336766652213271e-05,
"loss": 0.1884,
"step": 400
},
{
"epoch": 0.5507745266781411,
"eval_loss": 0.6828035712242126,
"eval_runtime": 28.6351,
"eval_samples_per_second": 58.076,
"eval_steps_per_second": 0.908,
"step": 400
},
{
"epoch": 0.5783132530120482,
"grad_norm": 1.4456895605154982,
"learning_rate": 4.372082150663168e-05,
"loss": 0.1778,
"step": 420
},
{
"epoch": 0.6058519793459552,
"grad_norm": 1.2769309375450901,
"learning_rate": 4.405754460810312e-05,
"loss": 0.1652,
"step": 440
},
{
"epoch": 0.6196213425129088,
"eval_loss": 0.7195386290550232,
"eval_runtime": 28.6548,
"eval_samples_per_second": 58.036,
"eval_steps_per_second": 0.907,
"step": 450
},
{
"epoch": 0.6333907056798623,
"grad_norm": 1.499724674279771,
"learning_rate": 4.437929719469291e-05,
"loss": 0.1529,
"step": 460
},
{
"epoch": 0.6609294320137694,
"grad_norm": 1.329658442082348,
"learning_rate": 4.468735395625979e-05,
"loss": 0.1517,
"step": 480
},
{
"epoch": 0.6884681583476764,
"grad_norm": 1.4651796729920221,
"learning_rate": 4.498283340560031e-05,
"loss": 0.1494,
"step": 500
},
{
"epoch": 0.6884681583476764,
"eval_loss": 0.7042670249938965,
"eval_runtime": 28.709,
"eval_samples_per_second": 57.926,
"eval_steps_per_second": 0.906,
"step": 500
},
{
"epoch": 0.7160068846815835,
"grad_norm": 1.1818360959102638,
"learning_rate": 4.526672239391333e-05,
"loss": 0.1277,
"step": 520
},
{
"epoch": 0.7435456110154905,
"grad_norm": 1.069536949096091,
"learning_rate": 4.553989599704948e-05,
"loss": 0.1205,
"step": 540
},
{
"epoch": 0.7573149741824441,
"eval_loss": 0.7115510702133179,
"eval_runtime": 28.6768,
"eval_samples_per_second": 57.991,
"eval_steps_per_second": 0.907,
"step": 550
},
{
"epoch": 0.7710843373493976,
"grad_norm": 1.0335626569454888,
"learning_rate": 4.5803133783436676e-05,
"loss": 0.1265,
"step": 560
},
{
"epoch": 0.7986230636833046,
"grad_norm": 0.9639495947016691,
"learning_rate": 4.605713322604896e-05,
"loss": 0.1148,
"step": 580
},
{
"epoch": 0.8261617900172117,
"grad_norm": 1.2178122279779189,
"learning_rate": 4.63025208397274e-05,
"loss": 0.1105,
"step": 600
},
{
"epoch": 0.8261617900172117,
"eval_loss": 0.7276355028152466,
"eval_runtime": 28.6233,
"eval_samples_per_second": 58.099,
"eval_steps_per_second": 0.908,
"step": 600
},
{
"epoch": 0.8537005163511188,
"grad_norm": 0.9591989006893769,
"learning_rate": 4.653986149163757e-05,
"loss": 0.1103,
"step": 620
},
{
"epoch": 0.8812392426850258,
"grad_norm": 0.9640633434513526,
"learning_rate": 4.676966623306479e-05,
"loss": 0.103,
"step": 640
},
{
"epoch": 0.8950086058519794,
"eval_loss": 0.7412395477294922,
"eval_runtime": 28.6538,
"eval_samples_per_second": 58.038,
"eval_steps_per_second": 0.907,
"step": 650
},
{
"epoch": 0.9087779690189329,
"grad_norm": 1.3247181203636382,
"learning_rate": 4.6992398925697814e-05,
"loss": 0.1002,
"step": 660
},
{
"epoch": 0.9363166953528399,
"grad_norm": 1.0831580794776108,
"learning_rate": 4.720848187843727e-05,
"loss": 0.0915,
"step": 680
},
{
"epoch": 0.963855421686747,
"grad_norm": 0.8957875356610676,
"learning_rate": 4.741830066690428e-05,
"loss": 0.0907,
"step": 700
},
{
"epoch": 0.963855421686747,
"eval_loss": 0.7684317827224731,
"eval_runtime": 28.5852,
"eval_samples_per_second": 58.177,
"eval_steps_per_second": 0.91,
"step": 700
},
{
"epoch": 0.9913941480206541,
"grad_norm": 1.015624872082201,
"learning_rate": 4.762220827385448e-05,
"loss": 0.0905,
"step": 720
},
{
"epoch": 1.0179001721170395,
"grad_norm": 0.8616491119321129,
"learning_rate": 4.781074063991376e-05,
"loss": 0.0828,
"step": 740
},
{
"epoch": 1.031669535283993,
"eval_loss": 0.7811098098754883,
"eval_runtime": 28.6012,
"eval_samples_per_second": 58.144,
"eval_steps_per_second": 0.909,
"step": 750
},
{
"epoch": 1.0454388984509466,
"grad_norm": 1.0135352103191346,
"learning_rate": 4.800402959825802e-05,
"loss": 0.0755,
"step": 760
},
{
"epoch": 1.0729776247848537,
"grad_norm": 0.8860613118174453,
"learning_rate": 4.819229096120941e-05,
"loss": 0.0777,
"step": 780
},
{
"epoch": 1.1005163511187608,
"grad_norm": 0.9329506643292693,
"learning_rate": 4.837577965523319e-05,
"loss": 0.0735,
"step": 800
},
{
"epoch": 1.1005163511187608,
"eval_loss": 0.7805448770523071,
"eval_runtime": 28.5975,
"eval_samples_per_second": 58.152,
"eval_steps_per_second": 0.909,
"step": 800
},
{
"epoch": 1.1280550774526679,
"grad_norm": 0.77495266305849,
"learning_rate": 4.855473169600698e-05,
"loss": 0.0696,
"step": 820
},
{
"epoch": 1.155593803786575,
"grad_norm": 0.888813437077165,
"learning_rate": 4.8729366013811674e-05,
"loss": 0.0685,
"step": 840
},
{
"epoch": 1.1693631669535285,
"eval_loss": 0.7928237318992615,
"eval_runtime": 28.6318,
"eval_samples_per_second": 58.082,
"eval_steps_per_second": 0.908,
"step": 850
}
],
"logging_steps": 20,
"max_steps": 14520,
"num_input_tokens_seen": 0,
"num_train_epochs": 20,
"save_steps": 50,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 9,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 9
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 39763805536256.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}