adaption_diverse_ai_task_samples / trainer_state.json
MM-AdaptionLabs's picture
Add 12 files
cf23ec4 verified
Raw
History Blame Contribute Delete
17.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 4.0,
"eval_steps": 20,
"global_step": 100,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.04,
"grad_norm": 0.4760715663433075,
"learning_rate": 0.0,
"loss": 1.4658,
"step": 1
},
{
"epoch": 0.08,
"grad_norm": 0.5013044476509094,
"learning_rate": 8.000000000000001e-06,
"loss": 1.4224,
"step": 2
},
{
"epoch": 0.12,
"grad_norm": 0.2839778661727905,
"learning_rate": 1.6000000000000003e-05,
"loss": 1.125,
"step": 3
},
{
"epoch": 0.16,
"grad_norm": 0.33960863947868347,
"learning_rate": 2.4e-05,
"loss": 1.238,
"step": 4
},
{
"epoch": 0.2,
"grad_norm": 0.416923850774765,
"learning_rate": 3.2000000000000005e-05,
"loss": 1.2939,
"step": 5
},
{
"epoch": 0.24,
"grad_norm": 0.5548073649406433,
"learning_rate": 4e-05,
"loss": 1.4395,
"step": 6
},
{
"epoch": 0.28,
"grad_norm": 0.7273683547973633,
"learning_rate": 3.999015863213667e-05,
"loss": 1.5093,
"step": 7
},
{
"epoch": 0.32,
"grad_norm": 0.5051376223564148,
"learning_rate": 3.996064528993794e-05,
"loss": 1.1609,
"step": 8
},
{
"epoch": 0.36,
"grad_norm": 0.49626877903938293,
"learning_rate": 3.9911492245810205e-05,
"loss": 1.3969,
"step": 9
},
{
"epoch": 0.4,
"grad_norm": 0.42138198018074036,
"learning_rate": 3.9842753247885556e-05,
"loss": 1.1953,
"step": 10
},
{
"epoch": 0.44,
"grad_norm": 0.5137280821800232,
"learning_rate": 3.975450346124901e-05,
"loss": 1.3467,
"step": 11
},
{
"epoch": 0.48,
"grad_norm": 0.2119121551513672,
"learning_rate": 3.964683938574657e-05,
"loss": 0.811,
"step": 12
},
{
"epoch": 0.52,
"grad_norm": 0.28574588894844055,
"learning_rate": 3.9519878750464104e-05,
"loss": 1.1553,
"step": 13
},
{
"epoch": 0.56,
"grad_norm": 0.3548891842365265,
"learning_rate": 3.937376038499228e-05,
"loss": 1.1643,
"step": 14
},
{
"epoch": 0.6,
"grad_norm": 0.32107675075531006,
"learning_rate": 3.920864406761844e-05,
"loss": 1.186,
"step": 15
},
{
"epoch": 0.64,
"grad_norm": 0.4450090527534485,
"learning_rate": 3.9024710350611426e-05,
"loss": 1.297,
"step": 16
},
{
"epoch": 0.68,
"grad_norm": 0.3887384235858917,
"learning_rate": 3.88221603627903e-05,
"loss": 1.2583,
"step": 17
},
{
"epoch": 0.72,
"grad_norm": 0.2024194747209549,
"learning_rate": 3.860121558959293e-05,
"loss": 1.1979,
"step": 18
},
{
"epoch": 0.76,
"grad_norm": 0.164462149143219,
"learning_rate": 3.836211763088493e-05,
"loss": 1.0645,
"step": 19
},
{
"epoch": 0.8,
"grad_norm": 0.07839324325323105,
"learning_rate": 3.8105127936773746e-05,
"loss": 0.7288,
"step": 20
},
{
"epoch": 0.8,
"eval_loss": 0.855224609375,
"eval_runtime": 2.1713,
"eval_samples_per_second": 2.303,
"eval_steps_per_second": 0.461,
"step": 20
},
{
"epoch": 0.84,
"grad_norm": 0.13838034868240356,
"learning_rate": 3.78305275217168e-05,
"loss": 1.1664,
"step": 21
},
{
"epoch": 0.88,
"grad_norm": 0.20036262273788452,
"learning_rate": 3.7538616657236334e-05,
"loss": 1.2454,
"step": 22
},
{
"epoch": 0.92,
"grad_norm": 0.08870978653430939,
"learning_rate": 3.722971454357684e-05,
"loss": 0.9868,
"step": 23
},
{
"epoch": 0.96,
"grad_norm": 0.08468154072761536,
"learning_rate": 3.6904158960664365e-05,
"loss": 1.0046,
"step": 24
},
{
"epoch": 1.0,
"grad_norm": 0.1123848706483841,
"learning_rate": 3.656230589874905e-05,
"loss": 1.1274,
"step": 25
},
{
"epoch": 1.04,
"grad_norm": 0.11019331961870193,
"learning_rate": 3.6204529169135086e-05,
"loss": 1.156,
"step": 26
},
{
"epoch": 1.08,
"grad_norm": 0.10665232688188553,
"learning_rate": 3.5831219995423466e-05,
"loss": 1.1367,
"step": 27
},
{
"epoch": 1.12,
"grad_norm": 0.08694541454315186,
"learning_rate": 3.544278658571477e-05,
"loss": 0.9375,
"step": 28
},
{
"epoch": 1.16,
"grad_norm": 0.0901435911655426,
"learning_rate": 3.5039653686239606e-05,
"loss": 1.0381,
"step": 29
},
{
"epoch": 1.2,
"grad_norm": 0.09067416191101074,
"learning_rate": 3.4622262116904795e-05,
"loss": 1.0396,
"step": 30
},
{
"epoch": 1.24,
"grad_norm": 0.09607220441102982,
"learning_rate": 3.419106828926334e-05,
"loss": 1.1133,
"step": 31
},
{
"epoch": 1.28,
"grad_norm": 0.09983466565608978,
"learning_rate": 3.374654370743504e-05,
"loss": 1.1624,
"step": 32
},
{
"epoch": 1.32,
"grad_norm": 0.08482648432254791,
"learning_rate": 3.328917445252367e-05,
"loss": 0.9143,
"step": 33
},
{
"epoch": 1.3599999999999999,
"grad_norm": 0.10168825834989548,
"learning_rate": 3.281946065109445e-05,
"loss": 1.1602,
"step": 34
},
{
"epoch": 1.4,
"grad_norm": 0.08425932377576828,
"learning_rate": 3.233791592829299e-05,
"loss": 1.0061,
"step": 35
},
{
"epoch": 1.44,
"grad_norm": 0.09837682545185089,
"learning_rate": 3.1845066846203686e-05,
"loss": 1.1282,
"step": 36
},
{
"epoch": 1.48,
"grad_norm": 0.05306907743215561,
"learning_rate": 3.134145232806188e-05,
"loss": 0.7241,
"step": 37
},
{
"epoch": 1.52,
"grad_norm": 0.08243704587221146,
"learning_rate": 3.082762306894915e-05,
"loss": 1.0229,
"step": 38
},
{
"epoch": 1.56,
"grad_norm": 0.07551784068346024,
"learning_rate": 3.0304140933616387e-05,
"loss": 1.0286,
"step": 39
},
{
"epoch": 1.6,
"grad_norm": 0.08548041433095932,
"learning_rate": 2.977157834209287e-05,
"loss": 1.0471,
"step": 40
},
{
"epoch": 1.6,
"eval_loss": 0.798828125,
"eval_runtime": 2.202,
"eval_samples_per_second": 2.271,
"eval_steps_per_second": 0.454,
"step": 40
},
{
"epoch": 1.6400000000000001,
"grad_norm": 0.08860009163618088,
"learning_rate": 2.9230517643753457e-05,
"loss": 1.1273,
"step": 41
},
{
"epoch": 1.6800000000000002,
"grad_norm": 0.09040582180023193,
"learning_rate": 2.8681550480527974e-05,
"loss": 1.1182,
"step": 42
},
{
"epoch": 1.72,
"grad_norm": 0.07563644647598267,
"learning_rate": 2.812527713994958e-05,
"loss": 1.0964,
"step": 43
},
{
"epoch": 1.76,
"grad_norm": 0.07461907714605331,
"learning_rate": 2.7562305898749054e-05,
"loss": 0.9688,
"step": 44
},
{
"epoch": 1.8,
"grad_norm": 0.04516046494245529,
"learning_rate": 2.6993252357713205e-05,
"loss": 0.6775,
"step": 45
},
{
"epoch": 1.8399999999999999,
"grad_norm": 0.07931992411613464,
"learning_rate": 2.6418738768534388e-05,
"loss": 1.0747,
"step": 46
},
{
"epoch": 1.88,
"grad_norm": 0.09479013085365295,
"learning_rate": 2.5839393353387444e-05,
"loss": 1.1385,
"step": 47
},
{
"epoch": 1.92,
"grad_norm": 0.057173825800418854,
"learning_rate": 2.5255849617977983e-05,
"loss": 0.9226,
"step": 48
},
{
"epoch": 1.96,
"grad_norm": 0.059427376836538315,
"learning_rate": 2.4668745658813156e-05,
"loss": 0.9497,
"step": 49
},
{
"epoch": 2.0,
"grad_norm": 0.07764241099357605,
"learning_rate": 2.4078723465452556e-05,
"loss": 1.0436,
"step": 50
},
{
"epoch": 2.04,
"grad_norm": 0.07360248267650604,
"learning_rate": 2.3486428218501987e-05,
"loss": 1.0789,
"step": 51
},
{
"epoch": 2.08,
"grad_norm": 0.07298833131790161,
"learning_rate": 2.2892507584118004e-05,
"loss": 1.0659,
"step": 52
},
{
"epoch": 2.12,
"grad_norm": 0.05753123015165329,
"learning_rate": 2.2297611005794456e-05,
"loss": 0.8865,
"step": 53
},
{
"epoch": 2.16,
"grad_norm": 0.06963388621807098,
"learning_rate": 2.170238899420555e-05,
"loss": 0.9897,
"step": 54
},
{
"epoch": 2.2,
"grad_norm": 0.07072041928768158,
"learning_rate": 2.1107492415882002e-05,
"loss": 0.9912,
"step": 55
},
{
"epoch": 2.24,
"grad_norm": 0.07816724479198456,
"learning_rate": 2.0513571781498022e-05,
"loss": 1.0527,
"step": 56
},
{
"epoch": 2.2800000000000002,
"grad_norm": 0.0970468819141388,
"learning_rate": 1.9921276534547453e-05,
"loss": 1.1062,
"step": 57
},
{
"epoch": 2.32,
"grad_norm": 0.07797855883836746,
"learning_rate": 1.9331254341186843e-05,
"loss": 0.8679,
"step": 58
},
{
"epoch": 2.36,
"grad_norm": 0.08266980946063995,
"learning_rate": 1.874415038202203e-05,
"loss": 1.1044,
"step": 59
},
{
"epoch": 2.4,
"grad_norm": 0.06626752018928528,
"learning_rate": 1.816060664661256e-05,
"loss": 0.9661,
"step": 60
},
{
"epoch": 2.4,
"eval_loss": 0.77880859375,
"eval_runtime": 2.2199,
"eval_samples_per_second": 2.252,
"eval_steps_per_second": 0.45,
"step": 60
},
{
"epoch": 2.44,
"grad_norm": 0.08102354407310486,
"learning_rate": 1.7581261231465618e-05,
"loss": 1.0759,
"step": 61
},
{
"epoch": 2.48,
"grad_norm": 0.054694049060344696,
"learning_rate": 1.70067476422868e-05,
"loss": 0.7046,
"step": 62
},
{
"epoch": 2.52,
"grad_norm": 0.07155449688434601,
"learning_rate": 1.643769410125095e-05,
"loss": 0.9838,
"step": 63
},
{
"epoch": 2.56,
"grad_norm": 0.06532476842403412,
"learning_rate": 1.5874722860050423e-05,
"loss": 0.994,
"step": 64
},
{
"epoch": 2.6,
"grad_norm": 0.07697983086109161,
"learning_rate": 1.5318449519472025e-05,
"loss": 1.0082,
"step": 65
},
{
"epoch": 2.64,
"grad_norm": 0.08935107290744781,
"learning_rate": 1.4769482356246556e-05,
"loss": 1.0865,
"step": 66
},
{
"epoch": 2.68,
"grad_norm": 0.0887816920876503,
"learning_rate": 1.422842165790713e-05,
"loss": 1.0815,
"step": 67
},
{
"epoch": 2.7199999999999998,
"grad_norm": 0.07478179782629013,
"learning_rate": 1.3695859066383624e-05,
"loss": 1.0665,
"step": 68
},
{
"epoch": 2.76,
"grad_norm": 0.07210303097963333,
"learning_rate": 1.317237693105086e-05,
"loss": 0.9429,
"step": 69
},
{
"epoch": 2.8,
"grad_norm": 0.044374942779541016,
"learning_rate": 1.2658547671938135e-05,
"loss": 0.6628,
"step": 70
},
{
"epoch": 2.84,
"grad_norm": 0.07966240495443344,
"learning_rate": 1.2154933153796323e-05,
"loss": 1.0466,
"step": 71
},
{
"epoch": 2.88,
"grad_norm": 0.0976930782198906,
"learning_rate": 1.1662084071707018e-05,
"loss": 1.1078,
"step": 72
},
{
"epoch": 2.92,
"grad_norm": 0.05639340355992317,
"learning_rate": 1.118053934890555e-05,
"loss": 0.9038,
"step": 73
},
{
"epoch": 2.96,
"grad_norm": 0.06098003685474396,
"learning_rate": 1.0710825547476333e-05,
"loss": 0.9326,
"step": 74
},
{
"epoch": 3.0,
"grad_norm": 0.07597635686397552,
"learning_rate": 1.0253456292564965e-05,
"loss": 1.0192,
"step": 75
},
{
"epoch": 3.04,
"grad_norm": 0.07052882015705109,
"learning_rate": 9.808931710736666e-06,
"loss": 1.0579,
"step": 76
},
{
"epoch": 3.08,
"grad_norm": 0.07034008204936981,
"learning_rate": 9.377737883095207e-06,
"loss": 1.0454,
"step": 77
},
{
"epoch": 3.12,
"grad_norm": 0.05514257028698921,
"learning_rate": 8.9603463137604e-06,
"loss": 0.873,
"step": 78
},
{
"epoch": 3.16,
"grad_norm": 0.06549564749002457,
"learning_rate": 8.557213414285236e-06,
"loss": 0.9741,
"step": 79
},
{
"epoch": 3.2,
"grad_norm": 0.07224049419164658,
"learning_rate": 8.168780004576542e-06,
"loss": 0.9753,
"step": 80
},
{
"epoch": 3.2,
"eval_loss": 0.771484375,
"eval_runtime": 2.2033,
"eval_samples_per_second": 2.269,
"eval_steps_per_second": 0.454,
"step": 80
},
{
"epoch": 3.24,
"grad_norm": 0.07591705769300461,
"learning_rate": 7.79547083086492e-06,
"loss": 1.0322,
"step": 81
},
{
"epoch": 3.2800000000000002,
"grad_norm": 0.09342397004365921,
"learning_rate": 7.437694101250949e-06,
"loss": 1.0872,
"step": 82
},
{
"epoch": 3.32,
"grad_norm": 0.07288067787885666,
"learning_rate": 7.09584103933564e-06,
"loss": 0.8525,
"step": 83
},
{
"epoch": 3.36,
"grad_norm": 0.07975227385759354,
"learning_rate": 6.7702854564231615e-06,
"loss": 1.0865,
"step": 84
},
{
"epoch": 3.4,
"grad_norm": 0.06429357826709747,
"learning_rate": 6.461383342763671e-06,
"loss": 0.9534,
"step": 85
},
{
"epoch": 3.44,
"grad_norm": 0.08074600249528885,
"learning_rate": 6.169472478283199e-06,
"loss": 1.0605,
"step": 86
},
{
"epoch": 3.48,
"grad_norm": 0.05224496126174927,
"learning_rate": 5.894872063226258e-06,
"loss": 0.696,
"step": 87
},
{
"epoch": 3.52,
"grad_norm": 0.06972762197256088,
"learning_rate": 5.637882369115075e-06,
"loss": 0.9702,
"step": 88
},
{
"epoch": 3.56,
"grad_norm": 0.06537563353776932,
"learning_rate": 5.3987844104070754e-06,
"loss": 0.9809,
"step": 89
},
{
"epoch": 3.6,
"grad_norm": 0.07811121642589569,
"learning_rate": 5.177839637209707e-06,
"loss": 0.9956,
"step": 90
},
{
"epoch": 3.64,
"grad_norm": 0.08834316581487656,
"learning_rate": 4.975289649388577e-06,
"loss": 1.0721,
"step": 91
},
{
"epoch": 3.68,
"grad_norm": 0.08688650280237198,
"learning_rate": 4.791355932381563e-06,
"loss": 1.0693,
"step": 92
},
{
"epoch": 3.7199999999999998,
"grad_norm": 0.0746871680021286,
"learning_rate": 4.626239615007727e-06,
"loss": 1.0565,
"step": 93
},
{
"epoch": 3.76,
"grad_norm": 0.07580739259719849,
"learning_rate": 4.480121249535897e-06,
"loss": 0.9346,
"step": 94
},
{
"epoch": 3.8,
"grad_norm": 0.061057522892951965,
"learning_rate": 4.353160614253432e-06,
"loss": 0.6584,
"step": 95
},
{
"epoch": 3.84,
"grad_norm": 0.08070012927055359,
"learning_rate": 4.245496538750999e-06,
"loss": 1.0371,
"step": 96
},
{
"epoch": 3.88,
"grad_norm": 0.09691870212554932,
"learning_rate": 4.157246752114447e-06,
"loss": 1.0974,
"step": 97
},
{
"epoch": 3.92,
"grad_norm": 0.0571683831512928,
"learning_rate": 4.0885077541897945e-06,
"loss": 0.8972,
"step": 98
},
{
"epoch": 3.96,
"grad_norm": 0.061304960399866104,
"learning_rate": 4.039354710062059e-06,
"loss": 0.9272,
"step": 99
},
{
"epoch": 4.0,
"grad_norm": 0.07660021632909775,
"learning_rate": 4.0098413678633315e-06,
"loss": 1.0127,
"step": 100
},
{
"epoch": 4.0,
"eval_loss": 0.77001953125,
"eval_runtime": 2.1902,
"eval_samples_per_second": 2.283,
"eval_steps_per_second": 0.457,
"step": 100
}
],
"logging_steps": 1.0,
"max_steps": 100,
"num_input_tokens_seen": 0,
"num_train_epochs": 4,
"save_steps": 0,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.1998359434821632e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}