t5gemma-2-4b-netjets-balanced-0p1 / trainer_state.json
Reza2kn's picture
Add final balanced 0.1 epoch checkpoint with resume state
90282e9 verified
Raw
History Blame
19.9 kB
{
"best_global_step": 1000,
"best_metric": 0.18616674840450287,
"best_model_checkpoint": "/workspace/t5gemma_continuation/runs/t5gemma-2-4b-netjets-balanced-0p1/checkpoint-1000",
"epoch": 0.10003237293622531,
"eval_steps": 1000,
"global_step": 2472,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0010116542570411137,
"grad_norm": 0.7588071823120117,
"learning_rate": 9.997674418116759e-06,
"loss": 0.09478737831115723,
"step": 25
},
{
"epoch": 0.0020233085140822274,
"grad_norm": 0.7066558003425598,
"learning_rate": 9.990308418965396e-06,
"loss": 0.08540201187133789,
"step": 50
},
{
"epoch": 0.003034962771123341,
"grad_norm": 0.9437556862831116,
"learning_rate": 9.977905399713323e-06,
"loss": 0.08831601142883301,
"step": 75
},
{
"epoch": 0.004046617028164455,
"grad_norm": 0.6379377245903015,
"learning_rate": 9.96047787947801e-06,
"loss": 0.08719367980957031,
"step": 100
},
{
"epoch": 0.005058271285205568,
"grad_norm": 0.7673565745353699,
"learning_rate": 9.938043448909642e-06,
"loss": 0.08562824249267578,
"step": 125
},
{
"epoch": 0.006069925542246682,
"grad_norm": 0.8915950655937195,
"learning_rate": 9.910624752435825e-06,
"loss": 0.08884576797485351,
"step": 150
},
{
"epoch": 0.007081579799287795,
"grad_norm": 0.9796419739723206,
"learning_rate": 9.87824946540519e-06,
"loss": 0.0844249153137207,
"step": 175
},
{
"epoch": 0.00809323405632891,
"grad_norm": 0.7828882932662964,
"learning_rate": 9.840950266152993e-06,
"loss": 0.08762908935546875,
"step": 200
},
{
"epoch": 0.009104888313370023,
"grad_norm": 0.8314036130905151,
"learning_rate": 9.798764803016892e-06,
"loss": 0.08477160453796387,
"step": 225
},
{
"epoch": 0.010116542570411136,
"grad_norm": 0.9383084177970886,
"learning_rate": 9.7517356563362e-06,
"loss": 0.0796052074432373,
"step": 250
},
{
"epoch": 0.01112819682745225,
"grad_norm": 0.6904627680778503,
"learning_rate": 9.699910295472986e-06,
"loss": 0.08183086395263672,
"step": 275
},
{
"epoch": 0.012139851084493364,
"grad_norm": 0.7161296010017395,
"learning_rate": 9.643341030898358e-06,
"loss": 0.08600561141967773,
"step": 300
},
{
"epoch": 0.013151505341534477,
"grad_norm": 0.7295992374420166,
"learning_rate": 9.582084961392358e-06,
"loss": 0.08031168937683106,
"step": 325
},
{
"epoch": 0.01416315959857559,
"grad_norm": 0.8786855340003967,
"learning_rate": 9.516203916410702e-06,
"loss": 0.07677621841430664,
"step": 350
},
{
"epoch": 0.015174813855616705,
"grad_norm": 0.664604127407074,
"learning_rate": 9.445764393676567e-06,
"loss": 0.08257333755493164,
"step": 375
},
{
"epoch": 0.01618646811265782,
"grad_norm": 0.6612857580184937,
"learning_rate": 9.370837492060428e-06,
"loss": 0.07814112663269043,
"step": 400
},
{
"epoch": 0.01719812236969893,
"grad_norm": 0.6337666511535645,
"learning_rate": 9.291498839815658e-06,
"loss": 0.07912947177886963,
"step": 425
},
{
"epoch": 0.018209776626740046,
"grad_norm": 0.9065153002738953,
"learning_rate": 9.20782851824236e-06,
"loss": 0.08001086235046387,
"step": 450
},
{
"epoch": 0.01922143088378116,
"grad_norm": 0.8778851628303528,
"learning_rate": 9.119910980856477e-06,
"loss": 0.08504880905151367,
"step": 475
},
{
"epoch": 0.020233085140822272,
"grad_norm": 0.8410937786102295,
"learning_rate": 9.027834968145736e-06,
"loss": 0.07751385688781738,
"step": 500
},
{
"epoch": 0.021244739397863387,
"grad_norm": 0.8290925025939941,
"learning_rate": 8.931693417998515e-06,
"loss": 0.08087217330932617,
"step": 525
},
{
"epoch": 0.0222563936549045,
"grad_norm": 0.9300380349159241,
"learning_rate": 8.831583371896011e-06,
"loss": 0.07645512580871582,
"step": 550
},
{
"epoch": 0.023268047911945613,
"grad_norm": 1.0256469249725342,
"learning_rate": 8.727605876962402e-06,
"loss": 0.07920522689819336,
"step": 575
},
{
"epoch": 0.024279702168986728,
"grad_norm": 0.7493225336074829,
"learning_rate": 8.619865883971879e-06,
"loss": 0.07890358448028564,
"step": 600
},
{
"epoch": 0.025291356426027842,
"grad_norm": 1.3388545513153076,
"learning_rate": 8.508472141415468e-06,
"loss": 0.0720207691192627,
"step": 625
},
{
"epoch": 0.026303010683068954,
"grad_norm": 0.8595075011253357,
"learning_rate": 8.393537085734616e-06,
"loss": 0.07741987228393554,
"step": 650
},
{
"epoch": 0.02731466494011007,
"grad_norm": 0.842380940914154,
"learning_rate": 8.275176727832289e-06,
"loss": 0.078358473777771,
"step": 675
},
{
"epoch": 0.02832631919715118,
"grad_norm": 0.6610252261161804,
"learning_rate": 8.153510535976138e-06,
"loss": 0.07246792793273926,
"step": 700
},
{
"epoch": 0.029337973454192295,
"grad_norm": 0.811519205570221,
"learning_rate": 8.028661315211968e-06,
"loss": 0.07699480533599853,
"step": 725
},
{
"epoch": 0.03034962771123341,
"grad_norm": 0.8042305111885071,
"learning_rate": 7.900755083409165e-06,
"loss": 0.07572071552276612,
"step": 750
},
{
"epoch": 0.03136128196827452,
"grad_norm": 1.0434718132019043,
"learning_rate": 7.769920944063244e-06,
"loss": 0.07450762748718262,
"step": 775
},
{
"epoch": 0.03237293622531564,
"grad_norm": 0.7678037285804749,
"learning_rate": 7.636290955983891e-06,
"loss": 0.07479867935180665,
"step": 800
},
{
"epoch": 0.03338459048235675,
"grad_norm": 0.7159585356712341,
"learning_rate": 7.500000000000001e-06,
"loss": 0.06815961360931397,
"step": 825
},
{
"epoch": 0.03439624473939786,
"grad_norm": 0.8384346961975098,
"learning_rate": 7.361185642816315e-06,
"loss": 0.07340707778930664,
"step": 850
},
{
"epoch": 0.03540789899643898,
"grad_norm": 0.8005127310752869,
"learning_rate": 7.219987998159018e-06,
"loss": 0.07145726203918457,
"step": 875
},
{
"epoch": 0.03641955325348009,
"grad_norm": 0.7431536316871643,
"learning_rate": 7.0765495853504875e-06,
"loss": 0.0730298662185669,
"step": 900
},
{
"epoch": 0.0374312075105212,
"grad_norm": 0.8528541922569275,
"learning_rate": 6.931015185455915e-06,
"loss": 0.07038732051849365,
"step": 925
},
{
"epoch": 0.03844286176756232,
"grad_norm": 1.045146107673645,
"learning_rate": 6.7835316951470185e-06,
"loss": 0.07059284210205079,
"step": 950
},
{
"epoch": 0.03945451602460343,
"grad_norm": 0.7227703928947449,
"learning_rate": 6.634247978430359e-06,
"loss": 0.06966906547546386,
"step": 975
},
{
"epoch": 0.040466170281644544,
"grad_norm": 0.8465985655784607,
"learning_rate": 6.483314716389888e-06,
"loss": 0.07425240516662597,
"step": 1000
},
{
"epoch": 0.040466170281644544,
"eval_loss": 0.18616674840450287,
"eval_runtime": 417.5341,
"eval_samples_per_second": 102.76,
"eval_steps_per_second": 3.212,
"step": 1000
},
{
"epoch": 0.04147782453868566,
"grad_norm": 0.9529474377632141,
"learning_rate": 6.330884255095409e-06,
"loss": 0.07227096557617188,
"step": 1025
},
{
"epoch": 0.04248947879572677,
"grad_norm": 0.8593569397926331,
"learning_rate": 6.1771104518304925e-06,
"loss": 0.06962797641754151,
"step": 1050
},
{
"epoch": 0.043501133052767885,
"grad_norm": 1.56771719455719,
"learning_rate": 6.0221485197949995e-06,
"loss": 0.0692414665222168,
"step": 1075
},
{
"epoch": 0.044512787309809,
"grad_norm": 0.9446329474449158,
"learning_rate": 5.866154871439018e-06,
"loss": 0.07052364349365234,
"step": 1100
},
{
"epoch": 0.045524441566850114,
"grad_norm": 0.9508762359619141,
"learning_rate": 5.709286960586318e-06,
"loss": 0.06672035217285156,
"step": 1125
},
{
"epoch": 0.046536095823891226,
"grad_norm": 0.9291703701019287,
"learning_rate": 5.551703123506678e-06,
"loss": 0.07133745193481446,
"step": 1150
},
{
"epoch": 0.047547750080932344,
"grad_norm": 1.0664215087890625,
"learning_rate": 5.393562419097525e-06,
"loss": 0.07111708641052246,
"step": 1175
},
{
"epoch": 0.048559404337973455,
"grad_norm": 0.9802451729774475,
"learning_rate": 5.235024468336154e-06,
"loss": 0.06713025569915772,
"step": 1200
},
{
"epoch": 0.04957105859501457,
"grad_norm": 0.9398006200790405,
"learning_rate": 5.07624929316463e-06,
"loss": 0.06843162536621093,
"step": 1225
},
{
"epoch": 0.050582712852055685,
"grad_norm": 0.8841513991355896,
"learning_rate": 4.917397154969965e-06,
"loss": 0.0674632453918457,
"step": 1250
},
{
"epoch": 0.051594367109096796,
"grad_norm": 0.9453590512275696,
"learning_rate": 4.758628392822602e-06,
"loss": 0.06608812808990479,
"step": 1275
},
{
"epoch": 0.05260602136613791,
"grad_norm": 1.0145738124847412,
"learning_rate": 4.600103261636496e-06,
"loss": 0.0655123233795166,
"step": 1300
},
{
"epoch": 0.053617675623179026,
"grad_norm": 0.8218289613723755,
"learning_rate": 4.441981770414145e-06,
"loss": 0.06619914054870606,
"step": 1325
},
{
"epoch": 0.05462932988022014,
"grad_norm": 0.9566552042961121,
"learning_rate": 4.284423520739811e-06,
"loss": 0.06477892875671387,
"step": 1350
},
{
"epoch": 0.05564098413726125,
"grad_norm": 0.8886809945106506,
"learning_rate": 4.127587545684002e-06,
"loss": 0.06271601676940917,
"step": 1375
},
{
"epoch": 0.05665263839430236,
"grad_norm": 0.9757625460624695,
"learning_rate": 3.971632149281768e-06,
"loss": 0.0660263204574585,
"step": 1400
},
{
"epoch": 0.05766429265134348,
"grad_norm": 0.9931125044822693,
"learning_rate": 3.8167147467468655e-06,
"loss": 0.06467216968536377,
"step": 1425
},
{
"epoch": 0.05867594690838459,
"grad_norm": 0.7876198887825012,
"learning_rate": 3.6629917055830685e-06,
"loss": 0.06067314147949219,
"step": 1450
},
{
"epoch": 0.0596876011654257,
"grad_norm": 0.8658786416053772,
"learning_rate": 3.51061818775298e-06,
"loss": 0.06845765113830567,
"step": 1475
},
{
"epoch": 0.06069925542246682,
"grad_norm": 0.8782923817634583,
"learning_rate": 3.359747993063682e-06,
"loss": 0.06363529682159424,
"step": 1500
},
{
"epoch": 0.06171090967950793,
"grad_norm": 0.8501570820808411,
"learning_rate": 3.2105334039272924e-06,
"loss": 0.06508552074432374,
"step": 1525
},
{
"epoch": 0.06272256393654904,
"grad_norm": 0.9424809217453003,
"learning_rate": 3.06312503165311e-06,
"loss": 0.06868315219879151,
"step": 1550
},
{
"epoch": 0.06373421819359015,
"grad_norm": 0.8879184722900391,
"learning_rate": 2.9176716644265228e-06,
"loss": 0.06361775398254395,
"step": 1575
},
{
"epoch": 0.06474587245063128,
"grad_norm": 0.8703402280807495,
"learning_rate": 2.7743201171280776e-06,
"loss": 0.06295756340026855,
"step": 1600
},
{
"epoch": 0.06575752670767239,
"grad_norm": 0.8063569068908691,
"learning_rate": 2.6332150831443524e-06,
"loss": 0.06665169715881347,
"step": 1625
},
{
"epoch": 0.0667691809647135,
"grad_norm": 0.899817943572998,
"learning_rate": 2.494498988320166e-06,
"loss": 0.06509072303771973,
"step": 1650
},
{
"epoch": 0.06778083522175461,
"grad_norm": 0.7589254975318909,
"learning_rate": 2.358311847199567e-06,
"loss": 0.06155346870422363,
"step": 1675
},
{
"epoch": 0.06879248947879572,
"grad_norm": 0.9403272867202759,
"learning_rate": 2.224791121700673e-06,
"loss": 0.06310113906860351,
"step": 1700
},
{
"epoch": 0.06980414373583683,
"grad_norm": 0.9749501347541809,
"learning_rate": 2.094071582367053e-06,
"loss": 0.05723265171051026,
"step": 1725
},
{
"epoch": 0.07081579799287796,
"grad_norm": 1.0470415353775024,
"learning_rate": 1.9662851723356628e-06,
"loss": 0.0638632583618164,
"step": 1750
},
{
"epoch": 0.07182745224991907,
"grad_norm": 0.9093928337097168,
"learning_rate": 1.8415608741586595e-06,
"loss": 0.059368858337402346,
"step": 1775
},
{
"epoch": 0.07283910650696018,
"grad_norm": 1.184372901916504,
"learning_rate": 1.7200245796135085e-06,
"loss": 0.0635831117630005,
"step": 1800
},
{
"epoch": 0.0738507607640013,
"grad_norm": 0.9792858362197876,
"learning_rate": 1.601798962632799e-06,
"loss": 0.06337547302246094,
"step": 1825
},
{
"epoch": 0.0748624150210424,
"grad_norm": 0.8788456320762634,
"learning_rate": 1.4870033554820256e-06,
"loss": 0.05948060989379883,
"step": 1850
},
{
"epoch": 0.07587406927808352,
"grad_norm": 1.129376769065857,
"learning_rate": 1.3757536283103145e-06,
"loss": 0.06096158981323242,
"step": 1875
},
{
"epoch": 0.07688572353512464,
"grad_norm": 1.0180684328079224,
"learning_rate": 1.2681620721956727e-06,
"loss": 0.06047186851501465,
"step": 1900
},
{
"epoch": 0.07789737779216575,
"grad_norm": 0.7889450788497925,
"learning_rate": 1.1643372858028185e-06,
"loss": 0.06576673984527588,
"step": 1925
},
{
"epoch": 0.07890903204920686,
"grad_norm": 0.9547349810600281,
"learning_rate": 1.0643840657679716e-06,
"loss": 0.06420350551605225,
"step": 1950
},
{
"epoch": 0.07992068630624798,
"grad_norm": 1.0346224308013916,
"learning_rate": 9.684033009212752e-07,
"loss": 0.06534246444702148,
"step": 1975
},
{
"epoch": 0.08093234056328909,
"grad_norm": 0.962091326713562,
"learning_rate": 8.764918704535979e-07,
"loss": 0.06413849830627441,
"step": 2000
},
{
"epoch": 0.08093234056328909,
"eval_loss": 0.2071998119354248,
"eval_runtime": 416.5888,
"eval_samples_per_second": 102.994,
"eval_steps_per_second": 3.219,
"step": 2000
},
{
"epoch": 0.0819439948203302,
"grad_norm": 0.8268165588378906,
"learning_rate": 7.887425461305059e-07,
"loss": 0.05936159610748291,
"step": 2025
},
{
"epoch": 0.08295564907737132,
"grad_norm": 0.8211469650268555,
"learning_rate": 7.052438986521121e-07,
"loss": 0.06574771881103515,
"step": 2050
},
{
"epoch": 0.08396730333441244,
"grad_norm": 0.9656228423118591,
"learning_rate": 6.260802082533074e-07,
"loss": 0.05933941841125488,
"step": 2075
},
{
"epoch": 0.08497895759145355,
"grad_norm": 1.1002612113952637,
"learning_rate": 5.513313796346242e-07,
"loss": 0.05868081092834473,
"step": 2100
},
{
"epoch": 0.08599061184849466,
"grad_norm": 0.9568577408790588,
"learning_rate": 4.81072861309591e-07,
"loss": 0.061365365982055664,
"step": 2125
},
{
"epoch": 0.08700226610553577,
"grad_norm": 1.263872504234314,
"learning_rate": 4.1537556944998225e-07,
"loss": 0.05863400459289551,
"step": 2150
},
{
"epoch": 0.08801392036257688,
"grad_norm": 0.949004590511322,
"learning_rate": 3.5430581630583884e-07,
"loss": 0.05913155555725098,
"step": 2175
},
{
"epoch": 0.089025574619618,
"grad_norm": 1.2876442670822144,
"learning_rate": 2.979252432725027e-07,
"loss": 0.057411818504333495,
"step": 2200
},
{
"epoch": 0.09003722887665912,
"grad_norm": 1.0092101097106934,
"learning_rate": 2.462907586722285e-07,
"loss": 0.0581765079498291,
"step": 2225
},
{
"epoch": 0.09104888313370023,
"grad_norm": 0.8489072322845459,
"learning_rate": 1.994544803131737e-07,
"loss": 0.05828178882598877,
"step": 2250
},
{
"epoch": 0.09206053739074134,
"grad_norm": 0.8021871447563171,
"learning_rate": 1.574636828837395e-07,
"loss": 0.06090761184692383,
"step": 2275
},
{
"epoch": 0.09307219164778245,
"grad_norm": 1.2686115503311157,
"learning_rate": 1.2036075023537208e-07,
"loss": 0.061113595962524414,
"step": 2300
},
{
"epoch": 0.09408384590482356,
"grad_norm": 0.9067429304122925,
"learning_rate": 8.818313260197553e-08,
"loss": 0.060579957962036135,
"step": 2325
},
{
"epoch": 0.09509550016186469,
"grad_norm": 0.9274111390113831,
"learning_rate": 6.096330879912682e-08,
"loss": 0.0602969217300415,
"step": 2350
},
{
"epoch": 0.0961071544189058,
"grad_norm": 0.958638608455658,
"learning_rate": 3.872875344124283e-08,
"loss": 0.06123236656188965,
"step": 2375
},
{
"epoch": 0.09711880867594691,
"grad_norm": 0.9400763511657715,
"learning_rate": 2.1501909209790672e-08,
"loss": 0.05601327896118164,
"step": 2400
},
{
"epoch": 0.09813046293298802,
"grad_norm": 0.8256824016571045,
"learning_rate": 9.300164200530815e-09,
"loss": 0.058267130851745605,
"step": 2425
},
{
"epoch": 0.09914211719002913,
"grad_norm": 0.8892621397972107,
"learning_rate": 2.1358343726618493e-09,
"loss": 0.05662036895751953,
"step": 2450
},
{
"epoch": 0.10003237293622531,
"eval_loss": 0.21075651049613953,
"eval_runtime": 417.5077,
"eval_samples_per_second": 102.767,
"eval_steps_per_second": 3.212,
"step": 2472
}
],
"logging_steps": 25,
"max_steps": 2472,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 6.891199665862083e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}