{ "best_global_step": 1000, "best_metric": 0.18616674840450287, "best_model_checkpoint": "/workspace/t5gemma_continuation/runs/t5gemma-2-4b-netjets-balanced-0p1/checkpoint-1000", "epoch": 0.10003237293622531, "eval_steps": 1000, "global_step": 2472, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0010116542570411137, "grad_norm": 0.7588071823120117, "learning_rate": 9.997674418116759e-06, "loss": 0.09478737831115723, "step": 25 }, { "epoch": 0.0020233085140822274, "grad_norm": 0.7066558003425598, "learning_rate": 9.990308418965396e-06, "loss": 0.08540201187133789, "step": 50 }, { "epoch": 0.003034962771123341, "grad_norm": 0.9437556862831116, "learning_rate": 9.977905399713323e-06, "loss": 0.08831601142883301, "step": 75 }, { "epoch": 0.004046617028164455, "grad_norm": 0.6379377245903015, "learning_rate": 9.96047787947801e-06, "loss": 0.08719367980957031, "step": 100 }, { "epoch": 0.005058271285205568, "grad_norm": 0.7673565745353699, "learning_rate": 9.938043448909642e-06, "loss": 0.08562824249267578, "step": 125 }, { "epoch": 0.006069925542246682, "grad_norm": 0.8915950655937195, "learning_rate": 9.910624752435825e-06, "loss": 0.08884576797485351, "step": 150 }, { "epoch": 0.007081579799287795, "grad_norm": 0.9796419739723206, "learning_rate": 9.87824946540519e-06, "loss": 0.0844249153137207, "step": 175 }, { "epoch": 0.00809323405632891, "grad_norm": 0.7828882932662964, "learning_rate": 9.840950266152993e-06, "loss": 0.08762908935546875, "step": 200 }, { "epoch": 0.009104888313370023, "grad_norm": 0.8314036130905151, "learning_rate": 9.798764803016892e-06, "loss": 0.08477160453796387, "step": 225 }, { "epoch": 0.010116542570411136, "grad_norm": 0.9383084177970886, "learning_rate": 9.7517356563362e-06, "loss": 0.0796052074432373, "step": 250 }, { "epoch": 0.01112819682745225, "grad_norm": 0.6904627680778503, "learning_rate": 9.699910295472986e-06, "loss": 0.08183086395263672, "step": 275 }, { "epoch": 0.012139851084493364, "grad_norm": 0.7161296010017395, "learning_rate": 9.643341030898358e-06, "loss": 0.08600561141967773, "step": 300 }, { "epoch": 0.013151505341534477, "grad_norm": 0.7295992374420166, "learning_rate": 9.582084961392358e-06, "loss": 0.08031168937683106, "step": 325 }, { "epoch": 0.01416315959857559, "grad_norm": 0.8786855340003967, "learning_rate": 9.516203916410702e-06, "loss": 0.07677621841430664, "step": 350 }, { "epoch": 0.015174813855616705, "grad_norm": 0.664604127407074, "learning_rate": 9.445764393676567e-06, "loss": 0.08257333755493164, "step": 375 }, { "epoch": 0.01618646811265782, "grad_norm": 0.6612857580184937, "learning_rate": 9.370837492060428e-06, "loss": 0.07814112663269043, "step": 400 }, { "epoch": 0.01719812236969893, "grad_norm": 0.6337666511535645, "learning_rate": 9.291498839815658e-06, "loss": 0.07912947177886963, "step": 425 }, { "epoch": 0.018209776626740046, "grad_norm": 0.9065153002738953, "learning_rate": 9.20782851824236e-06, "loss": 0.08001086235046387, "step": 450 }, { "epoch": 0.01922143088378116, "grad_norm": 0.8778851628303528, "learning_rate": 9.119910980856477e-06, "loss": 0.08504880905151367, "step": 475 }, { "epoch": 0.020233085140822272, "grad_norm": 0.8410937786102295, "learning_rate": 9.027834968145736e-06, "loss": 0.07751385688781738, "step": 500 }, { "epoch": 0.021244739397863387, "grad_norm": 0.8290925025939941, "learning_rate": 8.931693417998515e-06, "loss": 0.08087217330932617, "step": 525 }, { "epoch": 0.0222563936549045, "grad_norm": 0.9300380349159241, "learning_rate": 8.831583371896011e-06, "loss": 0.07645512580871582, "step": 550 }, { "epoch": 0.023268047911945613, "grad_norm": 1.0256469249725342, "learning_rate": 8.727605876962402e-06, "loss": 0.07920522689819336, "step": 575 }, { "epoch": 0.024279702168986728, "grad_norm": 0.7493225336074829, "learning_rate": 8.619865883971879e-06, "loss": 0.07890358448028564, "step": 600 }, { "epoch": 0.025291356426027842, "grad_norm": 1.3388545513153076, "learning_rate": 8.508472141415468e-06, "loss": 0.0720207691192627, "step": 625 }, { "epoch": 0.026303010683068954, "grad_norm": 0.8595075011253357, "learning_rate": 8.393537085734616e-06, "loss": 0.07741987228393554, "step": 650 }, { "epoch": 0.02731466494011007, "grad_norm": 0.842380940914154, "learning_rate": 8.275176727832289e-06, "loss": 0.078358473777771, "step": 675 }, { "epoch": 0.02832631919715118, "grad_norm": 0.6610252261161804, "learning_rate": 8.153510535976138e-06, "loss": 0.07246792793273926, "step": 700 }, { "epoch": 0.029337973454192295, "grad_norm": 0.811519205570221, "learning_rate": 8.028661315211968e-06, "loss": 0.07699480533599853, "step": 725 }, { "epoch": 0.03034962771123341, "grad_norm": 0.8042305111885071, "learning_rate": 7.900755083409165e-06, "loss": 0.07572071552276612, "step": 750 }, { "epoch": 0.03136128196827452, "grad_norm": 1.0434718132019043, "learning_rate": 7.769920944063244e-06, "loss": 0.07450762748718262, "step": 775 }, { "epoch": 0.03237293622531564, "grad_norm": 0.7678037285804749, "learning_rate": 7.636290955983891e-06, "loss": 0.07479867935180665, "step": 800 }, { "epoch": 0.03338459048235675, "grad_norm": 0.7159585356712341, "learning_rate": 7.500000000000001e-06, "loss": 0.06815961360931397, "step": 825 }, { "epoch": 0.03439624473939786, "grad_norm": 0.8384346961975098, "learning_rate": 7.361185642816315e-06, "loss": 0.07340707778930664, "step": 850 }, { "epoch": 0.03540789899643898, "grad_norm": 0.8005127310752869, "learning_rate": 7.219987998159018e-06, "loss": 0.07145726203918457, "step": 875 }, { "epoch": 0.03641955325348009, "grad_norm": 0.7431536316871643, "learning_rate": 7.0765495853504875e-06, "loss": 0.0730298662185669, "step": 900 }, { "epoch": 0.0374312075105212, "grad_norm": 0.8528541922569275, "learning_rate": 6.931015185455915e-06, "loss": 0.07038732051849365, "step": 925 }, { "epoch": 0.03844286176756232, "grad_norm": 1.045146107673645, "learning_rate": 6.7835316951470185e-06, "loss": 0.07059284210205079, "step": 950 }, { "epoch": 0.03945451602460343, "grad_norm": 0.7227703928947449, "learning_rate": 6.634247978430359e-06, "loss": 0.06966906547546386, "step": 975 }, { "epoch": 0.040466170281644544, "grad_norm": 0.8465985655784607, "learning_rate": 6.483314716389888e-06, "loss": 0.07425240516662597, "step": 1000 }, { "epoch": 0.040466170281644544, "eval_loss": 0.18616674840450287, "eval_runtime": 417.5341, "eval_samples_per_second": 102.76, "eval_steps_per_second": 3.212, "step": 1000 }, { "epoch": 0.04147782453868566, "grad_norm": 0.9529474377632141, "learning_rate": 6.330884255095409e-06, "loss": 0.07227096557617188, "step": 1025 }, { "epoch": 0.04248947879572677, "grad_norm": 0.8593569397926331, "learning_rate": 6.1771104518304925e-06, "loss": 0.06962797641754151, "step": 1050 }, { "epoch": 0.043501133052767885, "grad_norm": 1.56771719455719, "learning_rate": 6.0221485197949995e-06, "loss": 0.0692414665222168, "step": 1075 }, { "epoch": 0.044512787309809, "grad_norm": 0.9446329474449158, "learning_rate": 5.866154871439018e-06, "loss": 0.07052364349365234, "step": 1100 }, { "epoch": 0.045524441566850114, "grad_norm": 0.9508762359619141, "learning_rate": 5.709286960586318e-06, "loss": 0.06672035217285156, "step": 1125 }, { "epoch": 0.046536095823891226, "grad_norm": 0.9291703701019287, "learning_rate": 5.551703123506678e-06, "loss": 0.07133745193481446, "step": 1150 }, { "epoch": 0.047547750080932344, "grad_norm": 1.0664215087890625, "learning_rate": 5.393562419097525e-06, "loss": 0.07111708641052246, "step": 1175 }, { "epoch": 0.048559404337973455, "grad_norm": 0.9802451729774475, "learning_rate": 5.235024468336154e-06, "loss": 0.06713025569915772, "step": 1200 }, { "epoch": 0.04957105859501457, "grad_norm": 0.9398006200790405, "learning_rate": 5.07624929316463e-06, "loss": 0.06843162536621093, "step": 1225 }, { "epoch": 0.050582712852055685, "grad_norm": 0.8841513991355896, "learning_rate": 4.917397154969965e-06, "loss": 0.0674632453918457, "step": 1250 }, { "epoch": 0.051594367109096796, "grad_norm": 0.9453590512275696, "learning_rate": 4.758628392822602e-06, "loss": 0.06608812808990479, "step": 1275 }, { "epoch": 0.05260602136613791, "grad_norm": 1.0145738124847412, "learning_rate": 4.600103261636496e-06, "loss": 0.0655123233795166, "step": 1300 }, { "epoch": 0.053617675623179026, "grad_norm": 0.8218289613723755, "learning_rate": 4.441981770414145e-06, "loss": 0.06619914054870606, "step": 1325 }, { "epoch": 0.05462932988022014, "grad_norm": 0.9566552042961121, "learning_rate": 4.284423520739811e-06, "loss": 0.06477892875671387, "step": 1350 }, { "epoch": 0.05564098413726125, "grad_norm": 0.8886809945106506, "learning_rate": 4.127587545684002e-06, "loss": 0.06271601676940917, "step": 1375 }, { "epoch": 0.05665263839430236, "grad_norm": 0.9757625460624695, "learning_rate": 3.971632149281768e-06, "loss": 0.0660263204574585, "step": 1400 }, { "epoch": 0.05766429265134348, "grad_norm": 0.9931125044822693, "learning_rate": 3.8167147467468655e-06, "loss": 0.06467216968536377, "step": 1425 }, { "epoch": 0.05867594690838459, "grad_norm": 0.7876198887825012, "learning_rate": 3.6629917055830685e-06, "loss": 0.06067314147949219, "step": 1450 }, { "epoch": 0.0596876011654257, "grad_norm": 0.8658786416053772, "learning_rate": 3.51061818775298e-06, "loss": 0.06845765113830567, "step": 1475 }, { "epoch": 0.06069925542246682, "grad_norm": 0.8782923817634583, "learning_rate": 3.359747993063682e-06, "loss": 0.06363529682159424, "step": 1500 }, { "epoch": 0.06171090967950793, "grad_norm": 0.8501570820808411, "learning_rate": 3.2105334039272924e-06, "loss": 0.06508552074432374, "step": 1525 }, { "epoch": 0.06272256393654904, "grad_norm": 0.9424809217453003, "learning_rate": 3.06312503165311e-06, "loss": 0.06868315219879151, "step": 1550 }, { "epoch": 0.06373421819359015, "grad_norm": 0.8879184722900391, "learning_rate": 2.9176716644265228e-06, "loss": 0.06361775398254395, "step": 1575 }, { "epoch": 0.06474587245063128, "grad_norm": 0.8703402280807495, "learning_rate": 2.7743201171280776e-06, "loss": 0.06295756340026855, "step": 1600 }, { "epoch": 0.06575752670767239, "grad_norm": 0.8063569068908691, "learning_rate": 2.6332150831443524e-06, "loss": 0.06665169715881347, "step": 1625 }, { "epoch": 0.0667691809647135, "grad_norm": 0.899817943572998, "learning_rate": 2.494498988320166e-06, "loss": 0.06509072303771973, "step": 1650 }, { "epoch": 0.06778083522175461, "grad_norm": 0.7589254975318909, "learning_rate": 2.358311847199567e-06, "loss": 0.06155346870422363, "step": 1675 }, { "epoch": 0.06879248947879572, "grad_norm": 0.9403272867202759, "learning_rate": 2.224791121700673e-06, "loss": 0.06310113906860351, "step": 1700 }, { "epoch": 0.06980414373583683, "grad_norm": 0.9749501347541809, "learning_rate": 2.094071582367053e-06, "loss": 0.05723265171051026, "step": 1725 }, { "epoch": 0.07081579799287796, "grad_norm": 1.0470415353775024, "learning_rate": 1.9662851723356628e-06, "loss": 0.0638632583618164, "step": 1750 }, { "epoch": 0.07182745224991907, "grad_norm": 0.9093928337097168, "learning_rate": 1.8415608741586595e-06, "loss": 0.059368858337402346, "step": 1775 }, { "epoch": 0.07283910650696018, "grad_norm": 1.184372901916504, "learning_rate": 1.7200245796135085e-06, "loss": 0.0635831117630005, "step": 1800 }, { "epoch": 0.0738507607640013, "grad_norm": 0.9792858362197876, "learning_rate": 1.601798962632799e-06, "loss": 0.06337547302246094, "step": 1825 }, { "epoch": 0.0748624150210424, "grad_norm": 0.8788456320762634, "learning_rate": 1.4870033554820256e-06, "loss": 0.05948060989379883, "step": 1850 }, { "epoch": 0.07587406927808352, "grad_norm": 1.129376769065857, "learning_rate": 1.3757536283103145e-06, "loss": 0.06096158981323242, "step": 1875 }, { "epoch": 0.07688572353512464, "grad_norm": 1.0180684328079224, "learning_rate": 1.2681620721956727e-06, "loss": 0.06047186851501465, "step": 1900 }, { "epoch": 0.07789737779216575, "grad_norm": 0.7889450788497925, "learning_rate": 1.1643372858028185e-06, "loss": 0.06576673984527588, "step": 1925 }, { "epoch": 0.07890903204920686, "grad_norm": 0.9547349810600281, "learning_rate": 1.0643840657679716e-06, "loss": 0.06420350551605225, "step": 1950 }, { "epoch": 0.07992068630624798, "grad_norm": 1.0346224308013916, "learning_rate": 9.684033009212752e-07, "loss": 0.06534246444702148, "step": 1975 }, { "epoch": 0.08093234056328909, "grad_norm": 0.962091326713562, "learning_rate": 8.764918704535979e-07, "loss": 0.06413849830627441, "step": 2000 }, { "epoch": 0.08093234056328909, "eval_loss": 0.2071998119354248, "eval_runtime": 416.5888, "eval_samples_per_second": 102.994, "eval_steps_per_second": 3.219, "step": 2000 }, { "epoch": 0.0819439948203302, "grad_norm": 0.8268165588378906, "learning_rate": 7.887425461305059e-07, "loss": 0.05936159610748291, "step": 2025 }, { "epoch": 0.08295564907737132, "grad_norm": 0.8211469650268555, "learning_rate": 7.052438986521121e-07, "loss": 0.06574771881103515, "step": 2050 }, { "epoch": 0.08396730333441244, "grad_norm": 0.9656228423118591, "learning_rate": 6.260802082533074e-07, "loss": 0.05933941841125488, "step": 2075 }, { "epoch": 0.08497895759145355, "grad_norm": 1.1002612113952637, "learning_rate": 5.513313796346242e-07, "loss": 0.05868081092834473, "step": 2100 }, { "epoch": 0.08599061184849466, "grad_norm": 0.9568577408790588, "learning_rate": 4.81072861309591e-07, "loss": 0.061365365982055664, "step": 2125 }, { "epoch": 0.08700226610553577, "grad_norm": 1.263872504234314, "learning_rate": 4.1537556944998225e-07, "loss": 0.05863400459289551, "step": 2150 }, { "epoch": 0.08801392036257688, "grad_norm": 0.949004590511322, "learning_rate": 3.5430581630583884e-07, "loss": 0.05913155555725098, "step": 2175 }, { "epoch": 0.089025574619618, "grad_norm": 1.2876442670822144, "learning_rate": 2.979252432725027e-07, "loss": 0.057411818504333495, "step": 2200 }, { "epoch": 0.09003722887665912, "grad_norm": 1.0092101097106934, "learning_rate": 2.462907586722285e-07, "loss": 0.0581765079498291, "step": 2225 }, { "epoch": 0.09104888313370023, "grad_norm": 0.8489072322845459, "learning_rate": 1.994544803131737e-07, "loss": 0.05828178882598877, "step": 2250 }, { "epoch": 0.09206053739074134, "grad_norm": 0.8021871447563171, "learning_rate": 1.574636828837395e-07, "loss": 0.06090761184692383, "step": 2275 }, { "epoch": 0.09307219164778245, "grad_norm": 1.2686115503311157, "learning_rate": 1.2036075023537208e-07, "loss": 0.061113595962524414, "step": 2300 }, { "epoch": 0.09408384590482356, "grad_norm": 0.9067429304122925, "learning_rate": 8.818313260197553e-08, "loss": 0.060579957962036135, "step": 2325 }, { "epoch": 0.09509550016186469, "grad_norm": 0.9274111390113831, "learning_rate": 6.096330879912682e-08, "loss": 0.0602969217300415, "step": 2350 }, { "epoch": 0.0961071544189058, "grad_norm": 0.958638608455658, "learning_rate": 3.872875344124283e-08, "loss": 0.06123236656188965, "step": 2375 }, { "epoch": 0.09711880867594691, "grad_norm": 0.9400763511657715, "learning_rate": 2.1501909209790672e-08, "loss": 0.05601327896118164, "step": 2400 }, { "epoch": 0.09813046293298802, "grad_norm": 0.8256824016571045, "learning_rate": 9.300164200530815e-09, "loss": 0.058267130851745605, "step": 2425 }, { "epoch": 0.09914211719002913, "grad_norm": 0.8892621397972107, "learning_rate": 2.1358343726618493e-09, "loss": 0.05662036895751953, "step": 2450 }, { "epoch": 0.10003237293622531, "eval_loss": 0.21075651049613953, "eval_runtime": 417.5077, "eval_samples_per_second": 102.767, "eval_steps_per_second": 3.212, "step": 2472 } ], "logging_steps": 25, "max_steps": 2472, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 6.891199665862083e+17, "train_batch_size": 8, "trial_name": null, "trial_params": null }