{ "best_metric": 1.184820294380188, "best_model_checkpoint": "./mamba-790m-phase2/checkpoint-2850", "epoch": 1.2324324324324325, "eval_steps": 50, "global_step": 2850, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.008648648648648649, "grad_norm": 0.13316184282302856, "learning_rate": 2.158273381294964e-06, "loss": 1.3731, "step": 20 }, { "epoch": 0.017297297297297298, "grad_norm": 0.12288903445005417, "learning_rate": 4.316546762589928e-06, "loss": 1.5117, "step": 40 }, { "epoch": 0.021621621621621623, "eval_loss": 1.5164753198623657, "eval_runtime": 156.2707, "eval_samples_per_second": 9.599, "eval_steps_per_second": 2.4, "step": 50 }, { "epoch": 0.025945945945945945, "grad_norm": 0.15546943247318268, "learning_rate": 6.474820143884892e-06, "loss": 1.5425, "step": 60 }, { "epoch": 0.034594594594594595, "grad_norm": 0.13446089625358582, "learning_rate": 8.633093525179856e-06, "loss": 1.5552, "step": 80 }, { "epoch": 0.043243243243243246, "grad_norm": 0.1574675589799881, "learning_rate": 1.079136690647482e-05, "loss": 1.4, "step": 100 }, { "epoch": 0.043243243243243246, "eval_loss": 1.511157751083374, "eval_runtime": 156.5135, "eval_samples_per_second": 9.584, "eval_steps_per_second": 2.396, "step": 100 }, { "epoch": 0.05189189189189189, "grad_norm": 0.1704365462064743, "learning_rate": 1.2949640287769784e-05, "loss": 1.3642, "step": 120 }, { "epoch": 0.06054054054054054, "grad_norm": 0.24820564687252045, "learning_rate": 1.4999998160049665e-05, "loss": 1.2921, "step": 140 }, { "epoch": 0.06486486486486487, "eval_loss": 1.472154140472412, "eval_runtime": 156.2248, "eval_samples_per_second": 9.602, "eval_steps_per_second": 2.4, "step": 150 }, { "epoch": 0.06918918918918919, "grad_norm": 0.19965757429599762, "learning_rate": 1.4999188596499784e-05, "loss": 1.3836, "step": 160 }, { "epoch": 0.07783783783783783, "grad_norm": 0.1957588493824005, "learning_rate": 1.4996907255939673e-05, "loss": 1.3328, "step": 180 }, { "epoch": 0.08648648648648649, "grad_norm": 0.2037293016910553, "learning_rate": 1.4993154586101044e-05, "loss": 1.4367, "step": 200 }, { "epoch": 0.08648648648648649, "eval_loss": 1.4281501770019531, "eval_runtime": 156.5874, "eval_samples_per_second": 9.579, "eval_steps_per_second": 2.395, "step": 200 }, { "epoch": 0.09513513513513513, "grad_norm": 0.2824411988258362, "learning_rate": 1.4987931323476007e-05, "loss": 1.4272, "step": 220 }, { "epoch": 0.10378378378378378, "grad_norm": 0.30133140087127686, "learning_rate": 1.4981238493172506e-05, "loss": 1.2994, "step": 240 }, { "epoch": 0.10810810810810811, "eval_loss": 1.3918442726135254, "eval_runtime": 156.3152, "eval_samples_per_second": 9.596, "eval_steps_per_second": 2.399, "step": 250 }, { "epoch": 0.11243243243243244, "grad_norm": 0.22853460907936096, "learning_rate": 1.4973077408713158e-05, "loss": 1.3668, "step": 260 }, { "epoch": 0.12108108108108108, "grad_norm": 0.25242647528648376, "learning_rate": 1.4963449671777435e-05, "loss": 1.3376, "step": 280 }, { "epoch": 0.12972972972972974, "grad_norm": 0.2533341348171234, "learning_rate": 1.4952357171887349e-05, "loss": 1.3953, "step": 300 }, { "epoch": 0.12972972972972974, "eval_loss": 1.3653450012207031, "eval_runtime": 156.5177, "eval_samples_per_second": 9.584, "eval_steps_per_second": 2.396, "step": 300 }, { "epoch": 0.13837837837837838, "grad_norm": 0.4832008481025696, "learning_rate": 1.4939802086036593e-05, "loss": 1.4049, "step": 320 }, { "epoch": 0.14702702702702702, "grad_norm": 0.27169403433799744, "learning_rate": 1.4925786878263313e-05, "loss": 1.4256, "step": 340 }, { "epoch": 0.15135135135135136, "eval_loss": 1.3452147245407104, "eval_runtime": 156.1759, "eval_samples_per_second": 9.605, "eval_steps_per_second": 2.401, "step": 350 }, { "epoch": 0.15567567567567567, "grad_norm": 0.42071032524108887, "learning_rate": 1.4910314299166496e-05, "loss": 1.3099, "step": 360 }, { "epoch": 0.1643243243243243, "grad_norm": 0.37401214241981506, "learning_rate": 1.4893387385366164e-05, "loss": 1.3174, "step": 380 }, { "epoch": 0.17297297297297298, "grad_norm": 0.36374762654304504, "learning_rate": 1.4875009458907393e-05, "loss": 1.325, "step": 400 }, { "epoch": 0.17297297297297298, "eval_loss": 1.3278440237045288, "eval_runtime": 155.9619, "eval_samples_per_second": 9.618, "eval_steps_per_second": 2.404, "step": 400 }, { "epoch": 0.18162162162162163, "grad_norm": 0.44585686922073364, "learning_rate": 1.4855184126608352e-05, "loss": 1.2749, "step": 420 }, { "epoch": 0.19027027027027027, "grad_norm": 0.40485116839408875, "learning_rate": 1.4833915279352421e-05, "loss": 1.1299, "step": 440 }, { "epoch": 0.1945945945945946, "eval_loss": 1.3141183853149414, "eval_runtime": 156.3105, "eval_samples_per_second": 9.596, "eval_steps_per_second": 2.399, "step": 450 }, { "epoch": 0.1989189189189189, "grad_norm": 0.4696143865585327, "learning_rate": 1.4811207091324587e-05, "loss": 1.1933, "step": 460 }, { "epoch": 0.20756756756756756, "grad_norm": 0.6063587069511414, "learning_rate": 1.478706401919221e-05, "loss": 1.2983, "step": 480 }, { "epoch": 0.21621621621621623, "grad_norm": 0.4177221953868866, "learning_rate": 1.4761490801230385e-05, "loss": 1.2339, "step": 500 }, { "epoch": 0.21621621621621623, "eval_loss": 1.302538275718689, "eval_runtime": 156.5384, "eval_samples_per_second": 9.582, "eval_steps_per_second": 2.396, "step": 500 }, { "epoch": 0.22486486486486487, "grad_norm": 0.4580596089363098, "learning_rate": 1.4734492456391998e-05, "loss": 1.3529, "step": 520 }, { "epoch": 0.23351351351351352, "grad_norm": 0.4583284556865692, "learning_rate": 1.470607428332273e-05, "loss": 1.3169, "step": 540 }, { "epoch": 0.23783783783783785, "eval_loss": 1.2932534217834473, "eval_runtime": 156.5697, "eval_samples_per_second": 9.58, "eval_steps_per_second": 2.395, "step": 550 }, { "epoch": 0.24216216216216216, "grad_norm": 0.4312450885772705, "learning_rate": 1.4676241859321143e-05, "loss": 1.1324, "step": 560 }, { "epoch": 0.2508108108108108, "grad_norm": 0.5200898051261902, "learning_rate": 1.4645001039244101e-05, "loss": 1.2754, "step": 580 }, { "epoch": 0.2594594594594595, "grad_norm": 0.5838780403137207, "learning_rate": 1.4612357954357695e-05, "loss": 1.2903, "step": 600 }, { "epoch": 0.2594594594594595, "eval_loss": 1.284968376159668, "eval_runtime": 156.4193, "eval_samples_per_second": 9.59, "eval_steps_per_second": 2.397, "step": 600 }, { "epoch": 0.2681081081081081, "grad_norm": 0.3660845458507538, "learning_rate": 1.4578319011133939e-05, "loss": 1.1267, "step": 620 }, { "epoch": 0.27675675675675676, "grad_norm": 0.4065239429473877, "learning_rate": 1.454289088999345e-05, "loss": 1.2034, "step": 640 }, { "epoch": 0.2810810810810811, "eval_loss": 1.2779653072357178, "eval_runtime": 156.5245, "eval_samples_per_second": 9.583, "eval_steps_per_second": 2.396, "step": 650 }, { "epoch": 0.28540540540540543, "grad_norm": 0.4448115825653076, "learning_rate": 1.4506080543994352e-05, "loss": 1.1839, "step": 660 }, { "epoch": 0.29405405405405405, "grad_norm": 0.741157054901123, "learning_rate": 1.4467895197467692e-05, "loss": 1.2143, "step": 680 }, { "epoch": 0.3027027027027027, "grad_norm": 0.45047101378440857, "learning_rate": 1.4428342344599592e-05, "loss": 1.2868, "step": 700 }, { "epoch": 0.3027027027027027, "eval_loss": 1.2726409435272217, "eval_runtime": 156.3492, "eval_samples_per_second": 9.594, "eval_steps_per_second": 2.398, "step": 700 }, { "epoch": 0.31135135135135134, "grad_norm": 0.4149288535118103, "learning_rate": 1.4387429747960472e-05, "loss": 1.1808, "step": 720 }, { "epoch": 0.32, "grad_norm": 0.5024465322494507, "learning_rate": 1.4345165436981567e-05, "loss": 1.1616, "step": 740 }, { "epoch": 0.32432432432432434, "eval_loss": 1.2668416500091553, "eval_runtime": 156.232, "eval_samples_per_second": 9.601, "eval_steps_per_second": 2.4, "step": 750 }, { "epoch": 0.3286486486486486, "grad_norm": 0.5940514802932739, "learning_rate": 1.430155770637909e-05, "loss": 1.2955, "step": 760 }, { "epoch": 0.3372972972972973, "grad_norm": 0.4798080623149872, "learning_rate": 1.4256615114526333e-05, "loss": 1.1858, "step": 780 }, { "epoch": 0.34594594594594597, "grad_norm": 0.3747268319129944, "learning_rate": 1.4210346481774007e-05, "loss": 1.2592, "step": 800 }, { "epoch": 0.34594594594594597, "eval_loss": 1.261027216911316, "eval_runtime": 156.3223, "eval_samples_per_second": 9.596, "eval_steps_per_second": 2.399, "step": 800 }, { "epoch": 0.3545945945945946, "grad_norm": 0.6627951860427856, "learning_rate": 1.4162760888719174e-05, "loss": 1.1585, "step": 820 }, { "epoch": 0.36324324324324325, "grad_norm": 0.6270909309387207, "learning_rate": 1.4113867674423123e-05, "loss": 1.2351, "step": 840 }, { "epoch": 0.3675675675675676, "eval_loss": 1.2562013864517212, "eval_runtime": 156.3737, "eval_samples_per_second": 9.592, "eval_steps_per_second": 2.398, "step": 850 }, { "epoch": 0.37189189189189187, "grad_norm": 0.5605448484420776, "learning_rate": 1.4063676434578483e-05, "loss": 1.2151, "step": 860 }, { "epoch": 0.38054054054054054, "grad_norm": 0.4705483317375183, "learning_rate": 1.4012197019626004e-05, "loss": 1.1309, "step": 880 }, { "epoch": 0.3891891891891892, "grad_norm": 0.5667669773101807, "learning_rate": 1.3959439532821314e-05, "loss": 1.2531, "step": 900 }, { "epoch": 0.3891891891891892, "eval_loss": 1.2514050006866455, "eval_runtime": 156.3146, "eval_samples_per_second": 9.596, "eval_steps_per_second": 2.399, "step": 900 }, { "epoch": 0.3978378378378378, "grad_norm": 0.6878731846809387, "learning_rate": 1.3905414328252085e-05, "loss": 1.2473, "step": 920 }, { "epoch": 0.4064864864864865, "grad_norm": 0.799188494682312, "learning_rate": 1.3850132008805958e-05, "loss": 1.1098, "step": 940 }, { "epoch": 0.41081081081081083, "eval_loss": 1.2472807168960571, "eval_runtime": 156.3138, "eval_samples_per_second": 9.596, "eval_steps_per_second": 2.399, "step": 950 }, { "epoch": 0.4151351351351351, "grad_norm": 0.5942118763923645, "learning_rate": 1.379360342408963e-05, "loss": 1.1993, "step": 960 }, { "epoch": 0.4237837837837838, "grad_norm": 0.44030797481536865, "learning_rate": 1.3735839668299537e-05, "loss": 1.2577, "step": 980 }, { "epoch": 0.43243243243243246, "grad_norm": 0.5364145040512085, "learning_rate": 1.3676852078044528e-05, "loss": 1.209, "step": 1000 }, { "epoch": 0.43243243243243246, "eval_loss": 1.2433239221572876, "eval_runtime": 156.3683, "eval_samples_per_second": 9.593, "eval_steps_per_second": 2.398, "step": 1000 }, { "epoch": 0.4410810810810811, "grad_norm": 0.7929672598838806, "learning_rate": 1.3616652230120962e-05, "loss": 1.2357, "step": 1020 }, { "epoch": 0.44972972972972974, "grad_norm": 0.7581718564033508, "learning_rate": 1.3555251939240659e-05, "loss": 1.2092, "step": 1040 }, { "epoch": 0.4540540540540541, "eval_loss": 1.239459753036499, "eval_runtime": 156.2938, "eval_samples_per_second": 9.597, "eval_steps_per_second": 2.399, "step": 1050 }, { "epoch": 0.45837837837837836, "grad_norm": 0.5872713327407837, "learning_rate": 1.3492663255712187e-05, "loss": 1.2605, "step": 1060 }, { "epoch": 0.46702702702702703, "grad_norm": 0.5056009292602539, "learning_rate": 1.3428898463075862e-05, "loss": 1.2838, "step": 1080 }, { "epoch": 0.4756756756756757, "grad_norm": 0.5987468957901001, "learning_rate": 1.3363970075693032e-05, "loss": 1.2619, "step": 1100 }, { "epoch": 0.4756756756756757, "eval_loss": 1.2360332012176514, "eval_runtime": 156.4955, "eval_samples_per_second": 9.585, "eval_steps_per_second": 2.396, "step": 1100 }, { "epoch": 0.4843243243243243, "grad_norm": 0.6014208197593689, "learning_rate": 1.3297890836290004e-05, "loss": 1.2276, "step": 1120 }, { "epoch": 0.492972972972973, "grad_norm": 0.7187291383743286, "learning_rate": 1.3230673713457208e-05, "loss": 1.1775, "step": 1140 }, { "epoch": 0.4972972972972973, "eval_loss": 1.2334262132644653, "eval_runtime": 156.3371, "eval_samples_per_second": 9.595, "eval_steps_per_second": 2.399, "step": 1150 }, { "epoch": 0.5016216216216216, "grad_norm": 0.6566280722618103, "learning_rate": 1.3162331899103977e-05, "loss": 1.2047, "step": 1160 }, { "epoch": 0.5102702702702703, "grad_norm": 0.8335544466972351, "learning_rate": 1.3092878805869546e-05, "loss": 1.1767, "step": 1180 }, { "epoch": 0.518918918918919, "grad_norm": 0.6835708022117615, "learning_rate": 1.3022328064490712e-05, "loss": 1.1629, "step": 1200 }, { "epoch": 0.518918918918919, "eval_loss": 1.2302730083465576, "eval_runtime": 156.5356, "eval_samples_per_second": 9.582, "eval_steps_per_second": 2.396, "step": 1200 }, { "epoch": 0.5275675675675676, "grad_norm": 0.5832236409187317, "learning_rate": 1.2950693521126676e-05, "loss": 1.1748, "step": 1220 }, { "epoch": 0.5362162162162162, "grad_norm": 0.6758794188499451, "learning_rate": 1.2877989234641634e-05, "loss": 1.1371, "step": 1240 }, { "epoch": 0.5405405405405406, "eval_loss": 1.2266525030136108, "eval_runtime": 156.281, "eval_samples_per_second": 9.598, "eval_steps_per_second": 2.4, "step": 1250 }, { "epoch": 0.5448648648648649, "grad_norm": 0.5459420680999756, "learning_rate": 1.2804229473845609e-05, "loss": 1.2151, "step": 1260 }, { "epoch": 0.5535135135135135, "grad_norm": 0.5503604412078857, "learning_rate": 1.2729428714694075e-05, "loss": 1.1291, "step": 1280 }, { "epoch": 0.5621621621621622, "grad_norm": 0.6145665645599365, "learning_rate": 1.265360163744694e-05, "loss": 1.1212, "step": 1300 }, { "epoch": 0.5621621621621622, "eval_loss": 1.2243192195892334, "eval_runtime": 156.3088, "eval_samples_per_second": 9.596, "eval_steps_per_second": 2.399, "step": 1300 }, { "epoch": 0.5708108108108109, "grad_norm": 0.8270878791809082, "learning_rate": 1.257676312378741e-05, "loss": 1.0307, "step": 1320 }, { "epoch": 0.5794594594594594, "grad_norm": 0.6336683034896851, "learning_rate": 1.2498928253901358e-05, "loss": 1.143, "step": 1340 }, { "epoch": 0.5837837837837838, "eval_loss": 1.2215410470962524, "eval_runtime": 156.2606, "eval_samples_per_second": 9.599, "eval_steps_per_second": 2.4, "step": 1350 }, { "epoch": 0.5881081081081081, "grad_norm": 0.5482487678527832, "learning_rate": 1.24201123035177e-05, "loss": 1.3624, "step": 1360 }, { "epoch": 0.5967567567567568, "grad_norm": 0.7318127751350403, "learning_rate": 1.2340330740910413e-05, "loss": 1.1077, "step": 1380 }, { "epoch": 0.6054054054054054, "grad_norm": 0.5615875720977783, "learning_rate": 1.2259599223862757e-05, "loss": 1.232, "step": 1400 }, { "epoch": 0.6054054054054054, "eval_loss": 1.2196455001831055, "eval_runtime": 156.1978, "eval_samples_per_second": 9.603, "eval_steps_per_second": 2.401, "step": 1400 }, { "epoch": 0.614054054054054, "grad_norm": 0.6447334885597229, "learning_rate": 1.2177933596594313e-05, "loss": 1.1058, "step": 1420 }, { "epoch": 0.6227027027027027, "grad_norm": 0.8408645391464233, "learning_rate": 1.2095349886651426e-05, "loss": 1.302, "step": 1440 }, { "epoch": 0.6270270270270271, "eval_loss": 1.2167232036590576, "eval_runtime": 156.2131, "eval_samples_per_second": 9.602, "eval_steps_per_second": 2.401, "step": 1450 }, { "epoch": 0.6313513513513513, "grad_norm": 0.4599859416484833, "learning_rate": 1.2011864301761648e-05, "loss": 1.1504, "step": 1460 }, { "epoch": 0.64, "grad_norm": 0.9404271841049194, "learning_rate": 1.1927493226652876e-05, "loss": 1.2024, "step": 1480 }, { "epoch": 0.6486486486486487, "grad_norm": 0.5044443011283875, "learning_rate": 1.1842253219837676e-05, "loss": 1.213, "step": 1500 }, { "epoch": 0.6486486486486487, "eval_loss": 1.2149133682250977, "eval_runtime": 156.3249, "eval_samples_per_second": 9.595, "eval_steps_per_second": 2.399, "step": 1500 }, { "epoch": 0.6572972972972972, "grad_norm": 0.7133287191390991, "learning_rate": 1.1756161010363576e-05, "loss": 1.1682, "step": 1520 }, { "epoch": 0.6659459459459459, "grad_norm": 0.7438573241233826, "learning_rate": 1.1669233494529819e-05, "loss": 1.0579, "step": 1540 }, { "epoch": 0.6702702702702703, "eval_loss": 1.2130820751190186, "eval_runtime": 156.4016, "eval_samples_per_second": 9.591, "eval_steps_per_second": 2.398, "step": 1550 }, { "epoch": 0.6745945945945946, "grad_norm": 0.8739683032035828, "learning_rate": 1.158148773257135e-05, "loss": 1.0753, "step": 1560 }, { "epoch": 0.6832432432432433, "grad_norm": 0.7708102464675903, "learning_rate": 1.1492940945310608e-05, "loss": 1.2175, "step": 1580 }, { "epoch": 0.6918918918918919, "grad_norm": 0.549228847026825, "learning_rate": 1.1403610510777778e-05, "loss": 1.0838, "step": 1600 }, { "epoch": 0.6918918918918919, "eval_loss": 1.2114548683166504, "eval_runtime": 156.4625, "eval_samples_per_second": 9.587, "eval_steps_per_second": 2.397, "step": 1600 }, { "epoch": 0.7005405405405405, "grad_norm": 0.9724882245063782, "learning_rate": 1.1313513960800224e-05, "loss": 1.0542, "step": 1620 }, { "epoch": 0.7091891891891892, "grad_norm": 0.8888576030731201, "learning_rate": 1.1222668977561725e-05, "loss": 1.2136, "step": 1640 }, { "epoch": 0.7135135135135136, "eval_loss": 1.2095521688461304, "eval_runtime": 156.4366, "eval_samples_per_second": 9.589, "eval_steps_per_second": 2.397, "step": 1650 }, { "epoch": 0.7178378378378378, "grad_norm": 1.1320910453796387, "learning_rate": 1.1131093390132205e-05, "loss": 1.1844, "step": 1660 }, { "epoch": 0.7264864864864865, "grad_norm": 0.8856949210166931, "learning_rate": 1.1038805170968615e-05, "loss": 1.1142, "step": 1680 }, { "epoch": 0.7351351351351352, "grad_norm": 1.0155227184295654, "learning_rate": 1.0945822432387722e-05, "loss": 1.1138, "step": 1700 }, { "epoch": 0.7351351351351352, "eval_loss": 1.207614779472351, "eval_runtime": 156.4751, "eval_samples_per_second": 9.586, "eval_steps_per_second": 2.397, "step": 1700 }, { "epoch": 0.7437837837837837, "grad_norm": 0.8122560977935791, "learning_rate": 1.0852163423011382e-05, "loss": 1.1304, "step": 1720 }, { "epoch": 0.7524324324324324, "grad_norm": 0.8628650903701782, "learning_rate": 1.0757846524185135e-05, "loss": 1.1426, "step": 1740 }, { "epoch": 0.7567567567567568, "eval_loss": 1.2060997486114502, "eval_runtime": 156.2117, "eval_samples_per_second": 9.602, "eval_steps_per_second": 2.401, "step": 1750 }, { "epoch": 0.7610810810810811, "grad_norm": 1.243729591369629, "learning_rate": 1.0662890246370682e-05, "loss": 1.0881, "step": 1760 }, { "epoch": 0.7697297297297298, "grad_norm": 0.8714478015899658, "learning_rate": 1.0567313225513085e-05, "loss": 1.2214, "step": 1780 }, { "epoch": 0.7783783783783784, "grad_norm": 0.44382530450820923, "learning_rate": 1.0471134219383299e-05, "loss": 1.2328, "step": 1800 }, { "epoch": 0.7783783783783784, "eval_loss": 1.2047566175460815, "eval_runtime": 156.372, "eval_samples_per_second": 9.593, "eval_steps_per_second": 2.398, "step": 1800 }, { "epoch": 0.787027027027027, "grad_norm": 1.0515871047973633, "learning_rate": 1.0374372103896792e-05, "loss": 1.1519, "step": 1820 }, { "epoch": 0.7956756756756757, "grad_norm": 0.8955100178718567, "learning_rate": 1.027704586940902e-05, "loss": 1.0786, "step": 1840 }, { "epoch": 0.8, "eval_loss": 1.2030872106552124, "eval_runtime": 156.2817, "eval_samples_per_second": 9.598, "eval_steps_per_second": 2.4, "step": 1850 }, { "epoch": 0.8043243243243243, "grad_norm": 0.6575765609741211, "learning_rate": 1.0179174616988392e-05, "loss": 1.2385, "step": 1860 }, { "epoch": 0.812972972972973, "grad_norm": 0.5790345072746277, "learning_rate": 1.008077755466754e-05, "loss": 1.135, "step": 1880 }, { "epoch": 0.8216216216216217, "grad_norm": 0.7308002710342407, "learning_rate": 9.981873993673584e-06, "loss": 1.2052, "step": 1900 }, { "epoch": 0.8216216216216217, "eval_loss": 1.2018324136734009, "eval_runtime": 156.3907, "eval_samples_per_second": 9.591, "eval_steps_per_second": 2.398, "step": 1900 }, { "epoch": 0.8302702702702702, "grad_norm": 0.47168049216270447, "learning_rate": 9.882483344638144e-06, "loss": 1.1291, "step": 1920 }, { "epoch": 0.8389189189189189, "grad_norm": 1.0765182971954346, "learning_rate": 9.78262511378785e-06, "loss": 1.2196, "step": 1940 }, { "epoch": 0.8432432432432433, "eval_loss": 1.200095534324646, "eval_runtime": 156.3628, "eval_samples_per_second": 9.593, "eval_steps_per_second": 2.398, "step": 1950 }, { "epoch": 0.8475675675675676, "grad_norm": 0.9777532815933228, "learning_rate": 9.682318899116075e-06, "loss": 1.2965, "step": 1960 }, { "epoch": 0.8562162162162162, "grad_norm": 0.6992659568786621, "learning_rate": 9.58158438653668e-06, "loss": 1.2705, "step": 1980 }, { "epoch": 0.8648648648648649, "grad_norm": 0.7154545783996582, "learning_rate": 9.480441346020491e-06, "loss": 1.1538, "step": 2000 }, { "epoch": 0.8648648648648649, "eval_loss": 1.1992037296295166, "eval_runtime": 156.5695, "eval_samples_per_second": 9.58, "eval_steps_per_second": 2.395, "step": 2000 }, { "epoch": 0.8735135135135135, "grad_norm": 0.9878578782081604, "learning_rate": 9.378909627715276e-06, "loss": 1.1575, "step": 2020 }, { "epoch": 0.8821621621621621, "grad_norm": 0.7160919308662415, "learning_rate": 9.277009158049991e-06, "loss": 1.2407, "step": 2040 }, { "epoch": 0.8864864864864865, "eval_loss": 1.1983826160430908, "eval_runtime": 156.5345, "eval_samples_per_second": 9.583, "eval_steps_per_second": 2.396, "step": 2050 }, { "epoch": 0.8908108108108108, "grad_norm": 0.8028165102005005, "learning_rate": 9.174759935824059e-06, "loss": 1.0845, "step": 2060 }, { "epoch": 0.8994594594594595, "grad_norm": 0.5290041565895081, "learning_rate": 9.072182028282447e-06, "loss": 1.1363, "step": 2080 }, { "epoch": 0.9081081081081082, "grad_norm": 0.8659726977348328, "learning_rate": 8.96929556717729e-06, "loss": 1.1844, "step": 2100 }, { "epoch": 0.9081081081081082, "eval_loss": 1.1970139741897583, "eval_runtime": 156.645, "eval_samples_per_second": 9.576, "eval_steps_per_second": 2.394, "step": 2100 }, { "epoch": 0.9167567567567567, "grad_norm": 0.7906278371810913, "learning_rate": 8.866120744816888e-06, "loss": 1.1765, "step": 2120 }, { "epoch": 0.9254054054054054, "grad_norm": 0.7997767925262451, "learning_rate": 8.762677810102787e-06, "loss": 1.0805, "step": 2140 }, { "epoch": 0.9297297297297298, "eval_loss": 1.195316195487976, "eval_runtime": 156.3354, "eval_samples_per_second": 9.595, "eval_steps_per_second": 2.399, "step": 2150 }, { "epoch": 0.9340540540540541, "grad_norm": 0.5412635803222656, "learning_rate": 8.658987064555783e-06, "loss": 1.0922, "step": 2160 }, { "epoch": 0.9427027027027027, "grad_norm": 0.8357748985290527, "learning_rate": 8.555068858331553e-06, "loss": 1.2273, "step": 2180 }, { "epoch": 0.9513513513513514, "grad_norm": 0.8305333852767944, "learning_rate": 8.450943586226805e-06, "loss": 1.2381, "step": 2200 }, { "epoch": 0.9513513513513514, "eval_loss": 1.1945637464523315, "eval_runtime": 157.8154, "eval_samples_per_second": 9.505, "eval_steps_per_second": 2.376, "step": 2200 }, { "epoch": 0.96, "grad_norm": 0.5756638646125793, "learning_rate": 8.346631683676616e-06, "loss": 1.0844, "step": 2220 }, { "epoch": 0.9686486486486486, "grad_norm": 0.8370802998542786, "learning_rate": 8.242153622743802e-06, "loss": 1.1966, "step": 2240 }, { "epoch": 0.972972972972973, "eval_loss": 1.193472981452942, "eval_runtime": 156.5861, "eval_samples_per_second": 9.579, "eval_steps_per_second": 2.395, "step": 2250 }, { "epoch": 0.9772972972972973, "grad_norm": 0.654332160949707, "learning_rate": 8.137529908101128e-06, "loss": 1.1768, "step": 2260 }, { "epoch": 0.985945945945946, "grad_norm": 0.8234332799911499, "learning_rate": 8.03278107300709e-06, "loss": 1.1339, "step": 2280 }, { "epoch": 0.9945945945945946, "grad_norm": 0.618282675743103, "learning_rate": 7.927927675276087e-06, "loss": 1.1226, "step": 2300 }, { "epoch": 0.9945945945945946, "eval_loss": 1.1929038763046265, "eval_runtime": 156.4657, "eval_samples_per_second": 9.587, "eval_steps_per_second": 2.397, "step": 2300 }, { "epoch": 1.0032432432432432, "grad_norm": 0.7228516340255737, "learning_rate": 7.822990293243793e-06, "loss": 1.1974, "step": 2320 }, { "epoch": 1.011891891891892, "grad_norm": 0.6766774654388428, "learning_rate": 7.71798952172849e-06, "loss": 1.01, "step": 2340 }, { "epoch": 1.0162162162162163, "eval_loss": 1.1917825937271118, "eval_runtime": 156.3134, "eval_samples_per_second": 9.596, "eval_steps_per_second": 2.399, "step": 2350 }, { "epoch": 1.0205405405405406, "grad_norm": 0.8917098045349121, "learning_rate": 7.612945967989164e-06, "loss": 1.0233, "step": 2360 }, { "epoch": 1.0291891891891891, "grad_norm": 0.7241379022598267, "learning_rate": 7.5078802476811515e-06, "loss": 1.2105, "step": 2380 }, { "epoch": 1.037837837837838, "grad_norm": 0.6121885776519775, "learning_rate": 7.402812980810174e-06, "loss": 1.1697, "step": 2400 }, { "epoch": 1.037837837837838, "eval_loss": 1.1907098293304443, "eval_runtime": 156.2571, "eval_samples_per_second": 9.6, "eval_steps_per_second": 2.4, "step": 2400 }, { "epoch": 1.0464864864864865, "grad_norm": 0.56922847032547, "learning_rate": 7.297764787685467e-06, "loss": 1.2328, "step": 2420 }, { "epoch": 1.0551351351351352, "grad_norm": 0.8866540789604187, "learning_rate": 7.192756284872893e-06, "loss": 1.1378, "step": 2440 }, { "epoch": 1.0594594594594595, "eval_loss": 1.190106987953186, "eval_runtime": 156.2921, "eval_samples_per_second": 9.597, "eval_steps_per_second": 2.399, "step": 2450 }, { "epoch": 1.0637837837837838, "grad_norm": 0.9187541604042053, "learning_rate": 7.087808081148768e-06, "loss": 1.027, "step": 2460 }, { "epoch": 1.0724324324324324, "grad_norm": 0.4501543939113617, "learning_rate": 6.982940773455215e-06, "loss": 1.2174, "step": 2480 }, { "epoch": 1.0810810810810811, "grad_norm": 0.670372486114502, "learning_rate": 6.878174942857852e-06, "loss": 0.9583, "step": 2500 }, { "epoch": 1.0810810810810811, "eval_loss": 1.1890244483947754, "eval_runtime": 156.3208, "eval_samples_per_second": 9.596, "eval_steps_per_second": 2.399, "step": 2500 }, { "epoch": 1.0897297297297297, "grad_norm": 0.5464470386505127, "learning_rate": 6.7735311505065885e-06, "loss": 1.117, "step": 2520 }, { "epoch": 1.0983783783783783, "grad_norm": 0.5962574481964111, "learning_rate": 6.669029933600332e-06, "loss": 1.1578, "step": 2540 }, { "epoch": 1.1027027027027028, "eval_loss": 1.1883645057678223, "eval_runtime": 156.3484, "eval_samples_per_second": 9.594, "eval_steps_per_second": 2.398, "step": 2550 }, { "epoch": 1.107027027027027, "grad_norm": 0.7612497210502625, "learning_rate": 6.564691801356392e-06, "loss": 1.1369, "step": 2560 }, { "epoch": 1.1156756756756756, "grad_norm": 1.0087133646011353, "learning_rate": 6.460537230985388e-06, "loss": 1.1793, "step": 2580 }, { "epoch": 1.1243243243243244, "grad_norm": 0.6867474913597107, "learning_rate": 6.356586663672409e-06, "loss": 1.1688, "step": 2600 }, { "epoch": 1.1243243243243244, "eval_loss": 1.1876789331436157, "eval_runtime": 156.4562, "eval_samples_per_second": 9.587, "eval_steps_per_second": 2.397, "step": 2600 }, { "epoch": 1.132972972972973, "grad_norm": 0.8074759840965271, "learning_rate": 6.252860500565295e-06, "loss": 1.1414, "step": 2620 }, { "epoch": 1.1416216216216215, "grad_norm": 1.0738656520843506, "learning_rate": 6.1493790987707146e-06, "loss": 1.2174, "step": 2640 }, { "epoch": 1.145945945945946, "eval_loss": 1.1870859861373901, "eval_runtime": 156.2871, "eval_samples_per_second": 9.598, "eval_steps_per_second": 2.399, "step": 2650 }, { "epoch": 1.1502702702702703, "grad_norm": 0.7977942824363708, "learning_rate": 6.0461627673589336e-06, "loss": 1.2674, "step": 2660 }, { "epoch": 1.1589189189189189, "grad_norm": 0.5102550983428955, "learning_rate": 5.943231763377995e-06, "loss": 1.1778, "step": 2680 }, { "epoch": 1.1675675675675676, "grad_norm": 0.7279404997825623, "learning_rate": 5.840606287878094e-06, "loss": 1.1715, "step": 2700 }, { "epoch": 1.1675675675675676, "eval_loss": 1.1867084503173828, "eval_runtime": 156.3684, "eval_samples_per_second": 9.593, "eval_steps_per_second": 2.398, "step": 2700 }, { "epoch": 1.1762162162162162, "grad_norm": 1.0068808794021606, "learning_rate": 5.738306481946973e-06, "loss": 1.1962, "step": 2720 }, { "epoch": 1.1848648648648648, "grad_norm": 1.274601936340332, "learning_rate": 5.636352422757062e-06, "loss": 1.1244, "step": 2740 }, { "epoch": 1.1891891891891893, "eval_loss": 1.185834288597107, "eval_runtime": 156.5394, "eval_samples_per_second": 9.582, "eval_steps_per_second": 2.396, "step": 2750 }, { "epoch": 1.1935135135135135, "grad_norm": 0.7775521278381348, "learning_rate": 5.534764119625167e-06, "loss": 1.1735, "step": 2760 }, { "epoch": 1.202162162162162, "grad_norm": 0.7912615537643433, "learning_rate": 5.433561510085475e-06, "loss": 1.1918, "step": 2780 }, { "epoch": 1.2108108108108109, "grad_norm": 0.7740307450294495, "learning_rate": 5.3327644559766674e-06, "loss": 1.0983, "step": 2800 }, { "epoch": 1.2108108108108109, "eval_loss": 1.185600757598877, "eval_runtime": 156.2111, "eval_samples_per_second": 9.602, "eval_steps_per_second": 2.401, "step": 2800 }, { "epoch": 1.2194594594594594, "grad_norm": 0.7494848370552063, "learning_rate": 5.232392739543848e-06, "loss": 1.0842, "step": 2820 }, { "epoch": 1.228108108108108, "grad_norm": 0.936766505241394, "learning_rate": 5.132466059556139e-06, "loss": 1.0828, "step": 2840 }, { "epoch": 1.2324324324324325, "eval_loss": 1.184820294380188, "eval_runtime": 156.2295, "eval_samples_per_second": 9.601, "eval_steps_per_second": 2.4, "step": 2850 } ], "logging_steps": 20, "max_steps": 4624, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 50, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 2, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.08620239192064e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }