{ "best_global_step": 3300, "best_metric": 1.3866829872131348, "best_model_checkpoint": "/content/assets/train/checkpoint-3300", "epoch": 3.0, "eval_steps": 150, "global_step": 3465, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.008658008658008658, "grad_norm": 3.2492330074310303, "learning_rate": 2.3054755043227664e-06, "loss": 10.0227, "step": 10 }, { "epoch": 0.017316017316017316, "grad_norm": 4.142112731933594, "learning_rate": 5.187319884726225e-06, "loss": 10.0855, "step": 20 }, { "epoch": 0.025974025974025976, "grad_norm": 3.908407211303711, "learning_rate": 8.069164265129683e-06, "loss": 9.9533, "step": 30 }, { "epoch": 0.03463203463203463, "grad_norm": 3.6949715614318848, "learning_rate": 1.0951008645533143e-05, "loss": 9.8609, "step": 40 }, { "epoch": 0.04329004329004329, "grad_norm": 4.507739067077637, "learning_rate": 1.3832853025936602e-05, "loss": 9.6329, "step": 50 }, { "epoch": 0.05194805194805195, "grad_norm": 4.086377143859863, "learning_rate": 1.6714697406340058e-05, "loss": 9.0217, "step": 60 }, { "epoch": 0.06060606060606061, "grad_norm": 3.342482328414917, "learning_rate": 1.9596541786743517e-05, "loss": 8.7152, "step": 70 }, { "epoch": 0.06926406926406926, "grad_norm": 4.084209442138672, "learning_rate": 2.2478386167146976e-05, "loss": 7.9165, "step": 80 }, { "epoch": 0.07792207792207792, "grad_norm": 3.369382619857788, "learning_rate": 2.5360230547550436e-05, "loss": 7.3733, "step": 90 }, { "epoch": 0.08658008658008658, "grad_norm": 2.953098773956299, "learning_rate": 2.824207492795389e-05, "loss": 6.7771, "step": 100 }, { "epoch": 0.09523809523809523, "grad_norm": 2.8739757537841797, "learning_rate": 3.112391930835735e-05, "loss": 6.2224, "step": 110 }, { "epoch": 0.1038961038961039, "grad_norm": 2.5711309909820557, "learning_rate": 3.4005763688760814e-05, "loss": 5.5781, "step": 120 }, { "epoch": 0.11255411255411256, "grad_norm": 2.599085807800293, "learning_rate": 3.688760806916426e-05, "loss": 5.096, "step": 130 }, { "epoch": 0.12121212121212122, "grad_norm": 2.363588333129883, "learning_rate": 3.9769452449567725e-05, "loss": 4.391, "step": 140 }, { "epoch": 0.12987012987012986, "grad_norm": 2.858348846435547, "learning_rate": 4.265129682997118e-05, "loss": 3.9469, "step": 150 }, { "epoch": 0.12987012987012986, "eval_loss": 3.228956460952759, "eval_runtime": 7.8231, "eval_samples_per_second": 14.828, "eval_steps_per_second": 14.828, "step": 150 }, { "epoch": 0.13852813852813853, "grad_norm": 3.251692056655884, "learning_rate": 4.5533141210374644e-05, "loss": 3.5343, "step": 160 }, { "epoch": 0.1471861471861472, "grad_norm": 4.488837242126465, "learning_rate": 4.84149855907781e-05, "loss": 3.1367, "step": 170 }, { "epoch": 0.15584415584415584, "grad_norm": 1.685425043106079, "learning_rate": 5.1296829971181556e-05, "loss": 2.7944, "step": 180 }, { "epoch": 0.1645021645021645, "grad_norm": 1.291522741317749, "learning_rate": 5.417867435158501e-05, "loss": 2.5554, "step": 190 }, { "epoch": 0.17316017316017315, "grad_norm": 4.081550598144531, "learning_rate": 5.7060518731988474e-05, "loss": 2.2346, "step": 200 }, { "epoch": 0.18181818181818182, "grad_norm": 1.1544710397720337, "learning_rate": 5.994236311239193e-05, "loss": 2.1949, "step": 210 }, { "epoch": 0.19047619047619047, "grad_norm": 1.0788459777832031, "learning_rate": 6.28242074927954e-05, "loss": 2.032, "step": 220 }, { "epoch": 0.19913419913419914, "grad_norm": 0.9550963044166565, "learning_rate": 6.570605187319885e-05, "loss": 1.9622, "step": 230 }, { "epoch": 0.2077922077922078, "grad_norm": 1.2657291889190674, "learning_rate": 6.858789625360231e-05, "loss": 1.9345, "step": 240 }, { "epoch": 0.21645021645021645, "grad_norm": 0.8013891577720642, "learning_rate": 7.146974063400576e-05, "loss": 1.8761, "step": 250 }, { "epoch": 0.22510822510822512, "grad_norm": 0.7717137336730957, "learning_rate": 7.435158501440924e-05, "loss": 1.7893, "step": 260 }, { "epoch": 0.23376623376623376, "grad_norm": 1.0486984252929688, "learning_rate": 7.723342939481269e-05, "loss": 1.8113, "step": 270 }, { "epoch": 0.24242424242424243, "grad_norm": 0.8140750527381897, "learning_rate": 8.011527377521614e-05, "loss": 1.7928, "step": 280 }, { "epoch": 0.2510822510822511, "grad_norm": 0.6925544142723083, "learning_rate": 8.29971181556196e-05, "loss": 1.7529, "step": 290 }, { "epoch": 0.2597402597402597, "grad_norm": 0.5724755525588989, "learning_rate": 8.587896253602306e-05, "loss": 1.6537, "step": 300 }, { "epoch": 0.2597402597402597, "eval_loss": 1.7084261178970337, "eval_runtime": 7.8209, "eval_samples_per_second": 14.832, "eval_steps_per_second": 14.832, "step": 300 }, { "epoch": 0.2683982683982684, "grad_norm": 0.4527546763420105, "learning_rate": 8.876080691642652e-05, "loss": 1.7249, "step": 310 }, { "epoch": 0.27705627705627706, "grad_norm": 0.5245671272277832, "learning_rate": 9.164265129682997e-05, "loss": 1.6762, "step": 320 }, { "epoch": 0.2857142857142857, "grad_norm": 0.6595690846443176, "learning_rate": 9.452449567723344e-05, "loss": 1.6373, "step": 330 }, { "epoch": 0.2943722943722944, "grad_norm": 0.5773497223854065, "learning_rate": 9.74063400576369e-05, "loss": 1.669, "step": 340 }, { "epoch": 0.30303030303030304, "grad_norm": 0.5453928112983704, "learning_rate": 9.996792815907634e-05, "loss": 1.6387, "step": 350 }, { "epoch": 0.3116883116883117, "grad_norm": 0.6853697896003723, "learning_rate": 9.964720974983964e-05, "loss": 1.6445, "step": 360 }, { "epoch": 0.3203463203463203, "grad_norm": 0.44910380244255066, "learning_rate": 9.932649134060296e-05, "loss": 1.6044, "step": 370 }, { "epoch": 0.329004329004329, "grad_norm": 0.6204536557197571, "learning_rate": 9.900577293136627e-05, "loss": 1.5821, "step": 380 }, { "epoch": 0.33766233766233766, "grad_norm": 0.45651766657829285, "learning_rate": 9.868505452212958e-05, "loss": 1.6211, "step": 390 }, { "epoch": 0.3463203463203463, "grad_norm": 0.8843691945075989, "learning_rate": 9.836433611289288e-05, "loss": 1.638, "step": 400 }, { "epoch": 0.354978354978355, "grad_norm": 0.4958537817001343, "learning_rate": 9.804361770365619e-05, "loss": 1.5992, "step": 410 }, { "epoch": 0.36363636363636365, "grad_norm": 0.4527323246002197, "learning_rate": 9.77228992944195e-05, "loss": 1.575, "step": 420 }, { "epoch": 0.3722943722943723, "grad_norm": 0.6142332553863525, "learning_rate": 9.740218088518281e-05, "loss": 1.5653, "step": 430 }, { "epoch": 0.38095238095238093, "grad_norm": 0.5613299012184143, "learning_rate": 9.708146247594613e-05, "loss": 1.5683, "step": 440 }, { "epoch": 0.38961038961038963, "grad_norm": 0.5093253254890442, "learning_rate": 9.676074406670943e-05, "loss": 1.5821, "step": 450 }, { "epoch": 0.38961038961038963, "eval_loss": 1.5493597984313965, "eval_runtime": 7.5671, "eval_samples_per_second": 15.329, "eval_steps_per_second": 15.329, "step": 450 }, { "epoch": 0.39826839826839827, "grad_norm": 0.6183823943138123, "learning_rate": 9.644002565747275e-05, "loss": 1.5586, "step": 460 }, { "epoch": 0.4069264069264069, "grad_norm": 0.40400201082229614, "learning_rate": 9.611930724823606e-05, "loss": 1.5051, "step": 470 }, { "epoch": 0.4155844155844156, "grad_norm": 0.41863498091697693, "learning_rate": 9.579858883899936e-05, "loss": 1.5788, "step": 480 }, { "epoch": 0.42424242424242425, "grad_norm": 0.4935775101184845, "learning_rate": 9.547787042976267e-05, "loss": 1.507, "step": 490 }, { "epoch": 0.4329004329004329, "grad_norm": 0.4260643422603607, "learning_rate": 9.515715202052598e-05, "loss": 1.518, "step": 500 }, { "epoch": 0.44155844155844154, "grad_norm": 0.5746622681617737, "learning_rate": 9.483643361128929e-05, "loss": 1.5765, "step": 510 }, { "epoch": 0.45021645021645024, "grad_norm": 0.5225964784622192, "learning_rate": 9.45157152020526e-05, "loss": 1.5021, "step": 520 }, { "epoch": 0.4588744588744589, "grad_norm": 0.5609281659126282, "learning_rate": 9.419499679281592e-05, "loss": 1.5553, "step": 530 }, { "epoch": 0.4675324675324675, "grad_norm": 0.47306525707244873, "learning_rate": 9.387427838357921e-05, "loss": 1.5425, "step": 540 }, { "epoch": 0.47619047619047616, "grad_norm": 0.4314194321632385, "learning_rate": 9.355355997434253e-05, "loss": 1.4717, "step": 550 }, { "epoch": 0.48484848484848486, "grad_norm": 0.8003149032592773, "learning_rate": 9.323284156510584e-05, "loss": 1.5112, "step": 560 }, { "epoch": 0.4935064935064935, "grad_norm": 0.5599727034568787, "learning_rate": 9.291212315586915e-05, "loss": 1.5184, "step": 570 }, { "epoch": 0.5021645021645021, "grad_norm": 0.42898404598236084, "learning_rate": 9.259140474663246e-05, "loss": 1.4819, "step": 580 }, { "epoch": 0.5108225108225108, "grad_norm": 0.4543690085411072, "learning_rate": 9.227068633739577e-05, "loss": 1.5148, "step": 590 }, { "epoch": 0.5194805194805194, "grad_norm": 0.42663097381591797, "learning_rate": 9.194996792815907e-05, "loss": 1.5006, "step": 600 }, { "epoch": 0.5194805194805194, "eval_loss": 1.4994107484817505, "eval_runtime": 7.7698, "eval_samples_per_second": 14.93, "eval_steps_per_second": 14.93, "step": 600 }, { "epoch": 0.5281385281385281, "grad_norm": 0.5133946537971497, "learning_rate": 9.162924951892238e-05, "loss": 1.4678, "step": 610 }, { "epoch": 0.5367965367965368, "grad_norm": 0.4722423553466797, "learning_rate": 9.13085311096857e-05, "loss": 1.4334, "step": 620 }, { "epoch": 0.5454545454545454, "grad_norm": 0.43144020438194275, "learning_rate": 9.098781270044901e-05, "loss": 1.544, "step": 630 }, { "epoch": 0.5541125541125541, "grad_norm": 1.7946276664733887, "learning_rate": 9.066709429121232e-05, "loss": 1.518, "step": 640 }, { "epoch": 0.5627705627705628, "grad_norm": 0.5020509958267212, "learning_rate": 9.034637588197563e-05, "loss": 1.4587, "step": 650 }, { "epoch": 0.5714285714285714, "grad_norm": 0.39891430735588074, "learning_rate": 9.002565747273895e-05, "loss": 1.5042, "step": 660 }, { "epoch": 0.5800865800865801, "grad_norm": 0.4414899945259094, "learning_rate": 8.970493906350225e-05, "loss": 1.4729, "step": 670 }, { "epoch": 0.5887445887445888, "grad_norm": 0.5268612504005432, "learning_rate": 8.938422065426555e-05, "loss": 1.4627, "step": 680 }, { "epoch": 0.5974025974025974, "grad_norm": 0.3689039349555969, "learning_rate": 8.906350224502888e-05, "loss": 1.4954, "step": 690 }, { "epoch": 0.6060606060606061, "grad_norm": 0.5123299956321716, "learning_rate": 8.874278383579217e-05, "loss": 1.4886, "step": 700 }, { "epoch": 0.6147186147186147, "grad_norm": 0.41066890954971313, "learning_rate": 8.842206542655549e-05, "loss": 1.4847, "step": 710 }, { "epoch": 0.6233766233766234, "grad_norm": 0.4995342791080475, "learning_rate": 8.81013470173188e-05, "loss": 1.4533, "step": 720 }, { "epoch": 0.6320346320346321, "grad_norm": 0.75323486328125, "learning_rate": 8.778062860808211e-05, "loss": 1.5261, "step": 730 }, { "epoch": 0.6406926406926406, "grad_norm": 0.4391060173511505, "learning_rate": 8.745991019884542e-05, "loss": 1.4441, "step": 740 }, { "epoch": 0.6493506493506493, "grad_norm": 0.6707803606987, "learning_rate": 8.713919178960874e-05, "loss": 1.4817, "step": 750 }, { "epoch": 0.6493506493506493, "eval_loss": 1.4739664793014526, "eval_runtime": 7.8538, "eval_samples_per_second": 14.77, "eval_steps_per_second": 14.77, "step": 750 }, { "epoch": 0.658008658008658, "grad_norm": 0.39276689291000366, "learning_rate": 8.681847338037203e-05, "loss": 1.4755, "step": 760 }, { "epoch": 0.6666666666666666, "grad_norm": 0.5317443013191223, "learning_rate": 8.649775497113535e-05, "loss": 1.4851, "step": 770 }, { "epoch": 0.6753246753246753, "grad_norm": 0.41005635261535645, "learning_rate": 8.617703656189866e-05, "loss": 1.4603, "step": 780 }, { "epoch": 0.683982683982684, "grad_norm": 0.4464978277683258, "learning_rate": 8.585631815266196e-05, "loss": 1.4544, "step": 790 }, { "epoch": 0.6926406926406926, "grad_norm": 0.5416218638420105, "learning_rate": 8.553559974342528e-05, "loss": 1.4643, "step": 800 }, { "epoch": 0.7012987012987013, "grad_norm": 0.461434930562973, "learning_rate": 8.521488133418859e-05, "loss": 1.4672, "step": 810 }, { "epoch": 0.70995670995671, "grad_norm": 0.4783085882663727, "learning_rate": 8.48941629249519e-05, "loss": 1.4392, "step": 820 }, { "epoch": 0.7186147186147186, "grad_norm": 0.49549704790115356, "learning_rate": 8.45734445157152e-05, "loss": 1.4643, "step": 830 }, { "epoch": 0.7272727272727273, "grad_norm": 0.4395453929901123, "learning_rate": 8.425272610647852e-05, "loss": 1.4702, "step": 840 }, { "epoch": 0.7359307359307359, "grad_norm": 0.4826950430870056, "learning_rate": 8.393200769724182e-05, "loss": 1.4785, "step": 850 }, { "epoch": 0.7445887445887446, "grad_norm": 0.43482276797294617, "learning_rate": 8.361128928800514e-05, "loss": 1.4846, "step": 860 }, { "epoch": 0.7532467532467533, "grad_norm": 0.4471447765827179, "learning_rate": 8.329057087876845e-05, "loss": 1.4608, "step": 870 }, { "epoch": 0.7619047619047619, "grad_norm": 0.4189813733100891, "learning_rate": 8.296985246953174e-05, "loss": 1.4744, "step": 880 }, { "epoch": 0.7705627705627706, "grad_norm": 0.4434950649738312, "learning_rate": 8.264913406029507e-05, "loss": 1.4339, "step": 890 }, { "epoch": 0.7792207792207793, "grad_norm": 0.47065186500549316, "learning_rate": 8.232841565105837e-05, "loss": 1.463, "step": 900 }, { "epoch": 0.7792207792207793, "eval_loss": 1.4551337957382202, "eval_runtime": 7.6143, "eval_samples_per_second": 15.235, "eval_steps_per_second": 15.235, "step": 900 }, { "epoch": 0.7878787878787878, "grad_norm": 0.6143885850906372, "learning_rate": 8.200769724182168e-05, "loss": 1.4465, "step": 910 }, { "epoch": 0.7965367965367965, "grad_norm": 0.4523776173591614, "learning_rate": 8.168697883258499e-05, "loss": 1.483, "step": 920 }, { "epoch": 0.8051948051948052, "grad_norm": 0.4819616377353668, "learning_rate": 8.136626042334831e-05, "loss": 1.4685, "step": 930 }, { "epoch": 0.8138528138528138, "grad_norm": 0.44892895221710205, "learning_rate": 8.10455420141116e-05, "loss": 1.4753, "step": 940 }, { "epoch": 0.8225108225108225, "grad_norm": 0.401432603597641, "learning_rate": 8.072482360487493e-05, "loss": 1.4652, "step": 950 }, { "epoch": 0.8311688311688312, "grad_norm": 0.6020355820655823, "learning_rate": 8.040410519563824e-05, "loss": 1.4731, "step": 960 }, { "epoch": 0.8398268398268398, "grad_norm": 0.43847760558128357, "learning_rate": 8.008338678640154e-05, "loss": 1.4475, "step": 970 }, { "epoch": 0.8484848484848485, "grad_norm": 0.5052961111068726, "learning_rate": 7.976266837716485e-05, "loss": 1.478, "step": 980 }, { "epoch": 0.8571428571428571, "grad_norm": 0.49521583318710327, "learning_rate": 7.944194996792816e-05, "loss": 1.4718, "step": 990 }, { "epoch": 0.8658008658008658, "grad_norm": 0.5364260673522949, "learning_rate": 7.912123155869148e-05, "loss": 1.4448, "step": 1000 }, { "epoch": 0.8744588744588745, "grad_norm": 0.5025216937065125, "learning_rate": 7.880051314945478e-05, "loss": 1.4412, "step": 1010 }, { "epoch": 0.8831168831168831, "grad_norm": 0.5361949801445007, "learning_rate": 7.84797947402181e-05, "loss": 1.466, "step": 1020 }, { "epoch": 0.8917748917748918, "grad_norm": 0.4959454834461212, "learning_rate": 7.81590763309814e-05, "loss": 1.4497, "step": 1030 }, { "epoch": 0.9004329004329005, "grad_norm": 0.4520016014575958, "learning_rate": 7.783835792174471e-05, "loss": 1.4696, "step": 1040 }, { "epoch": 0.9090909090909091, "grad_norm": 0.4341891407966614, "learning_rate": 7.751763951250802e-05, "loss": 1.4861, "step": 1050 }, { "epoch": 0.9090909090909091, "eval_loss": 1.445294737815857, "eval_runtime": 7.7407, "eval_samples_per_second": 14.986, "eval_steps_per_second": 14.986, "step": 1050 }, { "epoch": 0.9177489177489178, "grad_norm": 0.4321749210357666, "learning_rate": 7.719692110327133e-05, "loss": 1.4709, "step": 1060 }, { "epoch": 0.9264069264069265, "grad_norm": 0.4757050573825836, "learning_rate": 7.687620269403464e-05, "loss": 1.4358, "step": 1070 }, { "epoch": 0.935064935064935, "grad_norm": 0.44605541229248047, "learning_rate": 7.655548428479795e-05, "loss": 1.4582, "step": 1080 }, { "epoch": 0.9437229437229437, "grad_norm": 0.9228002429008484, "learning_rate": 7.623476587556127e-05, "loss": 1.4346, "step": 1090 }, { "epoch": 0.9523809523809523, "grad_norm": 0.49421215057373047, "learning_rate": 7.591404746632456e-05, "loss": 1.4995, "step": 1100 }, { "epoch": 0.961038961038961, "grad_norm": 0.47634872794151306, "learning_rate": 7.559332905708789e-05, "loss": 1.4572, "step": 1110 }, { "epoch": 0.9696969696969697, "grad_norm": 0.42080676555633545, "learning_rate": 7.52726106478512e-05, "loss": 1.4603, "step": 1120 }, { "epoch": 0.9783549783549783, "grad_norm": 0.7112604975700378, "learning_rate": 7.49518922386145e-05, "loss": 1.4131, "step": 1130 }, { "epoch": 0.987012987012987, "grad_norm": 0.4389120638370514, "learning_rate": 7.463117382937781e-05, "loss": 1.4665, "step": 1140 }, { "epoch": 0.9956709956709957, "grad_norm": 0.43562325835227966, "learning_rate": 7.431045542014112e-05, "loss": 1.4105, "step": 1150 }, { "epoch": 1.0043290043290043, "grad_norm": 0.5207663178443909, "learning_rate": 7.398973701090443e-05, "loss": 1.4138, "step": 1160 }, { "epoch": 1.0129870129870129, "grad_norm": 0.458304226398468, "learning_rate": 7.366901860166773e-05, "loss": 1.4037, "step": 1170 }, { "epoch": 1.0216450216450217, "grad_norm": 0.44204622507095337, "learning_rate": 7.334830019243106e-05, "loss": 1.45, "step": 1180 }, { "epoch": 1.0303030303030303, "grad_norm": 0.4411581754684448, "learning_rate": 7.302758178319435e-05, "loss": 1.4178, "step": 1190 }, { "epoch": 1.0389610389610389, "grad_norm": 0.4655054807662964, "learning_rate": 7.270686337395767e-05, "loss": 1.435, "step": 1200 }, { "epoch": 1.0389610389610389, "eval_loss": 1.4338457584381104, "eval_runtime": 7.5729, "eval_samples_per_second": 15.318, "eval_steps_per_second": 15.318, "step": 1200 }, { "epoch": 1.0476190476190477, "grad_norm": 0.46722933650016785, "learning_rate": 7.238614496472098e-05, "loss": 1.4056, "step": 1210 }, { "epoch": 1.0562770562770563, "grad_norm": 0.43104156851768494, "learning_rate": 7.206542655548429e-05, "loss": 1.425, "step": 1220 }, { "epoch": 1.0649350649350648, "grad_norm": 0.45806413888931274, "learning_rate": 7.17447081462476e-05, "loss": 1.415, "step": 1230 }, { "epoch": 1.0735930735930737, "grad_norm": 0.4905741512775421, "learning_rate": 7.14239897370109e-05, "loss": 1.4251, "step": 1240 }, { "epoch": 1.0822510822510822, "grad_norm": 0.5820769667625427, "learning_rate": 7.110327132777421e-05, "loss": 1.4423, "step": 1250 }, { "epoch": 1.0909090909090908, "grad_norm": 0.4339599907398224, "learning_rate": 7.078255291853752e-05, "loss": 1.3944, "step": 1260 }, { "epoch": 1.0995670995670996, "grad_norm": 0.4569433331489563, "learning_rate": 7.046183450930084e-05, "loss": 1.4425, "step": 1270 }, { "epoch": 1.1082251082251082, "grad_norm": 0.43175208568573, "learning_rate": 7.014111610006415e-05, "loss": 1.4413, "step": 1280 }, { "epoch": 1.1168831168831168, "grad_norm": 0.4652206003665924, "learning_rate": 6.982039769082746e-05, "loss": 1.4131, "step": 1290 }, { "epoch": 1.1255411255411256, "grad_norm": 0.5452226996421814, "learning_rate": 6.949967928159077e-05, "loss": 1.3971, "step": 1300 }, { "epoch": 1.1341991341991342, "grad_norm": 0.48716047406196594, "learning_rate": 6.917896087235408e-05, "loss": 1.4121, "step": 1310 }, { "epoch": 1.1428571428571428, "grad_norm": 0.495291143655777, "learning_rate": 6.885824246311738e-05, "loss": 1.4392, "step": 1320 }, { "epoch": 1.1515151515151516, "grad_norm": 0.7268972396850586, "learning_rate": 6.853752405388069e-05, "loss": 1.448, "step": 1330 }, { "epoch": 1.1601731601731602, "grad_norm": 0.5051429271697998, "learning_rate": 6.821680564464401e-05, "loss": 1.4455, "step": 1340 }, { "epoch": 1.1688311688311688, "grad_norm": 0.4902680218219757, "learning_rate": 6.789608723540731e-05, "loss": 1.4264, "step": 1350 }, { "epoch": 1.1688311688311688, "eval_loss": 1.4238612651824951, "eval_runtime": 7.7602, "eval_samples_per_second": 14.948, "eval_steps_per_second": 14.948, "step": 1350 }, { "epoch": 1.1774891774891776, "grad_norm": 0.4761177897453308, "learning_rate": 6.757536882617063e-05, "loss": 1.3901, "step": 1360 }, { "epoch": 1.1861471861471862, "grad_norm": 0.5615859031677246, "learning_rate": 6.725465041693394e-05, "loss": 1.452, "step": 1370 }, { "epoch": 1.1948051948051948, "grad_norm": 0.4387504458427429, "learning_rate": 6.693393200769725e-05, "loss": 1.4367, "step": 1380 }, { "epoch": 1.2034632034632033, "grad_norm": 0.45687058568000793, "learning_rate": 6.661321359846055e-05, "loss": 1.3763, "step": 1390 }, { "epoch": 1.2121212121212122, "grad_norm": 0.5605970621109009, "learning_rate": 6.629249518922386e-05, "loss": 1.4052, "step": 1400 }, { "epoch": 1.2207792207792207, "grad_norm": 0.486742228269577, "learning_rate": 6.597177677998717e-05, "loss": 1.3496, "step": 1410 }, { "epoch": 1.2294372294372296, "grad_norm": 0.5142826437950134, "learning_rate": 6.565105837075048e-05, "loss": 1.4467, "step": 1420 }, { "epoch": 1.2380952380952381, "grad_norm": 0.6005675792694092, "learning_rate": 6.53303399615138e-05, "loss": 1.4524, "step": 1430 }, { "epoch": 1.2467532467532467, "grad_norm": 0.45657065510749817, "learning_rate": 6.50096215522771e-05, "loss": 1.3833, "step": 1440 }, { "epoch": 1.2554112554112553, "grad_norm": 0.5361114144325256, "learning_rate": 6.468890314304042e-05, "loss": 1.4584, "step": 1450 }, { "epoch": 1.2640692640692641, "grad_norm": 0.41551673412323, "learning_rate": 6.436818473380373e-05, "loss": 1.4233, "step": 1460 }, { "epoch": 1.2727272727272727, "grad_norm": 0.9184830784797668, "learning_rate": 6.404746632456703e-05, "loss": 1.4636, "step": 1470 }, { "epoch": 1.2813852813852815, "grad_norm": 0.4942251145839691, "learning_rate": 6.372674791533034e-05, "loss": 1.4074, "step": 1480 }, { "epoch": 1.29004329004329, "grad_norm": 0.45169901847839355, "learning_rate": 6.340602950609365e-05, "loss": 1.4324, "step": 1490 }, { "epoch": 1.2987012987012987, "grad_norm": 0.47444090247154236, "learning_rate": 6.308531109685696e-05, "loss": 1.3932, "step": 1500 }, { "epoch": 1.2987012987012987, "eval_loss": 1.4216547012329102, "eval_runtime": 7.7823, "eval_samples_per_second": 14.906, "eval_steps_per_second": 14.906, "step": 1500 }, { "epoch": 1.3073593073593073, "grad_norm": 0.49456027150154114, "learning_rate": 6.276459268762027e-05, "loss": 1.4163, "step": 1510 }, { "epoch": 1.316017316017316, "grad_norm": 0.5237517356872559, "learning_rate": 6.244387427838359e-05, "loss": 1.4241, "step": 1520 }, { "epoch": 1.3246753246753247, "grad_norm": 0.467379629611969, "learning_rate": 6.212315586914688e-05, "loss": 1.3793, "step": 1530 }, { "epoch": 1.3333333333333333, "grad_norm": 0.44650447368621826, "learning_rate": 6.18024374599102e-05, "loss": 1.421, "step": 1540 }, { "epoch": 1.341991341991342, "grad_norm": 0.5066041350364685, "learning_rate": 6.148171905067351e-05, "loss": 1.4078, "step": 1550 }, { "epoch": 1.3506493506493507, "grad_norm": 0.49115797877311707, "learning_rate": 6.116100064143682e-05, "loss": 1.4364, "step": 1560 }, { "epoch": 1.3593073593073592, "grad_norm": 0.447895348072052, "learning_rate": 6.084028223220013e-05, "loss": 1.4204, "step": 1570 }, { "epoch": 1.3679653679653678, "grad_norm": 0.4935031831264496, "learning_rate": 6.0519563822963443e-05, "loss": 1.3989, "step": 1580 }, { "epoch": 1.3766233766233766, "grad_norm": 0.46873730421066284, "learning_rate": 6.0198845413726745e-05, "loss": 1.3977, "step": 1590 }, { "epoch": 1.3852813852813852, "grad_norm": 0.5020815134048462, "learning_rate": 5.987812700449006e-05, "loss": 1.396, "step": 1600 }, { "epoch": 1.393939393939394, "grad_norm": 0.5052680373191833, "learning_rate": 5.9557408595253375e-05, "loss": 1.4509, "step": 1610 }, { "epoch": 1.4025974025974026, "grad_norm": 0.9146791100502014, "learning_rate": 5.923669018601668e-05, "loss": 1.4463, "step": 1620 }, { "epoch": 1.4112554112554112, "grad_norm": 0.6017730832099915, "learning_rate": 5.891597177677999e-05, "loss": 1.4418, "step": 1630 }, { "epoch": 1.4199134199134198, "grad_norm": 0.42603838443756104, "learning_rate": 5.85952533675433e-05, "loss": 1.3932, "step": 1640 }, { "epoch": 1.4285714285714286, "grad_norm": 0.44781237840652466, "learning_rate": 5.8274534958306614e-05, "loss": 1.4122, "step": 1650 }, { "epoch": 1.4285714285714286, "eval_loss": 1.4141463041305542, "eval_runtime": 7.5625, "eval_samples_per_second": 15.339, "eval_steps_per_second": 15.339, "step": 1650 }, { "epoch": 1.4372294372294372, "grad_norm": 0.545901358127594, "learning_rate": 5.7953816549069915e-05, "loss": 1.4365, "step": 1660 }, { "epoch": 1.445887445887446, "grad_norm": 0.6359984874725342, "learning_rate": 5.763309813983323e-05, "loss": 1.4015, "step": 1670 }, { "epoch": 1.4545454545454546, "grad_norm": 0.5338530540466309, "learning_rate": 5.7312379730596545e-05, "loss": 1.4229, "step": 1680 }, { "epoch": 1.4632034632034632, "grad_norm": 0.5224403142929077, "learning_rate": 5.699166132135985e-05, "loss": 1.4568, "step": 1690 }, { "epoch": 1.4718614718614718, "grad_norm": 0.4464894235134125, "learning_rate": 5.667094291212316e-05, "loss": 1.3786, "step": 1700 }, { "epoch": 1.4805194805194806, "grad_norm": 0.5031586289405823, "learning_rate": 5.635022450288647e-05, "loss": 1.4033, "step": 1710 }, { "epoch": 1.4891774891774892, "grad_norm": 0.4978921115398407, "learning_rate": 5.602950609364978e-05, "loss": 1.4008, "step": 1720 }, { "epoch": 1.497835497835498, "grad_norm": 0.4722082316875458, "learning_rate": 5.5708787684413086e-05, "loss": 1.4138, "step": 1730 }, { "epoch": 1.5064935064935066, "grad_norm": 0.49410945177078247, "learning_rate": 5.53880692751764e-05, "loss": 1.3493, "step": 1740 }, { "epoch": 1.5151515151515151, "grad_norm": 0.48314598202705383, "learning_rate": 5.50673508659397e-05, "loss": 1.4261, "step": 1750 }, { "epoch": 1.5238095238095237, "grad_norm": 0.4303835928440094, "learning_rate": 5.474663245670302e-05, "loss": 1.3669, "step": 1760 }, { "epoch": 1.5324675324675323, "grad_norm": 0.6156985759735107, "learning_rate": 5.442591404746633e-05, "loss": 1.4068, "step": 1770 }, { "epoch": 1.5411255411255411, "grad_norm": 0.47915613651275635, "learning_rate": 5.4105195638229634e-05, "loss": 1.4086, "step": 1780 }, { "epoch": 1.54978354978355, "grad_norm": 0.5295699834823608, "learning_rate": 5.378447722899295e-05, "loss": 1.4269, "step": 1790 }, { "epoch": 1.5584415584415585, "grad_norm": 0.503179669380188, "learning_rate": 5.346375881975626e-05, "loss": 1.4062, "step": 1800 }, { "epoch": 1.5584415584415585, "eval_loss": 1.4098143577575684, "eval_runtime": 7.8033, "eval_samples_per_second": 14.865, "eval_steps_per_second": 14.865, "step": 1800 }, { "epoch": 1.567099567099567, "grad_norm": 0.5550847053527832, "learning_rate": 5.3143040410519565e-05, "loss": 1.4071, "step": 1810 }, { "epoch": 1.5757575757575757, "grad_norm": 0.4503953456878662, "learning_rate": 5.282232200128287e-05, "loss": 1.378, "step": 1820 }, { "epoch": 1.5844155844155843, "grad_norm": 0.47239604592323303, "learning_rate": 5.250160359204619e-05, "loss": 1.4089, "step": 1830 }, { "epoch": 1.593073593073593, "grad_norm": 0.49943140149116516, "learning_rate": 5.218088518280949e-05, "loss": 1.3666, "step": 1840 }, { "epoch": 1.601731601731602, "grad_norm": 0.45932552218437195, "learning_rate": 5.1860166773572804e-05, "loss": 1.3963, "step": 1850 }, { "epoch": 1.6103896103896105, "grad_norm": 0.4893176853656769, "learning_rate": 5.153944836433612e-05, "loss": 1.3855, "step": 1860 }, { "epoch": 1.619047619047619, "grad_norm": 0.43340370059013367, "learning_rate": 5.121872995509942e-05, "loss": 1.3968, "step": 1870 }, { "epoch": 1.6277056277056277, "grad_norm": 0.5329946279525757, "learning_rate": 5.0898011545862735e-05, "loss": 1.3931, "step": 1880 }, { "epoch": 1.6363636363636362, "grad_norm": 0.5289266705513, "learning_rate": 5.057729313662605e-05, "loss": 1.3806, "step": 1890 }, { "epoch": 1.645021645021645, "grad_norm": 0.46577054262161255, "learning_rate": 5.025657472738935e-05, "loss": 1.3883, "step": 1900 }, { "epoch": 1.6536796536796536, "grad_norm": 0.6365689635276794, "learning_rate": 4.993585631815266e-05, "loss": 1.465, "step": 1910 }, { "epoch": 1.6623376623376624, "grad_norm": 0.4840717017650604, "learning_rate": 4.9615137908915975e-05, "loss": 1.4014, "step": 1920 }, { "epoch": 1.670995670995671, "grad_norm": 0.4716441035270691, "learning_rate": 4.929441949967928e-05, "loss": 1.3868, "step": 1930 }, { "epoch": 1.6796536796536796, "grad_norm": 0.5497351884841919, "learning_rate": 4.897370109044259e-05, "loss": 1.3977, "step": 1940 }, { "epoch": 1.6883116883116882, "grad_norm": 0.46503710746765137, "learning_rate": 4.8652982681205906e-05, "loss": 1.4178, "step": 1950 }, { "epoch": 1.6883116883116882, "eval_loss": 1.40426504611969, "eval_runtime": 7.8451, "eval_samples_per_second": 14.786, "eval_steps_per_second": 14.786, "step": 1950 }, { "epoch": 1.696969696969697, "grad_norm": 0.46529683470726013, "learning_rate": 4.8332264271969214e-05, "loss": 1.4008, "step": 1960 }, { "epoch": 1.7056277056277056, "grad_norm": 0.4543629288673401, "learning_rate": 4.801154586273252e-05, "loss": 1.3743, "step": 1970 }, { "epoch": 1.7142857142857144, "grad_norm": 0.5630565881729126, "learning_rate": 4.769082745349584e-05, "loss": 1.4285, "step": 1980 }, { "epoch": 1.722943722943723, "grad_norm": 0.5113540887832642, "learning_rate": 4.7370109044259146e-05, "loss": 1.4613, "step": 1990 }, { "epoch": 1.7316017316017316, "grad_norm": 0.4659116864204407, "learning_rate": 4.704939063502245e-05, "loss": 1.3922, "step": 2000 }, { "epoch": 1.7402597402597402, "grad_norm": 0.517657995223999, "learning_rate": 4.672867222578576e-05, "loss": 1.418, "step": 2010 }, { "epoch": 1.7489177489177488, "grad_norm": 0.5077757239341736, "learning_rate": 4.640795381654907e-05, "loss": 1.427, "step": 2020 }, { "epoch": 1.7575757575757576, "grad_norm": 0.44553670287132263, "learning_rate": 4.6087235407312385e-05, "loss": 1.3995, "step": 2030 }, { "epoch": 1.7662337662337664, "grad_norm": 0.5303440690040588, "learning_rate": 4.576651699807569e-05, "loss": 1.4122, "step": 2040 }, { "epoch": 1.774891774891775, "grad_norm": 0.5498613715171814, "learning_rate": 4.5445798588839e-05, "loss": 1.349, "step": 2050 }, { "epoch": 1.7835497835497836, "grad_norm": 0.5696060061454773, "learning_rate": 4.5125080179602316e-05, "loss": 1.3798, "step": 2060 }, { "epoch": 1.7922077922077921, "grad_norm": 0.538739025592804, "learning_rate": 4.4804361770365624e-05, "loss": 1.3867, "step": 2070 }, { "epoch": 1.8008658008658007, "grad_norm": 0.5294226408004761, "learning_rate": 4.448364336112893e-05, "loss": 1.4102, "step": 2080 }, { "epoch": 1.8095238095238095, "grad_norm": 0.6144235134124756, "learning_rate": 4.416292495189224e-05, "loss": 1.4011, "step": 2090 }, { "epoch": 1.8181818181818183, "grad_norm": 0.45938369631767273, "learning_rate": 4.384220654265555e-05, "loss": 1.3728, "step": 2100 }, { "epoch": 1.8181818181818183, "eval_loss": 1.404729962348938, "eval_runtime": 7.7744, "eval_samples_per_second": 14.921, "eval_steps_per_second": 14.921, "step": 2100 }, { "epoch": 1.826839826839827, "grad_norm": 0.5399343371391296, "learning_rate": 4.352148813341886e-05, "loss": 1.4382, "step": 2110 }, { "epoch": 1.8354978354978355, "grad_norm": 0.5021647214889526, "learning_rate": 4.320076972418217e-05, "loss": 1.4053, "step": 2120 }, { "epoch": 1.844155844155844, "grad_norm": 0.5417078137397766, "learning_rate": 4.288005131494548e-05, "loss": 1.4171, "step": 2130 }, { "epoch": 1.8528138528138527, "grad_norm": 0.45010820031166077, "learning_rate": 4.255933290570879e-05, "loss": 1.4057, "step": 2140 }, { "epoch": 1.8614718614718615, "grad_norm": 0.5336911678314209, "learning_rate": 4.22386144964721e-05, "loss": 1.4232, "step": 2150 }, { "epoch": 1.87012987012987, "grad_norm": 0.49677231907844543, "learning_rate": 4.191789608723541e-05, "loss": 1.4024, "step": 2160 }, { "epoch": 1.878787878787879, "grad_norm": 0.626252293586731, "learning_rate": 4.159717767799872e-05, "loss": 1.4063, "step": 2170 }, { "epoch": 1.8874458874458875, "grad_norm": 0.6295285224914551, "learning_rate": 4.127645926876203e-05, "loss": 1.3892, "step": 2180 }, { "epoch": 1.896103896103896, "grad_norm": 0.422695517539978, "learning_rate": 4.0955740859525336e-05, "loss": 1.3829, "step": 2190 }, { "epoch": 1.9047619047619047, "grad_norm": 0.48999500274658203, "learning_rate": 4.063502245028865e-05, "loss": 1.4659, "step": 2200 }, { "epoch": 1.9134199134199135, "grad_norm": 0.5450994372367859, "learning_rate": 4.031430404105196e-05, "loss": 1.3817, "step": 2210 }, { "epoch": 1.922077922077922, "grad_norm": 0.4830107092857361, "learning_rate": 3.999358563181527e-05, "loss": 1.368, "step": 2220 }, { "epoch": 1.9307359307359309, "grad_norm": 0.4606921672821045, "learning_rate": 3.967286722257858e-05, "loss": 1.415, "step": 2230 }, { "epoch": 1.9393939393939394, "grad_norm": 0.442903071641922, "learning_rate": 3.935214881334189e-05, "loss": 1.4027, "step": 2240 }, { "epoch": 1.948051948051948, "grad_norm": 0.6243829727172852, "learning_rate": 3.90314304041052e-05, "loss": 1.4393, "step": 2250 }, { "epoch": 1.948051948051948, "eval_loss": 1.3986151218414307, "eval_runtime": 7.815, "eval_samples_per_second": 14.843, "eval_steps_per_second": 14.843, "step": 2250 }, { "epoch": 1.9567099567099566, "grad_norm": 0.5800577402114868, "learning_rate": 3.8710711994868506e-05, "loss": 1.395, "step": 2260 }, { "epoch": 1.9653679653679652, "grad_norm": 0.47577986121177673, "learning_rate": 3.8389993585631815e-05, "loss": 1.3706, "step": 2270 }, { "epoch": 1.974025974025974, "grad_norm": 0.47002679109573364, "learning_rate": 3.806927517639512e-05, "loss": 1.4082, "step": 2280 }, { "epoch": 1.9826839826839828, "grad_norm": 0.5210914015769958, "learning_rate": 3.774855676715844e-05, "loss": 1.4035, "step": 2290 }, { "epoch": 1.9913419913419914, "grad_norm": 0.46940165758132935, "learning_rate": 3.7427838357921746e-05, "loss": 1.3688, "step": 2300 }, { "epoch": 2.0, "grad_norm": 0.46823203563690186, "learning_rate": 3.7107119948685054e-05, "loss": 1.4031, "step": 2310 }, { "epoch": 2.0086580086580086, "grad_norm": 0.5137255787849426, "learning_rate": 3.678640153944837e-05, "loss": 1.3741, "step": 2320 }, { "epoch": 2.017316017316017, "grad_norm": 0.48361772298812866, "learning_rate": 3.646568313021168e-05, "loss": 1.4079, "step": 2330 }, { "epoch": 2.0259740259740258, "grad_norm": 0.46107912063598633, "learning_rate": 3.6144964720974985e-05, "loss": 1.3965, "step": 2340 }, { "epoch": 2.034632034632035, "grad_norm": 0.5398858785629272, "learning_rate": 3.582424631173829e-05, "loss": 1.3703, "step": 2350 }, { "epoch": 2.0432900432900434, "grad_norm": 0.4744202792644501, "learning_rate": 3.55035279025016e-05, "loss": 1.3912, "step": 2360 }, { "epoch": 2.051948051948052, "grad_norm": 0.48757973313331604, "learning_rate": 3.5182809493264916e-05, "loss": 1.3599, "step": 2370 }, { "epoch": 2.0606060606060606, "grad_norm": 0.45649003982543945, "learning_rate": 3.4862091084028225e-05, "loss": 1.3833, "step": 2380 }, { "epoch": 2.069264069264069, "grad_norm": 0.5607898235321045, "learning_rate": 3.454137267479153e-05, "loss": 1.3749, "step": 2390 }, { "epoch": 2.0779220779220777, "grad_norm": 0.5641899704933167, "learning_rate": 3.422065426555485e-05, "loss": 1.3525, "step": 2400 }, { "epoch": 2.0779220779220777, "eval_loss": 1.39604914188385, "eval_runtime": 7.7836, "eval_samples_per_second": 14.903, "eval_steps_per_second": 14.903, "step": 2400 }, { "epoch": 2.0865800865800868, "grad_norm": 0.5425224304199219, "learning_rate": 3.3899935856318156e-05, "loss": 1.3309, "step": 2410 }, { "epoch": 2.0952380952380953, "grad_norm": 0.5572715401649475, "learning_rate": 3.3579217447081464e-05, "loss": 1.3868, "step": 2420 }, { "epoch": 2.103896103896104, "grad_norm": 0.4905586242675781, "learning_rate": 3.325849903784478e-05, "loss": 1.3527, "step": 2430 }, { "epoch": 2.1125541125541125, "grad_norm": 0.5391650795936584, "learning_rate": 3.293778062860808e-05, "loss": 1.3944, "step": 2440 }, { "epoch": 2.121212121212121, "grad_norm": 0.5208508372306824, "learning_rate": 3.261706221937139e-05, "loss": 1.3427, "step": 2450 }, { "epoch": 2.1298701298701297, "grad_norm": 0.5472680926322937, "learning_rate": 3.2296343810134703e-05, "loss": 1.3859, "step": 2460 }, { "epoch": 2.1385281385281387, "grad_norm": 0.607253909111023, "learning_rate": 3.197562540089801e-05, "loss": 1.4454, "step": 2470 }, { "epoch": 2.1471861471861473, "grad_norm": 0.49181562662124634, "learning_rate": 3.165490699166132e-05, "loss": 1.3663, "step": 2480 }, { "epoch": 2.155844155844156, "grad_norm": 0.5393516421318054, "learning_rate": 3.1334188582424635e-05, "loss": 1.4011, "step": 2490 }, { "epoch": 2.1645021645021645, "grad_norm": 0.5270664095878601, "learning_rate": 3.101347017318794e-05, "loss": 1.3797, "step": 2500 }, { "epoch": 2.173160173160173, "grad_norm": 0.49387580156326294, "learning_rate": 3.069275176395125e-05, "loss": 1.4065, "step": 2510 }, { "epoch": 2.1818181818181817, "grad_norm": 0.5828717947006226, "learning_rate": 3.0372033354714562e-05, "loss": 1.3756, "step": 2520 }, { "epoch": 2.1904761904761907, "grad_norm": 0.48174533247947693, "learning_rate": 3.005131494547787e-05, "loss": 1.3564, "step": 2530 }, { "epoch": 2.1991341991341993, "grad_norm": 0.48883873224258423, "learning_rate": 2.9730596536241186e-05, "loss": 1.3918, "step": 2540 }, { "epoch": 2.207792207792208, "grad_norm": 0.49527278542518616, "learning_rate": 2.9409878127004494e-05, "loss": 1.4049, "step": 2550 }, { "epoch": 2.207792207792208, "eval_loss": 1.39372980594635, "eval_runtime": 7.8154, "eval_samples_per_second": 14.843, "eval_steps_per_second": 14.843, "step": 2550 }, { "epoch": 2.2164502164502164, "grad_norm": 0.550302267074585, "learning_rate": 2.90891597177678e-05, "loss": 1.366, "step": 2560 }, { "epoch": 2.225108225108225, "grad_norm": 0.5304882526397705, "learning_rate": 2.8768441308531113e-05, "loss": 1.3969, "step": 2570 }, { "epoch": 2.2337662337662336, "grad_norm": 0.6370409727096558, "learning_rate": 2.844772289929442e-05, "loss": 1.4069, "step": 2580 }, { "epoch": 2.242424242424242, "grad_norm": 0.46794188022613525, "learning_rate": 2.812700449005773e-05, "loss": 1.3755, "step": 2590 }, { "epoch": 2.2510822510822512, "grad_norm": 0.5697752237319946, "learning_rate": 2.780628608082104e-05, "loss": 1.3703, "step": 2600 }, { "epoch": 2.25974025974026, "grad_norm": 0.532133936882019, "learning_rate": 2.748556767158435e-05, "loss": 1.3802, "step": 2610 }, { "epoch": 2.2683982683982684, "grad_norm": 0.5815490484237671, "learning_rate": 2.7164849262347658e-05, "loss": 1.4311, "step": 2620 }, { "epoch": 2.277056277056277, "grad_norm": 1.1725358963012695, "learning_rate": 2.6844130853110973e-05, "loss": 1.407, "step": 2630 }, { "epoch": 2.2857142857142856, "grad_norm": 0.5177101492881775, "learning_rate": 2.652341244387428e-05, "loss": 1.3759, "step": 2640 }, { "epoch": 2.2943722943722946, "grad_norm": 0.504612922668457, "learning_rate": 2.6202694034637585e-05, "loss": 1.3887, "step": 2650 }, { "epoch": 2.303030303030303, "grad_norm": 0.5126393437385559, "learning_rate": 2.58819756254009e-05, "loss": 1.3625, "step": 2660 }, { "epoch": 2.311688311688312, "grad_norm": 0.5162597894668579, "learning_rate": 2.556125721616421e-05, "loss": 1.3741, "step": 2670 }, { "epoch": 2.3203463203463204, "grad_norm": 0.5071930885314941, "learning_rate": 2.5240538806927517e-05, "loss": 1.353, "step": 2680 }, { "epoch": 2.329004329004329, "grad_norm": 0.5131155252456665, "learning_rate": 2.4919820397690828e-05, "loss": 1.3619, "step": 2690 }, { "epoch": 2.3376623376623376, "grad_norm": 0.5172668099403381, "learning_rate": 2.4599101988454136e-05, "loss": 1.361, "step": 2700 }, { "epoch": 2.3376623376623376, "eval_loss": 1.3935595750808716, "eval_runtime": 7.7819, "eval_samples_per_second": 14.906, "eval_steps_per_second": 14.906, "step": 2700 }, { "epoch": 2.346320346320346, "grad_norm": 0.49953222274780273, "learning_rate": 2.4278383579217448e-05, "loss": 1.3728, "step": 2710 }, { "epoch": 2.354978354978355, "grad_norm": 0.5227655172348022, "learning_rate": 2.395766516998076e-05, "loss": 1.3976, "step": 2720 }, { "epoch": 2.3636363636363638, "grad_norm": 0.5078625679016113, "learning_rate": 2.3636946760744068e-05, "loss": 1.3796, "step": 2730 }, { "epoch": 2.3722943722943723, "grad_norm": 0.5609903335571289, "learning_rate": 2.3316228351507376e-05, "loss": 1.356, "step": 2740 }, { "epoch": 2.380952380952381, "grad_norm": 0.5937998294830322, "learning_rate": 2.2995509942270687e-05, "loss": 1.3559, "step": 2750 }, { "epoch": 2.3896103896103895, "grad_norm": 0.5346037149429321, "learning_rate": 2.2674791533034e-05, "loss": 1.4105, "step": 2760 }, { "epoch": 2.398268398268398, "grad_norm": 0.5979208946228027, "learning_rate": 2.2354073123797307e-05, "loss": 1.4008, "step": 2770 }, { "epoch": 2.4069264069264067, "grad_norm": 0.6183347105979919, "learning_rate": 2.2033354714560615e-05, "loss": 1.4082, "step": 2780 }, { "epoch": 2.4155844155844157, "grad_norm": 0.5043891668319702, "learning_rate": 2.1712636305323927e-05, "loss": 1.3702, "step": 2790 }, { "epoch": 2.4242424242424243, "grad_norm": 0.6056050062179565, "learning_rate": 2.1391917896087235e-05, "loss": 1.3674, "step": 2800 }, { "epoch": 2.432900432900433, "grad_norm": 0.47270849347114563, "learning_rate": 2.1071199486850546e-05, "loss": 1.406, "step": 2810 }, { "epoch": 2.4415584415584415, "grad_norm": 0.5534608960151672, "learning_rate": 2.0750481077613858e-05, "loss": 1.3391, "step": 2820 }, { "epoch": 2.45021645021645, "grad_norm": 0.49758604168891907, "learning_rate": 2.0429762668377166e-05, "loss": 1.3806, "step": 2830 }, { "epoch": 2.458874458874459, "grad_norm": 0.47173675894737244, "learning_rate": 2.0109044259140474e-05, "loss": 1.4138, "step": 2840 }, { "epoch": 2.4675324675324677, "grad_norm": 0.6245967745780945, "learning_rate": 1.9788325849903786e-05, "loss": 1.3951, "step": 2850 }, { "epoch": 2.4675324675324677, "eval_loss": 1.3923684358596802, "eval_runtime": 7.6685, "eval_samples_per_second": 15.127, "eval_steps_per_second": 15.127, "step": 2850 }, { "epoch": 2.4761904761904763, "grad_norm": 0.7148988842964172, "learning_rate": 1.9467607440667097e-05, "loss": 1.404, "step": 2860 }, { "epoch": 2.484848484848485, "grad_norm": 0.6005236506462097, "learning_rate": 1.9146889031430406e-05, "loss": 1.3621, "step": 2870 }, { "epoch": 2.4935064935064934, "grad_norm": 0.5608522891998291, "learning_rate": 1.8826170622193714e-05, "loss": 1.3523, "step": 2880 }, { "epoch": 2.502164502164502, "grad_norm": 0.48156052827835083, "learning_rate": 1.8505452212957025e-05, "loss": 1.3447, "step": 2890 }, { "epoch": 2.5108225108225106, "grad_norm": 0.49435439705848694, "learning_rate": 1.8184733803720337e-05, "loss": 1.3732, "step": 2900 }, { "epoch": 2.5194805194805197, "grad_norm": 0.5171784162521362, "learning_rate": 1.7864015394483645e-05, "loss": 1.3816, "step": 2910 }, { "epoch": 2.5281385281385282, "grad_norm": 0.5172585844993591, "learning_rate": 1.7543296985246953e-05, "loss": 1.3507, "step": 2920 }, { "epoch": 2.536796536796537, "grad_norm": 0.5661709308624268, "learning_rate": 1.7222578576010265e-05, "loss": 1.4172, "step": 2930 }, { "epoch": 2.5454545454545454, "grad_norm": 0.5081381797790527, "learning_rate": 1.6901860166773573e-05, "loss": 1.4172, "step": 2940 }, { "epoch": 2.554112554112554, "grad_norm": 0.6050851345062256, "learning_rate": 1.6581141757536884e-05, "loss": 1.4198, "step": 2950 }, { "epoch": 2.562770562770563, "grad_norm": 0.5615077614784241, "learning_rate": 1.6260423348300192e-05, "loss": 1.3538, "step": 2960 }, { "epoch": 2.571428571428571, "grad_norm": 0.48784783482551575, "learning_rate": 1.59397049390635e-05, "loss": 1.361, "step": 2970 }, { "epoch": 2.58008658008658, "grad_norm": 0.5115649104118347, "learning_rate": 1.5618986529826812e-05, "loss": 1.3774, "step": 2980 }, { "epoch": 2.588744588744589, "grad_norm": 0.5294427871704102, "learning_rate": 1.5298268120590124e-05, "loss": 1.3469, "step": 2990 }, { "epoch": 2.5974025974025974, "grad_norm": 0.5069863796234131, "learning_rate": 1.4977549711353434e-05, "loss": 1.3643, "step": 3000 }, { "epoch": 2.5974025974025974, "eval_loss": 1.3886290788650513, "eval_runtime": 7.5687, "eval_samples_per_second": 15.326, "eval_steps_per_second": 15.326, "step": 3000 }, { "epoch": 2.606060606060606, "grad_norm": 0.5608567595481873, "learning_rate": 1.4656831302116742e-05, "loss": 1.3865, "step": 3010 }, { "epoch": 2.6147186147186146, "grad_norm": 0.5187973380088806, "learning_rate": 1.4336112892880052e-05, "loss": 1.3766, "step": 3020 }, { "epoch": 2.6233766233766236, "grad_norm": 0.5815955400466919, "learning_rate": 1.4015394483643363e-05, "loss": 1.3686, "step": 3030 }, { "epoch": 2.632034632034632, "grad_norm": 0.6289973855018616, "learning_rate": 1.3694676074406671e-05, "loss": 1.3718, "step": 3040 }, { "epoch": 2.6406926406926408, "grad_norm": 0.4538356363773346, "learning_rate": 1.3373957665169981e-05, "loss": 1.3807, "step": 3050 }, { "epoch": 2.6493506493506493, "grad_norm": 0.4869168996810913, "learning_rate": 1.3053239255933291e-05, "loss": 1.3828, "step": 3060 }, { "epoch": 2.658008658008658, "grad_norm": 0.49561557173728943, "learning_rate": 1.2732520846696603e-05, "loss": 1.3629, "step": 3070 }, { "epoch": 2.6666666666666665, "grad_norm": 0.5569724440574646, "learning_rate": 1.241180243745991e-05, "loss": 1.3523, "step": 3080 }, { "epoch": 2.675324675324675, "grad_norm": 0.5685627460479736, "learning_rate": 1.209108402822322e-05, "loss": 1.334, "step": 3090 }, { "epoch": 2.683982683982684, "grad_norm": 0.6472695469856262, "learning_rate": 1.177036561898653e-05, "loss": 1.3661, "step": 3100 }, { "epoch": 2.6926406926406927, "grad_norm": 0.5198913216590881, "learning_rate": 1.144964720974984e-05, "loss": 1.3965, "step": 3110 }, { "epoch": 2.7012987012987013, "grad_norm": 0.4987531900405884, "learning_rate": 1.112892880051315e-05, "loss": 1.3748, "step": 3120 }, { "epoch": 2.70995670995671, "grad_norm": 0.5096495747566223, "learning_rate": 1.080821039127646e-05, "loss": 1.332, "step": 3130 }, { "epoch": 2.7186147186147185, "grad_norm": 0.5957316160202026, "learning_rate": 1.048749198203977e-05, "loss": 1.3886, "step": 3140 }, { "epoch": 2.7272727272727275, "grad_norm": 0.5314722061157227, "learning_rate": 1.016677357280308e-05, "loss": 1.4061, "step": 3150 }, { "epoch": 2.7272727272727275, "eval_loss": 1.3869280815124512, "eval_runtime": 7.6381, "eval_samples_per_second": 15.187, "eval_steps_per_second": 15.187, "step": 3150 }, { "epoch": 2.7359307359307357, "grad_norm": 0.4673473536968231, "learning_rate": 9.84605516356639e-06, "loss": 1.3534, "step": 3160 }, { "epoch": 2.7445887445887447, "grad_norm": 0.5401672720909119, "learning_rate": 9.5253367543297e-06, "loss": 1.3426, "step": 3170 }, { "epoch": 2.7532467532467533, "grad_norm": 0.8116175532341003, "learning_rate": 9.20461834509301e-06, "loss": 1.4182, "step": 3180 }, { "epoch": 2.761904761904762, "grad_norm": 0.48323142528533936, "learning_rate": 8.883899935856319e-06, "loss": 1.3711, "step": 3190 }, { "epoch": 2.7705627705627704, "grad_norm": 0.48122236132621765, "learning_rate": 8.563181526619627e-06, "loss": 1.4349, "step": 3200 }, { "epoch": 2.779220779220779, "grad_norm": 0.5143867135047913, "learning_rate": 8.242463117382939e-06, "loss": 1.3888, "step": 3210 }, { "epoch": 2.787878787878788, "grad_norm": 0.5092139840126038, "learning_rate": 7.921744708146247e-06, "loss": 1.364, "step": 3220 }, { "epoch": 2.7965367965367967, "grad_norm": 0.5889108180999756, "learning_rate": 7.6010262989095584e-06, "loss": 1.3903, "step": 3230 }, { "epoch": 2.8051948051948052, "grad_norm": 0.5337643623352051, "learning_rate": 7.2803078896728674e-06, "loss": 1.3593, "step": 3240 }, { "epoch": 2.813852813852814, "grad_norm": 0.5285552740097046, "learning_rate": 6.959589480436178e-06, "loss": 1.3478, "step": 3250 }, { "epoch": 2.8225108225108224, "grad_norm": 0.540852427482605, "learning_rate": 6.638871071199487e-06, "loss": 1.4235, "step": 3260 }, { "epoch": 2.8311688311688314, "grad_norm": 0.5818207263946533, "learning_rate": 6.318152661962796e-06, "loss": 1.3333, "step": 3270 }, { "epoch": 2.8398268398268396, "grad_norm": 0.5971714854240417, "learning_rate": 5.997434252726107e-06, "loss": 1.3919, "step": 3280 }, { "epoch": 2.8484848484848486, "grad_norm": 0.5817723274230957, "learning_rate": 5.676715843489417e-06, "loss": 1.4027, "step": 3290 }, { "epoch": 2.857142857142857, "grad_norm": 0.8135156035423279, "learning_rate": 5.3559974342527265e-06, "loss": 1.4073, "step": 3300 }, { "epoch": 2.857142857142857, "eval_loss": 1.3866829872131348, "eval_runtime": 7.8013, "eval_samples_per_second": 14.869, "eval_steps_per_second": 14.869, "step": 3300 }, { "epoch": 2.865800865800866, "grad_norm": 0.5037099719047546, "learning_rate": 5.035279025016036e-06, "loss": 1.3707, "step": 3310 }, { "epoch": 2.8744588744588744, "grad_norm": 0.5332845449447632, "learning_rate": 4.714560615779346e-06, "loss": 1.3677, "step": 3320 }, { "epoch": 2.883116883116883, "grad_norm": 0.5143232941627502, "learning_rate": 4.393842206542656e-06, "loss": 1.375, "step": 3330 }, { "epoch": 2.891774891774892, "grad_norm": 0.5839101672172546, "learning_rate": 4.073123797305965e-06, "loss": 1.3671, "step": 3340 }, { "epoch": 2.9004329004329006, "grad_norm": 0.559463620185852, "learning_rate": 3.752405388069275e-06, "loss": 1.3806, "step": 3350 }, { "epoch": 2.909090909090909, "grad_norm": 0.541130781173706, "learning_rate": 3.431686978832585e-06, "loss": 1.3764, "step": 3360 }, { "epoch": 2.9177489177489178, "grad_norm": 0.5569273233413696, "learning_rate": 3.110968569595895e-06, "loss": 1.3454, "step": 3370 }, { "epoch": 2.9264069264069263, "grad_norm": 0.530331552028656, "learning_rate": 2.790250160359205e-06, "loss": 1.3539, "step": 3380 }, { "epoch": 2.935064935064935, "grad_norm": 0.6500270366668701, "learning_rate": 2.4695317511225143e-06, "loss": 1.3368, "step": 3390 }, { "epoch": 2.9437229437229435, "grad_norm": 0.5059459805488586, "learning_rate": 2.148813341885824e-06, "loss": 1.3411, "step": 3400 }, { "epoch": 2.9523809523809526, "grad_norm": 0.511215329170227, "learning_rate": 1.8280949326491342e-06, "loss": 1.3461, "step": 3410 }, { "epoch": 2.961038961038961, "grad_norm": 0.5307567119598389, "learning_rate": 1.5073765234124439e-06, "loss": 1.3705, "step": 3420 }, { "epoch": 2.9696969696969697, "grad_norm": 0.5198990702629089, "learning_rate": 1.1866581141757537e-06, "loss": 1.3744, "step": 3430 }, { "epoch": 2.9783549783549783, "grad_norm": 0.4826680123806, "learning_rate": 8.659397049390636e-07, "loss": 1.3278, "step": 3440 }, { "epoch": 2.987012987012987, "grad_norm": 0.5612112283706665, "learning_rate": 5.452212957023733e-07, "loss": 1.3663, "step": 3450 }, { "epoch": 2.987012987012987, "eval_loss": 1.3869423866271973, "eval_runtime": 7.5995, "eval_samples_per_second": 15.264, "eval_steps_per_second": 15.264, "step": 3450 }, { "epoch": 2.995670995670996, "grad_norm": 0.5130652189254761, "learning_rate": 2.2450288646568314e-07, "loss": 1.3678, "step": 3460 } ], "logging_steps": 10, "max_steps": 3465, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 150, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 5.870615814733824e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }