{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 300, "global_step": 2241, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.013391362571141614, "grad_norm": 1.1251516342163086, "learning_rate": 2.0000000000000003e-06, "loss": 2.1230167388916015, "step": 10 }, { "epoch": 0.026782725142283227, "grad_norm": 1.4087316989898682, "learning_rate": 4.222222222222223e-06, "loss": 2.060458946228027, "step": 20 }, { "epoch": 0.040174087713424844, "grad_norm": 1.6200941801071167, "learning_rate": 6.4444444444444445e-06, "loss": 2.076141929626465, "step": 30 }, { "epoch": 0.053565450284566454, "grad_norm": 1.388713002204895, "learning_rate": 8.666666666666668e-06, "loss": 2.0496809005737306, "step": 40 }, { "epoch": 0.06695681285570806, "grad_norm": 1.3109877109527588, "learning_rate": 1.088888888888889e-05, "loss": 2.1139976501464846, "step": 50 }, { "epoch": 0.08034817542684969, "grad_norm": 0.8334707617759705, "learning_rate": 1.3111111111111113e-05, "loss": 1.8950347900390625, "step": 60 }, { "epoch": 0.0937395379979913, "grad_norm": 0.8505852222442627, "learning_rate": 1.5333333333333334e-05, "loss": 1.795738410949707, "step": 70 }, { "epoch": 0.10713090056913291, "grad_norm": 0.9232431650161743, "learning_rate": 1.7555555555555556e-05, "loss": 1.710242462158203, "step": 80 }, { "epoch": 0.12052226314027452, "grad_norm": 0.8113048076629639, "learning_rate": 1.9777777777777778e-05, "loss": 1.7132640838623048, "step": 90 }, { "epoch": 0.13391362571141613, "grad_norm": 0.8083556294441223, "learning_rate": 2.2000000000000003e-05, "loss": 1.690536880493164, "step": 100 }, { "epoch": 0.14730498828255775, "grad_norm": 0.673184335231781, "learning_rate": 2.4222222222222224e-05, "loss": 1.5726326942443847, "step": 110 }, { "epoch": 0.16069635085369938, "grad_norm": 0.963398814201355, "learning_rate": 2.6444444444444443e-05, "loss": 1.3888358116149901, "step": 120 }, { "epoch": 0.17408771342484097, "grad_norm": 0.6759088635444641, "learning_rate": 2.8666666666666668e-05, "loss": 1.3290005683898927, "step": 130 }, { "epoch": 0.1874790759959826, "grad_norm": 0.844614565372467, "learning_rate": 3.088888888888889e-05, "loss": 1.2599190711975097, "step": 140 }, { "epoch": 0.2008704385671242, "grad_norm": 0.6923516988754272, "learning_rate": 3.311111111111112e-05, "loss": 1.2773826599121094, "step": 150 }, { "epoch": 0.21426180113826582, "grad_norm": 0.7745124101638794, "learning_rate": 3.5333333333333336e-05, "loss": 1.2277652740478515, "step": 160 }, { "epoch": 0.22765316370940744, "grad_norm": 1.0810950994491577, "learning_rate": 3.7555555555555554e-05, "loss": 1.2010490417480468, "step": 170 }, { "epoch": 0.24104452628054904, "grad_norm": 0.7222780585289001, "learning_rate": 3.977777777777778e-05, "loss": 1.1438576698303222, "step": 180 }, { "epoch": 0.25443588885169066, "grad_norm": 0.9007810950279236, "learning_rate": 4.2e-05, "loss": 1.1083187103271483, "step": 190 }, { "epoch": 0.26782725142283226, "grad_norm": 0.7866023182868958, "learning_rate": 4.422222222222222e-05, "loss": 1.0768976211547852, "step": 200 }, { "epoch": 0.2812186139939739, "grad_norm": 0.8120918273925781, "learning_rate": 4.644444444444445e-05, "loss": 1.1097023963928223, "step": 210 }, { "epoch": 0.2946099765651155, "grad_norm": 0.9135192036628723, "learning_rate": 4.866666666666667e-05, "loss": 1.119042205810547, "step": 220 }, { "epoch": 0.3080013391362571, "grad_norm": 0.8874865770339966, "learning_rate": 4.9999514323288454e-05, "loss": 0.980173397064209, "step": 230 }, { "epoch": 0.32139270170739875, "grad_norm": 0.8983038067817688, "learning_rate": 4.999405067699773e-05, "loss": 0.970307731628418, "step": 240 }, { "epoch": 0.33478406427854035, "grad_norm": 0.9653483033180237, "learning_rate": 4.998251761970997e-05, "loss": 1.032784652709961, "step": 250 }, { "epoch": 0.34817542684968195, "grad_norm": 1.141289472579956, "learning_rate": 4.996491795204623e-05, "loss": 0.9785713195800781, "step": 260 }, { "epoch": 0.36156678942082354, "grad_norm": 1.0336418151855469, "learning_rate": 4.9941255947808224e-05, "loss": 0.9411398887634277, "step": 270 }, { "epoch": 0.3749581519919652, "grad_norm": 0.9689179062843323, "learning_rate": 4.991153735294049e-05, "loss": 1.0034279823303223, "step": 280 }, { "epoch": 0.3883495145631068, "grad_norm": 0.8199458718299866, "learning_rate": 4.987576938413504e-05, "loss": 0.9443310737609864, "step": 290 }, { "epoch": 0.4017408771342484, "grad_norm": 1.082461953163147, "learning_rate": 4.9833960727078975e-05, "loss": 0.9262508392333985, "step": 300 }, { "epoch": 0.4017408771342484, "eval_loss": 1.022187352180481, "eval_runtime": 54.3223, "eval_samples_per_second": 12.223, "eval_steps_per_second": 12.223, "step": 300 }, { "epoch": 0.41513223970539004, "grad_norm": 1.213780164718628, "learning_rate": 4.9786121534345265e-05, "loss": 0.9448966979980469, "step": 310 }, { "epoch": 0.42852360227653163, "grad_norm": 1.0836976766586304, "learning_rate": 4.9732263422927315e-05, "loss": 1.0215834617614745, "step": 320 }, { "epoch": 0.44191496484767323, "grad_norm": 0.8629345893859863, "learning_rate": 4.967239947141803e-05, "loss": 0.9825343132019043, "step": 330 }, { "epoch": 0.4553063274188149, "grad_norm": 1.254758596420288, "learning_rate": 4.960654421683386e-05, "loss": 0.8087763786315918, "step": 340 }, { "epoch": 0.4686976899899565, "grad_norm": 1.1041864156723022, "learning_rate": 4.9534713651084696e-05, "loss": 0.8968398094177246, "step": 350 }, { "epoch": 0.4820890525610981, "grad_norm": 1.221664309501648, "learning_rate": 4.94569252170905e-05, "loss": 0.9529605865478515, "step": 360 }, { "epoch": 0.4954804151322397, "grad_norm": 1.0954457521438599, "learning_rate": 4.937319780454559e-05, "loss": 0.9047369003295899, "step": 370 }, { "epoch": 0.5088717777033813, "grad_norm": 1.3573025465011597, "learning_rate": 4.9283551745331534e-05, "loss": 0.9805423736572265, "step": 380 }, { "epoch": 0.5222631402745229, "grad_norm": 1.2266513109207153, "learning_rate": 4.9188008808579914e-05, "loss": 0.9189679145812988, "step": 390 }, { "epoch": 0.5356545028456645, "grad_norm": 1.1925843954086304, "learning_rate": 4.9086592195385974e-05, "loss": 0.8736061096191406, "step": 400 }, { "epoch": 0.5490458654168061, "grad_norm": 0.9948152899742126, "learning_rate": 4.89793265331747e-05, "loss": 0.8509424209594727, "step": 410 }, { "epoch": 0.5624372279879478, "grad_norm": 1.0283681154251099, "learning_rate": 4.886623786972033e-05, "loss": 0.8601439476013184, "step": 420 }, { "epoch": 0.5758285905590894, "grad_norm": 0.9124083518981934, "learning_rate": 4.874735366682115e-05, "loss": 0.8764433860778809, "step": 430 }, { "epoch": 0.589219953130231, "grad_norm": 1.104988932609558, "learning_rate": 4.8622702793630756e-05, "loss": 0.8691943168640137, "step": 440 }, { "epoch": 0.6026113157013726, "grad_norm": 1.0378754138946533, "learning_rate": 4.849231551964771e-05, "loss": 0.8470947265625, "step": 450 }, { "epoch": 0.6160026782725142, "grad_norm": 0.9452361464500427, "learning_rate": 4.8356223507364996e-05, "loss": 0.872993278503418, "step": 460 }, { "epoch": 0.6293940408436558, "grad_norm": 1.0585964918136597, "learning_rate": 4.821445980458134e-05, "loss": 0.8613449096679687, "step": 470 }, { "epoch": 0.6427854034147975, "grad_norm": 0.962693989276886, "learning_rate": 4.8067058836376044e-05, "loss": 0.8473030090332031, "step": 480 }, { "epoch": 0.6561767659859391, "grad_norm": 1.213151216506958, "learning_rate": 4.791405639674941e-05, "loss": 0.8945110321044922, "step": 490 }, { "epoch": 0.6695681285570807, "grad_norm": 1.098382592201233, "learning_rate": 4.775548963993072e-05, "loss": 0.8379823684692382, "step": 500 }, { "epoch": 0.6829594911282223, "grad_norm": 1.2232801914215088, "learning_rate": 4.759139707135592e-05, "loss": 0.8914398193359375, "step": 510 }, { "epoch": 0.6963508536993639, "grad_norm": 1.1614588499069214, "learning_rate": 4.742181853831721e-05, "loss": 0.7714352130889892, "step": 520 }, { "epoch": 0.7097422162705055, "grad_norm": 1.0375906229019165, "learning_rate": 4.724679522028672e-05, "loss": 0.8399144172668457, "step": 530 }, { "epoch": 0.7231335788416471, "grad_norm": 1.6367172002792358, "learning_rate": 4.706636961891673e-05, "loss": 0.8434115409851074, "step": 540 }, { "epoch": 0.7365249414127888, "grad_norm": 1.4899160861968994, "learning_rate": 4.6880585547718845e-05, "loss": 0.8600223541259766, "step": 550 }, { "epoch": 0.7499163039839304, "grad_norm": 1.3136088848114014, "learning_rate": 4.668948812142453e-05, "loss": 0.8417681694030762, "step": 560 }, { "epoch": 0.763307666555072, "grad_norm": 1.5014512538909912, "learning_rate": 4.649312374502976e-05, "loss": 0.8598422050476074, "step": 570 }, { "epoch": 0.7766990291262136, "grad_norm": 1.1034916639328003, "learning_rate": 4.6291540102526235e-05, "loss": 0.82028169631958, "step": 580 }, { "epoch": 0.7900903916973552, "grad_norm": 1.0077992677688599, "learning_rate": 4.608478614532215e-05, "loss": 0.8477327346801757, "step": 590 }, { "epoch": 0.8034817542684968, "grad_norm": 1.4599281549453735, "learning_rate": 4.587291208035503e-05, "loss": 0.7847702503204346, "step": 600 }, { "epoch": 0.8034817542684968, "eval_loss": 0.8773947954177856, "eval_runtime": 54.0516, "eval_samples_per_second": 12.285, "eval_steps_per_second": 12.285, "step": 600 }, { "epoch": 0.8168731168396385, "grad_norm": 1.3578146696090698, "learning_rate": 4.5655969357899874e-05, "loss": 0.8327409744262695, "step": 610 }, { "epoch": 0.8302644794107801, "grad_norm": 1.1919622421264648, "learning_rate": 4.543401065907516e-05, "loss": 0.8041424751281738, "step": 620 }, { "epoch": 0.8436558419819217, "grad_norm": 1.1500847339630127, "learning_rate": 4.5207089883050136e-05, "loss": 0.7486717224121093, "step": 630 }, { "epoch": 0.8570472045530633, "grad_norm": 1.1832966804504395, "learning_rate": 4.497526213395623e-05, "loss": 0.8147689819335937, "step": 640 }, { "epoch": 0.8704385671242049, "grad_norm": 1.350236415863037, "learning_rate": 4.4738583707505885e-05, "loss": 0.7860679626464844, "step": 650 }, { "epoch": 0.8838299296953465, "grad_norm": 1.2207894325256348, "learning_rate": 4.4497112077322044e-05, "loss": 0.8117258071899414, "step": 660 }, { "epoch": 0.8972212922664882, "grad_norm": 1.0513477325439453, "learning_rate": 4.4250905880981574e-05, "loss": 0.7919021129608155, "step": 670 }, { "epoch": 0.9106126548376298, "grad_norm": 1.3217025995254517, "learning_rate": 4.400002490577604e-05, "loss": 0.8166803359985352, "step": 680 }, { "epoch": 0.9240040174087714, "grad_norm": 1.1715842485427856, "learning_rate": 4.374453007419336e-05, "loss": 0.7445796012878418, "step": 690 }, { "epoch": 0.937395379979913, "grad_norm": 1.4749701023101807, "learning_rate": 4.3484483429123656e-05, "loss": 0.866641616821289, "step": 700 }, { "epoch": 0.9507867425510546, "grad_norm": 1.17747962474823, "learning_rate": 4.3219948118793214e-05, "loss": 0.7444936275482178, "step": 710 }, { "epoch": 0.9641781051221961, "grad_norm": 1.2830913066864014, "learning_rate": 4.295098838142985e-05, "loss": 0.8117733955383301, "step": 720 }, { "epoch": 0.9775694676933377, "grad_norm": 1.336511492729187, "learning_rate": 4.267766952966369e-05, "loss": 0.7992856979370118, "step": 730 }, { "epoch": 0.9909608302644795, "grad_norm": 1.4292641878128052, "learning_rate": 4.240005793466709e-05, "loss": 0.7759786605834961, "step": 740 }, { "epoch": 1.0040174087713425, "grad_norm": 1.2945338487625122, "learning_rate": 4.211822101003734e-05, "loss": 0.8514230728149415, "step": 750 }, { "epoch": 1.0174087713424842, "grad_norm": 1.1430498361587524, "learning_rate": 4.183222719542643e-05, "loss": 0.7180036544799805, "step": 760 }, { "epoch": 1.0308001339136257, "grad_norm": 1.380825400352478, "learning_rate": 4.154214593992149e-05, "loss": 0.7814423084259033, "step": 770 }, { "epoch": 1.0441914964847674, "grad_norm": 1.2941365242004395, "learning_rate": 4.1248047685180215e-05, "loss": 0.7181880950927735, "step": 780 }, { "epoch": 1.0575828590559089, "grad_norm": 1.4261479377746582, "learning_rate": 4.095000384832522e-05, "loss": 0.7421597480773926, "step": 790 }, { "epoch": 1.0709742216270506, "grad_norm": 1.4144198894500732, "learning_rate": 4.064808680460148e-05, "loss": 0.7506948947906494, "step": 800 }, { "epoch": 1.084365584198192, "grad_norm": 1.3969988822937012, "learning_rate": 4.034236986980119e-05, "loss": 0.7060422897338867, "step": 810 }, { "epoch": 1.0977569467693338, "grad_norm": 1.485485315322876, "learning_rate": 4.0032927282460146e-05, "loss": 0.7774518966674805, "step": 820 }, { "epoch": 1.1111483093404755, "grad_norm": 1.787782073020935, "learning_rate": 3.9719834185830116e-05, "loss": 0.8183602333068848, "step": 830 }, { "epoch": 1.124539671911617, "grad_norm": 1.1777045726776123, "learning_rate": 3.940316660963147e-05, "loss": 0.740683126449585, "step": 840 }, { "epoch": 1.1379310344827587, "grad_norm": 1.3298629522323608, "learning_rate": 3.908300145159055e-05, "loss": 0.7469647884368896, "step": 850 }, { "epoch": 1.1513223970539002, "grad_norm": 1.3478955030441284, "learning_rate": 3.875941645876631e-05, "loss": 0.7432316780090332, "step": 860 }, { "epoch": 1.1647137596250419, "grad_norm": 1.2774122953414917, "learning_rate": 3.84324902086706e-05, "loss": 0.7554194927215576, "step": 870 }, { "epoch": 1.1781051221961834, "grad_norm": 1.4324496984481812, "learning_rate": 3.810230209018694e-05, "loss": 0.7671016216278076, "step": 880 }, { "epoch": 1.191496484767325, "grad_norm": 1.7440871000289917, "learning_rate": 3.7768932284292146e-05, "loss": 0.7613705158233642, "step": 890 }, { "epoch": 1.2048878473384668, "grad_norm": 1.281699538230896, "learning_rate": 3.74324617445856e-05, "loss": 0.6879847049713135, "step": 900 }, { "epoch": 1.2048878473384668, "eval_loss": 0.8266693353652954, "eval_runtime": 53.6628, "eval_samples_per_second": 12.374, "eval_steps_per_second": 12.374, "step": 900 }, { "epoch": 1.2182792099096083, "grad_norm": 1.360567569732666, "learning_rate": 3.7092972177631e-05, "loss": 0.693269157409668, "step": 910 }, { "epoch": 1.23167057248075, "grad_norm": 1.8303319215774536, "learning_rate": 3.6750546023115216e-05, "loss": 0.7522525310516357, "step": 920 }, { "epoch": 1.2450619350518914, "grad_norm": 1.4251999855041504, "learning_rate": 3.6405266433829075e-05, "loss": 0.6977858066558837, "step": 930 }, { "epoch": 1.2584532976230332, "grad_norm": 1.5451791286468506, "learning_rate": 3.6057217255475034e-05, "loss": 0.7128232479095459, "step": 940 }, { "epoch": 1.2718446601941746, "grad_norm": 1.4011023044586182, "learning_rate": 3.570648300630657e-05, "loss": 0.7067931175231934, "step": 950 }, { "epoch": 1.2852360227653163, "grad_norm": 1.397749662399292, "learning_rate": 3.535314885660426e-05, "loss": 0.7212980270385743, "step": 960 }, { "epoch": 1.298627385336458, "grad_norm": 1.23228919506073, "learning_rate": 3.499730060799352e-05, "loss": 0.6783730506896972, "step": 970 }, { "epoch": 1.3120187479075995, "grad_norm": 1.3948746919631958, "learning_rate": 3.463902467260905e-05, "loss": 0.7117942333221435, "step": 980 }, { "epoch": 1.3254101104787412, "grad_norm": 1.3566443920135498, "learning_rate": 3.4278408052110946e-05, "loss": 0.7409574508666992, "step": 990 }, { "epoch": 1.338801473049883, "grad_norm": 1.3537638187408447, "learning_rate": 3.391553831655782e-05, "loss": 0.7592925548553466, "step": 1000 }, { "epoch": 1.3521928356210244, "grad_norm": 1.3646985292434692, "learning_rate": 3.355050358314172e-05, "loss": 0.7301356315612793, "step": 1010 }, { "epoch": 1.365584198192166, "grad_norm": 1.3367135524749756, "learning_rate": 3.318339249479026e-05, "loss": 0.7809906482696534, "step": 1020 }, { "epoch": 1.3789755607633076, "grad_norm": 1.567679524421692, "learning_rate": 3.281429419864112e-05, "loss": 0.6707557201385498, "step": 1030 }, { "epoch": 1.3923669233344493, "grad_norm": 1.8063384294509888, "learning_rate": 3.244329832439404e-05, "loss": 0.7046602725982666, "step": 1040 }, { "epoch": 1.4057582859055908, "grad_norm": 1.3105945587158203, "learning_rate": 3.207049496254569e-05, "loss": 0.758818244934082, "step": 1050 }, { "epoch": 1.4191496484767325, "grad_norm": 1.470205545425415, "learning_rate": 3.1695974642512585e-05, "loss": 0.7399599075317382, "step": 1060 }, { "epoch": 1.4325410110478742, "grad_norm": 1.3003753423690796, "learning_rate": 3.131982831064744e-05, "loss": 0.7131163120269776, "step": 1070 }, { "epoch": 1.4459323736190157, "grad_norm": 1.6275579929351807, "learning_rate": 3.094214730815433e-05, "loss": 0.6929296493530274, "step": 1080 }, { "epoch": 1.4593237361901574, "grad_norm": 1.5746970176696777, "learning_rate": 3.056302334890786e-05, "loss": 0.7268266677856445, "step": 1090 }, { "epoch": 1.472715098761299, "grad_norm": 2.2328906059265137, "learning_rate": 3.0182548497181946e-05, "loss": 0.6977500438690185, "step": 1100 }, { "epoch": 1.4861064613324406, "grad_norm": 1.3399721384048462, "learning_rate": 2.980081514529341e-05, "loss": 0.7302239894866943, "step": 1110 }, { "epoch": 1.499497823903582, "grad_norm": 1.4288753271102905, "learning_rate": 2.9417915991166008e-05, "loss": 0.7567366600036621, "step": 1120 }, { "epoch": 1.5128891864747238, "grad_norm": 1.75603449344635, "learning_rate": 2.903394401582017e-05, "loss": 0.7654183387756348, "step": 1130 }, { "epoch": 1.5262805490458655, "grad_norm": 1.3314752578735352, "learning_rate": 2.8648992460794056e-05, "loss": 0.7135534763336182, "step": 1140 }, { "epoch": 1.539671911617007, "grad_norm": 1.4941315650939941, "learning_rate": 2.8263154805501297e-05, "loss": 0.7175502300262451, "step": 1150 }, { "epoch": 1.5530632741881485, "grad_norm": 1.3964297771453857, "learning_rate": 2.787652474453097e-05, "loss": 0.6766695976257324, "step": 1160 }, { "epoch": 1.5664546367592904, "grad_norm": 1.5959055423736572, "learning_rate": 2.748919616489542e-05, "loss": 0.7289943218231201, "step": 1170 }, { "epoch": 1.579845999330432, "grad_norm": 1.670637607574463, "learning_rate": 2.710126312323119e-05, "loss": 0.7110982418060303, "step": 1180 }, { "epoch": 1.5932373619015734, "grad_norm": 1.6263046264648438, "learning_rate": 2.6712819822958917e-05, "loss": 0.6757009029388428, "step": 1190 }, { "epoch": 1.606628724472715, "grad_norm": 1.5645346641540527, "learning_rate": 2.632396059140749e-05, "loss": 0.6717938899993896, "step": 1200 }, { "epoch": 1.606628724472715, "eval_loss": 0.7993327975273132, "eval_runtime": 53.7389, "eval_samples_per_second": 12.356, "eval_steps_per_second": 12.356, "step": 1200 }, { "epoch": 1.6200200870438568, "grad_norm": 1.5552890300750732, "learning_rate": 2.593477985690815e-05, "loss": 0.7486276626586914, "step": 1210 }, { "epoch": 1.6334114496149983, "grad_norm": 1.6185609102249146, "learning_rate": 2.5545372125864032e-05, "loss": 0.6816000938415527, "step": 1220 }, { "epoch": 1.6468028121861398, "grad_norm": 1.3382222652435303, "learning_rate": 2.515583195980084e-05, "loss": 0.6346513271331787, "step": 1230 }, { "epoch": 1.6601941747572817, "grad_norm": 1.7194113731384277, "learning_rate": 2.4766253952404024e-05, "loss": 0.7409485340118408, "step": 1240 }, { "epoch": 1.6735855373284232, "grad_norm": 1.340211272239685, "learning_rate": 2.4376732706548183e-05, "loss": 0.7009283542633057, "step": 1250 }, { "epoch": 1.6869768998995647, "grad_norm": 1.3874890804290771, "learning_rate": 2.3987362811324298e-05, "loss": 0.6419552803039551, "step": 1260 }, { "epoch": 1.7003682624707064, "grad_norm": 1.1811823844909668, "learning_rate": 2.3598238819070202e-05, "loss": 0.7221670150756836, "step": 1270 }, { "epoch": 1.713759625041848, "grad_norm": 1.9249383211135864, "learning_rate": 2.3209455222410122e-05, "loss": 0.6979920864105225, "step": 1280 }, { "epoch": 1.7271509876129896, "grad_norm": 1.743878960609436, "learning_rate": 2.2821106431308544e-05, "loss": 0.7516108512878418, "step": 1290 }, { "epoch": 1.7405423501841313, "grad_norm": 1.7867244482040405, "learning_rate": 2.2433286750144293e-05, "loss": 0.6997213363647461, "step": 1300 }, { "epoch": 1.753933712755273, "grad_norm": 1.5474790334701538, "learning_rate": 2.204609035481018e-05, "loss": 0.7326123714447021, "step": 1310 }, { "epoch": 1.7673250753264145, "grad_norm": 1.6504864692687988, "learning_rate": 2.1659611269843906e-05, "loss": 0.7474339008331299, "step": 1320 }, { "epoch": 1.780716437897556, "grad_norm": 1.4319754838943481, "learning_rate": 2.1273943345595637e-05, "loss": 0.7082053661346436, "step": 1330 }, { "epoch": 1.7941078004686977, "grad_norm": 1.4845492839813232, "learning_rate": 2.0889180235437976e-05, "loss": 0.7185158252716064, "step": 1340 }, { "epoch": 1.8074991630398394, "grad_norm": 1.6886359453201294, "learning_rate": 2.0505415373023684e-05, "loss": 0.7255223274230957, "step": 1350 }, { "epoch": 1.8208905256109809, "grad_norm": 1.462658166885376, "learning_rate": 2.0122741949596797e-05, "loss": 0.678316307067871, "step": 1360 }, { "epoch": 1.8342818881821226, "grad_norm": 1.6203972101211548, "learning_rate": 1.9741252891362612e-05, "loss": 0.7009586334228516, "step": 1370 }, { "epoch": 1.8476732507532643, "grad_norm": 1.6375197172164917, "learning_rate": 1.936104083692202e-05, "loss": 0.711057710647583, "step": 1380 }, { "epoch": 1.8610646133244058, "grad_norm": 1.4735863208770752, "learning_rate": 1.8982198114775682e-05, "loss": 0.753815746307373, "step": 1390 }, { "epoch": 1.8744559758955472, "grad_norm": 1.4079184532165527, "learning_rate": 1.86048167209035e-05, "loss": 0.7394311428070068, "step": 1400 }, { "epoch": 1.887847338466689, "grad_norm": 1.1998661756515503, "learning_rate": 1.8228988296424877e-05, "loss": 0.6970119953155518, "step": 1410 }, { "epoch": 1.9012387010378307, "grad_norm": 1.4150874614715576, "learning_rate": 1.7854804105345062e-05, "loss": 0.7221133708953857, "step": 1420 }, { "epoch": 1.9146300636089721, "grad_norm": 1.9703272581100464, "learning_rate": 1.7482355012393177e-05, "loss": 0.6811443328857422, "step": 1430 }, { "epoch": 1.9280214261801139, "grad_norm": 1.3968387842178345, "learning_rate": 1.711173146095712e-05, "loss": 0.6836700439453125, "step": 1440 }, { "epoch": 1.9414127887512556, "grad_norm": 1.778705358505249, "learning_rate": 1.6743023451120832e-05, "loss": 0.729839277267456, "step": 1450 }, { "epoch": 1.954804151322397, "grad_norm": 1.753574252128601, "learning_rate": 1.637632051780917e-05, "loss": 0.7108103275299072, "step": 1460 }, { "epoch": 1.9681955138935385, "grad_norm": 1.5915656089782715, "learning_rate": 1.6011711709045813e-05, "loss": 0.6830355167388916, "step": 1470 }, { "epoch": 1.9815868764646802, "grad_norm": 1.4856032133102417, "learning_rate": 1.5649285564329296e-05, "loss": 0.6683127880096436, "step": 1480 }, { "epoch": 1.994978239035822, "grad_norm": 1.5113037824630737, "learning_rate": 1.5289130093132632e-05, "loss": 0.6894254684448242, "step": 1490 }, { "epoch": 2.008034817542685, "grad_norm": 1.2598875761032104, "learning_rate": 1.4931332753531574e-05, "loss": 0.7270267486572266, "step": 1500 }, { "epoch": 2.008034817542685, "eval_loss": 0.7799016833305359, "eval_runtime": 53.8556, "eval_samples_per_second": 12.329, "eval_steps_per_second": 12.329, "step": 1500 }, { "epoch": 2.0214261801138265, "grad_norm": 1.647517204284668, "learning_rate": 1.4575980430966807e-05, "loss": 0.6441567897796631, "step": 1510 }, { "epoch": 2.0348175426849684, "grad_norm": 1.5853488445281982, "learning_rate": 1.4223159417145179e-05, "loss": 0.6234518527984619, "step": 1520 }, { "epoch": 2.04820890525611, "grad_norm": 1.6781729459762573, "learning_rate": 1.387295538908519e-05, "loss": 0.6324089527130127, "step": 1530 }, { "epoch": 2.0616002678272514, "grad_norm": 1.4559346437454224, "learning_rate": 1.3525453388311554e-05, "loss": 0.7007440090179443, "step": 1540 }, { "epoch": 2.074991630398393, "grad_norm": 1.4268717765808105, "learning_rate": 1.318073780020433e-05, "loss": 0.6957920074462891, "step": 1550 }, { "epoch": 2.088382992969535, "grad_norm": 1.7965197563171387, "learning_rate": 1.2838892333507154e-05, "loss": 0.6843597888946533, "step": 1560 }, { "epoch": 2.1017743555406763, "grad_norm": 1.6434122323989868, "learning_rate": 1.2500000000000006e-05, "loss": 0.641016960144043, "step": 1570 }, { "epoch": 2.1151657181118177, "grad_norm": 1.5839534997940063, "learning_rate": 1.2164143094340993e-05, "loss": 0.5900714874267579, "step": 1580 }, { "epoch": 2.1285570806829597, "grad_norm": 1.3161916732788086, "learning_rate": 1.183140317408248e-05, "loss": 0.6945799350738525, "step": 1590 }, { "epoch": 2.141948443254101, "grad_norm": 1.5822694301605225, "learning_rate": 1.1501861039866094e-05, "loss": 0.6906570434570313, "step": 1600 }, { "epoch": 2.1553398058252426, "grad_norm": 1.6532809734344482, "learning_rate": 1.1175596715801515e-05, "loss": 0.7173725128173828, "step": 1610 }, { "epoch": 2.168731168396384, "grad_norm": 1.806372046470642, "learning_rate": 1.0852689430033972e-05, "loss": 0.6307380676269532, "step": 1620 }, { "epoch": 2.182122530967526, "grad_norm": 1.7923976182937622, "learning_rate": 1.0533217595504858e-05, "loss": 0.65055832862854, "step": 1630 }, { "epoch": 2.1955138935386675, "grad_norm": 1.5243982076644897, "learning_rate": 1.0217258790910448e-05, "loss": 0.635548210144043, "step": 1640 }, { "epoch": 2.208905256109809, "grad_norm": 1.9043457508087158, "learning_rate": 9.90488974186306e-06, "loss": 0.6788571357727051, "step": 1650 }, { "epoch": 2.222296618680951, "grad_norm": 1.3352289199829102, "learning_rate": 9.596186302259563e-06, "loss": 0.6936195373535157, "step": 1660 }, { "epoch": 2.2356879812520924, "grad_norm": 1.5376029014587402, "learning_rate": 9.291223435861318e-06, "loss": 0.6575944900512696, "step": 1670 }, { "epoch": 2.249079343823234, "grad_norm": 1.5691180229187012, "learning_rate": 8.99007519809053e-06, "loss": 0.6259189128875733, "step": 1680 }, { "epoch": 2.2624707063943754, "grad_norm": 1.382432460784912, "learning_rate": 8.69281471804698e-06, "loss": 0.6597430229187011, "step": 1690 }, { "epoch": 2.2758620689655173, "grad_norm": 1.8340421915054321, "learning_rate": 8.399514180749795e-06, "loss": 0.6881356716156006, "step": 1700 }, { "epoch": 2.289253431536659, "grad_norm": 1.7811270952224731, "learning_rate": 8.110244809608495e-06, "loss": 0.6642444610595704, "step": 1710 }, { "epoch": 2.3026447941078003, "grad_norm": 1.4019266366958618, "learning_rate": 7.825076849127458e-06, "loss": 0.6552130222320557, "step": 1720 }, { "epoch": 2.3160361566789422, "grad_norm": 1.4278745651245117, "learning_rate": 7.5440795478481815e-06, "loss": 0.6528130054473877, "step": 1730 }, { "epoch": 2.3294275192500837, "grad_norm": 1.4227335453033447, "learning_rate": 7.26732114153334e-06, "loss": 0.6589642524719238, "step": 1740 }, { "epoch": 2.342818881821225, "grad_norm": 1.4000329971313477, "learning_rate": 6.99486883659684e-06, "loss": 0.677797269821167, "step": 1750 }, { "epoch": 2.3562102443923667, "grad_norm": 1.4296038150787354, "learning_rate": 6.72678879378377e-06, "loss": 0.6286413192749023, "step": 1760 }, { "epoch": 2.3696016069635086, "grad_norm": 1.8827868700027466, "learning_rate": 6.463146112104332e-06, "loss": 0.6587582111358643, "step": 1770 }, { "epoch": 2.38299296953465, "grad_norm": 1.996030569076538, "learning_rate": 6.204004813025568e-06, "loss": 0.6844182014465332, "step": 1780 }, { "epoch": 2.3963843321057916, "grad_norm": 1.7106478214263916, "learning_rate": 5.949427824924731e-06, "loss": 0.680266284942627, "step": 1790 }, { "epoch": 2.4097756946769335, "grad_norm": 1.4984078407287598, "learning_rate": 5.699476967808168e-06, "loss": 0.6131497859954834, "step": 1800 }, { "epoch": 2.4097756946769335, "eval_loss": 0.7755688428878784, "eval_runtime": 53.8672, "eval_samples_per_second": 12.327, "eval_steps_per_second": 12.327, "step": 1800 }, { "epoch": 2.423167057248075, "grad_norm": 1.5627659559249878, "learning_rate": 5.454212938299255e-06, "loss": 0.6224833488464355, "step": 1810 }, { "epoch": 2.4365584198192165, "grad_norm": 1.5051418542861938, "learning_rate": 5.2136952948992346e-06, "loss": 0.6476008892059326, "step": 1820 }, { "epoch": 2.449949782390358, "grad_norm": 1.4398276805877686, "learning_rate": 4.977982443524304e-06, "loss": 0.6809599876403809, "step": 1830 }, { "epoch": 2.4633411449615, "grad_norm": 1.5645432472229004, "learning_rate": 4.747131623322737e-06, "loss": 0.6530858993530273, "step": 1840 }, { "epoch": 2.4767325075326414, "grad_norm": 1.5863847732543945, "learning_rate": 4.521198892775203e-06, "loss": 0.683343505859375, "step": 1850 }, { "epoch": 2.490123870103783, "grad_norm": 1.8528956174850464, "learning_rate": 4.3002391160818775e-06, "loss": 0.6594698905944825, "step": 1860 }, { "epoch": 2.503515232674925, "grad_norm": 1.7349070310592651, "learning_rate": 4.0843059498395065e-06, "loss": 0.6450272083282471, "step": 1870 }, { "epoch": 2.5169065952460663, "grad_norm": 1.7238874435424805, "learning_rate": 3.873451830011795e-06, "loss": 0.6686948776245117, "step": 1880 }, { "epoch": 2.530297957817208, "grad_norm": 1.7201752662658691, "learning_rate": 3.66772795919611e-06, "loss": 0.6779526710510254, "step": 1890 }, { "epoch": 2.5436893203883493, "grad_norm": 1.8537648916244507, "learning_rate": 3.4671842941897765e-06, "loss": 0.6612625598907471, "step": 1900 }, { "epoch": 2.557080682959491, "grad_norm": 1.8143243789672852, "learning_rate": 3.27186953385884e-06, "loss": 0.688960599899292, "step": 1910 }, { "epoch": 2.5704720455306327, "grad_norm": 1.7363539934158325, "learning_rate": 3.081831107312308e-06, "loss": 0.6001778602600097, "step": 1920 }, { "epoch": 2.5838634081017746, "grad_norm": 1.6225067377090454, "learning_rate": 2.8971151623847587e-06, "loss": 0.6114172458648681, "step": 1930 }, { "epoch": 2.597254770672916, "grad_norm": 1.894216775894165, "learning_rate": 2.717766554430043e-06, "loss": 0.6248059749603272, "step": 1940 }, { "epoch": 2.6106461332440576, "grad_norm": 1.4052571058273315, "learning_rate": 2.543828835428899e-06, "loss": 0.6594170570373535, "step": 1950 }, { "epoch": 2.624037495815199, "grad_norm": 1.518526554107666, "learning_rate": 2.3753442434129997e-06, "loss": 0.6457861423492431, "step": 1960 }, { "epoch": 2.6374288583863406, "grad_norm": 1.4106321334838867, "learning_rate": 2.212353692208172e-06, "loss": 0.6338630676269531, "step": 1970 }, { "epoch": 2.6508202209574825, "grad_norm": 1.7220522165298462, "learning_rate": 2.0548967614990507e-06, "loss": 0.6565276145935058, "step": 1980 }, { "epoch": 2.664211583528624, "grad_norm": 1.791856050491333, "learning_rate": 1.9030116872178316e-06, "loss": 0.6439648628234863, "step": 1990 }, { "epoch": 2.677602946099766, "grad_norm": 1.4954824447631836, "learning_rate": 1.7567353522592477e-06, "loss": 0.6367751598358155, "step": 2000 }, { "epoch": 2.6909943086709074, "grad_norm": 1.70801842212677, "learning_rate": 1.6161032775241503e-06, "loss": 0.6390559673309326, "step": 2010 }, { "epoch": 2.704385671242049, "grad_norm": 1.5347399711608887, "learning_rate": 1.4811496132938196e-06, "loss": 0.6345593452453613, "step": 2020 }, { "epoch": 2.7177770338131904, "grad_norm": 1.6422340869903564, "learning_rate": 1.3519071309370996e-06, "loss": 0.6990837097167969, "step": 2030 }, { "epoch": 2.731168396384332, "grad_norm": 1.6097452640533447, "learning_rate": 1.2284072149524094e-06, "loss": 0.6425330638885498, "step": 2040 }, { "epoch": 2.7445597589554738, "grad_norm": 1.6756435632705688, "learning_rate": 1.1106798553464804e-06, "loss": 0.6584507465362549, "step": 2050 }, { "epoch": 2.7579511215266153, "grad_norm": 1.7100108861923218, "learning_rate": 9.98753640351785e-07, "loss": 0.6514320850372315, "step": 2060 }, { "epoch": 2.771342484097757, "grad_norm": 1.662879228591919, "learning_rate": 8.926557494843085e-07, "loss": 0.6387072086334229, "step": 2070 }, { "epoch": 2.7847338466688987, "grad_norm": 1.6631816625595093, "learning_rate": 7.924119469434665e-07, "loss": 0.6538697719573975, "step": 2080 }, { "epoch": 2.79812520924004, "grad_norm": 1.4830073118209839, "learning_rate": 6.980465753556376e-07, "loss": 0.6062188625335694, "step": 2090 }, { "epoch": 2.8115165718111816, "grad_norm": 1.6122359037399292, "learning_rate": 6.095825498629692e-07, "loss": 0.6518032550811768, "step": 2100 }, { "epoch": 2.8115165718111816, "eval_loss": 0.7737736701965332, "eval_runtime": 53.7285, "eval_samples_per_second": 12.358, "eval_steps_per_second": 12.358, "step": 2100 }, { "epoch": 2.824907934382323, "grad_norm": 1.8782823085784912, "learning_rate": 5.270413525587909e-07, "loss": 0.7114206790924072, "step": 2110 }, { "epoch": 2.838299296953465, "grad_norm": 1.9547419548034668, "learning_rate": 4.5044302727100806e-07, "loss": 0.6745511054992676, "step": 2120 }, { "epoch": 2.8516906595246065, "grad_norm": 1.7238478660583496, "learning_rate": 3.7980617469479953e-07, "loss": 0.6630192279815674, "step": 2130 }, { "epoch": 2.8650820220957485, "grad_norm": 1.986541986465454, "learning_rate": 3.1514794787571854e-07, "loss": 0.677086067199707, "step": 2140 }, { "epoch": 2.87847338466689, "grad_norm": 1.5200341939926147, "learning_rate": 2.564840480443503e-07, "loss": 0.6238405227661132, "step": 2150 }, { "epoch": 2.8918647472380314, "grad_norm": 1.6327656507492065, "learning_rate": 2.0382872080351166e-07, "loss": 0.6561053276062012, "step": 2160 }, { "epoch": 2.905256109809173, "grad_norm": 1.5526694059371948, "learning_rate": 1.571947526689349e-07, "loss": 0.6776777744293213, "step": 2170 }, { "epoch": 2.918647472380315, "grad_norm": 1.7482457160949707, "learning_rate": 1.1659346796426551e-07, "loss": 0.6567188739776612, "step": 2180 }, { "epoch": 2.9320388349514563, "grad_norm": 1.7278902530670166, "learning_rate": 8.203472607112295e-08, "loss": 0.6143332958221436, "step": 2190 }, { "epoch": 2.945430197522598, "grad_norm": 1.835852861404419, "learning_rate": 5.352691903491303e-08, "loss": 0.6747828960418701, "step": 2200 }, { "epoch": 2.9588215600937398, "grad_norm": 1.778841495513916, "learning_rate": 3.107696952694139e-08, "loss": 0.6927904605865478, "step": 2210 }, { "epoch": 2.9722129226648812, "grad_norm": 1.5548834800720215, "learning_rate": 1.4690329163363769e-08, "loss": 0.629932975769043, "step": 2220 }, { "epoch": 2.9856042852360227, "grad_norm": 1.3981481790542603, "learning_rate": 4.370977181339386e-09, "loss": 0.657701063156128, "step": 2230 }, { "epoch": 2.998995647807164, "grad_norm": 1.709903359413147, "learning_rate": 1.214194727400253e-10, "loss": 0.6368677139282226, "step": 2240 }, { "epoch": 3.0, "eval_loss": 0.7736465334892273, "eval_runtime": 53.8484, "eval_samples_per_second": 12.331, "eval_steps_per_second": 12.331, "step": 2241 }, { "epoch": 3.0, "step": 2241, "total_flos": 6.028442138942669e+16, "train_loss": 0.8150908792992353, "train_runtime": 6217.0342, "train_samples_per_second": 2.883, "train_steps_per_second": 0.36 } ], "logging_steps": 10, "max_steps": 2241, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 300, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 6.028442138942669e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }