{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.0746536769268814, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 7.465367692688139e-05, "grad_norm": 41.25, "learning_rate": 0.0, "loss": 1.8824537992477417, "step": 1 }, { "epoch": 0.0007465367692688139, "grad_norm": 45.0, "learning_rate": 1.5000000000000002e-07, "loss": 2.0482389662000866, "step": 10 }, { "epoch": 0.0014930735385376278, "grad_norm": 47.0, "learning_rate": 3.166666666666667e-07, "loss": 2.0073740005493166, "step": 20 }, { "epoch": 0.0022396103078064417, "grad_norm": 52.5, "learning_rate": 4.833333333333334e-07, "loss": 2.002447319030762, "step": 30 }, { "epoch": 0.0029861470770752557, "grad_norm": 40.75, "learning_rate": 6.5e-07, "loss": 1.9365406036376953, "step": 40 }, { "epoch": 0.0037326838463440696, "grad_norm": 48.75, "learning_rate": 8.166666666666668e-07, "loss": 1.8309831619262695, "step": 50 }, { "epoch": 0.0044792206156128835, "grad_norm": 30.625, "learning_rate": 9.833333333333334e-07, "loss": 1.6815044403076171, "step": 60 }, { "epoch": 0.005225757384881697, "grad_norm": 32.5, "learning_rate": 1.1500000000000002e-06, "loss": 1.5275766372680664, "step": 70 }, { "epoch": 0.005972294154150511, "grad_norm": 29.375, "learning_rate": 1.3166666666666666e-06, "loss": 1.3091348648071288, "step": 80 }, { "epoch": 0.006718830923419325, "grad_norm": 23.25, "learning_rate": 1.4833333333333337e-06, "loss": 1.044612979888916, "step": 90 }, { "epoch": 0.007465367692688139, "grad_norm": 11.375, "learning_rate": 1.6500000000000003e-06, "loss": 0.8313380241394043, "step": 100 }, { "epoch": 0.008211904461956953, "grad_norm": 6.03125, "learning_rate": 1.816666666666667e-06, "loss": 0.6549209594726563, "step": 110 }, { "epoch": 0.008958441231225767, "grad_norm": 5.8125, "learning_rate": 1.9833333333333335e-06, "loss": 0.6153350830078125, "step": 120 }, { "epoch": 0.009704978000494581, "grad_norm": 3.890625, "learning_rate": 2.15e-06, "loss": 0.6363908767700195, "step": 130 }, { "epoch": 0.010451514769763394, "grad_norm": 4.0, "learning_rate": 2.316666666666667e-06, "loss": 0.5566326141357422, "step": 140 }, { "epoch": 0.011198051539032208, "grad_norm": 3.9375, "learning_rate": 2.4833333333333334e-06, "loss": 0.5371531009674072, "step": 150 }, { "epoch": 0.011944588308301023, "grad_norm": 2.890625, "learning_rate": 2.6500000000000005e-06, "loss": 0.5555124282836914, "step": 160 }, { "epoch": 0.012691125077569837, "grad_norm": 5.0625, "learning_rate": 2.816666666666667e-06, "loss": 0.5494957447052002, "step": 170 }, { "epoch": 0.01343766184683865, "grad_norm": 3.046875, "learning_rate": 2.9833333333333337e-06, "loss": 0.5402939796447754, "step": 180 }, { "epoch": 0.014184198616107464, "grad_norm": 3.765625, "learning_rate": 3.1500000000000003e-06, "loss": 0.5793848514556885, "step": 190 }, { "epoch": 0.014930735385376278, "grad_norm": 2.59375, "learning_rate": 3.316666666666667e-06, "loss": 0.5502342224121094, "step": 200 }, { "epoch": 0.01567727215464509, "grad_norm": 2.953125, "learning_rate": 3.4833333333333336e-06, "loss": 0.49313879013061523, "step": 210 }, { "epoch": 0.016423808923913905, "grad_norm": 3.78125, "learning_rate": 3.65e-06, "loss": 0.5263992786407471, "step": 220 }, { "epoch": 0.01717034569318272, "grad_norm": 3.4375, "learning_rate": 3.816666666666667e-06, "loss": 0.5459019184112549, "step": 230 }, { "epoch": 0.017916882462451534, "grad_norm": 3.140625, "learning_rate": 3.983333333333334e-06, "loss": 0.5428171634674073, "step": 240 }, { "epoch": 0.01866341923172035, "grad_norm": 3.21875, "learning_rate": 4.15e-06, "loss": 0.49319753646850584, "step": 250 }, { "epoch": 0.019409956000989163, "grad_norm": 3.453125, "learning_rate": 4.316666666666667e-06, "loss": 0.5125864505767822, "step": 260 }, { "epoch": 0.020156492770257974, "grad_norm": 3.171875, "learning_rate": 4.483333333333333e-06, "loss": 0.5314520835876465, "step": 270 }, { "epoch": 0.020903029539526788, "grad_norm": 2.546875, "learning_rate": 4.65e-06, "loss": 0.4978891372680664, "step": 280 }, { "epoch": 0.021649566308795602, "grad_norm": 3.03125, "learning_rate": 4.816666666666667e-06, "loss": 0.5198709487915039, "step": 290 }, { "epoch": 0.022396103078064417, "grad_norm": 3.171875, "learning_rate": 4.983333333333334e-06, "loss": 0.5384783744812012, "step": 300 }, { "epoch": 0.02314263984733323, "grad_norm": 2.796875, "learning_rate": 5.150000000000001e-06, "loss": 0.5182504177093505, "step": 310 }, { "epoch": 0.023889176616602045, "grad_norm": 2.734375, "learning_rate": 5.316666666666667e-06, "loss": 0.507215929031372, "step": 320 }, { "epoch": 0.02463571338587086, "grad_norm": 3.5, "learning_rate": 5.483333333333334e-06, "loss": 0.49228978157043457, "step": 330 }, { "epoch": 0.025382250155139674, "grad_norm": 3.125, "learning_rate": 5.65e-06, "loss": 0.4914403438568115, "step": 340 }, { "epoch": 0.026128786924408485, "grad_norm": 3.53125, "learning_rate": 5.816666666666667e-06, "loss": 0.534427547454834, "step": 350 }, { "epoch": 0.0268753236936773, "grad_norm": 3.0, "learning_rate": 5.983333333333334e-06, "loss": 0.5076132774353027, "step": 360 }, { "epoch": 0.027621860462946114, "grad_norm": 3.53125, "learning_rate": 6.15e-06, "loss": 0.5000465869903564, "step": 370 }, { "epoch": 0.028368397232214928, "grad_norm": 2.734375, "learning_rate": 6.3166666666666675e-06, "loss": 0.49956622123718264, "step": 380 }, { "epoch": 0.029114934001483742, "grad_norm": 2.390625, "learning_rate": 6.483333333333334e-06, "loss": 0.49751648902893064, "step": 390 }, { "epoch": 0.029861470770752557, "grad_norm": 2.765625, "learning_rate": 6.650000000000001e-06, "loss": 0.4907405376434326, "step": 400 }, { "epoch": 0.03060800754002137, "grad_norm": 2.90625, "learning_rate": 6.816666666666667e-06, "loss": 0.497531795501709, "step": 410 }, { "epoch": 0.03135454430929018, "grad_norm": 2.703125, "learning_rate": 6.983333333333334e-06, "loss": 0.4707779884338379, "step": 420 }, { "epoch": 0.032101081078558996, "grad_norm": 3.09375, "learning_rate": 7.15e-06, "loss": 0.4825934886932373, "step": 430 }, { "epoch": 0.03284761784782781, "grad_norm": 3.171875, "learning_rate": 7.316666666666667e-06, "loss": 0.4995779514312744, "step": 440 }, { "epoch": 0.033594154617096625, "grad_norm": 2.5, "learning_rate": 7.483333333333333e-06, "loss": 0.4832624435424805, "step": 450 }, { "epoch": 0.03434069138636544, "grad_norm": 2.59375, "learning_rate": 7.650000000000001e-06, "loss": 0.45832481384277346, "step": 460 }, { "epoch": 0.035087228155634254, "grad_norm": 3.15625, "learning_rate": 7.816666666666667e-06, "loss": 0.48647127151489256, "step": 470 }, { "epoch": 0.03583376492490307, "grad_norm": 2.75, "learning_rate": 7.983333333333334e-06, "loss": 0.4490346908569336, "step": 480 }, { "epoch": 0.03658030169417188, "grad_norm": 2.765625, "learning_rate": 8.15e-06, "loss": 0.46668305397033694, "step": 490 }, { "epoch": 0.0373268384634407, "grad_norm": 3.484375, "learning_rate": 8.316666666666668e-06, "loss": 0.47034263610839844, "step": 500 }, { "epoch": 0.0373268384634407, "eval_loss": 0.5070451498031616, "eval_runtime": 11.9697, "eval_samples_per_second": 41.772, "eval_steps_per_second": 41.772, "step": 500 }, { "epoch": 0.03807337523270951, "grad_norm": 3.5, "learning_rate": 8.483333333333334e-06, "loss": 0.4726890563964844, "step": 510 }, { "epoch": 0.038819912001978325, "grad_norm": 2.875, "learning_rate": 8.65e-06, "loss": 0.5026403903961182, "step": 520 }, { "epoch": 0.03956644877124714, "grad_norm": 3.296875, "learning_rate": 8.816666666666668e-06, "loss": 0.5066637992858887, "step": 530 }, { "epoch": 0.04031298554051595, "grad_norm": 3.1875, "learning_rate": 8.983333333333334e-06, "loss": 0.4934993743896484, "step": 540 }, { "epoch": 0.04105952230978476, "grad_norm": 3.3125, "learning_rate": 9.15e-06, "loss": 0.5037405014038085, "step": 550 }, { "epoch": 0.041806059079053576, "grad_norm": 2.5, "learning_rate": 9.316666666666667e-06, "loss": 0.4912420749664307, "step": 560 }, { "epoch": 0.04255259584832239, "grad_norm": 2.6875, "learning_rate": 9.483333333333335e-06, "loss": 0.4600395202636719, "step": 570 }, { "epoch": 0.043299132617591204, "grad_norm": 3.375, "learning_rate": 9.65e-06, "loss": 0.4717693328857422, "step": 580 }, { "epoch": 0.04404566938686002, "grad_norm": 3.125, "learning_rate": 9.816666666666667e-06, "loss": 0.47403817176818847, "step": 590 }, { "epoch": 0.04479220615612883, "grad_norm": 3.65625, "learning_rate": 9.983333333333333e-06, "loss": 0.5240823268890381, "step": 600 }, { "epoch": 0.04553874292539765, "grad_norm": 2.6875, "learning_rate": 9.999994689673353e-06, "loss": 0.4917013645172119, "step": 610 }, { "epoch": 0.04628527969466646, "grad_norm": 2.515625, "learning_rate": 9.999976333003123e-06, "loss": 0.47769603729248045, "step": 620 }, { "epoch": 0.047031816463935276, "grad_norm": 3.3125, "learning_rate": 9.999944864477851e-06, "loss": 0.4795827865600586, "step": 630 }, { "epoch": 0.04777835323320409, "grad_norm": 3.21875, "learning_rate": 9.99990028418006e-06, "loss": 0.43662128448486326, "step": 640 }, { "epoch": 0.048524890002472905, "grad_norm": 2.484375, "learning_rate": 9.999842592226653e-06, "loss": 0.45467290878295896, "step": 650 }, { "epoch": 0.04927142677174172, "grad_norm": 2.609375, "learning_rate": 9.999771788768926e-06, "loss": 0.4696822166442871, "step": 660 }, { "epoch": 0.050017963541010534, "grad_norm": 3.078125, "learning_rate": 9.99968787399255e-06, "loss": 0.48618736267089846, "step": 670 }, { "epoch": 0.05076450031027935, "grad_norm": 2.703125, "learning_rate": 9.999590848117582e-06, "loss": 0.41396608352661135, "step": 680 }, { "epoch": 0.051511037079548155, "grad_norm": 2.9375, "learning_rate": 9.99948071139846e-06, "loss": 0.4746438980102539, "step": 690 }, { "epoch": 0.05225757384881697, "grad_norm": 2.5625, "learning_rate": 9.999357464124004e-06, "loss": 0.41242361068725586, "step": 700 }, { "epoch": 0.053004110618085784, "grad_norm": 3.25, "learning_rate": 9.99922110661742e-06, "loss": 0.511469554901123, "step": 710 }, { "epoch": 0.0537506473873546, "grad_norm": 2.46875, "learning_rate": 9.999071639236285e-06, "loss": 0.4603419303894043, "step": 720 }, { "epoch": 0.05449718415662341, "grad_norm": 2.71875, "learning_rate": 9.998909062372562e-06, "loss": 0.4702977180480957, "step": 730 }, { "epoch": 0.05524372092589223, "grad_norm": 2.96875, "learning_rate": 9.998733376452589e-06, "loss": 0.4667942047119141, "step": 740 }, { "epoch": 0.05599025769516104, "grad_norm": 3.03125, "learning_rate": 9.998544581937083e-06, "loss": 0.45894484519958495, "step": 750 }, { "epoch": 0.056736794464429856, "grad_norm": 2.765625, "learning_rate": 9.998342679321134e-06, "loss": 0.4406691074371338, "step": 760 }, { "epoch": 0.05748333123369867, "grad_norm": 2.625, "learning_rate": 9.99812766913421e-06, "loss": 0.4889220714569092, "step": 770 }, { "epoch": 0.058229868002967484, "grad_norm": 2.875, "learning_rate": 9.997899551940148e-06, "loss": 0.43836426734924316, "step": 780 }, { "epoch": 0.0589764047722363, "grad_norm": 3.03125, "learning_rate": 9.997658328337161e-06, "loss": 0.4346059799194336, "step": 790 }, { "epoch": 0.05972294154150511, "grad_norm": 2.578125, "learning_rate": 9.997403998957827e-06, "loss": 0.4483802795410156, "step": 800 }, { "epoch": 0.06046947831077393, "grad_norm": 2.875, "learning_rate": 9.997136564469098e-06, "loss": 0.4692661762237549, "step": 810 }, { "epoch": 0.06121601508004274, "grad_norm": 2.4375, "learning_rate": 9.99685602557229e-06, "loss": 0.44000725746154784, "step": 820 }, { "epoch": 0.061962551849311556, "grad_norm": 2.71875, "learning_rate": 9.996562383003079e-06, "loss": 0.43952512741088867, "step": 830 }, { "epoch": 0.06270908861858036, "grad_norm": 2.96875, "learning_rate": 9.996255637531513e-06, "loss": 0.44098215103149413, "step": 840 }, { "epoch": 0.06345562538784918, "grad_norm": 2.09375, "learning_rate": 9.995935789961994e-06, "loss": 0.44136600494384765, "step": 850 }, { "epoch": 0.06420216215711799, "grad_norm": 2.84375, "learning_rate": 9.995602841133287e-06, "loss": 0.45519566535949707, "step": 860 }, { "epoch": 0.06494869892638681, "grad_norm": 2.796875, "learning_rate": 9.995256791918511e-06, "loss": 0.44521641731262207, "step": 870 }, { "epoch": 0.06569523569565562, "grad_norm": 3.203125, "learning_rate": 9.994897643225136e-06, "loss": 0.49935183525085447, "step": 880 }, { "epoch": 0.06644177246492444, "grad_norm": 2.40625, "learning_rate": 9.994525395994993e-06, "loss": 0.4272043228149414, "step": 890 }, { "epoch": 0.06718830923419325, "grad_norm": 3.046875, "learning_rate": 9.994140051204254e-06, "loss": 0.4512756824493408, "step": 900 }, { "epoch": 0.06793484600346207, "grad_norm": 2.046875, "learning_rate": 9.99374160986344e-06, "loss": 0.4511909008026123, "step": 910 }, { "epoch": 0.06868138277273088, "grad_norm": 2.625, "learning_rate": 9.99333007301742e-06, "loss": 0.4683080673217773, "step": 920 }, { "epoch": 0.06942791954199969, "grad_norm": 2.5625, "learning_rate": 9.992905441745398e-06, "loss": 0.470552921295166, "step": 930 }, { "epoch": 0.07017445631126851, "grad_norm": 3.078125, "learning_rate": 9.992467717160924e-06, "loss": 0.47638602256774903, "step": 940 }, { "epoch": 0.07092099308053731, "grad_norm": 2.3125, "learning_rate": 9.992016900411873e-06, "loss": 0.4649850845336914, "step": 950 }, { "epoch": 0.07166752984980614, "grad_norm": 2.4375, "learning_rate": 9.991552992680467e-06, "loss": 0.48718810081481934, "step": 960 }, { "epoch": 0.07241406661907494, "grad_norm": 3.0, "learning_rate": 9.991075995183246e-06, "loss": 0.5018165588378907, "step": 970 }, { "epoch": 0.07316060338834376, "grad_norm": 2.40625, "learning_rate": 9.99058590917108e-06, "loss": 0.44672532081604005, "step": 980 }, { "epoch": 0.07390714015761257, "grad_norm": 2.703125, "learning_rate": 9.990082735929166e-06, "loss": 0.4896130084991455, "step": 990 }, { "epoch": 0.0746536769268814, "grad_norm": 2.703125, "learning_rate": 9.989566476777013e-06, "loss": 0.43416008949279783, "step": 1000 }, { "epoch": 0.0746536769268814, "eval_loss": 0.48367443680763245, "eval_runtime": 12.0879, "eval_samples_per_second": 41.364, "eval_steps_per_second": 41.364, "step": 1000 } ], "logging_steps": 10, "max_steps": 20000, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.148408070564659e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }