{ "best_metric": 5.546361923217773, "best_model_checkpoint": "miner_id_24/checkpoint-100", "epoch": 0.013568060784912316, "eval_steps": 50, "global_step": 100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00013568060784912317, "grad_norm": 15.762146949768066, "learning_rate": 5.000000000000001e-07, "loss": 17.5251, "step": 1 }, { "epoch": 0.00013568060784912317, "eval_loss": 17.97577667236328, "eval_runtime": 988.5204, "eval_samples_per_second": 12.557, "eval_steps_per_second": 3.14, "step": 1 }, { "epoch": 0.00027136121569824634, "grad_norm": 15.15388298034668, "learning_rate": 1.0000000000000002e-06, "loss": 17.0609, "step": 2 }, { "epoch": 0.0004070418235473695, "grad_norm": 17.901601791381836, "learning_rate": 1.5e-06, "loss": 18.277, "step": 3 }, { "epoch": 0.0005427224313964927, "grad_norm": 16.00199317932129, "learning_rate": 2.0000000000000003e-06, "loss": 18.4372, "step": 4 }, { "epoch": 0.0006784030392456158, "grad_norm": 16.555130004882812, "learning_rate": 2.5e-06, "loss": 17.4032, "step": 5 }, { "epoch": 0.000814083647094739, "grad_norm": 16.318920135498047, "learning_rate": 3e-06, "loss": 17.5668, "step": 6 }, { "epoch": 0.0009497642549438621, "grad_norm": 17.335289001464844, "learning_rate": 3.5e-06, "loss": 18.4793, "step": 7 }, { "epoch": 0.0010854448627929854, "grad_norm": 17.1308536529541, "learning_rate": 4.000000000000001e-06, "loss": 18.0238, "step": 8 }, { "epoch": 0.0012211254706421084, "grad_norm": 16.88369369506836, "learning_rate": 4.5e-06, "loss": 18.038, "step": 9 }, { "epoch": 0.0013568060784912316, "grad_norm": 18.023923873901367, "learning_rate": 5e-06, "loss": 17.9376, "step": 10 }, { "epoch": 0.001492486686340355, "grad_norm": 16.119089126586914, "learning_rate": 4.99847706754774e-06, "loss": 17.228, "step": 11 }, { "epoch": 0.001628167294189478, "grad_norm": 19.076875686645508, "learning_rate": 4.993910125649561e-06, "loss": 18.2888, "step": 12 }, { "epoch": 0.0017638479020386012, "grad_norm": 17.7404727935791, "learning_rate": 4.986304738420684e-06, "loss": 17.6689, "step": 13 }, { "epoch": 0.0018995285098877242, "grad_norm": 19.57935905456543, "learning_rate": 4.975670171853926e-06, "loss": 18.0748, "step": 14 }, { "epoch": 0.0020352091177368472, "grad_norm": 19.126384735107422, "learning_rate": 4.962019382530521e-06, "loss": 17.7308, "step": 15 }, { "epoch": 0.0021708897255859707, "grad_norm": 19.213788986206055, "learning_rate": 4.9453690018345144e-06, "loss": 17.6152, "step": 16 }, { "epoch": 0.0023065703334350937, "grad_norm": 19.342151641845703, "learning_rate": 4.925739315689991e-06, "loss": 17.7039, "step": 17 }, { "epoch": 0.0024422509412842168, "grad_norm": 17.80344581604004, "learning_rate": 4.903154239845798e-06, "loss": 15.9165, "step": 18 }, { "epoch": 0.0025779315491333402, "grad_norm": 20.63853645324707, "learning_rate": 4.8776412907378845e-06, "loss": 17.62, "step": 19 }, { "epoch": 0.0027136121569824633, "grad_norm": 22.237533569335938, "learning_rate": 4.849231551964771e-06, "loss": 17.8717, "step": 20 }, { "epoch": 0.0028492927648315863, "grad_norm": 21.161718368530273, "learning_rate": 4.817959636416969e-06, "loss": 16.7998, "step": 21 }, { "epoch": 0.00298497337268071, "grad_norm": 22.185317993164062, "learning_rate": 4.783863644106502e-06, "loss": 17.1446, "step": 22 }, { "epoch": 0.003120653980529833, "grad_norm": 23.86289405822754, "learning_rate": 4.746985115747918e-06, "loss": 16.7542, "step": 23 }, { "epoch": 0.003256334588378956, "grad_norm": 21.632293701171875, "learning_rate": 4.707368982147318e-06, "loss": 16.4251, "step": 24 }, { "epoch": 0.003392015196228079, "grad_norm": 21.998170852661133, "learning_rate": 4.665063509461098e-06, "loss": 15.8686, "step": 25 }, { "epoch": 0.0035276958040772024, "grad_norm": 22.968353271484375, "learning_rate": 4.620120240391065e-06, "loss": 15.1071, "step": 26 }, { "epoch": 0.0036633764119263254, "grad_norm": 27.793222427368164, "learning_rate": 4.572593931387604e-06, "loss": 16.0389, "step": 27 }, { "epoch": 0.0037990570197754484, "grad_norm": 25.256834030151367, "learning_rate": 4.522542485937369e-06, "loss": 14.966, "step": 28 }, { "epoch": 0.003934737627624572, "grad_norm": 27.452804565429688, "learning_rate": 4.470026884016805e-06, "loss": 15.3857, "step": 29 }, { "epoch": 0.0040704182354736945, "grad_norm": 28.503049850463867, "learning_rate": 4.415111107797445e-06, "loss": 14.2744, "step": 30 }, { "epoch": 0.004206098843322818, "grad_norm": 26.86528205871582, "learning_rate": 4.357862063693486e-06, "loss": 14.3296, "step": 31 }, { "epoch": 0.004341779451171941, "grad_norm": 28.72145652770996, "learning_rate": 4.2983495008466285e-06, "loss": 14.8378, "step": 32 }, { "epoch": 0.004477460059021064, "grad_norm": 28.283493041992188, "learning_rate": 4.236645926147493e-06, "loss": 14.1692, "step": 33 }, { "epoch": 0.0046131406668701875, "grad_norm": 30.041580200195312, "learning_rate": 4.172826515897146e-06, "loss": 13.4264, "step": 34 }, { "epoch": 0.004748821274719311, "grad_norm": 33.323081970214844, "learning_rate": 4.106969024216348e-06, "loss": 13.2793, "step": 35 }, { "epoch": 0.0048845018825684336, "grad_norm": 25.383710861206055, "learning_rate": 4.039153688314146e-06, "loss": 13.0025, "step": 36 }, { "epoch": 0.005020182490417557, "grad_norm": 34.86724090576172, "learning_rate": 3.969463130731183e-06, "loss": 12.8519, "step": 37 }, { "epoch": 0.0051558630982666805, "grad_norm": 28.57182502746582, "learning_rate": 3.897982258676867e-06, "loss": 12.3253, "step": 38 }, { "epoch": 0.005291543706115803, "grad_norm": 27.965444564819336, "learning_rate": 3.824798160583012e-06, "loss": 11.9458, "step": 39 }, { "epoch": 0.0054272243139649266, "grad_norm": 30.288328170776367, "learning_rate": 3.7500000000000005e-06, "loss": 11.5927, "step": 40 }, { "epoch": 0.00556290492181405, "grad_norm": 29.882335662841797, "learning_rate": 3.6736789069647273e-06, "loss": 11.8575, "step": 41 }, { "epoch": 0.005698585529663173, "grad_norm": 27.096267700195312, "learning_rate": 3.595927866972694e-06, "loss": 11.5122, "step": 42 }, { "epoch": 0.005834266137512296, "grad_norm": 27.859052658081055, "learning_rate": 3.516841607689501e-06, "loss": 11.2235, "step": 43 }, { "epoch": 0.00596994674536142, "grad_norm": 27.79047203063965, "learning_rate": 3.436516483539781e-06, "loss": 10.7358, "step": 44 }, { "epoch": 0.006105627353210542, "grad_norm": 27.116655349731445, "learning_rate": 3.3550503583141726e-06, "loss": 10.6031, "step": 45 }, { "epoch": 0.006241307961059666, "grad_norm": 29.671985626220703, "learning_rate": 3.272542485937369e-06, "loss": 10.5947, "step": 46 }, { "epoch": 0.006376988568908789, "grad_norm": 24.509077072143555, "learning_rate": 3.189093389542498e-06, "loss": 10.671, "step": 47 }, { "epoch": 0.006512669176757912, "grad_norm": 30.852890014648438, "learning_rate": 3.1048047389991693e-06, "loss": 10.7918, "step": 48 }, { "epoch": 0.006648349784607035, "grad_norm": 29.77279281616211, "learning_rate": 3.019779227044398e-06, "loss": 11.0377, "step": 49 }, { "epoch": 0.006784030392456158, "grad_norm": 32.51844787597656, "learning_rate": 2.9341204441673267e-06, "loss": 11.3717, "step": 50 }, { "epoch": 0.006784030392456158, "eval_loss": 9.308085441589355, "eval_runtime": 992.1874, "eval_samples_per_second": 12.511, "eval_steps_per_second": 3.128, "step": 50 }, { "epoch": 0.006919711000305281, "grad_norm": 26.32299041748047, "learning_rate": 2.847932752400164e-06, "loss": 8.778, "step": 51 }, { "epoch": 0.007055391608154405, "grad_norm": 27.48458480834961, "learning_rate": 2.761321158169134e-06, "loss": 8.6638, "step": 52 }, { "epoch": 0.007191072216003527, "grad_norm": 28.693199157714844, "learning_rate": 2.6743911843603134e-06, "loss": 8.4307, "step": 53 }, { "epoch": 0.007326752823852651, "grad_norm": 25.406177520751953, "learning_rate": 2.587248741756253e-06, "loss": 8.0378, "step": 54 }, { "epoch": 0.007462433431701774, "grad_norm": 28.44993019104004, "learning_rate": 2.5e-06, "loss": 8.276, "step": 55 }, { "epoch": 0.007598114039550897, "grad_norm": 24.69778823852539, "learning_rate": 2.4127512582437486e-06, "loss": 8.2592, "step": 56 }, { "epoch": 0.00773379464740002, "grad_norm": 25.933664321899414, "learning_rate": 2.325608815639687e-06, "loss": 8.3317, "step": 57 }, { "epoch": 0.007869475255249144, "grad_norm": 27.458454132080078, "learning_rate": 2.238678841830867e-06, "loss": 7.7944, "step": 58 }, { "epoch": 0.008005155863098266, "grad_norm": 25.28622817993164, "learning_rate": 2.1520672475998374e-06, "loss": 7.7405, "step": 59 }, { "epoch": 0.008140836470947389, "grad_norm": 29.014318466186523, "learning_rate": 2.0658795558326745e-06, "loss": 7.3388, "step": 60 }, { "epoch": 0.008276517078796513, "grad_norm": 27.211328506469727, "learning_rate": 1.9802207729556023e-06, "loss": 7.5491, "step": 61 }, { "epoch": 0.008412197686645636, "grad_norm": 28.228635787963867, "learning_rate": 1.895195261000831e-06, "loss": 6.9176, "step": 62 }, { "epoch": 0.008547878294494759, "grad_norm": 28.854480743408203, "learning_rate": 1.8109066104575023e-06, "loss": 6.9789, "step": 63 }, { "epoch": 0.008683558902343883, "grad_norm": 30.74064064025879, "learning_rate": 1.7274575140626318e-06, "loss": 6.791, "step": 64 }, { "epoch": 0.008819239510193005, "grad_norm": 30.067106246948242, "learning_rate": 1.6449496416858285e-06, "loss": 7.27, "step": 65 }, { "epoch": 0.008954920118042128, "grad_norm": 28.86882209777832, "learning_rate": 1.56348351646022e-06, "loss": 6.8992, "step": 66 }, { "epoch": 0.009090600725891252, "grad_norm": 29.37924575805664, "learning_rate": 1.4831583923105e-06, "loss": 7.1342, "step": 67 }, { "epoch": 0.009226281333740375, "grad_norm": 28.117305755615234, "learning_rate": 1.4040721330273063e-06, "loss": 6.8556, "step": 68 }, { "epoch": 0.009361961941589498, "grad_norm": 31.97182846069336, "learning_rate": 1.3263210930352737e-06, "loss": 7.6376, "step": 69 }, { "epoch": 0.009497642549438622, "grad_norm": 30.822277069091797, "learning_rate": 1.2500000000000007e-06, "loss": 7.0273, "step": 70 }, { "epoch": 0.009633323157287745, "grad_norm": 36.39443588256836, "learning_rate": 1.1752018394169882e-06, "loss": 6.5916, "step": 71 }, { "epoch": 0.009769003765136867, "grad_norm": 31.061527252197266, "learning_rate": 1.1020177413231334e-06, "loss": 6.3773, "step": 72 }, { "epoch": 0.009904684372985991, "grad_norm": 36.107337951660156, "learning_rate": 1.0305368692688175e-06, "loss": 5.9991, "step": 73 }, { "epoch": 0.010040364980835114, "grad_norm": 33.352020263671875, "learning_rate": 9.608463116858544e-07, "loss": 6.0698, "step": 74 }, { "epoch": 0.010176045588684237, "grad_norm": 30.981962203979492, "learning_rate": 8.930309757836517e-07, "loss": 6.5031, "step": 75 }, { "epoch": 0.010311726196533361, "grad_norm": 31.83991050720215, "learning_rate": 8.271734841028553e-07, "loss": 6.594, "step": 76 }, { "epoch": 0.010447406804382484, "grad_norm": 33.01601791381836, "learning_rate": 7.633540738525066e-07, "loss": 6.1583, "step": 77 }, { "epoch": 0.010583087412231606, "grad_norm": 34.49018859863281, "learning_rate": 7.016504991533727e-07, "loss": 6.3534, "step": 78 }, { "epoch": 0.01071876802008073, "grad_norm": 35.218048095703125, "learning_rate": 6.421379363065142e-07, "loss": 5.9496, "step": 79 }, { "epoch": 0.010854448627929853, "grad_norm": 34.13999557495117, "learning_rate": 5.848888922025553e-07, "loss": 5.9489, "step": 80 }, { "epoch": 0.010990129235778976, "grad_norm": 33.84051513671875, "learning_rate": 5.299731159831953e-07, "loss": 5.8639, "step": 81 }, { "epoch": 0.0111258098436281, "grad_norm": 36.259944915771484, "learning_rate": 4.774575140626317e-07, "loss": 6.283, "step": 82 }, { "epoch": 0.011261490451477223, "grad_norm": 32.591651916503906, "learning_rate": 4.27406068612396e-07, "loss": 6.2367, "step": 83 }, { "epoch": 0.011397171059326345, "grad_norm": 35.87070083618164, "learning_rate": 3.798797596089351e-07, "loss": 6.3597, "step": 84 }, { "epoch": 0.01153285166717547, "grad_norm": 35.934539794921875, "learning_rate": 3.3493649053890325e-07, "loss": 5.7746, "step": 85 }, { "epoch": 0.011668532275024592, "grad_norm": 35.99143981933594, "learning_rate": 2.9263101785268253e-07, "loss": 6.9046, "step": 86 }, { "epoch": 0.011804212882873715, "grad_norm": 32.2277946472168, "learning_rate": 2.53014884252083e-07, "loss": 6.1874, "step": 87 }, { "epoch": 0.01193989349072284, "grad_norm": 38.41813659667969, "learning_rate": 2.1613635589349756e-07, "loss": 6.0549, "step": 88 }, { "epoch": 0.012075574098571962, "grad_norm": 35.493804931640625, "learning_rate": 1.8204036358303173e-07, "loss": 6.046, "step": 89 }, { "epoch": 0.012211254706421084, "grad_norm": 34.95344543457031, "learning_rate": 1.507684480352292e-07, "loss": 5.976, "step": 90 }, { "epoch": 0.012346935314270209, "grad_norm": 32.631591796875, "learning_rate": 1.223587092621162e-07, "loss": 5.7902, "step": 91 }, { "epoch": 0.012482615922119331, "grad_norm": 35.305580139160156, "learning_rate": 9.684576015420277e-08, "loss": 6.4926, "step": 92 }, { "epoch": 0.012618296529968454, "grad_norm": 35.67231369018555, "learning_rate": 7.426068431000883e-08, "loss": 5.8871, "step": 93 }, { "epoch": 0.012753977137817578, "grad_norm": 38.47718811035156, "learning_rate": 5.463099816548578e-08, "loss": 5.4537, "step": 94 }, { "epoch": 0.0128896577456667, "grad_norm": 39.857582092285156, "learning_rate": 3.798061746947995e-08, "loss": 5.6496, "step": 95 }, { "epoch": 0.013025338353515823, "grad_norm": 35.418609619140625, "learning_rate": 2.4329828146074096e-08, "loss": 6.1474, "step": 96 }, { "epoch": 0.013161018961364948, "grad_norm": 32.19925308227539, "learning_rate": 1.3695261579316776e-08, "loss": 6.7492, "step": 97 }, { "epoch": 0.01329669956921407, "grad_norm": 39.599151611328125, "learning_rate": 6.089874350439507e-09, "loss": 5.7039, "step": 98 }, { "epoch": 0.013432380177063193, "grad_norm": 38.118282318115234, "learning_rate": 1.5229324522605949e-09, "loss": 5.5559, "step": 99 }, { "epoch": 0.013568060784912316, "grad_norm": 35.434478759765625, "learning_rate": 0.0, "loss": 8.8397, "step": 100 }, { "epoch": 0.013568060784912316, "eval_loss": 5.546361923217773, "eval_runtime": 993.065, "eval_samples_per_second": 12.5, "eval_steps_per_second": 3.126, "step": 100 } ], "logging_steps": 1, "max_steps": 100, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 50, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 5, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.483800336924672e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }