{ "best_metric": 9.308085441589355, "best_model_checkpoint": "miner_id_24/checkpoint-50", "epoch": 0.006784030392456158, "eval_steps": 50, "global_step": 50, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00013568060784912317, "grad_norm": 15.762146949768066, "learning_rate": 5.000000000000001e-07, "loss": 17.5251, "step": 1 }, { "epoch": 0.00013568060784912317, "eval_loss": 17.97577667236328, "eval_runtime": 988.5204, "eval_samples_per_second": 12.557, "eval_steps_per_second": 3.14, "step": 1 }, { "epoch": 0.00027136121569824634, "grad_norm": 15.15388298034668, "learning_rate": 1.0000000000000002e-06, "loss": 17.0609, "step": 2 }, { "epoch": 0.0004070418235473695, "grad_norm": 17.901601791381836, "learning_rate": 1.5e-06, "loss": 18.277, "step": 3 }, { "epoch": 0.0005427224313964927, "grad_norm": 16.00199317932129, "learning_rate": 2.0000000000000003e-06, "loss": 18.4372, "step": 4 }, { "epoch": 0.0006784030392456158, "grad_norm": 16.555130004882812, "learning_rate": 2.5e-06, "loss": 17.4032, "step": 5 }, { "epoch": 0.000814083647094739, "grad_norm": 16.318920135498047, "learning_rate": 3e-06, "loss": 17.5668, "step": 6 }, { "epoch": 0.0009497642549438621, "grad_norm": 17.335289001464844, "learning_rate": 3.5e-06, "loss": 18.4793, "step": 7 }, { "epoch": 0.0010854448627929854, "grad_norm": 17.1308536529541, "learning_rate": 4.000000000000001e-06, "loss": 18.0238, "step": 8 }, { "epoch": 0.0012211254706421084, "grad_norm": 16.88369369506836, "learning_rate": 4.5e-06, "loss": 18.038, "step": 9 }, { "epoch": 0.0013568060784912316, "grad_norm": 18.023923873901367, "learning_rate": 5e-06, "loss": 17.9376, "step": 10 }, { "epoch": 0.001492486686340355, "grad_norm": 16.119089126586914, "learning_rate": 4.99847706754774e-06, "loss": 17.228, "step": 11 }, { "epoch": 0.001628167294189478, "grad_norm": 19.076875686645508, "learning_rate": 4.993910125649561e-06, "loss": 18.2888, "step": 12 }, { "epoch": 0.0017638479020386012, "grad_norm": 17.7404727935791, "learning_rate": 4.986304738420684e-06, "loss": 17.6689, "step": 13 }, { "epoch": 0.0018995285098877242, "grad_norm": 19.57935905456543, "learning_rate": 4.975670171853926e-06, "loss": 18.0748, "step": 14 }, { "epoch": 0.0020352091177368472, "grad_norm": 19.126384735107422, "learning_rate": 4.962019382530521e-06, "loss": 17.7308, "step": 15 }, { "epoch": 0.0021708897255859707, "grad_norm": 19.213788986206055, "learning_rate": 4.9453690018345144e-06, "loss": 17.6152, "step": 16 }, { "epoch": 0.0023065703334350937, "grad_norm": 19.342151641845703, "learning_rate": 4.925739315689991e-06, "loss": 17.7039, "step": 17 }, { "epoch": 0.0024422509412842168, "grad_norm": 17.80344581604004, "learning_rate": 4.903154239845798e-06, "loss": 15.9165, "step": 18 }, { "epoch": 0.0025779315491333402, "grad_norm": 20.63853645324707, "learning_rate": 4.8776412907378845e-06, "loss": 17.62, "step": 19 }, { "epoch": 0.0027136121569824633, "grad_norm": 22.237533569335938, "learning_rate": 4.849231551964771e-06, "loss": 17.8717, "step": 20 }, { "epoch": 0.0028492927648315863, "grad_norm": 21.161718368530273, "learning_rate": 4.817959636416969e-06, "loss": 16.7998, "step": 21 }, { "epoch": 0.00298497337268071, "grad_norm": 22.185317993164062, "learning_rate": 4.783863644106502e-06, "loss": 17.1446, "step": 22 }, { "epoch": 0.003120653980529833, "grad_norm": 23.86289405822754, "learning_rate": 4.746985115747918e-06, "loss": 16.7542, "step": 23 }, { "epoch": 0.003256334588378956, "grad_norm": 21.632293701171875, "learning_rate": 4.707368982147318e-06, "loss": 16.4251, "step": 24 }, { "epoch": 0.003392015196228079, "grad_norm": 21.998170852661133, "learning_rate": 4.665063509461098e-06, "loss": 15.8686, "step": 25 }, { "epoch": 0.0035276958040772024, "grad_norm": 22.968353271484375, "learning_rate": 4.620120240391065e-06, "loss": 15.1071, "step": 26 }, { "epoch": 0.0036633764119263254, "grad_norm": 27.793222427368164, "learning_rate": 4.572593931387604e-06, "loss": 16.0389, "step": 27 }, { "epoch": 0.0037990570197754484, "grad_norm": 25.256834030151367, "learning_rate": 4.522542485937369e-06, "loss": 14.966, "step": 28 }, { "epoch": 0.003934737627624572, "grad_norm": 27.452804565429688, "learning_rate": 4.470026884016805e-06, "loss": 15.3857, "step": 29 }, { "epoch": 0.0040704182354736945, "grad_norm": 28.503049850463867, "learning_rate": 4.415111107797445e-06, "loss": 14.2744, "step": 30 }, { "epoch": 0.004206098843322818, "grad_norm": 26.86528205871582, "learning_rate": 4.357862063693486e-06, "loss": 14.3296, "step": 31 }, { "epoch": 0.004341779451171941, "grad_norm": 28.72145652770996, "learning_rate": 4.2983495008466285e-06, "loss": 14.8378, "step": 32 }, { "epoch": 0.004477460059021064, "grad_norm": 28.283493041992188, "learning_rate": 4.236645926147493e-06, "loss": 14.1692, "step": 33 }, { "epoch": 0.0046131406668701875, "grad_norm": 30.041580200195312, "learning_rate": 4.172826515897146e-06, "loss": 13.4264, "step": 34 }, { "epoch": 0.004748821274719311, "grad_norm": 33.323081970214844, "learning_rate": 4.106969024216348e-06, "loss": 13.2793, "step": 35 }, { "epoch": 0.0048845018825684336, "grad_norm": 25.383710861206055, "learning_rate": 4.039153688314146e-06, "loss": 13.0025, "step": 36 }, { "epoch": 0.005020182490417557, "grad_norm": 34.86724090576172, "learning_rate": 3.969463130731183e-06, "loss": 12.8519, "step": 37 }, { "epoch": 0.0051558630982666805, "grad_norm": 28.57182502746582, "learning_rate": 3.897982258676867e-06, "loss": 12.3253, "step": 38 }, { "epoch": 0.005291543706115803, "grad_norm": 27.965444564819336, "learning_rate": 3.824798160583012e-06, "loss": 11.9458, "step": 39 }, { "epoch": 0.0054272243139649266, "grad_norm": 30.288328170776367, "learning_rate": 3.7500000000000005e-06, "loss": 11.5927, "step": 40 }, { "epoch": 0.00556290492181405, "grad_norm": 29.882335662841797, "learning_rate": 3.6736789069647273e-06, "loss": 11.8575, "step": 41 }, { "epoch": 0.005698585529663173, "grad_norm": 27.096267700195312, "learning_rate": 3.595927866972694e-06, "loss": 11.5122, "step": 42 }, { "epoch": 0.005834266137512296, "grad_norm": 27.859052658081055, "learning_rate": 3.516841607689501e-06, "loss": 11.2235, "step": 43 }, { "epoch": 0.00596994674536142, "grad_norm": 27.79047203063965, "learning_rate": 3.436516483539781e-06, "loss": 10.7358, "step": 44 }, { "epoch": 0.006105627353210542, "grad_norm": 27.116655349731445, "learning_rate": 3.3550503583141726e-06, "loss": 10.6031, "step": 45 }, { "epoch": 0.006241307961059666, "grad_norm": 29.671985626220703, "learning_rate": 3.272542485937369e-06, "loss": 10.5947, "step": 46 }, { "epoch": 0.006376988568908789, "grad_norm": 24.509077072143555, "learning_rate": 3.189093389542498e-06, "loss": 10.671, "step": 47 }, { "epoch": 0.006512669176757912, "grad_norm": 30.852890014648438, "learning_rate": 3.1048047389991693e-06, "loss": 10.7918, "step": 48 }, { "epoch": 0.006648349784607035, "grad_norm": 29.77279281616211, "learning_rate": 3.019779227044398e-06, "loss": 11.0377, "step": 49 }, { "epoch": 0.006784030392456158, "grad_norm": 32.51844787597656, "learning_rate": 2.9341204441673267e-06, "loss": 11.3717, "step": 50 }, { "epoch": 0.006784030392456158, "eval_loss": 9.308085441589355, "eval_runtime": 992.1874, "eval_samples_per_second": 12.511, "eval_steps_per_second": 3.128, "step": 50 } ], "logging_steps": 1, "max_steps": 100, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 50, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 5, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 7.41900168462336e+16, "train_batch_size": 4, "trial_name": null, "trial_params": null }