{ "best_global_step": null, "best_metric": Infinity, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 40, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.8529030084609985, "epoch": 0.02531645569620253, "grad_norm": 78.52010345458984, "learning_rate": 0.0, "loss": 15.181689262390137, "mean_token_accuracy": 0.28961846977472305, "num_tokens": 7286.0, "step": 1 }, { "entropy": 0.8989771902561188, "epoch": 0.05063291139240506, "grad_norm": 75.26119232177734, "learning_rate": 5e-05, "loss": 14.95038890838623, "mean_token_accuracy": 0.27897340804338455, "num_tokens": 14954.0, "step": 2 }, { "entropy": 0.9821003973484039, "epoch": 0.0759493670886076, "grad_norm": 74.54902648925781, "learning_rate": 0.0001, "loss": 13.742369651794434, "mean_token_accuracy": 0.2827275022864342, "num_tokens": 21366.0, "step": 3 }, { "entropy": 1.0873801112174988, "epoch": 0.10126582278481013, "grad_norm": 34.19524383544922, "learning_rate": 0.00015000000000000001, "loss": 11.25832462310791, "mean_token_accuracy": 0.44820327311754227, "num_tokens": 28250.0, "step": 4 }, { "entropy": 1.0790044069290161, "epoch": 0.12658227848101267, "grad_norm": 28.061630249023438, "learning_rate": 0.0002, "loss": 9.99978256225586, "mean_token_accuracy": 0.5489031970500946, "num_tokens": 34914.0, "step": 5 }, { "entropy": 1.1546767055988312, "epoch": 0.1518987341772152, "grad_norm": 24.789119720458984, "learning_rate": 0.0001999145758387301, "loss": 8.632344245910645, "mean_token_accuracy": 0.554060235619545, "num_tokens": 42532.0, "step": 6 }, { "entropy": 1.0596064329147339, "epoch": 0.17721518987341772, "grad_norm": 12.310446739196777, "learning_rate": 0.000199658449300667, "loss": 7.437180995941162, "mean_token_accuracy": 0.5873144865036011, "num_tokens": 49872.0, "step": 7 }, { "entropy": 0.7889958769083023, "epoch": 0.20253164556962025, "grad_norm": 10.70737361907959, "learning_rate": 0.0001992320579737045, "loss": 7.076646327972412, "mean_token_accuracy": 0.5939096212387085, "num_tokens": 55639.0, "step": 8 }, { "entropy": 0.9904351979494095, "epoch": 0.22784810126582278, "grad_norm": 39.2529296875, "learning_rate": 0.00019863613034027224, "loss": 7.060567855834961, "mean_token_accuracy": 0.6403393149375916, "num_tokens": 61649.0, "step": 9 }, { "entropy": 1.3839358687400818, "epoch": 0.25316455696202533, "grad_norm": 15.882004737854004, "learning_rate": 0.00019787168453273544, "loss": 6.710319519042969, "mean_token_accuracy": 0.603007972240448, "num_tokens": 69689.0, "step": 10 }, { "entropy": 1.1738347113132477, "epoch": 0.27848101265822783, "grad_norm": 8.31102180480957, "learning_rate": 0.00019694002659393305, "loss": 6.315446853637695, "mean_token_accuracy": 0.627836138010025, "num_tokens": 77528.0, "step": 11 }, { "entropy": 1.2701810002326965, "epoch": 0.3037974683544304, "grad_norm": 6.591884136199951, "learning_rate": 0.0001958427482458253, "loss": 6.042618751525879, "mean_token_accuracy": 0.6690841615200043, "num_tokens": 85064.0, "step": 12 }, { "entropy": 1.2295758128166199, "epoch": 0.3291139240506329, "grad_norm": 15.478667259216309, "learning_rate": 0.00019458172417006347, "loss": 6.213565826416016, "mean_token_accuracy": 0.6405076384544373, "num_tokens": 91009.0, "step": 13 }, { "entropy": 1.268456757068634, "epoch": 0.35443037974683544, "grad_norm": 7.625810146331787, "learning_rate": 0.0001931591088051279, "loss": 6.13183069229126, "mean_token_accuracy": 0.6365684270858765, "num_tokens": 97909.0, "step": 14 }, { "entropy": 1.2001140415668488, "epoch": 0.379746835443038, "grad_norm": 7.8025221824646, "learning_rate": 0.00019157733266550575, "loss": 6.064075469970703, "mean_token_accuracy": 0.6330698281526566, "num_tokens": 104187.0, "step": 15 }, { "entropy": 1.066677764058113, "epoch": 0.4050632911392405, "grad_norm": 8.150992393493652, "learning_rate": 0.0001898390981891979, "loss": 5.798349380493164, "mean_token_accuracy": 0.646238312125206, "num_tokens": 110300.0, "step": 16 }, { "entropy": 1.0704185664653778, "epoch": 0.43037974683544306, "grad_norm": 3.722452402114868, "learning_rate": 0.0001879473751206489, "loss": 5.87784481048584, "mean_token_accuracy": 0.6626823246479034, "num_tokens": 117157.0, "step": 17 }, { "entropy": 1.1619559824466705, "epoch": 0.45569620253164556, "grad_norm": 4.019715785980225, "learning_rate": 0.00018590539543698854, "loss": 5.398146152496338, "mean_token_accuracy": 0.714724525809288, "num_tokens": 123378.0, "step": 18 }, { "entropy": 1.072197139263153, "epoch": 0.4810126582278481, "grad_norm": 3.3014461994171143, "learning_rate": 0.00018371664782625287, "loss": 5.488443851470947, "mean_token_accuracy": 0.8233065903186798, "num_tokens": 129042.0, "step": 19 }, { "entropy": 0.9806628823280334, "epoch": 0.5063291139240507, "grad_norm": 2.70117449760437, "learning_rate": 0.0001813848717270195, "loss": 5.3289875984191895, "mean_token_accuracy": 0.8143462389707565, "num_tokens": 135747.0, "step": 20 }, { "entropy": 0.8040178865194321, "epoch": 0.5316455696202531, "grad_norm": 3.4564270973205566, "learning_rate": 0.00017891405093963938, "loss": 5.2513909339904785, "mean_token_accuracy": 0.8225801885128021, "num_tokens": 141848.0, "step": 21 }, { "entropy": 0.7444496601819992, "epoch": 0.5569620253164557, "grad_norm": 2.3326470851898193, "learning_rate": 0.00017630840681998066, "loss": 5.4000067710876465, "mean_token_accuracy": 0.8329752385616302, "num_tokens": 147566.0, "step": 22 }, { "entropy": 0.6936303377151489, "epoch": 0.5822784810126582, "grad_norm": 2.478424072265625, "learning_rate": 0.00017357239106731317, "loss": 5.346803665161133, "mean_token_accuracy": 0.8282431960105896, "num_tokens": 154620.0, "step": 23 }, { "entropy": 0.6478566229343414, "epoch": 0.6075949367088608, "grad_norm": 2.6104896068573, "learning_rate": 0.00017071067811865476, "loss": 5.191404342651367, "mean_token_accuracy": 0.8425344824790955, "num_tokens": 161701.0, "step": 24 }, { "entropy": 0.6078712940216064, "epoch": 0.6329113924050633, "grad_norm": 4.111148357391357, "learning_rate": 0.00016772815716257412, "loss": 5.243197917938232, "mean_token_accuracy": 0.8070437759160995, "num_tokens": 168435.0, "step": 25 }, { "entropy": 0.5901128649711609, "epoch": 0.6582278481012658, "grad_norm": 2.244276285171509, "learning_rate": 0.00016462992378609407, "loss": 5.272450923919678, "mean_token_accuracy": 0.8324518501758575, "num_tokens": 175650.0, "step": 26 }, { "entropy": 0.5017133206129074, "epoch": 0.6835443037974683, "grad_norm": 2.1174073219299316, "learning_rate": 0.0001614212712689668, "loss": 5.215684413909912, "mean_token_accuracy": 0.8321826756000519, "num_tokens": 181490.0, "step": 27 }, { "entropy": 0.4748859405517578, "epoch": 0.7088607594936709, "grad_norm": 2.087001323699951, "learning_rate": 0.00015810768154019385, "loss": 5.15059757232666, "mean_token_accuracy": 0.8388571739196777, "num_tokens": 188582.0, "step": 28 }, { "entropy": 0.3888755962252617, "epoch": 0.7341772151898734, "grad_norm": 1.487061858177185, "learning_rate": 0.00015469481581224272, "loss": 5.174810409545898, "mean_token_accuracy": 0.8587576746940613, "num_tokens": 193783.0, "step": 29 }, { "entropy": 0.4288812130689621, "epoch": 0.759493670886076, "grad_norm": 2.868377685546875, "learning_rate": 0.00015118850490896012, "loss": 5.343541145324707, "mean_token_accuracy": 0.8163273632526398, "num_tokens": 200686.0, "step": 30 }, { "entropy": 0.39349576085805893, "epoch": 0.7848101265822784, "grad_norm": 1.7554408311843872, "learning_rate": 0.00014759473930370736, "loss": 5.089621543884277, "mean_token_accuracy": 0.8510452210903168, "num_tokens": 208440.0, "step": 31 }, { "entropy": 0.37267740815877914, "epoch": 0.810126582278481, "grad_norm": 1.210075855255127, "learning_rate": 0.00014391965888473703, "loss": 5.0665974617004395, "mean_token_accuracy": 0.8576832711696625, "num_tokens": 215131.0, "step": 32 }, { "entropy": 0.3740547075867653, "epoch": 0.8354430379746836, "grad_norm": 2.1259520053863525, "learning_rate": 0.00014016954246529696, "loss": 5.144742012023926, "mean_token_accuracy": 0.8442028760910034, "num_tokens": 222195.0, "step": 33 }, { "entropy": 0.33895356953144073, "epoch": 0.8607594936708861, "grad_norm": 2.1364142894744873, "learning_rate": 0.00013635079705638298, "loss": 5.227801322937012, "mean_token_accuracy": 0.8455548137426376, "num_tokens": 229926.0, "step": 34 }, { "entropy": 0.3552927002310753, "epoch": 0.8860759493670886, "grad_norm": 2.4019367694854736, "learning_rate": 0.00013246994692046836, "loss": 5.275204181671143, "mean_token_accuracy": 0.8322960436344147, "num_tokens": 235766.0, "step": 35 }, { "entropy": 0.3192586973309517, "epoch": 0.9113924050632911, "grad_norm": 1.8943588733673096, "learning_rate": 0.00012853362242491053, "loss": 5.1949639320373535, "mean_token_accuracy": 0.8491553515195847, "num_tokens": 242731.0, "step": 36 }, { "entropy": 0.31374089419841766, "epoch": 0.9367088607594937, "grad_norm": 1.5797899961471558, "learning_rate": 0.00012454854871407994, "loss": 5.137860298156738, "mean_token_accuracy": 0.8447228074073792, "num_tokens": 249818.0, "step": 37 }, { "entropy": 0.3000646084547043, "epoch": 0.9620253164556962, "grad_norm": 1.9470438957214355, "learning_rate": 0.00012052153421956342, "loss": 5.12597131729126, "mean_token_accuracy": 0.8450468629598618, "num_tokens": 256043.0, "step": 38 }, { "entropy": 0.2730342224240303, "epoch": 0.9873417721518988, "grad_norm": 1.3998013734817505, "learning_rate": 0.00011645945902807341, "loss": 5.182764530181885, "mean_token_accuracy": 0.8505663871765137, "num_tokens": 263628.0, "step": 39 }, { "entropy": 0.31550464034080505, "epoch": 1.0, "grad_norm": 1.9481233358383179, "learning_rate": 0.00011236926312693479, "loss": 5.046781063079834, "mean_token_accuracy": 0.8476890921592712, "num_tokens": 266935.0, "step": 40 }, { "epoch": 1.0, "eval_entropy": 0.0, "eval_loss": NaN, "eval_mean_token_accuracy": 0.0, "eval_num_tokens": 266935.0, "eval_runtime": 9.0564, "eval_samples_per_second": 24.513, "eval_steps_per_second": 6.184, "step": 40 } ], "logging_steps": 1, "max_steps": 80, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 542852652204032.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }