{ "best_global_step": 500, "best_metric": 0.0026578546967357397, "best_model_checkpoint": "outputs/checkpoints/checkpoint-500", "epoch": 0.24516564003554903, "eval_steps": 100, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00490331280071098, "grad_norm": 38.97287368774414, "learning_rate": 1.8000000000000001e-06, "loss": 11.7965, "step": 10 }, { "epoch": 0.00980662560142196, "grad_norm": 37.44226837158203, "learning_rate": 3.8000000000000005e-06, "loss": 11.1348, "step": 20 }, { "epoch": 0.01470993840213294, "grad_norm": 39.490840911865234, "learning_rate": 5.8e-06, "loss": 10.3908, "step": 30 }, { "epoch": 0.01961325120284392, "grad_norm": 55.910770416259766, "learning_rate": 7.800000000000002e-06, "loss": 9.7397, "step": 40 }, { "epoch": 0.0245165640035549, "grad_norm": 69.5174789428711, "learning_rate": 9.800000000000001e-06, "loss": 9.0773, "step": 50 }, { "epoch": 0.02941987680426588, "grad_norm": 72.5235366821289, "learning_rate": 9.954773869346734e-06, "loss": 8.4558, "step": 60 }, { "epoch": 0.034323189604976864, "grad_norm": 74.18756103515625, "learning_rate": 9.904522613065327e-06, "loss": 7.8523, "step": 70 }, { "epoch": 0.03922650240568784, "grad_norm": 75.60600280761719, "learning_rate": 9.85427135678392e-06, "loss": 7.2893, "step": 80 }, { "epoch": 0.044129815206398824, "grad_norm": 76.96356201171875, "learning_rate": 9.804020100502513e-06, "loss": 6.7552, "step": 90 }, { "epoch": 0.0490331280071098, "grad_norm": 78.16697692871094, "learning_rate": 9.753768844221107e-06, "loss": 6.1989, "step": 100 }, { "epoch": 0.0490331280071098, "eval_bleu": 0.2568511156961756, "eval_exact_match": 0.02403846153846154, "eval_loss": 5.520397663116455, "eval_overlap_f1": 0.44806093548612735, "eval_rouge1": 0.43472462113402405, "eval_rouge2": 0.389460301819342, "eval_rougeL": 0.41802956544256537, "eval_runtime": 51.1798, "eval_samples_per_second": 3.908, "eval_steps_per_second": 0.254, "eval_substring_accuracy": 0.4375, "step": 100 }, { "epoch": 0.053936440807820785, "grad_norm": 78.8167953491211, "learning_rate": 9.7035175879397e-06, "loss": 5.6758, "step": 110 }, { "epoch": 0.05883975360853176, "grad_norm": 79.5491714477539, "learning_rate": 9.653266331658291e-06, "loss": 5.1469, "step": 120 }, { "epoch": 0.06374306640924274, "grad_norm": 79.28946685791016, "learning_rate": 9.603015075376885e-06, "loss": 4.607, "step": 130 }, { "epoch": 0.06864637920995373, "grad_norm": 79.43553924560547, "learning_rate": 9.552763819095478e-06, "loss": 4.0762, "step": 140 }, { "epoch": 0.0735496920106647, "grad_norm": 79.19751739501953, "learning_rate": 9.502512562814071e-06, "loss": 3.5677, "step": 150 }, { "epoch": 0.07845300481137568, "grad_norm": 77.9931411743164, "learning_rate": 9.452261306532664e-06, "loss": 3.0641, "step": 160 }, { "epoch": 0.08335631761208667, "grad_norm": 74.37619018554688, "learning_rate": 9.402010050251256e-06, "loss": 2.5681, "step": 170 }, { "epoch": 0.08825963041279765, "grad_norm": 69.27262878417969, "learning_rate": 9.35175879396985e-06, "loss": 2.1015, "step": 180 }, { "epoch": 0.09316294321350863, "grad_norm": 60.969303131103516, "learning_rate": 9.301507537688444e-06, "loss": 1.6754, "step": 190 }, { "epoch": 0.0980662560142196, "grad_norm": 50.06096649169922, "learning_rate": 9.251256281407036e-06, "loss": 1.3013, "step": 200 }, { "epoch": 0.0980662560142196, "eval_bleu": 0.14716894569508807, "eval_exact_match": 0.02403846153846154, "eval_loss": 0.9516403675079346, "eval_overlap_f1": 0.3883582231248927, "eval_rouge1": 0.36852942137992606, "eval_rouge2": 0.33485300994926664, "eval_rougeL": 0.35705470249538007, "eval_runtime": 62.2584, "eval_samples_per_second": 3.212, "eval_steps_per_second": 0.209, "eval_substring_accuracy": 0.2644230769230769, "step": 200 }, { "epoch": 0.10296956881493059, "grad_norm": 38.215309143066406, "learning_rate": 9.201005025125629e-06, "loss": 0.9937, "step": 210 }, { "epoch": 0.10787288161564157, "grad_norm": 26.703927993774414, "learning_rate": 9.150753768844222e-06, "loss": 0.7609, "step": 220 }, { "epoch": 0.11277619441635255, "grad_norm": 17.413555145263672, "learning_rate": 9.100502512562814e-06, "loss": 0.5952, "step": 230 }, { "epoch": 0.11767950721706352, "grad_norm": 10.940084457397461, "learning_rate": 9.050251256281409e-06, "loss": 0.4761, "step": 240 }, { "epoch": 0.12258282001777451, "grad_norm": 6.992828845977783, "learning_rate": 9e-06, "loss": 0.4064, "step": 250 }, { "epoch": 0.12748613281848548, "grad_norm": 4.597628593444824, "learning_rate": 8.949748743718593e-06, "loss": 0.3508, "step": 260 }, { "epoch": 0.13238944561919647, "grad_norm": 3.1910245418548584, "learning_rate": 8.899497487437187e-06, "loss": 0.2929, "step": 270 }, { "epoch": 0.13729275841990746, "grad_norm": 2.1990866661071777, "learning_rate": 8.84924623115578e-06, "loss": 0.241, "step": 280 }, { "epoch": 0.14219607122061842, "grad_norm": 1.5336138010025024, "learning_rate": 8.798994974874373e-06, "loss": 0.441, "step": 290 }, { "epoch": 0.1470993840213294, "grad_norm": 1.0439887046813965, "learning_rate": 8.748743718592966e-06, "loss": 0.0839, "step": 300 }, { "epoch": 0.1470993840213294, "eval_bleu": 0.8777994634083494, "eval_exact_match": 0.2548076923076923, "eval_loss": 0.06626231968402863, "eval_overlap_f1": 0.9088659585838987, "eval_rouge1": 0.9063033282561512, "eval_rouge2": 0.8942021365610976, "eval_rougeL": 0.9015459692112401, "eval_runtime": 22.2958, "eval_samples_per_second": 8.97, "eval_steps_per_second": 0.583, "eval_substring_accuracy": 0.33653846153846156, "step": 300 }, { "epoch": 0.1520026968220404, "grad_norm": 0.8918174505233765, "learning_rate": 8.698492462311558e-06, "loss": 0.0603, "step": 310 }, { "epoch": 0.15690600962275136, "grad_norm": 0.8070284724235535, "learning_rate": 8.648241206030151e-06, "loss": 0.0471, "step": 320 }, { "epoch": 0.16180932242346235, "grad_norm": 2.4222471714019775, "learning_rate": 8.597989949748744e-06, "loss": 0.0295, "step": 330 }, { "epoch": 0.16671263522417334, "grad_norm": 0.49611347913742065, "learning_rate": 8.547738693467338e-06, "loss": 0.0255, "step": 340 }, { "epoch": 0.1716159480248843, "grad_norm": 0.2609233558177948, "learning_rate": 8.497487437185931e-06, "loss": 0.0105, "step": 350 }, { "epoch": 0.1765192608255953, "grad_norm": 0.2548035979270935, "learning_rate": 8.447236180904524e-06, "loss": 0.0128, "step": 360 }, { "epoch": 0.18142257362630626, "grad_norm": 0.18216729164123535, "learning_rate": 8.396984924623116e-06, "loss": 0.0084, "step": 370 }, { "epoch": 0.18632588642701725, "grad_norm": 0.15114252269268036, "learning_rate": 8.346733668341709e-06, "loss": 0.0064, "step": 380 }, { "epoch": 0.19122919922772824, "grad_norm": 0.1348075270652771, "learning_rate": 8.296482412060302e-06, "loss": 0.0062, "step": 390 }, { "epoch": 0.1961325120284392, "grad_norm": 0.25008365511894226, "learning_rate": 8.246231155778895e-06, "loss": 0.0062, "step": 400 }, { "epoch": 0.1961325120284392, "eval_bleu": 0.8264721397464441, "eval_exact_match": 0.6009615384615384, "eval_loss": 0.0034012680407613516, "eval_overlap_f1": 0.9396967958900664, "eval_rouge1": 0.9287252310234548, "eval_rouge2": 0.924869521658068, "eval_rougeL": 0.92772120031963, "eval_runtime": 18.5847, "eval_samples_per_second": 10.762, "eval_steps_per_second": 0.7, "eval_substring_accuracy": 0.8942307692307693, "step": 400 }, { "epoch": 0.2010358248291502, "grad_norm": 0.11969061940908432, "learning_rate": 8.195979899497489e-06, "loss": 0.0054, "step": 410 }, { "epoch": 0.20593913762986119, "grad_norm": 0.10634017735719681, "learning_rate": 8.14572864321608e-06, "loss": 0.0053, "step": 420 }, { "epoch": 0.21084245043057215, "grad_norm": 0.10716363042593002, "learning_rate": 8.095477386934673e-06, "loss": 0.0052, "step": 430 }, { "epoch": 0.21574576323128314, "grad_norm": 0.09278230369091034, "learning_rate": 8.045226130653267e-06, "loss": 0.0051, "step": 440 }, { "epoch": 0.22064907603199413, "grad_norm": 0.08859017491340637, "learning_rate": 7.99497487437186e-06, "loss": 0.0049, "step": 450 }, { "epoch": 0.2255523888327051, "grad_norm": 0.08707090467214584, "learning_rate": 7.944723618090453e-06, "loss": 0.0053, "step": 460 }, { "epoch": 0.23045570163341608, "grad_norm": 0.13823187351226807, "learning_rate": 7.894472361809046e-06, "loss": 0.0047, "step": 470 }, { "epoch": 0.23535901443412705, "grad_norm": 0.07414552569389343, "learning_rate": 7.844221105527638e-06, "loss": 0.0042, "step": 480 }, { "epoch": 0.24026232723483804, "grad_norm": 0.08094857633113861, "learning_rate": 7.793969849246233e-06, "loss": 0.0046, "step": 490 }, { "epoch": 0.24516564003554903, "grad_norm": 0.07222504168748856, "learning_rate": 7.743718592964824e-06, "loss": 0.0041, "step": 500 }, { "epoch": 0.24516564003554903, "eval_bleu": 0.7604122865829173, "eval_exact_match": 0.4855769230769231, "eval_loss": 0.0026578546967357397, "eval_overlap_f1": 0.9140666246940682, "eval_rouge1": 0.8993297480179168, "eval_rouge2": 0.8943847041495613, "eval_rougeL": 0.897489490164824, "eval_runtime": 17.607, "eval_samples_per_second": 11.359, "eval_steps_per_second": 0.738, "eval_substring_accuracy": 0.9038461538461539, "step": 500 } ], "logging_steps": 10, "max_steps": 2040, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 100, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.001 }, "attributes": { "early_stopping_patience_counter": 1 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.77392610295808e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }