{ "best_global_step": 696, "best_metric": 37.6433, "best_model_checkpoint": "./results_bart_large/checkpoint-696", "epoch": 2.0, "eval_steps": 500, "global_step": 696, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.14398848092152627, "grad_norm": 86.04337310791016, "learning_rate": 2.859195402298851e-05, "loss": 23.5227392578125, "step": 50 }, { "epoch": 0.28797696184305255, "grad_norm": 125.26842498779297, "learning_rate": 2.7155172413793102e-05, "loss": 20.470574951171876, "step": 100 }, { "epoch": 0.4319654427645788, "grad_norm": 165.9732208251953, "learning_rate": 2.57183908045977e-05, "loss": 20.68321044921875, "step": 150 }, { "epoch": 0.5759539236861051, "grad_norm": 102.4205551147461, "learning_rate": 2.4281609195402298e-05, "loss": 20.2867919921875, "step": 200 }, { "epoch": 0.7199424046076314, "grad_norm": 97.07613372802734, "learning_rate": 2.2844827586206897e-05, "loss": 19.927686767578123, "step": 250 }, { "epoch": 0.8639308855291576, "grad_norm": 213.36459350585938, "learning_rate": 2.1408045977011497e-05, "loss": 19.565047607421874, "step": 300 }, { "epoch": 1.0, "eval_loss": 2.2826883792877197, "eval_rouge1": 44.9926, "eval_rouge2": 21.3081, "eval_rougeL": 36.6377, "eval_rougeLsum": 36.6539, "eval_runtime": 171.3954, "eval_samples_per_second": 2.025, "eval_steps_per_second": 2.025, "step": 348 }, { "epoch": 1.005759539236861, "grad_norm": 145.24673461914062, "learning_rate": 1.997126436781609e-05, "loss": 19.29373291015625, "step": 350 }, { "epoch": 1.1497480201583874, "grad_norm": 270.0838623046875, "learning_rate": 1.853448275862069e-05, "loss": 16.37059326171875, "step": 400 }, { "epoch": 1.2937365010799136, "grad_norm": 87.3062973022461, "learning_rate": 1.709770114942529e-05, "loss": 15.338236083984375, "step": 450 }, { "epoch": 1.43772498200144, "grad_norm": 138.10104370117188, "learning_rate": 1.5660919540229885e-05, "loss": 16.017222900390625, "step": 500 }, { "epoch": 1.5817134629229663, "grad_norm": 221.23165893554688, "learning_rate": 1.4224137931034483e-05, "loss": 15.628026123046874, "step": 550 }, { "epoch": 1.7257019438444925, "grad_norm": 87.9384994506836, "learning_rate": 1.2787356321839081e-05, "loss": 15.281673583984375, "step": 600 }, { "epoch": 1.8696904247660187, "grad_norm": 80.72342681884766, "learning_rate": 1.1350574712643677e-05, "loss": 15.443740234375, "step": 650 }, { "epoch": 2.0, "eval_loss": 2.2174012660980225, "eval_rouge1": 45.7446, "eval_rouge2": 22.2135, "eval_rougeL": 37.6433, "eval_rougeLsum": 37.6641, "eval_runtime": 160.8627, "eval_samples_per_second": 2.157, "eval_steps_per_second": 2.157, "step": 696 } ], "logging_steps": 50, "max_steps": 1044, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2429561286033408.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }