{ "best_global_step": 70, "best_metric": 80.06465424867399, "best_model_checkpoint": "./finetuned_models/roberta-base-squad2-nq-nasa\\checkpoint-70", "epoch": 4.5, "eval_steps": 10, "global_step": 90, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.25, "grad_norm": 78.77288818359375, "learning_rate": 2.88e-05, "loss": 2.4514, "step": 5 }, { "epoch": 0.5, "grad_norm": 38.788047790527344, "learning_rate": 2.7300000000000003e-05, "loss": 2.5046, "step": 10 }, { "epoch": 0.5, "eval_HasAns_f1": 72.05322567724542, "eval_NoAns_f1": 0.0, "eval_exact": 58.0, "eval_f1": 72.05322567724542, "eval_loss": 1.7548620700836182, "eval_runtime": 0.281, "eval_samples_per_second": 177.92, "eval_steps_per_second": 14.234, "step": 10 }, { "epoch": 0.75, "grad_norm": 39.58235168457031, "learning_rate": 2.58e-05, "loss": 2.161, "step": 15 }, { "epoch": 1.0, "grad_norm": 27.151378631591797, "learning_rate": 2.43e-05, "loss": 1.5071, "step": 20 }, { "epoch": 1.0, "eval_HasAns_f1": 79.20518851115948, "eval_NoAns_f1": 0.0, "eval_exact": 66.0, "eval_f1": 79.20518851115948, "eval_loss": 1.5741324424743652, "eval_runtime": 0.2825, "eval_samples_per_second": 176.976, "eval_steps_per_second": 14.158, "step": 20 }, { "epoch": 1.25, "grad_norm": 22.792789459228516, "learning_rate": 2.2800000000000002e-05, "loss": 1.1212, "step": 25 }, { "epoch": 1.5, "grad_norm": 16.58112907409668, "learning_rate": 2.13e-05, "loss": 1.0362, "step": 30 }, { "epoch": 1.5, "eval_HasAns_f1": 72.06465424867399, "eval_NoAns_f1": 0.0, "eval_exact": 58.0, "eval_f1": 72.06465424867399, "eval_loss": 1.6612951755523682, "eval_runtime": 0.2746, "eval_samples_per_second": 182.093, "eval_steps_per_second": 14.567, "step": 30 }, { "epoch": 1.75, "grad_norm": 28.810911178588867, "learning_rate": 1.98e-05, "loss": 1.0579, "step": 35 }, { "epoch": 2.0, "grad_norm": 18.168163299560547, "learning_rate": 1.83e-05, "loss": 0.7972, "step": 40 }, { "epoch": 2.0, "eval_HasAns_f1": 71.7789399629597, "eval_NoAns_f1": 0.0, "eval_exact": 56.0, "eval_f1": 71.7789399629597, "eval_loss": 1.7468838691711426, "eval_runtime": 0.2855, "eval_samples_per_second": 175.114, "eval_steps_per_second": 14.009, "step": 40 }, { "epoch": 2.25, "grad_norm": 12.084095001220703, "learning_rate": 1.6800000000000002e-05, "loss": 0.7772, "step": 45 }, { "epoch": 2.5, "grad_norm": 15.065386772155762, "learning_rate": 1.53e-05, "loss": 0.3204, "step": 50 }, { "epoch": 2.5, "eval_HasAns_f1": 78.35036853438828, "eval_NoAns_f1": 0.0, "eval_exact": 66.0, "eval_f1": 78.35036853438828, "eval_loss": 1.749760389328003, "eval_runtime": 0.2837, "eval_samples_per_second": 176.263, "eval_steps_per_second": 14.101, "step": 50 }, { "epoch": 2.75, "grad_norm": 14.943965911865234, "learning_rate": 1.3800000000000002e-05, "loss": 0.5864, "step": 55 }, { "epoch": 3.0, "grad_norm": 69.38665771484375, "learning_rate": 1.2299999999999999e-05, "loss": 0.4019, "step": 60 }, { "epoch": 3.0, "eval_HasAns_f1": 76.06465424867399, "eval_NoAns_f1": 0.0, "eval_exact": 62.0, "eval_f1": 76.06465424867399, "eval_loss": 1.8023927211761475, "eval_runtime": 0.2736, "eval_samples_per_second": 182.767, "eval_steps_per_second": 14.621, "step": 60 }, { "epoch": 3.25, "grad_norm": 4.20263671875, "learning_rate": 1.08e-05, "loss": 0.3497, "step": 65 }, { "epoch": 3.5, "grad_norm": 19.26348876953125, "learning_rate": 9.3e-06, "loss": 0.4772, "step": 70 }, { "epoch": 3.5, "eval_HasAns_f1": 80.06465424867399, "eval_NoAns_f1": 0.0, "eval_exact": 66.0, "eval_f1": 80.06465424867399, "eval_loss": 1.7305716276168823, "eval_runtime": 0.2777, "eval_samples_per_second": 180.029, "eval_steps_per_second": 14.402, "step": 70 }, { "epoch": 3.75, "grad_norm": 14.338303565979004, "learning_rate": 7.8e-06, "loss": 0.268, "step": 75 }, { "epoch": 4.0, "grad_norm": 2.6691396236419678, "learning_rate": 6.3e-06, "loss": 0.3622, "step": 80 }, { "epoch": 4.0, "eval_HasAns_f1": 78.06465424867399, "eval_NoAns_f1": 0.0, "eval_exact": 64.0, "eval_f1": 78.06465424867399, "eval_loss": 1.7988979816436768, "eval_runtime": 0.276, "eval_samples_per_second": 181.159, "eval_steps_per_second": 14.493, "step": 80 }, { "epoch": 4.25, "grad_norm": 7.720816135406494, "learning_rate": 4.800000000000001e-06, "loss": 0.1835, "step": 85 }, { "epoch": 4.5, "grad_norm": 13.70312786102295, "learning_rate": 3.3e-06, "loss": 0.4416, "step": 90 }, { "epoch": 4.5, "eval_HasAns_f1": 78.16991740656873, "eval_NoAns_f1": 0.0, "eval_exact": 66.0, "eval_f1": 78.16991740656873, "eval_loss": 1.8446077108383179, "eval_runtime": 0.2905, "eval_samples_per_second": 172.105, "eval_steps_per_second": 13.768, "step": 90 } ], "logging_steps": 5, "max_steps": 100, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 10, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 141100248637440.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }