{ "best_global_step": 609, "best_metric": 0.8755947274003588, "best_model_checkpoint": "./ner_crf_boundary_output/checkpoint-609", "epoch": 1.0, "eval_steps": 500, "global_step": 609, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.08213552361396304, "grad_norm": 289.9013977050781, "learning_rate": 2.677595628415301e-06, "loss": 7.03633056640625, "step": 50 }, { "epoch": 0.16427104722792607, "grad_norm": 397.5795593261719, "learning_rate": 5.409836065573772e-06, "loss": 5.944567260742187, "step": 100 }, { "epoch": 0.2464065708418891, "grad_norm": 1030.340576171875, "learning_rate": 8.14207650273224e-06, "loss": 6.386118774414062, "step": 150 }, { "epoch": 0.32854209445585214, "grad_norm": 416.71173095703125, "learning_rate": 9.944095038434662e-06, "loss": 6.638558349609375, "step": 200 }, { "epoch": 0.4106776180698152, "grad_norm": 379.8328857421875, "learning_rate": 9.769392033542979e-06, "loss": 5.887216186523437, "step": 250 }, { "epoch": 0.4928131416837782, "grad_norm": 328.294921875, "learning_rate": 9.594689028651294e-06, "loss": 6.057736206054687, "step": 300 }, { "epoch": 0.5749486652977412, "grad_norm": 306.49560546875, "learning_rate": 9.41998602375961e-06, "loss": 6.300731201171875, "step": 350 }, { "epoch": 0.6570841889117043, "grad_norm": 406.1339111328125, "learning_rate": 9.245283018867926e-06, "loss": 5.523515625, "step": 400 }, { "epoch": 0.7392197125256673, "grad_norm": 405.34136962890625, "learning_rate": 9.070580013976241e-06, "loss": 6.377322998046875, "step": 450 }, { "epoch": 0.8213552361396304, "grad_norm": 219.61463928222656, "learning_rate": 8.895877009084557e-06, "loss": 5.774469604492188, "step": 500 }, { "epoch": 0.9034907597535934, "grad_norm": 294.69683837890625, "learning_rate": 8.721174004192873e-06, "loss": 6.709805297851562, "step": 550 }, { "epoch": 0.9856262833675564, "grad_norm": 397.64190673828125, "learning_rate": 8.546470999301189e-06, "loss": 5.980140991210938, "step": 600 }, { "epoch": 1.0, "eval_f1": 0.8755947274003588, "eval_loss": 4.1545538902282715, "eval_precision": 0.8619471744471745, "eval_recall": 0.8896814075130766, "eval_runtime": 44.15, "eval_samples_per_second": 49.015, "eval_steps_per_second": 6.138, "step": 609 } ], "logging_steps": 50, "max_steps": 3045, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 2, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }