{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.08343360002810395, "eval_steps": 1000, "global_step": 9500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 8.782484213484626e-06, "grad_norm": 3.650646209716797, "learning_rate": 3e-06, "loss": 2.4534, "step": 1 }, { "epoch": 0.008782484213484626, "grad_norm": 7.008567810058594, "learning_rate": 2.9736788948121867e-06, "loss": 0.9508, "step": 1000 }, { "epoch": 0.008782484213484626, "eval_accuracy": 0.8620952367782593, "eval_loss": 0.6480623483657837, "eval_runtime": 91.7053, "eval_samples_per_second": 100.343, "eval_steps_per_second": 12.551, "step": 1000 }, { "epoch": 0.017564968426969252, "grad_norm": 7.082250595092773, "learning_rate": 2.9473314421717326e-06, "loss": 0.5848, "step": 2000 }, { "epoch": 0.017564968426969252, "eval_accuracy": 0.8683981895446777, "eval_loss": 0.5488540530204773, "eval_runtime": 88.6005, "eval_samples_per_second": 103.86, "eval_steps_per_second": 12.991, "step": 2000 }, { "epoch": 0.026347452640453878, "grad_norm": 9.752965927124023, "learning_rate": 2.920983989531279e-06, "loss": 0.538, "step": 3000 }, { "epoch": 0.026347452640453878, "eval_accuracy": 0.8763312697410583, "eval_loss": 0.5032069683074951, "eval_runtime": 91.911, "eval_samples_per_second": 100.119, "eval_steps_per_second": 12.523, "step": 3000 }, { "epoch": 0.035129936853938504, "grad_norm": 18.048477172851562, "learning_rate": 2.8946365368908247e-06, "loss": 0.4917, "step": 4000 }, { "epoch": 0.035129936853938504, "eval_accuracy": 0.8798087239265442, "eval_loss": 0.4753971993923187, "eval_runtime": 87.1557, "eval_samples_per_second": 105.581, "eval_steps_per_second": 13.206, "step": 4000 }, { "epoch": 0.04391242106742313, "grad_norm": 3.9426069259643555, "learning_rate": 2.868289084250371e-06, "loss": 0.4623, "step": 5000 }, { "epoch": 0.04391242106742313, "eval_accuracy": 0.8830689191818237, "eval_loss": 0.4554503560066223, "eval_runtime": 90.2062, "eval_samples_per_second": 102.011, "eval_steps_per_second": 12.76, "step": 5000 }, { "epoch": 0.052694905280907756, "grad_norm": 7.809971809387207, "learning_rate": 2.8419416316099173e-06, "loss": 0.4674, "step": 6000 }, { "epoch": 0.052694905280907756, "eval_accuracy": 0.885568380355835, "eval_loss": 0.439510315656662, "eval_runtime": 89.324, "eval_samples_per_second": 103.018, "eval_steps_per_second": 12.886, "step": 6000 }, { "epoch": 0.06147738949439238, "grad_norm": 11.946690559387207, "learning_rate": 2.8155941789694636e-06, "loss": 0.435, "step": 7000 }, { "epoch": 0.06147738949439238, "eval_accuracy": 0.8866550922393799, "eval_loss": 0.4272012412548065, "eval_runtime": 88.643, "eval_samples_per_second": 103.81, "eval_steps_per_second": 12.985, "step": 7000 }, { "epoch": 0.07025987370787701, "grad_norm": 8.120018005371094, "learning_rate": 2.7892467263290094e-06, "loss": 0.4202, "step": 8000 }, { "epoch": 0.07025987370787701, "eval_accuracy": 0.8886111974716187, "eval_loss": 0.41821107268333435, "eval_runtime": 86.7283, "eval_samples_per_second": 106.101, "eval_steps_per_second": 13.271, "step": 8000 }, { "epoch": 0.07904235792136163, "grad_norm": 9.031862258911133, "learning_rate": 2.7628992736885557e-06, "loss": 0.4149, "step": 9000 }, { "epoch": 0.07904235792136163, "eval_accuracy": 0.8927407264709473, "eval_loss": 0.4074467420578003, "eval_runtime": 89.6748, "eval_samples_per_second": 102.615, "eval_steps_per_second": 12.835, "step": 9000 } ], "logging_steps": 1000, "max_steps": 113863, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }