{ "best_global_step": 100, "best_metric": 0.581007719039917, "best_model_checkpoint": "outputs/lfm25-350m-commonsenseqa-lr1e4-r16-2k/checkpoint-100", "epoch": 2.0, "eval_steps": 50, "global_step": 250, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.49207068714313207, "epoch": 0.08, "grad_norm": 4.990988731384277, "learning_rate": 9.999578688879086e-05, "loss": 2.135391044616699, "mean_token_accuracy": 0.496875, "num_tokens": 9256.0, "step": 10 }, { "entropy": 0.7180297434329986, "epoch": 0.16, "grad_norm": 7.038885116577148, "learning_rate": 9.949107209404665e-05, "loss": 0.6821131229400634, "mean_token_accuracy": 0.7125, "num_tokens": 18706.0, "step": 20 }, { "entropy": 0.6099569849669934, "epoch": 0.24, "grad_norm": 9.42757511138916, "learning_rate": 9.815347070757232e-05, "loss": 0.7423738956451416, "mean_token_accuracy": 0.740625, "num_tokens": 27989.0, "step": 30 }, { "entropy": 0.6278413623571396, "epoch": 0.32, "grad_norm": 8.080451965332031, "learning_rate": 9.60054932593026e-05, "loss": 0.6707581043243408, "mean_token_accuracy": 0.73125, "num_tokens": 37273.0, "step": 40 }, { "entropy": 0.5547127045691014, "epoch": 0.4, "grad_norm": 5.448123931884766, "learning_rate": 9.30832881198487e-05, "loss": 0.6080288887023926, "mean_token_accuracy": 0.759375, "num_tokens": 46599.0, "step": 50 }, { "epoch": 0.4, "eval_entropy": 0.6053476703712364, "eval_loss": 0.6080912351608276, "eval_mean_token_accuracy": 0.7634803921568627, "eval_num_tokens": 46599.0, "eval_runtime": 11.5175, "eval_samples_per_second": 106.013, "eval_steps_per_second": 26.568, "step": 50 }, { "entropy": 0.6223195999860763, "epoch": 0.48, "grad_norm": 5.2335968017578125, "learning_rate": 8.943603315859101e-05, "loss": 0.6296503067016601, "mean_token_accuracy": 0.775, "num_tokens": 55998.0, "step": 60 }, { "entropy": 0.5325490891933441, "epoch": 0.56, "grad_norm": 3.735042095184326, "learning_rate": 8.512510812798426e-05, "loss": 0.6199626445770263, "mean_token_accuracy": 0.771875, "num_tokens": 65297.0, "step": 70 }, { "entropy": 0.6412477873265743, "epoch": 0.64, "grad_norm": 4.131916046142578, "learning_rate": 8.022306170204233e-05, "loss": 0.6183301448822022, "mean_token_accuracy": 0.759375, "num_tokens": 74530.0, "step": 80 }, { "entropy": 0.5066440511494875, "epoch": 0.72, "grad_norm": 6.953462600708008, "learning_rate": 7.481239055273959e-05, "loss": 0.6243555068969726, "mean_token_accuracy": 0.746875, "num_tokens": 83810.0, "step": 90 }, { "entropy": 0.5975224792957305, "epoch": 0.8, "grad_norm": 5.960926055908203, "learning_rate": 6.89841510112857e-05, "loss": 0.6379575729370117, "mean_token_accuracy": 0.75, "num_tokens": 93098.0, "step": 100 }, { "epoch": 0.8, "eval_entropy": 0.6016070044118594, "eval_loss": 0.581007719039917, "eval_mean_token_accuracy": 0.7745098039215687, "eval_num_tokens": 93098.0, "eval_runtime": 11.377, "eval_samples_per_second": 107.322, "eval_steps_per_second": 26.896, "step": 100 }, { "entropy": 0.593381131440401, "epoch": 0.88, "grad_norm": 5.572819232940674, "learning_rate": 6.283642667866316e-05, "loss": 0.5591686725616455, "mean_token_accuracy": 0.803125, "num_tokens": 102498.0, "step": 110 }, { "entropy": 0.5462032213807106, "epoch": 0.96, "grad_norm": 5.610764980316162, "learning_rate": 5.647267777405177e-05, "loss": 0.5735011577606202, "mean_token_accuracy": 0.784375, "num_tokens": 111914.0, "step": 120 }, { "entropy": 0.5103660989552736, "epoch": 1.04, "grad_norm": 4.618079662322998, "learning_rate": 5e-05, "loss": 0.4889837265014648, "mean_token_accuracy": 0.821875, "num_tokens": 121287.0, "step": 130 }, { "entropy": 0.2951751688495278, "epoch": 1.12, "grad_norm": 11.136743545532227, "learning_rate": 4.3527322225948234e-05, "loss": 0.3513810634613037, "mean_token_accuracy": 0.89375, "num_tokens": 130667.0, "step": 140 }, { "entropy": 0.2440035931766033, "epoch": 1.2, "grad_norm": 8.998021125793457, "learning_rate": 3.716357332133687e-05, "loss": 0.3495033740997314, "mean_token_accuracy": 0.9, "num_tokens": 139891.0, "step": 150 }, { "epoch": 1.2, "eval_entropy": 0.3550063371658325, "eval_loss": 0.6342237591743469, "eval_mean_token_accuracy": 0.7879901960784313, "eval_num_tokens": 139891.0, "eval_runtime": 11.4365, "eval_samples_per_second": 106.763, "eval_steps_per_second": 26.756, "step": 150 }, { "entropy": 0.33935176096856595, "epoch": 1.28, "grad_norm": 4.766120433807373, "learning_rate": 3.1015848988714305e-05, "loss": 0.3303521156311035, "mean_token_accuracy": 0.8875, "num_tokens": 149299.0, "step": 160 }, { "entropy": 0.36539566218853, "epoch": 1.3599999999999999, "grad_norm": 7.436731338500977, "learning_rate": 2.5187609447260417e-05, "loss": 0.348486065864563, "mean_token_accuracy": 0.865625, "num_tokens": 158544.0, "step": 170 }, { "entropy": 0.33908074218779805, "epoch": 1.44, "grad_norm": 8.012598991394043, "learning_rate": 1.9776938297957687e-05, "loss": 0.4287095069885254, "mean_token_accuracy": 0.834375, "num_tokens": 167960.0, "step": 180 }, { "entropy": 0.3853272207081318, "epoch": 1.52, "grad_norm": 5.60869836807251, "learning_rate": 1.4874891872015734e-05, "loss": 0.3443429708480835, "mean_token_accuracy": 0.890625, "num_tokens": 177219.0, "step": 190 }, { "entropy": 0.3327586879953742, "epoch": 1.6, "grad_norm": 6.2800164222717285, "learning_rate": 1.0563966841408995e-05, "loss": 0.3429755926132202, "mean_token_accuracy": 0.89375, "num_tokens": 186610.0, "step": 200 }, { "epoch": 1.6, "eval_entropy": 0.37273075129057653, "eval_loss": 0.6045761704444885, "eval_mean_token_accuracy": 0.7920751633986928, "eval_num_tokens": 186610.0, "eval_runtime": 11.4402, "eval_samples_per_second": 106.729, "eval_steps_per_second": 26.748, "step": 200 }, { "entropy": 0.3120275104418397, "epoch": 1.6800000000000002, "grad_norm": 3.8584883213043213, "learning_rate": 6.916711880151306e-06, "loss": 0.35584330558776855, "mean_token_accuracy": 0.871875, "num_tokens": 196043.0, "step": 210 }, { "entropy": 0.32570266518741847, "epoch": 1.76, "grad_norm": 7.246922492980957, "learning_rate": 3.994506740697407e-06, "loss": 0.3419358730316162, "mean_token_accuracy": 0.878125, "num_tokens": 205352.0, "step": 220 }, { "entropy": 0.31593060959130526, "epoch": 1.8399999999999999, "grad_norm": 5.6120829582214355, "learning_rate": 1.8465292924276845e-06, "loss": 0.3507185935974121, "mean_token_accuracy": 0.88125, "num_tokens": 214621.0, "step": 230 }, { "entropy": 0.34746452011168005, "epoch": 1.92, "grad_norm": 6.788421154022217, "learning_rate": 5.089279059533658e-07, "loss": 0.37170000076293946, "mean_token_accuracy": 0.86875, "num_tokens": 223936.0, "step": 240 }, { "entropy": 0.3478228982537985, "epoch": 2.0, "grad_norm": 4.587532997131348, "learning_rate": 4.213111209155907e-09, "loss": 0.29353837966918944, "mean_token_accuracy": 0.8875, "num_tokens": 233188.0, "step": 250 }, { "epoch": 2.0, "eval_entropy": 0.38705892378793044, "eval_loss": 0.5934809446334839, "eval_mean_token_accuracy": 0.7900326797385621, "eval_num_tokens": 233188.0, "eval_runtime": 11.4469, "eval_samples_per_second": 106.667, "eval_steps_per_second": 26.732, "step": 250 }, { "epoch": 2.0, "step": 250, "total_flos": 463827616407552.0, "train_loss": 0.5520024652481079, "train_runtime": 156.6255, "train_samples_per_second": 25.539, "train_steps_per_second": 1.596 } ], "logging_steps": 10, "max_steps": 250, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 463827616407552.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }