{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.07437363454655324, "eval_steps": 100, "global_step": 200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0018593408636638311, "grad_norm": 0.5517500638961792, "learning_rate": 5e-06, "loss": 0.849, "mean_token_accuracy": 0.7567294089429264, "step": 5 }, { "epoch": 0.0037186817273276622, "grad_norm": 0.5036010146141052, "learning_rate": 1e-05, "loss": 0.8417, "mean_token_accuracy": 0.7602161832405375, "step": 10 }, { "epoch": 0.005578022590991494, "grad_norm": 0.3149392902851105, "learning_rate": 1.5000000000000002e-05, "loss": 0.7461, "mean_token_accuracy": 0.7812357557611331, "step": 15 }, { "epoch": 0.0074373634546553245, "grad_norm": 0.3778176009654999, "learning_rate": 2e-05, "loss": 0.7233, "mean_token_accuracy": 0.7826617092119108, "step": 20 }, { "epoch": 0.009296704318319155, "grad_norm": 0.2921108603477478, "learning_rate": 1.9961946980917457e-05, "loss": 0.745, "mean_token_accuracy": 0.7759210851951164, "step": 25 }, { "epoch": 0.011156045181982988, "grad_norm": 0.3256559371948242, "learning_rate": 1.9848077530122083e-05, "loss": 0.7145, "mean_token_accuracy": 0.7840695255723248, "step": 30 }, { "epoch": 0.013015386045646818, "grad_norm": 0.2694910168647766, "learning_rate": 1.9659258262890683e-05, "loss": 0.7124, "mean_token_accuracy": 0.784175317004461, "step": 35 }, { "epoch": 0.014874726909310649, "grad_norm": 0.2669820487499237, "learning_rate": 1.9396926207859085e-05, "loss": 0.7094, "mean_token_accuracy": 0.7820243731166748, "step": 40 }, { "epoch": 0.01673406777297448, "grad_norm": 0.26924929022789, "learning_rate": 1.9063077870366504e-05, "loss": 0.7151, "mean_token_accuracy": 0.7791444741833659, "step": 45 }, { "epoch": 0.01859340863663831, "grad_norm": 0.26232558488845825, "learning_rate": 1.866025403784439e-05, "loss": 0.7383, "mean_token_accuracy": 0.777497076097214, "step": 50 }, { "epoch": 0.020452749500302143, "grad_norm": 0.23832707107067108, "learning_rate": 1.819152044288992e-05, "loss": 0.7205, "mean_token_accuracy": 0.7795166406125732, "step": 55 }, { "epoch": 0.022312090363965975, "grad_norm": 0.30983492732048035, "learning_rate": 1.766044443118978e-05, "loss": 0.7106, "mean_token_accuracy": 0.7813780332583716, "step": 60 }, { "epoch": 0.024171431227629804, "grad_norm": 0.27913030982017517, "learning_rate": 1.7071067811865477e-05, "loss": 0.7204, "mean_token_accuracy": 0.7806608674214954, "step": 65 }, { "epoch": 0.026030772091293636, "grad_norm": 0.2503748834133148, "learning_rate": 1.6427876096865394e-05, "loss": 0.6764, "mean_token_accuracy": 0.7921326068873837, "step": 70 }, { "epoch": 0.02789011295495747, "grad_norm": 0.32490983605384827, "learning_rate": 1.573576436351046e-05, "loss": 0.7179, "mean_token_accuracy": 0.7781825838933683, "step": 75 }, { "epoch": 0.029749453818621298, "grad_norm": 0.2666051983833313, "learning_rate": 1.5000000000000002e-05, "loss": 0.6915, "mean_token_accuracy": 0.7871176789479889, "step": 80 }, { "epoch": 0.03160879468228513, "grad_norm": 0.276684433221817, "learning_rate": 1.4226182617406996e-05, "loss": 0.6877, "mean_token_accuracy": 0.7900803501022032, "step": 85 }, { "epoch": 0.03346813554594896, "grad_norm": 0.286432147026062, "learning_rate": 1.342020143325669e-05, "loss": 0.7208, "mean_token_accuracy": 0.7803869265741546, "step": 90 }, { "epoch": 0.03532747640961279, "grad_norm": 0.21728664636611938, "learning_rate": 1.2588190451025209e-05, "loss": 0.657, "mean_token_accuracy": 0.7990809317528936, "step": 95 }, { "epoch": 0.03718681727327662, "grad_norm": 0.23999415338039398, "learning_rate": 1.1736481776669307e-05, "loss": 0.6769, "mean_token_accuracy": 0.7904624964468849, "step": 100 }, { "epoch": 0.03718681727327662, "eval_loss": 0.7101884484291077, "eval_mean_token_accuracy": 0.7805987882478478, "eval_runtime": 36.4141, "eval_samples_per_second": 7.003, "eval_steps_per_second": 3.515, "step": 100 }, { "epoch": 0.039046158136940456, "grad_norm": 0.2708650827407837, "learning_rate": 1.0871557427476585e-05, "loss": 0.6898, "mean_token_accuracy": 0.7857329375276986, "step": 105 }, { "epoch": 0.040905499000604285, "grad_norm": 0.2756446301937103, "learning_rate": 1e-05, "loss": 0.6699, "mean_token_accuracy": 0.7941881122764894, "step": 110 }, { "epoch": 0.042764839864268114, "grad_norm": 0.2609730660915375, "learning_rate": 9.128442572523418e-06, "loss": 0.6701, "mean_token_accuracy": 0.7917057155226149, "step": 115 }, { "epoch": 0.04462418072793195, "grad_norm": 0.24993322789669037, "learning_rate": 8.263518223330698e-06, "loss": 0.6932, "mean_token_accuracy": 0.785013354890821, "step": 120 }, { "epoch": 0.04648352159159578, "grad_norm": 0.26059097051620483, "learning_rate": 7.411809548974792e-06, "loss": 0.7185, "mean_token_accuracy": 0.7797458006772034, "step": 125 }, { "epoch": 0.04834286245525961, "grad_norm": 0.29260385036468506, "learning_rate": 6.579798566743314e-06, "loss": 0.6946, "mean_token_accuracy": 0.7872012509701252, "step": 130 }, { "epoch": 0.050202203318923444, "grad_norm": 0.2695474624633789, "learning_rate": 5.773817382593008e-06, "loss": 0.7062, "mean_token_accuracy": 0.7810278868453384, "step": 135 }, { "epoch": 0.05206154418258727, "grad_norm": 0.2609573006629944, "learning_rate": 5.000000000000003e-06, "loss": 0.714, "mean_token_accuracy": 0.7813100702221802, "step": 140 }, { "epoch": 0.0539208850462511, "grad_norm": 0.2358129918575287, "learning_rate": 4.264235636489542e-06, "loss": 0.6856, "mean_token_accuracy": 0.7875874510326348, "step": 145 }, { "epoch": 0.05578022590991494, "grad_norm": 0.2715813219547272, "learning_rate": 3.5721239031346067e-06, "loss": 0.6763, "mean_token_accuracy": 0.7909748424399494, "step": 150 }, { "epoch": 0.05763956677357877, "grad_norm": 0.2746134400367737, "learning_rate": 2.9289321881345257e-06, "loss": 0.6526, "mean_token_accuracy": 0.7976525522946976, "step": 155 }, { "epoch": 0.059498907637242596, "grad_norm": 0.27577507495880127, "learning_rate": 2.339555568810221e-06, "loss": 0.7025, "mean_token_accuracy": 0.7832329110436247, "step": 160 }, { "epoch": 0.06135824850090643, "grad_norm": 0.2632084786891937, "learning_rate": 1.808479557110081e-06, "loss": 0.7124, "mean_token_accuracy": 0.7811312896263776, "step": 165 }, { "epoch": 0.06321758936457025, "grad_norm": 0.24432240426540375, "learning_rate": 1.339745962155613e-06, "loss": 0.673, "mean_token_accuracy": 0.7929312039857386, "step": 170 }, { "epoch": 0.06507693022823409, "grad_norm": 0.29202762246131897, "learning_rate": 9.369221296335007e-07, "loss": 0.6661, "mean_token_accuracy": 0.7959059321766028, "step": 175 }, { "epoch": 0.06693627109189793, "grad_norm": 0.2842048406600952, "learning_rate": 6.030737921409169e-07, "loss": 0.6624, "mean_token_accuracy": 0.7954249017619823, "step": 180 }, { "epoch": 0.06879561195556175, "grad_norm": 0.27937719225883484, "learning_rate": 3.4074173710931804e-07, "loss": 0.6797, "mean_token_accuracy": 0.7905420581208954, "step": 185 }, { "epoch": 0.07065495281922558, "grad_norm": 0.2555555999279022, "learning_rate": 1.519224698779198e-07, "loss": 0.6621, "mean_token_accuracy": 0.7970947981270515, "step": 190 }, { "epoch": 0.07251429368288942, "grad_norm": 0.2836684286594391, "learning_rate": 3.805301908254455e-08, "loss": 0.6908, "mean_token_accuracy": 0.7861675013499152, "step": 195 }, { "epoch": 0.07437363454655324, "grad_norm": 0.2971171438694, "learning_rate": 0.0, "loss": 0.6917, "mean_token_accuracy": 0.7878082632745567, "step": 200 }, { "epoch": 0.07437363454655324, "eval_loss": 0.7039155960083008, "eval_mean_token_accuracy": 0.782441121027168, "eval_runtime": 36.4458, "eval_samples_per_second": 6.997, "eval_steps_per_second": 3.512, "step": 200 }, { "epoch": 0.07437363454655324, "step": 200, "total_flos": 6.070131503398912e+16, "train_loss": 0.7046466362476349, "train_runtime": 3718.7973, "train_samples_per_second": 0.86, "train_steps_per_second": 0.054 } ], "logging_steps": 5, "max_steps": 200, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": false, "should_training_stop": false }, "attributes": {} } }, "total_flos": 6.070131503398912e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }