{ "best_metric": 0.8706070780754089, "best_model_checkpoint": "ckpt/origin/pedes_rewrite/checkpoint-104", "epoch": 5.804651162790698, "eval_steps": 13, "global_step": 156, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.04, "learning_rate": 3.3333333333333335e-05, "loss": 1.8602, "step": 1 }, { "epoch": 0.07, "learning_rate": 6.666666666666667e-05, "loss": 1.8321, "step": 2 }, { "epoch": 0.11, "learning_rate": 0.0001, "loss": 1.8243, "step": 3 }, { "epoch": 0.15, "learning_rate": 9.999626433348663e-05, "loss": 1.8373, "step": 4 }, { "epoch": 0.19, "learning_rate": 9.998505789215469e-05, "loss": 1.7732, "step": 5 }, { "epoch": 0.22, "learning_rate": 9.996638235054528e-05, "loss": 1.7818, "step": 6 }, { "epoch": 0.26, "learning_rate": 9.994024049928221e-05, "loss": 1.6944, "step": 7 }, { "epoch": 0.3, "learning_rate": 9.990663624465504e-05, "loss": 1.6106, "step": 8 }, { "epoch": 0.33, "learning_rate": 9.986557460803527e-05, "loss": 1.6462, "step": 9 }, { "epoch": 0.37, "learning_rate": 9.981706172512619e-05, "loss": 1.6212, "step": 10 }, { "epoch": 0.41, "learning_rate": 9.976110484504588e-05, "loss": 1.6387, "step": 11 }, { "epoch": 0.45, "learning_rate": 9.969771232924403e-05, "loss": 1.6043, "step": 12 }, { "epoch": 0.48, "learning_rate": 9.962689365025259e-05, "loss": 1.5568, "step": 13 }, { "epoch": 0.48, "eval_loss": 1.5163209438323975, "eval_runtime": 34.871, "eval_samples_per_second": 1.434, "eval_steps_per_second": 1.434, "step": 13 }, { "epoch": 0.52, "learning_rate": 9.954865939027028e-05, "loss": 1.4951, "step": 14 }, { "epoch": 0.56, "learning_rate": 9.946302123958131e-05, "loss": 1.4334, "step": 15 }, { "epoch": 0.6, "learning_rate": 9.936999199480853e-05, "loss": 1.4054, "step": 16 }, { "epoch": 0.63, "learning_rate": 9.926958555700134e-05, "loss": 1.4458, "step": 17 }, { "epoch": 0.67, "learning_rate": 9.916181692955842e-05, "loss": 1.3881, "step": 18 }, { "epoch": 0.71, "learning_rate": 9.90467022159859e-05, "loss": 1.3585, "step": 19 }, { "epoch": 0.74, "learning_rate": 9.892425861749099e-05, "loss": 1.3459, "step": 20 }, { "epoch": 0.78, "learning_rate": 9.879450443041171e-05, "loss": 1.3004, "step": 21 }, { "epoch": 0.82, "learning_rate": 9.865745904348295e-05, "loss": 1.2611, "step": 22 }, { "epoch": 0.86, "learning_rate": 9.851314293493923e-05, "loss": 1.3038, "step": 23 }, { "epoch": 0.89, "learning_rate": 9.836157766945466e-05, "loss": 1.2547, "step": 24 }, { "epoch": 0.93, "learning_rate": 9.820278589492076e-05, "loss": 1.2802, "step": 25 }, { "epoch": 0.97, "learning_rate": 9.803679133906209e-05, "loss": 1.1729, "step": 26 }, { "epoch": 0.97, "eval_loss": 1.2355083227157593, "eval_runtime": 34.8406, "eval_samples_per_second": 1.435, "eval_steps_per_second": 1.435, "step": 26 }, { "epoch": 1.0, "learning_rate": 9.786361880589083e-05, "loss": 1.2083, "step": 27 }, { "epoch": 1.04, "learning_rate": 9.768329417200028e-05, "loss": 1.1907, "step": 28 }, { "epoch": 1.08, "learning_rate": 9.749584438269832e-05, "loss": 1.1546, "step": 29 }, { "epoch": 1.12, "learning_rate": 9.730129744798095e-05, "loss": 1.1084, "step": 30 }, { "epoch": 1.15, "learning_rate": 9.709968243834698e-05, "loss": 1.112, "step": 31 }, { "epoch": 1.19, "learning_rate": 9.689102948045397e-05, "loss": 1.0599, "step": 32 }, { "epoch": 1.23, "learning_rate": 9.667536975261667e-05, "loss": 1.0952, "step": 33 }, { "epoch": 1.27, "learning_rate": 9.6452735480148e-05, "loss": 1.1067, "step": 34 }, { "epoch": 1.3, "learning_rate": 9.622315993054383e-05, "loss": 1.0152, "step": 35 }, { "epoch": 1.34, "learning_rate": 9.598667740851187e-05, "loss": 1.0704, "step": 36 }, { "epoch": 1.38, "learning_rate": 9.574332325084563e-05, "loss": 1.031, "step": 37 }, { "epoch": 1.41, "learning_rate": 9.549313382114426e-05, "loss": 1.0216, "step": 38 }, { "epoch": 1.45, "learning_rate": 9.523614650437876e-05, "loss": 1.0242, "step": 39 }, { "epoch": 1.45, "eval_loss": 1.0572456121444702, "eval_runtime": 34.7485, "eval_samples_per_second": 1.439, "eval_steps_per_second": 1.439, "step": 39 }, { "epoch": 1.49, "learning_rate": 9.497239970130562e-05, "loss": 0.9805, "step": 40 }, { "epoch": 1.53, "learning_rate": 9.470193282272886e-05, "loss": 0.9745, "step": 41 }, { "epoch": 1.56, "learning_rate": 9.442478628361098e-05, "loss": 0.9749, "step": 42 }, { "epoch": 1.6, "learning_rate": 9.414100149703373e-05, "loss": 0.9916, "step": 43 }, { "epoch": 1.64, "learning_rate": 9.385062086801013e-05, "loss": 0.9389, "step": 44 }, { "epoch": 1.67, "learning_rate": 9.355368778714784e-05, "loss": 0.9721, "step": 45 }, { "epoch": 1.71, "learning_rate": 9.325024662416552e-05, "loss": 0.9278, "step": 46 }, { "epoch": 1.75, "learning_rate": 9.294034272126287e-05, "loss": 0.922, "step": 47 }, { "epoch": 1.79, "learning_rate": 9.262402238634515e-05, "loss": 0.9192, "step": 48 }, { "epoch": 1.82, "learning_rate": 9.230133288610366e-05, "loss": 0.9203, "step": 49 }, { "epoch": 1.86, "learning_rate": 9.197232243895284e-05, "loss": 0.9317, "step": 50 }, { "epoch": 1.9, "learning_rate": 9.163704020782507e-05, "loss": 0.9355, "step": 51 }, { "epoch": 1.93, "learning_rate": 9.129553629282448e-05, "loss": 0.9027, "step": 52 }, { "epoch": 1.93, "eval_loss": 0.9721283912658691, "eval_runtime": 34.6767, "eval_samples_per_second": 1.442, "eval_steps_per_second": 1.442, "step": 52 }, { "epoch": 1.97, "learning_rate": 9.094786172374066e-05, "loss": 0.9358, "step": 53 }, { "epoch": 2.01, "learning_rate": 9.059406845242342e-05, "loss": 0.8565, "step": 54 }, { "epoch": 2.05, "learning_rate": 9.02342093450198e-05, "loss": 0.8217, "step": 55 }, { "epoch": 2.08, "learning_rate": 8.986833817407449e-05, "loss": 0.8717, "step": 56 }, { "epoch": 2.12, "learning_rate": 8.949650961049478e-05, "loss": 0.8637, "step": 57 }, { "epoch": 2.16, "learning_rate": 8.911877921538117e-05, "loss": 0.8261, "step": 58 }, { "epoch": 2.2, "learning_rate": 8.87352034317252e-05, "loss": 0.7963, "step": 59 }, { "epoch": 2.23, "learning_rate": 8.834583957597529e-05, "loss": 0.8731, "step": 60 }, { "epoch": 2.27, "learning_rate": 8.795074582947214e-05, "loss": 0.8759, "step": 61 }, { "epoch": 2.31, "learning_rate": 8.754998122975489e-05, "loss": 0.8333, "step": 62 }, { "epoch": 2.34, "learning_rate": 8.714360566173931e-05, "loss": 0.7972, "step": 63 }, { "epoch": 2.38, "learning_rate": 8.673167984876949e-05, "loss": 0.8378, "step": 64 }, { "epoch": 2.42, "learning_rate": 8.631426534354403e-05, "loss": 0.8188, "step": 65 }, { "epoch": 2.42, "eval_loss": 0.9200485944747925, "eval_runtime": 34.696, "eval_samples_per_second": 1.441, "eval_steps_per_second": 1.441, "step": 65 }, { "epoch": 2.46, "learning_rate": 8.58914245189185e-05, "loss": 0.774, "step": 66 }, { "epoch": 2.49, "learning_rate": 8.546322055858526e-05, "loss": 0.8312, "step": 67 }, { "epoch": 2.53, "learning_rate": 8.502971744763215e-05, "loss": 0.8011, "step": 68 }, { "epoch": 2.57, "learning_rate": 8.459097996298137e-05, "loss": 0.7958, "step": 69 }, { "epoch": 2.6, "learning_rate": 8.414707366371007e-05, "loss": 0.7647, "step": 70 }, { "epoch": 2.64, "learning_rate": 8.369806488125418e-05, "loss": 0.8322, "step": 71 }, { "epoch": 2.68, "learning_rate": 8.324402070949658e-05, "loss": 0.7983, "step": 72 }, { "epoch": 2.72, "learning_rate": 8.278500899474163e-05, "loss": 0.7903, "step": 73 }, { "epoch": 2.75, "learning_rate": 8.232109832557696e-05, "loss": 0.765, "step": 74 }, { "epoch": 2.79, "learning_rate": 8.185235802262469e-05, "loss": 0.7847, "step": 75 }, { "epoch": 2.83, "learning_rate": 8.137885812818295e-05, "loss": 0.7789, "step": 76 }, { "epoch": 2.87, "learning_rate": 8.09006693957597e-05, "loss": 0.7802, "step": 77 }, { "epoch": 2.9, "learning_rate": 8.041786327950036e-05, "loss": 0.7535, "step": 78 }, { "epoch": 2.9, "eval_loss": 0.8959811925888062, "eval_runtime": 34.7154, "eval_samples_per_second": 1.44, "eval_steps_per_second": 1.44, "step": 78 }, { "epoch": 2.94, "learning_rate": 7.993051192351057e-05, "loss": 0.7877, "step": 79 }, { "epoch": 2.98, "learning_rate": 7.943868815107594e-05, "loss": 0.7804, "step": 80 }, { "epoch": 3.01, "learning_rate": 7.894246545378037e-05, "loss": 0.7512, "step": 81 }, { "epoch": 3.05, "learning_rate": 7.844191798052438e-05, "loss": 0.713, "step": 82 }, { "epoch": 3.09, "learning_rate": 7.793712052644535e-05, "loss": 0.7655, "step": 83 }, { "epoch": 3.13, "learning_rate": 7.742814852174112e-05, "loss": 0.6954, "step": 84 }, { "epoch": 3.16, "learning_rate": 7.691507802039862e-05, "loss": 0.7137, "step": 85 }, { "epoch": 3.2, "learning_rate": 7.639798568882947e-05, "loss": 0.7439, "step": 86 }, { "epoch": 3.24, "learning_rate": 7.587694879441401e-05, "loss": 0.7458, "step": 87 }, { "epoch": 3.27, "learning_rate": 7.535204519395538e-05, "loss": 0.7443, "step": 88 }, { "epoch": 3.31, "learning_rate": 7.482335332204568e-05, "loss": 0.7162, "step": 89 }, { "epoch": 3.35, "learning_rate": 7.429095217934577e-05, "loss": 0.7134, "step": 90 }, { "epoch": 3.39, "learning_rate": 7.375492132078052e-05, "loss": 0.7311, "step": 91 }, { "epoch": 3.39, "eval_loss": 0.8750792741775513, "eval_runtime": 34.7072, "eval_samples_per_second": 1.441, "eval_steps_per_second": 1.441, "step": 91 }, { "epoch": 3.42, "learning_rate": 7.321534084365102e-05, "loss": 0.6978, "step": 92 }, { "epoch": 3.46, "learning_rate": 7.267229137566607e-05, "loss": 0.7277, "step": 93 }, { "epoch": 3.5, "learning_rate": 7.212585406289418e-05, "loss": 0.7412, "step": 94 }, { "epoch": 3.53, "learning_rate": 7.157611055763819e-05, "loss": 0.6875, "step": 95 }, { "epoch": 3.57, "learning_rate": 7.102314300623426e-05, "loss": 0.68, "step": 96 }, { "epoch": 3.61, "learning_rate": 7.046703403677695e-05, "loss": 0.6764, "step": 97 }, { "epoch": 3.65, "learning_rate": 6.990786674677245e-05, "loss": 0.675, "step": 98 }, { "epoch": 3.68, "learning_rate": 6.934572469072162e-05, "loss": 0.7028, "step": 99 }, { "epoch": 3.72, "learning_rate": 6.878069186763465e-05, "loss": 0.6985, "step": 100 }, { "epoch": 3.76, "learning_rate": 6.821285270847934e-05, "loss": 0.7309, "step": 101 }, { "epoch": 3.8, "learning_rate": 6.764229206356498e-05, "loss": 0.6851, "step": 102 }, { "epoch": 3.83, "learning_rate": 6.70690951898634e-05, "loss": 0.6568, "step": 103 }, { "epoch": 3.87, "learning_rate": 6.649334773826924e-05, "loss": 0.6845, "step": 104 }, { "epoch": 3.87, "eval_loss": 0.8706070780754089, "eval_runtime": 34.6892, "eval_samples_per_second": 1.441, "eval_steps_per_second": 1.441, "step": 104 }, { "epoch": 3.91, "learning_rate": 6.591513574080151e-05, "loss": 0.6993, "step": 105 }, { "epoch": 3.94, "learning_rate": 6.533454559774807e-05, "loss": 0.6635, "step": 106 }, { "epoch": 3.98, "learning_rate": 6.475166406475515e-05, "loss": 0.7059, "step": 107 }, { "epoch": 4.02, "learning_rate": 6.41665782398637e-05, "loss": 0.6543, "step": 108 }, { "epoch": 4.06, "learning_rate": 6.357937555049464e-05, "loss": 0.6807, "step": 109 }, { "epoch": 4.09, "learning_rate": 6.299014374038493e-05, "loss": 0.6573, "step": 110 }, { "epoch": 4.13, "learning_rate": 6.239897085647623e-05, "loss": 0.6481, "step": 111 }, { "epoch": 4.17, "learning_rate": 6.180594523575838e-05, "loss": 0.6209, "step": 112 }, { "epoch": 4.2, "learning_rate": 6.121115549206949e-05, "loss": 0.6125, "step": 113 }, { "epoch": 4.24, "learning_rate": 6.061469050285469e-05, "loss": 0.6703, "step": 114 }, { "epoch": 4.28, "learning_rate": 6.001663939588542e-05, "loss": 0.6821, "step": 115 }, { "epoch": 4.32, "learning_rate": 5.941709153594146e-05, "loss": 0.6885, "step": 116 }, { "epoch": 4.35, "learning_rate": 5.881613651145732e-05, "loss": 0.6598, "step": 117 }, { "epoch": 4.35, "eval_loss": 0.8761024475097656, "eval_runtime": 34.7313, "eval_samples_per_second": 1.44, "eval_steps_per_second": 1.44, "step": 117 }, { "epoch": 4.39, "learning_rate": 5.821386412113545e-05, "loss": 0.6081, "step": 118 }, { "epoch": 4.43, "learning_rate": 5.761036436052788e-05, "loss": 0.6263, "step": 119 }, { "epoch": 4.47, "learning_rate": 5.700572740858847e-05, "loss": 0.6068, "step": 120 }, { "epoch": 4.5, "learning_rate": 5.640004361419776e-05, "loss": 0.626, "step": 121 }, { "epoch": 4.54, "learning_rate": 5.579340348266251e-05, "loss": 0.6514, "step": 122 }, { "epoch": 4.58, "learning_rate": 5.518589766219172e-05, "loss": 0.6156, "step": 123 }, { "epoch": 4.61, "learning_rate": 5.4577616930351385e-05, "loss": 0.6637, "step": 124 }, { "epoch": 4.65, "learning_rate": 5.396865218049995e-05, "loss": 0.6058, "step": 125 }, { "epoch": 4.69, "learning_rate": 5.3359094408206345e-05, "loss": 0.6208, "step": 126 }, { "epoch": 4.73, "learning_rate": 5.27490346976529e-05, "loss": 0.6259, "step": 127 }, { "epoch": 4.76, "learning_rate": 5.21385642080249e-05, "loss": 0.6001, "step": 128 }, { "epoch": 4.8, "learning_rate": 5.152777415988894e-05, "loss": 0.6447, "step": 129 }, { "epoch": 4.84, "learning_rate": 5.0916755821562237e-05, "loss": 0.5753, "step": 130 }, { "epoch": 4.84, "eval_loss": 0.8741121888160706, "eval_runtime": 34.7416, "eval_samples_per_second": 1.439, "eval_steps_per_second": 1.439, "step": 130 }, { "epoch": 4.87, "learning_rate": 5.030560049547458e-05, "loss": 0.6011, "step": 131 }, { "epoch": 4.91, "learning_rate": 4.969439950452543e-05, "loss": 0.6303, "step": 132 }, { "epoch": 4.95, "learning_rate": 4.908324417843778e-05, "loss": 0.6238, "step": 133 }, { "epoch": 4.99, "learning_rate": 4.847222584011106e-05, "loss": 0.623, "step": 134 }, { "epoch": 5.02, "learning_rate": 4.7861435791975126e-05, "loss": 0.5594, "step": 135 }, { "epoch": 5.06, "learning_rate": 4.72509653023471e-05, "loss": 0.5714, "step": 136 }, { "epoch": 5.1, "learning_rate": 4.664090559179367e-05, "loss": 0.6115, "step": 137 }, { "epoch": 5.13, "learning_rate": 4.603134781950006e-05, "loss": 0.5987, "step": 138 }, { "epoch": 5.17, "learning_rate": 4.542238306964863e-05, "loss": 0.5588, "step": 139 }, { "epoch": 5.21, "learning_rate": 4.4814102337808293e-05, "loss": 0.5612, "step": 140 }, { "epoch": 5.25, "learning_rate": 4.420659651733751e-05, "loss": 0.5595, "step": 141 }, { "epoch": 5.28, "learning_rate": 4.359995638580226e-05, "loss": 0.5534, "step": 142 }, { "epoch": 5.32, "learning_rate": 4.2994272591411556e-05, "loss": 0.5499, "step": 143 }, { "epoch": 5.32, "eval_loss": 0.897064745426178, "eval_runtime": 34.7112, "eval_samples_per_second": 1.44, "eval_steps_per_second": 1.44, "step": 143 }, { "epoch": 5.36, "learning_rate": 4.238963563947212e-05, "loss": 0.5902, "step": 144 }, { "epoch": 5.4, "learning_rate": 4.178613587886455e-05, "loss": 0.5371, "step": 145 }, { "epoch": 5.43, "learning_rate": 4.118386348854269e-05, "loss": 0.5798, "step": 146 }, { "epoch": 5.47, "learning_rate": 4.0582908464058556e-05, "loss": 0.5681, "step": 147 }, { "epoch": 5.51, "learning_rate": 3.998336060411459e-05, "loss": 0.5851, "step": 148 }, { "epoch": 5.54, "learning_rate": 3.938530949714533e-05, "loss": 0.5849, "step": 149 }, { "epoch": 5.58, "learning_rate": 3.878884450793053e-05, "loss": 0.5968, "step": 150 }, { "epoch": 5.62, "learning_rate": 3.819405476424163e-05, "loss": 0.5533, "step": 151 }, { "epoch": 5.66, "learning_rate": 3.7601029143523764e-05, "loss": 0.5724, "step": 152 }, { "epoch": 5.69, "learning_rate": 3.700985625961507e-05, "loss": 0.5314, "step": 153 }, { "epoch": 5.73, "learning_rate": 3.642062444950537e-05, "loss": 0.5572, "step": 154 }, { "epoch": 5.77, "learning_rate": 3.5833421760136324e-05, "loss": 0.5895, "step": 155 }, { "epoch": 5.8, "learning_rate": 3.524833593524487e-05, "loss": 0.5349, "step": 156 }, { "epoch": 5.8, "eval_loss": 0.8920581936836243, "eval_runtime": 34.8827, "eval_samples_per_second": 1.433, "eval_steps_per_second": 1.433, "step": 156 }, { "epoch": 5.8, "step": 156, "total_flos": 6.16421344002048e+17, "train_loss": 0.8834368617106707, "train_runtime": 13302.0563, "train_samples_per_second": 0.97, "train_steps_per_second": 0.02 } ], "logging_steps": 1.0, "max_steps": 260, "num_train_epochs": 10, "save_steps": 26, "total_flos": 6.16421344002048e+17, "trial_name": null, "trial_params": null }