diff --git "a/last-checkpoint/trainer_state.json" "b/last-checkpoint/trainer_state.json" new file mode 100644--- /dev/null +++ "b/last-checkpoint/trainer_state.json" @@ -0,0 +1,9034 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.008265897387149836, + "eval_steps": 500, + "global_step": 1000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 8.265897387149836e-06, + "grad_norm": 1.3251980543136597, + "learning_rate": 5e-05, + "loss": 1.5516, + "mean_token_accuracy": 0.7008633613586426, + "num_tokens": 57022.0, + "step": 1 + }, + { + "epoch": 1.653179477429967e-05, + "grad_norm": 1.300803542137146, + "learning_rate": 4.9999793352565324e-05, + "loss": 1.4318, + "mean_token_accuracy": 0.727364182472229, + "num_tokens": 59016.0, + "step": 2 + }, + { + "epoch": 2.4797692161449507e-05, + "grad_norm": 1.299092411994934, + "learning_rate": 4.9999586705130646e-05, + "loss": 1.3651, + "mean_token_accuracy": 0.740029513835907, + "num_tokens": 61053.0, + "step": 3 + }, + { + "epoch": 3.306358954859934e-05, + "grad_norm": 1.2995446920394897, + "learning_rate": 4.999938005769597e-05, + "loss": 1.2178, + "mean_token_accuracy": 0.7601810097694397, + "num_tokens": 63048.0, + "step": 4 + }, + { + "epoch": 4.132948693574918e-05, + "grad_norm": 1.2878410816192627, + "learning_rate": 4.999917341026128e-05, + "loss": 1.1257, + "mean_token_accuracy": 0.7849516868591309, + "num_tokens": 65021.0, + "step": 5 + }, + { + "epoch": 4.9595384322899015e-05, + "grad_norm": 1.298051357269287, + "learning_rate": 4.999896676282661e-05, + "loss": 1.0238, + "mean_token_accuracy": 0.8043912053108215, + "num_tokens": 67031.0, + "step": 6 + }, + { + "epoch": 5.786128171004885e-05, + "grad_norm": 1.2358893156051636, + "learning_rate": 4.999876011539193e-05, + "loss": 1.0112, + "mean_token_accuracy": 0.8141504526138306, + "num_tokens": 69044.0, + "step": 7 + }, + { + "epoch": 6.612717909719869e-05, + "grad_norm": 1.2391976118087769, + "learning_rate": 4.999855346795725e-05, + "loss": 0.8735, + "mean_token_accuracy": 0.8337622284889221, + "num_tokens": 70993.0, + "step": 8 + }, + { + "epoch": 7.439307648434852e-05, + "grad_norm": 1.2356516122817993, + "learning_rate": 4.9998346820522576e-05, + "loss": 0.8059, + "mean_token_accuracy": 0.8553104400634766, + "num_tokens": 72948.0, + "step": 9 + }, + { + "epoch": 8.265897387149836e-05, + "grad_norm": 1.2190320491790771, + "learning_rate": 4.999814017308789e-05, + "loss": 0.8336, + "mean_token_accuracy": 0.8362318873405457, + "num_tokens": 75024.0, + "step": 10 + }, + { + "epoch": 9.09248712586482e-05, + "grad_norm": 1.156231164932251, + "learning_rate": 4.999793352565321e-05, + "loss": 0.7332, + "mean_token_accuracy": 0.8614157438278198, + "num_tokens": 77036.0, + "step": 11 + }, + { + "epoch": 9.919076864579803e-05, + "grad_norm": 1.14757239818573, + "learning_rate": 4.9997726878218534e-05, + "loss": 0.6888, + "mean_token_accuracy": 0.8694362044334412, + "num_tokens": 79064.0, + "step": 12 + }, + { + "epoch": 0.00010745666603294786, + "grad_norm": 1.2405941486358643, + "learning_rate": 4.9997520230783856e-05, + "loss": 0.5499, + "mean_token_accuracy": 0.9004085659980774, + "num_tokens": 81028.0, + "step": 13 + }, + { + "epoch": 0.0001157225634200977, + "grad_norm": 1.1322728395462036, + "learning_rate": 4.9997313583349184e-05, + "loss": 0.5386, + "mean_token_accuracy": 0.898645281791687, + "num_tokens": 83027.0, + "step": 14 + }, + { + "epoch": 0.00012398846080724754, + "grad_norm": 1.1357864141464233, + "learning_rate": 4.99971069359145e-05, + "loss": 0.4413, + "mean_token_accuracy": 0.9220713973045349, + "num_tokens": 85022.0, + "step": 15 + }, + { + "epoch": 0.00013225435819439737, + "grad_norm": 1.273759126663208, + "learning_rate": 4.999690028847982e-05, + "loss": 0.5348, + "mean_token_accuracy": 0.91167813539505, + "num_tokens": 87066.0, + "step": 16 + }, + { + "epoch": 0.0001405202555815472, + "grad_norm": 0.975348174571991, + "learning_rate": 4.999669364104514e-05, + "loss": 0.3922, + "mean_token_accuracy": 0.935516357421875, + "num_tokens": 89057.0, + "step": 17 + }, + { + "epoch": 0.00014878615296869704, + "grad_norm": 1.0392197370529175, + "learning_rate": 4.9996486993610464e-05, + "loss": 0.5085, + "mean_token_accuracy": 0.9096071720123291, + "num_tokens": 91176.0, + "step": 18 + }, + { + "epoch": 0.00015705205035584688, + "grad_norm": 0.7911114692687988, + "learning_rate": 4.9996280346175785e-05, + "loss": 0.3615, + "mean_token_accuracy": 0.9434539079666138, + "num_tokens": 93145.0, + "step": 19 + }, + { + "epoch": 0.00016531794774299672, + "grad_norm": 0.7152270078659058, + "learning_rate": 4.999607369874111e-05, + "loss": 0.3766, + "mean_token_accuracy": 0.939257025718689, + "num_tokens": 95143.0, + "step": 20 + }, + { + "epoch": 0.00017358384513014655, + "grad_norm": 0.6786302328109741, + "learning_rate": 4.999586705130643e-05, + "loss": 0.3196, + "mean_token_accuracy": 0.9410868287086487, + "num_tokens": 97118.0, + "step": 21 + }, + { + "epoch": 0.0001818497425172964, + "grad_norm": 0.7003538012504578, + "learning_rate": 4.9995660403871744e-05, + "loss": 0.3482, + "mean_token_accuracy": 0.9361808896064758, + "num_tokens": 99114.0, + "step": 22 + }, + { + "epoch": 0.00019011563990444622, + "grad_norm": 0.6917778849601746, + "learning_rate": 4.999545375643707e-05, + "loss": 0.5061, + "mean_token_accuracy": 0.9058039784431458, + "num_tokens": 101222.0, + "step": 23 + }, + { + "epoch": 0.00019838153729159606, + "grad_norm": 0.5567969083786011, + "learning_rate": 4.9995247109002394e-05, + "loss": 0.3651, + "mean_token_accuracy": 0.9303579926490784, + "num_tokens": 103267.0, + "step": 24 + }, + { + "epoch": 0.0002066474346787459, + "grad_norm": 0.562647819519043, + "learning_rate": 4.999504046156771e-05, + "loss": 0.3227, + "mean_token_accuracy": 0.9463834166526794, + "num_tokens": 105250.0, + "step": 25 + }, + { + "epoch": 0.00021491333206589573, + "grad_norm": 0.6241666078567505, + "learning_rate": 4.999483381413304e-05, + "loss": 0.3877, + "mean_token_accuracy": 0.9294871687889099, + "num_tokens": 107284.0, + "step": 26 + }, + { + "epoch": 0.00022317922945304557, + "grad_norm": 0.5423364043235779, + "learning_rate": 4.999462716669835e-05, + "loss": 0.3916, + "mean_token_accuracy": 0.9313241243362427, + "num_tokens": 109314.0, + "step": 27 + }, + { + "epoch": 0.0002314451268401954, + "grad_norm": 0.6723122000694275, + "learning_rate": 4.9994420519263674e-05, + "loss": 0.5012, + "mean_token_accuracy": 0.9086124300956726, + "num_tokens": 111410.0, + "step": 28 + }, + { + "epoch": 0.00023971102422734524, + "grad_norm": 0.5182911157608032, + "learning_rate": 4.9994213871829e-05, + "loss": 0.4172, + "mean_token_accuracy": 0.9263360500335693, + "num_tokens": 113493.0, + "step": 29 + }, + { + "epoch": 0.00024797692161449507, + "grad_norm": 0.5118226408958435, + "learning_rate": 4.999400722439432e-05, + "loss": 0.376, + "mean_token_accuracy": 0.9312561750411987, + "num_tokens": 115521.0, + "step": 30 + }, + { + "epoch": 0.00025624281900164494, + "grad_norm": 0.45296454429626465, + "learning_rate": 4.999380057695964e-05, + "loss": 0.3249, + "mean_token_accuracy": 0.9384692311286926, + "num_tokens": 117526.0, + "step": 31 + }, + { + "epoch": 0.00026450871638879474, + "grad_norm": 0.48847129940986633, + "learning_rate": 4.999359392952496e-05, + "loss": 0.306, + "mean_token_accuracy": 0.9487309455871582, + "num_tokens": 119502.0, + "step": 32 + }, + { + "epoch": 0.0002727746137759446, + "grad_norm": 0.410657674074173, + "learning_rate": 4.999338728209028e-05, + "loss": 0.3191, + "mean_token_accuracy": 0.9454081654548645, + "num_tokens": 121468.0, + "step": 33 + }, + { + "epoch": 0.0002810405111630944, + "grad_norm": 0.45754924416542053, + "learning_rate": 4.9993180634655604e-05, + "loss": 0.2761, + "mean_token_accuracy": 0.9495155811309814, + "num_tokens": 123435.0, + "step": 34 + }, + { + "epoch": 0.0002893064085502443, + "grad_norm": 0.46412602066993713, + "learning_rate": 4.9992973987220925e-05, + "loss": 0.4123, + "mean_token_accuracy": 0.9186046719551086, + "num_tokens": 125505.0, + "step": 35 + }, + { + "epoch": 0.0002975723059373941, + "grad_norm": 0.41713273525238037, + "learning_rate": 4.999276733978625e-05, + "loss": 0.3499, + "mean_token_accuracy": 0.9345980882644653, + "num_tokens": 127514.0, + "step": 36 + }, + { + "epoch": 0.00030583820332454395, + "grad_norm": 0.3865780830383301, + "learning_rate": 4.999256069235157e-05, + "loss": 0.2502, + "mean_token_accuracy": 0.9512320160865784, + "num_tokens": 129468.0, + "step": 37 + }, + { + "epoch": 0.00031410410071169376, + "grad_norm": 0.3944219946861267, + "learning_rate": 4.999235404491689e-05, + "loss": 0.2821, + "mean_token_accuracy": 0.9468845725059509, + "num_tokens": 131432.0, + "step": 38 + }, + { + "epoch": 0.0003223699980988436, + "grad_norm": 0.38811054825782776, + "learning_rate": 4.999214739748221e-05, + "loss": 0.3101, + "mean_token_accuracy": 0.9409113526344299, + "num_tokens": 133435.0, + "step": 39 + }, + { + "epoch": 0.00033063589548599343, + "grad_norm": 0.6454439759254456, + "learning_rate": 4.9991940750047533e-05, + "loss": 0.4536, + "mean_token_accuracy": 0.9109621644020081, + "num_tokens": 135530.0, + "step": 40 + }, + { + "epoch": 0.0003389017928731433, + "grad_norm": 0.44250041246414185, + "learning_rate": 4.9991734102612855e-05, + "loss": 0.3279, + "mean_token_accuracy": 0.9331695437431335, + "num_tokens": 137571.0, + "step": 41 + }, + { + "epoch": 0.0003471676902602931, + "grad_norm": 0.36981847882270813, + "learning_rate": 4.999152745517817e-05, + "loss": 0.294, + "mean_token_accuracy": 0.9497206807136536, + "num_tokens": 139546.0, + "step": 42 + }, + { + "epoch": 0.00035543358764744296, + "grad_norm": 0.4224010407924652, + "learning_rate": 4.99913208077435e-05, + "loss": 0.3451, + "mean_token_accuracy": 0.936873733997345, + "num_tokens": 141548.0, + "step": 43 + }, + { + "epoch": 0.0003636994850345928, + "grad_norm": 0.4885828197002411, + "learning_rate": 4.999111416030881e-05, + "loss": 0.3556, + "mean_token_accuracy": 0.9327442049980164, + "num_tokens": 143591.0, + "step": 44 + }, + { + "epoch": 0.00037196538242174264, + "grad_norm": 0.48182302713394165, + "learning_rate": 4.9990907512874135e-05, + "loss": 0.355, + "mean_token_accuracy": 0.9366834163665771, + "num_tokens": 145587.0, + "step": 45 + }, + { + "epoch": 0.00038023127980889244, + "grad_norm": 0.5360848903656006, + "learning_rate": 4.9990700865439463e-05, + "loss": 0.3397, + "mean_token_accuracy": 0.9344504475593567, + "num_tokens": 147622.0, + "step": 46 + }, + { + "epoch": 0.0003884971771960423, + "grad_norm": 0.5050182342529297, + "learning_rate": 4.999049421800478e-05, + "loss": 0.399, + "mean_token_accuracy": 0.9243902564048767, + "num_tokens": 149678.0, + "step": 47 + }, + { + "epoch": 0.0003967630745831921, + "grad_norm": 0.362700492143631, + "learning_rate": 4.99902875705701e-05, + "loss": 0.2671, + "mean_token_accuracy": 0.953109085559845, + "num_tokens": 151646.0, + "step": 48 + }, + { + "epoch": 0.000405028971970342, + "grad_norm": 0.37579265236854553, + "learning_rate": 4.999008092313542e-05, + "loss": 0.2596, + "mean_token_accuracy": 0.950276255607605, + "num_tokens": 153643.0, + "step": 49 + }, + { + "epoch": 0.0004132948693574918, + "grad_norm": 0.5673742294311523, + "learning_rate": 4.998987427570074e-05, + "loss": 0.5196, + "mean_token_accuracy": 0.8972570896148682, + "num_tokens": 155800.0, + "step": 50 + }, + { + "epoch": 0.00042156076674464165, + "grad_norm": 0.4164047837257385, + "learning_rate": 4.9989667628266065e-05, + "loss": 0.296, + "mean_token_accuracy": 0.9427998065948486, + "num_tokens": 157799.0, + "step": 51 + }, + { + "epoch": 0.00042982666413179146, + "grad_norm": 0.4306670129299164, + "learning_rate": 4.9989460980831387e-05, + "loss": 0.3072, + "mean_token_accuracy": 0.9397410154342651, + "num_tokens": 159813.0, + "step": 52 + }, + { + "epoch": 0.0004380925615189413, + "grad_norm": 0.4390345513820648, + "learning_rate": 4.998925433339671e-05, + "loss": 0.4327, + "mean_token_accuracy": 0.9159461855888367, + "num_tokens": 161901.0, + "step": 53 + }, + { + "epoch": 0.00044635845890609113, + "grad_norm": 0.41451117396354675, + "learning_rate": 4.998904768596203e-05, + "loss": 0.3278, + "mean_token_accuracy": 0.9379921555519104, + "num_tokens": 163939.0, + "step": 54 + }, + { + "epoch": 0.000454624356293241, + "grad_norm": 0.37657612562179565, + "learning_rate": 4.998884103852735e-05, + "loss": 0.2581, + "mean_token_accuracy": 0.9523565769195557, + "num_tokens": 165897.0, + "step": 55 + }, + { + "epoch": 0.0004628902536803908, + "grad_norm": 0.499775767326355, + "learning_rate": 4.998863439109267e-05, + "loss": 0.3192, + "mean_token_accuracy": 0.9381546378135681, + "num_tokens": 167908.0, + "step": 56 + }, + { + "epoch": 0.00047115615106754067, + "grad_norm": 0.43703413009643555, + "learning_rate": 4.9988427743657995e-05, + "loss": 0.2726, + "mean_token_accuracy": 0.9463291168212891, + "num_tokens": 169889.0, + "step": 57 + }, + { + "epoch": 0.0004794220484546905, + "grad_norm": 0.4889462888240814, + "learning_rate": 4.9988221096223317e-05, + "loss": 0.2975, + "mean_token_accuracy": 0.9409409165382385, + "num_tokens": 171893.0, + "step": 58 + }, + { + "epoch": 0.00048768794584184034, + "grad_norm": 0.37268808484077454, + "learning_rate": 4.998801444878863e-05, + "loss": 0.2948, + "mean_token_accuracy": 0.9461499452590942, + "num_tokens": 173886.0, + "step": 59 + }, + { + "epoch": 0.0004959538432289901, + "grad_norm": 0.36821237206459045, + "learning_rate": 4.998780780135396e-05, + "loss": 0.2831, + "mean_token_accuracy": 0.9416205286979675, + "num_tokens": 175879.0, + "step": 60 + }, + { + "epoch": 0.00050421974061614, + "grad_norm": 0.4337264895439148, + "learning_rate": 4.9987601153919275e-05, + "loss": 0.3373, + "mean_token_accuracy": 0.9344181418418884, + "num_tokens": 177913.0, + "step": 61 + }, + { + "epoch": 0.0005124856380032899, + "grad_norm": 0.4724893271923065, + "learning_rate": 4.9987394506484596e-05, + "loss": 0.3336, + "mean_token_accuracy": 0.9384765625, + "num_tokens": 179967.0, + "step": 62 + }, + { + "epoch": 0.0005207515353904396, + "grad_norm": 0.4221535623073578, + "learning_rate": 4.9987187859049925e-05, + "loss": 0.2924, + "mean_token_accuracy": 0.9482412338256836, + "num_tokens": 181963.0, + "step": 63 + }, + { + "epoch": 0.0005290174327775895, + "grad_norm": 0.38894620537757874, + "learning_rate": 4.998698121161524e-05, + "loss": 0.2423, + "mean_token_accuracy": 0.9458646774291992, + "num_tokens": 183964.0, + "step": 64 + }, + { + "epoch": 0.0005372833301647394, + "grad_norm": 0.38573014736175537, + "learning_rate": 4.998677456418056e-05, + "loss": 0.302, + "mean_token_accuracy": 0.9441930651664734, + "num_tokens": 185959.0, + "step": 65 + }, + { + "epoch": 0.0005455492275518892, + "grad_norm": 0.5437004566192627, + "learning_rate": 4.998656791674588e-05, + "loss": 0.4231, + "mean_token_accuracy": 0.9245103001594543, + "num_tokens": 188058.0, + "step": 66 + }, + { + "epoch": 0.000553815124939039, + "grad_norm": 0.4524412751197815, + "learning_rate": 4.9986361269311205e-05, + "loss": 0.3121, + "mean_token_accuracy": 0.9383084774017334, + "num_tokens": 190074.0, + "step": 67 + }, + { + "epoch": 0.0005620810223261888, + "grad_norm": 0.3265776038169861, + "learning_rate": 4.9986154621876526e-05, + "loss": 0.2249, + "mean_token_accuracy": 0.9607235193252563, + "num_tokens": 192015.0, + "step": 68 + }, + { + "epoch": 0.0005703469197133387, + "grad_norm": 0.42387452721595764, + "learning_rate": 4.998594797444185e-05, + "loss": 0.2704, + "mean_token_accuracy": 0.9471032619476318, + "num_tokens": 194006.0, + "step": 69 + }, + { + "epoch": 0.0005786128171004886, + "grad_norm": 0.3408187925815582, + "learning_rate": 4.998574132700717e-05, + "loss": 0.221, + "mean_token_accuracy": 0.9580777287483215, + "num_tokens": 195968.0, + "step": 70 + }, + { + "epoch": 0.0005868787144876383, + "grad_norm": 0.34136003255844116, + "learning_rate": 4.9985534679572485e-05, + "loss": 0.2104, + "mean_token_accuracy": 0.9610854983329773, + "num_tokens": 197927.0, + "step": 71 + }, + { + "epoch": 0.0005951446118747882, + "grad_norm": 0.4188866913318634, + "learning_rate": 4.998532803213781e-05, + "loss": 0.325, + "mean_token_accuracy": 0.9374090433120728, + "num_tokens": 199994.0, + "step": 72 + }, + { + "epoch": 0.000603410509261938, + "grad_norm": 0.361499547958374, + "learning_rate": 4.9985121384703135e-05, + "loss": 0.2085, + "mean_token_accuracy": 0.9612001776695251, + "num_tokens": 201933.0, + "step": 73 + }, + { + "epoch": 0.0006116764066490879, + "grad_norm": 0.37521591782569885, + "learning_rate": 4.998491473726845e-05, + "loss": 0.2376, + "mean_token_accuracy": 0.9527918696403503, + "num_tokens": 203909.0, + "step": 74 + }, + { + "epoch": 0.0006199423040362377, + "grad_norm": 0.3477654755115509, + "learning_rate": 4.998470808983378e-05, + "loss": 0.2242, + "mean_token_accuracy": 0.9529827833175659, + "num_tokens": 205893.0, + "step": 75 + }, + { + "epoch": 0.0006282082014233875, + "grad_norm": 0.3677995800971985, + "learning_rate": 4.998450144239909e-05, + "loss": 0.2633, + "mean_token_accuracy": 0.9475786089897156, + "num_tokens": 207902.0, + "step": 76 + }, + { + "epoch": 0.0006364740988105374, + "grad_norm": 0.4442133605480194, + "learning_rate": 4.998429479496442e-05, + "loss": 0.3044, + "mean_token_accuracy": 0.9407407641410828, + "num_tokens": 209933.0, + "step": 77 + }, + { + "epoch": 0.0006447399961976872, + "grad_norm": 0.37177133560180664, + "learning_rate": 4.998408814752974e-05, + "loss": 0.2272, + "mean_token_accuracy": 0.9543859362602234, + "num_tokens": 211934.0, + "step": 78 + }, + { + "epoch": 0.000653005893584837, + "grad_norm": 0.41530996561050415, + "learning_rate": 4.998388150009506e-05, + "loss": 0.2895, + "mean_token_accuracy": 0.9417910575866699, + "num_tokens": 213950.0, + "step": 79 + }, + { + "epoch": 0.0006612717909719869, + "grad_norm": 0.43269816040992737, + "learning_rate": 4.9983674852660386e-05, + "loss": 0.2512, + "mean_token_accuracy": 0.9486419558525085, + "num_tokens": 215981.0, + "step": 80 + }, + { + "epoch": 0.0006695376883591367, + "grad_norm": 0.4208819270133972, + "learning_rate": 4.99834682052257e-05, + "loss": 0.2453, + "mean_token_accuracy": 0.9551411271095276, + "num_tokens": 217971.0, + "step": 81 + }, + { + "epoch": 0.0006778035857462866, + "grad_norm": 0.4460567533969879, + "learning_rate": 4.998326155779102e-05, + "loss": 0.2333, + "mean_token_accuracy": 0.9548223614692688, + "num_tokens": 219947.0, + "step": 82 + }, + { + "epoch": 0.0006860694831334363, + "grad_norm": 0.4036431312561035, + "learning_rate": 4.9983054910356344e-05, + "loss": 0.2905, + "mean_token_accuracy": 0.9427290558815002, + "num_tokens": 221961.0, + "step": 83 + }, + { + "epoch": 0.0006943353805205862, + "grad_norm": 0.3974411189556122, + "learning_rate": 4.9982848262921666e-05, + "loss": 0.2417, + "mean_token_accuracy": 0.9485628008842468, + "num_tokens": 223950.0, + "step": 84 + }, + { + "epoch": 0.0007026012779077361, + "grad_norm": 0.5355939269065857, + "learning_rate": 4.998264161548699e-05, + "loss": 0.3876, + "mean_token_accuracy": 0.9247830510139465, + "num_tokens": 226030.0, + "step": 85 + }, + { + "epoch": 0.0007108671752948859, + "grad_norm": 0.3597177565097809, + "learning_rate": 4.998243496805231e-05, + "loss": 0.2384, + "mean_token_accuracy": 0.9443888068199158, + "num_tokens": 228032.0, + "step": 86 + }, + { + "epoch": 0.0007191330726820357, + "grad_norm": 0.37672877311706543, + "learning_rate": 4.998222832061763e-05, + "loss": 0.2173, + "mean_token_accuracy": 0.9556122422218323, + "num_tokens": 229998.0, + "step": 87 + }, + { + "epoch": 0.0007273989700691855, + "grad_norm": 0.35750794410705566, + "learning_rate": 4.998202167318295e-05, + "loss": 0.2002, + "mean_token_accuracy": 0.9600409865379333, + "num_tokens": 231956.0, + "step": 88 + }, + { + "epoch": 0.0007356648674563354, + "grad_norm": 0.5296061038970947, + "learning_rate": 4.9981815025748274e-05, + "loss": 0.3698, + "mean_token_accuracy": 0.9266890287399292, + "num_tokens": 234049.0, + "step": 89 + }, + { + "epoch": 0.0007439307648434853, + "grad_norm": 0.36901018023490906, + "learning_rate": 4.9981608378313596e-05, + "loss": 0.2566, + "mean_token_accuracy": 0.9466532468795776, + "num_tokens": 236042.0, + "step": 90 + }, + { + "epoch": 0.000752196662230635, + "grad_norm": 0.3750539720058441, + "learning_rate": 4.998140173087891e-05, + "loss": 0.2034, + "mean_token_accuracy": 0.9589457511901855, + "num_tokens": 238021.0, + "step": 91 + }, + { + "epoch": 0.0007604625596177849, + "grad_norm": 0.41055604815483093, + "learning_rate": 4.998119508344424e-05, + "loss": 0.3369, + "mean_token_accuracy": 0.9331087470054626, + "num_tokens": 240105.0, + "step": 92 + }, + { + "epoch": 0.0007687284570049348, + "grad_norm": 0.4907441735267639, + "learning_rate": 4.9980988436009554e-05, + "loss": 0.2908, + "mean_token_accuracy": 0.9406234622001648, + "num_tokens": 242132.0, + "step": 93 + }, + { + "epoch": 0.0007769943543920846, + "grad_norm": 0.44093140959739685, + "learning_rate": 4.9980781788574876e-05, + "loss": 0.3768, + "mean_token_accuracy": 0.9267578125, + "num_tokens": 244186.0, + "step": 94 + }, + { + "epoch": 0.0007852602517792344, + "grad_norm": 0.3314705789089203, + "learning_rate": 4.9980575141140204e-05, + "loss": 0.2209, + "mean_token_accuracy": 0.9508363008499146, + "num_tokens": 246165.0, + "step": 95 + }, + { + "epoch": 0.0007935261491663842, + "grad_norm": 0.43607860803604126, + "learning_rate": 4.998036849370552e-05, + "loss": 0.2969, + "mean_token_accuracy": 0.9427005648612976, + "num_tokens": 248178.0, + "step": 96 + }, + { + "epoch": 0.0008017920465535341, + "grad_norm": 0.32071632146835327, + "learning_rate": 4.998016184627085e-05, + "loss": 0.1694, + "mean_token_accuracy": 0.9639732241630554, + "num_tokens": 250127.0, + "step": 97 + }, + { + "epoch": 0.000810057943940684, + "grad_norm": 0.39200201630592346, + "learning_rate": 4.997995519883616e-05, + "loss": 0.2925, + "mean_token_accuracy": 0.9392156600952148, + "num_tokens": 252173.0, + "step": 98 + }, + { + "epoch": 0.0008183238413278337, + "grad_norm": 0.3622921109199524, + "learning_rate": 4.9979748551401484e-05, + "loss": 0.2952, + "mean_token_accuracy": 0.942392885684967, + "num_tokens": 254210.0, + "step": 99 + }, + { + "epoch": 0.0008265897387149836, + "grad_norm": 0.3674699366092682, + "learning_rate": 4.9979541903966806e-05, + "loss": 0.2339, + "mean_token_accuracy": 0.9484999775886536, + "num_tokens": 256216.0, + "step": 100 + }, + { + "epoch": 0.0008348556361021334, + "grad_norm": 0.3341938555240631, + "learning_rate": 4.997933525653213e-05, + "loss": 0.1883, + "mean_token_accuracy": 0.9595701098442078, + "num_tokens": 258176.0, + "step": 101 + }, + { + "epoch": 0.0008431215334892833, + "grad_norm": 0.4190879166126251, + "learning_rate": 4.997912860909745e-05, + "loss": 0.3421, + "mean_token_accuracy": 0.929892897605896, + "num_tokens": 260236.0, + "step": 102 + }, + { + "epoch": 0.0008513874308764331, + "grad_norm": 0.3123447299003601, + "learning_rate": 4.997892196166277e-05, + "loss": 0.2194, + "mean_token_accuracy": 0.95489102602005, + "num_tokens": 262215.0, + "step": 103 + }, + { + "epoch": 0.0008596533282635829, + "grad_norm": 0.30452197790145874, + "learning_rate": 4.997871531422809e-05, + "loss": 0.1823, + "mean_token_accuracy": 0.9631742835044861, + "num_tokens": 264149.0, + "step": 104 + }, + { + "epoch": 0.0008679192256507328, + "grad_norm": 0.3034026026725769, + "learning_rate": 4.9978508666793414e-05, + "loss": 0.1735, + "mean_token_accuracy": 0.9628483057022095, + "num_tokens": 266093.0, + "step": 105 + }, + { + "epoch": 0.0008761851230378826, + "grad_norm": 0.4742376506328583, + "learning_rate": 4.9978302019358736e-05, + "loss": 0.2472, + "mean_token_accuracy": 0.946107804775238, + "num_tokens": 268103.0, + "step": 106 + }, + { + "epoch": 0.0008844510204250324, + "grad_norm": 0.491089791059494, + "learning_rate": 4.997809537192406e-05, + "loss": 0.2678, + "mean_token_accuracy": 0.9438090324401855, + "num_tokens": 270120.0, + "step": 107 + }, + { + "epoch": 0.0008927169178121823, + "grad_norm": 0.4098670184612274, + "learning_rate": 4.997788872448937e-05, + "loss": 0.2075, + "mean_token_accuracy": 0.9583333134651184, + "num_tokens": 272118.0, + "step": 108 + }, + { + "epoch": 0.0009009828151993321, + "grad_norm": 0.3567214906215668, + "learning_rate": 4.99776820770547e-05, + "loss": 0.2323, + "mean_token_accuracy": 0.9554075002670288, + "num_tokens": 274075.0, + "step": 109 + }, + { + "epoch": 0.000909248712586482, + "grad_norm": 0.32733988761901855, + "learning_rate": 4.9977475429620016e-05, + "loss": 0.2044, + "mean_token_accuracy": 0.9544057250022888, + "num_tokens": 276033.0, + "step": 110 + }, + { + "epoch": 0.0009175146099736317, + "grad_norm": 0.44298064708709717, + "learning_rate": 4.997726878218534e-05, + "loss": 0.295, + "mean_token_accuracy": 0.942643404006958, + "num_tokens": 278044.0, + "step": 111 + }, + { + "epoch": 0.0009257805073607816, + "grad_norm": 0.4355528652667999, + "learning_rate": 4.9977062134750666e-05, + "loss": 0.2227, + "mean_token_accuracy": 0.956632673740387, + "num_tokens": 280010.0, + "step": 112 + }, + { + "epoch": 0.0009340464047479315, + "grad_norm": 0.4641549587249756, + "learning_rate": 4.997685548731598e-05, + "loss": 0.274, + "mean_token_accuracy": 0.9453085660934448, + "num_tokens": 282009.0, + "step": 113 + }, + { + "epoch": 0.0009423123021350813, + "grad_norm": 0.4358769655227661, + "learning_rate": 4.99766488398813e-05, + "loss": 0.2348, + "mean_token_accuracy": 0.9539006948471069, + "num_tokens": 283989.0, + "step": 114 + }, + { + "epoch": 0.0009505781995222311, + "grad_norm": 0.3793763518333435, + "learning_rate": 4.9976442192446624e-05, + "loss": 0.2267, + "mean_token_accuracy": 0.9523321390151978, + "num_tokens": 285946.0, + "step": 115 + }, + { + "epoch": 0.000958844096909381, + "grad_norm": 0.35620346665382385, + "learning_rate": 4.9976235545011946e-05, + "loss": 0.2093, + "mean_token_accuracy": 0.9576530456542969, + "num_tokens": 287912.0, + "step": 116 + }, + { + "epoch": 0.0009671099942965308, + "grad_norm": 0.4162020981311798, + "learning_rate": 4.997602889757727e-05, + "loss": 0.265, + "mean_token_accuracy": 0.9475786089897156, + "num_tokens": 289921.0, + "step": 117 + }, + { + "epoch": 0.0009753758916836807, + "grad_norm": 0.37774839997291565, + "learning_rate": 4.997582225014259e-05, + "loss": 0.2451, + "mean_token_accuracy": 0.9467604160308838, + "num_tokens": 291918.0, + "step": 118 + }, + { + "epoch": 0.0009836417890708305, + "grad_norm": 0.37172678112983704, + "learning_rate": 4.997561560270791e-05, + "loss": 0.1832, + "mean_token_accuracy": 0.9625641107559204, + "num_tokens": 293874.0, + "step": 119 + }, + { + "epoch": 0.0009919076864579803, + "grad_norm": 0.34664982557296753, + "learning_rate": 4.997540895527323e-05, + "loss": 0.2393, + "mean_token_accuracy": 0.9501259326934814, + "num_tokens": 295865.0, + "step": 120 + }, + { + "epoch": 0.00100017358384513, + "grad_norm": 0.3998957574367523, + "learning_rate": 4.9975202307838554e-05, + "loss": 0.2463, + "mean_token_accuracy": 0.9456467032432556, + "num_tokens": 297858.0, + "step": 121 + }, + { + "epoch": 0.00100843948123228, + "grad_norm": 0.34160110354423523, + "learning_rate": 4.9974995660403875e-05, + "loss": 0.2268, + "mean_token_accuracy": 0.9513677954673767, + "num_tokens": 299838.0, + "step": 122 + }, + { + "epoch": 0.0010167053786194298, + "grad_norm": 0.4167325496673584, + "learning_rate": 4.99747890129692e-05, + "loss": 0.3688, + "mean_token_accuracy": 0.9249762296676636, + "num_tokens": 301950.0, + "step": 123 + }, + { + "epoch": 0.0010249712760065797, + "grad_norm": 0.3429563045501709, + "learning_rate": 4.997458236553452e-05, + "loss": 0.2127, + "mean_token_accuracy": 0.9597107172012329, + "num_tokens": 303892.0, + "step": 124 + }, + { + "epoch": 0.0010332371733937295, + "grad_norm": 0.46849849820137024, + "learning_rate": 4.9974375718099834e-05, + "loss": 0.3169, + "mean_token_accuracy": 0.939853310585022, + "num_tokens": 305943.0, + "step": 125 + }, + { + "epoch": 0.0010415030707808793, + "grad_norm": 0.4358327090740204, + "learning_rate": 4.997416907066516e-05, + "loss": 0.2923, + "mean_token_accuracy": 0.9409201145172119, + "num_tokens": 308014.0, + "step": 126 + }, + { + "epoch": 0.0010497689681680292, + "grad_norm": 0.40376272797584534, + "learning_rate": 4.997396242323048e-05, + "loss": 0.2575, + "mean_token_accuracy": 0.9454635381698608, + "num_tokens": 310037.0, + "step": 127 + }, + { + "epoch": 0.001058034865555179, + "grad_norm": 0.44060271978378296, + "learning_rate": 4.99737557757958e-05, + "loss": 0.2582, + "mean_token_accuracy": 0.9496728777885437, + "num_tokens": 312030.0, + "step": 128 + }, + { + "epoch": 0.0010663007629423287, + "grad_norm": 0.3269643783569336, + "learning_rate": 4.997354912836113e-05, + "loss": 0.2011, + "mean_token_accuracy": 0.9614213109016418, + "num_tokens": 314006.0, + "step": 129 + }, + { + "epoch": 0.0010745666603294787, + "grad_norm": 0.28902527689933777, + "learning_rate": 4.997334248092644e-05, + "loss": 0.1758, + "mean_token_accuracy": 0.9618514776229858, + "num_tokens": 315978.0, + "step": 130 + }, + { + "epoch": 0.0010828325577166285, + "grad_norm": 0.4907967746257782, + "learning_rate": 4.9973135833491764e-05, + "loss": 0.4331, + "mean_token_accuracy": 0.9163585901260376, + "num_tokens": 318148.0, + "step": 131 + }, + { + "epoch": 0.0010910984551037784, + "grad_norm": 0.44002026319503784, + "learning_rate": 4.9972929186057085e-05, + "loss": 0.3373, + "mean_token_accuracy": 0.9270488023757935, + "num_tokens": 320265.0, + "step": 132 + }, + { + "epoch": 0.0010993643524909282, + "grad_norm": 0.4253641664981842, + "learning_rate": 4.997272253862241e-05, + "loss": 0.3186, + "mean_token_accuracy": 0.9350268840789795, + "num_tokens": 322318.0, + "step": 133 + }, + { + "epoch": 0.001107630249878078, + "grad_norm": 0.47336700558662415, + "learning_rate": 4.997251589118773e-05, + "loss": 0.3062, + "mean_token_accuracy": 0.938339114189148, + "num_tokens": 324335.0, + "step": 134 + }, + { + "epoch": 0.001115896147265228, + "grad_norm": 0.4241746664047241, + "learning_rate": 4.997230924375305e-05, + "loss": 0.2258, + "mean_token_accuracy": 0.9517892599105835, + "num_tokens": 326353.0, + "step": 135 + }, + { + "epoch": 0.0011241620446523777, + "grad_norm": 0.41735950112342834, + "learning_rate": 4.997210259631837e-05, + "loss": 0.3644, + "mean_token_accuracy": 0.9337493777275085, + "num_tokens": 328442.0, + "step": 136 + }, + { + "epoch": 0.0011324279420395274, + "grad_norm": 0.3628050982952118, + "learning_rate": 4.9971895948883694e-05, + "loss": 0.2733, + "mean_token_accuracy": 0.9426877498626709, + "num_tokens": 330472.0, + "step": 137 + }, + { + "epoch": 0.0011406938394266774, + "grad_norm": 0.34173405170440674, + "learning_rate": 4.9971689301449015e-05, + "loss": 0.2499, + "mean_token_accuracy": 0.954017162322998, + "num_tokens": 332457.0, + "step": 138 + }, + { + "epoch": 0.0011489597368138271, + "grad_norm": 0.3606759309768677, + "learning_rate": 4.997148265401434e-05, + "loss": 0.2597, + "mean_token_accuracy": 0.9488752484321594, + "num_tokens": 334419.0, + "step": 139 + }, + { + "epoch": 0.0011572256342009771, + "grad_norm": 0.4132915735244751, + "learning_rate": 4.997127600657966e-05, + "loss": 0.2767, + "mean_token_accuracy": 0.9491778612136841, + "num_tokens": 336432.0, + "step": 140 + }, + { + "epoch": 0.0011654915315881269, + "grad_norm": 0.4765280485153198, + "learning_rate": 4.997106935914498e-05, + "loss": 0.3741, + "mean_token_accuracy": 0.9291488528251648, + "num_tokens": 338541.0, + "step": 141 + }, + { + "epoch": 0.0011737574289752766, + "grad_norm": 0.4147401452064514, + "learning_rate": 4.9970862711710295e-05, + "loss": 0.2949, + "mean_token_accuracy": 0.9372905492782593, + "num_tokens": 340636.0, + "step": 142 + }, + { + "epoch": 0.0011820233263624266, + "grad_norm": 0.4276408553123474, + "learning_rate": 4.9970656064275624e-05, + "loss": 0.2794, + "mean_token_accuracy": 0.9426189064979553, + "num_tokens": 342681.0, + "step": 143 + }, + { + "epoch": 0.0011902892237495763, + "grad_norm": 0.32022973895072937, + "learning_rate": 4.9970449416840945e-05, + "loss": 0.1828, + "mean_token_accuracy": 0.9586101174354553, + "num_tokens": 344644.0, + "step": 144 + }, + { + "epoch": 0.001198555121136726, + "grad_norm": 0.5508199334144592, + "learning_rate": 4.997024276940626e-05, + "loss": 0.3904, + "mean_token_accuracy": 0.9209012389183044, + "num_tokens": 346736.0, + "step": 145 + }, + { + "epoch": 0.001206821018523876, + "grad_norm": 0.3436821699142456, + "learning_rate": 4.997003612197159e-05, + "loss": 0.2325, + "mean_token_accuracy": 0.9511826634407043, + "num_tokens": 348729.0, + "step": 146 + }, + { + "epoch": 0.0012150869159110258, + "grad_norm": 0.3437710404396057, + "learning_rate": 4.99698294745369e-05, + "loss": 0.2104, + "mean_token_accuracy": 0.958268940448761, + "num_tokens": 350676.0, + "step": 147 + }, + { + "epoch": 0.0012233528132981758, + "grad_norm": 0.3376191258430481, + "learning_rate": 4.9969622827102225e-05, + "loss": 0.1821, + "mean_token_accuracy": 0.9618163108825684, + "num_tokens": 352620.0, + "step": 148 + }, + { + "epoch": 0.0012316187106853256, + "grad_norm": 0.4335744082927704, + "learning_rate": 4.996941617966755e-05, + "loss": 0.3394, + "mean_token_accuracy": 0.930355429649353, + "num_tokens": 354708.0, + "step": 149 + }, + { + "epoch": 0.0012398846080724753, + "grad_norm": 0.3190179765224457, + "learning_rate": 4.996920953223287e-05, + "loss": 0.1968, + "mean_token_accuracy": 0.9601227045059204, + "num_tokens": 356670.0, + "step": 150 + }, + { + "epoch": 0.0012481505054596253, + "grad_norm": 0.37530186772346497, + "learning_rate": 4.996900288479819e-05, + "loss": 0.248, + "mean_token_accuracy": 0.9488208889961243, + "num_tokens": 358669.0, + "step": 151 + }, + { + "epoch": 0.001256416402846775, + "grad_norm": 0.4432967007160187, + "learning_rate": 4.996879623736351e-05, + "loss": 0.3174, + "mean_token_accuracy": 0.9335918426513672, + "num_tokens": 360738.0, + "step": 152 + }, + { + "epoch": 0.0012646823002339248, + "grad_norm": 0.39701804518699646, + "learning_rate": 4.996858958992883e-05, + "loss": 0.3284, + "mean_token_accuracy": 0.9327852725982666, + "num_tokens": 362812.0, + "step": 153 + }, + { + "epoch": 0.0012729481976210748, + "grad_norm": 0.3877154588699341, + "learning_rate": 4.9968382942494155e-05, + "loss": 0.266, + "mean_token_accuracy": 0.9488089084625244, + "num_tokens": 364791.0, + "step": 154 + }, + { + "epoch": 0.0012812140950082245, + "grad_norm": 0.36334314942359924, + "learning_rate": 4.996817629505948e-05, + "loss": 0.2335, + "mean_token_accuracy": 0.9545224905014038, + "num_tokens": 366776.0, + "step": 155 + }, + { + "epoch": 0.0012894799923953745, + "grad_norm": 0.43625608086586, + "learning_rate": 4.99679696476248e-05, + "loss": 0.3179, + "mean_token_accuracy": 0.9325950741767883, + "num_tokens": 368859.0, + "step": 156 + }, + { + "epoch": 0.0012977458897825242, + "grad_norm": 0.36922386288642883, + "learning_rate": 4.996776300019011e-05, + "loss": 0.2259, + "mean_token_accuracy": 0.9508113861083984, + "num_tokens": 370837.0, + "step": 157 + }, + { + "epoch": 0.001306011787169674, + "grad_norm": 0.4996206760406494, + "learning_rate": 4.996755635275544e-05, + "loss": 0.3793, + "mean_token_accuracy": 0.9264069199562073, + "num_tokens": 372922.0, + "step": 158 + }, + { + "epoch": 0.001314277684556824, + "grad_norm": 0.3880661427974701, + "learning_rate": 4.9967349705320756e-05, + "loss": 0.2457, + "mean_token_accuracy": 0.946446418762207, + "num_tokens": 374926.0, + "step": 159 + }, + { + "epoch": 0.0013225435819439737, + "grad_norm": 0.32943350076675415, + "learning_rate": 4.9967143057886085e-05, + "loss": 0.2156, + "mean_token_accuracy": 0.952858567237854, + "num_tokens": 376926.0, + "step": 160 + }, + { + "epoch": 0.0013308094793311235, + "grad_norm": 0.3695654273033142, + "learning_rate": 4.9966936410451407e-05, + "loss": 0.2368, + "mean_token_accuracy": 0.9545681476593018, + "num_tokens": 378935.0, + "step": 161 + }, + { + "epoch": 0.0013390753767182734, + "grad_norm": 0.42351189255714417, + "learning_rate": 4.996672976301672e-05, + "loss": 0.2666, + "mean_token_accuracy": 0.9390485882759094, + "num_tokens": 380959.0, + "step": 162 + }, + { + "epoch": 0.0013473412741054232, + "grad_norm": 0.7745271921157837, + "learning_rate": 4.996652311558205e-05, + "loss": 0.219, + "mean_token_accuracy": 0.949999988079071, + "num_tokens": 382925.0, + "step": 163 + }, + { + "epoch": 0.0013556071714925732, + "grad_norm": 0.31670019030570984, + "learning_rate": 4.9966316468147365e-05, + "loss": 0.2137, + "mean_token_accuracy": 0.953406810760498, + "num_tokens": 384927.0, + "step": 164 + }, + { + "epoch": 0.001363873068879723, + "grad_norm": 0.32420817017555237, + "learning_rate": 4.9966109820712686e-05, + "loss": 0.1978, + "mean_token_accuracy": 0.9547534584999084, + "num_tokens": 386900.0, + "step": 165 + }, + { + "epoch": 0.0013721389662668727, + "grad_norm": 0.4137507379055023, + "learning_rate": 4.996590317327801e-05, + "loss": 0.2337, + "mean_token_accuracy": 0.9464373588562012, + "num_tokens": 388941.0, + "step": 166 + }, + { + "epoch": 0.0013804048636540227, + "grad_norm": 0.4905780553817749, + "learning_rate": 4.996569652584333e-05, + "loss": 0.2975, + "mean_token_accuracy": 0.9425173401832581, + "num_tokens": 390965.0, + "step": 167 + }, + { + "epoch": 0.0013886707610411724, + "grad_norm": 0.5064888000488281, + "learning_rate": 4.996548987840865e-05, + "loss": 0.372, + "mean_token_accuracy": 0.9281952977180481, + "num_tokens": 393060.0, + "step": 168 + }, + { + "epoch": 0.0013969366584283224, + "grad_norm": 0.3523234724998474, + "learning_rate": 4.996528323097397e-05, + "loss": 0.2051, + "mean_token_accuracy": 0.9609856009483337, + "num_tokens": 395014.0, + "step": 169 + }, + { + "epoch": 0.0014052025558154721, + "grad_norm": 0.34162983298301697, + "learning_rate": 4.9965076583539295e-05, + "loss": 0.2178, + "mean_token_accuracy": 0.9570055603981018, + "num_tokens": 396997.0, + "step": 170 + }, + { + "epoch": 0.0014134684532026219, + "grad_norm": 0.3736307621002197, + "learning_rate": 4.9964869936104616e-05, + "loss": 0.2185, + "mean_token_accuracy": 0.9555888175964355, + "num_tokens": 399007.0, + "step": 171 + }, + { + "epoch": 0.0014217343505897719, + "grad_norm": 0.3532184362411499, + "learning_rate": 4.996466328866994e-05, + "loss": 0.2133, + "mean_token_accuracy": 0.9600404500961304, + "num_tokens": 400990.0, + "step": 172 + }, + { + "epoch": 0.0014300002479769216, + "grad_norm": 0.4058968722820282, + "learning_rate": 4.996445664123526e-05, + "loss": 0.2618, + "mean_token_accuracy": 0.942643404006958, + "num_tokens": 403001.0, + "step": 173 + }, + { + "epoch": 0.0014382661453640714, + "grad_norm": 0.36838194727897644, + "learning_rate": 4.9964249993800575e-05, + "loss": 0.2952, + "mean_token_accuracy": 0.9451581239700317, + "num_tokens": 405031.0, + "step": 174 + }, + { + "epoch": 0.0014465320427512213, + "grad_norm": 0.4245535731315613, + "learning_rate": 4.99640433463659e-05, + "loss": 0.305, + "mean_token_accuracy": 0.9347721934318542, + "num_tokens": 407122.0, + "step": 175 + }, + { + "epoch": 0.001454797940138371, + "grad_norm": 0.35786592960357666, + "learning_rate": 4.996383669893122e-05, + "loss": 0.2508, + "mean_token_accuracy": 0.9473161101341248, + "num_tokens": 409140.0, + "step": 176 + }, + { + "epoch": 0.001463063837525521, + "grad_norm": 0.33934542536735535, + "learning_rate": 4.996363005149654e-05, + "loss": 0.2278, + "mean_token_accuracy": 0.952023983001709, + "num_tokens": 411147.0, + "step": 177 + }, + { + "epoch": 0.0014713297349126708, + "grad_norm": 0.36044228076934814, + "learning_rate": 4.996342340406187e-05, + "loss": 0.2051, + "mean_token_accuracy": 0.9536990523338318, + "num_tokens": 413140.0, + "step": 178 + }, + { + "epoch": 0.0014795956322998206, + "grad_norm": 0.31432509422302246, + "learning_rate": 4.996321675662718e-05, + "loss": 0.1774, + "mean_token_accuracy": 0.9571647047996521, + "num_tokens": 415107.0, + "step": 179 + }, + { + "epoch": 0.0014878615296869705, + "grad_norm": 0.43004900217056274, + "learning_rate": 4.996301010919251e-05, + "loss": 0.2464, + "mean_token_accuracy": 0.9493110179901123, + "num_tokens": 417145.0, + "step": 180 + }, + { + "epoch": 0.0014961274270741203, + "grad_norm": 0.38657617568969727, + "learning_rate": 4.9962803461757826e-05, + "loss": 0.1988, + "mean_token_accuracy": 0.9582272171974182, + "num_tokens": 419114.0, + "step": 181 + }, + { + "epoch": 0.00150439332446127, + "grad_norm": 0.323732852935791, + "learning_rate": 4.996259681432315e-05, + "loss": 0.2199, + "mean_token_accuracy": 0.9575543403625488, + "num_tokens": 421099.0, + "step": 182 + }, + { + "epoch": 0.00151265922184842, + "grad_norm": 0.3862565755844116, + "learning_rate": 4.9962390166888476e-05, + "loss": 0.2615, + "mean_token_accuracy": 0.9473684430122375, + "num_tokens": 423138.0, + "step": 183 + }, + { + "epoch": 0.0015209251192355698, + "grad_norm": 0.44200780987739563, + "learning_rate": 4.996218351945379e-05, + "loss": 0.2477, + "mean_token_accuracy": 0.9512194991111755, + "num_tokens": 425153.0, + "step": 184 + }, + { + "epoch": 0.0015291910166227198, + "grad_norm": 0.527441680431366, + "learning_rate": 4.996197687201911e-05, + "loss": 0.2395, + "mean_token_accuracy": 0.9471624493598938, + "num_tokens": 427203.0, + "step": 185 + }, + { + "epoch": 0.0015374569140098695, + "grad_norm": 0.35225358605384827, + "learning_rate": 4.9961770224584434e-05, + "loss": 0.2079, + "mean_token_accuracy": 0.9567649960517883, + "num_tokens": 429175.0, + "step": 186 + }, + { + "epoch": 0.0015457228113970193, + "grad_norm": 0.4101203680038452, + "learning_rate": 4.9961563577149756e-05, + "loss": 0.2409, + "mean_token_accuracy": 0.9457171559333801, + "num_tokens": 431189.0, + "step": 187 + }, + { + "epoch": 0.0015539887087841692, + "grad_norm": 0.35431399941444397, + "learning_rate": 4.996135692971508e-05, + "loss": 0.2084, + "mean_token_accuracy": 0.956940233707428, + "num_tokens": 433169.0, + "step": 188 + }, + { + "epoch": 0.001562254606171319, + "grad_norm": 0.3679504692554474, + "learning_rate": 4.99611502822804e-05, + "loss": 0.1955, + "mean_token_accuracy": 0.9568489789962769, + "num_tokens": 435168.0, + "step": 189 + }, + { + "epoch": 0.0015705205035584687, + "grad_norm": 0.3775530755519867, + "learning_rate": 4.996094363484572e-05, + "loss": 0.2188, + "mean_token_accuracy": 0.9526686668395996, + "num_tokens": 437160.0, + "step": 190 + }, + { + "epoch": 0.0015787864009456187, + "grad_norm": 0.397073894739151, + "learning_rate": 4.9960736987411036e-05, + "loss": 0.2229, + "mean_token_accuracy": 0.9520719051361084, + "num_tokens": 439169.0, + "step": 191 + }, + { + "epoch": 0.0015870522983327685, + "grad_norm": 0.5781298279762268, + "learning_rate": 4.9960530339976364e-05, + "loss": 0.2773, + "mean_token_accuracy": 0.942460298538208, + "num_tokens": 441191.0, + "step": 192 + }, + { + "epoch": 0.0015953181957199184, + "grad_norm": 0.4482797086238861, + "learning_rate": 4.9960323692541686e-05, + "loss": 0.2893, + "mean_token_accuracy": 0.944767415523529, + "num_tokens": 443261.0, + "step": 193 + }, + { + "epoch": 0.0016035840931070682, + "grad_norm": 0.43917760252952576, + "learning_rate": 4.9960117045107e-05, + "loss": 0.296, + "mean_token_accuracy": 0.9437869787216187, + "num_tokens": 445295.0, + "step": 194 + }, + { + "epoch": 0.001611849990494218, + "grad_norm": 0.41199809312820435, + "learning_rate": 4.995991039767233e-05, + "loss": 0.257, + "mean_token_accuracy": 0.9435721039772034, + "num_tokens": 447339.0, + "step": 195 + }, + { + "epoch": 0.001620115887881368, + "grad_norm": 0.44698280096054077, + "learning_rate": 4.9959703750237644e-05, + "loss": 0.2319, + "mean_token_accuracy": 0.9520479440689087, + "num_tokens": 449347.0, + "step": 196 + }, + { + "epoch": 0.0016283817852685177, + "grad_norm": 0.3956550657749176, + "learning_rate": 4.9959497102802966e-05, + "loss": 0.2465, + "mean_token_accuracy": 0.9480712413787842, + "num_tokens": 451375.0, + "step": 197 + }, + { + "epoch": 0.0016366476826556674, + "grad_norm": 0.3713931441307068, + "learning_rate": 4.995929045536829e-05, + "loss": 0.2835, + "mean_token_accuracy": 0.9433040022850037, + "num_tokens": 453427.0, + "step": 198 + }, + { + "epoch": 0.0016449135800428174, + "grad_norm": 0.49990788102149963, + "learning_rate": 4.995908380793361e-05, + "loss": 0.353, + "mean_token_accuracy": 0.9331449866294861, + "num_tokens": 455557.0, + "step": 199 + }, + { + "epoch": 0.0016531794774299672, + "grad_norm": 0.40154170989990234, + "learning_rate": 4.995887716049893e-05, + "loss": 0.2324, + "mean_token_accuracy": 0.9506234526634216, + "num_tokens": 457568.0, + "step": 200 + }, + { + "epoch": 0.0016614453748171171, + "grad_norm": 0.42626091837882996, + "learning_rate": 4.995867051306425e-05, + "loss": 0.2421, + "mean_token_accuracy": 0.9526656866073608, + "num_tokens": 459581.0, + "step": 201 + }, + { + "epoch": 0.0016697112722042669, + "grad_norm": 0.42444708943367004, + "learning_rate": 4.9958463865629574e-05, + "loss": 0.2724, + "mean_token_accuracy": 0.9428289532661438, + "num_tokens": 461616.0, + "step": 202 + }, + { + "epoch": 0.0016779771695914166, + "grad_norm": 0.3321168124675751, + "learning_rate": 4.9958257218194896e-05, + "loss": 0.2055, + "mean_token_accuracy": 0.9579533934593201, + "num_tokens": 463596.0, + "step": 203 + }, + { + "epoch": 0.0016862430669785666, + "grad_norm": 0.31841254234313965, + "learning_rate": 4.995805057076022e-05, + "loss": 0.1771, + "mean_token_accuracy": 0.9633401036262512, + "num_tokens": 465566.0, + "step": 204 + }, + { + "epoch": 0.0016945089643657164, + "grad_norm": 0.4629010856151581, + "learning_rate": 4.995784392332554e-05, + "loss": 0.3147, + "mean_token_accuracy": 0.9342294931411743, + "num_tokens": 467655.0, + "step": 205 + }, + { + "epoch": 0.0017027748617528661, + "grad_norm": 0.38947194814682007, + "learning_rate": 4.995763727589086e-05, + "loss": 0.2271, + "mean_token_accuracy": 0.9518255591392517, + "num_tokens": 469633.0, + "step": 206 + }, + { + "epoch": 0.001711040759140016, + "grad_norm": 0.39823102951049805, + "learning_rate": 4.995743062845618e-05, + "loss": 0.2338, + "mean_token_accuracy": 0.9496545195579529, + "num_tokens": 471665.0, + "step": 207 + }, + { + "epoch": 0.0017193066565271658, + "grad_norm": 0.4126001298427582, + "learning_rate": 4.99572239810215e-05, + "loss": 0.244, + "mean_token_accuracy": 0.9533705115318298, + "num_tokens": 473644.0, + "step": 208 + }, + { + "epoch": 0.0017275725539143158, + "grad_norm": 0.43648454546928406, + "learning_rate": 4.9957017333586826e-05, + "loss": 0.2394, + "mean_token_accuracy": 0.9514999985694885, + "num_tokens": 475650.0, + "step": 209 + }, + { + "epoch": 0.0017358384513014656, + "grad_norm": 0.4396474063396454, + "learning_rate": 4.995681068615215e-05, + "loss": 0.2683, + "mean_token_accuracy": 0.9454905986785889, + "num_tokens": 477674.0, + "step": 210 + }, + { + "epoch": 0.0017441043486886153, + "grad_norm": 0.389310747385025, + "learning_rate": 4.995660403871746e-05, + "loss": 0.2076, + "mean_token_accuracy": 0.957717776298523, + "num_tokens": 479643.0, + "step": 211 + }, + { + "epoch": 0.0017523702460757653, + "grad_norm": 0.5761370658874512, + "learning_rate": 4.995639739128279e-05, + "loss": 0.3375, + "mean_token_accuracy": 0.9356555342674255, + "num_tokens": 481716.0, + "step": 212 + }, + { + "epoch": 0.001760636143462915, + "grad_norm": 0.4655229151248932, + "learning_rate": 4.9956190743848106e-05, + "loss": 0.2651, + "mean_token_accuracy": 0.947029709815979, + "num_tokens": 483742.0, + "step": 213 + }, + { + "epoch": 0.0017689020408500648, + "grad_norm": 0.44393202662467957, + "learning_rate": 4.995598409641343e-05, + "loss": 0.3115, + "mean_token_accuracy": 0.9448584318161011, + "num_tokens": 485761.0, + "step": 214 + }, + { + "epoch": 0.0017771679382372148, + "grad_norm": 0.3399536609649658, + "learning_rate": 4.995577744897875e-05, + "loss": 0.1942, + "mean_token_accuracy": 0.9593830108642578, + "num_tokens": 487712.0, + "step": 215 + }, + { + "epoch": 0.0017854338356243645, + "grad_norm": 0.44372278451919556, + "learning_rate": 4.995557080154407e-05, + "loss": 0.3806, + "mean_token_accuracy": 0.9252601861953735, + "num_tokens": 489832.0, + "step": 216 + }, + { + "epoch": 0.0017936997330115145, + "grad_norm": 0.3342445194721222, + "learning_rate": 4.995536415410939e-05, + "loss": 0.1948, + "mean_token_accuracy": 0.9573934674263, + "num_tokens": 491833.0, + "step": 217 + }, + { + "epoch": 0.0018019656303986642, + "grad_norm": 0.35612207651138306, + "learning_rate": 4.9955157506674714e-05, + "loss": 0.2363, + "mean_token_accuracy": 0.9495549201965332, + "num_tokens": 493861.0, + "step": 218 + }, + { + "epoch": 0.001810231527785814, + "grad_norm": 0.47954094409942627, + "learning_rate": 4.9954950859240036e-05, + "loss": 0.3813, + "mean_token_accuracy": 0.9208294153213501, + "num_tokens": 495989.0, + "step": 219 + }, + { + "epoch": 0.001818497425172964, + "grad_norm": 0.40823832154273987, + "learning_rate": 4.995474421180536e-05, + "loss": 0.2748, + "mean_token_accuracy": 0.9354679584503174, + "num_tokens": 498025.0, + "step": 220 + }, + { + "epoch": 0.0018267633225601137, + "grad_norm": 0.40444284677505493, + "learning_rate": 4.995453756437068e-05, + "loss": 0.29, + "mean_token_accuracy": 0.9416996240615845, + "num_tokens": 500055.0, + "step": 221 + }, + { + "epoch": 0.0018350292199472635, + "grad_norm": 0.33328917622566223, + "learning_rate": 4.9954330916936e-05, + "loss": 0.2092, + "mean_token_accuracy": 0.9618473649024963, + "num_tokens": 502053.0, + "step": 222 + }, + { + "epoch": 0.0018432951173344135, + "grad_norm": 0.3845839202404022, + "learning_rate": 4.995412426950132e-05, + "loss": 0.1982, + "mean_token_accuracy": 0.9604862928390503, + "num_tokens": 504033.0, + "step": 223 + }, + { + "epoch": 0.0018515610147215632, + "grad_norm": 0.4249724745750427, + "learning_rate": 4.9953917622066644e-05, + "loss": 0.1636, + "mean_token_accuracy": 0.9634518027305603, + "num_tokens": 506009.0, + "step": 224 + }, + { + "epoch": 0.0018598269121087132, + "grad_norm": 0.46474647521972656, + "learning_rate": 4.995371097463196e-05, + "loss": 0.2951, + "mean_token_accuracy": 0.9388052225112915, + "num_tokens": 508074.0, + "step": 225 + }, + { + "epoch": 0.001868092809495863, + "grad_norm": 0.4238729774951935, + "learning_rate": 4.995350432719729e-05, + "loss": 0.2161, + "mean_token_accuracy": 0.9593908786773682, + "num_tokens": 510050.0, + "step": 226 + }, + { + "epoch": 0.0018763587068830127, + "grad_norm": 0.4334641396999359, + "learning_rate": 4.995329767976261e-05, + "loss": 0.2622, + "mean_token_accuracy": 0.9480968713760376, + "num_tokens": 512079.0, + "step": 227 + }, + { + "epoch": 0.0018846246042701627, + "grad_norm": 0.38220450282096863, + "learning_rate": 4.9953091032327924e-05, + "loss": 0.1968, + "mean_token_accuracy": 0.9569838047027588, + "num_tokens": 514061.0, + "step": 228 + }, + { + "epoch": 0.0018928905016573124, + "grad_norm": 0.3590328097343445, + "learning_rate": 4.995288438489325e-05, + "loss": 0.2105, + "mean_token_accuracy": 0.9559999704360962, + "num_tokens": 516067.0, + "step": 229 + }, + { + "epoch": 0.0019011563990444622, + "grad_norm": 0.365873247385025, + "learning_rate": 4.995267773745857e-05, + "loss": 0.2312, + "mean_token_accuracy": 0.9503012299537659, + "num_tokens": 518065.0, + "step": 230 + }, + { + "epoch": 0.0019094222964316121, + "grad_norm": 0.3869886100292206, + "learning_rate": 4.995247109002389e-05, + "loss": 0.2183, + "mean_token_accuracy": 0.9523326754570007, + "num_tokens": 520043.0, + "step": 231 + }, + { + "epoch": 0.001917688193818762, + "grad_norm": 0.4155399203300476, + "learning_rate": 4.995226444258922e-05, + "loss": 0.2543, + "mean_token_accuracy": 0.9486796259880066, + "num_tokens": 522056.0, + "step": 232 + }, + { + "epoch": 0.0019259540912059119, + "grad_norm": 0.385654479265213, + "learning_rate": 4.995205779515453e-05, + "loss": 0.2128, + "mean_token_accuracy": 0.9536390900611877, + "num_tokens": 524068.0, + "step": 233 + }, + { + "epoch": 0.0019342199885930616, + "grad_norm": 0.425402969121933, + "learning_rate": 4.9951851147719854e-05, + "loss": 0.2976, + "mean_token_accuracy": 0.9434323906898499, + "num_tokens": 526160.0, + "step": 234 + }, + { + "epoch": 0.0019424858859802114, + "grad_norm": 0.46727752685546875, + "learning_rate": 4.9951644500285175e-05, + "loss": 0.2954, + "mean_token_accuracy": 0.9373493790626526, + "num_tokens": 528241.0, + "step": 235 + }, + { + "epoch": 0.0019507517833673613, + "grad_norm": 0.3046579957008362, + "learning_rate": 4.99514378528505e-05, + "loss": 0.1787, + "mean_token_accuracy": 0.9619341492652893, + "num_tokens": 530191.0, + "step": 236 + }, + { + "epoch": 0.0019590176807545113, + "grad_norm": 0.44570425152778625, + "learning_rate": 4.995123120541582e-05, + "loss": 0.2982, + "mean_token_accuracy": 0.9380701184272766, + "num_tokens": 532280.0, + "step": 237 + }, + { + "epoch": 0.001967283578141661, + "grad_norm": 0.4583204686641693, + "learning_rate": 4.995102455798114e-05, + "loss": 0.267, + "mean_token_accuracy": 0.948319137096405, + "num_tokens": 534279.0, + "step": 238 + }, + { + "epoch": 0.001975549475528811, + "grad_norm": 0.48733460903167725, + "learning_rate": 4.995081791054646e-05, + "loss": 0.2298, + "mean_token_accuracy": 0.9539077877998352, + "num_tokens": 536281.0, + "step": 239 + }, + { + "epoch": 0.0019838153729159606, + "grad_norm": 0.3647000193595886, + "learning_rate": 4.995061126311178e-05, + "loss": 0.1994, + "mean_token_accuracy": 0.9569620490074158, + "num_tokens": 538262.0, + "step": 240 + }, + { + "epoch": 0.0019920812703031103, + "grad_norm": 0.35905659198760986, + "learning_rate": 4.9950404615677105e-05, + "loss": 0.2187, + "mean_token_accuracy": 0.9546586871147156, + "num_tokens": 540275.0, + "step": 241 + }, + { + "epoch": 0.00200034716769026, + "grad_norm": 0.4354383945465088, + "learning_rate": 4.995019796824243e-05, + "loss": 0.3224, + "mean_token_accuracy": 0.9346781969070435, + "num_tokens": 542363.0, + "step": 242 + }, + { + "epoch": 0.0020086130650774103, + "grad_norm": 0.35473981499671936, + "learning_rate": 4.994999132080775e-05, + "loss": 0.1936, + "mean_token_accuracy": 0.9590495228767395, + "num_tokens": 544347.0, + "step": 243 + }, + { + "epoch": 0.00201687896246456, + "grad_norm": 0.3254944086074829, + "learning_rate": 4.994978467337307e-05, + "loss": 0.1717, + "mean_token_accuracy": 0.9607942700386047, + "num_tokens": 546317.0, + "step": 244 + }, + { + "epoch": 0.00202514485985171, + "grad_norm": 0.3838103413581848, + "learning_rate": 4.9949578025938385e-05, + "loss": 0.2207, + "mean_token_accuracy": 0.9522402882575989, + "num_tokens": 548354.0, + "step": 245 + }, + { + "epoch": 0.0020334107572388595, + "grad_norm": 0.38548266887664795, + "learning_rate": 4.9949371378503714e-05, + "loss": 0.2581, + "mean_token_accuracy": 0.9475747346878052, + "num_tokens": 550401.0, + "step": 246 + }, + { + "epoch": 0.0020416766546260093, + "grad_norm": 0.3755143880844116, + "learning_rate": 4.994916473106903e-05, + "loss": 0.2557, + "mean_token_accuracy": 0.9424390196800232, + "num_tokens": 552457.0, + "step": 247 + }, + { + "epoch": 0.0020499425520131595, + "grad_norm": 0.3793683648109436, + "learning_rate": 4.994895808363435e-05, + "loss": 0.2264, + "mean_token_accuracy": 0.9554880857467651, + "num_tokens": 554440.0, + "step": 248 + }, + { + "epoch": 0.0020582084494003092, + "grad_norm": 0.4046688973903656, + "learning_rate": 4.994875143619968e-05, + "loss": 0.2443, + "mean_token_accuracy": 0.9479115605354309, + "num_tokens": 556481.0, + "step": 249 + }, + { + "epoch": 0.002066474346787459, + "grad_norm": 0.39033177495002747, + "learning_rate": 4.9948544788764993e-05, + "loss": 0.2337, + "mean_token_accuracy": 0.9542943239212036, + "num_tokens": 558478.0, + "step": 250 + }, + { + "epoch": 0.0020747402441746087, + "grad_norm": 0.43119877576828003, + "learning_rate": 4.9948338141330315e-05, + "loss": 0.1949, + "mean_token_accuracy": 0.9583756327629089, + "num_tokens": 560454.0, + "step": 251 + }, + { + "epoch": 0.0020830061415617585, + "grad_norm": 0.4812301695346832, + "learning_rate": 4.994813149389564e-05, + "loss": 0.1955, + "mean_token_accuracy": 0.957121729850769, + "num_tokens": 562489.0, + "step": 252 + }, + { + "epoch": 0.0020912720389489087, + "grad_norm": 0.401766300201416, + "learning_rate": 4.994792484646096e-05, + "loss": 0.2275, + "mean_token_accuracy": 0.953125, + "num_tokens": 564479.0, + "step": 253 + }, + { + "epoch": 0.0020995379363360584, + "grad_norm": 0.4104023575782776, + "learning_rate": 4.994771819902628e-05, + "loss": 0.2244, + "mean_token_accuracy": 0.9537773132324219, + "num_tokens": 566497.0, + "step": 254 + }, + { + "epoch": 0.002107803833723208, + "grad_norm": 0.37615010142326355, + "learning_rate": 4.99475115515916e-05, + "loss": 0.2366, + "mean_token_accuracy": 0.9547534584999084, + "num_tokens": 568470.0, + "step": 255 + }, + { + "epoch": 0.002116069731110358, + "grad_norm": 0.4524342715740204, + "learning_rate": 4.994730490415692e-05, + "loss": 0.2377, + "mean_token_accuracy": 0.9517412781715393, + "num_tokens": 570486.0, + "step": 256 + }, + { + "epoch": 0.0021243356284975077, + "grad_norm": 0.36174899339675903, + "learning_rate": 4.994709825672224e-05, + "loss": 0.2559, + "mean_token_accuracy": 0.9482329487800598, + "num_tokens": 572501.0, + "step": 257 + }, + { + "epoch": 0.0021326015258846575, + "grad_norm": 0.5051626563072205, + "learning_rate": 4.994689160928757e-05, + "loss": 0.2601, + "mean_token_accuracy": 0.9450767040252686, + "num_tokens": 574528.0, + "step": 258 + }, + { + "epoch": 0.0021408674232718077, + "grad_norm": 0.4387591779232025, + "learning_rate": 4.994668496185289e-05, + "loss": 0.242, + "mean_token_accuracy": 0.9555779695510864, + "num_tokens": 576515.0, + "step": 259 + }, + { + "epoch": 0.0021491333206589574, + "grad_norm": 0.46807482838630676, + "learning_rate": 4.99464783144182e-05, + "loss": 0.2313, + "mean_token_accuracy": 0.9486419558525085, + "num_tokens": 578546.0, + "step": 260 + }, + { + "epoch": 0.002157399218046107, + "grad_norm": 0.4324467182159424, + "learning_rate": 4.994627166698353e-05, + "loss": 0.2304, + "mean_token_accuracy": 0.9508684873580933, + "num_tokens": 580567.0, + "step": 261 + }, + { + "epoch": 0.002165665115433257, + "grad_norm": 0.3726848363876343, + "learning_rate": 4.9946065019548847e-05, + "loss": 0.1683, + "mean_token_accuracy": 0.9652742743492126, + "num_tokens": 582560.0, + "step": 262 + }, + { + "epoch": 0.0021739310128204067, + "grad_norm": 0.4649844765663147, + "learning_rate": 4.9945858372114175e-05, + "loss": 0.2823, + "mean_token_accuracy": 0.9440078735351562, + "num_tokens": 584602.0, + "step": 263 + }, + { + "epoch": 0.002182196910207557, + "grad_norm": 0.3798585832118988, + "learning_rate": 4.994565172467949e-05, + "loss": 0.2385, + "mean_token_accuracy": 0.9526420831680298, + "num_tokens": 586614.0, + "step": 264 + }, + { + "epoch": 0.0021904628075947066, + "grad_norm": 0.5047613978385925, + "learning_rate": 4.994544507724481e-05, + "loss": 0.2007, + "mean_token_accuracy": 0.9601837396621704, + "num_tokens": 588579.0, + "step": 265 + }, + { + "epoch": 0.0021987287049818564, + "grad_norm": 0.37147533893585205, + "learning_rate": 4.994523842981014e-05, + "loss": 0.2324, + "mean_token_accuracy": 0.9545683860778809, + "num_tokens": 590566.0, + "step": 266 + }, + { + "epoch": 0.002206994602369006, + "grad_norm": 0.39514973759651184, + "learning_rate": 4.9945031782375455e-05, + "loss": 0.2525, + "mean_token_accuracy": 0.9510143399238586, + "num_tokens": 592593.0, + "step": 267 + }, + { + "epoch": 0.002215260499756156, + "grad_norm": 0.43914228677749634, + "learning_rate": 4.9944825134940776e-05, + "loss": 0.1881, + "mean_token_accuracy": 0.9605936408042908, + "num_tokens": 594553.0, + "step": 268 + }, + { + "epoch": 0.002223526397143306, + "grad_norm": 0.4348392188549042, + "learning_rate": 4.99446184875061e-05, + "loss": 0.233, + "mean_token_accuracy": 0.9477871656417847, + "num_tokens": 596570.0, + "step": 269 + }, + { + "epoch": 0.002231792294530456, + "grad_norm": 0.4209921360015869, + "learning_rate": 4.994441184007142e-05, + "loss": 0.2436, + "mean_token_accuracy": 0.955610990524292, + "num_tokens": 598581.0, + "step": 270 + }, + { + "epoch": 0.0022400581919176056, + "grad_norm": 0.4016135632991791, + "learning_rate": 4.994420519263674e-05, + "loss": 0.2263, + "mean_token_accuracy": 0.9556650519371033, + "num_tokens": 600617.0, + "step": 271 + }, + { + "epoch": 0.0022483240893047553, + "grad_norm": 0.35575857758522034, + "learning_rate": 4.994399854520206e-05, + "loss": 0.2029, + "mean_token_accuracy": 0.9541832804679871, + "num_tokens": 602631.0, + "step": 272 + }, + { + "epoch": 0.002256589986691905, + "grad_norm": 0.3445430397987366, + "learning_rate": 4.9943791897767385e-05, + "loss": 0.1885, + "mean_token_accuracy": 0.9560059309005737, + "num_tokens": 604660.0, + "step": 273 + }, + { + "epoch": 0.002264855884079055, + "grad_norm": 0.36195898056030273, + "learning_rate": 4.99435852503327e-05, + "loss": 0.2284, + "mean_token_accuracy": 0.9558897018432617, + "num_tokens": 606661.0, + "step": 274 + }, + { + "epoch": 0.002273121781466205, + "grad_norm": 0.3910697102546692, + "learning_rate": 4.994337860289803e-05, + "loss": 0.2217, + "mean_token_accuracy": 0.9544329047203064, + "num_tokens": 608686.0, + "step": 275 + }, + { + "epoch": 0.0022813876788533548, + "grad_norm": 0.43754875659942627, + "learning_rate": 4.994317195546335e-05, + "loss": 0.2419, + "mean_token_accuracy": 0.9506480693817139, + "num_tokens": 610698.0, + "step": 276 + }, + { + "epoch": 0.0022896535762405045, + "grad_norm": 0.43161723017692566, + "learning_rate": 4.9942965308028665e-05, + "loss": 0.2328, + "mean_token_accuracy": 0.9513990879058838, + "num_tokens": 612741.0, + "step": 277 + }, + { + "epoch": 0.0022979194736276543, + "grad_norm": 0.258259117603302, + "learning_rate": 4.994275866059399e-05, + "loss": 0.1294, + "mean_token_accuracy": 0.9726521968841553, + "num_tokens": 614685.0, + "step": 278 + }, + { + "epoch": 0.002306185371014804, + "grad_norm": 0.4533786177635193, + "learning_rate": 4.994255201315931e-05, + "loss": 0.2567, + "mean_token_accuracy": 0.9435998201370239, + "num_tokens": 616730.0, + "step": 279 + }, + { + "epoch": 0.0023144512684019542, + "grad_norm": 0.40258121490478516, + "learning_rate": 4.994234536572463e-05, + "loss": 0.2557, + "mean_token_accuracy": 0.9493480324745178, + "num_tokens": 618730.0, + "step": 280 + }, + { + "epoch": 0.002322717165789104, + "grad_norm": 0.41241350769996643, + "learning_rate": 4.994213871828996e-05, + "loss": 0.2194, + "mean_token_accuracy": 0.9514027833938599, + "num_tokens": 620732.0, + "step": 281 + }, + { + "epoch": 0.0023309830631762537, + "grad_norm": 0.43289700150489807, + "learning_rate": 4.994193207085527e-05, + "loss": 0.2918, + "mean_token_accuracy": 0.9389716386795044, + "num_tokens": 622819.0, + "step": 282 + }, + { + "epoch": 0.0023392489605634035, + "grad_norm": 0.4616968631744385, + "learning_rate": 4.9941725423420595e-05, + "loss": 0.2696, + "mean_token_accuracy": 0.9431051015853882, + "num_tokens": 624899.0, + "step": 283 + }, + { + "epoch": 0.0023475148579505532, + "grad_norm": 0.43764299154281616, + "learning_rate": 4.9941518775985916e-05, + "loss": 0.2455, + "mean_token_accuracy": 0.9458128213882446, + "num_tokens": 626935.0, + "step": 284 + }, + { + "epoch": 0.0023557807553377034, + "grad_norm": 0.410492479801178, + "learning_rate": 4.994131212855124e-05, + "loss": 0.2407, + "mean_token_accuracy": 0.9466209411621094, + "num_tokens": 628983.0, + "step": 285 + }, + { + "epoch": 0.002364046652724853, + "grad_norm": 0.44209814071655273, + "learning_rate": 4.994110548111656e-05, + "loss": 0.2259, + "mean_token_accuracy": 0.9534301161766052, + "num_tokens": 630986.0, + "step": 286 + }, + { + "epoch": 0.002372312550112003, + "grad_norm": 0.4304454028606415, + "learning_rate": 4.994089883368188e-05, + "loss": 0.2157, + "mean_token_accuracy": 0.9500494599342346, + "num_tokens": 633014.0, + "step": 287 + }, + { + "epoch": 0.0023805784474991527, + "grad_norm": 0.37028518319129944, + "learning_rate": 4.99406921862472e-05, + "loss": 0.2446, + "mean_token_accuracy": 0.9519038200378418, + "num_tokens": 635016.0, + "step": 288 + }, + { + "epoch": 0.0023888443448863025, + "grad_norm": 0.3473495841026306, + "learning_rate": 4.9940485538812525e-05, + "loss": 0.1871, + "mean_token_accuracy": 0.9602187871932983, + "num_tokens": 637033.0, + "step": 289 + }, + { + "epoch": 0.002397110242273452, + "grad_norm": 0.4115881621837616, + "learning_rate": 4.9940278891377846e-05, + "loss": 0.3009, + "mean_token_accuracy": 0.9386473298072815, + "num_tokens": 639109.0, + "step": 290 + }, + { + "epoch": 0.0024053761396606024, + "grad_norm": 0.39887967705726624, + "learning_rate": 4.994007224394317e-05, + "loss": 0.2498, + "mean_token_accuracy": 0.9518371224403381, + "num_tokens": 641129.0, + "step": 291 + }, + { + "epoch": 0.002413642037047752, + "grad_norm": 0.28864195942878723, + "learning_rate": 4.993986559650849e-05, + "loss": 0.1681, + "mean_token_accuracy": 0.9704533815383911, + "num_tokens": 643098.0, + "step": 292 + }, + { + "epoch": 0.002421907934434902, + "grad_norm": 0.42355039715766907, + "learning_rate": 4.993965894907381e-05, + "loss": 0.2712, + "mean_token_accuracy": 0.943109393119812, + "num_tokens": 645143.0, + "step": 293 + }, + { + "epoch": 0.0024301738318220517, + "grad_norm": 0.5223525166511536, + "learning_rate": 4.9939452301639126e-05, + "loss": 0.2075, + "mean_token_accuracy": 0.9607843160629272, + "num_tokens": 647138.0, + "step": 294 + }, + { + "epoch": 0.0024384397292092014, + "grad_norm": 0.3669191300868988, + "learning_rate": 4.9939245654204454e-05, + "loss": 0.1558, + "mean_token_accuracy": 0.9679586291313171, + "num_tokens": 649079.0, + "step": 295 + }, + { + "epoch": 0.0024467056265963516, + "grad_norm": 0.35745570063591003, + "learning_rate": 4.993903900676977e-05, + "loss": 0.2239, + "mean_token_accuracy": 0.9514999985694885, + "num_tokens": 651085.0, + "step": 296 + }, + { + "epoch": 0.0024549715239835014, + "grad_norm": 0.4034227728843689, + "learning_rate": 4.993883235933509e-05, + "loss": 0.3067, + "mean_token_accuracy": 0.9388942718505859, + "num_tokens": 653153.0, + "step": 297 + }, + { + "epoch": 0.002463237421370651, + "grad_norm": 0.40081143379211426, + "learning_rate": 4.993862571190042e-05, + "loss": 0.23, + "mean_token_accuracy": 0.9531639218330383, + "num_tokens": 655166.0, + "step": 298 + }, + { + "epoch": 0.002471503318757801, + "grad_norm": 0.3677947223186493, + "learning_rate": 4.9938419064465734e-05, + "loss": 0.1783, + "mean_token_accuracy": 0.9605063199996948, + "num_tokens": 657147.0, + "step": 299 + }, + { + "epoch": 0.0024797692161449506, + "grad_norm": 0.3393653333187103, + "learning_rate": 4.9938212417031056e-05, + "loss": 0.1867, + "mean_token_accuracy": 0.9632652997970581, + "num_tokens": 659113.0, + "step": 300 + }, + { + "epoch": 0.002488035113532101, + "grad_norm": 0.41311779618263245, + "learning_rate": 4.993800576959638e-05, + "loss": 0.2167, + "mean_token_accuracy": 0.9567594528198242, + "num_tokens": 661131.0, + "step": 301 + }, + { + "epoch": 0.0024963010109192506, + "grad_norm": 0.3797242343425751, + "learning_rate": 4.99377991221617e-05, + "loss": 0.2078, + "mean_token_accuracy": 0.9559118151664734, + "num_tokens": 663133.0, + "step": 302 + }, + { + "epoch": 0.0025045669083064003, + "grad_norm": 0.44771602749824524, + "learning_rate": 4.993759247472702e-05, + "loss": 0.2621, + "mean_token_accuracy": 0.949127197265625, + "num_tokens": 665144.0, + "step": 303 + }, + { + "epoch": 0.00251283280569355, + "grad_norm": 0.33966875076293945, + "learning_rate": 4.993738582729234e-05, + "loss": 0.2111, + "mean_token_accuracy": 0.9543842077255249, + "num_tokens": 667123.0, + "step": 304 + }, + { + "epoch": 0.0025210987030807, + "grad_norm": 0.314005583524704, + "learning_rate": 4.9937179179857664e-05, + "loss": 0.1743, + "mean_token_accuracy": 0.9641393423080444, + "num_tokens": 669081.0, + "step": 305 + }, + { + "epoch": 0.0025293646004678496, + "grad_norm": 0.5659259557723999, + "learning_rate": 4.9936972532422986e-05, + "loss": 0.2362, + "mean_token_accuracy": 0.9511088728904724, + "num_tokens": 671071.0, + "step": 306 + }, + { + "epoch": 0.0025376304978549998, + "grad_norm": 0.3476862609386444, + "learning_rate": 4.993676588498831e-05, + "loss": 0.1537, + "mean_token_accuracy": 0.9676578044891357, + "num_tokens": 672994.0, + "step": 307 + }, + { + "epoch": 0.0025458963952421495, + "grad_norm": 0.45339474081993103, + "learning_rate": 4.993655923755363e-05, + "loss": 0.2449, + "mean_token_accuracy": 0.9519087672233582, + "num_tokens": 675017.0, + "step": 308 + }, + { + "epoch": 0.0025541622926292993, + "grad_norm": 0.3326128423213959, + "learning_rate": 4.993635259011895e-05, + "loss": 0.2103, + "mean_token_accuracy": 0.9533730149269104, + "num_tokens": 677039.0, + "step": 309 + }, + { + "epoch": 0.002562428190016449, + "grad_norm": 0.38087713718414307, + "learning_rate": 4.993614594268427e-05, + "loss": 0.1822, + "mean_token_accuracy": 0.9575328826904297, + "num_tokens": 679023.0, + "step": 310 + }, + { + "epoch": 0.002570694087403599, + "grad_norm": 0.41911280155181885, + "learning_rate": 4.993593929524959e-05, + "loss": 0.2534, + "mean_token_accuracy": 0.9478908181190491, + "num_tokens": 681044.0, + "step": 311 + }, + { + "epoch": 0.002578959984790749, + "grad_norm": 0.3845995366573334, + "learning_rate": 4.9935732647814916e-05, + "loss": 0.2271, + "mean_token_accuracy": 0.9553571343421936, + "num_tokens": 683066.0, + "step": 312 + }, + { + "epoch": 0.0025872258821778987, + "grad_norm": 0.4912784695625305, + "learning_rate": 4.993552600038023e-05, + "loss": 0.2081, + "mean_token_accuracy": 0.9535232186317444, + "num_tokens": 685073.0, + "step": 313 + }, + { + "epoch": 0.0025954917795650485, + "grad_norm": 0.35172325372695923, + "learning_rate": 4.993531935294555e-05, + "loss": 0.2089, + "mean_token_accuracy": 0.9572989344596863, + "num_tokens": 687093.0, + "step": 314 + }, + { + "epoch": 0.0026037576769521982, + "grad_norm": 0.35449934005737305, + "learning_rate": 4.993511270551088e-05, + "loss": 0.2002, + "mean_token_accuracy": 0.9577039480209351, + "num_tokens": 689085.0, + "step": 315 + }, + { + "epoch": 0.002612023574339348, + "grad_norm": 0.34856724739074707, + "learning_rate": 4.9934906058076196e-05, + "loss": 0.1863, + "mean_token_accuracy": 0.9597585797309875, + "num_tokens": 691079.0, + "step": 316 + }, + { + "epoch": 0.002620289471726498, + "grad_norm": 0.39429017901420593, + "learning_rate": 4.993469941064152e-05, + "loss": 0.264, + "mean_token_accuracy": 0.9471865892410278, + "num_tokens": 693111.0, + "step": 317 + }, + { + "epoch": 0.002628555369113648, + "grad_norm": 0.38967621326446533, + "learning_rate": 4.993449276320684e-05, + "loss": 0.2103, + "mean_token_accuracy": 0.9556227922439575, + "num_tokens": 695100.0, + "step": 318 + }, + { + "epoch": 0.0026368212665007977, + "grad_norm": 0.42454391717910767, + "learning_rate": 4.993428611577216e-05, + "loss": 0.2458, + "mean_token_accuracy": 0.9503759145736694, + "num_tokens": 697101.0, + "step": 319 + }, + { + "epoch": 0.0026450871638879474, + "grad_norm": 0.43203118443489075, + "learning_rate": 4.993407946833748e-05, + "loss": 0.209, + "mean_token_accuracy": 0.9589794874191284, + "num_tokens": 699106.0, + "step": 320 + }, + { + "epoch": 0.002653353061275097, + "grad_norm": 0.2782335877418518, + "learning_rate": 4.9933872820902804e-05, + "loss": 0.1457, + "mean_token_accuracy": 0.9726239442825317, + "num_tokens": 701048.0, + "step": 321 + }, + { + "epoch": 0.002661618958662247, + "grad_norm": 0.34580934047698975, + "learning_rate": 4.9933666173468126e-05, + "loss": 0.1517, + "mean_token_accuracy": 0.9663212299346924, + "num_tokens": 702984.0, + "step": 322 + }, + { + "epoch": 0.002669884856049397, + "grad_norm": 0.3792515695095062, + "learning_rate": 4.993345952603344e-05, + "loss": 0.1996, + "mean_token_accuracy": 0.9585207104682922, + "num_tokens": 704991.0, + "step": 323 + }, + { + "epoch": 0.002678150753436547, + "grad_norm": 0.4265529215335846, + "learning_rate": 4.993325287859877e-05, + "loss": 0.1854, + "mean_token_accuracy": 0.9631336331367493, + "num_tokens": 706950.0, + "step": 324 + }, + { + "epoch": 0.0026864166508236966, + "grad_norm": 0.36660078167915344, + "learning_rate": 4.993304623116409e-05, + "loss": 0.2067, + "mean_token_accuracy": 0.9601211547851562, + "num_tokens": 708937.0, + "step": 325 + }, + { + "epoch": 0.0026946825482108464, + "grad_norm": 0.4065447747707367, + "learning_rate": 4.993283958372941e-05, + "loss": 0.1888, + "mean_token_accuracy": 0.9626216292381287, + "num_tokens": 710896.0, + "step": 326 + }, + { + "epoch": 0.002702948445597996, + "grad_norm": 0.29612088203430176, + "learning_rate": 4.9932632936294734e-05, + "loss": 0.1354, + "mean_token_accuracy": 0.9708439707756042, + "num_tokens": 712857.0, + "step": 327 + }, + { + "epoch": 0.0027112143429851463, + "grad_norm": 0.3609902560710907, + "learning_rate": 4.993242628886005e-05, + "loss": 0.1816, + "mean_token_accuracy": 0.960774302482605, + "num_tokens": 714826.0, + "step": 328 + }, + { + "epoch": 0.002719480240372296, + "grad_norm": 0.4500750005245209, + "learning_rate": 4.993221964142538e-05, + "loss": 0.2144, + "mean_token_accuracy": 0.9514798521995544, + "num_tokens": 716893.0, + "step": 329 + }, + { + "epoch": 0.002727746137759446, + "grad_norm": 0.416002094745636, + "learning_rate": 4.99320129939907e-05, + "loss": 0.2419, + "mean_token_accuracy": 0.9465424418449402, + "num_tokens": 718938.0, + "step": 330 + }, + { + "epoch": 0.0027360120351465956, + "grad_norm": 0.396006315946579, + "learning_rate": 4.9931806346556014e-05, + "loss": 0.2139, + "mean_token_accuracy": 0.9553660750389099, + "num_tokens": 720938.0, + "step": 331 + }, + { + "epoch": 0.0027442779325337454, + "grad_norm": 0.4281254708766937, + "learning_rate": 4.993159969912134e-05, + "loss": 0.2475, + "mean_token_accuracy": 0.9524975419044495, + "num_tokens": 722986.0, + "step": 332 + }, + { + "epoch": 0.0027525438299208956, + "grad_norm": 0.4296991229057312, + "learning_rate": 4.993139305168666e-05, + "loss": 0.2036, + "mean_token_accuracy": 0.9571356773376465, + "num_tokens": 724975.0, + "step": 333 + }, + { + "epoch": 0.0027608097273080453, + "grad_norm": 0.41935306787490845, + "learning_rate": 4.993118640425198e-05, + "loss": 0.2116, + "mean_token_accuracy": 0.9563894271850586, + "num_tokens": 726953.0, + "step": 334 + }, + { + "epoch": 0.002769075624695195, + "grad_norm": 0.3584057092666626, + "learning_rate": 4.99309797568173e-05, + "loss": 0.1853, + "mean_token_accuracy": 0.9592252969741821, + "num_tokens": 728921.0, + "step": 335 + }, + { + "epoch": 0.002777341522082345, + "grad_norm": 0.4146767258644104, + "learning_rate": 4.993077310938262e-05, + "loss": 0.2196, + "mean_token_accuracy": 0.9568308591842651, + "num_tokens": 730896.0, + "step": 336 + }, + { + "epoch": 0.0027856074194694946, + "grad_norm": 0.3676367998123169, + "learning_rate": 4.9930566461947944e-05, + "loss": 0.1915, + "mean_token_accuracy": 0.9622736573219299, + "num_tokens": 732890.0, + "step": 337 + }, + { + "epoch": 0.0027938733168566448, + "grad_norm": 0.41326549649238586, + "learning_rate": 4.9930359814513265e-05, + "loss": 0.2046, + "mean_token_accuracy": 0.9549999833106995, + "num_tokens": 734896.0, + "step": 338 + }, + { + "epoch": 0.0028021392142437945, + "grad_norm": 0.4531644880771637, + "learning_rate": 4.993015316707859e-05, + "loss": 0.2445, + "mean_token_accuracy": 0.9481589198112488, + "num_tokens": 736966.0, + "step": 339 + }, + { + "epoch": 0.0028104051116309443, + "grad_norm": 0.38033097982406616, + "learning_rate": 4.992994651964391e-05, + "loss": 0.2096, + "mean_token_accuracy": 0.9564564824104309, + "num_tokens": 738970.0, + "step": 340 + }, + { + "epoch": 0.002818671009018094, + "grad_norm": 0.5736963152885437, + "learning_rate": 4.992973987220923e-05, + "loss": 0.32, + "mean_token_accuracy": 0.9341723322868347, + "num_tokens": 741042.0, + "step": 341 + }, + { + "epoch": 0.0028269369064052438, + "grad_norm": 0.44328004121780396, + "learning_rate": 4.992953322477455e-05, + "loss": 0.2257, + "mean_token_accuracy": 0.950470507144928, + "num_tokens": 743067.0, + "step": 342 + }, + { + "epoch": 0.0028352028037923935, + "grad_norm": 0.36262065172195435, + "learning_rate": 4.992932657733987e-05, + "loss": 0.2283, + "mean_token_accuracy": 0.9575848579406738, + "num_tokens": 745077.0, + "step": 343 + }, + { + "epoch": 0.0028434687011795437, + "grad_norm": 0.3923065960407257, + "learning_rate": 4.9929119929905195e-05, + "loss": 0.2119, + "mean_token_accuracy": 0.9602015018463135, + "num_tokens": 747068.0, + "step": 344 + }, + { + "epoch": 0.0028517345985666935, + "grad_norm": 0.5067260265350342, + "learning_rate": 4.992891328247051e-05, + "loss": 0.2586, + "mean_token_accuracy": 0.945919394493103, + "num_tokens": 749108.0, + "step": 345 + }, + { + "epoch": 0.0028600004959538432, + "grad_norm": 0.40983039140701294, + "learning_rate": 4.992870663503583e-05, + "loss": 0.2041, + "mean_token_accuracy": 0.9590080976486206, + "num_tokens": 751090.0, + "step": 346 + }, + { + "epoch": 0.002868266393340993, + "grad_norm": 0.4184195399284363, + "learning_rate": 4.992849998760116e-05, + "loss": 0.264, + "mean_token_accuracy": 0.948483407497406, + "num_tokens": 753173.0, + "step": 347 + }, + { + "epoch": 0.0028765322907281427, + "grad_norm": 0.4780874252319336, + "learning_rate": 4.9928293340166475e-05, + "loss": 0.2839, + "mean_token_accuracy": 0.9410637021064758, + "num_tokens": 755266.0, + "step": 348 + }, + { + "epoch": 0.002884798188115293, + "grad_norm": 0.3527054786682129, + "learning_rate": 4.9928086692731804e-05, + "loss": 0.2064, + "mean_token_accuracy": 0.9580808281898499, + "num_tokens": 757252.0, + "step": 349 + }, + { + "epoch": 0.0028930640855024427, + "grad_norm": 0.4469713270664215, + "learning_rate": 4.992788004529712e-05, + "loss": 0.3162, + "mean_token_accuracy": 0.9341232180595398, + "num_tokens": 759368.0, + "step": 350 + }, + { + "epoch": 0.0029013299828895924, + "grad_norm": 0.39907026290893555, + "learning_rate": 4.992767339786244e-05, + "loss": 0.2265, + "mean_token_accuracy": 0.9537920355796814, + "num_tokens": 761365.0, + "step": 351 + }, + { + "epoch": 0.002909595880276742, + "grad_norm": 0.34887832403182983, + "learning_rate": 4.992746675042776e-05, + "loss": 0.2377, + "mean_token_accuracy": 0.9492682814598083, + "num_tokens": 763421.0, + "step": 352 + }, + { + "epoch": 0.002917861777663892, + "grad_norm": 0.4177617132663727, + "learning_rate": 4.9927260102993083e-05, + "loss": 0.2459, + "mean_token_accuracy": 0.9459459185600281, + "num_tokens": 765462.0, + "step": 353 + }, + { + "epoch": 0.002926127675051042, + "grad_norm": 0.38036975264549255, + "learning_rate": 4.9927053455558405e-05, + "loss": 0.2166, + "mean_token_accuracy": 0.957121729850769, + "num_tokens": 767497.0, + "step": 354 + }, + { + "epoch": 0.002934393572438192, + "grad_norm": 0.3349733352661133, + "learning_rate": 4.992684680812373e-05, + "loss": 0.1878, + "mean_token_accuracy": 0.9640688300132751, + "num_tokens": 769479.0, + "step": 355 + }, + { + "epoch": 0.0029426594698253416, + "grad_norm": 0.4739646911621094, + "learning_rate": 4.992664016068905e-05, + "loss": 0.2587, + "mean_token_accuracy": 0.9436893463134766, + "num_tokens": 771545.0, + "step": 356 + }, + { + "epoch": 0.0029509253672124914, + "grad_norm": 0.3559514582157135, + "learning_rate": 4.992643351325437e-05, + "loss": 0.1915, + "mean_token_accuracy": 0.9610655903816223, + "num_tokens": 773503.0, + "step": 357 + }, + { + "epoch": 0.002959191264599641, + "grad_norm": 0.4058264195919037, + "learning_rate": 4.992622686581969e-05, + "loss": 0.2615, + "mean_token_accuracy": 0.9463152885437012, + "num_tokens": 775558.0, + "step": 358 + }, + { + "epoch": 0.002967457161986791, + "grad_norm": 0.39049819111824036, + "learning_rate": 4.9926020218385013e-05, + "loss": 0.2534, + "mean_token_accuracy": 0.9458927512168884, + "num_tokens": 777597.0, + "step": 359 + }, + { + "epoch": 0.002975723059373941, + "grad_norm": 0.4811549782752991, + "learning_rate": 4.992581357095033e-05, + "loss": 0.2993, + "mean_token_accuracy": 0.9370155334472656, + "num_tokens": 779667.0, + "step": 360 + }, + { + "epoch": 0.002983988956761091, + "grad_norm": 0.3548329174518585, + "learning_rate": 4.992560692351566e-05, + "loss": 0.1986, + "mean_token_accuracy": 0.9604802131652832, + "num_tokens": 781672.0, + "step": 361 + }, + { + "epoch": 0.0029922548541482406, + "grad_norm": 0.5780093669891357, + "learning_rate": 4.992540027608097e-05, + "loss": 0.2916, + "mean_token_accuracy": 0.9366230964660645, + "num_tokens": 783745.0, + "step": 362 + }, + { + "epoch": 0.0030005207515353904, + "grad_norm": 0.45139673352241516, + "learning_rate": 4.992519362864629e-05, + "loss": 0.2687, + "mean_token_accuracy": 0.9430102109909058, + "num_tokens": 785804.0, + "step": 363 + }, + { + "epoch": 0.00300878664892254, + "grad_norm": 0.4197750687599182, + "learning_rate": 4.992498698121162e-05, + "loss": 0.1919, + "mean_token_accuracy": 0.9562374353408813, + "num_tokens": 787798.0, + "step": 364 + }, + { + "epoch": 0.0030170525463096903, + "grad_norm": 0.4055244028568268, + "learning_rate": 4.9924780333776937e-05, + "loss": 0.2207, + "mean_token_accuracy": 0.9598997235298157, + "num_tokens": 789799.0, + "step": 365 + }, + { + "epoch": 0.00302531844369684, + "grad_norm": 0.4178362786769867, + "learning_rate": 4.992457368634226e-05, + "loss": 0.2215, + "mean_token_accuracy": 0.9520782232284546, + "num_tokens": 791850.0, + "step": 366 + }, + { + "epoch": 0.00303358434108399, + "grad_norm": 0.3683435320854187, + "learning_rate": 4.992436703890758e-05, + "loss": 0.1526, + "mean_token_accuracy": 0.9724675416946411, + "num_tokens": 793781.0, + "step": 367 + }, + { + "epoch": 0.0030418502384711396, + "grad_norm": 0.4005066454410553, + "learning_rate": 4.99241603914729e-05, + "loss": 0.162, + "mean_token_accuracy": 0.9660843014717102, + "num_tokens": 795733.0, + "step": 368 + }, + { + "epoch": 0.0030501161358582893, + "grad_norm": 0.3928993344306946, + "learning_rate": 4.992395374403822e-05, + "loss": 0.1892, + "mean_token_accuracy": 0.9575971961021423, + "num_tokens": 797720.0, + "step": 369 + }, + { + "epoch": 0.0030583820332454395, + "grad_norm": 0.3924673795700073, + "learning_rate": 4.9923747096603545e-05, + "loss": 0.155, + "mean_token_accuracy": 0.9669762849807739, + "num_tokens": 799664.0, + "step": 370 + }, + { + "epoch": 0.0030666479306325893, + "grad_norm": 0.41587457060813904, + "learning_rate": 4.9923540449168867e-05, + "loss": 0.1917, + "mean_token_accuracy": 0.9566301107406616, + "num_tokens": 801676.0, + "step": 371 + }, + { + "epoch": 0.003074913828019739, + "grad_norm": 0.42865025997161865, + "learning_rate": 4.992333380173419e-05, + "loss": 0.2885, + "mean_token_accuracy": 0.9363548755645752, + "num_tokens": 803756.0, + "step": 372 + }, + { + "epoch": 0.0030831797254068888, + "grad_norm": 0.4900335669517517, + "learning_rate": 4.992312715429951e-05, + "loss": 0.2366, + "mean_token_accuracy": 0.9501991868019104, + "num_tokens": 805770.0, + "step": 373 + }, + { + "epoch": 0.0030914456227940385, + "grad_norm": 0.5078573822975159, + "learning_rate": 4.992292050686483e-05, + "loss": 0.2046, + "mean_token_accuracy": 0.9584569931030273, + "num_tokens": 807798.0, + "step": 374 + }, + { + "epoch": 0.0030997115201811883, + "grad_norm": 0.37238258123397827, + "learning_rate": 4.992271385943015e-05, + "loss": 0.1896, + "mean_token_accuracy": 0.9603255391120911, + "num_tokens": 809770.0, + "step": 375 + }, + { + "epoch": 0.0031079774175683385, + "grad_norm": 0.45555543899536133, + "learning_rate": 4.9922507211995475e-05, + "loss": 0.2647, + "mean_token_accuracy": 0.949575662612915, + "num_tokens": 811779.0, + "step": 376 + }, + { + "epoch": 0.003116243314955488, + "grad_norm": 0.4149267077445984, + "learning_rate": 4.992230056456079e-05, + "loss": 0.2135, + "mean_token_accuracy": 0.9515655636787415, + "num_tokens": 813829.0, + "step": 377 + }, + { + "epoch": 0.003124509212342638, + "grad_norm": 0.4098355174064636, + "learning_rate": 4.992209391712612e-05, + "loss": 0.2225, + "mean_token_accuracy": 0.9564999938011169, + "num_tokens": 815835.0, + "step": 378 + }, + { + "epoch": 0.0031327751097297877, + "grad_norm": 0.44163843989372253, + "learning_rate": 4.992188726969143e-05, + "loss": 0.2849, + "mean_token_accuracy": 0.9403491616249084, + "num_tokens": 817903.0, + "step": 379 + }, + { + "epoch": 0.0031410410071169375, + "grad_norm": 0.3630768954753876, + "learning_rate": 4.9921680622256755e-05, + "loss": 0.2012, + "mean_token_accuracy": 0.9573721289634705, + "num_tokens": 819903.0, + "step": 380 + }, + { + "epoch": 0.0031493069045040877, + "grad_norm": 0.3289450407028198, + "learning_rate": 4.992147397482208e-05, + "loss": 0.1551, + "mean_token_accuracy": 0.9648760557174683, + "num_tokens": 821845.0, + "step": 381 + }, + { + "epoch": 0.0031575728018912374, + "grad_norm": 0.3904035687446594, + "learning_rate": 4.99212673273874e-05, + "loss": 0.1955, + "mean_token_accuracy": 0.9593082666397095, + "num_tokens": 823817.0, + "step": 382 + }, + { + "epoch": 0.003165838699278387, + "grad_norm": 0.36014196276664734, + "learning_rate": 4.992106067995272e-05, + "loss": 0.264, + "mean_token_accuracy": 0.9508116245269775, + "num_tokens": 825856.0, + "step": 383 + }, + { + "epoch": 0.003174104596665537, + "grad_norm": 0.3443008363246918, + "learning_rate": 4.992085403251804e-05, + "loss": 0.1814, + "mean_token_accuracy": 0.9601413011550903, + "num_tokens": 827844.0, + "step": 384 + }, + { + "epoch": 0.0031823704940526867, + "grad_norm": 0.4116482734680176, + "learning_rate": 4.992064738508336e-05, + "loss": 0.217, + "mean_token_accuracy": 0.9594663977622986, + "num_tokens": 829799.0, + "step": 385 + }, + { + "epoch": 0.003190636391439837, + "grad_norm": 0.5228381156921387, + "learning_rate": 4.9920440737648685e-05, + "loss": 0.2936, + "mean_token_accuracy": 0.9364467859268188, + "num_tokens": 831882.0, + "step": 386 + }, + { + "epoch": 0.0031989022888269866, + "grad_norm": 0.40949776768684387, + "learning_rate": 4.9920234090214006e-05, + "loss": 0.1998, + "mean_token_accuracy": 0.9591419696807861, + "num_tokens": 833846.0, + "step": 387 + }, + { + "epoch": 0.0032071681862141364, + "grad_norm": 0.4674682915210724, + "learning_rate": 4.992002744277933e-05, + "loss": 0.1669, + "mean_token_accuracy": 0.9629057049751282, + "num_tokens": 835793.0, + "step": 388 + }, + { + "epoch": 0.003215434083601286, + "grad_norm": 0.3216884434223175, + "learning_rate": 4.991982079534465e-05, + "loss": 0.1985, + "mean_token_accuracy": 0.960606038570404, + "num_tokens": 837779.0, + "step": 389 + }, + { + "epoch": 0.003223699980988436, + "grad_norm": 0.37692657113075256, + "learning_rate": 4.991961414790997e-05, + "loss": 0.2112, + "mean_token_accuracy": 0.9524752497673035, + "num_tokens": 839805.0, + "step": 390 + }, + { + "epoch": 0.0032319658783755856, + "grad_norm": 0.38113531470298767, + "learning_rate": 4.991940750047529e-05, + "loss": 0.2331, + "mean_token_accuracy": 0.9517478942871094, + "num_tokens": 841842.0, + "step": 391 + }, + { + "epoch": 0.003240231775762736, + "grad_norm": 0.4439680874347687, + "learning_rate": 4.9919200853040615e-05, + "loss": 0.3131, + "mean_token_accuracy": 0.9396508932113647, + "num_tokens": 843853.0, + "step": 392 + }, + { + "epoch": 0.0032484976731498856, + "grad_norm": 0.33021825551986694, + "learning_rate": 4.9918994205605936e-05, + "loss": 0.21, + "mean_token_accuracy": 0.9591429829597473, + "num_tokens": 845866.0, + "step": 393 + }, + { + "epoch": 0.0032567635705370353, + "grad_norm": 0.4424145221710205, + "learning_rate": 4.991878755817125e-05, + "loss": 0.3097, + "mean_token_accuracy": 0.9398350119590759, + "num_tokens": 847933.0, + "step": 394 + }, + { + "epoch": 0.003265029467924185, + "grad_norm": 0.3730950355529785, + "learning_rate": 4.991858091073658e-05, + "loss": 0.2081, + "mean_token_accuracy": 0.9553884863853455, + "num_tokens": 849934.0, + "step": 395 + }, + { + "epoch": 0.003273295365311335, + "grad_norm": 0.4788861870765686, + "learning_rate": 4.99183742633019e-05, + "loss": 0.2004, + "mean_token_accuracy": 0.9563275575637817, + "num_tokens": 851955.0, + "step": 396 + }, + { + "epoch": 0.003281561262698485, + "grad_norm": 0.4064439833164215, + "learning_rate": 4.9918167615867216e-05, + "loss": 0.2142, + "mean_token_accuracy": 0.9543424248695374, + "num_tokens": 853976.0, + "step": 397 + }, + { + "epoch": 0.003289827160085635, + "grad_norm": 0.41253840923309326, + "learning_rate": 4.9917960968432544e-05, + "loss": 0.2113, + "mean_token_accuracy": 0.9553752541542053, + "num_tokens": 855954.0, + "step": 398 + }, + { + "epoch": 0.0032980930574727845, + "grad_norm": 0.36155927181243896, + "learning_rate": 4.991775432099786e-05, + "loss": 0.1681, + "mean_token_accuracy": 0.9655703902244568, + "num_tokens": 857906.0, + "step": 399 + }, + { + "epoch": 0.0033063589548599343, + "grad_norm": 0.36993175745010376, + "learning_rate": 4.991754767356318e-05, + "loss": 0.2004, + "mean_token_accuracy": 0.9560161828994751, + "num_tokens": 859890.0, + "step": 400 + }, + { + "epoch": 0.003314624852247084, + "grad_norm": 0.7902066111564636, + "learning_rate": 4.99173410261285e-05, + "loss": 0.3206, + "mean_token_accuracy": 0.9354990720748901, + "num_tokens": 862020.0, + "step": 401 + }, + { + "epoch": 0.0033228907496342342, + "grad_norm": 0.4118296205997467, + "learning_rate": 4.9917134378693824e-05, + "loss": 0.2645, + "mean_token_accuracy": 0.9444990158081055, + "num_tokens": 864062.0, + "step": 402 + }, + { + "epoch": 0.003331156647021384, + "grad_norm": 0.41594621539115906, + "learning_rate": 4.9916927731259146e-05, + "loss": 0.1843, + "mean_token_accuracy": 0.9603612422943115, + "num_tokens": 866061.0, + "step": 403 + }, + { + "epoch": 0.0033394225444085338, + "grad_norm": 0.35747259855270386, + "learning_rate": 4.991672108382447e-05, + "loss": 0.1876, + "mean_token_accuracy": 0.962051272392273, + "num_tokens": 868017.0, + "step": 404 + }, + { + "epoch": 0.0033476884417956835, + "grad_norm": 0.38307011127471924, + "learning_rate": 4.991651443638979e-05, + "loss": 0.1546, + "mean_token_accuracy": 0.9671052694320679, + "num_tokens": 869999.0, + "step": 405 + }, + { + "epoch": 0.0033559543391828333, + "grad_norm": 0.37060555815696716, + "learning_rate": 4.991630778895511e-05, + "loss": 0.2177, + "mean_token_accuracy": 0.9546574950218201, + "num_tokens": 872034.0, + "step": 406 + }, + { + "epoch": 0.003364220236569983, + "grad_norm": 0.3875426650047302, + "learning_rate": 4.991610114152043e-05, + "loss": 0.2074, + "mean_token_accuracy": 0.9561971426010132, + "num_tokens": 874049.0, + "step": 407 + }, + { + "epoch": 0.003372486133957133, + "grad_norm": 0.3926350176334381, + "learning_rate": 4.9915894494085754e-05, + "loss": 0.1887, + "mean_token_accuracy": 0.959857702255249, + "num_tokens": 876023.0, + "step": 408 + }, + { + "epoch": 0.003380752031344283, + "grad_norm": 0.5841166973114014, + "learning_rate": 4.991568784665107e-05, + "loss": 0.2199, + "mean_token_accuracy": 0.9575757384300232, + "num_tokens": 878009.0, + "step": 409 + }, + { + "epoch": 0.0033890179287314327, + "grad_norm": 0.29495862126350403, + "learning_rate": 4.99154811992164e-05, + "loss": 0.1524, + "mean_token_accuracy": 0.9695248007774353, + "num_tokens": 879951.0, + "step": 410 + }, + { + "epoch": 0.0033972838261185825, + "grad_norm": 0.3995298743247986, + "learning_rate": 4.991527455178171e-05, + "loss": 0.2155, + "mean_token_accuracy": 0.9552238583564758, + "num_tokens": 881967.0, + "step": 411 + }, + { + "epoch": 0.0034055497235057322, + "grad_norm": 0.39600613713264465, + "learning_rate": 4.991506790434704e-05, + "loss": 0.2027, + "mean_token_accuracy": 0.9567404389381409, + "num_tokens": 883961.0, + "step": 412 + }, + { + "epoch": 0.0034138156208928824, + "grad_norm": 0.4439043700695038, + "learning_rate": 4.991486125691236e-05, + "loss": 0.1865, + "mean_token_accuracy": 0.962063729763031, + "num_tokens": 885944.0, + "step": 413 + }, + { + "epoch": 0.003422081518280032, + "grad_norm": 0.45049723982810974, + "learning_rate": 4.991465460947768e-05, + "loss": 0.2465, + "mean_token_accuracy": 0.9426934123039246, + "num_tokens": 888044.0, + "step": 414 + }, + { + "epoch": 0.003430347415667182, + "grad_norm": 0.33216142654418945, + "learning_rate": 4.9914447962043006e-05, + "loss": 0.1911, + "mean_token_accuracy": 0.9613648056983948, + "num_tokens": 890043.0, + "step": 415 + }, + { + "epoch": 0.0034386133130543317, + "grad_norm": 0.3986356258392334, + "learning_rate": 4.991424131460832e-05, + "loss": 0.1857, + "mean_token_accuracy": 0.9615573883056641, + "num_tokens": 892078.0, + "step": 416 + }, + { + "epoch": 0.0034468792104414814, + "grad_norm": 0.4196581542491913, + "learning_rate": 4.991403466717364e-05, + "loss": 0.2547, + "mean_token_accuracy": 0.9481813907623291, + "num_tokens": 894091.0, + "step": 417 + }, + { + "epoch": 0.0034551451078286316, + "grad_norm": 0.43260493874549866, + "learning_rate": 4.9913828019738964e-05, + "loss": 0.2203, + "mean_token_accuracy": 0.9589322209358215, + "num_tokens": 896045.0, + "step": 418 + }, + { + "epoch": 0.0034634110052157814, + "grad_norm": 0.352995365858078, + "learning_rate": 4.9913621372304286e-05, + "loss": 0.1628, + "mean_token_accuracy": 0.9689440727233887, + "num_tokens": 897983.0, + "step": 419 + }, + { + "epoch": 0.003471676902602931, + "grad_norm": 0.4919193387031555, + "learning_rate": 4.991341472486961e-05, + "loss": 0.2599, + "mean_token_accuracy": 0.9484337568283081, + "num_tokens": 900064.0, + "step": 420 + }, + { + "epoch": 0.003479942799990081, + "grad_norm": 0.37560829520225525, + "learning_rate": 4.991320807743493e-05, + "loss": 0.1983, + "mean_token_accuracy": 0.9549281597137451, + "num_tokens": 902089.0, + "step": 421 + }, + { + "epoch": 0.0034882086973772306, + "grad_norm": 0.37490546703338623, + "learning_rate": 4.991300143000025e-05, + "loss": 0.191, + "mean_token_accuracy": 0.9587525129318237, + "num_tokens": 904083.0, + "step": 422 + }, + { + "epoch": 0.0034964745947643804, + "grad_norm": 0.3598591685295105, + "learning_rate": 4.991279478256557e-05, + "loss": 0.2153, + "mean_token_accuracy": 0.9576482176780701, + "num_tokens": 906096.0, + "step": 423 + }, + { + "epoch": 0.0035047404921515306, + "grad_norm": 0.4452194273471832, + "learning_rate": 4.9912588135130894e-05, + "loss": 0.2417, + "mean_token_accuracy": 0.9560276865959167, + "num_tokens": 908126.0, + "step": 424 + }, + { + "epoch": 0.0035130063895386803, + "grad_norm": 0.3407069444656372, + "learning_rate": 4.9912381487696216e-05, + "loss": 0.1722, + "mean_token_accuracy": 0.9696816802024841, + "num_tokens": 910111.0, + "step": 425 + }, + { + "epoch": 0.00352127228692583, + "grad_norm": 0.2964221239089966, + "learning_rate": 4.991217484026153e-05, + "loss": 0.1468, + "mean_token_accuracy": 0.9682619571685791, + "num_tokens": 912102.0, + "step": 426 + }, + { + "epoch": 0.00352953818431298, + "grad_norm": 0.44236114621162415, + "learning_rate": 4.991196819282686e-05, + "loss": 0.236, + "mean_token_accuracy": 0.951884925365448, + "num_tokens": 914124.0, + "step": 427 + }, + { + "epoch": 0.0035378040817001296, + "grad_norm": 0.44241392612457275, + "learning_rate": 4.9911761545392174e-05, + "loss": 0.2342, + "mean_token_accuracy": 0.9520479440689087, + "num_tokens": 916132.0, + "step": 428 + }, + { + "epoch": 0.00354606997908728, + "grad_norm": 0.44964122772216797, + "learning_rate": 4.9911554897957496e-05, + "loss": 0.2244, + "mean_token_accuracy": 0.9514129757881165, + "num_tokens": 918155.0, + "step": 429 + }, + { + "epoch": 0.0035543358764744295, + "grad_norm": 0.4190461039543152, + "learning_rate": 4.9911348250522824e-05, + "loss": 0.1753, + "mean_token_accuracy": 0.9613478779792786, + "num_tokens": 920179.0, + "step": 430 + }, + { + "epoch": 0.0035626017738615793, + "grad_norm": 0.33894556760787964, + "learning_rate": 4.991114160308814e-05, + "loss": 0.2183, + "mean_token_accuracy": 0.9519563913345337, + "num_tokens": 922204.0, + "step": 431 + }, + { + "epoch": 0.003570867671248729, + "grad_norm": 0.40855875611305237, + "learning_rate": 4.991093495565347e-05, + "loss": 0.2215, + "mean_token_accuracy": 0.9560710787773132, + "num_tokens": 924236.0, + "step": 432 + }, + { + "epoch": 0.003579133568635879, + "grad_norm": 0.33665502071380615, + "learning_rate": 4.991072830821878e-05, + "loss": 0.159, + "mean_token_accuracy": 0.9615960121154785, + "num_tokens": 926247.0, + "step": 433 + }, + { + "epoch": 0.003587399466023029, + "grad_norm": 0.4639236330986023, + "learning_rate": 4.9910521660784104e-05, + "loss": 0.2001, + "mean_token_accuracy": 0.9574148058891296, + "num_tokens": 928249.0, + "step": 434 + }, + { + "epoch": 0.0035956653634101787, + "grad_norm": 0.33748435974121094, + "learning_rate": 4.991031501334943e-05, + "loss": 0.1833, + "mean_token_accuracy": 0.9631336331367493, + "num_tokens": 930208.0, + "step": 435 + }, + { + "epoch": 0.0036039312607973285, + "grad_norm": 0.3085154891014099, + "learning_rate": 4.991010836591475e-05, + "loss": 0.1397, + "mean_token_accuracy": 0.9710744023323059, + "num_tokens": 932150.0, + "step": 436 + }, + { + "epoch": 0.0036121971581844783, + "grad_norm": 0.31141841411590576, + "learning_rate": 4.990990171848007e-05, + "loss": 0.1502, + "mean_token_accuracy": 0.9713847637176514, + "num_tokens": 934113.0, + "step": 437 + }, + { + "epoch": 0.003620463055571628, + "grad_norm": 0.3119066655635834, + "learning_rate": 4.990969507104539e-05, + "loss": 0.1712, + "mean_token_accuracy": 0.9675257802009583, + "num_tokens": 936059.0, + "step": 438 + }, + { + "epoch": 0.0036287289529587778, + "grad_norm": 0.3771989643573761, + "learning_rate": 4.990948842361071e-05, + "loss": 0.2657, + "mean_token_accuracy": 0.9486803412437439, + "num_tokens": 938111.0, + "step": 439 + }, + { + "epoch": 0.003636994850345928, + "grad_norm": 0.39734941720962524, + "learning_rate": 4.9909281776176034e-05, + "loss": 0.1861, + "mean_token_accuracy": 0.9546574950218201, + "num_tokens": 940146.0, + "step": 440 + }, + { + "epoch": 0.0036452607477330777, + "grad_norm": 0.4957985281944275, + "learning_rate": 4.9909075128741355e-05, + "loss": 0.3424, + "mean_token_accuracy": 0.9304511547088623, + "num_tokens": 942280.0, + "step": 441 + }, + { + "epoch": 0.0036535266451202275, + "grad_norm": 0.4146612584590912, + "learning_rate": 4.990886848130668e-05, + "loss": 0.2766, + "mean_token_accuracy": 0.9470821022987366, + "num_tokens": 944308.0, + "step": 442 + }, + { + "epoch": 0.003661792542507377, + "grad_norm": 0.43134474754333496, + "learning_rate": 4.990866183387199e-05, + "loss": 0.2234, + "mean_token_accuracy": 0.9567404389381409, + "num_tokens": 946302.0, + "step": 443 + }, + { + "epoch": 0.003670058439894527, + "grad_norm": 0.3586181402206421, + "learning_rate": 4.990845518643732e-05, + "loss": 0.1804, + "mean_token_accuracy": 0.9633960127830505, + "num_tokens": 948275.0, + "step": 444 + }, + { + "epoch": 0.003678324337281677, + "grad_norm": 0.35363054275512695, + "learning_rate": 4.990824853900264e-05, + "loss": 0.1696, + "mean_token_accuracy": 0.965323805809021, + "num_tokens": 950242.0, + "step": 445 + }, + { + "epoch": 0.003686590234668827, + "grad_norm": 0.4113800823688507, + "learning_rate": 4.990804189156796e-05, + "loss": 0.2247, + "mean_token_accuracy": 0.9484536051750183, + "num_tokens": 952285.0, + "step": 446 + }, + { + "epoch": 0.0036948561320559767, + "grad_norm": 0.4207867383956909, + "learning_rate": 4.9907835244133285e-05, + "loss": 0.2419, + "mean_token_accuracy": 0.9496123790740967, + "num_tokens": 954355.0, + "step": 447 + }, + { + "epoch": 0.0037031220294431264, + "grad_norm": 0.4202803671360016, + "learning_rate": 4.99076285966986e-05, + "loss": 0.244, + "mean_token_accuracy": 0.9511221647262573, + "num_tokens": 956366.0, + "step": 448 + }, + { + "epoch": 0.003711387926830276, + "grad_norm": 0.4157666862010956, + "learning_rate": 4.990742194926392e-05, + "loss": 0.2257, + "mean_token_accuracy": 0.9516527056694031, + "num_tokens": 958399.0, + "step": 449 + }, + { + "epoch": 0.0037196538242174264, + "grad_norm": 0.41051551699638367, + "learning_rate": 4.9907215301829244e-05, + "loss": 0.1938, + "mean_token_accuracy": 0.9570707082748413, + "num_tokens": 960385.0, + "step": 450 + }, + { + "epoch": 0.003727919721604576, + "grad_norm": 0.395478755235672, + "learning_rate": 4.9907008654394565e-05, + "loss": 0.1661, + "mean_token_accuracy": 0.9637279510498047, + "num_tokens": 962376.0, + "step": 451 + }, + { + "epoch": 0.003736185618991726, + "grad_norm": 0.385276734828949, + "learning_rate": 4.9906802006959894e-05, + "loss": 0.2134, + "mean_token_accuracy": 0.9554675817489624, + "num_tokens": 964403.0, + "step": 452 + }, + { + "epoch": 0.0037444515163788756, + "grad_norm": 0.44546204805374146, + "learning_rate": 4.990659535952521e-05, + "loss": 0.1733, + "mean_token_accuracy": 0.9638988971710205, + "num_tokens": 966348.0, + "step": 453 + }, + { + "epoch": 0.0037527174137660254, + "grad_norm": 0.4484986662864685, + "learning_rate": 4.990638871209053e-05, + "loss": 0.172, + "mean_token_accuracy": 0.968008279800415, + "num_tokens": 968292.0, + "step": 454 + }, + { + "epoch": 0.003760983311153175, + "grad_norm": 0.37638169527053833, + "learning_rate": 4.990618206465585e-05, + "loss": 0.1986, + "mean_token_accuracy": 0.9592137336730957, + "num_tokens": 970333.0, + "step": 455 + }, + { + "epoch": 0.0037692492085403253, + "grad_norm": 0.4274209439754486, + "learning_rate": 4.9905975417221174e-05, + "loss": 0.2232, + "mean_token_accuracy": 0.9558312892913818, + "num_tokens": 972354.0, + "step": 456 + }, + { + "epoch": 0.003777515105927475, + "grad_norm": 0.32814547419548035, + "learning_rate": 4.9905768769786495e-05, + "loss": 0.1739, + "mean_token_accuracy": 0.9623304605484009, + "num_tokens": 974351.0, + "step": 457 + }, + { + "epoch": 0.003785781003314625, + "grad_norm": 0.3761850893497467, + "learning_rate": 4.990556212235182e-05, + "loss": 0.2242, + "mean_token_accuracy": 0.9508599638938904, + "num_tokens": 976392.0, + "step": 458 + }, + { + "epoch": 0.0037940469007017746, + "grad_norm": 0.32914650440216064, + "learning_rate": 4.990535547491714e-05, + "loss": 0.1801, + "mean_token_accuracy": 0.9625641107559204, + "num_tokens": 978348.0, + "step": 459 + }, + { + "epoch": 0.0038023127980889243, + "grad_norm": 0.43531864881515503, + "learning_rate": 4.990514882748245e-05, + "loss": 0.2171, + "mean_token_accuracy": 0.9565646648406982, + "num_tokens": 980380.0, + "step": 460 + }, + { + "epoch": 0.0038105786954760745, + "grad_norm": 0.4166911244392395, + "learning_rate": 4.990494218004778e-05, + "loss": 0.267, + "mean_token_accuracy": 0.9429124593734741, + "num_tokens": 982453.0, + "step": 461 + }, + { + "epoch": 0.0038188445928632243, + "grad_norm": 0.3695017397403717, + "learning_rate": 4.9904735532613103e-05, + "loss": 0.161, + "mean_token_accuracy": 0.9642309546470642, + "num_tokens": 984416.0, + "step": 462 + }, + { + "epoch": 0.003827110490250374, + "grad_norm": 0.34344106912612915, + "learning_rate": 4.990452888517842e-05, + "loss": 0.1761, + "mean_token_accuracy": 0.9605394601821899, + "num_tokens": 986424.0, + "step": 463 + }, + { + "epoch": 0.003835376387637524, + "grad_norm": 0.3933105766773224, + "learning_rate": 4.990432223774375e-05, + "loss": 0.218, + "mean_token_accuracy": 0.9563472270965576, + "num_tokens": 988423.0, + "step": 464 + }, + { + "epoch": 0.0038436422850246735, + "grad_norm": 0.3542276918888092, + "learning_rate": 4.990411559030906e-05, + "loss": 0.1719, + "mean_token_accuracy": 0.9633774161338806, + "num_tokens": 990395.0, + "step": 465 + }, + { + "epoch": 0.0038519081824118237, + "grad_norm": 0.450093150138855, + "learning_rate": 4.990390894287438e-05, + "loss": 0.1761, + "mean_token_accuracy": 0.9630753397941589, + "num_tokens": 992378.0, + "step": 466 + }, + { + "epoch": 0.0038601740797989735, + "grad_norm": 0.3510618507862091, + "learning_rate": 4.9903702295439705e-05, + "loss": 0.194, + "mean_token_accuracy": 0.9634332060813904, + "num_tokens": 994353.0, + "step": 467 + }, + { + "epoch": 0.0038684399771861232, + "grad_norm": 0.41123032569885254, + "learning_rate": 4.990349564800503e-05, + "loss": 0.2503, + "mean_token_accuracy": 0.9509803652763367, + "num_tokens": 996399.0, + "step": 468 + }, + { + "epoch": 0.003876705874573273, + "grad_norm": 0.43580517172813416, + "learning_rate": 4.990328900057035e-05, + "loss": 0.2306, + "mean_token_accuracy": 0.9522872567176819, + "num_tokens": 998438.0, + "step": 469 + }, + { + "epoch": 0.0038849717719604228, + "grad_norm": 0.39722317457199097, + "learning_rate": 4.990308235313567e-05, + "loss": 0.1887, + "mean_token_accuracy": 0.9601010084152222, + "num_tokens": 1000424.0, + "step": 470 + }, + { + "epoch": 0.0038932376693475725, + "grad_norm": 0.4448322355747223, + "learning_rate": 4.990287570570099e-05, + "loss": 0.2317, + "mean_token_accuracy": 0.9544088244438171, + "num_tokens": 1002426.0, + "step": 471 + }, + { + "epoch": 0.0039015035667347227, + "grad_norm": 0.34188705682754517, + "learning_rate": 4.990266905826631e-05, + "loss": 0.1693, + "mean_token_accuracy": 0.9652568101882935, + "num_tokens": 1004418.0, + "step": 472 + }, + { + "epoch": 0.0039097694641218724, + "grad_norm": 0.36124542355537415, + "learning_rate": 4.9902462410831635e-05, + "loss": 0.2059, + "mean_token_accuracy": 0.9597585797309875, + "num_tokens": 1006412.0, + "step": 473 + }, + { + "epoch": 0.003918035361509023, + "grad_norm": 0.4938713014125824, + "learning_rate": 4.9902255763396957e-05, + "loss": 0.2303, + "mean_token_accuracy": 0.9551724195480347, + "num_tokens": 1008448.0, + "step": 474 + }, + { + "epoch": 0.003926301258896172, + "grad_norm": 0.39540615677833557, + "learning_rate": 4.990204911596228e-05, + "loss": 0.2264, + "mean_token_accuracy": 0.9539309144020081, + "num_tokens": 1010451.0, + "step": 475 + }, + { + "epoch": 0.003934567156283322, + "grad_norm": 0.4768139123916626, + "learning_rate": 4.99018424685276e-05, + "loss": 0.1835, + "mean_token_accuracy": 0.9609683752059937, + "num_tokens": 1012481.0, + "step": 476 + }, + { + "epoch": 0.0039428330536704715, + "grad_norm": 0.329805850982666, + "learning_rate": 4.9901635821092915e-05, + "loss": 0.1326, + "mean_token_accuracy": 0.9701799750328064, + "num_tokens": 1014432.0, + "step": 477 + }, + { + "epoch": 0.003951098951057622, + "grad_norm": 0.37058165669441223, + "learning_rate": 4.990142917365824e-05, + "loss": 0.1867, + "mean_token_accuracy": 0.9611111283302307, + "num_tokens": 1016418.0, + "step": 478 + }, + { + "epoch": 0.003959364848444771, + "grad_norm": 0.5383991599082947, + "learning_rate": 4.9901222526223565e-05, + "loss": 0.2183, + "mean_token_accuracy": 0.9517892599105835, + "num_tokens": 1018436.0, + "step": 479 + }, + { + "epoch": 0.003967630745831921, + "grad_norm": 0.670604407787323, + "learning_rate": 4.990101587878888e-05, + "loss": 0.2127, + "mean_token_accuracy": 0.9586276412010193, + "num_tokens": 1020424.0, + "step": 480 + }, + { + "epoch": 0.003975896643219071, + "grad_norm": 0.4291754961013794, + "learning_rate": 4.990080923135421e-05, + "loss": 0.2622, + "mean_token_accuracy": 0.9468292593955994, + "num_tokens": 1022480.0, + "step": 481 + }, + { + "epoch": 0.003984162540606221, + "grad_norm": 0.5822583436965942, + "learning_rate": 4.990060258391952e-05, + "loss": 0.1756, + "mean_token_accuracy": 0.963764488697052, + "num_tokens": 1024473.0, + "step": 482 + }, + { + "epoch": 0.003992428437993371, + "grad_norm": 0.4418441951274872, + "learning_rate": 4.9900395936484845e-05, + "loss": 0.2186, + "mean_token_accuracy": 0.9539666771888733, + "num_tokens": 1026521.0, + "step": 483 + }, + { + "epoch": 0.00400069433538052, + "grad_norm": 0.39106106758117676, + "learning_rate": 4.990018928905017e-05, + "loss": 0.2278, + "mean_token_accuracy": 0.9536159634590149, + "num_tokens": 1028532.0, + "step": 484 + }, + { + "epoch": 0.00400896023276767, + "grad_norm": 0.40405771136283875, + "learning_rate": 4.989998264161549e-05, + "loss": 0.1978, + "mean_token_accuracy": 0.9608134627342224, + "num_tokens": 1030554.0, + "step": 485 + }, + { + "epoch": 0.0040172261301548206, + "grad_norm": 0.503392219543457, + "learning_rate": 4.989977599418081e-05, + "loss": 0.2308, + "mean_token_accuracy": 0.9507537484169006, + "num_tokens": 1032550.0, + "step": 486 + }, + { + "epoch": 0.00402549202754197, + "grad_norm": 0.3696815073490143, + "learning_rate": 4.989956934674613e-05, + "loss": 0.1455, + "mean_token_accuracy": 0.9691991806030273, + "num_tokens": 1034504.0, + "step": 487 + }, + { + "epoch": 0.00403375792492912, + "grad_norm": 0.4207642674446106, + "learning_rate": 4.989936269931145e-05, + "loss": 0.2391, + "mean_token_accuracy": 0.9518190622329712, + "num_tokens": 1036544.0, + "step": 488 + }, + { + "epoch": 0.004042023822316269, + "grad_norm": 0.41360029578208923, + "learning_rate": 4.9899156051876775e-05, + "loss": 0.2544, + "mean_token_accuracy": 0.9499514102935791, + "num_tokens": 1038608.0, + "step": 489 + }, + { + "epoch": 0.00405028971970342, + "grad_norm": 0.4410945475101471, + "learning_rate": 4.9898949404442096e-05, + "loss": 0.2673, + "mean_token_accuracy": 0.9487665891647339, + "num_tokens": 1040722.0, + "step": 490 + }, + { + "epoch": 0.00405855561709057, + "grad_norm": 0.41227084398269653, + "learning_rate": 4.989874275700742e-05, + "loss": 0.2378, + "mean_token_accuracy": 0.9528255462646484, + "num_tokens": 1042763.0, + "step": 491 + }, + { + "epoch": 0.004066821514477719, + "grad_norm": 0.3907535970211029, + "learning_rate": 4.989853610957273e-05, + "loss": 0.154, + "mean_token_accuracy": 0.9658163189888, + "num_tokens": 1044729.0, + "step": 492 + }, + { + "epoch": 0.004075087411864869, + "grad_norm": 0.41625314950942993, + "learning_rate": 4.989832946213806e-05, + "loss": 0.2214, + "mean_token_accuracy": 0.949009895324707, + "num_tokens": 1046755.0, + "step": 493 + }, + { + "epoch": 0.004083353309252019, + "grad_norm": 0.3951849937438965, + "learning_rate": 4.989812281470338e-05, + "loss": 0.2194, + "mean_token_accuracy": 0.9571072459220886, + "num_tokens": 1048766.0, + "step": 494 + }, + { + "epoch": 0.004091619206639169, + "grad_norm": 0.38774311542510986, + "learning_rate": 4.9897916167268705e-05, + "loss": 0.1921, + "mean_token_accuracy": 0.9617321491241455, + "num_tokens": 1050758.0, + "step": 495 + }, + { + "epoch": 0.004099885104026319, + "grad_norm": 0.360399067401886, + "learning_rate": 4.9897709519834026e-05, + "loss": 0.1536, + "mean_token_accuracy": 0.9669007062911987, + "num_tokens": 1052758.0, + "step": 496 + }, + { + "epoch": 0.004108151001413468, + "grad_norm": 0.4067020118236542, + "learning_rate": 4.989750287239934e-05, + "loss": 0.2394, + "mean_token_accuracy": 0.9497784376144409, + "num_tokens": 1054795.0, + "step": 497 + }, + { + "epoch": 0.0041164168988006185, + "grad_norm": 0.38551297783851624, + "learning_rate": 4.989729622496467e-05, + "loss": 0.2336, + "mean_token_accuracy": 0.9515331387519836, + "num_tokens": 1056823.0, + "step": 498 + }, + { + "epoch": 0.004124682796187768, + "grad_norm": 0.4567355811595917, + "learning_rate": 4.9897089577529984e-05, + "loss": 0.1985, + "mean_token_accuracy": 0.9577252268791199, + "num_tokens": 1058816.0, + "step": 499 + }, + { + "epoch": 0.004132948693574918, + "grad_norm": 0.3516772389411926, + "learning_rate": 4.9896882930095306e-05, + "loss": 0.192, + "mean_token_accuracy": 0.9586485028266907, + "num_tokens": 1060805.0, + "step": 500 + }, + { + "epoch": 0.004141214590962068, + "grad_norm": 0.3619779348373413, + "learning_rate": 4.9896676282660635e-05, + "loss": 0.2291, + "mean_token_accuracy": 0.9540967345237732, + "num_tokens": 1062837.0, + "step": 501 + }, + { + "epoch": 0.0041494804883492175, + "grad_norm": 0.3610847592353821, + "learning_rate": 4.989646963522595e-05, + "loss": 0.1744, + "mean_token_accuracy": 0.967725396156311, + "num_tokens": 1064795.0, + "step": 502 + }, + { + "epoch": 0.004157746385736368, + "grad_norm": 0.42383328080177307, + "learning_rate": 4.989626298779127e-05, + "loss": 0.2415, + "mean_token_accuracy": 0.9517003297805786, + "num_tokens": 1066830.0, + "step": 503 + }, + { + "epoch": 0.004166012283123517, + "grad_norm": 0.3487216532230377, + "learning_rate": 4.989605634035659e-05, + "loss": 0.1809, + "mean_token_accuracy": 0.9627016186714172, + "num_tokens": 1068820.0, + "step": 504 + }, + { + "epoch": 0.004174278180510667, + "grad_norm": 0.3901805281639099, + "learning_rate": 4.9895849692921914e-05, + "loss": 0.2177, + "mean_token_accuracy": 0.9561144113540649, + "num_tokens": 1070854.0, + "step": 505 + }, + { + "epoch": 0.004182544077897817, + "grad_norm": 0.4214717447757721, + "learning_rate": 4.9895643045487236e-05, + "loss": 0.1871, + "mean_token_accuracy": 0.9616151452064514, + "num_tokens": 1072866.0, + "step": 506 + }, + { + "epoch": 0.004190809975284967, + "grad_norm": 0.40214648842811584, + "learning_rate": 4.989543639805256e-05, + "loss": 0.2096, + "mean_token_accuracy": 0.9554656147956848, + "num_tokens": 1074848.0, + "step": 507 + }, + { + "epoch": 0.004199075872672117, + "grad_norm": 0.34685319662094116, + "learning_rate": 4.989522975061788e-05, + "loss": 0.1612, + "mean_token_accuracy": 0.9637755155563354, + "num_tokens": 1076814.0, + "step": 508 + }, + { + "epoch": 0.004207341770059266, + "grad_norm": 0.37900763750076294, + "learning_rate": 4.9895023103183194e-05, + "loss": 0.1585, + "mean_token_accuracy": 0.9673202633857727, + "num_tokens": 1078809.0, + "step": 509 + }, + { + "epoch": 0.004215607667446416, + "grad_norm": 0.42314958572387695, + "learning_rate": 4.989481645574852e-05, + "loss": 0.2021, + "mean_token_accuracy": 0.9601792097091675, + "num_tokens": 1080824.0, + "step": 510 + }, + { + "epoch": 0.004223873564833567, + "grad_norm": 0.6958469152450562, + "learning_rate": 4.9894609808313844e-05, + "loss": 0.244, + "mean_token_accuracy": 0.9466732144355774, + "num_tokens": 1082874.0, + "step": 511 + }, + { + "epoch": 0.004232139462220716, + "grad_norm": 0.41557443141937256, + "learning_rate": 4.989440316087916e-05, + "loss": 0.169, + "mean_token_accuracy": 0.9666160941123962, + "num_tokens": 1084857.0, + "step": 512 + }, + { + "epoch": 0.004240405359607866, + "grad_norm": 0.41902002692222595, + "learning_rate": 4.989419651344449e-05, + "loss": 0.2198, + "mean_token_accuracy": 0.9581465125083923, + "num_tokens": 1086870.0, + "step": 513 + }, + { + "epoch": 0.004248671256995015, + "grad_norm": 0.4280377924442291, + "learning_rate": 4.98939898660098e-05, + "loss": 0.1634, + "mean_token_accuracy": 0.9616161584854126, + "num_tokens": 1088856.0, + "step": 514 + }, + { + "epoch": 0.004256937154382166, + "grad_norm": 0.4948086738586426, + "learning_rate": 4.989378321857513e-05, + "loss": 0.3042, + "mean_token_accuracy": 0.9396718144416809, + "num_tokens": 1090934.0, + "step": 515 + }, + { + "epoch": 0.004265203051769315, + "grad_norm": 0.3329893946647644, + "learning_rate": 4.9893576571140446e-05, + "loss": 0.1678, + "mean_token_accuracy": 0.9655172228813171, + "num_tokens": 1092883.0, + "step": 516 + }, + { + "epoch": 0.004273468949156465, + "grad_norm": 0.5646424293518066, + "learning_rate": 4.989336992370577e-05, + "loss": 0.1971, + "mean_token_accuracy": 0.9614017009735107, + "num_tokens": 1094858.0, + "step": 517 + }, + { + "epoch": 0.004281734846543615, + "grad_norm": 0.4989800751209259, + "learning_rate": 4.9893163276271096e-05, + "loss": 0.2192, + "mean_token_accuracy": 0.9535906314849854, + "num_tokens": 1096911.0, + "step": 518 + }, + { + "epoch": 0.004290000743930765, + "grad_norm": 0.3853658139705658, + "learning_rate": 4.989295662883641e-05, + "loss": 0.1579, + "mean_token_accuracy": 0.96695476770401, + "num_tokens": 1098884.0, + "step": 519 + }, + { + "epoch": 0.004298266641317915, + "grad_norm": 0.4520922005176544, + "learning_rate": 4.989274998140173e-05, + "loss": 0.228, + "mean_token_accuracy": 0.948051929473877, + "num_tokens": 1100969.0, + "step": 520 + }, + { + "epoch": 0.004306532538705064, + "grad_norm": 0.35607728362083435, + "learning_rate": 4.9892543333967054e-05, + "loss": 0.1509, + "mean_token_accuracy": 0.9689567685127258, + "num_tokens": 1102940.0, + "step": 521 + }, + { + "epoch": 0.004314798436092214, + "grad_norm": 0.4449218511581421, + "learning_rate": 4.9892336686532376e-05, + "loss": 0.2816, + "mean_token_accuracy": 0.943668782711029, + "num_tokens": 1105023.0, + "step": 522 + }, + { + "epoch": 0.0043230643334793645, + "grad_norm": 0.5703555941581726, + "learning_rate": 4.98921300390977e-05, + "loss": 0.1871, + "mean_token_accuracy": 0.9587786197662354, + "num_tokens": 1106994.0, + "step": 523 + }, + { + "epoch": 0.004331330230866514, + "grad_norm": 0.33718162775039673, + "learning_rate": 4.989192339166302e-05, + "loss": 0.1851, + "mean_token_accuracy": 0.962063729763031, + "num_tokens": 1108977.0, + "step": 524 + }, + { + "epoch": 0.004339596128253664, + "grad_norm": 0.4550211429595947, + "learning_rate": 4.989171674422834e-05, + "loss": 0.2616, + "mean_token_accuracy": 0.9500244855880737, + "num_tokens": 1111024.0, + "step": 525 + }, + { + "epoch": 0.004347862025640813, + "grad_norm": 0.3400307297706604, + "learning_rate": 4.9891510096793656e-05, + "loss": 0.1954, + "mean_token_accuracy": 0.9562153816223145, + "num_tokens": 1113017.0, + "step": 526 + }, + { + "epoch": 0.0043561279230279635, + "grad_norm": 0.33124852180480957, + "learning_rate": 4.9891303449358984e-05, + "loss": 0.1957, + "mean_token_accuracy": 0.9598191976547241, + "num_tokens": 1115014.0, + "step": 527 + }, + { + "epoch": 0.004364393820415114, + "grad_norm": 0.48293545842170715, + "learning_rate": 4.9891096801924306e-05, + "loss": 0.2722, + "mean_token_accuracy": 0.9463053941726685, + "num_tokens": 1117050.0, + "step": 528 + }, + { + "epoch": 0.004372659717802263, + "grad_norm": 0.30610159039497375, + "learning_rate": 4.989089015448962e-05, + "loss": 0.1334, + "mean_token_accuracy": 0.9716932773590088, + "num_tokens": 1118999.0, + "step": 529 + }, + { + "epoch": 0.004380925615189413, + "grad_norm": 0.4187106788158417, + "learning_rate": 4.989068350705495e-05, + "loss": 0.2082, + "mean_token_accuracy": 0.9589178562164307, + "num_tokens": 1121001.0, + "step": 530 + }, + { + "epoch": 0.0043891915125765625, + "grad_norm": 0.5653623342514038, + "learning_rate": 4.9890476859620264e-05, + "loss": 0.2966, + "mean_token_accuracy": 0.9459459185600281, + "num_tokens": 1123005.0, + "step": 531 + }, + { + "epoch": 0.004397457409963713, + "grad_norm": 0.41617530584335327, + "learning_rate": 4.9890270212185586e-05, + "loss": 0.2344, + "mean_token_accuracy": 0.9540791511535645, + "num_tokens": 1125058.0, + "step": 532 + }, + { + "epoch": 0.004405723307350863, + "grad_norm": 0.40406036376953125, + "learning_rate": 4.9890063564750914e-05, + "loss": 0.1903, + "mean_token_accuracy": 0.9607250690460205, + "num_tokens": 1127050.0, + "step": 533 + }, + { + "epoch": 0.004413989204738012, + "grad_norm": 0.4404779076576233, + "learning_rate": 4.988985691731623e-05, + "loss": 0.2569, + "mean_token_accuracy": 0.9501726627349854, + "num_tokens": 1129083.0, + "step": 534 + }, + { + "epoch": 0.004422255102125162, + "grad_norm": 0.3881947696208954, + "learning_rate": 4.988965026988155e-05, + "loss": 0.2466, + "mean_token_accuracy": 0.950326144695282, + "num_tokens": 1131082.0, + "step": 535 + }, + { + "epoch": 0.004430520999512312, + "grad_norm": 0.2894626557826996, + "learning_rate": 4.988944362244687e-05, + "loss": 0.1235, + "mean_token_accuracy": 0.973738431930542, + "num_tokens": 1133030.0, + "step": 536 + }, + { + "epoch": 0.004438786896899462, + "grad_norm": 0.3985994756221771, + "learning_rate": 4.9889236975012194e-05, + "loss": 0.2072, + "mean_token_accuracy": 0.9604662656784058, + "num_tokens": 1135009.0, + "step": 537 + }, + { + "epoch": 0.004447052794286612, + "grad_norm": 0.28767383098602295, + "learning_rate": 4.9889030327577516e-05, + "loss": 0.1662, + "mean_token_accuracy": 0.9692937731742859, + "num_tokens": 1136969.0, + "step": 538 + }, + { + "epoch": 0.0044553186916737614, + "grad_norm": 0.36411911249160767, + "learning_rate": 4.988882368014284e-05, + "loss": 0.198, + "mean_token_accuracy": 0.9573934674263, + "num_tokens": 1138970.0, + "step": 539 + }, + { + "epoch": 0.004463584589060912, + "grad_norm": 0.38707268238067627, + "learning_rate": 4.988861703270816e-05, + "loss": 0.2443, + "mean_token_accuracy": 0.947576642036438, + "num_tokens": 1140998.0, + "step": 540 + }, + { + "epoch": 0.004471850486448061, + "grad_norm": 0.373520165681839, + "learning_rate": 4.988841038527348e-05, + "loss": 0.2164, + "mean_token_accuracy": 0.9554794430732727, + "num_tokens": 1143048.0, + "step": 541 + }, + { + "epoch": 0.004480116383835211, + "grad_norm": 0.479813814163208, + "learning_rate": 4.98882037378388e-05, + "loss": 0.2545, + "mean_token_accuracy": 0.9450549483299255, + "num_tokens": 1145147.0, + "step": 542 + }, + { + "epoch": 0.004488382281222361, + "grad_norm": 0.39338168501853943, + "learning_rate": 4.9887997090404124e-05, + "loss": 0.1829, + "mean_token_accuracy": 0.9600204825401306, + "num_tokens": 1147104.0, + "step": 543 + }, + { + "epoch": 0.004496648178609511, + "grad_norm": 0.42352020740509033, + "learning_rate": 4.9887790442969445e-05, + "loss": 0.1925, + "mean_token_accuracy": 0.9606686234474182, + "num_tokens": 1149144.0, + "step": 544 + }, + { + "epoch": 0.004504914075996661, + "grad_norm": 0.4865024983882904, + "learning_rate": 4.988758379553477e-05, + "loss": 0.2578, + "mean_token_accuracy": 0.9479882121086121, + "num_tokens": 1151188.0, + "step": 545 + }, + { + "epoch": 0.00451317997338381, + "grad_norm": 0.4011925756931305, + "learning_rate": 4.988737714810008e-05, + "loss": 0.1685, + "mean_token_accuracy": 0.9657988548278809, + "num_tokens": 1153153.0, + "step": 546 + }, + { + "epoch": 0.00452144587077096, + "grad_norm": 0.40737876296043396, + "learning_rate": 4.988717050066541e-05, + "loss": 0.2055, + "mean_token_accuracy": 0.9587365984916687, + "num_tokens": 1155122.0, + "step": 547 + }, + { + "epoch": 0.00452971176815811, + "grad_norm": 0.476521372795105, + "learning_rate": 4.9886963853230725e-05, + "loss": 0.2476, + "mean_token_accuracy": 0.9504659175872803, + "num_tokens": 1157167.0, + "step": 548 + }, + { + "epoch": 0.00453797766554526, + "grad_norm": 0.38565853238105774, + "learning_rate": 4.988675720579605e-05, + "loss": 0.1415, + "mean_token_accuracy": 0.9707070589065552, + "num_tokens": 1159153.0, + "step": 549 + }, + { + "epoch": 0.00454624356293241, + "grad_norm": 0.4481552243232727, + "learning_rate": 4.9886550558361375e-05, + "loss": 0.2018, + "mean_token_accuracy": 0.963761031627655, + "num_tokens": 1161201.0, + "step": 550 + }, + { + "epoch": 0.004554509460319559, + "grad_norm": 0.3850753605365753, + "learning_rate": 4.988634391092669e-05, + "loss": 0.1761, + "mean_token_accuracy": 0.9665465950965881, + "num_tokens": 1163150.0, + "step": 551 + }, + { + "epoch": 0.0045627753577067096, + "grad_norm": 0.49590855836868286, + "learning_rate": 4.988613726349201e-05, + "loss": 0.1915, + "mean_token_accuracy": 0.9587525129318237, + "num_tokens": 1165144.0, + "step": 552 + }, + { + "epoch": 0.004571041255093859, + "grad_norm": 0.4352778494358063, + "learning_rate": 4.9885930616057334e-05, + "loss": 0.2394, + "mean_token_accuracy": 0.9542450308799744, + "num_tokens": 1167117.0, + "step": 553 + }, + { + "epoch": 0.004579307152481009, + "grad_norm": 0.3296060860157013, + "learning_rate": 4.9885723968622655e-05, + "loss": 0.1448, + "mean_token_accuracy": 0.966292142868042, + "num_tokens": 1169081.0, + "step": 554 + }, + { + "epoch": 0.004587573049868159, + "grad_norm": 0.33051133155822754, + "learning_rate": 4.988551732118798e-05, + "loss": 0.1931, + "mean_token_accuracy": 0.9642674922943115, + "num_tokens": 1171046.0, + "step": 555 + }, + { + "epoch": 0.004595838947255309, + "grad_norm": 0.5116681456565857, + "learning_rate": 4.98853106737533e-05, + "loss": 0.1976, + "mean_token_accuracy": 0.9608433842658997, + "num_tokens": 1173044.0, + "step": 556 + }, + { + "epoch": 0.004604104844642459, + "grad_norm": 0.3828645348548889, + "learning_rate": 4.988510402631862e-05, + "loss": 0.1746, + "mean_token_accuracy": 0.9621594548225403, + "num_tokens": 1175032.0, + "step": 557 + }, + { + "epoch": 0.004612370742029608, + "grad_norm": 0.6423853635787964, + "learning_rate": 4.988489737888394e-05, + "loss": 0.3258, + "mean_token_accuracy": 0.930343508720398, + "num_tokens": 1177134.0, + "step": 558 + }, + { + "epoch": 0.004620636639416758, + "grad_norm": 0.456575870513916, + "learning_rate": 4.9884690731449264e-05, + "loss": 0.2104, + "mean_token_accuracy": 0.9585414528846741, + "num_tokens": 1179142.0, + "step": 559 + }, + { + "epoch": 0.0046289025368039085, + "grad_norm": 0.40300890803337097, + "learning_rate": 4.9884484084014585e-05, + "loss": 0.1759, + "mean_token_accuracy": 0.9616534113883972, + "num_tokens": 1181156.0, + "step": 560 + }, + { + "epoch": 0.004637168434191058, + "grad_norm": 0.4320686459541321, + "learning_rate": 4.988427743657991e-05, + "loss": 0.2638, + "mean_token_accuracy": 0.9496793150901794, + "num_tokens": 1183189.0, + "step": 561 + }, + { + "epoch": 0.004645434331578208, + "grad_norm": 0.31509634852409363, + "learning_rate": 4.988407078914523e-05, + "loss": 0.1451, + "mean_token_accuracy": 0.9720101952552795, + "num_tokens": 1185160.0, + "step": 562 + }, + { + "epoch": 0.004653700228965357, + "grad_norm": 0.47020307183265686, + "learning_rate": 4.9883864141710543e-05, + "loss": 0.1906, + "mean_token_accuracy": 0.9631525278091431, + "num_tokens": 1187120.0, + "step": 563 + }, + { + "epoch": 0.0046619661263525075, + "grad_norm": 0.3651725649833679, + "learning_rate": 4.988365749427587e-05, + "loss": 0.1594, + "mean_token_accuracy": 0.9637462496757507, + "num_tokens": 1189112.0, + "step": 564 + }, + { + "epoch": 0.004670232023739658, + "grad_norm": 0.31554025411605835, + "learning_rate": 4.988345084684119e-05, + "loss": 0.1853, + "mean_token_accuracy": 0.9606573581695557, + "num_tokens": 1191126.0, + "step": 565 + }, + { + "epoch": 0.004678497921126807, + "grad_norm": 0.350764662027359, + "learning_rate": 4.988324419940651e-05, + "loss": 0.16, + "mean_token_accuracy": 0.9633533954620361, + "num_tokens": 1193124.0, + "step": 566 + }, + { + "epoch": 0.004686763818513957, + "grad_norm": 0.3196449279785156, + "learning_rate": 4.988303755197184e-05, + "loss": 0.1513, + "mean_token_accuracy": 0.9681724905967712, + "num_tokens": 1195078.0, + "step": 567 + }, + { + "epoch": 0.0046950297159011065, + "grad_norm": 0.46126583218574524, + "learning_rate": 4.988283090453715e-05, + "loss": 0.2712, + "mean_token_accuracy": 0.9475473761558533, + "num_tokens": 1197143.0, + "step": 568 + }, + { + "epoch": 0.004703295613288257, + "grad_norm": 0.4376954734325409, + "learning_rate": 4.988262425710247e-05, + "loss": 0.1901, + "mean_token_accuracy": 0.9618902206420898, + "num_tokens": 1199117.0, + "step": 569 + }, + { + "epoch": 0.004711561510675407, + "grad_norm": 0.45122748613357544, + "learning_rate": 4.9882417609667795e-05, + "loss": 0.2919, + "mean_token_accuracy": 0.9361900091171265, + "num_tokens": 1201270.0, + "step": 570 + }, + { + "epoch": 0.004719827408062556, + "grad_norm": 0.5808910131454468, + "learning_rate": 4.988221096223312e-05, + "loss": 0.3158, + "mean_token_accuracy": 0.939496636390686, + "num_tokens": 1203342.0, + "step": 571 + }, + { + "epoch": 0.004728093305449706, + "grad_norm": 0.4194670021533966, + "learning_rate": 4.988200431479844e-05, + "loss": 0.2258, + "mean_token_accuracy": 0.9534653425216675, + "num_tokens": 1205368.0, + "step": 572 + }, + { + "epoch": 0.004736359202836856, + "grad_norm": 0.4512733519077301, + "learning_rate": 4.988179766736376e-05, + "loss": 0.1957, + "mean_token_accuracy": 0.9579207897186279, + "num_tokens": 1207394.0, + "step": 573 + }, + { + "epoch": 0.004744625100224006, + "grad_norm": 0.4763815701007843, + "learning_rate": 4.988159101992908e-05, + "loss": 0.2784, + "mean_token_accuracy": 0.9424564838409424, + "num_tokens": 1209468.0, + "step": 574 + }, + { + "epoch": 0.004752890997611156, + "grad_norm": 0.3886113464832306, + "learning_rate": 4.9881384372494397e-05, + "loss": 0.1563, + "mean_token_accuracy": 0.9676757454872131, + "num_tokens": 1211423.0, + "step": 575 + }, + { + "epoch": 0.004761156894998305, + "grad_norm": 0.449587881565094, + "learning_rate": 4.9881177725059725e-05, + "loss": 0.2726, + "mean_token_accuracy": 0.9422610402107239, + "num_tokens": 1213490.0, + "step": 576 + }, + { + "epoch": 0.004769422792385456, + "grad_norm": 0.36666297912597656, + "learning_rate": 4.9880971077625047e-05, + "loss": 0.1722, + "mean_token_accuracy": 0.9632241725921631, + "num_tokens": 1215481.0, + "step": 577 + }, + { + "epoch": 0.004777688689772605, + "grad_norm": 0.4038402736186981, + "learning_rate": 4.988076443019037e-05, + "loss": 0.2087, + "mean_token_accuracy": 0.9565651416778564, + "num_tokens": 1217490.0, + "step": 578 + }, + { + "epoch": 0.004785954587159755, + "grad_norm": 0.47383275628089905, + "learning_rate": 4.988055778275569e-05, + "loss": 0.2893, + "mean_token_accuracy": 0.9465240836143494, + "num_tokens": 1219553.0, + "step": 579 + }, + { + "epoch": 0.004794220484546904, + "grad_norm": 0.5003758668899536, + "learning_rate": 4.9880351135321005e-05, + "loss": 0.2143, + "mean_token_accuracy": 0.9577187895774841, + "num_tokens": 1221593.0, + "step": 580 + }, + { + "epoch": 0.004802486381934055, + "grad_norm": 0.4269118309020996, + "learning_rate": 4.988014448788633e-05, + "loss": 0.1874, + "mean_token_accuracy": 0.9630738496780396, + "num_tokens": 1223603.0, + "step": 581 + }, + { + "epoch": 0.004810752279321205, + "grad_norm": 0.5176770091056824, + "learning_rate": 4.9879937840451655e-05, + "loss": 0.205, + "mean_token_accuracy": 0.9568272829055786, + "num_tokens": 1225601.0, + "step": 582 + }, + { + "epoch": 0.004819018176708354, + "grad_norm": 0.36790063977241516, + "learning_rate": 4.987973119301697e-05, + "loss": 0.1652, + "mean_token_accuracy": 0.9640287756919861, + "num_tokens": 1227553.0, + "step": 583 + }, + { + "epoch": 0.004827284074095504, + "grad_norm": 0.3703189492225647, + "learning_rate": 4.98795245455823e-05, + "loss": 0.1537, + "mean_token_accuracy": 0.9708290696144104, + "num_tokens": 1229513.0, + "step": 584 + }, + { + "epoch": 0.004835549971482654, + "grad_norm": 0.8259407877922058, + "learning_rate": 4.987931789814761e-05, + "loss": 0.2563, + "mean_token_accuracy": 0.9576746821403503, + "num_tokens": 1231480.0, + "step": 585 + }, + { + "epoch": 0.004843815868869804, + "grad_norm": 0.32427746057510376, + "learning_rate": 4.9879111250712935e-05, + "loss": 0.151, + "mean_token_accuracy": 0.9679552316665649, + "num_tokens": 1233452.0, + "step": 586 + }, + { + "epoch": 0.004852081766256954, + "grad_norm": 0.42049461603164673, + "learning_rate": 4.9878904603278256e-05, + "loss": 0.188, + "mean_token_accuracy": 0.9590931534767151, + "num_tokens": 1235487.0, + "step": 587 + }, + { + "epoch": 0.004860347663644103, + "grad_norm": 0.35315588116645813, + "learning_rate": 4.987869795584358e-05, + "loss": 0.1954, + "mean_token_accuracy": 0.9597180485725403, + "num_tokens": 1237479.0, + "step": 588 + }, + { + "epoch": 0.0048686135610312535, + "grad_norm": 0.35957205295562744, + "learning_rate": 4.98784913084089e-05, + "loss": 0.2247, + "mean_token_accuracy": 0.955610990524292, + "num_tokens": 1239490.0, + "step": 589 + }, + { + "epoch": 0.004876879458418403, + "grad_norm": 0.37462323904037476, + "learning_rate": 4.987828466097422e-05, + "loss": 0.2092, + "mean_token_accuracy": 0.9589873552322388, + "num_tokens": 1241471.0, + "step": 590 + }, + { + "epoch": 0.004885145355805553, + "grad_norm": 0.3435719311237335, + "learning_rate": 4.987807801353954e-05, + "loss": 0.1895, + "mean_token_accuracy": 0.9608040452003479, + "num_tokens": 1243467.0, + "step": 591 + }, + { + "epoch": 0.004893411253192703, + "grad_norm": 0.47866758704185486, + "learning_rate": 4.9877871366104865e-05, + "loss": 0.1725, + "mean_token_accuracy": 0.9660144448280334, + "num_tokens": 1245415.0, + "step": 592 + }, + { + "epoch": 0.0049016771505798525, + "grad_norm": 0.33533069491386414, + "learning_rate": 4.9877664718670186e-05, + "loss": 0.1966, + "mean_token_accuracy": 0.9575212597846985, + "num_tokens": 1247422.0, + "step": 593 + }, + { + "epoch": 0.004909943047967003, + "grad_norm": 0.34776511788368225, + "learning_rate": 4.987745807123551e-05, + "loss": 0.1694, + "mean_token_accuracy": 0.9621020555496216, + "num_tokens": 1249407.0, + "step": 594 + }, + { + "epoch": 0.004918208945354152, + "grad_norm": 0.37613072991371155, + "learning_rate": 4.987725142380082e-05, + "loss": 0.2525, + "mean_token_accuracy": 0.9534085392951965, + "num_tokens": 1251452.0, + "step": 595 + }, + { + "epoch": 0.004926474842741302, + "grad_norm": 0.3642001450061798, + "learning_rate": 4.987704477636615e-05, + "loss": 0.183, + "mean_token_accuracy": 0.95839524269104, + "num_tokens": 1253477.0, + "step": 596 + }, + { + "epoch": 0.004934740740128452, + "grad_norm": 0.34267255663871765, + "learning_rate": 4.9876838128931466e-05, + "loss": 0.1945, + "mean_token_accuracy": 0.9652742743492126, + "num_tokens": 1255470.0, + "step": 597 + }, + { + "epoch": 0.004943006637515602, + "grad_norm": 0.3232819437980652, + "learning_rate": 4.987663148149679e-05, + "loss": 0.1791, + "mean_token_accuracy": 0.9632981419563293, + "num_tokens": 1257465.0, + "step": 598 + }, + { + "epoch": 0.004951272534902752, + "grad_norm": 0.42522719502449036, + "learning_rate": 4.9876424834062116e-05, + "loss": 0.2506, + "mean_token_accuracy": 0.9504613876342773, + "num_tokens": 1259530.0, + "step": 599 + }, + { + "epoch": 0.004959538432289901, + "grad_norm": 0.4197443127632141, + "learning_rate": 4.987621818662743e-05, + "loss": 0.2668, + "mean_token_accuracy": 0.9411201477050781, + "num_tokens": 1261625.0, + "step": 600 + }, + { + "epoch": 0.004967804329677051, + "grad_norm": 0.33340418338775635, + "learning_rate": 4.987601153919276e-05, + "loss": 0.2257, + "mean_token_accuracy": 0.9577114582061768, + "num_tokens": 1263641.0, + "step": 601 + }, + { + "epoch": 0.004976070227064202, + "grad_norm": 0.4351325035095215, + "learning_rate": 4.9875804891758074e-05, + "loss": 0.217, + "mean_token_accuracy": 0.9556227922439575, + "num_tokens": 1265630.0, + "step": 602 + }, + { + "epoch": 0.004984336124451351, + "grad_norm": 0.3091565668582916, + "learning_rate": 4.9875598244323396e-05, + "loss": 0.1436, + "mean_token_accuracy": 0.9680689573287964, + "num_tokens": 1267609.0, + "step": 603 + }, + { + "epoch": 0.004992602021838501, + "grad_norm": 0.3690471351146698, + "learning_rate": 4.987539159688872e-05, + "loss": 0.1543, + "mean_token_accuracy": 0.968988299369812, + "num_tokens": 1269582.0, + "step": 604 + }, + { + "epoch": 0.0050008679192256504, + "grad_norm": 0.5284733176231384, + "learning_rate": 4.987518494945404e-05, + "loss": 0.2306, + "mean_token_accuracy": 0.9521435499191284, + "num_tokens": 1271594.0, + "step": 605 + }, + { + "epoch": 0.005009133816612801, + "grad_norm": 0.3853582441806793, + "learning_rate": 4.987497830201936e-05, + "loss": 0.2079, + "mean_token_accuracy": 0.9585798978805542, + "num_tokens": 1273628.0, + "step": 606 + }, + { + "epoch": 0.005017399713999951, + "grad_norm": 0.44998297095298767, + "learning_rate": 4.987477165458468e-05, + "loss": 0.1937, + "mean_token_accuracy": 0.9611220359802246, + "num_tokens": 1275666.0, + "step": 607 + }, + { + "epoch": 0.0050256656113871, + "grad_norm": 0.4008032977581024, + "learning_rate": 4.9874565007150004e-05, + "loss": 0.1793, + "mean_token_accuracy": 0.9632652997970581, + "num_tokens": 1277632.0, + "step": 608 + }, + { + "epoch": 0.00503393150877425, + "grad_norm": 0.3322504758834839, + "learning_rate": 4.9874358359715326e-05, + "loss": 0.1297, + "mean_token_accuracy": 0.9696813821792603, + "num_tokens": 1279584.0, + "step": 609 + }, + { + "epoch": 0.0050421974061614, + "grad_norm": 0.8555606603622437, + "learning_rate": 4.987415171228065e-05, + "loss": 0.2322, + "mean_token_accuracy": 0.9585677981376648, + "num_tokens": 1281545.0, + "step": 610 + }, + { + "epoch": 0.00505046330354855, + "grad_norm": 0.3547472357749939, + "learning_rate": 4.987394506484597e-05, + "loss": 0.174, + "mean_token_accuracy": 0.96257483959198, + "num_tokens": 1283555.0, + "step": 611 + }, + { + "epoch": 0.005058729200935699, + "grad_norm": 0.4231840670108795, + "learning_rate": 4.9873738417411284e-05, + "loss": 0.1811, + "mean_token_accuracy": 0.9599800109863281, + "num_tokens": 1285560.0, + "step": 612 + }, + { + "epoch": 0.005066995098322849, + "grad_norm": 0.4377189576625824, + "learning_rate": 4.987353176997661e-05, + "loss": 0.1868, + "mean_token_accuracy": 0.9591939449310303, + "num_tokens": 1287551.0, + "step": 613 + }, + { + "epoch": 0.0050752609957099995, + "grad_norm": 0.4747653007507324, + "learning_rate": 4.987332512254193e-05, + "loss": 0.2138, + "mean_token_accuracy": 0.9557957053184509, + "num_tokens": 1289593.0, + "step": 614 + }, + { + "epoch": 0.005083526893097149, + "grad_norm": 0.48416292667388916, + "learning_rate": 4.987311847510725e-05, + "loss": 0.2593, + "mean_token_accuracy": 0.9521912336349487, + "num_tokens": 1291607.0, + "step": 615 + }, + { + "epoch": 0.005091792790484299, + "grad_norm": 0.4701284170150757, + "learning_rate": 4.987291182767258e-05, + "loss": 0.2189, + "mean_token_accuracy": 0.9538461565971375, + "num_tokens": 1293628.0, + "step": 616 + }, + { + "epoch": 0.005100058687871448, + "grad_norm": 0.5288640856742859, + "learning_rate": 4.987270518023789e-05, + "loss": 0.2348, + "mean_token_accuracy": 0.9571072459220886, + "num_tokens": 1295639.0, + "step": 617 + }, + { + "epoch": 0.0051083245852585986, + "grad_norm": 0.3681744337081909, + "learning_rate": 4.9872498532803214e-05, + "loss": 0.2096, + "mean_token_accuracy": 0.9571356773376465, + "num_tokens": 1297628.0, + "step": 618 + }, + { + "epoch": 0.005116590482645749, + "grad_norm": 0.3801528513431549, + "learning_rate": 4.9872291885368536e-05, + "loss": 0.1622, + "mean_token_accuracy": 0.9673469662666321, + "num_tokens": 1299594.0, + "step": 619 + }, + { + "epoch": 0.005124856380032898, + "grad_norm": 0.33789482712745667, + "learning_rate": 4.987208523793386e-05, + "loss": 0.1518, + "mean_token_accuracy": 0.9684842228889465, + "num_tokens": 1301599.0, + "step": 620 + }, + { + "epoch": 0.005133122277420048, + "grad_norm": 0.5162757635116577, + "learning_rate": 4.987187859049918e-05, + "loss": 0.278, + "mean_token_accuracy": 0.9440902471542358, + "num_tokens": 1303644.0, + "step": 621 + }, + { + "epoch": 0.005141388174807198, + "grad_norm": 0.42620551586151123, + "learning_rate": 4.98716719430645e-05, + "loss": 0.2407, + "mean_token_accuracy": 0.9534772038459778, + "num_tokens": 1305735.0, + "step": 622 + }, + { + "epoch": 0.005149654072194348, + "grad_norm": 0.35942429304122925, + "learning_rate": 4.987146529562982e-05, + "loss": 0.2066, + "mean_token_accuracy": 0.9572219252586365, + "num_tokens": 1307728.0, + "step": 623 + }, + { + "epoch": 0.005157919969581498, + "grad_norm": 0.3561047613620758, + "learning_rate": 4.9871258648195144e-05, + "loss": 0.1799, + "mean_token_accuracy": 0.9616742134094238, + "num_tokens": 1309717.0, + "step": 624 + }, + { + "epoch": 0.005166185866968647, + "grad_norm": 0.4044671058654785, + "learning_rate": 4.9871052000760466e-05, + "loss": 0.2267, + "mean_token_accuracy": 0.9577534794807434, + "num_tokens": 1311735.0, + "step": 625 + }, + { + "epoch": 0.0051744517643557975, + "grad_norm": 0.35080039501190186, + "learning_rate": 4.987084535332579e-05, + "loss": 0.1969, + "mean_token_accuracy": 0.9600197672843933, + "num_tokens": 1313767.0, + "step": 626 + }, + { + "epoch": 0.005182717661742947, + "grad_norm": 0.420389324426651, + "learning_rate": 4.987063870589111e-05, + "loss": 0.2062, + "mean_token_accuracy": 0.9584980010986328, + "num_tokens": 1315797.0, + "step": 627 + }, + { + "epoch": 0.005190983559130097, + "grad_norm": 0.32986149191856384, + "learning_rate": 4.987043205845643e-05, + "loss": 0.1553, + "mean_token_accuracy": 0.9685438871383667, + "num_tokens": 1317774.0, + "step": 628 + }, + { + "epoch": 0.005199249456517247, + "grad_norm": 0.36671149730682373, + "learning_rate": 4.9870225411021746e-05, + "loss": 0.1786, + "mean_token_accuracy": 0.965309202671051, + "num_tokens": 1319769.0, + "step": 629 + }, + { + "epoch": 0.0052075153539043965, + "grad_norm": 0.42939433455467224, + "learning_rate": 4.9870018763587074e-05, + "loss": 0.227, + "mean_token_accuracy": 0.9533600807189941, + "num_tokens": 1321769.0, + "step": 630 + }, + { + "epoch": 0.005215781251291547, + "grad_norm": 0.4047471582889557, + "learning_rate": 4.986981211615239e-05, + "loss": 0.2006, + "mean_token_accuracy": 0.9592555165290833, + "num_tokens": 1323763.0, + "step": 631 + }, + { + "epoch": 0.005224047148678696, + "grad_norm": 0.31303027272224426, + "learning_rate": 4.986960546871771e-05, + "loss": 0.144, + "mean_token_accuracy": 0.9680851101875305, + "num_tokens": 1325743.0, + "step": 632 + }, + { + "epoch": 0.005232313046065846, + "grad_norm": 0.39468520879745483, + "learning_rate": 4.986939882128304e-05, + "loss": 0.1708, + "mean_token_accuracy": 0.9617898464202881, + "num_tokens": 1327738.0, + "step": 633 + }, + { + "epoch": 0.005240578943452996, + "grad_norm": 0.3944607675075531, + "learning_rate": 4.9869192173848354e-05, + "loss": 0.2016, + "mean_token_accuracy": 0.9624624848365784, + "num_tokens": 1329742.0, + "step": 634 + }, + { + "epoch": 0.005248844840840146, + "grad_norm": 0.4482612907886505, + "learning_rate": 4.9868985526413676e-05, + "loss": 0.2218, + "mean_token_accuracy": 0.9538461565971375, + "num_tokens": 1331763.0, + "step": 635 + }, + { + "epoch": 0.005257110738227296, + "grad_norm": 0.5000016689300537, + "learning_rate": 4.9868778878979e-05, + "loss": 0.2209, + "mean_token_accuracy": 0.9566949009895325, + "num_tokens": 1333778.0, + "step": 636 + }, + { + "epoch": 0.005265376635614445, + "grad_norm": 0.47637665271759033, + "learning_rate": 4.986857223154432e-05, + "loss": 0.2229, + "mean_token_accuracy": 0.9557086825370789, + "num_tokens": 1335816.0, + "step": 637 + }, + { + "epoch": 0.005273642533001595, + "grad_norm": 0.42545145750045776, + "learning_rate": 4.986836558410964e-05, + "loss": 0.1667, + "mean_token_accuracy": 0.9671458005905151, + "num_tokens": 1337770.0, + "step": 638 + }, + { + "epoch": 0.0052819084303887456, + "grad_norm": 0.6827418804168701, + "learning_rate": 4.986815893667496e-05, + "loss": 0.2117, + "mean_token_accuracy": 0.9604462385177612, + "num_tokens": 1339748.0, + "step": 639 + }, + { + "epoch": 0.005290174327775895, + "grad_norm": 0.368962824344635, + "learning_rate": 4.9867952289240284e-05, + "loss": 0.1642, + "mean_token_accuracy": 0.9683834910392761, + "num_tokens": 1341715.0, + "step": 640 + }, + { + "epoch": 0.005298440225163045, + "grad_norm": 0.4205617606639862, + "learning_rate": 4.9867745641805606e-05, + "loss": 0.2486, + "mean_token_accuracy": 0.9519608020782471, + "num_tokens": 1343761.0, + "step": 641 + }, + { + "epoch": 0.005306706122550194, + "grad_norm": 0.33469706773757935, + "learning_rate": 4.986753899437093e-05, + "loss": 0.1639, + "mean_token_accuracy": 0.9635000228881836, + "num_tokens": 1345767.0, + "step": 642 + }, + { + "epoch": 0.005314972019937345, + "grad_norm": 0.44214770197868347, + "learning_rate": 4.986733234693625e-05, + "loss": 0.1848, + "mean_token_accuracy": 0.9607250690460205, + "num_tokens": 1347759.0, + "step": 643 + }, + { + "epoch": 0.005323237917324494, + "grad_norm": 0.34376171231269836, + "learning_rate": 4.986712569950157e-05, + "loss": 0.1851, + "mean_token_accuracy": 0.9625374674797058, + "num_tokens": 1349767.0, + "step": 644 + }, + { + "epoch": 0.005331503814711644, + "grad_norm": 0.41137999296188354, + "learning_rate": 4.986691905206689e-05, + "loss": 0.1569, + "mean_token_accuracy": 0.9691451787948608, + "num_tokens": 1351750.0, + "step": 645 + }, + { + "epoch": 0.005339769712098794, + "grad_norm": 0.368313193321228, + "learning_rate": 4.986671240463221e-05, + "loss": 0.1538, + "mean_token_accuracy": 0.9658805727958679, + "num_tokens": 1353749.0, + "step": 646 + }, + { + "epoch": 0.005348035609485944, + "grad_norm": 0.3550889194011688, + "learning_rate": 4.9866505757197536e-05, + "loss": 0.2014, + "mean_token_accuracy": 0.9619675278663635, + "num_tokens": 1355727.0, + "step": 647 + }, + { + "epoch": 0.005356301506873094, + "grad_norm": 0.3864426016807556, + "learning_rate": 4.986629910976286e-05, + "loss": 0.1633, + "mean_token_accuracy": 0.9668874144554138, + "num_tokens": 1357696.0, + "step": 648 + }, + { + "epoch": 0.005364567404260243, + "grad_norm": 0.3569417893886566, + "learning_rate": 4.986609246232817e-05, + "loss": 0.1506, + "mean_token_accuracy": 0.9674465656280518, + "num_tokens": 1359668.0, + "step": 649 + }, + { + "epoch": 0.005372833301647393, + "grad_norm": 0.4566428065299988, + "learning_rate": 4.98658858148935e-05, + "loss": 0.2085, + "mean_token_accuracy": 0.955875039100647, + "num_tokens": 1361691.0, + "step": 650 + }, + { + "epoch": 0.0053810991990345435, + "grad_norm": 0.35461804270744324, + "learning_rate": 4.9865679167458815e-05, + "loss": 0.2036, + "mean_token_accuracy": 0.9614213109016418, + "num_tokens": 1363667.0, + "step": 651 + }, + { + "epoch": 0.005389365096421693, + "grad_norm": 0.3737211525440216, + "learning_rate": 4.986547252002414e-05, + "loss": 0.1673, + "mean_token_accuracy": 0.9645177125930786, + "num_tokens": 1365674.0, + "step": 652 + }, + { + "epoch": 0.005397630993808843, + "grad_norm": 0.495787113904953, + "learning_rate": 4.986526587258946e-05, + "loss": 0.24, + "mean_token_accuracy": 0.9544103145599365, + "num_tokens": 1367698.0, + "step": 653 + }, + { + "epoch": 0.005405896891195992, + "grad_norm": 0.3912745714187622, + "learning_rate": 4.986505922515478e-05, + "loss": 0.2178, + "mean_token_accuracy": 0.955276370048523, + "num_tokens": 1369694.0, + "step": 654 + }, + { + "epoch": 0.0054141627885831425, + "grad_norm": 0.4028461277484894, + "learning_rate": 4.98648525777201e-05, + "loss": 0.2061, + "mean_token_accuracy": 0.9557957053184509, + "num_tokens": 1371736.0, + "step": 655 + }, + { + "epoch": 0.005422428685970293, + "grad_norm": 0.42663925886154175, + "learning_rate": 4.9864645930285424e-05, + "loss": 0.2033, + "mean_token_accuracy": 0.9591429829597473, + "num_tokens": 1373749.0, + "step": 656 + }, + { + "epoch": 0.005430694583357442, + "grad_norm": 0.4920315742492676, + "learning_rate": 4.9864439282850745e-05, + "loss": 0.274, + "mean_token_accuracy": 0.940487802028656, + "num_tokens": 1375805.0, + "step": 657 + }, + { + "epoch": 0.005438960480744592, + "grad_norm": 0.44999560713768005, + "learning_rate": 4.986423263541607e-05, + "loss": 0.1413, + "mean_token_accuracy": 0.9719673991203308, + "num_tokens": 1377773.0, + "step": 658 + }, + { + "epoch": 0.0054472263781317415, + "grad_norm": 0.5461704134941101, + "learning_rate": 4.986402598798139e-05, + "loss": 0.2902, + "mean_token_accuracy": 0.9418439865112305, + "num_tokens": 1379894.0, + "step": 659 + }, + { + "epoch": 0.005455492275518892, + "grad_norm": 0.40486854314804077, + "learning_rate": 4.986381934054671e-05, + "loss": 0.2201, + "mean_token_accuracy": 0.9576693177223206, + "num_tokens": 1381908.0, + "step": 660 + }, + { + "epoch": 0.005463758172906042, + "grad_norm": 0.39104777574539185, + "learning_rate": 4.986361269311203e-05, + "loss": 0.199, + "mean_token_accuracy": 0.9594391584396362, + "num_tokens": 1383911.0, + "step": 661 + }, + { + "epoch": 0.005472024070293191, + "grad_norm": 0.4896831512451172, + "learning_rate": 4.9863406045677354e-05, + "loss": 0.2927, + "mean_token_accuracy": 0.9400094747543335, + "num_tokens": 1386034.0, + "step": 662 + }, + { + "epoch": 0.005480289967680341, + "grad_norm": 0.39970508217811584, + "learning_rate": 4.986319939824267e-05, + "loss": 0.1597, + "mean_token_accuracy": 0.96546471118927, + "num_tokens": 1388009.0, + "step": 663 + }, + { + "epoch": 0.005488555865067491, + "grad_norm": 0.4880525469779968, + "learning_rate": 4.9862992750808e-05, + "loss": 0.2554, + "mean_token_accuracy": 0.9509470462799072, + "num_tokens": 1390074.0, + "step": 664 + }, + { + "epoch": 0.005496821762454641, + "grad_norm": 0.38858509063720703, + "learning_rate": 4.986278610337332e-05, + "loss": 0.2024, + "mean_token_accuracy": 0.9606181383132935, + "num_tokens": 1392086.0, + "step": 665 + }, + { + "epoch": 0.005505087659841791, + "grad_norm": 0.4237862527370453, + "learning_rate": 4.9862579455938633e-05, + "loss": 0.2149, + "mean_token_accuracy": 0.9590163826942444, + "num_tokens": 1394044.0, + "step": 666 + }, + { + "epoch": 0.00551335355722894, + "grad_norm": 0.3626960813999176, + "learning_rate": 4.986237280850396e-05, + "loss": 0.1563, + "mean_token_accuracy": 0.9675620794296265, + "num_tokens": 1396023.0, + "step": 667 + }, + { + "epoch": 0.005521619454616091, + "grad_norm": 0.43807655572891235, + "learning_rate": 4.986216616106928e-05, + "loss": 0.1969, + "mean_token_accuracy": 0.9539892077445984, + "num_tokens": 1398072.0, + "step": 668 + }, + { + "epoch": 0.00552988535200324, + "grad_norm": 0.4833122789859772, + "learning_rate": 4.98619595136346e-05, + "loss": 0.2412, + "mean_token_accuracy": 0.9476260542869568, + "num_tokens": 1400121.0, + "step": 669 + }, + { + "epoch": 0.00553815124939039, + "grad_norm": 0.28978195786476135, + "learning_rate": 4.986175286619992e-05, + "loss": 0.1628, + "mean_token_accuracy": 0.9713701605796814, + "num_tokens": 1402083.0, + "step": 670 + }, + { + "epoch": 0.00554641714677754, + "grad_norm": 0.34871920943260193, + "learning_rate": 4.986154621876524e-05, + "loss": 0.1755, + "mean_token_accuracy": 0.9663485884666443, + "num_tokens": 1404080.0, + "step": 671 + }, + { + "epoch": 0.00555468304416469, + "grad_norm": 0.32516831159591675, + "learning_rate": 4.9861339571330563e-05, + "loss": 0.1559, + "mean_token_accuracy": 0.9718237519264221, + "num_tokens": 1406038.0, + "step": 672 + }, + { + "epoch": 0.00556294894155184, + "grad_norm": 0.34836143255233765, + "learning_rate": 4.9861132923895885e-05, + "loss": 0.1902, + "mean_token_accuracy": 0.9575308561325073, + "num_tokens": 1408069.0, + "step": 673 + }, + { + "epoch": 0.005571214838938989, + "grad_norm": 0.41781359910964966, + "learning_rate": 4.986092627646121e-05, + "loss": 0.2541, + "mean_token_accuracy": 0.9523809552192688, + "num_tokens": 1410112.0, + "step": 674 + }, + { + "epoch": 0.005579480736326139, + "grad_norm": 0.43378257751464844, + "learning_rate": 4.986071962902653e-05, + "loss": 0.2344, + "mean_token_accuracy": 0.9537628889083862, + "num_tokens": 1412151.0, + "step": 675 + }, + { + "epoch": 0.0055877466337132895, + "grad_norm": 0.3090350031852722, + "learning_rate": 4.986051298159185e-05, + "loss": 0.1337, + "mean_token_accuracy": 0.9713408350944519, + "num_tokens": 1414111.0, + "step": 676 + }, + { + "epoch": 0.005596012531100439, + "grad_norm": 0.3500804901123047, + "learning_rate": 4.986030633415717e-05, + "loss": 0.188, + "mean_token_accuracy": 0.959857702255249, + "num_tokens": 1416085.0, + "step": 677 + }, + { + "epoch": 0.005604278428487589, + "grad_norm": 0.38729560375213623, + "learning_rate": 4.9860099686722487e-05, + "loss": 0.252, + "mean_token_accuracy": 0.9494900703430176, + "num_tokens": 1418150.0, + "step": 678 + }, + { + "epoch": 0.005612544325874738, + "grad_norm": 0.42061978578567505, + "learning_rate": 4.9859893039287815e-05, + "loss": 0.2006, + "mean_token_accuracy": 0.9550173282623291, + "num_tokens": 1420179.0, + "step": 679 + }, + { + "epoch": 0.0056208102232618885, + "grad_norm": 0.4347386956214905, + "learning_rate": 4.985968639185313e-05, + "loss": 0.1974, + "mean_token_accuracy": 0.9583333134651184, + "num_tokens": 1422201.0, + "step": 680 + }, + { + "epoch": 0.005629076120649038, + "grad_norm": 0.3133489489555359, + "learning_rate": 4.985947974441845e-05, + "loss": 0.1303, + "mean_token_accuracy": 0.9709035158157349, + "num_tokens": 1424166.0, + "step": 681 + }, + { + "epoch": 0.005637342018036188, + "grad_norm": 0.3719736337661743, + "learning_rate": 4.985927309698378e-05, + "loss": 0.1545, + "mean_token_accuracy": 0.96546471118927, + "num_tokens": 1426141.0, + "step": 682 + }, + { + "epoch": 0.005645607915423338, + "grad_norm": 0.34936827421188354, + "learning_rate": 4.9859066449549095e-05, + "loss": 0.1429, + "mean_token_accuracy": 0.9701952934265137, + "num_tokens": 1428093.0, + "step": 683 + }, + { + "epoch": 0.0056538738128104876, + "grad_norm": 0.46590298414230347, + "learning_rate": 4.985885980211442e-05, + "loss": 0.1757, + "mean_token_accuracy": 0.9638971090316772, + "num_tokens": 1430121.0, + "step": 684 + }, + { + "epoch": 0.005662139710197638, + "grad_norm": 0.3431544303894043, + "learning_rate": 4.985865315467974e-05, + "loss": 0.1753, + "mean_token_accuracy": 0.9636363387107849, + "num_tokens": 1432107.0, + "step": 685 + }, + { + "epoch": 0.005670405607584787, + "grad_norm": 0.3336385488510132, + "learning_rate": 4.985844650724506e-05, + "loss": 0.1895, + "mean_token_accuracy": 0.962705135345459, + "num_tokens": 1434124.0, + "step": 686 + }, + { + "epoch": 0.005678671504971937, + "grad_norm": 0.3304632008075714, + "learning_rate": 4.985823985981039e-05, + "loss": 0.1595, + "mean_token_accuracy": 0.9657947421073914, + "num_tokens": 1436118.0, + "step": 687 + }, + { + "epoch": 0.0056869374023590874, + "grad_norm": 0.5806984901428223, + "learning_rate": 4.98580332123757e-05, + "loss": 0.348, + "mean_token_accuracy": 0.9307909607887268, + "num_tokens": 1438248.0, + "step": 688 + }, + { + "epoch": 0.005695203299746237, + "grad_norm": 0.3722713887691498, + "learning_rate": 4.9857826564941025e-05, + "loss": 0.2137, + "mean_token_accuracy": 0.9550617337226868, + "num_tokens": 1440279.0, + "step": 689 + }, + { + "epoch": 0.005703469197133387, + "grad_norm": 0.4312034845352173, + "learning_rate": 4.9857619917506346e-05, + "loss": 0.1649, + "mean_token_accuracy": 0.9646191596984863, + "num_tokens": 1442320.0, + "step": 690 + }, + { + "epoch": 0.005711735094520536, + "grad_norm": 0.32912158966064453, + "learning_rate": 4.985741327007167e-05, + "loss": 0.1679, + "mean_token_accuracy": 0.9644444584846497, + "num_tokens": 1444351.0, + "step": 691 + }, + { + "epoch": 0.0057200009919076865, + "grad_norm": 0.3393937051296234, + "learning_rate": 4.985720662263699e-05, + "loss": 0.1401, + "mean_token_accuracy": 0.9711340069770813, + "num_tokens": 1446297.0, + "step": 692 + }, + { + "epoch": 0.005728266889294837, + "grad_norm": 0.3419071137905121, + "learning_rate": 4.985699997520231e-05, + "loss": 0.161, + "mean_token_accuracy": 0.965482234954834, + "num_tokens": 1448273.0, + "step": 693 + }, + { + "epoch": 0.005736532786681986, + "grad_norm": 0.400582879781723, + "learning_rate": 4.985679332776763e-05, + "loss": 0.2005, + "mean_token_accuracy": 0.959673285484314, + "num_tokens": 1450238.0, + "step": 694 + }, + { + "epoch": 0.005744798684069136, + "grad_norm": 0.31403979659080505, + "learning_rate": 4.985658668033295e-05, + "loss": 0.16, + "mean_token_accuracy": 0.9657288789749146, + "num_tokens": 1452199.0, + "step": 695 + }, + { + "epoch": 0.0057530645814562855, + "grad_norm": 0.4190968871116638, + "learning_rate": 4.9856380032898276e-05, + "loss": 0.1924, + "mean_token_accuracy": 0.9628687500953674, + "num_tokens": 1454171.0, + "step": 696 + }, + { + "epoch": 0.005761330478843436, + "grad_norm": 0.3504311144351959, + "learning_rate": 4.98561733854636e-05, + "loss": 0.1736, + "mean_token_accuracy": 0.9641594886779785, + "num_tokens": 1456158.0, + "step": 697 + }, + { + "epoch": 0.005769596376230586, + "grad_norm": 0.400316447019577, + "learning_rate": 4.985596673802891e-05, + "loss": 0.1664, + "mean_token_accuracy": 0.9645748734474182, + "num_tokens": 1458140.0, + "step": 698 + }, + { + "epoch": 0.005777862273617735, + "grad_norm": 0.36822885274887085, + "learning_rate": 4.985576009059424e-05, + "loss": 0.1905, + "mean_token_accuracy": 0.9655516743659973, + "num_tokens": 1460149.0, + "step": 699 + }, + { + "epoch": 0.005786128171004885, + "grad_norm": 0.35863491892814636, + "learning_rate": 4.9855553443159556e-05, + "loss": 0.1705, + "mean_token_accuracy": 0.9621976017951965, + "num_tokens": 1462139.0, + "step": 700 + }, + { + "epoch": 0.005794394068392035, + "grad_norm": 0.3071357011795044, + "learning_rate": 4.985534679572488e-05, + "loss": 0.1452, + "mean_token_accuracy": 0.9687179327011108, + "num_tokens": 1464095.0, + "step": 701 + }, + { + "epoch": 0.005802659965779185, + "grad_norm": 0.35435113310813904, + "learning_rate": 4.98551401482902e-05, + "loss": 0.1858, + "mean_token_accuracy": 0.9593373537063599, + "num_tokens": 1466093.0, + "step": 702 + }, + { + "epoch": 0.005810925863166335, + "grad_norm": 0.4352758526802063, + "learning_rate": 4.985493350085552e-05, + "loss": 0.241, + "mean_token_accuracy": 0.9529354572296143, + "num_tokens": 1468160.0, + "step": 703 + }, + { + "epoch": 0.005819191760553484, + "grad_norm": 0.3950839042663574, + "learning_rate": 4.985472685342085e-05, + "loss": 0.1652, + "mean_token_accuracy": 0.9668808579444885, + "num_tokens": 1470189.0, + "step": 704 + }, + { + "epoch": 0.0058274576579406346, + "grad_norm": 0.37273624539375305, + "learning_rate": 4.9854520205986165e-05, + "loss": 0.2047, + "mean_token_accuracy": 0.9579207897186279, + "num_tokens": 1472215.0, + "step": 705 + }, + { + "epoch": 0.005835723555327784, + "grad_norm": 0.5543181896209717, + "learning_rate": 4.9854313558551486e-05, + "loss": 0.2127, + "mean_token_accuracy": 0.9566075205802917, + "num_tokens": 1474249.0, + "step": 706 + }, + { + "epoch": 0.005843989452714934, + "grad_norm": 0.34716540575027466, + "learning_rate": 4.985410691111681e-05, + "loss": 0.1599, + "mean_token_accuracy": 0.9681233763694763, + "num_tokens": 1476200.0, + "step": 707 + }, + { + "epoch": 0.005852255350102084, + "grad_norm": 0.38925662636756897, + "learning_rate": 4.985390026368213e-05, + "loss": 0.2115, + "mean_token_accuracy": 0.9577187895774841, + "num_tokens": 1478240.0, + "step": 708 + }, + { + "epoch": 0.005860521247489234, + "grad_norm": 0.44542396068573, + "learning_rate": 4.985369361624745e-05, + "loss": 0.2563, + "mean_token_accuracy": 0.9501234292984009, + "num_tokens": 1480271.0, + "step": 709 + }, + { + "epoch": 0.005868787144876384, + "grad_norm": 0.3741936683654785, + "learning_rate": 4.985348696881277e-05, + "loss": 0.2109, + "mean_token_accuracy": 0.9556331038475037, + "num_tokens": 1482283.0, + "step": 710 + }, + { + "epoch": 0.005877053042263533, + "grad_norm": 0.3294547498226166, + "learning_rate": 4.9853280321378094e-05, + "loss": 0.1609, + "mean_token_accuracy": 0.9708737730979919, + "num_tokens": 1484246.0, + "step": 711 + }, + { + "epoch": 0.005885318939650683, + "grad_norm": 0.3919965922832489, + "learning_rate": 4.985307367394341e-05, + "loss": 0.1829, + "mean_token_accuracy": 0.9602415561676025, + "num_tokens": 1486239.0, + "step": 712 + }, + { + "epoch": 0.005893584837037833, + "grad_norm": 0.36469322443008423, + "learning_rate": 4.985286702650874e-05, + "loss": 0.2058, + "mean_token_accuracy": 0.9588972330093384, + "num_tokens": 1488240.0, + "step": 713 + }, + { + "epoch": 0.005901850734424983, + "grad_norm": 0.4072090685367584, + "learning_rate": 4.985266037907406e-05, + "loss": 0.2107, + "mean_token_accuracy": 0.9603456854820251, + "num_tokens": 1490213.0, + "step": 714 + }, + { + "epoch": 0.005910116631812133, + "grad_norm": 0.31470343470573425, + "learning_rate": 4.9852453731639374e-05, + "loss": 0.1809, + "mean_token_accuracy": 0.9616342782974243, + "num_tokens": 1492226.0, + "step": 715 + }, + { + "epoch": 0.005918382529199282, + "grad_norm": 0.3966371715068817, + "learning_rate": 4.98522470842047e-05, + "loss": 0.1953, + "mean_token_accuracy": 0.964092493057251, + "num_tokens": 1494265.0, + "step": 716 + }, + { + "epoch": 0.0059266484265864325, + "grad_norm": 0.3984452486038208, + "learning_rate": 4.985204043677002e-05, + "loss": 0.2752, + "mean_token_accuracy": 0.938804566860199, + "num_tokens": 1496379.0, + "step": 717 + }, + { + "epoch": 0.005934914323973582, + "grad_norm": 0.36626997590065, + "learning_rate": 4.985183378933534e-05, + "loss": 0.2399, + "mean_token_accuracy": 0.951604962348938, + "num_tokens": 1498410.0, + "step": 718 + }, + { + "epoch": 0.005943180221360732, + "grad_norm": 0.5053192377090454, + "learning_rate": 4.985162714190066e-05, + "loss": 0.2012, + "mean_token_accuracy": 0.9546350836753845, + "num_tokens": 1500444.0, + "step": 719 + }, + { + "epoch": 0.005951446118747882, + "grad_norm": 0.40764230489730835, + "learning_rate": 4.985142049446598e-05, + "loss": 0.242, + "mean_token_accuracy": 0.9532338380813599, + "num_tokens": 1502460.0, + "step": 720 + }, + { + "epoch": 0.0059597120161350315, + "grad_norm": 0.3426690101623535, + "learning_rate": 4.9851213847031304e-05, + "loss": 0.1655, + "mean_token_accuracy": 0.9657084941864014, + "num_tokens": 1504449.0, + "step": 721 + }, + { + "epoch": 0.005967977913522182, + "grad_norm": 0.37115100026130676, + "learning_rate": 4.9851007199596626e-05, + "loss": 0.1552, + "mean_token_accuracy": 0.9694430828094482, + "num_tokens": 1506484.0, + "step": 722 + }, + { + "epoch": 0.005976243810909331, + "grad_norm": 0.30470573902130127, + "learning_rate": 4.985080055216195e-05, + "loss": 0.1357, + "mean_token_accuracy": 0.972708523273468, + "num_tokens": 1508432.0, + "step": 723 + }, + { + "epoch": 0.005984509708296481, + "grad_norm": 0.42090368270874023, + "learning_rate": 4.985059390472727e-05, + "loss": 0.1951, + "mean_token_accuracy": 0.9596211314201355, + "num_tokens": 1510444.0, + "step": 724 + }, + { + "epoch": 0.005992775605683631, + "grad_norm": 0.44461822509765625, + "learning_rate": 4.985038725729259e-05, + "loss": 0.2102, + "mean_token_accuracy": 0.9578524827957153, + "num_tokens": 1512443.0, + "step": 725 + }, + { + "epoch": 0.006001041503070781, + "grad_norm": 0.30949079990386963, + "learning_rate": 4.985018060985791e-05, + "loss": 0.1453, + "mean_token_accuracy": 0.9671120047569275, + "num_tokens": 1514395.0, + "step": 726 + }, + { + "epoch": 0.006009307400457931, + "grad_norm": 0.3812202513217926, + "learning_rate": 4.9849973962423234e-05, + "loss": 0.1889, + "mean_token_accuracy": 0.9578736424446106, + "num_tokens": 1516395.0, + "step": 727 + }, + { + "epoch": 0.00601757329784508, + "grad_norm": 0.3606492877006531, + "learning_rate": 4.9849767314988556e-05, + "loss": 0.1626, + "mean_token_accuracy": 0.9687339663505554, + "num_tokens": 1518352.0, + "step": 728 + }, + { + "epoch": 0.00602583919523223, + "grad_norm": 0.4418604373931885, + "learning_rate": 4.984956066755387e-05, + "loss": 0.2059, + "mean_token_accuracy": 0.955610990524292, + "num_tokens": 1520363.0, + "step": 729 + }, + { + "epoch": 0.006034105092619381, + "grad_norm": 0.5098370909690857, + "learning_rate": 4.98493540201192e-05, + "loss": 0.2185, + "mean_token_accuracy": 0.9520514011383057, + "num_tokens": 1522392.0, + "step": 730 + }, + { + "epoch": 0.00604237099000653, + "grad_norm": 0.43088775873184204, + "learning_rate": 4.984914737268452e-05, + "loss": 0.2158, + "mean_token_accuracy": 0.9557788968086243, + "num_tokens": 1524388.0, + "step": 731 + }, + { + "epoch": 0.00605063688739368, + "grad_norm": 0.44536110758781433, + "learning_rate": 4.9848940725249836e-05, + "loss": 0.2113, + "mean_token_accuracy": 0.9576771855354309, + "num_tokens": 1526426.0, + "step": 732 + }, + { + "epoch": 0.006058902784780829, + "grad_norm": 0.3841190040111542, + "learning_rate": 4.9848734077815164e-05, + "loss": 0.1936, + "mean_token_accuracy": 0.9607160687446594, + "num_tokens": 1528443.0, + "step": 733 + }, + { + "epoch": 0.00606716868216798, + "grad_norm": 0.3974607586860657, + "learning_rate": 4.984852743038048e-05, + "loss": 0.225, + "mean_token_accuracy": 0.9522872567176819, + "num_tokens": 1530482.0, + "step": 734 + }, + { + "epoch": 0.00607543457955513, + "grad_norm": 0.37308064103126526, + "learning_rate": 4.98483207829458e-05, + "loss": 0.1955, + "mean_token_accuracy": 0.9607160687446594, + "num_tokens": 1532499.0, + "step": 735 + }, + { + "epoch": 0.006083700476942279, + "grad_norm": 0.41781359910964966, + "learning_rate": 4.984811413551113e-05, + "loss": 0.1806, + "mean_token_accuracy": 0.9641594886779785, + "num_tokens": 1534486.0, + "step": 736 + }, + { + "epoch": 0.006091966374329429, + "grad_norm": 0.4266640841960907, + "learning_rate": 4.9847907488076444e-05, + "loss": 0.2105, + "mean_token_accuracy": 0.9561315774917603, + "num_tokens": 1536498.0, + "step": 737 + }, + { + "epoch": 0.006100232271716579, + "grad_norm": 0.48743149638175964, + "learning_rate": 4.9847700840641766e-05, + "loss": 0.2462, + "mean_token_accuracy": 0.9492971897125244, + "num_tokens": 1538496.0, + "step": 738 + }, + { + "epoch": 0.006108498169103729, + "grad_norm": 0.3538137674331665, + "learning_rate": 4.984749419320709e-05, + "loss": 0.164, + "mean_token_accuracy": 0.9655521512031555, + "num_tokens": 1540476.0, + "step": 739 + }, + { + "epoch": 0.006116764066490879, + "grad_norm": 0.40453362464904785, + "learning_rate": 4.984728754577241e-05, + "loss": 0.2461, + "mean_token_accuracy": 0.9468982815742493, + "num_tokens": 1542497.0, + "step": 740 + }, + { + "epoch": 0.006125029963878028, + "grad_norm": 0.38154086470603943, + "learning_rate": 4.984708089833773e-05, + "loss": 0.183, + "mean_token_accuracy": 0.9572815299034119, + "num_tokens": 1544563.0, + "step": 741 + }, + { + "epoch": 0.0061332958612651785, + "grad_norm": 0.3262519836425781, + "learning_rate": 4.984687425090305e-05, + "loss": 0.1605, + "mean_token_accuracy": 0.9671385288238525, + "num_tokens": 1546547.0, + "step": 742 + }, + { + "epoch": 0.006141561758652328, + "grad_norm": 0.4108532965183258, + "learning_rate": 4.9846667603468374e-05, + "loss": 0.2542, + "mean_token_accuracy": 0.9488054513931274, + "num_tokens": 1548604.0, + "step": 743 + }, + { + "epoch": 0.006149827656039478, + "grad_norm": 0.35494884848594666, + "learning_rate": 4.984646095603369e-05, + "loss": 0.1819, + "mean_token_accuracy": 0.9633482098579407, + "num_tokens": 1550629.0, + "step": 744 + }, + { + "epoch": 0.006158093553426627, + "grad_norm": 0.40606263279914856, + "learning_rate": 4.984625430859902e-05, + "loss": 0.2148, + "mean_token_accuracy": 0.9566968679428101, + "num_tokens": 1552621.0, + "step": 745 + }, + { + "epoch": 0.0061663594508137775, + "grad_norm": 0.44487881660461426, + "learning_rate": 4.984604766116434e-05, + "loss": 0.3033, + "mean_token_accuracy": 0.9479572176933289, + "num_tokens": 1554683.0, + "step": 746 + }, + { + "epoch": 0.006174625348200928, + "grad_norm": 0.40845802426338196, + "learning_rate": 4.984584101372966e-05, + "loss": 0.222, + "mean_token_accuracy": 0.9511957168579102, + "num_tokens": 1556738.0, + "step": 747 + }, + { + "epoch": 0.006182891245588077, + "grad_norm": 0.3766586184501648, + "learning_rate": 4.984563436629498e-05, + "loss": 0.2169, + "mean_token_accuracy": 0.9517953991889954, + "num_tokens": 1558777.0, + "step": 748 + }, + { + "epoch": 0.006191157142975227, + "grad_norm": 0.33251988887786865, + "learning_rate": 4.98454277188603e-05, + "loss": 0.2064, + "mean_token_accuracy": 0.9600818753242493, + "num_tokens": 1560737.0, + "step": 749 + }, + { + "epoch": 0.0061994230403623765, + "grad_norm": 0.47217926383018494, + "learning_rate": 4.9845221071425626e-05, + "loss": 0.265, + "mean_token_accuracy": 0.944735586643219, + "num_tokens": 1562842.0, + "step": 750 + }, + { + "epoch": 0.006207688937749527, + "grad_norm": 0.4406071603298187, + "learning_rate": 4.984501442399094e-05, + "loss": 0.2143, + "mean_token_accuracy": 0.9543269276618958, + "num_tokens": 1564928.0, + "step": 751 + }, + { + "epoch": 0.006215954835136677, + "grad_norm": 0.41328927874565125, + "learning_rate": 4.984480777655626e-05, + "loss": 0.2182, + "mean_token_accuracy": 0.9553526043891907, + "num_tokens": 1566905.0, + "step": 752 + }, + { + "epoch": 0.006224220732523826, + "grad_norm": 0.3252612054347992, + "learning_rate": 4.984460112912159e-05, + "loss": 0.1835, + "mean_token_accuracy": 0.9661957621574402, + "num_tokens": 1568893.0, + "step": 753 + }, + { + "epoch": 0.006232486629910976, + "grad_norm": 0.46232733130455017, + "learning_rate": 4.9844394481686905e-05, + "loss": 0.1971, + "mean_token_accuracy": 0.9598413705825806, + "num_tokens": 1570916.0, + "step": 754 + }, + { + "epoch": 0.006240752527298126, + "grad_norm": 0.5029892325401306, + "learning_rate": 4.984418783425223e-05, + "loss": 0.267, + "mean_token_accuracy": 0.9429529905319214, + "num_tokens": 1573008.0, + "step": 755 + }, + { + "epoch": 0.006249018424685276, + "grad_norm": 0.4175070822238922, + "learning_rate": 4.984398118681755e-05, + "loss": 0.1851, + "mean_token_accuracy": 0.9622736573219299, + "num_tokens": 1575002.0, + "step": 756 + }, + { + "epoch": 0.006257284322072426, + "grad_norm": 0.4172671139240265, + "learning_rate": 4.984377453938287e-05, + "loss": 0.1826, + "mean_token_accuracy": 0.9615960121154785, + "num_tokens": 1577013.0, + "step": 757 + }, + { + "epoch": 0.0062655502194595755, + "grad_norm": 0.46920254826545715, + "learning_rate": 4.984356789194819e-05, + "loss": 0.1991, + "mean_token_accuracy": 0.9572271108627319, + "num_tokens": 1579053.0, + "step": 758 + }, + { + "epoch": 0.006273816116846726, + "grad_norm": 0.5021358132362366, + "learning_rate": 4.9843361244513514e-05, + "loss": 0.2116, + "mean_token_accuracy": 0.957446813583374, + "num_tokens": 1581080.0, + "step": 759 + }, + { + "epoch": 0.006282082014233875, + "grad_norm": 0.5324921607971191, + "learning_rate": 4.9843154597078835e-05, + "loss": 0.2597, + "mean_token_accuracy": 0.9497762322425842, + "num_tokens": 1583097.0, + "step": 760 + }, + { + "epoch": 0.006290347911621025, + "grad_norm": 0.46022337675094604, + "learning_rate": 4.984294794964415e-05, + "loss": 0.211, + "mean_token_accuracy": 0.95556640625, + "num_tokens": 1585151.0, + "step": 761 + }, + { + "epoch": 0.006298613809008175, + "grad_norm": 0.5305765867233276, + "learning_rate": 4.984274130220948e-05, + "loss": 0.2442, + "mean_token_accuracy": 0.9534769654273987, + "num_tokens": 1587199.0, + "step": 762 + }, + { + "epoch": 0.006306879706395325, + "grad_norm": 0.45197245478630066, + "learning_rate": 4.98425346547748e-05, + "loss": 0.1875, + "mean_token_accuracy": 0.9638554453849792, + "num_tokens": 1589197.0, + "step": 763 + }, + { + "epoch": 0.006315145603782475, + "grad_norm": 0.6175044178962708, + "learning_rate": 4.9842328007340115e-05, + "loss": 0.2469, + "mean_token_accuracy": 0.9531639218330383, + "num_tokens": 1591210.0, + "step": 764 + }, + { + "epoch": 0.006323411501169624, + "grad_norm": 0.4388083517551422, + "learning_rate": 4.9842121359905444e-05, + "loss": 0.1925, + "mean_token_accuracy": 0.9600202441215515, + "num_tokens": 1593192.0, + "step": 765 + }, + { + "epoch": 0.006331677398556774, + "grad_norm": 0.31428417563438416, + "learning_rate": 4.984191471247076e-05, + "loss": 0.15, + "mean_token_accuracy": 0.9669883251190186, + "num_tokens": 1595167.0, + "step": 766 + }, + { + "epoch": 0.0063399432959439245, + "grad_norm": 0.3937251567840576, + "learning_rate": 4.984170806503609e-05, + "loss": 0.2185, + "mean_token_accuracy": 0.9576399326324463, + "num_tokens": 1597156.0, + "step": 767 + }, + { + "epoch": 0.006348209193331074, + "grad_norm": 0.604350745677948, + "learning_rate": 4.98415014176014e-05, + "loss": 0.2357, + "mean_token_accuracy": 0.9501222372055054, + "num_tokens": 1599207.0, + "step": 768 + }, + { + "epoch": 0.006356475090718224, + "grad_norm": 0.4153241813182831, + "learning_rate": 4.9841294770166723e-05, + "loss": 0.223, + "mean_token_accuracy": 0.9524281620979309, + "num_tokens": 1601231.0, + "step": 769 + }, + { + "epoch": 0.006364740988105373, + "grad_norm": 0.348738431930542, + "learning_rate": 4.984108812273205e-05, + "loss": 0.1687, + "mean_token_accuracy": 0.9661102890968323, + "num_tokens": 1603214.0, + "step": 770 + }, + { + "epoch": 0.0063730068854925236, + "grad_norm": 0.3460107147693634, + "learning_rate": 4.984088147529737e-05, + "loss": 0.2187, + "mean_token_accuracy": 0.9582914710044861, + "num_tokens": 1605210.0, + "step": 771 + }, + { + "epoch": 0.006381272782879674, + "grad_norm": 0.2992319166660309, + "learning_rate": 4.984067482786269e-05, + "loss": 0.176, + "mean_token_accuracy": 0.9650025963783264, + "num_tokens": 1607159.0, + "step": 772 + }, + { + "epoch": 0.006389538680266823, + "grad_norm": 0.39421042799949646, + "learning_rate": 4.984046818042801e-05, + "loss": 0.1806, + "mean_token_accuracy": 0.9619145393371582, + "num_tokens": 1609108.0, + "step": 773 + }, + { + "epoch": 0.006397804577653973, + "grad_norm": 0.48183563351631165, + "learning_rate": 4.984026153299333e-05, + "loss": 0.2403, + "mean_token_accuracy": 0.9539215564727783, + "num_tokens": 1611154.0, + "step": 774 + }, + { + "epoch": 0.006406070475041123, + "grad_norm": 0.48275473713874817, + "learning_rate": 4.9840054885558653e-05, + "loss": 0.2541, + "mean_token_accuracy": 0.95068359375, + "num_tokens": 1613208.0, + "step": 775 + }, + { + "epoch": 0.006414336372428273, + "grad_norm": 0.3698482811450958, + "learning_rate": 4.9839848238123975e-05, + "loss": 0.1622, + "mean_token_accuracy": 0.9680905938148499, + "num_tokens": 1615157.0, + "step": 776 + }, + { + "epoch": 0.006422602269815422, + "grad_norm": 0.47950881719589233, + "learning_rate": 4.98396415906893e-05, + "loss": 0.2692, + "mean_token_accuracy": 0.9491771459579468, + "num_tokens": 1617229.0, + "step": 777 + }, + { + "epoch": 0.006430868167202572, + "grad_norm": 0.49546265602111816, + "learning_rate": 4.983943494325461e-05, + "loss": 0.2288, + "mean_token_accuracy": 0.9608826637268066, + "num_tokens": 1619229.0, + "step": 778 + }, + { + "epoch": 0.0064391340645897225, + "grad_norm": 0.524799644947052, + "learning_rate": 4.983922829581994e-05, + "loss": 0.2265, + "mean_token_accuracy": 0.9513034820556641, + "num_tokens": 1621268.0, + "step": 779 + }, + { + "epoch": 0.006447399961976872, + "grad_norm": 0.3272992968559265, + "learning_rate": 4.983902164838526e-05, + "loss": 0.1507, + "mean_token_accuracy": 0.9721074104309082, + "num_tokens": 1623210.0, + "step": 780 + }, + { + "epoch": 0.006455665859364022, + "grad_norm": 0.4449158310890198, + "learning_rate": 4.9838815000950577e-05, + "loss": 0.1857, + "mean_token_accuracy": 0.95839524269104, + "num_tokens": 1625235.0, + "step": 781 + }, + { + "epoch": 0.006463931756751171, + "grad_norm": 0.4281235337257385, + "learning_rate": 4.9838608353515905e-05, + "loss": 0.2276, + "mean_token_accuracy": 0.9552311301231384, + "num_tokens": 1627296.0, + "step": 782 + }, + { + "epoch": 0.0064721976541383215, + "grad_norm": 0.3788045644760132, + "learning_rate": 4.983840170608122e-05, + "loss": 0.2067, + "mean_token_accuracy": 0.9588701725006104, + "num_tokens": 1629320.0, + "step": 783 + }, + { + "epoch": 0.006480463551525472, + "grad_norm": 0.393130898475647, + "learning_rate": 4.983819505864654e-05, + "loss": 0.1676, + "mean_token_accuracy": 0.9674631357192993, + "num_tokens": 1631293.0, + "step": 784 + }, + { + "epoch": 0.006488729448912621, + "grad_norm": 0.399342805147171, + "learning_rate": 4.983798841121187e-05, + "loss": 0.1712, + "mean_token_accuracy": 0.9649649858474731, + "num_tokens": 1633297.0, + "step": 785 + }, + { + "epoch": 0.006496995346299771, + "grad_norm": 0.40883710980415344, + "learning_rate": 4.9837781763777185e-05, + "loss": 0.1974, + "mean_token_accuracy": 0.9562841653823853, + "num_tokens": 1635316.0, + "step": 786 + }, + { + "epoch": 0.0065052612436869205, + "grad_norm": 0.3678262531757355, + "learning_rate": 4.983757511634251e-05, + "loss": 0.1625, + "mean_token_accuracy": 0.9673635959625244, + "num_tokens": 1637283.0, + "step": 787 + }, + { + "epoch": 0.006513527141074071, + "grad_norm": 0.3532010614871979, + "learning_rate": 4.983736846890783e-05, + "loss": 0.1678, + "mean_token_accuracy": 0.9671551585197449, + "num_tokens": 1639268.0, + "step": 788 + }, + { + "epoch": 0.006521793038461221, + "grad_norm": 0.4240894913673401, + "learning_rate": 4.983716182147315e-05, + "loss": 0.2367, + "mean_token_accuracy": 0.9500489830970764, + "num_tokens": 1641316.0, + "step": 789 + }, + { + "epoch": 0.00653005893584837, + "grad_norm": 0.5130672454833984, + "learning_rate": 4.983695517403847e-05, + "loss": 0.2024, + "mean_token_accuracy": 0.9548192620277405, + "num_tokens": 1643314.0, + "step": 790 + }, + { + "epoch": 0.00653832483323552, + "grad_norm": 0.3678853213787079, + "learning_rate": 4.983674852660379e-05, + "loss": 0.1492, + "mean_token_accuracy": 0.9689092636108398, + "num_tokens": 1645282.0, + "step": 791 + }, + { + "epoch": 0.00654659073062267, + "grad_norm": 0.3945569396018982, + "learning_rate": 4.9836541879169115e-05, + "loss": 0.1749, + "mean_token_accuracy": 0.9648689031600952, + "num_tokens": 1647309.0, + "step": 792 + }, + { + "epoch": 0.00655485662800982, + "grad_norm": 0.48077425360679626, + "learning_rate": 4.9836335231734436e-05, + "loss": 0.1986, + "mean_token_accuracy": 0.9593781232833862, + "num_tokens": 1649309.0, + "step": 793 + }, + { + "epoch": 0.00656312252539697, + "grad_norm": 0.4411054849624634, + "learning_rate": 4.983612858429976e-05, + "loss": 0.1864, + "mean_token_accuracy": 0.9590842723846436, + "num_tokens": 1651368.0, + "step": 794 + }, + { + "epoch": 0.006571388422784119, + "grad_norm": 0.3010132312774658, + "learning_rate": 4.983592193686508e-05, + "loss": 0.162, + "mean_token_accuracy": 0.9670050740242004, + "num_tokens": 1653344.0, + "step": 795 + }, + { + "epoch": 0.00657965432017127, + "grad_norm": 0.4571327567100525, + "learning_rate": 4.98357152894304e-05, + "loss": 0.1738, + "mean_token_accuracy": 0.9667689204216003, + "num_tokens": 1655306.0, + "step": 796 + }, + { + "epoch": 0.006587920217558419, + "grad_norm": 0.4823872148990631, + "learning_rate": 4.983550864199572e-05, + "loss": 0.269, + "mean_token_accuracy": 0.9479768872261047, + "num_tokens": 1657388.0, + "step": 797 + }, + { + "epoch": 0.006596186114945569, + "grad_norm": 0.405563622713089, + "learning_rate": 4.983530199456104e-05, + "loss": 0.191, + "mean_token_accuracy": 0.9608142375946045, + "num_tokens": 1659359.0, + "step": 798 + }, + { + "epoch": 0.006604452012332719, + "grad_norm": 0.4063994288444519, + "learning_rate": 4.9835095347126366e-05, + "loss": 0.1593, + "mean_token_accuracy": 0.9664121866226196, + "num_tokens": 1661330.0, + "step": 799 + }, + { + "epoch": 0.006612717909719869, + "grad_norm": 0.4480558931827545, + "learning_rate": 4.983488869969168e-05, + "loss": 0.1881, + "mean_token_accuracy": 0.9653121829032898, + "num_tokens": 1663354.0, + "step": 800 + }, + { + "epoch": 0.006620983807107019, + "grad_norm": 0.4080691337585449, + "learning_rate": 4.9834682052257e-05, + "loss": 0.1976, + "mean_token_accuracy": 0.9613478779792786, + "num_tokens": 1665378.0, + "step": 801 + }, + { + "epoch": 0.006629249704494168, + "grad_norm": 0.5544767379760742, + "learning_rate": 4.983447540482233e-05, + "loss": 0.1827, + "mean_token_accuracy": 0.9623202681541443, + "num_tokens": 1667401.0, + "step": 802 + }, + { + "epoch": 0.006637515601881318, + "grad_norm": 0.4864117205142975, + "learning_rate": 4.9834268757387646e-05, + "loss": 0.1838, + "mean_token_accuracy": 0.9603658318519592, + "num_tokens": 1669375.0, + "step": 803 + }, + { + "epoch": 0.0066457814992684685, + "grad_norm": 0.34529808163642883, + "learning_rate": 4.983406210995297e-05, + "loss": 0.1526, + "mean_token_accuracy": 0.9655880928039551, + "num_tokens": 1671328.0, + "step": 804 + }, + { + "epoch": 0.006654047396655618, + "grad_norm": 0.39255163073539734, + "learning_rate": 4.983385546251829e-05, + "loss": 0.1954, + "mean_token_accuracy": 0.959919810295105, + "num_tokens": 1673330.0, + "step": 805 + }, + { + "epoch": 0.006662313294042768, + "grad_norm": 0.350628137588501, + "learning_rate": 4.983364881508361e-05, + "loss": 0.1415, + "mean_token_accuracy": 0.9679062366485596, + "num_tokens": 1675299.0, + "step": 806 + }, + { + "epoch": 0.006670579191429917, + "grad_norm": 0.35066065192222595, + "learning_rate": 4.983344216764893e-05, + "loss": 0.1912, + "mean_token_accuracy": 0.9628687500953674, + "num_tokens": 1677271.0, + "step": 807 + }, + { + "epoch": 0.0066788450888170675, + "grad_norm": 0.40352028608322144, + "learning_rate": 4.9833235520214255e-05, + "loss": 0.2173, + "mean_token_accuracy": 0.9588559865951538, + "num_tokens": 1679270.0, + "step": 808 + }, + { + "epoch": 0.006687110986204217, + "grad_norm": 0.34992119669914246, + "learning_rate": 4.9833028872779576e-05, + "loss": 0.1714, + "mean_token_accuracy": 0.9632089734077454, + "num_tokens": 1681233.0, + "step": 809 + }, + { + "epoch": 0.006695376883591367, + "grad_norm": 0.3540070652961731, + "learning_rate": 4.98328222253449e-05, + "loss": 0.1474, + "mean_token_accuracy": 0.9678256511688232, + "num_tokens": 1683166.0, + "step": 810 + }, + { + "epoch": 0.006703642780978517, + "grad_norm": 0.4656151235103607, + "learning_rate": 4.983261557791022e-05, + "loss": 0.1912, + "mean_token_accuracy": 0.9620128273963928, + "num_tokens": 1685199.0, + "step": 811 + }, + { + "epoch": 0.0067119086783656665, + "grad_norm": 0.5217596292495728, + "learning_rate": 4.983240893047554e-05, + "loss": 0.2457, + "mean_token_accuracy": 0.9494799375534058, + "num_tokens": 1687224.0, + "step": 812 + }, + { + "epoch": 0.006720174575752817, + "grad_norm": 0.39535465836524963, + "learning_rate": 4.983220228304086e-05, + "loss": 0.2054, + "mean_token_accuracy": 0.9591132998466492, + "num_tokens": 1689260.0, + "step": 813 + }, + { + "epoch": 0.006728440473139966, + "grad_norm": 0.38129371404647827, + "learning_rate": 4.9831995635606185e-05, + "loss": 0.1646, + "mean_token_accuracy": 0.9711099863052368, + "num_tokens": 1691239.0, + "step": 814 + }, + { + "epoch": 0.006736706370527116, + "grad_norm": 0.291294127702713, + "learning_rate": 4.98317889881715e-05, + "loss": 0.1511, + "mean_token_accuracy": 0.9708788394927979, + "num_tokens": 1693168.0, + "step": 815 + }, + { + "epoch": 0.006744972267914266, + "grad_norm": 0.466017484664917, + "learning_rate": 4.983158234073683e-05, + "loss": 0.2231, + "mean_token_accuracy": 0.9538003206253052, + "num_tokens": 1695187.0, + "step": 816 + }, + { + "epoch": 0.006753238165301416, + "grad_norm": 0.4086066484451294, + "learning_rate": 4.983137569330214e-05, + "loss": 0.1947, + "mean_token_accuracy": 0.9597585797309875, + "num_tokens": 1697181.0, + "step": 817 + }, + { + "epoch": 0.006761504062688566, + "grad_norm": 0.45003077387809753, + "learning_rate": 4.9831169045867464e-05, + "loss": 0.185, + "mean_token_accuracy": 0.9616742134094238, + "num_tokens": 1699170.0, + "step": 818 + }, + { + "epoch": 0.006769769960075715, + "grad_norm": 0.35875362157821655, + "learning_rate": 4.983096239843279e-05, + "loss": 0.1443, + "mean_token_accuracy": 0.9687026739120483, + "num_tokens": 1701157.0, + "step": 819 + }, + { + "epoch": 0.006778035857462865, + "grad_norm": 0.37253376841545105, + "learning_rate": 4.983075575099811e-05, + "loss": 0.2001, + "mean_token_accuracy": 0.9568272829055786, + "num_tokens": 1703155.0, + "step": 820 + }, + { + "epoch": 0.006786301754850016, + "grad_norm": 0.4945686459541321, + "learning_rate": 4.983054910356343e-05, + "loss": 0.3514, + "mean_token_accuracy": 0.9342105388641357, + "num_tokens": 1705289.0, + "step": 821 + }, + { + "epoch": 0.006794567652237165, + "grad_norm": 0.37332653999328613, + "learning_rate": 4.983034245612875e-05, + "loss": 0.2146, + "mean_token_accuracy": 0.9567354917526245, + "num_tokens": 1707329.0, + "step": 822 + }, + { + "epoch": 0.006802833549624315, + "grad_norm": 0.33233872056007385, + "learning_rate": 4.983013580869407e-05, + "loss": 0.1426, + "mean_token_accuracy": 0.9694656729698181, + "num_tokens": 1709300.0, + "step": 823 + }, + { + "epoch": 0.0068110994470114644, + "grad_norm": 0.48606806993484497, + "learning_rate": 4.9829929161259394e-05, + "loss": 0.2377, + "mean_token_accuracy": 0.9518013596534729, + "num_tokens": 1711360.0, + "step": 824 + }, + { + "epoch": 0.006819365344398615, + "grad_norm": 0.4521882236003876, + "learning_rate": 4.9829722513824716e-05, + "loss": 0.2607, + "mean_token_accuracy": 0.9503166079521179, + "num_tokens": 1713419.0, + "step": 825 + }, + { + "epoch": 0.006827631241785765, + "grad_norm": 0.3311852216720581, + "learning_rate": 4.982951586639004e-05, + "loss": 0.153, + "mean_token_accuracy": 0.9684317708015442, + "num_tokens": 1715389.0, + "step": 826 + }, + { + "epoch": 0.006835897139172914, + "grad_norm": 0.5356886982917786, + "learning_rate": 4.982930921895535e-05, + "loss": 0.2402, + "mean_token_accuracy": 0.9520348906517029, + "num_tokens": 1717459.0, + "step": 827 + }, + { + "epoch": 0.006844163036560064, + "grad_norm": 0.534487783908844, + "learning_rate": 4.982910257152068e-05, + "loss": 0.2511, + "mean_token_accuracy": 0.9495880007743835, + "num_tokens": 1719528.0, + "step": 828 + }, + { + "epoch": 0.006852428933947214, + "grad_norm": 0.5094696879386902, + "learning_rate": 4.9828895924086e-05, + "loss": 0.2083, + "mean_token_accuracy": 0.9571926593780518, + "num_tokens": 1721543.0, + "step": 829 + }, + { + "epoch": 0.006860694831334364, + "grad_norm": 0.45827627182006836, + "learning_rate": 4.9828689276651324e-05, + "loss": 0.2699, + "mean_token_accuracy": 0.94482421875, + "num_tokens": 1723597.0, + "step": 830 + }, + { + "epoch": 0.006868960728721514, + "grad_norm": 0.3388739824295044, + "learning_rate": 4.9828482629216646e-05, + "loss": 0.1718, + "mean_token_accuracy": 0.9656044244766235, + "num_tokens": 1725580.0, + "step": 831 + }, + { + "epoch": 0.006877226626108663, + "grad_norm": 0.32214492559432983, + "learning_rate": 4.982827598178196e-05, + "loss": 0.1905, + "mean_token_accuracy": 0.9608237147331238, + "num_tokens": 1727577.0, + "step": 832 + }, + { + "epoch": 0.0068854925234958135, + "grad_norm": 0.32804158329963684, + "learning_rate": 4.982806933434729e-05, + "loss": 0.1822, + "mean_token_accuracy": 0.9662808179855347, + "num_tokens": 1729570.0, + "step": 833 + }, + { + "epoch": 0.006893758420882963, + "grad_norm": 0.3797645568847656, + "learning_rate": 4.982786268691261e-05, + "loss": 0.2355, + "mean_token_accuracy": 0.9515484571456909, + "num_tokens": 1731578.0, + "step": 834 + }, + { + "epoch": 0.006902024318270113, + "grad_norm": 0.375230073928833, + "learning_rate": 4.9827656039477926e-05, + "loss": 0.1893, + "mean_token_accuracy": 0.9611503481864929, + "num_tokens": 1733566.0, + "step": 835 + }, + { + "epoch": 0.006910290215657263, + "grad_norm": 0.3135709762573242, + "learning_rate": 4.9827449392043254e-05, + "loss": 0.1767, + "mean_token_accuracy": 0.9642309546470642, + "num_tokens": 1735529.0, + "step": 836 + }, + { + "epoch": 0.0069185561130444126, + "grad_norm": 0.3929509222507477, + "learning_rate": 4.982724274460857e-05, + "loss": 0.2435, + "mean_token_accuracy": 0.9504901766777039, + "num_tokens": 1737575.0, + "step": 837 + }, + { + "epoch": 0.006926822010431563, + "grad_norm": 0.31875646114349365, + "learning_rate": 4.982703609717389e-05, + "loss": 0.1706, + "mean_token_accuracy": 0.9661017060279846, + "num_tokens": 1739587.0, + "step": 838 + }, + { + "epoch": 0.006935087907818712, + "grad_norm": 0.4902570843696594, + "learning_rate": 4.982682944973921e-05, + "loss": 0.2164, + "mean_token_accuracy": 0.9524975419044495, + "num_tokens": 1741635.0, + "step": 839 + }, + { + "epoch": 0.006943353805205862, + "grad_norm": 0.396259069442749, + "learning_rate": 4.9826622802304534e-05, + "loss": 0.1781, + "mean_token_accuracy": 0.9652917385101318, + "num_tokens": 1743629.0, + "step": 840 + }, + { + "epoch": 0.0069516197025930124, + "grad_norm": 0.3869590163230896, + "learning_rate": 4.9826416154869856e-05, + "loss": 0.1679, + "mean_token_accuracy": 0.9647355079650879, + "num_tokens": 1745620.0, + "step": 841 + }, + { + "epoch": 0.006959885599980162, + "grad_norm": 0.2901887595653534, + "learning_rate": 4.982620950743518e-05, + "loss": 0.1595, + "mean_token_accuracy": 0.9716055989265442, + "num_tokens": 1747563.0, + "step": 842 + }, + { + "epoch": 0.006968151497367312, + "grad_norm": 0.34304308891296387, + "learning_rate": 4.98260028600005e-05, + "loss": 0.1602, + "mean_token_accuracy": 0.9674465656280518, + "num_tokens": 1749535.0, + "step": 843 + }, + { + "epoch": 0.006976417394754461, + "grad_norm": 0.508950412273407, + "learning_rate": 4.982579621256582e-05, + "loss": 0.2147, + "mean_token_accuracy": 0.9550341963768005, + "num_tokens": 1751587.0, + "step": 844 + }, + { + "epoch": 0.0069846832921416115, + "grad_norm": 0.315696656703949, + "learning_rate": 4.982558956513114e-05, + "loss": 0.1596, + "mean_token_accuracy": 0.9683893918991089, + "num_tokens": 1753586.0, + "step": 845 + }, + { + "epoch": 0.006992949189528761, + "grad_norm": 0.37910759449005127, + "learning_rate": 4.9825382917696464e-05, + "loss": 0.1651, + "mean_token_accuracy": 0.9651817679405212, + "num_tokens": 1755545.0, + "step": 846 + }, + { + "epoch": 0.007001215086915911, + "grad_norm": 0.474913090467453, + "learning_rate": 4.982517627026178e-05, + "loss": 0.2151, + "mean_token_accuracy": 0.9575424790382385, + "num_tokens": 1757553.0, + "step": 847 + }, + { + "epoch": 0.007009480984303061, + "grad_norm": 0.4384135603904724, + "learning_rate": 4.982496962282711e-05, + "loss": 0.2018, + "mean_token_accuracy": 0.9589589834213257, + "num_tokens": 1759557.0, + "step": 848 + }, + { + "epoch": 0.0070177468816902105, + "grad_norm": 0.4935932457447052, + "learning_rate": 4.982476297539242e-05, + "loss": 0.2468, + "mean_token_accuracy": 0.9507557153701782, + "num_tokens": 1761614.0, + "step": 849 + }, + { + "epoch": 0.007026012779077361, + "grad_norm": 0.42140674591064453, + "learning_rate": 4.982455632795775e-05, + "loss": 0.1652, + "mean_token_accuracy": 0.9658859372138977, + "num_tokens": 1763584.0, + "step": 850 + }, + { + "epoch": 0.00703427867646451, + "grad_norm": 0.589418888092041, + "learning_rate": 4.982434968052307e-05, + "loss": 0.1986, + "mean_token_accuracy": 0.9621136784553528, + "num_tokens": 1765596.0, + "step": 851 + }, + { + "epoch": 0.00704254457385166, + "grad_norm": 0.5515609979629517, + "learning_rate": 4.982414303308839e-05, + "loss": 0.2175, + "mean_token_accuracy": 0.9505574703216553, + "num_tokens": 1767665.0, + "step": 852 + }, + { + "epoch": 0.00705081047123881, + "grad_norm": 0.42219194769859314, + "learning_rate": 4.9823936385653716e-05, + "loss": 0.17, + "mean_token_accuracy": 0.9626262784004211, + "num_tokens": 1769651.0, + "step": 853 + }, + { + "epoch": 0.00705907636862596, + "grad_norm": 0.3146474063396454, + "learning_rate": 4.982372973821903e-05, + "loss": 0.1443, + "mean_token_accuracy": 0.9693158864974976, + "num_tokens": 1771645.0, + "step": 854 + }, + { + "epoch": 0.00706734226601311, + "grad_norm": 0.4332464933395386, + "learning_rate": 4.982352309078435e-05, + "loss": 0.1856, + "mean_token_accuracy": 0.9673802256584167, + "num_tokens": 1773613.0, + "step": 855 + }, + { + "epoch": 0.007075608163400259, + "grad_norm": 0.38029155135154724, + "learning_rate": 4.9823316443349674e-05, + "loss": 0.1604, + "mean_token_accuracy": 0.9666160941123962, + "num_tokens": 1775596.0, + "step": 856 + }, + { + "epoch": 0.007083874060787409, + "grad_norm": 0.33078211545944214, + "learning_rate": 4.9823109795914995e-05, + "loss": 0.1634, + "mean_token_accuracy": 0.9691451787948608, + "num_tokens": 1777579.0, + "step": 857 + }, + { + "epoch": 0.00709213995817456, + "grad_norm": 0.47529563307762146, + "learning_rate": 4.982290314848032e-05, + "loss": 0.1634, + "mean_token_accuracy": 0.9662978053092957, + "num_tokens": 1779573.0, + "step": 858 + }, + { + "epoch": 0.007100405855561709, + "grad_norm": 0.3246769607067108, + "learning_rate": 4.982269650104564e-05, + "loss": 0.1794, + "mean_token_accuracy": 0.9668028354644775, + "num_tokens": 1781537.0, + "step": 859 + }, + { + "epoch": 0.007108671752948859, + "grad_norm": 0.4095306396484375, + "learning_rate": 4.982248985361096e-05, + "loss": 0.1861, + "mean_token_accuracy": 0.9620829224586487, + "num_tokens": 1783521.0, + "step": 860 + }, + { + "epoch": 0.007116937650336008, + "grad_norm": 0.45311596989631653, + "learning_rate": 4.982228320617628e-05, + "loss": 0.22, + "mean_token_accuracy": 0.9541015625, + "num_tokens": 1785575.0, + "step": 861 + }, + { + "epoch": 0.007125203547723159, + "grad_norm": 0.3538917601108551, + "learning_rate": 4.9822076558741604e-05, + "loss": 0.1652, + "mean_token_accuracy": 0.9666666388511658, + "num_tokens": 1787531.0, + "step": 862 + }, + { + "epoch": 0.007133469445110309, + "grad_norm": 0.3990963101387024, + "learning_rate": 4.9821869911306925e-05, + "loss": 0.2461, + "mean_token_accuracy": 0.9486552476882935, + "num_tokens": 1789582.0, + "step": 863 + }, + { + "epoch": 0.007141735342497458, + "grad_norm": 0.44176051020622253, + "learning_rate": 4.982166326387224e-05, + "loss": 0.2116, + "mean_token_accuracy": 0.9554047584533691, + "num_tokens": 1791651.0, + "step": 864 + }, + { + "epoch": 0.007150001239884608, + "grad_norm": 0.44992202520370483, + "learning_rate": 4.982145661643757e-05, + "loss": 0.2221, + "mean_token_accuracy": 0.9524742960929871, + "num_tokens": 1793698.0, + "step": 865 + }, + { + "epoch": 0.007158267137271758, + "grad_norm": 0.3285636305809021, + "learning_rate": 4.9821249969002884e-05, + "loss": 0.1481, + "mean_token_accuracy": 0.9697122573852539, + "num_tokens": 1795685.0, + "step": 866 + }, + { + "epoch": 0.007166533034658908, + "grad_norm": 0.4576401710510254, + "learning_rate": 4.9821043321568205e-05, + "loss": 0.1854, + "mean_token_accuracy": 0.9635728597640991, + "num_tokens": 1797695.0, + "step": 867 + }, + { + "epoch": 0.007174798932046058, + "grad_norm": 0.4985065460205078, + "learning_rate": 4.9820836674133534e-05, + "loss": 0.1948, + "mean_token_accuracy": 0.9574571847915649, + "num_tokens": 1799746.0, + "step": 868 + }, + { + "epoch": 0.007183064829433207, + "grad_norm": 0.38755112886428833, + "learning_rate": 4.982063002669885e-05, + "loss": 0.1714, + "mean_token_accuracy": 0.9661538600921631, + "num_tokens": 1801702.0, + "step": 869 + }, + { + "epoch": 0.0071913307268203575, + "grad_norm": 0.4477129876613617, + "learning_rate": 4.982042337926417e-05, + "loss": 0.1848, + "mean_token_accuracy": 0.9620189666748047, + "num_tokens": 1803709.0, + "step": 870 + }, + { + "epoch": 0.007199596624207507, + "grad_norm": 0.38782238960266113, + "learning_rate": 4.982021673182949e-05, + "loss": 0.1865, + "mean_token_accuracy": 0.9643584489822388, + "num_tokens": 1805679.0, + "step": 871 + }, + { + "epoch": 0.007207862521594657, + "grad_norm": 0.45049068331718445, + "learning_rate": 4.9820010084394814e-05, + "loss": 0.2122, + "mean_token_accuracy": 0.9574787616729736, + "num_tokens": 1807684.0, + "step": 872 + }, + { + "epoch": 0.007216128418981807, + "grad_norm": 0.44215312600135803, + "learning_rate": 4.9819803436960135e-05, + "loss": 0.1988, + "mean_token_accuracy": 0.9601413011550903, + "num_tokens": 1809672.0, + "step": 873 + }, + { + "epoch": 0.0072243943163689565, + "grad_norm": 0.4946404993534088, + "learning_rate": 4.981959678952546e-05, + "loss": 0.2441, + "mean_token_accuracy": 0.9473175406455994, + "num_tokens": 1811747.0, + "step": 874 + }, + { + "epoch": 0.007232660213756107, + "grad_norm": 0.3955952823162079, + "learning_rate": 4.981939014209078e-05, + "loss": 0.161, + "mean_token_accuracy": 0.9659489393234253, + "num_tokens": 1813750.0, + "step": 875 + }, + { + "epoch": 0.007240926111143256, + "grad_norm": 0.9727440476417542, + "learning_rate": 4.98191834946561e-05, + "loss": 0.1469, + "mean_token_accuracy": 0.9674022197723389, + "num_tokens": 1815750.0, + "step": 876 + }, + { + "epoch": 0.007249192008530406, + "grad_norm": 0.46547815203666687, + "learning_rate": 4.981897684722142e-05, + "loss": 0.1907, + "mean_token_accuracy": 0.9638190865516663, + "num_tokens": 1817746.0, + "step": 877 + }, + { + "epoch": 0.0072574579059175555, + "grad_norm": 0.43833407759666443, + "learning_rate": 4.9818770199786743e-05, + "loss": 0.1968, + "mean_token_accuracy": 0.9588559865951538, + "num_tokens": 1819745.0, + "step": 878 + }, + { + "epoch": 0.007265723803304706, + "grad_norm": 0.36661940813064575, + "learning_rate": 4.9818563552352065e-05, + "loss": 0.1883, + "mean_token_accuracy": 0.9613478779792786, + "num_tokens": 1821769.0, + "step": 879 + }, + { + "epoch": 0.007273989700691856, + "grad_norm": 0.4462507665157318, + "learning_rate": 4.981835690491739e-05, + "loss": 0.299, + "mean_token_accuracy": 0.941662609577179, + "num_tokens": 1823832.0, + "step": 880 + }, + { + "epoch": 0.007282255598079005, + "grad_norm": 0.45812344551086426, + "learning_rate": 4.98181502574827e-05, + "loss": 0.214, + "mean_token_accuracy": 0.9591633677482605, + "num_tokens": 1825846.0, + "step": 881 + }, + { + "epoch": 0.007290521495466155, + "grad_norm": 0.40240493416786194, + "learning_rate": 4.981794361004803e-05, + "loss": 0.1456, + "mean_token_accuracy": 0.970271646976471, + "num_tokens": 1827803.0, + "step": 882 + }, + { + "epoch": 0.007298787392853305, + "grad_norm": 0.3636603355407715, + "learning_rate": 4.9817736962613345e-05, + "loss": 0.1668, + "mean_token_accuracy": 0.9663437008857727, + "num_tokens": 1829770.0, + "step": 883 + }, + { + "epoch": 0.007307053290240455, + "grad_norm": 0.3355780839920044, + "learning_rate": 4.981753031517867e-05, + "loss": 0.1535, + "mean_token_accuracy": 0.971222996711731, + "num_tokens": 1831722.0, + "step": 884 + }, + { + "epoch": 0.007315319187627605, + "grad_norm": 0.5163689851760864, + "learning_rate": 4.9817323667743995e-05, + "loss": 0.2789, + "mean_token_accuracy": 0.9381783604621887, + "num_tokens": 1833847.0, + "step": 885 + }, + { + "epoch": 0.007323585085014754, + "grad_norm": 0.4665575623512268, + "learning_rate": 4.981711702030931e-05, + "loss": 0.1892, + "mean_token_accuracy": 0.9579746723175049, + "num_tokens": 1835828.0, + "step": 886 + }, + { + "epoch": 0.007331850982401905, + "grad_norm": 0.35391056537628174, + "learning_rate": 4.981691037287463e-05, + "loss": 0.1571, + "mean_token_accuracy": 0.9679389595985413, + "num_tokens": 1837799.0, + "step": 887 + }, + { + "epoch": 0.007340116879789054, + "grad_norm": 0.37589630484580994, + "learning_rate": 4.981670372543995e-05, + "loss": 0.1775, + "mean_token_accuracy": 0.9660415649414062, + "num_tokens": 1839778.0, + "step": 888 + }, + { + "epoch": 0.007348382777176204, + "grad_norm": 0.2645249664783478, + "learning_rate": 4.9816497078005275e-05, + "loss": 0.1357, + "mean_token_accuracy": 0.9729039072990417, + "num_tokens": 1841740.0, + "step": 889 + }, + { + "epoch": 0.007356648674563354, + "grad_norm": 0.37919551134109497, + "learning_rate": 4.9816290430570597e-05, + "loss": 0.1744, + "mean_token_accuracy": 0.9636091589927673, + "num_tokens": 1843752.0, + "step": 890 + }, + { + "epoch": 0.007364914571950504, + "grad_norm": 0.36111271381378174, + "learning_rate": 4.981608378313592e-05, + "loss": 0.1736, + "mean_token_accuracy": 0.9647467732429504, + "num_tokens": 1845772.0, + "step": 891 + }, + { + "epoch": 0.007373180469337654, + "grad_norm": 0.4354729652404785, + "learning_rate": 4.981587713570124e-05, + "loss": 0.2511, + "mean_token_accuracy": 0.9476801753044128, + "num_tokens": 1847804.0, + "step": 892 + }, + { + "epoch": 0.007381446366724803, + "grad_norm": 0.30511441826820374, + "learning_rate": 4.981567048826656e-05, + "loss": 0.1633, + "mean_token_accuracy": 0.968988299369812, + "num_tokens": 1849777.0, + "step": 893 + }, + { + "epoch": 0.007389712264111953, + "grad_norm": 0.46899569034576416, + "learning_rate": 4.981546384083188e-05, + "loss": 0.1945, + "mean_token_accuracy": 0.9620758295059204, + "num_tokens": 1851787.0, + "step": 894 + }, + { + "epoch": 0.0073979781614991035, + "grad_norm": 0.4520535469055176, + "learning_rate": 4.9815257193397205e-05, + "loss": 0.1975, + "mean_token_accuracy": 0.9593052268028259, + "num_tokens": 1853808.0, + "step": 895 + }, + { + "epoch": 0.007406244058886253, + "grad_norm": 0.3573121428489685, + "learning_rate": 4.9815050545962527e-05, + "loss": 0.155, + "mean_token_accuracy": 0.9676113128662109, + "num_tokens": 1855790.0, + "step": 896 + }, + { + "epoch": 0.007414509956273403, + "grad_norm": 0.4316529631614685, + "learning_rate": 4.981484389852785e-05, + "loss": 0.1926, + "mean_token_accuracy": 0.9633718132972717, + "num_tokens": 1857789.0, + "step": 897 + }, + { + "epoch": 0.007422775853660552, + "grad_norm": 0.33973968029022217, + "learning_rate": 4.981463725109316e-05, + "loss": 0.1448, + "mean_token_accuracy": 0.9667003154754639, + "num_tokens": 1859777.0, + "step": 898 + }, + { + "epoch": 0.0074310417510477025, + "grad_norm": 0.3881532549858093, + "learning_rate": 4.981443060365849e-05, + "loss": 0.1802, + "mean_token_accuracy": 0.9585414528846741, + "num_tokens": 1861785.0, + "step": 899 + }, + { + "epoch": 0.007439307648434853, + "grad_norm": 0.39037537574768066, + "learning_rate": 4.981422395622381e-05, + "loss": 0.1685, + "mean_token_accuracy": 0.9659035801887512, + "num_tokens": 1863844.0, + "step": 900 + }, + { + "epoch": 0.007447573545822002, + "grad_norm": 0.3870031237602234, + "learning_rate": 4.981401730878913e-05, + "loss": 0.2114, + "mean_token_accuracy": 0.9571285843849182, + "num_tokens": 1865856.0, + "step": 901 + }, + { + "epoch": 0.007455839443209152, + "grad_norm": 0.39852142333984375, + "learning_rate": 4.9813810661354456e-05, + "loss": 0.1754, + "mean_token_accuracy": 0.9642126560211182, + "num_tokens": 1867818.0, + "step": 902 + }, + { + "epoch": 0.0074641053405963016, + "grad_norm": 0.3147163689136505, + "learning_rate": 4.981360401391977e-05, + "loss": 0.1273, + "mean_token_accuracy": 0.9753340482711792, + "num_tokens": 1869770.0, + "step": 903 + }, + { + "epoch": 0.007472371237983452, + "grad_norm": 0.4568729102611542, + "learning_rate": 4.981339736648509e-05, + "loss": 0.19, + "mean_token_accuracy": 0.9620000123977661, + "num_tokens": 1871776.0, + "step": 904 + }, + { + "epoch": 0.007480637135370602, + "grad_norm": 0.501317024230957, + "learning_rate": 4.9813190719050415e-05, + "loss": 0.2305, + "mean_token_accuracy": 0.9508993625640869, + "num_tokens": 1873839.0, + "step": 905 + }, + { + "epoch": 0.007488903032757751, + "grad_norm": 0.5853086113929749, + "learning_rate": 4.9812984071615736e-05, + "loss": 0.3194, + "mean_token_accuracy": 0.9332392811775208, + "num_tokens": 1875972.0, + "step": 906 + }, + { + "epoch": 0.0074971689301449014, + "grad_norm": 0.4364166259765625, + "learning_rate": 4.981277742418106e-05, + "loss": 0.2387, + "mean_token_accuracy": 0.9537037014961243, + "num_tokens": 1878030.0, + "step": 907 + }, + { + "epoch": 0.007505434827532051, + "grad_norm": 0.44608074426651, + "learning_rate": 4.981257077674638e-05, + "loss": 0.2287, + "mean_token_accuracy": 0.9534301161766052, + "num_tokens": 1880033.0, + "step": 908 + }, + { + "epoch": 0.007513700724919201, + "grad_norm": 0.3870539963245392, + "learning_rate": 4.98123641293117e-05, + "loss": 0.2242, + "mean_token_accuracy": 0.9556331038475037, + "num_tokens": 1882045.0, + "step": 909 + }, + { + "epoch": 0.00752196662230635, + "grad_norm": 0.37544041872024536, + "learning_rate": 4.981215748187702e-05, + "loss": 0.1775, + "mean_token_accuracy": 0.9661957621574402, + "num_tokens": 1884033.0, + "step": 910 + }, + { + "epoch": 0.0075302325196935005, + "grad_norm": 0.35216644406318665, + "learning_rate": 4.9811950834442345e-05, + "loss": 0.1689, + "mean_token_accuracy": 0.9621020555496216, + "num_tokens": 1886018.0, + "step": 911 + }, + { + "epoch": 0.007538498417080651, + "grad_norm": 0.4044584333896637, + "learning_rate": 4.9811744187007666e-05, + "loss": 0.193, + "mean_token_accuracy": 0.9575757384300232, + "num_tokens": 1888004.0, + "step": 912 + }, + { + "epoch": 0.0075467643144678, + "grad_norm": 0.35822993516921997, + "learning_rate": 4.981153753957299e-05, + "loss": 0.1556, + "mean_token_accuracy": 0.965777575969696, + "num_tokens": 1889997.0, + "step": 913 + }, + { + "epoch": 0.00755503021185495, + "grad_norm": 0.32807430624961853, + "learning_rate": 4.981133089213831e-05, + "loss": 0.1529, + "mean_token_accuracy": 0.9670885801315308, + "num_tokens": 1891978.0, + "step": 914 + }, + { + "epoch": 0.0075632961092420995, + "grad_norm": 0.34989964962005615, + "learning_rate": 4.9811124244703624e-05, + "loss": 0.1857, + "mean_token_accuracy": 0.9636363387107849, + "num_tokens": 1893964.0, + "step": 915 + }, + { + "epoch": 0.00757156200662925, + "grad_norm": 0.3590420186519623, + "learning_rate": 4.981091759726895e-05, + "loss": 0.1799, + "mean_token_accuracy": 0.9637255072593689, + "num_tokens": 1896010.0, + "step": 916 + }, + { + "epoch": 0.0075798279040164, + "grad_norm": 0.41440725326538086, + "learning_rate": 4.9810710949834275e-05, + "loss": 0.286, + "mean_token_accuracy": 0.9443916082382202, + "num_tokens": 1898120.0, + "step": 917 + }, + { + "epoch": 0.007588093801403549, + "grad_norm": 0.3265133202075958, + "learning_rate": 4.981050430239959e-05, + "loss": 0.1578, + "mean_token_accuracy": 0.9685279130935669, + "num_tokens": 1900096.0, + "step": 918 + }, + { + "epoch": 0.007596359698790699, + "grad_norm": 0.39172786474227905, + "learning_rate": 4.981029765496492e-05, + "loss": 0.2176, + "mean_token_accuracy": 0.9558680653572083, + "num_tokens": 1902164.0, + "step": 919 + }, + { + "epoch": 0.007604625596177849, + "grad_norm": 0.3920506536960602, + "learning_rate": 4.981009100753023e-05, + "loss": 0.1834, + "mean_token_accuracy": 0.963873565196991, + "num_tokens": 1904163.0, + "step": 920 + }, + { + "epoch": 0.007612891493564999, + "grad_norm": 0.40847542881965637, + "learning_rate": 4.9809884360095554e-05, + "loss": 0.2257, + "mean_token_accuracy": 0.9582712650299072, + "num_tokens": 1906182.0, + "step": 921 + }, + { + "epoch": 0.007621157390952149, + "grad_norm": 0.31902965903282166, + "learning_rate": 4.9809677712660876e-05, + "loss": 0.1502, + "mean_token_accuracy": 0.9720101952552795, + "num_tokens": 1908153.0, + "step": 922 + }, + { + "epoch": 0.007629423288339298, + "grad_norm": 0.45197224617004395, + "learning_rate": 4.98094710652262e-05, + "loss": 0.2017, + "mean_token_accuracy": 0.9601196646690369, + "num_tokens": 1910165.0, + "step": 923 + }, + { + "epoch": 0.007637689185726449, + "grad_norm": 0.40337854623794556, + "learning_rate": 4.980926441779152e-05, + "loss": 0.1684, + "mean_token_accuracy": 0.9667171239852905, + "num_tokens": 1912154.0, + "step": 924 + }, + { + "epoch": 0.007645955083113598, + "grad_norm": 0.39368268847465515, + "learning_rate": 4.980905777035684e-05, + "loss": 0.2121, + "mean_token_accuracy": 0.9588559865951538, + "num_tokens": 1914153.0, + "step": 925 + }, + { + "epoch": 0.007654220980500748, + "grad_norm": 0.4261470139026642, + "learning_rate": 4.980885112292216e-05, + "loss": 0.2412, + "mean_token_accuracy": 0.9512194991111755, + "num_tokens": 1916250.0, + "step": 926 + }, + { + "epoch": 0.007662486877887898, + "grad_norm": 0.5017535090446472, + "learning_rate": 4.9808644475487484e-05, + "loss": 0.2617, + "mean_token_accuracy": 0.9467980265617371, + "num_tokens": 1918286.0, + "step": 927 + }, + { + "epoch": 0.007670752775275048, + "grad_norm": 0.3660185933113098, + "learning_rate": 4.9808437828052806e-05, + "loss": 0.201, + "mean_token_accuracy": 0.9614814519882202, + "num_tokens": 1920317.0, + "step": 928 + }, + { + "epoch": 0.007679018672662198, + "grad_norm": 0.3857627809047699, + "learning_rate": 4.980823118061813e-05, + "loss": 0.1726, + "mean_token_accuracy": 0.9633960127830505, + "num_tokens": 1922290.0, + "step": 929 + }, + { + "epoch": 0.007687284570049347, + "grad_norm": 0.4505801796913147, + "learning_rate": 4.980802453318344e-05, + "loss": 0.2391, + "mean_token_accuracy": 0.9511241316795349, + "num_tokens": 1924342.0, + "step": 930 + }, + { + "epoch": 0.007695550467436497, + "grad_norm": 0.5029123425483704, + "learning_rate": 4.980781788574877e-05, + "loss": 0.1569, + "mean_token_accuracy": 0.9662298560142517, + "num_tokens": 1926332.0, + "step": 931 + }, + { + "epoch": 0.0077038163648236475, + "grad_norm": 0.41090860962867737, + "learning_rate": 4.9807611238314086e-05, + "loss": 0.1592, + "mean_token_accuracy": 0.9629072546958923, + "num_tokens": 1928333.0, + "step": 932 + }, + { + "epoch": 0.007712082262210797, + "grad_norm": 0.45338863134384155, + "learning_rate": 4.980740459087941e-05, + "loss": 0.2259, + "mean_token_accuracy": 0.9506595134735107, + "num_tokens": 1930386.0, + "step": 933 + }, + { + "epoch": 0.007720348159597947, + "grad_norm": 0.3854855000972748, + "learning_rate": 4.9807197943444736e-05, + "loss": 0.2261, + "mean_token_accuracy": 0.9510791301727295, + "num_tokens": 1932477.0, + "step": 934 + }, + { + "epoch": 0.007728614056985096, + "grad_norm": 0.38385406136512756, + "learning_rate": 4.980699129601005e-05, + "loss": 0.1519, + "mean_token_accuracy": 0.9644288420677185, + "num_tokens": 1934479.0, + "step": 935 + }, + { + "epoch": 0.0077368799543722465, + "grad_norm": 0.39230501651763916, + "learning_rate": 4.980678464857538e-05, + "loss": 0.1455, + "mean_token_accuracy": 0.9668674468994141, + "num_tokens": 1936477.0, + "step": 936 + }, + { + "epoch": 0.007745145851759397, + "grad_norm": 0.41803377866744995, + "learning_rate": 4.9806578001140694e-05, + "loss": 0.1982, + "mean_token_accuracy": 0.9587525129318237, + "num_tokens": 1938471.0, + "step": 937 + }, + { + "epoch": 0.007753411749146546, + "grad_norm": 0.4002348780632019, + "learning_rate": 4.9806371353706016e-05, + "loss": 0.1612, + "mean_token_accuracy": 0.970933198928833, + "num_tokens": 1940438.0, + "step": 938 + }, + { + "epoch": 0.007761677646533696, + "grad_norm": 0.7597206830978394, + "learning_rate": 4.9806164706271344e-05, + "loss": 0.2265, + "mean_token_accuracy": 0.957198441028595, + "num_tokens": 1942500.0, + "step": 939 + }, + { + "epoch": 0.0077699435439208455, + "grad_norm": 0.3641800284385681, + "learning_rate": 4.980595805883666e-05, + "loss": 0.1786, + "mean_token_accuracy": 0.9631685018539429, + "num_tokens": 1944488.0, + "step": 940 + }, + { + "epoch": 0.007778209441307996, + "grad_norm": 0.43571937084198, + "learning_rate": 4.980575141140198e-05, + "loss": 0.2031, + "mean_token_accuracy": 0.9577187895774841, + "num_tokens": 1946528.0, + "step": 941 + }, + { + "epoch": 0.007786475338695145, + "grad_norm": 0.3917180299758911, + "learning_rate": 4.98055447639673e-05, + "loss": 0.223, + "mean_token_accuracy": 0.9562406539916992, + "num_tokens": 1948545.0, + "step": 942 + }, + { + "epoch": 0.007794741236082295, + "grad_norm": 0.3620387017726898, + "learning_rate": 4.9805338116532624e-05, + "loss": 0.1382, + "mean_token_accuracy": 0.9690198302268982, + "num_tokens": 1950520.0, + "step": 943 + }, + { + "epoch": 0.007803007133469445, + "grad_norm": 0.4767442047595978, + "learning_rate": 4.9805131469097946e-05, + "loss": 0.2268, + "mean_token_accuracy": 0.9569733142852783, + "num_tokens": 1952548.0, + "step": 944 + }, + { + "epoch": 0.007811273030856595, + "grad_norm": 0.36579081416130066, + "learning_rate": 4.980492482166327e-05, + "loss": 0.1507, + "mean_token_accuracy": 0.9702621102333069, + "num_tokens": 1954538.0, + "step": 945 + }, + { + "epoch": 0.007819538928243745, + "grad_norm": 0.43252885341644287, + "learning_rate": 4.980471817422859e-05, + "loss": 0.2563, + "mean_token_accuracy": 0.9483430981636047, + "num_tokens": 1956596.0, + "step": 946 + }, + { + "epoch": 0.007827804825630894, + "grad_norm": 0.6051336526870728, + "learning_rate": 4.9804511526793904e-05, + "loss": 0.2769, + "mean_token_accuracy": 0.9462729692459106, + "num_tokens": 1958668.0, + "step": 947 + }, + { + "epoch": 0.007836070723018045, + "grad_norm": 0.3463861346244812, + "learning_rate": 4.980430487935923e-05, + "loss": 0.1485, + "mean_token_accuracy": 0.9695122241973877, + "num_tokens": 1960642.0, + "step": 948 + }, + { + "epoch": 0.007844336620405195, + "grad_norm": 0.3766689598560333, + "learning_rate": 4.9804098231924554e-05, + "loss": 0.1924, + "mean_token_accuracy": 0.9621890783309937, + "num_tokens": 1962658.0, + "step": 949 + }, + { + "epoch": 0.007852602517792344, + "grad_norm": 0.4464820623397827, + "learning_rate": 4.980389158448987e-05, + "loss": 0.1612, + "mean_token_accuracy": 0.9684368968009949, + "num_tokens": 1964660.0, + "step": 950 + }, + { + "epoch": 0.007860868415179493, + "grad_norm": 0.2868194282054901, + "learning_rate": 4.98036849370552e-05, + "loss": 0.1509, + "mean_token_accuracy": 0.9711246490478516, + "num_tokens": 1966640.0, + "step": 951 + }, + { + "epoch": 0.007869134312566644, + "grad_norm": 0.2970883846282959, + "learning_rate": 4.980347828962051e-05, + "loss": 0.1549, + "mean_token_accuracy": 0.969774603843689, + "num_tokens": 1968598.0, + "step": 952 + }, + { + "epoch": 0.007877400209953794, + "grad_norm": 0.39536306262016296, + "learning_rate": 4.9803271642185834e-05, + "loss": 0.1863, + "mean_token_accuracy": 0.9632840156555176, + "num_tokens": 1970565.0, + "step": 953 + }, + { + "epoch": 0.007885666107340943, + "grad_norm": 0.4233575165271759, + "learning_rate": 4.9803064994751156e-05, + "loss": 0.1838, + "mean_token_accuracy": 0.9616171717643738, + "num_tokens": 1972525.0, + "step": 954 + }, + { + "epoch": 0.007893932004728094, + "grad_norm": 0.505504846572876, + "learning_rate": 4.980285834731648e-05, + "loss": 0.2767, + "mean_token_accuracy": 0.9472422003746033, + "num_tokens": 1974616.0, + "step": 955 + }, + { + "epoch": 0.007902197902115243, + "grad_norm": 0.4857965409755707, + "learning_rate": 4.9802651699881806e-05, + "loss": 0.1712, + "mean_token_accuracy": 0.9655172228813171, + "num_tokens": 1976565.0, + "step": 956 + }, + { + "epoch": 0.007910463799502393, + "grad_norm": 0.42851853370666504, + "learning_rate": 4.980244505244712e-05, + "loss": 0.1786, + "mean_token_accuracy": 0.961422860622406, + "num_tokens": 1978567.0, + "step": 957 + }, + { + "epoch": 0.007918729696889542, + "grad_norm": 0.3855806291103363, + "learning_rate": 4.980223840501244e-05, + "loss": 0.185, + "mean_token_accuracy": 0.9627268314361572, + "num_tokens": 1980612.0, + "step": 958 + }, + { + "epoch": 0.007926995594276693, + "grad_norm": 0.44890686869621277, + "learning_rate": 4.9802031757577764e-05, + "loss": 0.2755, + "mean_token_accuracy": 0.942307710647583, + "num_tokens": 1982750.0, + "step": 959 + }, + { + "epoch": 0.007935261491663842, + "grad_norm": 0.3707360327243805, + "learning_rate": 4.9801825110143085e-05, + "loss": 0.1629, + "mean_token_accuracy": 0.9668028354644775, + "num_tokens": 1984714.0, + "step": 960 + }, + { + "epoch": 0.007943527389050992, + "grad_norm": 0.457932710647583, + "learning_rate": 4.980161846270841e-05, + "loss": 0.1874, + "mean_token_accuracy": 0.9626865386962891, + "num_tokens": 1986730.0, + "step": 961 + }, + { + "epoch": 0.007951793286438143, + "grad_norm": 0.3275972604751587, + "learning_rate": 4.980141181527373e-05, + "loss": 0.1438, + "mean_token_accuracy": 0.9697285890579224, + "num_tokens": 1988652.0, + "step": 962 + }, + { + "epoch": 0.007960059183825292, + "grad_norm": 0.39132949709892273, + "learning_rate": 4.980120516783905e-05, + "loss": 0.1927, + "mean_token_accuracy": 0.9604009985923767, + "num_tokens": 1990653.0, + "step": 963 + }, + { + "epoch": 0.007968325081212441, + "grad_norm": 0.4453590214252472, + "learning_rate": 4.9800998520404365e-05, + "loss": 0.2627, + "mean_token_accuracy": 0.9438679218292236, + "num_tokens": 1992779.0, + "step": 964 + }, + { + "epoch": 0.007976590978599592, + "grad_norm": 0.4846074879169464, + "learning_rate": 4.9800791872969694e-05, + "loss": 0.1997, + "mean_token_accuracy": 0.9597585797309875, + "num_tokens": 1994773.0, + "step": 965 + }, + { + "epoch": 0.007984856875986742, + "grad_norm": 0.3702278137207031, + "learning_rate": 4.9800585225535015e-05, + "loss": 0.1423, + "mean_token_accuracy": 0.9713135361671448, + "num_tokens": 1996766.0, + "step": 966 + }, + { + "epoch": 0.007993122773373891, + "grad_norm": 0.3540761172771454, + "learning_rate": 4.980037857810033e-05, + "loss": 0.1977, + "mean_token_accuracy": 0.9621514081954956, + "num_tokens": 1998780.0, + "step": 967 + }, + { + "epoch": 0.00800138867076104, + "grad_norm": 0.3455694019794464, + "learning_rate": 4.980017193066566e-05, + "loss": 0.1588, + "mean_token_accuracy": 0.9707808494567871, + "num_tokens": 2000771.0, + "step": 968 + }, + { + "epoch": 0.008009654568148191, + "grad_norm": 0.37254098057746887, + "learning_rate": 4.9799965283230974e-05, + "loss": 0.1699, + "mean_token_accuracy": 0.9640393853187561, + "num_tokens": 2002807.0, + "step": 969 + }, + { + "epoch": 0.00801792046553534, + "grad_norm": 0.3742963969707489, + "learning_rate": 4.9799758635796295e-05, + "loss": 0.1905, + "mean_token_accuracy": 0.9588235020637512, + "num_tokens": 2004853.0, + "step": 970 + }, + { + "epoch": 0.00802618636292249, + "grad_norm": 0.3958035111427307, + "learning_rate": 4.979955198836162e-05, + "loss": 0.1985, + "mean_token_accuracy": 0.9617296457290649, + "num_tokens": 2006871.0, + "step": 971 + }, + { + "epoch": 0.008034452260309641, + "grad_norm": 0.3543177843093872, + "learning_rate": 4.979934534092694e-05, + "loss": 0.1898, + "mean_token_accuracy": 0.9626680016517639, + "num_tokens": 2008886.0, + "step": 972 + }, + { + "epoch": 0.00804271815769679, + "grad_norm": 0.3872028589248657, + "learning_rate": 4.979913869349226e-05, + "loss": 0.1995, + "mean_token_accuracy": 0.9607458114624023, + "num_tokens": 2010930.0, + "step": 973 + }, + { + "epoch": 0.00805098405508394, + "grad_norm": 0.5003104209899902, + "learning_rate": 4.979893204605758e-05, + "loss": 0.2237, + "mean_token_accuracy": 0.9536489248275757, + "num_tokens": 2012964.0, + "step": 974 + }, + { + "epoch": 0.00805924995247109, + "grad_norm": 0.41863206028938293, + "learning_rate": 4.9798725398622904e-05, + "loss": 0.1941, + "mean_token_accuracy": 0.9597180485725403, + "num_tokens": 2014956.0, + "step": 975 + }, + { + "epoch": 0.00806751584985824, + "grad_norm": 0.4648338556289673, + "learning_rate": 4.9798518751188225e-05, + "loss": 0.2449, + "mean_token_accuracy": 0.9497805833816528, + "num_tokens": 2017013.0, + "step": 976 + }, + { + "epoch": 0.00807578174724539, + "grad_norm": 0.3554210960865021, + "learning_rate": 4.979831210375355e-05, + "loss": 0.1655, + "mean_token_accuracy": 0.9632571935653687, + "num_tokens": 2019033.0, + "step": 977 + }, + { + "epoch": 0.008084047644632539, + "grad_norm": 0.3880045413970947, + "learning_rate": 4.979810545631887e-05, + "loss": 0.1476, + "mean_token_accuracy": 0.9674837589263916, + "num_tokens": 2021038.0, + "step": 978 + }, + { + "epoch": 0.00809231354201969, + "grad_norm": 0.3297460377216339, + "learning_rate": 4.979789880888419e-05, + "loss": 0.1659, + "mean_token_accuracy": 0.9670885801315308, + "num_tokens": 2023019.0, + "step": 979 + }, + { + "epoch": 0.00810057943940684, + "grad_norm": 0.3558855652809143, + "learning_rate": 4.979769216144951e-05, + "loss": 0.1882, + "mean_token_accuracy": 0.9620758295059204, + "num_tokens": 2025029.0, + "step": 980 + }, + { + "epoch": 0.008108845336793988, + "grad_norm": 0.3962882459163666, + "learning_rate": 4.979748551401483e-05, + "loss": 0.1728, + "mean_token_accuracy": 0.9603960514068604, + "num_tokens": 2027055.0, + "step": 981 + }, + { + "epoch": 0.00811711123418114, + "grad_norm": 0.5223516225814819, + "learning_rate": 4.9797278866580155e-05, + "loss": 0.1931, + "mean_token_accuracy": 0.9574257135391235, + "num_tokens": 2029081.0, + "step": 982 + }, + { + "epoch": 0.008125377131568289, + "grad_norm": 0.4435831606388092, + "learning_rate": 4.979707221914548e-05, + "loss": 0.2031, + "mean_token_accuracy": 0.9564152956008911, + "num_tokens": 2031129.0, + "step": 983 + }, + { + "epoch": 0.008133643028955438, + "grad_norm": 0.3897659480571747, + "learning_rate": 4.979686557171079e-05, + "loss": 0.1775, + "mean_token_accuracy": 0.9674962162971497, + "num_tokens": 2033104.0, + "step": 984 + }, + { + "epoch": 0.00814190892634259, + "grad_norm": 0.5357649326324463, + "learning_rate": 4.979665892427612e-05, + "loss": 0.1784, + "mean_token_accuracy": 0.959132194519043, + "num_tokens": 2035092.0, + "step": 985 + }, + { + "epoch": 0.008150174823729739, + "grad_norm": 0.40512484312057495, + "learning_rate": 4.9796452276841435e-05, + "loss": 0.1939, + "mean_token_accuracy": 0.9609929323196411, + "num_tokens": 2037072.0, + "step": 986 + }, + { + "epoch": 0.008158440721116888, + "grad_norm": 0.49325162172317505, + "learning_rate": 4.979624562940676e-05, + "loss": 0.1884, + "mean_token_accuracy": 0.9609929323196411, + "num_tokens": 2039052.0, + "step": 987 + }, + { + "epoch": 0.008166706618504037, + "grad_norm": 0.49558088183403015, + "learning_rate": 4.9796038981972085e-05, + "loss": 0.2092, + "mean_token_accuracy": 0.9586241245269775, + "num_tokens": 2041064.0, + "step": 988 + }, + { + "epoch": 0.008174972515891188, + "grad_norm": 0.34452107548713684, + "learning_rate": 4.97958323345374e-05, + "loss": 0.1755, + "mean_token_accuracy": 0.9629629850387573, + "num_tokens": 2043041.0, + "step": 989 + }, + { + "epoch": 0.008183238413278338, + "grad_norm": 0.4018665850162506, + "learning_rate": 4.979562568710272e-05, + "loss": 0.2419, + "mean_token_accuracy": 0.951361894607544, + "num_tokens": 2045103.0, + "step": 990 + }, + { + "epoch": 0.008191504310665487, + "grad_norm": 0.42745086550712585, + "learning_rate": 4.979541903966804e-05, + "loss": 0.2779, + "mean_token_accuracy": 0.9447406530380249, + "num_tokens": 2047172.0, + "step": 991 + }, + { + "epoch": 0.008199770208052638, + "grad_norm": 0.37178975343704224, + "learning_rate": 4.9795212392233365e-05, + "loss": 0.1647, + "mean_token_accuracy": 0.9659318923950195, + "num_tokens": 2049174.0, + "step": 992 + }, + { + "epoch": 0.008208036105439787, + "grad_norm": 0.3532976508140564, + "learning_rate": 4.979500574479869e-05, + "loss": 0.1984, + "mean_token_accuracy": 0.9630005359649658, + "num_tokens": 2051153.0, + "step": 993 + }, + { + "epoch": 0.008216302002826937, + "grad_norm": 0.3711738586425781, + "learning_rate": 4.979479909736401e-05, + "loss": 0.219, + "mean_token_accuracy": 0.9540566802024841, + "num_tokens": 2053205.0, + "step": 994 + }, + { + "epoch": 0.008224567900214086, + "grad_norm": 0.256096750497818, + "learning_rate": 4.979459244992933e-05, + "loss": 0.1299, + "mean_token_accuracy": 0.974452555179596, + "num_tokens": 2055129.0, + "step": 995 + }, + { + "epoch": 0.008232833797601237, + "grad_norm": 0.40168118476867676, + "learning_rate": 4.9794385802494645e-05, + "loss": 0.1703, + "mean_token_accuracy": 0.9630566835403442, + "num_tokens": 2057111.0, + "step": 996 + }, + { + "epoch": 0.008241099694988386, + "grad_norm": 0.436128169298172, + "learning_rate": 4.979417915505997e-05, + "loss": 0.24, + "mean_token_accuracy": 0.9478811621665955, + "num_tokens": 2059170.0, + "step": 997 + }, + { + "epoch": 0.008249365592375536, + "grad_norm": 0.3948153555393219, + "learning_rate": 4.9793972507625295e-05, + "loss": 0.1591, + "mean_token_accuracy": 0.9680203199386597, + "num_tokens": 2061146.0, + "step": 998 + }, + { + "epoch": 0.008257631489762687, + "grad_norm": 0.3767959475517273, + "learning_rate": 4.9793765860190617e-05, + "loss": 0.1693, + "mean_token_accuracy": 0.9674962162971497, + "num_tokens": 2063121.0, + "step": 999 + }, + { + "epoch": 0.008265897387149836, + "grad_norm": 0.4880599081516266, + "learning_rate": 4.979355921275594e-05, + "loss": 0.278, + "mean_token_accuracy": 0.9402697682380676, + "num_tokens": 2065203.0, + "step": 1000 + } + ], + "logging_steps": 1, + "max_steps": 241958, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 1000, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.729254097643712e+16, + "train_batch_size": 6, + "trial_name": null, + "trial_params": null +}