{ "best_global_step": null, "best_metric": Infinity, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 500, "global_step": 94, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.8770920187234879, "epoch": 0.02127659574468085, "grad_norm": 101.38615417480469, "learning_rate": 0.0, "loss": 11.496590614318848, "mean_token_accuracy": 0.22714237496256828, "num_tokens": 2486.0, "step": 1 }, { "entropy": 0.9114853590726852, "epoch": 0.0425531914893617, "grad_norm": 96.85296630859375, "learning_rate": 4e-05, "loss": 11.215909004211426, "mean_token_accuracy": 0.2649671100080013, "num_tokens": 4959.0, "step": 2 }, { "entropy": 1.2038442194461823, "epoch": 0.06382978723404255, "grad_norm": 73.84027862548828, "learning_rate": 8e-05, "loss": 9.273573875427246, "mean_token_accuracy": 0.37812498956918716, "num_tokens": 7552.0, "step": 3 }, { "entropy": 1.0524671226739883, "epoch": 0.0851063829787234, "grad_norm": 30.00477409362793, "learning_rate": 0.00012, "loss": 6.997811317443848, "mean_token_accuracy": 0.5748837292194366, "num_tokens": 10017.0, "step": 4 }, { "entropy": 1.0943913161754608, "epoch": 0.10638297872340426, "grad_norm": 29.77185821533203, "learning_rate": 0.00016, "loss": 5.874476432800293, "mean_token_accuracy": 0.6206140369176865, "num_tokens": 12542.0, "step": 5 }, { "entropy": 0.690106213092804, "epoch": 0.1276595744680851, "grad_norm": 28.456193923950195, "learning_rate": 0.0002, "loss": 4.93742036819458, "mean_token_accuracy": 0.7391025722026825, "num_tokens": 15108.0, "step": 6 }, { "entropy": 0.42824630439281464, "epoch": 0.14893617021276595, "grad_norm": 8.46117877960205, "learning_rate": 0.00019993770622619782, "loss": 4.776185512542725, "mean_token_accuracy": 0.7670790255069733, "num_tokens": 17715.0, "step": 7 }, { "entropy": 0.6275453418493271, "epoch": 0.1702127659574468, "grad_norm": 7.040255069732666, "learning_rate": 0.00019975090251507638, "loss": 4.601991653442383, "mean_token_accuracy": 0.7641165554523468, "num_tokens": 20143.0, "step": 8 }, { "entropy": 0.49182429164648056, "epoch": 0.19148936170212766, "grad_norm": 4.624846458435059, "learning_rate": 0.0001994398216007982, "loss": 4.511226654052734, "mean_token_accuracy": 0.7724626064300537, "num_tokens": 22656.0, "step": 9 }, { "entropy": 0.626158207654953, "epoch": 0.2127659574468085, "grad_norm": 7.813827037811279, "learning_rate": 0.00019900485105144543, "loss": 4.358890533447266, "mean_token_accuracy": 0.7753759473562241, "num_tokens": 25094.0, "step": 10 }, { "entropy": 0.5334508866071701, "epoch": 0.23404255319148937, "grad_norm": 3.6953277587890625, "learning_rate": 0.00019844653278615833, "loss": 4.273573875427246, "mean_token_accuracy": 0.7838225364685059, "num_tokens": 27456.0, "step": 11 }, { "entropy": 0.43513786792755127, "epoch": 0.2553191489361702, "grad_norm": 2.8964409828186035, "learning_rate": 0.00019776556239997146, "loss": 4.085248947143555, "mean_token_accuracy": 0.8868782967329025, "num_tokens": 29914.0, "step": 12 }, { "entropy": 0.3346208333969116, "epoch": 0.2765957446808511, "grad_norm": 5.369524955749512, "learning_rate": 0.00019696278829718883, "loss": 3.968517303466797, "mean_token_accuracy": 0.8908246159553528, "num_tokens": 32448.0, "step": 13 }, { "entropy": 0.33365894854068756, "epoch": 0.2978723404255319, "grad_norm": 2.550203800201416, "learning_rate": 0.00019603921063437793, "loss": 4.0511908531188965, "mean_token_accuracy": 0.8805366605520248, "num_tokens": 34909.0, "step": 14 }, { "entropy": 0.25230497866868973, "epoch": 0.3191489361702128, "grad_norm": 3.365182876586914, "learning_rate": 0.0001949959800742991, "loss": 4.221365928649902, "mean_token_accuracy": 0.8763548880815506, "num_tokens": 37476.0, "step": 15 }, { "entropy": 0.21353815868496895, "epoch": 0.3404255319148936, "grad_norm": 1.1460461616516113, "learning_rate": 0.00019383439635232294, "loss": 4.106394290924072, "mean_token_accuracy": 0.8868418335914612, "num_tokens": 39881.0, "step": 16 }, { "entropy": 0.21475103124976158, "epoch": 0.3617021276595745, "grad_norm": 3.043959617614746, "learning_rate": 0.00019255590665712214, "loss": 4.265631675720215, "mean_token_accuracy": 0.8690433949232101, "num_tokens": 42235.0, "step": 17 }, { "entropy": 0.1718740463256836, "epoch": 0.3829787234042553, "grad_norm": 0.8078291416168213, "learning_rate": 0.0001911621038276542, "loss": 4.106135368347168, "mean_token_accuracy": 0.892671525478363, "num_tokens": 44687.0, "step": 18 }, { "entropy": 0.16231479868292809, "epoch": 0.40425531914893614, "grad_norm": 0.9561502933502197, "learning_rate": 0.00018965472436868286, "loss": 4.120131015777588, "mean_token_accuracy": 0.8869824111461639, "num_tokens": 47206.0, "step": 19 }, { "entropy": 0.14364850148558617, "epoch": 0.425531914893617, "grad_norm": 0.9734947681427002, "learning_rate": 0.00018803564628730915, "loss": 4.03128719329834, "mean_token_accuracy": 0.8906020969152451, "num_tokens": 49799.0, "step": 20 }, { "entropy": 0.13312280178070068, "epoch": 0.44680851063829785, "grad_norm": 0.4489222764968872, "learning_rate": 0.00018630688675320842, "loss": 4.058135032653809, "mean_token_accuracy": 0.8986841887235641, "num_tokens": 52291.0, "step": 21 }, { "entropy": 0.13586510717868805, "epoch": 0.46808510638297873, "grad_norm": 0.7964894771575928, "learning_rate": 0.0001844705995854882, "loss": 3.965346574783325, "mean_token_accuracy": 0.8940518647432327, "num_tokens": 54812.0, "step": 22 }, { "entropy": 0.15179748088121414, "epoch": 0.48936170212765956, "grad_norm": 1.6409692764282227, "learning_rate": 0.00018252907256929775, "loss": 4.181431293487549, "mean_token_accuracy": 0.8783541172742844, "num_tokens": 57280.0, "step": 23 }, { "entropy": 0.11831228621304035, "epoch": 0.5106382978723404, "grad_norm": 0.7683380842208862, "learning_rate": 0.00018048472460553257, "loss": 4.24875545501709, "mean_token_accuracy": 0.8903311938047409, "num_tokens": 59802.0, "step": 24 }, { "entropy": 0.15002421662211418, "epoch": 0.5319148936170213, "grad_norm": 2.176997661590576, "learning_rate": 0.00017834010269718526, "loss": 4.15623664855957, "mean_token_accuracy": 0.8820056915283203, "num_tokens": 62271.0, "step": 25 }, { "entropy": 0.11383292451500893, "epoch": 0.5531914893617021, "grad_norm": 0.5305500030517578, "learning_rate": 0.0001760978787760968, "loss": 4.076779365539551, "mean_token_accuracy": 0.8941320031881332, "num_tokens": 64751.0, "step": 26 }, { "entropy": 0.13319513201713562, "epoch": 0.574468085106383, "grad_norm": 1.0374587774276733, "learning_rate": 0.00017376084637406222, "loss": 4.014706611633301, "mean_token_accuracy": 0.8837339729070663, "num_tokens": 67220.0, "step": 27 }, { "entropy": 0.13686015084385872, "epoch": 0.5957446808510638, "grad_norm": 1.387152075767517, "learning_rate": 0.00017133191714243805, "loss": 4.015310764312744, "mean_token_accuracy": 0.8779295533895493, "num_tokens": 69678.0, "step": 28 }, { "entropy": 0.13596300408244133, "epoch": 0.6170212765957447, "grad_norm": 1.2698324918746948, "learning_rate": 0.00016881411722458688, "loss": 3.992821455001831, "mean_token_accuracy": 0.8992939442396164, "num_tokens": 72158.0, "step": 29 }, { "entropy": 0.13812873139977455, "epoch": 0.6382978723404256, "grad_norm": 1.9082021713256836, "learning_rate": 0.00016621058348568007, "loss": 4.059752464294434, "mean_token_accuracy": 0.886225238442421, "num_tokens": 74621.0, "step": 30 }, { "entropy": 0.1471228487789631, "epoch": 0.6595744680851063, "grad_norm": 1.0790090560913086, "learning_rate": 0.00016352455960455387, "loss": 3.956774950027466, "mean_token_accuracy": 0.8888719379901886, "num_tokens": 77122.0, "step": 31 }, { "entropy": 0.13649508357048035, "epoch": 0.6808510638297872, "grad_norm": 0.8638296127319336, "learning_rate": 0.0001607593920324899, "loss": 4.1457977294921875, "mean_token_accuracy": 0.8863866329193115, "num_tokens": 79658.0, "step": 32 }, { "entropy": 0.13422205485403538, "epoch": 0.7021276595744681, "grad_norm": 0.8206593990325928, "learning_rate": 0.00015791852582395334, "loss": 4.104636192321777, "mean_token_accuracy": 0.893946647644043, "num_tokens": 82198.0, "step": 33 }, { "entropy": 0.13717253133654594, "epoch": 0.723404255319149, "grad_norm": 0.43719571828842163, "learning_rate": 0.00015500550034448413, "loss": 4.031332015991211, "mean_token_accuracy": 0.894197016954422, "num_tokens": 84670.0, "step": 34 }, { "entropy": 0.1137513667345047, "epoch": 0.7446808510638298, "grad_norm": 1.8441417217254639, "learning_rate": 0.0001520239448610882, "loss": 4.112149715423584, "mean_token_accuracy": 0.8909876793622971, "num_tokens": 87292.0, "step": 35 }, { "entropy": 0.11223667673766613, "epoch": 0.7659574468085106, "grad_norm": 0.4776930809020996, "learning_rate": 0.00014897757402062284, "loss": 4.026741027832031, "mean_token_accuracy": 0.8924113065004349, "num_tokens": 89830.0, "step": 36 }, { "entropy": 0.12275257520377636, "epoch": 0.7872340425531915, "grad_norm": 0.9828954935073853, "learning_rate": 0.00014587018322180905, "loss": 4.183655738830566, "mean_token_accuracy": 0.8827805668115616, "num_tokens": 92344.0, "step": 37 }, { "entropy": 0.12380701676011086, "epoch": 0.8085106382978723, "grad_norm": 1.3710100650787354, "learning_rate": 0.0001427056438866376, "loss": 4.003378868103027, "mean_token_accuracy": 0.8812988549470901, "num_tokens": 94826.0, "step": 38 }, { "entropy": 0.10968485288321972, "epoch": 0.8297872340425532, "grad_norm": 0.37869715690612793, "learning_rate": 0.00013948789863705912, "loss": 4.050682067871094, "mean_token_accuracy": 0.8941126763820648, "num_tokens": 97290.0, "step": 39 }, { "entropy": 0.12006617523729801, "epoch": 0.851063829787234, "grad_norm": 0.5866818428039551, "learning_rate": 0.00013622095638296826, "loss": 4.113466262817383, "mean_token_accuracy": 0.8894326388835907, "num_tokens": 99776.0, "step": 40 }, { "entropy": 0.09959963150322437, "epoch": 0.8723404255319149, "grad_norm": 0.4211389422416687, "learning_rate": 0.000132908887327601, "loss": 3.8911352157592773, "mean_token_accuracy": 0.8987201750278473, "num_tokens": 102278.0, "step": 41 }, { "entropy": 0.10989912413060665, "epoch": 0.8936170212765957, "grad_norm": 1.014770746231079, "learning_rate": 0.00012955581789656843, "loss": 4.067371845245361, "mean_token_accuracy": 0.8916666656732559, "num_tokens": 104764.0, "step": 42 }, { "entropy": 0.11506957560777664, "epoch": 0.9148936170212766, "grad_norm": 0.4580586552619934, "learning_rate": 0.0001261659255968441, "loss": 4.101069927215576, "mean_token_accuracy": 0.8936023861169815, "num_tokens": 107201.0, "step": 43 }, { "entropy": 0.10838168673217297, "epoch": 0.9361702127659575, "grad_norm": 0.4166942536830902, "learning_rate": 0.00012274343381211066, "loss": 4.025703430175781, "mean_token_accuracy": 0.8947224318981171, "num_tokens": 109660.0, "step": 44 }, { "entropy": 0.09614014439284801, "epoch": 0.9574468085106383, "grad_norm": 0.9769757390022278, "learning_rate": 0.00011929260654094969, "loss": 4.121439456939697, "mean_token_accuracy": 0.8903171271085739, "num_tokens": 112117.0, "step": 45 }, { "entropy": 0.11138966307044029, "epoch": 0.9787234042553191, "grad_norm": 1.5290015935897827, "learning_rate": 0.0001158177430844304, "loss": 4.022660732269287, "mean_token_accuracy": 0.8867548704147339, "num_tokens": 114595.0, "step": 46 }, { "entropy": 0.10535211116075516, "epoch": 1.0, "grad_norm": 0.6933005452156067, "learning_rate": 0.00011232317268971585, "loss": 4.150263786315918, "mean_token_accuracy": 0.8926616609096527, "num_tokens": 117080.0, "step": 47 }, { "epoch": 1.0, "eval_entropy": 0.0, "eval_loss": NaN, "eval_mean_token_accuracy": 0.0, "eval_num_tokens": 117080.0, "eval_runtime": 14.1972, "eval_samples_per_second": 21.131, "eval_steps_per_second": 5.283, "step": 47 }, { "entropy": 0.10801766626536846, "epoch": 1.0212765957446808, "grad_norm": 0.7822345495223999, "learning_rate": 0.00010881324915636019, "loss": 4.09091854095459, "mean_token_accuracy": 0.8906879872083664, "num_tokens": 119621.0, "step": 48 }, { "entropy": 0.09913330711424351, "epoch": 1.0425531914893618, "grad_norm": 0.39496442675590515, "learning_rate": 0.00010529234541201631, "loss": 4.025051593780518, "mean_token_accuracy": 0.8955279290676117, "num_tokens": 122130.0, "step": 49 }, { "entropy": 0.1028544194996357, "epoch": 1.0638297872340425, "grad_norm": 0.6361362338066101, "learning_rate": 0.00010176484806431288, "loss": 3.9412522315979004, "mean_token_accuracy": 0.8919207155704498, "num_tokens": 124637.0, "step": 50 }, { "entropy": 0.11368882842361927, "epoch": 1.0851063829787233, "grad_norm": 0.31298503279685974, "learning_rate": 9.823515193568715e-05, "loss": 4.047340393066406, "mean_token_accuracy": 0.8940476626157761, "num_tokens": 127112.0, "step": 51 }, { "entropy": 0.10808366723358631, "epoch": 1.1063829787234043, "grad_norm": 0.49920883774757385, "learning_rate": 9.470765458798368e-05, "loss": 4.001613616943359, "mean_token_accuracy": 0.889927327632904, "num_tokens": 129587.0, "step": 52 }, { "entropy": 0.11089801043272018, "epoch": 1.127659574468085, "grad_norm": 0.46408575773239136, "learning_rate": 9.118675084363986e-05, "loss": 4.0368852615356445, "mean_token_accuracy": 0.8947365581989288, "num_tokens": 132070.0, "step": 53 }, { "entropy": 0.10656954161822796, "epoch": 1.148936170212766, "grad_norm": 0.3796578049659729, "learning_rate": 8.767682731028415e-05, "loss": 4.020212173461914, "mean_token_accuracy": 0.8955279290676117, "num_tokens": 134579.0, "step": 54 }, { "entropy": 0.11924762278795242, "epoch": 1.1702127659574468, "grad_norm": 0.21246585249900818, "learning_rate": 8.418225691556962e-05, "loss": 4.0544514656066895, "mean_token_accuracy": 0.8960863649845123, "num_tokens": 136943.0, "step": 55 }, { "entropy": 0.11127430945634842, "epoch": 1.1914893617021276, "grad_norm": 0.3929970860481262, "learning_rate": 8.070739345905032e-05, "loss": 4.095489025115967, "mean_token_accuracy": 0.8973319381475449, "num_tokens": 139492.0, "step": 56 }, { "entropy": 0.11025936901569366, "epoch": 1.2127659574468086, "grad_norm": 0.5039997696876526, "learning_rate": 7.725656618788937e-05, "loss": 4.091797828674316, "mean_token_accuracy": 0.8902327716350555, "num_tokens": 141944.0, "step": 57 }, { "entropy": 0.1125901136547327, "epoch": 1.2340425531914894, "grad_norm": 0.23206305503845215, "learning_rate": 7.383407440315596e-05, "loss": 4.056682586669922, "mean_token_accuracy": 0.8979178667068481, "num_tokens": 144392.0, "step": 58 }, { "entropy": 0.10212262719869614, "epoch": 1.2553191489361701, "grad_norm": 0.05287244915962219, "learning_rate": 7.04441821034316e-05, "loss": 3.9536325931549072, "mean_token_accuracy": 0.899132177233696, "num_tokens": 146822.0, "step": 59 }, { "entropy": 0.10311507619917393, "epoch": 1.2765957446808511, "grad_norm": 0.22314538061618805, "learning_rate": 6.7091112672399e-05, "loss": 4.06229829788208, "mean_token_accuracy": 0.894688680768013, "num_tokens": 149381.0, "step": 60 }, { "entropy": 0.11741508357226849, "epoch": 1.297872340425532, "grad_norm": 0.8379692435264587, "learning_rate": 6.377904361703178e-05, "loss": 4.129307270050049, "mean_token_accuracy": 0.8864650130271912, "num_tokens": 151872.0, "step": 61 }, { "entropy": 0.10069144517183304, "epoch": 1.3191489361702127, "grad_norm": 0.07896701246500015, "learning_rate": 6.051210136294089e-05, "loss": 3.9954659938812256, "mean_token_accuracy": 0.8986529260873795, "num_tokens": 154366.0, "step": 62 }, { "entropy": 0.10588889196515083, "epoch": 1.3404255319148937, "grad_norm": 0.37503722310066223, "learning_rate": 5.729435611336239e-05, "loss": 4.065610885620117, "mean_token_accuracy": 0.8914495259523392, "num_tokens": 156920.0, "step": 63 }, { "entropy": 0.10409239679574966, "epoch": 1.3617021276595744, "grad_norm": 0.33657321333885193, "learning_rate": 5.4129816778190936e-05, "loss": 3.9452602863311768, "mean_token_accuracy": 0.8961538225412369, "num_tokens": 159260.0, "step": 64 }, { "entropy": 0.10675412602722645, "epoch": 1.3829787234042552, "grad_norm": 0.23680685460567474, "learning_rate": 5.102242597937717e-05, "loss": 4.065974235534668, "mean_token_accuracy": 0.8973371386528015, "num_tokens": 161698.0, "step": 65 }, { "entropy": 0.11763200350105762, "epoch": 1.4042553191489362, "grad_norm": 0.48635369539260864, "learning_rate": 4.797605513891179e-05, "loss": 4.164796829223633, "mean_token_accuracy": 0.8921221196651459, "num_tokens": 164193.0, "step": 66 }, { "entropy": 0.09798314236104488, "epoch": 1.425531914893617, "grad_norm": 0.14462092518806458, "learning_rate": 4.4994499655515865e-05, "loss": 4.042727947235107, "mean_token_accuracy": 0.8979178667068481, "num_tokens": 166683.0, "step": 67 }, { "entropy": 0.10395899415016174, "epoch": 1.4468085106382977, "grad_norm": 0.06169198080897331, "learning_rate": 4.2081474176046646e-05, "loss": 4.123526573181152, "mean_token_accuracy": 0.8957811146974564, "num_tokens": 169151.0, "step": 68 }, { "entropy": 0.10421585291624069, "epoch": 1.4680851063829787, "grad_norm": 1.1794296503067017, "learning_rate": 3.924060796751012e-05, "loss": 4.157026767730713, "mean_token_accuracy": 0.888762429356575, "num_tokens": 171681.0, "step": 69 }, { "entropy": 0.09568466432392597, "epoch": 1.4893617021276595, "grad_norm": 0.02028118632733822, "learning_rate": 3.647544039544615e-05, "loss": 4.053896427154541, "mean_token_accuracy": 0.8979416936635971, "num_tokens": 174203.0, "step": 70 }, { "entropy": 0.10582420416176319, "epoch": 1.5106382978723403, "grad_norm": 0.1698542982339859, "learning_rate": 3.378941651431996e-05, "loss": 3.990485191345215, "mean_token_accuracy": 0.898457407951355, "num_tokens": 176621.0, "step": 71 }, { "entropy": 0.1072782352566719, "epoch": 1.5319148936170213, "grad_norm": 0.6851707100868225, "learning_rate": 3.118588277541312e-05, "loss": 4.162285327911377, "mean_token_accuracy": 0.8921699970960617, "num_tokens": 179126.0, "step": 72 }, { "entropy": 0.10387748293578625, "epoch": 1.5531914893617023, "grad_norm": 0.37178531289100647, "learning_rate": 2.8668082857562005e-05, "loss": 4.084682464599609, "mean_token_accuracy": 0.8933728933334351, "num_tokens": 181650.0, "step": 73 }, { "entropy": 0.10093368589878082, "epoch": 1.574468085106383, "grad_norm": 0.03769727796316147, "learning_rate": 2.6239153625937784e-05, "loss": 4.045993804931641, "mean_token_accuracy": 0.8973006755113602, "num_tokens": 184077.0, "step": 74 }, { "entropy": 0.09933018498122692, "epoch": 1.5957446808510638, "grad_norm": 0.06748200207948685, "learning_rate": 2.390212122390323e-05, "loss": 3.9992191791534424, "mean_token_accuracy": 0.8992939442396164, "num_tokens": 186549.0, "step": 75 }, { "entropy": 0.10636681690812111, "epoch": 1.6170212765957448, "grad_norm": 0.21794308722019196, "learning_rate": 2.1659897302814747e-05, "loss": 4.072402000427246, "mean_token_accuracy": 0.8967273831367493, "num_tokens": 189001.0, "step": 76 }, { "entropy": 0.09489450231194496, "epoch": 1.6382978723404256, "grad_norm": 0.20672070980072021, "learning_rate": 1.9515275394467446e-05, "loss": 3.8761157989501953, "mean_token_accuracy": 0.9024099707603455, "num_tokens": 191502.0, "step": 77 }, { "entropy": 0.09246066771447659, "epoch": 1.6595744680851063, "grad_norm": 0.2982085943222046, "learning_rate": 1.7470927430702277e-05, "loss": 4.011519432067871, "mean_token_accuracy": 0.8992336541414261, "num_tokens": 194063.0, "step": 78 }, { "entropy": 0.09505276940762997, "epoch": 1.6808510638297873, "grad_norm": 0.41892215609550476, "learning_rate": 1.5529400414511806e-05, "loss": 3.942739725112915, "mean_token_accuracy": 0.8950906693935394, "num_tokens": 196634.0, "step": 79 }, { "entropy": 0.10412091203033924, "epoch": 1.702127659574468, "grad_norm": 0.6482428312301636, "learning_rate": 1.3693113246791589e-05, "loss": 4.158843517303467, "mean_token_accuracy": 0.8888326436281204, "num_tokens": 199099.0, "step": 80 }, { "entropy": 0.09425530955195427, "epoch": 1.7234042553191489, "grad_norm": 0.07691552489995956, "learning_rate": 1.196435371269089e-05, "loss": 4.058327674865723, "mean_token_accuracy": 0.8973006755113602, "num_tokens": 201577.0, "step": 81 }, { "entropy": 0.10262792184948921, "epoch": 1.7446808510638299, "grad_norm": 0.8844386339187622, "learning_rate": 1.0345275631317163e-05, "loss": 4.1612653732299805, "mean_token_accuracy": 0.8891943842172623, "num_tokens": 204137.0, "step": 82 }, { "entropy": 0.09942430071532726, "epoch": 1.7659574468085106, "grad_norm": 0.3644232749938965, "learning_rate": 8.837896172345827e-06, "loss": 4.026100158691406, "mean_token_accuracy": 0.8954477906227112, "num_tokens": 206717.0, "step": 83 }, { "entropy": 0.0988146997988224, "epoch": 1.7872340425531914, "grad_norm": 0.2477438896894455, "learning_rate": 7.4440933428779e-06, "loss": 3.8571834564208984, "mean_token_accuracy": 0.9018292427062988, "num_tokens": 209169.0, "step": 84 }, { "entropy": 0.10586683638393879, "epoch": 1.8085106382978724, "grad_norm": 0.26259544491767883, "learning_rate": 6.165603647677054e-06, "loss": 3.961254358291626, "mean_token_accuracy": 0.8967323154211044, "num_tokens": 211565.0, "step": 85 }, { "entropy": 0.10182979516685009, "epoch": 1.8297872340425532, "grad_norm": 0.1101575642824173, "learning_rate": 5.00401992570092e-06, "loss": 4.137490272521973, "mean_token_accuracy": 0.89537513256073, "num_tokens": 214053.0, "step": 86 }, { "entropy": 0.10845262557268143, "epoch": 1.851063829787234, "grad_norm": 0.048552438616752625, "learning_rate": 3.960789365622075e-06, "loss": 4.191901206970215, "mean_token_accuracy": 0.8933143615722656, "num_tokens": 216498.0, "step": 87 }, { "entropy": 0.10030228458344936, "epoch": 1.872340425531915, "grad_norm": 0.3250134289264679, "learning_rate": 3.0372117028111825e-06, "loss": 4.097182750701904, "mean_token_accuracy": 0.8939535617828369, "num_tokens": 218982.0, "step": 88 }, { "entropy": 0.11286174692213535, "epoch": 1.8936170212765957, "grad_norm": 0.7210190892219543, "learning_rate": 2.2344376000285604e-06, "loss": 4.022359848022461, "mean_token_accuracy": 0.8914642333984375, "num_tokens": 221444.0, "step": 89 }, { "entropy": 0.10275478102266788, "epoch": 1.9148936170212765, "grad_norm": 0.3212966322898865, "learning_rate": 1.553467213841664e-06, "loss": 4.045522689819336, "mean_token_accuracy": 0.8947365581989288, "num_tokens": 223969.0, "step": 90 }, { "entropy": 0.10150141455233097, "epoch": 1.9361702127659575, "grad_norm": 0.23617830872535706, "learning_rate": 9.951489485545695e-07, "loss": 4.035382270812988, "mean_token_accuracy": 0.8986529260873795, "num_tokens": 226520.0, "step": 91 }, { "entropy": 0.10262680239975452, "epoch": 1.9574468085106385, "grad_norm": 0.4545777440071106, "learning_rate": 5.60178399201805e-07, "loss": 4.09911584854126, "mean_token_accuracy": 0.8873096108436584, "num_tokens": 229047.0, "step": 92 }, { "entropy": 0.09875928983092308, "epoch": 1.978723404255319, "grad_norm": 0.07097365707159042, "learning_rate": 2.490974849236216e-07, "loss": 4.016970157623291, "mean_token_accuracy": 0.8986529260873795, "num_tokens": 231567.0, "step": 93 }, { "entropy": 0.09762230329215527, "epoch": 2.0, "grad_norm": 0.3958527445793152, "learning_rate": 6.229377380218005e-08, "loss": 4.0623064041137695, "mean_token_accuracy": 0.894871786236763, "num_tokens": 234138.0, "step": 94 }, { "epoch": 2.0, "eval_entropy": 0.0, "eval_loss": NaN, "eval_mean_token_accuracy": 0.0, "eval_num_tokens": 234138.0, "eval_runtime": 13.8638, "eval_samples_per_second": 21.639, "eval_steps_per_second": 5.41, "step": 94 } ], "logging_steps": 1, "max_steps": 94, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 1 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 392624361701376.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }