{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 51, "global_step": 256, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0078125, "grad_norm": 0.28995832800865173, "learning_rate": 0.0, "loss": 1.423828125, "step": 1 }, { "epoch": 0.015625, "grad_norm": 0.28130924701690674, "learning_rate": 7.692307692307694e-06, "loss": 1.38134765625, "step": 2 }, { "epoch": 0.0234375, "grad_norm": 0.25881335139274597, "learning_rate": 1.5384615384615387e-05, "loss": 1.3720703125, "step": 3 }, { "epoch": 0.03125, "grad_norm": 0.2908932864665985, "learning_rate": 2.307692307692308e-05, "loss": 1.27587890625, "step": 4 }, { "epoch": 0.0390625, "grad_norm": 0.3206496834754944, "learning_rate": 3.0769230769230774e-05, "loss": 1.37109375, "step": 5 }, { "epoch": 0.046875, "grad_norm": 0.25504836440086365, "learning_rate": 3.846153846153846e-05, "loss": 1.2137451171875, "step": 6 }, { "epoch": 0.0546875, "grad_norm": 0.28696101903915405, "learning_rate": 4.615384615384616e-05, "loss": 1.3525390625, "step": 7 }, { "epoch": 0.0625, "grad_norm": 0.2355114072561264, "learning_rate": 5.384615384615385e-05, "loss": 1.0560302734375, "step": 8 }, { "epoch": 0.0703125, "grad_norm": 0.25246548652648926, "learning_rate": 6.153846153846155e-05, "loss": 1.27490234375, "step": 9 }, { "epoch": 0.078125, "grad_norm": 0.19615069031715393, "learning_rate": 6.923076923076924e-05, "loss": 1.244140625, "step": 10 }, { "epoch": 0.0859375, "grad_norm": 0.17060348391532898, "learning_rate": 7.692307692307693e-05, "loss": 1.2353515625, "step": 11 }, { "epoch": 0.09375, "grad_norm": 0.15811215341091156, "learning_rate": 8.461538461538461e-05, "loss": 1.125, "step": 12 }, { "epoch": 0.1015625, "grad_norm": 0.23893103003501892, "learning_rate": 9.230769230769232e-05, "loss": 1.18359375, "step": 13 }, { "epoch": 0.109375, "grad_norm": 0.29393115639686584, "learning_rate": 0.0001, "loss": 1.2109375, "step": 14 }, { "epoch": 0.1171875, "grad_norm": 0.2848770022392273, "learning_rate": 9.999623934349469e-05, "loss": 1.17529296875, "step": 15 }, { "epoch": 0.125, "grad_norm": 0.23788601160049438, "learning_rate": 9.998495800253594e-05, "loss": 1.14501953125, "step": 16 }, { "epoch": 0.1328125, "grad_norm": 0.19343820214271545, "learning_rate": 9.996615786269035e-05, "loss": 1.2119140625, "step": 17 }, { "epoch": 0.140625, "grad_norm": 0.11705930531024933, "learning_rate": 9.993984206621875e-05, "loss": 1.138671875, "step": 18 }, { "epoch": 0.1484375, "grad_norm": 0.0940169170498848, "learning_rate": 9.990601501155095e-05, "loss": 1.047607421875, "step": 19 }, { "epoch": 0.15625, "grad_norm": 0.09164854884147644, "learning_rate": 9.986468235255065e-05, "loss": 1.07763671875, "step": 20 }, { "epoch": 0.1640625, "grad_norm": 0.11077525466680527, "learning_rate": 9.981585099757043e-05, "loss": 1.057861328125, "step": 21 }, { "epoch": 0.171875, "grad_norm": 0.11556923389434814, "learning_rate": 9.975952910829707e-05, "loss": 1.064453125, "step": 22 }, { "epoch": 0.1796875, "grad_norm": 0.10512404888868332, "learning_rate": 9.969572609838744e-05, "loss": 0.993896484375, "step": 23 }, { "epoch": 0.1875, "grad_norm": 0.10946336388587952, "learning_rate": 9.962445263189505e-05, "loss": 1.1328125, "step": 24 }, { "epoch": 0.1953125, "grad_norm": 0.10185452550649643, "learning_rate": 9.954572062148773e-05, "loss": 0.987548828125, "step": 25 }, { "epoch": 0.203125, "grad_norm": 0.10250338912010193, "learning_rate": 9.945954322645642e-05, "loss": 1.09912109375, "step": 26 }, { "epoch": 0.2109375, "grad_norm": 0.10008298605680466, "learning_rate": 9.936593485051584e-05, "loss": 1.071044921875, "step": 27 }, { "epoch": 0.21875, "grad_norm": 0.10557658970355988, "learning_rate": 9.926491113939705e-05, "loss": 1.100830078125, "step": 28 }, { "epoch": 0.2265625, "grad_norm": 0.08323658257722855, "learning_rate": 9.915648897823232e-05, "loss": 1.086669921875, "step": 29 }, { "epoch": 0.234375, "grad_norm": 0.08515891432762146, "learning_rate": 9.904068648873299e-05, "loss": 1.02685546875, "step": 30 }, { "epoch": 0.2421875, "grad_norm": 0.08433088660240173, "learning_rate": 9.891752302616066e-05, "loss": 1.05615234375, "step": 31 }, { "epoch": 0.25, "grad_norm": 0.1458551585674286, "learning_rate": 9.878701917609207e-05, "loss": 1.024658203125, "step": 32 }, { "epoch": 0.2578125, "grad_norm": 0.0871451199054718, "learning_rate": 9.864919675097846e-05, "loss": 1.11865234375, "step": 33 }, { "epoch": 0.265625, "grad_norm": 0.08478949218988419, "learning_rate": 9.85040787864998e-05, "loss": 1.01025390625, "step": 34 }, { "epoch": 0.2734375, "grad_norm": 0.07362563908100128, "learning_rate": 9.835168953771461e-05, "loss": 1.033203125, "step": 35 }, { "epoch": 0.28125, "grad_norm": 0.07105343043804169, "learning_rate": 9.819205447500603e-05, "loss": 1.02001953125, "step": 36 }, { "epoch": 0.2890625, "grad_norm": 0.08549123257398605, "learning_rate": 9.80252002798246e-05, "loss": 1.03857421875, "step": 37 }, { "epoch": 0.296875, "grad_norm": 0.09394215047359467, "learning_rate": 9.78511548402287e-05, "loss": 0.987548828125, "step": 38 }, { "epoch": 0.3046875, "grad_norm": 0.07717522233724594, "learning_rate": 9.766994724622344e-05, "loss": 0.911376953125, "step": 39 }, { "epoch": 0.3125, "grad_norm": 0.07993735373020172, "learning_rate": 9.74816077848985e-05, "loss": 1.052734375, "step": 40 }, { "epoch": 0.3203125, "grad_norm": 0.07395265251398087, "learning_rate": 9.728616793536588e-05, "loss": 1.03466796875, "step": 41 }, { "epoch": 0.328125, "grad_norm": 0.07913617789745331, "learning_rate": 9.708366036349854e-05, "loss": 0.97802734375, "step": 42 }, { "epoch": 0.3359375, "grad_norm": 0.08407563716173172, "learning_rate": 9.687411891647059e-05, "loss": 1.004638671875, "step": 43 }, { "epoch": 0.34375, "grad_norm": 0.07545147836208344, "learning_rate": 9.665757861710008e-05, "loss": 0.994140625, "step": 44 }, { "epoch": 0.3515625, "grad_norm": 0.07266917824745178, "learning_rate": 9.643407565799524e-05, "loss": 0.935302734375, "step": 45 }, { "epoch": 0.359375, "grad_norm": 0.08004212379455566, "learning_rate": 9.620364739550527e-05, "loss": 0.927978515625, "step": 46 }, { "epoch": 0.3671875, "grad_norm": 0.16914942860603333, "learning_rate": 9.59663323434766e-05, "loss": 0.969970703125, "step": 47 }, { "epoch": 0.375, "grad_norm": 0.07862447947263718, "learning_rate": 9.572217016681565e-05, "loss": 1.0166015625, "step": 48 }, { "epoch": 0.3828125, "grad_norm": 0.08359777182340622, "learning_rate": 9.54712016748592e-05, "loss": 1.01171875, "step": 49 }, { "epoch": 0.390625, "grad_norm": 0.0827992707490921, "learning_rate": 9.521346881455356e-05, "loss": 1.06103515625, "step": 50 }, { "epoch": 0.3984375, "grad_norm": 0.07072290778160095, "learning_rate": 9.494901466344353e-05, "loss": 0.874755859375, "step": 51 }, { "epoch": 0.40625, "grad_norm": 0.08112584054470062, "learning_rate": 9.467788342247236e-05, "loss": 0.9560546875, "step": 52 }, { "epoch": 0.40625, "eval_loss": 0.982421875, "eval_runtime": 6.3901, "eval_samples_per_second": 1.095, "eval_steps_per_second": 0.156, "step": 52 }, { "epoch": 0.4140625, "grad_norm": 0.08152227103710175, "learning_rate": 9.44001204085941e-05, "loss": 0.937744140625, "step": 53 }, { "epoch": 0.421875, "grad_norm": 0.07884660363197327, "learning_rate": 9.411577204719915e-05, "loss": 1.01171875, "step": 54 }, { "epoch": 0.4296875, "grad_norm": 0.08499646186828613, "learning_rate": 9.382488586435488e-05, "loss": 1.0107421875, "step": 55 }, { "epoch": 0.4375, "grad_norm": 0.08610514551401138, "learning_rate": 9.3527510478862e-05, "loss": 0.9307861328125, "step": 56 }, { "epoch": 0.4453125, "grad_norm": 0.07941639423370361, "learning_rate": 9.32236955941284e-05, "loss": 0.8533935546875, "step": 57 }, { "epoch": 0.453125, "grad_norm": 0.0884481891989708, "learning_rate": 9.291349198986173e-05, "loss": 0.9912109375, "step": 58 }, { "epoch": 0.4609375, "grad_norm": 0.08216440677642822, "learning_rate": 9.259695151358214e-05, "loss": 1.009765625, "step": 59 }, { "epoch": 0.46875, "grad_norm": 0.09028297662734985, "learning_rate": 9.227412707195636e-05, "loss": 0.931640625, "step": 60 }, { "epoch": 0.4765625, "grad_norm": 0.08735080063343048, "learning_rate": 9.194507262195484e-05, "loss": 1.001953125, "step": 61 }, { "epoch": 0.484375, "grad_norm": 0.08551003783941269, "learning_rate": 9.160984316183355e-05, "loss": 0.9010009765625, "step": 62 }, { "epoch": 0.4921875, "grad_norm": 0.08458489179611206, "learning_rate": 9.126849472194135e-05, "loss": 0.9619140625, "step": 63 }, { "epoch": 0.5, "grad_norm": 0.09197501093149185, "learning_rate": 9.092108435535519e-05, "loss": 0.860595703125, "step": 64 }, { "epoch": 0.5078125, "grad_norm": 0.0835501030087471, "learning_rate": 9.056767012834418e-05, "loss": 0.96728515625, "step": 65 }, { "epoch": 0.515625, "grad_norm": 0.0892043188214302, "learning_rate": 9.020831111066439e-05, "loss": 0.9072265625, "step": 66 }, { "epoch": 0.5234375, "grad_norm": 0.10175707936286926, "learning_rate": 8.984306736568596e-05, "loss": 0.8592529296875, "step": 67 }, { "epoch": 0.53125, "grad_norm": 0.1044527143239975, "learning_rate": 8.947199994035401e-05, "loss": 0.9072265625, "step": 68 }, { "epoch": 0.5390625, "grad_norm": 0.09157323092222214, "learning_rate": 8.909517085498531e-05, "loss": 0.97021484375, "step": 69 }, { "epoch": 0.546875, "grad_norm": 0.08929987996816635, "learning_rate": 8.871264309290213e-05, "loss": 0.927490234375, "step": 70 }, { "epoch": 0.5546875, "grad_norm": 0.09748449921607971, "learning_rate": 8.832448058990521e-05, "loss": 1.0166015625, "step": 71 }, { "epoch": 0.5625, "grad_norm": 0.09099110215902328, "learning_rate": 8.793074822358756e-05, "loss": 1.0107421875, "step": 72 }, { "epoch": 0.5703125, "grad_norm": 0.09120053797960281, "learning_rate": 8.753151180249069e-05, "loss": 0.89990234375, "step": 73 }, { "epoch": 0.578125, "grad_norm": 0.09496539831161499, "learning_rate": 8.712683805510546e-05, "loss": 0.99169921875, "step": 74 }, { "epoch": 0.5859375, "grad_norm": 0.08639498800039291, "learning_rate": 8.671679461871904e-05, "loss": 0.85504150390625, "step": 75 }, { "epoch": 0.59375, "grad_norm": 0.09459307044744492, "learning_rate": 8.630145002810988e-05, "loss": 0.9169921875, "step": 76 }, { "epoch": 0.6015625, "grad_norm": 0.09741773456335068, "learning_rate": 8.588087370409303e-05, "loss": 0.97607421875, "step": 77 }, { "epoch": 0.609375, "grad_norm": 0.09259133785963058, "learning_rate": 8.54551359419168e-05, "loss": 0.921142578125, "step": 78 }, { "epoch": 0.6171875, "grad_norm": 0.102195143699646, "learning_rate": 8.502430789951387e-05, "loss": 0.91845703125, "step": 79 }, { "epoch": 0.625, "grad_norm": 0.09723465144634247, "learning_rate": 8.458846158560787e-05, "loss": 0.83203125, "step": 80 }, { "epoch": 0.6328125, "grad_norm": 0.09734958410263062, "learning_rate": 8.414766984767764e-05, "loss": 0.943115234375, "step": 81 }, { "epoch": 0.640625, "grad_norm": 0.09370985627174377, "learning_rate": 8.370200635978177e-05, "loss": 0.96044921875, "step": 82 }, { "epoch": 0.6484375, "grad_norm": 0.10649316757917404, "learning_rate": 8.325154561024444e-05, "loss": 0.978515625, "step": 83 }, { "epoch": 0.65625, "grad_norm": 0.10507673770189285, "learning_rate": 8.279636288920557e-05, "loss": 0.9619140625, "step": 84 }, { "epoch": 0.6640625, "grad_norm": 0.0925222709774971, "learning_rate": 8.233653427603676e-05, "loss": 0.94677734375, "step": 85 }, { "epoch": 0.671875, "grad_norm": 0.09863923490047455, "learning_rate": 8.187213662662538e-05, "loss": 0.9267578125, "step": 86 }, { "epoch": 0.6796875, "grad_norm": 0.10442425310611725, "learning_rate": 8.14032475605288e-05, "loss": 0.98486328125, "step": 87 }, { "epoch": 0.6875, "grad_norm": 0.09902859479188919, "learning_rate": 8.092994544800111e-05, "loss": 0.904052734375, "step": 88 }, { "epoch": 0.6953125, "grad_norm": 0.1050918698310852, "learning_rate": 8.045230939689425e-05, "loss": 1.0224609375, "step": 89 }, { "epoch": 0.703125, "grad_norm": 0.10043203085660934, "learning_rate": 7.997041923943587e-05, "loss": 0.95703125, "step": 90 }, { "epoch": 0.7109375, "grad_norm": 0.09804964810609818, "learning_rate": 7.948435551888622e-05, "loss": 0.97998046875, "step": 91 }, { "epoch": 0.71875, "grad_norm": 0.1037558987736702, "learning_rate": 7.899419947607612e-05, "loss": 0.92626953125, "step": 92 }, { "epoch": 0.7265625, "grad_norm": 0.10760906338691711, "learning_rate": 7.850003303582823e-05, "loss": 0.836669921875, "step": 93 }, { "epoch": 0.734375, "grad_norm": 0.10727047175168991, "learning_rate": 7.800193879326429e-05, "loss": 0.785400390625, "step": 94 }, { "epoch": 0.7421875, "grad_norm": 0.11248599737882614, "learning_rate": 7.75e-05, "loss": 0.92919921875, "step": 95 }, { "epoch": 0.75, "grad_norm": 0.09993602335453033, "learning_rate": 7.699430055023039e-05, "loss": 0.797607421875, "step": 96 }, { "epoch": 0.7578125, "grad_norm": 0.10109154880046844, "learning_rate": 7.64849249667077e-05, "loss": 0.957275390625, "step": 97 }, { "epoch": 0.765625, "grad_norm": 0.09973707050085068, "learning_rate": 7.597195838661426e-05, "loss": 0.811279296875, "step": 98 }, { "epoch": 0.7734375, "grad_norm": 0.11369027942419052, "learning_rate": 7.545548654733254e-05, "loss": 0.859130859375, "step": 99 }, { "epoch": 0.78125, "grad_norm": 0.1155623346567154, "learning_rate": 7.493559577211509e-05, "loss": 0.99365234375, "step": 100 }, { "epoch": 0.7890625, "grad_norm": 0.10785958170890808, "learning_rate": 7.441237295565642e-05, "loss": 0.91455078125, "step": 101 }, { "epoch": 0.796875, "grad_norm": 0.10221569985151291, "learning_rate": 7.388590554956932e-05, "loss": 0.8681640625, "step": 102 }, { "epoch": 0.8046875, "grad_norm": 0.10055916756391525, "learning_rate": 7.335628154776826e-05, "loss": 0.93603515625, "step": 103 }, { "epoch": 0.8046875, "eval_loss": 0.9228515625, "eval_runtime": 6.3845, "eval_samples_per_second": 1.096, "eval_steps_per_second": 0.157, "step": 103 }, { "epoch": 0.8125, "grad_norm": 0.11852730065584183, "learning_rate": 7.282358947176207e-05, "loss": 0.88720703125, "step": 104 }, { "epoch": 0.8203125, "grad_norm": 0.10984767973423004, "learning_rate": 7.22879183558583e-05, "loss": 0.93994140625, "step": 105 }, { "epoch": 0.828125, "grad_norm": 0.10858634114265442, "learning_rate": 7.174935773228216e-05, "loss": 0.94921875, "step": 106 }, { "epoch": 0.8359375, "grad_norm": 0.10062723606824875, "learning_rate": 7.120799761621197e-05, "loss": 0.875, "step": 107 }, { "epoch": 0.84375, "grad_norm": 0.11308089643716812, "learning_rate": 7.066392849073408e-05, "loss": 0.92041015625, "step": 108 }, { "epoch": 0.8515625, "grad_norm": 0.11309632658958435, "learning_rate": 7.01172412917194e-05, "loss": 0.9326171875, "step": 109 }, { "epoch": 0.859375, "grad_norm": 0.10986102372407913, "learning_rate": 6.956802739262446e-05, "loss": 0.91357421875, "step": 110 }, { "epoch": 0.8671875, "grad_norm": 0.11195129156112671, "learning_rate": 6.901637858921912e-05, "loss": 0.904052734375, "step": 111 }, { "epoch": 0.875, "grad_norm": 0.09884140640497208, "learning_rate": 6.846238708424389e-05, "loss": 0.8277587890625, "step": 112 }, { "epoch": 0.8828125, "grad_norm": 0.12617164850234985, "learning_rate": 6.790614547199907e-05, "loss": 0.900634765625, "step": 113 }, { "epoch": 0.890625, "grad_norm": 0.09912654012441635, "learning_rate": 6.734774672286857e-05, "loss": 0.82177734375, "step": 114 }, { "epoch": 0.8984375, "grad_norm": 0.10471156239509583, "learning_rate": 6.678728416778077e-05, "loss": 0.95263671875, "step": 115 }, { "epoch": 0.90625, "grad_norm": 0.10680253058671951, "learning_rate": 6.622485148260916e-05, "loss": 0.93408203125, "step": 116 }, { "epoch": 0.9140625, "grad_norm": 0.12247629463672638, "learning_rate": 6.566054267251536e-05, "loss": 0.89697265625, "step": 117 }, { "epoch": 0.921875, "grad_norm": 0.09736290574073792, "learning_rate": 6.509445205623705e-05, "loss": 0.7998046875, "step": 118 }, { "epoch": 0.9296875, "grad_norm": 0.12649808824062347, "learning_rate": 6.45266742503235e-05, "loss": 0.984375, "step": 119 }, { "epoch": 0.9375, "grad_norm": 0.25388485193252563, "learning_rate": 6.395730415332133e-05, "loss": 0.822509765625, "step": 120 }, { "epoch": 0.9453125, "grad_norm": 0.11831840872764587, "learning_rate": 6.338643692991321e-05, "loss": 0.9404296875, "step": 121 }, { "epoch": 0.953125, "grad_norm": 0.11065713316202164, "learning_rate": 6.281416799501188e-05, "loss": 0.8447265625, "step": 122 }, { "epoch": 0.9609375, "grad_norm": 0.11394454538822174, "learning_rate": 6.224059299781258e-05, "loss": 0.9013671875, "step": 123 }, { "epoch": 0.96875, "grad_norm": 0.11419283598661423, "learning_rate": 6.166580780580621e-05, "loss": 0.95556640625, "step": 124 }, { "epoch": 0.9765625, "grad_norm": 0.11355093866586685, "learning_rate": 6.108990848875591e-05, "loss": 0.86279296875, "step": 125 }, { "epoch": 0.984375, "grad_norm": 0.13026076555252075, "learning_rate": 6.0512991302640044e-05, "loss": 0.9334716796875, "step": 126 }, { "epoch": 0.9921875, "grad_norm": 0.1125655397772789, "learning_rate": 5.993515267356393e-05, "loss": 0.94091796875, "step": 127 }, { "epoch": 1.0, "grad_norm": 0.11880125105381012, "learning_rate": 5.9356489181643075e-05, "loss": 0.8994140625, "step": 128 }, { "epoch": 1.0078125, "grad_norm": 0.12246272712945938, "learning_rate": 5.87770975448608e-05, "loss": 0.93115234375, "step": 129 }, { "epoch": 1.015625, "grad_norm": 0.11285988241434097, "learning_rate": 5.8197074602902854e-05, "loss": 0.9072265625, "step": 130 }, { "epoch": 1.0234375, "grad_norm": 0.11374016851186752, "learning_rate": 5.761651730097142e-05, "loss": 0.91748046875, "step": 131 }, { "epoch": 1.03125, "grad_norm": 0.11859993636608124, "learning_rate": 5.703552267358179e-05, "loss": 0.81982421875, "step": 132 }, { "epoch": 1.0390625, "grad_norm": 0.11889226734638214, "learning_rate": 5.645418782834398e-05, "loss": 0.904296875, "step": 133 }, { "epoch": 1.046875, "grad_norm": 0.11037025600671768, "learning_rate": 5.58726099297321e-05, "loss": 0.82666015625, "step": 134 }, { "epoch": 1.0546875, "grad_norm": 0.6102147102355957, "learning_rate": 5.529088618284427e-05, "loss": 0.91015625, "step": 135 }, { "epoch": 1.0625, "grad_norm": 0.10855386406183243, "learning_rate": 5.4709113817155734e-05, "loss": 0.716796875, "step": 136 }, { "epoch": 1.0703125, "grad_norm": 0.11782663315534592, "learning_rate": 5.4127390070267914e-05, "loss": 0.9013671875, "step": 137 }, { "epoch": 1.078125, "grad_norm": 0.11211375147104263, "learning_rate": 5.354581217165603e-05, "loss": 0.93701171875, "step": 138 }, { "epoch": 1.0859375, "grad_norm": 0.11000826954841614, "learning_rate": 5.2964477326418215e-05, "loss": 0.92138671875, "step": 139 }, { "epoch": 1.09375, "grad_norm": 0.11115771532058716, "learning_rate": 5.23834826990286e-05, "loss": 0.85693359375, "step": 140 }, { "epoch": 1.1015625, "grad_norm": 0.11890073120594025, "learning_rate": 5.180292539709716e-05, "loss": 0.89599609375, "step": 141 }, { "epoch": 1.109375, "grad_norm": 0.11530875414609909, "learning_rate": 5.122290245513919e-05, "loss": 0.908203125, "step": 142 }, { "epoch": 1.1171875, "grad_norm": 0.12277217209339142, "learning_rate": 5.064351081835694e-05, "loss": 0.889404296875, "step": 143 }, { "epoch": 1.125, "grad_norm": 0.1321323662996292, "learning_rate": 5.006484732643608e-05, "loss": 0.90283203125, "step": 144 }, { "epoch": 1.1328125, "grad_norm": 0.1247463971376419, "learning_rate": 4.948700869735996e-05, "loss": 0.96435546875, "step": 145 }, { "epoch": 1.140625, "grad_norm": 0.11841624230146408, "learning_rate": 4.8910091511244116e-05, "loss": 0.916015625, "step": 146 }, { "epoch": 1.1484375, "grad_norm": 0.1290961056947708, "learning_rate": 4.8334192194193816e-05, "loss": 0.84521484375, "step": 147 }, { "epoch": 1.15625, "grad_norm": 0.12063246965408325, "learning_rate": 4.775940700218742e-05, "loss": 0.875, "step": 148 }, { "epoch": 1.1640625, "grad_norm": 0.12241192907094955, "learning_rate": 4.718583200498814e-05, "loss": 0.8560791015625, "step": 149 }, { "epoch": 1.171875, "grad_norm": 0.11688437312841415, "learning_rate": 4.661356307008681e-05, "loss": 0.8658447265625, "step": 150 }, { "epoch": 1.1796875, "grad_norm": 0.11204364895820618, "learning_rate": 4.604269584667868e-05, "loss": 0.813232421875, "step": 151 }, { "epoch": 1.1875, "grad_norm": 0.12541894614696503, "learning_rate": 4.547332574967653e-05, "loss": 0.93310546875, "step": 152 }, { "epoch": 1.1953125, "grad_norm": 0.13657410442829132, "learning_rate": 4.490554794376297e-05, "loss": 0.8111572265625, "step": 153 }, { "epoch": 1.203125, "grad_norm": 0.11974389106035233, "learning_rate": 4.4339457327484635e-05, "loss": 0.91845703125, "step": 154 }, { "epoch": 1.203125, "eval_loss": 0.89794921875, "eval_runtime": 6.3795, "eval_samples_per_second": 1.097, "eval_steps_per_second": 0.157, "step": 154 }, { "epoch": 1.2109375, "grad_norm": 0.12390559911727905, "learning_rate": 4.377514851739085e-05, "loss": 0.89306640625, "step": 155 }, { "epoch": 1.21875, "grad_norm": 0.12012932449579239, "learning_rate": 4.3212715832219244e-05, "loss": 0.925048828125, "step": 156 }, { "epoch": 1.2265625, "grad_norm": 0.11713862419128418, "learning_rate": 4.2652253277131436e-05, "loss": 0.91064453125, "step": 157 }, { "epoch": 1.234375, "grad_norm": 0.11762246489524841, "learning_rate": 4.209385452800095e-05, "loss": 0.872314453125, "step": 158 }, { "epoch": 1.2421875, "grad_norm": 0.12124547362327576, "learning_rate": 4.153761291575614e-05, "loss": 0.901611328125, "step": 159 }, { "epoch": 1.25, "grad_norm": 0.1197875589132309, "learning_rate": 4.0983621410780895e-05, "loss": 0.85986328125, "step": 160 }, { "epoch": 1.2578125, "grad_norm": 0.12643730640411377, "learning_rate": 4.043197260737556e-05, "loss": 0.94873046875, "step": 161 }, { "epoch": 1.265625, "grad_norm": 0.13024495542049408, "learning_rate": 3.988275870828061e-05, "loss": 0.85400390625, "step": 162 }, { "epoch": 1.2734375, "grad_norm": 0.12089991569519043, "learning_rate": 3.933607150926594e-05, "loss": 0.87841796875, "step": 163 }, { "epoch": 1.28125, "grad_norm": 0.12083294242620468, "learning_rate": 3.879200238378804e-05, "loss": 0.8660888671875, "step": 164 }, { "epoch": 1.2890625, "grad_norm": 0.14186769723892212, "learning_rate": 3.825064226771786e-05, "loss": 0.8818359375, "step": 165 }, { "epoch": 1.296875, "grad_norm": 0.13118009269237518, "learning_rate": 3.7712081644141704e-05, "loss": 0.84375, "step": 166 }, { "epoch": 1.3046875, "grad_norm": 0.11879151314496994, "learning_rate": 3.717641052823795e-05, "loss": 0.77734375, "step": 167 }, { "epoch": 1.3125, "grad_norm": 0.13815367221832275, "learning_rate": 3.664371845223174e-05, "loss": 0.904541015625, "step": 168 }, { "epoch": 1.3203125, "grad_norm": 0.12955917418003082, "learning_rate": 3.611409445043069e-05, "loss": 0.89599609375, "step": 169 }, { "epoch": 1.328125, "grad_norm": 0.12600165605545044, "learning_rate": 3.558762704434361e-05, "loss": 0.841796875, "step": 170 }, { "epoch": 1.3359375, "grad_norm": 0.12873414158821106, "learning_rate": 3.506440422788493e-05, "loss": 0.859375, "step": 171 }, { "epoch": 1.34375, "grad_norm": 0.12860363721847534, "learning_rate": 3.4544513452667475e-05, "loss": 0.861572265625, "step": 172 }, { "epoch": 1.3515625, "grad_norm": 0.1260329931974411, "learning_rate": 3.402804161338577e-05, "loss": 0.810546875, "step": 173 }, { "epoch": 1.359375, "grad_norm": 0.13522958755493164, "learning_rate": 3.3515075033292297e-05, "loss": 0.80517578125, "step": 174 }, { "epoch": 1.3671875, "grad_norm": 0.19915230572223663, "learning_rate": 3.3005699449769615e-05, "loss": 0.84033203125, "step": 175 }, { "epoch": 1.375, "grad_norm": 0.13226912915706635, "learning_rate": 3.250000000000001e-05, "loss": 0.8857421875, "step": 176 }, { "epoch": 1.3828125, "grad_norm": 0.14104294776916504, "learning_rate": 3.1998061206735705e-05, "loss": 0.8740234375, "step": 177 }, { "epoch": 1.390625, "grad_norm": 0.13300438225269318, "learning_rate": 3.1499966964171777e-05, "loss": 0.931640625, "step": 178 }, { "epoch": 1.3984375, "grad_norm": 0.11573480814695358, "learning_rate": 3.100580052392391e-05, "loss": 0.762939453125, "step": 179 }, { "epoch": 1.40625, "grad_norm": 0.14123529195785522, "learning_rate": 3.0515644481113782e-05, "loss": 0.83349609375, "step": 180 }, { "epoch": 1.4140625, "grad_norm": 0.13057246804237366, "learning_rate": 3.0029580760564148e-05, "loss": 0.8267822265625, "step": 181 }, { "epoch": 1.421875, "grad_norm": 0.14644423127174377, "learning_rate": 2.9547690603105772e-05, "loss": 0.89208984375, "step": 182 }, { "epoch": 1.4296875, "grad_norm": 0.12269032001495361, "learning_rate": 2.907005455199889e-05, "loss": 0.884765625, "step": 183 }, { "epoch": 1.4375, "grad_norm": 0.12927685678005219, "learning_rate": 2.85967524394712e-05, "loss": 0.8193359375, "step": 184 }, { "epoch": 1.4453125, "grad_norm": 0.12026294320821762, "learning_rate": 2.8127863373374635e-05, "loss": 0.74896240234375, "step": 185 }, { "epoch": 1.453125, "grad_norm": 0.12809842824935913, "learning_rate": 2.766346572396324e-05, "loss": 0.87890625, "step": 186 }, { "epoch": 1.4609375, "grad_norm": 0.13720197975635529, "learning_rate": 2.720363711079444e-05, "loss": 0.8896484375, "step": 187 }, { "epoch": 1.46875, "grad_norm": 0.15317557752132416, "learning_rate": 2.6748454389755574e-05, "loss": 0.8212890625, "step": 188 }, { "epoch": 1.4765625, "grad_norm": 0.1357753425836563, "learning_rate": 2.6297993640218227e-05, "loss": 0.8916015625, "step": 189 }, { "epoch": 1.484375, "grad_norm": 0.12334258109331131, "learning_rate": 2.585233015232235e-05, "loss": 0.797119140625, "step": 190 }, { "epoch": 1.4921875, "grad_norm": 0.1273258626461029, "learning_rate": 2.5411538414392143e-05, "loss": 0.8525390625, "step": 191 }, { "epoch": 1.5, "grad_norm": 0.12042784690856934, "learning_rate": 2.4975692100486117e-05, "loss": 0.75634765625, "step": 192 }, { "epoch": 1.5078125, "grad_norm": 0.14903995394706726, "learning_rate": 2.4544864058083215e-05, "loss": 0.859375, "step": 193 }, { "epoch": 1.515625, "grad_norm": 0.1403791308403015, "learning_rate": 2.4119126295906998e-05, "loss": 0.8004150390625, "step": 194 }, { "epoch": 1.5234375, "grad_norm": 0.12431909143924713, "learning_rate": 2.369854997189011e-05, "loss": 0.75830078125, "step": 195 }, { "epoch": 1.53125, "grad_norm": 0.1252904087305069, "learning_rate": 2.328320538128098e-05, "loss": 0.807861328125, "step": 196 }, { "epoch": 1.5390625, "grad_norm": 0.13873587548732758, "learning_rate": 2.2873161944894553e-05, "loss": 0.8671875, "step": 197 }, { "epoch": 1.546875, "grad_norm": 0.13714814186096191, "learning_rate": 2.246848819750932e-05, "loss": 0.8271484375, "step": 198 }, { "epoch": 1.5546875, "grad_norm": 0.1349773406982422, "learning_rate": 2.2069251776412458e-05, "loss": 0.91015625, "step": 199 }, { "epoch": 1.5625, "grad_norm": 0.13301518559455872, "learning_rate": 2.16755194100948e-05, "loss": 0.908203125, "step": 200 }, { "epoch": 1.5703125, "grad_norm": 0.13332822918891907, "learning_rate": 2.128735690709788e-05, "loss": 0.8035888671875, "step": 201 }, { "epoch": 1.578125, "grad_norm": 0.13555565476417542, "learning_rate": 2.0904829145014696e-05, "loss": 0.888671875, "step": 202 }, { "epoch": 1.5859375, "grad_norm": 0.12675346434116364, "learning_rate": 2.0528000059645997e-05, "loss": 0.76788330078125, "step": 203 }, { "epoch": 1.59375, "grad_norm": 0.12981340289115906, "learning_rate": 2.015693263431404e-05, "loss": 0.82275390625, "step": 204 }, { "epoch": 1.6015625, "grad_norm": 0.13672125339508057, "learning_rate": 1.9791688889335612e-05, "loss": 0.87353515625, "step": 205 }, { "epoch": 1.6015625, "eval_loss": 0.88916015625, "eval_runtime": 6.3756, "eval_samples_per_second": 1.098, "eval_steps_per_second": 0.157, "step": 205 }, { "epoch": 1.609375, "grad_norm": 0.12884238362312317, "learning_rate": 1.943232987165584e-05, "loss": 0.825927734375, "step": 206 }, { "epoch": 1.6171875, "grad_norm": 0.1343514621257782, "learning_rate": 1.9078915644644818e-05, "loss": 0.826904296875, "step": 207 }, { "epoch": 1.625, "grad_norm": 0.1251915991306305, "learning_rate": 1.873150527805866e-05, "loss": 0.748779296875, "step": 208 }, { "epoch": 1.6328125, "grad_norm": 0.1351170539855957, "learning_rate": 1.8390156838166466e-05, "loss": 0.8525390625, "step": 209 }, { "epoch": 1.640625, "grad_norm": 0.13529124855995178, "learning_rate": 1.8054927378045173e-05, "loss": 0.8681640625, "step": 210 }, { "epoch": 1.6484375, "grad_norm": 0.24143168330192566, "learning_rate": 1.7725872928043662e-05, "loss": 0.8837890625, "step": 211 }, { "epoch": 1.65625, "grad_norm": 0.14436808228492737, "learning_rate": 1.740304848641787e-05, "loss": 0.8671875, "step": 212 }, { "epoch": 1.6640625, "grad_norm": 0.1449054628610611, "learning_rate": 1.708650801013827e-05, "loss": 0.8544921875, "step": 213 }, { "epoch": 1.671875, "grad_norm": 0.13676013052463531, "learning_rate": 1.6776304405871624e-05, "loss": 0.83984375, "step": 214 }, { "epoch": 1.6796875, "grad_norm": 0.14598451554775238, "learning_rate": 1.6472489521138015e-05, "loss": 0.89306640625, "step": 215 }, { "epoch": 1.6875, "grad_norm": 0.13086682558059692, "learning_rate": 1.6175114135645122e-05, "loss": 0.81982421875, "step": 216 }, { "epoch": 1.6953125, "grad_norm": 0.13416112959384918, "learning_rate": 1.588422795280085e-05, "loss": 0.935546875, "step": 217 }, { "epoch": 1.703125, "grad_norm": 0.13844376802444458, "learning_rate": 1.5599879591405917e-05, "loss": 0.869140625, "step": 218 }, { "epoch": 1.7109375, "grad_norm": 0.14437532424926758, "learning_rate": 1.532211657752764e-05, "loss": 0.89453125, "step": 219 }, { "epoch": 1.71875, "grad_norm": 0.14027994871139526, "learning_rate": 1.505098533655649e-05, "loss": 0.845703125, "step": 220 }, { "epoch": 1.7265625, "grad_norm": 0.18803958594799042, "learning_rate": 1.4786531185446454e-05, "loss": 0.758544921875, "step": 221 }, { "epoch": 1.734375, "grad_norm": 0.11587260663509369, "learning_rate": 1.4528798325140819e-05, "loss": 0.723388671875, "step": 222 }, { "epoch": 1.7421875, "grad_norm": 0.14269521832466125, "learning_rate": 1.4277829833184362e-05, "loss": 0.844482421875, "step": 223 }, { "epoch": 1.75, "grad_norm": 0.1624603122472763, "learning_rate": 1.4033667656523405e-05, "loss": 0.72503662109375, "step": 224 }, { "epoch": 1.7578125, "grad_norm": 0.14480014145374298, "learning_rate": 1.3796352604494737e-05, "loss": 0.87646484375, "step": 225 }, { "epoch": 1.765625, "grad_norm": 0.1253139227628708, "learning_rate": 1.3565924342004776e-05, "loss": 0.74560546875, "step": 226 }, { "epoch": 1.7734375, "grad_norm": 0.23191969096660614, "learning_rate": 1.3342421382899936e-05, "loss": 0.7784423828125, "step": 227 }, { "epoch": 1.78125, "grad_norm": 0.14313557744026184, "learning_rate": 1.3125881083529421e-05, "loss": 0.9173583984375, "step": 228 }, { "epoch": 1.7890625, "grad_norm": 0.14738067984580994, "learning_rate": 1.2916339636501467e-05, "loss": 0.8369140625, "step": 229 }, { "epoch": 1.796875, "grad_norm": 0.13663701713085175, "learning_rate": 1.2713832064634126e-05, "loss": 0.7978515625, "step": 230 }, { "epoch": 1.8046875, "grad_norm": 0.13957999646663666, "learning_rate": 1.2518392215101501e-05, "loss": 0.86669921875, "step": 231 }, { "epoch": 1.8125, "grad_norm": 0.14884498715400696, "learning_rate": 1.2330052753776559e-05, "loss": 0.8046875, "step": 232 }, { "epoch": 1.8203125, "grad_norm": 0.14636348187923431, "learning_rate": 1.2148845159771311e-05, "loss": 0.86181640625, "step": 233 }, { "epoch": 1.828125, "grad_norm": 0.14254586398601532, "learning_rate": 1.197479972017542e-05, "loss": 0.87353515625, "step": 234 }, { "epoch": 1.8359375, "grad_norm": 0.14920088648796082, "learning_rate": 1.1807945524993964e-05, "loss": 0.80810546875, "step": 235 }, { "epoch": 1.84375, "grad_norm": 0.14492006599903107, "learning_rate": 1.1648310462285386e-05, "loss": 0.84619140625, "step": 236 }, { "epoch": 1.8515625, "grad_norm": 0.1472831517457962, "learning_rate": 1.1495921213500211e-05, "loss": 0.857421875, "step": 237 }, { "epoch": 1.859375, "grad_norm": 0.1383552849292755, "learning_rate": 1.1350803249021543e-05, "loss": 0.8466796875, "step": 238 }, { "epoch": 1.8671875, "grad_norm": 0.1946849375963211, "learning_rate": 1.1212980823907931e-05, "loss": 0.833984375, "step": 239 }, { "epoch": 1.875, "grad_norm": 0.13776731491088867, "learning_rate": 1.108247697383934e-05, "loss": 0.769775390625, "step": 240 }, { "epoch": 1.8828125, "grad_norm": 0.14295612275600433, "learning_rate": 1.0959313511267016e-05, "loss": 0.8310546875, "step": 241 }, { "epoch": 1.890625, "grad_norm": 0.13705675303936005, "learning_rate": 1.084351102176769e-05, "loss": 0.7623291015625, "step": 242 }, { "epoch": 1.8984375, "grad_norm": 0.13686659932136536, "learning_rate": 1.073508886060295e-05, "loss": 0.89013671875, "step": 243 }, { "epoch": 1.90625, "grad_norm": 0.1406104564666748, "learning_rate": 1.0634065149484159e-05, "loss": 0.8671875, "step": 244 }, { "epoch": 1.9140625, "grad_norm": 0.14705617725849152, "learning_rate": 1.0540456773543596e-05, "loss": 0.829833984375, "step": 245 }, { "epoch": 1.921875, "grad_norm": 0.12452160567045212, "learning_rate": 1.0454279378512287e-05, "loss": 0.7509765625, "step": 246 }, { "epoch": 1.9296875, "grad_norm": 0.1495411992073059, "learning_rate": 1.0375547368104952e-05, "loss": 0.912109375, "step": 247 }, { "epoch": 1.9375, "grad_norm": 0.14412689208984375, "learning_rate": 1.0304273901612566e-05, "loss": 0.765380859375, "step": 248 }, { "epoch": 1.9453125, "grad_norm": 0.14419622719287872, "learning_rate": 1.0240470891702937e-05, "loss": 0.87548828125, "step": 249 }, { "epoch": 1.953125, "grad_norm": 0.1380612850189209, "learning_rate": 1.0184149002429582e-05, "loss": 0.78759765625, "step": 250 }, { "epoch": 1.9609375, "grad_norm": 0.13859306275844574, "learning_rate": 1.013531764744936e-05, "loss": 0.8388671875, "step": 251 }, { "epoch": 1.96875, "grad_norm": 0.15172813832759857, "learning_rate": 1.009398498844906e-05, "loss": 0.88818359375, "step": 252 }, { "epoch": 1.9765625, "grad_norm": 0.1881428360939026, "learning_rate": 1.0060157933781257e-05, "loss": 0.7987060546875, "step": 253 }, { "epoch": 1.984375, "grad_norm": 0.1493026316165924, "learning_rate": 1.0033842137309648e-05, "loss": 0.8685302734375, "step": 254 }, { "epoch": 1.9921875, "grad_norm": 0.14847420156002045, "learning_rate": 1.0015041997464066e-05, "loss": 0.8798828125, "step": 255 }, { "epoch": 2.0, "grad_norm": 0.1424848586320877, "learning_rate": 1.0003760656505323e-05, "loss": 0.83251953125, "step": 256 }, { "epoch": 2.0, "eval_loss": 0.88525390625, "eval_runtime": 6.3661, "eval_samples_per_second": 1.1, "eval_steps_per_second": 0.157, "step": 256 } ], "logging_steps": 1.0, "max_steps": 256, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.103933224220413e+19, "train_batch_size": 1, "trial_name": null, "trial_params": null }