Gro97's picture
Upload clinical_trial_power_analysis LoRA adapter weights
26b3c4c verified
Raw
History Blame Contribute Delete
45.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 51,
"global_step": 256,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0078125,
"grad_norm": 0.28995832800865173,
"learning_rate": 0.0,
"loss": 1.423828125,
"step": 1
},
{
"epoch": 0.015625,
"grad_norm": 0.28130924701690674,
"learning_rate": 7.692307692307694e-06,
"loss": 1.38134765625,
"step": 2
},
{
"epoch": 0.0234375,
"grad_norm": 0.25881335139274597,
"learning_rate": 1.5384615384615387e-05,
"loss": 1.3720703125,
"step": 3
},
{
"epoch": 0.03125,
"grad_norm": 0.2908932864665985,
"learning_rate": 2.307692307692308e-05,
"loss": 1.27587890625,
"step": 4
},
{
"epoch": 0.0390625,
"grad_norm": 0.3206496834754944,
"learning_rate": 3.0769230769230774e-05,
"loss": 1.37109375,
"step": 5
},
{
"epoch": 0.046875,
"grad_norm": 0.25504836440086365,
"learning_rate": 3.846153846153846e-05,
"loss": 1.2137451171875,
"step": 6
},
{
"epoch": 0.0546875,
"grad_norm": 0.28696101903915405,
"learning_rate": 4.615384615384616e-05,
"loss": 1.3525390625,
"step": 7
},
{
"epoch": 0.0625,
"grad_norm": 0.2355114072561264,
"learning_rate": 5.384615384615385e-05,
"loss": 1.0560302734375,
"step": 8
},
{
"epoch": 0.0703125,
"grad_norm": 0.25246548652648926,
"learning_rate": 6.153846153846155e-05,
"loss": 1.27490234375,
"step": 9
},
{
"epoch": 0.078125,
"grad_norm": 0.19615069031715393,
"learning_rate": 6.923076923076924e-05,
"loss": 1.244140625,
"step": 10
},
{
"epoch": 0.0859375,
"grad_norm": 0.17060348391532898,
"learning_rate": 7.692307692307693e-05,
"loss": 1.2353515625,
"step": 11
},
{
"epoch": 0.09375,
"grad_norm": 0.15811215341091156,
"learning_rate": 8.461538461538461e-05,
"loss": 1.125,
"step": 12
},
{
"epoch": 0.1015625,
"grad_norm": 0.23893103003501892,
"learning_rate": 9.230769230769232e-05,
"loss": 1.18359375,
"step": 13
},
{
"epoch": 0.109375,
"grad_norm": 0.29393115639686584,
"learning_rate": 0.0001,
"loss": 1.2109375,
"step": 14
},
{
"epoch": 0.1171875,
"grad_norm": 0.2848770022392273,
"learning_rate": 9.999623934349469e-05,
"loss": 1.17529296875,
"step": 15
},
{
"epoch": 0.125,
"grad_norm": 0.23788601160049438,
"learning_rate": 9.998495800253594e-05,
"loss": 1.14501953125,
"step": 16
},
{
"epoch": 0.1328125,
"grad_norm": 0.19343820214271545,
"learning_rate": 9.996615786269035e-05,
"loss": 1.2119140625,
"step": 17
},
{
"epoch": 0.140625,
"grad_norm": 0.11705930531024933,
"learning_rate": 9.993984206621875e-05,
"loss": 1.138671875,
"step": 18
},
{
"epoch": 0.1484375,
"grad_norm": 0.0940169170498848,
"learning_rate": 9.990601501155095e-05,
"loss": 1.047607421875,
"step": 19
},
{
"epoch": 0.15625,
"grad_norm": 0.09164854884147644,
"learning_rate": 9.986468235255065e-05,
"loss": 1.07763671875,
"step": 20
},
{
"epoch": 0.1640625,
"grad_norm": 0.11077525466680527,
"learning_rate": 9.981585099757043e-05,
"loss": 1.057861328125,
"step": 21
},
{
"epoch": 0.171875,
"grad_norm": 0.11556923389434814,
"learning_rate": 9.975952910829707e-05,
"loss": 1.064453125,
"step": 22
},
{
"epoch": 0.1796875,
"grad_norm": 0.10512404888868332,
"learning_rate": 9.969572609838744e-05,
"loss": 0.993896484375,
"step": 23
},
{
"epoch": 0.1875,
"grad_norm": 0.10946336388587952,
"learning_rate": 9.962445263189505e-05,
"loss": 1.1328125,
"step": 24
},
{
"epoch": 0.1953125,
"grad_norm": 0.10185452550649643,
"learning_rate": 9.954572062148773e-05,
"loss": 0.987548828125,
"step": 25
},
{
"epoch": 0.203125,
"grad_norm": 0.10250338912010193,
"learning_rate": 9.945954322645642e-05,
"loss": 1.09912109375,
"step": 26
},
{
"epoch": 0.2109375,
"grad_norm": 0.10008298605680466,
"learning_rate": 9.936593485051584e-05,
"loss": 1.071044921875,
"step": 27
},
{
"epoch": 0.21875,
"grad_norm": 0.10557658970355988,
"learning_rate": 9.926491113939705e-05,
"loss": 1.100830078125,
"step": 28
},
{
"epoch": 0.2265625,
"grad_norm": 0.08323658257722855,
"learning_rate": 9.915648897823232e-05,
"loss": 1.086669921875,
"step": 29
},
{
"epoch": 0.234375,
"grad_norm": 0.08515891432762146,
"learning_rate": 9.904068648873299e-05,
"loss": 1.02685546875,
"step": 30
},
{
"epoch": 0.2421875,
"grad_norm": 0.08433088660240173,
"learning_rate": 9.891752302616066e-05,
"loss": 1.05615234375,
"step": 31
},
{
"epoch": 0.25,
"grad_norm": 0.1458551585674286,
"learning_rate": 9.878701917609207e-05,
"loss": 1.024658203125,
"step": 32
},
{
"epoch": 0.2578125,
"grad_norm": 0.0871451199054718,
"learning_rate": 9.864919675097846e-05,
"loss": 1.11865234375,
"step": 33
},
{
"epoch": 0.265625,
"grad_norm": 0.08478949218988419,
"learning_rate": 9.85040787864998e-05,
"loss": 1.01025390625,
"step": 34
},
{
"epoch": 0.2734375,
"grad_norm": 0.07362563908100128,
"learning_rate": 9.835168953771461e-05,
"loss": 1.033203125,
"step": 35
},
{
"epoch": 0.28125,
"grad_norm": 0.07105343043804169,
"learning_rate": 9.819205447500603e-05,
"loss": 1.02001953125,
"step": 36
},
{
"epoch": 0.2890625,
"grad_norm": 0.08549123257398605,
"learning_rate": 9.80252002798246e-05,
"loss": 1.03857421875,
"step": 37
},
{
"epoch": 0.296875,
"grad_norm": 0.09394215047359467,
"learning_rate": 9.78511548402287e-05,
"loss": 0.987548828125,
"step": 38
},
{
"epoch": 0.3046875,
"grad_norm": 0.07717522233724594,
"learning_rate": 9.766994724622344e-05,
"loss": 0.911376953125,
"step": 39
},
{
"epoch": 0.3125,
"grad_norm": 0.07993735373020172,
"learning_rate": 9.74816077848985e-05,
"loss": 1.052734375,
"step": 40
},
{
"epoch": 0.3203125,
"grad_norm": 0.07395265251398087,
"learning_rate": 9.728616793536588e-05,
"loss": 1.03466796875,
"step": 41
},
{
"epoch": 0.328125,
"grad_norm": 0.07913617789745331,
"learning_rate": 9.708366036349854e-05,
"loss": 0.97802734375,
"step": 42
},
{
"epoch": 0.3359375,
"grad_norm": 0.08407563716173172,
"learning_rate": 9.687411891647059e-05,
"loss": 1.004638671875,
"step": 43
},
{
"epoch": 0.34375,
"grad_norm": 0.07545147836208344,
"learning_rate": 9.665757861710008e-05,
"loss": 0.994140625,
"step": 44
},
{
"epoch": 0.3515625,
"grad_norm": 0.07266917824745178,
"learning_rate": 9.643407565799524e-05,
"loss": 0.935302734375,
"step": 45
},
{
"epoch": 0.359375,
"grad_norm": 0.08004212379455566,
"learning_rate": 9.620364739550527e-05,
"loss": 0.927978515625,
"step": 46
},
{
"epoch": 0.3671875,
"grad_norm": 0.16914942860603333,
"learning_rate": 9.59663323434766e-05,
"loss": 0.969970703125,
"step": 47
},
{
"epoch": 0.375,
"grad_norm": 0.07862447947263718,
"learning_rate": 9.572217016681565e-05,
"loss": 1.0166015625,
"step": 48
},
{
"epoch": 0.3828125,
"grad_norm": 0.08359777182340622,
"learning_rate": 9.54712016748592e-05,
"loss": 1.01171875,
"step": 49
},
{
"epoch": 0.390625,
"grad_norm": 0.0827992707490921,
"learning_rate": 9.521346881455356e-05,
"loss": 1.06103515625,
"step": 50
},
{
"epoch": 0.3984375,
"grad_norm": 0.07072290778160095,
"learning_rate": 9.494901466344353e-05,
"loss": 0.874755859375,
"step": 51
},
{
"epoch": 0.40625,
"grad_norm": 0.08112584054470062,
"learning_rate": 9.467788342247236e-05,
"loss": 0.9560546875,
"step": 52
},
{
"epoch": 0.40625,
"eval_loss": 0.982421875,
"eval_runtime": 6.3901,
"eval_samples_per_second": 1.095,
"eval_steps_per_second": 0.156,
"step": 52
},
{
"epoch": 0.4140625,
"grad_norm": 0.08152227103710175,
"learning_rate": 9.44001204085941e-05,
"loss": 0.937744140625,
"step": 53
},
{
"epoch": 0.421875,
"grad_norm": 0.07884660363197327,
"learning_rate": 9.411577204719915e-05,
"loss": 1.01171875,
"step": 54
},
{
"epoch": 0.4296875,
"grad_norm": 0.08499646186828613,
"learning_rate": 9.382488586435488e-05,
"loss": 1.0107421875,
"step": 55
},
{
"epoch": 0.4375,
"grad_norm": 0.08610514551401138,
"learning_rate": 9.3527510478862e-05,
"loss": 0.9307861328125,
"step": 56
},
{
"epoch": 0.4453125,
"grad_norm": 0.07941639423370361,
"learning_rate": 9.32236955941284e-05,
"loss": 0.8533935546875,
"step": 57
},
{
"epoch": 0.453125,
"grad_norm": 0.0884481891989708,
"learning_rate": 9.291349198986173e-05,
"loss": 0.9912109375,
"step": 58
},
{
"epoch": 0.4609375,
"grad_norm": 0.08216440677642822,
"learning_rate": 9.259695151358214e-05,
"loss": 1.009765625,
"step": 59
},
{
"epoch": 0.46875,
"grad_norm": 0.09028297662734985,
"learning_rate": 9.227412707195636e-05,
"loss": 0.931640625,
"step": 60
},
{
"epoch": 0.4765625,
"grad_norm": 0.08735080063343048,
"learning_rate": 9.194507262195484e-05,
"loss": 1.001953125,
"step": 61
},
{
"epoch": 0.484375,
"grad_norm": 0.08551003783941269,
"learning_rate": 9.160984316183355e-05,
"loss": 0.9010009765625,
"step": 62
},
{
"epoch": 0.4921875,
"grad_norm": 0.08458489179611206,
"learning_rate": 9.126849472194135e-05,
"loss": 0.9619140625,
"step": 63
},
{
"epoch": 0.5,
"grad_norm": 0.09197501093149185,
"learning_rate": 9.092108435535519e-05,
"loss": 0.860595703125,
"step": 64
},
{
"epoch": 0.5078125,
"grad_norm": 0.0835501030087471,
"learning_rate": 9.056767012834418e-05,
"loss": 0.96728515625,
"step": 65
},
{
"epoch": 0.515625,
"grad_norm": 0.0892043188214302,
"learning_rate": 9.020831111066439e-05,
"loss": 0.9072265625,
"step": 66
},
{
"epoch": 0.5234375,
"grad_norm": 0.10175707936286926,
"learning_rate": 8.984306736568596e-05,
"loss": 0.8592529296875,
"step": 67
},
{
"epoch": 0.53125,
"grad_norm": 0.1044527143239975,
"learning_rate": 8.947199994035401e-05,
"loss": 0.9072265625,
"step": 68
},
{
"epoch": 0.5390625,
"grad_norm": 0.09157323092222214,
"learning_rate": 8.909517085498531e-05,
"loss": 0.97021484375,
"step": 69
},
{
"epoch": 0.546875,
"grad_norm": 0.08929987996816635,
"learning_rate": 8.871264309290213e-05,
"loss": 0.927490234375,
"step": 70
},
{
"epoch": 0.5546875,
"grad_norm": 0.09748449921607971,
"learning_rate": 8.832448058990521e-05,
"loss": 1.0166015625,
"step": 71
},
{
"epoch": 0.5625,
"grad_norm": 0.09099110215902328,
"learning_rate": 8.793074822358756e-05,
"loss": 1.0107421875,
"step": 72
},
{
"epoch": 0.5703125,
"grad_norm": 0.09120053797960281,
"learning_rate": 8.753151180249069e-05,
"loss": 0.89990234375,
"step": 73
},
{
"epoch": 0.578125,
"grad_norm": 0.09496539831161499,
"learning_rate": 8.712683805510546e-05,
"loss": 0.99169921875,
"step": 74
},
{
"epoch": 0.5859375,
"grad_norm": 0.08639498800039291,
"learning_rate": 8.671679461871904e-05,
"loss": 0.85504150390625,
"step": 75
},
{
"epoch": 0.59375,
"grad_norm": 0.09459307044744492,
"learning_rate": 8.630145002810988e-05,
"loss": 0.9169921875,
"step": 76
},
{
"epoch": 0.6015625,
"grad_norm": 0.09741773456335068,
"learning_rate": 8.588087370409303e-05,
"loss": 0.97607421875,
"step": 77
},
{
"epoch": 0.609375,
"grad_norm": 0.09259133785963058,
"learning_rate": 8.54551359419168e-05,
"loss": 0.921142578125,
"step": 78
},
{
"epoch": 0.6171875,
"grad_norm": 0.102195143699646,
"learning_rate": 8.502430789951387e-05,
"loss": 0.91845703125,
"step": 79
},
{
"epoch": 0.625,
"grad_norm": 0.09723465144634247,
"learning_rate": 8.458846158560787e-05,
"loss": 0.83203125,
"step": 80
},
{
"epoch": 0.6328125,
"grad_norm": 0.09734958410263062,
"learning_rate": 8.414766984767764e-05,
"loss": 0.943115234375,
"step": 81
},
{
"epoch": 0.640625,
"grad_norm": 0.09370985627174377,
"learning_rate": 8.370200635978177e-05,
"loss": 0.96044921875,
"step": 82
},
{
"epoch": 0.6484375,
"grad_norm": 0.10649316757917404,
"learning_rate": 8.325154561024444e-05,
"loss": 0.978515625,
"step": 83
},
{
"epoch": 0.65625,
"grad_norm": 0.10507673770189285,
"learning_rate": 8.279636288920557e-05,
"loss": 0.9619140625,
"step": 84
},
{
"epoch": 0.6640625,
"grad_norm": 0.0925222709774971,
"learning_rate": 8.233653427603676e-05,
"loss": 0.94677734375,
"step": 85
},
{
"epoch": 0.671875,
"grad_norm": 0.09863923490047455,
"learning_rate": 8.187213662662538e-05,
"loss": 0.9267578125,
"step": 86
},
{
"epoch": 0.6796875,
"grad_norm": 0.10442425310611725,
"learning_rate": 8.14032475605288e-05,
"loss": 0.98486328125,
"step": 87
},
{
"epoch": 0.6875,
"grad_norm": 0.09902859479188919,
"learning_rate": 8.092994544800111e-05,
"loss": 0.904052734375,
"step": 88
},
{
"epoch": 0.6953125,
"grad_norm": 0.1050918698310852,
"learning_rate": 8.045230939689425e-05,
"loss": 1.0224609375,
"step": 89
},
{
"epoch": 0.703125,
"grad_norm": 0.10043203085660934,
"learning_rate": 7.997041923943587e-05,
"loss": 0.95703125,
"step": 90
},
{
"epoch": 0.7109375,
"grad_norm": 0.09804964810609818,
"learning_rate": 7.948435551888622e-05,
"loss": 0.97998046875,
"step": 91
},
{
"epoch": 0.71875,
"grad_norm": 0.1037558987736702,
"learning_rate": 7.899419947607612e-05,
"loss": 0.92626953125,
"step": 92
},
{
"epoch": 0.7265625,
"grad_norm": 0.10760906338691711,
"learning_rate": 7.850003303582823e-05,
"loss": 0.836669921875,
"step": 93
},
{
"epoch": 0.734375,
"grad_norm": 0.10727047175168991,
"learning_rate": 7.800193879326429e-05,
"loss": 0.785400390625,
"step": 94
},
{
"epoch": 0.7421875,
"grad_norm": 0.11248599737882614,
"learning_rate": 7.75e-05,
"loss": 0.92919921875,
"step": 95
},
{
"epoch": 0.75,
"grad_norm": 0.09993602335453033,
"learning_rate": 7.699430055023039e-05,
"loss": 0.797607421875,
"step": 96
},
{
"epoch": 0.7578125,
"grad_norm": 0.10109154880046844,
"learning_rate": 7.64849249667077e-05,
"loss": 0.957275390625,
"step": 97
},
{
"epoch": 0.765625,
"grad_norm": 0.09973707050085068,
"learning_rate": 7.597195838661426e-05,
"loss": 0.811279296875,
"step": 98
},
{
"epoch": 0.7734375,
"grad_norm": 0.11369027942419052,
"learning_rate": 7.545548654733254e-05,
"loss": 0.859130859375,
"step": 99
},
{
"epoch": 0.78125,
"grad_norm": 0.1155623346567154,
"learning_rate": 7.493559577211509e-05,
"loss": 0.99365234375,
"step": 100
},
{
"epoch": 0.7890625,
"grad_norm": 0.10785958170890808,
"learning_rate": 7.441237295565642e-05,
"loss": 0.91455078125,
"step": 101
},
{
"epoch": 0.796875,
"grad_norm": 0.10221569985151291,
"learning_rate": 7.388590554956932e-05,
"loss": 0.8681640625,
"step": 102
},
{
"epoch": 0.8046875,
"grad_norm": 0.10055916756391525,
"learning_rate": 7.335628154776826e-05,
"loss": 0.93603515625,
"step": 103
},
{
"epoch": 0.8046875,
"eval_loss": 0.9228515625,
"eval_runtime": 6.3845,
"eval_samples_per_second": 1.096,
"eval_steps_per_second": 0.157,
"step": 103
},
{
"epoch": 0.8125,
"grad_norm": 0.11852730065584183,
"learning_rate": 7.282358947176207e-05,
"loss": 0.88720703125,
"step": 104
},
{
"epoch": 0.8203125,
"grad_norm": 0.10984767973423004,
"learning_rate": 7.22879183558583e-05,
"loss": 0.93994140625,
"step": 105
},
{
"epoch": 0.828125,
"grad_norm": 0.10858634114265442,
"learning_rate": 7.174935773228216e-05,
"loss": 0.94921875,
"step": 106
},
{
"epoch": 0.8359375,
"grad_norm": 0.10062723606824875,
"learning_rate": 7.120799761621197e-05,
"loss": 0.875,
"step": 107
},
{
"epoch": 0.84375,
"grad_norm": 0.11308089643716812,
"learning_rate": 7.066392849073408e-05,
"loss": 0.92041015625,
"step": 108
},
{
"epoch": 0.8515625,
"grad_norm": 0.11309632658958435,
"learning_rate": 7.01172412917194e-05,
"loss": 0.9326171875,
"step": 109
},
{
"epoch": 0.859375,
"grad_norm": 0.10986102372407913,
"learning_rate": 6.956802739262446e-05,
"loss": 0.91357421875,
"step": 110
},
{
"epoch": 0.8671875,
"grad_norm": 0.11195129156112671,
"learning_rate": 6.901637858921912e-05,
"loss": 0.904052734375,
"step": 111
},
{
"epoch": 0.875,
"grad_norm": 0.09884140640497208,
"learning_rate": 6.846238708424389e-05,
"loss": 0.8277587890625,
"step": 112
},
{
"epoch": 0.8828125,
"grad_norm": 0.12617164850234985,
"learning_rate": 6.790614547199907e-05,
"loss": 0.900634765625,
"step": 113
},
{
"epoch": 0.890625,
"grad_norm": 0.09912654012441635,
"learning_rate": 6.734774672286857e-05,
"loss": 0.82177734375,
"step": 114
},
{
"epoch": 0.8984375,
"grad_norm": 0.10471156239509583,
"learning_rate": 6.678728416778077e-05,
"loss": 0.95263671875,
"step": 115
},
{
"epoch": 0.90625,
"grad_norm": 0.10680253058671951,
"learning_rate": 6.622485148260916e-05,
"loss": 0.93408203125,
"step": 116
},
{
"epoch": 0.9140625,
"grad_norm": 0.12247629463672638,
"learning_rate": 6.566054267251536e-05,
"loss": 0.89697265625,
"step": 117
},
{
"epoch": 0.921875,
"grad_norm": 0.09736290574073792,
"learning_rate": 6.509445205623705e-05,
"loss": 0.7998046875,
"step": 118
},
{
"epoch": 0.9296875,
"grad_norm": 0.12649808824062347,
"learning_rate": 6.45266742503235e-05,
"loss": 0.984375,
"step": 119
},
{
"epoch": 0.9375,
"grad_norm": 0.25388485193252563,
"learning_rate": 6.395730415332133e-05,
"loss": 0.822509765625,
"step": 120
},
{
"epoch": 0.9453125,
"grad_norm": 0.11831840872764587,
"learning_rate": 6.338643692991321e-05,
"loss": 0.9404296875,
"step": 121
},
{
"epoch": 0.953125,
"grad_norm": 0.11065713316202164,
"learning_rate": 6.281416799501188e-05,
"loss": 0.8447265625,
"step": 122
},
{
"epoch": 0.9609375,
"grad_norm": 0.11394454538822174,
"learning_rate": 6.224059299781258e-05,
"loss": 0.9013671875,
"step": 123
},
{
"epoch": 0.96875,
"grad_norm": 0.11419283598661423,
"learning_rate": 6.166580780580621e-05,
"loss": 0.95556640625,
"step": 124
},
{
"epoch": 0.9765625,
"grad_norm": 0.11355093866586685,
"learning_rate": 6.108990848875591e-05,
"loss": 0.86279296875,
"step": 125
},
{
"epoch": 0.984375,
"grad_norm": 0.13026076555252075,
"learning_rate": 6.0512991302640044e-05,
"loss": 0.9334716796875,
"step": 126
},
{
"epoch": 0.9921875,
"grad_norm": 0.1125655397772789,
"learning_rate": 5.993515267356393e-05,
"loss": 0.94091796875,
"step": 127
},
{
"epoch": 1.0,
"grad_norm": 0.11880125105381012,
"learning_rate": 5.9356489181643075e-05,
"loss": 0.8994140625,
"step": 128
},
{
"epoch": 1.0078125,
"grad_norm": 0.12246272712945938,
"learning_rate": 5.87770975448608e-05,
"loss": 0.93115234375,
"step": 129
},
{
"epoch": 1.015625,
"grad_norm": 0.11285988241434097,
"learning_rate": 5.8197074602902854e-05,
"loss": 0.9072265625,
"step": 130
},
{
"epoch": 1.0234375,
"grad_norm": 0.11374016851186752,
"learning_rate": 5.761651730097142e-05,
"loss": 0.91748046875,
"step": 131
},
{
"epoch": 1.03125,
"grad_norm": 0.11859993636608124,
"learning_rate": 5.703552267358179e-05,
"loss": 0.81982421875,
"step": 132
},
{
"epoch": 1.0390625,
"grad_norm": 0.11889226734638214,
"learning_rate": 5.645418782834398e-05,
"loss": 0.904296875,
"step": 133
},
{
"epoch": 1.046875,
"grad_norm": 0.11037025600671768,
"learning_rate": 5.58726099297321e-05,
"loss": 0.82666015625,
"step": 134
},
{
"epoch": 1.0546875,
"grad_norm": 0.6102147102355957,
"learning_rate": 5.529088618284427e-05,
"loss": 0.91015625,
"step": 135
},
{
"epoch": 1.0625,
"grad_norm": 0.10855386406183243,
"learning_rate": 5.4709113817155734e-05,
"loss": 0.716796875,
"step": 136
},
{
"epoch": 1.0703125,
"grad_norm": 0.11782663315534592,
"learning_rate": 5.4127390070267914e-05,
"loss": 0.9013671875,
"step": 137
},
{
"epoch": 1.078125,
"grad_norm": 0.11211375147104263,
"learning_rate": 5.354581217165603e-05,
"loss": 0.93701171875,
"step": 138
},
{
"epoch": 1.0859375,
"grad_norm": 0.11000826954841614,
"learning_rate": 5.2964477326418215e-05,
"loss": 0.92138671875,
"step": 139
},
{
"epoch": 1.09375,
"grad_norm": 0.11115771532058716,
"learning_rate": 5.23834826990286e-05,
"loss": 0.85693359375,
"step": 140
},
{
"epoch": 1.1015625,
"grad_norm": 0.11890073120594025,
"learning_rate": 5.180292539709716e-05,
"loss": 0.89599609375,
"step": 141
},
{
"epoch": 1.109375,
"grad_norm": 0.11530875414609909,
"learning_rate": 5.122290245513919e-05,
"loss": 0.908203125,
"step": 142
},
{
"epoch": 1.1171875,
"grad_norm": 0.12277217209339142,
"learning_rate": 5.064351081835694e-05,
"loss": 0.889404296875,
"step": 143
},
{
"epoch": 1.125,
"grad_norm": 0.1321323662996292,
"learning_rate": 5.006484732643608e-05,
"loss": 0.90283203125,
"step": 144
},
{
"epoch": 1.1328125,
"grad_norm": 0.1247463971376419,
"learning_rate": 4.948700869735996e-05,
"loss": 0.96435546875,
"step": 145
},
{
"epoch": 1.140625,
"grad_norm": 0.11841624230146408,
"learning_rate": 4.8910091511244116e-05,
"loss": 0.916015625,
"step": 146
},
{
"epoch": 1.1484375,
"grad_norm": 0.1290961056947708,
"learning_rate": 4.8334192194193816e-05,
"loss": 0.84521484375,
"step": 147
},
{
"epoch": 1.15625,
"grad_norm": 0.12063246965408325,
"learning_rate": 4.775940700218742e-05,
"loss": 0.875,
"step": 148
},
{
"epoch": 1.1640625,
"grad_norm": 0.12241192907094955,
"learning_rate": 4.718583200498814e-05,
"loss": 0.8560791015625,
"step": 149
},
{
"epoch": 1.171875,
"grad_norm": 0.11688437312841415,
"learning_rate": 4.661356307008681e-05,
"loss": 0.8658447265625,
"step": 150
},
{
"epoch": 1.1796875,
"grad_norm": 0.11204364895820618,
"learning_rate": 4.604269584667868e-05,
"loss": 0.813232421875,
"step": 151
},
{
"epoch": 1.1875,
"grad_norm": 0.12541894614696503,
"learning_rate": 4.547332574967653e-05,
"loss": 0.93310546875,
"step": 152
},
{
"epoch": 1.1953125,
"grad_norm": 0.13657410442829132,
"learning_rate": 4.490554794376297e-05,
"loss": 0.8111572265625,
"step": 153
},
{
"epoch": 1.203125,
"grad_norm": 0.11974389106035233,
"learning_rate": 4.4339457327484635e-05,
"loss": 0.91845703125,
"step": 154
},
{
"epoch": 1.203125,
"eval_loss": 0.89794921875,
"eval_runtime": 6.3795,
"eval_samples_per_second": 1.097,
"eval_steps_per_second": 0.157,
"step": 154
},
{
"epoch": 1.2109375,
"grad_norm": 0.12390559911727905,
"learning_rate": 4.377514851739085e-05,
"loss": 0.89306640625,
"step": 155
},
{
"epoch": 1.21875,
"grad_norm": 0.12012932449579239,
"learning_rate": 4.3212715832219244e-05,
"loss": 0.925048828125,
"step": 156
},
{
"epoch": 1.2265625,
"grad_norm": 0.11713862419128418,
"learning_rate": 4.2652253277131436e-05,
"loss": 0.91064453125,
"step": 157
},
{
"epoch": 1.234375,
"grad_norm": 0.11762246489524841,
"learning_rate": 4.209385452800095e-05,
"loss": 0.872314453125,
"step": 158
},
{
"epoch": 1.2421875,
"grad_norm": 0.12124547362327576,
"learning_rate": 4.153761291575614e-05,
"loss": 0.901611328125,
"step": 159
},
{
"epoch": 1.25,
"grad_norm": 0.1197875589132309,
"learning_rate": 4.0983621410780895e-05,
"loss": 0.85986328125,
"step": 160
},
{
"epoch": 1.2578125,
"grad_norm": 0.12643730640411377,
"learning_rate": 4.043197260737556e-05,
"loss": 0.94873046875,
"step": 161
},
{
"epoch": 1.265625,
"grad_norm": 0.13024495542049408,
"learning_rate": 3.988275870828061e-05,
"loss": 0.85400390625,
"step": 162
},
{
"epoch": 1.2734375,
"grad_norm": 0.12089991569519043,
"learning_rate": 3.933607150926594e-05,
"loss": 0.87841796875,
"step": 163
},
{
"epoch": 1.28125,
"grad_norm": 0.12083294242620468,
"learning_rate": 3.879200238378804e-05,
"loss": 0.8660888671875,
"step": 164
},
{
"epoch": 1.2890625,
"grad_norm": 0.14186769723892212,
"learning_rate": 3.825064226771786e-05,
"loss": 0.8818359375,
"step": 165
},
{
"epoch": 1.296875,
"grad_norm": 0.13118009269237518,
"learning_rate": 3.7712081644141704e-05,
"loss": 0.84375,
"step": 166
},
{
"epoch": 1.3046875,
"grad_norm": 0.11879151314496994,
"learning_rate": 3.717641052823795e-05,
"loss": 0.77734375,
"step": 167
},
{
"epoch": 1.3125,
"grad_norm": 0.13815367221832275,
"learning_rate": 3.664371845223174e-05,
"loss": 0.904541015625,
"step": 168
},
{
"epoch": 1.3203125,
"grad_norm": 0.12955917418003082,
"learning_rate": 3.611409445043069e-05,
"loss": 0.89599609375,
"step": 169
},
{
"epoch": 1.328125,
"grad_norm": 0.12600165605545044,
"learning_rate": 3.558762704434361e-05,
"loss": 0.841796875,
"step": 170
},
{
"epoch": 1.3359375,
"grad_norm": 0.12873414158821106,
"learning_rate": 3.506440422788493e-05,
"loss": 0.859375,
"step": 171
},
{
"epoch": 1.34375,
"grad_norm": 0.12860363721847534,
"learning_rate": 3.4544513452667475e-05,
"loss": 0.861572265625,
"step": 172
},
{
"epoch": 1.3515625,
"grad_norm": 0.1260329931974411,
"learning_rate": 3.402804161338577e-05,
"loss": 0.810546875,
"step": 173
},
{
"epoch": 1.359375,
"grad_norm": 0.13522958755493164,
"learning_rate": 3.3515075033292297e-05,
"loss": 0.80517578125,
"step": 174
},
{
"epoch": 1.3671875,
"grad_norm": 0.19915230572223663,
"learning_rate": 3.3005699449769615e-05,
"loss": 0.84033203125,
"step": 175
},
{
"epoch": 1.375,
"grad_norm": 0.13226912915706635,
"learning_rate": 3.250000000000001e-05,
"loss": 0.8857421875,
"step": 176
},
{
"epoch": 1.3828125,
"grad_norm": 0.14104294776916504,
"learning_rate": 3.1998061206735705e-05,
"loss": 0.8740234375,
"step": 177
},
{
"epoch": 1.390625,
"grad_norm": 0.13300438225269318,
"learning_rate": 3.1499966964171777e-05,
"loss": 0.931640625,
"step": 178
},
{
"epoch": 1.3984375,
"grad_norm": 0.11573480814695358,
"learning_rate": 3.100580052392391e-05,
"loss": 0.762939453125,
"step": 179
},
{
"epoch": 1.40625,
"grad_norm": 0.14123529195785522,
"learning_rate": 3.0515644481113782e-05,
"loss": 0.83349609375,
"step": 180
},
{
"epoch": 1.4140625,
"grad_norm": 0.13057246804237366,
"learning_rate": 3.0029580760564148e-05,
"loss": 0.8267822265625,
"step": 181
},
{
"epoch": 1.421875,
"grad_norm": 0.14644423127174377,
"learning_rate": 2.9547690603105772e-05,
"loss": 0.89208984375,
"step": 182
},
{
"epoch": 1.4296875,
"grad_norm": 0.12269032001495361,
"learning_rate": 2.907005455199889e-05,
"loss": 0.884765625,
"step": 183
},
{
"epoch": 1.4375,
"grad_norm": 0.12927685678005219,
"learning_rate": 2.85967524394712e-05,
"loss": 0.8193359375,
"step": 184
},
{
"epoch": 1.4453125,
"grad_norm": 0.12026294320821762,
"learning_rate": 2.8127863373374635e-05,
"loss": 0.74896240234375,
"step": 185
},
{
"epoch": 1.453125,
"grad_norm": 0.12809842824935913,
"learning_rate": 2.766346572396324e-05,
"loss": 0.87890625,
"step": 186
},
{
"epoch": 1.4609375,
"grad_norm": 0.13720197975635529,
"learning_rate": 2.720363711079444e-05,
"loss": 0.8896484375,
"step": 187
},
{
"epoch": 1.46875,
"grad_norm": 0.15317557752132416,
"learning_rate": 2.6748454389755574e-05,
"loss": 0.8212890625,
"step": 188
},
{
"epoch": 1.4765625,
"grad_norm": 0.1357753425836563,
"learning_rate": 2.6297993640218227e-05,
"loss": 0.8916015625,
"step": 189
},
{
"epoch": 1.484375,
"grad_norm": 0.12334258109331131,
"learning_rate": 2.585233015232235e-05,
"loss": 0.797119140625,
"step": 190
},
{
"epoch": 1.4921875,
"grad_norm": 0.1273258626461029,
"learning_rate": 2.5411538414392143e-05,
"loss": 0.8525390625,
"step": 191
},
{
"epoch": 1.5,
"grad_norm": 0.12042784690856934,
"learning_rate": 2.4975692100486117e-05,
"loss": 0.75634765625,
"step": 192
},
{
"epoch": 1.5078125,
"grad_norm": 0.14903995394706726,
"learning_rate": 2.4544864058083215e-05,
"loss": 0.859375,
"step": 193
},
{
"epoch": 1.515625,
"grad_norm": 0.1403791308403015,
"learning_rate": 2.4119126295906998e-05,
"loss": 0.8004150390625,
"step": 194
},
{
"epoch": 1.5234375,
"grad_norm": 0.12431909143924713,
"learning_rate": 2.369854997189011e-05,
"loss": 0.75830078125,
"step": 195
},
{
"epoch": 1.53125,
"grad_norm": 0.1252904087305069,
"learning_rate": 2.328320538128098e-05,
"loss": 0.807861328125,
"step": 196
},
{
"epoch": 1.5390625,
"grad_norm": 0.13873587548732758,
"learning_rate": 2.2873161944894553e-05,
"loss": 0.8671875,
"step": 197
},
{
"epoch": 1.546875,
"grad_norm": 0.13714814186096191,
"learning_rate": 2.246848819750932e-05,
"loss": 0.8271484375,
"step": 198
},
{
"epoch": 1.5546875,
"grad_norm": 0.1349773406982422,
"learning_rate": 2.2069251776412458e-05,
"loss": 0.91015625,
"step": 199
},
{
"epoch": 1.5625,
"grad_norm": 0.13301518559455872,
"learning_rate": 2.16755194100948e-05,
"loss": 0.908203125,
"step": 200
},
{
"epoch": 1.5703125,
"grad_norm": 0.13332822918891907,
"learning_rate": 2.128735690709788e-05,
"loss": 0.8035888671875,
"step": 201
},
{
"epoch": 1.578125,
"grad_norm": 0.13555565476417542,
"learning_rate": 2.0904829145014696e-05,
"loss": 0.888671875,
"step": 202
},
{
"epoch": 1.5859375,
"grad_norm": 0.12675346434116364,
"learning_rate": 2.0528000059645997e-05,
"loss": 0.76788330078125,
"step": 203
},
{
"epoch": 1.59375,
"grad_norm": 0.12981340289115906,
"learning_rate": 2.015693263431404e-05,
"loss": 0.82275390625,
"step": 204
},
{
"epoch": 1.6015625,
"grad_norm": 0.13672125339508057,
"learning_rate": 1.9791688889335612e-05,
"loss": 0.87353515625,
"step": 205
},
{
"epoch": 1.6015625,
"eval_loss": 0.88916015625,
"eval_runtime": 6.3756,
"eval_samples_per_second": 1.098,
"eval_steps_per_second": 0.157,
"step": 205
},
{
"epoch": 1.609375,
"grad_norm": 0.12884238362312317,
"learning_rate": 1.943232987165584e-05,
"loss": 0.825927734375,
"step": 206
},
{
"epoch": 1.6171875,
"grad_norm": 0.1343514621257782,
"learning_rate": 1.9078915644644818e-05,
"loss": 0.826904296875,
"step": 207
},
{
"epoch": 1.625,
"grad_norm": 0.1251915991306305,
"learning_rate": 1.873150527805866e-05,
"loss": 0.748779296875,
"step": 208
},
{
"epoch": 1.6328125,
"grad_norm": 0.1351170539855957,
"learning_rate": 1.8390156838166466e-05,
"loss": 0.8525390625,
"step": 209
},
{
"epoch": 1.640625,
"grad_norm": 0.13529124855995178,
"learning_rate": 1.8054927378045173e-05,
"loss": 0.8681640625,
"step": 210
},
{
"epoch": 1.6484375,
"grad_norm": 0.24143168330192566,
"learning_rate": 1.7725872928043662e-05,
"loss": 0.8837890625,
"step": 211
},
{
"epoch": 1.65625,
"grad_norm": 0.14436808228492737,
"learning_rate": 1.740304848641787e-05,
"loss": 0.8671875,
"step": 212
},
{
"epoch": 1.6640625,
"grad_norm": 0.1449054628610611,
"learning_rate": 1.708650801013827e-05,
"loss": 0.8544921875,
"step": 213
},
{
"epoch": 1.671875,
"grad_norm": 0.13676013052463531,
"learning_rate": 1.6776304405871624e-05,
"loss": 0.83984375,
"step": 214
},
{
"epoch": 1.6796875,
"grad_norm": 0.14598451554775238,
"learning_rate": 1.6472489521138015e-05,
"loss": 0.89306640625,
"step": 215
},
{
"epoch": 1.6875,
"grad_norm": 0.13086682558059692,
"learning_rate": 1.6175114135645122e-05,
"loss": 0.81982421875,
"step": 216
},
{
"epoch": 1.6953125,
"grad_norm": 0.13416112959384918,
"learning_rate": 1.588422795280085e-05,
"loss": 0.935546875,
"step": 217
},
{
"epoch": 1.703125,
"grad_norm": 0.13844376802444458,
"learning_rate": 1.5599879591405917e-05,
"loss": 0.869140625,
"step": 218
},
{
"epoch": 1.7109375,
"grad_norm": 0.14437532424926758,
"learning_rate": 1.532211657752764e-05,
"loss": 0.89453125,
"step": 219
},
{
"epoch": 1.71875,
"grad_norm": 0.14027994871139526,
"learning_rate": 1.505098533655649e-05,
"loss": 0.845703125,
"step": 220
},
{
"epoch": 1.7265625,
"grad_norm": 0.18803958594799042,
"learning_rate": 1.4786531185446454e-05,
"loss": 0.758544921875,
"step": 221
},
{
"epoch": 1.734375,
"grad_norm": 0.11587260663509369,
"learning_rate": 1.4528798325140819e-05,
"loss": 0.723388671875,
"step": 222
},
{
"epoch": 1.7421875,
"grad_norm": 0.14269521832466125,
"learning_rate": 1.4277829833184362e-05,
"loss": 0.844482421875,
"step": 223
},
{
"epoch": 1.75,
"grad_norm": 0.1624603122472763,
"learning_rate": 1.4033667656523405e-05,
"loss": 0.72503662109375,
"step": 224
},
{
"epoch": 1.7578125,
"grad_norm": 0.14480014145374298,
"learning_rate": 1.3796352604494737e-05,
"loss": 0.87646484375,
"step": 225
},
{
"epoch": 1.765625,
"grad_norm": 0.1253139227628708,
"learning_rate": 1.3565924342004776e-05,
"loss": 0.74560546875,
"step": 226
},
{
"epoch": 1.7734375,
"grad_norm": 0.23191969096660614,
"learning_rate": 1.3342421382899936e-05,
"loss": 0.7784423828125,
"step": 227
},
{
"epoch": 1.78125,
"grad_norm": 0.14313557744026184,
"learning_rate": 1.3125881083529421e-05,
"loss": 0.9173583984375,
"step": 228
},
{
"epoch": 1.7890625,
"grad_norm": 0.14738067984580994,
"learning_rate": 1.2916339636501467e-05,
"loss": 0.8369140625,
"step": 229
},
{
"epoch": 1.796875,
"grad_norm": 0.13663701713085175,
"learning_rate": 1.2713832064634126e-05,
"loss": 0.7978515625,
"step": 230
},
{
"epoch": 1.8046875,
"grad_norm": 0.13957999646663666,
"learning_rate": 1.2518392215101501e-05,
"loss": 0.86669921875,
"step": 231
},
{
"epoch": 1.8125,
"grad_norm": 0.14884498715400696,
"learning_rate": 1.2330052753776559e-05,
"loss": 0.8046875,
"step": 232
},
{
"epoch": 1.8203125,
"grad_norm": 0.14636348187923431,
"learning_rate": 1.2148845159771311e-05,
"loss": 0.86181640625,
"step": 233
},
{
"epoch": 1.828125,
"grad_norm": 0.14254586398601532,
"learning_rate": 1.197479972017542e-05,
"loss": 0.87353515625,
"step": 234
},
{
"epoch": 1.8359375,
"grad_norm": 0.14920088648796082,
"learning_rate": 1.1807945524993964e-05,
"loss": 0.80810546875,
"step": 235
},
{
"epoch": 1.84375,
"grad_norm": 0.14492006599903107,
"learning_rate": 1.1648310462285386e-05,
"loss": 0.84619140625,
"step": 236
},
{
"epoch": 1.8515625,
"grad_norm": 0.1472831517457962,
"learning_rate": 1.1495921213500211e-05,
"loss": 0.857421875,
"step": 237
},
{
"epoch": 1.859375,
"grad_norm": 0.1383552849292755,
"learning_rate": 1.1350803249021543e-05,
"loss": 0.8466796875,
"step": 238
},
{
"epoch": 1.8671875,
"grad_norm": 0.1946849375963211,
"learning_rate": 1.1212980823907931e-05,
"loss": 0.833984375,
"step": 239
},
{
"epoch": 1.875,
"grad_norm": 0.13776731491088867,
"learning_rate": 1.108247697383934e-05,
"loss": 0.769775390625,
"step": 240
},
{
"epoch": 1.8828125,
"grad_norm": 0.14295612275600433,
"learning_rate": 1.0959313511267016e-05,
"loss": 0.8310546875,
"step": 241
},
{
"epoch": 1.890625,
"grad_norm": 0.13705675303936005,
"learning_rate": 1.084351102176769e-05,
"loss": 0.7623291015625,
"step": 242
},
{
"epoch": 1.8984375,
"grad_norm": 0.13686659932136536,
"learning_rate": 1.073508886060295e-05,
"loss": 0.89013671875,
"step": 243
},
{
"epoch": 1.90625,
"grad_norm": 0.1406104564666748,
"learning_rate": 1.0634065149484159e-05,
"loss": 0.8671875,
"step": 244
},
{
"epoch": 1.9140625,
"grad_norm": 0.14705617725849152,
"learning_rate": 1.0540456773543596e-05,
"loss": 0.829833984375,
"step": 245
},
{
"epoch": 1.921875,
"grad_norm": 0.12452160567045212,
"learning_rate": 1.0454279378512287e-05,
"loss": 0.7509765625,
"step": 246
},
{
"epoch": 1.9296875,
"grad_norm": 0.1495411992073059,
"learning_rate": 1.0375547368104952e-05,
"loss": 0.912109375,
"step": 247
},
{
"epoch": 1.9375,
"grad_norm": 0.14412689208984375,
"learning_rate": 1.0304273901612566e-05,
"loss": 0.765380859375,
"step": 248
},
{
"epoch": 1.9453125,
"grad_norm": 0.14419622719287872,
"learning_rate": 1.0240470891702937e-05,
"loss": 0.87548828125,
"step": 249
},
{
"epoch": 1.953125,
"grad_norm": 0.1380612850189209,
"learning_rate": 1.0184149002429582e-05,
"loss": 0.78759765625,
"step": 250
},
{
"epoch": 1.9609375,
"grad_norm": 0.13859306275844574,
"learning_rate": 1.013531764744936e-05,
"loss": 0.8388671875,
"step": 251
},
{
"epoch": 1.96875,
"grad_norm": 0.15172813832759857,
"learning_rate": 1.009398498844906e-05,
"loss": 0.88818359375,
"step": 252
},
{
"epoch": 1.9765625,
"grad_norm": 0.1881428360939026,
"learning_rate": 1.0060157933781257e-05,
"loss": 0.7987060546875,
"step": 253
},
{
"epoch": 1.984375,
"grad_norm": 0.1493026316165924,
"learning_rate": 1.0033842137309648e-05,
"loss": 0.8685302734375,
"step": 254
},
{
"epoch": 1.9921875,
"grad_norm": 0.14847420156002045,
"learning_rate": 1.0015041997464066e-05,
"loss": 0.8798828125,
"step": 255
},
{
"epoch": 2.0,
"grad_norm": 0.1424848586320877,
"learning_rate": 1.0003760656505323e-05,
"loss": 0.83251953125,
"step": 256
},
{
"epoch": 2.0,
"eval_loss": 0.88525390625,
"eval_runtime": 6.3661,
"eval_samples_per_second": 1.1,
"eval_steps_per_second": 0.157,
"step": 256
}
],
"logging_steps": 1.0,
"max_steps": 256,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 0,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.103933224220413e+19,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}