v3_r64_5e4_constant / trainer_state.json
sglucas's picture
Upload folder using huggingface_hub
cc66945 verified
Raw
History Blame Contribute Delete
41 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.4007212983370066,
"eval_steps": 500,
"global_step": 2500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0016028851933480265,
"grad_norm": 678.3370361328125,
"learning_rate": 9e-06,
"loss": 9.3792,
"step": 10
},
{
"epoch": 0.003205770386696053,
"grad_norm": 113.01063537597656,
"learning_rate": 1.9e-05,
"loss": 6.1237,
"step": 20
},
{
"epoch": 0.004808655580044079,
"grad_norm": 38.7303352355957,
"learning_rate": 2.9000000000000004e-05,
"loss": 3.9919,
"step": 30
},
{
"epoch": 0.006411540773392106,
"grad_norm": 11.953008651733398,
"learning_rate": 3.9e-05,
"loss": 3.2455,
"step": 40
},
{
"epoch": 0.008014425966740133,
"grad_norm": 7.101607799530029,
"learning_rate": 4.9000000000000005e-05,
"loss": 2.8384,
"step": 50
},
{
"epoch": 0.009617311160088158,
"grad_norm": 3.37833571434021,
"learning_rate": 5.9e-05,
"loss": 2.5245,
"step": 60
},
{
"epoch": 0.011220196353436185,
"grad_norm": 6.2443060874938965,
"learning_rate": 6.900000000000001e-05,
"loss": 2.3123,
"step": 70
},
{
"epoch": 0.012823081546784212,
"grad_norm": 3.346142530441284,
"learning_rate": 7.9e-05,
"loss": 2.2146,
"step": 80
},
{
"epoch": 0.014425966740132239,
"grad_norm": 5.297983646392822,
"learning_rate": 8.9e-05,
"loss": 2.1299,
"step": 90
},
{
"epoch": 0.016028851933480266,
"grad_norm": 3.8509230613708496,
"learning_rate": 9.900000000000001e-05,
"loss": 2.0268,
"step": 100
},
{
"epoch": 0.017631737126828292,
"grad_norm": 3.9156150817871094,
"learning_rate": 0.000109,
"loss": 1.9719,
"step": 110
},
{
"epoch": 0.019234622320176316,
"grad_norm": 2.475393056869507,
"learning_rate": 0.00011899999999999999,
"loss": 1.9239,
"step": 120
},
{
"epoch": 0.020837507513524343,
"grad_norm": 1.9771146774291992,
"learning_rate": 0.00012900000000000002,
"loss": 1.9036,
"step": 130
},
{
"epoch": 0.02244039270687237,
"grad_norm": 2.066272020339966,
"learning_rate": 0.00013900000000000002,
"loss": 1.8848,
"step": 140
},
{
"epoch": 0.024043277900220397,
"grad_norm": 3.157252311706543,
"learning_rate": 0.000149,
"loss": 1.8243,
"step": 150
},
{
"epoch": 0.025646163093568423,
"grad_norm": 1.3372395038604736,
"learning_rate": 0.00015900000000000002,
"loss": 1.7958,
"step": 160
},
{
"epoch": 0.02724904828691645,
"grad_norm": 1.4542139768600464,
"learning_rate": 0.00016900000000000002,
"loss": 1.7728,
"step": 170
},
{
"epoch": 0.028851933480264477,
"grad_norm": 1.0300779342651367,
"learning_rate": 0.000179,
"loss": 1.7621,
"step": 180
},
{
"epoch": 0.030454818673612504,
"grad_norm": 1.7812498807907104,
"learning_rate": 0.000189,
"loss": 1.7172,
"step": 190
},
{
"epoch": 0.03205770386696053,
"grad_norm": 2.1096291542053223,
"learning_rate": 0.000199,
"loss": 1.7046,
"step": 200
},
{
"epoch": 0.033660589060308554,
"grad_norm": 1.7795636653900146,
"learning_rate": 0.00020899999999999998,
"loss": 1.7024,
"step": 210
},
{
"epoch": 0.035263474253656585,
"grad_norm": 2.049923896789551,
"learning_rate": 0.000219,
"loss": 1.6741,
"step": 220
},
{
"epoch": 0.03686635944700461,
"grad_norm": 1.7486822605133057,
"learning_rate": 0.000229,
"loss": 1.6917,
"step": 230
},
{
"epoch": 0.03846924464035263,
"grad_norm": 0.8129467964172363,
"learning_rate": 0.00023899999999999998,
"loss": 1.611,
"step": 240
},
{
"epoch": 0.04007212983370066,
"grad_norm": 0.798921525478363,
"learning_rate": 0.000249,
"loss": 1.6248,
"step": 250
},
{
"epoch": 0.041675015027048685,
"grad_norm": 0.8136582374572754,
"learning_rate": 0.000259,
"loss": 1.6145,
"step": 260
},
{
"epoch": 0.043277900220396716,
"grad_norm": 0.7742071747779846,
"learning_rate": 0.00026900000000000003,
"loss": 1.5923,
"step": 270
},
{
"epoch": 0.04488078541374474,
"grad_norm": 1.268173098564148,
"learning_rate": 0.000279,
"loss": 1.6178,
"step": 280
},
{
"epoch": 0.04648367060709277,
"grad_norm": 0.6928769946098328,
"learning_rate": 0.000289,
"loss": 1.5796,
"step": 290
},
{
"epoch": 0.04808655580044079,
"grad_norm": 1.1396955251693726,
"learning_rate": 0.000299,
"loss": 1.5705,
"step": 300
},
{
"epoch": 0.049689440993788817,
"grad_norm": 0.8991694450378418,
"learning_rate": 0.00030900000000000003,
"loss": 1.5643,
"step": 310
},
{
"epoch": 0.05129232618713685,
"grad_norm": 0.7772015929222107,
"learning_rate": 0.000319,
"loss": 1.5568,
"step": 320
},
{
"epoch": 0.05289521138048487,
"grad_norm": 0.5438646078109741,
"learning_rate": 0.00032900000000000003,
"loss": 1.5606,
"step": 330
},
{
"epoch": 0.0544980965738329,
"grad_norm": 1.0528185367584229,
"learning_rate": 0.00033900000000000005,
"loss": 1.5214,
"step": 340
},
{
"epoch": 0.056100981767180924,
"grad_norm": 0.7310357093811035,
"learning_rate": 0.00034899999999999997,
"loss": 1.522,
"step": 350
},
{
"epoch": 0.057703866960528954,
"grad_norm": 0.7124305367469788,
"learning_rate": 0.000359,
"loss": 1.5262,
"step": 360
},
{
"epoch": 0.05930675215387698,
"grad_norm": 0.9238534569740295,
"learning_rate": 0.000369,
"loss": 1.5308,
"step": 370
},
{
"epoch": 0.06090963734722501,
"grad_norm": 0.6533244848251343,
"learning_rate": 0.000379,
"loss": 1.4975,
"step": 380
},
{
"epoch": 0.06251252254057303,
"grad_norm": 0.730185329914093,
"learning_rate": 0.000389,
"loss": 1.4823,
"step": 390
},
{
"epoch": 0.06411540773392106,
"grad_norm": 0.7585217952728271,
"learning_rate": 0.00039900000000000005,
"loss": 1.5047,
"step": 400
},
{
"epoch": 0.06571829292726908,
"grad_norm": 1.3076744079589844,
"learning_rate": 0.00040899999999999997,
"loss": 1.4638,
"step": 410
},
{
"epoch": 0.06732117812061711,
"grad_norm": 0.7289252877235413,
"learning_rate": 0.000419,
"loss": 1.4677,
"step": 420
},
{
"epoch": 0.06892406331396514,
"grad_norm": 0.7431015968322754,
"learning_rate": 0.000429,
"loss": 1.4918,
"step": 430
},
{
"epoch": 0.07052694850731317,
"grad_norm": 0.7311664819717407,
"learning_rate": 0.000439,
"loss": 1.4713,
"step": 440
},
{
"epoch": 0.07212983370066119,
"grad_norm": 1.0821692943572998,
"learning_rate": 0.000449,
"loss": 1.4724,
"step": 450
},
{
"epoch": 0.07373271889400922,
"grad_norm": 1.5106474161148071,
"learning_rate": 0.00045900000000000004,
"loss": 1.4655,
"step": 460
},
{
"epoch": 0.07533560408735725,
"grad_norm": 0.5979589223861694,
"learning_rate": 0.00046899999999999996,
"loss": 1.4639,
"step": 470
},
{
"epoch": 0.07693848928070526,
"grad_norm": 0.5786557197570801,
"learning_rate": 0.000479,
"loss": 1.4339,
"step": 480
},
{
"epoch": 0.0785413744740533,
"grad_norm": 0.43480566143989563,
"learning_rate": 0.000489,
"loss": 1.4583,
"step": 490
},
{
"epoch": 0.08014425966740132,
"grad_norm": 0.44123759865760803,
"learning_rate": 0.000499,
"loss": 1.4314,
"step": 500
},
{
"epoch": 0.08174714486074935,
"grad_norm": 0.463187038898468,
"learning_rate": 0.0005,
"loss": 1.4396,
"step": 510
},
{
"epoch": 0.08335003005409737,
"grad_norm": 1.4139055013656616,
"learning_rate": 0.0005,
"loss": 1.4437,
"step": 520
},
{
"epoch": 0.0849529152474454,
"grad_norm": 0.3580915033817291,
"learning_rate": 0.0005,
"loss": 1.414,
"step": 530
},
{
"epoch": 0.08655580044079343,
"grad_norm": 0.41002535820007324,
"learning_rate": 0.0005,
"loss": 1.427,
"step": 540
},
{
"epoch": 0.08815868563414145,
"grad_norm": 0.4274766445159912,
"learning_rate": 0.0005,
"loss": 1.4381,
"step": 550
},
{
"epoch": 0.08976157082748948,
"grad_norm": 0.46305719017982483,
"learning_rate": 0.0005,
"loss": 1.4022,
"step": 560
},
{
"epoch": 0.09136445602083751,
"grad_norm": 0.388123482465744,
"learning_rate": 0.0005,
"loss": 1.395,
"step": 570
},
{
"epoch": 0.09296734121418554,
"grad_norm": 0.44987061619758606,
"learning_rate": 0.0005,
"loss": 1.4009,
"step": 580
},
{
"epoch": 0.09457022640753356,
"grad_norm": 0.3794371485710144,
"learning_rate": 0.0005,
"loss": 1.4273,
"step": 590
},
{
"epoch": 0.09617311160088159,
"grad_norm": 0.3824334442615509,
"learning_rate": 0.0005,
"loss": 1.4076,
"step": 600
},
{
"epoch": 0.09777599679422962,
"grad_norm": 0.40158432722091675,
"learning_rate": 0.0005,
"loss": 1.3827,
"step": 610
},
{
"epoch": 0.09937888198757763,
"grad_norm": 0.36512696743011475,
"learning_rate": 0.0005,
"loss": 1.4304,
"step": 620
},
{
"epoch": 0.10098176718092566,
"grad_norm": 0.5844743847846985,
"learning_rate": 0.0005,
"loss": 1.3845,
"step": 630
},
{
"epoch": 0.1025846523742737,
"grad_norm": 0.3842383027076721,
"learning_rate": 0.0005,
"loss": 1.3851,
"step": 640
},
{
"epoch": 0.10418753756762172,
"grad_norm": 0.34687766432762146,
"learning_rate": 0.0005,
"loss": 1.4011,
"step": 650
},
{
"epoch": 0.10579042276096974,
"grad_norm": 0.3505879342556,
"learning_rate": 0.0005,
"loss": 1.365,
"step": 660
},
{
"epoch": 0.10739330795431777,
"grad_norm": 0.3470805883407593,
"learning_rate": 0.0005,
"loss": 1.3882,
"step": 670
},
{
"epoch": 0.1089961931476658,
"grad_norm": 0.35840025544166565,
"learning_rate": 0.0005,
"loss": 1.3652,
"step": 680
},
{
"epoch": 0.11059907834101383,
"grad_norm": 0.36231186985969543,
"learning_rate": 0.0005,
"loss": 1.3841,
"step": 690
},
{
"epoch": 0.11220196353436185,
"grad_norm": 0.3536931276321411,
"learning_rate": 0.0005,
"loss": 1.3746,
"step": 700
},
{
"epoch": 0.11380484872770988,
"grad_norm": 0.35982581973075867,
"learning_rate": 0.0005,
"loss": 1.3875,
"step": 710
},
{
"epoch": 0.11540773392105791,
"grad_norm": 0.4366588890552521,
"learning_rate": 0.0005,
"loss": 1.3723,
"step": 720
},
{
"epoch": 0.11701061911440593,
"grad_norm": 0.34436532855033875,
"learning_rate": 0.0005,
"loss": 1.3811,
"step": 730
},
{
"epoch": 0.11861350430775396,
"grad_norm": 0.38028818368911743,
"learning_rate": 0.0005,
"loss": 1.3894,
"step": 740
},
{
"epoch": 0.12021638950110199,
"grad_norm": 0.3495010733604431,
"learning_rate": 0.0005,
"loss": 1.3719,
"step": 750
},
{
"epoch": 0.12181927469445002,
"grad_norm": 0.3643304109573364,
"learning_rate": 0.0005,
"loss": 1.3793,
"step": 760
},
{
"epoch": 0.12342215988779803,
"grad_norm": 0.35712549090385437,
"learning_rate": 0.0005,
"loss": 1.3459,
"step": 770
},
{
"epoch": 0.12502504508114606,
"grad_norm": 0.348839670419693,
"learning_rate": 0.0005,
"loss": 1.3794,
"step": 780
},
{
"epoch": 0.1266279302744941,
"grad_norm": 0.4368819296360016,
"learning_rate": 0.0005,
"loss": 1.3722,
"step": 790
},
{
"epoch": 0.12823081546784212,
"grad_norm": 0.5412229299545288,
"learning_rate": 0.0005,
"loss": 1.3571,
"step": 800
},
{
"epoch": 0.12983370066119015,
"grad_norm": 0.42561405897140503,
"learning_rate": 0.0005,
"loss": 1.3667,
"step": 810
},
{
"epoch": 0.13143658585453816,
"grad_norm": 0.3597279489040375,
"learning_rate": 0.0005,
"loss": 1.3522,
"step": 820
},
{
"epoch": 0.1330394710478862,
"grad_norm": 0.4504384994506836,
"learning_rate": 0.0005,
"loss": 1.3349,
"step": 830
},
{
"epoch": 0.13464235624123422,
"grad_norm": 0.37311264872550964,
"learning_rate": 0.0005,
"loss": 1.339,
"step": 840
},
{
"epoch": 0.13624524143458225,
"grad_norm": 0.3933414816856384,
"learning_rate": 0.0005,
"loss": 1.3553,
"step": 850
},
{
"epoch": 0.13784812662793028,
"grad_norm": 0.3546708822250366,
"learning_rate": 0.0005,
"loss": 1.3518,
"step": 860
},
{
"epoch": 0.1394510118212783,
"grad_norm": 0.4191734492778778,
"learning_rate": 0.0005,
"loss": 1.3361,
"step": 870
},
{
"epoch": 0.14105389701462634,
"grad_norm": 0.5219401717185974,
"learning_rate": 0.0005,
"loss": 1.3464,
"step": 880
},
{
"epoch": 0.14265678220797434,
"grad_norm": 0.4485955238342285,
"learning_rate": 0.0005,
"loss": 1.3602,
"step": 890
},
{
"epoch": 0.14425966740132237,
"grad_norm": 0.45198988914489746,
"learning_rate": 0.0005,
"loss": 1.3578,
"step": 900
},
{
"epoch": 0.1458625525946704,
"grad_norm": 0.539563000202179,
"learning_rate": 0.0005,
"loss": 1.3387,
"step": 910
},
{
"epoch": 0.14746543778801843,
"grad_norm": 0.4177083671092987,
"learning_rate": 0.0005,
"loss": 1.3512,
"step": 920
},
{
"epoch": 0.14906832298136646,
"grad_norm": 0.4130881726741791,
"learning_rate": 0.0005,
"loss": 1.3481,
"step": 930
},
{
"epoch": 0.1506712081747145,
"grad_norm": 0.4453917443752289,
"learning_rate": 0.0005,
"loss": 1.371,
"step": 940
},
{
"epoch": 0.15227409336806252,
"grad_norm": 0.44530555605888367,
"learning_rate": 0.0005,
"loss": 1.3509,
"step": 950
},
{
"epoch": 0.15387697856141053,
"grad_norm": 0.6519402265548706,
"learning_rate": 0.0005,
"loss": 1.329,
"step": 960
},
{
"epoch": 0.15547986375475856,
"grad_norm": 0.40298616886138916,
"learning_rate": 0.0005,
"loss": 1.3243,
"step": 970
},
{
"epoch": 0.1570827489481066,
"grad_norm": 0.3541094958782196,
"learning_rate": 0.0005,
"loss": 1.3278,
"step": 980
},
{
"epoch": 0.15868563414145462,
"grad_norm": 0.39235177636146545,
"learning_rate": 0.0005,
"loss": 1.3347,
"step": 990
},
{
"epoch": 0.16028851933480265,
"grad_norm": 0.3771113455295563,
"learning_rate": 0.0005,
"loss": 1.3485,
"step": 1000
},
{
"epoch": 0.16189140452815068,
"grad_norm": 0.32740509510040283,
"learning_rate": 0.0005,
"loss": 1.3404,
"step": 1010
},
{
"epoch": 0.1634942897214987,
"grad_norm": 0.3351823091506958,
"learning_rate": 0.0005,
"loss": 1.302,
"step": 1020
},
{
"epoch": 0.1650971749148467,
"grad_norm": 0.3709336519241333,
"learning_rate": 0.0005,
"loss": 1.3094,
"step": 1030
},
{
"epoch": 0.16670006010819474,
"grad_norm": 0.4003657102584839,
"learning_rate": 0.0005,
"loss": 1.3612,
"step": 1040
},
{
"epoch": 0.16830294530154277,
"grad_norm": 0.3763624429702759,
"learning_rate": 0.0005,
"loss": 1.3209,
"step": 1050
},
{
"epoch": 0.1699058304948908,
"grad_norm": 0.48239532113075256,
"learning_rate": 0.0005,
"loss": 1.3369,
"step": 1060
},
{
"epoch": 0.17150871568823883,
"grad_norm": 0.5595227479934692,
"learning_rate": 0.0005,
"loss": 1.3194,
"step": 1070
},
{
"epoch": 0.17311160088158686,
"grad_norm": 0.3660586178302765,
"learning_rate": 0.0005,
"loss": 1.3209,
"step": 1080
},
{
"epoch": 0.1747144860749349,
"grad_norm": 0.38128146529197693,
"learning_rate": 0.0005,
"loss": 1.3207,
"step": 1090
},
{
"epoch": 0.1763173712682829,
"grad_norm": 0.4592175781726837,
"learning_rate": 0.0005,
"loss": 1.3105,
"step": 1100
},
{
"epoch": 0.17792025646163093,
"grad_norm": 0.35791411995887756,
"learning_rate": 0.0005,
"loss": 1.3121,
"step": 1110
},
{
"epoch": 0.17952314165497896,
"grad_norm": 0.33707818388938904,
"learning_rate": 0.0005,
"loss": 1.3123,
"step": 1120
},
{
"epoch": 0.181126026848327,
"grad_norm": 0.37126076221466064,
"learning_rate": 0.0005,
"loss": 1.3117,
"step": 1130
},
{
"epoch": 0.18272891204167502,
"grad_norm": 0.3038891553878784,
"learning_rate": 0.0005,
"loss": 1.3189,
"step": 1140
},
{
"epoch": 0.18433179723502305,
"grad_norm": 0.31843164563179016,
"learning_rate": 0.0005,
"loss": 1.302,
"step": 1150
},
{
"epoch": 0.18593468242837108,
"grad_norm": 0.3236716687679291,
"learning_rate": 0.0005,
"loss": 1.3137,
"step": 1160
},
{
"epoch": 0.18753756762171908,
"grad_norm": 0.33301737904548645,
"learning_rate": 0.0005,
"loss": 1.3194,
"step": 1170
},
{
"epoch": 0.1891404528150671,
"grad_norm": 0.3310806453227997,
"learning_rate": 0.0005,
"loss": 1.305,
"step": 1180
},
{
"epoch": 0.19074333800841514,
"grad_norm": 0.32767626643180847,
"learning_rate": 0.0005,
"loss": 1.314,
"step": 1190
},
{
"epoch": 0.19234622320176317,
"grad_norm": 0.3089030385017395,
"learning_rate": 0.0005,
"loss": 1.2897,
"step": 1200
},
{
"epoch": 0.1939491083951112,
"grad_norm": 0.33364149928092957,
"learning_rate": 0.0005,
"loss": 1.3003,
"step": 1210
},
{
"epoch": 0.19555199358845923,
"grad_norm": 0.29430854320526123,
"learning_rate": 0.0005,
"loss": 1.3135,
"step": 1220
},
{
"epoch": 0.19715487878180726,
"grad_norm": 0.40663015842437744,
"learning_rate": 0.0005,
"loss": 1.2946,
"step": 1230
},
{
"epoch": 0.19875776397515527,
"grad_norm": 0.3090682923793793,
"learning_rate": 0.0005,
"loss": 1.3055,
"step": 1240
},
{
"epoch": 0.2003606491685033,
"grad_norm": 0.33319520950317383,
"learning_rate": 0.0005,
"loss": 1.3028,
"step": 1250
},
{
"epoch": 0.20196353436185133,
"grad_norm": 0.39136168360710144,
"learning_rate": 0.0005,
"loss": 1.3126,
"step": 1260
},
{
"epoch": 0.20356641955519936,
"grad_norm": 0.9555182456970215,
"learning_rate": 0.0005,
"loss": 1.2978,
"step": 1270
},
{
"epoch": 0.2051693047485474,
"grad_norm": 0.36503541469573975,
"learning_rate": 0.0005,
"loss": 1.3118,
"step": 1280
},
{
"epoch": 0.20677218994189542,
"grad_norm": 0.4477512240409851,
"learning_rate": 0.0005,
"loss": 1.3162,
"step": 1290
},
{
"epoch": 0.20837507513524345,
"grad_norm": 0.3497491478919983,
"learning_rate": 0.0005,
"loss": 1.2952,
"step": 1300
},
{
"epoch": 0.20997796032859145,
"grad_norm": 0.44401678442955017,
"learning_rate": 0.0005,
"loss": 1.2727,
"step": 1310
},
{
"epoch": 0.21158084552193948,
"grad_norm": 0.3597167730331421,
"learning_rate": 0.0005,
"loss": 1.3,
"step": 1320
},
{
"epoch": 0.2131837307152875,
"grad_norm": 0.3729954957962036,
"learning_rate": 0.0005,
"loss": 1.3211,
"step": 1330
},
{
"epoch": 0.21478661590863554,
"grad_norm": 0.30662021040916443,
"learning_rate": 0.0005,
"loss": 1.2768,
"step": 1340
},
{
"epoch": 0.21638950110198357,
"grad_norm": 0.31561264395713806,
"learning_rate": 0.0005,
"loss": 1.3191,
"step": 1350
},
{
"epoch": 0.2179923862953316,
"grad_norm": 0.4170988202095032,
"learning_rate": 0.0005,
"loss": 1.3091,
"step": 1360
},
{
"epoch": 0.21959527148867963,
"grad_norm": 0.35628414154052734,
"learning_rate": 0.0005,
"loss": 1.305,
"step": 1370
},
{
"epoch": 0.22119815668202766,
"grad_norm": 0.3731990456581116,
"learning_rate": 0.0005,
"loss": 1.3092,
"step": 1380
},
{
"epoch": 0.22280104187537567,
"grad_norm": 0.3259612023830414,
"learning_rate": 0.0005,
"loss": 1.293,
"step": 1390
},
{
"epoch": 0.2244039270687237,
"grad_norm": 0.320374995470047,
"learning_rate": 0.0005,
"loss": 1.304,
"step": 1400
},
{
"epoch": 0.22600681226207173,
"grad_norm": 0.4857123792171478,
"learning_rate": 0.0005,
"loss": 1.2878,
"step": 1410
},
{
"epoch": 0.22760969745541976,
"grad_norm": 1.945692539215088,
"learning_rate": 0.0005,
"loss": 1.2989,
"step": 1420
},
{
"epoch": 0.2292125826487678,
"grad_norm": 0.39001426100730896,
"learning_rate": 0.0005,
"loss": 1.2989,
"step": 1430
},
{
"epoch": 0.23081546784211582,
"grad_norm": 0.3088345229625702,
"learning_rate": 0.0005,
"loss": 1.3036,
"step": 1440
},
{
"epoch": 0.23241835303546385,
"grad_norm": 0.368073970079422,
"learning_rate": 0.0005,
"loss": 1.3009,
"step": 1450
},
{
"epoch": 0.23402123822881185,
"grad_norm": 0.37869542837142944,
"learning_rate": 0.0005,
"loss": 1.2899,
"step": 1460
},
{
"epoch": 0.23562412342215988,
"grad_norm": 0.393318235874176,
"learning_rate": 0.0005,
"loss": 1.2763,
"step": 1470
},
{
"epoch": 0.2372270086155079,
"grad_norm": 0.3757217526435852,
"learning_rate": 0.0005,
"loss": 1.2987,
"step": 1480
},
{
"epoch": 0.23882989380885594,
"grad_norm": 0.39952972531318665,
"learning_rate": 0.0005,
"loss": 1.3131,
"step": 1490
},
{
"epoch": 0.24043277900220397,
"grad_norm": 0.4175151288509369,
"learning_rate": 0.0005,
"loss": 1.2952,
"step": 1500
},
{
"epoch": 0.242035664195552,
"grad_norm": 0.4070395529270172,
"learning_rate": 0.0005,
"loss": 1.2985,
"step": 1510
},
{
"epoch": 0.24363854938890003,
"grad_norm": 0.5496709942817688,
"learning_rate": 0.0005,
"loss": 1.2822,
"step": 1520
},
{
"epoch": 0.24524143458224804,
"grad_norm": 0.3813125193119049,
"learning_rate": 0.0005,
"loss": 1.2881,
"step": 1530
},
{
"epoch": 0.24684431977559607,
"grad_norm": 0.41737911105155945,
"learning_rate": 0.0005,
"loss": 1.3007,
"step": 1540
},
{
"epoch": 0.2484472049689441,
"grad_norm": 0.3591451644897461,
"learning_rate": 0.0005,
"loss": 1.2753,
"step": 1550
},
{
"epoch": 0.2500500901622921,
"grad_norm": 0.3714822828769684,
"learning_rate": 0.0005,
"loss": 1.2949,
"step": 1560
},
{
"epoch": 0.25165297535564013,
"grad_norm": 0.4229411482810974,
"learning_rate": 0.0005,
"loss": 1.2667,
"step": 1570
},
{
"epoch": 0.2532558605489882,
"grad_norm": 0.36146730184555054,
"learning_rate": 0.0005,
"loss": 1.297,
"step": 1580
},
{
"epoch": 0.2548587457423362,
"grad_norm": 0.40604183077812195,
"learning_rate": 0.0005,
"loss": 1.2979,
"step": 1590
},
{
"epoch": 0.25646163093568425,
"grad_norm": 0.3981959819793701,
"learning_rate": 0.0005,
"loss": 1.2731,
"step": 1600
},
{
"epoch": 0.25806451612903225,
"grad_norm": 0.3921387493610382,
"learning_rate": 0.0005,
"loss": 1.2985,
"step": 1610
},
{
"epoch": 0.2596674013223803,
"grad_norm": 0.3937159776687622,
"learning_rate": 0.0005,
"loss": 1.2894,
"step": 1620
},
{
"epoch": 0.2612702865157283,
"grad_norm": 0.687377393245697,
"learning_rate": 0.0005,
"loss": 1.2857,
"step": 1630
},
{
"epoch": 0.2628731717090763,
"grad_norm": 0.35336875915527344,
"learning_rate": 0.0005,
"loss": 1.2991,
"step": 1640
},
{
"epoch": 0.2644760569024244,
"grad_norm": 0.39487507939338684,
"learning_rate": 0.0005,
"loss": 1.2848,
"step": 1650
},
{
"epoch": 0.2660789420957724,
"grad_norm": 0.33148014545440674,
"learning_rate": 0.0005,
"loss": 1.296,
"step": 1660
},
{
"epoch": 0.26768182728912043,
"grad_norm": 0.30253589153289795,
"learning_rate": 0.0005,
"loss": 1.2882,
"step": 1670
},
{
"epoch": 0.26928471248246844,
"grad_norm": 0.33182498812675476,
"learning_rate": 0.0005,
"loss": 1.2624,
"step": 1680
},
{
"epoch": 0.2708875976758165,
"grad_norm": 0.3482310473918915,
"learning_rate": 0.0005,
"loss": 1.2969,
"step": 1690
},
{
"epoch": 0.2724904828691645,
"grad_norm": 0.3354679048061371,
"learning_rate": 0.0005,
"loss": 1.2818,
"step": 1700
},
{
"epoch": 0.2740933680625125,
"grad_norm": 0.36453723907470703,
"learning_rate": 0.0005,
"loss": 1.2872,
"step": 1710
},
{
"epoch": 0.27569625325586056,
"grad_norm": 0.47449424862861633,
"learning_rate": 0.0005,
"loss": 1.2834,
"step": 1720
},
{
"epoch": 0.27729913844920856,
"grad_norm": 0.32657721638679504,
"learning_rate": 0.0005,
"loss": 1.2823,
"step": 1730
},
{
"epoch": 0.2789020236425566,
"grad_norm": 0.2980170249938965,
"learning_rate": 0.0005,
"loss": 1.2806,
"step": 1740
},
{
"epoch": 0.2805049088359046,
"grad_norm": 0.3514454662799835,
"learning_rate": 0.0005,
"loss": 1.2589,
"step": 1750
},
{
"epoch": 0.2821077940292527,
"grad_norm": 0.34434592723846436,
"learning_rate": 0.0005,
"loss": 1.295,
"step": 1760
},
{
"epoch": 0.2837106792226007,
"grad_norm": 0.2812644839286804,
"learning_rate": 0.0005,
"loss": 1.2658,
"step": 1770
},
{
"epoch": 0.2853135644159487,
"grad_norm": 0.3048274517059326,
"learning_rate": 0.0005,
"loss": 1.281,
"step": 1780
},
{
"epoch": 0.28691644960929674,
"grad_norm": 0.3719802796840668,
"learning_rate": 0.0005,
"loss": 1.2642,
"step": 1790
},
{
"epoch": 0.28851933480264474,
"grad_norm": 0.40966910123825073,
"learning_rate": 0.0005,
"loss": 1.2675,
"step": 1800
},
{
"epoch": 0.2901222199959928,
"grad_norm": 0.3720247447490692,
"learning_rate": 0.0005,
"loss": 1.2798,
"step": 1810
},
{
"epoch": 0.2917251051893408,
"grad_norm": 0.3861991763114929,
"learning_rate": 0.0005,
"loss": 1.2718,
"step": 1820
},
{
"epoch": 0.29332799038268886,
"grad_norm": 0.4071897864341736,
"learning_rate": 0.0005,
"loss": 1.288,
"step": 1830
},
{
"epoch": 0.29493087557603687,
"grad_norm": 0.31495898962020874,
"learning_rate": 0.0005,
"loss": 1.3065,
"step": 1840
},
{
"epoch": 0.29653376076938487,
"grad_norm": 0.35031652450561523,
"learning_rate": 0.0005,
"loss": 1.2732,
"step": 1850
},
{
"epoch": 0.2981366459627329,
"grad_norm": 0.38266849517822266,
"learning_rate": 0.0005,
"loss": 1.2779,
"step": 1860
},
{
"epoch": 0.29973953115608093,
"grad_norm": 0.31431642174720764,
"learning_rate": 0.0005,
"loss": 1.2761,
"step": 1870
},
{
"epoch": 0.301342416349429,
"grad_norm": 0.318367600440979,
"learning_rate": 0.0005,
"loss": 1.2688,
"step": 1880
},
{
"epoch": 0.302945301542777,
"grad_norm": 0.3060268759727478,
"learning_rate": 0.0005,
"loss": 1.2619,
"step": 1890
},
{
"epoch": 0.30454818673612505,
"grad_norm": 0.33884698152542114,
"learning_rate": 0.0005,
"loss": 1.2748,
"step": 1900
},
{
"epoch": 0.30615107192947305,
"grad_norm": 0.3074434995651245,
"learning_rate": 0.0005,
"loss": 1.2694,
"step": 1910
},
{
"epoch": 0.30775395712282105,
"grad_norm": 0.35602208971977234,
"learning_rate": 0.0005,
"loss": 1.2766,
"step": 1920
},
{
"epoch": 0.3093568423161691,
"grad_norm": 0.31432512402534485,
"learning_rate": 0.0005,
"loss": 1.2813,
"step": 1930
},
{
"epoch": 0.3109597275095171,
"grad_norm": 0.3290809094905853,
"learning_rate": 0.0005,
"loss": 1.2798,
"step": 1940
},
{
"epoch": 0.3125626127028652,
"grad_norm": 0.2725956439971924,
"learning_rate": 0.0005,
"loss": 1.2654,
"step": 1950
},
{
"epoch": 0.3141654978962132,
"grad_norm": 0.27984774112701416,
"learning_rate": 0.0005,
"loss": 1.2584,
"step": 1960
},
{
"epoch": 0.31576838308956123,
"grad_norm": 0.5261242389678955,
"learning_rate": 0.0005,
"loss": 1.2441,
"step": 1970
},
{
"epoch": 0.31737126828290924,
"grad_norm": 0.36167559027671814,
"learning_rate": 0.0005,
"loss": 1.2547,
"step": 1980
},
{
"epoch": 0.31897415347625724,
"grad_norm": 0.39349183440208435,
"learning_rate": 0.0005,
"loss": 1.2899,
"step": 1990
},
{
"epoch": 0.3205770386696053,
"grad_norm": 0.32107916474342346,
"learning_rate": 0.0005,
"loss": 1.2536,
"step": 2000
},
{
"epoch": 0.3221799238629533,
"grad_norm": 0.3739472031593323,
"learning_rate": 0.0005,
"loss": 1.2951,
"step": 2010
},
{
"epoch": 0.32378280905630136,
"grad_norm": 0.38725772500038147,
"learning_rate": 0.0005,
"loss": 1.2766,
"step": 2020
},
{
"epoch": 0.32538569424964936,
"grad_norm": 0.2980344593524933,
"learning_rate": 0.0005,
"loss": 1.2623,
"step": 2030
},
{
"epoch": 0.3269885794429974,
"grad_norm": 0.31839045882225037,
"learning_rate": 0.0005,
"loss": 1.2631,
"step": 2040
},
{
"epoch": 0.3285914646363454,
"grad_norm": 0.34590938687324524,
"learning_rate": 0.0005,
"loss": 1.2874,
"step": 2050
},
{
"epoch": 0.3301943498296934,
"grad_norm": 0.2809009253978729,
"learning_rate": 0.0005,
"loss": 1.2801,
"step": 2060
},
{
"epoch": 0.3317972350230415,
"grad_norm": 0.5641685724258423,
"learning_rate": 0.0005,
"loss": 1.2658,
"step": 2070
},
{
"epoch": 0.3334001202163895,
"grad_norm": 0.34127888083457947,
"learning_rate": 0.0005,
"loss": 1.2424,
"step": 2080
},
{
"epoch": 0.33500300540973754,
"grad_norm": 0.5770083069801331,
"learning_rate": 0.0005,
"loss": 1.2656,
"step": 2090
},
{
"epoch": 0.33660589060308554,
"grad_norm": 0.35034167766571045,
"learning_rate": 0.0005,
"loss": 1.2709,
"step": 2100
},
{
"epoch": 0.3382087757964336,
"grad_norm": 0.4296245574951172,
"learning_rate": 0.0005,
"loss": 1.2739,
"step": 2110
},
{
"epoch": 0.3398116609897816,
"grad_norm": 0.37714719772338867,
"learning_rate": 0.0005,
"loss": 1.2685,
"step": 2120
},
{
"epoch": 0.3414145461831296,
"grad_norm": 0.3473512828350067,
"learning_rate": 0.0005,
"loss": 1.2755,
"step": 2130
},
{
"epoch": 0.34301743137647767,
"grad_norm": 0.8088376522064209,
"learning_rate": 0.0005,
"loss": 1.2662,
"step": 2140
},
{
"epoch": 0.34462031656982567,
"grad_norm": 0.322681725025177,
"learning_rate": 0.0005,
"loss": 1.2548,
"step": 2150
},
{
"epoch": 0.3462232017631737,
"grad_norm": 0.42762812972068787,
"learning_rate": 0.0005,
"loss": 1.2672,
"step": 2160
},
{
"epoch": 0.34782608695652173,
"grad_norm": 0.3658334016799927,
"learning_rate": 0.0005,
"loss": 1.2565,
"step": 2170
},
{
"epoch": 0.3494289721498698,
"grad_norm": 0.37944141030311584,
"learning_rate": 0.0005,
"loss": 1.2807,
"step": 2180
},
{
"epoch": 0.3510318573432178,
"grad_norm": 0.418755441904068,
"learning_rate": 0.0005,
"loss": 1.251,
"step": 2190
},
{
"epoch": 0.3526347425365658,
"grad_norm": 0.3580203950405121,
"learning_rate": 0.0005,
"loss": 1.2621,
"step": 2200
},
{
"epoch": 0.35423762772991385,
"grad_norm": 0.39281541109085083,
"learning_rate": 0.0005,
"loss": 1.2638,
"step": 2210
},
{
"epoch": 0.35584051292326185,
"grad_norm": 0.32786354422569275,
"learning_rate": 0.0005,
"loss": 1.2498,
"step": 2220
},
{
"epoch": 0.3574433981166099,
"grad_norm": 0.3115231692790985,
"learning_rate": 0.0005,
"loss": 1.2896,
"step": 2230
},
{
"epoch": 0.3590462833099579,
"grad_norm": 0.41042885184288025,
"learning_rate": 0.0005,
"loss": 1.2748,
"step": 2240
},
{
"epoch": 0.360649168503306,
"grad_norm": 0.4438491463661194,
"learning_rate": 0.0005,
"loss": 1.2476,
"step": 2250
},
{
"epoch": 0.362252053696654,
"grad_norm": 0.3606395721435547,
"learning_rate": 0.0005,
"loss": 1.253,
"step": 2260
},
{
"epoch": 0.363854938890002,
"grad_norm": 0.3120422959327698,
"learning_rate": 0.0005,
"loss": 1.2653,
"step": 2270
},
{
"epoch": 0.36545782408335004,
"grad_norm": 0.35044899582862854,
"learning_rate": 0.0005,
"loss": 1.2663,
"step": 2280
},
{
"epoch": 0.36706070927669804,
"grad_norm": 0.3766014277935028,
"learning_rate": 0.0005,
"loss": 1.2706,
"step": 2290
},
{
"epoch": 0.3686635944700461,
"grad_norm": 0.34974873065948486,
"learning_rate": 0.0005,
"loss": 1.2598,
"step": 2300
},
{
"epoch": 0.3702664796633941,
"grad_norm": 0.43365639448165894,
"learning_rate": 0.0005,
"loss": 1.273,
"step": 2310
},
{
"epoch": 0.37186936485674216,
"grad_norm": 0.3572383522987366,
"learning_rate": 0.0005,
"loss": 1.248,
"step": 2320
},
{
"epoch": 0.37347225005009016,
"grad_norm": 0.4122643768787384,
"learning_rate": 0.0005,
"loss": 1.2399,
"step": 2330
},
{
"epoch": 0.37507513524343816,
"grad_norm": 0.3526794910430908,
"learning_rate": 0.0005,
"loss": 1.278,
"step": 2340
},
{
"epoch": 0.3766780204367862,
"grad_norm": 0.29494354128837585,
"learning_rate": 0.0005,
"loss": 1.2503,
"step": 2350
},
{
"epoch": 0.3782809056301342,
"grad_norm": 0.5473882555961609,
"learning_rate": 0.0005,
"loss": 1.2286,
"step": 2360
},
{
"epoch": 0.3798837908234823,
"grad_norm": 0.33589014410972595,
"learning_rate": 0.0005,
"loss": 1.2863,
"step": 2370
},
{
"epoch": 0.3814866760168303,
"grad_norm": 0.30862322449684143,
"learning_rate": 0.0005,
"loss": 1.2577,
"step": 2380
},
{
"epoch": 0.38308956121017834,
"grad_norm": 0.7398898005485535,
"learning_rate": 0.0005,
"loss": 1.2732,
"step": 2390
},
{
"epoch": 0.38469244640352634,
"grad_norm": 0.32832425832748413,
"learning_rate": 0.0005,
"loss": 1.2687,
"step": 2400
},
{
"epoch": 0.38629533159687435,
"grad_norm": 0.30570557713508606,
"learning_rate": 0.0005,
"loss": 1.2775,
"step": 2410
},
{
"epoch": 0.3878982167902224,
"grad_norm": 0.32628288865089417,
"learning_rate": 0.0005,
"loss": 1.2584,
"step": 2420
},
{
"epoch": 0.3895011019835704,
"grad_norm": 0.41335487365722656,
"learning_rate": 0.0005,
"loss": 1.2731,
"step": 2430
},
{
"epoch": 0.39110398717691847,
"grad_norm": 0.4485657215118408,
"learning_rate": 0.0005,
"loss": 1.2715,
"step": 2440
},
{
"epoch": 0.39270687237026647,
"grad_norm": 0.4431282877922058,
"learning_rate": 0.0005,
"loss": 1.2634,
"step": 2450
},
{
"epoch": 0.3943097575636145,
"grad_norm": 0.2843770682811737,
"learning_rate": 0.0005,
"loss": 1.2706,
"step": 2460
},
{
"epoch": 0.39591264275696253,
"grad_norm": 0.3248964250087738,
"learning_rate": 0.0005,
"loss": 1.2479,
"step": 2470
},
{
"epoch": 0.39751552795031053,
"grad_norm": 0.2866270840167999,
"learning_rate": 0.0005,
"loss": 1.2202,
"step": 2480
},
{
"epoch": 0.3991184131436586,
"grad_norm": 0.296093612909317,
"learning_rate": 0.0005,
"loss": 1.2563,
"step": 2490
},
{
"epoch": 0.4007212983370066,
"grad_norm": 0.30020371079444885,
"learning_rate": 0.0005,
"loss": 1.2569,
"step": 2500
}
],
"logging_steps": 10,
"max_steps": 2500,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 6.105286991832678e+19,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}