seanyhan's picture
Duplicate from jackf857/qwen3-8b-base-kto-ultrafeedback-4xH200-batch-128
eebb736
Raw
History Blame Contribute Delete
47.8 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.9998691270776077,
"eval_steps": 200,
"global_step": 955,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0010469833791388562,
"grad_norm": 46.5684700012207,
"kl": 0.04943779110908508,
"learning_rate": 0.0,
"logits/chosen": 442452480.0,
"logits/rejected": 465586784.0,
"logps/chosen": -192.3951231060606,
"logps/rejected": -244.5851814516129,
"loss": 4.0033,
"rewards/chosen": -0.002359318913835468,
"rewards/margins": -0.005345997827551815,
"rewards/rejected": 0.002986678913716347,
"step": 1
},
{
"epoch": 0.010469833791388562,
"grad_norm": 47.87677001953125,
"kl": 0.0966624915599823,
"learning_rate": 4.6875e-08,
"logits/chosen": 497818176.0,
"logits/rejected": 465912416.0,
"logps/chosen": -272.4681021973466,
"logps/rejected": -251.92019581056465,
"loss": 4.0037,
"rewards/chosen": -0.0018457298848166394,
"rewards/margins": -0.002352562184804766,
"rewards/rejected": 0.0005068322999881265,
"step": 10
},
{
"epoch": 0.020939667582777124,
"grad_norm": 52.892616271972656,
"kl": 0.07839385420084,
"learning_rate": 9.895833333333332e-08,
"logits/chosen": 495900416.0,
"logits/rejected": 479196576.0,
"logps/chosen": -270.1613023952096,
"logps/rejected": -259.60822610294116,
"loss": 3.9998,
"rewards/chosen": -0.0014621614517565972,
"rewards/margins": 0.001095909008419559,
"rewards/rejected": -0.0025580704601761563,
"step": 20
},
{
"epoch": 0.031409501374165684,
"grad_norm": 49.37065505981445,
"kl": 0.12432318925857544,
"learning_rate": 1.5104166666666664e-07,
"logits/chosen": 446004160.0,
"logits/rejected": 416264512.0,
"logps/chosen": -286.6748310810811,
"logps/rejected": -239.96737581433226,
"loss": 3.9988,
"rewards/chosen": 0.005302351516288322,
"rewards/margins": 0.001094049639710752,
"rewards/rejected": 0.00420830187657757,
"step": 30
},
{
"epoch": 0.04187933516555425,
"grad_norm": 56.20479965209961,
"kl": 0.1288590282201767,
"learning_rate": 2.03125e-07,
"logits/chosen": 469622016.0,
"logits/rejected": 471840608.0,
"logps/chosen": -299.05229591836735,
"logps/rejected": -275.7191874027994,
"loss": 4.0024,
"rewards/chosen": 0.011023993020529275,
"rewards/margins": -0.0016035611417646294,
"rewards/rejected": 0.012627554162293905,
"step": 40
},
{
"epoch": 0.05234916895694281,
"grad_norm": 53.468544006347656,
"kl": 0.15856146812438965,
"learning_rate": 2.552083333333333e-07,
"logits/chosen": 472065984.0,
"logits/rejected": 415794880.0,
"logps/chosen": -301.99,
"logps/rejected": -266.23648313492066,
"loss": 3.9892,
"rewards/chosen": 0.0272962394127479,
"rewards/margins": 0.012006511944408674,
"rewards/rejected": 0.015289727468339225,
"step": 50
},
{
"epoch": 0.06281900274833137,
"grad_norm": 55.099525451660156,
"kl": 0.1767362356185913,
"learning_rate": 3.0729166666666665e-07,
"logits/chosen": 458564768.0,
"logits/rejected": 465017408.0,
"logps/chosen": -291.2200561908517,
"logps/rejected": -270.51400445046437,
"loss": 3.9806,
"rewards/chosen": 0.03807779967972909,
"rewards/margins": 0.01917116797379836,
"rewards/rejected": 0.018906631705930727,
"step": 60
},
{
"epoch": 0.07328883653971993,
"grad_norm": 59.78743362426758,
"kl": 0.1566978394985199,
"learning_rate": 3.59375e-07,
"logits/chosen": 435970144.0,
"logits/rejected": 464205728.0,
"logps/chosen": -276.08103898713824,
"logps/rejected": -271.9755176671733,
"loss": 3.974,
"rewards/chosen": 0.05013132555308449,
"rewards/margins": 0.027480934417912214,
"rewards/rejected": 0.02265039113517228,
"step": 70
},
{
"epoch": 0.0837586703311085,
"grad_norm": 63.29967498779297,
"kl": 0.14287321269512177,
"learning_rate": 4.114583333333333e-07,
"logits/chosen": 465435904.0,
"logits/rejected": 445954368.0,
"logps/chosen": -301.7261437595712,
"logps/rejected": -253.4555173444976,
"loss": 3.9459,
"rewards/chosen": 0.07625812337738083,
"rewards/margins": 0.05526375141259004,
"rewards/rejected": 0.020994371964790794,
"step": 80
},
{
"epoch": 0.09422850412249706,
"grad_norm": 51.23120880126953,
"kl": 0.08589013665914536,
"learning_rate": 4.6354166666666664e-07,
"logits/chosen": 425856352.0,
"logits/rejected": 442634752.0,
"logps/chosen": -250.01865157480316,
"logps/rejected": -253.97698643410854,
"loss": 3.9365,
"rewards/chosen": 0.0922366164800689,
"rewards/margins": 0.06793148576547496,
"rewards/rejected": 0.02430513071459393,
"step": 90
},
{
"epoch": 0.10469833791388562,
"grad_norm": 53.67849349975586,
"kl": 0.06646991521120071,
"learning_rate": 4.999849525959245e-07,
"logits/chosen": 443815680.0,
"logits/rejected": 468530592.0,
"logps/chosen": -292.86275268151815,
"logps/rejected": -254.13021606083086,
"loss": 3.8786,
"rewards/chosen": 0.1379817798979605,
"rewards/margins": 0.13271600843962053,
"rewards/rejected": 0.005265771458339974,
"step": 100
},
{
"epoch": 0.11516817170527417,
"grad_norm": 55.30476379394531,
"kl": 0.008740690536797047,
"learning_rate": 4.997174935782199e-07,
"logits/chosen": 405325280.0,
"logits/rejected": 404096320.0,
"logps/chosen": -281.1175155520995,
"logps/rejected": -245.54272959183675,
"loss": 3.8465,
"rewards/chosen": 0.10175868104071491,
"rewards/margins": 0.15764128317543147,
"rewards/rejected": -0.05588260213471657,
"step": 110
},
{
"epoch": 0.12563800549666274,
"grad_norm": 53.23088073730469,
"kl": 0.0,
"learning_rate": 4.9911605954668e-07,
"logits/chosen": 413253440.0,
"logits/rejected": 466272960.0,
"logps/chosen": -265.9372119815668,
"logps/rejected": -285.0679401828299,
"loss": 3.7909,
"rewards/chosen": 0.09825083297518541,
"rewards/margins": 0.21899295158017598,
"rewards/rejected": -0.12074211860499057,
"step": 120
},
{
"epoch": 0.1361078392880513,
"grad_norm": 47.935428619384766,
"kl": 0.0031980276107788086,
"learning_rate": 4.981814548660135e-07,
"logits/chosen": 415410240.0,
"logits/rejected": 464793856.0,
"logps/chosen": -278.3420138888889,
"logps/rejected": -253.4058807237814,
"loss": 3.7401,
"rewards/chosen": 0.16747628080706495,
"rewards/margins": 0.27606504747137556,
"rewards/rejected": -0.10858876666431061,
"step": 130
},
{
"epoch": 0.14657767307943986,
"grad_norm": 45.16371154785156,
"kl": 0.0,
"learning_rate": 4.969149294871417e-07,
"logits/chosen": 419959424.0,
"logits/rejected": 448011200.0,
"logps/chosen": -259.45691892971246,
"logps/rejected": -274.75979548929666,
"loss": 3.6988,
"rewards/chosen": 0.15218203364850613,
"rewards/margins": 0.3255889087455651,
"rewards/rejected": -0.17340687509705896,
"step": 140
},
{
"epoch": 0.1570475068708284,
"grad_norm": 45.20751190185547,
"kl": 0.0,
"learning_rate": 4.953181772754997e-07,
"logits/chosen": 419500992.0,
"logits/rejected": 426865440.0,
"logps/chosen": -262.6239265267176,
"logps/rejected": -255.55855,
"loss": 3.5915,
"rewards/chosen": 0.18705672635376908,
"rewards/margins": 0.4586699343615816,
"rewards/rejected": -0.2716132080078125,
"step": 150
},
{
"epoch": 0.167517340662217,
"grad_norm": 43.46672058105469,
"kl": 0.0,
"learning_rate": 4.93393333745642e-07,
"logits/chosen": 402036128.0,
"logits/rejected": 407421024.0,
"logps/chosen": -256.07155539772725,
"logps/rejected": -253.9230515813253,
"loss": 3.5417,
"rewards/chosen": 0.35380408051726103,
"rewards/margins": 0.5338230570275502,
"rewards/rejected": -0.1800189765102892,
"step": 160
},
{
"epoch": 0.17798717445360554,
"grad_norm": 50.28922653198242,
"kl": 0.0,
"learning_rate": 4.9114297320518e-07,
"logits/chosen": 443569248.0,
"logits/rejected": 446337024.0,
"logps/chosen": -272.3035854231975,
"logps/rejected": -268.38152258566976,
"loss": 3.4368,
"rewards/chosen": 0.5461393254677703,
"rewards/margins": 0.6761910660725394,
"rewards/rejected": -0.13005174060476904,
"step": 170
},
{
"epoch": 0.18845700824499412,
"grad_norm": 50.34736633300781,
"kl": 0.0,
"learning_rate": 4.885701053118751e-07,
"logits/chosen": 420526400.0,
"logits/rejected": 440075456.0,
"logps/chosen": -267.0804433925811,
"logps/rejected": -268.7849772906793,
"loss": 3.3582,
"rewards/chosen": 0.5984241420739954,
"rewards/margins": 0.7952823357110659,
"rewards/rejected": -0.1968581936370705,
"step": 180
},
{
"epoch": 0.19892684203638267,
"grad_norm": 46.28329086303711,
"kl": 0.0,
"learning_rate": 4.856781710484872e-07,
"logits/chosen": 400002560.0,
"logits/rejected": 408255584.0,
"logps/chosen": -266.1100976874003,
"logps/rejected": -277.3754067764165,
"loss": 3.272,
"rewards/chosen": 0.658042360150643,
"rewards/margins": 0.9656070181593528,
"rewards/rejected": -0.3075646580087098,
"step": 190
},
{
"epoch": 0.20939667582777124,
"grad_norm": 37.88730239868164,
"kl": 0.0,
"learning_rate": 4.824710381207655e-07,
"logits/chosen": 394069760.0,
"logits/rejected": 439350080.0,
"logps/chosen": -280.22834606109325,
"logps/rejected": -273.49769661854106,
"loss": 3.2673,
"rewards/chosen": 0.34384584580203725,
"rewards/margins": 1.0138983249053806,
"rewards/rejected": -0.6700524791033434,
"step": 200
},
{
"epoch": 0.2198665096191598,
"grad_norm": 50.169498443603516,
"kl": 0.0,
"learning_rate": 4.789529957847353e-07,
"logits/chosen": 409849664.0,
"logits/rejected": 351628448.0,
"logps/chosen": -283.19119751908397,
"logps/rejected": -262.1562,
"loss": 3.1422,
"rewards/chosen": 0.7572274943344466,
"rewards/margins": 1.2206477580063215,
"rewards/rejected": -0.463420263671875,
"step": 210
},
{
"epoch": 0.23033634341054834,
"grad_norm": 54.83884048461914,
"kl": 0.0,
"learning_rate": 4.751287491101977e-07,
"logits/chosen": 400426208.0,
"logits/rejected": 369194944.0,
"logps/chosen": -270.1439732142857,
"logps/rejected": -257.53584414308176,
"loss": 3.2684,
"rewards/chosen": 0.4789316402458996,
"rewards/margins": 1.1337323431866424,
"rewards/rejected": -0.6548007029407429,
"step": 220
},
{
"epoch": 0.24080617720193692,
"grad_norm": 59.397918701171875,
"kl": 0.0,
"learning_rate": 4.710034126881159e-07,
"logits/chosen": 424935232.0,
"logits/rejected": 324887488.0,
"logps/chosen": -288.61760826055314,
"logps/rejected": -282.7670741989882,
"loss": 3.1502,
"rewards/chosen": 0.5312555082673762,
"rewards/margins": 1.3070566024126125,
"rewards/rejected": -0.7758010941452361,
"step": 230
},
{
"epoch": 0.25127601099332547,
"grad_norm": 54.53902053833008,
"kl": 0.0,
"learning_rate": 4.665825037903035e-07,
"logits/chosen": 411758592.0,
"logits/rejected": 355237504.0,
"logps/chosen": -266.5797621340524,
"logps/rejected": -262.10652733755944,
"loss": 3.1504,
"rewards/chosen": 0.7458241232003563,
"rewards/margins": 1.340257552513327,
"rewards/rejected": -0.5944334293129705,
"step": 240
},
{
"epoch": 0.261745844784714,
"grad_norm": 84.02921295166016,
"kl": 0.0,
"learning_rate": 4.618719349905619e-07,
"logits/chosen": 432440224.0,
"logits/rejected": 374901696.0,
"logps/chosen": -284.9515267175573,
"logps/rejected": -268.12985,
"loss": 3.0524,
"rewards/chosen": 0.4285235455927958,
"rewards/margins": 1.5875603619990457,
"rewards/rejected": -1.15903681640625,
"step": 250
},
{
"epoch": 0.2722156785761026,
"grad_norm": 44.28253173828125,
"kl": 0.0,
"learning_rate": 4.568780062571374e-07,
"logits/chosen": 350974560.0,
"logits/rejected": 379531712.0,
"logps/chosen": -270.08513621794873,
"logps/rejected": -280.8126429115854,
"loss": 3.0586,
"rewards/chosen": 0.14809322357177734,
"rewards/margins": 1.5623344560948813,
"rewards/rejected": -1.414241232523104,
"step": 260
},
{
"epoch": 0.2826855123674912,
"grad_norm": 56.65611267089844,
"kl": 0.0,
"learning_rate": 4.516073965270717e-07,
"logits/chosen": 353575936.0,
"logits/rejected": 341260640.0,
"logps/chosen": -261.7265013693271,
"logps/rejected": -284.40742004680186,
"loss": 3.0462,
"rewards/chosen": 0.5539226979716843,
"rewards/margins": 1.646275173808999,
"rewards/rejected": -1.0923524758373147,
"step": 270
},
{
"epoch": 0.2931553461588797,
"grad_norm": 117.23200988769531,
"kl": 0.0,
"learning_rate": 4.460671547737158e-07,
"logits/chosen": 336798048.0,
"logits/rejected": 346110912.0,
"logps/chosen": -299.6681069131833,
"logps/rejected": -268.43320193768994,
"loss": 3.0478,
"rewards/chosen": -0.01779557194357133,
"rewards/margins": 1.6294317994113867,
"rewards/rejected": -1.6472273713549581,
"step": 280
},
{
"epoch": 0.3036251799502683,
"grad_norm": 45.30254364013672,
"kl": 0.0,
"learning_rate": 4.40264690579353e-07,
"logits/chosen": 350954464.0,
"logits/rejected": 331866784.0,
"logps/chosen": -285.780487804878,
"logps/rejected": -266.4627904647436,
"loss": 2.9457,
"rewards/chosen": 0.3624885140395746,
"rewards/margins": 1.9047759982330341,
"rewards/rejected": -1.5422874841934595,
"step": 290
},
{
"epoch": 0.3140950137416568,
"grad_norm": 45.462738037109375,
"kl": 0.0,
"learning_rate": 4.3420776422553916e-07,
"logits/chosen": 356290880.0,
"logits/rejected": 351119168.0,
"logps/chosen": -276.1206756498471,
"logps/rejected": -268.070062899361,
"loss": 3.0097,
"rewards/chosen": 0.5417160360820432,
"rewards/margins": 1.7571349400544374,
"rewards/rejected": -1.2154189039723942,
"step": 300
},
{
"epoch": 0.32456484753304543,
"grad_norm": 47.83991622924805,
"kl": 0.0,
"learning_rate": 4.279044763144141e-07,
"logits/chosen": 334029376.0,
"logits/rejected": 379953376.0,
"logps/chosen": -260.419678514377,
"logps/rejected": -303.30186831039754,
"loss": 2.9571,
"rewards/chosen": 0.12563846819697858,
"rewards/margins": 1.8882139502067263,
"rewards/rejected": -1.7625754820097477,
"step": 310
},
{
"epoch": 0.335034681324434,
"grad_norm": 42.41203308105469,
"kl": 0.0,
"learning_rate": 4.213632569348639e-07,
"logits/chosen": 396048096.0,
"logits/rejected": 356900800.0,
"logps/chosen": -283.4178257686676,
"logps/rejected": -284.24552449748745,
"loss": 3.0977,
"rewards/chosen": -0.031586469703328034,
"rewards/margins": 1.8606463005934684,
"rewards/rejected": -1.8922327702967965,
"step": 320
},
{
"epoch": 0.34550451511582253,
"grad_norm": 38.14891815185547,
"kl": 0.0,
"learning_rate": 4.145928543880249e-07,
"logits/chosen": 355648192.0,
"logits/rejected": 368038208.0,
"logps/chosen": -278.34861275671403,
"logps/rejected": -277.72862731839257,
"loss": 2.8694,
"rewards/chosen": 0.5873398622630331,
"rewards/margins": 2.0932907428295904,
"rewards/rejected": -1.5059508805665571,
"step": 330
},
{
"epoch": 0.3559743489072111,
"grad_norm": 52.64259719848633,
"kl": 0.0,
"learning_rate": 4.076023234872057e-07,
"logits/chosen": 334901248.0,
"logits/rejected": 373347008.0,
"logps/chosen": -278.5432905896607,
"logps/rejected": -275.132209720121,
"loss": 2.9211,
"rewards/chosen": 0.4131505716598092,
"rewards/margins": 1.998353064331897,
"rewards/rejected": -1.5852024926720878,
"step": 340
},
{
"epoch": 0.3664441826985997,
"grad_norm": 47.56734085083008,
"kl": 0.0,
"learning_rate": 4.004010134478771e-07,
"logits/chosen": 377446912.0,
"logits/rejected": 370444192.0,
"logps/chosen": -268.446590470679,
"logps/rejected": -275.46061609968353,
"loss": 2.8817,
"rewards/chosen": 0.38401062105908806,
"rewards/margins": 2.1151071060521653,
"rewards/rejected": -1.7310964849930774,
"step": 350
},
{
"epoch": 0.37691401648998824,
"grad_norm": 44.92960739135742,
"kl": 0.0,
"learning_rate": 3.9299855538392534e-07,
"logits/chosen": 367343424.0,
"logits/rejected": 372150560.0,
"logps/chosen": -282.18478154388714,
"logps/rejected": -279.0036507009346,
"loss": 2.8888,
"rewards/chosen": 0.24498392421997453,
"rewards/margins": 2.0810528114254847,
"rewards/rejected": -1.8360688872055102,
"step": 360
},
{
"epoch": 0.3873838502813768,
"grad_norm": 70.89231872558594,
"kl": 0.0,
"learning_rate": 3.8540484942689075e-07,
"logits/chosen": 341587808.0,
"logits/rejected": 377246784.0,
"logps/chosen": -268.64557623407643,
"logps/rejected": -290.71287864263803,
"loss": 2.9263,
"rewards/chosen": 0.4795560897535579,
"rewards/margins": 2.0588525528598653,
"rewards/rejected": -1.5792964631063076,
"step": 370
},
{
"epoch": 0.39785368407276533,
"grad_norm": 48.053218841552734,
"kl": 0.0,
"learning_rate": 3.77630051485419e-07,
"logits/chosen": 373726304.0,
"logits/rejected": 332450912.0,
"logps/chosen": -287.8293694690266,
"logps/rejected": -280.6202242524917,
"loss": 2.9653,
"rewards/chosen": 0.13132064954369468,
"rewards/margins": 2.172828205736593,
"rewards/rejected": -2.0415075561928986,
"step": 380
},
{
"epoch": 0.4083235178641539,
"grad_norm": 73.88297271728516,
"kl": 0.0,
"learning_rate": 3.696845596626342e-07,
"logits/chosen": 357619776.0,
"logits/rejected": 357397952.0,
"logps/chosen": -258.85225694444443,
"logps/rejected": -277.76314903846156,
"loss": 2.9633,
"rewards/chosen": 0.49055417984250993,
"rewards/margins": 2.095406193063664,
"rewards/rejected": -1.604852013221154,
"step": 390
},
{
"epoch": 0.4187933516555425,
"grad_norm": 59.15121078491211,
"kl": 0.0,
"learning_rate": 3.61579000349597e-07,
"logits/chosen": 388324384.0,
"logits/rejected": 387673536.0,
"logps/chosen": -280.22964449541286,
"logps/rejected": -283.0034944089457,
"loss": 2.7056,
"rewards/chosen": 0.5564632590757598,
"rewards/margins": 2.5239340558009995,
"rewards/rejected": -1.9674707967252396,
"step": 400
},
{
"epoch": 0.42926318544693104,
"grad_norm": 72.18789672851562,
"kl": 0.0,
"learning_rate": 3.5332421401344837e-07,
"logits/chosen": 336218400.0,
"logits/rejected": 390127072.0,
"logps/chosen": -281.6167403198653,
"logps/rejected": -275.0251457725947,
"loss": 2.935,
"rewards/chosen": 0.14200486719407618,
"rewards/margins": 2.1233040867982127,
"rewards/rejected": -1.9812992196041364,
"step": 410
},
{
"epoch": 0.4397330192383196,
"grad_norm": 83.5944595336914,
"kl": 0.0,
"learning_rate": 3.4493124069924635e-07,
"logits/chosen": 369444512.0,
"logits/rejected": 383078592.0,
"logps/chosen": -284.5074,
"logps/rejected": -268.33742843511453,
"loss": 2.8723,
"rewards/chosen": 0.2378343994140625,
"rewards/margins": 2.372110997696505,
"rewards/rejected": -2.1342765982824425,
"step": 420
},
{
"epoch": 0.45020285302970814,
"grad_norm": 52.63675308227539,
"kl": 0.0,
"learning_rate": 3.3641130526488335e-07,
"logits/chosen": 376764608.0,
"logits/rejected": 398398816.0,
"logps/chosen": -252.68347723704866,
"logps/rejected": -299.20040338258167,
"loss": 3.0279,
"rewards/chosen": 0.16862698589426756,
"rewards/margins": 2.0355602834861224,
"rewards/rejected": -1.8669332975918547,
"step": 430
},
{
"epoch": 0.4606726868210967,
"grad_norm": 39.36049270629883,
"kl": 0.0,
"learning_rate": 3.2777580236883473e-07,
"logits/chosen": 365922400.0,
"logits/rejected": 392508864.0,
"logps/chosen": -252.91024361022363,
"logps/rejected": -279.8361525229358,
"loss": 2.8382,
"rewards/chosen": 0.5580993262342752,
"rewards/margins": 2.297070068182861,
"rewards/rejected": -1.7389707419485856,
"step": 440
},
{
"epoch": 0.4711425206124853,
"grad_norm": 57.87444305419922,
"kl": 0.0,
"learning_rate": 3.1903628123081196e-07,
"logits/chosen": 394673920.0,
"logits/rejected": 370509824.0,
"logps/chosen": -272.00308132763973,
"logps/rejected": -274.67553557389937,
"loss": 2.7844,
"rewards/chosen": 0.5175159051551582,
"rewards/margins": 2.5180846069412235,
"rewards/rejected": -2.000568701786065,
"step": 450
},
{
"epoch": 0.48161235440387384,
"grad_norm": 76.35614013671875,
"kl": 0.0,
"learning_rate": 3.1020443018570556e-07,
"logits/chosen": 327263424.0,
"logits/rejected": 376021536.0,
"logps/chosen": -267.0524807224026,
"logps/rejected": -267.99872929216866,
"loss": 2.9054,
"rewards/chosen": 0.571973280473189,
"rewards/margins": 2.1715556308708734,
"rewards/rejected": -1.5995823503976845,
"step": 460
},
{
"epoch": 0.4920821881952624,
"grad_norm": 65.82987976074219,
"kl": 0.0,
"learning_rate": 3.0129206105147343e-07,
"logits/chosen": 370748928.0,
"logits/rejected": 389477536.0,
"logps/chosen": -286.8205546492659,
"logps/rejected": -267.65315779610194,
"loss": 2.9417,
"rewards/chosen": 0.08930689825708286,
"rewards/margins": 2.134248538764954,
"rewards/rejected": -2.044941640507871,
"step": 470
},
{
"epoch": 0.5025520219866509,
"grad_norm": 69.5935287475586,
"kl": 0.0,
"learning_rate": 2.923110933318805e-07,
"logits/chosen": 372539360.0,
"logits/rejected": 354864128.0,
"logps/chosen": -271.98661380597014,
"logps/rejected": -262.8959016393443,
"loss": 2.9602,
"rewards/chosen": 0.0067851991795781835,
"rewards/margins": 2.1713433846944343,
"rewards/rejected": -2.1645581855148563,
"step": 480
},
{
"epoch": 0.5130218557780395,
"grad_norm": 75.75752258300781,
"kl": 0.0,
"learning_rate": 2.832735382752194e-07,
"logits/chosen": 403122240.0,
"logits/rejected": 371043840.0,
"logps/chosen": -270.78357101837673,
"logps/rejected": -284.7364433811802,
"loss": 2.9662,
"rewards/chosen": -0.02843327544184593,
"rewards/margins": 2.2282741669923647,
"rewards/rejected": -2.2567074424342106,
"step": 490
},
{
"epoch": 0.523491689569428,
"grad_norm": 67.58584594726562,
"kl": 0.0,
"learning_rate": 2.741914828103307e-07,
"logits/chosen": 372796864.0,
"logits/rejected": 383237824.0,
"logps/chosen": -266.3919005102041,
"logps/rejected": -270.33850116640747,
"loss": 2.8509,
"rewards/chosen": 0.3570691981532697,
"rewards/margins": 2.358759767566664,
"rewards/rejected": -2.001690569413394,
"step": 500
},
{
"epoch": 0.5339615233608166,
"grad_norm": 93.17213439941406,
"kl": 0.0,
"learning_rate": 2.650770733814065e-07,
"logits/chosen": 373166944.0,
"logits/rejected": 374013248.0,
"logps/chosen": -274.2689144736842,
"logps/rejected": -269.6120549387443,
"loss": 2.8906,
"rewards/chosen": 0.45857961554276316,
"rewards/margins": 2.376228702090428,
"rewards/rejected": -1.9176490865476645,
"step": 510
},
{
"epoch": 0.5444313571522053,
"grad_norm": 41.66130065917969,
"kl": 0.0,
"learning_rate": 2.55942499703198e-07,
"logits/chosen": 398498176.0,
"logits/rejected": 392743488.0,
"logps/chosen": -277.3498,
"logps/rejected": -268.6053673664122,
"loss": 2.9243,
"rewards/chosen": 0.3561779296875,
"rewards/margins": 2.193211826097328,
"rewards/rejected": -1.8370338964098283,
"step": 520
},
{
"epoch": 0.5549011909435938,
"grad_norm": 55.216609954833984,
"kl": 0.0,
"learning_rate": 2.467999784583527e-07,
"logits/chosen": 361071104.0,
"logits/rejected": 369749184.0,
"logps/chosen": -261.3549321086262,
"logps/rejected": -272.8801605504587,
"loss": 2.8446,
"rewards/chosen": 0.34026234294659796,
"rewards/margins": 2.427280370529262,
"rewards/rejected": -2.087018027582664,
"step": 530
},
{
"epoch": 0.5653710247349824,
"grad_norm": 63.85381317138672,
"kl": 0.0,
"learning_rate": 2.3766173695868388e-07,
"logits/chosen": 359954880.0,
"logits/rejected": 357861440.0,
"logps/chosen": -279.6579010336907,
"logps/rejected": -281.34379984051037,
"loss": 2.9617,
"rewards/chosen": 0.2960061603446832,
"rewards/margins": 2.205951756312586,
"rewards/rejected": -1.9099455959679028,
"step": 540
},
{
"epoch": 0.5758408585263709,
"grad_norm": 49.361106872558594,
"kl": 0.0,
"learning_rate": 2.285399967922253e-07,
"logits/chosen": 359154336.0,
"logits/rejected": 393155392.0,
"logps/chosen": -259.8390325479233,
"logps/rejected": -275.05624044342505,
"loss": 2.7826,
"rewards/chosen": 0.05572237983679238,
"rewards/margins": 2.533227845003077,
"rewards/rejected": -2.4775054651662844,
"step": 550
},
{
"epoch": 0.5863106923177595,
"grad_norm": 133.47369384765625,
"kl": 0.0,
"learning_rate": 2.194469574779397e-07,
"logits/chosen": 403979776.0,
"logits/rejected": 350524512.0,
"logps/chosen": -281.06496585735965,
"logps/rejected": -278.4915710547504,
"loss": 2.9209,
"rewards/chosen": -0.0682100171565286,
"rewards/margins": 2.379913441730347,
"rewards/rejected": -2.448123458886876,
"step": 560
},
{
"epoch": 0.596780526109148,
"grad_norm": 52.14252853393555,
"kl": 0.0,
"learning_rate": 2.1039478014994441e-07,
"logits/chosen": 348112192.0,
"logits/rejected": 400084896.0,
"logps/chosen": -262.22181181959564,
"logps/rejected": -282.3291306907378,
"loss": 2.8607,
"rewards/chosen": 0.08417754818455057,
"rewards/margins": 2.4870239519203237,
"rewards/rejected": -2.402846403735773,
"step": 570
},
{
"epoch": 0.6072503599005366,
"grad_norm": 102.21758270263672,
"kl": 0.0,
"learning_rate": 2.0139557129307149e-07,
"logits/chosen": 375497920.0,
"logits/rejected": 391752224.0,
"logps/chosen": -287.6094496417197,
"logps/rejected": -300.8546060199387,
"loss": 2.8128,
"rewards/chosen": 0.2170035246830837,
"rewards/margins": 2.57385417802137,
"rewards/rejected": -2.3568506533382863,
"step": 580
},
{
"epoch": 0.6177201936919251,
"grad_norm": 50.08977127075195,
"kl": 0.0,
"learning_rate": 1.9246136655151808e-07,
"logits/chosen": 391623968.0,
"logits/rejected": 371523136.0,
"logps/chosen": -284.78519864341087,
"logps/rejected": -299.40981791338584,
"loss": 2.7844,
"rewards/chosen": -0.06276658523914426,
"rewards/margins": 2.5907717236929426,
"rewards/rejected": -2.6535383089320868,
"step": 590
},
{
"epoch": 0.6281900274833137,
"grad_norm": 62.64336013793945,
"kl": 0.0,
"learning_rate": 1.8360411463223873e-07,
"logits/chosen": 372225920.0,
"logits/rejected": 384911008.0,
"logps/chosen": -274.0559916534181,
"logps/rejected": -288.66136232718895,
"loss": 2.8593,
"rewards/chosen": -0.07598057611947598,
"rewards/margins": 2.551059179424879,
"rewards/rejected": -2.627039755544355,
"step": 600
},
{
"epoch": 0.6386598612747023,
"grad_norm": 50.6363639831543,
"kl": 0.0,
"learning_rate": 1.7483566132460865e-07,
"logits/chosen": 373666784.0,
"logits/rejected": 393250304.0,
"logps/chosen": -285.63343057753167,
"logps/rejected": -270.8369984567901,
"loss": 2.8871,
"rewards/chosen": 0.03572451313839683,
"rewards/margins": 2.3185132018922547,
"rewards/rejected": -2.282788688753858,
"step": 610
},
{
"epoch": 0.6491296950660909,
"grad_norm": 70.63817596435547,
"kl": 0.0,
"learning_rate": 1.66167733657731e-07,
"logits/chosen": 388653408.0,
"logits/rejected": 387147584.0,
"logps/chosen": -286.9971341706539,
"logps/rejected": -280.6799866003063,
"loss": 2.9484,
"rewards/chosen": 0.25652475068063446,
"rewards/margins": 2.2528504903556916,
"rewards/rejected": -1.9963257396750573,
"step": 620
},
{
"epoch": 0.6595995288574794,
"grad_norm": 42.911075592041016,
"kl": 0.0,
"learning_rate": 1.5761192421657456e-07,
"logits/chosen": 380535040.0,
"logits/rejected": 384688384.0,
"logps/chosen": -277.87602336261983,
"logps/rejected": -287.9544629204893,
"loss": 2.7116,
"rewards/chosen": 0.6408637781112719,
"rewards/margins": 2.699830458515515,
"rewards/rejected": -2.058966680404243,
"step": 630
},
{
"epoch": 0.670069362648868,
"grad_norm": 33.01219177246094,
"kl": 0.0,
"learning_rate": 1.491796756379185e-07,
"logits/chosen": 426926528.0,
"logits/rejected": 395172800.0,
"logps/chosen": -296.3998833955224,
"logps/rejected": -276.0863729508197,
"loss": 2.8864,
"rewards/chosen": 0.3844701510756763,
"rewards/margins": 2.4492122425203484,
"rewards/rejected": -2.064742091444672,
"step": 640
},
{
"epoch": 0.6805391964402565,
"grad_norm": 37.57501220703125,
"kl": 0.0,
"learning_rate": 1.4088226530684071e-07,
"logits/chosen": 419599680.0,
"logits/rejected": 368290528.0,
"logps/chosen": -283.03209005376345,
"logps/rejected": -280.43193561208267,
"loss": 2.7923,
"rewards/chosen": 0.5528853690386185,
"rewards/margins": 2.5762015750079152,
"rewards/rejected": -2.0233162059692966,
"step": 650
},
{
"epoch": 0.6910090302316451,
"grad_norm": 73.64015197753906,
"kl": 0.0,
"learning_rate": 1.327307902742142e-07,
"logits/chosen": 411392192.0,
"logits/rejected": 383965600.0,
"logps/chosen": -270.74495192307694,
"logps/rejected": -289.49122023809525,
"loss": 2.7692,
"rewards/chosen": 0.3836714054987981,
"rewards/margins": 2.714577089712588,
"rewards/rejected": -2.3309056842137896,
"step": 660
},
{
"epoch": 0.7014788640230336,
"grad_norm": 80.35784912109375,
"kl": 0.0,
"learning_rate": 1.2473615241538523e-07,
"logits/chosen": 383171776.0,
"logits/rejected": 369880512.0,
"logps/chosen": -261.0426136363636,
"logps/rejected": -292.5834616174056,
"loss": 2.893,
"rewards/chosen": 0.42839020730486216,
"rewards/margins": 2.40669276047861,
"rewards/rejected": -1.978302553173748,
"step": 670
},
{
"epoch": 0.7119486978144222,
"grad_norm": 42.02663040161133,
"kl": 0.0,
"learning_rate": 1.169090438498816e-07,
"logits/chosen": 406482432.0,
"logits/rejected": 408727328.0,
"logps/chosen": -278.5440385367762,
"logps/rejected": -283.1681942277691,
"loss": 2.7501,
"rewards/chosen": 0.6435129467123925,
"rewards/margins": 2.670884500558921,
"rewards/rejected": -2.0273715538465287,
"step": 680
},
{
"epoch": 0.7224185316058107,
"grad_norm": 44.5306396484375,
"kl": 0.0,
"learning_rate": 1.0925993264165045e-07,
"logits/chosen": 379088128.0,
"logits/rejected": 389904960.0,
"logps/chosen": -274.40904552715654,
"logps/rejected": -286.7942708333333,
"loss": 2.8273,
"rewards/chosen": 0.4699281930161741,
"rewards/margins": 2.5310232645113,
"rewards/rejected": -2.061095071495126,
"step": 690
},
{
"epoch": 0.7328883653971994,
"grad_norm": 51.31837463378906,
"kl": 0.0,
"learning_rate": 1.0179904879894998e-07,
"logits/chosen": 404275392.0,
"logits/rejected": 392524608.0,
"logps/chosen": -271.8105407523511,
"logps/rejected": -288.45069119937693,
"loss": 2.8177,
"rewards/chosen": 0.28736071452078027,
"rewards/margins": 2.677813256929756,
"rewards/rejected": -2.3904525424089758,
"step": 700
},
{
"epoch": 0.7433581991885879,
"grad_norm": 65.66101837158203,
"kl": 0.0,
"learning_rate": 9.453637059262117e-08,
"logits/chosen": 381676384.0,
"logits/rejected": 391855936.0,
"logps/chosen": -266.3333492366412,
"logps/rejected": -267.5372,
"loss": 2.9462,
"rewards/chosen": 0.19959532759571805,
"rewards/margins": 2.291592788533218,
"rewards/rejected": -2.0919974609375,
"step": 710
},
{
"epoch": 0.7538280329799765,
"grad_norm": 87.61113739013672,
"kl": 0.0,
"learning_rate": 8.748161121103406e-08,
"logits/chosen": 391284128.0,
"logits/rejected": 399996864.0,
"logps/chosen": -276.3944143700787,
"logps/rejected": -298.0451792635659,
"loss": 2.737,
"rewards/chosen": 0.5421728900098425,
"rewards/margins": 2.7657016115456954,
"rewards/rejected": -2.223528721535853,
"step": 720
},
{
"epoch": 0.764297866771365,
"grad_norm": 83.69277954101562,
"kl": 0.0,
"learning_rate": 8.064420576955965e-08,
"logits/chosen": 411759936.0,
"logits/rejected": 421010976.0,
"logps/chosen": -281.4224365234375,
"logps/rejected": -293.0370361328125,
"loss": 2.8698,
"rewards/chosen": 0.0782856285572052,
"rewards/margins": 2.5774748146533963,
"rewards/rejected": -2.4991891860961912,
"step": 730
},
{
"epoch": 0.7747677005627536,
"grad_norm": 43.22333526611328,
"kl": 0.0,
"learning_rate": 7.403329869193922e-08,
"logits/chosen": 400044256.0,
"logits/rejected": 360019264.0,
"logps/chosen": -269.0556355606759,
"logps/rejected": -272.2297794117647,
"loss": 2.5935,
"rewards/chosen": 0.15169298960133448,
"rewards/margins": 3.1453841474411597,
"rewards/rejected": -2.9936911578398253,
"step": 740
},
{
"epoch": 0.7852375343541421,
"grad_norm": 55.45348358154297,
"kl": 0.0,
"learning_rate": 6.765773148042858e-08,
"logits/chosen": 402389952.0,
"logits/rejected": 381027904.0,
"logps/chosen": -278.2174539170507,
"logps/rejected": -275.59782392686805,
"loss": 2.9414,
"rewards/chosen": 0.10164003621231758,
"rewards/margins": 2.3010800265243208,
"rewards/rejected": -2.199439990312003,
"step": 750
},
{
"epoch": 0.7957073681455307,
"grad_norm": 88.17606353759766,
"kl": 0.0,
"learning_rate": 6.152603089107139e-08,
"logits/chosen": 405889216.0,
"logits/rejected": 379471808.0,
"logps/chosen": -268.80648306697105,
"logps/rejected": -274.56631219903693,
"loss": 2.9234,
"rewards/chosen": 0.23258001365255185,
"rewards/margins": 2.3599755700580496,
"rewards/rejected": -2.1273955564054976,
"step": 760
},
{
"epoch": 0.8061772019369192,
"grad_norm": 76.30126190185547,
"kl": 0.0,
"learning_rate": 5.5646397529920175e-08,
"logits/chosen": 395753920.0,
"logits/rejected": 400388992.0,
"logps/chosen": -295.6583118044515,
"logps/rejected": -280.01015264976957,
"loss": 2.6817,
"rewards/chosen": 0.3095470483049111,
"rewards/margins": 2.8186074406700223,
"rewards/rejected": -2.5090603923651114,
"step": 770
},
{
"epoch": 0.8166470357283078,
"grad_norm": 82.81681823730469,
"kl": 0.0,
"learning_rate": 5.002669488545111e-08,
"logits/chosen": 367751136.0,
"logits/rejected": 401200928.0,
"logps/chosen": -271.7482040229885,
"logps/rejected": -296.7671153129657,
"loss": 2.8095,
"rewards/chosen": 0.1301105543114673,
"rewards/margins": 2.4850469977028604,
"rewards/rejected": -2.3549364433913933,
"step": 780
},
{
"epoch": 0.8271168695196964,
"grad_norm": 62.69572448730469,
"kl": 0.0,
"learning_rate": 4.467443881184646e-08,
"logits/chosen": 372966144.0,
"logits/rejected": 386677760.0,
"logps/chosen": -278.3856132075472,
"logps/rejected": -270.80277076863354,
"loss": 2.9023,
"rewards/chosen": 0.03588581685000246,
"rewards/margins": 2.3716193608620366,
"rewards/rejected": -2.3357335440120344,
"step": 790
},
{
"epoch": 0.837586703311085,
"grad_norm": 43.35691833496094,
"kl": 0.0,
"learning_rate": 3.959678747720488e-08,
"logits/chosen": 410616064.0,
"logits/rejected": 374841760.0,
"logps/chosen": -270.33201388888887,
"logps/rejected": -281.9245867768595,
"loss": 2.8421,
"rewards/chosen": 0.23464515968605323,
"rewards/margins": 2.7391692267056813,
"rewards/rejected": -2.504524067019628,
"step": 800
},
{
"epoch": 0.8480565371024735,
"grad_norm": 44.70280838012695,
"kl": 0.0,
"learning_rate": 3.480053179012654e-08,
"logits/chosen": 351436864.0,
"logits/rejected": 401837312.0,
"logps/chosen": -260.5194256756757,
"logps/rejected": -283.58179723502303,
"loss": 3.0422,
"rewards/chosen": -0.020509217994580775,
"rewards/margins": 2.058081561815327,
"rewards/rejected": -2.078590779809908,
"step": 810
},
{
"epoch": 0.8585263708938621,
"grad_norm": 96.47203826904297,
"kl": 0.0,
"learning_rate": 3.029208631747446e-08,
"logits/chosen": 404733696.0,
"logits/rejected": 377852096.0,
"logps/chosen": -264.6643500766871,
"logps/rejected": -281.85546875,
"loss": 2.7119,
"rewards/chosen": 0.3689906582510544,
"rewards/margins": 2.8578583511376983,
"rewards/rejected": -2.488867692886644,
"step": 820
},
{
"epoch": 0.8689962046852506,
"grad_norm": 56.39802169799805,
"kl": 0.0,
"learning_rate": 2.607748070546037e-08,
"logits/chosen": 405348512.0,
"logits/rejected": 421100256.0,
"logps/chosen": -267.34557373817034,
"logps/rejected": -290.90634674922603,
"loss": 2.8455,
"rewards/chosen": 0.21449558968047613,
"rewards/margins": 2.5988345354767226,
"rewards/rejected": -2.3843389457962463,
"step": 830
},
{
"epoch": 0.8794660384766392,
"grad_norm": 53.03834533691406,
"kl": 0.0,
"learning_rate": 2.2162351615526544e-08,
"logits/chosen": 399964032.0,
"logits/rejected": 412186112.0,
"logps/chosen": -291.91339285714287,
"logps/rejected": -283.60141826923075,
"loss": 2.8146,
"rewards/chosen": 0.25672137548053076,
"rewards/margins": 2.538224906129569,
"rewards/rejected": -2.2815035306490383,
"step": 840
},
{
"epoch": 0.8899358722680277,
"grad_norm": 44.19123077392578,
"kl": 0.0,
"learning_rate": 1.8551935185811717e-08,
"logits/chosen": 369389504.0,
"logits/rejected": 379160128.0,
"logps/chosen": -273.960441468254,
"logps/rejected": -294.90163461538464,
"loss": 2.7471,
"rewards/chosen": 0.26350000775049603,
"rewards/margins": 2.7092262322096303,
"rewards/rejected": -2.4457262244591345,
"step": 850
},
{
"epoch": 0.9004057060594163,
"grad_norm": 69.50191497802734,
"kl": 0.0,
"learning_rate": 1.5251060028279612e-08,
"logits/chosen": 406441888.0,
"logits/rejected": 384275776.0,
"logps/chosen": -261.94189528593506,
"logps/rejected": -298.96228278041076,
"loss": 2.88,
"rewards/chosen": 0.2605755435996667,
"rewards/margins": 2.450452539921744,
"rewards/rejected": -2.189876996322077,
"step": 860
},
{
"epoch": 0.9108755398508048,
"grad_norm": 49.09358215332031,
"kl": 0.0,
"learning_rate": 1.2264140770878839e-08,
"logits/chosen": 381910016.0,
"logits/rejected": 408627904.0,
"logps/chosen": -288.8589045166403,
"logps/rejected": -287.52084938366716,
"loss": 2.86,
"rewards/chosen": 0.2764157931513718,
"rewards/margins": 2.49960226843787,
"rewards/rejected": -2.2231864752864983,
"step": 870
},
{
"epoch": 0.9213453736421934,
"grad_norm": 94.33980560302734,
"kl": 0.0,
"learning_rate": 9.59517215336922e-09,
"logits/chosen": 337365408.0,
"logits/rejected": 363262144.0,
"logps/chosen": -271.76117468701096,
"logps/rejected": -282.8595700078003,
"loss": 2.8254,
"rewards/chosen": 0.10245320494745819,
"rewards/margins": 2.6755982694219123,
"rewards/rejected": -2.573145064474454,
"step": 880
},
{
"epoch": 0.931815207433582,
"grad_norm": 67.45891571044922,
"kl": 0.0,
"learning_rate": 7.247723684711382e-09,
"logits/chosen": 388323680.0,
"logits/rejected": 380559360.0,
"logps/chosen": -261.3919588414634,
"logps/rejected": -287.53240184294873,
"loss": 2.7528,
"rewards/chosen": 0.4676312702458079,
"rewards/margins": 2.706891625877318,
"rewards/rejected": -2.2392603556315103,
"step": 890
},
{
"epoch": 0.9422850412249706,
"grad_norm": 61.053680419921875,
"kl": 0.0,
"learning_rate": 5.224934869164976e-09,
"logits/chosen": 389374336.0,
"logits/rejected": 416766144.0,
"logps/chosen": -281.80756179092384,
"logps/rejected": -292.0082249245852,
"loss": 2.9554,
"rewards/chosen": 0.13213771282177497,
"rewards/margins": 2.3010161904447957,
"rewards/rejected": -2.1688784776230206,
"step": 900
},
{
"epoch": 0.9527548750163591,
"grad_norm": 57.665740966796875,
"kl": 0.0,
"learning_rate": 3.529511007479946e-09,
"logits/chosen": 392336480.0,
"logits/rejected": 398449632.0,
"logps/chosen": -280.89854550691246,
"logps/rejected": -273.7118441971383,
"loss": 2.8584,
"rewards/chosen": 0.3160471879575293,
"rewards/margins": 2.478805146398507,
"rewards/rejected": -2.1627579584409777,
"step": 910
},
{
"epoch": 0.9632247088077477,
"grad_norm": 62.919960021972656,
"kl": 0.0,
"learning_rate": 2.1637195787966857e-09,
"logits/chosen": 370773184.0,
"logits/rejected": 438506944.0,
"logps/chosen": -283.6101524879615,
"logps/rejected": -277.2926179604262,
"loss": 2.7438,
"rewards/chosen": 0.5020495272371589,
"rewards/margins": 2.5911041864956252,
"rewards/rejected": -2.0890546592584665,
"step": 920
},
{
"epoch": 0.9736945425991362,
"grad_norm": 56.47111129760742,
"kl": 0.0,
"learning_rate": 1.1293872080934963e-09,
"logits/chosen": 367021120.0,
"logits/rejected": 405562304.0,
"logps/chosen": -274.2324472402597,
"logps/rejected": -289.800828313253,
"loss": 2.7894,
"rewards/chosen": 0.2850929359336952,
"rewards/margins": 2.6591384343335447,
"rewards/rejected": -2.3740454983998496,
"step": 930
},
{
"epoch": 0.9841643763905248,
"grad_norm": 55.910579681396484,
"kl": 0.0,
"learning_rate": 4.2789722323760546e-10,
"logits/chosen": 390189216.0,
"logits/rejected": 378433184.0,
"logps/chosen": -277.966340755988,
"logps/rejected": -284.6381229575163,
"loss": 2.7211,
"rewards/chosen": 0.5247520857942318,
"rewards/margins": 2.884224622367455,
"rewards/rejected": -2.359472536573223,
"step": 940
},
{
"epoch": 0.9946342101819133,
"grad_norm": 105.30035400390625,
"kl": 0.0,
"learning_rate": 6.018780490690822e-11,
"logits/chosen": 404358912.0,
"logits/rejected": 365349088.0,
"logps/chosen": -274.1581202651515,
"logps/rejected": -274.12162298387096,
"loss": 2.7314,
"rewards/chosen": 0.3820543924967448,
"rewards/margins": 2.859391448318317,
"rewards/rejected": -2.4773370558215726,
"step": 950
},
{
"epoch": 0.9998691270776077,
"step": 955,
"total_flos": 0.0,
"train_loss": 3.070508968892522,
"train_runtime": 9873.9747,
"train_samples_per_second": 12.383,
"train_steps_per_second": 0.097
}
],
"logging_steps": 10,
"max_steps": 955,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": false,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}