{ "best_global_step": 3600, "best_metric": 0.6341557778664263, "best_model_checkpoint": "./experiments/modernbert-large-router-lr5e-6-ep5-20250808-213234/checkpoint-3600", "epoch": 2.719033232628399, "eval_steps": 100, "global_step": 3600, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0007552870090634441, "grad_norm": 26.948183059692383, "learning_rate": 0.0, "loss": 1.3654, "step": 1 }, { "epoch": 0.0188821752265861, "grad_norm": 13.511099815368652, "learning_rate": 2.4000000000000003e-07, "loss": 1.686, "step": 25 }, { "epoch": 0.0377643504531722, "grad_norm": 11.786803245544434, "learning_rate": 4.900000000000001e-07, "loss": 1.508, "step": 50 }, { "epoch": 0.05664652567975831, "grad_norm": 12.238818168640137, "learning_rate": 7.4e-07, "loss": 1.4226, "step": 75 }, { "epoch": 0.0755287009063444, "grad_norm": 9.133111953735352, "learning_rate": 9.9e-07, "loss": 1.4262, "step": 100 }, { "epoch": 0.0755287009063444, "eval_accuracy": 0.5558073654390935, "eval_f1": 0.5538780809735232, "eval_loss": 0.6949775218963623, "eval_precision": 0.5525289134150683, "eval_recall": 0.5558073654390934, "eval_runtime": 26.307, "eval_samples_per_second": 201.277, "eval_steps_per_second": 12.582, "step": 100 }, { "epoch": 0.09441087613293052, "grad_norm": 7.815569877624512, "learning_rate": 1.2400000000000002e-06, "loss": 1.3694, "step": 125 }, { "epoch": 0.11329305135951662, "grad_norm": 18.00971794128418, "learning_rate": 1.4900000000000001e-06, "loss": 1.3346, "step": 150 }, { "epoch": 0.13217522658610273, "grad_norm": 8.447665214538574, "learning_rate": 1.74e-06, "loss": 1.3443, "step": 175 }, { "epoch": 0.1510574018126888, "grad_norm": 9.353869438171387, "learning_rate": 1.9900000000000004e-06, "loss": 1.3471, "step": 200 }, { "epoch": 0.1510574018126888, "eval_accuracy": 0.5933899905571294, "eval_f1": 0.5870828666987644, "eval_loss": 0.6730061173439026, "eval_precision": 0.5858765908974611, "eval_recall": 0.5933899905571294, "eval_runtime": 25.7751, "eval_samples_per_second": 205.431, "eval_steps_per_second": 12.842, "step": 200 }, { "epoch": 0.16993957703927492, "grad_norm": 6.845251560211182, "learning_rate": 2.24e-06, "loss": 1.3692, "step": 225 }, { "epoch": 0.18882175226586104, "grad_norm": 14.863338470458984, "learning_rate": 2.4900000000000003e-06, "loss": 1.3566, "step": 250 }, { "epoch": 0.20770392749244712, "grad_norm": 10.733919143676758, "learning_rate": 2.7400000000000004e-06, "loss": 1.3426, "step": 275 }, { "epoch": 0.22658610271903323, "grad_norm": 8.589818000793457, "learning_rate": 2.99e-06, "loss": 1.3253, "step": 300 }, { "epoch": 0.22658610271903323, "eval_accuracy": 0.6073654390934844, "eval_f1": 0.5758152044311772, "eval_loss": 0.6623404622077942, "eval_precision": 0.5958916118010293, "eval_recall": 0.6073654390934844, "eval_runtime": 25.6943, "eval_samples_per_second": 206.077, "eval_steps_per_second": 12.882, "step": 300 }, { "epoch": 0.24546827794561935, "grad_norm": 7.530769348144531, "learning_rate": 3.2400000000000003e-06, "loss": 1.3273, "step": 325 }, { "epoch": 0.26435045317220546, "grad_norm": 16.52275276184082, "learning_rate": 3.49e-06, "loss": 1.33, "step": 350 }, { "epoch": 0.28323262839879154, "grad_norm": 9.330696105957031, "learning_rate": 3.74e-06, "loss": 1.3396, "step": 375 }, { "epoch": 0.3021148036253776, "grad_norm": 4.76742696762085, "learning_rate": 3.990000000000001e-06, "loss": 1.359, "step": 400 }, { "epoch": 0.3021148036253776, "eval_accuracy": 0.6239848914069878, "eval_f1": 0.5901741272637462, "eval_loss": 0.6522805094718933, "eval_precision": 0.6190840821922633, "eval_recall": 0.6239848914069878, "eval_runtime": 27.5423, "eval_samples_per_second": 192.25, "eval_steps_per_second": 12.018, "step": 400 }, { "epoch": 0.32099697885196377, "grad_norm": 7.44769811630249, "learning_rate": 4.24e-06, "loss": 1.3093, "step": 425 }, { "epoch": 0.33987915407854985, "grad_norm": 8.336981773376465, "learning_rate": 4.49e-06, "loss": 1.2871, "step": 450 }, { "epoch": 0.35876132930513593, "grad_norm": 4.4486918449401855, "learning_rate": 4.74e-06, "loss": 1.2957, "step": 475 }, { "epoch": 0.3776435045317221, "grad_norm": 5.152225017547607, "learning_rate": 4.9900000000000005e-06, "loss": 1.2706, "step": 500 }, { "epoch": 0.3776435045317221, "eval_accuracy": 0.6251180358829084, "eval_f1": 0.5859680282877181, "eval_loss": 0.654725193977356, "eval_precision": 0.6233075274864223, "eval_recall": 0.6251180358829084, "eval_runtime": 26.3536, "eval_samples_per_second": 200.921, "eval_steps_per_second": 12.56, "step": 500 }, { "epoch": 0.39652567975830816, "grad_norm": 5.1736931800842285, "learning_rate": 4.980392156862746e-06, "loss": 1.3144, "step": 525 }, { "epoch": 0.41540785498489424, "grad_norm": 8.337306022644043, "learning_rate": 4.959967320261438e-06, "loss": 1.3004, "step": 550 }, { "epoch": 0.4342900302114804, "grad_norm": 21.556997299194336, "learning_rate": 4.939542483660132e-06, "loss": 1.281, "step": 575 }, { "epoch": 0.45317220543806647, "grad_norm": 10.470200538635254, "learning_rate": 4.919117647058823e-06, "loss": 1.3114, "step": 600 }, { "epoch": 0.45317220543806647, "eval_accuracy": 0.6168083097261567, "eval_f1": 0.5444872481570541, "eval_loss": 0.6602128148078918, "eval_precision": 0.6358703772903485, "eval_recall": 0.6168083097261567, "eval_runtime": 26.4011, "eval_samples_per_second": 200.56, "eval_steps_per_second": 12.537, "step": 600 }, { "epoch": 0.47205438066465255, "grad_norm": 7.532138824462891, "learning_rate": 4.8986928104575166e-06, "loss": 1.2788, "step": 625 }, { "epoch": 0.4909365558912387, "grad_norm": 8.277374267578125, "learning_rate": 4.87826797385621e-06, "loss": 1.283, "step": 650 }, { "epoch": 0.5098187311178247, "grad_norm": 4.102471828460693, "learning_rate": 4.857843137254902e-06, "loss": 1.2815, "step": 675 }, { "epoch": 0.5287009063444109, "grad_norm": 9.688183784484863, "learning_rate": 4.8374183006535956e-06, "loss": 1.3075, "step": 700 }, { "epoch": 0.5287009063444109, "eval_accuracy": 0.6356940509915014, "eval_f1": 0.6084915332524169, "eval_loss": 0.6435697078704834, "eval_precision": 0.6320921608809188, "eval_recall": 0.6356940509915014, "eval_runtime": 28.2231, "eval_samples_per_second": 187.612, "eval_steps_per_second": 11.728, "step": 700 }, { "epoch": 0.547583081570997, "grad_norm": 11.222074508666992, "learning_rate": 4.816993464052288e-06, "loss": 1.2944, "step": 725 }, { "epoch": 0.5664652567975831, "grad_norm": 5.912996768951416, "learning_rate": 4.796568627450981e-06, "loss": 1.3052, "step": 750 }, { "epoch": 0.5853474320241692, "grad_norm": 6.690607070922852, "learning_rate": 4.776143790849674e-06, "loss": 1.2849, "step": 775 }, { "epoch": 0.6042296072507553, "grad_norm": 3.7729241847991943, "learning_rate": 4.755718954248366e-06, "loss": 1.2988, "step": 800 }, { "epoch": 0.6042296072507553, "eval_accuracy": 0.6326723323890463, "eval_f1": 0.5875834641292582, "eval_loss": 0.6444017887115479, "eval_precision": 0.6395765540326241, "eval_recall": 0.6326723323890463, "eval_runtime": 26.5576, "eval_samples_per_second": 199.378, "eval_steps_per_second": 12.463, "step": 800 }, { "epoch": 0.6231117824773413, "grad_norm": 4.947546005249023, "learning_rate": 4.7352941176470594e-06, "loss": 1.2908, "step": 825 }, { "epoch": 0.6419939577039275, "grad_norm": 6.54949951171875, "learning_rate": 4.714869281045752e-06, "loss": 1.3008, "step": 850 }, { "epoch": 0.6608761329305136, "grad_norm": 5.186257362365723, "learning_rate": 4.694444444444445e-06, "loss": 1.3012, "step": 875 }, { "epoch": 0.6797583081570997, "grad_norm": 4.848501682281494, "learning_rate": 4.674019607843138e-06, "loss": 1.3748, "step": 900 }, { "epoch": 0.6797583081570997, "eval_accuracy": 0.6196411709159585, "eval_f1": 0.5413471089456644, "eval_loss": 0.6539095044136047, "eval_precision": 0.6522323982900737, "eval_recall": 0.6196411709159585, "eval_runtime": 26.3133, "eval_samples_per_second": 201.229, "eval_steps_per_second": 12.579, "step": 900 }, { "epoch": 0.6986404833836858, "grad_norm": 8.589735984802246, "learning_rate": 4.653594771241831e-06, "loss": 1.3267, "step": 925 }, { "epoch": 0.7175226586102719, "grad_norm": 7.5751848220825195, "learning_rate": 4.633169934640523e-06, "loss": 1.2539, "step": 950 }, { "epoch": 0.736404833836858, "grad_norm": 4.0868120193481445, "learning_rate": 4.612745098039217e-06, "loss": 1.312, "step": 975 }, { "epoch": 0.7552870090634441, "grad_norm": 5.95460844039917, "learning_rate": 4.592320261437909e-06, "loss": 1.2903, "step": 1000 }, { "epoch": 0.7552870090634441, "eval_accuracy": 0.6385269121813031, "eval_f1": 0.6173864182737019, "eval_loss": 0.6376426815986633, "eval_precision": 0.6332296117395951, "eval_recall": 0.6385269121813031, "eval_runtime": 28.415, "eval_samples_per_second": 186.345, "eval_steps_per_second": 11.649, "step": 1000 }, { "epoch": 0.7741691842900302, "grad_norm": 6.253991603851318, "learning_rate": 4.5718954248366015e-06, "loss": 1.3063, "step": 1025 }, { "epoch": 0.7930513595166163, "grad_norm": 3.0682971477508545, "learning_rate": 4.551470588235295e-06, "loss": 1.2785, "step": 1050 }, { "epoch": 0.8119335347432024, "grad_norm": 4.491682052612305, "learning_rate": 4.531045751633987e-06, "loss": 1.276, "step": 1075 }, { "epoch": 0.8308157099697885, "grad_norm": 7.531124114990234, "learning_rate": 4.5106209150326805e-06, "loss": 1.2757, "step": 1100 }, { "epoch": 0.8308157099697885, "eval_accuracy": 0.6417374881964117, "eval_f1": 0.6312473050221801, "eval_loss": 0.6380065679550171, "eval_precision": 0.6351146396632452, "eval_recall": 0.6417374881964117, "eval_runtime": 25.9777, "eval_samples_per_second": 203.828, "eval_steps_per_second": 12.742, "step": 1100 }, { "epoch": 0.8496978851963746, "grad_norm": 7.8424201011657715, "learning_rate": 4.490196078431373e-06, "loss": 1.2807, "step": 1125 }, { "epoch": 0.8685800604229608, "grad_norm": 8.517139434814453, "learning_rate": 4.469771241830066e-06, "loss": 1.2705, "step": 1150 }, { "epoch": 0.8874622356495468, "grad_norm": 5.245467185974121, "learning_rate": 4.449346405228759e-06, "loss": 1.2839, "step": 1175 }, { "epoch": 0.9063444108761329, "grad_norm": 6.94294548034668, "learning_rate": 4.428921568627451e-06, "loss": 1.2711, "step": 1200 }, { "epoch": 0.9063444108761329, "eval_accuracy": 0.6321057601510859, "eval_f1": 0.5846932538581225, "eval_loss": 0.6422750949859619, "eval_precision": 0.6407048384547473, "eval_recall": 0.6321057601510859, "eval_runtime": 25.7628, "eval_samples_per_second": 205.529, "eval_steps_per_second": 12.848, "step": 1200 }, { "epoch": 0.925226586102719, "grad_norm": 3.8326165676116943, "learning_rate": 4.408496732026144e-06, "loss": 1.2671, "step": 1225 }, { "epoch": 0.9441087613293051, "grad_norm": 4.557371139526367, "learning_rate": 4.388071895424837e-06, "loss": 1.3158, "step": 1250 }, { "epoch": 0.9629909365558912, "grad_norm": 3.9651763439178467, "learning_rate": 4.36764705882353e-06, "loss": 1.2823, "step": 1275 }, { "epoch": 0.9818731117824774, "grad_norm": 3.4279274940490723, "learning_rate": 4.3472222222222225e-06, "loss": 1.3348, "step": 1300 }, { "epoch": 0.9818731117824774, "eval_accuracy": 0.6245514636449481, "eval_f1": 0.6260536519033915, "eval_loss": 0.6523462533950806, "eval_precision": 0.6287153689730779, "eval_recall": 0.6245514636449481, "eval_runtime": 27.6559, "eval_samples_per_second": 191.46, "eval_steps_per_second": 11.969, "step": 1300 }, { "epoch": 1.0007552870090635, "grad_norm": 6.088149547576904, "learning_rate": 4.326797385620916e-06, "loss": 1.3225, "step": 1325 }, { "epoch": 1.0196374622356494, "grad_norm": 10.229233741760254, "learning_rate": 4.306372549019608e-06, "loss": 1.243, "step": 1350 }, { "epoch": 1.0385196374622356, "grad_norm": 3.2610249519348145, "learning_rate": 4.285947712418301e-06, "loss": 1.2981, "step": 1375 }, { "epoch": 1.0574018126888218, "grad_norm": 11.988770484924316, "learning_rate": 4.265522875816994e-06, "loss": 1.2404, "step": 1400 }, { "epoch": 1.0574018126888218, "eval_accuracy": 0.624929178470255, "eval_f1": 0.6264983238137061, "eval_loss": 0.6569391489028931, "eval_precision": 0.6293753800764041, "eval_recall": 0.624929178470255, "eval_runtime": 26.1047, "eval_samples_per_second": 202.837, "eval_steps_per_second": 12.68, "step": 1400 }, { "epoch": 1.0762839879154078, "grad_norm": 3.8238422870635986, "learning_rate": 4.245098039215686e-06, "loss": 1.2335, "step": 1425 }, { "epoch": 1.095166163141994, "grad_norm": 8.899502754211426, "learning_rate": 4.22467320261438e-06, "loss": 1.2353, "step": 1450 }, { "epoch": 1.11404833836858, "grad_norm": 7.564877510070801, "learning_rate": 4.204248366013072e-06, "loss": 1.2154, "step": 1475 }, { "epoch": 1.1329305135951662, "grad_norm": 4.982959270477295, "learning_rate": 4.183823529411765e-06, "loss": 1.2499, "step": 1500 }, { "epoch": 1.1329305135951662, "eval_accuracy": 0.6396600566572238, "eval_f1": 0.6198342963492217, "eval_loss": 0.6338247656822205, "eval_precision": 0.6341757111657282, "eval_recall": 0.6396600566572238, "eval_runtime": 26.367, "eval_samples_per_second": 200.819, "eval_steps_per_second": 12.554, "step": 1500 }, { "epoch": 1.1518126888217524, "grad_norm": 6.588780879974365, "learning_rate": 4.163398692810458e-06, "loss": 1.2348, "step": 1525 }, { "epoch": 1.1706948640483383, "grad_norm": 46.35456848144531, "learning_rate": 4.142973856209151e-06, "loss": 1.2517, "step": 1550 }, { "epoch": 1.1895770392749245, "grad_norm": 4.0942277908325195, "learning_rate": 4.1225490196078435e-06, "loss": 1.226, "step": 1575 }, { "epoch": 1.2084592145015105, "grad_norm": 30.18272590637207, "learning_rate": 4.102124183006536e-06, "loss": 1.2077, "step": 1600 }, { "epoch": 1.2084592145015105, "eval_accuracy": 0.6381491973559962, "eval_f1": 0.6242245896900378, "eval_loss": 0.6355974674224854, "eval_precision": 0.6312162931573174, "eval_recall": 0.6381491973559962, "eval_runtime": 26.2286, "eval_samples_per_second": 201.879, "eval_steps_per_second": 12.62, "step": 1600 }, { "epoch": 1.2273413897280967, "grad_norm": 5.6306843757629395, "learning_rate": 4.081699346405229e-06, "loss": 1.2495, "step": 1625 }, { "epoch": 1.2462235649546827, "grad_norm": 7.549539566040039, "learning_rate": 4.061274509803922e-06, "loss": 1.2438, "step": 1650 }, { "epoch": 1.2651057401812689, "grad_norm": 7.462466716766357, "learning_rate": 4.040849673202615e-06, "loss": 1.264, "step": 1675 }, { "epoch": 1.283987915407855, "grad_norm": 4.440084934234619, "learning_rate": 4.020424836601307e-06, "loss": 1.2455, "step": 1700 }, { "epoch": 1.283987915407855, "eval_accuracy": 0.6379603399433428, "eval_f1": 0.6099089285109587, "eval_loss": 0.6329221725463867, "eval_precision": 0.6355277706702459, "eval_recall": 0.6379603399433428, "eval_runtime": 27.9156, "eval_samples_per_second": 189.679, "eval_steps_per_second": 11.857, "step": 1700 }, { "epoch": 1.302870090634441, "grad_norm": 12.334700584411621, "learning_rate": 4.000000000000001e-06, "loss": 1.2148, "step": 1725 }, { "epoch": 1.3217522658610272, "grad_norm": 12.755899429321289, "learning_rate": 3.979575163398693e-06, "loss": 1.185, "step": 1750 }, { "epoch": 1.3406344410876132, "grad_norm": 4.876974582672119, "learning_rate": 3.9591503267973855e-06, "loss": 1.1808, "step": 1775 }, { "epoch": 1.3595166163141994, "grad_norm": 7.091792106628418, "learning_rate": 3.938725490196079e-06, "loss": 1.243, "step": 1800 }, { "epoch": 1.3595166163141994, "eval_accuracy": 0.6383380547686497, "eval_f1": 0.6127733372599106, "eval_loss": 0.6369228959083557, "eval_precision": 0.6347855200764598, "eval_recall": 0.6383380547686497, "eval_runtime": 25.6226, "eval_samples_per_second": 206.654, "eval_steps_per_second": 12.918, "step": 1800 }, { "epoch": 1.3783987915407856, "grad_norm": 20.21983528137207, "learning_rate": 3.918300653594771e-06, "loss": 1.2483, "step": 1825 }, { "epoch": 1.3972809667673716, "grad_norm": 10.870339393615723, "learning_rate": 3.8978758169934645e-06, "loss": 1.2401, "step": 1850 }, { "epoch": 1.4161631419939578, "grad_norm": 5.997837543487549, "learning_rate": 3.877450980392157e-06, "loss": 1.2504, "step": 1875 }, { "epoch": 1.4350453172205437, "grad_norm": 17.45680046081543, "learning_rate": 3.85702614379085e-06, "loss": 1.2222, "step": 1900 }, { "epoch": 1.4350453172205437, "eval_accuracy": 0.6368271954674221, "eval_f1": 0.5909856645024059, "eval_loss": 0.6384395956993103, "eval_precision": 0.647404076427884, "eval_recall": 0.6368271954674221, "eval_runtime": 25.6817, "eval_samples_per_second": 206.178, "eval_steps_per_second": 12.889, "step": 1900 }, { "epoch": 1.45392749244713, "grad_norm": 10.445354461669922, "learning_rate": 3.836601307189543e-06, "loss": 1.2701, "step": 1925 }, { "epoch": 1.4728096676737161, "grad_norm": 4.692181587219238, "learning_rate": 3.816176470588235e-06, "loss": 1.2394, "step": 1950 }, { "epoch": 1.491691842900302, "grad_norm": 10.470508575439453, "learning_rate": 3.7957516339869284e-06, "loss": 1.1962, "step": 1975 }, { "epoch": 1.510574018126888, "grad_norm": 7.276846885681152, "learning_rate": 3.7753267973856213e-06, "loss": 1.2455, "step": 2000 }, { "epoch": 1.510574018126888, "eval_accuracy": 0.6445703493862134, "eval_f1": 0.6293429417019504, "eval_loss": 0.636458694934845, "eval_precision": 0.6387100201588051, "eval_recall": 0.6445703493862134, "eval_runtime": 27.9815, "eval_samples_per_second": 189.232, "eval_steps_per_second": 11.829, "step": 2000 }, { "epoch": 1.5294561933534743, "grad_norm": 10.635672569274902, "learning_rate": 3.754901960784314e-06, "loss": 1.2269, "step": 2025 }, { "epoch": 1.5483383685800605, "grad_norm": 11.313166618347168, "learning_rate": 3.734477124183007e-06, "loss": 1.251, "step": 2050 }, { "epoch": 1.5672205438066467, "grad_norm": 6.484985828399658, "learning_rate": 3.7140522875817e-06, "loss": 1.2621, "step": 2075 }, { "epoch": 1.5861027190332326, "grad_norm": 4.878018379211426, "learning_rate": 3.6936274509803927e-06, "loss": 1.2292, "step": 2100 }, { "epoch": 1.5861027190332326, "eval_accuracy": 0.6449480642115203, "eval_f1": 0.6179400117774106, "eval_loss": 0.6318739652633667, "eval_precision": 0.6442848843529498, "eval_recall": 0.6449480642115203, "eval_runtime": 26.4812, "eval_samples_per_second": 199.953, "eval_steps_per_second": 12.499, "step": 2100 }, { "epoch": 1.6049848942598186, "grad_norm": 14.128438949584961, "learning_rate": 3.6732026143790856e-06, "loss": 1.2229, "step": 2125 }, { "epoch": 1.6238670694864048, "grad_norm": 8.369355201721191, "learning_rate": 3.652777777777778e-06, "loss": 1.2459, "step": 2150 }, { "epoch": 1.642749244712991, "grad_norm": 6.0107808113098145, "learning_rate": 3.632352941176471e-06, "loss": 1.2377, "step": 2175 }, { "epoch": 1.6616314199395772, "grad_norm": 24.867504119873047, "learning_rate": 3.6119281045751637e-06, "loss": 1.2272, "step": 2200 }, { "epoch": 1.6616314199395772, "eval_accuracy": 0.6237960339943343, "eval_f1": 0.5542731710957122, "eval_loss": 0.6526551842689514, "eval_precision": 0.6494505292663029, "eval_recall": 0.6237960339943343, "eval_runtime": 26.5153, "eval_samples_per_second": 199.696, "eval_steps_per_second": 12.483, "step": 2200 }, { "epoch": 1.6805135951661632, "grad_norm": 9.593733787536621, "learning_rate": 3.5915032679738566e-06, "loss": 1.2012, "step": 2225 }, { "epoch": 1.6993957703927491, "grad_norm": 6.158414840698242, "learning_rate": 3.5710784313725494e-06, "loss": 1.2514, "step": 2250 }, { "epoch": 1.7182779456193353, "grad_norm": 7.738510608673096, "learning_rate": 3.5506535947712423e-06, "loss": 1.2585, "step": 2275 }, { "epoch": 1.7371601208459215, "grad_norm": 6.2952423095703125, "learning_rate": 3.530228758169935e-06, "loss": 1.2085, "step": 2300 }, { "epoch": 1.7371601208459215, "eval_accuracy": 0.6474032105760151, "eval_f1": 0.6281159209295336, "eval_loss": 0.630427360534668, "eval_precision": 0.6433494506393627, "eval_recall": 0.6474032105760151, "eval_runtime": 28.1713, "eval_samples_per_second": 187.957, "eval_steps_per_second": 11.75, "step": 2300 }, { "epoch": 1.7560422960725075, "grad_norm": 4.894021987915039, "learning_rate": 3.5098039215686276e-06, "loss": 1.2198, "step": 2325 }, { "epoch": 1.7749244712990937, "grad_norm": 10.691727638244629, "learning_rate": 3.4893790849673205e-06, "loss": 1.2269, "step": 2350 }, { "epoch": 1.7938066465256797, "grad_norm": 6.024422645568848, "learning_rate": 3.4689542483660133e-06, "loss": 1.2162, "step": 2375 }, { "epoch": 1.8126888217522659, "grad_norm": 7.545328140258789, "learning_rate": 3.448529411764706e-06, "loss": 1.2114, "step": 2400 }, { "epoch": 1.8126888217522659, "eval_accuracy": 0.6394711992445703, "eval_f1": 0.6140748119530789, "eval_loss": 0.636786162853241, "eval_precision": 0.6361754382587972, "eval_recall": 0.6394711992445703, "eval_runtime": 27.0479, "eval_samples_per_second": 195.764, "eval_steps_per_second": 12.238, "step": 2400 }, { "epoch": 1.831570996978852, "grad_norm": 11.729330062866211, "learning_rate": 3.428104575163399e-06, "loss": 1.2473, "step": 2425 }, { "epoch": 1.850453172205438, "grad_norm": 8.259448051452637, "learning_rate": 3.407679738562092e-06, "loss": 1.2086, "step": 2450 }, { "epoch": 1.869335347432024, "grad_norm": 7.117493629455566, "learning_rate": 3.3872549019607848e-06, "loss": 1.2435, "step": 2475 }, { "epoch": 1.8882175226586102, "grad_norm": 11.000151634216309, "learning_rate": 3.3668300653594776e-06, "loss": 1.2081, "step": 2500 }, { "epoch": 1.8882175226586102, "eval_accuracy": 0.6457034938621341, "eval_f1": 0.6192035548672061, "eval_loss": 0.632973849773407, "eval_precision": 0.6449753360936373, "eval_recall": 0.6457034938621341, "eval_runtime": 26.2323, "eval_samples_per_second": 201.851, "eval_steps_per_second": 12.618, "step": 2500 }, { "epoch": 1.9070996978851964, "grad_norm": 6.117466926574707, "learning_rate": 3.34640522875817e-06, "loss": 1.2099, "step": 2525 }, { "epoch": 1.9259818731117826, "grad_norm": 7.307370662689209, "learning_rate": 3.325980392156863e-06, "loss": 1.1788, "step": 2550 }, { "epoch": 1.9448640483383686, "grad_norm": 9.010822296142578, "learning_rate": 3.3055555555555558e-06, "loss": 1.2212, "step": 2575 }, { "epoch": 1.9637462235649545, "grad_norm": 7.040300369262695, "learning_rate": 3.2851307189542486e-06, "loss": 1.2359, "step": 2600 }, { "epoch": 1.9637462235649545, "eval_accuracy": 0.6436260623229462, "eval_f1": 0.618869473778857, "eval_loss": 0.6305481195449829, "eval_precision": 0.6412356250382201, "eval_recall": 0.6436260623229462, "eval_runtime": 27.5332, "eval_samples_per_second": 192.313, "eval_steps_per_second": 12.022, "step": 2600 }, { "epoch": 1.9826283987915407, "grad_norm": 14.115243911743164, "learning_rate": 3.2647058823529415e-06, "loss": 1.2123, "step": 2625 }, { "epoch": 2.001510574018127, "grad_norm": 13.984496116638184, "learning_rate": 3.2442810457516343e-06, "loss": 1.2124, "step": 2650 }, { "epoch": 2.020392749244713, "grad_norm": 9.57017993927002, "learning_rate": 3.223856209150327e-06, "loss": 1.0599, "step": 2675 }, { "epoch": 2.039274924471299, "grad_norm": 10.857102394104004, "learning_rate": 3.20343137254902e-06, "loss": 1.113, "step": 2700 }, { "epoch": 2.039274924471299, "eval_accuracy": 0.6494806421152031, "eval_f1": 0.6320126937395264, "eval_loss": 0.6417879462242126, "eval_precision": 0.6451152563709769, "eval_recall": 0.6494806421152031, "eval_runtime": 25.6285, "eval_samples_per_second": 206.606, "eval_steps_per_second": 12.915, "step": 2700 }, { "epoch": 2.058157099697885, "grad_norm": 7.998616695404053, "learning_rate": 3.1830065359477125e-06, "loss": 1.0953, "step": 2725 }, { "epoch": 2.0770392749244713, "grad_norm": 11.49893856048584, "learning_rate": 3.1625816993464054e-06, "loss": 1.0805, "step": 2750 }, { "epoch": 2.0959214501510575, "grad_norm": 33.727813720703125, "learning_rate": 3.1421568627450982e-06, "loss": 1.113, "step": 2775 }, { "epoch": 2.1148036253776437, "grad_norm": 13.618017196655273, "learning_rate": 3.121732026143791e-06, "loss": 1.0903, "step": 2800 }, { "epoch": 2.1148036253776437, "eval_accuracy": 0.6343720491029273, "eval_f1": 0.5939358416916795, "eval_loss": 0.6593873500823975, "eval_precision": 0.6384799226464456, "eval_recall": 0.6343720491029273, "eval_runtime": 25.6715, "eval_samples_per_second": 206.26, "eval_steps_per_second": 12.894, "step": 2800 }, { "epoch": 2.1336858006042294, "grad_norm": 17.023202896118164, "learning_rate": 3.101307189542484e-06, "loss": 1.092, "step": 2825 }, { "epoch": 2.1525679758308156, "grad_norm": 93.96994018554688, "learning_rate": 3.080882352941177e-06, "loss": 1.0704, "step": 2850 }, { "epoch": 2.171450151057402, "grad_norm": 18.93490982055664, "learning_rate": 3.0604575163398697e-06, "loss": 1.0752, "step": 2875 }, { "epoch": 2.190332326283988, "grad_norm": 16.731698989868164, "learning_rate": 3.040032679738562e-06, "loss": 1.0768, "step": 2900 }, { "epoch": 2.190332326283988, "eval_accuracy": 0.6311614730878187, "eval_f1": 0.6227425810648518, "eval_loss": 0.6634938716888428, "eval_precision": 0.624132285789951, "eval_recall": 0.6311614730878187, "eval_runtime": 26.3588, "eval_samples_per_second": 200.881, "eval_steps_per_second": 12.557, "step": 2900 }, { "epoch": 2.209214501510574, "grad_norm": 11.118818283081055, "learning_rate": 3.019607843137255e-06, "loss": 1.0888, "step": 2925 }, { "epoch": 2.22809667673716, "grad_norm": 10.985156059265137, "learning_rate": 2.999183006535948e-06, "loss": 1.1436, "step": 2950 }, { "epoch": 2.246978851963746, "grad_norm": 19.878847122192383, "learning_rate": 2.9787581699346407e-06, "loss": 1.1073, "step": 2975 }, { "epoch": 2.2658610271903323, "grad_norm": 38.21413803100586, "learning_rate": 2.9583333333333335e-06, "loss": 1.0574, "step": 3000 }, { "epoch": 2.2658610271903323, "eval_accuracy": 0.6349386213408876, "eval_f1": 0.627970344866798, "eval_loss": 0.6681957840919495, "eval_precision": 0.6285863561364663, "eval_recall": 0.6349386213408876, "eval_runtime": 27.7894, "eval_samples_per_second": 190.54, "eval_steps_per_second": 11.911, "step": 3000 }, { "epoch": 2.2847432024169185, "grad_norm": 12.937191009521484, "learning_rate": 2.9379084967320264e-06, "loss": 1.0699, "step": 3025 }, { "epoch": 2.3036253776435047, "grad_norm": 20.07396125793457, "learning_rate": 2.9174836601307192e-06, "loss": 1.051, "step": 3050 }, { "epoch": 2.3225075528700905, "grad_norm": 15.067835807800293, "learning_rate": 2.897058823529412e-06, "loss": 1.0947, "step": 3075 }, { "epoch": 2.3413897280966767, "grad_norm": 42.31669998168945, "learning_rate": 2.8766339869281045e-06, "loss": 1.0713, "step": 3100 }, { "epoch": 2.3413897280966767, "eval_accuracy": 0.6277620396600566, "eval_f1": 0.6194707679474215, "eval_loss": 0.6624400615692139, "eval_precision": 0.6205786035913383, "eval_recall": 0.6277620396600566, "eval_runtime": 25.7958, "eval_samples_per_second": 205.266, "eval_steps_per_second": 12.832, "step": 3100 }, { "epoch": 2.360271903323263, "grad_norm": 18.090736389160156, "learning_rate": 2.8562091503267974e-06, "loss": 1.0245, "step": 3125 }, { "epoch": 2.379154078549849, "grad_norm": 52.456302642822266, "learning_rate": 2.8357843137254903e-06, "loss": 1.0917, "step": 3150 }, { "epoch": 2.398036253776435, "grad_norm": 13.822253227233887, "learning_rate": 2.815359477124183e-06, "loss": 1.0362, "step": 3175 }, { "epoch": 2.416918429003021, "grad_norm": 32.68608474731445, "learning_rate": 2.794934640522876e-06, "loss": 1.0118, "step": 3200 }, { "epoch": 2.416918429003021, "eval_accuracy": 0.6315391879131256, "eval_f1": 0.6185399761211638, "eval_loss": 0.6814322471618652, "eval_precision": 0.6238170726799035, "eval_recall": 0.6315391879131256, "eval_runtime": 25.2547, "eval_samples_per_second": 209.664, "eval_steps_per_second": 13.106, "step": 3200 }, { "epoch": 2.435800604229607, "grad_norm": 28.337984085083008, "learning_rate": 2.774509803921569e-06, "loss": 1.0688, "step": 3225 }, { "epoch": 2.4546827794561934, "grad_norm": 17.661848068237305, "learning_rate": 2.7540849673202617e-06, "loss": 1.0645, "step": 3250 }, { "epoch": 2.4735649546827796, "grad_norm": 24.61591339111328, "learning_rate": 2.733660130718954e-06, "loss": 1.084, "step": 3275 }, { "epoch": 2.4924471299093653, "grad_norm": 19.35943603515625, "learning_rate": 2.713235294117647e-06, "loss": 1.0458, "step": 3300 }, { "epoch": 2.4924471299093653, "eval_accuracy": 0.6343720491029273, "eval_f1": 0.6261022786359158, "eval_loss": 0.6693563461303711, "eval_precision": 0.6275730183984842, "eval_recall": 0.6343720491029273, "eval_runtime": 27.7312, "eval_samples_per_second": 190.94, "eval_steps_per_second": 11.936, "step": 3300 }, { "epoch": 2.5113293051359515, "grad_norm": 27.008237838745117, "learning_rate": 2.69281045751634e-06, "loss": 1.0649, "step": 3325 }, { "epoch": 2.5302114803625377, "grad_norm": 22.106470108032227, "learning_rate": 2.6723856209150327e-06, "loss": 1.0598, "step": 3350 }, { "epoch": 2.549093655589124, "grad_norm": 35.57805633544922, "learning_rate": 2.6519607843137256e-06, "loss": 1.0983, "step": 3375 }, { "epoch": 2.56797583081571, "grad_norm": 19.551307678222656, "learning_rate": 2.6315359477124184e-06, "loss": 1.0895, "step": 3400 }, { "epoch": 2.56797583081571, "eval_accuracy": 0.6330500472143532, "eval_f1": 0.6033695321475454, "eval_loss": 0.6630004644393921, "eval_precision": 0.6297347803000727, "eval_recall": 0.6330500472143532, "eval_runtime": 25.2264, "eval_samples_per_second": 209.899, "eval_steps_per_second": 13.121, "step": 3400 }, { "epoch": 2.586858006042296, "grad_norm": 17.806697845458984, "learning_rate": 2.6111111111111113e-06, "loss": 1.078, "step": 3425 }, { "epoch": 2.605740181268882, "grad_norm": 12.314886093139648, "learning_rate": 2.5906862745098046e-06, "loss": 1.0708, "step": 3450 }, { "epoch": 2.6246223564954683, "grad_norm": 24.937700271606445, "learning_rate": 2.5702614379084966e-06, "loss": 1.0807, "step": 3475 }, { "epoch": 2.6435045317220545, "grad_norm": 19.148723602294922, "learning_rate": 2.5498366013071894e-06, "loss": 1.0981, "step": 3500 }, { "epoch": 2.6435045317220545, "eval_accuracy": 0.6290840415486307, "eval_f1": 0.61111999303902, "eval_loss": 0.6673372387886047, "eval_precision": 0.6212227015642893, "eval_recall": 0.6290840415486307, "eval_runtime": 25.7251, "eval_samples_per_second": 205.83, "eval_steps_per_second": 12.867, "step": 3500 }, { "epoch": 2.6623867069486407, "grad_norm": 18.942354202270508, "learning_rate": 2.5294117647058823e-06, "loss": 1.0382, "step": 3525 }, { "epoch": 2.6812688821752264, "grad_norm": 13.00023365020752, "learning_rate": 2.508986928104575e-06, "loss": 1.0019, "step": 3550 }, { "epoch": 2.7001510574018126, "grad_norm": 18.894309997558594, "learning_rate": 2.488562091503268e-06, "loss": 1.0346, "step": 3575 }, { "epoch": 2.719033232628399, "grad_norm": 27.026264190673828, "learning_rate": 2.4681372549019613e-06, "loss": 1.0459, "step": 3600 }, { "epoch": 2.719033232628399, "eval_accuracy": 0.6356940509915014, "eval_f1": 0.6341557778664263, "eval_loss": 0.6878824234008789, "eval_precision": 0.6332597508413698, "eval_recall": 0.6356940509915014, "eval_runtime": 27.4703, "eval_samples_per_second": 192.754, "eval_steps_per_second": 12.049, "step": 3600 } ], "logging_steps": 25, "max_steps": 6620, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.4268243718705856e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }