{ "best_metric": 0.8136880993843079, "best_model_checkpoint": "./outputs/instruct-lora-8b-aplly_chat_template-intellectual/checkpoint-1200", "epoch": 1.8528389339513325, "eval_steps": 20, "global_step": 1200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.001544998068752414, "eval_loss": 1.3165150880813599, "eval_runtime": 48.891, "eval_samples_per_second": 23.542, "eval_steps_per_second": 5.891, "step": 1 }, { "epoch": 0.03089996137504828, "grad_norm": 0.7807549238204956, "learning_rate": 3.092783505154639e-06, "loss": 1.2724, "step": 20 }, { "epoch": 0.03089996137504828, "eval_loss": 1.314327597618103, "eval_runtime": 48.8364, "eval_samples_per_second": 23.568, "eval_steps_per_second": 5.897, "step": 20 }, { "epoch": 0.06179992275009656, "grad_norm": 0.8449882864952087, "learning_rate": 6.185567010309278e-06, "loss": 1.2394, "step": 40 }, { "epoch": 0.06179992275009656, "eval_loss": 1.2848930358886719, "eval_runtime": 48.9051, "eval_samples_per_second": 23.535, "eval_steps_per_second": 5.889, "step": 40 }, { "epoch": 0.09269988412514485, "grad_norm": 0.8352286219596863, "learning_rate": 9.278350515463918e-06, "loss": 1.1438, "step": 60 }, { "epoch": 0.09269988412514485, "eval_loss": 1.1923872232437134, "eval_runtime": 48.8793, "eval_samples_per_second": 23.548, "eval_steps_per_second": 5.892, "step": 60 }, { "epoch": 0.12359984550019312, "grad_norm": 0.877621591091156, "learning_rate": 1.2371134020618556e-05, "loss": 1.057, "step": 80 }, { "epoch": 0.12359984550019312, "eval_loss": 1.13431978225708, "eval_runtime": 50.9437, "eval_samples_per_second": 22.594, "eval_steps_per_second": 5.653, "step": 80 }, { "epoch": 0.1544998068752414, "grad_norm": 0.9503705501556396, "learning_rate": 1.5463917525773194e-05, "loss": 1.0444, "step": 100 }, { "epoch": 0.1544998068752414, "eval_loss": 1.0924711227416992, "eval_runtime": 48.8783, "eval_samples_per_second": 23.548, "eval_steps_per_second": 5.892, "step": 100 }, { "epoch": 0.1853997682502897, "grad_norm": 1.030405879020691, "learning_rate": 1.8556701030927837e-05, "loss": 0.994, "step": 120 }, { "epoch": 0.1853997682502897, "eval_loss": 1.064813256263733, "eval_runtime": 48.8238, "eval_samples_per_second": 23.575, "eval_steps_per_second": 5.899, "step": 120 }, { "epoch": 0.21629972962533797, "grad_norm": 1.367910623550415, "learning_rate": 2.1649484536082473e-05, "loss": 0.9561, "step": 140 }, { "epoch": 0.21629972962533797, "eval_loss": 1.036982774734497, "eval_runtime": 51.1767, "eval_samples_per_second": 22.491, "eval_steps_per_second": 5.628, "step": 140 }, { "epoch": 0.24719969100038625, "grad_norm": 1.3933994770050049, "learning_rate": 2.4742268041237112e-05, "loss": 0.9565, "step": 160 }, { "epoch": 0.24719969100038625, "eval_loss": 1.019098162651062, "eval_runtime": 50.3225, "eval_samples_per_second": 22.872, "eval_steps_per_second": 5.723, "step": 160 }, { "epoch": 0.27809965237543455, "grad_norm": 1.367946982383728, "learning_rate": 2.7835051546391755e-05, "loss": 0.8842, "step": 180 }, { "epoch": 0.27809965237543455, "eval_loss": 1.004747986793518, "eval_runtime": 48.9997, "eval_samples_per_second": 23.49, "eval_steps_per_second": 5.878, "step": 180 }, { "epoch": 0.3089996137504828, "grad_norm": 1.4316825866699219, "learning_rate": 2.9999126880904965e-05, "loss": 0.8863, "step": 200 }, { "epoch": 0.3089996137504828, "eval_loss": 0.9973997473716736, "eval_runtime": 50.6767, "eval_samples_per_second": 22.713, "eval_steps_per_second": 5.683, "step": 200 }, { "epoch": 0.3398995751255311, "grad_norm": 1.4682165384292603, "learning_rate": 2.998360759115084e-05, "loss": 0.8935, "step": 220 }, { "epoch": 0.3398995751255311, "eval_loss": 0.9823518991470337, "eval_runtime": 48.7888, "eval_samples_per_second": 23.591, "eval_steps_per_second": 5.903, "step": 220 }, { "epoch": 0.3707995365005794, "grad_norm": 1.6310033798217773, "learning_rate": 2.9948708759677052e-05, "loss": 0.8596, "step": 240 }, { "epoch": 0.3707995365005794, "eval_loss": 0.9750108122825623, "eval_runtime": 48.8205, "eval_samples_per_second": 23.576, "eval_steps_per_second": 5.899, "step": 240 }, { "epoch": 0.40169949787562764, "grad_norm": 1.498504877090454, "learning_rate": 2.9894475524035186e-05, "loss": 0.8656, "step": 260 }, { "epoch": 0.40169949787562764, "eval_loss": 0.9654810428619385, "eval_runtime": 50.0758, "eval_samples_per_second": 22.985, "eval_steps_per_second": 5.751, "step": 260 }, { "epoch": 0.43259945925067594, "grad_norm": 1.630052089691162, "learning_rate": 2.9820978028564395e-05, "loss": 0.852, "step": 280 }, { "epoch": 0.43259945925067594, "eval_loss": 0.954610288143158, "eval_runtime": 49.7619, "eval_samples_per_second": 23.13, "eval_steps_per_second": 5.788, "step": 280 }, { "epoch": 0.46349942062572425, "grad_norm": 1.565081238746643, "learning_rate": 2.9728311333667943e-05, "loss": 0.8407, "step": 300 }, { "epoch": 0.46349942062572425, "eval_loss": 0.9461371898651123, "eval_runtime": 48.774, "eval_samples_per_second": 23.599, "eval_steps_per_second": 5.905, "step": 300 }, { "epoch": 0.4943993820007725, "grad_norm": 1.5313355922698975, "learning_rate": 2.961659529286366e-05, "loss": 0.8102, "step": 320 }, { "epoch": 0.4943993820007725, "eval_loss": 0.9419096112251282, "eval_runtime": 48.7963, "eval_samples_per_second": 23.588, "eval_steps_per_second": 5.902, "step": 320 }, { "epoch": 0.5252993433758207, "grad_norm": 1.8025727272033691, "learning_rate": 2.948597439776749e-05, "loss": 0.817, "step": 340 }, { "epoch": 0.5252993433758207, "eval_loss": 0.9346877932548523, "eval_runtime": 48.7844, "eval_samples_per_second": 23.594, "eval_steps_per_second": 5.904, "step": 340 }, { "epoch": 0.5561993047508691, "grad_norm": 1.6470723152160645, "learning_rate": 2.9336617591210508e-05, "loss": 0.802, "step": 360 }, { "epoch": 0.5561993047508691, "eval_loss": 0.9356982111930847, "eval_runtime": 48.7896, "eval_samples_per_second": 23.591, "eval_steps_per_second": 5.903, "step": 360 }, { "epoch": 0.5870992661259173, "grad_norm": 1.5940176248550415, "learning_rate": 2.9168718048731113e-05, "loss": 0.8232, "step": 380 }, { "epoch": 0.5870992661259173, "eval_loss": 0.928005039691925, "eval_runtime": 48.9837, "eval_samples_per_second": 23.498, "eval_steps_per_second": 5.88, "step": 380 }, { "epoch": 0.6179992275009656, "grad_norm": 1.7030407190322876, "learning_rate": 2.898249292872514e-05, "loss": 0.8222, "step": 400 }, { "epoch": 0.6179992275009656, "eval_loss": 0.9209285378456116, "eval_runtime": 48.7992, "eval_samples_per_second": 23.586, "eval_steps_per_second": 5.902, "step": 400 }, { "epoch": 0.6488991888760139, "grad_norm": 1.6369273662567139, "learning_rate": 2.8778183091576867e-05, "loss": 0.8094, "step": 420 }, { "epoch": 0.6488991888760139, "eval_loss": 0.9116755127906799, "eval_runtime": 48.8182, "eval_samples_per_second": 23.577, "eval_steps_per_second": 5.899, "step": 420 }, { "epoch": 0.6797991502510622, "grad_norm": 1.6444923877716064, "learning_rate": 2.855605278813435e-05, "loss": 0.7793, "step": 440 }, { "epoch": 0.6797991502510622, "eval_loss": 0.9064341187477112, "eval_runtime": 48.9673, "eval_samples_per_second": 23.505, "eval_steps_per_second": 5.881, "step": 440 }, { "epoch": 0.7106991116261104, "grad_norm": 1.5660841464996338, "learning_rate": 2.8316389317931867e-05, "loss": 0.7989, "step": 460 }, { "epoch": 0.7106991116261104, "eval_loss": 0.9033644199371338, "eval_runtime": 48.8113, "eval_samples_per_second": 23.581, "eval_steps_per_second": 5.9, "step": 460 }, { "epoch": 0.7415990730011588, "grad_norm": 1.7576305866241455, "learning_rate": 2.8059502657601618e-05, "loss": 0.7804, "step": 480 }, { "epoch": 0.7415990730011588, "eval_loss": 0.8978912234306335, "eval_runtime": 50.7823, "eval_samples_per_second": 22.665, "eval_steps_per_second": 5.671, "step": 480 }, { "epoch": 0.772499034376207, "grad_norm": 1.7764692306518555, "learning_rate": 2.7785725059955288e-05, "loss": 0.7651, "step": 500 }, { "epoch": 0.772499034376207, "eval_loss": 0.8953514695167542, "eval_runtime": 48.7892, "eval_samples_per_second": 23.591, "eval_steps_per_second": 5.903, "step": 500 }, { "epoch": 0.8033989957512553, "grad_norm": 1.7256971597671509, "learning_rate": 2.7495410624253885e-05, "loss": 0.7886, "step": 520 }, { "epoch": 0.8033989957512553, "eval_loss": 0.8885264992713928, "eval_runtime": 48.7926, "eval_samples_per_second": 23.59, "eval_steps_per_second": 5.903, "step": 520 }, { "epoch": 0.8342989571263036, "grad_norm": 1.761567234992981, "learning_rate": 2.718893483822187e-05, "loss": 0.7771, "step": 540 }, { "epoch": 0.8342989571263036, "eval_loss": 0.8897767663002014, "eval_runtime": 50.7177, "eval_samples_per_second": 22.694, "eval_steps_per_second": 5.678, "step": 540 }, { "epoch": 0.8651989185013519, "grad_norm": 1.7774807214736938, "learning_rate": 2.686669409239773e-05, "loss": 0.7708, "step": 560 }, { "epoch": 0.8651989185013519, "eval_loss": 0.884600043296814, "eval_runtime": 48.8104, "eval_samples_per_second": 23.581, "eval_steps_per_second": 5.9, "step": 560 }, { "epoch": 0.8960988798764001, "grad_norm": 1.616105079650879, "learning_rate": 2.6529105167449225e-05, "loss": 0.7656, "step": 580 }, { "epoch": 0.8960988798764001, "eval_loss": 0.8817371129989624, "eval_runtime": 48.7884, "eval_samples_per_second": 23.592, "eval_steps_per_second": 5.903, "step": 580 }, { "epoch": 0.9269988412514485, "grad_norm": 1.5919208526611328, "learning_rate": 2.6176604695116443e-05, "loss": 0.7574, "step": 600 }, { "epoch": 0.9269988412514485, "eval_loss": 0.878905713558197, "eval_runtime": 51.0012, "eval_samples_per_second": 22.568, "eval_steps_per_second": 5.647, "step": 600 }, { "epoch": 0.9578988026264967, "grad_norm": 1.7113957405090332, "learning_rate": 2.5809648593479732e-05, "loss": 0.78, "step": 620 }, { "epoch": 0.9578988026264967, "eval_loss": 0.8750773072242737, "eval_runtime": 48.8281, "eval_samples_per_second": 23.572, "eval_steps_per_second": 5.898, "step": 620 }, { "epoch": 0.988798764001545, "grad_norm": 1.6923496723175049, "learning_rate": 2.5428711477283085e-05, "loss": 0.8123, "step": 640 }, { "epoch": 0.988798764001545, "eval_loss": 0.8708633780479431, "eval_runtime": 48.7852, "eval_samples_per_second": 23.593, "eval_steps_per_second": 5.903, "step": 640 }, { "epoch": 1.018539976825029, "grad_norm": 1.8015915155410767, "learning_rate": 2.5034286044075546e-05, "loss": 0.7468, "step": 660 }, { "epoch": 1.018539976825029, "eval_loss": 0.8686777353286743, "eval_runtime": 49.0562, "eval_samples_per_second": 23.463, "eval_steps_per_second": 5.871, "step": 660 }, { "epoch": 1.0494399382000772, "grad_norm": 1.838549256324768, "learning_rate": 2.462688243696461e-05, "loss": 0.7258, "step": 680 }, { "epoch": 1.0494399382000772, "eval_loss": 0.8642013072967529, "eval_runtime": 48.7685, "eval_samples_per_second": 23.601, "eval_steps_per_second": 5.905, "step": 680 }, { "epoch": 1.0803398995751254, "grad_norm": 1.7961382865905762, "learning_rate": 2.420702758480588e-05, "loss": 0.7093, "step": 700 }, { "epoch": 1.0803398995751254, "eval_loss": 0.8624302744865417, "eval_runtime": 48.7964, "eval_samples_per_second": 23.588, "eval_steps_per_second": 5.902, "step": 700 }, { "epoch": 1.111239860950174, "grad_norm": 1.7665976285934448, "learning_rate": 2.3775264520682277e-05, "loss": 0.6989, "step": 720 }, { "epoch": 1.111239860950174, "eval_loss": 0.8579444289207458, "eval_runtime": 48.7833, "eval_samples_per_second": 23.594, "eval_steps_per_second": 5.904, "step": 720 }, { "epoch": 1.1421398223252222, "grad_norm": 1.9921693801879883, "learning_rate": 2.3332151679554377e-05, "loss": 0.686, "step": 740 }, { "epoch": 1.1421398223252222, "eval_loss": 0.8583009839057922, "eval_runtime": 48.8345, "eval_samples_per_second": 23.569, "eval_steps_per_second": 5.897, "step": 740 }, { "epoch": 1.1730397837002704, "grad_norm": 1.8822782039642334, "learning_rate": 2.2878262175990123e-05, "loss": 0.6953, "step": 760 }, { "epoch": 1.1730397837002704, "eval_loss": 0.8588049411773682, "eval_runtime": 48.8072, "eval_samples_per_second": 23.583, "eval_steps_per_second": 5.901, "step": 760 }, { "epoch": 1.2039397450753186, "grad_norm": 1.9839003086090088, "learning_rate": 2.2414183062908324e-05, "loss": 0.6849, "step": 780 }, { "epoch": 1.2039397450753186, "eval_loss": 0.8559426665306091, "eval_runtime": 48.7613, "eval_samples_per_second": 23.605, "eval_steps_per_second": 5.906, "step": 780 }, { "epoch": 1.234839706450367, "grad_norm": 1.9713268280029297, "learning_rate": 2.19405145722944e-05, "loss": 0.7103, "step": 800 }, { "epoch": 1.234839706450367, "eval_loss": 0.8510345816612244, "eval_runtime": 48.7589, "eval_samples_per_second": 23.606, "eval_steps_per_second": 5.907, "step": 800 }, { "epoch": 1.2657396678254151, "grad_norm": 1.9331954717636108, "learning_rate": 2.1457869338870596e-05, "loss": 0.6864, "step": 820 }, { "epoch": 1.2657396678254151, "eval_loss": 0.850884199142456, "eval_runtime": 48.759, "eval_samples_per_second": 23.606, "eval_steps_per_second": 5.907, "step": 820 }, { "epoch": 1.2966396292004636, "grad_norm": 2.3717479705810547, "learning_rate": 2.096687160772478e-05, "loss": 0.6829, "step": 840 }, { "epoch": 1.2966396292004636, "eval_loss": 0.8503381013870239, "eval_runtime": 48.7619, "eval_samples_per_second": 23.605, "eval_steps_per_second": 5.906, "step": 840 }, { "epoch": 1.3275395905755119, "grad_norm": 2.0674445629119873, "learning_rate": 2.0468156426922442e-05, "loss": 0.7029, "step": 860 }, { "epoch": 1.3275395905755119, "eval_loss": 0.8445314168930054, "eval_runtime": 48.7601, "eval_samples_per_second": 23.605, "eval_steps_per_second": 5.906, "step": 860 }, { "epoch": 1.35843955195056, "grad_norm": 1.9750181436538696, "learning_rate": 1.9962368826146446e-05, "loss": 0.6955, "step": 880 }, { "epoch": 1.35843955195056, "eval_loss": 0.8400866985321045, "eval_runtime": 48.7637, "eval_samples_per_second": 23.604, "eval_steps_per_second": 5.906, "step": 880 }, { "epoch": 1.3893395133256083, "grad_norm": 2.0038938522338867, "learning_rate": 1.945016298242664e-05, "loss": 0.6692, "step": 900 }, { "epoch": 1.3893395133256083, "eval_loss": 0.8380523324012756, "eval_runtime": 48.9093, "eval_samples_per_second": 23.533, "eval_steps_per_second": 5.888, "step": 900 }, { "epoch": 1.4202394747006566, "grad_norm": 1.8987348079681396, "learning_rate": 1.8932201374038505e-05, "loss": 0.6654, "step": 920 }, { "epoch": 1.4202394747006566, "eval_loss": 0.8386799693107605, "eval_runtime": 48.7795, "eval_samples_per_second": 23.596, "eval_steps_per_second": 5.904, "step": 920 }, { "epoch": 1.4511394360757048, "grad_norm": 2.025766372680664, "learning_rate": 1.8409153923665073e-05, "loss": 0.7131, "step": 940 }, { "epoch": 1.4511394360757048, "eval_loss": 0.8346343636512756, "eval_runtime": 51.0682, "eval_samples_per_second": 22.539, "eval_steps_per_second": 5.64, "step": 940 }, { "epoch": 1.482039397450753, "grad_norm": 1.9496480226516724, "learning_rate": 1.7881697131930393e-05, "loss": 0.6742, "step": 960 }, { "epoch": 1.482039397450753, "eval_loss": 0.8343452215194702, "eval_runtime": 48.7857, "eval_samples_per_second": 23.593, "eval_steps_per_second": 5.903, "step": 960 }, { "epoch": 1.5129393588258013, "grad_norm": 2.2017662525177, "learning_rate": 1.7350513202425192e-05, "loss": 0.6731, "step": 980 }, { "epoch": 1.5129393588258013, "eval_loss": 0.831669807434082, "eval_runtime": 48.7641, "eval_samples_per_second": 23.603, "eval_steps_per_second": 5.906, "step": 980 }, { "epoch": 1.5438393202008498, "grad_norm": 2.1149885654449463, "learning_rate": 1.681628915935642e-05, "loss": 0.6843, "step": 1000 }, { "epoch": 1.5438393202008498, "eval_loss": 0.8293876051902771, "eval_runtime": 51.2816, "eval_samples_per_second": 22.445, "eval_steps_per_second": 5.616, "step": 1000 }, { "epoch": 1.574739281575898, "grad_norm": 2.221484899520874, "learning_rate": 1.627971595896191e-05, "loss": 0.6875, "step": 1020 }, { "epoch": 1.574739281575898, "eval_loss": 0.8284665942192078, "eval_runtime": 48.8242, "eval_samples_per_second": 23.574, "eval_steps_per_second": 5.899, "step": 1020 }, { "epoch": 1.6056392429509463, "grad_norm": 2.17756986618042, "learning_rate": 1.5741487595839394e-05, "loss": 0.6713, "step": 1040 }, { "epoch": 1.6056392429509463, "eval_loss": 0.8284040093421936, "eval_runtime": 48.8193, "eval_samples_per_second": 23.577, "eval_steps_per_second": 5.899, "step": 1040 }, { "epoch": 1.6365392043259948, "grad_norm": 1.9823157787322998, "learning_rate": 1.5202300205345747e-05, "loss": 0.6839, "step": 1060 }, { "epoch": 1.6365392043259948, "eval_loss": 0.8247435092926025, "eval_runtime": 51.2128, "eval_samples_per_second": 22.475, "eval_steps_per_second": 5.624, "step": 1060 }, { "epoch": 1.667439165701043, "grad_norm": 2.0765607357025146, "learning_rate": 1.4662851163227446e-05, "loss": 0.6845, "step": 1080 }, { "epoch": 1.667439165701043, "eval_loss": 0.8243246078491211, "eval_runtime": 48.7965, "eval_samples_per_second": 23.588, "eval_steps_per_second": 5.902, "step": 1080 }, { "epoch": 1.6983391270760912, "grad_norm": 2.0634026527404785, "learning_rate": 1.41238381836467e-05, "loss": 0.6792, "step": 1100 }, { "epoch": 1.6983391270760912, "eval_loss": 0.8208648562431335, "eval_runtime": 48.7933, "eval_samples_per_second": 23.589, "eval_steps_per_second": 5.902, "step": 1100 }, { "epoch": 1.7292390884511395, "grad_norm": 1.9673739671707153, "learning_rate": 1.3585958416769904e-05, "loss": 0.6512, "step": 1120 }, { "epoch": 1.7292390884511395, "eval_loss": 0.8207812905311584, "eval_runtime": 48.8357, "eval_samples_per_second": 23.569, "eval_steps_per_second": 5.897, "step": 1120 }, { "epoch": 1.7601390498261877, "grad_norm": 2.3055999279022217, "learning_rate": 1.304990754708551e-05, "loss": 0.6502, "step": 1140 }, { "epoch": 1.7601390498261877, "eval_loss": 0.818783164024353, "eval_runtime": 48.8503, "eval_samples_per_second": 23.562, "eval_steps_per_second": 5.896, "step": 1140 }, { "epoch": 1.791039011201236, "grad_norm": 2.2930891513824463, "learning_rate": 1.2516378893617636e-05, "loss": 0.6552, "step": 1160 }, { "epoch": 1.791039011201236, "eval_loss": 0.8174114227294922, "eval_runtime": 48.8468, "eval_samples_per_second": 23.563, "eval_steps_per_second": 5.896, "step": 1160 }, { "epoch": 1.8219389725762842, "grad_norm": 1.9812862873077393, "learning_rate": 1.1986062513199107e-05, "loss": 0.6382, "step": 1180 }, { "epoch": 1.8219389725762842, "eval_loss": 0.8155190944671631, "eval_runtime": 48.7931, "eval_samples_per_second": 23.589, "eval_steps_per_second": 5.902, "step": 1180 }, { "epoch": 1.8528389339513325, "grad_norm": 2.177253007888794, "learning_rate": 1.1459644307963727e-05, "loss": 0.6748, "step": 1200 }, { "epoch": 1.8528389339513325, "eval_loss": 0.8136880993843079, "eval_runtime": 48.7851, "eval_samples_per_second": 23.593, "eval_steps_per_second": 5.903, "step": 1200 } ], "logging_steps": 20, "max_steps": 1941, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 200, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.484725714805064e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }