{ "best_metric": 0.9725916385650635, "best_model_checkpoint": "./outputs/instruct-lora-8b-aplly_chat_template-environmental/checkpoint-1600", "epoch": 1.8870539663815984, "eval_steps": 20, "global_step": 1600, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0011795930404010617, "eval_loss": 1.42765212059021, "eval_runtime": 63.0401, "eval_samples_per_second": 23.905, "eval_steps_per_second": 5.98, "step": 1 }, { "epoch": 0.023591860808021232, "grad_norm": 0.8140115737915039, "learning_rate": 2.3622047244094487e-06, "loss": 1.4383, "step": 20 }, { "epoch": 0.023591860808021232, "eval_loss": 1.4257409572601318, "eval_runtime": 63.0141, "eval_samples_per_second": 23.915, "eval_steps_per_second": 5.983, "step": 20 }, { "epoch": 0.047183721616042465, "grad_norm": 0.8540558218955994, "learning_rate": 4.7244094488188975e-06, "loss": 1.4736, "step": 40 }, { "epoch": 0.047183721616042465, "eval_loss": 1.4058444499969482, "eval_runtime": 65.5526, "eval_samples_per_second": 22.989, "eval_steps_per_second": 5.751, "step": 40 }, { "epoch": 0.0707755824240637, "grad_norm": 0.9564130902290344, "learning_rate": 7.086614173228346e-06, "loss": 1.3855, "step": 60 }, { "epoch": 0.0707755824240637, "eval_loss": 1.3293768167495728, "eval_runtime": 62.9854, "eval_samples_per_second": 23.926, "eval_steps_per_second": 5.986, "step": 60 }, { "epoch": 0.09436744323208493, "grad_norm": 0.9375326037406921, "learning_rate": 9.448818897637795e-06, "loss": 1.3151, "step": 80 }, { "epoch": 0.09436744323208493, "eval_loss": 1.256630301475525, "eval_runtime": 62.9741, "eval_samples_per_second": 23.93, "eval_steps_per_second": 5.987, "step": 80 }, { "epoch": 0.11795930404010617, "grad_norm": 0.9875860810279846, "learning_rate": 1.1811023622047245e-05, "loss": 1.2527, "step": 100 }, { "epoch": 0.11795930404010617, "eval_loss": 1.2264838218688965, "eval_runtime": 65.3152, "eval_samples_per_second": 23.073, "eval_steps_per_second": 5.772, "step": 100 }, { "epoch": 0.1415511648481274, "grad_norm": 1.0547633171081543, "learning_rate": 1.4173228346456692e-05, "loss": 1.2557, "step": 120 }, { "epoch": 0.1415511648481274, "eval_loss": 1.2046794891357422, "eval_runtime": 62.9226, "eval_samples_per_second": 23.95, "eval_steps_per_second": 5.991, "step": 120 }, { "epoch": 0.16514302565614863, "grad_norm": 1.010538101196289, "learning_rate": 1.6535433070866142e-05, "loss": 1.2405, "step": 140 }, { "epoch": 0.16514302565614863, "eval_loss": 1.188104271888733, "eval_runtime": 62.9407, "eval_samples_per_second": 23.943, "eval_steps_per_second": 5.99, "step": 140 }, { "epoch": 0.18873488646416986, "grad_norm": 1.1231751441955566, "learning_rate": 1.889763779527559e-05, "loss": 1.2074, "step": 160 }, { "epoch": 0.18873488646416986, "eval_loss": 1.1720376014709473, "eval_runtime": 62.9691, "eval_samples_per_second": 23.932, "eval_steps_per_second": 5.987, "step": 160 }, { "epoch": 0.21232674727219109, "grad_norm": 1.2803903818130493, "learning_rate": 2.1259842519685038e-05, "loss": 1.1897, "step": 180 }, { "epoch": 0.21232674727219109, "eval_loss": 1.1597559452056885, "eval_runtime": 63.1045, "eval_samples_per_second": 23.881, "eval_steps_per_second": 5.974, "step": 180 }, { "epoch": 0.23591860808021234, "grad_norm": 1.2758204936981201, "learning_rate": 2.362204724409449e-05, "loss": 1.145, "step": 200 }, { "epoch": 0.23591860808021234, "eval_loss": 1.1493200063705444, "eval_runtime": 65.8866, "eval_samples_per_second": 22.873, "eval_steps_per_second": 5.722, "step": 200 }, { "epoch": 0.25951046888823354, "grad_norm": 1.517013430595398, "learning_rate": 2.5984251968503937e-05, "loss": 1.1508, "step": 220 }, { "epoch": 0.25951046888823354, "eval_loss": 1.1411106586456299, "eval_runtime": 62.986, "eval_samples_per_second": 23.926, "eval_steps_per_second": 5.985, "step": 220 }, { "epoch": 0.2831023296962548, "grad_norm": 1.6017550230026245, "learning_rate": 2.8346456692913385e-05, "loss": 1.1406, "step": 240 }, { "epoch": 0.2831023296962548, "eval_loss": 1.1336663961410522, "eval_runtime": 62.9587, "eval_samples_per_second": 23.936, "eval_steps_per_second": 5.988, "step": 240 }, { "epoch": 0.30669419050427604, "grad_norm": 1.5281150341033936, "learning_rate": 2.9999490518144496e-05, "loss": 1.1156, "step": 260 }, { "epoch": 0.30669419050427604, "eval_loss": 1.1270569562911987, "eval_runtime": 66.1576, "eval_samples_per_second": 22.779, "eval_steps_per_second": 5.699, "step": 260 }, { "epoch": 0.33028605131229727, "grad_norm": 1.4530911445617676, "learning_rate": 2.9990434025704478e-05, "loss": 1.1439, "step": 280 }, { "epoch": 0.33028605131229727, "eval_loss": 1.118715524673462, "eval_runtime": 62.9289, "eval_samples_per_second": 23.948, "eval_steps_per_second": 5.991, "step": 280 }, { "epoch": 0.3538779121203185, "grad_norm": 1.4522110223770142, "learning_rate": 2.9970063582150774e-05, "loss": 1.0991, "step": 300 }, { "epoch": 0.3538779121203185, "eval_loss": 1.1142727136611938, "eval_runtime": 62.9463, "eval_samples_per_second": 23.941, "eval_steps_per_second": 5.989, "step": 300 }, { "epoch": 0.3774697729283397, "grad_norm": 1.6753257513046265, "learning_rate": 2.9938394561968347e-05, "loss": 1.1037, "step": 320 }, { "epoch": 0.3774697729283397, "eval_loss": 1.1066044569015503, "eval_runtime": 62.9455, "eval_samples_per_second": 23.941, "eval_steps_per_second": 5.989, "step": 320 }, { "epoch": 0.40106163373636095, "grad_norm": 1.5857524871826172, "learning_rate": 2.9895450867183358e-05, "loss": 1.0821, "step": 340 }, { "epoch": 0.40106163373636095, "eval_loss": 1.1023849248886108, "eval_runtime": 62.9815, "eval_samples_per_second": 23.928, "eval_steps_per_second": 5.986, "step": 340 }, { "epoch": 0.42465349454438217, "grad_norm": 1.6321624517440796, "learning_rate": 2.9841264909323215e-05, "loss": 1.0355, "step": 360 }, { "epoch": 0.42465349454438217, "eval_loss": 1.0976252555847168, "eval_runtime": 63.0759, "eval_samples_per_second": 23.892, "eval_steps_per_second": 5.977, "step": 360 }, { "epoch": 0.4482453553524034, "grad_norm": 1.7007124423980713, "learning_rate": 2.9775877584954185e-05, "loss": 1.0705, "step": 380 }, { "epoch": 0.4482453553524034, "eval_loss": 1.0898144245147705, "eval_runtime": 63.0529, "eval_samples_per_second": 23.901, "eval_steps_per_second": 5.979, "step": 380 }, { "epoch": 0.4718372161604247, "grad_norm": 1.6532444953918457, "learning_rate": 2.9699338244814873e-05, "loss": 1.058, "step": 400 }, { "epoch": 0.4718372161604247, "eval_loss": 1.0839428901672363, "eval_runtime": 63.0318, "eval_samples_per_second": 23.909, "eval_steps_per_second": 5.981, "step": 400 }, { "epoch": 0.4954290769684459, "grad_norm": 1.7736274003982544, "learning_rate": 2.961170465656906e-05, "loss": 1.073, "step": 420 }, { "epoch": 0.4954290769684459, "eval_loss": 1.0811110734939575, "eval_runtime": 65.7766, "eval_samples_per_second": 22.911, "eval_steps_per_second": 5.732, "step": 420 }, { "epoch": 0.5190209377764671, "grad_norm": 1.7278027534484863, "learning_rate": 2.9513042961205828e-05, "loss": 1.0669, "step": 440 }, { "epoch": 0.5190209377764671, "eval_loss": 1.0773712396621704, "eval_runtime": 63.1642, "eval_samples_per_second": 23.858, "eval_steps_per_second": 5.969, "step": 440 }, { "epoch": 0.5426127985844883, "grad_norm": 1.7342020273208618, "learning_rate": 2.940342762312002e-05, "loss": 1.0742, "step": 460 }, { "epoch": 0.5426127985844883, "eval_loss": 1.07448410987854, "eval_runtime": 63.1172, "eval_samples_per_second": 23.876, "eval_steps_per_second": 5.973, "step": 460 }, { "epoch": 0.5662046593925096, "grad_norm": 1.688236117362976, "learning_rate": 2.9282941373910622e-05, "loss": 1.0391, "step": 480 }, { "epoch": 0.5662046593925096, "eval_loss": 1.0696014165878296, "eval_runtime": 63.5007, "eval_samples_per_second": 23.732, "eval_steps_per_second": 5.937, "step": 480 }, { "epoch": 0.5897965202005309, "grad_norm": 1.6653029918670654, "learning_rate": 2.915167514993952e-05, "loss": 1.0388, "step": 500 }, { "epoch": 0.5897965202005309, "eval_loss": 1.0648998022079468, "eval_runtime": 63.0976, "eval_samples_per_second": 23.884, "eval_steps_per_second": 5.975, "step": 500 }, { "epoch": 0.6133883810085521, "grad_norm": 1.7940328121185303, "learning_rate": 2.9009728023697777e-05, "loss": 1.0483, "step": 520 }, { "epoch": 0.6133883810085521, "eval_loss": 1.0635266304016113, "eval_runtime": 63.1023, "eval_samples_per_second": 23.882, "eval_steps_per_second": 5.974, "step": 520 }, { "epoch": 0.6369802418165733, "grad_norm": 1.7853456735610962, "learning_rate": 2.8857207129031153e-05, "loss": 1.0767, "step": 540 }, { "epoch": 0.6369802418165733, "eval_loss": 1.0566504001617432, "eval_runtime": 63.0964, "eval_samples_per_second": 23.884, "eval_steps_per_second": 5.975, "step": 540 }, { "epoch": 0.6605721026245945, "grad_norm": 1.8145803213119507, "learning_rate": 2.869422758028145e-05, "loss": 1.0273, "step": 560 }, { "epoch": 0.6605721026245945, "eval_loss": 1.0557910203933716, "eval_runtime": 63.1078, "eval_samples_per_second": 23.88, "eval_steps_per_second": 5.974, "step": 560 }, { "epoch": 0.6841639634326158, "grad_norm": 1.7679259777069092, "learning_rate": 2.852091238540454e-05, "loss": 1.021, "step": 580 }, { "epoch": 0.6841639634326158, "eval_loss": 1.0533658266067505, "eval_runtime": 65.8301, "eval_samples_per_second": 22.892, "eval_steps_per_second": 5.727, "step": 580 }, { "epoch": 0.707755824240637, "grad_norm": 1.6286741495132446, "learning_rate": 2.8337392353130755e-05, "loss": 1.0429, "step": 600 }, { "epoch": 0.707755824240637, "eval_loss": 1.0482341051101685, "eval_runtime": 63.1283, "eval_samples_per_second": 23.872, "eval_steps_per_second": 5.972, "step": 600 }, { "epoch": 0.7313476850486582, "grad_norm": 2.0246284008026123, "learning_rate": 2.81438059942377e-05, "loss": 1.001, "step": 620 }, { "epoch": 0.7313476850486582, "eval_loss": 1.0442626476287842, "eval_runtime": 63.0773, "eval_samples_per_second": 23.891, "eval_steps_per_second": 5.977, "step": 620 }, { "epoch": 0.7549395458566794, "grad_norm": 1.8399453163146973, "learning_rate": 2.7940299417009968e-05, "loss": 1.0257, "step": 640 }, { "epoch": 0.7549395458566794, "eval_loss": 1.0410016775131226, "eval_runtime": 66.0639, "eval_samples_per_second": 22.811, "eval_steps_per_second": 5.707, "step": 640 }, { "epoch": 0.7785314066647007, "grad_norm": 1.7166261672973633, "learning_rate": 2.772702621696468e-05, "loss": 0.9959, "step": 660 }, { "epoch": 0.7785314066647007, "eval_loss": 1.036692500114441, "eval_runtime": 62.9935, "eval_samples_per_second": 23.923, "eval_steps_per_second": 5.985, "step": 660 }, { "epoch": 0.8021232674727219, "grad_norm": 1.8086529970169067, "learning_rate": 2.7504147360926084e-05, "loss": 0.9912, "step": 680 }, { "epoch": 0.8021232674727219, "eval_loss": 1.0342631340026855, "eval_runtime": 62.9732, "eval_samples_per_second": 23.931, "eval_steps_per_second": 5.987, "step": 680 }, { "epoch": 0.8257151282807431, "grad_norm": 1.7481584548950195, "learning_rate": 2.7271831065536684e-05, "loss": 0.9986, "step": 700 }, { "epoch": 0.8257151282807431, "eval_loss": 1.0320111513137817, "eval_runtime": 63.187, "eval_samples_per_second": 23.85, "eval_steps_per_second": 5.966, "step": 700 }, { "epoch": 0.8493069890887643, "grad_norm": 1.8035798072814941, "learning_rate": 2.7030252670296612e-05, "loss": 0.9972, "step": 720 }, { "epoch": 0.8493069890887643, "eval_loss": 1.0306118726730347, "eval_runtime": 62.9945, "eval_samples_per_second": 23.923, "eval_steps_per_second": 5.985, "step": 720 }, { "epoch": 0.8728988498967856, "grad_norm": 1.7504149675369263, "learning_rate": 2.677959450522709e-05, "loss": 0.9923, "step": 740 }, { "epoch": 0.8728988498967856, "eval_loss": 1.028536081314087, "eval_runtime": 66.0048, "eval_samples_per_second": 22.832, "eval_steps_per_second": 5.712, "step": 740 }, { "epoch": 0.8964907107048068, "grad_norm": 1.9125969409942627, "learning_rate": 2.6520045753257774e-05, "loss": 0.9862, "step": 760 }, { "epoch": 0.8964907107048068, "eval_loss": 1.0277767181396484, "eval_runtime": 62.8849, "eval_samples_per_second": 23.964, "eval_steps_per_second": 5.995, "step": 760 }, { "epoch": 0.9200825715128281, "grad_norm": 1.7713780403137207, "learning_rate": 2.625180230744195e-05, "loss": 1.0248, "step": 780 }, { "epoch": 0.9200825715128281, "eval_loss": 1.024271845817566, "eval_runtime": 62.9468, "eval_samples_per_second": 23.941, "eval_steps_per_second": 5.989, "step": 780 }, { "epoch": 0.9436744323208494, "grad_norm": 1.794228196144104, "learning_rate": 2.597506662310728e-05, "loss": 0.9898, "step": 800 }, { "epoch": 0.9436744323208494, "eval_loss": 1.024512767791748, "eval_runtime": 65.8042, "eval_samples_per_second": 22.901, "eval_steps_per_second": 5.729, "step": 800 }, { "epoch": 0.9672662931288706, "grad_norm": 2.150176525115967, "learning_rate": 2.569004756505373e-05, "loss": 0.9838, "step": 820 }, { "epoch": 0.9672662931288706, "eval_loss": 1.0203757286071777, "eval_runtime": 63.2378, "eval_samples_per_second": 23.831, "eval_steps_per_second": 5.962, "step": 820 }, { "epoch": 0.9908581539368918, "grad_norm": 1.892907977104187, "learning_rate": 2.539696024991391e-05, "loss": 0.9655, "step": 840 }, { "epoch": 0.9908581539368918, "eval_loss": 1.0187581777572632, "eval_runtime": 62.8975, "eval_samples_per_second": 23.96, "eval_steps_per_second": 5.994, "step": 840 }, { "epoch": 1.0141551164848128, "grad_norm": 1.8649617433547974, "learning_rate": 2.5096025883795e-05, "loss": 0.9747, "step": 860 }, { "epoch": 1.0141551164848128, "eval_loss": 1.0219627618789673, "eval_runtime": 62.8985, "eval_samples_per_second": 23.959, "eval_steps_per_second": 5.994, "step": 860 }, { "epoch": 1.037746977292834, "grad_norm": 1.9797245264053345, "learning_rate": 2.4787471595324554e-05, "loss": 0.9133, "step": 880 }, { "epoch": 1.037746977292834, "eval_loss": 1.0162080526351929, "eval_runtime": 62.9338, "eval_samples_per_second": 23.946, "eval_steps_per_second": 5.99, "step": 880 }, { "epoch": 1.0613388381008553, "grad_norm": 1.9416215419769287, "learning_rate": 2.447153026422637e-05, "loss": 0.9122, "step": 900 }, { "epoch": 1.0613388381008553, "eval_loss": 1.014188528060913, "eval_runtime": 62.9073, "eval_samples_per_second": 23.956, "eval_steps_per_second": 5.993, "step": 900 }, { "epoch": 1.0849306989088765, "grad_norm": 2.022336721420288, "learning_rate": 2.4148440345555778e-05, "loss": 0.9089, "step": 920 }, { "epoch": 1.0849306989088765, "eval_loss": 1.0171178579330444, "eval_runtime": 62.9354, "eval_samples_per_second": 23.945, "eval_steps_per_second": 5.99, "step": 920 }, { "epoch": 1.1085225597168977, "grad_norm": 2.2142956256866455, "learning_rate": 2.38184456897269e-05, "loss": 0.9315, "step": 940 }, { "epoch": 1.1085225597168977, "eval_loss": 1.0155071020126343, "eval_runtime": 63.3545, "eval_samples_per_second": 23.787, "eval_steps_per_second": 5.951, "step": 940 }, { "epoch": 1.132114420524919, "grad_norm": 1.9037110805511475, "learning_rate": 2.3481795358467866e-05, "loss": 0.9469, "step": 960 }, { "epoch": 1.132114420524919, "eval_loss": 1.0110633373260498, "eval_runtime": 64.9111, "eval_samples_per_second": 23.216, "eval_steps_per_second": 5.808, "step": 960 }, { "epoch": 1.1557062813329402, "grad_norm": 2.169173240661621, "learning_rate": 2.3138743436842772e-05, "loss": 0.9255, "step": 980 }, { "epoch": 1.1557062813329402, "eval_loss": 1.0110522508621216, "eval_runtime": 62.9115, "eval_samples_per_second": 23.954, "eval_steps_per_second": 5.993, "step": 980 }, { "epoch": 1.1792981421409614, "grad_norm": 1.8711203336715698, "learning_rate": 2.278954884148232e-05, "loss": 0.9322, "step": 1000 }, { "epoch": 1.1792981421409614, "eval_loss": 1.0103003978729248, "eval_runtime": 62.9309, "eval_samples_per_second": 23.947, "eval_steps_per_second": 5.991, "step": 1000 }, { "epoch": 1.2028900029489826, "grad_norm": 1.9024525880813599, "learning_rate": 2.2434475125167866e-05, "loss": 0.8943, "step": 1020 }, { "epoch": 1.2028900029489826, "eval_loss": 1.0080772638320923, "eval_runtime": 63.4989, "eval_samples_per_second": 23.733, "eval_steps_per_second": 5.937, "step": 1020 }, { "epoch": 1.2264818637570039, "grad_norm": 2.0306591987609863, "learning_rate": 2.207379027791632e-05, "loss": 0.8974, "step": 1040 }, { "epoch": 1.2264818637570039, "eval_loss": 1.005001187324524, "eval_runtime": 62.9683, "eval_samples_per_second": 23.933, "eval_steps_per_second": 5.987, "step": 1040 }, { "epoch": 1.250073724565025, "grad_norm": 2.0461585521698, "learning_rate": 2.170776652471611e-05, "loss": 0.8922, "step": 1060 }, { "epoch": 1.250073724565025, "eval_loss": 1.0041309595108032, "eval_runtime": 62.9406, "eval_samples_per_second": 23.943, "eval_steps_per_second": 5.99, "step": 1060 }, { "epoch": 1.2736655853730463, "grad_norm": 2.301267385482788, "learning_rate": 2.133668012006682e-05, "loss": 0.9341, "step": 1080 }, { "epoch": 1.2736655853730463, "eval_loss": 1.0036579370498657, "eval_runtime": 62.8908, "eval_samples_per_second": 23.962, "eval_steps_per_second": 5.995, "step": 1080 }, { "epoch": 1.2972574461810675, "grad_norm": 2.170428991317749, "learning_rate": 2.096081113947753e-05, "loss": 0.9075, "step": 1100 }, { "epoch": 1.2972574461810675, "eval_loss": 1.0047935247421265, "eval_runtime": 62.9099, "eval_samples_per_second": 23.955, "eval_steps_per_second": 5.993, "step": 1100 }, { "epoch": 1.3208493069890888, "grad_norm": 2.1537463665008545, "learning_rate": 2.058044326808132e-05, "loss": 0.9296, "step": 1120 }, { "epoch": 1.3208493069890888, "eval_loss": 1.0024445056915283, "eval_runtime": 64.9442, "eval_samples_per_second": 23.205, "eval_steps_per_second": 5.805, "step": 1120 }, { "epoch": 1.34444116779711, "grad_norm": 2.0056726932525635, "learning_rate": 2.0195863586525413e-05, "loss": 0.9133, "step": 1140 }, { "epoch": 1.34444116779711, "eval_loss": 1.0002470016479492, "eval_runtime": 62.892, "eval_samples_per_second": 23.962, "eval_steps_per_second": 5.994, "step": 1140 }, { "epoch": 1.3680330286051312, "grad_norm": 2.3192081451416016, "learning_rate": 1.9807362354298556e-05, "loss": 0.9447, "step": 1160 }, { "epoch": 1.3680330286051312, "eval_loss": 1.0005617141723633, "eval_runtime": 62.9711, "eval_samples_per_second": 23.932, "eval_steps_per_second": 5.987, "step": 1160 }, { "epoch": 1.3916248894131524, "grad_norm": 2.085900068283081, "learning_rate": 1.9415232790659206e-05, "loss": 0.8843, "step": 1180 }, { "epoch": 1.3916248894131524, "eval_loss": 0.9992862939834595, "eval_runtime": 65.4435, "eval_samples_per_second": 23.027, "eval_steps_per_second": 5.761, "step": 1180 }, { "epoch": 1.4152167502211737, "grad_norm": 2.2436399459838867, "learning_rate": 1.9019770853329856e-05, "loss": 0.9046, "step": 1200 }, { "epoch": 1.4152167502211737, "eval_loss": 0.996922492980957, "eval_runtime": 62.9124, "eval_samples_per_second": 23.954, "eval_steps_per_second": 5.992, "step": 1200 }, { "epoch": 1.4388086110291949, "grad_norm": 2.1963181495666504, "learning_rate": 1.8621275015124457e-05, "loss": 0.8844, "step": 1220 }, { "epoch": 1.4388086110291949, "eval_loss": 0.9958762526512146, "eval_runtime": 62.9054, "eval_samples_per_second": 23.957, "eval_steps_per_second": 5.993, "step": 1220 }, { "epoch": 1.462400471837216, "grad_norm": 2.19089674949646, "learning_rate": 1.82200460386777e-05, "loss": 0.923, "step": 1240 }, { "epoch": 1.462400471837216, "eval_loss": 0.9949436783790588, "eval_runtime": 62.9162, "eval_samples_per_second": 23.952, "eval_steps_per_second": 5.992, "step": 1240 }, { "epoch": 1.4859923326452373, "grad_norm": 2.2525527477264404, "learning_rate": 1.7816386749445935e-05, "loss": 0.8587, "step": 1260 }, { "epoch": 1.4859923326452373, "eval_loss": 0.9949393272399902, "eval_runtime": 62.931, "eval_samples_per_second": 23.947, "eval_steps_per_second": 5.991, "step": 1260 }, { "epoch": 1.5095841934532586, "grad_norm": 2.4868662357330322, "learning_rate": 1.7410601807151304e-05, "loss": 0.8878, "step": 1280 }, { "epoch": 1.5095841934532586, "eval_loss": 0.9940009713172913, "eval_runtime": 64.7991, "eval_samples_per_second": 23.256, "eval_steps_per_second": 5.818, "step": 1280 }, { "epoch": 1.53317605426128, "grad_norm": 1.9369481801986694, "learning_rate": 1.700299747584139e-05, "loss": 0.904, "step": 1300 }, { "epoch": 1.53317605426128, "eval_loss": 0.9907172918319702, "eval_runtime": 62.932, "eval_samples_per_second": 23.946, "eval_steps_per_second": 5.991, "step": 1300 }, { "epoch": 1.556767915069301, "grad_norm": 2.2156777381896973, "learning_rate": 1.659388139273806e-05, "loss": 0.9121, "step": 1320 }, { "epoch": 1.556767915069301, "eval_loss": 0.9908357262611389, "eval_runtime": 62.9132, "eval_samples_per_second": 23.954, "eval_steps_per_second": 5.992, "step": 1320 }, { "epoch": 1.5803597758773225, "grad_norm": 2.393859386444092, "learning_rate": 1.6183562336049867e-05, "loss": 0.9023, "step": 1340 }, { "epoch": 1.5803597758773225, "eval_loss": 0.9863225221633911, "eval_runtime": 65.5958, "eval_samples_per_second": 22.974, "eval_steps_per_second": 5.747, "step": 1340 }, { "epoch": 1.6039516366853435, "grad_norm": 2.1125807762145996, "learning_rate": 1.5772349991923366e-05, "loss": 0.892, "step": 1360 }, { "epoch": 1.6039516366853435, "eval_loss": 0.9855474233627319, "eval_runtime": 62.9171, "eval_samples_per_second": 23.952, "eval_steps_per_second": 5.992, "step": 1360 }, { "epoch": 1.627543497493365, "grad_norm": 2.1116766929626465, "learning_rate": 1.536055472070907e-05, "loss": 0.9116, "step": 1380 }, { "epoch": 1.627543497493365, "eval_loss": 0.9856626391410828, "eval_runtime": 62.9526, "eval_samples_per_second": 23.939, "eval_steps_per_second": 5.989, "step": 1380 }, { "epoch": 1.651135358301386, "grad_norm": 2.2223665714263916, "learning_rate": 1.4948487322718669e-05, "loss": 0.8816, "step": 1400 }, { "epoch": 1.651135358301386, "eval_loss": 0.9842101335525513, "eval_runtime": 63.0292, "eval_samples_per_second": 23.91, "eval_steps_per_second": 5.981, "step": 1400 }, { "epoch": 1.6747272191094074, "grad_norm": 2.2404255867004395, "learning_rate": 1.4536458803650085e-05, "loss": 0.859, "step": 1420 }, { "epoch": 1.6747272191094074, "eval_loss": 0.9844129085540771, "eval_runtime": 63.0729, "eval_samples_per_second": 23.893, "eval_steps_per_second": 5.977, "step": 1420 }, { "epoch": 1.6983190799174284, "grad_norm": 2.072277784347534, "learning_rate": 1.4124780139857582e-05, "loss": 0.9234, "step": 1440 }, { "epoch": 1.6983190799174284, "eval_loss": 0.9798393845558167, "eval_runtime": 64.8962, "eval_samples_per_second": 23.222, "eval_steps_per_second": 5.809, "step": 1440 }, { "epoch": 1.7219109407254498, "grad_norm": 2.4477767944335938, "learning_rate": 1.3713762043644008e-05, "loss": 0.889, "step": 1460 }, { "epoch": 1.7219109407254498, "eval_loss": 0.9810368418693542, "eval_runtime": 62.9029, "eval_samples_per_second": 23.958, "eval_steps_per_second": 5.993, "step": 1460 }, { "epoch": 1.7455028015334708, "grad_norm": 2.2249417304992676, "learning_rate": 1.3303714728752293e-05, "loss": 0.8679, "step": 1480 }, { "epoch": 1.7455028015334708, "eval_loss": 0.9801770448684692, "eval_runtime": 62.9129, "eval_samples_per_second": 23.954, "eval_steps_per_second": 5.992, "step": 1480 }, { "epoch": 1.7690946623414923, "grad_norm": 2.2835938930511475, "learning_rate": 1.2894947676233291e-05, "loss": 0.8896, "step": 1500 }, { "epoch": 1.7690946623414923, "eval_loss": 0.9786974787712097, "eval_runtime": 65.11, "eval_samples_per_second": 23.145, "eval_steps_per_second": 5.79, "step": 1500 }, { "epoch": 1.7926865231495133, "grad_norm": 2.386866569519043, "learning_rate": 1.2487769400866573e-05, "loss": 0.8687, "step": 1520 }, { "epoch": 1.7926865231495133, "eval_loss": 0.9775878190994263, "eval_runtime": 62.9587, "eval_samples_per_second": 23.936, "eval_steps_per_second": 5.988, "step": 1520 }, { "epoch": 1.8162783839575347, "grad_norm": 2.3122761249542236, "learning_rate": 1.2082487218310524e-05, "loss": 0.8992, "step": 1540 }, { "epoch": 1.8162783839575347, "eval_loss": 0.9774647951126099, "eval_runtime": 62.8905, "eval_samples_per_second": 23.962, "eval_steps_per_second": 5.995, "step": 1540 }, { "epoch": 1.8398702447655557, "grad_norm": 2.2307450771331787, "learning_rate": 1.1679407013157457e-05, "loss": 0.9041, "step": 1560 }, { "epoch": 1.8398702447655557, "eval_loss": 0.9749870300292969, "eval_runtime": 62.9232, "eval_samples_per_second": 23.95, "eval_steps_per_second": 5.991, "step": 1560 }, { "epoch": 1.8634621055735772, "grad_norm": 2.1991312503814697, "learning_rate": 1.1278833008068863e-05, "loss": 0.8804, "step": 1580 }, { "epoch": 1.8634621055735772, "eval_loss": 0.973229169845581, "eval_runtime": 62.9112, "eval_samples_per_second": 23.954, "eval_steps_per_second": 5.993, "step": 1580 }, { "epoch": 1.8870539663815984, "grad_norm": 2.1787588596343994, "learning_rate": 1.088106753416491e-05, "loss": 0.9004, "step": 1600 }, { "epoch": 1.8870539663815984, "eval_loss": 0.9725916385650635, "eval_runtime": 62.9975, "eval_samples_per_second": 23.922, "eval_steps_per_second": 5.984, "step": 1600 } ], "logging_steps": 20, "max_steps": 2541, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 200, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.937740637329162e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }