{ "best_global_step": 900, "best_metric": 0.05392824113368988, "best_model_checkpoint": "/kaggle/working/billstructai_qwen_lora/checkpoint-900", "epoch": 1.9163558870538093, "eval_steps": 100, "global_step": 900, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.021310602024507193, "grad_norm": 0.5570411682128906, "learning_rate": 6.206896551724138e-05, "loss": 0.48706421852111814, "step": 10 }, { "epoch": 0.042621204049014386, "grad_norm": 0.5630005598068237, "learning_rate": 0.00013103448275862068, "loss": 0.223022723197937, "step": 20 }, { "epoch": 0.06393180607352157, "grad_norm": 0.2142772376537323, "learning_rate": 0.0002, "loss": 0.11430357694625855, "step": 30 }, { "epoch": 0.08524240809802877, "grad_norm": 0.1824568212032318, "learning_rate": 0.00019994054478472144, "loss": 0.10234310626983642, "step": 40 }, { "epoch": 0.10655301012253596, "grad_norm": 0.1363372802734375, "learning_rate": 0.00019976224983733816, "loss": 0.09078772068023681, "step": 50 }, { "epoch": 0.12786361214704314, "grad_norm": 0.22561518847942352, "learning_rate": 0.0001994653271691398, "loss": 0.08356261253356934, "step": 60 }, { "epoch": 0.14917421417155036, "grad_norm": 0.234844371676445, "learning_rate": 0.00019905012985214953, "loss": 0.08094308376312256, "step": 70 }, { "epoch": 0.17048481619605754, "grad_norm": 0.21515238285064697, "learning_rate": 0.00019851715159928466, "loss": 0.07718738913536072, "step": 80 }, { "epoch": 0.19179541822056473, "grad_norm": 0.13278549909591675, "learning_rate": 0.0001978670261772804, "loss": 0.08123236298561096, "step": 90 }, { "epoch": 0.21310602024507191, "grad_norm": 0.17123660445213318, "learning_rate": 0.00019710052665307523, "loss": 0.0745608925819397, "step": 100 }, { "epoch": 0.21310602024507191, "eval_loss": 0.07421404123306274, "eval_runtime": 248.5477, "eval_samples_per_second": 1.891, "eval_steps_per_second": 1.891, "step": 100 }, { "epoch": 0.23441662226957913, "grad_norm": 0.16013474762439728, "learning_rate": 0.00019621856447455364, "loss": 0.07106327414512634, "step": 110 }, { "epoch": 0.2557272242940863, "grad_norm": 0.13360778987407684, "learning_rate": 0.00019522218838673944, "loss": 0.0767333984375, "step": 120 }, { "epoch": 0.2770378263185935, "grad_norm": 0.16006118059158325, "learning_rate": 0.00019411258318472862, "loss": 0.06799736022949218, "step": 130 }, { "epoch": 0.2983484283431007, "grad_norm": 0.17742912471294403, "learning_rate": 0.00019289106830484436, "loss": 0.06742151379585266, "step": 140 }, { "epoch": 0.3196590303676079, "grad_norm": 0.19604063034057617, "learning_rate": 0.00019155909625568967, "loss": 0.06300732493400574, "step": 150 }, { "epoch": 0.3409696323921151, "grad_norm": 0.23139697313308716, "learning_rate": 0.0001901182508909631, "loss": 0.0801832914352417, "step": 160 }, { "epoch": 0.36228023441662227, "grad_norm": 0.15756270289421082, "learning_rate": 0.00018857024552609145, "loss": 0.06489556431770324, "step": 170 }, { "epoch": 0.38359083644112946, "grad_norm": 0.16894873976707458, "learning_rate": 0.00018691692090091927, "loss": 0.06612523198127747, "step": 180 }, { "epoch": 0.40490143846563664, "grad_norm": 0.17246082425117493, "learning_rate": 0.0001851602429908767, "loss": 0.0627750039100647, "step": 190 }, { "epoch": 0.42621204049014383, "grad_norm": 0.15236839652061462, "learning_rate": 0.00018330230066923022, "loss": 0.06336764097213746, "step": 200 }, { "epoch": 0.42621204049014383, "eval_loss": 0.0664505884051323, "eval_runtime": 249.4364, "eval_samples_per_second": 1.884, "eval_steps_per_second": 1.884, "step": 200 }, { "epoch": 0.447522642514651, "grad_norm": 0.1786014884710312, "learning_rate": 0.0001813453032231939, "loss": 0.0747511088848114, "step": 210 }, { "epoch": 0.46883324453915826, "grad_norm": 0.12548740208148956, "learning_rate": 0.00017929157772685685, "loss": 0.06296217441558838, "step": 220 }, { "epoch": 0.49014384656366544, "grad_norm": 0.12285338342189789, "learning_rate": 0.00017714356627404924, "loss": 0.05755079984664917, "step": 230 }, { "epoch": 0.5114544485881726, "grad_norm": 0.12364857643842697, "learning_rate": 0.000174903823074438, "loss": 0.07338430285453797, "step": 240 }, { "epoch": 0.5327650506126798, "grad_norm": 0.14315958321094513, "learning_rate": 0.00017257501141630516, "loss": 0.06376387476921082, "step": 250 }, { "epoch": 0.554075652637187, "grad_norm": 0.17841553688049316, "learning_rate": 0.0001701599004996203, "loss": 0.07746977806091308, "step": 260 }, { "epoch": 0.5753862546616942, "grad_norm": 0.18484671413898468, "learning_rate": 0.00016766136214317286, "loss": 0.0655578076839447, "step": 270 }, { "epoch": 0.5966968566862014, "grad_norm": 0.15894602239131927, "learning_rate": 0.00016508236736968016, "loss": 0.059864658117294314, "step": 280 }, { "epoch": 0.6180074587107086, "grad_norm": 0.14981523156166077, "learning_rate": 0.00016242598287293135, "loss": 0.06459205150604248, "step": 290 }, { "epoch": 0.6393180607352158, "grad_norm": 0.19262194633483887, "learning_rate": 0.00015969536737116879, "loss": 0.05724593997001648, "step": 300 }, { "epoch": 0.6393180607352158, "eval_loss": 0.06404831260442734, "eval_runtime": 248.8778, "eval_samples_per_second": 1.888, "eval_steps_per_second": 1.888, "step": 300 }, { "epoch": 0.660628662759723, "grad_norm": 0.16405339539051056, "learning_rate": 0.0001568937678510425, "loss": 0.06382941007614136, "step": 310 }, { "epoch": 0.6819392647842302, "grad_norm": 0.13134469091892242, "learning_rate": 0.00015402451570660437, "loss": 0.06093383431434631, "step": 320 }, { "epoch": 0.7032498668087374, "grad_norm": 0.19201718270778656, "learning_rate": 0.00015109102277793306, "loss": 0.0615972101688385, "step": 330 }, { "epoch": 0.7245604688332445, "grad_norm": 0.11001285165548325, "learning_rate": 0.00014809677729410046, "loss": 0.05652051568031311, "step": 340 }, { "epoch": 0.7458710708577517, "grad_norm": 0.1298859715461731, "learning_rate": 0.0001450453397253033, "loss": 0.05437501072883606, "step": 350 }, { "epoch": 0.7671816728822589, "grad_norm": 0.1667214184999466, "learning_rate": 0.0001419403385490929, "loss": 0.05537524223327637, "step": 360 }, { "epoch": 0.7884922749067661, "grad_norm": 0.160597026348114, "learning_rate": 0.00013878546593573663, "loss": 0.06058817505836487, "step": 370 }, { "epoch": 0.8098028769312733, "grad_norm": 0.11980368942022324, "learning_rate": 0.00013558447335784254, "loss": 0.056959474086761476, "step": 380 }, { "epoch": 0.8311134789557805, "grad_norm": 0.10598862916231155, "learning_rate": 0.00013234116712946715, "loss": 0.062009012699127196, "step": 390 }, { "epoch": 0.8524240809802877, "grad_norm": 0.1465042680501938, "learning_rate": 0.00012905940388001092, "loss": 0.06569045186042785, "step": 400 }, { "epoch": 0.8524240809802877, "eval_loss": 0.05861470475792885, "eval_runtime": 248.8019, "eval_samples_per_second": 1.889, "eval_steps_per_second": 1.889, "step": 400 }, { "epoch": 0.8737346830047948, "grad_norm": 0.13985313475131989, "learning_rate": 0.00012574308596828364, "loss": 0.059485018253326416, "step": 410 }, { "epoch": 0.895045285029302, "grad_norm": 0.09439831972122192, "learning_rate": 0.00012239615684219273, "loss": 0.04954729676246643, "step": 420 }, { "epoch": 0.9163558870538092, "grad_norm": 0.13079901039600372, "learning_rate": 0.0001190225963495725, "loss": 0.06261422634124755, "step": 430 }, { "epoch": 0.9376664890783165, "grad_norm": 0.17101094126701355, "learning_rate": 0.00011562641600572993, "loss": 0.05220479965209961, "step": 440 }, { "epoch": 0.9589770911028237, "grad_norm": 0.18949410319328308, "learning_rate": 0.0001122116542233342, "loss": 0.05655173659324646, "step": 450 }, { "epoch": 0.9802876931273309, "grad_norm": 0.16985633969306946, "learning_rate": 0.0001087823715103234, "loss": 0.05631093382835388, "step": 460 }, { "epoch": 1.0, "grad_norm": 0.21016985177993774, "learning_rate": 0.00010534264564153651, "loss": 0.0492259293794632, "step": 470 }, { "epoch": 1.0213106020245073, "grad_norm": 0.10946141928434372, "learning_rate": 0.00010189656680981415, "loss": 0.045346027612686156, "step": 480 }, { "epoch": 1.0426212040490144, "grad_norm": 0.18159270286560059, "learning_rate": 9.844823276233243e-05, "loss": 0.04748743176460266, "step": 490 }, { "epoch": 1.0639318060735217, "grad_norm": 0.1416451632976532, "learning_rate": 9.500174392795431e-05, "loss": 0.04537383615970612, "step": 500 }, { "epoch": 1.0639318060735217, "eval_loss": 0.05737318471074104, "eval_runtime": 249.9023, "eval_samples_per_second": 1.881, "eval_steps_per_second": 1.881, "step": 500 }, { "epoch": 1.0852424080980287, "grad_norm": 0.1302674263715744, "learning_rate": 9.156119854139173e-05, "loss": 0.042424333095550534, "step": 510 }, { "epoch": 1.106553010122536, "grad_norm": 0.15241168439388275, "learning_rate": 8.813068776997747e-05, "loss": 0.037749645113945005, "step": 520 }, { "epoch": 1.1278636121470431, "grad_norm": 0.189493790268898, "learning_rate": 8.471429084884012e-05, "loss": 0.04497165381908417, "step": 530 }, { "epoch": 1.1491742141715504, "grad_norm": 0.1870124340057373, "learning_rate": 8.131607023026814e-05, "loss": 0.04265827238559723, "step": 540 }, { "epoch": 1.1704848161960575, "grad_norm": 0.1087406650185585, "learning_rate": 7.794006675303031e-05, "loss": 0.035568210482597354, "step": 550 }, { "epoch": 1.1917954182205648, "grad_norm": 0.1936003565788269, "learning_rate": 7.459029483739711e-05, "loss": 0.038499835133552554, "step": 560 }, { "epoch": 1.2131060202450719, "grad_norm": 0.1559380143880844, "learning_rate": 7.127073771157606e-05, "loss": 0.04679949283599853, "step": 570 }, { "epoch": 1.2344166222695792, "grad_norm": 0.1537848860025406, "learning_rate": 6.798534267523806e-05, "loss": 0.04622254967689514, "step": 580 }, { "epoch": 1.2557272242940862, "grad_norm": 0.17289568483829498, "learning_rate": 6.473801640576633e-05, "loss": 0.040285307168960574, "step": 590 }, { "epoch": 1.2770378263185935, "grad_norm": 0.14587342739105225, "learning_rate": 6.153262031280951e-05, "loss": 0.03852958083152771, "step": 600 }, { "epoch": 1.2770378263185935, "eval_loss": 0.056128598749637604, "eval_runtime": 248.6964, "eval_samples_per_second": 1.89, "eval_steps_per_second": 1.89, "step": 600 }, { "epoch": 1.2983484283431008, "grad_norm": 0.15503859519958496, "learning_rate": 5.8372965946662815e-05, "loss": 0.03877540528774261, "step": 610 }, { "epoch": 1.319659030367608, "grad_norm": 0.10821698606014252, "learning_rate": 5.5262810465937045e-05, "loss": 0.04052968025207519, "step": 620 }, { "epoch": 1.340969632392115, "grad_norm": 0.18947947025299072, "learning_rate": 5.2205852169905434e-05, "loss": 0.05081030130386353, "step": 630 }, { "epoch": 1.3622802344166223, "grad_norm": 0.2615494132041931, "learning_rate": 4.920572610083977e-05, "loss": 0.04443525373935699, "step": 640 }, { "epoch": 1.3835908364411296, "grad_norm": 0.1606501042842865, "learning_rate": 4.626599972156593e-05, "loss": 0.04287891089916229, "step": 650 }, { "epoch": 1.4049014384656366, "grad_norm": 0.14430288970470428, "learning_rate": 4.3390168673378775e-05, "loss": 0.04097432494163513, "step": 660 }, { "epoch": 1.4262120404901437, "grad_norm": 0.14559805393218994, "learning_rate": 4.0581652619359775e-05, "loss": 0.034264594316482544, "step": 670 }, { "epoch": 1.447522642514651, "grad_norm": 0.15087302029132843, "learning_rate": 3.7843791178041054e-05, "loss": 0.038701537251472476, "step": 680 }, { "epoch": 1.4688332445391583, "grad_norm": 0.18511506915092468, "learning_rate": 3.5179839952250524e-05, "loss": 0.039507734775543216, "step": 690 }, { "epoch": 1.4901438465636654, "grad_norm": 0.1208174079656601, "learning_rate": 3.2592966657860625e-05, "loss": 0.037732216715812686, "step": 700 }, { "epoch": 1.4901438465636654, "eval_loss": 0.05517593026161194, "eval_runtime": 248.5187, "eval_samples_per_second": 1.891, "eval_steps_per_second": 1.891, "step": 700 }, { "epoch": 1.5114544485881725, "grad_norm": 0.14407405257225037, "learning_rate": 3.0086247357043705e-05, "loss": 0.04141993820667267, "step": 710 }, { "epoch": 1.5327650506126798, "grad_norm": 0.1950131356716156, "learning_rate": 2.766266280051316e-05, "loss": 0.042274028062820435, "step": 720 }, { "epoch": 1.554075652637187, "grad_norm": 0.1330132633447647, "learning_rate": 2.5325094883100108e-05, "loss": 0.039421483874320984, "step": 730 }, { "epoch": 1.5753862546616944, "grad_norm": 0.16335627436637878, "learning_rate": 2.3076323216879714e-05, "loss": 0.03970510959625244, "step": 740 }, { "epoch": 1.5966968566862014, "grad_norm": 0.1316670924425125, "learning_rate": 2.0919021825922536e-05, "loss": 0.04199607074260712, "step": 750 }, { "epoch": 1.6180074587107085, "grad_norm": 0.132982537150383, "learning_rate": 1.8855755966600962e-05, "loss": 0.04375255405902863, "step": 760 }, { "epoch": 1.6393180607352158, "grad_norm": 0.15142162144184113, "learning_rate": 1.688897907723186e-05, "loss": 0.03803563416004181, "step": 770 }, { "epoch": 1.660628662759723, "grad_norm": 0.15250155329704285, "learning_rate": 1.50210298606825e-05, "loss": 0.03791479468345642, "step": 780 }, { "epoch": 1.6819392647842302, "grad_norm": 0.11432624608278275, "learning_rate": 1.325412950340882e-05, "loss": 0.0383548378944397, "step": 790 }, { "epoch": 1.7032498668087372, "grad_norm": 0.15887320041656494, "learning_rate": 1.159037903423319e-05, "loss": 0.04067508578300476, "step": 800 }, { "epoch": 1.7032498668087372, "eval_loss": 0.054582156240940094, "eval_runtime": 248.4421, "eval_samples_per_second": 1.892, "eval_steps_per_second": 1.892, "step": 800 }, { "epoch": 1.7245604688332445, "grad_norm": 0.2519368827342987, "learning_rate": 1.0031756826001914e-05, "loss": 0.0420225739479065, "step": 810 }, { "epoch": 1.7458710708577518, "grad_norm": 0.13151676952838898, "learning_rate": 8.580116243093562e-06, "loss": 0.041281819343566895, "step": 820 }, { "epoch": 1.767181672882259, "grad_norm": 0.11074542254209518, "learning_rate": 7.23718343757539e-06, "loss": 0.03622758090496063, "step": 830 }, { "epoch": 1.788492274906766, "grad_norm": 0.17330627143383026, "learning_rate": 6.004555296628556e-06, "loss": 0.0376776397228241, "step": 840 }, { "epoch": 1.8098028769312733, "grad_norm": 0.1254781186580658, "learning_rate": 4.88369754368263e-06, "loss": 0.03871485292911529, "step": 850 }, { "epoch": 1.8311134789557806, "grad_norm": 0.15773062407970428, "learning_rate": 3.8759429955175564e-06, "loss": 0.041798022389411923, "step": 860 }, { "epoch": 1.8524240809802877, "grad_norm": 0.12225436419248581, "learning_rate": 2.9824899774055113e-06, "loss": 0.036775484681129456, "step": 870 }, { "epoch": 1.8737346830047947, "grad_norm": 0.14229069650173187, "learning_rate": 2.2044008981771947e-06, "loss": 0.03825798928737641, "step": 880 }, { "epoch": 1.895045285029302, "grad_norm": 0.12034007161855698, "learning_rate": 1.5426009869067948e-06, "loss": 0.03620096147060394, "step": 890 }, { "epoch": 1.9163558870538093, "grad_norm": 0.16056819260120392, "learning_rate": 9.97877192718255e-07, "loss": 0.037316632270812986, "step": 900 }, { "epoch": 1.9163558870538093, "eval_loss": 0.05392824113368988, "eval_runtime": 248.0734, "eval_samples_per_second": 1.895, "eval_steps_per_second": 1.895, "step": 900 } ], "logging_steps": 10, "max_steps": 940, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 5.290876726467379e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }