Instructions to use nttx/72886a10-7367-4561-9e00-37b78522209f with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use nttx/72886a10-7367-4561-9e00-37b78522209f with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("NousResearch/Hermes-2-Pro-Llama-3-8B") model = PeftModel.from_pretrained(base_model, "nttx/72886a10-7367-4561-9e00-37b78522209f") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_metric": 5.546361923217773, | |
| "best_model_checkpoint": "miner_id_24/checkpoint-100", | |
| "epoch": 0.013568060784912316, | |
| "eval_steps": 50, | |
| "global_step": 100, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.00013568060784912317, | |
| "grad_norm": 15.762146949768066, | |
| "learning_rate": 5.000000000000001e-07, | |
| "loss": 17.5251, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.00013568060784912317, | |
| "eval_loss": 17.97577667236328, | |
| "eval_runtime": 988.5204, | |
| "eval_samples_per_second": 12.557, | |
| "eval_steps_per_second": 3.14, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.00027136121569824634, | |
| "grad_norm": 15.15388298034668, | |
| "learning_rate": 1.0000000000000002e-06, | |
| "loss": 17.0609, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.0004070418235473695, | |
| "grad_norm": 17.901601791381836, | |
| "learning_rate": 1.5e-06, | |
| "loss": 18.277, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.0005427224313964927, | |
| "grad_norm": 16.00199317932129, | |
| "learning_rate": 2.0000000000000003e-06, | |
| "loss": 18.4372, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.0006784030392456158, | |
| "grad_norm": 16.555130004882812, | |
| "learning_rate": 2.5e-06, | |
| "loss": 17.4032, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.000814083647094739, | |
| "grad_norm": 16.318920135498047, | |
| "learning_rate": 3e-06, | |
| "loss": 17.5668, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.0009497642549438621, | |
| "grad_norm": 17.335289001464844, | |
| "learning_rate": 3.5e-06, | |
| "loss": 18.4793, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.0010854448627929854, | |
| "grad_norm": 17.1308536529541, | |
| "learning_rate": 4.000000000000001e-06, | |
| "loss": 18.0238, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.0012211254706421084, | |
| "grad_norm": 16.88369369506836, | |
| "learning_rate": 4.5e-06, | |
| "loss": 18.038, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.0013568060784912316, | |
| "grad_norm": 18.023923873901367, | |
| "learning_rate": 5e-06, | |
| "loss": 17.9376, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.001492486686340355, | |
| "grad_norm": 16.119089126586914, | |
| "learning_rate": 4.99847706754774e-06, | |
| "loss": 17.228, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.001628167294189478, | |
| "grad_norm": 19.076875686645508, | |
| "learning_rate": 4.993910125649561e-06, | |
| "loss": 18.2888, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.0017638479020386012, | |
| "grad_norm": 17.7404727935791, | |
| "learning_rate": 4.986304738420684e-06, | |
| "loss": 17.6689, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.0018995285098877242, | |
| "grad_norm": 19.57935905456543, | |
| "learning_rate": 4.975670171853926e-06, | |
| "loss": 18.0748, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.0020352091177368472, | |
| "grad_norm": 19.126384735107422, | |
| "learning_rate": 4.962019382530521e-06, | |
| "loss": 17.7308, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.0021708897255859707, | |
| "grad_norm": 19.213788986206055, | |
| "learning_rate": 4.9453690018345144e-06, | |
| "loss": 17.6152, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.0023065703334350937, | |
| "grad_norm": 19.342151641845703, | |
| "learning_rate": 4.925739315689991e-06, | |
| "loss": 17.7039, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.0024422509412842168, | |
| "grad_norm": 17.80344581604004, | |
| "learning_rate": 4.903154239845798e-06, | |
| "loss": 15.9165, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.0025779315491333402, | |
| "grad_norm": 20.63853645324707, | |
| "learning_rate": 4.8776412907378845e-06, | |
| "loss": 17.62, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.0027136121569824633, | |
| "grad_norm": 22.237533569335938, | |
| "learning_rate": 4.849231551964771e-06, | |
| "loss": 17.8717, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.0028492927648315863, | |
| "grad_norm": 21.161718368530273, | |
| "learning_rate": 4.817959636416969e-06, | |
| "loss": 16.7998, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.00298497337268071, | |
| "grad_norm": 22.185317993164062, | |
| "learning_rate": 4.783863644106502e-06, | |
| "loss": 17.1446, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.003120653980529833, | |
| "grad_norm": 23.86289405822754, | |
| "learning_rate": 4.746985115747918e-06, | |
| "loss": 16.7542, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.003256334588378956, | |
| "grad_norm": 21.632293701171875, | |
| "learning_rate": 4.707368982147318e-06, | |
| "loss": 16.4251, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.003392015196228079, | |
| "grad_norm": 21.998170852661133, | |
| "learning_rate": 4.665063509461098e-06, | |
| "loss": 15.8686, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.0035276958040772024, | |
| "grad_norm": 22.968353271484375, | |
| "learning_rate": 4.620120240391065e-06, | |
| "loss": 15.1071, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.0036633764119263254, | |
| "grad_norm": 27.793222427368164, | |
| "learning_rate": 4.572593931387604e-06, | |
| "loss": 16.0389, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.0037990570197754484, | |
| "grad_norm": 25.256834030151367, | |
| "learning_rate": 4.522542485937369e-06, | |
| "loss": 14.966, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.003934737627624572, | |
| "grad_norm": 27.452804565429688, | |
| "learning_rate": 4.470026884016805e-06, | |
| "loss": 15.3857, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.0040704182354736945, | |
| "grad_norm": 28.503049850463867, | |
| "learning_rate": 4.415111107797445e-06, | |
| "loss": 14.2744, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.004206098843322818, | |
| "grad_norm": 26.86528205871582, | |
| "learning_rate": 4.357862063693486e-06, | |
| "loss": 14.3296, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.004341779451171941, | |
| "grad_norm": 28.72145652770996, | |
| "learning_rate": 4.2983495008466285e-06, | |
| "loss": 14.8378, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.004477460059021064, | |
| "grad_norm": 28.283493041992188, | |
| "learning_rate": 4.236645926147493e-06, | |
| "loss": 14.1692, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.0046131406668701875, | |
| "grad_norm": 30.041580200195312, | |
| "learning_rate": 4.172826515897146e-06, | |
| "loss": 13.4264, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.004748821274719311, | |
| "grad_norm": 33.323081970214844, | |
| "learning_rate": 4.106969024216348e-06, | |
| "loss": 13.2793, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.0048845018825684336, | |
| "grad_norm": 25.383710861206055, | |
| "learning_rate": 4.039153688314146e-06, | |
| "loss": 13.0025, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.005020182490417557, | |
| "grad_norm": 34.86724090576172, | |
| "learning_rate": 3.969463130731183e-06, | |
| "loss": 12.8519, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.0051558630982666805, | |
| "grad_norm": 28.57182502746582, | |
| "learning_rate": 3.897982258676867e-06, | |
| "loss": 12.3253, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.005291543706115803, | |
| "grad_norm": 27.965444564819336, | |
| "learning_rate": 3.824798160583012e-06, | |
| "loss": 11.9458, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.0054272243139649266, | |
| "grad_norm": 30.288328170776367, | |
| "learning_rate": 3.7500000000000005e-06, | |
| "loss": 11.5927, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.00556290492181405, | |
| "grad_norm": 29.882335662841797, | |
| "learning_rate": 3.6736789069647273e-06, | |
| "loss": 11.8575, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.005698585529663173, | |
| "grad_norm": 27.096267700195312, | |
| "learning_rate": 3.595927866972694e-06, | |
| "loss": 11.5122, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.005834266137512296, | |
| "grad_norm": 27.859052658081055, | |
| "learning_rate": 3.516841607689501e-06, | |
| "loss": 11.2235, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.00596994674536142, | |
| "grad_norm": 27.79047203063965, | |
| "learning_rate": 3.436516483539781e-06, | |
| "loss": 10.7358, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.006105627353210542, | |
| "grad_norm": 27.116655349731445, | |
| "learning_rate": 3.3550503583141726e-06, | |
| "loss": 10.6031, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.006241307961059666, | |
| "grad_norm": 29.671985626220703, | |
| "learning_rate": 3.272542485937369e-06, | |
| "loss": 10.5947, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 0.006376988568908789, | |
| "grad_norm": 24.509077072143555, | |
| "learning_rate": 3.189093389542498e-06, | |
| "loss": 10.671, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 0.006512669176757912, | |
| "grad_norm": 30.852890014648438, | |
| "learning_rate": 3.1048047389991693e-06, | |
| "loss": 10.7918, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.006648349784607035, | |
| "grad_norm": 29.77279281616211, | |
| "learning_rate": 3.019779227044398e-06, | |
| "loss": 11.0377, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 0.006784030392456158, | |
| "grad_norm": 32.51844787597656, | |
| "learning_rate": 2.9341204441673267e-06, | |
| "loss": 11.3717, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.006784030392456158, | |
| "eval_loss": 9.308085441589355, | |
| "eval_runtime": 992.1874, | |
| "eval_samples_per_second": 12.511, | |
| "eval_steps_per_second": 3.128, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.006919711000305281, | |
| "grad_norm": 26.32299041748047, | |
| "learning_rate": 2.847932752400164e-06, | |
| "loss": 8.778, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 0.007055391608154405, | |
| "grad_norm": 27.48458480834961, | |
| "learning_rate": 2.761321158169134e-06, | |
| "loss": 8.6638, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 0.007191072216003527, | |
| "grad_norm": 28.693199157714844, | |
| "learning_rate": 2.6743911843603134e-06, | |
| "loss": 8.4307, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 0.007326752823852651, | |
| "grad_norm": 25.406177520751953, | |
| "learning_rate": 2.587248741756253e-06, | |
| "loss": 8.0378, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 0.007462433431701774, | |
| "grad_norm": 28.44993019104004, | |
| "learning_rate": 2.5e-06, | |
| "loss": 8.276, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.007598114039550897, | |
| "grad_norm": 24.69778823852539, | |
| "learning_rate": 2.4127512582437486e-06, | |
| "loss": 8.2592, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 0.00773379464740002, | |
| "grad_norm": 25.933664321899414, | |
| "learning_rate": 2.325608815639687e-06, | |
| "loss": 8.3317, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 0.007869475255249144, | |
| "grad_norm": 27.458454132080078, | |
| "learning_rate": 2.238678841830867e-06, | |
| "loss": 7.7944, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 0.008005155863098266, | |
| "grad_norm": 25.28622817993164, | |
| "learning_rate": 2.1520672475998374e-06, | |
| "loss": 7.7405, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 0.008140836470947389, | |
| "grad_norm": 29.014318466186523, | |
| "learning_rate": 2.0658795558326745e-06, | |
| "loss": 7.3388, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.008276517078796513, | |
| "grad_norm": 27.211328506469727, | |
| "learning_rate": 1.9802207729556023e-06, | |
| "loss": 7.5491, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 0.008412197686645636, | |
| "grad_norm": 28.228635787963867, | |
| "learning_rate": 1.895195261000831e-06, | |
| "loss": 6.9176, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 0.008547878294494759, | |
| "grad_norm": 28.854480743408203, | |
| "learning_rate": 1.8109066104575023e-06, | |
| "loss": 6.9789, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 0.008683558902343883, | |
| "grad_norm": 30.74064064025879, | |
| "learning_rate": 1.7274575140626318e-06, | |
| "loss": 6.791, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 0.008819239510193005, | |
| "grad_norm": 30.067106246948242, | |
| "learning_rate": 1.6449496416858285e-06, | |
| "loss": 7.27, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.008954920118042128, | |
| "grad_norm": 28.86882209777832, | |
| "learning_rate": 1.56348351646022e-06, | |
| "loss": 6.8992, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 0.009090600725891252, | |
| "grad_norm": 29.37924575805664, | |
| "learning_rate": 1.4831583923105e-06, | |
| "loss": 7.1342, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 0.009226281333740375, | |
| "grad_norm": 28.117305755615234, | |
| "learning_rate": 1.4040721330273063e-06, | |
| "loss": 6.8556, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 0.009361961941589498, | |
| "grad_norm": 31.97182846069336, | |
| "learning_rate": 1.3263210930352737e-06, | |
| "loss": 7.6376, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 0.009497642549438622, | |
| "grad_norm": 30.822277069091797, | |
| "learning_rate": 1.2500000000000007e-06, | |
| "loss": 7.0273, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.009633323157287745, | |
| "grad_norm": 36.39443588256836, | |
| "learning_rate": 1.1752018394169882e-06, | |
| "loss": 6.5916, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 0.009769003765136867, | |
| "grad_norm": 31.061527252197266, | |
| "learning_rate": 1.1020177413231334e-06, | |
| "loss": 6.3773, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 0.009904684372985991, | |
| "grad_norm": 36.107337951660156, | |
| "learning_rate": 1.0305368692688175e-06, | |
| "loss": 5.9991, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 0.010040364980835114, | |
| "grad_norm": 33.352020263671875, | |
| "learning_rate": 9.608463116858544e-07, | |
| "loss": 6.0698, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 0.010176045588684237, | |
| "grad_norm": 30.981962203979492, | |
| "learning_rate": 8.930309757836517e-07, | |
| "loss": 6.5031, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.010311726196533361, | |
| "grad_norm": 31.83991050720215, | |
| "learning_rate": 8.271734841028553e-07, | |
| "loss": 6.594, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 0.010447406804382484, | |
| "grad_norm": 33.01601791381836, | |
| "learning_rate": 7.633540738525066e-07, | |
| "loss": 6.1583, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 0.010583087412231606, | |
| "grad_norm": 34.49018859863281, | |
| "learning_rate": 7.016504991533727e-07, | |
| "loss": 6.3534, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 0.01071876802008073, | |
| "grad_norm": 35.218048095703125, | |
| "learning_rate": 6.421379363065142e-07, | |
| "loss": 5.9496, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 0.010854448627929853, | |
| "grad_norm": 34.13999557495117, | |
| "learning_rate": 5.848888922025553e-07, | |
| "loss": 5.9489, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.010990129235778976, | |
| "grad_norm": 33.84051513671875, | |
| "learning_rate": 5.299731159831953e-07, | |
| "loss": 5.8639, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 0.0111258098436281, | |
| "grad_norm": 36.259944915771484, | |
| "learning_rate": 4.774575140626317e-07, | |
| "loss": 6.283, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 0.011261490451477223, | |
| "grad_norm": 32.591651916503906, | |
| "learning_rate": 4.27406068612396e-07, | |
| "loss": 6.2367, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 0.011397171059326345, | |
| "grad_norm": 35.87070083618164, | |
| "learning_rate": 3.798797596089351e-07, | |
| "loss": 6.3597, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 0.01153285166717547, | |
| "grad_norm": 35.934539794921875, | |
| "learning_rate": 3.3493649053890325e-07, | |
| "loss": 5.7746, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 0.011668532275024592, | |
| "grad_norm": 35.99143981933594, | |
| "learning_rate": 2.9263101785268253e-07, | |
| "loss": 6.9046, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 0.011804212882873715, | |
| "grad_norm": 32.2277946472168, | |
| "learning_rate": 2.53014884252083e-07, | |
| "loss": 6.1874, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 0.01193989349072284, | |
| "grad_norm": 38.41813659667969, | |
| "learning_rate": 2.1613635589349756e-07, | |
| "loss": 6.0549, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 0.012075574098571962, | |
| "grad_norm": 35.493804931640625, | |
| "learning_rate": 1.8204036358303173e-07, | |
| "loss": 6.046, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 0.012211254706421084, | |
| "grad_norm": 34.95344543457031, | |
| "learning_rate": 1.507684480352292e-07, | |
| "loss": 5.976, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.012346935314270209, | |
| "grad_norm": 32.631591796875, | |
| "learning_rate": 1.223587092621162e-07, | |
| "loss": 5.7902, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 0.012482615922119331, | |
| "grad_norm": 35.305580139160156, | |
| "learning_rate": 9.684576015420277e-08, | |
| "loss": 6.4926, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 0.012618296529968454, | |
| "grad_norm": 35.67231369018555, | |
| "learning_rate": 7.426068431000883e-08, | |
| "loss": 5.8871, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 0.012753977137817578, | |
| "grad_norm": 38.47718811035156, | |
| "learning_rate": 5.463099816548578e-08, | |
| "loss": 5.4537, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 0.0128896577456667, | |
| "grad_norm": 39.857582092285156, | |
| "learning_rate": 3.798061746947995e-08, | |
| "loss": 5.6496, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 0.013025338353515823, | |
| "grad_norm": 35.418609619140625, | |
| "learning_rate": 2.4329828146074096e-08, | |
| "loss": 6.1474, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 0.013161018961364948, | |
| "grad_norm": 32.19925308227539, | |
| "learning_rate": 1.3695261579316776e-08, | |
| "loss": 6.7492, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 0.01329669956921407, | |
| "grad_norm": 39.599151611328125, | |
| "learning_rate": 6.089874350439507e-09, | |
| "loss": 5.7039, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 0.013432380177063193, | |
| "grad_norm": 38.118282318115234, | |
| "learning_rate": 1.5229324522605949e-09, | |
| "loss": 5.5559, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 0.013568060784912316, | |
| "grad_norm": 35.434478759765625, | |
| "learning_rate": 0.0, | |
| "loss": 8.8397, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.013568060784912316, | |
| "eval_loss": 5.546361923217773, | |
| "eval_runtime": 993.065, | |
| "eval_samples_per_second": 12.5, | |
| "eval_steps_per_second": 3.126, | |
| "step": 100 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 100, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "EarlyStoppingCallback": { | |
| "args": { | |
| "early_stopping_patience": 5, | |
| "early_stopping_threshold": 0.0 | |
| }, | |
| "attributes": { | |
| "early_stopping_patience_counter": 0 | |
| } | |
| }, | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.483800336924672e+17, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |