Instructions to use pp-beta/newmodel with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use pp-beta/newmodel with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("NousResearch/Nous-Hermes-2-Mistral-7B-DPO") model = PeftModel.from_pretrained(base_model, "pp-beta/newmodel") - Notebooks
- Google Colab
- Kaggle
Download checkpoint-804/trainer_state.json from pp-beta/newmodel: direct link, hf CLI and curl.
- Browser
- Download file 35.6 kB
-
https://huggingface.co/pp-beta/newmodel/resolve/main/checkpoint-804/trainer_state.json
- Command line
-
hf download hf://pp-beta/newmodel/checkpoint-804/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/pp-beta/newmodel/resolve/main/checkpoint-804/trainer_state.json
35.6 kB
| { | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.9993784959602238, | |
| "eval_steps": 500, | |
| "global_step": 804, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.004972032318210068, | |
| "grad_norm": 2.5709357261657715, | |
| "learning_rate": 3.3333333333333335e-05, | |
| "loss": 1.307, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.009944064636420136, | |
| "grad_norm": 1.4358521699905396, | |
| "learning_rate": 6.666666666666667e-05, | |
| "loss": 1.1509, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.014916096954630205, | |
| "grad_norm": 1.1599832773208618, | |
| "learning_rate": 0.0001, | |
| "loss": 0.9128, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.019888129272840272, | |
| "grad_norm": 0.9250568747520447, | |
| "learning_rate": 0.00013333333333333334, | |
| "loss": 0.7575, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.024860161591050343, | |
| "grad_norm": 0.6691205501556396, | |
| "learning_rate": 0.0001666666666666667, | |
| "loss": 0.6885, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.02983219390926041, | |
| "grad_norm": 0.6702026128768921, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6703, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.03480422622747048, | |
| "grad_norm": 0.6191584467887878, | |
| "learning_rate": 0.00019998702249713748, | |
| "loss": 0.6191, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.039776258545680544, | |
| "grad_norm": 0.585008978843689, | |
| "learning_rate": 0.0001999480933568615, | |
| "loss": 0.6302, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.044748290863890615, | |
| "grad_norm": 0.5618470907211304, | |
| "learning_rate": 0.00019988322268323268, | |
| "loss": 0.6047, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.049720323182100686, | |
| "grad_norm": 0.5016953945159912, | |
| "learning_rate": 0.00019979242731343804, | |
| "loss": 0.6009, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.05469235550031075, | |
| "grad_norm": 0.4973951578140259, | |
| "learning_rate": 0.00019967573081342103, | |
| "loss": 0.5741, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.05966438781852082, | |
| "grad_norm": 0.5195545554161072, | |
| "learning_rate": 0.00019953316347176488, | |
| "loss": 0.5883, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.06463642013673089, | |
| "grad_norm": 0.4920307993888855, | |
| "learning_rate": 0.00019936476229183133, | |
| "loss": 0.557, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 0.06960845245494096, | |
| "grad_norm": 0.4726178050041199, | |
| "learning_rate": 0.0001991705709821562, | |
| "loss": 0.534, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 0.07458048477315103, | |
| "grad_norm": 0.5112979412078857, | |
| "learning_rate": 0.0001989506399451051, | |
| "loss": 0.5725, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.07955251709136109, | |
| "grad_norm": 0.4693872034549713, | |
| "learning_rate": 0.00019870502626379127, | |
| "loss": 0.5515, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 0.08452454940957116, | |
| "grad_norm": 0.5028090476989746, | |
| "learning_rate": 0.00019843379368725977, | |
| "loss": 0.5525, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 0.08949658172778123, | |
| "grad_norm": 0.4817284345626831, | |
| "learning_rate": 0.00019813701261394136, | |
| "loss": 0.5563, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 0.0944686140459913, | |
| "grad_norm": 0.4770365357398987, | |
| "learning_rate": 0.00019781476007338058, | |
| "loss": 0.551, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 0.09944064636420137, | |
| "grad_norm": 0.4698512554168701, | |
| "learning_rate": 0.0001974671197062428, | |
| "loss": 0.55, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.10441267868241144, | |
| "grad_norm": 0.4815049469470978, | |
| "learning_rate": 0.0001970941817426052, | |
| "loss": 0.5324, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 0.1093847110006215, | |
| "grad_norm": 0.47757378220558167, | |
| "learning_rate": 0.00019669604297853764, | |
| "loss": 0.5403, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 0.11435674331883157, | |
| "grad_norm": 0.5221468806266785, | |
| "learning_rate": 0.00019627280675097908, | |
| "loss": 0.5585, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 0.11932877563704164, | |
| "grad_norm": 0.5312801599502563, | |
| "learning_rate": 0.00019582458291091663, | |
| "loss": 0.5434, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 0.12430080795525171, | |
| "grad_norm": 0.4535232186317444, | |
| "learning_rate": 0.00019535148779487363, | |
| "loss": 0.566, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.12927284027346178, | |
| "grad_norm": 0.45621493458747864, | |
| "learning_rate": 0.00019485364419471454, | |
| "loss": 0.5339, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 0.13424487259167184, | |
| "grad_norm": 0.4411988854408264, | |
| "learning_rate": 0.0001943311813257743, | |
| "loss": 0.5377, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 0.13921690490988192, | |
| "grad_norm": 0.4519474506378174, | |
| "learning_rate": 0.00019378423479332046, | |
| "loss": 0.5392, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 0.14418893722809198, | |
| "grad_norm": 0.4649061858654022, | |
| "learning_rate": 0.0001932129465573568, | |
| "loss": 0.5258, | |
| "step": 116 | |
| }, | |
| { | |
| "epoch": 0.14916096954630206, | |
| "grad_norm": 0.44414597749710083, | |
| "learning_rate": 0.00019261746489577765, | |
| "loss": 0.5237, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.15413300186451212, | |
| "grad_norm": 0.4718000590801239, | |
| "learning_rate": 0.00019199794436588243, | |
| "loss": 0.5323, | |
| "step": 124 | |
| }, | |
| { | |
| "epoch": 0.15910503418272218, | |
| "grad_norm": 0.43624797463417053, | |
| "learning_rate": 0.0001913545457642601, | |
| "loss": 0.5179, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 0.16407706650093226, | |
| "grad_norm": 0.47694411873817444, | |
| "learning_rate": 0.00019068743608505455, | |
| "loss": 0.54, | |
| "step": 132 | |
| }, | |
| { | |
| "epoch": 0.16904909881914232, | |
| "grad_norm": 0.4488740861415863, | |
| "learning_rate": 0.0001899967884766212, | |
| "loss": 0.5071, | |
| "step": 136 | |
| }, | |
| { | |
| "epoch": 0.1740211311373524, | |
| "grad_norm": 0.4883563220500946, | |
| "learning_rate": 0.00018928278219658643, | |
| "loss": 0.5273, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.17899316345556246, | |
| "grad_norm": 0.4428342878818512, | |
| "learning_rate": 0.000188545602565321, | |
| "loss": 0.5205, | |
| "step": 144 | |
| }, | |
| { | |
| "epoch": 0.18396519577377252, | |
| "grad_norm": 0.4439612925052643, | |
| "learning_rate": 0.00018778544091784048, | |
| "loss": 0.5169, | |
| "step": 148 | |
| }, | |
| { | |
| "epoch": 0.1889372280919826, | |
| "grad_norm": 0.5181368589401245, | |
| "learning_rate": 0.00018700249455414394, | |
| "loss": 0.52, | |
| "step": 152 | |
| }, | |
| { | |
| "epoch": 0.19390926041019266, | |
| "grad_norm": 0.4589499831199646, | |
| "learning_rate": 0.00018619696668800492, | |
| "loss": 0.5212, | |
| "step": 156 | |
| }, | |
| { | |
| "epoch": 0.19888129272840274, | |
| "grad_norm": 0.4652368724346161, | |
| "learning_rate": 0.00018536906639422725, | |
| "loss": 0.5058, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.2038533250466128, | |
| "grad_norm": 0.4471285343170166, | |
| "learning_rate": 0.0001845190085543795, | |
| "loss": 0.5139, | |
| "step": 164 | |
| }, | |
| { | |
| "epoch": 0.20882535736482288, | |
| "grad_norm": 0.4473588466644287, | |
| "learning_rate": 0.00018364701380102266, | |
| "loss": 0.5011, | |
| "step": 168 | |
| }, | |
| { | |
| "epoch": 0.21379738968303294, | |
| "grad_norm": 0.46769270300865173, | |
| "learning_rate": 0.000182753308460445, | |
| "loss": 0.5095, | |
| "step": 172 | |
| }, | |
| { | |
| "epoch": 0.218769422001243, | |
| "grad_norm": 0.4742557108402252, | |
| "learning_rate": 0.0001818381244939187, | |
| "loss": 0.522, | |
| "step": 176 | |
| }, | |
| { | |
| "epoch": 0.22374145431945308, | |
| "grad_norm": 0.4403395354747772, | |
| "learning_rate": 0.00018090169943749476, | |
| "loss": 0.5067, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.22871348663766314, | |
| "grad_norm": 0.4548196792602539, | |
| "learning_rate": 0.00017994427634035015, | |
| "loss": 0.5079, | |
| "step": 184 | |
| }, | |
| { | |
| "epoch": 0.23368551895587322, | |
| "grad_norm": 0.48214584589004517, | |
| "learning_rate": 0.0001789661037017045, | |
| "loss": 0.4928, | |
| "step": 188 | |
| }, | |
| { | |
| "epoch": 0.23865755127408328, | |
| "grad_norm": 0.4306032061576843, | |
| "learning_rate": 0.00017796743540632223, | |
| "loss": 0.5083, | |
| "step": 192 | |
| }, | |
| { | |
| "epoch": 0.24362958359229334, | |
| "grad_norm": 0.4764976501464844, | |
| "learning_rate": 0.00017694853065861662, | |
| "loss": 0.4956, | |
| "step": 196 | |
| }, | |
| { | |
| "epoch": 0.24860161591050342, | |
| "grad_norm": 0.4228585958480835, | |
| "learning_rate": 0.00017590965391537316, | |
| "loss": 0.5158, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.2535736482287135, | |
| "grad_norm": 0.4141365587711334, | |
| "learning_rate": 0.00017485107481711012, | |
| "loss": 0.4989, | |
| "step": 204 | |
| }, | |
| { | |
| "epoch": 0.25854568054692356, | |
| "grad_norm": 0.45275670289993286, | |
| "learning_rate": 0.00017377306811809304, | |
| "loss": 0.4952, | |
| "step": 208 | |
| }, | |
| { | |
| "epoch": 0.26351771286513365, | |
| "grad_norm": 0.4202629327774048, | |
| "learning_rate": 0.00017267591361502232, | |
| "loss": 0.5082, | |
| "step": 212 | |
| }, | |
| { | |
| "epoch": 0.2684897451833437, | |
| "grad_norm": 0.4502929449081421, | |
| "learning_rate": 0.00017155989607441213, | |
| "loss": 0.4974, | |
| "step": 216 | |
| }, | |
| { | |
| "epoch": 0.27346177750155376, | |
| "grad_norm": 0.4718655049800873, | |
| "learning_rate": 0.00017042530515867896, | |
| "loss": 0.5041, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.27843380981976384, | |
| "grad_norm": 0.43044278025627136, | |
| "learning_rate": 0.00016927243535095997, | |
| "loss": 0.5007, | |
| "step": 224 | |
| }, | |
| { | |
| "epoch": 0.2834058421379739, | |
| "grad_norm": 0.4416678249835968, | |
| "learning_rate": 0.00016810158587867973, | |
| "loss": 0.5075, | |
| "step": 228 | |
| }, | |
| { | |
| "epoch": 0.28837787445618396, | |
| "grad_norm": 0.44607338309288025, | |
| "learning_rate": 0.00016691306063588583, | |
| "loss": 0.4979, | |
| "step": 232 | |
| }, | |
| { | |
| "epoch": 0.29334990677439404, | |
| "grad_norm": 0.44135963916778564, | |
| "learning_rate": 0.0001657071681043731, | |
| "loss": 0.5008, | |
| "step": 236 | |
| }, | |
| { | |
| "epoch": 0.2983219390926041, | |
| "grad_norm": 0.4461626410484314, | |
| "learning_rate": 0.00016448422127361706, | |
| "loss": 0.4994, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.30329397141081416, | |
| "grad_norm": 0.4296169877052307, | |
| "learning_rate": 0.00016324453755953773, | |
| "loss": 0.508, | |
| "step": 244 | |
| }, | |
| { | |
| "epoch": 0.30826600372902424, | |
| "grad_norm": 0.4123411476612091, | |
| "learning_rate": 0.00016198843872211404, | |
| "loss": 0.491, | |
| "step": 248 | |
| }, | |
| { | |
| "epoch": 0.3132380360472343, | |
| "grad_norm": 0.4264468252658844, | |
| "learning_rate": 0.00016071625078187114, | |
| "loss": 0.5015, | |
| "step": 252 | |
| }, | |
| { | |
| "epoch": 0.31821006836544435, | |
| "grad_norm": 0.4258119761943817, | |
| "learning_rate": 0.00015942830393526176, | |
| "loss": 0.4982, | |
| "step": 256 | |
| }, | |
| { | |
| "epoch": 0.32318210068365444, | |
| "grad_norm": 0.44614851474761963, | |
| "learning_rate": 0.00015812493246896366, | |
| "loss": 0.5014, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.3281541330018645, | |
| "grad_norm": 0.4335807263851166, | |
| "learning_rate": 0.00015680647467311557, | |
| "loss": 0.4919, | |
| "step": 264 | |
| }, | |
| { | |
| "epoch": 0.3331261653200746, | |
| "grad_norm": 0.4183286726474762, | |
| "learning_rate": 0.0001554732727535139, | |
| "loss": 0.477, | |
| "step": 268 | |
| }, | |
| { | |
| "epoch": 0.33809819763828464, | |
| "grad_norm": 0.43014243245124817, | |
| "learning_rate": 0.00015412567274279316, | |
| "loss": 0.4684, | |
| "step": 272 | |
| }, | |
| { | |
| "epoch": 0.3430702299564947, | |
| "grad_norm": 0.4089718163013458, | |
| "learning_rate": 0.0001527640244106133, | |
| "loss": 0.4927, | |
| "step": 276 | |
| }, | |
| { | |
| "epoch": 0.3480422622747048, | |
| "grad_norm": 0.40746763348579407, | |
| "learning_rate": 0.0001513886811728769, | |
| "loss": 0.4868, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.35301429459291483, | |
| "grad_norm": 0.4374973177909851, | |
| "learning_rate": 0.00015000000000000001, | |
| "loss": 0.4826, | |
| "step": 284 | |
| }, | |
| { | |
| "epoch": 0.3579863269111249, | |
| "grad_norm": 0.4501773715019226, | |
| "learning_rate": 0.0001485983413242606, | |
| "loss": 0.4952, | |
| "step": 288 | |
| }, | |
| { | |
| "epoch": 0.362958359229335, | |
| "grad_norm": 0.4177991449832916, | |
| "learning_rate": 0.0001471840689462482, | |
| "loss": 0.49, | |
| "step": 292 | |
| }, | |
| { | |
| "epoch": 0.36793039154754503, | |
| "grad_norm": 0.4343775510787964, | |
| "learning_rate": 0.00014575754994043956, | |
| "loss": 0.4872, | |
| "step": 296 | |
| }, | |
| { | |
| "epoch": 0.3729024238657551, | |
| "grad_norm": 0.45072102546691895, | |
| "learning_rate": 0.00014431915455992414, | |
| "loss": 0.4907, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.3778744561839652, | |
| "grad_norm": 0.4326207637786865, | |
| "learning_rate": 0.00014286925614030542, | |
| "loss": 0.4885, | |
| "step": 304 | |
| }, | |
| { | |
| "epoch": 0.3828464885021753, | |
| "grad_norm": 0.4340527653694153, | |
| "learning_rate": 0.0001414082310028012, | |
| "loss": 0.4772, | |
| "step": 308 | |
| }, | |
| { | |
| "epoch": 0.3878185208203853, | |
| "grad_norm": 0.4523162841796875, | |
| "learning_rate": 0.00013993645835656953, | |
| "loss": 0.4959, | |
| "step": 312 | |
| }, | |
| { | |
| "epoch": 0.3927905531385954, | |
| "grad_norm": 0.4163872003555298, | |
| "learning_rate": 0.0001384543202002851, | |
| "loss": 0.4889, | |
| "step": 316 | |
| }, | |
| { | |
| "epoch": 0.3977625854568055, | |
| "grad_norm": 0.417036771774292, | |
| "learning_rate": 0.00013696220122299112, | |
| "loss": 0.5005, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.4027346177750155, | |
| "grad_norm": 0.43414178490638733, | |
| "learning_rate": 0.00013546048870425356, | |
| "loss": 0.489, | |
| "step": 324 | |
| }, | |
| { | |
| "epoch": 0.4077066500932256, | |
| "grad_norm": 0.4082673192024231, | |
| "learning_rate": 0.00013394957241364273, | |
| "loss": 0.4767, | |
| "step": 328 | |
| }, | |
| { | |
| "epoch": 0.4126786824114357, | |
| "grad_norm": 0.4241110682487488, | |
| "learning_rate": 0.00013242984450956828, | |
| "loss": 0.4757, | |
| "step": 332 | |
| }, | |
| { | |
| "epoch": 0.41765071472964577, | |
| "grad_norm": 0.4089127480983734, | |
| "learning_rate": 0.00013090169943749476, | |
| "loss": 0.4698, | |
| "step": 336 | |
| }, | |
| { | |
| "epoch": 0.4226227470478558, | |
| "grad_norm": 0.4317830502986908, | |
| "learning_rate": 0.0001293655338275631, | |
| "loss": 0.495, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.4275947793660659, | |
| "grad_norm": 0.4141937792301178, | |
| "learning_rate": 0.0001278217463916453, | |
| "loss": 0.4813, | |
| "step": 344 | |
| }, | |
| { | |
| "epoch": 0.43256681168427596, | |
| "grad_norm": 0.4085291624069214, | |
| "learning_rate": 0.0001262707378198587, | |
| "loss": 0.4838, | |
| "step": 348 | |
| }, | |
| { | |
| "epoch": 0.437538844002486, | |
| "grad_norm": 0.4401163160800934, | |
| "learning_rate": 0.00012471291067656697, | |
| "loss": 0.4725, | |
| "step": 352 | |
| }, | |
| { | |
| "epoch": 0.4425108763206961, | |
| "grad_norm": 0.4499000310897827, | |
| "learning_rate": 0.00012314866929589432, | |
| "loss": 0.4738, | |
| "step": 356 | |
| }, | |
| { | |
| "epoch": 0.44748290863890616, | |
| "grad_norm": 0.4250274896621704, | |
| "learning_rate": 0.00012157841967678063, | |
| "loss": 0.48, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.45245494095711625, | |
| "grad_norm": 0.4591006934642792, | |
| "learning_rate": 0.00012000256937760445, | |
| "loss": 0.4898, | |
| "step": 364 | |
| }, | |
| { | |
| "epoch": 0.4574269732753263, | |
| "grad_norm": 0.42636924982070923, | |
| "learning_rate": 0.00011842152741040116, | |
| "loss": 0.4736, | |
| "step": 368 | |
| }, | |
| { | |
| "epoch": 0.46239900559353636, | |
| "grad_norm": 0.41370445489883423, | |
| "learning_rate": 0.00011683570413470383, | |
| "loss": 0.479, | |
| "step": 372 | |
| }, | |
| { | |
| "epoch": 0.46737103791174645, | |
| "grad_norm": 0.41576653718948364, | |
| "learning_rate": 0.00011524551115103454, | |
| "loss": 0.4684, | |
| "step": 376 | |
| }, | |
| { | |
| "epoch": 0.4723430702299565, | |
| "grad_norm": 0.4330123960971832, | |
| "learning_rate": 0.00011365136119407319, | |
| "loss": 0.4642, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.47731510254816656, | |
| "grad_norm": 0.43045657873153687, | |
| "learning_rate": 0.0001120536680255323, | |
| "loss": 0.483, | |
| "step": 384 | |
| }, | |
| { | |
| "epoch": 0.48228713486637664, | |
| "grad_norm": 0.4194320738315582, | |
| "learning_rate": 0.00011045284632676536, | |
| "loss": 0.4621, | |
| "step": 388 | |
| }, | |
| { | |
| "epoch": 0.4872591671845867, | |
| "grad_norm": 0.40911245346069336, | |
| "learning_rate": 0.00010884931159113586, | |
| "loss": 0.482, | |
| "step": 392 | |
| }, | |
| { | |
| "epoch": 0.49223119950279676, | |
| "grad_norm": 0.4329901337623596, | |
| "learning_rate": 0.00010724348001617625, | |
| "loss": 0.4743, | |
| "step": 396 | |
| }, | |
| { | |
| "epoch": 0.49720323182100684, | |
| "grad_norm": 0.42870208621025085, | |
| "learning_rate": 0.00010563576839556374, | |
| "loss": 0.4658, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.5021752641392169, | |
| "grad_norm": 0.43135136365890503, | |
| "learning_rate": 0.00010402659401094152, | |
| "loss": 0.4651, | |
| "step": 404 | |
| }, | |
| { | |
| "epoch": 0.507147296457427, | |
| "grad_norm": 0.41581398248672485, | |
| "learning_rate": 0.00010241637452361323, | |
| "loss": 0.481, | |
| "step": 408 | |
| }, | |
| { | |
| "epoch": 0.512119328775637, | |
| "grad_norm": 0.4430304169654846, | |
| "learning_rate": 0.00010080552786613899, | |
| "loss": 0.467, | |
| "step": 412 | |
| }, | |
| { | |
| "epoch": 0.5170913610938471, | |
| "grad_norm": 0.4333083927631378, | |
| "learning_rate": 9.919447213386103e-05, | |
| "loss": 0.4659, | |
| "step": 416 | |
| }, | |
| { | |
| "epoch": 0.5220633934120572, | |
| "grad_norm": 0.42966219782829285, | |
| "learning_rate": 9.75836254763868e-05, | |
| "loss": 0.4608, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.5270354257302673, | |
| "grad_norm": 0.44130048155784607, | |
| "learning_rate": 9.597340598905852e-05, | |
| "loss": 0.451, | |
| "step": 424 | |
| }, | |
| { | |
| "epoch": 0.5320074580484773, | |
| "grad_norm": 0.42254915833473206, | |
| "learning_rate": 9.436423160443625e-05, | |
| "loss": 0.4657, | |
| "step": 428 | |
| }, | |
| { | |
| "epoch": 0.5369794903666874, | |
| "grad_norm": 0.4129006266593933, | |
| "learning_rate": 9.275651998382377e-05, | |
| "loss": 0.4635, | |
| "step": 432 | |
| }, | |
| { | |
| "epoch": 0.5419515226848974, | |
| "grad_norm": 0.43645158410072327, | |
| "learning_rate": 9.115068840886417e-05, | |
| "loss": 0.4568, | |
| "step": 436 | |
| }, | |
| { | |
| "epoch": 0.5469235550031075, | |
| "grad_norm": 0.41948822140693665, | |
| "learning_rate": 8.954715367323468e-05, | |
| "loss": 0.4655, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.5518955873213176, | |
| "grad_norm": 0.4248465895652771, | |
| "learning_rate": 8.79463319744677e-05, | |
| "loss": 0.4694, | |
| "step": 444 | |
| }, | |
| { | |
| "epoch": 0.5568676196395277, | |
| "grad_norm": 0.42567265033721924, | |
| "learning_rate": 8.634863880592686e-05, | |
| "loss": 0.454, | |
| "step": 448 | |
| }, | |
| { | |
| "epoch": 0.5618396519577378, | |
| "grad_norm": 0.4329916834831238, | |
| "learning_rate": 8.475448884896547e-05, | |
| "loss": 0.4609, | |
| "step": 452 | |
| }, | |
| { | |
| "epoch": 0.5668116842759477, | |
| "grad_norm": 0.40616366267204285, | |
| "learning_rate": 8.316429586529615e-05, | |
| "loss": 0.4641, | |
| "step": 456 | |
| }, | |
| { | |
| "epoch": 0.5717837165941578, | |
| "grad_norm": 0.4116172790527344, | |
| "learning_rate": 8.157847258959885e-05, | |
| "loss": 0.4484, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.5767557489123679, | |
| "grad_norm": 0.43640103936195374, | |
| "learning_rate": 7.999743062239557e-05, | |
| "loss": 0.4582, | |
| "step": 464 | |
| }, | |
| { | |
| "epoch": 0.581727781230578, | |
| "grad_norm": 0.41392359137535095, | |
| "learning_rate": 7.84215803232194e-05, | |
| "loss": 0.4434, | |
| "step": 468 | |
| }, | |
| { | |
| "epoch": 0.5866998135487881, | |
| "grad_norm": 0.4084075093269348, | |
| "learning_rate": 7.685133070410571e-05, | |
| "loss": 0.4722, | |
| "step": 472 | |
| }, | |
| { | |
| "epoch": 0.5916718458669982, | |
| "grad_norm": 0.4227941632270813, | |
| "learning_rate": 7.528708932343304e-05, | |
| "loss": 0.4517, | |
| "step": 476 | |
| }, | |
| { | |
| "epoch": 0.5966438781852083, | |
| "grad_norm": 0.44045257568359375, | |
| "learning_rate": 7.372926218014131e-05, | |
| "loss": 0.4625, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.6016159105034182, | |
| "grad_norm": 0.4112107753753662, | |
| "learning_rate": 7.217825360835473e-05, | |
| "loss": 0.4539, | |
| "step": 484 | |
| }, | |
| { | |
| "epoch": 0.6065879428216283, | |
| "grad_norm": 0.4590305685997009, | |
| "learning_rate": 7.063446617243694e-05, | |
| "loss": 0.4518, | |
| "step": 488 | |
| }, | |
| { | |
| "epoch": 0.6115599751398384, | |
| "grad_norm": 0.4143747389316559, | |
| "learning_rate": 6.909830056250527e-05, | |
| "loss": 0.4495, | |
| "step": 492 | |
| }, | |
| { | |
| "epoch": 0.6165320074580485, | |
| "grad_norm": 0.4207197427749634, | |
| "learning_rate": 6.757015549043175e-05, | |
| "loss": 0.4594, | |
| "step": 496 | |
| }, | |
| { | |
| "epoch": 0.6215040397762586, | |
| "grad_norm": 0.4427318274974823, | |
| "learning_rate": 6.605042758635729e-05, | |
| "loss": 0.4483, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.6264760720944687, | |
| "grad_norm": 0.42062947154045105, | |
| "learning_rate": 6.453951129574644e-05, | |
| "loss": 0.4548, | |
| "step": 504 | |
| }, | |
| { | |
| "epoch": 0.6314481044126787, | |
| "grad_norm": 0.40602120757102966, | |
| "learning_rate": 6.30377987770089e-05, | |
| "loss": 0.4541, | |
| "step": 508 | |
| }, | |
| { | |
| "epoch": 0.6364201367308887, | |
| "grad_norm": 0.4235445261001587, | |
| "learning_rate": 6.154567979971493e-05, | |
| "loss": 0.4547, | |
| "step": 512 | |
| }, | |
| { | |
| "epoch": 0.6413921690490988, | |
| "grad_norm": 0.4362446367740631, | |
| "learning_rate": 6.006354164343046e-05, | |
| "loss": 0.4648, | |
| "step": 516 | |
| }, | |
| { | |
| "epoch": 0.6463642013673089, | |
| "grad_norm": 0.4211137890815735, | |
| "learning_rate": 5.859176899719883e-05, | |
| "loss": 0.4467, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.651336233685519, | |
| "grad_norm": 0.423961341381073, | |
| "learning_rate": 5.713074385969457e-05, | |
| "loss": 0.4554, | |
| "step": 524 | |
| }, | |
| { | |
| "epoch": 0.656308266003729, | |
| "grad_norm": 0.4417620003223419, | |
| "learning_rate": 5.568084544007588e-05, | |
| "loss": 0.4681, | |
| "step": 528 | |
| }, | |
| { | |
| "epoch": 0.6612802983219391, | |
| "grad_norm": 0.4363749921321869, | |
| "learning_rate": 5.424245005956048e-05, | |
| "loss": 0.4389, | |
| "step": 532 | |
| }, | |
| { | |
| "epoch": 0.6662523306401492, | |
| "grad_norm": 0.42354437708854675, | |
| "learning_rate": 5.28159310537518e-05, | |
| "loss": 0.4524, | |
| "step": 536 | |
| }, | |
| { | |
| "epoch": 0.6712243629583592, | |
| "grad_norm": 0.42178061604499817, | |
| "learning_rate": 5.14016586757394e-05, | |
| "loss": 0.4473, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.6761963952765693, | |
| "grad_norm": 0.4353598356246948, | |
| "learning_rate": 5.000000000000002e-05, | |
| "loss": 0.4473, | |
| "step": 544 | |
| }, | |
| { | |
| "epoch": 0.6811684275947794, | |
| "grad_norm": 0.4380674362182617, | |
| "learning_rate": 4.861131882712314e-05, | |
| "loss": 0.4579, | |
| "step": 548 | |
| }, | |
| { | |
| "epoch": 0.6861404599129894, | |
| "grad_norm": 0.4278354048728943, | |
| "learning_rate": 4.723597558938672e-05, | |
| "loss": 0.4355, | |
| "step": 552 | |
| }, | |
| { | |
| "epoch": 0.6911124922311995, | |
| "grad_norm": 0.41823214292526245, | |
| "learning_rate": 4.587432725720687e-05, | |
| "loss": 0.4394, | |
| "step": 556 | |
| }, | |
| { | |
| "epoch": 0.6960845245494096, | |
| "grad_norm": 0.43046334385871887, | |
| "learning_rate": 4.452672724648611e-05, | |
| "loss": 0.4529, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.7010565568676196, | |
| "grad_norm": 0.430922269821167, | |
| "learning_rate": 4.3193525326884435e-05, | |
| "loss": 0.4462, | |
| "step": 564 | |
| }, | |
| { | |
| "epoch": 0.7060285891858297, | |
| "grad_norm": 0.4363158345222473, | |
| "learning_rate": 4.1875067531036374e-05, | |
| "loss": 0.458, | |
| "step": 568 | |
| }, | |
| { | |
| "epoch": 0.7110006215040398, | |
| "grad_norm": 0.41834723949432373, | |
| "learning_rate": 4.057169606473827e-05, | |
| "loss": 0.4548, | |
| "step": 572 | |
| }, | |
| { | |
| "epoch": 0.7159726538222498, | |
| "grad_norm": 0.4106977880001068, | |
| "learning_rate": 3.9283749218128885e-05, | |
| "loss": 0.463, | |
| "step": 576 | |
| }, | |
| { | |
| "epoch": 0.7209446861404599, | |
| "grad_norm": 0.45078086853027344, | |
| "learning_rate": 3.8011561277885964e-05, | |
| "loss": 0.4459, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.72591671845867, | |
| "grad_norm": 0.4266386330127716, | |
| "learning_rate": 3.675546244046228e-05, | |
| "loss": 0.438, | |
| "step": 584 | |
| }, | |
| { | |
| "epoch": 0.7308887507768801, | |
| "grad_norm": 0.4289485514163971, | |
| "learning_rate": 3.5515778726382966e-05, | |
| "loss": 0.4522, | |
| "step": 588 | |
| }, | |
| { | |
| "epoch": 0.7358607830950901, | |
| "grad_norm": 0.4158768057823181, | |
| "learning_rate": 3.429283189562694e-05, | |
| "loss": 0.4424, | |
| "step": 592 | |
| }, | |
| { | |
| "epoch": 0.7408328154133001, | |
| "grad_norm": 0.4208343029022217, | |
| "learning_rate": 3.308693936411421e-05, | |
| "loss": 0.4311, | |
| "step": 596 | |
| }, | |
| { | |
| "epoch": 0.7458048477315102, | |
| "grad_norm": 0.44292351603507996, | |
| "learning_rate": 3.1898414121320276e-05, | |
| "loss": 0.4454, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.7507768800497203, | |
| "grad_norm": 0.4283224940299988, | |
| "learning_rate": 3.072756464904006e-05, | |
| "loss": 0.4323, | |
| "step": 604 | |
| }, | |
| { | |
| "epoch": 0.7557489123679304, | |
| "grad_norm": 0.4522048234939575, | |
| "learning_rate": 2.9574694841321082e-05, | |
| "loss": 0.4514, | |
| "step": 608 | |
| }, | |
| { | |
| "epoch": 0.7607209446861405, | |
| "grad_norm": 0.41480395197868347, | |
| "learning_rate": 2.84401039255879e-05, | |
| "loss": 0.4422, | |
| "step": 612 | |
| }, | |
| { | |
| "epoch": 0.7656929770043506, | |
| "grad_norm": 0.43344831466674805, | |
| "learning_rate": 2.7324086384977698e-05, | |
| "loss": 0.443, | |
| "step": 616 | |
| }, | |
| { | |
| "epoch": 0.7706650093225605, | |
| "grad_norm": 0.4390140175819397, | |
| "learning_rate": 2.622693188190699e-05, | |
| "loss": 0.4655, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.7756370416407706, | |
| "grad_norm": 0.41029900312423706, | |
| "learning_rate": 2.514892518288988e-05, | |
| "loss": 0.4196, | |
| "step": 624 | |
| }, | |
| { | |
| "epoch": 0.7806090739589807, | |
| "grad_norm": 0.413832426071167, | |
| "learning_rate": 2.409034608462686e-05, | |
| "loss": 0.4396, | |
| "step": 628 | |
| }, | |
| { | |
| "epoch": 0.7855811062771908, | |
| "grad_norm": 0.43535104393959045, | |
| "learning_rate": 2.3051469341383402e-05, | |
| "loss": 0.4353, | |
| "step": 632 | |
| }, | |
| { | |
| "epoch": 0.7905531385954009, | |
| "grad_norm": 0.44554823637008667, | |
| "learning_rate": 2.2032564593677774e-05, | |
| "loss": 0.4568, | |
| "step": 636 | |
| }, | |
| { | |
| "epoch": 0.795525170913611, | |
| "grad_norm": 0.4224577844142914, | |
| "learning_rate": 2.1033896298295508e-05, | |
| "loss": 0.4414, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.800497203231821, | |
| "grad_norm": 0.4140743017196655, | |
| "learning_rate": 2.0055723659649904e-05, | |
| "loss": 0.4399, | |
| "step": 644 | |
| }, | |
| { | |
| "epoch": 0.805469235550031, | |
| "grad_norm": 0.43011415004730225, | |
| "learning_rate": 1.9098300562505266e-05, | |
| "loss": 0.4549, | |
| "step": 648 | |
| }, | |
| { | |
| "epoch": 0.8104412678682411, | |
| "grad_norm": 0.4245777130126953, | |
| "learning_rate": 1.8161875506081293e-05, | |
| "loss": 0.4444, | |
| "step": 652 | |
| }, | |
| { | |
| "epoch": 0.8154133001864512, | |
| "grad_norm": 0.44440820813179016, | |
| "learning_rate": 1.7246691539555028e-05, | |
| "loss": 0.46, | |
| "step": 656 | |
| }, | |
| { | |
| "epoch": 0.8203853325046613, | |
| "grad_norm": 0.414103627204895, | |
| "learning_rate": 1.6352986198977325e-05, | |
| "loss": 0.4532, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.8253573648228714, | |
| "grad_norm": 0.41898444294929504, | |
| "learning_rate": 1.5480991445620542e-05, | |
| "loss": 0.4517, | |
| "step": 664 | |
| }, | |
| { | |
| "epoch": 0.8303293971410814, | |
| "grad_norm": 0.4177073836326599, | |
| "learning_rate": 1.4630933605772801e-05, | |
| "loss": 0.4335, | |
| "step": 668 | |
| }, | |
| { | |
| "epoch": 0.8353014294592915, | |
| "grad_norm": 0.4281357228755951, | |
| "learning_rate": 1.3803033311995072e-05, | |
| "loss": 0.4573, | |
| "step": 672 | |
| }, | |
| { | |
| "epoch": 0.8402734617775015, | |
| "grad_norm": 0.4267916977405548, | |
| "learning_rate": 1.2997505445856084e-05, | |
| "loss": 0.4387, | |
| "step": 676 | |
| }, | |
| { | |
| "epoch": 0.8452454940957116, | |
| "grad_norm": 0.42911484837532043, | |
| "learning_rate": 1.2214559082159537e-05, | |
| "loss": 0.4339, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.8502175264139217, | |
| "grad_norm": 0.4185105264186859, | |
| "learning_rate": 1.1454397434679021e-05, | |
| "loss": 0.4453, | |
| "step": 684 | |
| }, | |
| { | |
| "epoch": 0.8551895587321318, | |
| "grad_norm": 0.4304141104221344, | |
| "learning_rate": 1.0717217803413604e-05, | |
| "loss": 0.4403, | |
| "step": 688 | |
| }, | |
| { | |
| "epoch": 0.8601615910503418, | |
| "grad_norm": 0.43691304326057434, | |
| "learning_rate": 1.0003211523378796e-05, | |
| "loss": 0.4349, | |
| "step": 692 | |
| }, | |
| { | |
| "epoch": 0.8651336233685519, | |
| "grad_norm": 0.4254210889339447, | |
| "learning_rate": 9.31256391494546e-06, | |
| "loss": 0.4312, | |
| "step": 696 | |
| }, | |
| { | |
| "epoch": 0.870105655686762, | |
| "grad_norm": 0.4237820506095886, | |
| "learning_rate": 8.645454235739903e-06, | |
| "loss": 0.4435, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.875077688004972, | |
| "grad_norm": 0.4290446639060974, | |
| "learning_rate": 8.002055634117578e-06, | |
| "loss": 0.4314, | |
| "step": 704 | |
| }, | |
| { | |
| "epoch": 0.8800497203231821, | |
| "grad_norm": 0.41713830828666687, | |
| "learning_rate": 7.382535104222366e-06, | |
| "loss": 0.4261, | |
| "step": 708 | |
| }, | |
| { | |
| "epoch": 0.8850217526413922, | |
| "grad_norm": 0.442330539226532, | |
| "learning_rate": 6.787053442643232e-06, | |
| "loss": 0.435, | |
| "step": 712 | |
| }, | |
| { | |
| "epoch": 0.8899937849596022, | |
| "grad_norm": 0.4291313588619232, | |
| "learning_rate": 6.215765206679569e-06, | |
| "loss": 0.4309, | |
| "step": 716 | |
| }, | |
| { | |
| "epoch": 0.8949658172778123, | |
| "grad_norm": 0.4301079511642456, | |
| "learning_rate": 5.668818674225685e-06, | |
| "loss": 0.442, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.8999378495960224, | |
| "grad_norm": 0.43183088302612305, | |
| "learning_rate": 5.146355805285452e-06, | |
| "loss": 0.4403, | |
| "step": 724 | |
| }, | |
| { | |
| "epoch": 0.9049098819142325, | |
| "grad_norm": 0.42470988631248474, | |
| "learning_rate": 4.648512205126376e-06, | |
| "loss": 0.4464, | |
| "step": 728 | |
| }, | |
| { | |
| "epoch": 0.9098819142324425, | |
| "grad_norm": 0.4176940619945526, | |
| "learning_rate": 4.175417089083378e-06, | |
| "loss": 0.4201, | |
| "step": 732 | |
| }, | |
| { | |
| "epoch": 0.9148539465506526, | |
| "grad_norm": 0.419644832611084, | |
| "learning_rate": 3.7271932490209328e-06, | |
| "loss": 0.4389, | |
| "step": 736 | |
| }, | |
| { | |
| "epoch": 0.9198259788688626, | |
| "grad_norm": 0.4146890640258789, | |
| "learning_rate": 3.3039570214623782e-06, | |
| "loss": 0.4538, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.9247980111870727, | |
| "grad_norm": 0.4463767409324646, | |
| "learning_rate": 2.905818257394799e-06, | |
| "loss": 0.4284, | |
| "step": 744 | |
| }, | |
| { | |
| "epoch": 0.9297700435052828, | |
| "grad_norm": 0.4303642511367798, | |
| "learning_rate": 2.532880293757223e-06, | |
| "loss": 0.4363, | |
| "step": 748 | |
| }, | |
| { | |
| "epoch": 0.9347420758234929, | |
| "grad_norm": 0.42455166578292847, | |
| "learning_rate": 2.1852399266194314e-06, | |
| "loss": 0.4615, | |
| "step": 752 | |
| }, | |
| { | |
| "epoch": 0.939714108141703, | |
| "grad_norm": 0.41838544607162476, | |
| "learning_rate": 1.8629873860586566e-06, | |
| "loss": 0.4357, | |
| "step": 756 | |
| }, | |
| { | |
| "epoch": 0.944686140459913, | |
| "grad_norm": 0.42117899656295776, | |
| "learning_rate": 1.566206312740226e-06, | |
| "loss": 0.4337, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.949658172778123, | |
| "grad_norm": 0.439235121011734, | |
| "learning_rate": 1.2949737362087156e-06, | |
| "loss": 0.4414, | |
| "step": 764 | |
| }, | |
| { | |
| "epoch": 0.9546302050963331, | |
| "grad_norm": 0.45641785860061646, | |
| "learning_rate": 1.0493600548948878e-06, | |
| "loss": 0.439, | |
| "step": 768 | |
| }, | |
| { | |
| "epoch": 0.9596022374145432, | |
| "grad_norm": 0.4211345314979553, | |
| "learning_rate": 8.294290178437969e-07, | |
| "loss": 0.4444, | |
| "step": 772 | |
| }, | |
| { | |
| "epoch": 0.9645742697327533, | |
| "grad_norm": 0.4054080843925476, | |
| "learning_rate": 6.352377081687011e-07, | |
| "loss": 0.4328, | |
| "step": 776 | |
| }, | |
| { | |
| "epoch": 0.9695463020509634, | |
| "grad_norm": 0.39851078391075134, | |
| "learning_rate": 4.668365282351372e-07, | |
| "loss": 0.4389, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.9745183343691733, | |
| "grad_norm": 0.42228272557258606, | |
| "learning_rate": 3.2426918657900704e-07, | |
| "loss": 0.43, | |
| "step": 784 | |
| }, | |
| { | |
| "epoch": 0.9794903666873834, | |
| "grad_norm": 0.42619001865386963, | |
| "learning_rate": 2.0757268656198537e-07, | |
| "loss": 0.4424, | |
| "step": 788 | |
| }, | |
| { | |
| "epoch": 0.9844623990055935, | |
| "grad_norm": 0.4146987199783325, | |
| "learning_rate": 1.1677731676733584e-07, | |
| "loss": 0.4475, | |
| "step": 792 | |
| }, | |
| { | |
| "epoch": 0.9894344313238036, | |
| "grad_norm": 0.39335352182388306, | |
| "learning_rate": 5.190664313851068e-08, | |
| "loss": 0.4391, | |
| "step": 796 | |
| }, | |
| { | |
| "epoch": 0.9944064636420137, | |
| "grad_norm": 0.418887734413147, | |
| "learning_rate": 1.2977502862532297e-08, | |
| "loss": 0.4308, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.9993784959602238, | |
| "grad_norm": 0.4512234926223755, | |
| "learning_rate": 0.0, | |
| "loss": 0.4518, | |
| "step": 804 | |
| } | |
| ], | |
| "logging_steps": 4, | |
| "max_steps": 804, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.314262857038168e+18, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |