Instructions to use Minutor/adaption_math_and_word_problem_soluti with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Minutor/adaption_math_and_word_problem_soluti with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("togethercomputer/Mistral-7B-Instruct-v0.2") model = PeftModel.from_pretrained(base_model, "Minutor/adaption_math_and_word_problem_soluti") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 3.0, | |
| "eval_steps": 28, | |
| "global_step": 141, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.02127659574468085, | |
| "grad_norm": 0.614821195602417, | |
| "learning_rate": 0.0, | |
| "loss": 0.81884765625, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.0425531914893617, | |
| "grad_norm": 0.8086351156234741, | |
| "learning_rate": 1.25e-06, | |
| "loss": 0.83984375, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.06382978723404255, | |
| "grad_norm": 0.5076808333396912, | |
| "learning_rate": 2.5e-06, | |
| "loss": 0.7861328125, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.0851063829787234, | |
| "grad_norm": 12.88310718536377, | |
| "learning_rate": 3.7500000000000005e-06, | |
| "loss": 1.4091796875, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.10638297872340426, | |
| "grad_norm": 1.8641468286514282, | |
| "learning_rate": 5e-06, | |
| "loss": 0.857421875, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.1276595744680851, | |
| "grad_norm": 2.1419777870178223, | |
| "learning_rate": 6.25e-06, | |
| "loss": 0.82470703125, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.14893617021276595, | |
| "grad_norm": 0.5267848968505859, | |
| "learning_rate": 7.500000000000001e-06, | |
| "loss": 0.81640625, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.1702127659574468, | |
| "grad_norm": 0.4465678632259369, | |
| "learning_rate": 8.750000000000001e-06, | |
| "loss": 0.7666015625, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.19148936170212766, | |
| "grad_norm": 0.364780068397522, | |
| "learning_rate": 1e-05, | |
| "loss": 0.716796875, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.2127659574468085, | |
| "grad_norm": 0.4930365979671478, | |
| "learning_rate": 9.998744667454124e-06, | |
| "loss": 0.75439453125, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.23404255319148937, | |
| "grad_norm": 0.4643309414386749, | |
| "learning_rate": 9.994979370198627e-06, | |
| "loss": 0.7685546875, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.2553191489361702, | |
| "grad_norm": 0.25887879729270935, | |
| "learning_rate": 9.988706208989152e-06, | |
| "loss": 0.7080078125, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.2765957446808511, | |
| "grad_norm": 0.21602444350719452, | |
| "learning_rate": 9.979928683782777e-06, | |
| "loss": 0.6953125, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.2978723404255319, | |
| "grad_norm": 0.16701330244541168, | |
| "learning_rate": 9.968651691785309e-06, | |
| "loss": 0.6826171875, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.3191489361702128, | |
| "grad_norm": 0.21458739042282104, | |
| "learning_rate": 9.954881524719004e-06, | |
| "loss": 0.71533203125, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.3404255319148936, | |
| "grad_norm": 0.5292935967445374, | |
| "learning_rate": 9.938625865312252e-06, | |
| "loss": 0.638427734375, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.3617021276595745, | |
| "grad_norm": 0.14642807841300964, | |
| "learning_rate": 9.91989378301319e-06, | |
| "loss": 0.69921875, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.3829787234042553, | |
| "grad_norm": 0.2138093262910843, | |
| "learning_rate": 9.898695728929624e-06, | |
| "loss": 0.736328125, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.40425531914893614, | |
| "grad_norm": 0.1565290242433548, | |
| "learning_rate": 9.875043529998089e-06, | |
| "loss": 0.66748046875, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.425531914893617, | |
| "grad_norm": 0.14800888299942017, | |
| "learning_rate": 9.848950382385292e-06, | |
| "loss": 0.659423828125, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.44680851063829785, | |
| "grad_norm": 0.17405381798744202, | |
| "learning_rate": 9.820430844125648e-06, | |
| "loss": 0.6953125, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.46808510638297873, | |
| "grad_norm": 0.15458369255065918, | |
| "learning_rate": 9.789500826998963e-06, | |
| "loss": 0.64990234375, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.48936170212765956, | |
| "grad_norm": 0.1480713188648224, | |
| "learning_rate": 9.756177587652857e-06, | |
| "loss": 0.665771484375, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.5106382978723404, | |
| "grad_norm": 0.1611735075712204, | |
| "learning_rate": 9.720479717974834e-06, | |
| "loss": 0.65478515625, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.5319148936170213, | |
| "grad_norm": 0.15233327448368073, | |
| "learning_rate": 9.682427134719397e-06, | |
| "loss": 0.6826171875, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.5531914893617021, | |
| "grad_norm": 0.13786296546459198, | |
| "learning_rate": 9.642041068395971e-06, | |
| "loss": 0.65771484375, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.574468085106383, | |
| "grad_norm": 0.1627306044101715, | |
| "learning_rate": 9.599344051423873e-06, | |
| "loss": 0.645751953125, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.5957446808510638, | |
| "grad_norm": 0.11854298412799835, | |
| "learning_rate": 9.554359905560887e-06, | |
| "loss": 0.623291015625, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.6170212765957447, | |
| "grad_norm": 0.09749210625886917, | |
| "learning_rate": 9.507113728612501e-06, | |
| "loss": 0.65673828125, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.6170212765957447, | |
| "eval_loss": 0.6583251953125, | |
| "eval_runtime": 0.9309, | |
| "eval_samples_per_second": 8.594, | |
| "eval_steps_per_second": 1.074, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.6382978723404256, | |
| "grad_norm": 0.09445308893918991, | |
| "learning_rate": 9.4576318804292e-06, | |
| "loss": 0.64990234375, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.6595744680851063, | |
| "grad_norm": 0.12036604434251785, | |
| "learning_rate": 9.405941968199636e-06, | |
| "loss": 0.6259765625, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.6808510638297872, | |
| "grad_norm": 0.09057900309562683, | |
| "learning_rate": 9.35207283104785e-06, | |
| "loss": 0.64892578125, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.7021276595744681, | |
| "grad_norm": 0.08564602583646774, | |
| "learning_rate": 9.296054523943224e-06, | |
| "loss": 0.66357421875, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.723404255319149, | |
| "grad_norm": 0.10631843656301498, | |
| "learning_rate": 9.237918300932005e-06, | |
| "loss": 0.656494140625, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.7446808510638298, | |
| "grad_norm": 0.08722808957099915, | |
| "learning_rate": 9.177696597699903e-06, | |
| "loss": 0.64453125, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.7659574468085106, | |
| "grad_norm": 0.49558505415916443, | |
| "learning_rate": 9.115423013475376e-06, | |
| "loss": 0.64208984375, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.7872340425531915, | |
| "grad_norm": 0.08237365633249283, | |
| "learning_rate": 9.051132292283772e-06, | |
| "loss": 0.64404296875, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.8085106382978723, | |
| "grad_norm": 0.07720646262168884, | |
| "learning_rate": 8.984860303562737e-06, | |
| "loss": 0.62109375, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.8297872340425532, | |
| "grad_norm": 0.08277340978384018, | |
| "learning_rate": 8.91664402214975e-06, | |
| "loss": 0.679443359375, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.851063829787234, | |
| "grad_norm": 0.07692992687225342, | |
| "learning_rate": 8.846521507652905e-06, | |
| "loss": 0.61279296875, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.8723404255319149, | |
| "grad_norm": 0.07395167648792267, | |
| "learning_rate": 8.774531883216489e-06, | |
| "loss": 0.6171875, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.8936170212765957, | |
| "grad_norm": 0.08734069019556046, | |
| "learning_rate": 8.700715313693179e-06, | |
| "loss": 0.5966796875, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.9148936170212766, | |
| "grad_norm": 0.0718359649181366, | |
| "learning_rate": 8.625112983235038e-06, | |
| "loss": 0.622802734375, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.9361702127659575, | |
| "grad_norm": 2.8077023029327393, | |
| "learning_rate": 8.547767072315835e-06, | |
| "loss": 0.633544921875, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.9574468085106383, | |
| "grad_norm": 0.20353853702545166, | |
| "learning_rate": 8.468720734197465e-06, | |
| "loss": 0.64208984375, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.9787234042553191, | |
| "grad_norm": 0.0717790350317955, | |
| "learning_rate": 8.388018070853643e-06, | |
| "loss": 0.63037109375, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 0.07482967525720596, | |
| "learning_rate": 8.305704108364301e-06, | |
| "loss": 0.615478515625, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 1.0212765957446808, | |
| "grad_norm": 0.07452995330095291, | |
| "learning_rate": 8.22182477179437e-06, | |
| "loss": 0.615234375, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 1.0425531914893618, | |
| "grad_norm": 0.09891754388809204, | |
| "learning_rate": 8.136426859571014e-06, | |
| "loss": 0.63916015625, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 1.0638297872340425, | |
| "grad_norm": 0.0689992755651474, | |
| "learning_rate": 8.049558017373593e-06, | |
| "loss": 0.61376953125, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 1.0851063829787233, | |
| "grad_norm": 0.7521502375602722, | |
| "learning_rate": 7.961266711550922e-06, | |
| "loss": 0.59326171875, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 1.1063829787234043, | |
| "grad_norm": 0.12467394024133682, | |
| "learning_rate": 7.871602202080656e-06, | |
| "loss": 0.632080078125, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 1.127659574468085, | |
| "grad_norm": 0.10193628817796707, | |
| "learning_rate": 7.78061451508588e-06, | |
| "loss": 0.621826171875, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 1.148936170212766, | |
| "grad_norm": 0.08595224469900131, | |
| "learning_rate": 7.688354414924266e-06, | |
| "loss": 0.6337890625, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 1.1702127659574468, | |
| "grad_norm": 0.06556966155767441, | |
| "learning_rate": 7.594873375865336e-06, | |
| "loss": 0.612060546875, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 1.1914893617021276, | |
| "grad_norm": 0.06449580192565918, | |
| "learning_rate": 7.500223553371642e-06, | |
| "loss": 0.587646484375, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 1.2127659574468086, | |
| "grad_norm": 0.17886410653591156, | |
| "learning_rate": 7.404457754999913e-06, | |
| "loss": 0.6162109375, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 1.2127659574468086, | |
| "eval_loss": 0.622802734375, | |
| "eval_runtime": 0.9118, | |
| "eval_samples_per_second": 8.774, | |
| "eval_steps_per_second": 1.097, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 1.2340425531914894, | |
| "grad_norm": 0.1568862795829773, | |
| "learning_rate": 7.307629410938364e-06, | |
| "loss": 0.637451171875, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 1.2553191489361701, | |
| "grad_norm": 0.06442597508430481, | |
| "learning_rate": 7.20979254419662e-06, | |
| "loss": 0.599609375, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 1.2765957446808511, | |
| "grad_norm": 0.06344356387853622, | |
| "learning_rate": 7.11100174046491e-06, | |
| "loss": 0.596923828125, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 1.297872340425532, | |
| "grad_norm": 0.06211620196700096, | |
| "learning_rate": 7.011312117659303e-06, | |
| "loss": 0.599365234375, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 1.3191489361702127, | |
| "grad_norm": 0.06851235032081604, | |
| "learning_rate": 6.910779295170017e-06, | |
| "loss": 0.627197265625, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 1.3404255319148937, | |
| "grad_norm": 0.07076431065797806, | |
| "learning_rate": 6.809459362829941e-06, | |
| "loss": 0.56201171875, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 1.3617021276595744, | |
| "grad_norm": 0.062243252992630005, | |
| "learning_rate": 6.707408849620683e-06, | |
| "loss": 0.6279296875, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 1.3829787234042552, | |
| "grad_norm": 0.1926475316286087, | |
| "learning_rate": 6.604684692133597e-06, | |
| "loss": 0.65380859375, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 1.4042553191489362, | |
| "grad_norm": 0.06368491053581238, | |
| "learning_rate": 6.501344202803415e-06, | |
| "loss": 0.595947265625, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 1.425531914893617, | |
| "grad_norm": 0.06680840253829956, | |
| "learning_rate": 6.397445037932167e-06, | |
| "loss": 0.59033203125, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 1.4468085106382977, | |
| "grad_norm": 0.07508081942796707, | |
| "learning_rate": 6.293045165521249e-06, | |
| "loss": 0.609375, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 1.4680851063829787, | |
| "grad_norm": 0.06227220967411995, | |
| "learning_rate": 6.188202832929607e-06, | |
| "loss": 0.580322265625, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 1.4893617021276595, | |
| "grad_norm": 0.06462941318750381, | |
| "learning_rate": 6.0829765343760376e-06, | |
| "loss": 0.5986328125, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 1.5106382978723403, | |
| "grad_norm": 0.07289247214794159, | |
| "learning_rate": 5.977424978303762e-06, | |
| "loss": 0.576171875, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 1.5319148936170213, | |
| "grad_norm": 0.08890023827552795, | |
| "learning_rate": 5.871607054625497e-06, | |
| "loss": 0.6259765625, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 1.5531914893617023, | |
| "grad_norm": 0.07831184566020966, | |
| "learning_rate": 5.765581801867254e-06, | |
| "loss": 0.5927734375, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 1.574468085106383, | |
| "grad_norm": 0.07617679238319397, | |
| "learning_rate": 5.659408374229244e-06, | |
| "loss": 0.574951171875, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 1.5957446808510638, | |
| "grad_norm": 0.0626956969499588, | |
| "learning_rate": 5.553146008582232e-06, | |
| "loss": 0.56689453125, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 1.6170212765957448, | |
| "grad_norm": 0.06204919144511223, | |
| "learning_rate": 5.446853991417771e-06, | |
| "loss": 0.6123046875, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 1.6382978723404256, | |
| "grad_norm": 0.06160138547420502, | |
| "learning_rate": 5.340591625770758e-06, | |
| "loss": 0.6025390625, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 1.6595744680851063, | |
| "grad_norm": 0.11200636625289917, | |
| "learning_rate": 5.234418198132748e-06, | |
| "loss": 0.57666015625, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 1.6808510638297873, | |
| "grad_norm": 0.06134967878460884, | |
| "learning_rate": 5.1283929453745055e-06, | |
| "loss": 0.60498046875, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 1.702127659574468, | |
| "grad_norm": 0.06297880411148071, | |
| "learning_rate": 5.02257502169624e-06, | |
| "loss": 0.62060546875, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 1.7234042553191489, | |
| "grad_norm": 0.06980058550834656, | |
| "learning_rate": 4.9170234656239655e-06, | |
| "loss": 0.611083984375, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 1.7446808510638299, | |
| "grad_norm": 0.06381814926862717, | |
| "learning_rate": 4.811797167070393e-06, | |
| "loss": 0.60498046875, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 1.7659574468085106, | |
| "grad_norm": 0.2403756082057953, | |
| "learning_rate": 4.706954834478753e-06, | |
| "loss": 0.59375, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 1.7872340425531914, | |
| "grad_norm": 0.06059819459915161, | |
| "learning_rate": 4.602554962067836e-06, | |
| "loss": 0.60546875, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 1.8085106382978724, | |
| "grad_norm": 0.06093069911003113, | |
| "learning_rate": 4.4986557971965865e-06, | |
| "loss": 0.584716796875, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 1.8085106382978724, | |
| "eval_loss": 0.6068115234375, | |
| "eval_runtime": 0.9222, | |
| "eval_samples_per_second": 8.675, | |
| "eval_steps_per_second": 1.084, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 1.8297872340425532, | |
| "grad_norm": 0.06800687313079834, | |
| "learning_rate": 4.395315307866404e-06, | |
| "loss": 0.642822265625, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 1.851063829787234, | |
| "grad_norm": 0.06103246659040451, | |
| "learning_rate": 4.2925911503793205e-06, | |
| "loss": 0.58251953125, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 1.872340425531915, | |
| "grad_norm": 0.061805445700883865, | |
| "learning_rate": 4.19054063717006e-06, | |
| "loss": 0.58056640625, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 1.8936170212765957, | |
| "grad_norm": 0.07350873202085495, | |
| "learning_rate": 4.089220704829986e-06, | |
| "loss": 0.554443359375, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 1.9148936170212765, | |
| "grad_norm": 0.06171874329447746, | |
| "learning_rate": 3.988687882340698e-06, | |
| "loss": 0.5888671875, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 1.9361702127659575, | |
| "grad_norm": 0.262273371219635, | |
| "learning_rate": 3.888998259535092e-06, | |
| "loss": 0.55419921875, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 1.9574468085106385, | |
| "grad_norm": 0.1396542489528656, | |
| "learning_rate": 3.790207455803381e-06, | |
| "loss": 0.6015625, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 1.978723404255319, | |
| "grad_norm": 0.06226907670497894, | |
| "learning_rate": 3.692370589061639e-06, | |
| "loss": 0.599365234375, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 0.06341912597417831, | |
| "learning_rate": 3.595542245000089e-06, | |
| "loss": 0.5810546875, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 2.021276595744681, | |
| "grad_norm": 0.06388843804597855, | |
| "learning_rate": 3.499776446628361e-06, | |
| "loss": 0.584716796875, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 2.0425531914893615, | |
| "grad_norm": 0.07137155532836914, | |
| "learning_rate": 3.4051266241346658e-06, | |
| "loss": 0.60986328125, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 2.0638297872340425, | |
| "grad_norm": 0.0604974739253521, | |
| "learning_rate": 3.3116455850757343e-06, | |
| "loss": 0.587890625, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 2.0851063829787235, | |
| "grad_norm": 8.030447006225586, | |
| "learning_rate": 3.2193854849141204e-06, | |
| "loss": 0.612548828125, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 2.106382978723404, | |
| "grad_norm": 0.09623796492815018, | |
| "learning_rate": 3.1283977979193458e-06, | |
| "loss": 0.60302734375, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 2.127659574468085, | |
| "grad_norm": 0.07766978442668915, | |
| "learning_rate": 3.0387332884490806e-06, | |
| "loss": 0.598388671875, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 2.148936170212766, | |
| "grad_norm": 0.06870637089014053, | |
| "learning_rate": 2.9504419826264116e-06, | |
| "loss": 0.607666015625, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 2.1702127659574466, | |
| "grad_norm": 0.060668252408504486, | |
| "learning_rate": 2.8635731404289895e-06, | |
| "loss": 0.5888671875, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 2.1914893617021276, | |
| "grad_norm": 0.06026003509759903, | |
| "learning_rate": 2.7781752282056328e-06, | |
| "loss": 0.566162109375, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 2.2127659574468086, | |
| "grad_norm": 0.08196396380662918, | |
| "learning_rate": 2.6942958916356997e-06, | |
| "loss": 0.59326171875, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 2.2340425531914896, | |
| "grad_norm": 0.08349911868572235, | |
| "learning_rate": 2.6119819291463594e-06, | |
| "loss": 0.61376953125, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 2.25531914893617, | |
| "grad_norm": 0.06174217164516449, | |
| "learning_rate": 2.531279265802538e-06, | |
| "loss": 0.577880859375, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 2.276595744680851, | |
| "grad_norm": 0.060782574117183685, | |
| "learning_rate": 2.4522329276841664e-06, | |
| "loss": 0.5771484375, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 2.297872340425532, | |
| "grad_norm": 0.059110283851623535, | |
| "learning_rate": 2.374887016764961e-06, | |
| "loss": 0.5810546875, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 2.3191489361702127, | |
| "grad_norm": 0.06728767603635788, | |
| "learning_rate": 2.299284686306823e-06, | |
| "loss": 0.607177734375, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 2.3404255319148937, | |
| "grad_norm": 0.06625807285308838, | |
| "learning_rate": 2.2254681167835123e-06, | |
| "loss": 0.544189453125, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 2.3617021276595747, | |
| "grad_norm": 0.060310665518045425, | |
| "learning_rate": 2.153478492347097e-06, | |
| "loss": 0.6103515625, | |
| "step": 111 | |
| }, | |
| { | |
| "epoch": 2.382978723404255, | |
| "grad_norm": 0.07253512740135193, | |
| "learning_rate": 2.083355977850252e-06, | |
| "loss": 0.634033203125, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 2.404255319148936, | |
| "grad_norm": 0.061543628573417664, | |
| "learning_rate": 2.0151396964372642e-06, | |
| "loss": 0.579345703125, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 2.404255319148936, | |
| "eval_loss": 0.6005859375, | |
| "eval_runtime": 0.9332, | |
| "eval_samples_per_second": 8.572, | |
| "eval_steps_per_second": 1.072, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 2.425531914893617, | |
| "grad_norm": 0.0641883984208107, | |
| "learning_rate": 1.94886770771623e-06, | |
| "loss": 0.57421875, | |
| "step": 114 | |
| }, | |
| { | |
| "epoch": 2.4468085106382977, | |
| "grad_norm": 0.07023778557777405, | |
| "learning_rate": 1.8845769865246256e-06, | |
| "loss": 0.591064453125, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 2.4680851063829787, | |
| "grad_norm": 0.06087420508265495, | |
| "learning_rate": 1.822303402300099e-06, | |
| "loss": 0.564208984375, | |
| "step": 116 | |
| }, | |
| { | |
| "epoch": 2.4893617021276597, | |
| "grad_norm": 0.06413070857524872, | |
| "learning_rate": 1.7620816990679975e-06, | |
| "loss": 0.583740234375, | |
| "step": 117 | |
| }, | |
| { | |
| "epoch": 2.5106382978723403, | |
| "grad_norm": 0.06855274736881256, | |
| "learning_rate": 1.703945476056778e-06, | |
| "loss": 0.557861328125, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 2.5319148936170213, | |
| "grad_norm": 0.07735947519540787, | |
| "learning_rate": 1.6479271689521504e-06, | |
| "loss": 0.613525390625, | |
| "step": 119 | |
| }, | |
| { | |
| "epoch": 2.5531914893617023, | |
| "grad_norm": 0.06765682250261307, | |
| "learning_rate": 1.5940580318003663e-06, | |
| "loss": 0.577392578125, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 2.574468085106383, | |
| "grad_norm": 0.07223811745643616, | |
| "learning_rate": 1.5423681195707997e-06, | |
| "loss": 0.55908203125, | |
| "step": 121 | |
| }, | |
| { | |
| "epoch": 2.595744680851064, | |
| "grad_norm": 0.06124420091509819, | |
| "learning_rate": 1.4928862713874996e-06, | |
| "loss": 0.552490234375, | |
| "step": 122 | |
| }, | |
| { | |
| "epoch": 2.617021276595745, | |
| "grad_norm": 0.061064235866069794, | |
| "learning_rate": 1.4456400944391147e-06, | |
| "loss": 0.60009765625, | |
| "step": 123 | |
| }, | |
| { | |
| "epoch": 2.6382978723404253, | |
| "grad_norm": 0.059814613312482834, | |
| "learning_rate": 1.4006559485761282e-06, | |
| "loss": 0.59033203125, | |
| "step": 124 | |
| }, | |
| { | |
| "epoch": 2.6595744680851063, | |
| "grad_norm": 0.08451995998620987, | |
| "learning_rate": 1.3579589316040297e-06, | |
| "loss": 0.564208984375, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 2.6808510638297873, | |
| "grad_norm": 0.061760902404785156, | |
| "learning_rate": 1.3175728652806047e-06, | |
| "loss": 0.594482421875, | |
| "step": 126 | |
| }, | |
| { | |
| "epoch": 2.702127659574468, | |
| "grad_norm": 0.061048850417137146, | |
| "learning_rate": 1.2795202820251665e-06, | |
| "loss": 0.609375, | |
| "step": 127 | |
| }, | |
| { | |
| "epoch": 2.723404255319149, | |
| "grad_norm": 0.06953231245279312, | |
| "learning_rate": 1.2438224123471442e-06, | |
| "loss": 0.598876953125, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 2.74468085106383, | |
| "grad_norm": 0.05982961133122444, | |
| "learning_rate": 1.210499173001039e-06, | |
| "loss": 0.59521484375, | |
| "step": 129 | |
| }, | |
| { | |
| "epoch": 2.7659574468085104, | |
| "grad_norm": 0.0727211982011795, | |
| "learning_rate": 1.1795691558743535e-06, | |
| "loss": 0.581787109375, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 2.7872340425531914, | |
| "grad_norm": 0.0596589520573616, | |
| "learning_rate": 1.1510496176147085e-06, | |
| "loss": 0.59716796875, | |
| "step": 131 | |
| }, | |
| { | |
| "epoch": 2.8085106382978724, | |
| "grad_norm": 0.05985628813505173, | |
| "learning_rate": 1.1249564700019127e-06, | |
| "loss": 0.57421875, | |
| "step": 132 | |
| }, | |
| { | |
| "epoch": 2.829787234042553, | |
| "grad_norm": 0.06684412807226181, | |
| "learning_rate": 1.1013042710703767e-06, | |
| "loss": 0.634521484375, | |
| "step": 133 | |
| }, | |
| { | |
| "epoch": 2.851063829787234, | |
| "grad_norm": 0.0605284757912159, | |
| "learning_rate": 1.0801062169868107e-06, | |
| "loss": 0.57470703125, | |
| "step": 134 | |
| }, | |
| { | |
| "epoch": 2.872340425531915, | |
| "grad_norm": 0.06104891747236252, | |
| "learning_rate": 1.0613741346877498e-06, | |
| "loss": 0.57080078125, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 2.8936170212765955, | |
| "grad_norm": 0.0715995654463768, | |
| "learning_rate": 1.0451184752809978e-06, | |
| "loss": 0.5458984375, | |
| "step": 136 | |
| }, | |
| { | |
| "epoch": 2.9148936170212765, | |
| "grad_norm": 0.06113986298441887, | |
| "learning_rate": 1.0313483082146918e-06, | |
| "loss": 0.58056640625, | |
| "step": 137 | |
| }, | |
| { | |
| "epoch": 2.9361702127659575, | |
| "grad_norm": 0.0903206393122673, | |
| "learning_rate": 1.0200713162172245e-06, | |
| "loss": 0.5439453125, | |
| "step": 138 | |
| }, | |
| { | |
| "epoch": 2.9574468085106385, | |
| "grad_norm": 0.10972226411104202, | |
| "learning_rate": 1.0112937910108494e-06, | |
| "loss": 0.593505859375, | |
| "step": 139 | |
| }, | |
| { | |
| "epoch": 2.978723404255319, | |
| "grad_norm": 0.061755139380693436, | |
| "learning_rate": 1.005020629801373e-06, | |
| "loss": 0.591064453125, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "grad_norm": 0.0636168122291565, | |
| "learning_rate": 1.0012553325458768e-06, | |
| "loss": 0.574951171875, | |
| "step": 141 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_loss": 0.59783935546875, | |
| "eval_runtime": 0.9275, | |
| "eval_samples_per_second": 8.625, | |
| "eval_steps_per_second": 1.078, | |
| "step": 141 | |
| } | |
| ], | |
| "logging_steps": 1.0, | |
| "max_steps": 141, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 0, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 3.173363486029775e+18, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |