Instructions to use ErrorAI/8483f937-fc66-4437-bbfb-90255226e43c with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use ErrorAI/8483f937-fc66-4437-bbfb-90255226e43c with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("NousResearch/Yarn-Llama-2-13b-64k") model = PeftModel.from_pretrained(base_model, "ErrorAI/8483f937-fc66-4437-bbfb-90255226e43c") - Notebooks
- Google Colab
- Kaggle
Download last-checkpoint/trainer_state.json from ErrorAI/8483f937-fc66-4437-bbfb-90255226e43c: direct link, hf CLI and curl.
- Browser
- Download file 42.2 kB
-
https://huggingface.co/ErrorAI/8483f937-fc66-4437-bbfb-90255226e43c/resolve/main/last-checkpoint/trainer_state.json
- Command line
-
hf download hf://ErrorAI/8483f937-fc66-4437-bbfb-90255226e43c/last-checkpoint/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/ErrorAI/8483f937-fc66-4437-bbfb-90255226e43c/resolve/main/last-checkpoint/trainer_state.json
42.2 kB
| { | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.0, | |
| "eval_steps": 59, | |
| "global_step": 236, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.00423728813559322, | |
| "grad_norm": 0.93435138463974, | |
| "learning_rate": 2e-05, | |
| "loss": 6.022, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.00423728813559322, | |
| "eval_loss": 1.5282647609710693, | |
| "eval_runtime": 7.1175, | |
| "eval_samples_per_second": 14.05, | |
| "eval_steps_per_second": 7.025, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.00847457627118644, | |
| "grad_norm": 1.3107619285583496, | |
| "learning_rate": 4e-05, | |
| "loss": 5.9185, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.012711864406779662, | |
| "grad_norm": 0.6630541086196899, | |
| "learning_rate": 6e-05, | |
| "loss": 6.0478, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.01694915254237288, | |
| "grad_norm": 1.1335469484329224, | |
| "learning_rate": 8e-05, | |
| "loss": 5.2389, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.0211864406779661, | |
| "grad_norm": 1.1335643529891968, | |
| "learning_rate": 0.0001, | |
| "loss": 7.1338, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.025423728813559324, | |
| "grad_norm": 1.5306239128112793, | |
| "learning_rate": 0.00012, | |
| "loss": 6.0755, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.029661016949152543, | |
| "grad_norm": 1.0867124795913696, | |
| "learning_rate": 0.00014, | |
| "loss": 6.8117, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.03389830508474576, | |
| "grad_norm": 0.9578568935394287, | |
| "learning_rate": 0.00016, | |
| "loss": 6.8011, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.038135593220338986, | |
| "grad_norm": 1.0799486637115479, | |
| "learning_rate": 0.00018, | |
| "loss": 6.7039, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.0423728813559322, | |
| "grad_norm": 1.5282158851623535, | |
| "learning_rate": 0.0002, | |
| "loss": 5.6313, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.046610169491525424, | |
| "grad_norm": 1.9403914213180542, | |
| "learning_rate": 0.00019999033847063811, | |
| "loss": 7.0799, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.05084745762711865, | |
| "grad_norm": 3.048349618911743, | |
| "learning_rate": 0.00019996135574945544, | |
| "loss": 6.5488, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.05508474576271186, | |
| "grad_norm": 2.31885027885437, | |
| "learning_rate": 0.00019991305743680013, | |
| "loss": 7.2261, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.059322033898305086, | |
| "grad_norm": 1.8449187278747559, | |
| "learning_rate": 0.0001998454528653836, | |
| "loss": 5.4851, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.0635593220338983, | |
| "grad_norm": 4.439443588256836, | |
| "learning_rate": 0.00019975855509847686, | |
| "loss": 6.414, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.06779661016949153, | |
| "grad_norm": 2.1660385131835938, | |
| "learning_rate": 0.00019965238092738643, | |
| "loss": 7.2336, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.07203389830508475, | |
| "grad_norm": 1.5337001085281372, | |
| "learning_rate": 0.00019952695086820975, | |
| "loss": 6.2012, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.07627118644067797, | |
| "grad_norm": 1.4069186449050903, | |
| "learning_rate": 0.0001993822891578708, | |
| "loss": 5.561, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.08050847457627118, | |
| "grad_norm": 2.1463675498962402, | |
| "learning_rate": 0.0001992184237494368, | |
| "loss": 5.7428, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.0847457627118644, | |
| "grad_norm": 2.5662553310394287, | |
| "learning_rate": 0.0001990353863067169, | |
| "loss": 4.293, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.08898305084745763, | |
| "grad_norm": 1.8066450357437134, | |
| "learning_rate": 0.0001988332121981436, | |
| "loss": 4.2494, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.09322033898305085, | |
| "grad_norm": 1.886709213256836, | |
| "learning_rate": 0.00019861194048993863, | |
| "loss": 6.4416, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.09745762711864407, | |
| "grad_norm": 1.9437390565872192, | |
| "learning_rate": 0.0001983716139385641, | |
| "loss": 5.7425, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.1016949152542373, | |
| "grad_norm": 2.127446413040161, | |
| "learning_rate": 0.0001981122789824607, | |
| "loss": 6.2049, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.1059322033898305, | |
| "grad_norm": 2.5859451293945312, | |
| "learning_rate": 0.00019783398573307428, | |
| "loss": 6.1108, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.11016949152542373, | |
| "grad_norm": 1.9746959209442139, | |
| "learning_rate": 0.00019753678796517282, | |
| "loss": 4.653, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.11440677966101695, | |
| "grad_norm": 1.5029537677764893, | |
| "learning_rate": 0.00019722074310645553, | |
| "loss": 6.2839, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.11864406779661017, | |
| "grad_norm": 2.269805908203125, | |
| "learning_rate": 0.00019688591222645607, | |
| "loss": 5.628, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.1228813559322034, | |
| "grad_norm": 2.1564295291900635, | |
| "learning_rate": 0.000196532360024742, | |
| "loss": 6.4123, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.1271186440677966, | |
| "grad_norm": 2.3761954307556152, | |
| "learning_rate": 0.0001961601548184129, | |
| "loss": 5.5128, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.13135593220338984, | |
| "grad_norm": 1.9238841533660889, | |
| "learning_rate": 0.00019576936852889936, | |
| "loss": 5.836, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.13559322033898305, | |
| "grad_norm": 1.7540390491485596, | |
| "learning_rate": 0.00019536007666806556, | |
| "loss": 6.7537, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.13983050847457626, | |
| "grad_norm": 2.3828277587890625, | |
| "learning_rate": 0.0001949323583236181, | |
| "loss": 6.257, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.1440677966101695, | |
| "grad_norm": 1.759395718574524, | |
| "learning_rate": 0.0001944862961438239, | |
| "loss": 3.6914, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.1483050847457627, | |
| "grad_norm": 2.694974899291992, | |
| "learning_rate": 0.00019402197632153992, | |
| "loss": 6.2578, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.15254237288135594, | |
| "grad_norm": 3.1266930103302, | |
| "learning_rate": 0.00019353948857755803, | |
| "loss": 6.6762, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.15677966101694915, | |
| "grad_norm": 2.4520297050476074, | |
| "learning_rate": 0.00019303892614326836, | |
| "loss": 6.9808, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.16101694915254236, | |
| "grad_norm": 1.475329875946045, | |
| "learning_rate": 0.00019252038574264405, | |
| "loss": 5.6409, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.1652542372881356, | |
| "grad_norm": 2.588773012161255, | |
| "learning_rate": 0.00019198396757355118, | |
| "loss": 6.3522, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.1694915254237288, | |
| "grad_norm": 1.8694051504135132, | |
| "learning_rate": 0.00019142977528838762, | |
| "loss": 6.1291, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.17372881355932204, | |
| "grad_norm": 2.373533010482788, | |
| "learning_rate": 0.00019085791597405404, | |
| "loss": 5.9928, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.17796610169491525, | |
| "grad_norm": 3.6754894256591797, | |
| "learning_rate": 0.00019026850013126157, | |
| "loss": 6.3815, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.18220338983050846, | |
| "grad_norm": 1.7676002979278564, | |
| "learning_rate": 0.00018966164165317966, | |
| "loss": 6.453, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.1864406779661017, | |
| "grad_norm": 1.3256787061691284, | |
| "learning_rate": 0.00018903745780342839, | |
| "loss": 6.3553, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.1906779661016949, | |
| "grad_norm": 1.6511330604553223, | |
| "learning_rate": 0.0001883960691934196, | |
| "loss": 4.8997, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.19491525423728814, | |
| "grad_norm": 1.721350073814392, | |
| "learning_rate": 0.00018773759975905098, | |
| "loss": 5.0406, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 0.19915254237288135, | |
| "grad_norm": 1.7820731401443481, | |
| "learning_rate": 0.00018706217673675811, | |
| "loss": 5.7118, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 0.2033898305084746, | |
| "grad_norm": 1.6048412322998047, | |
| "learning_rate": 0.0001863699306389282, | |
| "loss": 6.0263, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.2076271186440678, | |
| "grad_norm": 1.4817653894424438, | |
| "learning_rate": 0.00018566099522868119, | |
| "loss": 5.9415, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 0.211864406779661, | |
| "grad_norm": 2.7853312492370605, | |
| "learning_rate": 0.00018493550749402278, | |
| "loss": 5.5053, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.21610169491525424, | |
| "grad_norm": 1.8527765274047852, | |
| "learning_rate": 0.00018419360762137395, | |
| "loss": 4.5492, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 0.22033898305084745, | |
| "grad_norm": 2.2048535346984863, | |
| "learning_rate": 0.00018343543896848273, | |
| "loss": 8.1486, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 0.2245762711864407, | |
| "grad_norm": 1.7079168558120728, | |
| "learning_rate": 0.00018266114803672318, | |
| "loss": 5.3628, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 0.2288135593220339, | |
| "grad_norm": 2.1374549865722656, | |
| "learning_rate": 0.00018187088444278674, | |
| "loss": 5.8904, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 0.2330508474576271, | |
| "grad_norm": 2.382983684539795, | |
| "learning_rate": 0.00018106480088977172, | |
| "loss": 4.538, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.23728813559322035, | |
| "grad_norm": 2.197672128677368, | |
| "learning_rate": 0.00018024305313767646, | |
| "loss": 4.4606, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 0.24152542372881355, | |
| "grad_norm": 1.6247694492340088, | |
| "learning_rate": 0.00017940579997330165, | |
| "loss": 4.0559, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 0.2457627118644068, | |
| "grad_norm": 1.5712074041366577, | |
| "learning_rate": 0.00017855320317956784, | |
| "loss": 5.8273, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 1.6524977684020996, | |
| "learning_rate": 0.00017768542750425426, | |
| "loss": 6.2318, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "eval_loss": 1.3850336074829102, | |
| "eval_runtime": 7.0902, | |
| "eval_samples_per_second": 14.104, | |
| "eval_steps_per_second": 7.052, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 0.2542372881355932, | |
| "grad_norm": 1.5502198934555054, | |
| "learning_rate": 0.0001768026406281642, | |
| "loss": 5.2109, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.2584745762711864, | |
| "grad_norm": 1.8017003536224365, | |
| "learning_rate": 0.00017590501313272415, | |
| "loss": 6.0785, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 0.2627118644067797, | |
| "grad_norm": 1.7847765684127808, | |
| "learning_rate": 0.00017499271846702213, | |
| "loss": 4.9068, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 0.2669491525423729, | |
| "grad_norm": 1.5741537809371948, | |
| "learning_rate": 0.00017406593291429217, | |
| "loss": 5.4379, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 0.2711864406779661, | |
| "grad_norm": 1.365412950515747, | |
| "learning_rate": 0.00017312483555785086, | |
| "loss": 3.6425, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 0.2754237288135593, | |
| "grad_norm": 1.7937501668930054, | |
| "learning_rate": 0.00017216960824649303, | |
| "loss": 6.818, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.2796610169491525, | |
| "grad_norm": 1.7252205610275269, | |
| "learning_rate": 0.00017120043555935298, | |
| "loss": 5.2337, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 0.2838983050847458, | |
| "grad_norm": 1.6318126916885376, | |
| "learning_rate": 0.0001702175047702382, | |
| "loss": 4.8196, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 0.288135593220339, | |
| "grad_norm": 2.2506821155548096, | |
| "learning_rate": 0.00016922100581144228, | |
| "loss": 4.5169, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 0.2923728813559322, | |
| "grad_norm": 1.5296686887741089, | |
| "learning_rate": 0.00016821113123704424, | |
| "loss": 4.6808, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 0.2966101694915254, | |
| "grad_norm": 1.6065572500228882, | |
| "learning_rate": 0.00016718807618570106, | |
| "loss": 5.6518, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.3008474576271186, | |
| "grad_norm": 1.5301107168197632, | |
| "learning_rate": 0.00016615203834294119, | |
| "loss": 4.3934, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 0.3050847457627119, | |
| "grad_norm": 1.1689343452453613, | |
| "learning_rate": 0.00016510321790296525, | |
| "loss": 4.6425, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 0.3093220338983051, | |
| "grad_norm": 1.2540870904922485, | |
| "learning_rate": 0.00016404181752996289, | |
| "loss": 6.5413, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 0.3135593220338983, | |
| "grad_norm": 2.988340377807617, | |
| "learning_rate": 0.00016296804231895142, | |
| "loss": 2.8704, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 0.3177966101694915, | |
| "grad_norm": 2.624145269393921, | |
| "learning_rate": 0.00016188209975614542, | |
| "loss": 8.0201, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.3220338983050847, | |
| "grad_norm": 2.1858763694763184, | |
| "learning_rate": 0.00016078419967886402, | |
| "loss": 6.0421, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 0.326271186440678, | |
| "grad_norm": 1.665157675743103, | |
| "learning_rate": 0.00015967455423498387, | |
| "loss": 6.4215, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 0.3305084745762712, | |
| "grad_norm": 1.1391340494155884, | |
| "learning_rate": 0.00015855337784194577, | |
| "loss": 5.7596, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 0.3347457627118644, | |
| "grad_norm": 1.3100152015686035, | |
| "learning_rate": 0.00015742088714532247, | |
| "loss": 5.2074, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 0.3389830508474576, | |
| "grad_norm": 1.9967092275619507, | |
| "learning_rate": 0.00015627730097695638, | |
| "loss": 5.3709, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.3432203389830508, | |
| "grad_norm": 1.5776952505111694, | |
| "learning_rate": 0.00015512284031267437, | |
| "loss": 5.9981, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 0.3474576271186441, | |
| "grad_norm": 1.0257835388183594, | |
| "learning_rate": 0.00015395772822958845, | |
| "loss": 5.9825, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 0.3516949152542373, | |
| "grad_norm": 1.5740242004394531, | |
| "learning_rate": 0.00015278218986299074, | |
| "loss": 4.8249, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 0.3559322033898305, | |
| "grad_norm": 1.6861892938613892, | |
| "learning_rate": 0.0001515964523628501, | |
| "loss": 4.3845, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 0.3601694915254237, | |
| "grad_norm": 1.4004765748977661, | |
| "learning_rate": 0.00015040074484992, | |
| "loss": 4.4196, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 0.3644067796610169, | |
| "grad_norm": 1.792279839515686, | |
| "learning_rate": 0.00014919529837146528, | |
| "loss": 5.1566, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 0.3686440677966102, | |
| "grad_norm": 1.9727193117141724, | |
| "learning_rate": 0.00014798034585661695, | |
| "loss": 6.2365, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 0.3728813559322034, | |
| "grad_norm": 1.918335199356079, | |
| "learning_rate": 0.0001467561220713628, | |
| "loss": 4.8331, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 0.3771186440677966, | |
| "grad_norm": 1.2826801538467407, | |
| "learning_rate": 0.0001455228635731839, | |
| "loss": 6.5472, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 0.3813559322033898, | |
| "grad_norm": 0.9126927852630615, | |
| "learning_rate": 0.00014428080866534396, | |
| "loss": 5.3882, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.3855932203389831, | |
| "grad_norm": 1.3578442335128784, | |
| "learning_rate": 0.00014303019735084226, | |
| "loss": 5.4403, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 0.3898305084745763, | |
| "grad_norm": 1.3523539304733276, | |
| "learning_rate": 0.00014177127128603745, | |
| "loss": 6.2458, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 0.3940677966101695, | |
| "grad_norm": 2.189840316772461, | |
| "learning_rate": 0.0001405042737339524, | |
| "loss": 5.3938, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 0.3983050847457627, | |
| "grad_norm": 2.7657406330108643, | |
| "learning_rate": 0.0001392294495172681, | |
| "loss": 6.3785, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 0.4025423728813559, | |
| "grad_norm": 1.462851881980896, | |
| "learning_rate": 0.00013794704497101655, | |
| "loss": 5.4128, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 0.4067796610169492, | |
| "grad_norm": 1.3086453676223755, | |
| "learning_rate": 0.0001366573078949813, | |
| "loss": 5.7441, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 0.4110169491525424, | |
| "grad_norm": 2.55996036529541, | |
| "learning_rate": 0.00013536048750581494, | |
| "loss": 5.4807, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 0.4152542372881356, | |
| "grad_norm": 1.7401981353759766, | |
| "learning_rate": 0.00013405683438888282, | |
| "loss": 5.0087, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 0.4194915254237288, | |
| "grad_norm": 1.833206057548523, | |
| "learning_rate": 0.00013274660044984224, | |
| "loss": 5.401, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 0.423728813559322, | |
| "grad_norm": 1.1227648258209229, | |
| "learning_rate": 0.00013143003886596669, | |
| "loss": 5.8596, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.4279661016949153, | |
| "grad_norm": 1.4440932273864746, | |
| "learning_rate": 0.0001301074040372242, | |
| "loss": 4.299, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 0.4322033898305085, | |
| "grad_norm": 1.3902015686035156, | |
| "learning_rate": 0.00012877895153711935, | |
| "loss": 5.2348, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 0.4364406779661017, | |
| "grad_norm": 2.3583362102508545, | |
| "learning_rate": 0.0001274449380633089, | |
| "loss": 6.7036, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 0.4406779661016949, | |
| "grad_norm": 1.4885296821594238, | |
| "learning_rate": 0.00012610562138799978, | |
| "loss": 6.339, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 0.4449152542372881, | |
| "grad_norm": 1.6107800006866455, | |
| "learning_rate": 0.00012476126030813963, | |
| "loss": 5.5737, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 0.4491525423728814, | |
| "grad_norm": 1.6457529067993164, | |
| "learning_rate": 0.0001234121145954094, | |
| "loss": 4.68, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 0.4533898305084746, | |
| "grad_norm": 2.6190664768218994, | |
| "learning_rate": 0.0001220584449460274, | |
| "loss": 5.6051, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 0.4576271186440678, | |
| "grad_norm": 1.8676761388778687, | |
| "learning_rate": 0.00012070051293037492, | |
| "loss": 5.4647, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 0.461864406779661, | |
| "grad_norm": 2.39504337310791, | |
| "learning_rate": 0.00011933858094245281, | |
| "loss": 4.0834, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 0.4661016949152542, | |
| "grad_norm": 2.288006067276001, | |
| "learning_rate": 0.00011797291214917881, | |
| "loss": 5.9169, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.4703389830508475, | |
| "grad_norm": 1.2063994407653809, | |
| "learning_rate": 0.00011660377043953588, | |
| "loss": 5.8516, | |
| "step": 111 | |
| }, | |
| { | |
| "epoch": 0.4745762711864407, | |
| "grad_norm": 2.7913434505462646, | |
| "learning_rate": 0.0001152314203735805, | |
| "loss": 5.452, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 0.4788135593220339, | |
| "grad_norm": 1.5486477613449097, | |
| "learning_rate": 0.0001138561271313219, | |
| "loss": 5.6845, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 0.4830508474576271, | |
| "grad_norm": 1.3842769861221313, | |
| "learning_rate": 0.00011247815646148087, | |
| "loss": 3.9482, | |
| "step": 114 | |
| }, | |
| { | |
| "epoch": 0.4872881355932203, | |
| "grad_norm": 1.8453153371810913, | |
| "learning_rate": 0.00011109777463013915, | |
| "loss": 6.0286, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 0.4915254237288136, | |
| "grad_norm": 1.570230484008789, | |
| "learning_rate": 0.0001097152483692886, | |
| "loss": 4.6404, | |
| "step": 116 | |
| }, | |
| { | |
| "epoch": 0.4957627118644068, | |
| "grad_norm": 1.6343928575515747, | |
| "learning_rate": 0.00010833084482529048, | |
| "loss": 6.4812, | |
| "step": 117 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 1.450670838356018, | |
| "learning_rate": 0.00010694483150725458, | |
| "loss": 5.0213, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "eval_loss": 1.3630183935165405, | |
| "eval_runtime": 7.0743, | |
| "eval_samples_per_second": 14.136, | |
| "eval_steps_per_second": 7.068, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 0.5042372881355932, | |
| "grad_norm": 1.6642025709152222, | |
| "learning_rate": 0.00010555747623534831, | |
| "loss": 5.1026, | |
| "step": 119 | |
| }, | |
| { | |
| "epoch": 0.5084745762711864, | |
| "grad_norm": 2.017059087753296, | |
| "learning_rate": 0.00010416904708904548, | |
| "loss": 4.8477, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.5127118644067796, | |
| "grad_norm": 2.029778003692627, | |
| "learning_rate": 0.00010277981235532541, | |
| "loss": 5.9989, | |
| "step": 121 | |
| }, | |
| { | |
| "epoch": 0.5169491525423728, | |
| "grad_norm": 1.565796136856079, | |
| "learning_rate": 0.00010139004047683151, | |
| "loss": 4.0977, | |
| "step": 122 | |
| }, | |
| { | |
| "epoch": 0.5211864406779662, | |
| "grad_norm": 1.284759283065796, | |
| "learning_rate": 0.0001, | |
| "loss": 6.3971, | |
| "step": 123 | |
| }, | |
| { | |
| "epoch": 0.5254237288135594, | |
| "grad_norm": 1.5899869203567505, | |
| "learning_rate": 9.860995952316851e-05, | |
| "loss": 5.342, | |
| "step": 124 | |
| }, | |
| { | |
| "epoch": 0.5296610169491526, | |
| "grad_norm": 1.2444443702697754, | |
| "learning_rate": 9.722018764467461e-05, | |
| "loss": 5.5082, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 0.5338983050847458, | |
| "grad_norm": 1.5828735828399658, | |
| "learning_rate": 9.583095291095453e-05, | |
| "loss": 5.8702, | |
| "step": 126 | |
| }, | |
| { | |
| "epoch": 0.538135593220339, | |
| "grad_norm": 3.7572929859161377, | |
| "learning_rate": 9.444252376465171e-05, | |
| "loss": 4.3785, | |
| "step": 127 | |
| }, | |
| { | |
| "epoch": 0.5423728813559322, | |
| "grad_norm": 2.7158265113830566, | |
| "learning_rate": 9.305516849274541e-05, | |
| "loss": 5.0584, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 0.5466101694915254, | |
| "grad_norm": 1.598179817199707, | |
| "learning_rate": 9.166915517470953e-05, | |
| "loss": 4.3117, | |
| "step": 129 | |
| }, | |
| { | |
| "epoch": 0.5508474576271186, | |
| "grad_norm": 1.5766159296035767, | |
| "learning_rate": 9.028475163071141e-05, | |
| "loss": 5.6085, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.5550847457627118, | |
| "grad_norm": 1.7020022869110107, | |
| "learning_rate": 8.890222536986085e-05, | |
| "loss": 5.3097, | |
| "step": 131 | |
| }, | |
| { | |
| "epoch": 0.559322033898305, | |
| "grad_norm": 1.423659324645996, | |
| "learning_rate": 8.752184353851916e-05, | |
| "loss": 6.0762, | |
| "step": 132 | |
| }, | |
| { | |
| "epoch": 0.5635593220338984, | |
| "grad_norm": 2.035299062728882, | |
| "learning_rate": 8.614387286867814e-05, | |
| "loss": 5.5225, | |
| "step": 133 | |
| }, | |
| { | |
| "epoch": 0.5677966101694916, | |
| "grad_norm": 2.2816035747528076, | |
| "learning_rate": 8.47685796264195e-05, | |
| "loss": 5.565, | |
| "step": 134 | |
| }, | |
| { | |
| "epoch": 0.5720338983050848, | |
| "grad_norm": 1.8796865940093994, | |
| "learning_rate": 8.339622956046417e-05, | |
| "loss": 5.4363, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 0.576271186440678, | |
| "grad_norm": 1.6780980825424194, | |
| "learning_rate": 8.202708785082121e-05, | |
| "loss": 4.9135, | |
| "step": 136 | |
| }, | |
| { | |
| "epoch": 0.5805084745762712, | |
| "grad_norm": 2.6253199577331543, | |
| "learning_rate": 8.066141905754723e-05, | |
| "loss": 5.8014, | |
| "step": 137 | |
| }, | |
| { | |
| "epoch": 0.5847457627118644, | |
| "grad_norm": 1.7806695699691772, | |
| "learning_rate": 7.929948706962508e-05, | |
| "loss": 5.6643, | |
| "step": 138 | |
| }, | |
| { | |
| "epoch": 0.5889830508474576, | |
| "grad_norm": 1.6690291166305542, | |
| "learning_rate": 7.794155505397261e-05, | |
| "loss": 4.788, | |
| "step": 139 | |
| }, | |
| { | |
| "epoch": 0.5932203389830508, | |
| "grad_norm": 1.2224397659301758, | |
| "learning_rate": 7.658788540459062e-05, | |
| "loss": 5.7951, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.597457627118644, | |
| "grad_norm": 1.7819712162017822, | |
| "learning_rate": 7.523873969186039e-05, | |
| "loss": 5.5056, | |
| "step": 141 | |
| }, | |
| { | |
| "epoch": 0.6016949152542372, | |
| "grad_norm": 2.8600285053253174, | |
| "learning_rate": 7.389437861200024e-05, | |
| "loss": 4.424, | |
| "step": 142 | |
| }, | |
| { | |
| "epoch": 0.6059322033898306, | |
| "grad_norm": 2.1180453300476074, | |
| "learning_rate": 7.25550619366911e-05, | |
| "loss": 4.7318, | |
| "step": 143 | |
| }, | |
| { | |
| "epoch": 0.6101694915254238, | |
| "grad_norm": 1.7061822414398193, | |
| "learning_rate": 7.122104846288064e-05, | |
| "loss": 6.6938, | |
| "step": 144 | |
| }, | |
| { | |
| "epoch": 0.614406779661017, | |
| "grad_norm": 1.474294900894165, | |
| "learning_rate": 6.989259596277582e-05, | |
| "loss": 5.7241, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 0.6186440677966102, | |
| "grad_norm": 1.4275479316711426, | |
| "learning_rate": 6.85699611340333e-05, | |
| "loss": 4.0837, | |
| "step": 146 | |
| }, | |
| { | |
| "epoch": 0.6228813559322034, | |
| "grad_norm": 2.809462785720825, | |
| "learning_rate": 6.725339955015777e-05, | |
| "loss": 7.3159, | |
| "step": 147 | |
| }, | |
| { | |
| "epoch": 0.6271186440677966, | |
| "grad_norm": 2.748603343963623, | |
| "learning_rate": 6.594316561111724e-05, | |
| "loss": 6.2878, | |
| "step": 148 | |
| }, | |
| { | |
| "epoch": 0.6313559322033898, | |
| "grad_norm": 1.9641263484954834, | |
| "learning_rate": 6.46395124941851e-05, | |
| "loss": 4.7853, | |
| "step": 149 | |
| }, | |
| { | |
| "epoch": 0.635593220338983, | |
| "grad_norm": 3.6411221027374268, | |
| "learning_rate": 6.334269210501875e-05, | |
| "loss": 5.5019, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.6398305084745762, | |
| "grad_norm": 1.7731056213378906, | |
| "learning_rate": 6.205295502898348e-05, | |
| "loss": 4.3701, | |
| "step": 151 | |
| }, | |
| { | |
| "epoch": 0.6440677966101694, | |
| "grad_norm": 1.3389068841934204, | |
| "learning_rate": 6.0770550482731924e-05, | |
| "loss": 6.5773, | |
| "step": 152 | |
| }, | |
| { | |
| "epoch": 0.6483050847457628, | |
| "grad_norm": 1.3923825025558472, | |
| "learning_rate": 5.9495726266047605e-05, | |
| "loss": 5.4175, | |
| "step": 153 | |
| }, | |
| { | |
| "epoch": 0.652542372881356, | |
| "grad_norm": 2.2159035205841064, | |
| "learning_rate": 5.8228728713962543e-05, | |
| "loss": 3.6546, | |
| "step": 154 | |
| }, | |
| { | |
| "epoch": 0.6567796610169492, | |
| "grad_norm": 1.6734590530395508, | |
| "learning_rate": 5.696980264915777e-05, | |
| "loss": 4.4299, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 0.6610169491525424, | |
| "grad_norm": 1.7563037872314453, | |
| "learning_rate": 5.571919133465605e-05, | |
| "loss": 5.0263, | |
| "step": 156 | |
| }, | |
| { | |
| "epoch": 0.6652542372881356, | |
| "grad_norm": 1.501452088356018, | |
| "learning_rate": 5.447713642681612e-05, | |
| "loss": 6.2963, | |
| "step": 157 | |
| }, | |
| { | |
| "epoch": 0.6694915254237288, | |
| "grad_norm": 1.4349921941757202, | |
| "learning_rate": 5.324387792863719e-05, | |
| "loss": 6.4959, | |
| "step": 158 | |
| }, | |
| { | |
| "epoch": 0.673728813559322, | |
| "grad_norm": 1.7934768199920654, | |
| "learning_rate": 5.201965414338308e-05, | |
| "loss": 5.6093, | |
| "step": 159 | |
| }, | |
| { | |
| "epoch": 0.6779661016949152, | |
| "grad_norm": 1.5769773721694946, | |
| "learning_rate": 5.080470162853472e-05, | |
| "loss": 6.9835, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.6822033898305084, | |
| "grad_norm": 2.40470290184021, | |
| "learning_rate": 4.959925515008002e-05, | |
| "loss": 4.8795, | |
| "step": 161 | |
| }, | |
| { | |
| "epoch": 0.6864406779661016, | |
| "grad_norm": 1.6426795721054077, | |
| "learning_rate": 4.840354763714991e-05, | |
| "loss": 4.7669, | |
| "step": 162 | |
| }, | |
| { | |
| "epoch": 0.690677966101695, | |
| "grad_norm": 1.5152642726898193, | |
| "learning_rate": 4.7217810137009274e-05, | |
| "loss": 4.3649, | |
| "step": 163 | |
| }, | |
| { | |
| "epoch": 0.6949152542372882, | |
| "grad_norm": 0.9684991836547852, | |
| "learning_rate": 4.604227177041156e-05, | |
| "loss": 5.1498, | |
| "step": 164 | |
| }, | |
| { | |
| "epoch": 0.6991525423728814, | |
| "grad_norm": 1.9173654317855835, | |
| "learning_rate": 4.487715968732568e-05, | |
| "loss": 5.7244, | |
| "step": 165 | |
| }, | |
| { | |
| "epoch": 0.7033898305084746, | |
| "grad_norm": 1.960520625114441, | |
| "learning_rate": 4.372269902304363e-05, | |
| "loss": 4.9004, | |
| "step": 166 | |
| }, | |
| { | |
| "epoch": 0.7076271186440678, | |
| "grad_norm": 1.0363643169403076, | |
| "learning_rate": 4.257911285467754e-05, | |
| "loss": 5.8545, | |
| "step": 167 | |
| }, | |
| { | |
| "epoch": 0.711864406779661, | |
| "grad_norm": 1.3583155870437622, | |
| "learning_rate": 4.144662215805426e-05, | |
| "loss": 6.3824, | |
| "step": 168 | |
| }, | |
| { | |
| "epoch": 0.7161016949152542, | |
| "grad_norm": 4.059554100036621, | |
| "learning_rate": 4.0325445765016145e-05, | |
| "loss": 4.7046, | |
| "step": 169 | |
| }, | |
| { | |
| "epoch": 0.7203389830508474, | |
| "grad_norm": 1.8046865463256836, | |
| "learning_rate": 3.921580032113602e-05, | |
| "loss": 3.955, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.7245762711864406, | |
| "grad_norm": 1.36460280418396, | |
| "learning_rate": 3.8117900243854595e-05, | |
| "loss": 5.9647, | |
| "step": 171 | |
| }, | |
| { | |
| "epoch": 0.7288135593220338, | |
| "grad_norm": 1.7739871740341187, | |
| "learning_rate": 3.7031957681048604e-05, | |
| "loss": 6.397, | |
| "step": 172 | |
| }, | |
| { | |
| "epoch": 0.7330508474576272, | |
| "grad_norm": 2.6238420009613037, | |
| "learning_rate": 3.595818247003713e-05, | |
| "loss": 5.9568, | |
| "step": 173 | |
| }, | |
| { | |
| "epoch": 0.7372881355932204, | |
| "grad_norm": 1.4640283584594727, | |
| "learning_rate": 3.489678209703475e-05, | |
| "loss": 5.3649, | |
| "step": 174 | |
| }, | |
| { | |
| "epoch": 0.7415254237288136, | |
| "grad_norm": 1.3590552806854248, | |
| "learning_rate": 3.3847961657058845e-05, | |
| "loss": 6.5281, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 0.7457627118644068, | |
| "grad_norm": 2.4690585136413574, | |
| "learning_rate": 3.281192381429894e-05, | |
| "loss": 5.6778, | |
| "step": 176 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 1.4456470012664795, | |
| "learning_rate": 3.178886876295578e-05, | |
| "loss": 6.7767, | |
| "step": 177 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "eval_loss": 1.3556182384490967, | |
| "eval_runtime": 7.0946, | |
| "eval_samples_per_second": 14.095, | |
| "eval_steps_per_second": 7.048, | |
| "step": 177 | |
| }, | |
| { | |
| "epoch": 0.7542372881355932, | |
| "grad_norm": 1.659873366355896, | |
| "learning_rate": 3.077899418855772e-05, | |
| "loss": 5.2241, | |
| "step": 178 | |
| }, | |
| { | |
| "epoch": 0.7584745762711864, | |
| "grad_norm": 1.6144360303878784, | |
| "learning_rate": 2.9782495229761808e-05, | |
| "loss": 6.47, | |
| "step": 179 | |
| }, | |
| { | |
| "epoch": 0.7627118644067796, | |
| "grad_norm": 2.68172287940979, | |
| "learning_rate": 2.879956444064703e-05, | |
| "loss": 5.6168, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.7669491525423728, | |
| "grad_norm": 1.148950219154358, | |
| "learning_rate": 2.783039175350699e-05, | |
| "loss": 4.7857, | |
| "step": 181 | |
| }, | |
| { | |
| "epoch": 0.7711864406779662, | |
| "grad_norm": 2.0405430793762207, | |
| "learning_rate": 2.6875164442149147e-05, | |
| "loss": 4.1435, | |
| "step": 182 | |
| }, | |
| { | |
| "epoch": 0.7754237288135594, | |
| "grad_norm": 1.8292560577392578, | |
| "learning_rate": 2.5934067085707834e-05, | |
| "loss": 4.8491, | |
| "step": 183 | |
| }, | |
| { | |
| "epoch": 0.7796610169491526, | |
| "grad_norm": 1.592108964920044, | |
| "learning_rate": 2.500728153297788e-05, | |
| "loss": 5.9074, | |
| "step": 184 | |
| }, | |
| { | |
| "epoch": 0.7838983050847458, | |
| "grad_norm": 1.3204245567321777, | |
| "learning_rate": 2.409498686727587e-05, | |
| "loss": 5.3229, | |
| "step": 185 | |
| }, | |
| { | |
| "epoch": 0.788135593220339, | |
| "grad_norm": 1.6157606840133667, | |
| "learning_rate": 2.3197359371835802e-05, | |
| "loss": 5.0719, | |
| "step": 186 | |
| }, | |
| { | |
| "epoch": 0.7923728813559322, | |
| "grad_norm": 1.5353844165802002, | |
| "learning_rate": 2.2314572495745746e-05, | |
| "loss": 5.2844, | |
| "step": 187 | |
| }, | |
| { | |
| "epoch": 0.7966101694915254, | |
| "grad_norm": 1.859458327293396, | |
| "learning_rate": 2.1446796820432167e-05, | |
| "loss": 5.0241, | |
| "step": 188 | |
| }, | |
| { | |
| "epoch": 0.8008474576271186, | |
| "grad_norm": 2.213860273361206, | |
| "learning_rate": 2.0594200026698363e-05, | |
| "loss": 4.9303, | |
| "step": 189 | |
| }, | |
| { | |
| "epoch": 0.8050847457627118, | |
| "grad_norm": 1.3739302158355713, | |
| "learning_rate": 1.9756946862323535e-05, | |
| "loss": 6.1114, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.809322033898305, | |
| "grad_norm": 1.5952653884887695, | |
| "learning_rate": 1.8935199110228275e-05, | |
| "loss": 5.3459, | |
| "step": 191 | |
| }, | |
| { | |
| "epoch": 0.8135593220338984, | |
| "grad_norm": 1.7411179542541504, | |
| "learning_rate": 1.8129115557213262e-05, | |
| "loss": 6.0951, | |
| "step": 192 | |
| }, | |
| { | |
| "epoch": 0.8177966101694916, | |
| "grad_norm": 1.467255711555481, | |
| "learning_rate": 1.7338851963276825e-05, | |
| "loss": 3.5396, | |
| "step": 193 | |
| }, | |
| { | |
| "epoch": 0.8220338983050848, | |
| "grad_norm": 1.6787402629852295, | |
| "learning_rate": 1.656456103151728e-05, | |
| "loss": 4.9857, | |
| "step": 194 | |
| }, | |
| { | |
| "epoch": 0.826271186440678, | |
| "grad_norm": 1.718984842300415, | |
| "learning_rate": 1.580639237862608e-05, | |
| "loss": 7.6591, | |
| "step": 195 | |
| }, | |
| { | |
| "epoch": 0.8305084745762712, | |
| "grad_norm": 1.2019591331481934, | |
| "learning_rate": 1.5064492505977234e-05, | |
| "loss": 5.4475, | |
| "step": 196 | |
| }, | |
| { | |
| "epoch": 0.8347457627118644, | |
| "grad_norm": 1.509769320487976, | |
| "learning_rate": 1.433900477131882e-05, | |
| "loss": 5.373, | |
| "step": 197 | |
| }, | |
| { | |
| "epoch": 0.8389830508474576, | |
| "grad_norm": 1.1810944080352783, | |
| "learning_rate": 1.363006936107183e-05, | |
| "loss": 6.8259, | |
| "step": 198 | |
| }, | |
| { | |
| "epoch": 0.8432203389830508, | |
| "grad_norm": 1.7051451206207275, | |
| "learning_rate": 1.29378232632419e-05, | |
| "loss": 5.3893, | |
| "step": 199 | |
| }, | |
| { | |
| "epoch": 0.847457627118644, | |
| "grad_norm": 1.605209469795227, | |
| "learning_rate": 1.2262400240949023e-05, | |
| "loss": 3.6749, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.8516949152542372, | |
| "grad_norm": 1.559640884399414, | |
| "learning_rate": 1.1603930806580444e-05, | |
| "loss": 6.7777, | |
| "step": 201 | |
| }, | |
| { | |
| "epoch": 0.8559322033898306, | |
| "grad_norm": 1.8430358171463013, | |
| "learning_rate": 1.0962542196571634e-05, | |
| "loss": 5.6894, | |
| "step": 202 | |
| }, | |
| { | |
| "epoch": 0.8601694915254238, | |
| "grad_norm": 1.3345764875411987, | |
| "learning_rate": 1.0338358346820353e-05, | |
| "loss": 4.8869, | |
| "step": 203 | |
| }, | |
| { | |
| "epoch": 0.864406779661017, | |
| "grad_norm": 1.2212978601455688, | |
| "learning_rate": 9.731499868738447e-06, | |
| "loss": 5.3213, | |
| "step": 204 | |
| }, | |
| { | |
| "epoch": 0.8686440677966102, | |
| "grad_norm": 1.6549381017684937, | |
| "learning_rate": 9.142084025945984e-06, | |
| "loss": 6.597, | |
| "step": 205 | |
| }, | |
| { | |
| "epoch": 0.8728813559322034, | |
| "grad_norm": 1.4284532070159912, | |
| "learning_rate": 8.570224711612385e-06, | |
| "loss": 3.9897, | |
| "step": 206 | |
| }, | |
| { | |
| "epoch": 0.8771186440677966, | |
| "grad_norm": 1.5879578590393066, | |
| "learning_rate": 8.016032426448817e-06, | |
| "loss": 5.833, | |
| "step": 207 | |
| }, | |
| { | |
| "epoch": 0.8813559322033898, | |
| "grad_norm": 1.9117746353149414, | |
| "learning_rate": 7.479614257355971e-06, | |
| "loss": 6.5309, | |
| "step": 208 | |
| }, | |
| { | |
| "epoch": 0.885593220338983, | |
| "grad_norm": 1.4658851623535156, | |
| "learning_rate": 6.961073856731648e-06, | |
| "loss": 5.767, | |
| "step": 209 | |
| }, | |
| { | |
| "epoch": 0.8898305084745762, | |
| "grad_norm": 1.2028073072433472, | |
| "learning_rate": 6.460511422441984e-06, | |
| "loss": 6.1011, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.8940677966101694, | |
| "grad_norm": 1.6110073328018188, | |
| "learning_rate": 5.978023678460099e-06, | |
| "loss": 4.3484, | |
| "step": 211 | |
| }, | |
| { | |
| "epoch": 0.8983050847457628, | |
| "grad_norm": 3.445389986038208, | |
| "learning_rate": 5.5137038561761115e-06, | |
| "loss": 6.5291, | |
| "step": 212 | |
| }, | |
| { | |
| "epoch": 0.902542372881356, | |
| "grad_norm": 2.289745330810547, | |
| "learning_rate": 5.067641676381918e-06, | |
| "loss": 6.0326, | |
| "step": 213 | |
| }, | |
| { | |
| "epoch": 0.9067796610169492, | |
| "grad_norm": 1.7480942010879517, | |
| "learning_rate": 4.639923331934471e-06, | |
| "loss": 4.8869, | |
| "step": 214 | |
| }, | |
| { | |
| "epoch": 0.9110169491525424, | |
| "grad_norm": 2.0448532104492188, | |
| "learning_rate": 4.230631471100655e-06, | |
| "loss": 6.7924, | |
| "step": 215 | |
| }, | |
| { | |
| "epoch": 0.9152542372881356, | |
| "grad_norm": 1.7284777164459229, | |
| "learning_rate": 3.839845181587098e-06, | |
| "loss": 5.6074, | |
| "step": 216 | |
| }, | |
| { | |
| "epoch": 0.9194915254237288, | |
| "grad_norm": 1.3124265670776367, | |
| "learning_rate": 3.467639975257997e-06, | |
| "loss": 5.1132, | |
| "step": 217 | |
| }, | |
| { | |
| "epoch": 0.923728813559322, | |
| "grad_norm": 2.4826791286468506, | |
| "learning_rate": 3.1140877735439387e-06, | |
| "loss": 7.7159, | |
| "step": 218 | |
| }, | |
| { | |
| "epoch": 0.9279661016949152, | |
| "grad_norm": 2.097788095474243, | |
| "learning_rate": 2.7792568935444796e-06, | |
| "loss": 3.8859, | |
| "step": 219 | |
| }, | |
| { | |
| "epoch": 0.9322033898305084, | |
| "grad_norm": 1.7564079761505127, | |
| "learning_rate": 2.4632120348272003e-06, | |
| "loss": 4.8586, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.9364406779661016, | |
| "grad_norm": 1.6387519836425781, | |
| "learning_rate": 2.166014266925731e-06, | |
| "loss": 6.3061, | |
| "step": 221 | |
| }, | |
| { | |
| "epoch": 0.940677966101695, | |
| "grad_norm": 1.330946445465088, | |
| "learning_rate": 1.88772101753929e-06, | |
| "loss": 5.0511, | |
| "step": 222 | |
| }, | |
| { | |
| "epoch": 0.9449152542372882, | |
| "grad_norm": 1.418730616569519, | |
| "learning_rate": 1.6283860614358936e-06, | |
| "loss": 4.5408, | |
| "step": 223 | |
| }, | |
| { | |
| "epoch": 0.9491525423728814, | |
| "grad_norm": 1.767754316329956, | |
| "learning_rate": 1.3880595100613792e-06, | |
| "loss": 5.6123, | |
| "step": 224 | |
| }, | |
| { | |
| "epoch": 0.9533898305084746, | |
| "grad_norm": 1.25843346118927, | |
| "learning_rate": 1.1667878018564171e-06, | |
| "loss": 4.6931, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 0.9576271186440678, | |
| "grad_norm": 1.2846879959106445, | |
| "learning_rate": 9.64613693283123e-07, | |
| "loss": 5.2122, | |
| "step": 226 | |
| }, | |
| { | |
| "epoch": 0.961864406779661, | |
| "grad_norm": 1.5150436162948608, | |
| "learning_rate": 7.815762505632096e-07, | |
| "loss": 6.3263, | |
| "step": 227 | |
| }, | |
| { | |
| "epoch": 0.9661016949152542, | |
| "grad_norm": 1.6773252487182617, | |
| "learning_rate": 6.177108421292266e-07, | |
| "loss": 5.8491, | |
| "step": 228 | |
| }, | |
| { | |
| "epoch": 0.9703389830508474, | |
| "grad_norm": 1.4844250679016113, | |
| "learning_rate": 4.7304913179025965e-07, | |
| "loss": 5.981, | |
| "step": 229 | |
| }, | |
| { | |
| "epoch": 0.9745762711864406, | |
| "grad_norm": 2.42675518989563, | |
| "learning_rate": 3.4761907261356976e-07, | |
| "loss": 5.1298, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.9788135593220338, | |
| "grad_norm": 1.7614575624465942, | |
| "learning_rate": 2.414449015231357e-07, | |
| "loss": 5.1633, | |
| "step": 231 | |
| }, | |
| { | |
| "epoch": 0.9830508474576272, | |
| "grad_norm": 1.1330649852752686, | |
| "learning_rate": 1.545471346164007e-07, | |
| "loss": 6.7273, | |
| "step": 232 | |
| }, | |
| { | |
| "epoch": 0.9872881355932204, | |
| "grad_norm": 1.9067260026931763, | |
| "learning_rate": 8.694256319987659e-08, | |
| "loss": 6.0546, | |
| "step": 233 | |
| }, | |
| { | |
| "epoch": 0.9915254237288136, | |
| "grad_norm": 1.432326078414917, | |
| "learning_rate": 3.8644250544594975e-08, | |
| "loss": 6.6485, | |
| "step": 234 | |
| }, | |
| { | |
| "epoch": 0.9957627118644068, | |
| "grad_norm": 1.3281971216201782, | |
| "learning_rate": 9.661529361892907e-09, | |
| "loss": 5.262, | |
| "step": 235 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 1.966170072555542, | |
| "learning_rate": 0.0, | |
| "loss": 5.7779, | |
| "step": 236 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_loss": 1.3537216186523438, | |
| "eval_runtime": 7.0949, | |
| "eval_samples_per_second": 14.095, | |
| "eval_steps_per_second": 7.047, | |
| "step": 236 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 236, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 59, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.0721558879797248e+17, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |