Text Generation
Transformers
Safetensors
qwen2
Generated from Trainer
sft
hf_jobs
alignment-handbook
trl
conversational
text-generation-inference
4-bit precision
bitsandbytes
Instructions to use lhkhiem28/Book2Chatbot-qwen2.5-14b-sft-qlora-Caregiving with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use lhkhiem28/Book2Chatbot-qwen2.5-14b-sft-qlora-Caregiving with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="lhkhiem28/Book2Chatbot-qwen2.5-14b-sft-qlora-Caregiving", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("lhkhiem28/Book2Chatbot-qwen2.5-14b-sft-qlora-Caregiving") model = AutoModelForCausalLM.from_pretrained("lhkhiem28/Book2Chatbot-qwen2.5-14b-sft-qlora-Caregiving", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use lhkhiem28/Book2Chatbot-qwen2.5-14b-sft-qlora-Caregiving with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "lhkhiem28/Book2Chatbot-qwen2.5-14b-sft-qlora-Caregiving" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "lhkhiem28/Book2Chatbot-qwen2.5-14b-sft-qlora-Caregiving", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/lhkhiem28/Book2Chatbot-qwen2.5-14b-sft-qlora-Caregiving
- SGLang
How to use lhkhiem28/Book2Chatbot-qwen2.5-14b-sft-qlora-Caregiving with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "lhkhiem28/Book2Chatbot-qwen2.5-14b-sft-qlora-Caregiving" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "lhkhiem28/Book2Chatbot-qwen2.5-14b-sft-qlora-Caregiving", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "lhkhiem28/Book2Chatbot-qwen2.5-14b-sft-qlora-Caregiving" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "lhkhiem28/Book2Chatbot-qwen2.5-14b-sft-qlora-Caregiving", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use lhkhiem28/Book2Chatbot-qwen2.5-14b-sft-qlora-Caregiving with Docker Model Runner:
docker model run hf.co/lhkhiem28/Book2Chatbot-qwen2.5-14b-sft-qlora-Caregiving
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.0, | |
| "eval_steps": 500, | |
| "global_step": 820, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 0.8716129064559937, | |
| "epoch": 0.0024390243902439024, | |
| "grad_norm": 2.1505093574523926, | |
| "learning_rate": 0.0, | |
| "loss": 2.6919, | |
| "mean_token_accuracy": 0.5286247730255127, | |
| "num_tokens": 12872.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 0.8612800240516663, | |
| "epoch": 0.004878048780487805, | |
| "grad_norm": 2.0426065921783447, | |
| "learning_rate": 1.2195121951219514e-07, | |
| "loss": 2.6919, | |
| "mean_token_accuracy": 0.5243263244628906, | |
| "num_tokens": 26248.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 0.8617479801177979, | |
| "epoch": 0.007317073170731708, | |
| "grad_norm": 1.9424431324005127, | |
| "learning_rate": 2.439024390243903e-07, | |
| "loss": 2.639, | |
| "mean_token_accuracy": 0.5316513180732727, | |
| "num_tokens": 39502.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 0.8756797909736633, | |
| "epoch": 0.00975609756097561, | |
| "grad_norm": 2.1382882595062256, | |
| "learning_rate": 3.6585365853658536e-07, | |
| "loss": 2.7627, | |
| "mean_token_accuracy": 0.5206302404403687, | |
| "num_tokens": 52339.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 0.8642444610595703, | |
| "epoch": 0.012195121951219513, | |
| "grad_norm": 2.020120143890381, | |
| "learning_rate": 4.878048780487805e-07, | |
| "loss": 2.718, | |
| "mean_token_accuracy": 0.5269583463668823, | |
| "num_tokens": 65542.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 0.8727173805236816, | |
| "epoch": 0.014634146341463415, | |
| "grad_norm": 2.0316474437713623, | |
| "learning_rate": 6.097560975609757e-07, | |
| "loss": 2.6628, | |
| "mean_token_accuracy": 0.527190089225769, | |
| "num_tokens": 78982.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 0.8731244206428528, | |
| "epoch": 0.01707317073170732, | |
| "grad_norm": 2.113321304321289, | |
| "learning_rate": 7.317073170731707e-07, | |
| "loss": 2.6782, | |
| "mean_token_accuracy": 0.52106773853302, | |
| "num_tokens": 91885.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 0.8809671401977539, | |
| "epoch": 0.01951219512195122, | |
| "grad_norm": 1.8974612951278687, | |
| "learning_rate": 8.53658536585366e-07, | |
| "loss": 2.6159, | |
| "mean_token_accuracy": 0.5320430994033813, | |
| "num_tokens": 105180.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 0.8630732297897339, | |
| "epoch": 0.02195121951219512, | |
| "grad_norm": 2.0424561500549316, | |
| "learning_rate": 9.75609756097561e-07, | |
| "loss": 2.5871, | |
| "mean_token_accuracy": 0.5326229929924011, | |
| "num_tokens": 118898.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 0.8593544363975525, | |
| "epoch": 0.024390243902439025, | |
| "grad_norm": 1.9281632900238037, | |
| "learning_rate": 1.0975609756097562e-06, | |
| "loss": 2.5685, | |
| "mean_token_accuracy": 0.5355057120323181, | |
| "num_tokens": 132785.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 0.8840179443359375, | |
| "epoch": 0.026829268292682926, | |
| "grad_norm": 1.9911386966705322, | |
| "learning_rate": 1.2195121951219514e-06, | |
| "loss": 2.6835, | |
| "mean_token_accuracy": 0.5258385539054871, | |
| "num_tokens": 146366.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 0.8695968389511108, | |
| "epoch": 0.02926829268292683, | |
| "grad_norm": 1.922995924949646, | |
| "learning_rate": 1.3414634146341465e-06, | |
| "loss": 2.6168, | |
| "mean_token_accuracy": 0.5292648077011108, | |
| "num_tokens": 159589.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 0.8798849582672119, | |
| "epoch": 0.03170731707317073, | |
| "grad_norm": 1.9930217266082764, | |
| "learning_rate": 1.4634146341463414e-06, | |
| "loss": 2.6339, | |
| "mean_token_accuracy": 0.5334321856498718, | |
| "num_tokens": 172422.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 0.8729078769683838, | |
| "epoch": 0.03414634146341464, | |
| "grad_norm": 1.8291631937026978, | |
| "learning_rate": 1.5853658536585368e-06, | |
| "loss": 2.6239, | |
| "mean_token_accuracy": 0.53228360414505, | |
| "num_tokens": 185711.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 0.8857439160346985, | |
| "epoch": 0.036585365853658534, | |
| "grad_norm": 1.8444254398345947, | |
| "learning_rate": 1.707317073170732e-06, | |
| "loss": 2.6283, | |
| "mean_token_accuracy": 0.5282639265060425, | |
| "num_tokens": 199154.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 0.8875442743301392, | |
| "epoch": 0.03902439024390244, | |
| "grad_norm": 1.9070334434509277, | |
| "learning_rate": 1.8292682926829268e-06, | |
| "loss": 2.6719, | |
| "mean_token_accuracy": 0.5216583013534546, | |
| "num_tokens": 212075.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 0.8761826753616333, | |
| "epoch": 0.041463414634146344, | |
| "grad_norm": 1.828985571861267, | |
| "learning_rate": 1.951219512195122e-06, | |
| "loss": 2.6031, | |
| "mean_token_accuracy": 0.5246410965919495, | |
| "num_tokens": 225605.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 0.8728659749031067, | |
| "epoch": 0.04390243902439024, | |
| "grad_norm": 1.8210647106170654, | |
| "learning_rate": 2.073170731707317e-06, | |
| "loss": 2.4953, | |
| "mean_token_accuracy": 0.5386132597923279, | |
| "num_tokens": 239308.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 0.8789602518081665, | |
| "epoch": 0.046341463414634146, | |
| "grad_norm": 1.940412163734436, | |
| "learning_rate": 2.1951219512195125e-06, | |
| "loss": 2.6284, | |
| "mean_token_accuracy": 0.5310542583465576, | |
| "num_tokens": 252575.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 0.875320315361023, | |
| "epoch": 0.04878048780487805, | |
| "grad_norm": 1.8743823766708374, | |
| "learning_rate": 2.317073170731708e-06, | |
| "loss": 2.5582, | |
| "mean_token_accuracy": 0.5299984812736511, | |
| "num_tokens": 265825.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 0.8594653606414795, | |
| "epoch": 0.05121951219512195, | |
| "grad_norm": 1.8117427825927734, | |
| "learning_rate": 2.4390243902439027e-06, | |
| "loss": 2.5562, | |
| "mean_token_accuracy": 0.5371906757354736, | |
| "num_tokens": 279218.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 0.8692665696144104, | |
| "epoch": 0.05365853658536585, | |
| "grad_norm": 1.8945330381393433, | |
| "learning_rate": 2.5609756097560977e-06, | |
| "loss": 2.558, | |
| "mean_token_accuracy": 0.5370146632194519, | |
| "num_tokens": 292472.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 0.8777738809585571, | |
| "epoch": 0.05609756097560976, | |
| "grad_norm": 1.7756246328353882, | |
| "learning_rate": 2.682926829268293e-06, | |
| "loss": 2.5399, | |
| "mean_token_accuracy": 0.5344337224960327, | |
| "num_tokens": 306544.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 0.8751537799835205, | |
| "epoch": 0.05853658536585366, | |
| "grad_norm": 1.8381223678588867, | |
| "learning_rate": 2.8048780487804884e-06, | |
| "loss": 2.5104, | |
| "mean_token_accuracy": 0.5305012464523315, | |
| "num_tokens": 320166.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 0.8838329315185547, | |
| "epoch": 0.06097560975609756, | |
| "grad_norm": 1.9993051290512085, | |
| "learning_rate": 2.926829268292683e-06, | |
| "loss": 2.5373, | |
| "mean_token_accuracy": 0.5335705280303955, | |
| "num_tokens": 333393.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 0.8722259998321533, | |
| "epoch": 0.06341463414634146, | |
| "grad_norm": 1.7992353439331055, | |
| "learning_rate": 3.0487804878048782e-06, | |
| "loss": 2.5252, | |
| "mean_token_accuracy": 0.5407407283782959, | |
| "num_tokens": 346909.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 0.8720287084579468, | |
| "epoch": 0.06585365853658537, | |
| "grad_norm": 1.8377394676208496, | |
| "learning_rate": 3.1707317073170736e-06, | |
| "loss": 2.4664, | |
| "mean_token_accuracy": 0.544649600982666, | |
| "num_tokens": 360139.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 0.8602600693702698, | |
| "epoch": 0.06829268292682927, | |
| "grad_norm": 1.7901852130889893, | |
| "learning_rate": 3.292682926829269e-06, | |
| "loss": 2.4281, | |
| "mean_token_accuracy": 0.5409996509552002, | |
| "num_tokens": 373460.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 0.8788866996765137, | |
| "epoch": 0.07073170731707316, | |
| "grad_norm": 1.8166674375534058, | |
| "learning_rate": 3.414634146341464e-06, | |
| "loss": 2.4646, | |
| "mean_token_accuracy": 0.5414108037948608, | |
| "num_tokens": 386830.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 0.863952100276947, | |
| "epoch": 0.07317073170731707, | |
| "grad_norm": 1.743186354637146, | |
| "learning_rate": 3.5365853658536588e-06, | |
| "loss": 2.4102, | |
| "mean_token_accuracy": 0.5462642908096313, | |
| "num_tokens": 400431.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.865651547908783, | |
| "epoch": 0.07560975609756097, | |
| "grad_norm": 1.7701572179794312, | |
| "learning_rate": 3.6585365853658537e-06, | |
| "loss": 2.4892, | |
| "mean_token_accuracy": 0.5413939356803894, | |
| "num_tokens": 413432.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 0.8686628341674805, | |
| "epoch": 0.07804878048780488, | |
| "grad_norm": 1.8279269933700562, | |
| "learning_rate": 3.780487804878049e-06, | |
| "loss": 2.4728, | |
| "mean_token_accuracy": 0.5418347120285034, | |
| "num_tokens": 427085.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 0.8562468886375427, | |
| "epoch": 0.08048780487804878, | |
| "grad_norm": 1.8034300804138184, | |
| "learning_rate": 3.902439024390244e-06, | |
| "loss": 2.5066, | |
| "mean_token_accuracy": 0.5384673476219177, | |
| "num_tokens": 440372.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 0.8735157251358032, | |
| "epoch": 0.08292682926829269, | |
| "grad_norm": 1.7519137859344482, | |
| "learning_rate": 4.024390243902439e-06, | |
| "loss": 2.3914, | |
| "mean_token_accuracy": 0.5398162603378296, | |
| "num_tokens": 453448.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 0.8666555881500244, | |
| "epoch": 0.08536585365853659, | |
| "grad_norm": 1.7969316244125366, | |
| "learning_rate": 4.146341463414634e-06, | |
| "loss": 2.3763, | |
| "mean_token_accuracy": 0.5528104901313782, | |
| "num_tokens": 467145.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 0.8785781264305115, | |
| "epoch": 0.08780487804878048, | |
| "grad_norm": 1.888017177581787, | |
| "learning_rate": 4.268292682926829e-06, | |
| "loss": 2.4335, | |
| "mean_token_accuracy": 0.5460895895957947, | |
| "num_tokens": 480331.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 0.8501675724983215, | |
| "epoch": 0.09024390243902439, | |
| "grad_norm": 1.7441424131393433, | |
| "learning_rate": 4.390243902439025e-06, | |
| "loss": 2.3185, | |
| "mean_token_accuracy": 0.5568350553512573, | |
| "num_tokens": 493807.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 0.8716937303543091, | |
| "epoch": 0.09268292682926829, | |
| "grad_norm": 1.8410546779632568, | |
| "learning_rate": 4.51219512195122e-06, | |
| "loss": 2.3366, | |
| "mean_token_accuracy": 0.5552944540977478, | |
| "num_tokens": 507441.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 0.8760689496994019, | |
| "epoch": 0.0951219512195122, | |
| "grad_norm": 1.8491054773330688, | |
| "learning_rate": 4.634146341463416e-06, | |
| "loss": 2.3352, | |
| "mean_token_accuracy": 0.5513505935668945, | |
| "num_tokens": 521303.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 0.8930657505989075, | |
| "epoch": 0.0975609756097561, | |
| "grad_norm": 1.794344186782837, | |
| "learning_rate": 4.75609756097561e-06, | |
| "loss": 2.274, | |
| "mean_token_accuracy": 0.5474337935447693, | |
| "num_tokens": 534685.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.8910093903541565, | |
| "epoch": 0.1, | |
| "grad_norm": 1.7851758003234863, | |
| "learning_rate": 4.8780487804878055e-06, | |
| "loss": 2.2718, | |
| "mean_token_accuracy": 0.5464914441108704, | |
| "num_tokens": 547940.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 0.8795550465583801, | |
| "epoch": 0.1024390243902439, | |
| "grad_norm": 1.6806493997573853, | |
| "learning_rate": 5e-06, | |
| "loss": 2.1691, | |
| "mean_token_accuracy": 0.5671883821487427, | |
| "num_tokens": 562140.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 0.8985618352890015, | |
| "epoch": 0.1048780487804878, | |
| "grad_norm": 1.847882866859436, | |
| "learning_rate": 5.121951219512195e-06, | |
| "loss": 2.2579, | |
| "mean_token_accuracy": 0.5494333505630493, | |
| "num_tokens": 575568.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 0.9023619890213013, | |
| "epoch": 0.1073170731707317, | |
| "grad_norm": 1.875916838645935, | |
| "learning_rate": 5.243902439024391e-06, | |
| "loss": 2.2653, | |
| "mean_token_accuracy": 0.5583165287971497, | |
| "num_tokens": 588985.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 0.8863162398338318, | |
| "epoch": 0.10975609756097561, | |
| "grad_norm": 1.9038965702056885, | |
| "learning_rate": 5.365853658536586e-06, | |
| "loss": 2.2634, | |
| "mean_token_accuracy": 0.5584648847579956, | |
| "num_tokens": 602368.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 0.8825463056564331, | |
| "epoch": 0.11219512195121951, | |
| "grad_norm": 1.9453665018081665, | |
| "learning_rate": 5.487804878048781e-06, | |
| "loss": 2.1974, | |
| "mean_token_accuracy": 0.5623090863227844, | |
| "num_tokens": 615480.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 0.9041008353233337, | |
| "epoch": 0.11463414634146342, | |
| "grad_norm": 1.8884116411209106, | |
| "learning_rate": 5.609756097560977e-06, | |
| "loss": 2.129, | |
| "mean_token_accuracy": 0.5642023086547852, | |
| "num_tokens": 628860.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 0.9142757654190063, | |
| "epoch": 0.11707317073170732, | |
| "grad_norm": 1.8844501972198486, | |
| "learning_rate": 5.731707317073171e-06, | |
| "loss": 2.1263, | |
| "mean_token_accuracy": 0.5588369369506836, | |
| "num_tokens": 642014.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 0.9239153861999512, | |
| "epoch": 0.11951219512195121, | |
| "grad_norm": 1.7458008527755737, | |
| "learning_rate": 5.853658536585366e-06, | |
| "loss": 2.0406, | |
| "mean_token_accuracy": 0.5653674006462097, | |
| "num_tokens": 655653.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 0.8941378593444824, | |
| "epoch": 0.12195121951219512, | |
| "grad_norm": 1.8360707759857178, | |
| "learning_rate": 5.9756097560975615e-06, | |
| "loss": 2.0686, | |
| "mean_token_accuracy": 0.5699096322059631, | |
| "num_tokens": 668836.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.9041756987571716, | |
| "epoch": 0.12439024390243902, | |
| "grad_norm": 1.7880253791809082, | |
| "learning_rate": 6.0975609756097564e-06, | |
| "loss": 2.0037, | |
| "mean_token_accuracy": 0.5757826566696167, | |
| "num_tokens": 682140.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 0.9205608367919922, | |
| "epoch": 0.12682926829268293, | |
| "grad_norm": 1.7444533109664917, | |
| "learning_rate": 6.219512195121951e-06, | |
| "loss": 1.979, | |
| "mean_token_accuracy": 0.5779402852058411, | |
| "num_tokens": 695692.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 0.9216024875640869, | |
| "epoch": 0.12926829268292683, | |
| "grad_norm": 1.731343150138855, | |
| "learning_rate": 6.341463414634147e-06, | |
| "loss": 1.9391, | |
| "mean_token_accuracy": 0.5785799026489258, | |
| "num_tokens": 709172.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 0.940102756023407, | |
| "epoch": 0.13170731707317074, | |
| "grad_norm": 1.6420127153396606, | |
| "learning_rate": 6.463414634146342e-06, | |
| "loss": 1.9096, | |
| "mean_token_accuracy": 0.5771420001983643, | |
| "num_tokens": 722715.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 0.9335538744926453, | |
| "epoch": 0.13414634146341464, | |
| "grad_norm": 1.5793882608413696, | |
| "learning_rate": 6.585365853658538e-06, | |
| "loss": 1.8691, | |
| "mean_token_accuracy": 0.5772127509117126, | |
| "num_tokens": 736142.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 0.9485749006271362, | |
| "epoch": 0.13658536585365855, | |
| "grad_norm": 1.5499825477600098, | |
| "learning_rate": 6.707317073170733e-06, | |
| "loss": 1.8778, | |
| "mean_token_accuracy": 0.5797693133354187, | |
| "num_tokens": 750117.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 0.9361413717269897, | |
| "epoch": 0.13902439024390245, | |
| "grad_norm": 1.6096574068069458, | |
| "learning_rate": 6.829268292682928e-06, | |
| "loss": 1.8691, | |
| "mean_token_accuracy": 0.5884116888046265, | |
| "num_tokens": 763474.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 0.9481914639472961, | |
| "epoch": 0.14146341463414633, | |
| "grad_norm": 1.5803636312484741, | |
| "learning_rate": 6.951219512195122e-06, | |
| "loss": 1.8303, | |
| "mean_token_accuracy": 0.5844748616218567, | |
| "num_tokens": 776630.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 0.9388015270233154, | |
| "epoch": 0.14390243902439023, | |
| "grad_norm": 1.3934180736541748, | |
| "learning_rate": 7.0731707317073175e-06, | |
| "loss": 1.744, | |
| "mean_token_accuracy": 0.5921754837036133, | |
| "num_tokens": 790142.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 0.9618735313415527, | |
| "epoch": 0.14634146341463414, | |
| "grad_norm": 1.424424409866333, | |
| "learning_rate": 7.1951219512195125e-06, | |
| "loss": 1.7299, | |
| "mean_token_accuracy": 0.5924223065376282, | |
| "num_tokens": 803645.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.9727312326431274, | |
| "epoch": 0.14878048780487804, | |
| "grad_norm": 1.2729369401931763, | |
| "learning_rate": 7.317073170731707e-06, | |
| "loss": 1.7138, | |
| "mean_token_accuracy": 0.600612461566925, | |
| "num_tokens": 817049.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 0.9681069254875183, | |
| "epoch": 0.15121951219512195, | |
| "grad_norm": 1.2588528394699097, | |
| "learning_rate": 7.439024390243903e-06, | |
| "loss": 1.689, | |
| "mean_token_accuracy": 0.6010857820510864, | |
| "num_tokens": 830143.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 1.0009177923202515, | |
| "epoch": 0.15365853658536585, | |
| "grad_norm": 1.2635364532470703, | |
| "learning_rate": 7.560975609756098e-06, | |
| "loss": 1.6665, | |
| "mean_token_accuracy": 0.5937312245368958, | |
| "num_tokens": 843495.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 0.9910491704940796, | |
| "epoch": 0.15609756097560976, | |
| "grad_norm": 1.1177386045455933, | |
| "learning_rate": 7.682926829268293e-06, | |
| "loss": 1.6223, | |
| "mean_token_accuracy": 0.6033629179000854, | |
| "num_tokens": 857249.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 1.0137639045715332, | |
| "epoch": 0.15853658536585366, | |
| "grad_norm": 1.0478475093841553, | |
| "learning_rate": 7.804878048780489e-06, | |
| "loss": 1.5789, | |
| "mean_token_accuracy": 0.6136430501937866, | |
| "num_tokens": 870825.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 1.0203578472137451, | |
| "epoch": 0.16097560975609757, | |
| "grad_norm": 0.9052762389183044, | |
| "learning_rate": 7.926829268292685e-06, | |
| "loss": 1.5095, | |
| "mean_token_accuracy": 0.613807737827301, | |
| "num_tokens": 884500.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 1.0393266677856445, | |
| "epoch": 0.16341463414634147, | |
| "grad_norm": 0.9190409779548645, | |
| "learning_rate": 8.048780487804879e-06, | |
| "loss": 1.5473, | |
| "mean_token_accuracy": 0.6107198596000671, | |
| "num_tokens": 898005.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 1.0291173458099365, | |
| "epoch": 0.16585365853658537, | |
| "grad_norm": 0.83433598279953, | |
| "learning_rate": 8.170731707317073e-06, | |
| "loss": 1.466, | |
| "mean_token_accuracy": 0.624069094657898, | |
| "num_tokens": 911449.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 1.0759785175323486, | |
| "epoch": 0.16829268292682928, | |
| "grad_norm": 0.8013431429862976, | |
| "learning_rate": 8.292682926829268e-06, | |
| "loss": 1.4757, | |
| "mean_token_accuracy": 0.6221522688865662, | |
| "num_tokens": 924809.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 1.0588490962982178, | |
| "epoch": 0.17073170731707318, | |
| "grad_norm": 0.7442017197608948, | |
| "learning_rate": 8.414634146341464e-06, | |
| "loss": 1.4679, | |
| "mean_token_accuracy": 0.6220347881317139, | |
| "num_tokens": 938104.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 1.0712034702301025, | |
| "epoch": 0.17317073170731706, | |
| "grad_norm": 0.6614459156990051, | |
| "learning_rate": 8.536585365853658e-06, | |
| "loss": 1.4075, | |
| "mean_token_accuracy": 0.6332119703292847, | |
| "num_tokens": 951850.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 1.088219404220581, | |
| "epoch": 0.17560975609756097, | |
| "grad_norm": 0.7117521166801453, | |
| "learning_rate": 8.658536585365854e-06, | |
| "loss": 1.4387, | |
| "mean_token_accuracy": 0.6288971304893494, | |
| "num_tokens": 965113.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 1.1224637031555176, | |
| "epoch": 0.17804878048780487, | |
| "grad_norm": 0.5708485245704651, | |
| "learning_rate": 8.78048780487805e-06, | |
| "loss": 1.3922, | |
| "mean_token_accuracy": 0.6311355233192444, | |
| "num_tokens": 978779.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 1.1288890838623047, | |
| "epoch": 0.18048780487804877, | |
| "grad_norm": 0.5456262826919556, | |
| "learning_rate": 8.902439024390244e-06, | |
| "loss": 1.3848, | |
| "mean_token_accuracy": 0.6382190585136414, | |
| "num_tokens": 992024.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 1.1250863075256348, | |
| "epoch": 0.18292682926829268, | |
| "grad_norm": 0.5261056423187256, | |
| "learning_rate": 9.02439024390244e-06, | |
| "loss": 1.3867, | |
| "mean_token_accuracy": 0.6402657628059387, | |
| "num_tokens": 1005436.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 1.1720695495605469, | |
| "epoch": 0.18536585365853658, | |
| "grad_norm": 0.4624958336353302, | |
| "learning_rate": 9.146341463414635e-06, | |
| "loss": 1.3784, | |
| "mean_token_accuracy": 0.636989414691925, | |
| "num_tokens": 1018672.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 1.1629294157028198, | |
| "epoch": 0.1878048780487805, | |
| "grad_norm": 0.46797341108322144, | |
| "learning_rate": 9.268292682926831e-06, | |
| "loss": 1.355, | |
| "mean_token_accuracy": 0.6373533010482788, | |
| "num_tokens": 1031640.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 1.1572749614715576, | |
| "epoch": 0.1902439024390244, | |
| "grad_norm": 0.3808497488498688, | |
| "learning_rate": 9.390243902439025e-06, | |
| "loss": 1.3303, | |
| "mean_token_accuracy": 0.6452391743659973, | |
| "num_tokens": 1044910.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 1.1750357151031494, | |
| "epoch": 0.1926829268292683, | |
| "grad_norm": 0.34629523754119873, | |
| "learning_rate": 9.51219512195122e-06, | |
| "loss": 1.3324, | |
| "mean_token_accuracy": 0.6452615857124329, | |
| "num_tokens": 1058116.0, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 1.1967684030532837, | |
| "epoch": 0.1951219512195122, | |
| "grad_norm": 0.34349682927131653, | |
| "learning_rate": 9.634146341463415e-06, | |
| "loss": 1.322, | |
| "mean_token_accuracy": 0.6471808552742004, | |
| "num_tokens": 1071150.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 1.2120548486709595, | |
| "epoch": 0.1975609756097561, | |
| "grad_norm": 0.32455945014953613, | |
| "learning_rate": 9.756097560975611e-06, | |
| "loss": 1.2859, | |
| "mean_token_accuracy": 0.657558262348175, | |
| "num_tokens": 1084853.0, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 1.2008144855499268, | |
| "epoch": 0.2, | |
| "grad_norm": 0.30691349506378174, | |
| "learning_rate": 9.878048780487805e-06, | |
| "loss": 1.305, | |
| "mean_token_accuracy": 0.6493477821350098, | |
| "num_tokens": 1098438.0, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 1.232369065284729, | |
| "epoch": 0.20243902439024392, | |
| "grad_norm": 0.32630908489227295, | |
| "learning_rate": 1e-05, | |
| "loss": 1.3101, | |
| "mean_token_accuracy": 0.6437846422195435, | |
| "num_tokens": 1111623.0, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 1.2427518367767334, | |
| "epoch": 0.2048780487804878, | |
| "grad_norm": 0.3173503279685974, | |
| "learning_rate": 9.986449864498647e-06, | |
| "loss": 1.3054, | |
| "mean_token_accuracy": 0.6477247476577759, | |
| "num_tokens": 1125066.0, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 1.1999444961547852, | |
| "epoch": 0.2073170731707317, | |
| "grad_norm": 0.29154670238494873, | |
| "learning_rate": 9.972899728997291e-06, | |
| "loss": 1.2631, | |
| "mean_token_accuracy": 0.6559225916862488, | |
| "num_tokens": 1138826.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 1.2297258377075195, | |
| "epoch": 0.2097560975609756, | |
| "grad_norm": 0.3280792236328125, | |
| "learning_rate": 9.959349593495936e-06, | |
| "loss": 1.2839, | |
| "mean_token_accuracy": 0.6533303260803223, | |
| "num_tokens": 1152114.0, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 1.2501524686813354, | |
| "epoch": 0.2121951219512195, | |
| "grad_norm": 0.3305222988128662, | |
| "learning_rate": 9.94579945799458e-06, | |
| "loss": 1.3045, | |
| "mean_token_accuracy": 0.642970085144043, | |
| "num_tokens": 1165409.0, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 1.2506544589996338, | |
| "epoch": 0.2146341463414634, | |
| "grad_norm": 0.3272988796234131, | |
| "learning_rate": 9.932249322493226e-06, | |
| "loss": 1.2882, | |
| "mean_token_accuracy": 0.6515557169914246, | |
| "num_tokens": 1178506.0, | |
| "step": 88 | |
| }, | |
| { | |
| "entropy": 1.2083759307861328, | |
| "epoch": 0.21707317073170732, | |
| "grad_norm": 0.29003989696502686, | |
| "learning_rate": 9.91869918699187e-06, | |
| "loss": 1.2796, | |
| "mean_token_accuracy": 0.6522111296653748, | |
| "num_tokens": 1192542.0, | |
| "step": 89 | |
| }, | |
| { | |
| "entropy": 1.2205573320388794, | |
| "epoch": 0.21951219512195122, | |
| "grad_norm": 0.3061564564704895, | |
| "learning_rate": 9.905149051490516e-06, | |
| "loss": 1.2584, | |
| "mean_token_accuracy": 0.6538350582122803, | |
| "num_tokens": 1206404.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 1.2132331132888794, | |
| "epoch": 0.22195121951219512, | |
| "grad_norm": 0.2983347475528717, | |
| "learning_rate": 9.89159891598916e-06, | |
| "loss": 1.2618, | |
| "mean_token_accuracy": 0.6545613408088684, | |
| "num_tokens": 1220133.0, | |
| "step": 91 | |
| }, | |
| { | |
| "entropy": 1.1786279678344727, | |
| "epoch": 0.22439024390243903, | |
| "grad_norm": 0.2982328534126282, | |
| "learning_rate": 9.878048780487805e-06, | |
| "loss": 1.2286, | |
| "mean_token_accuracy": 0.6618372201919556, | |
| "num_tokens": 1233332.0, | |
| "step": 92 | |
| }, | |
| { | |
| "entropy": 1.1757036447525024, | |
| "epoch": 0.22682926829268293, | |
| "grad_norm": 0.2842158079147339, | |
| "learning_rate": 9.864498644986451e-06, | |
| "loss": 1.2393, | |
| "mean_token_accuracy": 0.6610386967658997, | |
| "num_tokens": 1246615.0, | |
| "step": 93 | |
| }, | |
| { | |
| "entropy": 1.1978955268859863, | |
| "epoch": 0.22926829268292684, | |
| "grad_norm": 0.2821376323699951, | |
| "learning_rate": 9.850948509485095e-06, | |
| "loss": 1.2549, | |
| "mean_token_accuracy": 0.6564176082611084, | |
| "num_tokens": 1259868.0, | |
| "step": 94 | |
| }, | |
| { | |
| "entropy": 1.1675746440887451, | |
| "epoch": 0.23170731707317074, | |
| "grad_norm": 0.2966885268688202, | |
| "learning_rate": 9.837398373983741e-06, | |
| "loss": 1.2118, | |
| "mean_token_accuracy": 0.6594321131706238, | |
| "num_tokens": 1273338.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 1.159611701965332, | |
| "epoch": 0.23414634146341465, | |
| "grad_norm": 0.2769213914871216, | |
| "learning_rate": 9.823848238482386e-06, | |
| "loss": 1.2249, | |
| "mean_token_accuracy": 0.6568121314048767, | |
| "num_tokens": 1286918.0, | |
| "step": 96 | |
| }, | |
| { | |
| "entropy": 1.172745943069458, | |
| "epoch": 0.23658536585365852, | |
| "grad_norm": 0.2758103013038635, | |
| "learning_rate": 9.81029810298103e-06, | |
| "loss": 1.2585, | |
| "mean_token_accuracy": 0.6483401656150818, | |
| "num_tokens": 1300339.0, | |
| "step": 97 | |
| }, | |
| { | |
| "entropy": 1.170766830444336, | |
| "epoch": 0.23902439024390243, | |
| "grad_norm": 0.2661439776420593, | |
| "learning_rate": 9.796747967479675e-06, | |
| "loss": 1.2254, | |
| "mean_token_accuracy": 0.6616303324699402, | |
| "num_tokens": 1313923.0, | |
| "step": 98 | |
| }, | |
| { | |
| "entropy": 1.177963376045227, | |
| "epoch": 0.24146341463414633, | |
| "grad_norm": 0.26802775263786316, | |
| "learning_rate": 9.78319783197832e-06, | |
| "loss": 1.2445, | |
| "mean_token_accuracy": 0.6533701419830322, | |
| "num_tokens": 1327351.0, | |
| "step": 99 | |
| }, | |
| { | |
| "entropy": 1.15558922290802, | |
| "epoch": 0.24390243902439024, | |
| "grad_norm": 0.2651721239089966, | |
| "learning_rate": 9.769647696476967e-06, | |
| "loss": 1.2158, | |
| "mean_token_accuracy": 0.6576597094535828, | |
| "num_tokens": 1340468.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 1.1425437927246094, | |
| "epoch": 0.24634146341463414, | |
| "grad_norm": 0.25243017077445984, | |
| "learning_rate": 9.756097560975611e-06, | |
| "loss": 1.2187, | |
| "mean_token_accuracy": 0.660866916179657, | |
| "num_tokens": 1353703.0, | |
| "step": 101 | |
| }, | |
| { | |
| "entropy": 1.1315678358078003, | |
| "epoch": 0.24878048780487805, | |
| "grad_norm": 0.25873032212257385, | |
| "learning_rate": 9.742547425474255e-06, | |
| "loss": 1.1975, | |
| "mean_token_accuracy": 0.6670178174972534, | |
| "num_tokens": 1367008.0, | |
| "step": 102 | |
| }, | |
| { | |
| "entropy": 1.1415460109710693, | |
| "epoch": 0.25121951219512195, | |
| "grad_norm": 0.26438820362091064, | |
| "learning_rate": 9.7289972899729e-06, | |
| "loss": 1.211, | |
| "mean_token_accuracy": 0.6611496806144714, | |
| "num_tokens": 1380558.0, | |
| "step": 103 | |
| }, | |
| { | |
| "entropy": 1.1473474502563477, | |
| "epoch": 0.25365853658536586, | |
| "grad_norm": 0.2560437023639679, | |
| "learning_rate": 9.715447154471546e-06, | |
| "loss": 1.2108, | |
| "mean_token_accuracy": 0.6570150852203369, | |
| "num_tokens": 1394216.0, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 1.1478271484375, | |
| "epoch": 0.25609756097560976, | |
| "grad_norm": 0.26183217763900757, | |
| "learning_rate": 9.70189701897019e-06, | |
| "loss": 1.2186, | |
| "mean_token_accuracy": 0.6576521992683411, | |
| "num_tokens": 1407470.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 1.1295911073684692, | |
| "epoch": 0.25853658536585367, | |
| "grad_norm": 0.25204378366470337, | |
| "learning_rate": 9.688346883468836e-06, | |
| "loss": 1.1837, | |
| "mean_token_accuracy": 0.6604463458061218, | |
| "num_tokens": 1420883.0, | |
| "step": 106 | |
| }, | |
| { | |
| "entropy": 1.125402808189392, | |
| "epoch": 0.26097560975609757, | |
| "grad_norm": 0.26209568977355957, | |
| "learning_rate": 9.67479674796748e-06, | |
| "loss": 1.1919, | |
| "mean_token_accuracy": 0.662480354309082, | |
| "num_tokens": 1434276.0, | |
| "step": 107 | |
| }, | |
| { | |
| "entropy": 1.1191213130950928, | |
| "epoch": 0.2634146341463415, | |
| "grad_norm": 0.2613905668258667, | |
| "learning_rate": 9.661246612466125e-06, | |
| "loss": 1.1838, | |
| "mean_token_accuracy": 0.6658087968826294, | |
| "num_tokens": 1447503.0, | |
| "step": 108 | |
| }, | |
| { | |
| "entropy": 1.1112308502197266, | |
| "epoch": 0.2658536585365854, | |
| "grad_norm": 0.25403350591659546, | |
| "learning_rate": 9.64769647696477e-06, | |
| "loss": 1.1703, | |
| "mean_token_accuracy": 0.6672566533088684, | |
| "num_tokens": 1461079.0, | |
| "step": 109 | |
| }, | |
| { | |
| "entropy": 1.1137951612472534, | |
| "epoch": 0.2682926829268293, | |
| "grad_norm": 0.26483258605003357, | |
| "learning_rate": 9.634146341463415e-06, | |
| "loss": 1.1691, | |
| "mean_token_accuracy": 0.6706117391586304, | |
| "num_tokens": 1474614.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 1.0933289527893066, | |
| "epoch": 0.2707317073170732, | |
| "grad_norm": 0.2698538601398468, | |
| "learning_rate": 9.620596205962061e-06, | |
| "loss": 1.1605, | |
| "mean_token_accuracy": 0.6701310276985168, | |
| "num_tokens": 1487908.0, | |
| "step": 111 | |
| }, | |
| { | |
| "entropy": 1.1143202781677246, | |
| "epoch": 0.2731707317073171, | |
| "grad_norm": 0.2627071142196655, | |
| "learning_rate": 9.607046070460706e-06, | |
| "loss": 1.1438, | |
| "mean_token_accuracy": 0.6680628061294556, | |
| "num_tokens": 1501294.0, | |
| "step": 112 | |
| }, | |
| { | |
| "entropy": 1.127140760421753, | |
| "epoch": 0.275609756097561, | |
| "grad_norm": 0.273106187582016, | |
| "learning_rate": 9.59349593495935e-06, | |
| "loss": 1.1985, | |
| "mean_token_accuracy": 0.6580502390861511, | |
| "num_tokens": 1514850.0, | |
| "step": 113 | |
| }, | |
| { | |
| "entropy": 1.0913937091827393, | |
| "epoch": 0.2780487804878049, | |
| "grad_norm": 0.2593974769115448, | |
| "learning_rate": 9.579945799457996e-06, | |
| "loss": 1.1618, | |
| "mean_token_accuracy": 0.6630794405937195, | |
| "num_tokens": 1528154.0, | |
| "step": 114 | |
| }, | |
| { | |
| "entropy": 1.1081091165542603, | |
| "epoch": 0.2804878048780488, | |
| "grad_norm": 0.2798754870891571, | |
| "learning_rate": 9.56639566395664e-06, | |
| "loss": 1.1377, | |
| "mean_token_accuracy": 0.6722344756126404, | |
| "num_tokens": 1540862.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 1.1191236972808838, | |
| "epoch": 0.28292682926829266, | |
| "grad_norm": 0.2535606920719147, | |
| "learning_rate": 9.552845528455286e-06, | |
| "loss": 1.1376, | |
| "mean_token_accuracy": 0.6760023832321167, | |
| "num_tokens": 1554196.0, | |
| "step": 116 | |
| }, | |
| { | |
| "entropy": 1.1165391206741333, | |
| "epoch": 0.28536585365853656, | |
| "grad_norm": 0.25735312700271606, | |
| "learning_rate": 9.53929539295393e-06, | |
| "loss": 1.1408, | |
| "mean_token_accuracy": 0.6719987392425537, | |
| "num_tokens": 1567090.0, | |
| "step": 117 | |
| }, | |
| { | |
| "entropy": 1.106642484664917, | |
| "epoch": 0.28780487804878047, | |
| "grad_norm": 0.2398259937763214, | |
| "learning_rate": 9.525745257452575e-06, | |
| "loss": 1.145, | |
| "mean_token_accuracy": 0.6701483726501465, | |
| "num_tokens": 1580318.0, | |
| "step": 118 | |
| }, | |
| { | |
| "entropy": 1.0864262580871582, | |
| "epoch": 0.29024390243902437, | |
| "grad_norm": 0.2223978489637375, | |
| "learning_rate": 9.51219512195122e-06, | |
| "loss": 1.1119, | |
| "mean_token_accuracy": 0.6760355234146118, | |
| "num_tokens": 1593854.0, | |
| "step": 119 | |
| }, | |
| { | |
| "entropy": 1.094162940979004, | |
| "epoch": 0.2926829268292683, | |
| "grad_norm": 0.23250681161880493, | |
| "learning_rate": 9.498644986449865e-06, | |
| "loss": 1.1139, | |
| "mean_token_accuracy": 0.6825433373451233, | |
| "num_tokens": 1606908.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 1.0955393314361572, | |
| "epoch": 0.2951219512195122, | |
| "grad_norm": 0.21376796066761017, | |
| "learning_rate": 9.485094850948512e-06, | |
| "loss": 1.108, | |
| "mean_token_accuracy": 0.6783738136291504, | |
| "num_tokens": 1620477.0, | |
| "step": 121 | |
| }, | |
| { | |
| "entropy": 1.1169179677963257, | |
| "epoch": 0.2975609756097561, | |
| "grad_norm": 0.2168598771095276, | |
| "learning_rate": 9.471544715447156e-06, | |
| "loss": 1.1403, | |
| "mean_token_accuracy": 0.6717775464057922, | |
| "num_tokens": 1633798.0, | |
| "step": 122 | |
| }, | |
| { | |
| "entropy": 1.1065254211425781, | |
| "epoch": 0.3, | |
| "grad_norm": 0.20749054849147797, | |
| "learning_rate": 9.4579945799458e-06, | |
| "loss": 1.1324, | |
| "mean_token_accuracy": 0.6725362539291382, | |
| "num_tokens": 1647614.0, | |
| "step": 123 | |
| }, | |
| { | |
| "entropy": 1.0934035778045654, | |
| "epoch": 0.3024390243902439, | |
| "grad_norm": 0.2093004733324051, | |
| "learning_rate": 9.444444444444445e-06, | |
| "loss": 1.1156, | |
| "mean_token_accuracy": 0.6740745902061462, | |
| "num_tokens": 1661354.0, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 1.1130709648132324, | |
| "epoch": 0.3048780487804878, | |
| "grad_norm": 0.2131703943014145, | |
| "learning_rate": 9.43089430894309e-06, | |
| "loss": 1.1447, | |
| "mean_token_accuracy": 0.669326901435852, | |
| "num_tokens": 1674652.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 1.080055594444275, | |
| "epoch": 0.3073170731707317, | |
| "grad_norm": 0.20652315020561218, | |
| "learning_rate": 9.417344173441735e-06, | |
| "loss": 1.105, | |
| "mean_token_accuracy": 0.6778402924537659, | |
| "num_tokens": 1688003.0, | |
| "step": 126 | |
| }, | |
| { | |
| "entropy": 1.0850718021392822, | |
| "epoch": 0.3097560975609756, | |
| "grad_norm": 0.19275838136672974, | |
| "learning_rate": 9.403794037940381e-06, | |
| "loss": 1.1143, | |
| "mean_token_accuracy": 0.6753328442573547, | |
| "num_tokens": 1702289.0, | |
| "step": 127 | |
| }, | |
| { | |
| "entropy": 1.0820226669311523, | |
| "epoch": 0.3121951219512195, | |
| "grad_norm": 0.21166393160820007, | |
| "learning_rate": 9.390243902439025e-06, | |
| "loss": 1.1253, | |
| "mean_token_accuracy": 0.6773277521133423, | |
| "num_tokens": 1715687.0, | |
| "step": 128 | |
| }, | |
| { | |
| "entropy": 1.0830371379852295, | |
| "epoch": 0.3146341463414634, | |
| "grad_norm": 0.21370024979114532, | |
| "learning_rate": 9.37669376693767e-06, | |
| "loss": 1.1021, | |
| "mean_token_accuracy": 0.6788139343261719, | |
| "num_tokens": 1728957.0, | |
| "step": 129 | |
| }, | |
| { | |
| "entropy": 1.0973628759384155, | |
| "epoch": 0.3170731707317073, | |
| "grad_norm": 0.21937358379364014, | |
| "learning_rate": 9.363143631436316e-06, | |
| "loss": 1.1162, | |
| "mean_token_accuracy": 0.6790520548820496, | |
| "num_tokens": 1742349.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 1.0636382102966309, | |
| "epoch": 0.3195121951219512, | |
| "grad_norm": 0.21198157966136932, | |
| "learning_rate": 9.34959349593496e-06, | |
| "loss": 1.0773, | |
| "mean_token_accuracy": 0.6862117648124695, | |
| "num_tokens": 1755804.0, | |
| "step": 131 | |
| }, | |
| { | |
| "entropy": 1.0731333494186401, | |
| "epoch": 0.32195121951219513, | |
| "grad_norm": 0.2029760479927063, | |
| "learning_rate": 9.336043360433606e-06, | |
| "loss": 1.0861, | |
| "mean_token_accuracy": 0.6837157011032104, | |
| "num_tokens": 1769115.0, | |
| "step": 132 | |
| }, | |
| { | |
| "entropy": 1.0707873106002808, | |
| "epoch": 0.32439024390243903, | |
| "grad_norm": 0.20230601727962494, | |
| "learning_rate": 9.32249322493225e-06, | |
| "loss": 1.0817, | |
| "mean_token_accuracy": 0.6842864751815796, | |
| "num_tokens": 1782298.0, | |
| "step": 133 | |
| }, | |
| { | |
| "entropy": 1.0774948596954346, | |
| "epoch": 0.32682926829268294, | |
| "grad_norm": 0.20387127995491028, | |
| "learning_rate": 9.308943089430895e-06, | |
| "loss": 1.086, | |
| "mean_token_accuracy": 0.6792807579040527, | |
| "num_tokens": 1795606.0, | |
| "step": 134 | |
| }, | |
| { | |
| "entropy": 1.0700063705444336, | |
| "epoch": 0.32926829268292684, | |
| "grad_norm": 0.20648805797100067, | |
| "learning_rate": 9.29539295392954e-06, | |
| "loss": 1.0602, | |
| "mean_token_accuracy": 0.6847176551818848, | |
| "num_tokens": 1809010.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 1.0678541660308838, | |
| "epoch": 0.33170731707317075, | |
| "grad_norm": 0.20196370780467987, | |
| "learning_rate": 9.281842818428185e-06, | |
| "loss": 1.0767, | |
| "mean_token_accuracy": 0.6867226362228394, | |
| "num_tokens": 1822372.0, | |
| "step": 136 | |
| }, | |
| { | |
| "entropy": 1.0628666877746582, | |
| "epoch": 0.33414634146341465, | |
| "grad_norm": 0.1941923052072525, | |
| "learning_rate": 9.268292682926831e-06, | |
| "loss": 1.0941, | |
| "mean_token_accuracy": 0.6836166381835938, | |
| "num_tokens": 1835859.0, | |
| "step": 137 | |
| }, | |
| { | |
| "entropy": 1.0489256381988525, | |
| "epoch": 0.33658536585365856, | |
| "grad_norm": 0.19842347502708435, | |
| "learning_rate": 9.254742547425476e-06, | |
| "loss": 1.0761, | |
| "mean_token_accuracy": 0.6827327013015747, | |
| "num_tokens": 1849444.0, | |
| "step": 138 | |
| }, | |
| { | |
| "entropy": 1.0854852199554443, | |
| "epoch": 0.33902439024390246, | |
| "grad_norm": 0.19903236627578735, | |
| "learning_rate": 9.24119241192412e-06, | |
| "loss": 1.0873, | |
| "mean_token_accuracy": 0.6775000095367432, | |
| "num_tokens": 1863460.0, | |
| "step": 139 | |
| }, | |
| { | |
| "entropy": 1.0722227096557617, | |
| "epoch": 0.34146341463414637, | |
| "grad_norm": 0.19855357706546783, | |
| "learning_rate": 9.227642276422764e-06, | |
| "loss": 1.0847, | |
| "mean_token_accuracy": 0.6859818696975708, | |
| "num_tokens": 1877144.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 1.0752365589141846, | |
| "epoch": 0.3439024390243902, | |
| "grad_norm": 0.19797125458717346, | |
| "learning_rate": 9.21409214092141e-06, | |
| "loss": 1.099, | |
| "mean_token_accuracy": 0.6804720163345337, | |
| "num_tokens": 1890295.0, | |
| "step": 141 | |
| }, | |
| { | |
| "entropy": 1.0549845695495605, | |
| "epoch": 0.3463414634146341, | |
| "grad_norm": 0.18283385038375854, | |
| "learning_rate": 9.200542005420055e-06, | |
| "loss": 1.0662, | |
| "mean_token_accuracy": 0.6898062825202942, | |
| "num_tokens": 1903319.0, | |
| "step": 142 | |
| }, | |
| { | |
| "entropy": 1.0448575019836426, | |
| "epoch": 0.348780487804878, | |
| "grad_norm": 0.17837047576904297, | |
| "learning_rate": 9.1869918699187e-06, | |
| "loss": 1.0748, | |
| "mean_token_accuracy": 0.6830585598945618, | |
| "num_tokens": 1917224.0, | |
| "step": 143 | |
| }, | |
| { | |
| "entropy": 1.0477330684661865, | |
| "epoch": 0.35121951219512193, | |
| "grad_norm": 0.18431058526039124, | |
| "learning_rate": 9.173441734417345e-06, | |
| "loss": 1.057, | |
| "mean_token_accuracy": 0.6876409649848938, | |
| "num_tokens": 1930542.0, | |
| "step": 144 | |
| }, | |
| { | |
| "entropy": 1.0347704887390137, | |
| "epoch": 0.35365853658536583, | |
| "grad_norm": 0.18002833425998688, | |
| "learning_rate": 9.15989159891599e-06, | |
| "loss": 1.062, | |
| "mean_token_accuracy": 0.6917096376419067, | |
| "num_tokens": 1943935.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 1.0429667234420776, | |
| "epoch": 0.35609756097560974, | |
| "grad_norm": 0.1801144927740097, | |
| "learning_rate": 9.146341463414635e-06, | |
| "loss": 1.0623, | |
| "mean_token_accuracy": 0.6872867941856384, | |
| "num_tokens": 1957142.0, | |
| "step": 146 | |
| }, | |
| { | |
| "entropy": 1.0446667671203613, | |
| "epoch": 0.35853658536585364, | |
| "grad_norm": 0.18068258464336395, | |
| "learning_rate": 9.13279132791328e-06, | |
| "loss": 1.0737, | |
| "mean_token_accuracy": 0.6836559176445007, | |
| "num_tokens": 1970539.0, | |
| "step": 147 | |
| }, | |
| { | |
| "entropy": 1.0441868305206299, | |
| "epoch": 0.36097560975609755, | |
| "grad_norm": 0.17684251070022583, | |
| "learning_rate": 9.119241192411926e-06, | |
| "loss": 1.0487, | |
| "mean_token_accuracy": 0.6862218379974365, | |
| "num_tokens": 1983953.0, | |
| "step": 148 | |
| }, | |
| { | |
| "entropy": 1.037201166152954, | |
| "epoch": 0.36341463414634145, | |
| "grad_norm": 0.170819953083992, | |
| "learning_rate": 9.10569105691057e-06, | |
| "loss": 1.0587, | |
| "mean_token_accuracy": 0.6860895156860352, | |
| "num_tokens": 1997218.0, | |
| "step": 149 | |
| }, | |
| { | |
| "entropy": 1.0491631031036377, | |
| "epoch": 0.36585365853658536, | |
| "grad_norm": 0.18243585526943207, | |
| "learning_rate": 9.092140921409215e-06, | |
| "loss": 1.0699, | |
| "mean_token_accuracy": 0.6834457516670227, | |
| "num_tokens": 2010723.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 1.029181957244873, | |
| "epoch": 0.36829268292682926, | |
| "grad_norm": 0.18266521394252777, | |
| "learning_rate": 9.07859078590786e-06, | |
| "loss": 1.0574, | |
| "mean_token_accuracy": 0.6896981000900269, | |
| "num_tokens": 2024387.0, | |
| "step": 151 | |
| }, | |
| { | |
| "entropy": 1.0140658617019653, | |
| "epoch": 0.37073170731707317, | |
| "grad_norm": 0.17179487645626068, | |
| "learning_rate": 9.065040650406505e-06, | |
| "loss": 1.0406, | |
| "mean_token_accuracy": 0.6913700103759766, | |
| "num_tokens": 2037775.0, | |
| "step": 152 | |
| }, | |
| { | |
| "entropy": 1.0303168296813965, | |
| "epoch": 0.37317073170731707, | |
| "grad_norm": 0.1785237044095993, | |
| "learning_rate": 9.051490514905151e-06, | |
| "loss": 1.0363, | |
| "mean_token_accuracy": 0.6900920867919922, | |
| "num_tokens": 2051366.0, | |
| "step": 153 | |
| }, | |
| { | |
| "entropy": 1.019331693649292, | |
| "epoch": 0.375609756097561, | |
| "grad_norm": 0.17573611438274384, | |
| "learning_rate": 9.037940379403795e-06, | |
| "loss": 1.0413, | |
| "mean_token_accuracy": 0.6888290047645569, | |
| "num_tokens": 2064738.0, | |
| "step": 154 | |
| }, | |
| { | |
| "entropy": 1.041901707649231, | |
| "epoch": 0.3780487804878049, | |
| "grad_norm": 0.17206346988677979, | |
| "learning_rate": 9.02439024390244e-06, | |
| "loss": 1.0615, | |
| "mean_token_accuracy": 0.6894234418869019, | |
| "num_tokens": 2077849.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 1.0418643951416016, | |
| "epoch": 0.3804878048780488, | |
| "grad_norm": 0.17650866508483887, | |
| "learning_rate": 9.010840108401084e-06, | |
| "loss": 1.0688, | |
| "mean_token_accuracy": 0.6822457313537598, | |
| "num_tokens": 2091366.0, | |
| "step": 156 | |
| }, | |
| { | |
| "entropy": 1.0257384777069092, | |
| "epoch": 0.3829268292682927, | |
| "grad_norm": 0.17796455323696136, | |
| "learning_rate": 8.99728997289973e-06, | |
| "loss": 1.0436, | |
| "mean_token_accuracy": 0.6862221956253052, | |
| "num_tokens": 2104882.0, | |
| "step": 157 | |
| }, | |
| { | |
| "entropy": 1.0320515632629395, | |
| "epoch": 0.3853658536585366, | |
| "grad_norm": 0.17598049342632294, | |
| "learning_rate": 8.983739837398374e-06, | |
| "loss": 1.0419, | |
| "mean_token_accuracy": 0.6948973536491394, | |
| "num_tokens": 2118146.0, | |
| "step": 158 | |
| }, | |
| { | |
| "entropy": 1.019339919090271, | |
| "epoch": 0.3878048780487805, | |
| "grad_norm": 0.19084501266479492, | |
| "learning_rate": 8.970189701897019e-06, | |
| "loss": 1.0391, | |
| "mean_token_accuracy": 0.6915437579154968, | |
| "num_tokens": 2131454.0, | |
| "step": 159 | |
| }, | |
| { | |
| "entropy": 1.0261130332946777, | |
| "epoch": 0.3902439024390244, | |
| "grad_norm": 0.17102600634098053, | |
| "learning_rate": 8.956639566395665e-06, | |
| "loss": 1.025, | |
| "mean_token_accuracy": 0.6942394971847534, | |
| "num_tokens": 2144889.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 1.0434393882751465, | |
| "epoch": 0.3926829268292683, | |
| "grad_norm": 0.17654499411582947, | |
| "learning_rate": 8.94308943089431e-06, | |
| "loss": 1.0519, | |
| "mean_token_accuracy": 0.6885669827461243, | |
| "num_tokens": 2158436.0, | |
| "step": 161 | |
| }, | |
| { | |
| "entropy": 1.0071184635162354, | |
| "epoch": 0.3951219512195122, | |
| "grad_norm": 0.17178241908550262, | |
| "learning_rate": 8.929539295392955e-06, | |
| "loss": 1.0156, | |
| "mean_token_accuracy": 0.693914532661438, | |
| "num_tokens": 2172239.0, | |
| "step": 162 | |
| }, | |
| { | |
| "entropy": 1.0304242372512817, | |
| "epoch": 0.3975609756097561, | |
| "grad_norm": 0.16800439357757568, | |
| "learning_rate": 8.9159891598916e-06, | |
| "loss": 1.0366, | |
| "mean_token_accuracy": 0.6918449997901917, | |
| "num_tokens": 2185388.0, | |
| "step": 163 | |
| }, | |
| { | |
| "entropy": 1.0210349559783936, | |
| "epoch": 0.4, | |
| "grad_norm": 0.1748812049627304, | |
| "learning_rate": 8.902439024390244e-06, | |
| "loss": 1.0313, | |
| "mean_token_accuracy": 0.6942216753959656, | |
| "num_tokens": 2198747.0, | |
| "step": 164 | |
| }, | |
| { | |
| "entropy": 1.0305485725402832, | |
| "epoch": 0.4024390243902439, | |
| "grad_norm": 0.17672093212604523, | |
| "learning_rate": 8.888888888888888e-06, | |
| "loss": 1.0314, | |
| "mean_token_accuracy": 0.6892403364181519, | |
| "num_tokens": 2212230.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 1.0268189907073975, | |
| "epoch": 0.40487804878048783, | |
| "grad_norm": 0.16995690762996674, | |
| "learning_rate": 8.875338753387534e-06, | |
| "loss": 1.0279, | |
| "mean_token_accuracy": 0.6927863359451294, | |
| "num_tokens": 2225263.0, | |
| "step": 166 | |
| }, | |
| { | |
| "entropy": 1.0141714811325073, | |
| "epoch": 0.4073170731707317, | |
| "grad_norm": 0.1733706146478653, | |
| "learning_rate": 8.86178861788618e-06, | |
| "loss": 1.0209, | |
| "mean_token_accuracy": 0.6984298825263977, | |
| "num_tokens": 2238208.0, | |
| "step": 167 | |
| }, | |
| { | |
| "entropy": 1.015406608581543, | |
| "epoch": 0.4097560975609756, | |
| "grad_norm": 0.175829216837883, | |
| "learning_rate": 8.848238482384825e-06, | |
| "loss": 1.0377, | |
| "mean_token_accuracy": 0.6940392255783081, | |
| "num_tokens": 2250974.0, | |
| "step": 168 | |
| }, | |
| { | |
| "entropy": 1.0115768909454346, | |
| "epoch": 0.4121951219512195, | |
| "grad_norm": 0.16748936474323273, | |
| "learning_rate": 8.834688346883469e-06, | |
| "loss": 1.027, | |
| "mean_token_accuracy": 0.6916769742965698, | |
| "num_tokens": 2264771.0, | |
| "step": 169 | |
| }, | |
| { | |
| "entropy": 1.003655195236206, | |
| "epoch": 0.4146341463414634, | |
| "grad_norm": 0.16363762319087982, | |
| "learning_rate": 8.821138211382113e-06, | |
| "loss": 0.9975, | |
| "mean_token_accuracy": 0.6990435123443604, | |
| "num_tokens": 2278274.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 1.0265607833862305, | |
| "epoch": 0.4170731707317073, | |
| "grad_norm": 0.1725579798221588, | |
| "learning_rate": 8.80758807588076e-06, | |
| "loss": 1.0406, | |
| "mean_token_accuracy": 0.6887966990470886, | |
| "num_tokens": 2291786.0, | |
| "step": 171 | |
| }, | |
| { | |
| "entropy": 1.0243334770202637, | |
| "epoch": 0.4195121951219512, | |
| "grad_norm": 0.17333285510540009, | |
| "learning_rate": 8.794037940379404e-06, | |
| "loss": 1.0251, | |
| "mean_token_accuracy": 0.6909435987472534, | |
| "num_tokens": 2305505.0, | |
| "step": 172 | |
| }, | |
| { | |
| "entropy": 1.0068650245666504, | |
| "epoch": 0.4219512195121951, | |
| "grad_norm": 0.17407289147377014, | |
| "learning_rate": 8.78048780487805e-06, | |
| "loss": 0.9931, | |
| "mean_token_accuracy": 0.6996558904647827, | |
| "num_tokens": 2318889.0, | |
| "step": 173 | |
| }, | |
| { | |
| "entropy": 1.0199451446533203, | |
| "epoch": 0.424390243902439, | |
| "grad_norm": 0.17032553255558014, | |
| "learning_rate": 8.766937669376694e-06, | |
| "loss": 1.0338, | |
| "mean_token_accuracy": 0.6946343779563904, | |
| "num_tokens": 2332361.0, | |
| "step": 174 | |
| }, | |
| { | |
| "entropy": 1.0083736181259155, | |
| "epoch": 0.4268292682926829, | |
| "grad_norm": 0.17206445336341858, | |
| "learning_rate": 8.753387533875339e-06, | |
| "loss": 1.0215, | |
| "mean_token_accuracy": 0.6917036771774292, | |
| "num_tokens": 2345877.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 1.0085593461990356, | |
| "epoch": 0.4292682926829268, | |
| "grad_norm": 0.1674298793077469, | |
| "learning_rate": 8.739837398373985e-06, | |
| "loss": 1.0097, | |
| "mean_token_accuracy": 0.6976450681686401, | |
| "num_tokens": 2359354.0, | |
| "step": 176 | |
| }, | |
| { | |
| "entropy": 1.0162107944488525, | |
| "epoch": 0.4317073170731707, | |
| "grad_norm": 0.1732998937368393, | |
| "learning_rate": 8.726287262872629e-06, | |
| "loss": 1.0413, | |
| "mean_token_accuracy": 0.688483476638794, | |
| "num_tokens": 2372525.0, | |
| "step": 177 | |
| }, | |
| { | |
| "entropy": 1.0145041942596436, | |
| "epoch": 0.43414634146341463, | |
| "grad_norm": 0.16612009704113007, | |
| "learning_rate": 8.712737127371275e-06, | |
| "loss": 1.0258, | |
| "mean_token_accuracy": 0.6966949105262756, | |
| "num_tokens": 2386217.0, | |
| "step": 178 | |
| }, | |
| { | |
| "entropy": 1.0364079475402832, | |
| "epoch": 0.43658536585365854, | |
| "grad_norm": 0.16687557101249695, | |
| "learning_rate": 8.69918699186992e-06, | |
| "loss": 1.0329, | |
| "mean_token_accuracy": 0.689834475517273, | |
| "num_tokens": 2399887.0, | |
| "step": 179 | |
| }, | |
| { | |
| "entropy": 1.000331163406372, | |
| "epoch": 0.43902439024390244, | |
| "grad_norm": 0.17682859301567078, | |
| "learning_rate": 8.685636856368564e-06, | |
| "loss": 1.0069, | |
| "mean_token_accuracy": 0.6982501745223999, | |
| "num_tokens": 2412990.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 1.0094903707504272, | |
| "epoch": 0.44146341463414634, | |
| "grad_norm": 0.17109999060630798, | |
| "learning_rate": 8.67208672086721e-06, | |
| "loss": 0.9865, | |
| "mean_token_accuracy": 0.7004877924919128, | |
| "num_tokens": 2426331.0, | |
| "step": 181 | |
| }, | |
| { | |
| "entropy": 1.001022219657898, | |
| "epoch": 0.44390243902439025, | |
| "grad_norm": 0.17116393148899078, | |
| "learning_rate": 8.658536585365854e-06, | |
| "loss": 1.0041, | |
| "mean_token_accuracy": 0.6996858716011047, | |
| "num_tokens": 2439400.0, | |
| "step": 182 | |
| }, | |
| { | |
| "entropy": 1.0060547590255737, | |
| "epoch": 0.44634146341463415, | |
| "grad_norm": 0.17257100343704224, | |
| "learning_rate": 8.6449864498645e-06, | |
| "loss": 1.0233, | |
| "mean_token_accuracy": 0.6987658143043518, | |
| "num_tokens": 2452542.0, | |
| "step": 183 | |
| }, | |
| { | |
| "entropy": 0.9930256605148315, | |
| "epoch": 0.44878048780487806, | |
| "grad_norm": 0.16270838677883148, | |
| "learning_rate": 8.631436314363144e-06, | |
| "loss": 0.9916, | |
| "mean_token_accuracy": 0.7055611610412598, | |
| "num_tokens": 2466476.0, | |
| "step": 184 | |
| }, | |
| { | |
| "entropy": 1.0109392404556274, | |
| "epoch": 0.45121951219512196, | |
| "grad_norm": 0.16337797045707703, | |
| "learning_rate": 8.617886178861789e-06, | |
| "loss": 0.9938, | |
| "mean_token_accuracy": 0.7032565474510193, | |
| "num_tokens": 2479911.0, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 1.0034139156341553, | |
| "epoch": 0.45365853658536587, | |
| "grad_norm": 0.16562442481517792, | |
| "learning_rate": 8.604336043360433e-06, | |
| "loss": 1.0043, | |
| "mean_token_accuracy": 0.6976569294929504, | |
| "num_tokens": 2493243.0, | |
| "step": 186 | |
| }, | |
| { | |
| "entropy": 1.0120468139648438, | |
| "epoch": 0.4560975609756098, | |
| "grad_norm": 0.16520871222019196, | |
| "learning_rate": 8.59078590785908e-06, | |
| "loss": 0.9956, | |
| "mean_token_accuracy": 0.6959730982780457, | |
| "num_tokens": 2506942.0, | |
| "step": 187 | |
| }, | |
| { | |
| "entropy": 1.0021930932998657, | |
| "epoch": 0.4585365853658537, | |
| "grad_norm": 0.16627825796604156, | |
| "learning_rate": 8.577235772357724e-06, | |
| "loss": 1.0007, | |
| "mean_token_accuracy": 0.7009619474411011, | |
| "num_tokens": 2520264.0, | |
| "step": 188 | |
| }, | |
| { | |
| "entropy": 1.0003260374069214, | |
| "epoch": 0.4609756097560976, | |
| "grad_norm": 0.17842690646648407, | |
| "learning_rate": 8.56368563685637e-06, | |
| "loss": 1.0258, | |
| "mean_token_accuracy": 0.6934998631477356, | |
| "num_tokens": 2533249.0, | |
| "step": 189 | |
| }, | |
| { | |
| "entropy": 0.998503565788269, | |
| "epoch": 0.4634146341463415, | |
| "grad_norm": 0.17247022688388824, | |
| "learning_rate": 8.550135501355014e-06, | |
| "loss": 0.9917, | |
| "mean_token_accuracy": 0.7048850059509277, | |
| "num_tokens": 2546182.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 1.0056812763214111, | |
| "epoch": 0.4658536585365854, | |
| "grad_norm": 0.17095550894737244, | |
| "learning_rate": 8.536585365853658e-06, | |
| "loss": 1.001, | |
| "mean_token_accuracy": 0.698594868183136, | |
| "num_tokens": 2559791.0, | |
| "step": 191 | |
| }, | |
| { | |
| "entropy": 1.0053273439407349, | |
| "epoch": 0.4682926829268293, | |
| "grad_norm": 0.17117735743522644, | |
| "learning_rate": 8.523035230352304e-06, | |
| "loss": 0.998, | |
| "mean_token_accuracy": 0.7012236714363098, | |
| "num_tokens": 2572964.0, | |
| "step": 192 | |
| }, | |
| { | |
| "entropy": 1.0028555393218994, | |
| "epoch": 0.47073170731707314, | |
| "grad_norm": 0.16437511146068573, | |
| "learning_rate": 8.509485094850949e-06, | |
| "loss": 1.0107, | |
| "mean_token_accuracy": 0.6982872486114502, | |
| "num_tokens": 2586642.0, | |
| "step": 193 | |
| }, | |
| { | |
| "entropy": 0.9957489967346191, | |
| "epoch": 0.47317073170731705, | |
| "grad_norm": 0.16638755798339844, | |
| "learning_rate": 8.495934959349595e-06, | |
| "loss": 1.0016, | |
| "mean_token_accuracy": 0.6981272101402283, | |
| "num_tokens": 2600114.0, | |
| "step": 194 | |
| }, | |
| { | |
| "entropy": 1.0133684873580933, | |
| "epoch": 0.47560975609756095, | |
| "grad_norm": 0.1650749295949936, | |
| "learning_rate": 8.482384823848239e-06, | |
| "loss": 1.0037, | |
| "mean_token_accuracy": 0.7015370726585388, | |
| "num_tokens": 2613532.0, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 0.9839978218078613, | |
| "epoch": 0.47804878048780486, | |
| "grad_norm": 0.1746927946805954, | |
| "learning_rate": 8.468834688346883e-06, | |
| "loss": 0.9846, | |
| "mean_token_accuracy": 0.7021719813346863, | |
| "num_tokens": 2626992.0, | |
| "step": 196 | |
| }, | |
| { | |
| "entropy": 0.9965272545814514, | |
| "epoch": 0.48048780487804876, | |
| "grad_norm": 0.16948050260543823, | |
| "learning_rate": 8.45528455284553e-06, | |
| "loss": 0.9919, | |
| "mean_token_accuracy": 0.7043160200119019, | |
| "num_tokens": 2640678.0, | |
| "step": 197 | |
| }, | |
| { | |
| "entropy": 0.9951333999633789, | |
| "epoch": 0.48292682926829267, | |
| "grad_norm": 0.17663675546646118, | |
| "learning_rate": 8.441734417344174e-06, | |
| "loss": 0.9898, | |
| "mean_token_accuracy": 0.6999698281288147, | |
| "num_tokens": 2653946.0, | |
| "step": 198 | |
| }, | |
| { | |
| "entropy": 0.9917622804641724, | |
| "epoch": 0.4853658536585366, | |
| "grad_norm": 0.16705453395843506, | |
| "learning_rate": 8.42818428184282e-06, | |
| "loss": 0.9863, | |
| "mean_token_accuracy": 0.7023406624794006, | |
| "num_tokens": 2667548.0, | |
| "step": 199 | |
| }, | |
| { | |
| "entropy": 0.9877250790596008, | |
| "epoch": 0.4878048780487805, | |
| "grad_norm": 0.1668422818183899, | |
| "learning_rate": 8.414634146341464e-06, | |
| "loss": 0.9898, | |
| "mean_token_accuracy": 0.6997197270393372, | |
| "num_tokens": 2680765.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.9894189834594727, | |
| "epoch": 0.4902439024390244, | |
| "grad_norm": 0.16777603328227997, | |
| "learning_rate": 8.401084010840109e-06, | |
| "loss": 0.9858, | |
| "mean_token_accuracy": 0.7059915065765381, | |
| "num_tokens": 2694250.0, | |
| "step": 201 | |
| }, | |
| { | |
| "entropy": 1.0040414333343506, | |
| "epoch": 0.4926829268292683, | |
| "grad_norm": 0.15866151452064514, | |
| "learning_rate": 8.387533875338753e-06, | |
| "loss": 1.003, | |
| "mean_token_accuracy": 0.6997585892677307, | |
| "num_tokens": 2707522.0, | |
| "step": 202 | |
| }, | |
| { | |
| "entropy": 0.9769632816314697, | |
| "epoch": 0.4951219512195122, | |
| "grad_norm": 0.1801648736000061, | |
| "learning_rate": 8.373983739837399e-06, | |
| "loss": 0.9734, | |
| "mean_token_accuracy": 0.7056036591529846, | |
| "num_tokens": 2721047.0, | |
| "step": 203 | |
| }, | |
| { | |
| "entropy": 0.9782701134681702, | |
| "epoch": 0.4975609756097561, | |
| "grad_norm": 0.1702914983034134, | |
| "learning_rate": 8.360433604336045e-06, | |
| "loss": 0.9915, | |
| "mean_token_accuracy": 0.7058641314506531, | |
| "num_tokens": 2733955.0, | |
| "step": 204 | |
| }, | |
| { | |
| "entropy": 0.9618117809295654, | |
| "epoch": 0.5, | |
| "grad_norm": 0.17133237421512604, | |
| "learning_rate": 8.34688346883469e-06, | |
| "loss": 0.9788, | |
| "mean_token_accuracy": 0.7108246684074402, | |
| "num_tokens": 2746849.0, | |
| "step": 205 | |
| }, | |
| { | |
| "entropy": 0.9704866409301758, | |
| "epoch": 0.5024390243902439, | |
| "grad_norm": 0.16161450743675232, | |
| "learning_rate": 8.333333333333334e-06, | |
| "loss": 0.9652, | |
| "mean_token_accuracy": 0.7115023136138916, | |
| "num_tokens": 2760158.0, | |
| "step": 206 | |
| }, | |
| { | |
| "entropy": 0.9772287607192993, | |
| "epoch": 0.5048780487804878, | |
| "grad_norm": 0.16217578947544098, | |
| "learning_rate": 8.319783197831978e-06, | |
| "loss": 0.9722, | |
| "mean_token_accuracy": 0.704070508480072, | |
| "num_tokens": 2773907.0, | |
| "step": 207 | |
| }, | |
| { | |
| "entropy": 0.9927241802215576, | |
| "epoch": 0.5073170731707317, | |
| "grad_norm": 0.16909728944301605, | |
| "learning_rate": 8.306233062330624e-06, | |
| "loss": 0.9958, | |
| "mean_token_accuracy": 0.7050141096115112, | |
| "num_tokens": 2787744.0, | |
| "step": 208 | |
| }, | |
| { | |
| "entropy": 0.97894287109375, | |
| "epoch": 0.5097560975609756, | |
| "grad_norm": 0.163661390542984, | |
| "learning_rate": 8.292682926829268e-06, | |
| "loss": 0.9846, | |
| "mean_token_accuracy": 0.698600172996521, | |
| "num_tokens": 2801476.0, | |
| "step": 209 | |
| }, | |
| { | |
| "entropy": 0.961266279220581, | |
| "epoch": 0.5121951219512195, | |
| "grad_norm": 0.16647972166538239, | |
| "learning_rate": 8.279132791327915e-06, | |
| "loss": 0.9514, | |
| "mean_token_accuracy": 0.7096498608589172, | |
| "num_tokens": 2814373.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 0.9882842898368835, | |
| "epoch": 0.5146341463414634, | |
| "grad_norm": 0.1674662083387375, | |
| "learning_rate": 8.265582655826559e-06, | |
| "loss": 0.9814, | |
| "mean_token_accuracy": 0.701384425163269, | |
| "num_tokens": 2828330.0, | |
| "step": 211 | |
| }, | |
| { | |
| "entropy": 0.9803353548049927, | |
| "epoch": 0.5170731707317073, | |
| "grad_norm": 0.16690295934677124, | |
| "learning_rate": 8.252032520325203e-06, | |
| "loss": 0.9887, | |
| "mean_token_accuracy": 0.707240104675293, | |
| "num_tokens": 2841343.0, | |
| "step": 212 | |
| }, | |
| { | |
| "entropy": 0.986532986164093, | |
| "epoch": 0.5195121951219512, | |
| "grad_norm": 0.16405653953552246, | |
| "learning_rate": 8.23848238482385e-06, | |
| "loss": 0.9875, | |
| "mean_token_accuracy": 0.7040362358093262, | |
| "num_tokens": 2854837.0, | |
| "step": 213 | |
| }, | |
| { | |
| "entropy": 0.9744679927825928, | |
| "epoch": 0.5219512195121951, | |
| "grad_norm": 0.16172032058238983, | |
| "learning_rate": 8.224932249322494e-06, | |
| "loss": 0.9852, | |
| "mean_token_accuracy": 0.7052052617073059, | |
| "num_tokens": 2868666.0, | |
| "step": 214 | |
| }, | |
| { | |
| "entropy": 0.9497202634811401, | |
| "epoch": 0.524390243902439, | |
| "grad_norm": 0.16827084124088287, | |
| "learning_rate": 8.21138211382114e-06, | |
| "loss": 0.9593, | |
| "mean_token_accuracy": 0.7130415439605713, | |
| "num_tokens": 2882001.0, | |
| "step": 215 | |
| }, | |
| { | |
| "entropy": 0.9834163188934326, | |
| "epoch": 0.526829268292683, | |
| "grad_norm": 0.16540959477424622, | |
| "learning_rate": 8.197831978319784e-06, | |
| "loss": 0.9887, | |
| "mean_token_accuracy": 0.7012408971786499, | |
| "num_tokens": 2895717.0, | |
| "step": 216 | |
| }, | |
| { | |
| "entropy": 0.9932485818862915, | |
| "epoch": 0.5292682926829269, | |
| "grad_norm": 0.16657041013240814, | |
| "learning_rate": 8.184281842818428e-06, | |
| "loss": 0.9775, | |
| "mean_token_accuracy": 0.7028895020484924, | |
| "num_tokens": 2909334.0, | |
| "step": 217 | |
| }, | |
| { | |
| "entropy": 0.9768931865692139, | |
| "epoch": 0.5317073170731708, | |
| "grad_norm": 0.1715688705444336, | |
| "learning_rate": 8.170731707317073e-06, | |
| "loss": 0.989, | |
| "mean_token_accuracy": 0.7002978920936584, | |
| "num_tokens": 2922443.0, | |
| "step": 218 | |
| }, | |
| { | |
| "entropy": 0.9682226181030273, | |
| "epoch": 0.5341463414634147, | |
| "grad_norm": 0.16455644369125366, | |
| "learning_rate": 8.157181571815719e-06, | |
| "loss": 0.9792, | |
| "mean_token_accuracy": 0.6996614933013916, | |
| "num_tokens": 2936047.0, | |
| "step": 219 | |
| }, | |
| { | |
| "entropy": 0.967424750328064, | |
| "epoch": 0.5365853658536586, | |
| "grad_norm": 0.1654297411441803, | |
| "learning_rate": 8.143631436314365e-06, | |
| "loss": 0.9522, | |
| "mean_token_accuracy": 0.710684061050415, | |
| "num_tokens": 2949073.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 0.978946328163147, | |
| "epoch": 0.5390243902439025, | |
| "grad_norm": 0.16667896509170532, | |
| "learning_rate": 8.130081300813009e-06, | |
| "loss": 0.98, | |
| "mean_token_accuracy": 0.7056810259819031, | |
| "num_tokens": 2962238.0, | |
| "step": 221 | |
| }, | |
| { | |
| "entropy": 0.9638472199440002, | |
| "epoch": 0.5414634146341464, | |
| "grad_norm": 0.16370747983455658, | |
| "learning_rate": 8.116531165311653e-06, | |
| "loss": 0.9453, | |
| "mean_token_accuracy": 0.7188960313796997, | |
| "num_tokens": 2975733.0, | |
| "step": 222 | |
| }, | |
| { | |
| "entropy": 0.9723875522613525, | |
| "epoch": 0.5439024390243903, | |
| "grad_norm": 0.16714785993099213, | |
| "learning_rate": 8.102981029810298e-06, | |
| "loss": 0.9875, | |
| "mean_token_accuracy": 0.698201596736908, | |
| "num_tokens": 2988983.0, | |
| "step": 223 | |
| }, | |
| { | |
| "entropy": 0.9673885107040405, | |
| "epoch": 0.5463414634146342, | |
| "grad_norm": 0.1624123454093933, | |
| "learning_rate": 8.089430894308944e-06, | |
| "loss": 0.9644, | |
| "mean_token_accuracy": 0.708252489566803, | |
| "num_tokens": 3002401.0, | |
| "step": 224 | |
| }, | |
| { | |
| "entropy": 0.9567648768424988, | |
| "epoch": 0.5487804878048781, | |
| "grad_norm": 0.16196352243423462, | |
| "learning_rate": 8.075880758807588e-06, | |
| "loss": 0.9497, | |
| "mean_token_accuracy": 0.7132189869880676, | |
| "num_tokens": 3015943.0, | |
| "step": 225 | |
| }, | |
| { | |
| "entropy": 0.9580562114715576, | |
| "epoch": 0.551219512195122, | |
| "grad_norm": 0.15929940342903137, | |
| "learning_rate": 8.062330623306234e-06, | |
| "loss": 0.9428, | |
| "mean_token_accuracy": 0.7144014835357666, | |
| "num_tokens": 3029534.0, | |
| "step": 226 | |
| }, | |
| { | |
| "entropy": 0.9454320669174194, | |
| "epoch": 0.5536585365853659, | |
| "grad_norm": 0.16950178146362305, | |
| "learning_rate": 8.048780487804879e-06, | |
| "loss": 0.9408, | |
| "mean_token_accuracy": 0.7093318700790405, | |
| "num_tokens": 3042527.0, | |
| "step": 227 | |
| }, | |
| { | |
| "entropy": 0.9679467678070068, | |
| "epoch": 0.5560975609756098, | |
| "grad_norm": 0.1640005111694336, | |
| "learning_rate": 8.035230352303523e-06, | |
| "loss": 0.9704, | |
| "mean_token_accuracy": 0.7116739153862, | |
| "num_tokens": 3055889.0, | |
| "step": 228 | |
| }, | |
| { | |
| "entropy": 0.9547273516654968, | |
| "epoch": 0.5585365853658537, | |
| "grad_norm": 0.16052336990833282, | |
| "learning_rate": 8.021680216802169e-06, | |
| "loss": 0.934, | |
| "mean_token_accuracy": 0.7157609462738037, | |
| "num_tokens": 3069559.0, | |
| "step": 229 | |
| }, | |
| { | |
| "entropy": 0.9567209482192993, | |
| "epoch": 0.5609756097560976, | |
| "grad_norm": 0.16757436096668243, | |
| "learning_rate": 8.008130081300813e-06, | |
| "loss": 0.9744, | |
| "mean_token_accuracy": 0.7066189646720886, | |
| "num_tokens": 3082991.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 0.9696470499038696, | |
| "epoch": 0.5634146341463414, | |
| "grad_norm": 0.15978163480758667, | |
| "learning_rate": 7.99457994579946e-06, | |
| "loss": 0.9766, | |
| "mean_token_accuracy": 0.7067956924438477, | |
| "num_tokens": 3096854.0, | |
| "step": 231 | |
| }, | |
| { | |
| "entropy": 0.9619528651237488, | |
| "epoch": 0.5658536585365853, | |
| "grad_norm": 0.1610889881849289, | |
| "learning_rate": 7.981029810298104e-06, | |
| "loss": 0.9522, | |
| "mean_token_accuracy": 0.7112933397293091, | |
| "num_tokens": 3110285.0, | |
| "step": 232 | |
| }, | |
| { | |
| "entropy": 0.9486234188079834, | |
| "epoch": 0.5682926829268292, | |
| "grad_norm": 0.16641642153263092, | |
| "learning_rate": 7.967479674796748e-06, | |
| "loss": 0.9275, | |
| "mean_token_accuracy": 0.7189168334007263, | |
| "num_tokens": 3123411.0, | |
| "step": 233 | |
| }, | |
| { | |
| "entropy": 0.95262610912323, | |
| "epoch": 0.5707317073170731, | |
| "grad_norm": 0.1619957685470581, | |
| "learning_rate": 7.953929539295394e-06, | |
| "loss": 0.9668, | |
| "mean_token_accuracy": 0.7126327157020569, | |
| "num_tokens": 3137082.0, | |
| "step": 234 | |
| }, | |
| { | |
| "entropy": 0.9534478783607483, | |
| "epoch": 0.573170731707317, | |
| "grad_norm": 0.16168786585330963, | |
| "learning_rate": 7.940379403794039e-06, | |
| "loss": 0.964, | |
| "mean_token_accuracy": 0.7050497531890869, | |
| "num_tokens": 3150663.0, | |
| "step": 235 | |
| }, | |
| { | |
| "entropy": 0.9454038143157959, | |
| "epoch": 0.5756097560975609, | |
| "grad_norm": 0.16300973296165466, | |
| "learning_rate": 7.926829268292685e-06, | |
| "loss": 0.9401, | |
| "mean_token_accuracy": 0.7151955366134644, | |
| "num_tokens": 3164025.0, | |
| "step": 236 | |
| }, | |
| { | |
| "entropy": 0.9535937309265137, | |
| "epoch": 0.5780487804878048, | |
| "grad_norm": 0.16334660351276398, | |
| "learning_rate": 7.913279132791329e-06, | |
| "loss": 0.9503, | |
| "mean_token_accuracy": 0.7116466760635376, | |
| "num_tokens": 3177195.0, | |
| "step": 237 | |
| }, | |
| { | |
| "entropy": 1.0005275011062622, | |
| "epoch": 0.5804878048780487, | |
| "grad_norm": 0.16791778802871704, | |
| "learning_rate": 7.899728997289973e-06, | |
| "loss": 1.0015, | |
| "mean_token_accuracy": 0.7042770385742188, | |
| "num_tokens": 3190842.0, | |
| "step": 238 | |
| }, | |
| { | |
| "entropy": 0.9564257860183716, | |
| "epoch": 0.5829268292682926, | |
| "grad_norm": 0.15814629197120667, | |
| "learning_rate": 7.886178861788618e-06, | |
| "loss": 0.9487, | |
| "mean_token_accuracy": 0.7144843935966492, | |
| "num_tokens": 3204521.0, | |
| "step": 239 | |
| }, | |
| { | |
| "entropy": 0.9540543556213379, | |
| "epoch": 0.5853658536585366, | |
| "grad_norm": 0.1548798680305481, | |
| "learning_rate": 7.872628726287264e-06, | |
| "loss": 0.9506, | |
| "mean_token_accuracy": 0.711961030960083, | |
| "num_tokens": 3217872.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 0.9536082744598389, | |
| "epoch": 0.5878048780487805, | |
| "grad_norm": 0.16294530034065247, | |
| "learning_rate": 7.859078590785908e-06, | |
| "loss": 0.9498, | |
| "mean_token_accuracy": 0.7111994624137878, | |
| "num_tokens": 3231219.0, | |
| "step": 241 | |
| }, | |
| { | |
| "entropy": 0.9481508731842041, | |
| "epoch": 0.5902439024390244, | |
| "grad_norm": 0.15385769307613373, | |
| "learning_rate": 7.845528455284554e-06, | |
| "loss": 0.9323, | |
| "mean_token_accuracy": 0.7128936052322388, | |
| "num_tokens": 3244986.0, | |
| "step": 242 | |
| }, | |
| { | |
| "entropy": 0.935053825378418, | |
| "epoch": 0.5926829268292683, | |
| "grad_norm": 0.15816359221935272, | |
| "learning_rate": 7.831978319783198e-06, | |
| "loss": 0.9247, | |
| "mean_token_accuracy": 0.7194153070449829, | |
| "num_tokens": 3258342.0, | |
| "step": 243 | |
| }, | |
| { | |
| "entropy": 0.9509957432746887, | |
| "epoch": 0.5951219512195122, | |
| "grad_norm": 0.16170227527618408, | |
| "learning_rate": 7.818428184281843e-06, | |
| "loss": 0.9558, | |
| "mean_token_accuracy": 0.7063164114952087, | |
| "num_tokens": 3271910.0, | |
| "step": 244 | |
| }, | |
| { | |
| "entropy": 0.9488095045089722, | |
| "epoch": 0.5975609756097561, | |
| "grad_norm": 0.16762597858905792, | |
| "learning_rate": 7.804878048780489e-06, | |
| "loss": 0.9325, | |
| "mean_token_accuracy": 0.7141220569610596, | |
| "num_tokens": 3285019.0, | |
| "step": 245 | |
| }, | |
| { | |
| "entropy": 0.9412808418273926, | |
| "epoch": 0.6, | |
| "grad_norm": 0.1669067144393921, | |
| "learning_rate": 7.791327913279133e-06, | |
| "loss": 0.9304, | |
| "mean_token_accuracy": 0.7160465717315674, | |
| "num_tokens": 3298097.0, | |
| "step": 246 | |
| }, | |
| { | |
| "entropy": 0.9411801099777222, | |
| "epoch": 0.6024390243902439, | |
| "grad_norm": 0.16510054469108582, | |
| "learning_rate": 7.77777777777778e-06, | |
| "loss": 0.952, | |
| "mean_token_accuracy": 0.7096559405326843, | |
| "num_tokens": 3311628.0, | |
| "step": 247 | |
| }, | |
| { | |
| "entropy": 0.9391855001449585, | |
| "epoch": 0.6048780487804878, | |
| "grad_norm": 0.16120120882987976, | |
| "learning_rate": 7.764227642276424e-06, | |
| "loss": 0.9299, | |
| "mean_token_accuracy": 0.7161240577697754, | |
| "num_tokens": 3324544.0, | |
| "step": 248 | |
| }, | |
| { | |
| "entropy": 0.9606072902679443, | |
| "epoch": 0.6073170731707317, | |
| "grad_norm": 0.1596563309431076, | |
| "learning_rate": 7.750677506775068e-06, | |
| "loss": 0.98, | |
| "mean_token_accuracy": 0.7059526443481445, | |
| "num_tokens": 3337949.0, | |
| "step": 249 | |
| }, | |
| { | |
| "entropy": 0.959593653678894, | |
| "epoch": 0.6097560975609756, | |
| "grad_norm": 0.16428229212760925, | |
| "learning_rate": 7.737127371273714e-06, | |
| "loss": 0.9731, | |
| "mean_token_accuracy": 0.7107242941856384, | |
| "num_tokens": 3351523.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 0.9481107592582703, | |
| "epoch": 0.6121951219512195, | |
| "grad_norm": 0.15851643681526184, | |
| "learning_rate": 7.723577235772358e-06, | |
| "loss": 0.9415, | |
| "mean_token_accuracy": 0.7170389890670776, | |
| "num_tokens": 3365237.0, | |
| "step": 251 | |
| }, | |
| { | |
| "entropy": 0.9265803098678589, | |
| "epoch": 0.6146341463414634, | |
| "grad_norm": 0.16618311405181885, | |
| "learning_rate": 7.710027100271004e-06, | |
| "loss": 0.9122, | |
| "mean_token_accuracy": 0.7207344174385071, | |
| "num_tokens": 3378434.0, | |
| "step": 252 | |
| }, | |
| { | |
| "entropy": 0.9509798288345337, | |
| "epoch": 0.6170731707317073, | |
| "grad_norm": 0.16133299469947815, | |
| "learning_rate": 7.696476964769649e-06, | |
| "loss": 0.947, | |
| "mean_token_accuracy": 0.713214099407196, | |
| "num_tokens": 3391648.0, | |
| "step": 253 | |
| }, | |
| { | |
| "entropy": 0.92350172996521, | |
| "epoch": 0.6195121951219512, | |
| "grad_norm": 0.16066798567771912, | |
| "learning_rate": 7.682926829268293e-06, | |
| "loss": 0.9029, | |
| "mean_token_accuracy": 0.7265830636024475, | |
| "num_tokens": 3404977.0, | |
| "step": 254 | |
| }, | |
| { | |
| "entropy": 0.9618203639984131, | |
| "epoch": 0.6219512195121951, | |
| "grad_norm": 0.15734082460403442, | |
| "learning_rate": 7.669376693766937e-06, | |
| "loss": 0.9437, | |
| "mean_token_accuracy": 0.7111424207687378, | |
| "num_tokens": 3418491.0, | |
| "step": 255 | |
| }, | |
| { | |
| "entropy": 0.9390702247619629, | |
| "epoch": 0.624390243902439, | |
| "grad_norm": 0.15325915813446045, | |
| "learning_rate": 7.655826558265583e-06, | |
| "loss": 0.9392, | |
| "mean_token_accuracy": 0.7145180106163025, | |
| "num_tokens": 3432035.0, | |
| "step": 256 | |
| }, | |
| { | |
| "entropy": 0.9358468055725098, | |
| "epoch": 0.6268292682926829, | |
| "grad_norm": 0.1554923802614212, | |
| "learning_rate": 7.64227642276423e-06, | |
| "loss": 0.928, | |
| "mean_token_accuracy": 0.7181775569915771, | |
| "num_tokens": 3444935.0, | |
| "step": 257 | |
| }, | |
| { | |
| "entropy": 0.9481029510498047, | |
| "epoch": 0.6292682926829268, | |
| "grad_norm": 0.15726210176944733, | |
| "learning_rate": 7.628726287262873e-06, | |
| "loss": 0.9564, | |
| "mean_token_accuracy": 0.7126176953315735, | |
| "num_tokens": 3458654.0, | |
| "step": 258 | |
| }, | |
| { | |
| "entropy": 0.9535932540893555, | |
| "epoch": 0.6317073170731707, | |
| "grad_norm": 0.15442681312561035, | |
| "learning_rate": 7.615176151761519e-06, | |
| "loss": 0.9514, | |
| "mean_token_accuracy": 0.7092245817184448, | |
| "num_tokens": 3472134.0, | |
| "step": 259 | |
| }, | |
| { | |
| "entropy": 0.9278210401535034, | |
| "epoch": 0.6341463414634146, | |
| "grad_norm": 0.16804730892181396, | |
| "learning_rate": 7.601626016260163e-06, | |
| "loss": 0.9326, | |
| "mean_token_accuracy": 0.7159616947174072, | |
| "num_tokens": 3485106.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 0.9546136856079102, | |
| "epoch": 0.6365853658536585, | |
| "grad_norm": 0.15850891172885895, | |
| "learning_rate": 7.5880758807588085e-06, | |
| "loss": 0.9725, | |
| "mean_token_accuracy": 0.705976128578186, | |
| "num_tokens": 3498291.0, | |
| "step": 261 | |
| }, | |
| { | |
| "entropy": 0.928404688835144, | |
| "epoch": 0.6390243902439025, | |
| "grad_norm": 0.1619364470243454, | |
| "learning_rate": 7.574525745257453e-06, | |
| "loss": 0.9357, | |
| "mean_token_accuracy": 0.7146782875061035, | |
| "num_tokens": 3511408.0, | |
| "step": 262 | |
| }, | |
| { | |
| "entropy": 0.9354878067970276, | |
| "epoch": 0.6414634146341464, | |
| "grad_norm": 0.16030831634998322, | |
| "learning_rate": 7.560975609756098e-06, | |
| "loss": 0.9349, | |
| "mean_token_accuracy": 0.7133307456970215, | |
| "num_tokens": 3524439.0, | |
| "step": 263 | |
| }, | |
| { | |
| "entropy": 0.9242296814918518, | |
| "epoch": 0.6439024390243903, | |
| "grad_norm": 0.1562914103269577, | |
| "learning_rate": 7.547425474254744e-06, | |
| "loss": 0.9303, | |
| "mean_token_accuracy": 0.7126427888870239, | |
| "num_tokens": 3537759.0, | |
| "step": 264 | |
| }, | |
| { | |
| "entropy": 0.9220150709152222, | |
| "epoch": 0.6463414634146342, | |
| "grad_norm": 0.14866940677165985, | |
| "learning_rate": 7.5338753387533885e-06, | |
| "loss": 0.922, | |
| "mean_token_accuracy": 0.7132981419563293, | |
| "num_tokens": 3551228.0, | |
| "step": 265 | |
| }, | |
| { | |
| "entropy": 0.9343201518058777, | |
| "epoch": 0.6487804878048781, | |
| "grad_norm": 0.1494896113872528, | |
| "learning_rate": 7.520325203252034e-06, | |
| "loss": 0.9373, | |
| "mean_token_accuracy": 0.7129477262496948, | |
| "num_tokens": 3565231.0, | |
| "step": 266 | |
| }, | |
| { | |
| "entropy": 0.9533241987228394, | |
| "epoch": 0.651219512195122, | |
| "grad_norm": 0.15667204558849335, | |
| "learning_rate": 7.506775067750678e-06, | |
| "loss": 0.9589, | |
| "mean_token_accuracy": 0.7093436121940613, | |
| "num_tokens": 3578775.0, | |
| "step": 267 | |
| }, | |
| { | |
| "entropy": 0.9355111122131348, | |
| "epoch": 0.6536585365853659, | |
| "grad_norm": 0.15565158426761627, | |
| "learning_rate": 7.493224932249323e-06, | |
| "loss": 0.9295, | |
| "mean_token_accuracy": 0.7132697701454163, | |
| "num_tokens": 3592009.0, | |
| "step": 268 | |
| }, | |
| { | |
| "entropy": 0.9118462800979614, | |
| "epoch": 0.6560975609756098, | |
| "grad_norm": 0.15243865549564362, | |
| "learning_rate": 7.4796747967479676e-06, | |
| "loss": 0.9183, | |
| "mean_token_accuracy": 0.7204574346542358, | |
| "num_tokens": 3605404.0, | |
| "step": 269 | |
| }, | |
| { | |
| "entropy": 0.9283488988876343, | |
| "epoch": 0.6585365853658537, | |
| "grad_norm": 0.15385380387306213, | |
| "learning_rate": 7.466124661246613e-06, | |
| "loss": 0.926, | |
| "mean_token_accuracy": 0.7187360525131226, | |
| "num_tokens": 3618838.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 0.9379990100860596, | |
| "epoch": 0.6609756097560976, | |
| "grad_norm": 0.15456515550613403, | |
| "learning_rate": 7.452574525745257e-06, | |
| "loss": 0.9381, | |
| "mean_token_accuracy": 0.7181525230407715, | |
| "num_tokens": 3632191.0, | |
| "step": 271 | |
| }, | |
| { | |
| "entropy": 0.9382643103599548, | |
| "epoch": 0.6634146341463415, | |
| "grad_norm": 0.15582406520843506, | |
| "learning_rate": 7.439024390243903e-06, | |
| "loss": 0.9367, | |
| "mean_token_accuracy": 0.7143399119377136, | |
| "num_tokens": 3645387.0, | |
| "step": 272 | |
| }, | |
| { | |
| "entropy": 0.9416444301605225, | |
| "epoch": 0.6658536585365854, | |
| "grad_norm": 0.1587027907371521, | |
| "learning_rate": 7.425474254742548e-06, | |
| "loss": 0.9521, | |
| "mean_token_accuracy": 0.7076588273048401, | |
| "num_tokens": 3659178.0, | |
| "step": 273 | |
| }, | |
| { | |
| "entropy": 0.9447643756866455, | |
| "epoch": 0.6682926829268293, | |
| "grad_norm": 0.16017645597457886, | |
| "learning_rate": 7.411924119241193e-06, | |
| "loss": 0.9442, | |
| "mean_token_accuracy": 0.7130175232887268, | |
| "num_tokens": 3672261.0, | |
| "step": 274 | |
| }, | |
| { | |
| "entropy": 0.9379363059997559, | |
| "epoch": 0.6707317073170732, | |
| "grad_norm": 0.14899934828281403, | |
| "learning_rate": 7.398373983739838e-06, | |
| "loss": 0.9324, | |
| "mean_token_accuracy": 0.7158769965171814, | |
| "num_tokens": 3685743.0, | |
| "step": 275 | |
| }, | |
| { | |
| "entropy": 0.9268349409103394, | |
| "epoch": 0.6731707317073171, | |
| "grad_norm": 0.15139304101467133, | |
| "learning_rate": 7.384823848238482e-06, | |
| "loss": 0.9269, | |
| "mean_token_accuracy": 0.7169948816299438, | |
| "num_tokens": 3699469.0, | |
| "step": 276 | |
| }, | |
| { | |
| "entropy": 0.9546395540237427, | |
| "epoch": 0.675609756097561, | |
| "grad_norm": 0.16162307560443878, | |
| "learning_rate": 7.371273712737128e-06, | |
| "loss": 0.9587, | |
| "mean_token_accuracy": 0.7085087299346924, | |
| "num_tokens": 3712789.0, | |
| "step": 277 | |
| }, | |
| { | |
| "entropy": 0.9113729000091553, | |
| "epoch": 0.6780487804878049, | |
| "grad_norm": 0.15460745990276337, | |
| "learning_rate": 7.357723577235773e-06, | |
| "loss": 0.9004, | |
| "mean_token_accuracy": 0.7206665873527527, | |
| "num_tokens": 3725947.0, | |
| "step": 278 | |
| }, | |
| { | |
| "entropy": 0.9525165557861328, | |
| "epoch": 0.6804878048780488, | |
| "grad_norm": 0.15463463962078094, | |
| "learning_rate": 7.344173441734418e-06, | |
| "loss": 0.9383, | |
| "mean_token_accuracy": 0.7162497043609619, | |
| "num_tokens": 3739274.0, | |
| "step": 279 | |
| }, | |
| { | |
| "entropy": 0.9366529583930969, | |
| "epoch": 0.6829268292682927, | |
| "grad_norm": 0.15342386066913605, | |
| "learning_rate": 7.330623306233063e-06, | |
| "loss": 0.9483, | |
| "mean_token_accuracy": 0.7094659209251404, | |
| "num_tokens": 3752865.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 0.935637354850769, | |
| "epoch": 0.6853658536585366, | |
| "grad_norm": 0.15574605762958527, | |
| "learning_rate": 7.317073170731707e-06, | |
| "loss": 0.9274, | |
| "mean_token_accuracy": 0.7157266736030579, | |
| "num_tokens": 3766463.0, | |
| "step": 281 | |
| }, | |
| { | |
| "entropy": 0.9355779886245728, | |
| "epoch": 0.6878048780487804, | |
| "grad_norm": 0.1519261598587036, | |
| "learning_rate": 7.303523035230353e-06, | |
| "loss": 0.9327, | |
| "mean_token_accuracy": 0.7185456156730652, | |
| "num_tokens": 3779323.0, | |
| "step": 282 | |
| }, | |
| { | |
| "entropy": 0.952324390411377, | |
| "epoch": 0.6902439024390243, | |
| "grad_norm": 0.1669672280550003, | |
| "learning_rate": 7.289972899728998e-06, | |
| "loss": 0.9357, | |
| "mean_token_accuracy": 0.7216391563415527, | |
| "num_tokens": 3792297.0, | |
| "step": 283 | |
| }, | |
| { | |
| "entropy": 0.9187766313552856, | |
| "epoch": 0.6926829268292682, | |
| "grad_norm": 0.14877188205718994, | |
| "learning_rate": 7.276422764227643e-06, | |
| "loss": 0.9125, | |
| "mean_token_accuracy": 0.7230643033981323, | |
| "num_tokens": 3805706.0, | |
| "step": 284 | |
| }, | |
| { | |
| "entropy": 0.9129336476325989, | |
| "epoch": 0.6951219512195121, | |
| "grad_norm": 0.15119393169879913, | |
| "learning_rate": 7.262872628726287e-06, | |
| "loss": 0.9191, | |
| "mean_token_accuracy": 0.7201807498931885, | |
| "num_tokens": 3819220.0, | |
| "step": 285 | |
| }, | |
| { | |
| "entropy": 0.9101721048355103, | |
| "epoch": 0.697560975609756, | |
| "grad_norm": 0.1465786248445511, | |
| "learning_rate": 7.2493224932249325e-06, | |
| "loss": 0.9127, | |
| "mean_token_accuracy": 0.7222345471382141, | |
| "num_tokens": 3832751.0, | |
| "step": 286 | |
| }, | |
| { | |
| "entropy": 0.9107828736305237, | |
| "epoch": 0.7, | |
| "grad_norm": 0.15555697679519653, | |
| "learning_rate": 7.2357723577235786e-06, | |
| "loss": 0.8996, | |
| "mean_token_accuracy": 0.7236950397491455, | |
| "num_tokens": 3846158.0, | |
| "step": 287 | |
| }, | |
| { | |
| "entropy": 0.9074515104293823, | |
| "epoch": 0.7024390243902439, | |
| "grad_norm": 0.15076883137226105, | |
| "learning_rate": 7.222222222222223e-06, | |
| "loss": 0.8957, | |
| "mean_token_accuracy": 0.723412275314331, | |
| "num_tokens": 3859479.0, | |
| "step": 288 | |
| }, | |
| { | |
| "entropy": 0.917039155960083, | |
| "epoch": 0.7048780487804878, | |
| "grad_norm": 0.14963188767433167, | |
| "learning_rate": 7.208672086720868e-06, | |
| "loss": 0.9132, | |
| "mean_token_accuracy": 0.7183962464332581, | |
| "num_tokens": 3873188.0, | |
| "step": 289 | |
| }, | |
| { | |
| "entropy": 0.9054569602012634, | |
| "epoch": 0.7073170731707317, | |
| "grad_norm": 0.15667130053043365, | |
| "learning_rate": 7.1951219512195125e-06, | |
| "loss": 0.9072, | |
| "mean_token_accuracy": 0.7192850708961487, | |
| "num_tokens": 3886520.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 0.92705237865448, | |
| "epoch": 0.7097560975609756, | |
| "grad_norm": 0.15387941896915436, | |
| "learning_rate": 7.181571815718158e-06, | |
| "loss": 0.9132, | |
| "mean_token_accuracy": 0.7153183817863464, | |
| "num_tokens": 3899540.0, | |
| "step": 291 | |
| }, | |
| { | |
| "entropy": 0.9047387838363647, | |
| "epoch": 0.7121951219512195, | |
| "grad_norm": 0.148861825466156, | |
| "learning_rate": 7.168021680216802e-06, | |
| "loss": 0.9001, | |
| "mean_token_accuracy": 0.7203510403633118, | |
| "num_tokens": 3912887.0, | |
| "step": 292 | |
| }, | |
| { | |
| "entropy": 0.924647867679596, | |
| "epoch": 0.7146341463414634, | |
| "grad_norm": 0.15873289108276367, | |
| "learning_rate": 7.154471544715448e-06, | |
| "loss": 0.9227, | |
| "mean_token_accuracy": 0.7200701832771301, | |
| "num_tokens": 3926017.0, | |
| "step": 293 | |
| }, | |
| { | |
| "entropy": 0.9390074014663696, | |
| "epoch": 0.7170731707317073, | |
| "grad_norm": 0.1504705548286438, | |
| "learning_rate": 7.140921409214093e-06, | |
| "loss": 0.9383, | |
| "mean_token_accuracy": 0.7134274244308472, | |
| "num_tokens": 3939848.0, | |
| "step": 294 | |
| }, | |
| { | |
| "entropy": 0.9174056649208069, | |
| "epoch": 0.7195121951219512, | |
| "grad_norm": 0.1560080498456955, | |
| "learning_rate": 7.127371273712738e-06, | |
| "loss": 0.9205, | |
| "mean_token_accuracy": 0.7206430435180664, | |
| "num_tokens": 3953549.0, | |
| "step": 295 | |
| }, | |
| { | |
| "entropy": 0.9219064712524414, | |
| "epoch": 0.7219512195121951, | |
| "grad_norm": 0.1586093157529831, | |
| "learning_rate": 7.113821138211383e-06, | |
| "loss": 0.9438, | |
| "mean_token_accuracy": 0.7093410491943359, | |
| "num_tokens": 3967086.0, | |
| "step": 296 | |
| }, | |
| { | |
| "entropy": 0.9237949848175049, | |
| "epoch": 0.724390243902439, | |
| "grad_norm": 0.14479567110538483, | |
| "learning_rate": 7.100271002710027e-06, | |
| "loss": 0.9207, | |
| "mean_token_accuracy": 0.7216541171073914, | |
| "num_tokens": 3980499.0, | |
| "step": 297 | |
| }, | |
| { | |
| "entropy": 0.9169784784317017, | |
| "epoch": 0.7268292682926829, | |
| "grad_norm": 0.1539381593465805, | |
| "learning_rate": 7.086720867208673e-06, | |
| "loss": 0.927, | |
| "mean_token_accuracy": 0.7158411145210266, | |
| "num_tokens": 3993557.0, | |
| "step": 298 | |
| }, | |
| { | |
| "entropy": 0.9099527597427368, | |
| "epoch": 0.7292682926829268, | |
| "grad_norm": 0.1458337903022766, | |
| "learning_rate": 7.0731707317073175e-06, | |
| "loss": 0.9104, | |
| "mean_token_accuracy": 0.7185899615287781, | |
| "num_tokens": 4007048.0, | |
| "step": 299 | |
| }, | |
| { | |
| "entropy": 0.9373666048049927, | |
| "epoch": 0.7317073170731707, | |
| "grad_norm": 0.15674933791160583, | |
| "learning_rate": 7.059620596205963e-06, | |
| "loss": 0.9331, | |
| "mean_token_accuracy": 0.7143380641937256, | |
| "num_tokens": 4020706.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 0.9198070764541626, | |
| "epoch": 0.7341463414634146, | |
| "grad_norm": 0.15851294994354248, | |
| "learning_rate": 7.046070460704607e-06, | |
| "loss": 0.9139, | |
| "mean_token_accuracy": 0.7180051803588867, | |
| "num_tokens": 4033896.0, | |
| "step": 301 | |
| }, | |
| { | |
| "entropy": 0.9198285341262817, | |
| "epoch": 0.7365853658536585, | |
| "grad_norm": 0.15451189875602722, | |
| "learning_rate": 7.032520325203252e-06, | |
| "loss": 0.9197, | |
| "mean_token_accuracy": 0.7124741673469543, | |
| "num_tokens": 4047476.0, | |
| "step": 302 | |
| }, | |
| { | |
| "entropy": 0.9247706532478333, | |
| "epoch": 0.7390243902439024, | |
| "grad_norm": 0.16229675710201263, | |
| "learning_rate": 7.018970189701898e-06, | |
| "loss": 0.9205, | |
| "mean_token_accuracy": 0.7124660611152649, | |
| "num_tokens": 4060760.0, | |
| "step": 303 | |
| }, | |
| { | |
| "entropy": 0.914578914642334, | |
| "epoch": 0.7414634146341463, | |
| "grad_norm": 0.1586454063653946, | |
| "learning_rate": 7.005420054200543e-06, | |
| "loss": 0.9105, | |
| "mean_token_accuracy": 0.7220610976219177, | |
| "num_tokens": 4074225.0, | |
| "step": 304 | |
| }, | |
| { | |
| "entropy": 0.9418405294418335, | |
| "epoch": 0.7439024390243902, | |
| "grad_norm": 0.15731269121170044, | |
| "learning_rate": 6.991869918699188e-06, | |
| "loss": 0.9215, | |
| "mean_token_accuracy": 0.7197117805480957, | |
| "num_tokens": 4087563.0, | |
| "step": 305 | |
| }, | |
| { | |
| "entropy": 0.9367963075637817, | |
| "epoch": 0.7463414634146341, | |
| "grad_norm": 0.15139515697956085, | |
| "learning_rate": 6.978319783197832e-06, | |
| "loss": 0.9353, | |
| "mean_token_accuracy": 0.7137369513511658, | |
| "num_tokens": 4100595.0, | |
| "step": 306 | |
| }, | |
| { | |
| "entropy": 0.928600549697876, | |
| "epoch": 0.748780487804878, | |
| "grad_norm": 0.15391124784946442, | |
| "learning_rate": 6.964769647696477e-06, | |
| "loss": 0.9175, | |
| "mean_token_accuracy": 0.7180485129356384, | |
| "num_tokens": 4113975.0, | |
| "step": 307 | |
| }, | |
| { | |
| "entropy": 0.9189996719360352, | |
| "epoch": 0.751219512195122, | |
| "grad_norm": 0.14990229904651642, | |
| "learning_rate": 6.951219512195122e-06, | |
| "loss": 0.9219, | |
| "mean_token_accuracy": 0.7203125953674316, | |
| "num_tokens": 4127810.0, | |
| "step": 308 | |
| }, | |
| { | |
| "entropy": 0.9270630478858948, | |
| "epoch": 0.7536585365853659, | |
| "grad_norm": 0.15296263992786407, | |
| "learning_rate": 6.937669376693768e-06, | |
| "loss": 0.9238, | |
| "mean_token_accuracy": 0.7191330194473267, | |
| "num_tokens": 4141206.0, | |
| "step": 309 | |
| }, | |
| { | |
| "entropy": 0.9125182628631592, | |
| "epoch": 0.7560975609756098, | |
| "grad_norm": 0.14483878016471863, | |
| "learning_rate": 6.924119241192413e-06, | |
| "loss": 0.9108, | |
| "mean_token_accuracy": 0.7178426384925842, | |
| "num_tokens": 4155239.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 0.9118213057518005, | |
| "epoch": 0.7585365853658537, | |
| "grad_norm": 0.15586057305335999, | |
| "learning_rate": 6.910569105691057e-06, | |
| "loss": 0.8996, | |
| "mean_token_accuracy": 0.7207787036895752, | |
| "num_tokens": 4168456.0, | |
| "step": 311 | |
| }, | |
| { | |
| "entropy": 0.9187057018280029, | |
| "epoch": 0.7609756097560976, | |
| "grad_norm": 0.14583183825016022, | |
| "learning_rate": 6.8970189701897025e-06, | |
| "loss": 0.9137, | |
| "mean_token_accuracy": 0.7201070785522461, | |
| "num_tokens": 4181920.0, | |
| "step": 312 | |
| }, | |
| { | |
| "entropy": 0.9076229333877563, | |
| "epoch": 0.7634146341463415, | |
| "grad_norm": 0.14867785573005676, | |
| "learning_rate": 6.883468834688347e-06, | |
| "loss": 0.9095, | |
| "mean_token_accuracy": 0.7186159491539001, | |
| "num_tokens": 4195693.0, | |
| "step": 313 | |
| }, | |
| { | |
| "entropy": 0.9289067983627319, | |
| "epoch": 0.7658536585365854, | |
| "grad_norm": 0.15520809590816498, | |
| "learning_rate": 6.869918699186993e-06, | |
| "loss": 0.9205, | |
| "mean_token_accuracy": 0.7182366251945496, | |
| "num_tokens": 4208979.0, | |
| "step": 314 | |
| }, | |
| { | |
| "entropy": 0.912957489490509, | |
| "epoch": 0.7682926829268293, | |
| "grad_norm": 0.1523636430501938, | |
| "learning_rate": 6.856368563685637e-06, | |
| "loss": 0.9227, | |
| "mean_token_accuracy": 0.7217300534248352, | |
| "num_tokens": 4222428.0, | |
| "step": 315 | |
| }, | |
| { | |
| "entropy": 0.8968350887298584, | |
| "epoch": 0.7707317073170732, | |
| "grad_norm": 0.16188141703605652, | |
| "learning_rate": 6.8428184281842825e-06, | |
| "loss": 0.9074, | |
| "mean_token_accuracy": 0.722152590751648, | |
| "num_tokens": 4236009.0, | |
| "step": 316 | |
| }, | |
| { | |
| "entropy": 0.9147211313247681, | |
| "epoch": 0.7731707317073171, | |
| "grad_norm": 0.1570591777563095, | |
| "learning_rate": 6.829268292682928e-06, | |
| "loss": 0.9246, | |
| "mean_token_accuracy": 0.716189444065094, | |
| "num_tokens": 4249157.0, | |
| "step": 317 | |
| }, | |
| { | |
| "entropy": 0.9082373976707458, | |
| "epoch": 0.775609756097561, | |
| "grad_norm": 0.15219484269618988, | |
| "learning_rate": 6.815718157181572e-06, | |
| "loss": 0.884, | |
| "mean_token_accuracy": 0.729555070400238, | |
| "num_tokens": 4262636.0, | |
| "step": 318 | |
| }, | |
| { | |
| "entropy": 0.9198713898658752, | |
| "epoch": 0.7780487804878049, | |
| "grad_norm": 0.1499103456735611, | |
| "learning_rate": 6.802168021680218e-06, | |
| "loss": 0.9166, | |
| "mean_token_accuracy": 0.714636504650116, | |
| "num_tokens": 4276091.0, | |
| "step": 319 | |
| }, | |
| { | |
| "entropy": 0.894140362739563, | |
| "epoch": 0.7804878048780488, | |
| "grad_norm": 0.15162697434425354, | |
| "learning_rate": 6.788617886178862e-06, | |
| "loss": 0.8845, | |
| "mean_token_accuracy": 0.7299917936325073, | |
| "num_tokens": 4289514.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 0.9078084230422974, | |
| "epoch": 0.7829268292682927, | |
| "grad_norm": 0.1546027660369873, | |
| "learning_rate": 6.775067750677508e-06, | |
| "loss": 0.9118, | |
| "mean_token_accuracy": 0.717620849609375, | |
| "num_tokens": 4303451.0, | |
| "step": 321 | |
| }, | |
| { | |
| "entropy": 0.909231424331665, | |
| "epoch": 0.7853658536585366, | |
| "grad_norm": 0.1494377702474594, | |
| "learning_rate": 6.761517615176152e-06, | |
| "loss": 0.8964, | |
| "mean_token_accuracy": 0.722392737865448, | |
| "num_tokens": 4316824.0, | |
| "step": 322 | |
| }, | |
| { | |
| "entropy": 0.920364260673523, | |
| "epoch": 0.7878048780487805, | |
| "grad_norm": 0.16057001054286957, | |
| "learning_rate": 6.747967479674797e-06, | |
| "loss": 0.9136, | |
| "mean_token_accuracy": 0.7145892977714539, | |
| "num_tokens": 4330487.0, | |
| "step": 323 | |
| }, | |
| { | |
| "entropy": 0.9032753705978394, | |
| "epoch": 0.7902439024390244, | |
| "grad_norm": 0.15743280947208405, | |
| "learning_rate": 6.734417344173443e-06, | |
| "loss": 0.9009, | |
| "mean_token_accuracy": 0.7194689512252808, | |
| "num_tokens": 4343760.0, | |
| "step": 324 | |
| }, | |
| { | |
| "entropy": 0.9105545282363892, | |
| "epoch": 0.7926829268292683, | |
| "grad_norm": 0.1525033861398697, | |
| "learning_rate": 6.7208672086720876e-06, | |
| "loss": 0.9065, | |
| "mean_token_accuracy": 0.7208117842674255, | |
| "num_tokens": 4357129.0, | |
| "step": 325 | |
| }, | |
| { | |
| "entropy": 0.906657338142395, | |
| "epoch": 0.7951219512195122, | |
| "grad_norm": 0.1705314815044403, | |
| "learning_rate": 6.707317073170733e-06, | |
| "loss": 0.9237, | |
| "mean_token_accuracy": 0.7187808752059937, | |
| "num_tokens": 4370302.0, | |
| "step": 326 | |
| }, | |
| { | |
| "entropy": 0.9039660692214966, | |
| "epoch": 0.7975609756097561, | |
| "grad_norm": 0.15754637122154236, | |
| "learning_rate": 6.693766937669377e-06, | |
| "loss": 0.8871, | |
| "mean_token_accuracy": 0.7259286046028137, | |
| "num_tokens": 4384048.0, | |
| "step": 327 | |
| }, | |
| { | |
| "entropy": 0.9237337708473206, | |
| "epoch": 0.8, | |
| "grad_norm": 0.16106484830379486, | |
| "learning_rate": 6.680216802168022e-06, | |
| "loss": 0.9221, | |
| "mean_token_accuracy": 0.7178065776824951, | |
| "num_tokens": 4397413.0, | |
| "step": 328 | |
| }, | |
| { | |
| "entropy": 0.8977658152580261, | |
| "epoch": 0.802439024390244, | |
| "grad_norm": 0.16258393228054047, | |
| "learning_rate": 6.666666666666667e-06, | |
| "loss": 0.9158, | |
| "mean_token_accuracy": 0.7205637097358704, | |
| "num_tokens": 4410627.0, | |
| "step": 329 | |
| }, | |
| { | |
| "entropy": 0.9091554880142212, | |
| "epoch": 0.8048780487804879, | |
| "grad_norm": 0.16257335245609283, | |
| "learning_rate": 6.653116531165313e-06, | |
| "loss": 0.905, | |
| "mean_token_accuracy": 0.7194573283195496, | |
| "num_tokens": 4423985.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 0.9025290012359619, | |
| "epoch": 0.8073170731707318, | |
| "grad_norm": 0.15430954098701477, | |
| "learning_rate": 6.639566395663957e-06, | |
| "loss": 0.9082, | |
| "mean_token_accuracy": 0.7190539240837097, | |
| "num_tokens": 4437573.0, | |
| "step": 331 | |
| }, | |
| { | |
| "entropy": 0.9192676544189453, | |
| "epoch": 0.8097560975609757, | |
| "grad_norm": 0.1551608443260193, | |
| "learning_rate": 6.626016260162602e-06, | |
| "loss": 0.9148, | |
| "mean_token_accuracy": 0.7191833257675171, | |
| "num_tokens": 4450715.0, | |
| "step": 332 | |
| }, | |
| { | |
| "entropy": 0.9210897088050842, | |
| "epoch": 0.8121951219512196, | |
| "grad_norm": 0.15126371383666992, | |
| "learning_rate": 6.6124661246612474e-06, | |
| "loss": 0.9272, | |
| "mean_token_accuracy": 0.7119234204292297, | |
| "num_tokens": 4464519.0, | |
| "step": 333 | |
| }, | |
| { | |
| "entropy": 0.9274299144744873, | |
| "epoch": 0.8146341463414634, | |
| "grad_norm": 0.15113505721092224, | |
| "learning_rate": 6.598915989159892e-06, | |
| "loss": 0.911, | |
| "mean_token_accuracy": 0.7139639854431152, | |
| "num_tokens": 4477855.0, | |
| "step": 334 | |
| }, | |
| { | |
| "entropy": 0.9136286973953247, | |
| "epoch": 0.8170731707317073, | |
| "grad_norm": 0.1449194997549057, | |
| "learning_rate": 6.585365853658538e-06, | |
| "loss": 0.9097, | |
| "mean_token_accuracy": 0.7178084254264832, | |
| "num_tokens": 4491578.0, | |
| "step": 335 | |
| }, | |
| { | |
| "entropy": 0.8942598700523376, | |
| "epoch": 0.8195121951219512, | |
| "grad_norm": 0.15594850480556488, | |
| "learning_rate": 6.571815718157182e-06, | |
| "loss": 0.8835, | |
| "mean_token_accuracy": 0.725902259349823, | |
| "num_tokens": 4505060.0, | |
| "step": 336 | |
| }, | |
| { | |
| "entropy": 0.8936731815338135, | |
| "epoch": 0.8219512195121951, | |
| "grad_norm": 0.15950734913349152, | |
| "learning_rate": 6.558265582655827e-06, | |
| "loss": 0.8879, | |
| "mean_token_accuracy": 0.7259511351585388, | |
| "num_tokens": 4518008.0, | |
| "step": 337 | |
| }, | |
| { | |
| "entropy": 0.9004725217819214, | |
| "epoch": 0.824390243902439, | |
| "grad_norm": 0.14698483049869537, | |
| "learning_rate": 6.544715447154472e-06, | |
| "loss": 0.9086, | |
| "mean_token_accuracy": 0.7235898375511169, | |
| "num_tokens": 4531551.0, | |
| "step": 338 | |
| }, | |
| { | |
| "entropy": 0.8944765329360962, | |
| "epoch": 0.8268292682926829, | |
| "grad_norm": 0.15387873351573944, | |
| "learning_rate": 6.531165311653117e-06, | |
| "loss": 0.8977, | |
| "mean_token_accuracy": 0.7176317572593689, | |
| "num_tokens": 4545400.0, | |
| "step": 339 | |
| }, | |
| { | |
| "entropy": 0.9095175266265869, | |
| "epoch": 0.8292682926829268, | |
| "grad_norm": 0.15829972922801971, | |
| "learning_rate": 6.517615176151762e-06, | |
| "loss": 0.8969, | |
| "mean_token_accuracy": 0.723007082939148, | |
| "num_tokens": 4559077.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 0.9253937005996704, | |
| "epoch": 0.8317073170731707, | |
| "grad_norm": 0.1539793163537979, | |
| "learning_rate": 6.504065040650407e-06, | |
| "loss": 0.9268, | |
| "mean_token_accuracy": 0.7156819701194763, | |
| "num_tokens": 4572803.0, | |
| "step": 341 | |
| }, | |
| { | |
| "entropy": 0.8887916803359985, | |
| "epoch": 0.8341463414634146, | |
| "grad_norm": 0.16268229484558105, | |
| "learning_rate": 6.4905149051490525e-06, | |
| "loss": 0.8854, | |
| "mean_token_accuracy": 0.7258303761482239, | |
| "num_tokens": 4586307.0, | |
| "step": 342 | |
| }, | |
| { | |
| "entropy": 0.9081874489784241, | |
| "epoch": 0.8365853658536585, | |
| "grad_norm": 0.15919581055641174, | |
| "learning_rate": 6.476964769647697e-06, | |
| "loss": 0.9098, | |
| "mean_token_accuracy": 0.7165588140487671, | |
| "num_tokens": 4599458.0, | |
| "step": 343 | |
| }, | |
| { | |
| "entropy": 0.906166136264801, | |
| "epoch": 0.8390243902439024, | |
| "grad_norm": 0.15650396049022675, | |
| "learning_rate": 6.463414634146342e-06, | |
| "loss": 0.902, | |
| "mean_token_accuracy": 0.7163677215576172, | |
| "num_tokens": 4612854.0, | |
| "step": 344 | |
| }, | |
| { | |
| "entropy": 0.8984540700912476, | |
| "epoch": 0.8414634146341463, | |
| "grad_norm": 0.1492290049791336, | |
| "learning_rate": 6.449864498644986e-06, | |
| "loss": 0.8879, | |
| "mean_token_accuracy": 0.7269256711006165, | |
| "num_tokens": 4626229.0, | |
| "step": 345 | |
| }, | |
| { | |
| "entropy": 0.9049922227859497, | |
| "epoch": 0.8439024390243902, | |
| "grad_norm": 0.15556073188781738, | |
| "learning_rate": 6.436314363143632e-06, | |
| "loss": 0.8954, | |
| "mean_token_accuracy": 0.7196219563484192, | |
| "num_tokens": 4639577.0, | |
| "step": 346 | |
| }, | |
| { | |
| "entropy": 0.8850518465042114, | |
| "epoch": 0.8463414634146341, | |
| "grad_norm": 0.1551712155342102, | |
| "learning_rate": 6.422764227642278e-06, | |
| "loss": 0.8819, | |
| "mean_token_accuracy": 0.7270249724388123, | |
| "num_tokens": 4652803.0, | |
| "step": 347 | |
| }, | |
| { | |
| "entropy": 0.8971195220947266, | |
| "epoch": 0.848780487804878, | |
| "grad_norm": 0.16061030328273773, | |
| "learning_rate": 6.409214092140922e-06, | |
| "loss": 0.9152, | |
| "mean_token_accuracy": 0.7229515910148621, | |
| "num_tokens": 4666073.0, | |
| "step": 348 | |
| }, | |
| { | |
| "entropy": 0.8811110258102417, | |
| "epoch": 0.8512195121951219, | |
| "grad_norm": 0.16647042334079742, | |
| "learning_rate": 6.395663956639567e-06, | |
| "loss": 0.892, | |
| "mean_token_accuracy": 0.728188693523407, | |
| "num_tokens": 4679190.0, | |
| "step": 349 | |
| }, | |
| { | |
| "entropy": 0.8929190039634705, | |
| "epoch": 0.8536585365853658, | |
| "grad_norm": 0.16059380769729614, | |
| "learning_rate": 6.3821138211382115e-06, | |
| "loss": 0.8903, | |
| "mean_token_accuracy": 0.7205564975738525, | |
| "num_tokens": 4692647.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 0.8734034299850464, | |
| "epoch": 0.8560975609756097, | |
| "grad_norm": 0.15726624429225922, | |
| "learning_rate": 6.368563685636857e-06, | |
| "loss": 0.8663, | |
| "mean_token_accuracy": 0.7282682061195374, | |
| "num_tokens": 4705996.0, | |
| "step": 351 | |
| }, | |
| { | |
| "entropy": 0.9022495746612549, | |
| "epoch": 0.8585365853658536, | |
| "grad_norm": 0.16244319081306458, | |
| "learning_rate": 6.355013550135501e-06, | |
| "loss": 0.9039, | |
| "mean_token_accuracy": 0.7216587066650391, | |
| "num_tokens": 4719420.0, | |
| "step": 352 | |
| }, | |
| { | |
| "entropy": 0.8873569965362549, | |
| "epoch": 0.8609756097560975, | |
| "grad_norm": 0.15533290803432465, | |
| "learning_rate": 6.341463414634147e-06, | |
| "loss": 0.8872, | |
| "mean_token_accuracy": 0.7262784838676453, | |
| "num_tokens": 4732694.0, | |
| "step": 353 | |
| }, | |
| { | |
| "entropy": 0.9040166139602661, | |
| "epoch": 0.8634146341463415, | |
| "grad_norm": 0.1683635264635086, | |
| "learning_rate": 6.3279132791327915e-06, | |
| "loss": 0.9086, | |
| "mean_token_accuracy": 0.7204293012619019, | |
| "num_tokens": 4745755.0, | |
| "step": 354 | |
| }, | |
| { | |
| "entropy": 0.8856945633888245, | |
| "epoch": 0.8658536585365854, | |
| "grad_norm": 0.16074056923389435, | |
| "learning_rate": 6.314363143631437e-06, | |
| "loss": 0.885, | |
| "mean_token_accuracy": 0.7246061563491821, | |
| "num_tokens": 4759101.0, | |
| "step": 355 | |
| }, | |
| { | |
| "entropy": 0.905910849571228, | |
| "epoch": 0.8682926829268293, | |
| "grad_norm": 0.15096408128738403, | |
| "learning_rate": 6.300813008130082e-06, | |
| "loss": 0.899, | |
| "mean_token_accuracy": 0.7240304350852966, | |
| "num_tokens": 4772912.0, | |
| "step": 356 | |
| }, | |
| { | |
| "entropy": 0.9093368649482727, | |
| "epoch": 0.8707317073170732, | |
| "grad_norm": 0.15921390056610107, | |
| "learning_rate": 6.287262872628726e-06, | |
| "loss": 0.9007, | |
| "mean_token_accuracy": 0.7238253355026245, | |
| "num_tokens": 4786166.0, | |
| "step": 357 | |
| }, | |
| { | |
| "entropy": 0.8879554271697998, | |
| "epoch": 0.8731707317073171, | |
| "grad_norm": 0.16032229363918304, | |
| "learning_rate": 6.273712737127372e-06, | |
| "loss": 0.8967, | |
| "mean_token_accuracy": 0.7268417477607727, | |
| "num_tokens": 4799471.0, | |
| "step": 358 | |
| }, | |
| { | |
| "entropy": 0.891460657119751, | |
| "epoch": 0.875609756097561, | |
| "grad_norm": 0.16416114568710327, | |
| "learning_rate": 6.260162601626017e-06, | |
| "loss": 0.8902, | |
| "mean_token_accuracy": 0.7235052585601807, | |
| "num_tokens": 4813386.0, | |
| "step": 359 | |
| }, | |
| { | |
| "entropy": 0.8875571489334106, | |
| "epoch": 0.8780487804878049, | |
| "grad_norm": 0.1605481505393982, | |
| "learning_rate": 6.246612466124662e-06, | |
| "loss": 0.8898, | |
| "mean_token_accuracy": 0.7255409955978394, | |
| "num_tokens": 4826526.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 0.8935996294021606, | |
| "epoch": 0.8804878048780488, | |
| "grad_norm": 0.16389435529708862, | |
| "learning_rate": 6.233062330623306e-06, | |
| "loss": 0.91, | |
| "mean_token_accuracy": 0.7174138426780701, | |
| "num_tokens": 4840060.0, | |
| "step": 361 | |
| }, | |
| { | |
| "entropy": 0.8958407640457153, | |
| "epoch": 0.8829268292682927, | |
| "grad_norm": 0.16387997567653656, | |
| "learning_rate": 6.219512195121951e-06, | |
| "loss": 0.8974, | |
| "mean_token_accuracy": 0.72060626745224, | |
| "num_tokens": 4853140.0, | |
| "step": 362 | |
| }, | |
| { | |
| "entropy": 0.8770266771316528, | |
| "epoch": 0.8853658536585366, | |
| "grad_norm": 0.1663968414068222, | |
| "learning_rate": 6.205962059620597e-06, | |
| "loss": 0.8814, | |
| "mean_token_accuracy": 0.7238948941230774, | |
| "num_tokens": 4866209.0, | |
| "step": 363 | |
| }, | |
| { | |
| "entropy": 0.904643177986145, | |
| "epoch": 0.8878048780487805, | |
| "grad_norm": 0.15112806856632233, | |
| "learning_rate": 6.192411924119242e-06, | |
| "loss": 0.9089, | |
| "mean_token_accuracy": 0.7163041830062866, | |
| "num_tokens": 4879743.0, | |
| "step": 364 | |
| }, | |
| { | |
| "entropy": 0.89634770154953, | |
| "epoch": 0.8902439024390244, | |
| "grad_norm": 0.1654719114303589, | |
| "learning_rate": 6.178861788617887e-06, | |
| "loss": 0.894, | |
| "mean_token_accuracy": 0.7259781360626221, | |
| "num_tokens": 4893382.0, | |
| "step": 365 | |
| }, | |
| { | |
| "entropy": 0.9034420251846313, | |
| "epoch": 0.8926829268292683, | |
| "grad_norm": 0.15709993243217468, | |
| "learning_rate": 6.165311653116531e-06, | |
| "loss": 0.907, | |
| "mean_token_accuracy": 0.7218876481056213, | |
| "num_tokens": 4906515.0, | |
| "step": 366 | |
| }, | |
| { | |
| "entropy": 0.8903079032897949, | |
| "epoch": 0.8951219512195122, | |
| "grad_norm": 0.17142841219902039, | |
| "learning_rate": 6.1517615176151765e-06, | |
| "loss": 0.8922, | |
| "mean_token_accuracy": 0.7258428931236267, | |
| "num_tokens": 4919374.0, | |
| "step": 367 | |
| }, | |
| { | |
| "entropy": 0.9114763140678406, | |
| "epoch": 0.8975609756097561, | |
| "grad_norm": 0.16571395099163055, | |
| "learning_rate": 6.138211382113821e-06, | |
| "loss": 0.9181, | |
| "mean_token_accuracy": 0.7214821577072144, | |
| "num_tokens": 4932452.0, | |
| "step": 368 | |
| }, | |
| { | |
| "entropy": 0.8874707818031311, | |
| "epoch": 0.9, | |
| "grad_norm": 0.16487263143062592, | |
| "learning_rate": 6.124661246612467e-06, | |
| "loss": 0.8915, | |
| "mean_token_accuracy": 0.7204229831695557, | |
| "num_tokens": 4946085.0, | |
| "step": 369 | |
| }, | |
| { | |
| "entropy": 0.8861266374588013, | |
| "epoch": 0.9024390243902439, | |
| "grad_norm": 0.1598166823387146, | |
| "learning_rate": 6.111111111111112e-06, | |
| "loss": 0.8735, | |
| "mean_token_accuracy": 0.7311769127845764, | |
| "num_tokens": 4958838.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 0.8907301425933838, | |
| "epoch": 0.9048780487804878, | |
| "grad_norm": 0.1626753956079483, | |
| "learning_rate": 6.0975609756097564e-06, | |
| "loss": 0.9115, | |
| "mean_token_accuracy": 0.7186935544013977, | |
| "num_tokens": 4972142.0, | |
| "step": 371 | |
| }, | |
| { | |
| "entropy": 0.895031213760376, | |
| "epoch": 0.9073170731707317, | |
| "grad_norm": 0.15703290700912476, | |
| "learning_rate": 6.084010840108402e-06, | |
| "loss": 0.8925, | |
| "mean_token_accuracy": 0.7240086793899536, | |
| "num_tokens": 4985499.0, | |
| "step": 372 | |
| }, | |
| { | |
| "entropy": 0.8968839645385742, | |
| "epoch": 0.9097560975609756, | |
| "grad_norm": 0.15938685834407806, | |
| "learning_rate": 6.070460704607046e-06, | |
| "loss": 0.8922, | |
| "mean_token_accuracy": 0.7231118083000183, | |
| "num_tokens": 4998755.0, | |
| "step": 373 | |
| }, | |
| { | |
| "entropy": 0.8882355690002441, | |
| "epoch": 0.9121951219512195, | |
| "grad_norm": 0.1686704307794571, | |
| "learning_rate": 6.056910569105692e-06, | |
| "loss": 0.8867, | |
| "mean_token_accuracy": 0.7230345010757446, | |
| "num_tokens": 5011834.0, | |
| "step": 374 | |
| }, | |
| { | |
| "entropy": 0.9107680320739746, | |
| "epoch": 0.9146341463414634, | |
| "grad_norm": 0.15755151212215424, | |
| "learning_rate": 6.043360433604336e-06, | |
| "loss": 0.9115, | |
| "mean_token_accuracy": 0.7232315540313721, | |
| "num_tokens": 5025280.0, | |
| "step": 375 | |
| }, | |
| { | |
| "entropy": 0.876611590385437, | |
| "epoch": 0.9170731707317074, | |
| "grad_norm": 0.16388185322284698, | |
| "learning_rate": 6.0298102981029816e-06, | |
| "loss": 0.8723, | |
| "mean_token_accuracy": 0.7300817966461182, | |
| "num_tokens": 5038500.0, | |
| "step": 376 | |
| }, | |
| { | |
| "entropy": 0.8733739852905273, | |
| "epoch": 0.9195121951219513, | |
| "grad_norm": 0.16187280416488647, | |
| "learning_rate": 6.016260162601627e-06, | |
| "loss": 0.8635, | |
| "mean_token_accuracy": 0.7310600280761719, | |
| "num_tokens": 5052006.0, | |
| "step": 377 | |
| }, | |
| { | |
| "entropy": 0.8965020179748535, | |
| "epoch": 0.9219512195121952, | |
| "grad_norm": 0.16080215573310852, | |
| "learning_rate": 6.002710027100271e-06, | |
| "loss": 0.8937, | |
| "mean_token_accuracy": 0.721447229385376, | |
| "num_tokens": 5065427.0, | |
| "step": 378 | |
| }, | |
| { | |
| "entropy": 0.8970279097557068, | |
| "epoch": 0.9243902439024391, | |
| "grad_norm": 0.1639380156993866, | |
| "learning_rate": 5.989159891598917e-06, | |
| "loss": 0.883, | |
| "mean_token_accuracy": 0.727632999420166, | |
| "num_tokens": 5079068.0, | |
| "step": 379 | |
| }, | |
| { | |
| "entropy": 0.8991611003875732, | |
| "epoch": 0.926829268292683, | |
| "grad_norm": 0.16831153631210327, | |
| "learning_rate": 5.9756097560975615e-06, | |
| "loss": 0.9014, | |
| "mean_token_accuracy": 0.7194920182228088, | |
| "num_tokens": 5092392.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 0.8883278369903564, | |
| "epoch": 0.9292682926829269, | |
| "grad_norm": 0.1687973588705063, | |
| "learning_rate": 5.962059620596207e-06, | |
| "loss": 0.8735, | |
| "mean_token_accuracy": 0.7264938354492188, | |
| "num_tokens": 5105830.0, | |
| "step": 381 | |
| }, | |
| { | |
| "entropy": 0.8809381723403931, | |
| "epoch": 0.9317073170731708, | |
| "grad_norm": 0.16963472962379456, | |
| "learning_rate": 5.948509485094851e-06, | |
| "loss": 0.882, | |
| "mean_token_accuracy": 0.7262528538703918, | |
| "num_tokens": 5119395.0, | |
| "step": 382 | |
| }, | |
| { | |
| "entropy": 0.9021738767623901, | |
| "epoch": 0.9341463414634147, | |
| "grad_norm": 0.16875696182250977, | |
| "learning_rate": 5.934959349593496e-06, | |
| "loss": 0.9195, | |
| "mean_token_accuracy": 0.718323290348053, | |
| "num_tokens": 5133033.0, | |
| "step": 383 | |
| }, | |
| { | |
| "entropy": 0.8832775950431824, | |
| "epoch": 0.9365853658536586, | |
| "grad_norm": 0.16139884293079376, | |
| "learning_rate": 5.921409214092141e-06, | |
| "loss": 0.8663, | |
| "mean_token_accuracy": 0.7280119061470032, | |
| "num_tokens": 5146454.0, | |
| "step": 384 | |
| }, | |
| { | |
| "entropy": 0.9056813716888428, | |
| "epoch": 0.9390243902439024, | |
| "grad_norm": 0.16711100935935974, | |
| "learning_rate": 5.907859078590787e-06, | |
| "loss": 0.89, | |
| "mean_token_accuracy": 0.723343551158905, | |
| "num_tokens": 5160144.0, | |
| "step": 385 | |
| }, | |
| { | |
| "entropy": 0.8854928016662598, | |
| "epoch": 0.9414634146341463, | |
| "grad_norm": 0.15719208121299744, | |
| "learning_rate": 5.894308943089432e-06, | |
| "loss": 0.8874, | |
| "mean_token_accuracy": 0.7249353528022766, | |
| "num_tokens": 5173695.0, | |
| "step": 386 | |
| }, | |
| { | |
| "entropy": 0.9151058197021484, | |
| "epoch": 0.9439024390243902, | |
| "grad_norm": 0.17206765711307526, | |
| "learning_rate": 5.880758807588076e-06, | |
| "loss": 0.9246, | |
| "mean_token_accuracy": 0.7111825942993164, | |
| "num_tokens": 5187384.0, | |
| "step": 387 | |
| }, | |
| { | |
| "entropy": 0.8885694742202759, | |
| "epoch": 0.9463414634146341, | |
| "grad_norm": 0.15557175874710083, | |
| "learning_rate": 5.867208672086721e-06, | |
| "loss": 0.8783, | |
| "mean_token_accuracy": 0.7255944013595581, | |
| "num_tokens": 5201321.0, | |
| "step": 388 | |
| }, | |
| { | |
| "entropy": 0.8794446587562561, | |
| "epoch": 0.948780487804878, | |
| "grad_norm": 0.16666075587272644, | |
| "learning_rate": 5.853658536585366e-06, | |
| "loss": 0.8845, | |
| "mean_token_accuracy": 0.7247271537780762, | |
| "num_tokens": 5214622.0, | |
| "step": 389 | |
| }, | |
| { | |
| "entropy": 0.8968200087547302, | |
| "epoch": 0.9512195121951219, | |
| "grad_norm": 0.17773029208183289, | |
| "learning_rate": 5.840108401084012e-06, | |
| "loss": 0.9077, | |
| "mean_token_accuracy": 0.7226738929748535, | |
| "num_tokens": 5227922.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 0.8937841653823853, | |
| "epoch": 0.9536585365853658, | |
| "grad_norm": 0.16367283463478088, | |
| "learning_rate": 5.826558265582656e-06, | |
| "loss": 0.8809, | |
| "mean_token_accuracy": 0.7214851975440979, | |
| "num_tokens": 5241808.0, | |
| "step": 391 | |
| }, | |
| { | |
| "entropy": 0.8804587125778198, | |
| "epoch": 0.9560975609756097, | |
| "grad_norm": 0.1632731407880783, | |
| "learning_rate": 5.813008130081301e-06, | |
| "loss": 0.8683, | |
| "mean_token_accuracy": 0.7282600998878479, | |
| "num_tokens": 5255451.0, | |
| "step": 392 | |
| }, | |
| { | |
| "entropy": 0.8958999514579773, | |
| "epoch": 0.9585365853658536, | |
| "grad_norm": 0.17145903408527374, | |
| "learning_rate": 5.7994579945799465e-06, | |
| "loss": 0.8949, | |
| "mean_token_accuracy": 0.7235816121101379, | |
| "num_tokens": 5268545.0, | |
| "step": 393 | |
| }, | |
| { | |
| "entropy": 0.8910573124885559, | |
| "epoch": 0.9609756097560975, | |
| "grad_norm": 0.17792750895023346, | |
| "learning_rate": 5.785907859078591e-06, | |
| "loss": 0.8947, | |
| "mean_token_accuracy": 0.7218443155288696, | |
| "num_tokens": 5281791.0, | |
| "step": 394 | |
| }, | |
| { | |
| "entropy": 0.8853224515914917, | |
| "epoch": 0.9634146341463414, | |
| "grad_norm": 0.1683335304260254, | |
| "learning_rate": 5.772357723577237e-06, | |
| "loss": 0.8731, | |
| "mean_token_accuracy": 0.7287229895591736, | |
| "num_tokens": 5295284.0, | |
| "step": 395 | |
| }, | |
| { | |
| "entropy": 0.894146740436554, | |
| "epoch": 0.9658536585365853, | |
| "grad_norm": 0.1783977597951889, | |
| "learning_rate": 5.758807588075881e-06, | |
| "loss": 0.8843, | |
| "mean_token_accuracy": 0.7266537547111511, | |
| "num_tokens": 5308225.0, | |
| "step": 396 | |
| }, | |
| { | |
| "entropy": 0.8935642242431641, | |
| "epoch": 0.9682926829268292, | |
| "grad_norm": 0.18579219281673431, | |
| "learning_rate": 5.7452574525745265e-06, | |
| "loss": 0.9289, | |
| "mean_token_accuracy": 0.7102810740470886, | |
| "num_tokens": 5321440.0, | |
| "step": 397 | |
| }, | |
| { | |
| "entropy": 0.868985652923584, | |
| "epoch": 0.9707317073170731, | |
| "grad_norm": 0.1684473305940628, | |
| "learning_rate": 5.731707317073171e-06, | |
| "loss": 0.85, | |
| "mean_token_accuracy": 0.7313686013221741, | |
| "num_tokens": 5334418.0, | |
| "step": 398 | |
| }, | |
| { | |
| "entropy": 0.8838146924972534, | |
| "epoch": 0.973170731707317, | |
| "grad_norm": 0.1632496416568756, | |
| "learning_rate": 5.718157181571816e-06, | |
| "loss": 0.8864, | |
| "mean_token_accuracy": 0.7268916964530945, | |
| "num_tokens": 5347795.0, | |
| "step": 399 | |
| }, | |
| { | |
| "entropy": 0.882776141166687, | |
| "epoch": 0.975609756097561, | |
| "grad_norm": 0.16958434879779816, | |
| "learning_rate": 5.704607046070462e-06, | |
| "loss": 0.8898, | |
| "mean_token_accuracy": 0.7269032001495361, | |
| "num_tokens": 5361341.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.8883211016654968, | |
| "epoch": 0.9780487804878049, | |
| "grad_norm": 0.15948385000228882, | |
| "learning_rate": 5.691056910569106e-06, | |
| "loss": 0.8854, | |
| "mean_token_accuracy": 0.7242578864097595, | |
| "num_tokens": 5374866.0, | |
| "step": 401 | |
| }, | |
| { | |
| "entropy": 0.8896247744560242, | |
| "epoch": 0.9804878048780488, | |
| "grad_norm": 0.1636204868555069, | |
| "learning_rate": 5.677506775067752e-06, | |
| "loss": 0.8869, | |
| "mean_token_accuracy": 0.7276943325996399, | |
| "num_tokens": 5388466.0, | |
| "step": 402 | |
| }, | |
| { | |
| "entropy": 0.9205676317214966, | |
| "epoch": 0.9829268292682927, | |
| "grad_norm": 0.18203061819076538, | |
| "learning_rate": 5.663956639566396e-06, | |
| "loss": 0.9197, | |
| "mean_token_accuracy": 0.7194843888282776, | |
| "num_tokens": 5402524.0, | |
| "step": 403 | |
| }, | |
| { | |
| "entropy": 0.875140905380249, | |
| "epoch": 0.9853658536585366, | |
| "grad_norm": 0.17026175558567047, | |
| "learning_rate": 5.650406504065041e-06, | |
| "loss": 0.8884, | |
| "mean_token_accuracy": 0.7227595448493958, | |
| "num_tokens": 5415774.0, | |
| "step": 404 | |
| }, | |
| { | |
| "entropy": 0.8699055910110474, | |
| "epoch": 0.9878048780487805, | |
| "grad_norm": 0.15694531798362732, | |
| "learning_rate": 5.6368563685636855e-06, | |
| "loss": 0.8806, | |
| "mean_token_accuracy": 0.7257359623908997, | |
| "num_tokens": 5429514.0, | |
| "step": 405 | |
| }, | |
| { | |
| "entropy": 0.8878951072692871, | |
| "epoch": 0.9902439024390244, | |
| "grad_norm": 0.16797906160354614, | |
| "learning_rate": 5.6233062330623315e-06, | |
| "loss": 0.8888, | |
| "mean_token_accuracy": 0.7275060415267944, | |
| "num_tokens": 5442778.0, | |
| "step": 406 | |
| }, | |
| { | |
| "entropy": 0.876734733581543, | |
| "epoch": 0.9926829268292683, | |
| "grad_norm": 0.17915265262126923, | |
| "learning_rate": 5.609756097560977e-06, | |
| "loss": 0.8878, | |
| "mean_token_accuracy": 0.724197268486023, | |
| "num_tokens": 5456155.0, | |
| "step": 407 | |
| }, | |
| { | |
| "entropy": 0.8894374370574951, | |
| "epoch": 0.9951219512195122, | |
| "grad_norm": 0.16572211682796478, | |
| "learning_rate": 5.596205962059621e-06, | |
| "loss": 0.89, | |
| "mean_token_accuracy": 0.7255958318710327, | |
| "num_tokens": 5469724.0, | |
| "step": 408 | |
| }, | |
| { | |
| "entropy": 0.8932273387908936, | |
| "epoch": 0.9975609756097561, | |
| "grad_norm": 0.15642738342285156, | |
| "learning_rate": 5.582655826558266e-06, | |
| "loss": 0.8877, | |
| "mean_token_accuracy": 0.7234919667243958, | |
| "num_tokens": 5483566.0, | |
| "step": 409 | |
| }, | |
| { | |
| "entropy": 0.8865507245063782, | |
| "epoch": 1.0, | |
| "grad_norm": 0.17557752132415771, | |
| "learning_rate": 5.569105691056911e-06, | |
| "loss": 0.8676, | |
| "mean_token_accuracy": 0.729709267616272, | |
| "num_tokens": 5496790.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 0.883284866809845, | |
| "epoch": 1.002439024390244, | |
| "grad_norm": 0.15459215641021729, | |
| "learning_rate": 5.555555555555557e-06, | |
| "loss": 0.8867, | |
| "mean_token_accuracy": 0.7233609557151794, | |
| "num_tokens": 5510564.0, | |
| "step": 411 | |
| }, | |
| { | |
| "entropy": 0.873902440071106, | |
| "epoch": 1.0048780487804878, | |
| "grad_norm": 0.17083869874477386, | |
| "learning_rate": 5.542005420054201e-06, | |
| "loss": 0.8604, | |
| "mean_token_accuracy": 0.7324744462966919, | |
| "num_tokens": 5523775.0, | |
| "step": 412 | |
| }, | |
| { | |
| "entropy": 0.8813484311103821, | |
| "epoch": 1.0073170731707317, | |
| "grad_norm": 0.17701290547847748, | |
| "learning_rate": 5.528455284552846e-06, | |
| "loss": 0.873, | |
| "mean_token_accuracy": 0.7278922200202942, | |
| "num_tokens": 5536852.0, | |
| "step": 413 | |
| }, | |
| { | |
| "entropy": 0.8950551748275757, | |
| "epoch": 1.0097560975609756, | |
| "grad_norm": 0.18133288621902466, | |
| "learning_rate": 5.5149051490514906e-06, | |
| "loss": 0.8765, | |
| "mean_token_accuracy": 0.7292779684066772, | |
| "num_tokens": 5549970.0, | |
| "step": 414 | |
| }, | |
| { | |
| "entropy": 0.881912350654602, | |
| "epoch": 1.0121951219512195, | |
| "grad_norm": 0.1715339571237564, | |
| "learning_rate": 5.501355013550136e-06, | |
| "loss": 0.8937, | |
| "mean_token_accuracy": 0.7215859889984131, | |
| "num_tokens": 5563782.0, | |
| "step": 415 | |
| }, | |
| { | |
| "entropy": 0.8737983703613281, | |
| "epoch": 1.0146341463414634, | |
| "grad_norm": 0.17756839096546173, | |
| "learning_rate": 5.487804878048781e-06, | |
| "loss": 0.8851, | |
| "mean_token_accuracy": 0.7261270880699158, | |
| "num_tokens": 5577129.0, | |
| "step": 416 | |
| }, | |
| { | |
| "entropy": 0.883063793182373, | |
| "epoch": 1.0170731707317073, | |
| "grad_norm": 0.1765228509902954, | |
| "learning_rate": 5.474254742547425e-06, | |
| "loss": 0.8864, | |
| "mean_token_accuracy": 0.7223793864250183, | |
| "num_tokens": 5590577.0, | |
| "step": 417 | |
| }, | |
| { | |
| "entropy": 0.8849365711212158, | |
| "epoch": 1.0195121951219512, | |
| "grad_norm": 0.1792328804731369, | |
| "learning_rate": 5.460704607046071e-06, | |
| "loss": 0.8766, | |
| "mean_token_accuracy": 0.7255821228027344, | |
| "num_tokens": 5603821.0, | |
| "step": 418 | |
| }, | |
| { | |
| "entropy": 0.8823648691177368, | |
| "epoch": 1.0219512195121951, | |
| "grad_norm": 0.173680379986763, | |
| "learning_rate": 5.447154471544716e-06, | |
| "loss": 0.8822, | |
| "mean_token_accuracy": 0.7273980975151062, | |
| "num_tokens": 5616889.0, | |
| "step": 419 | |
| }, | |
| { | |
| "entropy": 0.8869985342025757, | |
| "epoch": 1.024390243902439, | |
| "grad_norm": 0.17492908239364624, | |
| "learning_rate": 5.433604336043361e-06, | |
| "loss": 0.9018, | |
| "mean_token_accuracy": 0.7217662334442139, | |
| "num_tokens": 5630063.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 0.8956865072250366, | |
| "epoch": 1.026829268292683, | |
| "grad_norm": 0.16189217567443848, | |
| "learning_rate": 5.420054200542005e-06, | |
| "loss": 0.887, | |
| "mean_token_accuracy": 0.7262184619903564, | |
| "num_tokens": 5643703.0, | |
| "step": 421 | |
| }, | |
| { | |
| "entropy": 0.8691190481185913, | |
| "epoch": 1.0292682926829269, | |
| "grad_norm": 0.17272132635116577, | |
| "learning_rate": 5.4065040650406504e-06, | |
| "loss": 0.8765, | |
| "mean_token_accuracy": 0.7276405096054077, | |
| "num_tokens": 5657315.0, | |
| "step": 422 | |
| }, | |
| { | |
| "entropy": 0.8758895397186279, | |
| "epoch": 1.0317073170731708, | |
| "grad_norm": 0.17333146929740906, | |
| "learning_rate": 5.3929539295392965e-06, | |
| "loss": 0.8742, | |
| "mean_token_accuracy": 0.7282917499542236, | |
| "num_tokens": 5671070.0, | |
| "step": 423 | |
| }, | |
| { | |
| "entropy": 0.8903429508209229, | |
| "epoch": 1.0341463414634147, | |
| "grad_norm": 0.1801253706216812, | |
| "learning_rate": 5.379403794037941e-06, | |
| "loss": 0.8842, | |
| "mean_token_accuracy": 0.7301153540611267, | |
| "num_tokens": 5684262.0, | |
| "step": 424 | |
| }, | |
| { | |
| "entropy": 0.8774839639663696, | |
| "epoch": 1.0365853658536586, | |
| "grad_norm": 0.1836852729320526, | |
| "learning_rate": 5.365853658536586e-06, | |
| "loss": 0.8781, | |
| "mean_token_accuracy": 0.7317860722541809, | |
| "num_tokens": 5697592.0, | |
| "step": 425 | |
| }, | |
| { | |
| "entropy": 0.898011326789856, | |
| "epoch": 1.0390243902439025, | |
| "grad_norm": 0.17385412752628326, | |
| "learning_rate": 5.35230352303523e-06, | |
| "loss": 0.8899, | |
| "mean_token_accuracy": 0.724575936794281, | |
| "num_tokens": 5710991.0, | |
| "step": 426 | |
| }, | |
| { | |
| "entropy": 0.885576069355011, | |
| "epoch": 1.0414634146341464, | |
| "grad_norm": 0.16952155530452728, | |
| "learning_rate": 5.338753387533876e-06, | |
| "loss": 0.8831, | |
| "mean_token_accuracy": 0.7247596383094788, | |
| "num_tokens": 5724319.0, | |
| "step": 427 | |
| }, | |
| { | |
| "entropy": 0.8738988041877747, | |
| "epoch": 1.0439024390243903, | |
| "grad_norm": 0.18119633197784424, | |
| "learning_rate": 5.32520325203252e-06, | |
| "loss": 0.8629, | |
| "mean_token_accuracy": 0.7306736707687378, | |
| "num_tokens": 5737620.0, | |
| "step": 428 | |
| }, | |
| { | |
| "entropy": 0.8968448638916016, | |
| "epoch": 1.0463414634146342, | |
| "grad_norm": 0.189066544175148, | |
| "learning_rate": 5.311653116531166e-06, | |
| "loss": 0.8896, | |
| "mean_token_accuracy": 0.7251328825950623, | |
| "num_tokens": 5750806.0, | |
| "step": 429 | |
| }, | |
| { | |
| "entropy": 0.8695570230484009, | |
| "epoch": 1.048780487804878, | |
| "grad_norm": 0.16916069388389587, | |
| "learning_rate": 5.298102981029811e-06, | |
| "loss": 0.8897, | |
| "mean_token_accuracy": 0.7256984710693359, | |
| "num_tokens": 5764566.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 0.8742542266845703, | |
| "epoch": 1.051219512195122, | |
| "grad_norm": 0.1751270592212677, | |
| "learning_rate": 5.2845528455284555e-06, | |
| "loss": 0.882, | |
| "mean_token_accuracy": 0.727017879486084, | |
| "num_tokens": 5778136.0, | |
| "step": 431 | |
| }, | |
| { | |
| "entropy": 0.8784512281417847, | |
| "epoch": 1.053658536585366, | |
| "grad_norm": 0.16934418678283691, | |
| "learning_rate": 5.271002710027101e-06, | |
| "loss": 0.8728, | |
| "mean_token_accuracy": 0.729217529296875, | |
| "num_tokens": 5791661.0, | |
| "step": 432 | |
| }, | |
| { | |
| "entropy": 0.8749353885650635, | |
| "epoch": 1.0560975609756098, | |
| "grad_norm": 0.18582025170326233, | |
| "learning_rate": 5.257452574525745e-06, | |
| "loss": 0.8637, | |
| "mean_token_accuracy": 0.7266749143600464, | |
| "num_tokens": 5804603.0, | |
| "step": 433 | |
| }, | |
| { | |
| "entropy": 0.8723912239074707, | |
| "epoch": 1.0585365853658537, | |
| "grad_norm": 0.18588410317897797, | |
| "learning_rate": 5.243902439024391e-06, | |
| "loss": 0.8872, | |
| "mean_token_accuracy": 0.7275745272636414, | |
| "num_tokens": 5817874.0, | |
| "step": 434 | |
| }, | |
| { | |
| "entropy": 0.8809516429901123, | |
| "epoch": 1.0609756097560976, | |
| "grad_norm": 0.174485445022583, | |
| "learning_rate": 5.2303523035230355e-06, | |
| "loss": 0.878, | |
| "mean_token_accuracy": 0.7257272601127625, | |
| "num_tokens": 5831125.0, | |
| "step": 435 | |
| }, | |
| { | |
| "entropy": 0.8659344911575317, | |
| "epoch": 1.0634146341463415, | |
| "grad_norm": 0.17202284932136536, | |
| "learning_rate": 5.216802168021681e-06, | |
| "loss": 0.8644, | |
| "mean_token_accuracy": 0.731433629989624, | |
| "num_tokens": 5844687.0, | |
| "step": 436 | |
| }, | |
| { | |
| "entropy": 0.885354220867157, | |
| "epoch": 1.0658536585365854, | |
| "grad_norm": 0.1710902750492096, | |
| "learning_rate": 5.203252032520326e-06, | |
| "loss": 0.8919, | |
| "mean_token_accuracy": 0.7240340709686279, | |
| "num_tokens": 5858317.0, | |
| "step": 437 | |
| }, | |
| { | |
| "entropy": 0.8834629654884338, | |
| "epoch": 1.0682926829268293, | |
| "grad_norm": 0.17878998816013336, | |
| "learning_rate": 5.18970189701897e-06, | |
| "loss": 0.8884, | |
| "mean_token_accuracy": 0.724520742893219, | |
| "num_tokens": 5871844.0, | |
| "step": 438 | |
| }, | |
| { | |
| "entropy": 0.8910503387451172, | |
| "epoch": 1.0707317073170732, | |
| "grad_norm": 0.17803862690925598, | |
| "learning_rate": 5.176151761517616e-06, | |
| "loss": 0.8887, | |
| "mean_token_accuracy": 0.7292178869247437, | |
| "num_tokens": 5885694.0, | |
| "step": 439 | |
| }, | |
| { | |
| "entropy": 0.8749967813491821, | |
| "epoch": 1.0731707317073171, | |
| "grad_norm": 0.18004469573497772, | |
| "learning_rate": 5.162601626016261e-06, | |
| "loss": 0.8691, | |
| "mean_token_accuracy": 0.7276826500892639, | |
| "num_tokens": 5898794.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 0.8866884708404541, | |
| "epoch": 1.075609756097561, | |
| "grad_norm": 0.1842956691980362, | |
| "learning_rate": 5.149051490514906e-06, | |
| "loss": 0.8972, | |
| "mean_token_accuracy": 0.724666953086853, | |
| "num_tokens": 5912172.0, | |
| "step": 441 | |
| }, | |
| { | |
| "entropy": 0.878664493560791, | |
| "epoch": 1.078048780487805, | |
| "grad_norm": 0.18605175614356995, | |
| "learning_rate": 5.13550135501355e-06, | |
| "loss": 0.8696, | |
| "mean_token_accuracy": 0.7282981276512146, | |
| "num_tokens": 5925309.0, | |
| "step": 442 | |
| }, | |
| { | |
| "entropy": 0.8751529455184937, | |
| "epoch": 1.0804878048780489, | |
| "grad_norm": 0.1772121638059616, | |
| "learning_rate": 5.121951219512195e-06, | |
| "loss": 0.8758, | |
| "mean_token_accuracy": 0.7304328083992004, | |
| "num_tokens": 5938357.0, | |
| "step": 443 | |
| }, | |
| { | |
| "entropy": 0.8884094953536987, | |
| "epoch": 1.0829268292682928, | |
| "grad_norm": 0.17419125139713287, | |
| "learning_rate": 5.10840108401084e-06, | |
| "loss": 0.8761, | |
| "mean_token_accuracy": 0.7276250720024109, | |
| "num_tokens": 5952306.0, | |
| "step": 444 | |
| }, | |
| { | |
| "entropy": 0.8670481443405151, | |
| "epoch": 1.0853658536585367, | |
| "grad_norm": 0.18553416430950165, | |
| "learning_rate": 5.094850948509486e-06, | |
| "loss": 0.8756, | |
| "mean_token_accuracy": 0.7303195595741272, | |
| "num_tokens": 5966435.0, | |
| "step": 445 | |
| }, | |
| { | |
| "entropy": 0.8847004771232605, | |
| "epoch": 1.0878048780487806, | |
| "grad_norm": 0.17910823225975037, | |
| "learning_rate": 5.081300813008131e-06, | |
| "loss": 0.8986, | |
| "mean_token_accuracy": 0.7208833694458008, | |
| "num_tokens": 5979356.0, | |
| "step": 446 | |
| }, | |
| { | |
| "entropy": 0.8879530429840088, | |
| "epoch": 1.0902439024390245, | |
| "grad_norm": 0.19892668724060059, | |
| "learning_rate": 5.067750677506775e-06, | |
| "loss": 0.8864, | |
| "mean_token_accuracy": 0.7233535647392273, | |
| "num_tokens": 5993220.0, | |
| "step": 447 | |
| }, | |
| { | |
| "entropy": 0.8809808492660522, | |
| "epoch": 1.0926829268292684, | |
| "grad_norm": 0.17457018792629242, | |
| "learning_rate": 5.0542005420054205e-06, | |
| "loss": 0.8767, | |
| "mean_token_accuracy": 0.7264518737792969, | |
| "num_tokens": 6007080.0, | |
| "step": 448 | |
| }, | |
| { | |
| "entropy": 0.8835265636444092, | |
| "epoch": 1.0951219512195123, | |
| "grad_norm": 0.17747731506824493, | |
| "learning_rate": 5.040650406504065e-06, | |
| "loss": 0.8768, | |
| "mean_token_accuracy": 0.7282616496086121, | |
| "num_tokens": 6020701.0, | |
| "step": 449 | |
| }, | |
| { | |
| "entropy": 0.8794373273849487, | |
| "epoch": 1.0975609756097562, | |
| "grad_norm": 0.18246370553970337, | |
| "learning_rate": 5.027100271002711e-06, | |
| "loss": 0.8808, | |
| "mean_token_accuracy": 0.7193954586982727, | |
| "num_tokens": 6034612.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 0.8770255446434021, | |
| "epoch": 1.1, | |
| "grad_norm": 0.16051927208900452, | |
| "learning_rate": 5.013550135501355e-06, | |
| "loss": 0.8782, | |
| "mean_token_accuracy": 0.726668119430542, | |
| "num_tokens": 6048161.0, | |
| "step": 451 | |
| }, | |
| { | |
| "entropy": 0.9005379676818848, | |
| "epoch": 1.102439024390244, | |
| "grad_norm": 0.17038728296756744, | |
| "learning_rate": 5e-06, | |
| "loss": 0.8964, | |
| "mean_token_accuracy": 0.7211425304412842, | |
| "num_tokens": 6061761.0, | |
| "step": 452 | |
| }, | |
| { | |
| "entropy": 0.8716856837272644, | |
| "epoch": 1.104878048780488, | |
| "grad_norm": 0.18405020236968994, | |
| "learning_rate": 4.986449864498646e-06, | |
| "loss": 0.871, | |
| "mean_token_accuracy": 0.7311229705810547, | |
| "num_tokens": 6075259.0, | |
| "step": 453 | |
| }, | |
| { | |
| "entropy": 0.8855595588684082, | |
| "epoch": 1.1073170731707318, | |
| "grad_norm": 0.1729445457458496, | |
| "learning_rate": 4.97289972899729e-06, | |
| "loss": 0.8739, | |
| "mean_token_accuracy": 0.7265796661376953, | |
| "num_tokens": 6088917.0, | |
| "step": 454 | |
| }, | |
| { | |
| "entropy": 0.8742420673370361, | |
| "epoch": 1.1097560975609757, | |
| "grad_norm": 0.17936216294765472, | |
| "learning_rate": 4.959349593495935e-06, | |
| "loss": 0.8636, | |
| "mean_token_accuracy": 0.7290731072425842, | |
| "num_tokens": 6102516.0, | |
| "step": 455 | |
| }, | |
| { | |
| "entropy": 0.8735711574554443, | |
| "epoch": 1.1121951219512196, | |
| "grad_norm": 0.18746447563171387, | |
| "learning_rate": 4.94579945799458e-06, | |
| "loss": 0.8505, | |
| "mean_token_accuracy": 0.7305099368095398, | |
| "num_tokens": 6116180.0, | |
| "step": 456 | |
| }, | |
| { | |
| "entropy": 0.8641989231109619, | |
| "epoch": 1.1146341463414635, | |
| "grad_norm": 0.1635252684354782, | |
| "learning_rate": 4.9322493224932255e-06, | |
| "loss": 0.8549, | |
| "mean_token_accuracy": 0.732119619846344, | |
| "num_tokens": 6130038.0, | |
| "step": 457 | |
| }, | |
| { | |
| "entropy": 0.8750979900360107, | |
| "epoch": 1.1170731707317074, | |
| "grad_norm": 0.1839144378900528, | |
| "learning_rate": 4.918699186991871e-06, | |
| "loss": 0.8908, | |
| "mean_token_accuracy": 0.7277798652648926, | |
| "num_tokens": 6143319.0, | |
| "step": 458 | |
| }, | |
| { | |
| "entropy": 0.8701959252357483, | |
| "epoch": 1.1195121951219513, | |
| "grad_norm": 0.1786291003227234, | |
| "learning_rate": 4.905149051490515e-06, | |
| "loss": 0.8599, | |
| "mean_token_accuracy": 0.7290351390838623, | |
| "num_tokens": 6156798.0, | |
| "step": 459 | |
| }, | |
| { | |
| "entropy": 0.8633676171302795, | |
| "epoch": 1.1219512195121952, | |
| "grad_norm": 0.16640040278434753, | |
| "learning_rate": 4.89159891598916e-06, | |
| "loss": 0.8629, | |
| "mean_token_accuracy": 0.7302494645118713, | |
| "num_tokens": 6170282.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 0.8711209297180176, | |
| "epoch": 1.1243902439024391, | |
| "grad_norm": 0.19053176045417786, | |
| "learning_rate": 4.8780487804878055e-06, | |
| "loss": 0.8654, | |
| "mean_token_accuracy": 0.7281391620635986, | |
| "num_tokens": 6183518.0, | |
| "step": 461 | |
| }, | |
| { | |
| "entropy": 0.8640310764312744, | |
| "epoch": 1.126829268292683, | |
| "grad_norm": 0.17878729104995728, | |
| "learning_rate": 4.86449864498645e-06, | |
| "loss": 0.8617, | |
| "mean_token_accuracy": 0.7309045791625977, | |
| "num_tokens": 6197176.0, | |
| "step": 462 | |
| }, | |
| { | |
| "entropy": 0.8896546363830566, | |
| "epoch": 1.129268292682927, | |
| "grad_norm": 0.18125811219215393, | |
| "learning_rate": 4.850948509485095e-06, | |
| "loss": 0.9083, | |
| "mean_token_accuracy": 0.7183119058609009, | |
| "num_tokens": 6210888.0, | |
| "step": 463 | |
| }, | |
| { | |
| "entropy": 0.8741787672042847, | |
| "epoch": 1.1317073170731708, | |
| "grad_norm": 0.17769162356853485, | |
| "learning_rate": 4.83739837398374e-06, | |
| "loss": 0.8768, | |
| "mean_token_accuracy": 0.7282008528709412, | |
| "num_tokens": 6224127.0, | |
| "step": 464 | |
| }, | |
| { | |
| "entropy": 0.8620750904083252, | |
| "epoch": 1.1341463414634148, | |
| "grad_norm": 0.19808581471443176, | |
| "learning_rate": 4.823848238482385e-06, | |
| "loss": 0.8799, | |
| "mean_token_accuracy": 0.7266132235527039, | |
| "num_tokens": 6237238.0, | |
| "step": 465 | |
| }, | |
| { | |
| "entropy": 0.8672773838043213, | |
| "epoch": 1.1365853658536587, | |
| "grad_norm": 0.18568822741508484, | |
| "learning_rate": 4.810298102981031e-06, | |
| "loss": 0.8891, | |
| "mean_token_accuracy": 0.7204229235649109, | |
| "num_tokens": 6250778.0, | |
| "step": 466 | |
| }, | |
| { | |
| "entropy": 0.8523983359336853, | |
| "epoch": 1.1390243902439026, | |
| "grad_norm": 0.17448151111602783, | |
| "learning_rate": 4.796747967479675e-06, | |
| "loss": 0.8647, | |
| "mean_token_accuracy": 0.7291819453239441, | |
| "num_tokens": 6264412.0, | |
| "step": 467 | |
| }, | |
| { | |
| "entropy": 0.8495972156524658, | |
| "epoch": 1.1414634146341462, | |
| "grad_norm": 0.16932238638401031, | |
| "learning_rate": 4.78319783197832e-06, | |
| "loss": 0.8446, | |
| "mean_token_accuracy": 0.7364223599433899, | |
| "num_tokens": 6277593.0, | |
| "step": 468 | |
| }, | |
| { | |
| "entropy": 0.881886899471283, | |
| "epoch": 1.1439024390243901, | |
| "grad_norm": 0.1763680875301361, | |
| "learning_rate": 4.769647696476965e-06, | |
| "loss": 0.8899, | |
| "mean_token_accuracy": 0.7244584560394287, | |
| "num_tokens": 6290950.0, | |
| "step": 469 | |
| }, | |
| { | |
| "entropy": 0.8751710057258606, | |
| "epoch": 1.146341463414634, | |
| "grad_norm": 0.19120320677757263, | |
| "learning_rate": 4.75609756097561e-06, | |
| "loss": 0.886, | |
| "mean_token_accuracy": 0.7226884365081787, | |
| "num_tokens": 6304193.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 0.876998782157898, | |
| "epoch": 1.148780487804878, | |
| "grad_norm": 0.1712970733642578, | |
| "learning_rate": 4.742547425474256e-06, | |
| "loss": 0.8769, | |
| "mean_token_accuracy": 0.7278986573219299, | |
| "num_tokens": 6317862.0, | |
| "step": 471 | |
| }, | |
| { | |
| "entropy": 0.8527517318725586, | |
| "epoch": 1.1512195121951219, | |
| "grad_norm": 0.18993927538394928, | |
| "learning_rate": 4.7289972899729e-06, | |
| "loss": 0.8733, | |
| "mean_token_accuracy": 0.7293280363082886, | |
| "num_tokens": 6330661.0, | |
| "step": 472 | |
| }, | |
| { | |
| "entropy": 0.8713936805725098, | |
| "epoch": 1.1536585365853658, | |
| "grad_norm": 0.18412742018699646, | |
| "learning_rate": 4.715447154471545e-06, | |
| "loss": 0.8874, | |
| "mean_token_accuracy": 0.7243731021881104, | |
| "num_tokens": 6344315.0, | |
| "step": 473 | |
| }, | |
| { | |
| "entropy": 0.874845027923584, | |
| "epoch": 1.1560975609756097, | |
| "grad_norm": 0.16824601590633392, | |
| "learning_rate": 4.7018970189701905e-06, | |
| "loss": 0.8768, | |
| "mean_token_accuracy": 0.7322383522987366, | |
| "num_tokens": 6357421.0, | |
| "step": 474 | |
| }, | |
| { | |
| "entropy": 0.8650723695755005, | |
| "epoch": 1.1585365853658536, | |
| "grad_norm": 0.18967200815677643, | |
| "learning_rate": 4.688346883468835e-06, | |
| "loss": 0.8619, | |
| "mean_token_accuracy": 0.731358528137207, | |
| "num_tokens": 6371143.0, | |
| "step": 475 | |
| }, | |
| { | |
| "entropy": 0.8843879699707031, | |
| "epoch": 1.1609756097560975, | |
| "grad_norm": 0.1760745793581009, | |
| "learning_rate": 4.67479674796748e-06, | |
| "loss": 0.8785, | |
| "mean_token_accuracy": 0.7255582213401794, | |
| "num_tokens": 6384415.0, | |
| "step": 476 | |
| }, | |
| { | |
| "entropy": 0.8725862503051758, | |
| "epoch": 1.1634146341463414, | |
| "grad_norm": 0.18959973752498627, | |
| "learning_rate": 4.661246612466125e-06, | |
| "loss": 0.8468, | |
| "mean_token_accuracy": 0.732191801071167, | |
| "num_tokens": 6397571.0, | |
| "step": 477 | |
| }, | |
| { | |
| "entropy": 0.860714316368103, | |
| "epoch": 1.1658536585365853, | |
| "grad_norm": 0.1788821965456009, | |
| "learning_rate": 4.64769647696477e-06, | |
| "loss": 0.8572, | |
| "mean_token_accuracy": 0.7313535809516907, | |
| "num_tokens": 6410619.0, | |
| "step": 478 | |
| }, | |
| { | |
| "entropy": 0.8556495904922485, | |
| "epoch": 1.1682926829268292, | |
| "grad_norm": 0.19264046847820282, | |
| "learning_rate": 4.634146341463416e-06, | |
| "loss": 0.8415, | |
| "mean_token_accuracy": 0.7346753478050232, | |
| "num_tokens": 6423849.0, | |
| "step": 479 | |
| }, | |
| { | |
| "entropy": 0.879152238368988, | |
| "epoch": 1.170731707317073, | |
| "grad_norm": 0.17785273492336273, | |
| "learning_rate": 4.62059620596206e-06, | |
| "loss": 0.8609, | |
| "mean_token_accuracy": 0.733600378036499, | |
| "num_tokens": 6437097.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 0.8685513734817505, | |
| "epoch": 1.173170731707317, | |
| "grad_norm": 0.1842828094959259, | |
| "learning_rate": 4.607046070460705e-06, | |
| "loss": 0.8557, | |
| "mean_token_accuracy": 0.7308443784713745, | |
| "num_tokens": 6450425.0, | |
| "step": 481 | |
| }, | |
| { | |
| "entropy": 0.8665934801101685, | |
| "epoch": 1.175609756097561, | |
| "grad_norm": 0.18133185803890228, | |
| "learning_rate": 4.59349593495935e-06, | |
| "loss": 0.8542, | |
| "mean_token_accuracy": 0.7300595045089722, | |
| "num_tokens": 6463555.0, | |
| "step": 482 | |
| }, | |
| { | |
| "entropy": 0.8803141117095947, | |
| "epoch": 1.1780487804878048, | |
| "grad_norm": 0.1882920265197754, | |
| "learning_rate": 4.579945799457995e-06, | |
| "loss": 0.8695, | |
| "mean_token_accuracy": 0.7308064699172974, | |
| "num_tokens": 6477000.0, | |
| "step": 483 | |
| }, | |
| { | |
| "entropy": 0.8705790042877197, | |
| "epoch": 1.1804878048780487, | |
| "grad_norm": 0.16724060475826263, | |
| "learning_rate": 4.56639566395664e-06, | |
| "loss": 0.8696, | |
| "mean_token_accuracy": 0.7313664555549622, | |
| "num_tokens": 6490540.0, | |
| "step": 484 | |
| }, | |
| { | |
| "entropy": 0.8668768405914307, | |
| "epoch": 1.1829268292682926, | |
| "grad_norm": 0.18207673728466034, | |
| "learning_rate": 4.552845528455285e-06, | |
| "loss": 0.8706, | |
| "mean_token_accuracy": 0.7298742532730103, | |
| "num_tokens": 6504394.0, | |
| "step": 485 | |
| }, | |
| { | |
| "entropy": 0.857469916343689, | |
| "epoch": 1.1853658536585365, | |
| "grad_norm": 0.17468515038490295, | |
| "learning_rate": 4.53929539295393e-06, | |
| "loss": 0.8595, | |
| "mean_token_accuracy": 0.7317895293235779, | |
| "num_tokens": 6518358.0, | |
| "step": 486 | |
| }, | |
| { | |
| "entropy": 0.868085503578186, | |
| "epoch": 1.1878048780487804, | |
| "grad_norm": 0.18118400871753693, | |
| "learning_rate": 4.5257452574525755e-06, | |
| "loss": 0.8822, | |
| "mean_token_accuracy": 0.7288097143173218, | |
| "num_tokens": 6531682.0, | |
| "step": 487 | |
| }, | |
| { | |
| "entropy": 0.875089704990387, | |
| "epoch": 1.1902439024390243, | |
| "grad_norm": 0.19479995965957642, | |
| "learning_rate": 4.51219512195122e-06, | |
| "loss": 0.898, | |
| "mean_token_accuracy": 0.7220537066459656, | |
| "num_tokens": 6545215.0, | |
| "step": 488 | |
| }, | |
| { | |
| "entropy": 0.8687515258789062, | |
| "epoch": 1.1926829268292682, | |
| "grad_norm": 0.18653246760368347, | |
| "learning_rate": 4.498644986449865e-06, | |
| "loss": 0.8582, | |
| "mean_token_accuracy": 0.7328128814697266, | |
| "num_tokens": 6558424.0, | |
| "step": 489 | |
| }, | |
| { | |
| "entropy": 0.8572927713394165, | |
| "epoch": 1.1951219512195121, | |
| "grad_norm": 0.17981292307376862, | |
| "learning_rate": 4.485094850948509e-06, | |
| "loss": 0.8593, | |
| "mean_token_accuracy": 0.7302917242050171, | |
| "num_tokens": 6571810.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 0.8861751556396484, | |
| "epoch": 1.197560975609756, | |
| "grad_norm": 0.1817339062690735, | |
| "learning_rate": 4.471544715447155e-06, | |
| "loss": 0.8928, | |
| "mean_token_accuracy": 0.7191566824913025, | |
| "num_tokens": 6584965.0, | |
| "step": 491 | |
| }, | |
| { | |
| "entropy": 0.8445186614990234, | |
| "epoch": 1.2, | |
| "grad_norm": 0.17858710885047913, | |
| "learning_rate": 4.4579945799458e-06, | |
| "loss": 0.8465, | |
| "mean_token_accuracy": 0.7365540266036987, | |
| "num_tokens": 6598684.0, | |
| "step": 492 | |
| }, | |
| { | |
| "entropy": 0.8746671676635742, | |
| "epoch": 1.2024390243902439, | |
| "grad_norm": 0.17243576049804688, | |
| "learning_rate": 4.444444444444444e-06, | |
| "loss": 0.8859, | |
| "mean_token_accuracy": 0.7267000079154968, | |
| "num_tokens": 6612509.0, | |
| "step": 493 | |
| }, | |
| { | |
| "entropy": 0.8706621527671814, | |
| "epoch": 1.2048780487804878, | |
| "grad_norm": 0.19680029153823853, | |
| "learning_rate": 4.43089430894309e-06, | |
| "loss": 0.8837, | |
| "mean_token_accuracy": 0.7250975370407104, | |
| "num_tokens": 6626108.0, | |
| "step": 494 | |
| }, | |
| { | |
| "entropy": 0.8592489957809448, | |
| "epoch": 1.2073170731707317, | |
| "grad_norm": 0.17318998277187347, | |
| "learning_rate": 4.4173441734417345e-06, | |
| "loss": 0.8403, | |
| "mean_token_accuracy": 0.7346216440200806, | |
| "num_tokens": 6639682.0, | |
| "step": 495 | |
| }, | |
| { | |
| "entropy": 0.8765473365783691, | |
| "epoch": 1.2097560975609756, | |
| "grad_norm": 0.19630788266658783, | |
| "learning_rate": 4.40379403794038e-06, | |
| "loss": 0.8858, | |
| "mean_token_accuracy": 0.7274890542030334, | |
| "num_tokens": 6652725.0, | |
| "step": 496 | |
| }, | |
| { | |
| "entropy": 0.8659340143203735, | |
| "epoch": 1.2121951219512195, | |
| "grad_norm": 0.18291766941547394, | |
| "learning_rate": 4.390243902439025e-06, | |
| "loss": 0.853, | |
| "mean_token_accuracy": 0.7339065670967102, | |
| "num_tokens": 6666116.0, | |
| "step": 497 | |
| }, | |
| { | |
| "entropy": 0.8639433979988098, | |
| "epoch": 1.2146341463414634, | |
| "grad_norm": 0.19510066509246826, | |
| "learning_rate": 4.376693766937669e-06, | |
| "loss": 0.8537, | |
| "mean_token_accuracy": 0.7323106527328491, | |
| "num_tokens": 6679756.0, | |
| "step": 498 | |
| }, | |
| { | |
| "entropy": 0.8815720081329346, | |
| "epoch": 1.2170731707317073, | |
| "grad_norm": 0.1966511309146881, | |
| "learning_rate": 4.3631436314363145e-06, | |
| "loss": 0.8854, | |
| "mean_token_accuracy": 0.7242141962051392, | |
| "num_tokens": 6692880.0, | |
| "step": 499 | |
| }, | |
| { | |
| "entropy": 0.8695896863937378, | |
| "epoch": 1.2195121951219512, | |
| "grad_norm": 0.17670577764511108, | |
| "learning_rate": 4.34959349593496e-06, | |
| "loss": 0.8709, | |
| "mean_token_accuracy": 0.731483519077301, | |
| "num_tokens": 6706519.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 0.8815171718597412, | |
| "epoch": 1.221951219512195, | |
| "grad_norm": 0.18315380811691284, | |
| "learning_rate": 4.336043360433605e-06, | |
| "loss": 0.8811, | |
| "mean_token_accuracy": 0.7204508185386658, | |
| "num_tokens": 6720021.0, | |
| "step": 501 | |
| }, | |
| { | |
| "entropy": 0.8691625595092773, | |
| "epoch": 1.224390243902439, | |
| "grad_norm": 0.18377022445201874, | |
| "learning_rate": 4.32249322493225e-06, | |
| "loss": 0.8559, | |
| "mean_token_accuracy": 0.7272188067436218, | |
| "num_tokens": 6733524.0, | |
| "step": 502 | |
| }, | |
| { | |
| "entropy": 0.8703157305717468, | |
| "epoch": 1.226829268292683, | |
| "grad_norm": 0.19667857885360718, | |
| "learning_rate": 4.308943089430894e-06, | |
| "loss": 0.8677, | |
| "mean_token_accuracy": 0.7263264060020447, | |
| "num_tokens": 6746413.0, | |
| "step": 503 | |
| }, | |
| { | |
| "entropy": 0.9045153856277466, | |
| "epoch": 1.2292682926829268, | |
| "grad_norm": 0.18945592641830444, | |
| "learning_rate": 4.29539295392954e-06, | |
| "loss": 0.9142, | |
| "mean_token_accuracy": 0.7132720947265625, | |
| "num_tokens": 6759818.0, | |
| "step": 504 | |
| }, | |
| { | |
| "entropy": 0.8753666281700134, | |
| "epoch": 1.2317073170731707, | |
| "grad_norm": 0.18175500631332397, | |
| "learning_rate": 4.281842818428185e-06, | |
| "loss": 0.8755, | |
| "mean_token_accuracy": 0.728762686252594, | |
| "num_tokens": 6773501.0, | |
| "step": 505 | |
| }, | |
| { | |
| "entropy": 0.876529335975647, | |
| "epoch": 1.2341463414634146, | |
| "grad_norm": 0.17408494651317596, | |
| "learning_rate": 4.268292682926829e-06, | |
| "loss": 0.878, | |
| "mean_token_accuracy": 0.7268484234809875, | |
| "num_tokens": 6787015.0, | |
| "step": 506 | |
| }, | |
| { | |
| "entropy": 0.8460504412651062, | |
| "epoch": 1.2365853658536585, | |
| "grad_norm": 0.1703876405954361, | |
| "learning_rate": 4.254742547425474e-06, | |
| "loss": 0.8404, | |
| "mean_token_accuracy": 0.7368658781051636, | |
| "num_tokens": 6800317.0, | |
| "step": 507 | |
| }, | |
| { | |
| "entropy": 0.887944757938385, | |
| "epoch": 1.2390243902439024, | |
| "grad_norm": 0.1907789558172226, | |
| "learning_rate": 4.2411924119241196e-06, | |
| "loss": 0.8899, | |
| "mean_token_accuracy": 0.7258834838867188, | |
| "num_tokens": 6813944.0, | |
| "step": 508 | |
| }, | |
| { | |
| "entropy": 0.8727298974990845, | |
| "epoch": 1.2414634146341463, | |
| "grad_norm": 0.20074300467967987, | |
| "learning_rate": 4.227642276422765e-06, | |
| "loss": 0.8858, | |
| "mean_token_accuracy": 0.7224164605140686, | |
| "num_tokens": 6827401.0, | |
| "step": 509 | |
| }, | |
| { | |
| "entropy": 0.8581738471984863, | |
| "epoch": 1.2439024390243902, | |
| "grad_norm": 0.18092957139015198, | |
| "learning_rate": 4.21409214092141e-06, | |
| "loss": 0.8584, | |
| "mean_token_accuracy": 0.7286903262138367, | |
| "num_tokens": 6840756.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 0.8607147932052612, | |
| "epoch": 1.2463414634146341, | |
| "grad_norm": 0.17750075459480286, | |
| "learning_rate": 4.200542005420054e-06, | |
| "loss": 0.873, | |
| "mean_token_accuracy": 0.7288525700569153, | |
| "num_tokens": 6854237.0, | |
| "step": 511 | |
| }, | |
| { | |
| "entropy": 0.879986584186554, | |
| "epoch": 1.248780487804878, | |
| "grad_norm": 0.17938187718391418, | |
| "learning_rate": 4.1869918699186995e-06, | |
| "loss": 0.8704, | |
| "mean_token_accuracy": 0.7252417206764221, | |
| "num_tokens": 6867905.0, | |
| "step": 512 | |
| }, | |
| { | |
| "entropy": 0.8603850603103638, | |
| "epoch": 1.251219512195122, | |
| "grad_norm": 0.1875443160533905, | |
| "learning_rate": 4.173441734417345e-06, | |
| "loss": 0.8487, | |
| "mean_token_accuracy": 0.7376420497894287, | |
| "num_tokens": 6881738.0, | |
| "step": 513 | |
| }, | |
| { | |
| "entropy": 0.8875347375869751, | |
| "epoch": 1.2536585365853659, | |
| "grad_norm": 0.1712435483932495, | |
| "learning_rate": 4.159891598915989e-06, | |
| "loss": 0.8811, | |
| "mean_token_accuracy": 0.7265061140060425, | |
| "num_tokens": 6894917.0, | |
| "step": 514 | |
| }, | |
| { | |
| "entropy": 0.8665733337402344, | |
| "epoch": 1.2560975609756098, | |
| "grad_norm": 0.19203098118305206, | |
| "learning_rate": 4.146341463414634e-06, | |
| "loss": 0.862, | |
| "mean_token_accuracy": 0.734067440032959, | |
| "num_tokens": 6908192.0, | |
| "step": 515 | |
| }, | |
| { | |
| "entropy": 0.8782904148101807, | |
| "epoch": 1.2585365853658537, | |
| "grad_norm": 0.18738849461078644, | |
| "learning_rate": 4.1327913279132794e-06, | |
| "loss": 0.8662, | |
| "mean_token_accuracy": 0.7297396659851074, | |
| "num_tokens": 6921769.0, | |
| "step": 516 | |
| }, | |
| { | |
| "entropy": 0.8696860074996948, | |
| "epoch": 1.2609756097560976, | |
| "grad_norm": 0.18507178127765656, | |
| "learning_rate": 4.119241192411925e-06, | |
| "loss": 0.8569, | |
| "mean_token_accuracy": 0.7358604073524475, | |
| "num_tokens": 6935081.0, | |
| "step": 517 | |
| }, | |
| { | |
| "entropy": 0.853559136390686, | |
| "epoch": 1.2634146341463415, | |
| "grad_norm": 0.1817474067211151, | |
| "learning_rate": 4.10569105691057e-06, | |
| "loss": 0.8708, | |
| "mean_token_accuracy": 0.7304454445838928, | |
| "num_tokens": 6948994.0, | |
| "step": 518 | |
| }, | |
| { | |
| "entropy": 0.8644067049026489, | |
| "epoch": 1.2658536585365854, | |
| "grad_norm": 0.18193352222442627, | |
| "learning_rate": 4.092140921409214e-06, | |
| "loss": 0.8687, | |
| "mean_token_accuracy": 0.7295045256614685, | |
| "num_tokens": 6962452.0, | |
| "step": 519 | |
| }, | |
| { | |
| "entropy": 0.8609942197799683, | |
| "epoch": 1.2682926829268293, | |
| "grad_norm": 0.18788494169712067, | |
| "learning_rate": 4.078590785907859e-06, | |
| "loss": 0.8493, | |
| "mean_token_accuracy": 0.729697048664093, | |
| "num_tokens": 6975705.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 0.8733319044113159, | |
| "epoch": 1.2707317073170732, | |
| "grad_norm": 0.17995619773864746, | |
| "learning_rate": 4.0650406504065046e-06, | |
| "loss": 0.8664, | |
| "mean_token_accuracy": 0.7323063015937805, | |
| "num_tokens": 6988833.0, | |
| "step": 521 | |
| }, | |
| { | |
| "entropy": 0.8484479188919067, | |
| "epoch": 1.273170731707317, | |
| "grad_norm": 0.1766081154346466, | |
| "learning_rate": 4.051490514905149e-06, | |
| "loss": 0.8423, | |
| "mean_token_accuracy": 0.7349044680595398, | |
| "num_tokens": 7002512.0, | |
| "step": 522 | |
| }, | |
| { | |
| "entropy": 0.8707907795906067, | |
| "epoch": 1.275609756097561, | |
| "grad_norm": 0.1928197741508484, | |
| "learning_rate": 4.037940379403794e-06, | |
| "loss": 0.8637, | |
| "mean_token_accuracy": 0.7341483235359192, | |
| "num_tokens": 7016107.0, | |
| "step": 523 | |
| }, | |
| { | |
| "entropy": 0.8589579463005066, | |
| "epoch": 1.278048780487805, | |
| "grad_norm": 0.17874617874622345, | |
| "learning_rate": 4.024390243902439e-06, | |
| "loss": 0.8523, | |
| "mean_token_accuracy": 0.7354934811592102, | |
| "num_tokens": 7029548.0, | |
| "step": 524 | |
| }, | |
| { | |
| "entropy": 0.868780255317688, | |
| "epoch": 1.2804878048780488, | |
| "grad_norm": 0.17817656695842743, | |
| "learning_rate": 4.0108401084010845e-06, | |
| "loss": 0.8679, | |
| "mean_token_accuracy": 0.7251309156417847, | |
| "num_tokens": 7043316.0, | |
| "step": 525 | |
| }, | |
| { | |
| "entropy": 0.8748735189437866, | |
| "epoch": 1.2829268292682927, | |
| "grad_norm": 0.17905448377132416, | |
| "learning_rate": 3.99728997289973e-06, | |
| "loss": 0.8801, | |
| "mean_token_accuracy": 0.7233904600143433, | |
| "num_tokens": 7057218.0, | |
| "step": 526 | |
| }, | |
| { | |
| "entropy": 0.8642637729644775, | |
| "epoch": 1.2853658536585366, | |
| "grad_norm": 0.1892337054014206, | |
| "learning_rate": 3.983739837398374e-06, | |
| "loss": 0.8672, | |
| "mean_token_accuracy": 0.7301107048988342, | |
| "num_tokens": 7070784.0, | |
| "step": 527 | |
| }, | |
| { | |
| "entropy": 0.8635598421096802, | |
| "epoch": 1.2878048780487805, | |
| "grad_norm": 0.1739298403263092, | |
| "learning_rate": 3.970189701897019e-06, | |
| "loss": 0.8588, | |
| "mean_token_accuracy": 0.729408323764801, | |
| "num_tokens": 7084422.0, | |
| "step": 528 | |
| }, | |
| { | |
| "entropy": 0.8527634739875793, | |
| "epoch": 1.2902439024390244, | |
| "grad_norm": 0.1835845410823822, | |
| "learning_rate": 3.9566395663956644e-06, | |
| "loss": 0.8617, | |
| "mean_token_accuracy": 0.726246178150177, | |
| "num_tokens": 7097899.0, | |
| "step": 529 | |
| }, | |
| { | |
| "entropy": 0.8675320148468018, | |
| "epoch": 1.2926829268292683, | |
| "grad_norm": 0.18817897140979767, | |
| "learning_rate": 3.943089430894309e-06, | |
| "loss": 0.8732, | |
| "mean_token_accuracy": 0.7264676690101624, | |
| "num_tokens": 7111014.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 0.8717451095581055, | |
| "epoch": 1.2951219512195122, | |
| "grad_norm": 0.18769040703773499, | |
| "learning_rate": 3.929539295392954e-06, | |
| "loss": 0.8794, | |
| "mean_token_accuracy": 0.7313988208770752, | |
| "num_tokens": 7124470.0, | |
| "step": 531 | |
| }, | |
| { | |
| "entropy": 0.8724467754364014, | |
| "epoch": 1.2975609756097561, | |
| "grad_norm": 0.19329647719860077, | |
| "learning_rate": 3.915989159891599e-06, | |
| "loss": 0.8889, | |
| "mean_token_accuracy": 0.7284098863601685, | |
| "num_tokens": 7137837.0, | |
| "step": 532 | |
| }, | |
| { | |
| "entropy": 0.8455716967582703, | |
| "epoch": 1.3, | |
| "grad_norm": 0.18541646003723145, | |
| "learning_rate": 3.902439024390244e-06, | |
| "loss": 0.8288, | |
| "mean_token_accuracy": 0.7398167252540588, | |
| "num_tokens": 7150840.0, | |
| "step": 533 | |
| }, | |
| { | |
| "entropy": 0.854907751083374, | |
| "epoch": 1.302439024390244, | |
| "grad_norm": 0.18639497458934784, | |
| "learning_rate": 3.88888888888889e-06, | |
| "loss": 0.8579, | |
| "mean_token_accuracy": 0.7294135093688965, | |
| "num_tokens": 7164275.0, | |
| "step": 534 | |
| }, | |
| { | |
| "entropy": 0.8669297695159912, | |
| "epoch": 1.3048780487804879, | |
| "grad_norm": 0.20313623547554016, | |
| "learning_rate": 3.875338753387534e-06, | |
| "loss": 0.8625, | |
| "mean_token_accuracy": 0.7300493121147156, | |
| "num_tokens": 7178075.0, | |
| "step": 535 | |
| }, | |
| { | |
| "entropy": 0.8517297506332397, | |
| "epoch": 1.3073170731707318, | |
| "grad_norm": 0.19427485764026642, | |
| "learning_rate": 3.861788617886179e-06, | |
| "loss": 0.8439, | |
| "mean_token_accuracy": 0.7385932207107544, | |
| "num_tokens": 7191526.0, | |
| "step": 536 | |
| }, | |
| { | |
| "entropy": 0.8521525859832764, | |
| "epoch": 1.3097560975609757, | |
| "grad_norm": 0.1958754062652588, | |
| "learning_rate": 3.848238482384824e-06, | |
| "loss": 0.8523, | |
| "mean_token_accuracy": 0.7323172688484192, | |
| "num_tokens": 7205058.0, | |
| "step": 537 | |
| }, | |
| { | |
| "entropy": 0.8587372303009033, | |
| "epoch": 1.3121951219512196, | |
| "grad_norm": 0.1967170685529709, | |
| "learning_rate": 3.834688346883469e-06, | |
| "loss": 0.8648, | |
| "mean_token_accuracy": 0.7314472198486328, | |
| "num_tokens": 7218576.0, | |
| "step": 538 | |
| }, | |
| { | |
| "entropy": 0.8489270210266113, | |
| "epoch": 1.3146341463414635, | |
| "grad_norm": 0.20891073346138, | |
| "learning_rate": 3.821138211382115e-06, | |
| "loss": 0.8588, | |
| "mean_token_accuracy": 0.7309644818305969, | |
| "num_tokens": 7231594.0, | |
| "step": 539 | |
| }, | |
| { | |
| "entropy": 0.8510292768478394, | |
| "epoch": 1.3170731707317074, | |
| "grad_norm": 0.17983919382095337, | |
| "learning_rate": 3.8075880758807595e-06, | |
| "loss": 0.8438, | |
| "mean_token_accuracy": 0.7355894446372986, | |
| "num_tokens": 7245055.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 0.8718546032905579, | |
| "epoch": 1.3195121951219513, | |
| "grad_norm": 0.18964819610118866, | |
| "learning_rate": 3.7940379403794043e-06, | |
| "loss": 0.8706, | |
| "mean_token_accuracy": 0.7269119620323181, | |
| "num_tokens": 7258931.0, | |
| "step": 541 | |
| }, | |
| { | |
| "entropy": 0.8766772150993347, | |
| "epoch": 1.3219512195121952, | |
| "grad_norm": 0.17909395694732666, | |
| "learning_rate": 3.780487804878049e-06, | |
| "loss": 0.8769, | |
| "mean_token_accuracy": 0.7309192419052124, | |
| "num_tokens": 7272534.0, | |
| "step": 542 | |
| }, | |
| { | |
| "entropy": 0.8771216869354248, | |
| "epoch": 1.324390243902439, | |
| "grad_norm": 0.18655753135681152, | |
| "learning_rate": 3.7669376693766942e-06, | |
| "loss": 0.8908, | |
| "mean_token_accuracy": 0.7244673371315002, | |
| "num_tokens": 7285739.0, | |
| "step": 543 | |
| }, | |
| { | |
| "entropy": 0.8514188528060913, | |
| "epoch": 1.326829268292683, | |
| "grad_norm": 0.1860886812210083, | |
| "learning_rate": 3.753387533875339e-06, | |
| "loss": 0.8579, | |
| "mean_token_accuracy": 0.7302050590515137, | |
| "num_tokens": 7298776.0, | |
| "step": 544 | |
| }, | |
| { | |
| "entropy": 0.8441017866134644, | |
| "epoch": 1.329268292682927, | |
| "grad_norm": 0.187427818775177, | |
| "learning_rate": 3.7398373983739838e-06, | |
| "loss": 0.8512, | |
| "mean_token_accuracy": 0.7347075343132019, | |
| "num_tokens": 7312230.0, | |
| "step": 545 | |
| }, | |
| { | |
| "entropy": 0.8616207838058472, | |
| "epoch": 1.3317073170731708, | |
| "grad_norm": 0.18081805109977722, | |
| "learning_rate": 3.7262872628726286e-06, | |
| "loss": 0.8603, | |
| "mean_token_accuracy": 0.7315198183059692, | |
| "num_tokens": 7325774.0, | |
| "step": 546 | |
| }, | |
| { | |
| "entropy": 0.8618036508560181, | |
| "epoch": 1.3341463414634147, | |
| "grad_norm": 0.20267686247825623, | |
| "learning_rate": 3.712737127371274e-06, | |
| "loss": 0.862, | |
| "mean_token_accuracy": 0.7296164035797119, | |
| "num_tokens": 7338668.0, | |
| "step": 547 | |
| }, | |
| { | |
| "entropy": 0.8625529408454895, | |
| "epoch": 1.3365853658536586, | |
| "grad_norm": 0.19352561235427856, | |
| "learning_rate": 3.699186991869919e-06, | |
| "loss": 0.8553, | |
| "mean_token_accuracy": 0.732282280921936, | |
| "num_tokens": 7352131.0, | |
| "step": 548 | |
| }, | |
| { | |
| "entropy": 0.868601381778717, | |
| "epoch": 1.3390243902439025, | |
| "grad_norm": 0.1874302625656128, | |
| "learning_rate": 3.685636856368564e-06, | |
| "loss": 0.8714, | |
| "mean_token_accuracy": 0.7254257798194885, | |
| "num_tokens": 7365535.0, | |
| "step": 549 | |
| }, | |
| { | |
| "entropy": 0.8333048820495605, | |
| "epoch": 1.3414634146341464, | |
| "grad_norm": 0.1842752993106842, | |
| "learning_rate": 3.672086720867209e-06, | |
| "loss": 0.8236, | |
| "mean_token_accuracy": 0.7369009256362915, | |
| "num_tokens": 7378968.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 0.8596416115760803, | |
| "epoch": 1.34390243902439, | |
| "grad_norm": 0.19583648443222046, | |
| "learning_rate": 3.6585365853658537e-06, | |
| "loss": 0.8421, | |
| "mean_token_accuracy": 0.7383792996406555, | |
| "num_tokens": 7391892.0, | |
| "step": 551 | |
| }, | |
| { | |
| "entropy": 0.8696916103363037, | |
| "epoch": 1.346341463414634, | |
| "grad_norm": 0.19787564873695374, | |
| "learning_rate": 3.644986449864499e-06, | |
| "loss": 0.8675, | |
| "mean_token_accuracy": 0.724095344543457, | |
| "num_tokens": 7404869.0, | |
| "step": 552 | |
| }, | |
| { | |
| "entropy": 0.8838014602661133, | |
| "epoch": 1.348780487804878, | |
| "grad_norm": 0.19168251752853394, | |
| "learning_rate": 3.6314363143631437e-06, | |
| "loss": 0.8767, | |
| "mean_token_accuracy": 0.7258371114730835, | |
| "num_tokens": 7418563.0, | |
| "step": 553 | |
| }, | |
| { | |
| "entropy": 0.8391138315200806, | |
| "epoch": 1.3512195121951218, | |
| "grad_norm": 0.1764480471611023, | |
| "learning_rate": 3.6178861788617893e-06, | |
| "loss": 0.8354, | |
| "mean_token_accuracy": 0.7345172762870789, | |
| "num_tokens": 7431755.0, | |
| "step": 554 | |
| }, | |
| { | |
| "entropy": 0.8448973894119263, | |
| "epoch": 1.3536585365853657, | |
| "grad_norm": 0.19826233386993408, | |
| "learning_rate": 3.604336043360434e-06, | |
| "loss": 0.8473, | |
| "mean_token_accuracy": 0.7349461317062378, | |
| "num_tokens": 7445040.0, | |
| "step": 555 | |
| }, | |
| { | |
| "entropy": 0.8632727861404419, | |
| "epoch": 1.3560975609756096, | |
| "grad_norm": 0.19437728822231293, | |
| "learning_rate": 3.590785907859079e-06, | |
| "loss": 0.8647, | |
| "mean_token_accuracy": 0.7322266101837158, | |
| "num_tokens": 7458489.0, | |
| "step": 556 | |
| }, | |
| { | |
| "entropy": 0.8689159154891968, | |
| "epoch": 1.3585365853658535, | |
| "grad_norm": 0.19678860902786255, | |
| "learning_rate": 3.577235772357724e-06, | |
| "loss": 0.8827, | |
| "mean_token_accuracy": 0.7263685464859009, | |
| "num_tokens": 7471676.0, | |
| "step": 557 | |
| }, | |
| { | |
| "entropy": 0.8646066188812256, | |
| "epoch": 1.3609756097560974, | |
| "grad_norm": 0.1897372454404831, | |
| "learning_rate": 3.563685636856369e-06, | |
| "loss": 0.8534, | |
| "mean_token_accuracy": 0.732787013053894, | |
| "num_tokens": 7484749.0, | |
| "step": 558 | |
| }, | |
| { | |
| "entropy": 0.8650884628295898, | |
| "epoch": 1.3634146341463413, | |
| "grad_norm": 0.1903863549232483, | |
| "learning_rate": 3.5501355013550136e-06, | |
| "loss": 0.8616, | |
| "mean_token_accuracy": 0.7318161725997925, | |
| "num_tokens": 7498431.0, | |
| "step": 559 | |
| }, | |
| { | |
| "entropy": 0.8552368879318237, | |
| "epoch": 1.3658536585365852, | |
| "grad_norm": 0.19023962318897247, | |
| "learning_rate": 3.5365853658536588e-06, | |
| "loss": 0.8501, | |
| "mean_token_accuracy": 0.729788601398468, | |
| "num_tokens": 7512214.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 0.8545181751251221, | |
| "epoch": 1.3682926829268292, | |
| "grad_norm": 0.18914692103862762, | |
| "learning_rate": 3.5230352303523035e-06, | |
| "loss": 0.8479, | |
| "mean_token_accuracy": 0.7299030423164368, | |
| "num_tokens": 7525951.0, | |
| "step": 561 | |
| }, | |
| { | |
| "entropy": 0.871481716632843, | |
| "epoch": 1.370731707317073, | |
| "grad_norm": 0.21258091926574707, | |
| "learning_rate": 3.509485094850949e-06, | |
| "loss": 0.8593, | |
| "mean_token_accuracy": 0.7324293851852417, | |
| "num_tokens": 7539242.0, | |
| "step": 562 | |
| }, | |
| { | |
| "entropy": 0.8490629196166992, | |
| "epoch": 1.373170731707317, | |
| "grad_norm": 0.20024360716342926, | |
| "learning_rate": 3.495934959349594e-06, | |
| "loss": 0.8496, | |
| "mean_token_accuracy": 0.7306812405586243, | |
| "num_tokens": 7552807.0, | |
| "step": 563 | |
| }, | |
| { | |
| "entropy": 0.8514649271965027, | |
| "epoch": 1.3756097560975609, | |
| "grad_norm": 0.17793771624565125, | |
| "learning_rate": 3.4823848238482387e-06, | |
| "loss": 0.8587, | |
| "mean_token_accuracy": 0.7358647584915161, | |
| "num_tokens": 7566017.0, | |
| "step": 564 | |
| }, | |
| { | |
| "entropy": 0.8559709787368774, | |
| "epoch": 1.3780487804878048, | |
| "grad_norm": 0.18806791305541992, | |
| "learning_rate": 3.468834688346884e-06, | |
| "loss": 0.8437, | |
| "mean_token_accuracy": 0.7373141050338745, | |
| "num_tokens": 7579079.0, | |
| "step": 565 | |
| }, | |
| { | |
| "entropy": 0.8687812089920044, | |
| "epoch": 1.3804878048780487, | |
| "grad_norm": 0.1876194328069687, | |
| "learning_rate": 3.4552845528455287e-06, | |
| "loss": 0.8727, | |
| "mean_token_accuracy": 0.7246053218841553, | |
| "num_tokens": 7592523.0, | |
| "step": 566 | |
| }, | |
| { | |
| "entropy": 0.8511624336242676, | |
| "epoch": 1.3829268292682926, | |
| "grad_norm": 0.18997825682163239, | |
| "learning_rate": 3.4417344173441734e-06, | |
| "loss": 0.8521, | |
| "mean_token_accuracy": 0.7291620373725891, | |
| "num_tokens": 7606012.0, | |
| "step": 567 | |
| }, | |
| { | |
| "entropy": 0.8713839054107666, | |
| "epoch": 1.3853658536585365, | |
| "grad_norm": 0.19520047307014465, | |
| "learning_rate": 3.4281842818428186e-06, | |
| "loss": 0.8737, | |
| "mean_token_accuracy": 0.7267184853553772, | |
| "num_tokens": 7619150.0, | |
| "step": 568 | |
| }, | |
| { | |
| "entropy": 0.8599538803100586, | |
| "epoch": 1.3878048780487804, | |
| "grad_norm": 0.20235277712345123, | |
| "learning_rate": 3.414634146341464e-06, | |
| "loss": 0.8757, | |
| "mean_token_accuracy": 0.7303602695465088, | |
| "num_tokens": 7632239.0, | |
| "step": 569 | |
| }, | |
| { | |
| "entropy": 0.8565975427627563, | |
| "epoch": 1.3902439024390243, | |
| "grad_norm": 0.1819470226764679, | |
| "learning_rate": 3.401084010840109e-06, | |
| "loss": 0.865, | |
| "mean_token_accuracy": 0.729332447052002, | |
| "num_tokens": 7645452.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 0.8241442441940308, | |
| "epoch": 1.3926829268292682, | |
| "grad_norm": 0.1833989918231964, | |
| "learning_rate": 3.387533875338754e-06, | |
| "loss": 0.8213, | |
| "mean_token_accuracy": 0.7422797679901123, | |
| "num_tokens": 7658680.0, | |
| "step": 571 | |
| }, | |
| { | |
| "entropy": 0.8508949279785156, | |
| "epoch": 1.395121951219512, | |
| "grad_norm": 0.18061420321464539, | |
| "learning_rate": 3.3739837398373986e-06, | |
| "loss": 0.8511, | |
| "mean_token_accuracy": 0.735736608505249, | |
| "num_tokens": 7672122.0, | |
| "step": 572 | |
| }, | |
| { | |
| "entropy": 0.8487075567245483, | |
| "epoch": 1.397560975609756, | |
| "grad_norm": 0.186850905418396, | |
| "learning_rate": 3.3604336043360438e-06, | |
| "loss": 0.8382, | |
| "mean_token_accuracy": 0.738534152507782, | |
| "num_tokens": 7685482.0, | |
| "step": 573 | |
| }, | |
| { | |
| "entropy": 0.869383692741394, | |
| "epoch": 1.4, | |
| "grad_norm": 0.1888049691915512, | |
| "learning_rate": 3.3468834688346886e-06, | |
| "loss": 0.8702, | |
| "mean_token_accuracy": 0.7279847860336304, | |
| "num_tokens": 7698648.0, | |
| "step": 574 | |
| }, | |
| { | |
| "entropy": 0.8390681147575378, | |
| "epoch": 1.4024390243902438, | |
| "grad_norm": 0.17867664992809296, | |
| "learning_rate": 3.3333333333333333e-06, | |
| "loss": 0.8283, | |
| "mean_token_accuracy": 0.7399199604988098, | |
| "num_tokens": 7711660.0, | |
| "step": 575 | |
| }, | |
| { | |
| "entropy": 0.8469206094741821, | |
| "epoch": 1.4048780487804877, | |
| "grad_norm": 0.19395941495895386, | |
| "learning_rate": 3.3197831978319785e-06, | |
| "loss": 0.8485, | |
| "mean_token_accuracy": 0.7336561679840088, | |
| "num_tokens": 7724892.0, | |
| "step": 576 | |
| }, | |
| { | |
| "entropy": 0.8645744919776917, | |
| "epoch": 1.4073170731707316, | |
| "grad_norm": 0.2073330581188202, | |
| "learning_rate": 3.3062330623306237e-06, | |
| "loss": 0.8804, | |
| "mean_token_accuracy": 0.7230904698371887, | |
| "num_tokens": 7738537.0, | |
| "step": 577 | |
| }, | |
| { | |
| "entropy": 0.8457903861999512, | |
| "epoch": 1.4097560975609755, | |
| "grad_norm": 0.19049414992332458, | |
| "learning_rate": 3.292682926829269e-06, | |
| "loss": 0.8494, | |
| "mean_token_accuracy": 0.7300188541412354, | |
| "num_tokens": 7751828.0, | |
| "step": 578 | |
| }, | |
| { | |
| "entropy": 0.8619527816772461, | |
| "epoch": 1.4121951219512194, | |
| "grad_norm": 0.17878854274749756, | |
| "learning_rate": 3.2791327913279137e-06, | |
| "loss": 0.8704, | |
| "mean_token_accuracy": 0.7315168976783752, | |
| "num_tokens": 7765167.0, | |
| "step": 579 | |
| }, | |
| { | |
| "entropy": 0.8565795421600342, | |
| "epoch": 1.4146341463414633, | |
| "grad_norm": 0.19386078417301178, | |
| "learning_rate": 3.2655826558265585e-06, | |
| "loss": 0.8827, | |
| "mean_token_accuracy": 0.7268211841583252, | |
| "num_tokens": 7779075.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 0.8594475984573364, | |
| "epoch": 1.4170731707317072, | |
| "grad_norm": 0.19009767472743988, | |
| "learning_rate": 3.2520325203252037e-06, | |
| "loss": 0.8575, | |
| "mean_token_accuracy": 0.7269622087478638, | |
| "num_tokens": 7792558.0, | |
| "step": 581 | |
| }, | |
| { | |
| "entropy": 0.856437087059021, | |
| "epoch": 1.4195121951219511, | |
| "grad_norm": 0.18176284432411194, | |
| "learning_rate": 3.2384823848238484e-06, | |
| "loss": 0.8519, | |
| "mean_token_accuracy": 0.735020637512207, | |
| "num_tokens": 7806126.0, | |
| "step": 582 | |
| }, | |
| { | |
| "entropy": 0.8499815464019775, | |
| "epoch": 1.421951219512195, | |
| "grad_norm": 0.17889046669006348, | |
| "learning_rate": 3.224932249322493e-06, | |
| "loss": 0.8459, | |
| "mean_token_accuracy": 0.7320988774299622, | |
| "num_tokens": 7819535.0, | |
| "step": 583 | |
| }, | |
| { | |
| "entropy": 0.8566194176673889, | |
| "epoch": 1.424390243902439, | |
| "grad_norm": 0.19046318531036377, | |
| "learning_rate": 3.211382113821139e-06, | |
| "loss": 0.8539, | |
| "mean_token_accuracy": 0.73642498254776, | |
| "num_tokens": 7832295.0, | |
| "step": 584 | |
| }, | |
| { | |
| "entropy": 0.874726414680481, | |
| "epoch": 1.4268292682926829, | |
| "grad_norm": 0.19308649003505707, | |
| "learning_rate": 3.1978319783197836e-06, | |
| "loss": 0.857, | |
| "mean_token_accuracy": 0.7281978130340576, | |
| "num_tokens": 7845578.0, | |
| "step": 585 | |
| }, | |
| { | |
| "entropy": 0.8651847839355469, | |
| "epoch": 1.4292682926829268, | |
| "grad_norm": 0.18000152707099915, | |
| "learning_rate": 3.1842818428184284e-06, | |
| "loss": 0.8575, | |
| "mean_token_accuracy": 0.7298014163970947, | |
| "num_tokens": 7858788.0, | |
| "step": 586 | |
| }, | |
| { | |
| "entropy": 0.8516252636909485, | |
| "epoch": 1.4317073170731707, | |
| "grad_norm": 0.18842175602912903, | |
| "learning_rate": 3.1707317073170736e-06, | |
| "loss": 0.8558, | |
| "mean_token_accuracy": 0.7326483726501465, | |
| "num_tokens": 7871944.0, | |
| "step": 587 | |
| }, | |
| { | |
| "entropy": 0.8462690114974976, | |
| "epoch": 1.4341463414634146, | |
| "grad_norm": 0.1798364222049713, | |
| "learning_rate": 3.1571815718157183e-06, | |
| "loss": 0.8264, | |
| "mean_token_accuracy": 0.7403327226638794, | |
| "num_tokens": 7885304.0, | |
| "step": 588 | |
| }, | |
| { | |
| "entropy": 0.8627457022666931, | |
| "epoch": 1.4365853658536585, | |
| "grad_norm": 0.19561219215393066, | |
| "learning_rate": 3.143631436314363e-06, | |
| "loss": 0.8646, | |
| "mean_token_accuracy": 0.7325738072395325, | |
| "num_tokens": 7898662.0, | |
| "step": 589 | |
| }, | |
| { | |
| "entropy": 0.8492992520332336, | |
| "epoch": 1.4390243902439024, | |
| "grad_norm": 0.18039856851100922, | |
| "learning_rate": 3.1300813008130083e-06, | |
| "loss": 0.8353, | |
| "mean_token_accuracy": 0.7358734607696533, | |
| "num_tokens": 7911827.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 0.8460092544555664, | |
| "epoch": 1.4414634146341463, | |
| "grad_norm": 0.19393689930438995, | |
| "learning_rate": 3.116531165311653e-06, | |
| "loss": 0.8282, | |
| "mean_token_accuracy": 0.7371993064880371, | |
| "num_tokens": 7925104.0, | |
| "step": 591 | |
| }, | |
| { | |
| "entropy": 0.8655027747154236, | |
| "epoch": 1.4439024390243902, | |
| "grad_norm": 0.19649480283260345, | |
| "learning_rate": 3.1029810298102987e-06, | |
| "loss": 0.8843, | |
| "mean_token_accuracy": 0.7273722887039185, | |
| "num_tokens": 7938820.0, | |
| "step": 592 | |
| }, | |
| { | |
| "entropy": 0.8631415963172913, | |
| "epoch": 1.446341463414634, | |
| "grad_norm": 0.19127148389816284, | |
| "learning_rate": 3.0894308943089435e-06, | |
| "loss": 0.8568, | |
| "mean_token_accuracy": 0.7302283644676208, | |
| "num_tokens": 7952062.0, | |
| "step": 593 | |
| }, | |
| { | |
| "entropy": 0.8497236967086792, | |
| "epoch": 1.448780487804878, | |
| "grad_norm": 0.18874233961105347, | |
| "learning_rate": 3.0758807588075882e-06, | |
| "loss": 0.86, | |
| "mean_token_accuracy": 0.7315238118171692, | |
| "num_tokens": 7965636.0, | |
| "step": 594 | |
| }, | |
| { | |
| "entropy": 0.856023907661438, | |
| "epoch": 1.451219512195122, | |
| "grad_norm": 0.18885262310504913, | |
| "learning_rate": 3.0623306233062334e-06, | |
| "loss": 0.8447, | |
| "mean_token_accuracy": 0.7383915185928345, | |
| "num_tokens": 7978832.0, | |
| "step": 595 | |
| }, | |
| { | |
| "entropy": 0.8641533851623535, | |
| "epoch": 1.4536585365853658, | |
| "grad_norm": 0.19485171139240265, | |
| "learning_rate": 3.0487804878048782e-06, | |
| "loss": 0.8548, | |
| "mean_token_accuracy": 0.7297952175140381, | |
| "num_tokens": 7992471.0, | |
| "step": 596 | |
| }, | |
| { | |
| "entropy": 0.8497927188873291, | |
| "epoch": 1.4560975609756097, | |
| "grad_norm": 0.18832214176654816, | |
| "learning_rate": 3.035230352303523e-06, | |
| "loss": 0.8484, | |
| "mean_token_accuracy": 0.735218346118927, | |
| "num_tokens": 8006068.0, | |
| "step": 597 | |
| }, | |
| { | |
| "entropy": 0.8550186157226562, | |
| "epoch": 1.4585365853658536, | |
| "grad_norm": 0.1983252912759781, | |
| "learning_rate": 3.021680216802168e-06, | |
| "loss": 0.868, | |
| "mean_token_accuracy": 0.7317743897438049, | |
| "num_tokens": 8019170.0, | |
| "step": 598 | |
| }, | |
| { | |
| "entropy": 0.8382817506790161, | |
| "epoch": 1.4609756097560975, | |
| "grad_norm": 0.1967770755290985, | |
| "learning_rate": 3.0081300813008134e-06, | |
| "loss": 0.8349, | |
| "mean_token_accuracy": 0.7366904020309448, | |
| "num_tokens": 8032372.0, | |
| "step": 599 | |
| }, | |
| { | |
| "entropy": 0.8516252040863037, | |
| "epoch": 1.4634146341463414, | |
| "grad_norm": 0.18903858959674835, | |
| "learning_rate": 2.9945799457994586e-06, | |
| "loss": 0.8647, | |
| "mean_token_accuracy": 0.7299439907073975, | |
| "num_tokens": 8046137.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 0.8517444729804993, | |
| "epoch": 1.4658536585365853, | |
| "grad_norm": 0.19564732909202576, | |
| "learning_rate": 2.9810298102981034e-06, | |
| "loss": 0.8586, | |
| "mean_token_accuracy": 0.7297217845916748, | |
| "num_tokens": 8059776.0, | |
| "step": 601 | |
| }, | |
| { | |
| "entropy": 0.8595305681228638, | |
| "epoch": 1.4682926829268292, | |
| "grad_norm": 0.20328737795352936, | |
| "learning_rate": 2.967479674796748e-06, | |
| "loss": 0.8787, | |
| "mean_token_accuracy": 0.7226027250289917, | |
| "num_tokens": 8073516.0, | |
| "step": 602 | |
| }, | |
| { | |
| "entropy": 0.8476274013519287, | |
| "epoch": 1.4707317073170731, | |
| "grad_norm": 0.1782613843679428, | |
| "learning_rate": 2.9539295392953933e-06, | |
| "loss": 0.851, | |
| "mean_token_accuracy": 0.7361205220222473, | |
| "num_tokens": 8086807.0, | |
| "step": 603 | |
| }, | |
| { | |
| "entropy": 0.8445456027984619, | |
| "epoch": 1.473170731707317, | |
| "grad_norm": 0.20236928761005402, | |
| "learning_rate": 2.940379403794038e-06, | |
| "loss": 0.8381, | |
| "mean_token_accuracy": 0.7368095517158508, | |
| "num_tokens": 8099749.0, | |
| "step": 604 | |
| }, | |
| { | |
| "entropy": 0.8485767841339111, | |
| "epoch": 1.475609756097561, | |
| "grad_norm": 0.20927858352661133, | |
| "learning_rate": 2.926829268292683e-06, | |
| "loss": 0.8596, | |
| "mean_token_accuracy": 0.7299847602844238, | |
| "num_tokens": 8112905.0, | |
| "step": 605 | |
| }, | |
| { | |
| "entropy": 0.8670172691345215, | |
| "epoch": 1.4780487804878049, | |
| "grad_norm": 0.18927742540836334, | |
| "learning_rate": 2.913279132791328e-06, | |
| "loss": 0.8631, | |
| "mean_token_accuracy": 0.7319460511207581, | |
| "num_tokens": 8126713.0, | |
| "step": 606 | |
| }, | |
| { | |
| "entropy": 0.8468033075332642, | |
| "epoch": 1.4804878048780488, | |
| "grad_norm": 0.1939922720193863, | |
| "learning_rate": 2.8997289972899733e-06, | |
| "loss": 0.8571, | |
| "mean_token_accuracy": 0.7332726716995239, | |
| "num_tokens": 8139911.0, | |
| "step": 607 | |
| }, | |
| { | |
| "entropy": 0.8749080300331116, | |
| "epoch": 1.4829268292682927, | |
| "grad_norm": 0.19756527245044708, | |
| "learning_rate": 2.8861788617886185e-06, | |
| "loss": 0.8602, | |
| "mean_token_accuracy": 0.7331797480583191, | |
| "num_tokens": 8152947.0, | |
| "step": 608 | |
| }, | |
| { | |
| "entropy": 0.8337868452072144, | |
| "epoch": 1.4853658536585366, | |
| "grad_norm": 0.18436206877231598, | |
| "learning_rate": 2.8726287262872632e-06, | |
| "loss": 0.8309, | |
| "mean_token_accuracy": 0.7352545857429504, | |
| "num_tokens": 8166357.0, | |
| "step": 609 | |
| }, | |
| { | |
| "entropy": 0.8511760830879211, | |
| "epoch": 1.4878048780487805, | |
| "grad_norm": 0.19367781281471252, | |
| "learning_rate": 2.859078590785908e-06, | |
| "loss": 0.8483, | |
| "mean_token_accuracy": 0.7363938093185425, | |
| "num_tokens": 8179639.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 0.840193510055542, | |
| "epoch": 1.4902439024390244, | |
| "grad_norm": 0.18650898337364197, | |
| "learning_rate": 2.845528455284553e-06, | |
| "loss": 0.8523, | |
| "mean_token_accuracy": 0.7330692410469055, | |
| "num_tokens": 8193033.0, | |
| "step": 611 | |
| }, | |
| { | |
| "entropy": 0.8553098440170288, | |
| "epoch": 1.4926829268292683, | |
| "grad_norm": 0.19180989265441895, | |
| "learning_rate": 2.831978319783198e-06, | |
| "loss": 0.8457, | |
| "mean_token_accuracy": 0.7340659499168396, | |
| "num_tokens": 8206244.0, | |
| "step": 612 | |
| }, | |
| { | |
| "entropy": 0.8556879758834839, | |
| "epoch": 1.4951219512195122, | |
| "grad_norm": 0.19618037343025208, | |
| "learning_rate": 2.8184281842818427e-06, | |
| "loss": 0.8627, | |
| "mean_token_accuracy": 0.7297991514205933, | |
| "num_tokens": 8219502.0, | |
| "step": 613 | |
| }, | |
| { | |
| "entropy": 0.8604175448417664, | |
| "epoch": 1.497560975609756, | |
| "grad_norm": 0.1963457465171814, | |
| "learning_rate": 2.8048780487804884e-06, | |
| "loss": 0.8478, | |
| "mean_token_accuracy": 0.733389675617218, | |
| "num_tokens": 8232537.0, | |
| "step": 614 | |
| }, | |
| { | |
| "entropy": 0.843771755695343, | |
| "epoch": 1.5, | |
| "grad_norm": 0.18628379702568054, | |
| "learning_rate": 2.791327913279133e-06, | |
| "loss": 0.8372, | |
| "mean_token_accuracy": 0.7395327687263489, | |
| "num_tokens": 8245737.0, | |
| "step": 615 | |
| }, | |
| { | |
| "entropy": 0.8475285768508911, | |
| "epoch": 1.502439024390244, | |
| "grad_norm": 0.1898878812789917, | |
| "learning_rate": 2.7777777777777783e-06, | |
| "loss": 0.8499, | |
| "mean_token_accuracy": 0.7381895780563354, | |
| "num_tokens": 8258877.0, | |
| "step": 616 | |
| }, | |
| { | |
| "entropy": 0.8462591171264648, | |
| "epoch": 1.5048780487804878, | |
| "grad_norm": 0.19080275297164917, | |
| "learning_rate": 2.764227642276423e-06, | |
| "loss": 0.8333, | |
| "mean_token_accuracy": 0.7345710396766663, | |
| "num_tokens": 8272682.0, | |
| "step": 617 | |
| }, | |
| { | |
| "entropy": 0.8637003898620605, | |
| "epoch": 1.5073170731707317, | |
| "grad_norm": 0.21446824073791504, | |
| "learning_rate": 2.750677506775068e-06, | |
| "loss": 0.8834, | |
| "mean_token_accuracy": 0.7266576290130615, | |
| "num_tokens": 8286000.0, | |
| "step": 618 | |
| }, | |
| { | |
| "entropy": 0.8389323353767395, | |
| "epoch": 1.5097560975609756, | |
| "grad_norm": 0.18551738560199738, | |
| "learning_rate": 2.7371273712737127e-06, | |
| "loss": 0.8489, | |
| "mean_token_accuracy": 0.7319799065589905, | |
| "num_tokens": 8299168.0, | |
| "step": 619 | |
| }, | |
| { | |
| "entropy": 0.8565845489501953, | |
| "epoch": 1.5121951219512195, | |
| "grad_norm": 0.19202789664268494, | |
| "learning_rate": 2.723577235772358e-06, | |
| "loss": 0.8554, | |
| "mean_token_accuracy": 0.7329407930374146, | |
| "num_tokens": 8312432.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 0.8483622074127197, | |
| "epoch": 1.5146341463414634, | |
| "grad_norm": 0.19737857580184937, | |
| "learning_rate": 2.7100271002710026e-06, | |
| "loss": 0.8596, | |
| "mean_token_accuracy": 0.7318035960197449, | |
| "num_tokens": 8325871.0, | |
| "step": 621 | |
| }, | |
| { | |
| "entropy": 0.8586803674697876, | |
| "epoch": 1.5170731707317073, | |
| "grad_norm": 0.18837496638298035, | |
| "learning_rate": 2.6964769647696482e-06, | |
| "loss": 0.8543, | |
| "mean_token_accuracy": 0.7367194890975952, | |
| "num_tokens": 8339196.0, | |
| "step": 622 | |
| }, | |
| { | |
| "entropy": 0.8477186560630798, | |
| "epoch": 1.5195121951219512, | |
| "grad_norm": 0.19471576809883118, | |
| "learning_rate": 2.682926829268293e-06, | |
| "loss": 0.8331, | |
| "mean_token_accuracy": 0.7372268438339233, | |
| "num_tokens": 8352208.0, | |
| "step": 623 | |
| }, | |
| { | |
| "entropy": 0.8441017866134644, | |
| "epoch": 1.5219512195121951, | |
| "grad_norm": 0.19018323719501495, | |
| "learning_rate": 2.669376693766938e-06, | |
| "loss": 0.8321, | |
| "mean_token_accuracy": 0.7384440302848816, | |
| "num_tokens": 8365399.0, | |
| "step": 624 | |
| }, | |
| { | |
| "entropy": 0.8366572856903076, | |
| "epoch": 1.524390243902439, | |
| "grad_norm": 0.1984400749206543, | |
| "learning_rate": 2.655826558265583e-06, | |
| "loss": 0.846, | |
| "mean_token_accuracy": 0.734561562538147, | |
| "num_tokens": 8378985.0, | |
| "step": 625 | |
| }, | |
| { | |
| "entropy": 0.8450554609298706, | |
| "epoch": 1.526829268292683, | |
| "grad_norm": 0.19116923213005066, | |
| "learning_rate": 2.6422764227642278e-06, | |
| "loss": 0.8538, | |
| "mean_token_accuracy": 0.7278881072998047, | |
| "num_tokens": 8392444.0, | |
| "step": 626 | |
| }, | |
| { | |
| "entropy": 0.8557592034339905, | |
| "epoch": 1.5292682926829269, | |
| "grad_norm": 0.1939450055360794, | |
| "learning_rate": 2.6287262872628725e-06, | |
| "loss": 0.8738, | |
| "mean_token_accuracy": 0.7258123755455017, | |
| "num_tokens": 8406093.0, | |
| "step": 627 | |
| }, | |
| { | |
| "entropy": 0.8385140895843506, | |
| "epoch": 1.5317073170731708, | |
| "grad_norm": 0.19521206617355347, | |
| "learning_rate": 2.6151761517615177e-06, | |
| "loss": 0.8562, | |
| "mean_token_accuracy": 0.7332026362419128, | |
| "num_tokens": 8419370.0, | |
| "step": 628 | |
| }, | |
| { | |
| "entropy": 0.8567601442337036, | |
| "epoch": 1.5341463414634147, | |
| "grad_norm": 0.18665672838687897, | |
| "learning_rate": 2.601626016260163e-06, | |
| "loss": 0.8566, | |
| "mean_token_accuracy": 0.7314379811286926, | |
| "num_tokens": 8432787.0, | |
| "step": 629 | |
| }, | |
| { | |
| "entropy": 0.851043701171875, | |
| "epoch": 1.5365853658536586, | |
| "grad_norm": 0.20015431940555573, | |
| "learning_rate": 2.588075880758808e-06, | |
| "loss": 0.8497, | |
| "mean_token_accuracy": 0.7346607446670532, | |
| "num_tokens": 8446363.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 0.855539083480835, | |
| "epoch": 1.5390243902439025, | |
| "grad_norm": 0.19007694721221924, | |
| "learning_rate": 2.574525745257453e-06, | |
| "loss": 0.8449, | |
| "mean_token_accuracy": 0.7352513670921326, | |
| "num_tokens": 8460143.0, | |
| "step": 631 | |
| }, | |
| { | |
| "entropy": 0.8558579683303833, | |
| "epoch": 1.5414634146341464, | |
| "grad_norm": 0.1872863471508026, | |
| "learning_rate": 2.5609756097560977e-06, | |
| "loss": 0.8565, | |
| "mean_token_accuracy": 0.7286000847816467, | |
| "num_tokens": 8474131.0, | |
| "step": 632 | |
| }, | |
| { | |
| "entropy": 0.8450092673301697, | |
| "epoch": 1.5439024390243903, | |
| "grad_norm": 0.19050945341587067, | |
| "learning_rate": 2.547425474254743e-06, | |
| "loss": 0.8447, | |
| "mean_token_accuracy": 0.735329270362854, | |
| "num_tokens": 8487541.0, | |
| "step": 633 | |
| }, | |
| { | |
| "entropy": 0.8530290722846985, | |
| "epoch": 1.5463414634146342, | |
| "grad_norm": 0.20085333287715912, | |
| "learning_rate": 2.5338753387533876e-06, | |
| "loss": 0.8343, | |
| "mean_token_accuracy": 0.7410814166069031, | |
| "num_tokens": 8500928.0, | |
| "step": 634 | |
| }, | |
| { | |
| "entropy": 0.8755598068237305, | |
| "epoch": 1.548780487804878, | |
| "grad_norm": 0.21024124324321747, | |
| "learning_rate": 2.5203252032520324e-06, | |
| "loss": 0.8705, | |
| "mean_token_accuracy": 0.7288838028907776, | |
| "num_tokens": 8513979.0, | |
| "step": 635 | |
| }, | |
| { | |
| "entropy": 0.849466860294342, | |
| "epoch": 1.551219512195122, | |
| "grad_norm": 0.19688434898853302, | |
| "learning_rate": 2.5067750677506776e-06, | |
| "loss": 0.8623, | |
| "mean_token_accuracy": 0.7304276823997498, | |
| "num_tokens": 8527509.0, | |
| "step": 636 | |
| }, | |
| { | |
| "entropy": 0.8681310415267944, | |
| "epoch": 1.553658536585366, | |
| "grad_norm": 0.1976250261068344, | |
| "learning_rate": 2.493224932249323e-06, | |
| "loss": 0.8484, | |
| "mean_token_accuracy": 0.7330136895179749, | |
| "num_tokens": 8540874.0, | |
| "step": 637 | |
| }, | |
| { | |
| "entropy": 0.8659052848815918, | |
| "epoch": 1.5560975609756098, | |
| "grad_norm": 0.18264448642730713, | |
| "learning_rate": 2.4796747967479676e-06, | |
| "loss": 0.859, | |
| "mean_token_accuracy": 0.7320760488510132, | |
| "num_tokens": 8554517.0, | |
| "step": 638 | |
| }, | |
| { | |
| "entropy": 0.8266971111297607, | |
| "epoch": 1.5585365853658537, | |
| "grad_norm": 0.17848636209964752, | |
| "learning_rate": 2.4661246612466128e-06, | |
| "loss": 0.8289, | |
| "mean_token_accuracy": 0.7398349642753601, | |
| "num_tokens": 8567863.0, | |
| "step": 639 | |
| }, | |
| { | |
| "entropy": 0.8521214127540588, | |
| "epoch": 1.5609756097560976, | |
| "grad_norm": 0.18783526122570038, | |
| "learning_rate": 2.4525745257452575e-06, | |
| "loss": 0.8587, | |
| "mean_token_accuracy": 0.7322368025779724, | |
| "num_tokens": 8581376.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 0.8435356616973877, | |
| "epoch": 1.5634146341463415, | |
| "grad_norm": 0.18920935690402985, | |
| "learning_rate": 2.4390243902439027e-06, | |
| "loss": 0.8505, | |
| "mean_token_accuracy": 0.7323869466781616, | |
| "num_tokens": 8594706.0, | |
| "step": 641 | |
| }, | |
| { | |
| "entropy": 0.8567894697189331, | |
| "epoch": 1.5658536585365854, | |
| "grad_norm": 0.19047923386096954, | |
| "learning_rate": 2.4254742547425475e-06, | |
| "loss": 0.8514, | |
| "mean_token_accuracy": 0.7303991317749023, | |
| "num_tokens": 8608127.0, | |
| "step": 642 | |
| }, | |
| { | |
| "entropy": 0.8464937806129456, | |
| "epoch": 1.5682926829268293, | |
| "grad_norm": 0.19749760627746582, | |
| "learning_rate": 2.4119241192411927e-06, | |
| "loss": 0.8645, | |
| "mean_token_accuracy": 0.7283561825752258, | |
| "num_tokens": 8621484.0, | |
| "step": 643 | |
| }, | |
| { | |
| "entropy": 0.8501962423324585, | |
| "epoch": 1.5707317073170732, | |
| "grad_norm": 0.19121719896793365, | |
| "learning_rate": 2.3983739837398375e-06, | |
| "loss": 0.8575, | |
| "mean_token_accuracy": 0.736571729183197, | |
| "num_tokens": 8634737.0, | |
| "step": 644 | |
| }, | |
| { | |
| "entropy": 0.8764846324920654, | |
| "epoch": 1.5731707317073171, | |
| "grad_norm": 0.1958206743001938, | |
| "learning_rate": 2.3848238482384827e-06, | |
| "loss": 0.8697, | |
| "mean_token_accuracy": 0.7286435961723328, | |
| "num_tokens": 8648016.0, | |
| "step": 645 | |
| }, | |
| { | |
| "entropy": 0.8585939407348633, | |
| "epoch": 1.575609756097561, | |
| "grad_norm": 0.19487060606479645, | |
| "learning_rate": 2.371273712737128e-06, | |
| "loss": 0.8702, | |
| "mean_token_accuracy": 0.7259446978569031, | |
| "num_tokens": 8661449.0, | |
| "step": 646 | |
| }, | |
| { | |
| "entropy": 0.8674750328063965, | |
| "epoch": 1.578048780487805, | |
| "grad_norm": 0.20030128955841064, | |
| "learning_rate": 2.3577235772357727e-06, | |
| "loss": 0.8756, | |
| "mean_token_accuracy": 0.7257105112075806, | |
| "num_tokens": 8675082.0, | |
| "step": 647 | |
| }, | |
| { | |
| "entropy": 0.8603734970092773, | |
| "epoch": 1.5804878048780489, | |
| "grad_norm": 0.18645605444908142, | |
| "learning_rate": 2.3441734417344174e-06, | |
| "loss": 0.8616, | |
| "mean_token_accuracy": 0.7309102416038513, | |
| "num_tokens": 8687919.0, | |
| "step": 648 | |
| }, | |
| { | |
| "entropy": 0.8567901849746704, | |
| "epoch": 1.5829268292682928, | |
| "grad_norm": 0.18722356855869293, | |
| "learning_rate": 2.3306233062330626e-06, | |
| "loss": 0.8556, | |
| "mean_token_accuracy": 0.7300856113433838, | |
| "num_tokens": 8701606.0, | |
| "step": 649 | |
| }, | |
| { | |
| "entropy": 0.8658725023269653, | |
| "epoch": 1.5853658536585367, | |
| "grad_norm": 0.19841359555721283, | |
| "learning_rate": 2.317073170731708e-06, | |
| "loss": 0.8607, | |
| "mean_token_accuracy": 0.7348301410675049, | |
| "num_tokens": 8715251.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 0.864837110042572, | |
| "epoch": 1.5878048780487806, | |
| "grad_norm": 0.20387713611125946, | |
| "learning_rate": 2.3035230352303526e-06, | |
| "loss": 0.8672, | |
| "mean_token_accuracy": 0.7283127307891846, | |
| "num_tokens": 8728466.0, | |
| "step": 651 | |
| }, | |
| { | |
| "entropy": 0.8558300733566284, | |
| "epoch": 1.5902439024390245, | |
| "grad_norm": 0.18569935858249664, | |
| "learning_rate": 2.2899728997289974e-06, | |
| "loss": 0.8529, | |
| "mean_token_accuracy": 0.7360357046127319, | |
| "num_tokens": 8741927.0, | |
| "step": 652 | |
| }, | |
| { | |
| "entropy": 0.8700096607208252, | |
| "epoch": 1.5926829268292684, | |
| "grad_norm": 0.21747605502605438, | |
| "learning_rate": 2.2764227642276426e-06, | |
| "loss": 0.8637, | |
| "mean_token_accuracy": 0.7255343794822693, | |
| "num_tokens": 8755697.0, | |
| "step": 653 | |
| }, | |
| { | |
| "entropy": 0.8406076431274414, | |
| "epoch": 1.5951219512195123, | |
| "grad_norm": 0.20201769471168518, | |
| "learning_rate": 2.2628726287262878e-06, | |
| "loss": 0.8232, | |
| "mean_token_accuracy": 0.7413987517356873, | |
| "num_tokens": 8768996.0, | |
| "step": 654 | |
| }, | |
| { | |
| "entropy": 0.870011031627655, | |
| "epoch": 1.5975609756097562, | |
| "grad_norm": 0.20148082077503204, | |
| "learning_rate": 2.2493224932249325e-06, | |
| "loss": 0.8811, | |
| "mean_token_accuracy": 0.7248213291168213, | |
| "num_tokens": 8782585.0, | |
| "step": 655 | |
| }, | |
| { | |
| "entropy": 0.8453396558761597, | |
| "epoch": 1.6, | |
| "grad_norm": 0.20931822061538696, | |
| "learning_rate": 2.2357723577235773e-06, | |
| "loss": 0.8421, | |
| "mean_token_accuracy": 0.7329903244972229, | |
| "num_tokens": 8795623.0, | |
| "step": 656 | |
| }, | |
| { | |
| "entropy": 0.8622744083404541, | |
| "epoch": 1.602439024390244, | |
| "grad_norm": 0.19886784255504608, | |
| "learning_rate": 2.222222222222222e-06, | |
| "loss": 0.8635, | |
| "mean_token_accuracy": 0.730383038520813, | |
| "num_tokens": 8809084.0, | |
| "step": 657 | |
| }, | |
| { | |
| "entropy": 0.8559050559997559, | |
| "epoch": 1.604878048780488, | |
| "grad_norm": 0.1918165683746338, | |
| "learning_rate": 2.2086720867208673e-06, | |
| "loss": 0.8609, | |
| "mean_token_accuracy": 0.7311277985572815, | |
| "num_tokens": 8822400.0, | |
| "step": 658 | |
| }, | |
| { | |
| "entropy": 0.8488461971282959, | |
| "epoch": 1.6073170731707318, | |
| "grad_norm": 0.19921588897705078, | |
| "learning_rate": 2.1951219512195125e-06, | |
| "loss": 0.8483, | |
| "mean_token_accuracy": 0.7353887557983398, | |
| "num_tokens": 8835779.0, | |
| "step": 659 | |
| }, | |
| { | |
| "entropy": 0.881496250629425, | |
| "epoch": 1.6097560975609757, | |
| "grad_norm": 0.21144771575927734, | |
| "learning_rate": 2.1815718157181572e-06, | |
| "loss": 0.8823, | |
| "mean_token_accuracy": 0.7272259593009949, | |
| "num_tokens": 8849396.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 0.8597643971443176, | |
| "epoch": 1.6121951219512196, | |
| "grad_norm": 0.19742603600025177, | |
| "learning_rate": 2.1680216802168024e-06, | |
| "loss": 0.8718, | |
| "mean_token_accuracy": 0.7294816970825195, | |
| "num_tokens": 8863034.0, | |
| "step": 661 | |
| }, | |
| { | |
| "entropy": 0.865936815738678, | |
| "epoch": 1.6146341463414635, | |
| "grad_norm": 0.2040947675704956, | |
| "learning_rate": 2.154471544715447e-06, | |
| "loss": 0.866, | |
| "mean_token_accuracy": 0.727960467338562, | |
| "num_tokens": 8876401.0, | |
| "step": 662 | |
| }, | |
| { | |
| "entropy": 0.8746140003204346, | |
| "epoch": 1.6170731707317074, | |
| "grad_norm": 0.19248297810554504, | |
| "learning_rate": 2.1409214092140924e-06, | |
| "loss": 0.8701, | |
| "mean_token_accuracy": 0.7300986647605896, | |
| "num_tokens": 8889896.0, | |
| "step": 663 | |
| }, | |
| { | |
| "entropy": 0.8540151715278625, | |
| "epoch": 1.6195121951219513, | |
| "grad_norm": 0.21466383337974548, | |
| "learning_rate": 2.127371273712737e-06, | |
| "loss": 0.8496, | |
| "mean_token_accuracy": 0.7361807227134705, | |
| "num_tokens": 8902883.0, | |
| "step": 664 | |
| }, | |
| { | |
| "entropy": 0.8697842955589294, | |
| "epoch": 1.6219512195121952, | |
| "grad_norm": 0.1929200142621994, | |
| "learning_rate": 2.1138211382113824e-06, | |
| "loss": 0.8525, | |
| "mean_token_accuracy": 0.7341955304145813, | |
| "num_tokens": 8916740.0, | |
| "step": 665 | |
| }, | |
| { | |
| "entropy": 0.8582409620285034, | |
| "epoch": 1.6243902439024391, | |
| "grad_norm": 0.18925856053829193, | |
| "learning_rate": 2.100271002710027e-06, | |
| "loss": 0.8587, | |
| "mean_token_accuracy": 0.7289534211158752, | |
| "num_tokens": 8929846.0, | |
| "step": 666 | |
| }, | |
| { | |
| "entropy": 0.8528343439102173, | |
| "epoch": 1.626829268292683, | |
| "grad_norm": 0.19603484869003296, | |
| "learning_rate": 2.0867208672086723e-06, | |
| "loss": 0.8583, | |
| "mean_token_accuracy": 0.7347631454467773, | |
| "num_tokens": 8942824.0, | |
| "step": 667 | |
| }, | |
| { | |
| "entropy": 0.8672012090682983, | |
| "epoch": 1.629268292682927, | |
| "grad_norm": 0.1923493593931198, | |
| "learning_rate": 2.073170731707317e-06, | |
| "loss": 0.8721, | |
| "mean_token_accuracy": 0.7292376756668091, | |
| "num_tokens": 8955748.0, | |
| "step": 668 | |
| }, | |
| { | |
| "entropy": 0.8548610806465149, | |
| "epoch": 1.6317073170731708, | |
| "grad_norm": 0.2052767127752304, | |
| "learning_rate": 2.0596205962059623e-06, | |
| "loss": 0.8421, | |
| "mean_token_accuracy": 0.7371867895126343, | |
| "num_tokens": 8968895.0, | |
| "step": 669 | |
| }, | |
| { | |
| "entropy": 0.8442499041557312, | |
| "epoch": 1.6341463414634148, | |
| "grad_norm": 0.18734319508075714, | |
| "learning_rate": 2.046070460704607e-06, | |
| "loss": 0.8509, | |
| "mean_token_accuracy": 0.7343496680259705, | |
| "num_tokens": 8982489.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 0.8563357591629028, | |
| "epoch": 1.6365853658536587, | |
| "grad_norm": 0.18925635516643524, | |
| "learning_rate": 2.0325203252032523e-06, | |
| "loss": 0.8626, | |
| "mean_token_accuracy": 0.7292543649673462, | |
| "num_tokens": 8995809.0, | |
| "step": 671 | |
| }, | |
| { | |
| "entropy": 0.8476035594940186, | |
| "epoch": 1.6390243902439026, | |
| "grad_norm": 0.18875564634799957, | |
| "learning_rate": 2.018970189701897e-06, | |
| "loss": 0.8388, | |
| "mean_token_accuracy": 0.7343665957450867, | |
| "num_tokens": 9008858.0, | |
| "step": 672 | |
| }, | |
| { | |
| "entropy": 0.8399662375450134, | |
| "epoch": 1.6414634146341465, | |
| "grad_norm": 0.1930282562971115, | |
| "learning_rate": 2.0054200542005423e-06, | |
| "loss": 0.8437, | |
| "mean_token_accuracy": 0.7364839911460876, | |
| "num_tokens": 9022543.0, | |
| "step": 673 | |
| }, | |
| { | |
| "entropy": 0.8500676155090332, | |
| "epoch": 1.6439024390243904, | |
| "grad_norm": 0.20816656947135925, | |
| "learning_rate": 1.991869918699187e-06, | |
| "loss": 0.8573, | |
| "mean_token_accuracy": 0.7287561893463135, | |
| "num_tokens": 9035857.0, | |
| "step": 674 | |
| }, | |
| { | |
| "entropy": 0.8518763780593872, | |
| "epoch": 1.6463414634146343, | |
| "grad_norm": 0.20092223584651947, | |
| "learning_rate": 1.9783197831978322e-06, | |
| "loss": 0.8554, | |
| "mean_token_accuracy": 0.732020378112793, | |
| "num_tokens": 9049430.0, | |
| "step": 675 | |
| }, | |
| { | |
| "entropy": 0.8682869672775269, | |
| "epoch": 1.6487804878048782, | |
| "grad_norm": 0.20551393926143646, | |
| "learning_rate": 1.964769647696477e-06, | |
| "loss": 0.8746, | |
| "mean_token_accuracy": 0.7290708422660828, | |
| "num_tokens": 9063147.0, | |
| "step": 676 | |
| }, | |
| { | |
| "entropy": 0.8445431590080261, | |
| "epoch": 1.651219512195122, | |
| "grad_norm": 0.1954556405544281, | |
| "learning_rate": 1.951219512195122e-06, | |
| "loss": 0.8474, | |
| "mean_token_accuracy": 0.7327855229377747, | |
| "num_tokens": 9076306.0, | |
| "step": 677 | |
| }, | |
| { | |
| "entropy": 0.8518280982971191, | |
| "epoch": 1.653658536585366, | |
| "grad_norm": 0.19159460067749023, | |
| "learning_rate": 1.937669376693767e-06, | |
| "loss": 0.8466, | |
| "mean_token_accuracy": 0.734912633895874, | |
| "num_tokens": 9089661.0, | |
| "step": 678 | |
| }, | |
| { | |
| "entropy": 0.8668668270111084, | |
| "epoch": 1.65609756097561, | |
| "grad_norm": 0.20159472525119781, | |
| "learning_rate": 1.924119241192412e-06, | |
| "loss": 0.876, | |
| "mean_token_accuracy": 0.7221975326538086, | |
| "num_tokens": 9103165.0, | |
| "step": 679 | |
| }, | |
| { | |
| "entropy": 0.8498247265815735, | |
| "epoch": 1.6585365853658538, | |
| "grad_norm": 0.17916780710220337, | |
| "learning_rate": 1.9105691056910574e-06, | |
| "loss": 0.8398, | |
| "mean_token_accuracy": 0.7360494136810303, | |
| "num_tokens": 9116460.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 0.8593329191207886, | |
| "epoch": 1.6609756097560977, | |
| "grad_norm": 0.20385178923606873, | |
| "learning_rate": 1.8970189701897021e-06, | |
| "loss": 0.8743, | |
| "mean_token_accuracy": 0.7305371165275574, | |
| "num_tokens": 9129565.0, | |
| "step": 681 | |
| }, | |
| { | |
| "entropy": 0.8521544933319092, | |
| "epoch": 1.6634146341463416, | |
| "grad_norm": 0.1913313865661621, | |
| "learning_rate": 1.8834688346883471e-06, | |
| "loss": 0.8418, | |
| "mean_token_accuracy": 0.7370095252990723, | |
| "num_tokens": 9142783.0, | |
| "step": 682 | |
| }, | |
| { | |
| "entropy": 0.8547897338867188, | |
| "epoch": 1.6658536585365855, | |
| "grad_norm": 0.19753193855285645, | |
| "learning_rate": 1.8699186991869919e-06, | |
| "loss": 0.8581, | |
| "mean_token_accuracy": 0.7303997278213501, | |
| "num_tokens": 9156434.0, | |
| "step": 683 | |
| }, | |
| { | |
| "entropy": 0.859555721282959, | |
| "epoch": 1.6682926829268294, | |
| "grad_norm": 0.21616385877132416, | |
| "learning_rate": 1.856368563685637e-06, | |
| "loss": 0.8586, | |
| "mean_token_accuracy": 0.7308056950569153, | |
| "num_tokens": 9170165.0, | |
| "step": 684 | |
| }, | |
| { | |
| "entropy": 0.8644682168960571, | |
| "epoch": 1.6707317073170733, | |
| "grad_norm": 0.20613378286361694, | |
| "learning_rate": 1.842818428184282e-06, | |
| "loss": 0.8729, | |
| "mean_token_accuracy": 0.727326512336731, | |
| "num_tokens": 9183699.0, | |
| "step": 685 | |
| }, | |
| { | |
| "entropy": 0.8454245924949646, | |
| "epoch": 1.6731707317073172, | |
| "grad_norm": 0.18449188768863678, | |
| "learning_rate": 1.8292682926829268e-06, | |
| "loss": 0.8407, | |
| "mean_token_accuracy": 0.7404232025146484, | |
| "num_tokens": 9196663.0, | |
| "step": 686 | |
| }, | |
| { | |
| "entropy": 0.8595112562179565, | |
| "epoch": 1.6756097560975611, | |
| "grad_norm": 0.2021973878145218, | |
| "learning_rate": 1.8157181571815718e-06, | |
| "loss": 0.8369, | |
| "mean_token_accuracy": 0.735076904296875, | |
| "num_tokens": 9209947.0, | |
| "step": 687 | |
| }, | |
| { | |
| "entropy": 0.8636391162872314, | |
| "epoch": 1.678048780487805, | |
| "grad_norm": 0.19267405569553375, | |
| "learning_rate": 1.802168021680217e-06, | |
| "loss": 0.8637, | |
| "mean_token_accuracy": 0.7290427088737488, | |
| "num_tokens": 9223574.0, | |
| "step": 688 | |
| }, | |
| { | |
| "entropy": 0.8558269143104553, | |
| "epoch": 1.680487804878049, | |
| "grad_norm": 0.1942630261182785, | |
| "learning_rate": 1.788617886178862e-06, | |
| "loss": 0.8593, | |
| "mean_token_accuracy": 0.7335766553878784, | |
| "num_tokens": 9237016.0, | |
| "step": 689 | |
| }, | |
| { | |
| "entropy": 0.8581171035766602, | |
| "epoch": 1.6829268292682928, | |
| "grad_norm": 0.20008458197116852, | |
| "learning_rate": 1.7750677506775068e-06, | |
| "loss": 0.8462, | |
| "mean_token_accuracy": 0.7356287837028503, | |
| "num_tokens": 9250653.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 0.8696762323379517, | |
| "epoch": 1.6853658536585368, | |
| "grad_norm": 0.20756582915782928, | |
| "learning_rate": 1.7615176151761518e-06, | |
| "loss": 0.8521, | |
| "mean_token_accuracy": 0.734020471572876, | |
| "num_tokens": 9264155.0, | |
| "step": 691 | |
| }, | |
| { | |
| "entropy": 0.8596901893615723, | |
| "epoch": 1.6878048780487804, | |
| "grad_norm": 0.19614450633525848, | |
| "learning_rate": 1.747967479674797e-06, | |
| "loss": 0.8596, | |
| "mean_token_accuracy": 0.7338370680809021, | |
| "num_tokens": 9278200.0, | |
| "step": 692 | |
| }, | |
| { | |
| "entropy": 0.8524608016014099, | |
| "epoch": 1.6902439024390243, | |
| "grad_norm": 0.20042568445205688, | |
| "learning_rate": 1.734417344173442e-06, | |
| "loss": 0.8657, | |
| "mean_token_accuracy": 0.7275142073631287, | |
| "num_tokens": 9291391.0, | |
| "step": 693 | |
| }, | |
| { | |
| "entropy": 0.8588581085205078, | |
| "epoch": 1.6926829268292682, | |
| "grad_norm": 0.195918470621109, | |
| "learning_rate": 1.7208672086720867e-06, | |
| "loss": 0.8752, | |
| "mean_token_accuracy": 0.72524493932724, | |
| "num_tokens": 9304677.0, | |
| "step": 694 | |
| }, | |
| { | |
| "entropy": 0.8536249399185181, | |
| "epoch": 1.6951219512195121, | |
| "grad_norm": 0.1939048022031784, | |
| "learning_rate": 1.707317073170732e-06, | |
| "loss": 0.8585, | |
| "mean_token_accuracy": 0.7366573810577393, | |
| "num_tokens": 9318371.0, | |
| "step": 695 | |
| }, | |
| { | |
| "entropy": 0.8678462505340576, | |
| "epoch": 1.697560975609756, | |
| "grad_norm": 0.19590549170970917, | |
| "learning_rate": 1.693766937669377e-06, | |
| "loss": 0.8602, | |
| "mean_token_accuracy": 0.7325801849365234, | |
| "num_tokens": 9331576.0, | |
| "step": 696 | |
| }, | |
| { | |
| "entropy": 0.8561972379684448, | |
| "epoch": 1.7, | |
| "grad_norm": 0.197646364569664, | |
| "learning_rate": 1.6802168021680219e-06, | |
| "loss": 0.8623, | |
| "mean_token_accuracy": 0.7266197204589844, | |
| "num_tokens": 9345792.0, | |
| "step": 697 | |
| }, | |
| { | |
| "entropy": 0.8263330459594727, | |
| "epoch": 1.7024390243902439, | |
| "grad_norm": 0.1956222802400589, | |
| "learning_rate": 1.6666666666666667e-06, | |
| "loss": 0.8296, | |
| "mean_token_accuracy": 0.7327542304992676, | |
| "num_tokens": 9359507.0, | |
| "step": 698 | |
| }, | |
| { | |
| "entropy": 0.8621451258659363, | |
| "epoch": 1.7048780487804878, | |
| "grad_norm": 0.18726736307144165, | |
| "learning_rate": 1.6531165311653119e-06, | |
| "loss": 0.855, | |
| "mean_token_accuracy": 0.7335154414176941, | |
| "num_tokens": 9373066.0, | |
| "step": 699 | |
| }, | |
| { | |
| "entropy": 0.8437690734863281, | |
| "epoch": 1.7073170731707317, | |
| "grad_norm": 0.19272619485855103, | |
| "learning_rate": 1.6395663956639568e-06, | |
| "loss": 0.8333, | |
| "mean_token_accuracy": 0.7366671562194824, | |
| "num_tokens": 9386620.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 0.859840989112854, | |
| "epoch": 1.7097560975609756, | |
| "grad_norm": 0.19936420023441315, | |
| "learning_rate": 1.6260162601626018e-06, | |
| "loss": 0.8591, | |
| "mean_token_accuracy": 0.7266056537628174, | |
| "num_tokens": 9399855.0, | |
| "step": 701 | |
| }, | |
| { | |
| "entropy": 0.8391731977462769, | |
| "epoch": 1.7121951219512195, | |
| "grad_norm": 0.19459789991378784, | |
| "learning_rate": 1.6124661246612466e-06, | |
| "loss": 0.8414, | |
| "mean_token_accuracy": 0.7338288426399231, | |
| "num_tokens": 9413460.0, | |
| "step": 702 | |
| }, | |
| { | |
| "entropy": 0.8309324979782104, | |
| "epoch": 1.7146341463414634, | |
| "grad_norm": 0.21322514116764069, | |
| "learning_rate": 1.5989159891598918e-06, | |
| "loss": 0.8442, | |
| "mean_token_accuracy": 0.7402694225311279, | |
| "num_tokens": 9426913.0, | |
| "step": 703 | |
| }, | |
| { | |
| "entropy": 0.8639693856239319, | |
| "epoch": 1.7170731707317073, | |
| "grad_norm": 0.19077976047992706, | |
| "learning_rate": 1.5853658536585368e-06, | |
| "loss": 0.8737, | |
| "mean_token_accuracy": 0.7287358045578003, | |
| "num_tokens": 9440661.0, | |
| "step": 704 | |
| }, | |
| { | |
| "entropy": 0.8579573631286621, | |
| "epoch": 1.7195121951219512, | |
| "grad_norm": 0.196372851729393, | |
| "learning_rate": 1.5718157181571816e-06, | |
| "loss": 0.86, | |
| "mean_token_accuracy": 0.7288172841072083, | |
| "num_tokens": 9454273.0, | |
| "step": 705 | |
| }, | |
| { | |
| "entropy": 0.8493719100952148, | |
| "epoch": 1.721951219512195, | |
| "grad_norm": 0.1844881922006607, | |
| "learning_rate": 1.5582655826558265e-06, | |
| "loss": 0.8393, | |
| "mean_token_accuracy": 0.735931396484375, | |
| "num_tokens": 9467812.0, | |
| "step": 706 | |
| }, | |
| { | |
| "entropy": 0.850537896156311, | |
| "epoch": 1.724390243902439, | |
| "grad_norm": 0.19616253674030304, | |
| "learning_rate": 1.5447154471544717e-06, | |
| "loss": 0.837, | |
| "mean_token_accuracy": 0.738007128238678, | |
| "num_tokens": 9481336.0, | |
| "step": 707 | |
| }, | |
| { | |
| "entropy": 0.852540135383606, | |
| "epoch": 1.726829268292683, | |
| "grad_norm": 0.19334371387958527, | |
| "learning_rate": 1.5311653116531167e-06, | |
| "loss": 0.8326, | |
| "mean_token_accuracy": 0.7419998645782471, | |
| "num_tokens": 9494883.0, | |
| "step": 708 | |
| }, | |
| { | |
| "entropy": 0.8625578880310059, | |
| "epoch": 1.7292682926829268, | |
| "grad_norm": 0.19667640328407288, | |
| "learning_rate": 1.5176151761517615e-06, | |
| "loss": 0.8684, | |
| "mean_token_accuracy": 0.726330578327179, | |
| "num_tokens": 9508408.0, | |
| "step": 709 | |
| }, | |
| { | |
| "entropy": 0.8546831607818604, | |
| "epoch": 1.7317073170731707, | |
| "grad_norm": 0.19391046464443207, | |
| "learning_rate": 1.5040650406504067e-06, | |
| "loss": 0.8679, | |
| "mean_token_accuracy": 0.7256612181663513, | |
| "num_tokens": 9522527.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 0.8476510047912598, | |
| "epoch": 1.7341463414634146, | |
| "grad_norm": 0.17655602097511292, | |
| "learning_rate": 1.4905149051490517e-06, | |
| "loss": 0.8377, | |
| "mean_token_accuracy": 0.7392624616622925, | |
| "num_tokens": 9536373.0, | |
| "step": 711 | |
| }, | |
| { | |
| "entropy": 0.844441294670105, | |
| "epoch": 1.7365853658536585, | |
| "grad_norm": 0.20517893135547638, | |
| "learning_rate": 1.4769647696476967e-06, | |
| "loss": 0.8428, | |
| "mean_token_accuracy": 0.7325944900512695, | |
| "num_tokens": 9549833.0, | |
| "step": 712 | |
| }, | |
| { | |
| "entropy": 0.8518630266189575, | |
| "epoch": 1.7390243902439024, | |
| "grad_norm": 0.1965651959180832, | |
| "learning_rate": 1.4634146341463414e-06, | |
| "loss": 0.8452, | |
| "mean_token_accuracy": 0.727881669998169, | |
| "num_tokens": 9563435.0, | |
| "step": 713 | |
| }, | |
| { | |
| "entropy": 0.8457773923873901, | |
| "epoch": 1.7414634146341463, | |
| "grad_norm": 0.19006958603858948, | |
| "learning_rate": 1.4498644986449866e-06, | |
| "loss": 0.8275, | |
| "mean_token_accuracy": 0.7393438816070557, | |
| "num_tokens": 9576894.0, | |
| "step": 714 | |
| }, | |
| { | |
| "entropy": 0.8564866781234741, | |
| "epoch": 1.7439024390243902, | |
| "grad_norm": 0.2010202705860138, | |
| "learning_rate": 1.4363143631436316e-06, | |
| "loss": 0.8597, | |
| "mean_token_accuracy": 0.7363360524177551, | |
| "num_tokens": 9590742.0, | |
| "step": 715 | |
| }, | |
| { | |
| "entropy": 0.8455218076705933, | |
| "epoch": 1.7463414634146341, | |
| "grad_norm": 0.19736050069332123, | |
| "learning_rate": 1.4227642276422766e-06, | |
| "loss": 0.8473, | |
| "mean_token_accuracy": 0.730883002281189, | |
| "num_tokens": 9604280.0, | |
| "step": 716 | |
| }, | |
| { | |
| "entropy": 0.8673247694969177, | |
| "epoch": 1.748780487804878, | |
| "grad_norm": 0.19236670434474945, | |
| "learning_rate": 1.4092140921409214e-06, | |
| "loss": 0.8689, | |
| "mean_token_accuracy": 0.7293338179588318, | |
| "num_tokens": 9617881.0, | |
| "step": 717 | |
| }, | |
| { | |
| "entropy": 0.8403637409210205, | |
| "epoch": 1.751219512195122, | |
| "grad_norm": 0.19086958467960358, | |
| "learning_rate": 1.3956639566395666e-06, | |
| "loss": 0.8454, | |
| "mean_token_accuracy": 0.7351208329200745, | |
| "num_tokens": 9631137.0, | |
| "step": 718 | |
| }, | |
| { | |
| "entropy": 0.8552924394607544, | |
| "epoch": 1.7536585365853659, | |
| "grad_norm": 0.2235487997531891, | |
| "learning_rate": 1.3821138211382116e-06, | |
| "loss": 0.8365, | |
| "mean_token_accuracy": 0.7410858273506165, | |
| "num_tokens": 9644783.0, | |
| "step": 719 | |
| }, | |
| { | |
| "entropy": 0.8442793488502502, | |
| "epoch": 1.7560975609756098, | |
| "grad_norm": 0.20413640141487122, | |
| "learning_rate": 1.3685636856368563e-06, | |
| "loss": 0.8441, | |
| "mean_token_accuracy": 0.7311614751815796, | |
| "num_tokens": 9658428.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 0.856056809425354, | |
| "epoch": 1.7585365853658537, | |
| "grad_norm": 0.19709528982639313, | |
| "learning_rate": 1.3550135501355013e-06, | |
| "loss": 0.8378, | |
| "mean_token_accuracy": 0.7371993064880371, | |
| "num_tokens": 9671705.0, | |
| "step": 721 | |
| }, | |
| { | |
| "entropy": 0.84223872423172, | |
| "epoch": 1.7609756097560976, | |
| "grad_norm": 0.21388745307922363, | |
| "learning_rate": 1.3414634146341465e-06, | |
| "loss": 0.8407, | |
| "mean_token_accuracy": 0.7297487258911133, | |
| "num_tokens": 9684535.0, | |
| "step": 722 | |
| }, | |
| { | |
| "entropy": 0.8511770963668823, | |
| "epoch": 1.7634146341463415, | |
| "grad_norm": 0.18245741724967957, | |
| "learning_rate": 1.3279132791327915e-06, | |
| "loss": 0.8523, | |
| "mean_token_accuracy": 0.7327352166175842, | |
| "num_tokens": 9697815.0, | |
| "step": 723 | |
| }, | |
| { | |
| "entropy": 0.853592038154602, | |
| "epoch": 1.7658536585365854, | |
| "grad_norm": 0.1975676268339157, | |
| "learning_rate": 1.3143631436314363e-06, | |
| "loss": 0.8479, | |
| "mean_token_accuracy": 0.7345311045646667, | |
| "num_tokens": 9711245.0, | |
| "step": 724 | |
| }, | |
| { | |
| "entropy": 0.8440106511116028, | |
| "epoch": 1.7682926829268293, | |
| "grad_norm": 0.20077702403068542, | |
| "learning_rate": 1.3008130081300815e-06, | |
| "loss": 0.8317, | |
| "mean_token_accuracy": 0.7399922609329224, | |
| "num_tokens": 9724226.0, | |
| "step": 725 | |
| }, | |
| { | |
| "entropy": 0.8635171055793762, | |
| "epoch": 1.7707317073170732, | |
| "grad_norm": 0.1960218995809555, | |
| "learning_rate": 1.2872628726287264e-06, | |
| "loss": 0.8681, | |
| "mean_token_accuracy": 0.7306538820266724, | |
| "num_tokens": 9737578.0, | |
| "step": 726 | |
| }, | |
| { | |
| "entropy": 0.8365871906280518, | |
| "epoch": 1.773170731707317, | |
| "grad_norm": 0.19658249616622925, | |
| "learning_rate": 1.2737127371273714e-06, | |
| "loss": 0.8307, | |
| "mean_token_accuracy": 0.7418926954269409, | |
| "num_tokens": 9751162.0, | |
| "step": 727 | |
| }, | |
| { | |
| "entropy": 0.8456725478172302, | |
| "epoch": 1.775609756097561, | |
| "grad_norm": 0.2136267125606537, | |
| "learning_rate": 1.2601626016260162e-06, | |
| "loss": 0.8405, | |
| "mean_token_accuracy": 0.7332991361618042, | |
| "num_tokens": 9764815.0, | |
| "step": 728 | |
| }, | |
| { | |
| "entropy": 0.8460253477096558, | |
| "epoch": 1.778048780487805, | |
| "grad_norm": 0.2026556134223938, | |
| "learning_rate": 1.2466124661246614e-06, | |
| "loss": 0.8378, | |
| "mean_token_accuracy": 0.7357039451599121, | |
| "num_tokens": 9777964.0, | |
| "step": 729 | |
| }, | |
| { | |
| "entropy": 0.8548044562339783, | |
| "epoch": 1.7804878048780488, | |
| "grad_norm": 0.19436872005462646, | |
| "learning_rate": 1.2330623306233064e-06, | |
| "loss": 0.8654, | |
| "mean_token_accuracy": 0.7290599346160889, | |
| "num_tokens": 9791256.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 0.8560187816619873, | |
| "epoch": 1.7829268292682927, | |
| "grad_norm": 0.19585715234279633, | |
| "learning_rate": 1.2195121951219514e-06, | |
| "loss": 0.854, | |
| "mean_token_accuracy": 0.7302951216697693, | |
| "num_tokens": 9804657.0, | |
| "step": 731 | |
| }, | |
| { | |
| "entropy": 0.8435602188110352, | |
| "epoch": 1.7853658536585366, | |
| "grad_norm": 0.19885797798633575, | |
| "learning_rate": 1.2059620596205964e-06, | |
| "loss": 0.8428, | |
| "mean_token_accuracy": 0.7359856963157654, | |
| "num_tokens": 9818070.0, | |
| "step": 732 | |
| }, | |
| { | |
| "entropy": 0.8532072305679321, | |
| "epoch": 1.7878048780487805, | |
| "grad_norm": 0.20609894394874573, | |
| "learning_rate": 1.1924119241192413e-06, | |
| "loss": 0.8622, | |
| "mean_token_accuracy": 0.7294403314590454, | |
| "num_tokens": 9831255.0, | |
| "step": 733 | |
| }, | |
| { | |
| "entropy": 0.8447146415710449, | |
| "epoch": 1.7902439024390244, | |
| "grad_norm": 0.1939428597688675, | |
| "learning_rate": 1.1788617886178863e-06, | |
| "loss": 0.8482, | |
| "mean_token_accuracy": 0.7313094735145569, | |
| "num_tokens": 9844513.0, | |
| "step": 734 | |
| }, | |
| { | |
| "entropy": 0.8524222373962402, | |
| "epoch": 1.7926829268292683, | |
| "grad_norm": 0.20892949402332306, | |
| "learning_rate": 1.1653116531165313e-06, | |
| "loss": 0.8452, | |
| "mean_token_accuracy": 0.7328373193740845, | |
| "num_tokens": 9857566.0, | |
| "step": 735 | |
| }, | |
| { | |
| "entropy": 0.8320717811584473, | |
| "epoch": 1.7951219512195122, | |
| "grad_norm": 0.18978025019168854, | |
| "learning_rate": 1.1517615176151763e-06, | |
| "loss": 0.8349, | |
| "mean_token_accuracy": 0.7377734780311584, | |
| "num_tokens": 9870975.0, | |
| "step": 736 | |
| }, | |
| { | |
| "entropy": 0.8415433168411255, | |
| "epoch": 1.7975609756097561, | |
| "grad_norm": 0.21102409064769745, | |
| "learning_rate": 1.1382113821138213e-06, | |
| "loss": 0.8452, | |
| "mean_token_accuracy": 0.7326037287712097, | |
| "num_tokens": 9884514.0, | |
| "step": 737 | |
| }, | |
| { | |
| "entropy": 0.850642204284668, | |
| "epoch": 1.8, | |
| "grad_norm": 0.204196959733963, | |
| "learning_rate": 1.1246612466124663e-06, | |
| "loss": 0.8672, | |
| "mean_token_accuracy": 0.724947988986969, | |
| "num_tokens": 9897513.0, | |
| "step": 738 | |
| }, | |
| { | |
| "entropy": 0.8529345393180847, | |
| "epoch": 1.802439024390244, | |
| "grad_norm": 0.18976934254169464, | |
| "learning_rate": 1.111111111111111e-06, | |
| "loss": 0.8653, | |
| "mean_token_accuracy": 0.7342261672019958, | |
| "num_tokens": 9910969.0, | |
| "step": 739 | |
| }, | |
| { | |
| "entropy": 0.848357617855072, | |
| "epoch": 1.8048780487804879, | |
| "grad_norm": 0.22443044185638428, | |
| "learning_rate": 1.0975609756097562e-06, | |
| "loss": 0.8514, | |
| "mean_token_accuracy": 0.7322797775268555, | |
| "num_tokens": 9923767.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 0.8451347947120667, | |
| "epoch": 1.8073170731707318, | |
| "grad_norm": 0.21177564561367035, | |
| "learning_rate": 1.0840108401084012e-06, | |
| "loss": 0.8534, | |
| "mean_token_accuracy": 0.7316635251045227, | |
| "num_tokens": 9937158.0, | |
| "step": 741 | |
| }, | |
| { | |
| "entropy": 0.8371709585189819, | |
| "epoch": 1.8097560975609757, | |
| "grad_norm": 0.2079295665025711, | |
| "learning_rate": 1.0704607046070462e-06, | |
| "loss": 0.8444, | |
| "mean_token_accuracy": 0.7338888645172119, | |
| "num_tokens": 9950255.0, | |
| "step": 742 | |
| }, | |
| { | |
| "entropy": 0.8622915744781494, | |
| "epoch": 1.8121951219512196, | |
| "grad_norm": 0.20502783358097076, | |
| "learning_rate": 1.0569105691056912e-06, | |
| "loss": 0.8726, | |
| "mean_token_accuracy": 0.7261030673980713, | |
| "num_tokens": 9963484.0, | |
| "step": 743 | |
| }, | |
| { | |
| "entropy": 0.8526772260665894, | |
| "epoch": 1.8146341463414632, | |
| "grad_norm": 0.21239180862903595, | |
| "learning_rate": 1.0433604336043362e-06, | |
| "loss": 0.8581, | |
| "mean_token_accuracy": 0.7288627624511719, | |
| "num_tokens": 9976936.0, | |
| "step": 744 | |
| }, | |
| { | |
| "entropy": 0.8445687890052795, | |
| "epoch": 1.8170731707317072, | |
| "grad_norm": 0.20623742043972015, | |
| "learning_rate": 1.0298102981029812e-06, | |
| "loss": 0.8522, | |
| "mean_token_accuracy": 0.7347913980484009, | |
| "num_tokens": 9990760.0, | |
| "step": 745 | |
| }, | |
| { | |
| "entropy": 0.8608044385910034, | |
| "epoch": 1.819512195121951, | |
| "grad_norm": 0.19621485471725464, | |
| "learning_rate": 1.0162601626016261e-06, | |
| "loss": 0.8718, | |
| "mean_token_accuracy": 0.7230565547943115, | |
| "num_tokens": 10004360.0, | |
| "step": 746 | |
| }, | |
| { | |
| "entropy": 0.8496952056884766, | |
| "epoch": 1.821951219512195, | |
| "grad_norm": 0.19843044877052307, | |
| "learning_rate": 1.0027100271002711e-06, | |
| "loss": 0.8541, | |
| "mean_token_accuracy": 0.7331779599189758, | |
| "num_tokens": 10017677.0, | |
| "step": 747 | |
| }, | |
| { | |
| "entropy": 0.8300923109054565, | |
| "epoch": 1.8243902439024389, | |
| "grad_norm": 0.19320283830165863, | |
| "learning_rate": 9.891598915989161e-07, | |
| "loss": 0.8226, | |
| "mean_token_accuracy": 0.7383586764335632, | |
| "num_tokens": 10030707.0, | |
| "step": 748 | |
| }, | |
| { | |
| "entropy": 0.862189769744873, | |
| "epoch": 1.8268292682926828, | |
| "grad_norm": 0.19311180710792542, | |
| "learning_rate": 9.75609756097561e-07, | |
| "loss": 0.8502, | |
| "mean_token_accuracy": 0.7346285581588745, | |
| "num_tokens": 10044466.0, | |
| "step": 749 | |
| }, | |
| { | |
| "entropy": 0.8316363096237183, | |
| "epoch": 1.8292682926829267, | |
| "grad_norm": 0.2041832059621811, | |
| "learning_rate": 9.62059620596206e-07, | |
| "loss": 0.8221, | |
| "mean_token_accuracy": 0.7383882999420166, | |
| "num_tokens": 10058132.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 0.8450522422790527, | |
| "epoch": 1.8317073170731706, | |
| "grad_norm": 0.199119433760643, | |
| "learning_rate": 9.485094850948511e-07, | |
| "loss": 0.824, | |
| "mean_token_accuracy": 0.7412486672401428, | |
| "num_tokens": 10071346.0, | |
| "step": 751 | |
| }, | |
| { | |
| "entropy": 0.84795081615448, | |
| "epoch": 1.8341463414634145, | |
| "grad_norm": 0.2036094069480896, | |
| "learning_rate": 9.349593495934959e-07, | |
| "loss": 0.8574, | |
| "mean_token_accuracy": 0.7317926287651062, | |
| "num_tokens": 10084516.0, | |
| "step": 752 | |
| }, | |
| { | |
| "entropy": 0.8715170621871948, | |
| "epoch": 1.8365853658536584, | |
| "grad_norm": 0.2116577923297882, | |
| "learning_rate": 9.21409214092141e-07, | |
| "loss": 0.8351, | |
| "mean_token_accuracy": 0.7349324226379395, | |
| "num_tokens": 10097706.0, | |
| "step": 753 | |
| }, | |
| { | |
| "entropy": 0.8570759296417236, | |
| "epoch": 1.8390243902439023, | |
| "grad_norm": 0.20559139549732208, | |
| "learning_rate": 9.078590785907859e-07, | |
| "loss": 0.861, | |
| "mean_token_accuracy": 0.7247146368026733, | |
| "num_tokens": 10111475.0, | |
| "step": 754 | |
| }, | |
| { | |
| "entropy": 0.8573019504547119, | |
| "epoch": 1.8414634146341462, | |
| "grad_norm": 0.20710168778896332, | |
| "learning_rate": 8.94308943089431e-07, | |
| "loss": 0.8701, | |
| "mean_token_accuracy": 0.7320393919944763, | |
| "num_tokens": 10124784.0, | |
| "step": 755 | |
| }, | |
| { | |
| "entropy": 0.8414781093597412, | |
| "epoch": 1.84390243902439, | |
| "grad_norm": 0.19474507868289948, | |
| "learning_rate": 8.807588075880759e-07, | |
| "loss": 0.8389, | |
| "mean_token_accuracy": 0.7376715540885925, | |
| "num_tokens": 10138062.0, | |
| "step": 756 | |
| }, | |
| { | |
| "entropy": 0.8562086820602417, | |
| "epoch": 1.846341463414634, | |
| "grad_norm": 0.18625088036060333, | |
| "learning_rate": 8.67208672086721e-07, | |
| "loss": 0.8406, | |
| "mean_token_accuracy": 0.7356444001197815, | |
| "num_tokens": 10152184.0, | |
| "step": 757 | |
| }, | |
| { | |
| "entropy": 0.8786016702651978, | |
| "epoch": 1.848780487804878, | |
| "grad_norm": 0.20720075070858002, | |
| "learning_rate": 8.53658536585366e-07, | |
| "loss": 0.8872, | |
| "mean_token_accuracy": 0.723919153213501, | |
| "num_tokens": 10165754.0, | |
| "step": 758 | |
| }, | |
| { | |
| "entropy": 0.8555569648742676, | |
| "epoch": 1.8512195121951218, | |
| "grad_norm": 0.20634230971336365, | |
| "learning_rate": 8.401084010840109e-07, | |
| "loss": 0.8515, | |
| "mean_token_accuracy": 0.7339683771133423, | |
| "num_tokens": 10178682.0, | |
| "step": 759 | |
| }, | |
| { | |
| "entropy": 0.8689761757850647, | |
| "epoch": 1.8536585365853657, | |
| "grad_norm": 0.19764046370983124, | |
| "learning_rate": 8.265582655826559e-07, | |
| "loss": 0.865, | |
| "mean_token_accuracy": 0.7301658987998962, | |
| "num_tokens": 10191958.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 0.8437796235084534, | |
| "epoch": 1.8560975609756096, | |
| "grad_norm": 0.19624987244606018, | |
| "learning_rate": 8.130081300813009e-07, | |
| "loss": 0.8435, | |
| "mean_token_accuracy": 0.735300600528717, | |
| "num_tokens": 10205597.0, | |
| "step": 761 | |
| }, | |
| { | |
| "entropy": 0.8480662703514099, | |
| "epoch": 1.8585365853658535, | |
| "grad_norm": 0.20579519867897034, | |
| "learning_rate": 7.994579945799459e-07, | |
| "loss": 0.8641, | |
| "mean_token_accuracy": 0.734367847442627, | |
| "num_tokens": 10218759.0, | |
| "step": 762 | |
| }, | |
| { | |
| "entropy": 0.8355182409286499, | |
| "epoch": 1.8609756097560974, | |
| "grad_norm": 0.2053273767232895, | |
| "learning_rate": 7.859078590785908e-07, | |
| "loss": 0.8409, | |
| "mean_token_accuracy": 0.7342787384986877, | |
| "num_tokens": 10232244.0, | |
| "step": 763 | |
| }, | |
| { | |
| "entropy": 0.8215388655662537, | |
| "epoch": 1.8634146341463413, | |
| "grad_norm": 0.207631453871727, | |
| "learning_rate": 7.723577235772359e-07, | |
| "loss": 0.8198, | |
| "mean_token_accuracy": 0.7401138544082642, | |
| "num_tokens": 10245258.0, | |
| "step": 764 | |
| }, | |
| { | |
| "entropy": 0.8489701747894287, | |
| "epoch": 1.8658536585365852, | |
| "grad_norm": 0.19653555750846863, | |
| "learning_rate": 7.588075880758807e-07, | |
| "loss": 0.8665, | |
| "mean_token_accuracy": 0.7305497527122498, | |
| "num_tokens": 10259117.0, | |
| "step": 765 | |
| }, | |
| { | |
| "entropy": 0.8704265356063843, | |
| "epoch": 1.8682926829268292, | |
| "grad_norm": 0.18554694950580597, | |
| "learning_rate": 7.452574525745258e-07, | |
| "loss": 0.8681, | |
| "mean_token_accuracy": 0.7264304757118225, | |
| "num_tokens": 10272625.0, | |
| "step": 766 | |
| }, | |
| { | |
| "entropy": 0.8253329992294312, | |
| "epoch": 1.870731707317073, | |
| "grad_norm": 0.1967262178659439, | |
| "learning_rate": 7.317073170731707e-07, | |
| "loss": 0.827, | |
| "mean_token_accuracy": 0.7363318204879761, | |
| "num_tokens": 10286359.0, | |
| "step": 767 | |
| }, | |
| { | |
| "entropy": 0.845137357711792, | |
| "epoch": 1.873170731707317, | |
| "grad_norm": 0.1927618682384491, | |
| "learning_rate": 7.181571815718158e-07, | |
| "loss": 0.8374, | |
| "mean_token_accuracy": 0.7362507581710815, | |
| "num_tokens": 10299903.0, | |
| "step": 768 | |
| }, | |
| { | |
| "entropy": 0.8345843553543091, | |
| "epoch": 1.8756097560975609, | |
| "grad_norm": 0.19964925944805145, | |
| "learning_rate": 7.046070460704607e-07, | |
| "loss": 0.8322, | |
| "mean_token_accuracy": 0.7415523529052734, | |
| "num_tokens": 10312970.0, | |
| "step": 769 | |
| }, | |
| { | |
| "entropy": 0.8438344597816467, | |
| "epoch": 1.8780487804878048, | |
| "grad_norm": 0.19649818539619446, | |
| "learning_rate": 6.910569105691058e-07, | |
| "loss": 0.833, | |
| "mean_token_accuracy": 0.7362222671508789, | |
| "num_tokens": 10325978.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 0.8615357875823975, | |
| "epoch": 1.8804878048780487, | |
| "grad_norm": 0.19380824267864227, | |
| "learning_rate": 6.775067750677507e-07, | |
| "loss": 0.8682, | |
| "mean_token_accuracy": 0.7287015318870544, | |
| "num_tokens": 10339610.0, | |
| "step": 771 | |
| }, | |
| { | |
| "entropy": 0.8343783617019653, | |
| "epoch": 1.8829268292682926, | |
| "grad_norm": 0.2009415328502655, | |
| "learning_rate": 6.639566395663957e-07, | |
| "loss": 0.8262, | |
| "mean_token_accuracy": 0.7381997108459473, | |
| "num_tokens": 10352613.0, | |
| "step": 772 | |
| }, | |
| { | |
| "entropy": 0.8724961280822754, | |
| "epoch": 1.8853658536585365, | |
| "grad_norm": 0.21221604943275452, | |
| "learning_rate": 6.504065040650407e-07, | |
| "loss": 0.8996, | |
| "mean_token_accuracy": 0.718626081943512, | |
| "num_tokens": 10365992.0, | |
| "step": 773 | |
| }, | |
| { | |
| "entropy": 0.8535772562026978, | |
| "epoch": 1.8878048780487804, | |
| "grad_norm": 0.20168307423591614, | |
| "learning_rate": 6.368563685636857e-07, | |
| "loss": 0.8313, | |
| "mean_token_accuracy": 0.7387219667434692, | |
| "num_tokens": 10379419.0, | |
| "step": 774 | |
| }, | |
| { | |
| "entropy": 0.8459309935569763, | |
| "epoch": 1.8902439024390243, | |
| "grad_norm": 0.1862184703350067, | |
| "learning_rate": 6.233062330623307e-07, | |
| "loss": 0.847, | |
| "mean_token_accuracy": 0.7340514659881592, | |
| "num_tokens": 10392524.0, | |
| "step": 775 | |
| }, | |
| { | |
| "entropy": 0.8495763540267944, | |
| "epoch": 1.8926829268292682, | |
| "grad_norm": 0.19959184527397156, | |
| "learning_rate": 6.097560975609757e-07, | |
| "loss": 0.849, | |
| "mean_token_accuracy": 0.7358462810516357, | |
| "num_tokens": 10406017.0, | |
| "step": 776 | |
| }, | |
| { | |
| "entropy": 0.855975329875946, | |
| "epoch": 1.895121951219512, | |
| "grad_norm": 0.20276881754398346, | |
| "learning_rate": 5.962059620596207e-07, | |
| "loss": 0.8426, | |
| "mean_token_accuracy": 0.7363553047180176, | |
| "num_tokens": 10419115.0, | |
| "step": 777 | |
| }, | |
| { | |
| "entropy": 0.8373376727104187, | |
| "epoch": 1.897560975609756, | |
| "grad_norm": 0.20193855464458466, | |
| "learning_rate": 5.826558265582657e-07, | |
| "loss": 0.8356, | |
| "mean_token_accuracy": 0.7349722385406494, | |
| "num_tokens": 10432473.0, | |
| "step": 778 | |
| }, | |
| { | |
| "entropy": 0.8574913740158081, | |
| "epoch": 1.9, | |
| "grad_norm": 0.1951507329940796, | |
| "learning_rate": 5.691056910569106e-07, | |
| "loss": 0.8454, | |
| "mean_token_accuracy": 0.7371317744255066, | |
| "num_tokens": 10445389.0, | |
| "step": 779 | |
| }, | |
| { | |
| "entropy": 0.8459637761116028, | |
| "epoch": 1.9024390243902438, | |
| "grad_norm": 0.21754737198352814, | |
| "learning_rate": 5.555555555555555e-07, | |
| "loss": 0.8479, | |
| "mean_token_accuracy": 0.7290775179862976, | |
| "num_tokens": 10458955.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 0.8668469786643982, | |
| "epoch": 1.9048780487804877, | |
| "grad_norm": 0.19004595279693604, | |
| "learning_rate": 5.420054200542006e-07, | |
| "loss": 0.8651, | |
| "mean_token_accuracy": 0.7281619310379028, | |
| "num_tokens": 10472262.0, | |
| "step": 781 | |
| }, | |
| { | |
| "entropy": 0.8526676893234253, | |
| "epoch": 1.9073170731707316, | |
| "grad_norm": 0.20260126888751984, | |
| "learning_rate": 5.284552845528456e-07, | |
| "loss": 0.8451, | |
| "mean_token_accuracy": 0.7369789481163025, | |
| "num_tokens": 10485737.0, | |
| "step": 782 | |
| }, | |
| { | |
| "entropy": 0.8564171195030212, | |
| "epoch": 1.9097560975609755, | |
| "grad_norm": 0.21006231009960175, | |
| "learning_rate": 5.149051490514906e-07, | |
| "loss": 0.8525, | |
| "mean_token_accuracy": 0.7312126159667969, | |
| "num_tokens": 10499459.0, | |
| "step": 783 | |
| }, | |
| { | |
| "entropy": 0.8616898655891418, | |
| "epoch": 1.9121951219512194, | |
| "grad_norm": 0.22315165400505066, | |
| "learning_rate": 5.013550135501356e-07, | |
| "loss": 0.8616, | |
| "mean_token_accuracy": 0.7301322221755981, | |
| "num_tokens": 10513241.0, | |
| "step": 784 | |
| }, | |
| { | |
| "entropy": 0.8496356010437012, | |
| "epoch": 1.9146341463414633, | |
| "grad_norm": 0.1904105544090271, | |
| "learning_rate": 4.878048780487805e-07, | |
| "loss": 0.8492, | |
| "mean_token_accuracy": 0.7327806949615479, | |
| "num_tokens": 10526527.0, | |
| "step": 785 | |
| }, | |
| { | |
| "entropy": 0.8355883359909058, | |
| "epoch": 1.9170731707317072, | |
| "grad_norm": 0.20292788743972778, | |
| "learning_rate": 4.7425474254742553e-07, | |
| "loss": 0.8419, | |
| "mean_token_accuracy": 0.7367938756942749, | |
| "num_tokens": 10539643.0, | |
| "step": 786 | |
| }, | |
| { | |
| "entropy": 0.8364092111587524, | |
| "epoch": 1.9195121951219511, | |
| "grad_norm": 0.20216518640518188, | |
| "learning_rate": 4.607046070460705e-07, | |
| "loss": 0.819, | |
| "mean_token_accuracy": 0.7400240302085876, | |
| "num_tokens": 10552991.0, | |
| "step": 787 | |
| }, | |
| { | |
| "entropy": 0.8569232821464539, | |
| "epoch": 1.921951219512195, | |
| "grad_norm": 0.21923497319221497, | |
| "learning_rate": 4.471544715447155e-07, | |
| "loss": 0.8679, | |
| "mean_token_accuracy": 0.7307437658309937, | |
| "num_tokens": 10566600.0, | |
| "step": 788 | |
| }, | |
| { | |
| "entropy": 0.8531014323234558, | |
| "epoch": 1.924390243902439, | |
| "grad_norm": 0.20161768794059753, | |
| "learning_rate": 4.336043360433605e-07, | |
| "loss": 0.8558, | |
| "mean_token_accuracy": 0.7282842397689819, | |
| "num_tokens": 10580097.0, | |
| "step": 789 | |
| }, | |
| { | |
| "entropy": 0.8500542640686035, | |
| "epoch": 1.9268292682926829, | |
| "grad_norm": 0.187560573220253, | |
| "learning_rate": 4.2005420054200547e-07, | |
| "loss": 0.8403, | |
| "mean_token_accuracy": 0.7343399524688721, | |
| "num_tokens": 10593491.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 0.8405550718307495, | |
| "epoch": 1.9292682926829268, | |
| "grad_norm": 0.19617001712322235, | |
| "learning_rate": 4.0650406504065046e-07, | |
| "loss": 0.8227, | |
| "mean_token_accuracy": 0.7386794090270996, | |
| "num_tokens": 10606713.0, | |
| "step": 791 | |
| }, | |
| { | |
| "entropy": 0.8317885994911194, | |
| "epoch": 1.9317073170731707, | |
| "grad_norm": 0.20573502779006958, | |
| "learning_rate": 3.929539295392954e-07, | |
| "loss": 0.82, | |
| "mean_token_accuracy": 0.7416048049926758, | |
| "num_tokens": 10619802.0, | |
| "step": 792 | |
| }, | |
| { | |
| "entropy": 0.8333207368850708, | |
| "epoch": 1.9341463414634146, | |
| "grad_norm": 0.19632014632225037, | |
| "learning_rate": 3.794037940379404e-07, | |
| "loss": 0.8522, | |
| "mean_token_accuracy": 0.7321804761886597, | |
| "num_tokens": 10633581.0, | |
| "step": 793 | |
| }, | |
| { | |
| "entropy": 0.8593798875808716, | |
| "epoch": 1.9365853658536585, | |
| "grad_norm": 0.19296619296073914, | |
| "learning_rate": 3.6585365853658536e-07, | |
| "loss": 0.8544, | |
| "mean_token_accuracy": 0.730027973651886, | |
| "num_tokens": 10646828.0, | |
| "step": 794 | |
| }, | |
| { | |
| "entropy": 0.8579990267753601, | |
| "epoch": 1.9390243902439024, | |
| "grad_norm": 0.19028954207897186, | |
| "learning_rate": 3.5230352303523034e-07, | |
| "loss": 0.8397, | |
| "mean_token_accuracy": 0.7340456247329712, | |
| "num_tokens": 10660602.0, | |
| "step": 795 | |
| }, | |
| { | |
| "entropy": 0.8487682938575745, | |
| "epoch": 1.9414634146341463, | |
| "grad_norm": 0.2062513530254364, | |
| "learning_rate": 3.3875338753387533e-07, | |
| "loss": 0.8554, | |
| "mean_token_accuracy": 0.736031711101532, | |
| "num_tokens": 10673737.0, | |
| "step": 796 | |
| }, | |
| { | |
| "entropy": 0.8565185070037842, | |
| "epoch": 1.9439024390243902, | |
| "grad_norm": 0.22061142325401306, | |
| "learning_rate": 3.2520325203252037e-07, | |
| "loss": 0.8529, | |
| "mean_token_accuracy": 0.7323763966560364, | |
| "num_tokens": 10686293.0, | |
| "step": 797 | |
| }, | |
| { | |
| "entropy": 0.84625244140625, | |
| "epoch": 1.946341463414634, | |
| "grad_norm": 0.213920459151268, | |
| "learning_rate": 3.1165311653116535e-07, | |
| "loss": 0.8391, | |
| "mean_token_accuracy": 0.7343069314956665, | |
| "num_tokens": 10699388.0, | |
| "step": 798 | |
| }, | |
| { | |
| "entropy": 0.862379789352417, | |
| "epoch": 1.948780487804878, | |
| "grad_norm": 0.2047111839056015, | |
| "learning_rate": 2.9810298102981034e-07, | |
| "loss": 0.865, | |
| "mean_token_accuracy": 0.7316440939903259, | |
| "num_tokens": 10713296.0, | |
| "step": 799 | |
| }, | |
| { | |
| "entropy": 0.8566243648529053, | |
| "epoch": 1.951219512195122, | |
| "grad_norm": 0.19687318801879883, | |
| "learning_rate": 2.845528455284553e-07, | |
| "loss": 0.841, | |
| "mean_token_accuracy": 0.7335733771324158, | |
| "num_tokens": 10726644.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 0.8384063243865967, | |
| "epoch": 1.9536585365853658, | |
| "grad_norm": 0.18069839477539062, | |
| "learning_rate": 2.710027100271003e-07, | |
| "loss": 0.8471, | |
| "mean_token_accuracy": 0.7319970726966858, | |
| "num_tokens": 10740380.0, | |
| "step": 801 | |
| }, | |
| { | |
| "entropy": 0.8644918203353882, | |
| "epoch": 1.9560975609756097, | |
| "grad_norm": 0.19222773611545563, | |
| "learning_rate": 2.574525745257453e-07, | |
| "loss": 0.8728, | |
| "mean_token_accuracy": 0.728790283203125, | |
| "num_tokens": 10753515.0, | |
| "step": 802 | |
| }, | |
| { | |
| "entropy": 0.8495630025863647, | |
| "epoch": 1.9585365853658536, | |
| "grad_norm": 0.19031932950019836, | |
| "learning_rate": 2.439024390243903e-07, | |
| "loss": 0.8469, | |
| "mean_token_accuracy": 0.7325720191001892, | |
| "num_tokens": 10766929.0, | |
| "step": 803 | |
| }, | |
| { | |
| "entropy": 0.8337970972061157, | |
| "epoch": 1.9609756097560975, | |
| "grad_norm": 0.20217815041542053, | |
| "learning_rate": 2.3035230352303526e-07, | |
| "loss": 0.8368, | |
| "mean_token_accuracy": 0.7349351644515991, | |
| "num_tokens": 10779972.0, | |
| "step": 804 | |
| }, | |
| { | |
| "entropy": 0.8449347019195557, | |
| "epoch": 1.9634146341463414, | |
| "grad_norm": 0.1968362182378769, | |
| "learning_rate": 2.1680216802168024e-07, | |
| "loss": 0.8309, | |
| "mean_token_accuracy": 0.7364509701728821, | |
| "num_tokens": 10793310.0, | |
| "step": 805 | |
| }, | |
| { | |
| "entropy": 0.8543494939804077, | |
| "epoch": 1.9658536585365853, | |
| "grad_norm": 0.19359824061393738, | |
| "learning_rate": 2.0325203252032523e-07, | |
| "loss": 0.8437, | |
| "mean_token_accuracy": 0.7330183386802673, | |
| "num_tokens": 10806870.0, | |
| "step": 806 | |
| }, | |
| { | |
| "entropy": 0.8296524882316589, | |
| "epoch": 1.9682926829268292, | |
| "grad_norm": 0.19010023772716522, | |
| "learning_rate": 1.897018970189702e-07, | |
| "loss": 0.825, | |
| "mean_token_accuracy": 0.743084192276001, | |
| "num_tokens": 10820225.0, | |
| "step": 807 | |
| }, | |
| { | |
| "entropy": 0.8526460528373718, | |
| "epoch": 1.9707317073170731, | |
| "grad_norm": 0.19789716601371765, | |
| "learning_rate": 1.7615176151761517e-07, | |
| "loss": 0.8656, | |
| "mean_token_accuracy": 0.7355901002883911, | |
| "num_tokens": 10833357.0, | |
| "step": 808 | |
| }, | |
| { | |
| "entropy": 0.8426751494407654, | |
| "epoch": 1.973170731707317, | |
| "grad_norm": 0.20161619782447815, | |
| "learning_rate": 1.6260162601626018e-07, | |
| "loss": 0.8276, | |
| "mean_token_accuracy": 0.7407682538032532, | |
| "num_tokens": 10846832.0, | |
| "step": 809 | |
| }, | |
| { | |
| "entropy": 0.855075478553772, | |
| "epoch": 1.975609756097561, | |
| "grad_norm": 0.21478648483753204, | |
| "learning_rate": 1.4905149051490517e-07, | |
| "loss": 0.8653, | |
| "mean_token_accuracy": 0.7304821014404297, | |
| "num_tokens": 10859708.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 0.8732905387878418, | |
| "epoch": 1.9780487804878049, | |
| "grad_norm": 0.19577589631080627, | |
| "learning_rate": 1.3550135501355015e-07, | |
| "loss": 0.8699, | |
| "mean_token_accuracy": 0.7293443083763123, | |
| "num_tokens": 10873328.0, | |
| "step": 811 | |
| }, | |
| { | |
| "entropy": 0.8290870189666748, | |
| "epoch": 1.9804878048780488, | |
| "grad_norm": 0.22332845628261566, | |
| "learning_rate": 1.2195121951219514e-07, | |
| "loss": 0.8305, | |
| "mean_token_accuracy": 0.7437856793403625, | |
| "num_tokens": 10886298.0, | |
| "step": 812 | |
| }, | |
| { | |
| "entropy": 0.8486424088478088, | |
| "epoch": 1.9829268292682927, | |
| "grad_norm": 0.1950785368680954, | |
| "learning_rate": 1.0840108401084012e-07, | |
| "loss": 0.8481, | |
| "mean_token_accuracy": 0.7326783537864685, | |
| "num_tokens": 10899953.0, | |
| "step": 813 | |
| }, | |
| { | |
| "entropy": 0.8452553749084473, | |
| "epoch": 1.9853658536585366, | |
| "grad_norm": 0.19996321201324463, | |
| "learning_rate": 9.48509485094851e-08, | |
| "loss": 0.8512, | |
| "mean_token_accuracy": 0.7341687083244324, | |
| "num_tokens": 10913376.0, | |
| "step": 814 | |
| }, | |
| { | |
| "entropy": 0.8601592183113098, | |
| "epoch": 1.9878048780487805, | |
| "grad_norm": 0.19899865984916687, | |
| "learning_rate": 8.130081300813009e-08, | |
| "loss": 0.8585, | |
| "mean_token_accuracy": 0.7343636751174927, | |
| "num_tokens": 10927174.0, | |
| "step": 815 | |
| }, | |
| { | |
| "entropy": 0.8372820019721985, | |
| "epoch": 1.9902439024390244, | |
| "grad_norm": 0.19347034394741058, | |
| "learning_rate": 6.775067750677508e-08, | |
| "loss": 0.8281, | |
| "mean_token_accuracy": 0.7355829477310181, | |
| "num_tokens": 10940733.0, | |
| "step": 816 | |
| }, | |
| { | |
| "entropy": 0.8477611541748047, | |
| "epoch": 1.9926829268292683, | |
| "grad_norm": 0.19224300980567932, | |
| "learning_rate": 5.420054200542006e-08, | |
| "loss": 0.8319, | |
| "mean_token_accuracy": 0.7393810749053955, | |
| "num_tokens": 10953933.0, | |
| "step": 817 | |
| }, | |
| { | |
| "entropy": 0.8453364372253418, | |
| "epoch": 1.9951219512195122, | |
| "grad_norm": 0.18883691728115082, | |
| "learning_rate": 4.0650406504065046e-08, | |
| "loss": 0.8244, | |
| "mean_token_accuracy": 0.7396546602249146, | |
| "num_tokens": 10967385.0, | |
| "step": 818 | |
| }, | |
| { | |
| "entropy": 0.8373251557350159, | |
| "epoch": 1.997560975609756, | |
| "grad_norm": 0.20955298840999603, | |
| "learning_rate": 2.710027100271003e-08, | |
| "loss": 0.8206, | |
| "mean_token_accuracy": 0.74117112159729, | |
| "num_tokens": 10980568.0, | |
| "step": 819 | |
| }, | |
| { | |
| "entropy": 0.8374952673912048, | |
| "epoch": 2.0, | |
| "grad_norm": 0.18724212050437927, | |
| "learning_rate": 1.3550135501355015e-08, | |
| "loss": 0.8354, | |
| "mean_token_accuracy": 0.7327674627304077, | |
| "num_tokens": 10994250.0, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "step": 820, | |
| "total_flos": 1.0323202908744581e+18, | |
| "train_loss": 1.0359788402551557, | |
| "train_runtime": 4829.1249, | |
| "train_samples_per_second": 2.713, | |
| "train_steps_per_second": 0.17 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 820, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.0323202908744581e+18, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |