zgrgr commited on
Commit
ad9cc3b
·
verified ·
1 Parent(s): e9b00df

Upload model files with Nebius access

Browse files
README.md CHANGED
@@ -1,202 +1,26 @@
1
- ---
2
- base_model: meta-llama/Llama-3.1-8B-Instruct
3
- library_name: peft
4
- ---
5
 
6
- # Model Card for Model ID
 
 
 
 
 
 
 
 
 
 
 
 
7
 
8
- <!-- Provide a quick summary of what the model is/does. -->
9
 
 
10
 
 
11
 
12
  ## Model Details
13
-
14
- ### Model Description
15
-
16
- <!-- Provide a longer summary of what this model is. -->
17
-
18
-
19
-
20
- - **Developed by:** [More Information Needed]
21
- - **Funded by [optional]:** [More Information Needed]
22
- - **Shared by [optional]:** [More Information Needed]
23
- - **Model type:** [More Information Needed]
24
- - **Language(s) (NLP):** [More Information Needed]
25
- - **License:** [More Information Needed]
26
- - **Finetuned from model [optional]:** [More Information Needed]
27
-
28
- ### Model Sources [optional]
29
-
30
- <!-- Provide the basic links for the model. -->
31
-
32
- - **Repository:** [More Information Needed]
33
- - **Paper [optional]:** [More Information Needed]
34
- - **Demo [optional]:** [More Information Needed]
35
-
36
- ## Uses
37
-
38
- <!-- Address questions around how the model is intended to be used, including the foreseeable users of the model and those affected by the model. -->
39
-
40
- ### Direct Use
41
-
42
- <!-- This section is for the model use without fine-tuning or plugging into a larger ecosystem/app. -->
43
-
44
- [More Information Needed]
45
-
46
- ### Downstream Use [optional]
47
-
48
- <!-- This section is for the model use when fine-tuned for a task, or when plugged into a larger ecosystem/app -->
49
-
50
- [More Information Needed]
51
-
52
- ### Out-of-Scope Use
53
-
54
- <!-- This section addresses misuse, malicious use, and uses that the model will not work well for. -->
55
-
56
- [More Information Needed]
57
-
58
- ## Bias, Risks, and Limitations
59
-
60
- <!-- This section is meant to convey both technical and sociotechnical limitations. -->
61
-
62
- [More Information Needed]
63
-
64
- ### Recommendations
65
-
66
- <!-- This section is meant to convey recommendations with respect to the bias, risk, and technical limitations. -->
67
-
68
- Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
69
-
70
- ## How to Get Started with the Model
71
-
72
- Use the code below to get started with the model.
73
-
74
- [More Information Needed]
75
-
76
- ## Training Details
77
-
78
- ### Training Data
79
-
80
- <!-- This should link to a Dataset Card, perhaps with a short stub of information on what the training data is all about as well as documentation related to data pre-processing or additional filtering. -->
81
-
82
- [More Information Needed]
83
-
84
- ### Training Procedure
85
-
86
- <!-- This relates heavily to the Technical Specifications. Content here should link to that section when it is relevant to the training procedure. -->
87
-
88
- #### Preprocessing [optional]
89
-
90
- [More Information Needed]
91
-
92
-
93
- #### Training Hyperparameters
94
-
95
- - **Training regime:** [More Information Needed] <!--fp32, fp16 mixed precision, bf16 mixed precision, bf16 non-mixed precision, fp16 non-mixed precision, fp8 mixed precision -->
96
-
97
- #### Speeds, Sizes, Times [optional]
98
-
99
- <!-- This section provides information about throughput, start/end time, checkpoint size if relevant, etc. -->
100
-
101
- [More Information Needed]
102
-
103
- ## Evaluation
104
-
105
- <!-- This section describes the evaluation protocols and provides the results. -->
106
-
107
- ### Testing Data, Factors & Metrics
108
-
109
- #### Testing Data
110
-
111
- <!-- This should link to a Dataset Card if possible. -->
112
-
113
- [More Information Needed]
114
-
115
- #### Factors
116
-
117
- <!-- These are the things the evaluation is disaggregating by, e.g., subpopulations or domains. -->
118
-
119
- [More Information Needed]
120
-
121
- #### Metrics
122
-
123
- <!-- These are the evaluation metrics being used, ideally with a description of why. -->
124
-
125
- [More Information Needed]
126
-
127
- ### Results
128
-
129
- [More Information Needed]
130
-
131
- #### Summary
132
-
133
-
134
-
135
- ## Model Examination [optional]
136
-
137
- <!-- Relevant interpretability work for the model goes here -->
138
-
139
- [More Information Needed]
140
-
141
- ## Environmental Impact
142
-
143
- <!-- Total emissions (in grams of CO2eq) and additional considerations, such as electricity usage, go here. Edit the suggested text below accordingly -->
144
-
145
- Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
146
-
147
- - **Hardware Type:** [More Information Needed]
148
- - **Hours used:** [More Information Needed]
149
- - **Cloud Provider:** [More Information Needed]
150
- - **Compute Region:** [More Information Needed]
151
- - **Carbon Emitted:** [More Information Needed]
152
-
153
- ## Technical Specifications [optional]
154
-
155
- ### Model Architecture and Objective
156
-
157
- [More Information Needed]
158
-
159
- ### Compute Infrastructure
160
-
161
- [More Information Needed]
162
-
163
- #### Hardware
164
-
165
- [More Information Needed]
166
-
167
- #### Software
168
-
169
- [More Information Needed]
170
-
171
- ## Citation [optional]
172
-
173
- <!-- If there is a paper or blog post introducing the model, the APA and Bibtex information for that should go in this section. -->
174
-
175
- **BibTeX:**
176
-
177
- [More Information Needed]
178
-
179
- **APA:**
180
-
181
- [More Information Needed]
182
-
183
- ## Glossary [optional]
184
-
185
- <!-- If relevant, include terms and calculations in this section that can help readers understand the model or model card. -->
186
-
187
- [More Information Needed]
188
-
189
- ## More Information [optional]
190
-
191
- [More Information Needed]
192
-
193
- ## Model Card Authors [optional]
194
-
195
- [More Information Needed]
196
-
197
- ## Model Card Contact
198
-
199
- [More Information Needed]
200
- ### Framework versions
201
-
202
- - PEFT 0.14.0
 
 
 
 
 
1
 
2
+ ---
3
+ language:
4
+ - tr
5
+ - en
6
+ license: llama3
7
+ tags:
8
+ - llama-3
9
+ - eurohps
10
+ - turkish
11
+ - newmindai
12
+ - nebius
13
+ datasets:
14
+ - environmental-instruction-dataset
15
 
 
16
 
17
+ # Meta-Llama-3.1-8B-Instruct environmental Data Model
18
 
19
+ This model is fine-tuned version of Meta-Llama-3.1-8B-Instruct model with extended Turkish instruction dataset.
20
 
21
  ## Model Details
22
+ - Base Model: Meta-Llama-3.1-8B-Instruct
23
+ - Training Dataset: environmental Turkish Instruction Dataset
24
+ - Organization: NewMind AI
25
+ - Collection: Eurohps
26
+ - Resource Group: Nebius Access Enabled
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
adapter_config.json CHANGED
@@ -23,13 +23,13 @@
23
  "rank_pattern": {},
24
  "revision": null,
25
  "target_modules": [
26
- "q_proj",
27
  "v_proj",
28
  "o_proj",
29
  "down_proj",
 
 
30
  "k_proj",
31
- "up_proj",
32
- "gate_proj"
33
  ],
34
  "task_type": "CAUSAL_LM",
35
  "use_dora": false,
 
23
  "rank_pattern": {},
24
  "revision": null,
25
  "target_modules": [
 
26
  "v_proj",
27
  "o_proj",
28
  "down_proj",
29
+ "q_proj",
30
+ "gate_proj",
31
  "k_proj",
32
+ "up_proj"
 
33
  ],
34
  "task_type": "CAUSAL_LM",
35
  "use_dora": false,
adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:36f00cc96a3471ca7ab3b256d5ceb9f47422e96f554e2cb23e928de2c3e044fb
3
  size 167832240
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bc548e1c06e32d756ac46badc50a93b0a923093e634cca8dddb7f40bd55ac224
3
  size 167832240
optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6b84cd1c831c647136ff534e99dd26f63ae362e40cadb923d60abfae3608ab7c
3
  size 335922386
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:28338d13f61da8dbfee186d7409b8de326f331a458354da1228323a29d496333
3
  size 335922386
rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:601011b5f5c92a6c41dc706212b35d38526cdebeefe162bf095772b553db461b
3
  size 14244
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:90526829e9717d188d821093533bb80d56c70bb7939608f676732b4dcb7f4e38
3
  size 14244
tokenizer_config.json CHANGED
@@ -2050,7 +2050,7 @@
2050
  }
2051
  },
2052
  "bos_token": "<|begin_of_text|>",
2053
- "chat_template": "{{- bos_token }}\n{%- if custom_tools is defined %}\n {%- set tools = custom_tools %}\n{%- endif %}\n{%- if not tools_in_user_message is defined %}\n {%- set tools_in_user_message = true %}\n{%- endif %}\n{%- if not date_string is defined %}\n {%- set date_string = \"26 Jul 2024\" %}\n{%- endif %}\n{%- if not tools is defined %}\n {%- set tools = none %}\n{%- endif %}\n\n{#- This block extracts the system message, so we can slot it into the right place. #}\n{%- if messages[0]['role'] == 'system' %}\n {%- set system_message = messages[0]['content']|trim %}\n {%- set messages = messages[1:] %}\n{%- else %}\n {%- set system_message = \"\" %}\n{%- endif %}\n\n{#- System message + builtin tools #}\n{{- \"<|start_header_id|>system<|end_header_id|>\\n\\n\" }}\n{%- if builtin_tools is defined or tools is not none %}\n {{- \"Environment: ipython\\n\" }}\n{%- endif %}\n{%- if builtin_tools is defined %}\n {{- \"Tools: \" + builtin_tools | reject('equalto', 'code_interpreter') | join(\", \") + \"\\n\\n\"}}\n{%- endif %}\n{{- \"Cutting Knowledge Date: December 2023\\n\" }}\n{{- \"Today Date: \" + date_string + \"\\n\\n\" }}\n{%- if tools is not none and not tools_in_user_message %}\n {{- \"You have access to the following functions. To call a function, please respond with JSON for a function call.\" }}\n {{- 'Respond in the format {\"name\": function name, \"parameters\": dictionary of argument name and its value}.' }}\n {{- \"Do not use variables.\\n\\n\" }}\n {%- for t in tools %}\n {{- t | tojson(indent=4) }}\n {{- \"\\n\\n\" }}\n {%- endfor %}\n{%- endif %}\n{{- system_message }}\n{{- \"<|eot_id|>\" }}\n\n{#- Custom tools are passed in a user message with some extra guidance #}\n{%- if tools_in_user_message and not tools is none %}\n {#- Extract the first user message so we can plug it in here #}\n {%- if messages | length != 0 %}\n {%- set first_user_message = messages[0]['content']|trim %}\n {%- set messages = messages[1:] %}\n {%- else %}\n {{- raise_exception(\"Cannot put tools in the first user message when there's no first user message!\") }}\n{%- endif %}\n {{- '<|start_header_id|>user<|end_header_id|>\\n\\n' -}}\n {{- \"Given the following functions, please respond with a JSON for a function call \" }}\n {{- \"with its proper arguments that best answers the given prompt.\\n\\n\" }}\n {{- 'Respond in the format {\"name\": function name, \"parameters\": dictionary of argument name and its value}.' }}\n {{- \"Do not use variables.\\n\\n\" }}\n {%- for t in tools %}\n {{- t | tojson(indent=4) }}\n {{- \"\\n\\n\" }}\n {%- endfor %}\n {{- first_user_message + \"<|eot_id|>\"}}\n{%- endif %}\n\n{%- for message in messages %}\n {%- if not (message.role == 'ipython' or message.role == 'tool' or 'tool_calls' in message) %}\n {{- '<|start_header_id|>' + message['role'] + '<|end_header_id|>\\n\\n'+ message['content'] | trim + '<|eot_id|>' }}\n {%- elif 'tool_calls' in message %}\n {%- if not message.tool_calls|length == 1 %}\n {{- raise_exception(\"This model only supports single tool-calls at once!\") }}\n {%- endif %}\n {%- set tool_call = message.tool_calls[0].function %}\n {%- if builtin_tools is defined and tool_call.name in builtin_tools %}\n {{- '<|start_header_id|>assistant<|end_header_id|>\\n\\n' -}}\n {{- \"<|python_tag|>\" + tool_call.name + \".call(\" }}\n {%- for arg_name, arg_val in tool_call.arguments | items %}\n {{- arg_name + '=\"' + arg_val + '\"' }}\n {%- if not loop.last %}\n {{- \", \" }}\n {%- endif %}\n {%- endfor %}\n {{- \")\" }}\n {%- else %}\n {{- '<|start_header_id|>assistant<|end_header_id|>\\n\\n' -}}\n {{- '{\"name\": \"' + tool_call.name + '\", ' }}\n {{- '\"parameters\": ' }}\n {{- tool_call.arguments | tojson }}\n {{- \"}\" }}\n {%- endif %}\n {%- if builtin_tools is defined %}\n {#- This means we're in ipython mode #}\n {{- \"<|eom_id|>\" }}\n {%- else %}\n {{- \"<|eot_id|>\" }}\n {%- endif %}\n {%- elif message.role == \"tool\" or message.role == \"ipython\" %}\n {{- \"<|start_header_id|>ipython<|end_header_id|>\\n\\n\" }}\n {%- if message.content is mapping or message.content is iterable %}\n {{- message.content | tojson }}\n {%- else %}\n {{- message.content }}\n {%- endif %}\n {{- \"<|eot_id|>\" }}\n {%- endif %}\n{%- endfor %}\n{%- if add_generation_prompt %}\n {{- '<|start_header_id|>assistant<|end_header_id|>\\n\\n' }}\n{%- endif %}\n",
2054
  "clean_up_tokenization_spaces": true,
2055
  "eos_token": "<|eot_id|>",
2056
  "extra_special_tokens": {},
 
2050
  }
2051
  },
2052
  "bos_token": "<|begin_of_text|>",
2053
+ "chat_template": "{% if not add_generation_prompt is defined %}{% set add_generation_prompt = false %}{% endif %}{% set loop_messages = messages %}{% for message in loop_messages %}{% set content = '<|start_header_id|>' + message['role'] + '<|end_header_id|>\n\n'+ message['content'] | trim + '<|eot_id|>' %}{% if loop.index0 == 0 %}{% set content = bos_token + content %}{% endif %}{{ content }}{% endfor %}{% if add_generation_prompt %}{{ '<|start_header_id|>assistant<|end_header_id|>\n\n' }}{% endif %}",
2054
  "clean_up_tokenization_spaces": true,
2055
  "eos_token": "<|eot_id|>",
2056
  "extra_special_tokens": {},
trainer_state.json CHANGED
@@ -1,6 +1,6 @@
1
  {
2
- "best_metric": 0.974395215511322,
3
- "best_model_checkpoint": "./outputs/instruct-lora-8b-alpaca-environmental/checkpoint-1600",
4
  "epoch": 1.8870539663815984,
5
  "eval_steps": 20,
6
  "global_step": 1600,
@@ -10,1210 +10,1210 @@
10
  "log_history": [
11
  {
12
  "epoch": 0.0011795930404010617,
13
- "eval_loss": 1.4447940587997437,
14
- "eval_runtime": 66.7471,
15
- "eval_samples_per_second": 22.578,
16
- "eval_steps_per_second": 5.648,
17
  "step": 1
18
  },
19
  {
20
  "epoch": 0.023591860808021232,
21
- "grad_norm": 0.8165745139122009,
22
  "learning_rate": 2.3622047244094487e-06,
23
- "loss": 1.4495,
24
  "step": 20
25
  },
26
  {
27
  "epoch": 0.023591860808021232,
28
- "eval_loss": 1.4427223205566406,
29
- "eval_runtime": 68.7227,
30
- "eval_samples_per_second": 21.929,
31
- "eval_steps_per_second": 5.486,
32
  "step": 20
33
  },
34
  {
35
  "epoch": 0.047183721616042465,
36
- "grad_norm": 0.8174494504928589,
37
  "learning_rate": 4.7244094488188975e-06,
38
- "loss": 1.4899,
39
  "step": 40
40
  },
41
  {
42
  "epoch": 0.047183721616042465,
43
- "eval_loss": 1.4231655597686768,
44
- "eval_runtime": 66.6176,
45
- "eval_samples_per_second": 22.622,
46
- "eval_steps_per_second": 5.659,
47
  "step": 40
48
  },
49
  {
50
  "epoch": 0.0707755824240637,
51
- "grad_norm": 0.9848796129226685,
52
  "learning_rate": 7.086614173228346e-06,
53
- "loss": 1.4016,
54
  "step": 60
55
  },
56
  {
57
  "epoch": 0.0707755824240637,
58
- "eval_loss": 1.3492255210876465,
59
- "eval_runtime": 66.5747,
60
- "eval_samples_per_second": 22.636,
61
- "eval_steps_per_second": 5.663,
62
  "step": 60
63
  },
64
  {
65
  "epoch": 0.09436744323208493,
66
- "grad_norm": 0.9268898367881775,
67
  "learning_rate": 9.448818897637795e-06,
68
- "loss": 1.3283,
69
  "step": 80
70
  },
71
  {
72
  "epoch": 0.09436744323208493,
73
- "eval_loss": 1.2675418853759766,
74
- "eval_runtime": 68.6638,
75
- "eval_samples_per_second": 21.948,
76
- "eval_steps_per_second": 5.491,
77
  "step": 80
78
  },
79
  {
80
  "epoch": 0.11795930404010617,
81
- "grad_norm": 0.9920526742935181,
82
  "learning_rate": 1.1811023622047245e-05,
83
- "loss": 1.2584,
84
  "step": 100
85
  },
86
  {
87
  "epoch": 0.11795930404010617,
88
- "eval_loss": 1.2328431606292725,
89
- "eval_runtime": 66.703,
90
- "eval_samples_per_second": 22.593,
91
- "eval_steps_per_second": 5.652,
92
  "step": 100
93
  },
94
  {
95
  "epoch": 0.1415511648481274,
96
- "grad_norm": 1.0559078454971313,
97
  "learning_rate": 1.4173228346456692e-05,
98
- "loss": 1.2596,
99
  "step": 120
100
  },
101
  {
102
  "epoch": 0.1415511648481274,
103
- "eval_loss": 1.209496259689331,
104
- "eval_runtime": 69.2307,
105
- "eval_samples_per_second": 21.768,
106
- "eval_steps_per_second": 5.446,
107
  "step": 120
108
  },
109
  {
110
  "epoch": 0.16514302565614863,
111
- "grad_norm": 1.0239228010177612,
112
  "learning_rate": 1.6535433070866142e-05,
113
- "loss": 1.2432,
114
  "step": 140
115
  },
116
  {
117
  "epoch": 0.16514302565614863,
118
- "eval_loss": 1.1917829513549805,
119
- "eval_runtime": 66.7215,
120
- "eval_samples_per_second": 22.586,
121
- "eval_steps_per_second": 5.65,
122
  "step": 140
123
  },
124
  {
125
  "epoch": 0.18873488646416986,
126
- "grad_norm": 1.1438844203948975,
127
  "learning_rate": 1.889763779527559e-05,
128
- "loss": 1.2102,
129
  "step": 160
130
  },
131
  {
132
  "epoch": 0.18873488646416986,
133
- "eval_loss": 1.1754366159439087,
134
- "eval_runtime": 66.6395,
135
- "eval_samples_per_second": 22.614,
136
- "eval_steps_per_second": 5.657,
137
  "step": 160
138
  },
139
  {
140
  "epoch": 0.21232674727219109,
141
- "grad_norm": 1.2777637243270874,
142
  "learning_rate": 2.1259842519685038e-05,
143
- "loss": 1.1931,
144
  "step": 180
145
  },
146
  {
147
  "epoch": 0.21232674727219109,
148
- "eval_loss": 1.1629679203033447,
149
- "eval_runtime": 68.7237,
150
- "eval_samples_per_second": 21.928,
151
- "eval_steps_per_second": 5.486,
152
  "step": 180
153
  },
154
  {
155
  "epoch": 0.23591860808021234,
156
- "grad_norm": 1.3225220441818237,
157
  "learning_rate": 2.362204724409449e-05,
158
- "loss": 1.1493,
159
  "step": 200
160
  },
161
  {
162
  "epoch": 0.23591860808021234,
163
- "eval_loss": 1.1514708995819092,
164
- "eval_runtime": 66.7133,
165
- "eval_samples_per_second": 22.589,
166
- "eval_steps_per_second": 5.651,
167
  "step": 200
168
  },
169
  {
170
  "epoch": 0.25951046888823354,
171
- "grad_norm": 1.49991774559021,
172
  "learning_rate": 2.5984251968503937e-05,
173
- "loss": 1.1555,
174
  "step": 220
175
  },
176
  {
177
  "epoch": 0.25951046888823354,
178
- "eval_loss": 1.1435123682022095,
179
- "eval_runtime": 66.74,
180
- "eval_samples_per_second": 22.58,
181
- "eval_steps_per_second": 5.649,
182
  "step": 220
183
  },
184
  {
185
  "epoch": 0.2831023296962548,
186
- "grad_norm": 1.6506001949310303,
187
  "learning_rate": 2.8346456692913385e-05,
188
- "loss": 1.143,
189
  "step": 240
190
  },
191
  {
192
  "epoch": 0.2831023296962548,
193
- "eval_loss": 1.1358726024627686,
194
- "eval_runtime": 66.733,
195
- "eval_samples_per_second": 22.583,
196
- "eval_steps_per_second": 5.649,
197
  "step": 240
198
  },
199
  {
200
  "epoch": 0.30669419050427604,
201
- "grad_norm": 1.5138826370239258,
202
  "learning_rate": 2.9999490518144496e-05,
203
- "loss": 1.1158,
204
  "step": 260
205
  },
206
  {
207
  "epoch": 0.30669419050427604,
208
- "eval_loss": 1.1296896934509277,
209
- "eval_runtime": 66.7403,
210
- "eval_samples_per_second": 22.58,
211
- "eval_steps_per_second": 5.649,
212
  "step": 260
213
  },
214
  {
215
  "epoch": 0.33028605131229727,
216
- "grad_norm": 1.4625916481018066,
217
  "learning_rate": 2.9990434025704478e-05,
218
- "loss": 1.1462,
219
  "step": 280
220
  },
221
  {
222
  "epoch": 0.33028605131229727,
223
- "eval_loss": 1.1224937438964844,
224
- "eval_runtime": 69.052,
225
- "eval_samples_per_second": 21.824,
226
- "eval_steps_per_second": 5.46,
227
  "step": 280
228
  },
229
  {
230
  "epoch": 0.3538779121203185,
231
- "grad_norm": 1.4778045415878296,
232
  "learning_rate": 2.9970063582150774e-05,
233
- "loss": 1.1018,
234
  "step": 300
235
  },
236
  {
237
  "epoch": 0.3538779121203185,
238
- "eval_loss": 1.1171784400939941,
239
- "eval_runtime": 66.7001,
240
- "eval_samples_per_second": 22.594,
241
- "eval_steps_per_second": 5.652,
242
  "step": 300
243
  },
244
  {
245
  "epoch": 0.3774697729283397,
246
- "grad_norm": 1.6671929359436035,
247
  "learning_rate": 2.9938394561968347e-05,
248
- "loss": 1.1069,
249
  "step": 320
250
  },
251
  {
252
  "epoch": 0.3774697729283397,
253
- "eval_loss": 1.1091420650482178,
254
- "eval_runtime": 66.6922,
255
- "eval_samples_per_second": 22.596,
256
- "eval_steps_per_second": 5.653,
257
  "step": 320
258
  },
259
  {
260
  "epoch": 0.40106163373636095,
261
- "grad_norm": 1.5929043292999268,
262
  "learning_rate": 2.9895450867183358e-05,
263
- "loss": 1.0844,
264
  "step": 340
265
  },
266
  {
267
  "epoch": 0.40106163373636095,
268
- "eval_loss": 1.104718565940857,
269
- "eval_runtime": 66.6741,
270
- "eval_samples_per_second": 22.602,
271
- "eval_steps_per_second": 5.654,
272
  "step": 340
273
  },
274
  {
275
  "epoch": 0.42465349454438217,
276
- "grad_norm": 1.6665343046188354,
277
  "learning_rate": 2.9841264909323215e-05,
278
- "loss": 1.039,
279
  "step": 360
280
  },
281
  {
282
  "epoch": 0.42465349454438217,
283
- "eval_loss": 1.101120948791504,
284
- "eval_runtime": 66.7353,
285
- "eval_samples_per_second": 22.582,
286
- "eval_steps_per_second": 5.649,
287
  "step": 360
288
  },
289
  {
290
  "epoch": 0.4482453553524034,
291
- "grad_norm": 1.7163054943084717,
292
  "learning_rate": 2.9775877584954185e-05,
293
- "loss": 1.0731,
294
  "step": 380
295
  },
296
  {
297
  "epoch": 0.4482453553524034,
298
- "eval_loss": 1.0928065776824951,
299
- "eval_runtime": 69.2506,
300
- "eval_samples_per_second": 21.762,
301
- "eval_steps_per_second": 5.444,
302
  "step": 380
303
  },
304
  {
305
  "epoch": 0.4718372161604247,
306
- "grad_norm": 1.6514698266983032,
307
  "learning_rate": 2.9699338244814873e-05,
308
- "loss": 1.0618,
309
  "step": 400
310
  },
311
  {
312
  "epoch": 0.4718372161604247,
313
- "eval_loss": 1.08615243434906,
314
- "eval_runtime": 66.6083,
315
- "eval_samples_per_second": 22.625,
316
- "eval_steps_per_second": 5.66,
317
  "step": 400
318
  },
319
  {
320
  "epoch": 0.4954290769684459,
321
- "grad_norm": 1.761924147605896,
322
  "learning_rate": 2.961170465656906e-05,
323
- "loss": 1.0758,
324
  "step": 420
325
  },
326
  {
327
  "epoch": 0.4954290769684459,
328
- "eval_loss": 1.0836244821548462,
329
- "eval_runtime": 66.6894,
330
- "eval_samples_per_second": 22.597,
331
- "eval_steps_per_second": 5.653,
332
  "step": 420
333
  },
334
  {
335
  "epoch": 0.5190209377764671,
336
- "grad_norm": 1.7449309825897217,
337
  "learning_rate": 2.9513042961205828e-05,
338
- "loss": 1.0697,
339
  "step": 440
340
  },
341
  {
342
  "epoch": 0.5190209377764671,
343
- "eval_loss": 1.0806337594985962,
344
- "eval_runtime": 66.7114,
345
- "eval_samples_per_second": 22.59,
346
- "eval_steps_per_second": 5.651,
347
  "step": 440
348
  },
349
  {
350
  "epoch": 0.5426127985844883,
351
- "grad_norm": 1.73285973072052,
352
  "learning_rate": 2.940342762312002e-05,
353
- "loss": 1.0769,
354
  "step": 460
355
  },
356
  {
357
  "epoch": 0.5426127985844883,
358
- "eval_loss": 1.0765126943588257,
359
- "eval_runtime": 66.7739,
360
- "eval_samples_per_second": 22.569,
361
- "eval_steps_per_second": 5.646,
362
  "step": 460
363
  },
364
  {
365
  "epoch": 0.5662046593925096,
366
- "grad_norm": 1.7008869647979736,
367
  "learning_rate": 2.9282941373910622e-05,
368
- "loss": 1.0406,
369
  "step": 480
370
  },
371
  {
372
  "epoch": 0.5662046593925096,
373
- "eval_loss": 1.0717772245407104,
374
- "eval_runtime": 69.1199,
375
- "eval_samples_per_second": 21.803,
376
- "eval_steps_per_second": 5.454,
377
  "step": 480
378
  },
379
  {
380
  "epoch": 0.5897965202005309,
381
- "grad_norm": 1.6530652046203613,
382
  "learning_rate": 2.915167514993952e-05,
383
- "loss": 1.0416,
384
  "step": 500
385
  },
386
  {
387
  "epoch": 0.5897965202005309,
388
- "eval_loss": 1.0675851106643677,
389
- "eval_runtime": 66.7189,
390
- "eval_samples_per_second": 22.587,
391
- "eval_steps_per_second": 5.651,
392
  "step": 500
393
  },
394
  {
395
  "epoch": 0.6133883810085521,
396
- "grad_norm": 1.788845419883728,
397
  "learning_rate": 2.9009728023697777e-05,
398
- "loss": 1.0509,
399
  "step": 520
400
  },
401
  {
402
  "epoch": 0.6133883810085521,
403
- "eval_loss": 1.065712332725525,
404
- "eval_runtime": 66.738,
405
- "eval_samples_per_second": 22.581,
406
- "eval_steps_per_second": 5.649,
407
  "step": 520
408
  },
409
  {
410
  "epoch": 0.6369802418165733,
411
- "grad_norm": 1.7791155576705933,
412
  "learning_rate": 2.8857207129031153e-05,
413
- "loss": 1.08,
414
  "step": 540
415
  },
416
  {
417
  "epoch": 0.6369802418165733,
418
- "eval_loss": 1.0589417219161987,
419
- "eval_runtime": 66.7425,
420
- "eval_samples_per_second": 22.579,
421
- "eval_steps_per_second": 5.649,
422
  "step": 540
423
  },
424
  {
425
  "epoch": 0.6605721026245945,
426
- "grad_norm": 1.8033630847930908,
427
  "learning_rate": 2.869422758028145e-05,
428
- "loss": 1.0312,
429
  "step": 560
430
  },
431
  {
432
  "epoch": 0.6605721026245945,
433
- "eval_loss": 1.0578253269195557,
434
- "eval_runtime": 66.6865,
435
- "eval_samples_per_second": 22.598,
436
- "eval_steps_per_second": 5.653,
437
  "step": 560
438
  },
439
  {
440
  "epoch": 0.6841639634326158,
441
- "grad_norm": 1.7615036964416504,
442
  "learning_rate": 2.852091238540454e-05,
443
- "loss": 1.0238,
444
  "step": 580
445
  },
446
  {
447
  "epoch": 0.6841639634326158,
448
- "eval_loss": 1.0552713871002197,
449
- "eval_runtime": 69.1593,
450
- "eval_samples_per_second": 21.79,
451
- "eval_steps_per_second": 5.451,
452
  "step": 580
453
  },
454
  {
455
  "epoch": 0.707755824240637,
456
- "grad_norm": 1.6202025413513184,
457
  "learning_rate": 2.8337392353130755e-05,
458
- "loss": 1.0457,
459
  "step": 600
460
  },
461
  {
462
  "epoch": 0.707755824240637,
463
- "eval_loss": 1.0504437685012817,
464
- "eval_runtime": 66.5899,
465
- "eval_samples_per_second": 22.631,
466
- "eval_steps_per_second": 5.662,
467
  "step": 600
468
  },
469
  {
470
  "epoch": 0.7313476850486582,
471
- "grad_norm": 2.028264284133911,
472
  "learning_rate": 2.81438059942377e-05,
473
- "loss": 1.0028,
474
  "step": 620
475
  },
476
  {
477
  "epoch": 0.7313476850486582,
478
- "eval_loss": 1.0460361242294312,
479
- "eval_runtime": 66.6029,
480
- "eval_samples_per_second": 22.627,
481
- "eval_steps_per_second": 5.66,
482
  "step": 620
483
  },
484
  {
485
  "epoch": 0.7549395458566794,
486
- "grad_norm": 1.8573793172836304,
487
  "learning_rate": 2.7940299417009968e-05,
488
- "loss": 1.0268,
489
  "step": 640
490
  },
491
  {
492
  "epoch": 0.7549395458566794,
493
- "eval_loss": 1.0440465211868286,
494
- "eval_runtime": 68.8558,
495
- "eval_samples_per_second": 21.886,
496
- "eval_steps_per_second": 5.475,
497
  "step": 640
498
  },
499
  {
500
  "epoch": 0.7785314066647007,
501
- "grad_norm": 1.7014297246932983,
502
  "learning_rate": 2.772702621696468e-05,
503
- "loss": 0.9977,
504
  "step": 660
505
  },
506
  {
507
  "epoch": 0.7785314066647007,
508
- "eval_loss": 1.0395982265472412,
509
- "eval_runtime": 66.9333,
510
- "eval_samples_per_second": 22.515,
511
- "eval_steps_per_second": 5.632,
512
  "step": 660
513
  },
514
  {
515
  "epoch": 0.8021232674727219,
516
- "grad_norm": 1.8055284023284912,
517
  "learning_rate": 2.7504147360926084e-05,
518
- "loss": 0.9934,
519
  "step": 680
520
  },
521
  {
522
  "epoch": 0.8021232674727219,
523
- "eval_loss": 1.0370361804962158,
524
- "eval_runtime": 68.9181,
525
- "eval_samples_per_second": 21.867,
526
- "eval_steps_per_second": 5.47,
527
  "step": 680
528
  },
529
  {
530
  "epoch": 0.8257151282807431,
531
- "grad_norm": 1.7314211130142212,
532
  "learning_rate": 2.7271831065536684e-05,
533
- "loss": 1.0002,
534
  "step": 700
535
  },
536
  {
537
  "epoch": 0.8257151282807431,
538
- "eval_loss": 1.0348241329193115,
539
- "eval_runtime": 66.5795,
540
- "eval_samples_per_second": 22.635,
541
- "eval_steps_per_second": 5.662,
542
  "step": 700
543
  },
544
  {
545
  "epoch": 0.8493069890887643,
546
- "grad_norm": 1.808159589767456,
547
  "learning_rate": 2.7030252670296612e-05,
548
- "loss": 0.9998,
549
  "step": 720
550
  },
551
  {
552
  "epoch": 0.8493069890887643,
553
- "eval_loss": 1.0329915285110474,
554
- "eval_runtime": 66.5761,
555
- "eval_samples_per_second": 22.636,
556
- "eval_steps_per_second": 5.663,
557
  "step": 720
558
  },
559
  {
560
  "epoch": 0.8728988498967856,
561
- "grad_norm": 1.7294625043869019,
562
  "learning_rate": 2.677959450522709e-05,
563
- "loss": 0.994,
564
  "step": 740
565
  },
566
  {
567
  "epoch": 0.8728988498967856,
568
- "eval_loss": 1.030936360359192,
569
- "eval_runtime": 68.7325,
570
- "eval_samples_per_second": 21.926,
571
- "eval_steps_per_second": 5.485,
572
  "step": 740
573
  },
574
  {
575
  "epoch": 0.8964907107048068,
576
- "grad_norm": 1.8886359930038452,
577
  "learning_rate": 2.6520045753257774e-05,
578
- "loss": 0.9885,
579
  "step": 760
580
  },
581
  {
582
  "epoch": 0.8964907107048068,
583
- "eval_loss": 1.0302257537841797,
584
- "eval_runtime": 66.5876,
585
- "eval_samples_per_second": 22.632,
586
- "eval_steps_per_second": 5.662,
587
  "step": 760
588
  },
589
  {
590
  "epoch": 0.9200825715128281,
591
- "grad_norm": 1.7796871662139893,
592
  "learning_rate": 2.625180230744195e-05,
593
- "loss": 1.0271,
594
  "step": 780
595
  },
596
  {
597
  "epoch": 0.9200825715128281,
598
- "eval_loss": 1.026247262954712,
599
- "eval_runtime": 66.6131,
600
- "eval_samples_per_second": 22.623,
601
- "eval_steps_per_second": 5.66,
602
  "step": 780
603
  },
604
  {
605
  "epoch": 0.9436744323208494,
606
- "grad_norm": 1.790818452835083,
607
  "learning_rate": 2.597506662310728e-05,
608
- "loss": 0.9902,
609
  "step": 800
610
  },
611
  {
612
  "epoch": 0.9436744323208494,
613
- "eval_loss": 1.0263715982437134,
614
- "eval_runtime": 66.5963,
615
- "eval_samples_per_second": 22.629,
616
- "eval_steps_per_second": 5.661,
617
  "step": 800
618
  },
619
  {
620
  "epoch": 0.9672662931288706,
621
- "grad_norm": 2.1395716667175293,
622
  "learning_rate": 2.569004756505373e-05,
623
- "loss": 0.9851,
624
  "step": 820
625
  },
626
  {
627
  "epoch": 0.9672662931288706,
628
- "eval_loss": 1.022589921951294,
629
- "eval_runtime": 66.5965,
630
- "eval_samples_per_second": 22.629,
631
- "eval_steps_per_second": 5.661,
632
  "step": 820
633
  },
634
  {
635
  "epoch": 0.9908581539368918,
636
- "grad_norm": 1.8714855909347534,
637
  "learning_rate": 2.539696024991391e-05,
638
- "loss": 0.9663,
639
  "step": 840
640
  },
641
  {
642
  "epoch": 0.9908581539368918,
643
- "eval_loss": 1.020493984222412,
644
- "eval_runtime": 68.8083,
645
- "eval_samples_per_second": 21.901,
646
- "eval_steps_per_second": 5.479,
647
  "step": 840
648
  },
649
  {
650
  "epoch": 1.0141551164848128,
651
- "grad_norm": 1.8689191341400146,
652
  "learning_rate": 2.5096025883795e-05,
653
- "loss": 0.9774,
654
  "step": 860
655
  },
656
  {
657
  "epoch": 1.0141551164848128,
658
- "eval_loss": 1.0238546133041382,
659
- "eval_runtime": 66.5942,
660
- "eval_samples_per_second": 22.63,
661
- "eval_steps_per_second": 5.661,
662
  "step": 860
663
  },
664
  {
665
  "epoch": 1.037746977292834,
666
- "grad_norm": 1.9778001308441162,
667
  "learning_rate": 2.4787471595324554e-05,
668
- "loss": 0.9166,
669
  "step": 880
670
  },
671
  {
672
  "epoch": 1.037746977292834,
673
- "eval_loss": 1.017867922782898,
674
- "eval_runtime": 66.587,
675
- "eval_samples_per_second": 22.632,
676
- "eval_steps_per_second": 5.662,
677
  "step": 880
678
  },
679
  {
680
  "epoch": 1.0613388381008553,
681
- "grad_norm": 1.9455280303955078,
682
  "learning_rate": 2.447153026422637e-05,
683
- "loss": 0.9147,
684
  "step": 900
685
  },
686
  {
687
  "epoch": 1.0613388381008553,
688
- "eval_loss": 1.0164260864257812,
689
- "eval_runtime": 66.6045,
690
- "eval_samples_per_second": 22.626,
691
- "eval_steps_per_second": 5.66,
692
  "step": 900
693
  },
694
  {
695
  "epoch": 1.0849306989088765,
696
- "grad_norm": 2.014035224914551,
697
  "learning_rate": 2.4148440345555778e-05,
698
- "loss": 0.9121,
699
  "step": 920
700
  },
701
  {
702
  "epoch": 1.0849306989088765,
703
- "eval_loss": 1.019012451171875,
704
- "eval_runtime": 66.5906,
705
- "eval_samples_per_second": 22.631,
706
- "eval_steps_per_second": 5.661,
707
  "step": 920
708
  },
709
  {
710
  "epoch": 1.1085225597168977,
711
- "grad_norm": 2.1933348178863525,
712
  "learning_rate": 2.38184456897269e-05,
713
- "loss": 0.9332,
714
  "step": 940
715
  },
716
  {
717
  "epoch": 1.1085225597168977,
718
- "eval_loss": 1.0168778896331787,
719
- "eval_runtime": 68.9948,
720
- "eval_samples_per_second": 21.842,
721
- "eval_steps_per_second": 5.464,
722
  "step": 940
723
  },
724
  {
725
  "epoch": 1.132114420524919,
726
- "grad_norm": 1.9070005416870117,
727
  "learning_rate": 2.3481795358467866e-05,
728
- "loss": 0.9501,
729
  "step": 960
730
  },
731
  {
732
  "epoch": 1.132114420524919,
733
- "eval_loss": 1.0127308368682861,
734
- "eval_runtime": 66.6279,
735
- "eval_samples_per_second": 22.618,
736
- "eval_steps_per_second": 5.658,
737
  "step": 960
738
  },
739
  {
740
  "epoch": 1.1557062813329402,
741
- "grad_norm": 2.166768789291382,
742
  "learning_rate": 2.3138743436842772e-05,
743
- "loss": 0.9279,
744
  "step": 980
745
  },
746
  {
747
  "epoch": 1.1557062813329402,
748
- "eval_loss": 1.013027548789978,
749
- "eval_runtime": 66.6135,
750
- "eval_samples_per_second": 22.623,
751
- "eval_steps_per_second": 5.66,
752
  "step": 980
753
  },
754
  {
755
  "epoch": 1.1792981421409614,
756
- "grad_norm": 1.9013581275939941,
757
  "learning_rate": 2.278954884148232e-05,
758
- "loss": 0.9343,
759
  "step": 1000
760
  },
761
  {
762
  "epoch": 1.1792981421409614,
763
- "eval_loss": 1.0117987394332886,
764
- "eval_runtime": 66.5962,
765
- "eval_samples_per_second": 22.629,
766
- "eval_steps_per_second": 5.661,
767
  "step": 1000
768
  },
769
  {
770
  "epoch": 1.2028900029489826,
771
- "grad_norm": 1.893983006477356,
772
  "learning_rate": 2.2434475125167866e-05,
773
- "loss": 0.8973,
774
  "step": 1020
775
  },
776
  {
777
  "epoch": 1.2028900029489826,
778
- "eval_loss": 1.009979486465454,
779
- "eval_runtime": 66.6038,
780
- "eval_samples_per_second": 22.626,
781
- "eval_steps_per_second": 5.66,
782
  "step": 1020
783
  },
784
  {
785
  "epoch": 1.2264818637570039,
786
- "grad_norm": 2.000823497772217,
787
  "learning_rate": 2.207379027791632e-05,
788
- "loss": 0.9009,
789
  "step": 1040
790
  },
791
  {
792
  "epoch": 1.2264818637570039,
793
- "eval_loss": 1.006852388381958,
794
- "eval_runtime": 69.1904,
795
- "eval_samples_per_second": 21.78,
796
- "eval_steps_per_second": 5.449,
797
  "step": 1040
798
  },
799
  {
800
  "epoch": 1.250073724565025,
801
- "grad_norm": 2.0272953510284424,
802
  "learning_rate": 2.170776652471611e-05,
803
- "loss": 0.8942,
804
  "step": 1060
805
  },
806
  {
807
  "epoch": 1.250073724565025,
808
- "eval_loss": 1.0058958530426025,
809
- "eval_runtime": 66.5922,
810
- "eval_samples_per_second": 22.63,
811
- "eval_steps_per_second": 5.661,
812
  "step": 1060
813
  },
814
  {
815
  "epoch": 1.2736655853730463,
816
- "grad_norm": 2.306683301925659,
817
  "learning_rate": 2.133668012006682e-05,
818
- "loss": 0.9363,
819
  "step": 1080
820
  },
821
  {
822
  "epoch": 1.2736655853730463,
823
- "eval_loss": 1.0057122707366943,
824
- "eval_runtime": 66.7333,
825
- "eval_samples_per_second": 22.582,
826
- "eval_steps_per_second": 5.649,
827
  "step": 1080
828
  },
829
  {
830
  "epoch": 1.2972574461810675,
831
- "grad_norm": 2.1628775596618652,
832
  "learning_rate": 2.096081113947753e-05,
833
- "loss": 0.9101,
834
  "step": 1100
835
  },
836
  {
837
  "epoch": 1.2972574461810675,
838
- "eval_loss": 1.0064170360565186,
839
- "eval_runtime": 66.5977,
840
- "eval_samples_per_second": 22.628,
841
- "eval_steps_per_second": 5.661,
842
  "step": 1100
843
  },
844
  {
845
  "epoch": 1.3208493069890888,
846
- "grad_norm": 2.1356565952301025,
847
  "learning_rate": 2.058044326808132e-05,
848
- "loss": 0.932,
849
  "step": 1120
850
  },
851
  {
852
  "epoch": 1.3208493069890888,
853
- "eval_loss": 1.0042451620101929,
854
- "eval_runtime": 66.5522,
855
- "eval_samples_per_second": 22.644,
856
- "eval_steps_per_second": 5.665,
857
  "step": 1120
858
  },
859
  {
860
  "epoch": 1.34444116779711,
861
- "grad_norm": 2.054288387298584,
862
  "learning_rate": 2.0195863586525413e-05,
863
- "loss": 0.9156,
864
  "step": 1140
865
  },
866
  {
867
  "epoch": 1.34444116779711,
868
- "eval_loss": 1.002011775970459,
869
- "eval_runtime": 69.2205,
870
- "eval_samples_per_second": 21.771,
871
- "eval_steps_per_second": 5.446,
872
  "step": 1140
873
  },
874
  {
875
  "epoch": 1.3680330286051312,
876
- "grad_norm": 2.2903268337249756,
877
  "learning_rate": 1.9807362354298556e-05,
878
- "loss": 0.9467,
879
  "step": 1160
880
  },
881
  {
882
  "epoch": 1.3680330286051312,
883
- "eval_loss": 1.0025988817214966,
884
- "eval_runtime": 66.6254,
885
- "eval_samples_per_second": 22.619,
886
- "eval_steps_per_second": 5.659,
887
  "step": 1160
888
  },
889
  {
890
  "epoch": 1.3916248894131524,
891
- "grad_norm": 2.107551336288452,
892
  "learning_rate": 1.9415232790659206e-05,
893
- "loss": 0.8872,
894
  "step": 1180
895
  },
896
  {
897
  "epoch": 1.3916248894131524,
898
- "eval_loss": 1.0008505582809448,
899
- "eval_runtime": 66.5499,
900
- "eval_samples_per_second": 22.645,
901
- "eval_steps_per_second": 5.665,
902
  "step": 1180
903
  },
904
  {
905
  "epoch": 1.4152167502211737,
906
- "grad_norm": 2.23716402053833,
907
  "learning_rate": 1.9019770853329856e-05,
908
- "loss": 0.9062,
909
  "step": 1200
910
  },
911
  {
912
  "epoch": 1.4152167502211737,
913
- "eval_loss": 0.998691976070404,
914
- "eval_runtime": 68.7653,
915
- "eval_samples_per_second": 21.915,
916
- "eval_steps_per_second": 5.482,
917
  "step": 1200
918
  },
919
  {
920
  "epoch": 1.4388086110291949,
921
- "grad_norm": 2.1724088191986084,
922
  "learning_rate": 1.8621275015124457e-05,
923
- "loss": 0.8858,
924
  "step": 1220
925
  },
926
  {
927
  "epoch": 1.4388086110291949,
928
- "eval_loss": 0.9982479214668274,
929
- "eval_runtime": 66.6817,
930
- "eval_samples_per_second": 22.6,
931
- "eval_steps_per_second": 5.654,
932
  "step": 1220
933
  },
934
  {
935
  "epoch": 1.462400471837216,
936
- "grad_norm": 2.208951950073242,
937
  "learning_rate": 1.82200460386777e-05,
938
- "loss": 0.9256,
939
  "step": 1240
940
  },
941
  {
942
  "epoch": 1.462400471837216,
943
- "eval_loss": 0.9968158006668091,
944
- "eval_runtime": 66.7301,
945
- "eval_samples_per_second": 22.583,
946
- "eval_steps_per_second": 5.65,
947
  "step": 1240
948
  },
949
  {
950
  "epoch": 1.4859923326452373,
951
- "grad_norm": 2.241866111755371,
952
  "learning_rate": 1.7816386749445935e-05,
953
- "loss": 0.8607,
954
  "step": 1260
955
  },
956
  {
957
  "epoch": 1.4859923326452373,
958
- "eval_loss": 0.996986448764801,
959
- "eval_runtime": 66.687,
960
- "eval_samples_per_second": 22.598,
961
- "eval_steps_per_second": 5.653,
962
  "step": 1260
963
  },
964
  {
965
  "epoch": 1.5095841934532586,
966
- "grad_norm": 2.4940097332000732,
967
  "learning_rate": 1.7410601807151304e-05,
968
- "loss": 0.8896,
969
  "step": 1280
970
  },
971
  {
972
  "epoch": 1.5095841934532586,
973
- "eval_loss": 0.9959249496459961,
974
- "eval_runtime": 66.7445,
975
- "eval_samples_per_second": 22.579,
976
- "eval_steps_per_second": 5.648,
977
  "step": 1280
978
  },
979
  {
980
  "epoch": 1.53317605426128,
981
- "grad_norm": 1.942398190498352,
982
  "learning_rate": 1.700299747584139e-05,
983
- "loss": 0.9061,
984
  "step": 1300
985
  },
986
  {
987
  "epoch": 1.53317605426128,
988
- "eval_loss": 0.9924446940422058,
989
- "eval_runtime": 69.1908,
990
- "eval_samples_per_second": 21.78,
991
- "eval_steps_per_second": 5.449,
992
  "step": 1300
993
  },
994
  {
995
  "epoch": 1.556767915069301,
996
- "grad_norm": 2.2117722034454346,
997
  "learning_rate": 1.659388139273806e-05,
998
- "loss": 0.9147,
999
  "step": 1320
1000
  },
1001
  {
1002
  "epoch": 1.556767915069301,
1003
- "eval_loss": 0.99241042137146,
1004
- "eval_runtime": 66.5596,
1005
- "eval_samples_per_second": 22.641,
1006
- "eval_steps_per_second": 5.664,
1007
  "step": 1320
1008
  },
1009
  {
1010
  "epoch": 1.5803597758773225,
1011
- "grad_norm": 2.4062092304229736,
1012
  "learning_rate": 1.6183562336049867e-05,
1013
- "loss": 0.9045,
1014
  "step": 1340
1015
  },
1016
  {
1017
  "epoch": 1.5803597758773225,
1018
- "eval_loss": 0.9884071350097656,
1019
- "eval_runtime": 66.617,
1020
- "eval_samples_per_second": 22.622,
1021
- "eval_steps_per_second": 5.659,
1022
  "step": 1340
1023
  },
1024
  {
1025
  "epoch": 1.6039516366853435,
1026
- "grad_norm": 2.1194331645965576,
1027
  "learning_rate": 1.5772349991923366e-05,
1028
- "loss": 0.8937,
1029
  "step": 1360
1030
  },
1031
  {
1032
  "epoch": 1.6039516366853435,
1033
- "eval_loss": 0.9872897863388062,
1034
- "eval_runtime": 66.666,
1035
- "eval_samples_per_second": 22.605,
1036
- "eval_steps_per_second": 5.655,
1037
  "step": 1360
1038
  },
1039
  {
1040
  "epoch": 1.627543497493365,
1041
- "grad_norm": 2.1357710361480713,
1042
  "learning_rate": 1.536055472070907e-05,
1043
- "loss": 0.914,
1044
  "step": 1380
1045
  },
1046
  {
1047
  "epoch": 1.627543497493365,
1048
- "eval_loss": 0.9874758720397949,
1049
- "eval_runtime": 66.7002,
1050
- "eval_samples_per_second": 22.594,
1051
- "eval_steps_per_second": 5.652,
1052
  "step": 1380
1053
  },
1054
  {
1055
  "epoch": 1.651135358301386,
1056
- "grad_norm": 2.210505962371826,
1057
  "learning_rate": 1.4948487322718669e-05,
1058
- "loss": 0.8841,
1059
  "step": 1400
1060
  },
1061
  {
1062
  "epoch": 1.651135358301386,
1063
- "eval_loss": 0.9857823252677917,
1064
- "eval_runtime": 69.526,
1065
- "eval_samples_per_second": 21.675,
1066
- "eval_steps_per_second": 5.422,
1067
  "step": 1400
1068
  },
1069
  {
1070
  "epoch": 1.6747272191094074,
1071
- "grad_norm": 2.2325799465179443,
1072
  "learning_rate": 1.4536458803650085e-05,
1073
- "loss": 0.861,
1074
  "step": 1420
1075
  },
1076
  {
1077
  "epoch": 1.6747272191094074,
1078
- "eval_loss": 0.9860907793045044,
1079
- "eval_runtime": 66.719,
1080
- "eval_samples_per_second": 22.587,
1081
- "eval_steps_per_second": 5.651,
1082
  "step": 1420
1083
  },
1084
  {
1085
  "epoch": 1.6983190799174284,
1086
- "grad_norm": 2.1073429584503174,
1087
  "learning_rate": 1.4124780139857582e-05,
1088
- "loss": 0.9254,
1089
  "step": 1440
1090
  },
1091
  {
1092
  "epoch": 1.6983190799174284,
1093
- "eval_loss": 0.9815816283226013,
1094
- "eval_runtime": 66.7493,
1095
- "eval_samples_per_second": 22.577,
1096
- "eval_steps_per_second": 5.648,
1097
  "step": 1440
1098
  },
1099
  {
1100
  "epoch": 1.7219109407254498,
1101
- "grad_norm": 2.432131767272949,
1102
  "learning_rate": 1.3713762043644008e-05,
1103
- "loss": 0.8917,
1104
  "step": 1460
1105
  },
1106
  {
1107
  "epoch": 1.7219109407254498,
1108
- "eval_loss": 0.9828724265098572,
1109
- "eval_runtime": 66.7104,
1110
- "eval_samples_per_second": 22.59,
1111
- "eval_steps_per_second": 5.651,
1112
  "step": 1460
1113
  },
1114
  {
1115
  "epoch": 1.7455028015334708,
1116
- "grad_norm": 2.2178120613098145,
1117
  "learning_rate": 1.3303714728752293e-05,
1118
- "loss": 0.8695,
1119
  "step": 1480
1120
  },
1121
  {
1122
  "epoch": 1.7455028015334708,
1123
- "eval_loss": 0.9821544289588928,
1124
- "eval_runtime": 66.7271,
1125
- "eval_samples_per_second": 22.585,
1126
- "eval_steps_per_second": 5.65,
1127
  "step": 1480
1128
  },
1129
  {
1130
  "epoch": 1.7690946623414923,
1131
- "grad_norm": 2.3081140518188477,
1132
  "learning_rate": 1.2894947676233291e-05,
1133
- "loss": 0.8922,
1134
  "step": 1500
1135
  },
1136
  {
1137
  "epoch": 1.7690946623414923,
1138
- "eval_loss": 0.9805226922035217,
1139
- "eval_runtime": 69.3053,
1140
- "eval_samples_per_second": 21.744,
1141
- "eval_steps_per_second": 5.44,
1142
  "step": 1500
1143
  },
1144
  {
1145
  "epoch": 1.7926865231495133,
1146
- "grad_norm": 2.408884048461914,
1147
  "learning_rate": 1.2487769400866573e-05,
1148
- "loss": 0.8727,
1149
  "step": 1520
1150
  },
1151
  {
1152
  "epoch": 1.7926865231495133,
1153
- "eval_loss": 0.9798446893692017,
1154
- "eval_runtime": 66.7518,
1155
- "eval_samples_per_second": 22.576,
1156
- "eval_steps_per_second": 5.648,
1157
  "step": 1520
1158
  },
1159
  {
1160
  "epoch": 1.8162783839575347,
1161
- "grad_norm": 2.334815502166748,
1162
  "learning_rate": 1.2082487218310524e-05,
1163
- "loss": 0.9015,
1164
  "step": 1540
1165
  },
1166
  {
1167
  "epoch": 1.8162783839575347,
1168
- "eval_loss": 0.9793778657913208,
1169
- "eval_runtime": 66.6631,
1170
- "eval_samples_per_second": 22.606,
1171
- "eval_steps_per_second": 5.655,
1172
  "step": 1540
1173
  },
1174
  {
1175
  "epoch": 1.8398702447655557,
1176
- "grad_norm": 2.2518022060394287,
1177
  "learning_rate": 1.1679407013157457e-05,
1178
- "loss": 0.9064,
1179
  "step": 1560
1180
  },
1181
  {
1182
  "epoch": 1.8398702447655557,
1183
- "eval_loss": 0.9765506982803345,
1184
- "eval_runtime": 66.5449,
1185
- "eval_samples_per_second": 22.646,
1186
- "eval_steps_per_second": 5.665,
1187
  "step": 1560
1188
  },
1189
  {
1190
  "epoch": 1.8634621055735772,
1191
- "grad_norm": 2.1811118125915527,
1192
  "learning_rate": 1.1278833008068863e-05,
1193
- "loss": 0.883,
1194
  "step": 1580
1195
  },
1196
  {
1197
  "epoch": 1.8634621055735772,
1198
- "eval_loss": 0.9749047756195068,
1199
- "eval_runtime": 66.5689,
1200
- "eval_samples_per_second": 22.638,
1201
- "eval_steps_per_second": 5.663,
1202
  "step": 1580
1203
  },
1204
  {
1205
  "epoch": 1.8870539663815984,
1206
- "grad_norm": 2.1696884632110596,
1207
  "learning_rate": 1.088106753416491e-05,
1208
- "loss": 0.903,
1209
  "step": 1600
1210
  },
1211
  {
1212
  "epoch": 1.8870539663815984,
1213
- "eval_loss": 0.974395215511322,
1214
- "eval_runtime": 69.1351,
1215
- "eval_samples_per_second": 21.798,
1216
- "eval_steps_per_second": 5.453,
1217
  "step": 1600
1218
  }
1219
  ],
@@ -1243,7 +1243,7 @@
1243
  "attributes": {}
1244
  }
1245
  },
1246
- "total_flos": 4.2037767804184166e+17,
1247
  "train_batch_size": 4,
1248
  "trial_name": null,
1249
  "trial_params": null
 
1
  {
2
+ "best_metric": 0.9725916385650635,
3
+ "best_model_checkpoint": "./outputs/instruct-lora-8b-aplly_chat_template-environmental/checkpoint-1600",
4
  "epoch": 1.8870539663815984,
5
  "eval_steps": 20,
6
  "global_step": 1600,
 
10
  "log_history": [
11
  {
12
  "epoch": 0.0011795930404010617,
13
+ "eval_loss": 1.42765212059021,
14
+ "eval_runtime": 63.0401,
15
+ "eval_samples_per_second": 23.905,
16
+ "eval_steps_per_second": 5.98,
17
  "step": 1
18
  },
19
  {
20
  "epoch": 0.023591860808021232,
21
+ "grad_norm": 0.8140115737915039,
22
  "learning_rate": 2.3622047244094487e-06,
23
+ "loss": 1.4383,
24
  "step": 20
25
  },
26
  {
27
  "epoch": 0.023591860808021232,
28
+ "eval_loss": 1.4257409572601318,
29
+ "eval_runtime": 63.0141,
30
+ "eval_samples_per_second": 23.915,
31
+ "eval_steps_per_second": 5.983,
32
  "step": 20
33
  },
34
  {
35
  "epoch": 0.047183721616042465,
36
+ "grad_norm": 0.8540558218955994,
37
  "learning_rate": 4.7244094488188975e-06,
38
+ "loss": 1.4736,
39
  "step": 40
40
  },
41
  {
42
  "epoch": 0.047183721616042465,
43
+ "eval_loss": 1.4058444499969482,
44
+ "eval_runtime": 65.5526,
45
+ "eval_samples_per_second": 22.989,
46
+ "eval_steps_per_second": 5.751,
47
  "step": 40
48
  },
49
  {
50
  "epoch": 0.0707755824240637,
51
+ "grad_norm": 0.9564130902290344,
52
  "learning_rate": 7.086614173228346e-06,
53
+ "loss": 1.3855,
54
  "step": 60
55
  },
56
  {
57
  "epoch": 0.0707755824240637,
58
+ "eval_loss": 1.3293768167495728,
59
+ "eval_runtime": 62.9854,
60
+ "eval_samples_per_second": 23.926,
61
+ "eval_steps_per_second": 5.986,
62
  "step": 60
63
  },
64
  {
65
  "epoch": 0.09436744323208493,
66
+ "grad_norm": 0.9375326037406921,
67
  "learning_rate": 9.448818897637795e-06,
68
+ "loss": 1.3151,
69
  "step": 80
70
  },
71
  {
72
  "epoch": 0.09436744323208493,
73
+ "eval_loss": 1.256630301475525,
74
+ "eval_runtime": 62.9741,
75
+ "eval_samples_per_second": 23.93,
76
+ "eval_steps_per_second": 5.987,
77
  "step": 80
78
  },
79
  {
80
  "epoch": 0.11795930404010617,
81
+ "grad_norm": 0.9875860810279846,
82
  "learning_rate": 1.1811023622047245e-05,
83
+ "loss": 1.2527,
84
  "step": 100
85
  },
86
  {
87
  "epoch": 0.11795930404010617,
88
+ "eval_loss": 1.2264838218688965,
89
+ "eval_runtime": 65.3152,
90
+ "eval_samples_per_second": 23.073,
91
+ "eval_steps_per_second": 5.772,
92
  "step": 100
93
  },
94
  {
95
  "epoch": 0.1415511648481274,
96
+ "grad_norm": 1.0547633171081543,
97
  "learning_rate": 1.4173228346456692e-05,
98
+ "loss": 1.2557,
99
  "step": 120
100
  },
101
  {
102
  "epoch": 0.1415511648481274,
103
+ "eval_loss": 1.2046794891357422,
104
+ "eval_runtime": 62.9226,
105
+ "eval_samples_per_second": 23.95,
106
+ "eval_steps_per_second": 5.991,
107
  "step": 120
108
  },
109
  {
110
  "epoch": 0.16514302565614863,
111
+ "grad_norm": 1.010538101196289,
112
  "learning_rate": 1.6535433070866142e-05,
113
+ "loss": 1.2405,
114
  "step": 140
115
  },
116
  {
117
  "epoch": 0.16514302565614863,
118
+ "eval_loss": 1.188104271888733,
119
+ "eval_runtime": 62.9407,
120
+ "eval_samples_per_second": 23.943,
121
+ "eval_steps_per_second": 5.99,
122
  "step": 140
123
  },
124
  {
125
  "epoch": 0.18873488646416986,
126
+ "grad_norm": 1.1231751441955566,
127
  "learning_rate": 1.889763779527559e-05,
128
+ "loss": 1.2074,
129
  "step": 160
130
  },
131
  {
132
  "epoch": 0.18873488646416986,
133
+ "eval_loss": 1.1720376014709473,
134
+ "eval_runtime": 62.9691,
135
+ "eval_samples_per_second": 23.932,
136
+ "eval_steps_per_second": 5.987,
137
  "step": 160
138
  },
139
  {
140
  "epoch": 0.21232674727219109,
141
+ "grad_norm": 1.2803903818130493,
142
  "learning_rate": 2.1259842519685038e-05,
143
+ "loss": 1.1897,
144
  "step": 180
145
  },
146
  {
147
  "epoch": 0.21232674727219109,
148
+ "eval_loss": 1.1597559452056885,
149
+ "eval_runtime": 63.1045,
150
+ "eval_samples_per_second": 23.881,
151
+ "eval_steps_per_second": 5.974,
152
  "step": 180
153
  },
154
  {
155
  "epoch": 0.23591860808021234,
156
+ "grad_norm": 1.2758204936981201,
157
  "learning_rate": 2.362204724409449e-05,
158
+ "loss": 1.145,
159
  "step": 200
160
  },
161
  {
162
  "epoch": 0.23591860808021234,
163
+ "eval_loss": 1.1493200063705444,
164
+ "eval_runtime": 65.8866,
165
+ "eval_samples_per_second": 22.873,
166
+ "eval_steps_per_second": 5.722,
167
  "step": 200
168
  },
169
  {
170
  "epoch": 0.25951046888823354,
171
+ "grad_norm": 1.517013430595398,
172
  "learning_rate": 2.5984251968503937e-05,
173
+ "loss": 1.1508,
174
  "step": 220
175
  },
176
  {
177
  "epoch": 0.25951046888823354,
178
+ "eval_loss": 1.1411106586456299,
179
+ "eval_runtime": 62.986,
180
+ "eval_samples_per_second": 23.926,
181
+ "eval_steps_per_second": 5.985,
182
  "step": 220
183
  },
184
  {
185
  "epoch": 0.2831023296962548,
186
+ "grad_norm": 1.6017550230026245,
187
  "learning_rate": 2.8346456692913385e-05,
188
+ "loss": 1.1406,
189
  "step": 240
190
  },
191
  {
192
  "epoch": 0.2831023296962548,
193
+ "eval_loss": 1.1336663961410522,
194
+ "eval_runtime": 62.9587,
195
+ "eval_samples_per_second": 23.936,
196
+ "eval_steps_per_second": 5.988,
197
  "step": 240
198
  },
199
  {
200
  "epoch": 0.30669419050427604,
201
+ "grad_norm": 1.5281150341033936,
202
  "learning_rate": 2.9999490518144496e-05,
203
+ "loss": 1.1156,
204
  "step": 260
205
  },
206
  {
207
  "epoch": 0.30669419050427604,
208
+ "eval_loss": 1.1270569562911987,
209
+ "eval_runtime": 66.1576,
210
+ "eval_samples_per_second": 22.779,
211
+ "eval_steps_per_second": 5.699,
212
  "step": 260
213
  },
214
  {
215
  "epoch": 0.33028605131229727,
216
+ "grad_norm": 1.4530911445617676,
217
  "learning_rate": 2.9990434025704478e-05,
218
+ "loss": 1.1439,
219
  "step": 280
220
  },
221
  {
222
  "epoch": 0.33028605131229727,
223
+ "eval_loss": 1.118715524673462,
224
+ "eval_runtime": 62.9289,
225
+ "eval_samples_per_second": 23.948,
226
+ "eval_steps_per_second": 5.991,
227
  "step": 280
228
  },
229
  {
230
  "epoch": 0.3538779121203185,
231
+ "grad_norm": 1.4522110223770142,
232
  "learning_rate": 2.9970063582150774e-05,
233
+ "loss": 1.0991,
234
  "step": 300
235
  },
236
  {
237
  "epoch": 0.3538779121203185,
238
+ "eval_loss": 1.1142727136611938,
239
+ "eval_runtime": 62.9463,
240
+ "eval_samples_per_second": 23.941,
241
+ "eval_steps_per_second": 5.989,
242
  "step": 300
243
  },
244
  {
245
  "epoch": 0.3774697729283397,
246
+ "grad_norm": 1.6753257513046265,
247
  "learning_rate": 2.9938394561968347e-05,
248
+ "loss": 1.1037,
249
  "step": 320
250
  },
251
  {
252
  "epoch": 0.3774697729283397,
253
+ "eval_loss": 1.1066044569015503,
254
+ "eval_runtime": 62.9455,
255
+ "eval_samples_per_second": 23.941,
256
+ "eval_steps_per_second": 5.989,
257
  "step": 320
258
  },
259
  {
260
  "epoch": 0.40106163373636095,
261
+ "grad_norm": 1.5857524871826172,
262
  "learning_rate": 2.9895450867183358e-05,
263
+ "loss": 1.0821,
264
  "step": 340
265
  },
266
  {
267
  "epoch": 0.40106163373636095,
268
+ "eval_loss": 1.1023849248886108,
269
+ "eval_runtime": 62.9815,
270
+ "eval_samples_per_second": 23.928,
271
+ "eval_steps_per_second": 5.986,
272
  "step": 340
273
  },
274
  {
275
  "epoch": 0.42465349454438217,
276
+ "grad_norm": 1.6321624517440796,
277
  "learning_rate": 2.9841264909323215e-05,
278
+ "loss": 1.0355,
279
  "step": 360
280
  },
281
  {
282
  "epoch": 0.42465349454438217,
283
+ "eval_loss": 1.0976252555847168,
284
+ "eval_runtime": 63.0759,
285
+ "eval_samples_per_second": 23.892,
286
+ "eval_steps_per_second": 5.977,
287
  "step": 360
288
  },
289
  {
290
  "epoch": 0.4482453553524034,
291
+ "grad_norm": 1.7007124423980713,
292
  "learning_rate": 2.9775877584954185e-05,
293
+ "loss": 1.0705,
294
  "step": 380
295
  },
296
  {
297
  "epoch": 0.4482453553524034,
298
+ "eval_loss": 1.0898144245147705,
299
+ "eval_runtime": 63.0529,
300
+ "eval_samples_per_second": 23.901,
301
+ "eval_steps_per_second": 5.979,
302
  "step": 380
303
  },
304
  {
305
  "epoch": 0.4718372161604247,
306
+ "grad_norm": 1.6532444953918457,
307
  "learning_rate": 2.9699338244814873e-05,
308
+ "loss": 1.058,
309
  "step": 400
310
  },
311
  {
312
  "epoch": 0.4718372161604247,
313
+ "eval_loss": 1.0839428901672363,
314
+ "eval_runtime": 63.0318,
315
+ "eval_samples_per_second": 23.909,
316
+ "eval_steps_per_second": 5.981,
317
  "step": 400
318
  },
319
  {
320
  "epoch": 0.4954290769684459,
321
+ "grad_norm": 1.7736274003982544,
322
  "learning_rate": 2.961170465656906e-05,
323
+ "loss": 1.073,
324
  "step": 420
325
  },
326
  {
327
  "epoch": 0.4954290769684459,
328
+ "eval_loss": 1.0811110734939575,
329
+ "eval_runtime": 65.7766,
330
+ "eval_samples_per_second": 22.911,
331
+ "eval_steps_per_second": 5.732,
332
  "step": 420
333
  },
334
  {
335
  "epoch": 0.5190209377764671,
336
+ "grad_norm": 1.7278027534484863,
337
  "learning_rate": 2.9513042961205828e-05,
338
+ "loss": 1.0669,
339
  "step": 440
340
  },
341
  {
342
  "epoch": 0.5190209377764671,
343
+ "eval_loss": 1.0773712396621704,
344
+ "eval_runtime": 63.1642,
345
+ "eval_samples_per_second": 23.858,
346
+ "eval_steps_per_second": 5.969,
347
  "step": 440
348
  },
349
  {
350
  "epoch": 0.5426127985844883,
351
+ "grad_norm": 1.7342020273208618,
352
  "learning_rate": 2.940342762312002e-05,
353
+ "loss": 1.0742,
354
  "step": 460
355
  },
356
  {
357
  "epoch": 0.5426127985844883,
358
+ "eval_loss": 1.07448410987854,
359
+ "eval_runtime": 63.1172,
360
+ "eval_samples_per_second": 23.876,
361
+ "eval_steps_per_second": 5.973,
362
  "step": 460
363
  },
364
  {
365
  "epoch": 0.5662046593925096,
366
+ "grad_norm": 1.688236117362976,
367
  "learning_rate": 2.9282941373910622e-05,
368
+ "loss": 1.0391,
369
  "step": 480
370
  },
371
  {
372
  "epoch": 0.5662046593925096,
373
+ "eval_loss": 1.0696014165878296,
374
+ "eval_runtime": 63.5007,
375
+ "eval_samples_per_second": 23.732,
376
+ "eval_steps_per_second": 5.937,
377
  "step": 480
378
  },
379
  {
380
  "epoch": 0.5897965202005309,
381
+ "grad_norm": 1.6653029918670654,
382
  "learning_rate": 2.915167514993952e-05,
383
+ "loss": 1.0388,
384
  "step": 500
385
  },
386
  {
387
  "epoch": 0.5897965202005309,
388
+ "eval_loss": 1.0648998022079468,
389
+ "eval_runtime": 63.0976,
390
+ "eval_samples_per_second": 23.884,
391
+ "eval_steps_per_second": 5.975,
392
  "step": 500
393
  },
394
  {
395
  "epoch": 0.6133883810085521,
396
+ "grad_norm": 1.7940328121185303,
397
  "learning_rate": 2.9009728023697777e-05,
398
+ "loss": 1.0483,
399
  "step": 520
400
  },
401
  {
402
  "epoch": 0.6133883810085521,
403
+ "eval_loss": 1.0635266304016113,
404
+ "eval_runtime": 63.1023,
405
+ "eval_samples_per_second": 23.882,
406
+ "eval_steps_per_second": 5.974,
407
  "step": 520
408
  },
409
  {
410
  "epoch": 0.6369802418165733,
411
+ "grad_norm": 1.7853456735610962,
412
  "learning_rate": 2.8857207129031153e-05,
413
+ "loss": 1.0767,
414
  "step": 540
415
  },
416
  {
417
  "epoch": 0.6369802418165733,
418
+ "eval_loss": 1.0566504001617432,
419
+ "eval_runtime": 63.0964,
420
+ "eval_samples_per_second": 23.884,
421
+ "eval_steps_per_second": 5.975,
422
  "step": 540
423
  },
424
  {
425
  "epoch": 0.6605721026245945,
426
+ "grad_norm": 1.8145803213119507,
427
  "learning_rate": 2.869422758028145e-05,
428
+ "loss": 1.0273,
429
  "step": 560
430
  },
431
  {
432
  "epoch": 0.6605721026245945,
433
+ "eval_loss": 1.0557910203933716,
434
+ "eval_runtime": 63.1078,
435
+ "eval_samples_per_second": 23.88,
436
+ "eval_steps_per_second": 5.974,
437
  "step": 560
438
  },
439
  {
440
  "epoch": 0.6841639634326158,
441
+ "grad_norm": 1.7679259777069092,
442
  "learning_rate": 2.852091238540454e-05,
443
+ "loss": 1.021,
444
  "step": 580
445
  },
446
  {
447
  "epoch": 0.6841639634326158,
448
+ "eval_loss": 1.0533658266067505,
449
+ "eval_runtime": 65.8301,
450
+ "eval_samples_per_second": 22.892,
451
+ "eval_steps_per_second": 5.727,
452
  "step": 580
453
  },
454
  {
455
  "epoch": 0.707755824240637,
456
+ "grad_norm": 1.6286741495132446,
457
  "learning_rate": 2.8337392353130755e-05,
458
+ "loss": 1.0429,
459
  "step": 600
460
  },
461
  {
462
  "epoch": 0.707755824240637,
463
+ "eval_loss": 1.0482341051101685,
464
+ "eval_runtime": 63.1283,
465
+ "eval_samples_per_second": 23.872,
466
+ "eval_steps_per_second": 5.972,
467
  "step": 600
468
  },
469
  {
470
  "epoch": 0.7313476850486582,
471
+ "grad_norm": 2.0246284008026123,
472
  "learning_rate": 2.81438059942377e-05,
473
+ "loss": 1.001,
474
  "step": 620
475
  },
476
  {
477
  "epoch": 0.7313476850486582,
478
+ "eval_loss": 1.0442626476287842,
479
+ "eval_runtime": 63.0773,
480
+ "eval_samples_per_second": 23.891,
481
+ "eval_steps_per_second": 5.977,
482
  "step": 620
483
  },
484
  {
485
  "epoch": 0.7549395458566794,
486
+ "grad_norm": 1.8399453163146973,
487
  "learning_rate": 2.7940299417009968e-05,
488
+ "loss": 1.0257,
489
  "step": 640
490
  },
491
  {
492
  "epoch": 0.7549395458566794,
493
+ "eval_loss": 1.0410016775131226,
494
+ "eval_runtime": 66.0639,
495
+ "eval_samples_per_second": 22.811,
496
+ "eval_steps_per_second": 5.707,
497
  "step": 640
498
  },
499
  {
500
  "epoch": 0.7785314066647007,
501
+ "grad_norm": 1.7166261672973633,
502
  "learning_rate": 2.772702621696468e-05,
503
+ "loss": 0.9959,
504
  "step": 660
505
  },
506
  {
507
  "epoch": 0.7785314066647007,
508
+ "eval_loss": 1.036692500114441,
509
+ "eval_runtime": 62.9935,
510
+ "eval_samples_per_second": 23.923,
511
+ "eval_steps_per_second": 5.985,
512
  "step": 660
513
  },
514
  {
515
  "epoch": 0.8021232674727219,
516
+ "grad_norm": 1.8086529970169067,
517
  "learning_rate": 2.7504147360926084e-05,
518
+ "loss": 0.9912,
519
  "step": 680
520
  },
521
  {
522
  "epoch": 0.8021232674727219,
523
+ "eval_loss": 1.0342631340026855,
524
+ "eval_runtime": 62.9732,
525
+ "eval_samples_per_second": 23.931,
526
+ "eval_steps_per_second": 5.987,
527
  "step": 680
528
  },
529
  {
530
  "epoch": 0.8257151282807431,
531
+ "grad_norm": 1.7481584548950195,
532
  "learning_rate": 2.7271831065536684e-05,
533
+ "loss": 0.9986,
534
  "step": 700
535
  },
536
  {
537
  "epoch": 0.8257151282807431,
538
+ "eval_loss": 1.0320111513137817,
539
+ "eval_runtime": 63.187,
540
+ "eval_samples_per_second": 23.85,
541
+ "eval_steps_per_second": 5.966,
542
  "step": 700
543
  },
544
  {
545
  "epoch": 0.8493069890887643,
546
+ "grad_norm": 1.8035798072814941,
547
  "learning_rate": 2.7030252670296612e-05,
548
+ "loss": 0.9972,
549
  "step": 720
550
  },
551
  {
552
  "epoch": 0.8493069890887643,
553
+ "eval_loss": 1.0306118726730347,
554
+ "eval_runtime": 62.9945,
555
+ "eval_samples_per_second": 23.923,
556
+ "eval_steps_per_second": 5.985,
557
  "step": 720
558
  },
559
  {
560
  "epoch": 0.8728988498967856,
561
+ "grad_norm": 1.7504149675369263,
562
  "learning_rate": 2.677959450522709e-05,
563
+ "loss": 0.9923,
564
  "step": 740
565
  },
566
  {
567
  "epoch": 0.8728988498967856,
568
+ "eval_loss": 1.028536081314087,
569
+ "eval_runtime": 66.0048,
570
+ "eval_samples_per_second": 22.832,
571
+ "eval_steps_per_second": 5.712,
572
  "step": 740
573
  },
574
  {
575
  "epoch": 0.8964907107048068,
576
+ "grad_norm": 1.9125969409942627,
577
  "learning_rate": 2.6520045753257774e-05,
578
+ "loss": 0.9862,
579
  "step": 760
580
  },
581
  {
582
  "epoch": 0.8964907107048068,
583
+ "eval_loss": 1.0277767181396484,
584
+ "eval_runtime": 62.8849,
585
+ "eval_samples_per_second": 23.964,
586
+ "eval_steps_per_second": 5.995,
587
  "step": 760
588
  },
589
  {
590
  "epoch": 0.9200825715128281,
591
+ "grad_norm": 1.7713780403137207,
592
  "learning_rate": 2.625180230744195e-05,
593
+ "loss": 1.0248,
594
  "step": 780
595
  },
596
  {
597
  "epoch": 0.9200825715128281,
598
+ "eval_loss": 1.024271845817566,
599
+ "eval_runtime": 62.9468,
600
+ "eval_samples_per_second": 23.941,
601
+ "eval_steps_per_second": 5.989,
602
  "step": 780
603
  },
604
  {
605
  "epoch": 0.9436744323208494,
606
+ "grad_norm": 1.794228196144104,
607
  "learning_rate": 2.597506662310728e-05,
608
+ "loss": 0.9898,
609
  "step": 800
610
  },
611
  {
612
  "epoch": 0.9436744323208494,
613
+ "eval_loss": 1.024512767791748,
614
+ "eval_runtime": 65.8042,
615
+ "eval_samples_per_second": 22.901,
616
+ "eval_steps_per_second": 5.729,
617
  "step": 800
618
  },
619
  {
620
  "epoch": 0.9672662931288706,
621
+ "grad_norm": 2.150176525115967,
622
  "learning_rate": 2.569004756505373e-05,
623
+ "loss": 0.9838,
624
  "step": 820
625
  },
626
  {
627
  "epoch": 0.9672662931288706,
628
+ "eval_loss": 1.0203757286071777,
629
+ "eval_runtime": 63.2378,
630
+ "eval_samples_per_second": 23.831,
631
+ "eval_steps_per_second": 5.962,
632
  "step": 820
633
  },
634
  {
635
  "epoch": 0.9908581539368918,
636
+ "grad_norm": 1.892907977104187,
637
  "learning_rate": 2.539696024991391e-05,
638
+ "loss": 0.9655,
639
  "step": 840
640
  },
641
  {
642
  "epoch": 0.9908581539368918,
643
+ "eval_loss": 1.0187581777572632,
644
+ "eval_runtime": 62.8975,
645
+ "eval_samples_per_second": 23.96,
646
+ "eval_steps_per_second": 5.994,
647
  "step": 840
648
  },
649
  {
650
  "epoch": 1.0141551164848128,
651
+ "grad_norm": 1.8649617433547974,
652
  "learning_rate": 2.5096025883795e-05,
653
+ "loss": 0.9747,
654
  "step": 860
655
  },
656
  {
657
  "epoch": 1.0141551164848128,
658
+ "eval_loss": 1.0219627618789673,
659
+ "eval_runtime": 62.8985,
660
+ "eval_samples_per_second": 23.959,
661
+ "eval_steps_per_second": 5.994,
662
  "step": 860
663
  },
664
  {
665
  "epoch": 1.037746977292834,
666
+ "grad_norm": 1.9797245264053345,
667
  "learning_rate": 2.4787471595324554e-05,
668
+ "loss": 0.9133,
669
  "step": 880
670
  },
671
  {
672
  "epoch": 1.037746977292834,
673
+ "eval_loss": 1.0162080526351929,
674
+ "eval_runtime": 62.9338,
675
+ "eval_samples_per_second": 23.946,
676
+ "eval_steps_per_second": 5.99,
677
  "step": 880
678
  },
679
  {
680
  "epoch": 1.0613388381008553,
681
+ "grad_norm": 1.9416215419769287,
682
  "learning_rate": 2.447153026422637e-05,
683
+ "loss": 0.9122,
684
  "step": 900
685
  },
686
  {
687
  "epoch": 1.0613388381008553,
688
+ "eval_loss": 1.014188528060913,
689
+ "eval_runtime": 62.9073,
690
+ "eval_samples_per_second": 23.956,
691
+ "eval_steps_per_second": 5.993,
692
  "step": 900
693
  },
694
  {
695
  "epoch": 1.0849306989088765,
696
+ "grad_norm": 2.022336721420288,
697
  "learning_rate": 2.4148440345555778e-05,
698
+ "loss": 0.9089,
699
  "step": 920
700
  },
701
  {
702
  "epoch": 1.0849306989088765,
703
+ "eval_loss": 1.0171178579330444,
704
+ "eval_runtime": 62.9354,
705
+ "eval_samples_per_second": 23.945,
706
+ "eval_steps_per_second": 5.99,
707
  "step": 920
708
  },
709
  {
710
  "epoch": 1.1085225597168977,
711
+ "grad_norm": 2.2142956256866455,
712
  "learning_rate": 2.38184456897269e-05,
713
+ "loss": 0.9315,
714
  "step": 940
715
  },
716
  {
717
  "epoch": 1.1085225597168977,
718
+ "eval_loss": 1.0155071020126343,
719
+ "eval_runtime": 63.3545,
720
+ "eval_samples_per_second": 23.787,
721
+ "eval_steps_per_second": 5.951,
722
  "step": 940
723
  },
724
  {
725
  "epoch": 1.132114420524919,
726
+ "grad_norm": 1.9037110805511475,
727
  "learning_rate": 2.3481795358467866e-05,
728
+ "loss": 0.9469,
729
  "step": 960
730
  },
731
  {
732
  "epoch": 1.132114420524919,
733
+ "eval_loss": 1.0110633373260498,
734
+ "eval_runtime": 64.9111,
735
+ "eval_samples_per_second": 23.216,
736
+ "eval_steps_per_second": 5.808,
737
  "step": 960
738
  },
739
  {
740
  "epoch": 1.1557062813329402,
741
+ "grad_norm": 2.169173240661621,
742
  "learning_rate": 2.3138743436842772e-05,
743
+ "loss": 0.9255,
744
  "step": 980
745
  },
746
  {
747
  "epoch": 1.1557062813329402,
748
+ "eval_loss": 1.0110522508621216,
749
+ "eval_runtime": 62.9115,
750
+ "eval_samples_per_second": 23.954,
751
+ "eval_steps_per_second": 5.993,
752
  "step": 980
753
  },
754
  {
755
  "epoch": 1.1792981421409614,
756
+ "grad_norm": 1.8711203336715698,
757
  "learning_rate": 2.278954884148232e-05,
758
+ "loss": 0.9322,
759
  "step": 1000
760
  },
761
  {
762
  "epoch": 1.1792981421409614,
763
+ "eval_loss": 1.0103003978729248,
764
+ "eval_runtime": 62.9309,
765
+ "eval_samples_per_second": 23.947,
766
+ "eval_steps_per_second": 5.991,
767
  "step": 1000
768
  },
769
  {
770
  "epoch": 1.2028900029489826,
771
+ "grad_norm": 1.9024525880813599,
772
  "learning_rate": 2.2434475125167866e-05,
773
+ "loss": 0.8943,
774
  "step": 1020
775
  },
776
  {
777
  "epoch": 1.2028900029489826,
778
+ "eval_loss": 1.0080772638320923,
779
+ "eval_runtime": 63.4989,
780
+ "eval_samples_per_second": 23.733,
781
+ "eval_steps_per_second": 5.937,
782
  "step": 1020
783
  },
784
  {
785
  "epoch": 1.2264818637570039,
786
+ "grad_norm": 2.0306591987609863,
787
  "learning_rate": 2.207379027791632e-05,
788
+ "loss": 0.8974,
789
  "step": 1040
790
  },
791
  {
792
  "epoch": 1.2264818637570039,
793
+ "eval_loss": 1.005001187324524,
794
+ "eval_runtime": 62.9683,
795
+ "eval_samples_per_second": 23.933,
796
+ "eval_steps_per_second": 5.987,
797
  "step": 1040
798
  },
799
  {
800
  "epoch": 1.250073724565025,
801
+ "grad_norm": 2.0461585521698,
802
  "learning_rate": 2.170776652471611e-05,
803
+ "loss": 0.8922,
804
  "step": 1060
805
  },
806
  {
807
  "epoch": 1.250073724565025,
808
+ "eval_loss": 1.0041309595108032,
809
+ "eval_runtime": 62.9406,
810
+ "eval_samples_per_second": 23.943,
811
+ "eval_steps_per_second": 5.99,
812
  "step": 1060
813
  },
814
  {
815
  "epoch": 1.2736655853730463,
816
+ "grad_norm": 2.301267385482788,
817
  "learning_rate": 2.133668012006682e-05,
818
+ "loss": 0.9341,
819
  "step": 1080
820
  },
821
  {
822
  "epoch": 1.2736655853730463,
823
+ "eval_loss": 1.0036579370498657,
824
+ "eval_runtime": 62.8908,
825
+ "eval_samples_per_second": 23.962,
826
+ "eval_steps_per_second": 5.995,
827
  "step": 1080
828
  },
829
  {
830
  "epoch": 1.2972574461810675,
831
+ "grad_norm": 2.170428991317749,
832
  "learning_rate": 2.096081113947753e-05,
833
+ "loss": 0.9075,
834
  "step": 1100
835
  },
836
  {
837
  "epoch": 1.2972574461810675,
838
+ "eval_loss": 1.0047935247421265,
839
+ "eval_runtime": 62.9099,
840
+ "eval_samples_per_second": 23.955,
841
+ "eval_steps_per_second": 5.993,
842
  "step": 1100
843
  },
844
  {
845
  "epoch": 1.3208493069890888,
846
+ "grad_norm": 2.1537463665008545,
847
  "learning_rate": 2.058044326808132e-05,
848
+ "loss": 0.9296,
849
  "step": 1120
850
  },
851
  {
852
  "epoch": 1.3208493069890888,
853
+ "eval_loss": 1.0024445056915283,
854
+ "eval_runtime": 64.9442,
855
+ "eval_samples_per_second": 23.205,
856
+ "eval_steps_per_second": 5.805,
857
  "step": 1120
858
  },
859
  {
860
  "epoch": 1.34444116779711,
861
+ "grad_norm": 2.0056726932525635,
862
  "learning_rate": 2.0195863586525413e-05,
863
+ "loss": 0.9133,
864
  "step": 1140
865
  },
866
  {
867
  "epoch": 1.34444116779711,
868
+ "eval_loss": 1.0002470016479492,
869
+ "eval_runtime": 62.892,
870
+ "eval_samples_per_second": 23.962,
871
+ "eval_steps_per_second": 5.994,
872
  "step": 1140
873
  },
874
  {
875
  "epoch": 1.3680330286051312,
876
+ "grad_norm": 2.3192081451416016,
877
  "learning_rate": 1.9807362354298556e-05,
878
+ "loss": 0.9447,
879
  "step": 1160
880
  },
881
  {
882
  "epoch": 1.3680330286051312,
883
+ "eval_loss": 1.0005617141723633,
884
+ "eval_runtime": 62.9711,
885
+ "eval_samples_per_second": 23.932,
886
+ "eval_steps_per_second": 5.987,
887
  "step": 1160
888
  },
889
  {
890
  "epoch": 1.3916248894131524,
891
+ "grad_norm": 2.085900068283081,
892
  "learning_rate": 1.9415232790659206e-05,
893
+ "loss": 0.8843,
894
  "step": 1180
895
  },
896
  {
897
  "epoch": 1.3916248894131524,
898
+ "eval_loss": 0.9992862939834595,
899
+ "eval_runtime": 65.4435,
900
+ "eval_samples_per_second": 23.027,
901
+ "eval_steps_per_second": 5.761,
902
  "step": 1180
903
  },
904
  {
905
  "epoch": 1.4152167502211737,
906
+ "grad_norm": 2.2436399459838867,
907
  "learning_rate": 1.9019770853329856e-05,
908
+ "loss": 0.9046,
909
  "step": 1200
910
  },
911
  {
912
  "epoch": 1.4152167502211737,
913
+ "eval_loss": 0.996922492980957,
914
+ "eval_runtime": 62.9124,
915
+ "eval_samples_per_second": 23.954,
916
+ "eval_steps_per_second": 5.992,
917
  "step": 1200
918
  },
919
  {
920
  "epoch": 1.4388086110291949,
921
+ "grad_norm": 2.1963181495666504,
922
  "learning_rate": 1.8621275015124457e-05,
923
+ "loss": 0.8844,
924
  "step": 1220
925
  },
926
  {
927
  "epoch": 1.4388086110291949,
928
+ "eval_loss": 0.9958762526512146,
929
+ "eval_runtime": 62.9054,
930
+ "eval_samples_per_second": 23.957,
931
+ "eval_steps_per_second": 5.993,
932
  "step": 1220
933
  },
934
  {
935
  "epoch": 1.462400471837216,
936
+ "grad_norm": 2.19089674949646,
937
  "learning_rate": 1.82200460386777e-05,
938
+ "loss": 0.923,
939
  "step": 1240
940
  },
941
  {
942
  "epoch": 1.462400471837216,
943
+ "eval_loss": 0.9949436783790588,
944
+ "eval_runtime": 62.9162,
945
+ "eval_samples_per_second": 23.952,
946
+ "eval_steps_per_second": 5.992,
947
  "step": 1240
948
  },
949
  {
950
  "epoch": 1.4859923326452373,
951
+ "grad_norm": 2.2525527477264404,
952
  "learning_rate": 1.7816386749445935e-05,
953
+ "loss": 0.8587,
954
  "step": 1260
955
  },
956
  {
957
  "epoch": 1.4859923326452373,
958
+ "eval_loss": 0.9949393272399902,
959
+ "eval_runtime": 62.931,
960
+ "eval_samples_per_second": 23.947,
961
+ "eval_steps_per_second": 5.991,
962
  "step": 1260
963
  },
964
  {
965
  "epoch": 1.5095841934532586,
966
+ "grad_norm": 2.4868662357330322,
967
  "learning_rate": 1.7410601807151304e-05,
968
+ "loss": 0.8878,
969
  "step": 1280
970
  },
971
  {
972
  "epoch": 1.5095841934532586,
973
+ "eval_loss": 0.9940009713172913,
974
+ "eval_runtime": 64.7991,
975
+ "eval_samples_per_second": 23.256,
976
+ "eval_steps_per_second": 5.818,
977
  "step": 1280
978
  },
979
  {
980
  "epoch": 1.53317605426128,
981
+ "grad_norm": 1.9369481801986694,
982
  "learning_rate": 1.700299747584139e-05,
983
+ "loss": 0.904,
984
  "step": 1300
985
  },
986
  {
987
  "epoch": 1.53317605426128,
988
+ "eval_loss": 0.9907172918319702,
989
+ "eval_runtime": 62.932,
990
+ "eval_samples_per_second": 23.946,
991
+ "eval_steps_per_second": 5.991,
992
  "step": 1300
993
  },
994
  {
995
  "epoch": 1.556767915069301,
996
+ "grad_norm": 2.2156777381896973,
997
  "learning_rate": 1.659388139273806e-05,
998
+ "loss": 0.9121,
999
  "step": 1320
1000
  },
1001
  {
1002
  "epoch": 1.556767915069301,
1003
+ "eval_loss": 0.9908357262611389,
1004
+ "eval_runtime": 62.9132,
1005
+ "eval_samples_per_second": 23.954,
1006
+ "eval_steps_per_second": 5.992,
1007
  "step": 1320
1008
  },
1009
  {
1010
  "epoch": 1.5803597758773225,
1011
+ "grad_norm": 2.393859386444092,
1012
  "learning_rate": 1.6183562336049867e-05,
1013
+ "loss": 0.9023,
1014
  "step": 1340
1015
  },
1016
  {
1017
  "epoch": 1.5803597758773225,
1018
+ "eval_loss": 0.9863225221633911,
1019
+ "eval_runtime": 65.5958,
1020
+ "eval_samples_per_second": 22.974,
1021
+ "eval_steps_per_second": 5.747,
1022
  "step": 1340
1023
  },
1024
  {
1025
  "epoch": 1.6039516366853435,
1026
+ "grad_norm": 2.1125807762145996,
1027
  "learning_rate": 1.5772349991923366e-05,
1028
+ "loss": 0.892,
1029
  "step": 1360
1030
  },
1031
  {
1032
  "epoch": 1.6039516366853435,
1033
+ "eval_loss": 0.9855474233627319,
1034
+ "eval_runtime": 62.9171,
1035
+ "eval_samples_per_second": 23.952,
1036
+ "eval_steps_per_second": 5.992,
1037
  "step": 1360
1038
  },
1039
  {
1040
  "epoch": 1.627543497493365,
1041
+ "grad_norm": 2.1116766929626465,
1042
  "learning_rate": 1.536055472070907e-05,
1043
+ "loss": 0.9116,
1044
  "step": 1380
1045
  },
1046
  {
1047
  "epoch": 1.627543497493365,
1048
+ "eval_loss": 0.9856626391410828,
1049
+ "eval_runtime": 62.9526,
1050
+ "eval_samples_per_second": 23.939,
1051
+ "eval_steps_per_second": 5.989,
1052
  "step": 1380
1053
  },
1054
  {
1055
  "epoch": 1.651135358301386,
1056
+ "grad_norm": 2.2223665714263916,
1057
  "learning_rate": 1.4948487322718669e-05,
1058
+ "loss": 0.8816,
1059
  "step": 1400
1060
  },
1061
  {
1062
  "epoch": 1.651135358301386,
1063
+ "eval_loss": 0.9842101335525513,
1064
+ "eval_runtime": 63.0292,
1065
+ "eval_samples_per_second": 23.91,
1066
+ "eval_steps_per_second": 5.981,
1067
  "step": 1400
1068
  },
1069
  {
1070
  "epoch": 1.6747272191094074,
1071
+ "grad_norm": 2.2404255867004395,
1072
  "learning_rate": 1.4536458803650085e-05,
1073
+ "loss": 0.859,
1074
  "step": 1420
1075
  },
1076
  {
1077
  "epoch": 1.6747272191094074,
1078
+ "eval_loss": 0.9844129085540771,
1079
+ "eval_runtime": 63.0729,
1080
+ "eval_samples_per_second": 23.893,
1081
+ "eval_steps_per_second": 5.977,
1082
  "step": 1420
1083
  },
1084
  {
1085
  "epoch": 1.6983190799174284,
1086
+ "grad_norm": 2.072277784347534,
1087
  "learning_rate": 1.4124780139857582e-05,
1088
+ "loss": 0.9234,
1089
  "step": 1440
1090
  },
1091
  {
1092
  "epoch": 1.6983190799174284,
1093
+ "eval_loss": 0.9798393845558167,
1094
+ "eval_runtime": 64.8962,
1095
+ "eval_samples_per_second": 23.222,
1096
+ "eval_steps_per_second": 5.809,
1097
  "step": 1440
1098
  },
1099
  {
1100
  "epoch": 1.7219109407254498,
1101
+ "grad_norm": 2.4477767944335938,
1102
  "learning_rate": 1.3713762043644008e-05,
1103
+ "loss": 0.889,
1104
  "step": 1460
1105
  },
1106
  {
1107
  "epoch": 1.7219109407254498,
1108
+ "eval_loss": 0.9810368418693542,
1109
+ "eval_runtime": 62.9029,
1110
+ "eval_samples_per_second": 23.958,
1111
+ "eval_steps_per_second": 5.993,
1112
  "step": 1460
1113
  },
1114
  {
1115
  "epoch": 1.7455028015334708,
1116
+ "grad_norm": 2.2249417304992676,
1117
  "learning_rate": 1.3303714728752293e-05,
1118
+ "loss": 0.8679,
1119
  "step": 1480
1120
  },
1121
  {
1122
  "epoch": 1.7455028015334708,
1123
+ "eval_loss": 0.9801770448684692,
1124
+ "eval_runtime": 62.9129,
1125
+ "eval_samples_per_second": 23.954,
1126
+ "eval_steps_per_second": 5.992,
1127
  "step": 1480
1128
  },
1129
  {
1130
  "epoch": 1.7690946623414923,
1131
+ "grad_norm": 2.2835938930511475,
1132
  "learning_rate": 1.2894947676233291e-05,
1133
+ "loss": 0.8896,
1134
  "step": 1500
1135
  },
1136
  {
1137
  "epoch": 1.7690946623414923,
1138
+ "eval_loss": 0.9786974787712097,
1139
+ "eval_runtime": 65.11,
1140
+ "eval_samples_per_second": 23.145,
1141
+ "eval_steps_per_second": 5.79,
1142
  "step": 1500
1143
  },
1144
  {
1145
  "epoch": 1.7926865231495133,
1146
+ "grad_norm": 2.386866569519043,
1147
  "learning_rate": 1.2487769400866573e-05,
1148
+ "loss": 0.8687,
1149
  "step": 1520
1150
  },
1151
  {
1152
  "epoch": 1.7926865231495133,
1153
+ "eval_loss": 0.9775878190994263,
1154
+ "eval_runtime": 62.9587,
1155
+ "eval_samples_per_second": 23.936,
1156
+ "eval_steps_per_second": 5.988,
1157
  "step": 1520
1158
  },
1159
  {
1160
  "epoch": 1.8162783839575347,
1161
+ "grad_norm": 2.3122761249542236,
1162
  "learning_rate": 1.2082487218310524e-05,
1163
+ "loss": 0.8992,
1164
  "step": 1540
1165
  },
1166
  {
1167
  "epoch": 1.8162783839575347,
1168
+ "eval_loss": 0.9774647951126099,
1169
+ "eval_runtime": 62.8905,
1170
+ "eval_samples_per_second": 23.962,
1171
+ "eval_steps_per_second": 5.995,
1172
  "step": 1540
1173
  },
1174
  {
1175
  "epoch": 1.8398702447655557,
1176
+ "grad_norm": 2.2307450771331787,
1177
  "learning_rate": 1.1679407013157457e-05,
1178
+ "loss": 0.9041,
1179
  "step": 1560
1180
  },
1181
  {
1182
  "epoch": 1.8398702447655557,
1183
+ "eval_loss": 0.9749870300292969,
1184
+ "eval_runtime": 62.9232,
1185
+ "eval_samples_per_second": 23.95,
1186
+ "eval_steps_per_second": 5.991,
1187
  "step": 1560
1188
  },
1189
  {
1190
  "epoch": 1.8634621055735772,
1191
+ "grad_norm": 2.1991312503814697,
1192
  "learning_rate": 1.1278833008068863e-05,
1193
+ "loss": 0.8804,
1194
  "step": 1580
1195
  },
1196
  {
1197
  "epoch": 1.8634621055735772,
1198
+ "eval_loss": 0.973229169845581,
1199
+ "eval_runtime": 62.9112,
1200
+ "eval_samples_per_second": 23.954,
1201
+ "eval_steps_per_second": 5.993,
1202
  "step": 1580
1203
  },
1204
  {
1205
  "epoch": 1.8870539663815984,
1206
+ "grad_norm": 2.1787588596343994,
1207
  "learning_rate": 1.088106753416491e-05,
1208
+ "loss": 0.9004,
1209
  "step": 1600
1210
  },
1211
  {
1212
  "epoch": 1.8870539663815984,
1213
+ "eval_loss": 0.9725916385650635,
1214
+ "eval_runtime": 62.9975,
1215
+ "eval_samples_per_second": 23.922,
1216
+ "eval_steps_per_second": 5.984,
1217
  "step": 1600
1218
  }
1219
  ],
 
1243
  "attributes": {}
1244
  }
1245
  },
1246
+ "total_flos": 3.937740637329162e+17,
1247
  "train_batch_size": 4,
1248
  "trial_name": null,
1249
  "trial_params": null
training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:69e121e7c25b7b21cddbd335368e2574f3f50d08e1b8e98dbd57d54cca8ee4c6
3
- size 6584
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:11f83e9f934bc33e50720d217ae99dabaf0b3ef8a9013e81986c142bfd6f2b2c
3
+ size 7160