thanhduc1180 commited on
Commit
387afdb
·
verified ·
1 Parent(s): 9b65426

Training in progress, step 400, checkpoint

Browse files
last-checkpoint/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a67d8d40ccd059830aa09e47c262874407e5a1f0abf374dec76f8c94925ee01e
3
  size 87361592
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:00e86a0299b19346ff15d2fe0fae3dc80394649e1b7bd924d6d84a3b0dc67a49
3
  size 87361592
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bf255e7a8b3081904c36115a4363ca1c22d7562c5b86ffa55cba869d161ee585
3
- size 89256453
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d5e66fdc75dc783c8500339a5622eb420a0bb1a37440cc184551c39bd993e02b
3
+ size 89256965
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f57739c021082da51ed2723d3a0065648e8d26fa8bb17a237e8421e7490ec212
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a3041132d027ee07d43a67456dbd178f2f9a31cf6b130d97869dc3cf45899db5
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f31f8f4c4585764dcc07488c9354aff14b217f0b6f3a7a53679ab604a0e5622e
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:695a90790e7f7bcc6fd389a350feb6a91e68c7bad26131ed75e6cfed010521a8
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": Infinity,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.3048780487804878,
6
  "eval_steps": 200,
7
- "global_step": 200,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -129,6 +129,117 @@
129
  "eval_samples_per_second": 2.483,
130
  "eval_steps_per_second": 1.241,
131
  "step": 200
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
132
  }
133
  ],
134
  "logging_steps": 20,
@@ -148,7 +259,7 @@
148
  "attributes": {}
149
  }
150
  },
151
- "total_flos": 2.7575034621782016e+17,
152
  "train_batch_size": 2,
153
  "trial_name": null,
154
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": Infinity,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.6097560975609756,
6
  "eval_steps": 200,
7
+ "global_step": 400,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
129
  "eval_samples_per_second": 2.483,
130
  "eval_steps_per_second": 1.241,
131
  "step": 200
132
+ },
133
+ {
134
+ "entropy": 1.209118977189064,
135
+ "epoch": 0.3353658536585366,
136
+ "grad_norm": 0.166015625,
137
+ "learning_rate": 9.521739130434784e-06,
138
+ "loss": 0.8307,
139
+ "mean_token_accuracy": 0.7851326018571854,
140
+ "num_tokens": 6638022.0,
141
+ "step": 220
142
+ },
143
+ {
144
+ "entropy": 1.2081195436418057,
145
+ "epoch": 0.36585365853658536,
146
+ "grad_norm": 0.154296875,
147
+ "learning_rate": 1.0391304347826088e-05,
148
+ "loss": 0.8054,
149
+ "mean_token_accuracy": 0.775788264721632,
150
+ "num_tokens": 7242603.0,
151
+ "step": 240
152
+ },
153
+ {
154
+ "entropy": 1.218064185231924,
155
+ "epoch": 0.39634146341463417,
156
+ "grad_norm": 0.1572265625,
157
+ "learning_rate": 1.1260869565217392e-05,
158
+ "loss": 0.8023,
159
+ "mean_token_accuracy": 0.7786701653152704,
160
+ "num_tokens": 7854134.0,
161
+ "step": 260
162
+ },
163
+ {
164
+ "entropy": 1.222281923890114,
165
+ "epoch": 0.4268292682926829,
166
+ "grad_norm": 0.2080078125,
167
+ "learning_rate": 1.2130434782608698e-05,
168
+ "loss": 0.7419,
169
+ "mean_token_accuracy": 0.7926970385015011,
170
+ "num_tokens": 8456300.0,
171
+ "step": 280
172
+ },
173
+ {
174
+ "entropy": 1.1952788300812245,
175
+ "epoch": 0.4573170731707317,
176
+ "grad_norm": 0.1982421875,
177
+ "learning_rate": 1.3000000000000001e-05,
178
+ "loss": 0.7198,
179
+ "mean_token_accuracy": 0.800191256031394,
180
+ "num_tokens": 9058721.0,
181
+ "step": 300
182
+ },
183
+ {
184
+ "entropy": 1.2105496317148208,
185
+ "epoch": 0.4878048780487805,
186
+ "grad_norm": 0.228515625,
187
+ "learning_rate": 1.3869565217391305e-05,
188
+ "loss": 0.6962,
189
+ "mean_token_accuracy": 0.8068932801485061,
190
+ "num_tokens": 9662758.0,
191
+ "step": 320
192
+ },
193
+ {
194
+ "entropy": 1.2259060773998498,
195
+ "epoch": 0.5182926829268293,
196
+ "grad_norm": 0.189453125,
197
+ "learning_rate": 1.473913043478261e-05,
198
+ "loss": 0.7312,
199
+ "mean_token_accuracy": 0.8055971477180719,
200
+ "num_tokens": 10271738.0,
201
+ "step": 340
202
+ },
203
+ {
204
+ "entropy": 1.2056082211434842,
205
+ "epoch": 0.5487804878048781,
206
+ "grad_norm": 0.1826171875,
207
+ "learning_rate": 1.5608695652173914e-05,
208
+ "loss": 0.6527,
209
+ "mean_token_accuracy": 0.7986662428826093,
210
+ "num_tokens": 10879740.0,
211
+ "step": 360
212
+ },
213
+ {
214
+ "entropy": 1.225981270521879,
215
+ "epoch": 0.5792682926829268,
216
+ "grad_norm": 0.259765625,
217
+ "learning_rate": 1.6478260869565218e-05,
218
+ "loss": 0.682,
219
+ "mean_token_accuracy": 0.7959255930036306,
220
+ "num_tokens": 11483336.0,
221
+ "step": 380
222
+ },
223
+ {
224
+ "entropy": 1.1928005013614893,
225
+ "epoch": 0.6097560975609756,
226
+ "grad_norm": 0.201171875,
227
+ "learning_rate": 1.7347826086956522e-05,
228
+ "loss": 0.6594,
229
+ "mean_token_accuracy": 0.8185551591217518,
230
+ "num_tokens": 12085058.0,
231
+ "step": 400
232
+ },
233
+ {
234
+ "epoch": 0.6097560975609756,
235
+ "eval_entropy": 1.1817513504910724,
236
+ "eval_loss": NaN,
237
+ "eval_mean_token_accuracy": 0.806651482590577,
238
+ "eval_num_tokens": 12085058.0,
239
+ "eval_runtime": 229.1412,
240
+ "eval_samples_per_second": 2.453,
241
+ "eval_steps_per_second": 1.226,
242
+ "step": 400
243
  }
244
  ],
245
  "logging_steps": 20,
 
259
  "attributes": {}
260
  }
261
  },
262
+ "total_flos": 5.5195257431906304e+17,
263
  "train_batch_size": 2,
264
  "trial_name": null,
265
  "trial_params": null