genshiai-daichi commited on
Commit
2bddaaf
·
verified ·
1 Parent(s): e159a89

latest = step 1500 (nDCG@10=0.4498)

Browse files
Files changed (2) hide show
  1. model.safetensors +1 -1
  2. trainer_state.json +94 -5
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:96bed2cdda97dd7cf15f58cb353885069b4954e42704150ac67f4320d582dcf9
3
  size 280019040
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1c256b3723c0993bf2ee89be89e5a21231692159d44e6bc93d7a719fbf16924b
3
  size 280019040
trainer_state.json CHANGED
@@ -1,10 +1,10 @@
1
  {
2
- "best_global_step": 1000,
3
- "best_metric": 0.4370587039801932,
4
- "best_model_checkpoint": "checkpoints/med-ruri-v3-70m-v2-from-med/checkpoint-1000",
5
- "epoch": 0.1623640201331385,
6
  "eval_steps": 500,
7
- "global_step": 1000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -186,6 +186,95 @@
186
  "eval_samples_per_second": 0.0,
187
  "eval_steps_per_second": 0.0,
188
  "step": 1000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
189
  }
190
  ],
191
  "logging_steps": 50,
 
1
  {
2
+ "best_global_step": 1500,
3
+ "best_metric": 0.4497772162074601,
4
+ "best_model_checkpoint": "checkpoints/med-ruri-v3-70m-v2-from-med/checkpoint-1500",
5
+ "epoch": 0.24354603019970775,
6
  "eval_steps": 500,
7
+ "global_step": 1500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
186
  "eval_samples_per_second": 0.0,
187
  "eval_steps_per_second": 0.0,
188
  "step": 1000
189
+ },
190
+ {
191
+ "epoch": 0.17048222113979541,
192
+ "grad_norm": 23.29427146911621,
193
+ "learning_rate": 8.733549820543497e-06,
194
+ "loss": 0.6038346862792969,
195
+ "step": 1050
196
+ },
197
+ {
198
+ "epoch": 0.17860042214645236,
199
+ "grad_norm": 28.32552719116211,
200
+ "learning_rate": 8.648094342847378e-06,
201
+ "loss": 0.6003586959838867,
202
+ "step": 1100
203
+ },
204
+ {
205
+ "epoch": 0.18671862315310928,
206
+ "grad_norm": 30.75159454345703,
207
+ "learning_rate": 8.562638865151257e-06,
208
+ "loss": 0.6092750930786133,
209
+ "step": 1150
210
+ },
211
+ {
212
+ "epoch": 0.1948368241597662,
213
+ "grad_norm": 23.42568016052246,
214
+ "learning_rate": 8.477183387455136e-06,
215
+ "loss": 0.5733106994628906,
216
+ "step": 1200
217
+ },
218
+ {
219
+ "epoch": 0.2029550251664231,
220
+ "grad_norm": 26.38534927368164,
221
+ "learning_rate": 8.391727909759017e-06,
222
+ "loss": 0.6007821655273438,
223
+ "step": 1250
224
+ },
225
+ {
226
+ "epoch": 0.21107322617308005,
227
+ "grad_norm": 29.11765480041504,
228
+ "learning_rate": 8.306272432062896e-06,
229
+ "loss": 0.575584602355957,
230
+ "step": 1300
231
+ },
232
+ {
233
+ "epoch": 0.21919142717973697,
234
+ "grad_norm": 26.75505256652832,
235
+ "learning_rate": 8.220816954366777e-06,
236
+ "loss": 0.5628342819213867,
237
+ "step": 1350
238
+ },
239
+ {
240
+ "epoch": 0.22730962818639389,
241
+ "grad_norm": 26.10503387451172,
242
+ "learning_rate": 8.135361476670656e-06,
243
+ "loss": 0.5451336669921875,
244
+ "step": 1400
245
+ },
246
+ {
247
+ "epoch": 0.23542782919305083,
248
+ "grad_norm": 28.066715240478516,
249
+ "learning_rate": 8.049905998974535e-06,
250
+ "loss": 0.5360281372070312,
251
+ "step": 1450
252
+ },
253
+ {
254
+ "epoch": 0.24354603019970775,
255
+ "grad_norm": 26.54391860961914,
256
+ "learning_rate": 7.964450521278416e-06,
257
+ "loss": 0.5346591949462891,
258
+ "step": 1500
259
+ },
260
+ {
261
+ "epoch": 0.24354603019970775,
262
+ "eval_med-ir_cosine_accuracy@1": 0.2595,
263
+ "eval_med-ir_cosine_accuracy@10": 0.6725,
264
+ "eval_med-ir_cosine_accuracy@5": 0.55,
265
+ "eval_med-ir_cosine_map@10": 0.38029999999999997,
266
+ "eval_med-ir_cosine_mrr@10": 0.3803000000000005,
267
+ "eval_med-ir_cosine_ndcg@10": 0.4497772162074601,
268
+ "eval_med-ir_cosine_precision@1": 0.2595,
269
+ "eval_med-ir_cosine_precision@10": 0.06724999999999999,
270
+ "eval_med-ir_cosine_precision@5": 0.11,
271
+ "eval_med-ir_cosine_recall@1": 0.2595,
272
+ "eval_med-ir_cosine_recall@10": 0.6725,
273
+ "eval_med-ir_cosine_recall@5": 0.55,
274
+ "eval_runtime": 54.4304,
275
+ "eval_samples_per_second": 0.0,
276
+ "eval_steps_per_second": 0.0,
277
+ "step": 1500
278
  }
279
  ],
280
  "logging_steps": 50,