genshiai-daichi commited on
Commit
92b1daa
·
verified ·
1 Parent(s): afd608f

latest = step 1000 (nDCG@10=0.4371)

Browse files
Files changed (2) hide show
  1. model.safetensors +1 -1
  2. trainer_state.json +94 -5
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2fb0a39ed6e6e56f7eee8cc4e11ae1c71dbd6c864fe9ab2420cde643b694a7af
3
  size 280019040
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:96bed2cdda97dd7cf15f58cb353885069b4954e42704150ac67f4320d582dcf9
3
  size 280019040
trainer_state.json CHANGED
@@ -1,10 +1,10 @@
1
  {
2
- "best_global_step": 500,
3
- "best_metric": 0.42346580839400816,
4
- "best_model_checkpoint": "checkpoints/med-ruri-v3-70m-v2-from-med/checkpoint-500",
5
- "epoch": 0.08118201006656925,
6
  "eval_steps": 500,
7
- "global_step": 500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -97,6 +97,95 @@
97
  "eval_samples_per_second": 0.0,
98
  "eval_steps_per_second": 0.0,
99
  "step": 500
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
100
  }
101
  ],
102
  "logging_steps": 50,
 
1
  {
2
+ "best_global_step": 1000,
3
+ "best_metric": 0.4370587039801932,
4
+ "best_model_checkpoint": "checkpoints/med-ruri-v3-70m-v2-from-med/checkpoint-1000",
5
+ "epoch": 0.1623640201331385,
6
  "eval_steps": 500,
7
+ "global_step": 1000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
97
  "eval_samples_per_second": 0.0,
98
  "eval_steps_per_second": 0.0,
99
  "step": 500
100
+ },
101
+ {
102
+ "epoch": 0.08930021107322618,
103
+ "grad_norm": 26.730838775634766,
104
+ "learning_rate": 9.5881045975047e-06,
105
+ "loss": 0.6993674468994141,
106
+ "step": 550
107
+ },
108
+ {
109
+ "epoch": 0.0974184120798831,
110
+ "grad_norm": 30.956209182739258,
111
+ "learning_rate": 9.50264911980858e-06,
112
+ "loss": 0.6762686157226563,
113
+ "step": 600
114
+ },
115
+ {
116
+ "epoch": 0.10553661308654003,
117
+ "grad_norm": 26.836666107177734,
118
+ "learning_rate": 9.41719364211246e-06,
119
+ "loss": 0.6830927276611328,
120
+ "step": 650
121
+ },
122
+ {
123
+ "epoch": 0.11365481409319694,
124
+ "grad_norm": 27.171998977661133,
125
+ "learning_rate": 9.33173816441634e-06,
126
+ "loss": 0.655235824584961,
127
+ "step": 700
128
+ },
129
+ {
130
+ "epoch": 0.12177301509985387,
131
+ "grad_norm": 32.39191818237305,
132
+ "learning_rate": 9.24628268672022e-06,
133
+ "loss": 0.6455143737792969,
134
+ "step": 750
135
+ },
136
+ {
137
+ "epoch": 0.1298912161065108,
138
+ "grad_norm": 27.211759567260742,
139
+ "learning_rate": 9.160827209024098e-06,
140
+ "loss": 0.646562728881836,
141
+ "step": 800
142
+ },
143
+ {
144
+ "epoch": 0.13800941711316772,
145
+ "grad_norm": 26.15242576599121,
146
+ "learning_rate": 9.07537173132798e-06,
147
+ "loss": 0.641706314086914,
148
+ "step": 850
149
+ },
150
+ {
151
+ "epoch": 0.14612761811982464,
152
+ "grad_norm": 30.478113174438477,
153
+ "learning_rate": 8.989916253631858e-06,
154
+ "loss": 0.6305813598632812,
155
+ "step": 900
156
+ },
157
+ {
158
+ "epoch": 0.15424581912648158,
159
+ "grad_norm": 25.28243064880371,
160
+ "learning_rate": 8.904460775935739e-06,
161
+ "loss": 0.6182423400878906,
162
+ "step": 950
163
+ },
164
+ {
165
+ "epoch": 0.1623640201331385,
166
+ "grad_norm": 29.67841339111328,
167
+ "learning_rate": 8.819005298239618e-06,
168
+ "loss": 0.6209118270874023,
169
+ "step": 1000
170
+ },
171
+ {
172
+ "epoch": 0.1623640201331385,
173
+ "eval_med-ir_cosine_accuracy@1": 0.243,
174
+ "eval_med-ir_cosine_accuracy@10": 0.66,
175
+ "eval_med-ir_cosine_accuracy@5": 0.542,
176
+ "eval_med-ir_cosine_map@10": 0.36730773809523803,
177
+ "eval_med-ir_cosine_mrr@10": 0.3673077380952388,
178
+ "eval_med-ir_cosine_ndcg@10": 0.4370587039801932,
179
+ "eval_med-ir_cosine_precision@1": 0.243,
180
+ "eval_med-ir_cosine_precision@10": 0.066,
181
+ "eval_med-ir_cosine_precision@5": 0.1084,
182
+ "eval_med-ir_cosine_recall@1": 0.243,
183
+ "eval_med-ir_cosine_recall@10": 0.66,
184
+ "eval_med-ir_cosine_recall@5": 0.542,
185
+ "eval_runtime": 54.0291,
186
+ "eval_samples_per_second": 0.0,
187
+ "eval_steps_per_second": 0.0,
188
+ "step": 1000
189
  }
190
  ],
191
  "logging_steps": 50,