jz666 commited on
Commit
ef15816
·
verified ·
1 Parent(s): 712466e

Model save

Browse files
README.md ADDED
@@ -0,0 +1,74 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: transformers
3
+ license: gemma
4
+ base_model: google/gemma-2-9b-it
5
+ tags:
6
+ - trl
7
+ - simpo
8
+ - generated_from_trainer
9
+ model-index:
10
+ - name: gemma-2-9b-it-dpo-train_filtered_full
11
+ results: []
12
+ ---
13
+
14
+ <!-- This model card has been generated automatically according to the information the Trainer had access to. You
15
+ should probably proofread and complete it, then remove this comment. -->
16
+
17
+ # gemma-2-9b-it-dpo-train_filtered_full
18
+
19
+ This model is a fine-tuned version of [google/gemma-2-9b-it](https://huggingface.co/google/gemma-2-9b-it) on an unknown dataset.
20
+ It achieves the following results on the evaluation set:
21
+ - Loss: 0.6509
22
+ - Rewards/chosen: -0.1749
23
+ - Rewards/rejected: -0.2671
24
+ - Rewards/accuracies: 0.7561
25
+ - Rewards/margins: 0.0922
26
+ - Logps/rejected: -26.7055
27
+ - Logps/chosen: -17.4891
28
+ - Logits/rejected: -24.9311
29
+ - Logits/chosen: -23.9323
30
+
31
+ ## Model description
32
+
33
+ More information needed
34
+
35
+ ## Intended uses & limitations
36
+
37
+ More information needed
38
+
39
+ ## Training and evaluation data
40
+
41
+ More information needed
42
+
43
+ ## Training procedure
44
+
45
+ ### Training hyperparameters
46
+
47
+ The following hyperparameters were used during training:
48
+ - learning_rate: 5e-07
49
+ - train_batch_size: 2
50
+ - eval_batch_size: 4
51
+ - seed: 42
52
+ - distributed_type: multi-GPU
53
+ - num_devices: 4
54
+ - gradient_accumulation_steps: 16
55
+ - total_train_batch_size: 128
56
+ - total_eval_batch_size: 16
57
+ - optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
58
+ - lr_scheduler_type: cosine
59
+ - lr_scheduler_warmup_ratio: 0.1
60
+ - num_epochs: 1
61
+
62
+ ### Training results
63
+
64
+ | Training Loss | Epoch | Step | Validation Loss | Rewards/chosen | Rewards/rejected | Rewards/accuracies | Rewards/margins | Logps/rejected | Logps/chosen | Logits/rejected | Logits/chosen |
65
+ |:-------------:|:------:|:----:|:---------------:|:--------------:|:----------------:|:------------------:|:---------------:|:--------------:|:------------:|:---------------:|:-------------:|
66
+ | 0.6503 | 0.8724 | 400 | 0.6509 | -0.1749 | -0.2671 | 0.7561 | 0.0922 | -26.7055 | -17.4891 | -24.9311 | -23.9323 |
67
+
68
+
69
+ ### Framework versions
70
+
71
+ - Transformers 4.44.2
72
+ - Pytorch 2.7.0+cu128
73
+ - Datasets 2.18.0
74
+ - Tokenizers 0.19.1
all_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 0.9989094874591058,
3
+ "total_flos": 0.0,
4
+ "train_loss": 0.6719389883191305,
5
+ "train_runtime": 8958.0836,
6
+ "train_samples": 58684,
7
+ "train_samples_per_second": 6.551,
8
+ "train_steps_per_second": 0.051
9
+ }
generation_config.json ADDED
@@ -0,0 +1,8 @@
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "bos_token_id": 2,
4
+ "cache_implementation": "hybrid",
5
+ "eos_token_id": 1,
6
+ "pad_token_id": 0,
7
+ "transformers_version": "4.44.2"
8
+ }
train_results.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 0.9989094874591058,
3
+ "total_flos": 0.0,
4
+ "train_loss": 0.6719389883191305,
5
+ "train_runtime": 8958.0836,
6
+ "train_samples": 58684,
7
+ "train_samples_per_second": 6.551,
8
+ "train_steps_per_second": 0.051
9
+ }
trainer_state.json ADDED
@@ -0,0 +1,1423 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 0.9989094874591058,
5
+ "eval_steps": 400,
6
+ "global_step": 458,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.010905125408942203,
13
+ "grad_norm": 0.030929296339124078,
14
+ "learning_rate": 5.434782608695652e-08,
15
+ "logits/chosen": -10.946500778198242,
16
+ "logits/rejected": -10.932920455932617,
17
+ "logps/chosen": -0.8995386362075806,
18
+ "logps/rejected": -0.859021008014679,
19
+ "loss": 0.6946,
20
+ "rewards/accuracies": 0.4937500059604645,
21
+ "rewards/chosen": -0.008995385840535164,
22
+ "rewards/margins": -0.0004051766009069979,
23
+ "rewards/rejected": -0.008590209297835827,
24
+ "step": 5
25
+ },
26
+ {
27
+ "epoch": 0.021810250817884406,
28
+ "grad_norm": 0.056975571795654635,
29
+ "learning_rate": 1.0869565217391303e-07,
30
+ "logits/chosen": -9.881834030151367,
31
+ "logits/rejected": -9.909406661987305,
32
+ "logps/chosen": -1.1416651010513306,
33
+ "logps/rejected": -1.1611769199371338,
34
+ "loss": 0.6945,
35
+ "rewards/accuracies": 0.512499988079071,
36
+ "rewards/chosen": -0.011416650377213955,
37
+ "rewards/margins": 0.00019511766731739044,
38
+ "rewards/rejected": -0.01161176897585392,
39
+ "step": 10
40
+ },
41
+ {
42
+ "epoch": 0.03271537622682661,
43
+ "grad_norm": 0.06260194504125143,
44
+ "learning_rate": 1.6304347826086955e-07,
45
+ "logits/chosen": -10.483625411987305,
46
+ "logits/rejected": -10.386244773864746,
47
+ "logps/chosen": -0.888972282409668,
48
+ "logps/rejected": -0.8580414056777954,
49
+ "loss": 0.6941,
50
+ "rewards/accuracies": 0.5,
51
+ "rewards/chosen": -0.008889722637832165,
52
+ "rewards/margins": -0.00030930957291275263,
53
+ "rewards/rejected": -0.008580413646996021,
54
+ "step": 15
55
+ },
56
+ {
57
+ "epoch": 0.04362050163576881,
58
+ "grad_norm": 0.04432449010316115,
59
+ "learning_rate": 2.1739130434782607e-07,
60
+ "logits/chosen": -10.143729209899902,
61
+ "logits/rejected": -10.027105331420898,
62
+ "logps/chosen": -0.968403697013855,
63
+ "logps/rejected": -1.055953860282898,
64
+ "loss": 0.6943,
65
+ "rewards/accuracies": 0.5687500238418579,
66
+ "rewards/chosen": -0.009684036485850811,
67
+ "rewards/margins": 0.0008755017188377678,
68
+ "rewards/rejected": -0.010559538379311562,
69
+ "step": 20
70
+ },
71
+ {
72
+ "epoch": 0.05452562704471101,
73
+ "grad_norm": 0.03633191693144241,
74
+ "learning_rate": 2.717391304347826e-07,
75
+ "logits/chosen": -10.541749954223633,
76
+ "logits/rejected": -10.645447731018066,
77
+ "logps/chosen": -0.8666504621505737,
78
+ "logps/rejected": -0.7926900386810303,
79
+ "loss": 0.6944,
80
+ "rewards/accuracies": 0.518750011920929,
81
+ "rewards/chosen": -0.008666505105793476,
82
+ "rewards/margins": -0.0007396038272418082,
83
+ "rewards/rejected": -0.007926899939775467,
84
+ "step": 25
85
+ },
86
+ {
87
+ "epoch": 0.06543075245365322,
88
+ "grad_norm": 0.03704281683817436,
89
+ "learning_rate": 3.260869565217391e-07,
90
+ "logits/chosen": -10.218794822692871,
91
+ "logits/rejected": -10.175888061523438,
92
+ "logps/chosen": -0.8812982439994812,
93
+ "logps/rejected": -1.040617823600769,
94
+ "loss": 0.6942,
95
+ "rewards/accuracies": 0.5562499761581421,
96
+ "rewards/chosen": -0.00881298165768385,
97
+ "rewards/margins": 0.001593196764588356,
98
+ "rewards/rejected": -0.010406178422272205,
99
+ "step": 30
100
+ },
101
+ {
102
+ "epoch": 0.07633587786259542,
103
+ "grad_norm": 0.04627201231568104,
104
+ "learning_rate": 3.8043478260869567e-07,
105
+ "logits/chosen": -10.650358200073242,
106
+ "logits/rejected": -10.50601863861084,
107
+ "logps/chosen": -0.8724371194839478,
108
+ "logps/rejected": -0.8634036779403687,
109
+ "loss": 0.6944,
110
+ "rewards/accuracies": 0.53125,
111
+ "rewards/chosen": -0.00872437097132206,
112
+ "rewards/margins": -9.033350215759128e-05,
113
+ "rewards/rejected": -0.008634037338197231,
114
+ "step": 35
115
+ },
116
+ {
117
+ "epoch": 0.08724100327153762,
118
+ "grad_norm": 0.08463024653133087,
119
+ "learning_rate": 4.3478260869565214e-07,
120
+ "logits/chosen": -10.552633285522461,
121
+ "logits/rejected": -10.402359008789062,
122
+ "logps/chosen": -0.8455907702445984,
123
+ "logps/rejected": -0.8345605134963989,
124
+ "loss": 0.6944,
125
+ "rewards/accuracies": 0.5625,
126
+ "rewards/chosen": -0.008455907925963402,
127
+ "rewards/margins": -0.00011030271707568318,
128
+ "rewards/rejected": -0.008345604874193668,
129
+ "step": 40
130
+ },
131
+ {
132
+ "epoch": 0.09814612868047982,
133
+ "grad_norm": 0.07287385137819305,
134
+ "learning_rate": 4.891304347826087e-07,
135
+ "logits/chosen": -10.243791580200195,
136
+ "logits/rejected": -10.251897811889648,
137
+ "logps/chosen": -0.8864496350288391,
138
+ "logps/rejected": -0.8499637842178345,
139
+ "loss": 0.6943,
140
+ "rewards/accuracies": 0.512499988079071,
141
+ "rewards/chosen": -0.008864495903253555,
142
+ "rewards/margins": -0.00036485903547145426,
143
+ "rewards/rejected": -0.008499637246131897,
144
+ "step": 45
145
+ },
146
+ {
147
+ "epoch": 0.10905125408942203,
148
+ "grad_norm": 0.03143058985457917,
149
+ "learning_rate": 4.998837209058379e-07,
150
+ "logits/chosen": -10.024384498596191,
151
+ "logits/rejected": -9.826332092285156,
152
+ "logps/chosen": -0.965563178062439,
153
+ "logps/rejected": -1.0626901388168335,
154
+ "loss": 0.694,
155
+ "rewards/accuracies": 0.5562499761581421,
156
+ "rewards/chosen": -0.009655632078647614,
157
+ "rewards/margins": 0.000971272005699575,
158
+ "rewards/rejected": -0.010626902803778648,
159
+ "step": 50
160
+ },
161
+ {
162
+ "epoch": 0.11995637949836423,
163
+ "grad_norm": 0.03937305345117487,
164
+ "learning_rate": 4.994115224629204e-07,
165
+ "logits/chosen": -11.061460494995117,
166
+ "logits/rejected": -10.943079948425293,
167
+ "logps/chosen": -0.8814244270324707,
168
+ "logps/rejected": -0.9907912015914917,
169
+ "loss": 0.6939,
170
+ "rewards/accuracies": 0.5562499761581421,
171
+ "rewards/chosen": -0.008814243599772453,
172
+ "rewards/margins": 0.0010936675826087594,
173
+ "rewards/rejected": -0.009907910600304604,
174
+ "step": 55
175
+ },
176
+ {
177
+ "epoch": 0.13086150490730644,
178
+ "grad_norm": 0.11654523697246219,
179
+ "learning_rate": 4.98576823004801e-07,
180
+ "logits/chosen": -10.834707260131836,
181
+ "logits/rejected": -10.95356559753418,
182
+ "logps/chosen": -0.9678617715835571,
183
+ "logps/rejected": -1.1425087451934814,
184
+ "loss": 0.6939,
185
+ "rewards/accuracies": 0.5687500238418579,
186
+ "rewards/chosen": -0.009678617119789124,
187
+ "rewards/margins": 0.0017464684788137674,
188
+ "rewards/rejected": -0.011425087228417397,
189
+ "step": 60
190
+ },
191
+ {
192
+ "epoch": 0.14176663031624864,
193
+ "grad_norm": 0.07036248559926651,
194
+ "learning_rate": 4.973808357047844e-07,
195
+ "logits/chosen": -11.805063247680664,
196
+ "logits/rejected": -12.005667686462402,
197
+ "logps/chosen": -1.0525237321853638,
198
+ "logps/rejected": -1.302790880203247,
199
+ "loss": 0.6932,
200
+ "rewards/accuracies": 0.5874999761581421,
201
+ "rewards/chosen": -0.010525235906243324,
202
+ "rewards/margins": 0.0025026723742485046,
203
+ "rewards/rejected": -0.013027909211814404,
204
+ "step": 65
205
+ },
206
+ {
207
+ "epoch": 0.15267175572519084,
208
+ "grad_norm": 0.10218773629789948,
209
+ "learning_rate": 4.95825298841063e-07,
210
+ "logits/chosen": -12.53321647644043,
211
+ "logits/rejected": -12.769686698913574,
212
+ "logps/chosen": -1.4837205410003662,
213
+ "logps/rejected": -1.564917802810669,
214
+ "loss": 0.6937,
215
+ "rewards/accuracies": 0.6000000238418579,
216
+ "rewards/chosen": -0.014837203547358513,
217
+ "rewards/margins": 0.0008119717240333557,
218
+ "rewards/rejected": -0.01564917527139187,
219
+ "step": 70
220
+ },
221
+ {
222
+ "epoch": 0.16357688113413305,
223
+ "grad_norm": 0.0847097031908177,
224
+ "learning_rate": 4.939124732702595e-07,
225
+ "logits/chosen": -13.13440227508545,
226
+ "logits/rejected": -13.338907241821289,
227
+ "logps/chosen": -1.2520761489868164,
228
+ "logps/rejected": -1.7030487060546875,
229
+ "loss": 0.6933,
230
+ "rewards/accuracies": 0.581250011920929,
231
+ "rewards/chosen": -0.012520760297775269,
232
+ "rewards/margins": 0.004509727004915476,
233
+ "rewards/rejected": -0.017030486837029457,
234
+ "step": 75
235
+ },
236
+ {
237
+ "epoch": 0.17448200654307525,
238
+ "grad_norm": 0.06786395465454413,
239
+ "learning_rate": 4.9164513914144e-07,
240
+ "logits/chosen": -13.549310684204102,
241
+ "logits/rejected": -13.727215766906738,
242
+ "logps/chosen": -1.2481013536453247,
243
+ "logps/rejected": -1.5681723356246948,
244
+ "loss": 0.6929,
245
+ "rewards/accuracies": 0.6000000238418579,
246
+ "rewards/chosen": -0.01248101331293583,
247
+ "rewards/margins": 0.00320070912130177,
248
+ "rewards/rejected": -0.01568172499537468,
249
+ "step": 80
250
+ },
251
+ {
252
+ "epoch": 0.18538713195201745,
253
+ "grad_norm": 0.14405979791376544,
254
+ "learning_rate": 4.890265918553759e-07,
255
+ "logits/chosen": -13.3426513671875,
256
+ "logits/rejected": -13.706072807312012,
257
+ "logps/chosen": -1.1179548501968384,
258
+ "logps/rejected": -1.5296298265457153,
259
+ "loss": 0.6928,
260
+ "rewards/accuracies": 0.606249988079071,
261
+ "rewards/chosen": -0.011179549619555473,
262
+ "rewards/margins": 0.004116747993975878,
263
+ "rewards/rejected": -0.015296298079192638,
264
+ "step": 85
265
+ },
266
+ {
267
+ "epoch": 0.19629225736095965,
268
+ "grad_norm": 0.11143154894940574,
269
+ "learning_rate": 4.860606372749246e-07,
270
+ "logits/chosen": -13.619897842407227,
271
+ "logits/rejected": -14.0485258102417,
272
+ "logps/chosen": -1.3001683950424194,
273
+ "logps/rejected": -1.6298154592514038,
274
+ "loss": 0.6925,
275
+ "rewards/accuracies": 0.59375,
276
+ "rewards/chosen": -0.013001683168113232,
277
+ "rewards/margins": 0.003296471433714032,
278
+ "rewards/rejected": -0.01629815436899662,
279
+ "step": 90
280
+ },
281
+ {
282
+ "epoch": 0.20719738276990185,
283
+ "grad_norm": 0.1370023325254743,
284
+ "learning_rate": 4.827515861934924e-07,
285
+ "logits/chosen": -14.583166122436523,
286
+ "logits/rejected": -14.910693168640137,
287
+ "logps/chosen": -1.7190353870391846,
288
+ "logps/rejected": -2.3775477409362793,
289
+ "loss": 0.692,
290
+ "rewards/accuracies": 0.625,
291
+ "rewards/chosen": -0.0171903558075428,
292
+ "rewards/margins": 0.00658512394875288,
293
+ "rewards/rejected": -0.023775478824973106,
294
+ "step": 95
295
+ },
296
+ {
297
+ "epoch": 0.21810250817884405,
298
+ "grad_norm": 0.16816122755954477,
299
+ "learning_rate": 4.791042480696179e-07,
300
+ "logits/chosen": -15.31629467010498,
301
+ "logits/rejected": -15.362884521484375,
302
+ "logps/chosen": -1.7697193622589111,
303
+ "logps/rejected": -2.579834461212158,
304
+ "loss": 0.6915,
305
+ "rewards/accuracies": 0.574999988079071,
306
+ "rewards/chosen": -0.01769719272851944,
307
+ "rewards/margins": 0.008101152256131172,
308
+ "rewards/rejected": -0.025798344984650612,
309
+ "step": 100
310
+ },
311
+ {
312
+ "epoch": 0.22900763358778625,
313
+ "grad_norm": 0.10536216668445386,
314
+ "learning_rate": 4.751239240367838e-07,
315
+ "logits/chosen": -16.13490867614746,
316
+ "logits/rejected": -16.28664779663086,
317
+ "logps/chosen": -1.6209475994110107,
318
+ "logps/rejected": -1.7623802423477173,
319
+ "loss": 0.692,
320
+ "rewards/accuracies": 0.5625,
321
+ "rewards/chosen": -0.016209475696086884,
322
+ "rewards/margins": 0.0014143256703391671,
323
+ "rewards/rejected": -0.01762380264699459,
324
+ "step": 105
325
+ },
326
+ {
327
+ "epoch": 0.23991275899672845,
328
+ "grad_norm": 0.07946442768084311,
329
+ "learning_rate": 4.7081639919861513e-07,
330
+ "logits/chosen": -16.778369903564453,
331
+ "logits/rejected": -17.438077926635742,
332
+ "logps/chosen": -1.8414093255996704,
333
+ "logps/rejected": -2.527489185333252,
334
+ "loss": 0.691,
335
+ "rewards/accuracies": 0.5687500238418579,
336
+ "rewards/chosen": -0.01841409131884575,
337
+ "rewards/margins": 0.006860800087451935,
338
+ "rewards/rejected": -0.025274891406297684,
339
+ "step": 110
340
+ },
341
+ {
342
+ "epoch": 0.25081788440567065,
343
+ "grad_norm": 0.19920298946639162,
344
+ "learning_rate": 4.661879342206636e-07,
345
+ "logits/chosen": -17.369365692138672,
346
+ "logits/rejected": -17.71587371826172,
347
+ "logps/chosen": -2.287747621536255,
348
+ "logps/rejected": -3.306758165359497,
349
+ "loss": 0.6906,
350
+ "rewards/accuracies": 0.6187499761581421,
351
+ "rewards/chosen": -0.02287747897207737,
352
+ "rewards/margins": 0.010190103203058243,
353
+ "rewards/rejected": -0.033067576587200165,
354
+ "step": 115
355
+ },
356
+ {
357
+ "epoch": 0.2617230098146129,
358
+ "grad_norm": 0.13511852371641964,
359
+ "learning_rate": 4.6124525623099745e-07,
360
+ "logits/chosen": -17.924758911132812,
361
+ "logits/rejected": -18.15680694580078,
362
+ "logps/chosen": -2.1572861671447754,
363
+ "logps/rejected": -2.6086325645446777,
364
+ "loss": 0.6909,
365
+ "rewards/accuracies": 0.6312500238418579,
366
+ "rewards/chosen": -0.021572861820459366,
367
+ "rewards/margins": 0.004513464402407408,
368
+ "rewards/rejected": -0.02608632482588291,
369
+ "step": 120
370
+ },
371
+ {
372
+ "epoch": 0.27262813522355506,
373
+ "grad_norm": 0.14616514763497487,
374
+ "learning_rate": 4.5599554904282377e-07,
375
+ "logits/chosen": -18.488866806030273,
376
+ "logits/rejected": -18.58377456665039,
377
+ "logps/chosen": -2.484189987182617,
378
+ "logps/rejected": -3.0170865058898926,
379
+ "loss": 0.69,
380
+ "rewards/accuracies": 0.625,
381
+ "rewards/chosen": -0.024841900914907455,
382
+ "rewards/margins": 0.00532896351069212,
383
+ "rewards/rejected": -0.0301708672195673,
384
+ "step": 125
385
+ },
386
+ {
387
+ "epoch": 0.2835332606324973,
388
+ "grad_norm": 0.12127246177781695,
389
+ "learning_rate": 4.5044644271335264e-07,
390
+ "logits/chosen": -18.254194259643555,
391
+ "logits/rejected": -18.820096969604492,
392
+ "logps/chosen": -3.067932605743408,
393
+ "logps/rejected": -4.546811103820801,
394
+ "loss": 0.688,
395
+ "rewards/accuracies": 0.581250011920929,
396
+ "rewards/chosen": -0.03067932464182377,
397
+ "rewards/margins": 0.014788785949349403,
398
+ "rewards/rejected": -0.04546811059117317,
399
+ "step": 130
400
+ },
401
+ {
402
+ "epoch": 0.29443838604143946,
403
+ "grad_norm": 0.12658327392034777,
404
+ "learning_rate": 4.4460600245407876e-07,
405
+ "logits/chosen": -18.94732093811035,
406
+ "logits/rejected": -19.414775848388672,
407
+ "logps/chosen": -3.276075839996338,
408
+ "logps/rejected": -4.676281452178955,
409
+ "loss": 0.6891,
410
+ "rewards/accuracies": 0.6499999761581421,
411
+ "rewards/chosen": -0.03276075795292854,
412
+ "rewards/margins": 0.014002054929733276,
413
+ "rewards/rejected": -0.04676281288266182,
414
+ "step": 135
415
+ },
416
+ {
417
+ "epoch": 0.3053435114503817,
418
+ "grad_norm": 0.10760144841394713,
419
+ "learning_rate": 4.3848271690859927e-07,
420
+ "logits/chosen": -18.926616668701172,
421
+ "logits/rejected": -19.358631134033203,
422
+ "logps/chosen": -3.4336490631103516,
423
+ "logps/rejected": -4.3059892654418945,
424
+ "loss": 0.6895,
425
+ "rewards/accuracies": 0.574999988079071,
426
+ "rewards/chosen": -0.03433648869395256,
427
+ "rewards/margins": 0.008723398670554161,
428
+ "rewards/rejected": -0.04305989295244217,
429
+ "step": 140
430
+ },
431
+ {
432
+ "epoch": 0.31624863685932386,
433
+ "grad_norm": 0.1382830404713516,
434
+ "learning_rate": 4.3208548581500455e-07,
435
+ "logits/chosen": -19.934051513671875,
436
+ "logits/rejected": -19.995485305786133,
437
+ "logps/chosen": -3.247889995574951,
438
+ "logps/rejected": -4.867912769317627,
439
+ "loss": 0.6869,
440
+ "rewards/accuracies": 0.6875,
441
+ "rewards/chosen": -0.032478902488946915,
442
+ "rewards/margins": 0.016200218349695206,
443
+ "rewards/rejected": -0.04867911711335182,
444
+ "step": 145
445
+ },
446
+ {
447
+ "epoch": 0.3271537622682661,
448
+ "grad_norm": 0.17855337171133584,
449
+ "learning_rate": 4.2542360707077327e-07,
450
+ "logits/chosen": -20.74686050415039,
451
+ "logits/rejected": -20.895763397216797,
452
+ "logps/chosen": -3.7406821250915527,
453
+ "logps/rejected": -4.3149309158325195,
454
+ "loss": 0.6888,
455
+ "rewards/accuracies": 0.625,
456
+ "rewards/chosen": -0.03740682452917099,
457
+ "rewards/margins": 0.005742488894611597,
458
+ "rewards/rejected": -0.04314931482076645,
459
+ "step": 150
460
+ },
461
+ {
462
+ "epoch": 0.33805888767720826,
463
+ "grad_norm": 0.412241203723386,
464
+ "learning_rate": 4.185067632189737e-07,
465
+ "logits/chosen": -20.4768009185791,
466
+ "logits/rejected": -20.78377914428711,
467
+ "logps/chosen": -4.34366512298584,
468
+ "logps/rejected": -5.832276821136475,
469
+ "loss": 0.6878,
470
+ "rewards/accuracies": 0.625,
471
+ "rewards/chosen": -0.04343665391206741,
472
+ "rewards/margins": 0.014886116608977318,
473
+ "rewards/rejected": -0.05832276865839958,
474
+ "step": 155
475
+ },
476
+ {
477
+ "epoch": 0.3489640130861505,
478
+ "grad_norm": 0.18153876299727773,
479
+ "learning_rate": 4.113450073754102e-07,
480
+ "logits/chosen": -20.895898818969727,
481
+ "logits/rejected": -21.19687843322754,
482
+ "logps/chosen": -5.16976261138916,
483
+ "logps/rejected": -6.861837863922119,
484
+ "loss": 0.6872,
485
+ "rewards/accuracies": 0.625,
486
+ "rewards/chosen": -0.05169763043522835,
487
+ "rewards/margins": 0.016920754685997963,
488
+ "rewards/rejected": -0.06861837953329086,
489
+ "step": 160
490
+ },
491
+ {
492
+ "epoch": 0.35986913849509267,
493
+ "grad_norm": 0.21342125732127162,
494
+ "learning_rate": 4.039487486171707e-07,
495
+ "logits/chosen": -21.601755142211914,
496
+ "logits/rejected": -21.642393112182617,
497
+ "logps/chosen": -4.909188270568848,
498
+ "logps/rejected": -6.523903846740723,
499
+ "loss": 0.6864,
500
+ "rewards/accuracies": 0.606249988079071,
501
+ "rewards/chosen": -0.0490918830037117,
502
+ "rewards/margins": 0.016147149726748466,
503
+ "rewards/rejected": -0.06523902714252472,
504
+ "step": 165
505
+ },
506
+ {
507
+ "epoch": 0.3707742639040349,
508
+ "grad_norm": 0.22893947928190392,
509
+ "learning_rate": 3.963287368538105e-07,
510
+ "logits/chosen": -22.623598098754883,
511
+ "logits/rejected": -22.650497436523438,
512
+ "logps/chosen": -6.888545036315918,
513
+ "logps/rejected": -8.499242782592773,
514
+ "loss": 0.6853,
515
+ "rewards/accuracies": 0.6000000238418579,
516
+ "rewards/chosen": -0.06888546049594879,
517
+ "rewards/margins": 0.0161069817841053,
518
+ "rewards/rejected": -0.0849924311041832,
519
+ "step": 170
520
+ },
521
+ {
522
+ "epoch": 0.3816793893129771,
523
+ "grad_norm": 0.288117238602039,
524
+ "learning_rate": 3.884960472031622e-07,
525
+ "logits/chosen": -23.40947151184082,
526
+ "logits/rejected": -23.49216079711914,
527
+ "logps/chosen": -6.957637786865234,
528
+ "logps/rejected": -8.827032089233398,
529
+ "loss": 0.683,
530
+ "rewards/accuracies": 0.706250011920929,
531
+ "rewards/chosen": -0.06957637518644333,
532
+ "rewards/margins": 0.018693946301937103,
533
+ "rewards/rejected": -0.08827032148838043,
534
+ "step": 175
535
+ },
536
+ {
537
+ "epoch": 0.3925845147219193,
538
+ "grad_norm": 0.27552264475755045,
539
+ "learning_rate": 3.804620638944791e-07,
540
+ "logits/chosen": -22.68706512451172,
541
+ "logits/rejected": -22.84552764892578,
542
+ "logps/chosen": -9.296040534973145,
543
+ "logps/rejected": -11.636777877807617,
544
+ "loss": 0.6843,
545
+ "rewards/accuracies": 0.6937500238418579,
546
+ "rewards/chosen": -0.0929604023694992,
547
+ "rewards/margins": 0.023407381027936935,
548
+ "rewards/rejected": -0.11636777967214584,
549
+ "step": 180
550
+ },
551
+ {
552
+ "epoch": 0.4034896401308615,
553
+ "grad_norm": 0.27805736438529915,
554
+ "learning_rate": 3.722384637223084e-07,
555
+ "logits/chosen": -24.04327392578125,
556
+ "logits/rejected": -24.12721824645996,
557
+ "logps/chosen": -9.727739334106445,
558
+ "logps/rejected": -11.088327407836914,
559
+ "loss": 0.6848,
560
+ "rewards/accuracies": 0.6625000238418579,
561
+ "rewards/chosen": -0.09727739542722702,
562
+ "rewards/margins": 0.013605867512524128,
563
+ "rewards/rejected": -0.11088325828313828,
564
+ "step": 185
565
+ },
566
+ {
567
+ "epoch": 0.4143947655398037,
568
+ "grad_norm": 0.27448426639927703,
569
+ "learning_rate": 3.6383719907514274e-07,
570
+ "logits/chosen": -23.48944091796875,
571
+ "logits/rejected": -23.55702781677246,
572
+ "logps/chosen": -11.73414134979248,
573
+ "logps/rejected": -14.337844848632812,
574
+ "loss": 0.6804,
575
+ "rewards/accuracies": 0.643750011920929,
576
+ "rewards/chosen": -0.11734139919281006,
577
+ "rewards/margins": 0.026037033647298813,
578
+ "rewards/rejected": -0.14337845146656036,
579
+ "step": 190
580
+ },
581
+ {
582
+ "epoch": 0.42529989094874593,
583
+ "grad_norm": 0.30500743869421215,
584
+ "learning_rate": 3.5527048056351654e-07,
585
+ "logits/chosen": -24.235092163085938,
586
+ "logits/rejected": -24.290729522705078,
587
+ "logps/chosen": -10.834362030029297,
588
+ "logps/rejected": -13.723051071166992,
589
+ "loss": 0.6817,
590
+ "rewards/accuracies": 0.6499999761581421,
591
+ "rewards/chosen": -0.10834361612796783,
592
+ "rewards/margins": 0.028886884450912476,
593
+ "rewards/rejected": -0.1372305005788803,
594
+ "step": 195
595
+ },
596
+ {
597
+ "epoch": 0.4362050163576881,
598
+ "grad_norm": 0.37377098173604945,
599
+ "learning_rate": 3.465507592727957e-07,
600
+ "logits/chosen": -23.979053497314453,
601
+ "logits/rejected": -24.071990966796875,
602
+ "logps/chosen": -12.171896934509277,
603
+ "logps/rejected": -16.258481979370117,
604
+ "loss": 0.6799,
605
+ "rewards/accuracies": 0.731249988079071,
606
+ "rewards/chosen": -0.12171895802021027,
607
+ "rewards/margins": 0.04086584970355034,
608
+ "rewards/rejected": -0.1625848114490509,
609
+ "step": 200
610
+ },
611
+ {
612
+ "epoch": 0.44711014176663033,
613
+ "grad_norm": 0.37089627410325865,
614
+ "learning_rate": 3.37690708666455e-07,
615
+ "logits/chosen": -24.075651168823242,
616
+ "logits/rejected": -24.11351203918457,
617
+ "logps/chosen": -12.68486499786377,
618
+ "logps/rejected": -14.939569473266602,
619
+ "loss": 0.6807,
620
+ "rewards/accuracies": 0.668749988079071,
621
+ "rewards/chosen": -0.12684863805770874,
622
+ "rewards/margins": 0.022547055035829544,
623
+ "rewards/rejected": -0.14939570426940918,
624
+ "step": 205
625
+ },
626
+ {
627
+ "epoch": 0.4580152671755725,
628
+ "grad_norm": 0.37053905747928084,
629
+ "learning_rate": 3.287032061661462e-07,
630
+ "logits/chosen": -24.205493927001953,
631
+ "logits/rejected": -24.298234939575195,
632
+ "logps/chosen": -13.609357833862305,
633
+ "logps/rejected": -18.634946823120117,
634
+ "loss": 0.6757,
635
+ "rewards/accuracies": 0.6937500238418579,
636
+ "rewards/chosen": -0.13609358668327332,
637
+ "rewards/margins": 0.050255876034498215,
638
+ "rewards/rejected": -0.18634946644306183,
639
+ "step": 210
640
+ },
641
+ {
642
+ "epoch": 0.46892039258451473,
643
+ "grad_norm": 0.3633800041091051,
644
+ "learning_rate": 3.196013144353274e-07,
645
+ "logits/chosen": -24.66036033630371,
646
+ "logits/rejected": -24.763050079345703,
647
+ "logps/chosen": -13.911908149719238,
648
+ "logps/rejected": -17.66451644897461,
649
+ "loss": 0.6782,
650
+ "rewards/accuracies": 0.706250011920929,
651
+ "rewards/chosen": -0.13911907374858856,
652
+ "rewards/margins": 0.03752611204981804,
653
+ "rewards/rejected": -0.1766451895236969,
654
+ "step": 215
655
+ },
656
+ {
657
+ "epoch": 0.4798255179934569,
658
+ "grad_norm": 1.0948303510787734,
659
+ "learning_rate": 3.103982623936575e-07,
660
+ "logits/chosen": -24.110694885253906,
661
+ "logits/rejected": -24.23526954650879,
662
+ "logps/chosen": -15.881921768188477,
663
+ "logps/rejected": -20.27142906188965,
664
+ "loss": 0.6752,
665
+ "rewards/accuracies": 0.706250011920929,
666
+ "rewards/chosen": -0.15881919860839844,
667
+ "rewards/margins": 0.043895088136196136,
668
+ "rewards/rejected": -0.20271429419517517,
669
+ "step": 220
670
+ },
671
+ {
672
+ "epoch": 0.49073064340239914,
673
+ "grad_norm": 0.5197470019914936,
674
+ "learning_rate": 3.011074259897499e-07,
675
+ "logits/chosen": -24.41493034362793,
676
+ "logits/rejected": -24.538925170898438,
677
+ "logps/chosen": -15.199113845825195,
678
+ "logps/rejected": -19.166044235229492,
679
+ "loss": 0.6746,
680
+ "rewards/accuracies": 0.6499999761581421,
681
+ "rewards/chosen": -0.1519911140203476,
682
+ "rewards/margins": 0.03966929763555527,
683
+ "rewards/rejected": -0.19166040420532227,
684
+ "step": 225
685
+ },
686
+ {
687
+ "epoch": 0.5016357688113413,
688
+ "grad_norm": 0.6808943035909418,
689
+ "learning_rate": 2.9174230876023054e-07,
690
+ "logits/chosen": -24.559289932250977,
691
+ "logits/rejected": -24.69730567932129,
692
+ "logps/chosen": -18.434986114501953,
693
+ "logps/rejected": -22.413331985473633,
694
+ "loss": 0.6766,
695
+ "rewards/accuracies": 0.6812499761581421,
696
+ "rewards/chosen": -0.18434984982013702,
697
+ "rewards/margins": 0.03978346660733223,
698
+ "rewards/rejected": -0.22413332760334015,
699
+ "step": 230
700
+ },
701
+ {
702
+ "epoch": 0.5125408942202835,
703
+ "grad_norm": 0.5653763032514039,
704
+ "learning_rate": 2.8231652220335603e-07,
705
+ "logits/chosen": -24.52471351623535,
706
+ "logits/rejected": -24.600597381591797,
707
+ "logps/chosen": -18.48925018310547,
708
+ "logps/rejected": -23.984424591064453,
709
+ "loss": 0.6707,
710
+ "rewards/accuracies": 0.643750011920929,
711
+ "rewards/chosen": -0.18489250540733337,
712
+ "rewards/margins": 0.0549517385661602,
713
+ "rewards/rejected": -0.23984424769878387,
714
+ "step": 235
715
+ },
716
+ {
717
+ "epoch": 0.5234460196292258,
718
+ "grad_norm": 0.6497132806211787,
719
+ "learning_rate": 2.728437659957177e-07,
720
+ "logits/chosen": -24.80784797668457,
721
+ "logits/rejected": -24.986042022705078,
722
+ "logps/chosen": -19.79264259338379,
723
+ "logps/rejected": -24.296344757080078,
724
+ "loss": 0.6715,
725
+ "rewards/accuracies": 0.637499988079071,
726
+ "rewards/chosen": -0.19792641699314117,
727
+ "rewards/margins": 0.045037031173706055,
728
+ "rewards/rejected": -0.24296343326568604,
729
+ "step": 240
730
+ },
731
+ {
732
+ "epoch": 0.5343511450381679,
733
+ "grad_norm": 0.9626814200638923,
734
+ "learning_rate": 2.6333780808078594e-07,
735
+ "logits/chosen": -24.93509292602539,
736
+ "logits/rejected": -25.033912658691406,
737
+ "logps/chosen": -22.77157211303711,
738
+ "logps/rejected": -29.090633392333984,
739
+ "loss": 0.6665,
740
+ "rewards/accuracies": 0.78125,
741
+ "rewards/chosen": -0.22771573066711426,
742
+ "rewards/margins": 0.06319063156843185,
743
+ "rewards/rejected": -0.2909063696861267,
744
+ "step": 245
745
+ },
746
+ {
747
+ "epoch": 0.5452562704471101,
748
+ "grad_norm": 0.8758115163547733,
749
+ "learning_rate": 2.538124646582315e-07,
750
+ "logits/chosen": -24.20846176147461,
751
+ "logits/rejected": -24.555444717407227,
752
+ "logps/chosen": -13.707853317260742,
753
+ "logps/rejected": -20.560867309570312,
754
+ "loss": 0.6683,
755
+ "rewards/accuracies": 0.7124999761581421,
756
+ "rewards/chosen": -0.13707853853702545,
757
+ "rewards/margins": 0.0685301423072815,
758
+ "rewards/rejected": -0.20560868084430695,
759
+ "step": 250
760
+ },
761
+ {
762
+ "epoch": 0.5561613958560524,
763
+ "grad_norm": 1.2031911734843694,
764
+ "learning_rate": 2.442815801031128e-07,
765
+ "logits/chosen": -24.35436248779297,
766
+ "logits/rejected": -24.653484344482422,
767
+ "logps/chosen": -15.509927749633789,
768
+ "logps/rejected": -22.37173080444336,
769
+ "loss": 0.6642,
770
+ "rewards/accuracies": 0.793749988079071,
771
+ "rewards/chosen": -0.1550992727279663,
772
+ "rewards/margins": 0.06861802190542221,
773
+ "rewards/rejected": -0.22371730208396912,
774
+ "step": 255
775
+ },
776
+ {
777
+ "epoch": 0.5670665212649946,
778
+ "grad_norm": 1.26121798704608,
779
+ "learning_rate": 2.3475900684411025e-07,
780
+ "logits/chosen": -24.240325927734375,
781
+ "logits/rejected": -24.665193557739258,
782
+ "logps/chosen": -14.284322738647461,
783
+ "logps/rejected": -21.667491912841797,
784
+ "loss": 0.665,
785
+ "rewards/accuracies": 0.768750011920929,
786
+ "rewards/chosen": -0.14284323155879974,
787
+ "rewards/margins": 0.07383168488740921,
788
+ "rewards/rejected": -0.21667489409446716,
789
+ "step": 260
790
+ },
791
+ {
792
+ "epoch": 0.5779716466739367,
793
+ "grad_norm": 1.4926633522783754,
794
+ "learning_rate": 2.2525858523005637e-07,
795
+ "logits/chosen": -24.77151870727539,
796
+ "logits/rejected": -25.164073944091797,
797
+ "logps/chosen": -19.22076416015625,
798
+ "logps/rejected": -25.62625503540039,
799
+ "loss": 0.664,
800
+ "rewards/accuracies": 0.6937500238418579,
801
+ "rewards/chosen": -0.19220763444900513,
802
+ "rewards/margins": 0.06405490636825562,
803
+ "rewards/rejected": -0.25626254081726074,
804
+ "step": 265
805
+ },
806
+ {
807
+ "epoch": 0.5888767720828789,
808
+ "grad_norm": 1.9007333677964324,
809
+ "learning_rate": 2.1579412341402248e-07,
810
+ "logits/chosen": -24.617694854736328,
811
+ "logits/rejected": -24.862285614013672,
812
+ "logps/chosen": -16.634843826293945,
813
+ "logps/rejected": -22.411142349243164,
814
+ "loss": 0.6635,
815
+ "rewards/accuracies": 0.7124999761581421,
816
+ "rewards/chosen": -0.1663484275341034,
817
+ "rewards/margins": 0.05776297301054001,
818
+ "rewards/rejected": -0.2241113930940628,
819
+ "step": 270
820
+ },
821
+ {
822
+ "epoch": 0.5997818974918212,
823
+ "grad_norm": 1.5526395061631688,
824
+ "learning_rate": 2.0637937728420008e-07,
825
+ "logits/chosen": -24.820884704589844,
826
+ "logits/rejected": -25.266693115234375,
827
+ "logps/chosen": -19.834583282470703,
828
+ "logps/rejected": -27.931264877319336,
829
+ "loss": 0.6597,
830
+ "rewards/accuracies": 0.737500011920929,
831
+ "rewards/chosen": -0.1983458548784256,
832
+ "rewards/margins": 0.08096680045127869,
833
+ "rewards/rejected": -0.2793126702308655,
834
+ "step": 275
835
+ },
836
+ {
837
+ "epoch": 0.6106870229007634,
838
+ "grad_norm": 1.7934268985600719,
839
+ "learning_rate": 1.970280304707447e-07,
840
+ "logits/chosen": -24.92822265625,
841
+ "logits/rejected": -25.202295303344727,
842
+ "logps/chosen": -14.220446586608887,
843
+ "logps/rejected": -22.21088981628418,
844
+ "loss": 0.661,
845
+ "rewards/accuracies": 0.78125,
846
+ "rewards/chosen": -0.14220447838306427,
847
+ "rewards/margins": 0.07990442216396332,
848
+ "rewards/rejected": -0.22210891544818878,
849
+ "step": 280
850
+ },
851
+ {
852
+ "epoch": 0.6215921483097055,
853
+ "grad_norm": 2.748107098549448,
854
+ "learning_rate": 1.8775367445764204e-07,
855
+ "logits/chosen": -24.601261138916016,
856
+ "logits/rejected": -25.075407028198242,
857
+ "logps/chosen": -17.336923599243164,
858
+ "logps/rejected": -23.92327880859375,
859
+ "loss": 0.6637,
860
+ "rewards/accuracies": 0.7437499761581421,
861
+ "rewards/chosen": -0.17336924374103546,
862
+ "rewards/margins": 0.06586353480815887,
863
+ "rewards/rejected": -0.23923280835151672,
864
+ "step": 285
865
+ },
866
+ {
867
+ "epoch": 0.6324972737186477,
868
+ "grad_norm": 2.6772560842896804,
869
+ "learning_rate": 1.785697888285011e-07,
870
+ "logits/chosen": -25.160493850708008,
871
+ "logits/rejected": -25.41177749633789,
872
+ "logps/chosen": -18.49761390686035,
873
+ "logps/rejected": -24.65076446533203,
874
+ "loss": 0.6609,
875
+ "rewards/accuracies": 0.731249988079071,
876
+ "rewards/chosen": -0.18497613072395325,
877
+ "rewards/margins": 0.061531513929367065,
878
+ "rewards/rejected": -0.2465076446533203,
879
+ "step": 290
880
+ },
881
+ {
882
+ "epoch": 0.64340239912759,
883
+ "grad_norm": 2.024301326251699,
884
+ "learning_rate": 1.6948972167498649e-07,
885
+ "logits/chosen": -25.294282913208008,
886
+ "logits/rejected": -25.73337745666504,
887
+ "logps/chosen": -17.11026954650879,
888
+ "logps/rejected": -24.634340286254883,
889
+ "loss": 0.6587,
890
+ "rewards/accuracies": 0.6875,
891
+ "rewards/chosen": -0.17110270261764526,
892
+ "rewards/margins": 0.07524070143699646,
893
+ "rewards/rejected": -0.24634337425231934,
894
+ "step": 295
895
+ },
896
+ {
897
+ "epoch": 0.6543075245365322,
898
+ "grad_norm": 2.7307785987453963,
899
+ "learning_rate": 1.605266701963646e-07,
900
+ "logits/chosen": -25.117237091064453,
901
+ "logits/rejected": -25.448089599609375,
902
+ "logps/chosen": -17.745468139648438,
903
+ "logps/rejected": -26.143442153930664,
904
+ "loss": 0.6547,
905
+ "rewards/accuracies": 0.7562500238418579,
906
+ "rewards/chosen": -0.17745468020439148,
907
+ "rewards/margins": 0.08397971838712692,
908
+ "rewards/rejected": -0.261434406042099,
909
+ "step": 300
910
+ },
911
+ {
912
+ "epoch": 0.6652126499454744,
913
+ "grad_norm": 1.857948182227819,
914
+ "learning_rate": 1.5169366151835994e-07,
915
+ "logits/chosen": -25.616552352905273,
916
+ "logits/rejected": -25.87392807006836,
917
+ "logps/chosen": -23.979658126831055,
918
+ "logps/rejected": -29.496234893798828,
919
+ "loss": 0.6583,
920
+ "rewards/accuracies": 0.6625000238418579,
921
+ "rewards/chosen": -0.23979659378528595,
922
+ "rewards/margins": 0.05516573786735535,
923
+ "rewards/rejected": -0.2949623465538025,
924
+ "step": 305
925
+ },
926
+ {
927
+ "epoch": 0.6761177753544165,
928
+ "grad_norm": 2.5256107025497885,
929
+ "learning_rate": 1.430035337592018e-07,
930
+ "logits/chosen": -25.01370620727539,
931
+ "logits/rejected": -25.45524787902832,
932
+ "logps/chosen": -19.495426177978516,
933
+ "logps/rejected": -28.25351333618164,
934
+ "loss": 0.6583,
935
+ "rewards/accuracies": 0.7437499761581421,
936
+ "rewards/chosen": -0.19495424628257751,
937
+ "rewards/margins": 0.0875808596611023,
938
+ "rewards/rejected": -0.2825351357460022,
939
+ "step": 310
940
+ },
941
+ {
942
+ "epoch": 0.6870229007633588,
943
+ "grad_norm": 2.8615478848624023,
944
+ "learning_rate": 1.3446891737037762e-07,
945
+ "logits/chosen": -24.765771865844727,
946
+ "logits/rejected": -25.376537322998047,
947
+ "logps/chosen": -17.96234130859375,
948
+ "logps/rejected": -26.534252166748047,
949
+ "loss": 0.6546,
950
+ "rewards/accuracies": 0.7124999761581421,
951
+ "rewards/chosen": -0.17962339520454407,
952
+ "rewards/margins": 0.08571910858154297,
953
+ "rewards/rejected": -0.26534250378608704,
954
+ "step": 315
955
+ },
956
+ {
957
+ "epoch": 0.697928026172301,
958
+ "grad_norm": 2.9485949341956044,
959
+ "learning_rate": 1.261022167792161e-07,
960
+ "logits/chosen": -25.101655960083008,
961
+ "logits/rejected": -25.687358856201172,
962
+ "logps/chosen": -20.705102920532227,
963
+ "logps/rejected": -29.696491241455078,
964
+ "loss": 0.6557,
965
+ "rewards/accuracies": 0.7437499761581421,
966
+ "rewards/chosen": -0.20705100893974304,
967
+ "rewards/margins": 0.08991388976573944,
968
+ "rewards/rejected": -0.2969648838043213,
969
+ "step": 320
970
+ },
971
+ {
972
+ "epoch": 0.7088331515812432,
973
+ "grad_norm": 2.2993871611090584,
974
+ "learning_rate": 1.1791559235997833e-07,
975
+ "logits/chosen": -25.622081756591797,
976
+ "logits/rejected": -25.974563598632812,
977
+ "logps/chosen": -25.657718658447266,
978
+ "logps/rejected": -31.523218154907227,
979
+ "loss": 0.6603,
980
+ "rewards/accuracies": 0.65625,
981
+ "rewards/chosen": -0.25657719373703003,
982
+ "rewards/margins": 0.05865497514605522,
983
+ "rewards/rejected": -0.31523215770721436,
984
+ "step": 325
985
+ },
986
+ {
987
+ "epoch": 0.7197382769901853,
988
+ "grad_norm": 2.777928096129579,
989
+ "learning_rate": 1.0992094275966254e-07,
990
+ "logits/chosen": -25.372146606445312,
991
+ "logits/rejected": -25.923391342163086,
992
+ "logps/chosen": -21.982194900512695,
993
+ "logps/rejected": -31.152759552001953,
994
+ "loss": 0.6558,
995
+ "rewards/accuracies": 0.699999988079071,
996
+ "rewards/chosen": -0.21982192993164062,
997
+ "rewards/margins": 0.09170565754175186,
998
+ "rewards/rejected": -0.3115276098251343,
999
+ "step": 330
1000
+ },
1001
+ {
1002
+ "epoch": 0.7306434023991276,
1003
+ "grad_norm": 2.83155273465803,
1004
+ "learning_rate": 1.0212988760420918e-07,
1005
+ "logits/chosen": -24.919795989990234,
1006
+ "logits/rejected": -25.5791015625,
1007
+ "logps/chosen": -18.939666748046875,
1008
+ "logps/rejected": -28.968042373657227,
1009
+ "loss": 0.649,
1010
+ "rewards/accuracies": 0.768750011920929,
1011
+ "rewards/chosen": -0.1893966645002365,
1012
+ "rewards/margins": 0.10028377920389175,
1013
+ "rewards/rejected": -0.28968045115470886,
1014
+ "step": 335
1015
+ },
1016
+ {
1017
+ "epoch": 0.7415485278080698,
1018
+ "grad_norm": 3.183452120789625,
1019
+ "learning_rate": 9.455375061024317e-08,
1020
+ "logits/chosen": -24.678586959838867,
1021
+ "logits/rejected": -25.56129264831543,
1022
+ "logps/chosen": -15.477849006652832,
1023
+ "logps/rejected": -26.394145965576172,
1024
+ "loss": 0.6509,
1025
+ "rewards/accuracies": 0.793749988079071,
1026
+ "rewards/chosen": -0.15477848052978516,
1027
+ "rewards/margins": 0.10916298627853394,
1028
+ "rewards/rejected": -0.2639414668083191,
1029
+ "step": 340
1030
+ },
1031
+ {
1032
+ "epoch": 0.752453653217012,
1033
+ "grad_norm": 3.530921544143697,
1034
+ "learning_rate": 8.720354312689751e-08,
1035
+ "logits/chosen": -24.498729705810547,
1036
+ "logits/rejected": -25.28777313232422,
1037
+ "logps/chosen": -20.05240249633789,
1038
+ "logps/rejected": -29.38003158569336,
1039
+ "loss": 0.6518,
1040
+ "rewards/accuracies": 0.7250000238418579,
1041
+ "rewards/chosen": -0.20052401721477509,
1042
+ "rewards/margins": 0.09327626973390579,
1043
+ "rewards/rejected": -0.2938002943992615,
1044
+ "step": 345
1045
+ },
1046
+ {
1047
+ "epoch": 0.7633587786259542,
1048
+ "grad_norm": 3.0505910146648727,
1049
+ "learning_rate": 8.008994813163994e-08,
1050
+ "logits/chosen": -24.892383575439453,
1051
+ "logits/rejected": -25.568103790283203,
1052
+ "logps/chosen": -21.45001220703125,
1053
+ "logps/rejected": -31.58233070373535,
1054
+ "loss": 0.6533,
1055
+ "rewards/accuracies": 0.731249988079071,
1056
+ "rewards/chosen": -0.21450011432170868,
1057
+ "rewards/margins": 0.1013231873512268,
1058
+ "rewards/rejected": -0.3158233165740967,
1059
+ "step": 350
1060
+ },
1061
+ {
1062
+ "epoch": 0.7742639040348964,
1063
+ "grad_norm": 3.3936252259046684,
1064
+ "learning_rate": 7.322330470336313e-08,
1065
+ "logits/chosen": -25.23516845703125,
1066
+ "logits/rejected": -25.73038673400879,
1067
+ "logps/chosen": -23.45631217956543,
1068
+ "logps/rejected": -33.43750762939453,
1069
+ "loss": 0.652,
1070
+ "rewards/accuracies": 0.675000011920929,
1071
+ "rewards/chosen": -0.23456314206123352,
1072
+ "rewards/margins": 0.09981193393468857,
1073
+ "rewards/rejected": -0.3343750536441803,
1074
+ "step": 355
1075
+ },
1076
+ {
1077
+ "epoch": 0.7851690294438386,
1078
+ "grad_norm": 3.1909990002329427,
1079
+ "learning_rate": 6.661359299530626e-08,
1080
+ "logits/chosen": -24.70314598083496,
1081
+ "logits/rejected": -25.460840225219727,
1082
+ "logps/chosen": -20.430919647216797,
1083
+ "logps/rejected": -31.104305267333984,
1084
+ "loss": 0.6483,
1085
+ "rewards/accuracies": 0.793749988079071,
1086
+ "rewards/chosen": -0.20430922508239746,
1087
+ "rewards/margins": 0.10673384368419647,
1088
+ "rewards/rejected": -0.3110430836677551,
1089
+ "step": 360
1090
+ },
1091
+ {
1092
+ "epoch": 0.7960741548527808,
1093
+ "grad_norm": 3.291992655231796,
1094
+ "learning_rate": 6.027041972964766e-08,
1095
+ "logits/chosen": -24.697559356689453,
1096
+ "logits/rejected": -25.534496307373047,
1097
+ "logps/chosen": -20.09422492980957,
1098
+ "logps/rejected": -30.154062271118164,
1099
+ "loss": 0.6521,
1100
+ "rewards/accuracies": 0.731249988079071,
1101
+ "rewards/chosen": -0.2009422332048416,
1102
+ "rewards/margins": 0.10059837996959686,
1103
+ "rewards/rejected": -0.3015406131744385,
1104
+ "step": 365
1105
+ },
1106
+ {
1107
+ "epoch": 0.806979280261723,
1108
+ "grad_norm": 3.2949559481980986,
1109
+ "learning_rate": 5.4203004234851664e-08,
1110
+ "logits/chosen": -24.35785675048828,
1111
+ "logits/rejected": -25.193906784057617,
1112
+ "logps/chosen": -21.446033477783203,
1113
+ "logps/rejected": -31.33773422241211,
1114
+ "loss": 0.647,
1115
+ "rewards/accuracies": 0.731249988079071,
1116
+ "rewards/chosen": -0.2144603431224823,
1117
+ "rewards/margins": 0.09891701489686966,
1118
+ "rewards/rejected": -0.313377320766449,
1119
+ "step": 370
1120
+ },
1121
+ {
1122
+ "epoch": 0.8178844056706652,
1123
+ "grad_norm": 3.594122355037719,
1124
+ "learning_rate": 4.842016504606375e-08,
1125
+ "logits/chosen": -24.57286262512207,
1126
+ "logits/rejected": -25.43461036682129,
1127
+ "logps/chosen": -21.629987716674805,
1128
+ "logps/rejected": -32.51239776611328,
1129
+ "loss": 0.6504,
1130
+ "rewards/accuracies": 0.768750011920929,
1131
+ "rewards/chosen": -0.2162998616695404,
1132
+ "rewards/margins": 0.10882411152124405,
1133
+ "rewards/rejected": -0.32512399554252625,
1134
+ "step": 375
1135
+ },
1136
+ {
1137
+ "epoch": 0.8287895310796074,
1138
+ "grad_norm": 3.1838157026232135,
1139
+ "learning_rate": 4.293030708802833e-08,
1140
+ "logits/chosen": -24.03682518005371,
1141
+ "logits/rejected": -24.663799285888672,
1142
+ "logps/chosen": -21.035297393798828,
1143
+ "logps/rejected": -28.495147705078125,
1144
+ "loss": 0.6511,
1145
+ "rewards/accuracies": 0.7124999761581421,
1146
+ "rewards/chosen": -0.21035297214984894,
1147
+ "rewards/margins": 0.0745985358953476,
1148
+ "rewards/rejected": -0.28495147824287415,
1149
+ "step": 380
1150
+ },
1151
+ {
1152
+ "epoch": 0.8396946564885496,
1153
+ "grad_norm": 3.6512115795796376,
1154
+ "learning_rate": 3.7741409459158576e-08,
1155
+ "logits/chosen": -23.64044761657715,
1156
+ "logits/rejected": -24.594707489013672,
1157
+ "logps/chosen": -18.868743896484375,
1158
+ "logps/rejected": -27.33072280883789,
1159
+ "loss": 0.6558,
1160
+ "rewards/accuracies": 0.699999988079071,
1161
+ "rewards/chosen": -0.18868745863437653,
1162
+ "rewards/margins": 0.08461979776620865,
1163
+ "rewards/rejected": -0.2733072340488434,
1164
+ "step": 385
1165
+ },
1166
+ {
1167
+ "epoch": 0.8505997818974919,
1168
+ "grad_norm": 3.336997336682689,
1169
+ "learning_rate": 3.286101383451284e-08,
1170
+ "logits/chosen": -23.809391021728516,
1171
+ "logits/rejected": -24.789653778076172,
1172
+ "logps/chosen": -19.703807830810547,
1173
+ "logps/rejected": -31.056636810302734,
1174
+ "loss": 0.6508,
1175
+ "rewards/accuracies": 0.7437499761581421,
1176
+ "rewards/chosen": -0.19703808426856995,
1177
+ "rewards/margins": 0.1135282889008522,
1178
+ "rewards/rejected": -0.31056636571884155,
1179
+ "step": 390
1180
+ },
1181
+ {
1182
+ "epoch": 0.861504907306434,
1183
+ "grad_norm": 3.650332846610603,
1184
+ "learning_rate": 2.8296213504533596e-08,
1185
+ "logits/chosen": -23.612497329711914,
1186
+ "logits/rejected": -24.643917083740234,
1187
+ "logps/chosen": -18.772497177124023,
1188
+ "logps/rejected": -29.0363712310791,
1189
+ "loss": 0.6549,
1190
+ "rewards/accuracies": 0.768750011920929,
1191
+ "rewards/chosen": -0.1877249926328659,
1192
+ "rewards/margins": 0.10263872146606445,
1193
+ "rewards/rejected": -0.29036369919776917,
1194
+ "step": 395
1195
+ },
1196
+ {
1197
+ "epoch": 0.8724100327153762,
1198
+ "grad_norm": 3.1463089972485228,
1199
+ "learning_rate": 2.405364306547955e-08,
1200
+ "logits/chosen": -23.916240692138672,
1201
+ "logits/rejected": -24.74551773071289,
1202
+ "logps/chosen": -18.31199073791504,
1203
+ "logps/rejected": -27.967397689819336,
1204
+ "loss": 0.6503,
1205
+ "rewards/accuracies": 0.731249988079071,
1206
+ "rewards/chosen": -0.18311990797519684,
1207
+ "rewards/margins": 0.09655408561229706,
1208
+ "rewards/rejected": -0.2796739935874939,
1209
+ "step": 400
1210
+ },
1211
+ {
1212
+ "epoch": 0.8724100327153762,
1213
+ "eval_logits/chosen": -23.932262420654297,
1214
+ "eval_logits/rejected": -24.931102752685547,
1215
+ "eval_logps/chosen": -17.48914909362793,
1216
+ "eval_logps/rejected": -26.70553207397461,
1217
+ "eval_loss": 0.6508545279502869,
1218
+ "eval_rewards/accuracies": 0.756147563457489,
1219
+ "eval_rewards/chosen": -0.17489148676395416,
1220
+ "eval_rewards/margins": 0.09216383844614029,
1221
+ "eval_rewards/rejected": -0.26705533266067505,
1222
+ "eval_runtime": 90.5043,
1223
+ "eval_samples_per_second": 21.446,
1224
+ "eval_steps_per_second": 1.348,
1225
+ "step": 400
1226
+ },
1227
+ {
1228
+ "epoch": 0.8833151581243184,
1229
+ "grad_norm": 3.1425773193083977,
1230
+ "learning_rate": 2.0139468776535718e-08,
1231
+ "logits/chosen": -23.820995330810547,
1232
+ "logits/rejected": -24.96358299255371,
1233
+ "logps/chosen": -19.28446388244629,
1234
+ "logps/rejected": -29.758419036865234,
1235
+ "loss": 0.6522,
1236
+ "rewards/accuracies": 0.762499988079071,
1237
+ "rewards/chosen": -0.19284464418888092,
1238
+ "rewards/margins": 0.10473956167697906,
1239
+ "rewards/rejected": -0.2975841462612152,
1240
+ "step": 405
1241
+ },
1242
+ {
1243
+ "epoch": 0.8942202835332607,
1244
+ "grad_norm": 2.745854518026326,
1245
+ "learning_rate": 1.6559379597616136e-08,
1246
+ "logits/chosen": -23.470592498779297,
1247
+ "logits/rejected": -24.550033569335938,
1248
+ "logps/chosen": -18.000120162963867,
1249
+ "logps/rejected": -28.478153228759766,
1250
+ "loss": 0.6498,
1251
+ "rewards/accuracies": 0.762499988079071,
1252
+ "rewards/chosen": -0.18000119924545288,
1253
+ "rewards/margins": 0.10478033125400543,
1254
+ "rewards/rejected": -0.2847815155982971,
1255
+ "step": 410
1256
+ },
1257
+ {
1258
+ "epoch": 0.9051254089422028,
1259
+ "grad_norm": 3.963393459289569,
1260
+ "learning_rate": 1.3318578920886003e-08,
1261
+ "logits/chosen": -23.724620819091797,
1262
+ "logits/rejected": -24.733633041381836,
1263
+ "logps/chosen": -21.162649154663086,
1264
+ "logps/rejected": -32.321632385253906,
1265
+ "loss": 0.6462,
1266
+ "rewards/accuracies": 0.768750011920929,
1267
+ "rewards/chosen": -0.21162649989128113,
1268
+ "rewards/margins": 0.11158982664346695,
1269
+ "rewards/rejected": -0.3232163190841675,
1270
+ "step": 415
1271
+ },
1272
+ {
1273
+ "epoch": 0.916030534351145,
1274
+ "grad_norm": 3.646649584092885,
1275
+ "learning_rate": 1.042177700801966e-08,
1276
+ "logits/chosen": -23.974315643310547,
1277
+ "logits/rejected": -25.02378273010254,
1278
+ "logps/chosen": -19.89191436767578,
1279
+ "logps/rejected": -31.294485092163086,
1280
+ "loss": 0.6466,
1281
+ "rewards/accuracies": 0.699999988079071,
1282
+ "rewards/chosen": -0.1989191472530365,
1283
+ "rewards/margins": 0.11402571201324463,
1284
+ "rewards/rejected": -0.31294482946395874,
1285
+ "step": 420
1286
+ },
1287
+ {
1288
+ "epoch": 0.9269356597600873,
1289
+ "grad_norm": 2.910140700569881,
1290
+ "learning_rate": 7.873184144186972e-09,
1291
+ "logits/chosen": -23.87249183654785,
1292
+ "logits/rejected": -24.726253509521484,
1293
+ "logps/chosen": -19.595571517944336,
1294
+ "logps/rejected": -29.641769409179688,
1295
+ "loss": 0.646,
1296
+ "rewards/accuracies": 0.75,
1297
+ "rewards/chosen": -0.19595569372177124,
1298
+ "rewards/margins": 0.10046200454235077,
1299
+ "rewards/rejected": -0.2964176833629608,
1300
+ "step": 425
1301
+ },
1302
+ {
1303
+ "epoch": 0.9378407851690295,
1304
+ "grad_norm": 2.4959827939301458,
1305
+ "learning_rate": 5.676504518718761e-09,
1306
+ "logits/chosen": -24.001766204833984,
1307
+ "logits/rejected": -24.754119873046875,
1308
+ "logps/chosen": -19.787260055541992,
1309
+ "logps/rejected": -29.593700408935547,
1310
+ "loss": 0.6471,
1311
+ "rewards/accuracies": 0.706250011920929,
1312
+ "rewards/chosen": -0.197872593998909,
1313
+ "rewards/margins": 0.09806440025568008,
1314
+ "rewards/rejected": -0.2959369719028473,
1315
+ "step": 430
1316
+ },
1317
+ {
1318
+ "epoch": 0.9487459105779716,
1319
+ "grad_norm": 4.224961358571927,
1320
+ "learning_rate": 3.834930841344119e-09,
1321
+ "logits/chosen": -24.059728622436523,
1322
+ "logits/rejected": -24.974977493286133,
1323
+ "logps/chosen": -21.249866485595703,
1324
+ "logps/rejected": -30.9521427154541,
1325
+ "loss": 0.648,
1326
+ "rewards/accuracies": 0.7562500238418579,
1327
+ "rewards/chosen": -0.21249863505363464,
1328
+ "rewards/margins": 0.09702278673648834,
1329
+ "rewards/rejected": -0.30952146649360657,
1330
+ "step": 435
1331
+ },
1332
+ {
1333
+ "epoch": 0.9596510359869138,
1334
+ "grad_norm": 3.2680876255639357,
1335
+ "learning_rate": 2.3511397018252664e-09,
1336
+ "logits/chosen": -23.782819747924805,
1337
+ "logits/rejected": -24.70381736755371,
1338
+ "logps/chosen": -21.060720443725586,
1339
+ "logps/rejected": -28.60394859313965,
1340
+ "loss": 0.649,
1341
+ "rewards/accuracies": 0.6937500238418579,
1342
+ "rewards/chosen": -0.21060721576213837,
1343
+ "rewards/margins": 0.07543227076530457,
1344
+ "rewards/rejected": -0.28603947162628174,
1345
+ "step": 440
1346
+ },
1347
+ {
1348
+ "epoch": 0.9705561613958561,
1349
+ "grad_norm": 3.1683461698436934,
1350
+ "learning_rate": 1.227287679734429e-09,
1351
+ "logits/chosen": -23.462703704833984,
1352
+ "logits/rejected": -24.59607696533203,
1353
+ "logps/chosen": -18.034442901611328,
1354
+ "logps/rejected": -29.30611801147461,
1355
+ "loss": 0.6478,
1356
+ "rewards/accuracies": 0.7875000238418579,
1357
+ "rewards/chosen": -0.18034443259239197,
1358
+ "rewards/margins": 0.11271677166223526,
1359
+ "rewards/rejected": -0.29306119680404663,
1360
+ "step": 445
1361
+ },
1362
+ {
1363
+ "epoch": 0.9814612868047983,
1364
+ "grad_norm": 3.2800584418942376,
1365
+ "learning_rate": 4.650082100265407e-10,
1366
+ "logits/chosen": -23.944908142089844,
1367
+ "logits/rejected": -24.941503524780273,
1368
+ "logps/chosen": -20.453250885009766,
1369
+ "logps/rejected": -31.82330322265625,
1370
+ "loss": 0.648,
1371
+ "rewards/accuracies": 0.793749988079071,
1372
+ "rewards/chosen": -0.2045324742794037,
1373
+ "rewards/margins": 0.11370055377483368,
1374
+ "rewards/rejected": -0.31823304295539856,
1375
+ "step": 450
1376
+ },
1377
+ {
1378
+ "epoch": 0.9923664122137404,
1379
+ "grad_norm": 3.2265616237555537,
1380
+ "learning_rate": 6.54092089634739e-11,
1381
+ "logits/chosen": -23.501338958740234,
1382
+ "logits/rejected": -24.58260726928711,
1383
+ "logps/chosen": -19.16789436340332,
1384
+ "logps/rejected": -28.90520668029785,
1385
+ "loss": 0.6484,
1386
+ "rewards/accuracies": 0.7437499761581421,
1387
+ "rewards/chosen": -0.1916789561510086,
1388
+ "rewards/margins": 0.0973731279373169,
1389
+ "rewards/rejected": -0.2890520691871643,
1390
+ "step": 455
1391
+ },
1392
+ {
1393
+ "epoch": 0.9989094874591058,
1394
+ "step": 458,
1395
+ "total_flos": 0.0,
1396
+ "train_loss": 0.6719389883191305,
1397
+ "train_runtime": 8958.0836,
1398
+ "train_samples_per_second": 6.551,
1399
+ "train_steps_per_second": 0.051
1400
+ }
1401
+ ],
1402
+ "logging_steps": 5,
1403
+ "max_steps": 458,
1404
+ "num_input_tokens_seen": 0,
1405
+ "num_train_epochs": 1,
1406
+ "save_steps": 1000000,
1407
+ "stateful_callbacks": {
1408
+ "TrainerControl": {
1409
+ "args": {
1410
+ "should_epoch_stop": false,
1411
+ "should_evaluate": false,
1412
+ "should_log": false,
1413
+ "should_save": true,
1414
+ "should_training_stop": true
1415
+ },
1416
+ "attributes": {}
1417
+ }
1418
+ },
1419
+ "total_flos": 0.0,
1420
+ "train_batch_size": 2,
1421
+ "trial_name": null,
1422
+ "trial_params": null
1423
+ }