Oberhaus commited on
Commit
cb33b25
·
verified ·
1 Parent(s): 25068c1

End of training

Browse files
all_results.json CHANGED
@@ -1,8 +1,8 @@
1
  {
2
  "total_flos": 0.0,
3
- "train_loss": 0.0025116026401519774,
4
- "train_runtime": 799.9489,
5
- "train_samples": 2,
6
- "train_samples_per_second": 0.05,
7
- "train_steps_per_second": 0.013
8
  }
 
1
  {
2
  "total_flos": 0.0,
3
+ "train_loss": 0.009888447250705212,
4
+ "train_runtime": 625.0756,
5
+ "train_samples": 27,
6
+ "train_samples_per_second": 0.064,
7
+ "train_steps_per_second": 0.016
8
  }
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9a3158ccaf4cbb037a69a564fb85739b375d4a19acc624a9a1c79f01fe6f025a
3
  size 1976163472
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2f8973be940c2e7e354d3b1e541c04a913d6bc99f036ae16e3fab345cb7289bf
3
  size 1976163472
train_results.json CHANGED
@@ -1,8 +1,8 @@
1
  {
2
  "total_flos": 0.0,
3
- "train_loss": 0.0025116026401519774,
4
- "train_runtime": 799.9489,
5
- "train_samples": 2,
6
- "train_samples_per_second": 0.05,
7
- "train_steps_per_second": 0.013
8
  }
 
1
  {
2
  "total_flos": 0.0,
3
+ "train_loss": 0.009888447250705212,
4
+ "train_runtime": 625.0756,
5
+ "train_samples": 27,
6
+ "train_samples_per_second": 0.064,
7
+ "train_steps_per_second": 0.016
8
  }
trainer_state.json CHANGED
@@ -2,7 +2,7 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 10.0,
6
  "eval_steps": 500,
7
  "global_step": 10,
8
  "is_hyper_param_search": false,
@@ -16,21 +16,21 @@
16
  "clip_ratio/low_min": 0.0,
17
  "clip_ratio/region_mean": 0.0,
18
  "completions/clipped_ratio": 0.0,
19
- "completions/max_length": 69.0,
20
- "completions/max_terminated_length": 69.0,
21
- "completions/mean_length": 64.875,
22
- "completions/mean_terminated_length": 64.875,
23
- "completions/min_length": 62.0,
24
- "completions/min_terminated_length": 62.0,
25
- "epoch": 2.0,
26
  "frac_reward_zero_std": 0.5,
27
- "grad_norm": 6.228816032409668,
28
  "kl": 0.0,
29
  "learning_rate": 5e-07,
30
- "loss": 0.0046,
31
- "num_tokens": 1543.0,
32
- "reward": 0.6934062242507935,
33
- "reward_std": 0.06088415801059455,
34
  "rewards/concensus_correctness_reward_func/mean": 0.0,
35
  "rewards/concensus_correctness_reward_func/std": 0.0,
36
  "rewards/consensus_reward_func/mean": 0.0,
@@ -39,13 +39,13 @@
39
  "rewards/cumulative_reward_2/std": 0.0,
40
  "rewards/final_correctness_reward_func/mean": 0.0,
41
  "rewards/final_correctness_reward_func/std": 0.0,
42
- "rewards/question_recreation_reward_func/mean": 0.199406236410141,
43
- "rewards/question_recreation_reward_func/std": 0.20537260174751282,
44
  "rewards/soft_format_reward_func/mean": 0.0,
45
  "rewards/soft_format_reward_func/std": 0.0,
46
  "rewards/strict_format_reward_func/mean": 0.0,
47
  "rewards/strict_format_reward_func/std": 0.0,
48
- "rewards/xmlcount_reward_func/mean": 0.49399998784065247,
49
  "rewards/xmlcount_reward_func/std": 0.0,
50
  "step": 2
51
  },
@@ -56,21 +56,21 @@
56
  "clip_ratio/low_min": 0.0,
57
  "clip_ratio/region_mean": 0.0,
58
  "completions/clipped_ratio": 0.0,
59
- "completions/max_length": 95.0,
60
- "completions/max_terminated_length": 95.0,
61
- "completions/mean_length": 71.0,
62
- "completions/mean_terminated_length": 71.0,
63
- "completions/min_length": 62.0,
64
- "completions/min_terminated_length": 62.0,
65
- "epoch": 4.0,
66
  "frac_reward_zero_std": 0.5,
67
- "grad_norm": 14.296950340270996,
68
- "kl": 0.008060061466267143,
69
  "learning_rate": 4.415111107797445e-07,
70
- "loss": 0.0558,
71
- "num_tokens": 3135.0,
72
- "reward": 0.6558665037155151,
73
- "reward_std": 0.09568738762754947,
74
  "rewards/concensus_correctness_reward_func/mean": 0.0,
75
  "rewards/concensus_correctness_reward_func/std": 0.0,
76
  "rewards/consensus_reward_func/mean": 0.0,
@@ -79,14 +79,14 @@
79
  "rewards/cumulative_reward_2/std": 0.0,
80
  "rewards/final_correctness_reward_func/mean": 0.0,
81
  "rewards/final_correctness_reward_func/std": 0.0,
82
- "rewards/question_recreation_reward_func/mean": 0.22361651808023453,
83
- "rewards/question_recreation_reward_func/std": 0.20930995047092438,
84
  "rewards/soft_format_reward_func/mean": 0.0,
85
  "rewards/soft_format_reward_func/std": 0.0,
86
  "rewards/strict_format_reward_func/mean": 0.0,
87
  "rewards/strict_format_reward_func/std": 0.0,
88
- "rewards/xmlcount_reward_func/mean": 0.4322499930858612,
89
- "rewards/xmlcount_reward_func/std": 0.12349999696016312,
90
  "step": 4
91
  },
92
  {
@@ -96,21 +96,21 @@
96
  "clip_ratio/low_min": 0.0,
97
  "clip_ratio/region_mean": 0.0,
98
  "completions/clipped_ratio": 0.0,
99
- "completions/max_length": 65.5,
100
- "completions/max_terminated_length": 65.5,
101
- "completions/mean_length": 63.25,
102
- "completions/mean_terminated_length": 63.25,
103
- "completions/min_length": 61.0,
104
- "completions/min_terminated_length": 61.0,
105
- "epoch": 6.0,
106
- "frac_reward_zero_std": 0.0,
107
- "grad_norm": 7.470577716827393,
108
- "kl": 0.021054526325315237,
109
  "learning_rate": 2.934120444167326e-07,
110
- "loss": -0.0026,
111
- "num_tokens": 4665.0,
112
- "reward": 0.7195066809654236,
113
- "reward_std": 0.007645343546755612,
114
  "rewards/concensus_correctness_reward_func/mean": 0.0,
115
  "rewards/concensus_correctness_reward_func/std": 0.0,
116
  "rewards/consensus_reward_func/mean": 0.0,
@@ -119,13 +119,13 @@
119
  "rewards/cumulative_reward_2/std": 0.0,
120
  "rewards/final_correctness_reward_func/mean": 0.0,
121
  "rewards/final_correctness_reward_func/std": 0.0,
122
- "rewards/question_recreation_reward_func/mean": 0.22550669312477112,
123
- "rewards/question_recreation_reward_func/std": 0.20679625123739243,
124
  "rewards/soft_format_reward_func/mean": 0.0,
125
  "rewards/soft_format_reward_func/std": 0.0,
126
  "rewards/strict_format_reward_func/mean": 0.0,
127
  "rewards/strict_format_reward_func/std": 0.0,
128
- "rewards/xmlcount_reward_func/mean": 0.49399998784065247,
129
  "rewards/xmlcount_reward_func/std": 0.0,
130
  "step": 6
131
  },
@@ -136,21 +136,21 @@
136
  "clip_ratio/low_min": 0.0,
137
  "clip_ratio/region_mean": 0.0,
138
  "completions/clipped_ratio": 0.0,
139
- "completions/max_length": 64.5,
140
- "completions/max_terminated_length": 64.5,
141
- "completions/mean_length": 59.75,
142
- "completions/mean_terminated_length": 59.75,
143
- "completions/min_length": 49.0,
144
- "completions/min_terminated_length": 49.0,
145
- "epoch": 8.0,
146
  "frac_reward_zero_std": 0.25,
147
- "grad_norm": 12.293351173400879,
148
- "kl": 0.05089123750803992,
149
  "learning_rate": 1.2500000000000005e-07,
150
- "loss": -0.0458,
151
- "num_tokens": 6167.0,
152
- "reward": 0.6569569408893585,
153
- "reward_std": 0.09472145570907742,
154
  "rewards/concensus_correctness_reward_func/mean": 0.0,
155
  "rewards/concensus_correctness_reward_func/std": 0.0,
156
  "rewards/consensus_reward_func/mean": 0.0,
@@ -159,14 +159,14 @@
159
  "rewards/cumulative_reward_2/std": 0.0,
160
  "rewards/final_correctness_reward_func/mean": 0.0,
161
  "rewards/final_correctness_reward_func/std": 0.0,
162
- "rewards/question_recreation_reward_func/mean": 0.22470694035291672,
163
- "rewards/question_recreation_reward_func/std": 0.20819812268018723,
164
  "rewards/soft_format_reward_func/mean": 0.0,
165
  "rewards/soft_format_reward_func/std": 0.0,
166
  "rewards/strict_format_reward_func/mean": 0.0,
167
  "rewards/strict_format_reward_func/std": 0.0,
168
- "rewards/xmlcount_reward_func/mean": 0.4322499930858612,
169
- "rewards/xmlcount_reward_func/std": 0.12349999696016312,
170
  "step": 8
171
  },
172
  {
@@ -176,53 +176,53 @@
176
  "clip_ratio/low_min": 0.0,
177
  "clip_ratio/region_mean": 0.0,
178
  "completions/clipped_ratio": 0.0,
179
- "completions/max_length": 65.5,
180
- "completions/max_terminated_length": 65.5,
181
- "completions/mean_length": 63.0,
182
- "completions/mean_terminated_length": 63.0,
183
- "completions/min_length": 61.0,
184
- "completions/min_terminated_length": 61.0,
185
- "epoch": 10.0,
186
  "frac_reward_zero_std": 0.25,
187
- "grad_norm": 14.979830741882324,
188
- "kl": 0.10098545905202627,
189
  "learning_rate": 1.507684480352292e-08,
190
- "loss": 0.0006,
191
- "num_tokens": 7695.0,
192
- "reward": 0.7237494587898254,
193
- "reward_std": 0.002912905707489699,
194
- "rewards/concensus_correctness_reward_func/mean": 0.0,
195
- "rewards/concensus_correctness_reward_func/std": 0.0,
196
- "rewards/consensus_reward_func/mean": 0.0,
197
- "rewards/consensus_reward_func/std": 0.0,
198
  "rewards/cumulative_reward_2/mean": 0.0,
199
  "rewards/cumulative_reward_2/std": 0.0,
200
  "rewards/final_correctness_reward_func/mean": 0.0,
201
  "rewards/final_correctness_reward_func/std": 0.0,
202
- "rewards/question_recreation_reward_func/mean": 0.22974946349859238,
203
- "rewards/question_recreation_reward_func/std": 0.2142425775527954,
204
  "rewards/soft_format_reward_func/mean": 0.0,
205
  "rewards/soft_format_reward_func/std": 0.0,
206
  "rewards/strict_format_reward_func/mean": 0.0,
207
  "rewards/strict_format_reward_func/std": 0.0,
208
- "rewards/xmlcount_reward_func/mean": 0.49399998784065247,
209
  "rewards/xmlcount_reward_func/std": 0.0,
210
  "step": 10
211
  },
212
  {
213
- "epoch": 10.0,
214
  "step": 10,
215
  "total_flos": 0.0,
216
- "train_loss": 0.0025116026401519774,
217
- "train_runtime": 799.9489,
218
- "train_samples_per_second": 0.05,
219
- "train_steps_per_second": 0.013
220
  }
221
  ],
222
  "logging_steps": 2,
223
  "max_steps": 10,
224
- "num_input_tokens_seen": 7695,
225
- "num_train_epochs": 10,
226
  "save_steps": 10,
227
  "stateful_callbacks": {
228
  "TrainerControl": {
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.7407407407407407,
6
  "eval_steps": 500,
7
  "global_step": 10,
8
  "is_hyper_param_search": false,
 
16
  "clip_ratio/low_min": 0.0,
17
  "clip_ratio/region_mean": 0.0,
18
  "completions/clipped_ratio": 0.0,
19
+ "completions/max_length": 50.0,
20
+ "completions/max_terminated_length": 50.0,
21
+ "completions/mean_length": 21.125,
22
+ "completions/mean_terminated_length": 21.125,
23
+ "completions/min_length": 4.0,
24
+ "completions/min_terminated_length": 4.0,
25
+ "epoch": 0.14814814814814814,
26
  "frac_reward_zero_std": 0.5,
27
+ "grad_norm": 12.743616104125977,
28
  "kl": 0.0,
29
  "learning_rate": 5e-07,
30
+ "loss": 0.0992,
31
+ "num_tokens": 1193.0,
32
+ "reward": 0.09130313247442245,
33
+ "reward_std": 0.01168987131677568,
34
  "rewards/concensus_correctness_reward_func/mean": 0.0,
35
  "rewards/concensus_correctness_reward_func/std": 0.0,
36
  "rewards/consensus_reward_func/mean": 0.0,
 
39
  "rewards/cumulative_reward_2/std": 0.0,
40
  "rewards/final_correctness_reward_func/mean": 0.0,
41
  "rewards/final_correctness_reward_func/std": 0.0,
42
+ "rewards/question_recreation_reward_func/mean": 0.09130313247442245,
43
+ "rewards/question_recreation_reward_func/std": 0.013678928487934172,
44
  "rewards/soft_format_reward_func/mean": 0.0,
45
  "rewards/soft_format_reward_func/std": 0.0,
46
  "rewards/strict_format_reward_func/mean": 0.0,
47
  "rewards/strict_format_reward_func/std": 0.0,
48
+ "rewards/xmlcount_reward_func/mean": 0.0,
49
  "rewards/xmlcount_reward_func/std": 0.0,
50
  "step": 2
51
  },
 
56
  "clip_ratio/low_min": 0.0,
57
  "clip_ratio/region_mean": 0.0,
58
  "completions/clipped_ratio": 0.0,
59
+ "completions/max_length": 22.0,
60
+ "completions/max_terminated_length": 22.0,
61
+ "completions/mean_length": 12.375,
62
+ "completions/mean_terminated_length": 12.375,
63
+ "completions/min_length": 7.0,
64
+ "completions/min_terminated_length": 7.0,
65
+ "epoch": 0.2962962962962963,
66
  "frac_reward_zero_std": 0.5,
67
+ "grad_norm": 43.35768508911133,
68
+ "kl": 0.017325570806860924,
69
  "learning_rate": 4.415111107797445e-07,
70
+ "loss": -0.1484,
71
+ "num_tokens": 2316.0,
72
+ "reward": 0.1280631353147328,
73
+ "reward_std": 0.018915515393018723,
74
  "rewards/concensus_correctness_reward_func/mean": 0.0,
75
  "rewards/concensus_correctness_reward_func/std": 0.0,
76
  "rewards/consensus_reward_func/mean": 0.0,
 
79
  "rewards/cumulative_reward_2/std": 0.0,
80
  "rewards/final_correctness_reward_func/mean": 0.0,
81
  "rewards/final_correctness_reward_func/std": 0.0,
82
+ "rewards/question_recreation_reward_func/mean": 0.1280631353147328,
83
+ "rewards/question_recreation_reward_func/std": 0.018273787572979927,
84
  "rewards/soft_format_reward_func/mean": 0.0,
85
  "rewards/soft_format_reward_func/std": 0.0,
86
  "rewards/strict_format_reward_func/mean": 0.0,
87
  "rewards/strict_format_reward_func/std": 0.0,
88
+ "rewards/xmlcount_reward_func/mean": 0.0,
89
+ "rewards/xmlcount_reward_func/std": 0.0,
90
  "step": 4
91
  },
92
  {
 
96
  "clip_ratio/low_min": 0.0,
97
  "clip_ratio/region_mean": 0.0,
98
  "completions/clipped_ratio": 0.0,
99
+ "completions/max_length": 19.5,
100
+ "completions/max_terminated_length": 19.5,
101
+ "completions/mean_length": 13.375,
102
+ "completions/mean_terminated_length": 13.375,
103
+ "completions/min_length": 6.5,
104
+ "completions/min_terminated_length": 6.5,
105
+ "epoch": 0.4444444444444444,
106
+ "frac_reward_zero_std": 0.5,
107
+ "grad_norm": 0.018915563821792603,
108
+ "kl": 0.03074789233505726,
109
  "learning_rate": 2.934120444167326e-07,
110
+ "loss": 0.0001,
111
+ "num_tokens": 3447.0,
112
+ "reward": 0.09580376278609037,
113
+ "reward_std": 0.002759912982583046,
114
  "rewards/concensus_correctness_reward_func/mean": 0.0,
115
  "rewards/concensus_correctness_reward_func/std": 0.0,
116
  "rewards/consensus_reward_func/mean": 0.0,
 
119
  "rewards/cumulative_reward_2/std": 0.0,
120
  "rewards/final_correctness_reward_func/mean": 0.0,
121
  "rewards/final_correctness_reward_func/std": 0.0,
122
+ "rewards/question_recreation_reward_func/mean": 0.09580376371741295,
123
+ "rewards/question_recreation_reward_func/std": 0.002817572792991996,
124
  "rewards/soft_format_reward_func/mean": 0.0,
125
  "rewards/soft_format_reward_func/std": 0.0,
126
  "rewards/strict_format_reward_func/mean": 0.0,
127
  "rewards/strict_format_reward_func/std": 0.0,
128
+ "rewards/xmlcount_reward_func/mean": 0.0,
129
  "rewards/xmlcount_reward_func/std": 0.0,
130
  "step": 6
131
  },
 
136
  "clip_ratio/low_min": 0.0,
137
  "clip_ratio/region_mean": 0.0,
138
  "completions/clipped_ratio": 0.0,
139
+ "completions/max_length": 61.5,
140
+ "completions/max_terminated_length": 61.5,
141
+ "completions/mean_length": 29.375,
142
+ "completions/mean_terminated_length": 29.375,
143
+ "completions/min_length": 3.0,
144
+ "completions/min_terminated_length": 3.0,
145
+ "epoch": 0.5925925925925926,
146
  "frac_reward_zero_std": 0.25,
147
+ "grad_norm": 36.02655792236328,
148
+ "kl": 0.03904347028583288,
149
  "learning_rate": 1.2500000000000005e-07,
150
+ "loss": 0.0023,
151
+ "num_tokens": 4706.0,
152
+ "reward": 0.01581350341439247,
153
+ "reward_std": 0.008347119903191924,
154
  "rewards/concensus_correctness_reward_func/mean": 0.0,
155
  "rewards/concensus_correctness_reward_func/std": 0.0,
156
  "rewards/consensus_reward_func/mean": 0.0,
 
159
  "rewards/cumulative_reward_2/std": 0.0,
160
  "rewards/final_correctness_reward_func/mean": 0.0,
161
  "rewards/final_correctness_reward_func/std": 0.0,
162
+ "rewards/question_recreation_reward_func/mean": 0.01581350341439247,
163
+ "rewards/question_recreation_reward_func/std": 0.012281739618629217,
164
  "rewards/soft_format_reward_func/mean": 0.0,
165
  "rewards/soft_format_reward_func/std": 0.0,
166
  "rewards/strict_format_reward_func/mean": 0.0,
167
  "rewards/strict_format_reward_func/std": 0.0,
168
+ "rewards/xmlcount_reward_func/mean": 0.0,
169
+ "rewards/xmlcount_reward_func/std": 0.0,
170
  "step": 8
171
  },
172
  {
 
176
  "clip_ratio/low_min": 0.0,
177
  "clip_ratio/region_mean": 0.0,
178
  "completions/clipped_ratio": 0.0,
179
+ "completions/max_length": 18.0,
180
+ "completions/max_terminated_length": 18.0,
181
+ "completions/mean_length": 11.75,
182
+ "completions/mean_terminated_length": 11.75,
183
+ "completions/min_length": 4.5,
184
+ "completions/min_terminated_length": 4.5,
185
+ "epoch": 0.7407407407407407,
186
  "frac_reward_zero_std": 0.25,
187
+ "grad_norm": 89.89861297607422,
188
+ "kl": 0.04395892460888717,
189
  "learning_rate": 1.507684480352292e-08,
190
+ "loss": 0.0962,
191
+ "num_tokens": 5824.0,
192
+ "reward": 0.5346636138856411,
193
+ "reward_std": 0.6897922963835299,
194
+ "rewards/concensus_correctness_reward_func/mean": 0.2395000010728836,
195
+ "rewards/concensus_correctness_reward_func/std": 0.4790000319480896,
196
+ "rewards/consensus_reward_func/mean": 0.25,
197
+ "rewards/consensus_reward_func/std": 0.5,
198
  "rewards/cumulative_reward_2/mean": 0.0,
199
  "rewards/cumulative_reward_2/std": 0.0,
200
  "rewards/final_correctness_reward_func/mean": 0.0,
201
  "rewards/final_correctness_reward_func/std": 0.0,
202
+ "rewards/question_recreation_reward_func/mean": 0.045163657516241074,
203
+ "rewards/question_recreation_reward_func/std": 0.028757712803781033,
204
  "rewards/soft_format_reward_func/mean": 0.0,
205
  "rewards/soft_format_reward_func/std": 0.0,
206
  "rewards/strict_format_reward_func/mean": 0.0,
207
  "rewards/strict_format_reward_func/std": 0.0,
208
+ "rewards/xmlcount_reward_func/mean": 0.0,
209
  "rewards/xmlcount_reward_func/std": 0.0,
210
  "step": 10
211
  },
212
  {
213
+ "epoch": 0.7407407407407407,
214
  "step": 10,
215
  "total_flos": 0.0,
216
+ "train_loss": 0.009888447250705212,
217
+ "train_runtime": 625.0756,
218
+ "train_samples_per_second": 0.064,
219
+ "train_steps_per_second": 0.016
220
  }
221
  ],
222
  "logging_steps": 2,
223
  "max_steps": 10,
224
+ "num_input_tokens_seen": 5824,
225
+ "num_train_epochs": 1,
226
  "save_steps": 10,
227
  "stateful_callbacks": {
228
  "TrainerControl": {