hasdal commited on
Commit
5480988
·
verified ·
1 Parent(s): 34cd7b2

DPO emergency upload (timeout) - job 4c139833-f70c-49d9-b684-84c0688eb857

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,209 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ base_model: unsloth/gpt-oss-20b
3
+ library_name: peft
4
+ tags:
5
+ - base_model:adapter:unsloth/gpt-oss-20b
6
+ - dpo
7
+ - lora
8
+ - transformers
9
+ - trl
10
+ - unsloth
11
+ ---
12
+
13
+ # Model Card for Model ID
14
+
15
+ <!-- Provide a quick summary of what the model is/does. -->
16
+
17
+
18
+
19
+ ## Model Details
20
+
21
+ ### Model Description
22
+
23
+ <!-- Provide a longer summary of what this model is. -->
24
+
25
+
26
+
27
+ - **Developed by:** [More Information Needed]
28
+ - **Funded by [optional]:** [More Information Needed]
29
+ - **Shared by [optional]:** [More Information Needed]
30
+ - **Model type:** [More Information Needed]
31
+ - **Language(s) (NLP):** [More Information Needed]
32
+ - **License:** [More Information Needed]
33
+ - **Finetuned from model [optional]:** [More Information Needed]
34
+
35
+ ### Model Sources [optional]
36
+
37
+ <!-- Provide the basic links for the model. -->
38
+
39
+ - **Repository:** [More Information Needed]
40
+ - **Paper [optional]:** [More Information Needed]
41
+ - **Demo [optional]:** [More Information Needed]
42
+
43
+ ## Uses
44
+
45
+ <!-- Address questions around how the model is intended to be used, including the foreseeable users of the model and those affected by the model. -->
46
+
47
+ ### Direct Use
48
+
49
+ <!-- This section is for the model use without fine-tuning or plugging into a larger ecosystem/app. -->
50
+
51
+ [More Information Needed]
52
+
53
+ ### Downstream Use [optional]
54
+
55
+ <!-- This section is for the model use when fine-tuned for a task, or when plugged into a larger ecosystem/app -->
56
+
57
+ [More Information Needed]
58
+
59
+ ### Out-of-Scope Use
60
+
61
+ <!-- This section addresses misuse, malicious use, and uses that the model will not work well for. -->
62
+
63
+ [More Information Needed]
64
+
65
+ ## Bias, Risks, and Limitations
66
+
67
+ <!-- This section is meant to convey both technical and sociotechnical limitations. -->
68
+
69
+ [More Information Needed]
70
+
71
+ ### Recommendations
72
+
73
+ <!-- This section is meant to convey recommendations with respect to the bias, risk, and technical limitations. -->
74
+
75
+ Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
76
+
77
+ ## How to Get Started with the Model
78
+
79
+ Use the code below to get started with the model.
80
+
81
+ [More Information Needed]
82
+
83
+ ## Training Details
84
+
85
+ ### Training Data
86
+
87
+ <!-- This should link to a Dataset Card, perhaps with a short stub of information on what the training data is all about as well as documentation related to data pre-processing or additional filtering. -->
88
+
89
+ [More Information Needed]
90
+
91
+ ### Training Procedure
92
+
93
+ <!-- This relates heavily to the Technical Specifications. Content here should link to that section when it is relevant to the training procedure. -->
94
+
95
+ #### Preprocessing [optional]
96
+
97
+ [More Information Needed]
98
+
99
+
100
+ #### Training Hyperparameters
101
+
102
+ - **Training regime:** [More Information Needed] <!--fp32, fp16 mixed precision, bf16 mixed precision, bf16 non-mixed precision, fp16 non-mixed precision, fp8 mixed precision -->
103
+
104
+ #### Speeds, Sizes, Times [optional]
105
+
106
+ <!-- This section provides information about throughput, start/end time, checkpoint size if relevant, etc. -->
107
+
108
+ [More Information Needed]
109
+
110
+ ## Evaluation
111
+
112
+ <!-- This section describes the evaluation protocols and provides the results. -->
113
+
114
+ ### Testing Data, Factors & Metrics
115
+
116
+ #### Testing Data
117
+
118
+ <!-- This should link to a Dataset Card if possible. -->
119
+
120
+ [More Information Needed]
121
+
122
+ #### Factors
123
+
124
+ <!-- These are the things the evaluation is disaggregating by, e.g., subpopulations or domains. -->
125
+
126
+ [More Information Needed]
127
+
128
+ #### Metrics
129
+
130
+ <!-- These are the evaluation metrics being used, ideally with a description of why. -->
131
+
132
+ [More Information Needed]
133
+
134
+ ### Results
135
+
136
+ [More Information Needed]
137
+
138
+ #### Summary
139
+
140
+
141
+
142
+ ## Model Examination [optional]
143
+
144
+ <!-- Relevant interpretability work for the model goes here -->
145
+
146
+ [More Information Needed]
147
+
148
+ ## Environmental Impact
149
+
150
+ <!-- Total emissions (in grams of CO2eq) and additional considerations, such as electricity usage, go here. Edit the suggested text below accordingly -->
151
+
152
+ Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
153
+
154
+ - **Hardware Type:** [More Information Needed]
155
+ - **Hours used:** [More Information Needed]
156
+ - **Cloud Provider:** [More Information Needed]
157
+ - **Compute Region:** [More Information Needed]
158
+ - **Carbon Emitted:** [More Information Needed]
159
+
160
+ ## Technical Specifications [optional]
161
+
162
+ ### Model Architecture and Objective
163
+
164
+ [More Information Needed]
165
+
166
+ ### Compute Infrastructure
167
+
168
+ [More Information Needed]
169
+
170
+ #### Hardware
171
+
172
+ [More Information Needed]
173
+
174
+ #### Software
175
+
176
+ [More Information Needed]
177
+
178
+ ## Citation [optional]
179
+
180
+ <!-- If there is a paper or blog post introducing the model, the APA and Bibtex information for that should go in this section. -->
181
+
182
+ **BibTeX:**
183
+
184
+ [More Information Needed]
185
+
186
+ **APA:**
187
+
188
+ [More Information Needed]
189
+
190
+ ## Glossary [optional]
191
+
192
+ <!-- If relevant, include terms and calculations in this section that can help readers understand the model or model card. -->
193
+
194
+ [More Information Needed]
195
+
196
+ ## More Information [optional]
197
+
198
+ [More Information Needed]
199
+
200
+ ## Model Card Authors [optional]
201
+
202
+ [More Information Needed]
203
+
204
+ ## Model Card Contact
205
+
206
+ [More Information Needed]
207
+ ### Framework versions
208
+
209
+ - PEFT 0.17.1
adapter_config.json ADDED
@@ -0,0 +1,45 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alpha_pattern": {},
3
+ "auto_mapping": {
4
+ "base_model_class": "GptOssForCausalLM",
5
+ "parent_library": "transformers.models.gpt_oss.modeling_gpt_oss"
6
+ },
7
+ "base_model_name_or_path": "unsloth/gpt-oss-20b",
8
+ "bias": "none",
9
+ "corda_config": null,
10
+ "eva_config": null,
11
+ "exclude_modules": null,
12
+ "fan_in_fan_out": false,
13
+ "inference_mode": true,
14
+ "init_lora_weights": true,
15
+ "layer_replication": null,
16
+ "layers_pattern": null,
17
+ "layers_to_transform": null,
18
+ "loftq_config": {},
19
+ "lora_alpha": 32,
20
+ "lora_bias": false,
21
+ "lora_dropout": 0.0,
22
+ "megatron_config": null,
23
+ "megatron_core": "megatron.core",
24
+ "modules_to_save": null,
25
+ "peft_type": "LORA",
26
+ "qalora_group_size": 16,
27
+ "r": 32,
28
+ "rank_pattern": {},
29
+ "revision": null,
30
+ "target_modules": [
31
+ "v_proj",
32
+ "k_proj",
33
+ "up_proj",
34
+ "o_proj",
35
+ "gate_proj",
36
+ "q_proj",
37
+ "down_proj"
38
+ ],
39
+ "target_parameters": null,
40
+ "task_type": null,
41
+ "trainable_token_indices": null,
42
+ "use_dora": false,
43
+ "use_qalora": false,
44
+ "use_rslora": false
45
+ }
adapter_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:97dca5618b69b45c0ff2257182550e3efd5a5e987e3bfb7bdf938aabdd070fae
3
+ size 63726760
chat_template.jinja ADDED
@@ -0,0 +1,345 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {# Chat template fixes by Unsloth #}
2
+ {#-
3
+ In addition to the normal inputs of `messages` and `tools`, this template also accepts the
4
+ following kwargs:
5
+ - "builtin_tools": A list, can contain "browser" and/or "python".
6
+ - "model_identity": A string that optionally describes the model identity.
7
+ - "reasoning_effort": A string that describes the reasoning effort, defaults to "medium".
8
+ #}
9
+
10
+ {#- Tool Definition Rendering ============================================== #}
11
+ {%- macro render_typescript_type(param_spec, required_params, is_nullable=false) -%}
12
+ {%- if param_spec.type == "array" -%}
13
+ {%- if param_spec['items'] -%}
14
+ {%- if param_spec['items']['type'] == "string" -%}
15
+ {{- "string[]" }}
16
+ {%- elif param_spec['items']['type'] == "number" -%}
17
+ {{- "number[]" }}
18
+ {%- elif param_spec['items']['type'] == "integer" -%}
19
+ {{- "number[]" }}
20
+ {%- elif param_spec['items']['type'] == "boolean" -%}
21
+ {{- "boolean[]" }}
22
+ {%- else -%}
23
+ {%- set inner_type = render_typescript_type(param_spec['items'], required_params) -%}
24
+ {%- if inner_type == "object | object" or inner_type|length > 50 -%}
25
+ {{- "any[]" }}
26
+ {%- else -%}
27
+ {{- inner_type + "[]" }}
28
+ {%- endif -%}
29
+ {%- endif -%}
30
+ {%- if param_spec.nullable -%}
31
+ {{- " | null" }}
32
+ {%- endif -%}
33
+ {%- else -%}
34
+ {{- "any[]" }}
35
+ {%- if param_spec.nullable -%}
36
+ {{- " | null" }}
37
+ {%- endif -%}
38
+ {%- endif -%}
39
+ {%- elif param_spec.type is defined and param_spec.type is iterable and param_spec.type is not string and param_spec.type is not mapping and param_spec.type[0] is defined -%}
40
+ {#- Handle array of types like ["object", "object"] from Union[dict, list] #}
41
+ {%- if param_spec.type | length > 1 -%}
42
+ {{- param_spec.type | join(" | ") }}
43
+ {%- else -%}
44
+ {{- param_spec.type[0] }}
45
+ {%- endif -%}
46
+ {%- elif param_spec.oneOf -%}
47
+ {#- Handle oneOf schemas - check for complex unions and fallback to any #}
48
+ {%- set has_object_variants = false -%}
49
+ {%- for variant in param_spec.oneOf -%}
50
+ {%- if variant.type == "object" -%}
51
+ {%- set has_object_variants = true -%}
52
+ {%- endif -%}
53
+ {%- endfor -%}
54
+ {%- if has_object_variants and param_spec.oneOf|length > 1 -%}
55
+ {{- "any" }}
56
+ {%- else -%}
57
+ {%- for variant in param_spec.oneOf -%}
58
+ {{- render_typescript_type(variant, required_params) -}}
59
+ {%- if variant.description %}
60
+ {{- "// " + variant.description }}
61
+ {%- endif -%}
62
+ {%- if variant.default is defined %}
63
+ {{ "// default: " + variant.default|tojson }}
64
+ {%- endif -%}
65
+ {%- if not loop.last %}
66
+ {{- " | " }}
67
+ {% endif -%}
68
+ {%- endfor -%}
69
+ {%- endif -%}
70
+ {%- elif param_spec.type == "string" -%}
71
+ {%- if param_spec.enum -%}
72
+ {{- '"' + param_spec.enum|join('" | "') + '"' -}}
73
+ {%- else -%}
74
+ {{- "string" }}
75
+ {%- if param_spec.nullable %}
76
+ {{- " | null" }}
77
+ {%- endif -%}
78
+ {%- endif -%}
79
+ {%- elif param_spec.type == "number" -%}
80
+ {{- "number" }}
81
+ {%- elif param_spec.type == "integer" -%}
82
+ {{- "number" }}
83
+ {%- elif param_spec.type == "boolean" -%}
84
+ {{- "boolean" }}
85
+
86
+ {%- elif param_spec.type == "object" -%}
87
+ {%- if param_spec.properties -%}
88
+ {{- "{\n" }}
89
+ {%- for prop_name, prop_spec in param_spec.properties.items() -%}
90
+ {{- prop_name -}}
91
+ {%- if prop_name not in (param_spec.required or []) -%}
92
+ {{- "?" }}
93
+ {%- endif -%}
94
+ {{- ": " }}
95
+ {{ render_typescript_type(prop_spec, param_spec.required or []) }}
96
+ {%- if not loop.last -%}
97
+ {{-", " }}
98
+ {%- endif -%}
99
+ {%- endfor -%}
100
+ {{- "}" }}
101
+ {%- else -%}
102
+ {{- "object" }}
103
+ {%- endif -%}
104
+ {%- else -%}
105
+ {{- "any" }}
106
+ {%- endif -%}
107
+ {%- endmacro -%}
108
+
109
+ {%- macro render_tool_namespace(namespace_name, tools) -%}
110
+ {{- "## " + namespace_name + "\n\n" }}
111
+ {{- "namespace " + namespace_name + " {\n\n" }}
112
+ {%- for tool in tools %}
113
+ {%- set tool = tool.function %}
114
+ {{- "// " + tool.description + "\n" }}
115
+ {{- "type "+ tool.name + " = " }}
116
+ {%- if tool.parameters and tool.parameters.properties %}
117
+ {{- "(_: {\n" }}
118
+ {%- for param_name, param_spec in tool.parameters.properties.items() %}
119
+ {%- if param_spec.description %}
120
+ {{- "// " + param_spec.description + "\n" }}
121
+ {%- endif %}
122
+ {{- param_name }}
123
+ {%- if param_name not in (tool.parameters.required or []) -%}
124
+ {{- "?" }}
125
+ {%- endif -%}
126
+ {{- ": " }}
127
+ {{- render_typescript_type(param_spec, tool.parameters.required or []) }}
128
+ {%- if param_spec.default is defined -%}
129
+ {%- if param_spec.enum %}
130
+ {{- ", // default: " + param_spec.default }}
131
+ {%- elif param_spec.oneOf %}
132
+ {{- "// default: " + param_spec.default }}
133
+ {%- else %}
134
+ {{- ", // default: " + param_spec.default|tojson }}
135
+ {%- endif -%}
136
+ {%- endif -%}
137
+ {%- if not loop.last %}
138
+ {{- ",\n" }}
139
+ {%- else %}
140
+ {{- ",\n" }}
141
+ {%- endif -%}
142
+ {%- endfor %}
143
+ {{- "}) => any;\n\n" }}
144
+ {%- else -%}
145
+ {{- "() => any;\n\n" }}
146
+ {%- endif -%}
147
+ {%- endfor %}
148
+ {{- "} // namespace " + namespace_name }}
149
+ {%- endmacro -%}
150
+
151
+ {%- macro render_builtin_tools(browser_tool, python_tool) -%}
152
+ {%- if browser_tool %}
153
+ {{- "## browser\n\n" }}
154
+ {{- "// Tool for browsing.\n" }}
155
+ {{- "// The `cursor` appears in brackets before each browsing display: `[{cursor}]`.\n" }}
156
+ {{- "// Cite information from the tool using the following format:\n" }}
157
+ {{- "// `【{cursor}†L{line_start}(-L{line_end})?】`, for example: `【6†L9-L11】` or `【8†L3】`.\n" }}
158
+ {{- "// Do not quote more than 10 words directly from the tool output.\n" }}
159
+ {{- "// sources=web (default: web)\n" }}
160
+ {{- "namespace browser {\n\n" }}
161
+ {{- "// Searches for information related to `query` and displays `topn` results.\n" }}
162
+ {{- "type search = (_: {\n" }}
163
+ {{- "query: string,\n" }}
164
+ {{- "topn?: number, // default: 10\n" }}
165
+ {{- "source?: string,\n" }}
166
+ {{- "}) => any;\n\n" }}
167
+ {{- "// Opens the link `id` from the page indicated by `cursor` starting at line number `loc`, showing `num_lines` lines.\n" }}
168
+ {{- "// Valid link ids are displayed with the formatting: `【{id}†.*】`.\n" }}
169
+ {{- "// If `cursor` is not provided, the most recent page is implied.\n" }}
170
+ {{- "// If `id` is a string, it is treated as a fully qualified URL associated with `source`.\n" }}
171
+ {{- "// If `loc` is not provided, the viewport will be positioned at the beginning of the document or centered on the most relevant passage, if available.\n" }}
172
+ {{- "// Use this function without `id` to scroll to a new location of an opened page.\n" }}
173
+ {{- "type open = (_: {\n" }}
174
+ {{- "id?: number | string, // default: -1\n" }}
175
+ {{- "cursor?: number, // default: -1\n" }}
176
+ {{- "loc?: number, // default: -1\n" }}
177
+ {{- "num_lines?: number, // default: -1\n" }}
178
+ {{- "view_source?: boolean, // default: false\n" }}
179
+ {{- "source?: string,\n" }}
180
+ {{- "}) => any;\n\n" }}
181
+ {{- "// Finds exact matches of `pattern` in the current page, or the page given by `cursor`.\n" }}
182
+ {{- "type find = (_: {\n" }}
183
+ {{- "pattern: string,\n" }}
184
+ {{- "cursor?: number, // default: -1\n" }}
185
+ {{- "}) => any;\n\n" }}
186
+ {{- "} // namespace browser\n\n" }}
187
+ {%- endif -%}
188
+
189
+ {%- if python_tool %}
190
+ {{- "## python\n\n" }}
191
+ {{- "Use this tool to execute Python code in your chain of thought. The code will not be shown to the user. This tool should be used for internal reasoning, but not for code that is intended to be visible to the user (e.g. when creating plots, tables, or files).\n\n" }}
192
+ {{- "When you send a message containing Python code to python, it will be executed in a stateful Jupyter notebook environment. python will respond with the output of the execution or time out after 120.0 seconds. The drive at '/mnt/data' can be used to save and persist user files. Internet access for this session is UNKNOWN. Depends on the cluster.\n\n" }}
193
+ {%- endif -%}
194
+ {%- endmacro -%}
195
+
196
+ {#- System Message Construction ============================================ #}
197
+ {%- macro build_system_message() -%}
198
+ {%- if model_identity is not defined %}
199
+ {%- set model_identity = "You are ChatGPT, a large language model trained by OpenAI." %}
200
+ {%- endif %}
201
+ {{- model_identity + "\n" }}
202
+ {{- "Knowledge cutoff: 2024-06\n" }}
203
+ {{- "Current date: " + strftime_now("%Y-%m-%d") + "\n\n" }}
204
+ {%- if reasoning_effort is not defined %}
205
+ {%- set reasoning_effort = "medium" %}
206
+ {%- endif %}
207
+ {{- "Reasoning: " + reasoning_effort + "\n\n" }}
208
+ {%- if builtin_tools is defined and builtin_tools is not none %}
209
+ {{- "# Tools\n\n" }}
210
+ {%- set available_builtin_tools = namespace(browser=false, python=false) %}
211
+ {%- for tool in builtin_tools %}
212
+ {%- if tool == "browser" %}
213
+ {%- set available_builtin_tools.browser = true %}
214
+ {%- elif tool == "python" %}
215
+ {%- set available_builtin_tools.python = true %}
216
+ {%- endif %}
217
+ {%- endfor %}
218
+ {{- render_builtin_tools(available_builtin_tools.browser, available_builtin_tools.python) }}
219
+ {%- endif -%}
220
+ {{- "# Valid channels: analysis, commentary, final. Channel must be included for every message." }}
221
+ {%- if tools -%}
222
+ {{- "\nCalls to these tools must go to the commentary channel: 'functions'." }}
223
+ {%- endif -%}
224
+ {%- endmacro -%}
225
+
226
+ {#- Main Template Logic ================================================= #}
227
+ {#- Set defaults #}
228
+
229
+ {#- Render system message #}
230
+ {{- "<|start|>system<|message|>" }}
231
+ {{- build_system_message() }}
232
+ {{- "<|end|>" }}
233
+
234
+ {#- Extract developer message #}
235
+ {%- if developer_instructions is defined and developer_instructions is not none %}
236
+ {%- set developer_message = developer_instructions %}
237
+ {%- set loop_messages = messages %}
238
+ {%- elif messages[0].role == "developer" or messages[0].role == "system" %}
239
+ {%- set developer_message = messages[0].content %}
240
+ {%- set loop_messages = messages[1:] %}
241
+ {%- else %}
242
+ {%- set developer_message = "" %}
243
+ {%- set loop_messages = messages %}
244
+ {%- endif %}
245
+
246
+ {#- Render developer message #}
247
+ {%- if developer_message or tools %}
248
+ {{- "<|start|>developer<|message|>" }}
249
+ {%- if developer_message %}
250
+ {{- "# Instructions\n\n" }}
251
+ {{- developer_message }}
252
+ {%- endif %}
253
+ {%- if tools -%}
254
+ {%- if developer_message %}
255
+ {{- "\n\n" }}
256
+ {%- endif %}
257
+ {{- "# Tools\n\n" }}
258
+ {{- render_tool_namespace("functions", tools) }}
259
+ {%- endif -%}
260
+ {{- "<|end|>" }}
261
+ {%- endif %}
262
+
263
+ {#- Render messages #}
264
+ {%- set last_tool_call = namespace(name=none) %}
265
+ {%- for message in loop_messages -%}
266
+ {#- At this point only assistant/user/tool messages should remain #}
267
+ {%- if message.role == 'assistant' -%}
268
+ {#- Checks to ensure the messages are being passed in the format we expect #}
269
+ {%- if "thinking" in message %}
270
+ {%- if "<|channel|>analysis<|message|>" in message.thinking or "<|channel|>final<|message|>" in message.thinking %}
271
+ {{- raise_exception("You have passed a message containing <|channel|> tags in the thinking field. Instead of doing this, you should pass analysis messages (the string between '<|message|>' and '<|end|>') in the 'thinking' field, and final messages (the string between '<|message|>' and '<|end|>') in the 'content' field.") }}
272
+ {%- endif %}
273
+ {%- endif %}
274
+ {%- if "tool_calls" in message %}
275
+ {#- We need very careful handling here - we want to drop the tool call analysis message if the model #}
276
+ {#- has output a later <|final|> message, but otherwise we want to retain it. This is the only case #}
277
+ {#- when we render CoT/analysis messages in inference. #}
278
+ {%- set future_final_message = namespace(found=false) %}
279
+ {%- for future_message in loop_messages[loop.index:] %}
280
+ {%- if future_message.role == 'assistant' and "tool_calls" not in future_message %}
281
+ {%- set future_final_message.found = true %}
282
+ {%- endif %}
283
+ {%- endfor %}
284
+ {#- We assume max 1 tool call per message, and so we infer the tool call name #}
285
+ {#- in "tool" messages from the most recent assistant tool call name #}
286
+ {%- set tool_call = message.tool_calls[0] %}
287
+ {%- if tool_call.function %}
288
+ {%- set tool_call = tool_call.function %}
289
+ {%- endif %}
290
+ {%- if message.content and message.thinking %}
291
+ {{- raise_exception("Cannot pass both content and thinking in an assistant message with tool calls! Put the analysis message in one or the other, but not both.") }}
292
+ {%- elif message.content and not future_final_message.found %}
293
+ {{- "<|start|>assistant<|channel|>analysis<|message|>" + message.content + "<|end|>" }}
294
+ {%- elif message.thinking and not future_final_message.found %}
295
+ {{- "<|start|>assistant<|channel|>analysis<|message|>" + message.thinking + "<|end|>" }}
296
+ {%- endif %}
297
+ {{- "<|start|>assistant to=" }}
298
+ {{- "functions." + tool_call.name + "<|channel|>commentary " }}
299
+ {{- (tool_call.content_type if tool_call.content_type is defined else "json") + "<|message|>" }}
300
+ {%- if tool_call.arguments is string %}
301
+ {{- tool_call.arguments }}
302
+ {%- else %}
303
+ {{- tool_call.arguments|tojson }}
304
+ {%- endif %}
305
+ {{- "<|call|>" }}
306
+ {%- set last_tool_call.name = tool_call.name %}
307
+ {%- elif loop.last and not add_generation_prompt %}
308
+ {#- Only render the CoT if the final turn is an assistant turn and add_generation_prompt is false #}
309
+ {#- This is a situation that should only occur in training, never in inference. #}
310
+ {%- if "thinking" in message %}
311
+ {{- "<|start|>assistant<|channel|>analysis<|message|>" + message.thinking + "<|end|>" }}
312
+ {%- endif %}
313
+ {#- <|return|> indicates the end of generation, but <|end|> does not #}
314
+ {#- <|return|> should never be an input to the model, but we include it as the final token #}
315
+ {#- when training, so the model learns to emit it. #}
316
+ {{- "<|start|>assistant<|channel|>final<|message|>" + message.content + "<|end|>" }}
317
+ {%- elif "thinking" in message %}
318
+ {#- CoT is dropped during all previous turns, so we never render it for inference #}
319
+ {{- "<|start|>assistant<|channel|>analysis<|message|>" + message.thinking + "<|end|>" }}
320
+ {%- set last_tool_call.name = none %}
321
+ {%- else %}
322
+ {#- CoT is dropped during all previous turns, so we never render it for inference #}
323
+ {{- "<|start|>assistant<|channel|>final<|message|>" + message.content + "<|end|>" }}
324
+ {%- set last_tool_call.name = none %}
325
+ {%- endif %}
326
+ {%- elif message.role == 'tool' -%}
327
+ {%- if last_tool_call.name is none %}
328
+ {{- raise_exception("Message has tool role, but there was no previous assistant message with a tool call!") }}
329
+ {%- endif %}
330
+ {{- "<|start|>functions." + last_tool_call.name }}
331
+ {%- if message.content is string %}
332
+ {{- " to=assistant<|channel|>commentary<|message|>" + message.content + "<|end|>" }}
333
+ {%- else %}
334
+ {{- " to=assistant<|channel|>commentary<|message|>" + message.content|tojson + "<|end|>" }}
335
+ {%- endif %}
336
+ {%- elif message.role == 'user' -%}
337
+ {{- "<|start|>user<|message|>" + message.content + "<|end|>" }}
338
+ {%- endif -%}
339
+ {%- endfor -%}
340
+
341
+ {#- Generation prompt #}
342
+ {%- if add_generation_prompt -%}
343
+ <|start|>assistant
344
+ {%- endif -%}
345
+ {# Copyright 2025-present Unsloth. Apache 2.0 License. Unsloth chat template fixes. Edited from ggml-org & OpenAI #}
loss.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ 156,no_eval
optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:40d6cf5e0df049b7eaa805bff8ed8cc7205d8f4d23ba482f8df8fdd52c576c04
3
+ size 32569658
rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7ba77c4358d5913436545fc6995706402cd54ccf015646708e622eca7f93ed87
3
+ size 14244
scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:09d174ff6de6f33125a8a81084fa043de37ad6b4d22ff40a8983c3c934efaf0c
3
+ size 1064
special_tokens_map.json ADDED
@@ -0,0 +1,23 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token": {
3
+ "content": "<|startoftext|>",
4
+ "lstrip": false,
5
+ "normalized": false,
6
+ "rstrip": false,
7
+ "single_word": false
8
+ },
9
+ "eos_token": {
10
+ "content": "<|return|>",
11
+ "lstrip": false,
12
+ "normalized": false,
13
+ "rstrip": false,
14
+ "single_word": false
15
+ },
16
+ "pad_token": {
17
+ "content": "<|reserved_200017|>",
18
+ "lstrip": false,
19
+ "normalized": false,
20
+ "rstrip": false,
21
+ "single_word": false
22
+ }
23
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0614fe83cadab421296e664e1f48f4261fa8fef6e03e63bb75c20f38e37d07d3
3
+ size 27868174
tokenizer_config.json ADDED
@@ -0,0 +1,185 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "added_tokens_decoder": {
3
+ "199998": {
4
+ "content": "<|startoftext|>",
5
+ "lstrip": false,
6
+ "normalized": false,
7
+ "rstrip": false,
8
+ "single_word": false,
9
+ "special": true
10
+ },
11
+ "199999": {
12
+ "content": "<|endoftext|>",
13
+ "lstrip": false,
14
+ "normalized": false,
15
+ "rstrip": false,
16
+ "single_word": false,
17
+ "special": true
18
+ },
19
+ "200000": {
20
+ "content": "<|reserved_200000|>",
21
+ "lstrip": false,
22
+ "normalized": false,
23
+ "rstrip": false,
24
+ "single_word": false,
25
+ "special": true
26
+ },
27
+ "200001": {
28
+ "content": "<|reserved_200001|>",
29
+ "lstrip": false,
30
+ "normalized": false,
31
+ "rstrip": false,
32
+ "single_word": false,
33
+ "special": true
34
+ },
35
+ "200002": {
36
+ "content": "<|return|>",
37
+ "lstrip": false,
38
+ "normalized": false,
39
+ "rstrip": false,
40
+ "single_word": false,
41
+ "special": true
42
+ },
43
+ "200003": {
44
+ "content": "<|constrain|>",
45
+ "lstrip": false,
46
+ "normalized": false,
47
+ "rstrip": false,
48
+ "single_word": false,
49
+ "special": true
50
+ },
51
+ "200004": {
52
+ "content": "<|reserved_200004|>",
53
+ "lstrip": false,
54
+ "normalized": false,
55
+ "rstrip": false,
56
+ "single_word": false,
57
+ "special": true
58
+ },
59
+ "200005": {
60
+ "content": "<|channel|>",
61
+ "lstrip": false,
62
+ "normalized": false,
63
+ "rstrip": false,
64
+ "single_word": false,
65
+ "special": true
66
+ },
67
+ "200006": {
68
+ "content": "<|start|>",
69
+ "lstrip": false,
70
+ "normalized": false,
71
+ "rstrip": false,
72
+ "single_word": false,
73
+ "special": true
74
+ },
75
+ "200007": {
76
+ "content": "<|end|>",
77
+ "lstrip": false,
78
+ "normalized": false,
79
+ "rstrip": false,
80
+ "single_word": false,
81
+ "special": true
82
+ },
83
+ "200008": {
84
+ "content": "<|message|>",
85
+ "lstrip": false,
86
+ "normalized": false,
87
+ "rstrip": false,
88
+ "single_word": false,
89
+ "special": true
90
+ },
91
+ "200009": {
92
+ "content": "<|reserved_200009|>",
93
+ "lstrip": false,
94
+ "normalized": false,
95
+ "rstrip": false,
96
+ "single_word": false,
97
+ "special": true
98
+ },
99
+ "200010": {
100
+ "content": "<|reserved_200010|>",
101
+ "lstrip": false,
102
+ "normalized": false,
103
+ "rstrip": false,
104
+ "single_word": false,
105
+ "special": true
106
+ },
107
+ "200011": {
108
+ "content": "<|reserved_200011|>",
109
+ "lstrip": false,
110
+ "normalized": false,
111
+ "rstrip": false,
112
+ "single_word": false,
113
+ "special": true
114
+ },
115
+ "200012": {
116
+ "content": "<|call|>",
117
+ "lstrip": false,
118
+ "normalized": false,
119
+ "rstrip": false,
120
+ "single_word": false,
121
+ "special": true
122
+ },
123
+ "200013": {
124
+ "content": "<|reserved_200013|>",
125
+ "lstrip": false,
126
+ "normalized": false,
127
+ "rstrip": false,
128
+ "single_word": false,
129
+ "special": true
130
+ },
131
+ "200014": {
132
+ "content": "<|reserved_200014|>",
133
+ "lstrip": false,
134
+ "normalized": false,
135
+ "rstrip": false,
136
+ "single_word": false,
137
+ "special": true
138
+ },
139
+ "200015": {
140
+ "content": "<|reserved_200015|>",
141
+ "lstrip": false,
142
+ "normalized": false,
143
+ "rstrip": false,
144
+ "single_word": false,
145
+ "special": true
146
+ },
147
+ "200016": {
148
+ "content": "<|reserved_200016|>",
149
+ "lstrip": false,
150
+ "normalized": false,
151
+ "rstrip": false,
152
+ "single_word": false,
153
+ "special": true
154
+ },
155
+ "200017": {
156
+ "content": "<|reserved_200017|>",
157
+ "lstrip": false,
158
+ "normalized": false,
159
+ "rstrip": false,
160
+ "single_word": false,
161
+ "special": true
162
+ },
163
+ "200018": {
164
+ "content": "<|endofprompt|>",
165
+ "lstrip": false,
166
+ "normalized": false,
167
+ "rstrip": false,
168
+ "single_word": false,
169
+ "special": true
170
+ }
171
+ },
172
+ "bos_token": "<|startoftext|>",
173
+ "clean_up_tokenization_spaces": false,
174
+ "eos_token": "<|return|>",
175
+ "extra_special_tokens": {},
176
+ "model_input_names": [
177
+ "input_ids",
178
+ "attention_mask"
179
+ ],
180
+ "model_max_length": 131072,
181
+ "pad_token": "<|reserved_200017|>",
182
+ "padding_side": "right",
183
+ "tokenizer_class": "PreTrainedTokenizerFast",
184
+ "unk_token": null
185
+ }
trainer_state.json ADDED
@@ -0,0 +1,2374 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.26485568760611206,
6
+ "eval_steps": 500,
7
+ "global_step": 156,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.001697792869269949,
14
+ "grad_norm": 253.41531372070312,
15
+ "learning_rate": 0.0,
16
+ "logits/chosen": -3.862927198410034,
17
+ "logits/rejected": -3.6351959705352783,
18
+ "logps/chosen": -605.5757446289062,
19
+ "logps/rejected": -1404.901611328125,
20
+ "loss": 0.6931,
21
+ "rewards/accuracies": 0.0,
22
+ "rewards/chosen": 0.0,
23
+ "rewards/margins": 0.0,
24
+ "rewards/rejected": 0.0,
25
+ "step": 1
26
+ },
27
+ {
28
+ "epoch": 0.003395585738539898,
29
+ "grad_norm": 168.63119506835938,
30
+ "learning_rate": 2e-07,
31
+ "logits/chosen": -3.7591066360473633,
32
+ "logits/rejected": -3.6339735984802246,
33
+ "logps/chosen": -829.5263061523438,
34
+ "logps/rejected": -1331.5780029296875,
35
+ "loss": 0.6931,
36
+ "rewards/accuracies": 0.0,
37
+ "rewards/chosen": 0.0,
38
+ "rewards/margins": 0.0,
39
+ "rewards/rejected": 0.0,
40
+ "step": 2
41
+ },
42
+ {
43
+ "epoch": 0.0050933786078098476,
44
+ "grad_norm": 250.63763427734375,
45
+ "learning_rate": 4e-07,
46
+ "logits/chosen": -3.887515068054199,
47
+ "logits/rejected": -3.7103145122528076,
48
+ "logps/chosen": -766.8009033203125,
49
+ "logps/rejected": -1616.171875,
50
+ "loss": 0.6411,
51
+ "rewards/accuracies": 0.6842105388641357,
52
+ "rewards/chosen": 0.6313945651054382,
53
+ "rewards/margins": 1.0291563272476196,
54
+ "rewards/rejected": -0.39776191115379333,
55
+ "step": 3
56
+ },
57
+ {
58
+ "epoch": 0.006791171477079796,
59
+ "grad_norm": 322.8396911621094,
60
+ "learning_rate": 6e-07,
61
+ "logits/chosen": -3.7688064575195312,
62
+ "logits/rejected": -3.654154062271118,
63
+ "logps/chosen": -627.8695068359375,
64
+ "logps/rejected": -1573.804443359375,
65
+ "loss": 1.1542,
66
+ "rewards/accuracies": 0.5789473652839661,
67
+ "rewards/chosen": 0.18179118633270264,
68
+ "rewards/margins": -0.08869992196559906,
69
+ "rewards/rejected": 0.2704910635948181,
70
+ "step": 4
71
+ },
72
+ {
73
+ "epoch": 0.008488964346349746,
74
+ "grad_norm": 421.36041259765625,
75
+ "learning_rate": 8e-07,
76
+ "logits/chosen": -3.8056693077087402,
77
+ "logits/rejected": -3.6669576168060303,
78
+ "logps/chosen": -917.1754760742188,
79
+ "logps/rejected": -1573.216552734375,
80
+ "loss": 1.5513,
81
+ "rewards/accuracies": 0.5263158082962036,
82
+ "rewards/chosen": -0.4203932285308838,
83
+ "rewards/margins": -0.8918607831001282,
84
+ "rewards/rejected": 0.4714674651622772,
85
+ "step": 5
86
+ },
87
+ {
88
+ "epoch": 0.010186757215619695,
89
+ "grad_norm": 465.82470703125,
90
+ "learning_rate": 1e-06,
91
+ "logits/chosen": -3.646392822265625,
92
+ "logits/rejected": -3.419647216796875,
93
+ "logps/chosen": -766.7083740234375,
94
+ "logps/rejected": -1917.0477294921875,
95
+ "loss": 1.0477,
96
+ "rewards/accuracies": 0.5789473652839661,
97
+ "rewards/chosen": 0.39575517177581787,
98
+ "rewards/margins": 0.6562828421592712,
99
+ "rewards/rejected": -0.2605276107788086,
100
+ "step": 6
101
+ },
102
+ {
103
+ "epoch": 0.011884550084889643,
104
+ "grad_norm": 383.790771484375,
105
+ "learning_rate": 1.2e-06,
106
+ "logits/chosen": -3.67680287361145,
107
+ "logits/rejected": -3.279794216156006,
108
+ "logps/chosen": -555.0008544921875,
109
+ "logps/rejected": -1844.1700439453125,
110
+ "loss": 1.1984,
111
+ "rewards/accuracies": 0.42105263471603394,
112
+ "rewards/chosen": 0.1972377598285675,
113
+ "rewards/margins": 0.061311546713113785,
114
+ "rewards/rejected": 0.1359262317419052,
115
+ "step": 7
116
+ },
117
+ {
118
+ "epoch": 0.013582342954159592,
119
+ "grad_norm": 193.729248046875,
120
+ "learning_rate": 1.4000000000000001e-06,
121
+ "logits/chosen": -3.8404300212860107,
122
+ "logits/rejected": -3.687358856201172,
123
+ "logps/chosen": -692.4404907226562,
124
+ "logps/rejected": -1474.986083984375,
125
+ "loss": 1.2099,
126
+ "rewards/accuracies": 0.4736842215061188,
127
+ "rewards/chosen": -0.3380126953125,
128
+ "rewards/margins": -0.10957071930170059,
129
+ "rewards/rejected": -0.2284420132637024,
130
+ "step": 8
131
+ },
132
+ {
133
+ "epoch": 0.015280135823429542,
134
+ "grad_norm": 295.02197265625,
135
+ "learning_rate": 1.6e-06,
136
+ "logits/chosen": -3.912959098815918,
137
+ "logits/rejected": -3.6805474758148193,
138
+ "logps/chosen": -551.9108276367188,
139
+ "logps/rejected": -1136.086181640625,
140
+ "loss": 2.2536,
141
+ "rewards/accuracies": 0.4736842215061188,
142
+ "rewards/chosen": -0.2959785461425781,
143
+ "rewards/margins": -1.3720390796661377,
144
+ "rewards/rejected": 1.0760605335235596,
145
+ "step": 9
146
+ },
147
+ {
148
+ "epoch": 0.01697792869269949,
149
+ "grad_norm": 257.409912109375,
150
+ "learning_rate": 1.7999999999999997e-06,
151
+ "logits/chosen": -3.78908634185791,
152
+ "logits/rejected": -3.679199457168579,
153
+ "logps/chosen": -439.6385803222656,
154
+ "logps/rejected": -1298.555908203125,
155
+ "loss": 1.1054,
156
+ "rewards/accuracies": 0.5263158082962036,
157
+ "rewards/chosen": 0.05673830211162567,
158
+ "rewards/margins": 0.06232653185725212,
159
+ "rewards/rejected": -0.005588180385529995,
160
+ "step": 10
161
+ },
162
+ {
163
+ "epoch": 0.01867572156196944,
164
+ "grad_norm": 293.6235656738281,
165
+ "learning_rate": 2e-06,
166
+ "logits/chosen": -3.7469851970672607,
167
+ "logits/rejected": -3.6060433387756348,
168
+ "logps/chosen": -759.355224609375,
169
+ "logps/rejected": -1455.1871337890625,
170
+ "loss": 1.2198,
171
+ "rewards/accuracies": 0.6315789222717285,
172
+ "rewards/chosen": 0.09574534744024277,
173
+ "rewards/margins": 0.17931774258613586,
174
+ "rewards/rejected": -0.08357242494821548,
175
+ "step": 11
176
+ },
177
+ {
178
+ "epoch": 0.02037351443123939,
179
+ "grad_norm": 298.3741760253906,
180
+ "learning_rate": 2.2e-06,
181
+ "logits/chosen": -3.8653757572174072,
182
+ "logits/rejected": -3.6336910724639893,
183
+ "logps/chosen": -719.357177734375,
184
+ "logps/rejected": -1460.9769287109375,
185
+ "loss": 1.3198,
186
+ "rewards/accuracies": 0.4736842215061188,
187
+ "rewards/chosen": -0.8121546506881714,
188
+ "rewards/margins": -0.4211699962615967,
189
+ "rewards/rejected": -0.3909846842288971,
190
+ "step": 12
191
+ },
192
+ {
193
+ "epoch": 0.022071307300509338,
194
+ "grad_norm": 560.5316772460938,
195
+ "learning_rate": 2.4e-06,
196
+ "logits/chosen": -3.7372677326202393,
197
+ "logits/rejected": -3.375757932662964,
198
+ "logps/chosen": -784.5247802734375,
199
+ "logps/rejected": -1696.49755859375,
200
+ "loss": 4.0524,
201
+ "rewards/accuracies": 0.31578946113586426,
202
+ "rewards/chosen": -0.8245162963867188,
203
+ "rewards/margins": -3.4090776443481445,
204
+ "rewards/rejected": 2.5845611095428467,
205
+ "step": 13
206
+ },
207
+ {
208
+ "epoch": 0.023769100169779286,
209
+ "grad_norm": 236.77005004882812,
210
+ "learning_rate": 2.6e-06,
211
+ "logits/chosen": -3.5540072917938232,
212
+ "logits/rejected": -3.5078113079071045,
213
+ "logps/chosen": -733.4524536132812,
214
+ "logps/rejected": -1333.154052734375,
215
+ "loss": 1.0773,
216
+ "rewards/accuracies": 0.6842105388641357,
217
+ "rewards/chosen": -0.5969735383987427,
218
+ "rewards/margins": 0.8910157084465027,
219
+ "rewards/rejected": -1.4879893064498901,
220
+ "step": 14
221
+ },
222
+ {
223
+ "epoch": 0.025466893039049237,
224
+ "grad_norm": 229.76531982421875,
225
+ "learning_rate": 2.8000000000000003e-06,
226
+ "logits/chosen": -3.9040117263793945,
227
+ "logits/rejected": -3.7774672508239746,
228
+ "logps/chosen": -635.8306884765625,
229
+ "logps/rejected": -1249.3895263671875,
230
+ "loss": 0.8262,
231
+ "rewards/accuracies": 0.8421052694320679,
232
+ "rewards/chosen": -0.1118985116481781,
233
+ "rewards/margins": 0.4985432028770447,
234
+ "rewards/rejected": -0.6104416847229004,
235
+ "step": 15
236
+ },
237
+ {
238
+ "epoch": 0.027164685908319185,
239
+ "grad_norm": 107.49576568603516,
240
+ "learning_rate": 2.9999999999999997e-06,
241
+ "logits/chosen": -3.6848840713500977,
242
+ "logits/rejected": -3.5065793991088867,
243
+ "logps/chosen": -634.2091674804688,
244
+ "logps/rejected": -1518.8646240234375,
245
+ "loss": 0.7195,
246
+ "rewards/accuracies": 0.6842105388641357,
247
+ "rewards/chosen": -0.577033519744873,
248
+ "rewards/margins": 1.5605580806732178,
249
+ "rewards/rejected": -2.137591600418091,
250
+ "step": 16
251
+ },
252
+ {
253
+ "epoch": 0.028862478777589132,
254
+ "grad_norm": 415.56146240234375,
255
+ "learning_rate": 3.2e-06,
256
+ "logits/chosen": -3.6984755992889404,
257
+ "logits/rejected": -3.463688850402832,
258
+ "logps/chosen": -764.843017578125,
259
+ "logps/rejected": -1857.59375,
260
+ "loss": 1.1264,
261
+ "rewards/accuracies": 0.6315789222717285,
262
+ "rewards/chosen": -0.6638931632041931,
263
+ "rewards/margins": 0.4968886077404022,
264
+ "rewards/rejected": -1.160781741142273,
265
+ "step": 17
266
+ },
267
+ {
268
+ "epoch": 0.030560271646859084,
269
+ "grad_norm": 94.64751434326172,
270
+ "learning_rate": 3.4e-06,
271
+ "logits/chosen": -3.751709222793579,
272
+ "logits/rejected": -3.501725912094116,
273
+ "logps/chosen": -1178.7249755859375,
274
+ "logps/rejected": -2049.426513671875,
275
+ "loss": 0.3738,
276
+ "rewards/accuracies": 0.7894737124443054,
277
+ "rewards/chosen": -0.984968900680542,
278
+ "rewards/margins": 2.2881321907043457,
279
+ "rewards/rejected": -3.2731010913848877,
280
+ "step": 18
281
+ },
282
+ {
283
+ "epoch": 0.03225806451612903,
284
+ "grad_norm": 189.4529266357422,
285
+ "learning_rate": 3.5999999999999994e-06,
286
+ "logits/chosen": -3.6436092853546143,
287
+ "logits/rejected": -3.5360822677612305,
288
+ "logps/chosen": -1026.79541015625,
289
+ "logps/rejected": -1805.1661376953125,
290
+ "loss": 0.6848,
291
+ "rewards/accuracies": 0.5789473652839661,
292
+ "rewards/chosen": -1.6188812255859375,
293
+ "rewards/margins": 1.1595208644866943,
294
+ "rewards/rejected": -2.778402090072632,
295
+ "step": 19
296
+ },
297
+ {
298
+ "epoch": 0.03395585738539898,
299
+ "grad_norm": 274.99066162109375,
300
+ "learning_rate": 3.7999999999999996e-06,
301
+ "logits/chosen": -3.6498701572418213,
302
+ "logits/rejected": -3.4178977012634277,
303
+ "logps/chosen": -999.5308227539062,
304
+ "logps/rejected": -2296.958251953125,
305
+ "loss": 0.6219,
306
+ "rewards/accuracies": 0.7368420958518982,
307
+ "rewards/chosen": -1.8587936162948608,
308
+ "rewards/margins": 1.8212978839874268,
309
+ "rewards/rejected": -3.680091381072998,
310
+ "step": 20
311
+ },
312
+ {
313
+ "epoch": 0.035653650254668934,
314
+ "grad_norm": 38.05210494995117,
315
+ "learning_rate": 4e-06,
316
+ "logits/chosen": -3.9445407390594482,
317
+ "logits/rejected": -3.6595799922943115,
318
+ "logps/chosen": -800.626220703125,
319
+ "logps/rejected": -1689.36474609375,
320
+ "loss": 0.3567,
321
+ "rewards/accuracies": 0.8421052694320679,
322
+ "rewards/chosen": -0.8077056407928467,
323
+ "rewards/margins": 3.5434539318084717,
324
+ "rewards/rejected": -4.351159572601318,
325
+ "step": 21
326
+ },
327
+ {
328
+ "epoch": 0.03735144312393888,
329
+ "grad_norm": 158.98568725585938,
330
+ "learning_rate": 4.2e-06,
331
+ "logits/chosen": -3.736311197280884,
332
+ "logits/rejected": -3.480236530303955,
333
+ "logps/chosen": -916.6001586914062,
334
+ "logps/rejected": -2222.215576171875,
335
+ "loss": 0.563,
336
+ "rewards/accuracies": 0.7368420958518982,
337
+ "rewards/chosen": -1.4374593496322632,
338
+ "rewards/margins": 4.035632610321045,
339
+ "rewards/rejected": -5.473092555999756,
340
+ "step": 22
341
+ },
342
+ {
343
+ "epoch": 0.03904923599320883,
344
+ "grad_norm": 70.41584777832031,
345
+ "learning_rate": 4.4e-06,
346
+ "logits/chosen": -3.833054780960083,
347
+ "logits/rejected": -3.6345179080963135,
348
+ "logps/chosen": -394.1758728027344,
349
+ "logps/rejected": -1003.4253540039062,
350
+ "loss": 0.4901,
351
+ "rewards/accuracies": 0.7894737124443054,
352
+ "rewards/chosen": -1.265379548072815,
353
+ "rewards/margins": 2.194890022277832,
354
+ "rewards/rejected": -3.4602696895599365,
355
+ "step": 23
356
+ },
357
+ {
358
+ "epoch": 0.04074702886247878,
359
+ "grad_norm": 421.5316162109375,
360
+ "learning_rate": 4.6e-06,
361
+ "logits/chosen": -3.865057945251465,
362
+ "logits/rejected": -3.7267401218414307,
363
+ "logps/chosen": -1011.3937377929688,
364
+ "logps/rejected": -1325.136474609375,
365
+ "loss": 2.5717,
366
+ "rewards/accuracies": 0.6315789222717285,
367
+ "rewards/chosen": -4.050071716308594,
368
+ "rewards/margins": 0.2841028869152069,
369
+ "rewards/rejected": -4.334174633026123,
370
+ "step": 24
371
+ },
372
+ {
373
+ "epoch": 0.042444821731748725,
374
+ "grad_norm": 23.352031707763672,
375
+ "learning_rate": 4.8e-06,
376
+ "logits/chosen": -3.747166395187378,
377
+ "logits/rejected": -3.5740578174591064,
378
+ "logps/chosen": -636.3488159179688,
379
+ "logps/rejected": -1744.6492919921875,
380
+ "loss": 0.2064,
381
+ "rewards/accuracies": 1.0,
382
+ "rewards/chosen": -1.844959020614624,
383
+ "rewards/margins": 4.199265956878662,
384
+ "rewards/rejected": -6.044224739074707,
385
+ "step": 25
386
+ },
387
+ {
388
+ "epoch": 0.044142614601018676,
389
+ "grad_norm": 195.68930053710938,
390
+ "learning_rate": 5e-06,
391
+ "logits/chosen": -3.7053744792938232,
392
+ "logits/rejected": -3.458592176437378,
393
+ "logps/chosen": -1098.926513671875,
394
+ "logps/rejected": -2076.791015625,
395
+ "loss": 0.8933,
396
+ "rewards/accuracies": 0.7368420958518982,
397
+ "rewards/chosen": -4.474255084991455,
398
+ "rewards/margins": 6.412208080291748,
399
+ "rewards/rejected": -10.886463165283203,
400
+ "step": 26
401
+ },
402
+ {
403
+ "epoch": 0.04584040747028863,
404
+ "grad_norm": 227.4545440673828,
405
+ "learning_rate": 5.2e-06,
406
+ "logits/chosen": -3.8032331466674805,
407
+ "logits/rejected": -3.699617862701416,
408
+ "logps/chosen": -1081.37841796875,
409
+ "logps/rejected": -1176.47314453125,
410
+ "loss": 2.6358,
411
+ "rewards/accuracies": 0.6315789222717285,
412
+ "rewards/chosen": -4.119551181793213,
413
+ "rewards/margins": 1.8443418741226196,
414
+ "rewards/rejected": -5.963892459869385,
415
+ "step": 27
416
+ },
417
+ {
418
+ "epoch": 0.04753820033955857,
419
+ "grad_norm": 34.18882751464844,
420
+ "learning_rate": 5.4e-06,
421
+ "logits/chosen": -3.7299857139587402,
422
+ "logits/rejected": -3.5211801528930664,
423
+ "logps/chosen": -769.3715209960938,
424
+ "logps/rejected": -2031.3714599609375,
425
+ "loss": 0.3846,
426
+ "rewards/accuracies": 0.8421052694320679,
427
+ "rewards/chosen": -3.4353513717651367,
428
+ "rewards/margins": 7.42952299118042,
429
+ "rewards/rejected": -10.864873886108398,
430
+ "step": 28
431
+ },
432
+ {
433
+ "epoch": 0.04923599320882852,
434
+ "grad_norm": 47.27467727661133,
435
+ "learning_rate": 5.600000000000001e-06,
436
+ "logits/chosen": -3.7908668518066406,
437
+ "logits/rejected": -3.70328950881958,
438
+ "logps/chosen": -450.0216979980469,
439
+ "logps/rejected": -850.3040161132812,
440
+ "loss": 0.3451,
441
+ "rewards/accuracies": 0.8421052694320679,
442
+ "rewards/chosen": -2.090538501739502,
443
+ "rewards/margins": 2.738893747329712,
444
+ "rewards/rejected": -4.829432010650635,
445
+ "step": 29
446
+ },
447
+ {
448
+ "epoch": 0.050933786078098474,
449
+ "grad_norm": 57.626739501953125,
450
+ "learning_rate": 5.8e-06,
451
+ "logits/chosen": -3.8924810886383057,
452
+ "logits/rejected": -3.5905206203460693,
453
+ "logps/chosen": -835.1837158203125,
454
+ "logps/rejected": -1747.001220703125,
455
+ "loss": 0.4026,
456
+ "rewards/accuracies": 0.8947368264198303,
457
+ "rewards/chosen": -4.321366786956787,
458
+ "rewards/margins": 6.867539882659912,
459
+ "rewards/rejected": -11.1889066696167,
460
+ "step": 30
461
+ },
462
+ {
463
+ "epoch": 0.05263157894736842,
464
+ "grad_norm": 38.01590347290039,
465
+ "learning_rate": 5.999999999999999e-06,
466
+ "logits/chosen": -3.851223945617676,
467
+ "logits/rejected": -3.510930299758911,
468
+ "logps/chosen": -1061.4251708984375,
469
+ "logps/rejected": -2431.38818359375,
470
+ "loss": 0.2778,
471
+ "rewards/accuracies": 0.8421052694320679,
472
+ "rewards/chosen": -4.868941783905029,
473
+ "rewards/margins": 8.6685209274292,
474
+ "rewards/rejected": -13.537463188171387,
475
+ "step": 31
476
+ },
477
+ {
478
+ "epoch": 0.05432937181663837,
479
+ "grad_norm": 212.42942810058594,
480
+ "learning_rate": 6.2e-06,
481
+ "logits/chosen": -3.774933099746704,
482
+ "logits/rejected": -3.769662857055664,
483
+ "logps/chosen": -772.5845336914062,
484
+ "logps/rejected": -1347.6492919921875,
485
+ "loss": 1.2241,
486
+ "rewards/accuracies": 0.7894737124443054,
487
+ "rewards/chosen": -4.480807304382324,
488
+ "rewards/margins": 4.54947566986084,
489
+ "rewards/rejected": -9.030282020568848,
490
+ "step": 32
491
+ },
492
+ {
493
+ "epoch": 0.05602716468590832,
494
+ "grad_norm": 19.666946411132812,
495
+ "learning_rate": 6.4e-06,
496
+ "logits/chosen": -3.743957281112671,
497
+ "logits/rejected": -3.4936163425445557,
498
+ "logps/chosen": -682.9749145507812,
499
+ "logps/rejected": -1827.3819580078125,
500
+ "loss": 0.1635,
501
+ "rewards/accuracies": 0.8947368264198303,
502
+ "rewards/chosen": -3.1712920665740967,
503
+ "rewards/margins": 6.201633930206299,
504
+ "rewards/rejected": -9.372926712036133,
505
+ "step": 33
506
+ },
507
+ {
508
+ "epoch": 0.057724957555178265,
509
+ "grad_norm": 120.70894622802734,
510
+ "learning_rate": 6.5999999999999995e-06,
511
+ "logits/chosen": -3.7753212451934814,
512
+ "logits/rejected": -3.556863784790039,
513
+ "logps/chosen": -671.4615478515625,
514
+ "logps/rejected": -1785.2418212890625,
515
+ "loss": 0.318,
516
+ "rewards/accuracies": 0.8947368264198303,
517
+ "rewards/chosen": -3.6064252853393555,
518
+ "rewards/margins": 8.610679626464844,
519
+ "rewards/rejected": -12.2171049118042,
520
+ "step": 34
521
+ },
522
+ {
523
+ "epoch": 0.059422750424448216,
524
+ "grad_norm": 142.81478881835938,
525
+ "learning_rate": 6.8e-06,
526
+ "logits/chosen": -3.6816179752349854,
527
+ "logits/rejected": -3.592928647994995,
528
+ "logps/chosen": -983.4131469726562,
529
+ "logps/rejected": -1972.7388916015625,
530
+ "loss": 0.741,
531
+ "rewards/accuracies": 0.8421052694320679,
532
+ "rewards/chosen": -4.976840496063232,
533
+ "rewards/margins": 7.173476219177246,
534
+ "rewards/rejected": -12.150318145751953,
535
+ "step": 35
536
+ },
537
+ {
538
+ "epoch": 0.06112054329371817,
539
+ "grad_norm": 55.45768356323242,
540
+ "learning_rate": 7e-06,
541
+ "logits/chosen": -3.8779475688934326,
542
+ "logits/rejected": -3.7793450355529785,
543
+ "logps/chosen": -339.6081848144531,
544
+ "logps/rejected": -951.3660888671875,
545
+ "loss": 0.2939,
546
+ "rewards/accuracies": 0.8947368264198303,
547
+ "rewards/chosen": -1.9719674587249756,
548
+ "rewards/margins": 3.296804189682007,
549
+ "rewards/rejected": -5.268771648406982,
550
+ "step": 36
551
+ },
552
+ {
553
+ "epoch": 0.06281833616298811,
554
+ "grad_norm": 30.784549713134766,
555
+ "learning_rate": 6.999995681795924e-06,
556
+ "logits/chosen": -3.828057050704956,
557
+ "logits/rejected": -3.502441644668579,
558
+ "logps/chosen": -714.7034301757812,
559
+ "logps/rejected": -2708.83349609375,
560
+ "loss": 0.2977,
561
+ "rewards/accuracies": 0.9473684430122375,
562
+ "rewards/chosen": -3.3775370121002197,
563
+ "rewards/margins": 11.722590446472168,
564
+ "rewards/rejected": -15.100126266479492,
565
+ "step": 37
566
+ },
567
+ {
568
+ "epoch": 0.06451612903225806,
569
+ "grad_norm": 92.5975341796875,
570
+ "learning_rate": 6.999982727197902e-06,
571
+ "logits/chosen": -3.8347432613372803,
572
+ "logits/rejected": -3.7575533390045166,
573
+ "logps/chosen": -636.1466674804688,
574
+ "logps/rejected": -1029.7694091796875,
575
+ "loss": 0.7757,
576
+ "rewards/accuracies": 0.8421052694320679,
577
+ "rewards/chosen": -3.5677731037139893,
578
+ "rewards/margins": 1.545227289199829,
579
+ "rewards/rejected": -5.113000392913818,
580
+ "step": 38
581
+ },
582
+ {
583
+ "epoch": 0.06621392190152801,
584
+ "grad_norm": 95.85789489746094,
585
+ "learning_rate": 6.999961136248556e-06,
586
+ "logits/chosen": -4.125431060791016,
587
+ "logits/rejected": -3.8893556594848633,
588
+ "logps/chosen": -410.7164306640625,
589
+ "logps/rejected": -891.2525024414062,
590
+ "loss": 0.6768,
591
+ "rewards/accuracies": 0.7894737124443054,
592
+ "rewards/chosen": -2.504324197769165,
593
+ "rewards/margins": 3.1136813163757324,
594
+ "rewards/rejected": -5.618005275726318,
595
+ "step": 39
596
+ },
597
+ {
598
+ "epoch": 0.06791171477079797,
599
+ "grad_norm": 100.32817840576172,
600
+ "learning_rate": 6.999930909018923e-06,
601
+ "logits/chosen": -3.7379164695739746,
602
+ "logits/rejected": -3.6506543159484863,
603
+ "logps/chosen": -773.4288940429688,
604
+ "logps/rejected": -1535.619384765625,
605
+ "loss": 0.6897,
606
+ "rewards/accuracies": 0.7894737124443054,
607
+ "rewards/chosen": -4.3702168464660645,
608
+ "rewards/margins": 5.706230163574219,
609
+ "rewards/rejected": -10.076446533203125,
610
+ "step": 40
611
+ },
612
+ {
613
+ "epoch": 0.06960950764006792,
614
+ "grad_norm": 265.2519226074219,
615
+ "learning_rate": 6.999892045608449e-06,
616
+ "logits/chosen": -3.7866342067718506,
617
+ "logits/rejected": -3.6257829666137695,
618
+ "logps/chosen": -1463.1141357421875,
619
+ "logps/rejected": -1968.306396484375,
620
+ "loss": 1.7624,
621
+ "rewards/accuracies": 0.7368420958518982,
622
+ "rewards/chosen": -8.517228126525879,
623
+ "rewards/margins": 3.0944013595581055,
624
+ "rewards/rejected": -11.611628532409668,
625
+ "step": 41
626
+ },
627
+ {
628
+ "epoch": 0.07130730050933787,
629
+ "grad_norm": 172.8343048095703,
630
+ "learning_rate": 6.999844546145e-06,
631
+ "logits/chosen": -3.7290871143341064,
632
+ "logits/rejected": -3.678785800933838,
633
+ "logps/chosen": -1073.1202392578125,
634
+ "logps/rejected": -1557.5167236328125,
635
+ "loss": 1.1741,
636
+ "rewards/accuracies": 0.6315789222717285,
637
+ "rewards/chosen": -4.971875190734863,
638
+ "rewards/margins": 5.183844566345215,
639
+ "rewards/rejected": -10.155719757080078,
640
+ "step": 42
641
+ },
642
+ {
643
+ "epoch": 0.0730050933786078,
644
+ "grad_norm": 439.6719665527344,
645
+ "learning_rate": 6.999788410784851e-06,
646
+ "logits/chosen": -3.736490249633789,
647
+ "logits/rejected": -3.7374424934387207,
648
+ "logps/chosen": -970.9537353515625,
649
+ "logps/rejected": -1044.634521484375,
650
+ "loss": 2.492,
651
+ "rewards/accuracies": 0.7368420958518982,
652
+ "rewards/chosen": -4.464043617248535,
653
+ "rewards/margins": 1.9694724082946777,
654
+ "rewards/rejected": -6.433516025543213,
655
+ "step": 43
656
+ },
657
+ {
658
+ "epoch": 0.07470288624787776,
659
+ "grad_norm": 348.20208740234375,
660
+ "learning_rate": 6.999723639712691e-06,
661
+ "logits/chosen": -3.7370145320892334,
662
+ "logits/rejected": -3.5357182025909424,
663
+ "logps/chosen": -1153.1453857421875,
664
+ "logps/rejected": -2073.501220703125,
665
+ "loss": 1.224,
666
+ "rewards/accuracies": 0.8947368264198303,
667
+ "rewards/chosen": -5.5407490730285645,
668
+ "rewards/margins": 6.521337032318115,
669
+ "rewards/rejected": -12.06208610534668,
670
+ "step": 44
671
+ },
672
+ {
673
+ "epoch": 0.07640067911714771,
674
+ "grad_norm": 88.37775421142578,
675
+ "learning_rate": 6.99965023314162e-06,
676
+ "logits/chosen": -3.579968214035034,
677
+ "logits/rejected": -3.5226123332977295,
678
+ "logps/chosen": -890.927734375,
679
+ "logps/rejected": -1632.11865234375,
680
+ "loss": 0.4036,
681
+ "rewards/accuracies": 0.8947368264198303,
682
+ "rewards/chosen": -3.7555582523345947,
683
+ "rewards/margins": 5.139606952667236,
684
+ "rewards/rejected": -8.89516544342041,
685
+ "step": 45
686
+ },
687
+ {
688
+ "epoch": 0.07809847198641766,
689
+ "grad_norm": 26.1304988861084,
690
+ "learning_rate": 6.999568191313151e-06,
691
+ "logits/chosen": -3.8651726245880127,
692
+ "logits/rejected": -3.720208168029785,
693
+ "logps/chosen": -614.7899169921875,
694
+ "logps/rejected": -1408.1048583984375,
695
+ "loss": 0.1974,
696
+ "rewards/accuracies": 0.8947368264198303,
697
+ "rewards/chosen": -1.4795647859573364,
698
+ "rewards/margins": 4.5847673416137695,
699
+ "rewards/rejected": -6.064332008361816,
700
+ "step": 46
701
+ },
702
+ {
703
+ "epoch": 0.07979626485568761,
704
+ "grad_norm": 113.91500091552734,
705
+ "learning_rate": 6.999477514497206e-06,
706
+ "logits/chosen": -3.823136568069458,
707
+ "logits/rejected": -3.4229936599731445,
708
+ "logps/chosen": -528.0443115234375,
709
+ "logps/rejected": -1226.7037353515625,
710
+ "loss": 0.7325,
711
+ "rewards/accuracies": 0.5263158082962036,
712
+ "rewards/chosen": -2.1668002605438232,
713
+ "rewards/margins": 3.469679117202759,
714
+ "rewards/rejected": -5.63647985458374,
715
+ "step": 47
716
+ },
717
+ {
718
+ "epoch": 0.08149405772495756,
719
+ "grad_norm": 489.7789611816406,
720
+ "learning_rate": 6.999378202992117e-06,
721
+ "logits/chosen": -3.5525624752044678,
722
+ "logits/rejected": -3.5467617511749268,
723
+ "logps/chosen": -1388.6363525390625,
724
+ "logps/rejected": -2001.3951416015625,
725
+ "loss": 1.8689,
726
+ "rewards/accuracies": 0.7368420958518982,
727
+ "rewards/chosen": -4.708498477935791,
728
+ "rewards/margins": 5.626183032989502,
729
+ "rewards/rejected": -10.334681510925293,
730
+ "step": 48
731
+ },
732
+ {
733
+ "epoch": 0.0831918505942275,
734
+ "grad_norm": 22.89203453063965,
735
+ "learning_rate": 6.999270257124625e-06,
736
+ "logits/chosen": -3.796808958053589,
737
+ "logits/rejected": -3.505606174468994,
738
+ "logps/chosen": -892.1825561523438,
739
+ "logps/rejected": -2162.55908203125,
740
+ "loss": 0.163,
741
+ "rewards/accuracies": 0.9473684430122375,
742
+ "rewards/chosen": -2.251508951187134,
743
+ "rewards/margins": 7.360548973083496,
744
+ "rewards/rejected": -9.612058639526367,
745
+ "step": 49
746
+ },
747
+ {
748
+ "epoch": 0.08488964346349745,
749
+ "grad_norm": 91.42052459716797,
750
+ "learning_rate": 6.999153677249879e-06,
751
+ "logits/chosen": -3.908195972442627,
752
+ "logits/rejected": -3.6327476501464844,
753
+ "logps/chosen": -673.4215087890625,
754
+ "logps/rejected": -1590.754150390625,
755
+ "loss": 0.4303,
756
+ "rewards/accuracies": 0.7894737124443054,
757
+ "rewards/chosen": -1.6777422428131104,
758
+ "rewards/margins": 4.665722370147705,
759
+ "rewards/rejected": -6.3434648513793945,
760
+ "step": 50
761
+ },
762
+ {
763
+ "epoch": 0.0865874363327674,
764
+ "grad_norm": 91.4797134399414,
765
+ "learning_rate": 6.999028463751432e-06,
766
+ "logits/chosen": -3.7286806106567383,
767
+ "logits/rejected": -3.413952112197876,
768
+ "logps/chosen": -520.708984375,
769
+ "logps/rejected": -1529.3165283203125,
770
+ "loss": 0.5809,
771
+ "rewards/accuracies": 0.7894737124443054,
772
+ "rewards/chosen": -1.926355242729187,
773
+ "rewards/margins": 4.901339054107666,
774
+ "rewards/rejected": -6.827694416046143,
775
+ "step": 51
776
+ },
777
+ {
778
+ "epoch": 0.08828522920203735,
779
+ "grad_norm": 212.3939208984375,
780
+ "learning_rate": 6.998894617041247e-06,
781
+ "logits/chosen": -3.603062868118286,
782
+ "logits/rejected": -3.29253888130188,
783
+ "logps/chosen": -808.3012084960938,
784
+ "logps/rejected": -1734.44677734375,
785
+ "loss": 0.4248,
786
+ "rewards/accuracies": 0.8947368264198303,
787
+ "rewards/chosen": -2.2691493034362793,
788
+ "rewards/margins": 3.9479000568389893,
789
+ "rewards/rejected": -6.217049598693848,
790
+ "step": 52
791
+ },
792
+ {
793
+ "epoch": 0.0899830220713073,
794
+ "grad_norm": 74.79203033447266,
795
+ "learning_rate": 6.998752137559685e-06,
796
+ "logits/chosen": -3.6790192127227783,
797
+ "logits/rejected": -3.5017669200897217,
798
+ "logps/chosen": -953.6409301757812,
799
+ "logps/rejected": -1656.254150390625,
800
+ "loss": 0.4278,
801
+ "rewards/accuracies": 0.7894737124443054,
802
+ "rewards/chosen": -1.8970955610275269,
803
+ "rewards/margins": 4.207927703857422,
804
+ "rewards/rejected": -6.10502290725708,
805
+ "step": 53
806
+ },
807
+ {
808
+ "epoch": 0.09168081494057725,
809
+ "grad_norm": 59.26031494140625,
810
+ "learning_rate": 6.998601025775514e-06,
811
+ "logits/chosen": -3.8182411193847656,
812
+ "logits/rejected": -3.5321524143218994,
813
+ "logps/chosen": -736.5953979492188,
814
+ "logps/rejected": -1425.5853271484375,
815
+ "loss": 0.264,
816
+ "rewards/accuracies": 0.8421052694320679,
817
+ "rewards/chosen": -1.5467214584350586,
818
+ "rewards/margins": 4.007129669189453,
819
+ "rewards/rejected": -5.553851127624512,
820
+ "step": 54
821
+ },
822
+ {
823
+ "epoch": 0.0933786078098472,
824
+ "grad_norm": 52.41440200805664,
825
+ "learning_rate": 6.9984412821858986e-06,
826
+ "logits/chosen": -3.9926223754882812,
827
+ "logits/rejected": -3.7583560943603516,
828
+ "logps/chosen": -829.6281127929688,
829
+ "logps/rejected": -1729.273681640625,
830
+ "loss": 0.2221,
831
+ "rewards/accuracies": 0.9473684430122375,
832
+ "rewards/chosen": -0.7696541547775269,
833
+ "rewards/margins": 6.237390041351318,
834
+ "rewards/rejected": -7.007043838500977,
835
+ "step": 55
836
+ },
837
+ {
838
+ "epoch": 0.09507640067911714,
839
+ "grad_norm": 26.63044548034668,
840
+ "learning_rate": 6.998272907316408e-06,
841
+ "logits/chosen": -3.779285430908203,
842
+ "logits/rejected": -3.7332136631011963,
843
+ "logps/chosen": -813.6694946289062,
844
+ "logps/rejected": -1219.005126953125,
845
+ "loss": 0.2965,
846
+ "rewards/accuracies": 0.9473684430122375,
847
+ "rewards/chosen": -0.7820217609405518,
848
+ "rewards/margins": 3.99786376953125,
849
+ "rewards/rejected": -4.779885768890381,
850
+ "step": 56
851
+ },
852
+ {
853
+ "epoch": 0.0967741935483871,
854
+ "grad_norm": 200.0863037109375,
855
+ "learning_rate": 6.998095901721002e-06,
856
+ "logits/chosen": -3.737215042114258,
857
+ "logits/rejected": -3.4522533416748047,
858
+ "logps/chosen": -1219.6558837890625,
859
+ "logps/rejected": -2281.621337890625,
860
+ "loss": 0.6528,
861
+ "rewards/accuracies": 0.7368420958518982,
862
+ "rewards/chosen": -1.4408289194107056,
863
+ "rewards/margins": 5.970677852630615,
864
+ "rewards/rejected": -7.4115071296691895,
865
+ "step": 57
866
+ },
867
+ {
868
+ "epoch": 0.09847198641765705,
869
+ "grad_norm": 117.3527603149414,
870
+ "learning_rate": 6.997910265982044e-06,
871
+ "logits/chosen": -3.8976874351501465,
872
+ "logits/rejected": -3.5120694637298584,
873
+ "logps/chosen": -645.6788940429688,
874
+ "logps/rejected": -2199.60107421875,
875
+ "loss": 0.3866,
876
+ "rewards/accuracies": 0.8947368264198303,
877
+ "rewards/chosen": -1.1234122514724731,
878
+ "rewards/margins": 9.132166862487793,
879
+ "rewards/rejected": -10.25557804107666,
880
+ "step": 58
881
+ },
882
+ {
883
+ "epoch": 0.100169779286927,
884
+ "grad_norm": 102.26219177246094,
885
+ "learning_rate": 6.997716000710282e-06,
886
+ "logits/chosen": -3.730203866958618,
887
+ "logits/rejected": -3.469224452972412,
888
+ "logps/chosen": -665.0298461914062,
889
+ "logps/rejected": -2010.6336669921875,
890
+ "loss": 0.5415,
891
+ "rewards/accuracies": 0.8947368264198303,
892
+ "rewards/chosen": -1.3938777446746826,
893
+ "rewards/margins": 6.654629230499268,
894
+ "rewards/rejected": -8.048505783081055,
895
+ "step": 59
896
+ },
897
+ {
898
+ "epoch": 0.10186757215619695,
899
+ "grad_norm": 61.66415786743164,
900
+ "learning_rate": 6.9975131065448635e-06,
901
+ "logits/chosen": -3.8243424892425537,
902
+ "logits/rejected": -3.732562780380249,
903
+ "logps/chosen": -607.7645263671875,
904
+ "logps/rejected": -1131.4736328125,
905
+ "loss": 0.5046,
906
+ "rewards/accuracies": 0.8947368264198303,
907
+ "rewards/chosen": -1.3792232275009155,
908
+ "rewards/margins": 3.7461965084075928,
909
+ "rewards/rejected": -5.125420093536377,
910
+ "step": 60
911
+ },
912
+ {
913
+ "epoch": 0.1035653650254669,
914
+ "grad_norm": 37.84029769897461,
915
+ "learning_rate": 6.997301584153322e-06,
916
+ "logits/chosen": -3.714604377746582,
917
+ "logits/rejected": -3.463052749633789,
918
+ "logps/chosen": -762.448486328125,
919
+ "logps/rejected": -2047.9002685546875,
920
+ "loss": 0.1614,
921
+ "rewards/accuracies": 0.8947368264198303,
922
+ "rewards/chosen": -1.0677417516708374,
923
+ "rewards/margins": 8.98747730255127,
924
+ "rewards/rejected": -10.055219650268555,
925
+ "step": 61
926
+ },
927
+ {
928
+ "epoch": 0.10526315789473684,
929
+ "grad_norm": 82.76973724365234,
930
+ "learning_rate": 6.9970814342315785e-06,
931
+ "logits/chosen": -3.89551043510437,
932
+ "logits/rejected": -3.806321859359741,
933
+ "logps/chosen": -1028.5377197265625,
934
+ "logps/rejected": -1512.9459228515625,
935
+ "loss": 0.3038,
936
+ "rewards/accuracies": 0.8947368264198303,
937
+ "rewards/chosen": -1.632301926612854,
938
+ "rewards/margins": 6.467922210693359,
939
+ "rewards/rejected": -8.100224494934082,
940
+ "step": 62
941
+ },
942
+ {
943
+ "epoch": 0.10696095076400679,
944
+ "grad_norm": 64.66484069824219,
945
+ "learning_rate": 6.99685265750394e-06,
946
+ "logits/chosen": -3.8749654293060303,
947
+ "logits/rejected": -3.5141024589538574,
948
+ "logps/chosen": -803.72265625,
949
+ "logps/rejected": -2069.438720703125,
950
+ "loss": 0.149,
951
+ "rewards/accuracies": 0.9473684430122375,
952
+ "rewards/chosen": -0.3676658570766449,
953
+ "rewards/margins": 6.284032344818115,
954
+ "rewards/rejected": -6.651698589324951,
955
+ "step": 63
956
+ },
957
+ {
958
+ "epoch": 0.10865874363327674,
959
+ "grad_norm": 319.979736328125,
960
+ "learning_rate": 6.996615254723095e-06,
961
+ "logits/chosen": -3.723146915435791,
962
+ "logits/rejected": -3.653900623321533,
963
+ "logps/chosen": -1207.6829833984375,
964
+ "logps/rejected": -1694.005859375,
965
+ "loss": 1.8275,
966
+ "rewards/accuracies": 0.6315789222717285,
967
+ "rewards/chosen": -1.6885120868682861,
968
+ "rewards/margins": 1.9671132564544678,
969
+ "rewards/rejected": -3.655625104904175,
970
+ "step": 64
971
+ },
972
+ {
973
+ "epoch": 0.11035653650254669,
974
+ "grad_norm": 36.157405853271484,
975
+ "learning_rate": 6.996369226670114e-06,
976
+ "logits/chosen": -3.987626552581787,
977
+ "logits/rejected": -3.628830909729004,
978
+ "logps/chosen": -341.0587463378906,
979
+ "logps/rejected": -1282.7177734375,
980
+ "loss": 0.2223,
981
+ "rewards/accuracies": 0.8421052694320679,
982
+ "rewards/chosen": -1.118723750114441,
983
+ "rewards/margins": 4.808956146240234,
984
+ "rewards/rejected": -5.927680015563965,
985
+ "step": 65
986
+ },
987
+ {
988
+ "epoch": 0.11205432937181664,
989
+ "grad_norm": 22.443660736083984,
990
+ "learning_rate": 6.996114574154442e-06,
991
+ "logits/chosen": -3.928772211074829,
992
+ "logits/rejected": -3.497762680053711,
993
+ "logps/chosen": -930.9664916992188,
994
+ "logps/rejected": -2155.483154296875,
995
+ "loss": 0.1819,
996
+ "rewards/accuracies": 0.9473684430122375,
997
+ "rewards/chosen": -0.1744617372751236,
998
+ "rewards/margins": 8.700950622558594,
999
+ "rewards/rejected": -8.875412940979004,
1000
+ "step": 66
1001
+ },
1002
+ {
1003
+ "epoch": 0.11375212224108659,
1004
+ "grad_norm": 130.13873291015625,
1005
+ "learning_rate": 6.9958512980139036e-06,
1006
+ "logits/chosen": -3.6982197761535645,
1007
+ "logits/rejected": -3.524240016937256,
1008
+ "logps/chosen": -549.5940551757812,
1009
+ "logps/rejected": -1785.2578125,
1010
+ "loss": 0.7641,
1011
+ "rewards/accuracies": 0.8421052694320679,
1012
+ "rewards/chosen": -1.5123597383499146,
1013
+ "rewards/margins": 3.1788170337677,
1014
+ "rewards/rejected": -4.691176414489746,
1015
+ "step": 67
1016
+ },
1017
+ {
1018
+ "epoch": 0.11544991511035653,
1019
+ "grad_norm": 51.48603820800781,
1020
+ "learning_rate": 6.995579399114692e-06,
1021
+ "logits/chosen": -3.842341423034668,
1022
+ "logits/rejected": -3.610034942626953,
1023
+ "logps/chosen": -806.690673828125,
1024
+ "logps/rejected": -2141.96630859375,
1025
+ "loss": 0.2012,
1026
+ "rewards/accuracies": 0.8947368264198303,
1027
+ "rewards/chosen": -1.566497802734375,
1028
+ "rewards/margins": 7.737715721130371,
1029
+ "rewards/rejected": -9.304213523864746,
1030
+ "step": 68
1031
+ },
1032
+ {
1033
+ "epoch": 0.11714770797962648,
1034
+ "grad_norm": 73.42926025390625,
1035
+ "learning_rate": 6.995298878351372e-06,
1036
+ "logits/chosen": -3.790009021759033,
1037
+ "logits/rejected": -3.6310887336730957,
1038
+ "logps/chosen": -944.5301513671875,
1039
+ "logps/rejected": -1037.1728515625,
1040
+ "loss": 0.602,
1041
+ "rewards/accuracies": 0.7894737124443054,
1042
+ "rewards/chosen": -1.2610541582107544,
1043
+ "rewards/margins": 3.599123477935791,
1044
+ "rewards/rejected": -4.860177516937256,
1045
+ "step": 69
1046
+ },
1047
+ {
1048
+ "epoch": 0.11884550084889643,
1049
+ "grad_norm": 21.031574249267578,
1050
+ "learning_rate": 6.995009736646872e-06,
1051
+ "logits/chosen": -3.8047678470611572,
1052
+ "logits/rejected": -3.6022684574127197,
1053
+ "logps/chosen": -574.5223388671875,
1054
+ "logps/rejected": -1691.0224609375,
1055
+ "loss": 0.121,
1056
+ "rewards/accuracies": 0.9473684430122375,
1057
+ "rewards/chosen": -1.6642251014709473,
1058
+ "rewards/margins": 8.040745735168457,
1059
+ "rewards/rejected": -9.704970359802246,
1060
+ "step": 70
1061
+ },
1062
+ {
1063
+ "epoch": 0.12054329371816638,
1064
+ "grad_norm": 16.911624908447266,
1065
+ "learning_rate": 6.9947119749524874e-06,
1066
+ "logits/chosen": -3.818938732147217,
1067
+ "logits/rejected": -3.619452953338623,
1068
+ "logps/chosen": -481.9064636230469,
1069
+ "logps/rejected": -1320.2601318359375,
1070
+ "loss": 0.1583,
1071
+ "rewards/accuracies": 1.0,
1072
+ "rewards/chosen": -0.6912651062011719,
1073
+ "rewards/margins": 8.028682708740234,
1074
+ "rewards/rejected": -8.71994686126709,
1075
+ "step": 71
1076
+ },
1077
+ {
1078
+ "epoch": 0.12224108658743633,
1079
+ "grad_norm": 12.058719635009766,
1080
+ "learning_rate": 6.994405594247871e-06,
1081
+ "logits/chosen": -3.6893556118011475,
1082
+ "logits/rejected": -3.5537164211273193,
1083
+ "logps/chosen": -683.3974609375,
1084
+ "logps/rejected": -1866.5242919921875,
1085
+ "loss": 0.1022,
1086
+ "rewards/accuracies": 1.0,
1087
+ "rewards/chosen": -0.6975005865097046,
1088
+ "rewards/margins": 10.15715217590332,
1089
+ "rewards/rejected": -10.854653358459473,
1090
+ "step": 72
1091
+ },
1092
+ {
1093
+ "epoch": 0.12393887945670629,
1094
+ "grad_norm": 22.33544921875,
1095
+ "learning_rate": 6.9940905955410325e-06,
1096
+ "logits/chosen": -3.5932538509368896,
1097
+ "logits/rejected": -3.4058444499969482,
1098
+ "logps/chosen": -1016.451904296875,
1099
+ "logps/rejected": -2503.58642578125,
1100
+ "loss": 0.1588,
1101
+ "rewards/accuracies": 0.9473684430122375,
1102
+ "rewards/chosen": -1.3289124965667725,
1103
+ "rewards/margins": 11.663505554199219,
1104
+ "rewards/rejected": -12.99241828918457,
1105
+ "step": 73
1106
+ },
1107
+ {
1108
+ "epoch": 0.12563667232597622,
1109
+ "grad_norm": 22.422624588012695,
1110
+ "learning_rate": 6.99376697986834e-06,
1111
+ "logits/chosen": -3.8296735286712646,
1112
+ "logits/rejected": -3.6365044116973877,
1113
+ "logps/chosen": -1009.485595703125,
1114
+ "logps/rejected": -1367.0968017578125,
1115
+ "loss": 0.164,
1116
+ "rewards/accuracies": 1.0,
1117
+ "rewards/chosen": -0.8882247805595398,
1118
+ "rewards/margins": 7.45314359664917,
1119
+ "rewards/rejected": -8.341367721557617,
1120
+ "step": 74
1121
+ },
1122
+ {
1123
+ "epoch": 0.1273344651952462,
1124
+ "grad_norm": 49.275638580322266,
1125
+ "learning_rate": 6.993434748294506e-06,
1126
+ "logits/chosen": -3.7765982151031494,
1127
+ "logits/rejected": -3.6348676681518555,
1128
+ "logps/chosen": -1144.813720703125,
1129
+ "logps/rejected": -1617.056884765625,
1130
+ "loss": 0.255,
1131
+ "rewards/accuracies": 0.8947368264198303,
1132
+ "rewards/chosen": -0.4225502014160156,
1133
+ "rewards/margins": 9.486503601074219,
1134
+ "rewards/rejected": -9.909053802490234,
1135
+ "step": 75
1136
+ },
1137
+ {
1138
+ "epoch": 0.12903225806451613,
1139
+ "grad_norm": 14.187338829040527,
1140
+ "learning_rate": 6.993093901912594e-06,
1141
+ "logits/chosen": -3.6928181648254395,
1142
+ "logits/rejected": -3.587698221206665,
1143
+ "logps/chosen": -553.68505859375,
1144
+ "logps/rejected": -1374.8743896484375,
1145
+ "loss": 0.0957,
1146
+ "rewards/accuracies": 1.0,
1147
+ "rewards/chosen": -1.0303900241851807,
1148
+ "rewards/margins": 7.220921516418457,
1149
+ "rewards/rejected": -8.251312255859375,
1150
+ "step": 76
1151
+ },
1152
+ {
1153
+ "epoch": 0.1307300509337861,
1154
+ "grad_norm": 14.263720512390137,
1155
+ "learning_rate": 6.992744441844007e-06,
1156
+ "logits/chosen": -3.684743881225586,
1157
+ "logits/rejected": -3.4999022483825684,
1158
+ "logps/chosen": -932.639404296875,
1159
+ "logps/rejected": -1908.8145751953125,
1160
+ "loss": 0.1539,
1161
+ "rewards/accuracies": 1.0,
1162
+ "rewards/chosen": -2.9391114711761475,
1163
+ "rewards/margins": 9.202366828918457,
1164
+ "rewards/rejected": -12.141478538513184,
1165
+ "step": 77
1166
+ },
1167
+ {
1168
+ "epoch": 0.13242784380305603,
1169
+ "grad_norm": 37.87944412231445,
1170
+ "learning_rate": 6.992386369238492e-06,
1171
+ "logits/chosen": -3.895080327987671,
1172
+ "logits/rejected": -3.6478140354156494,
1173
+ "logps/chosen": -429.8042907714844,
1174
+ "logps/rejected": -1550.5736083984375,
1175
+ "loss": 0.3366,
1176
+ "rewards/accuracies": 0.8421052694320679,
1177
+ "rewards/chosen": -1.025573492050171,
1178
+ "rewards/margins": 10.461471557617188,
1179
+ "rewards/rejected": -11.487046241760254,
1180
+ "step": 78
1181
+ },
1182
+ {
1183
+ "epoch": 0.13412563667232597,
1184
+ "grad_norm": 10.795161247253418,
1185
+ "learning_rate": 6.992019685274128e-06,
1186
+ "logits/chosen": -3.830293655395508,
1187
+ "logits/rejected": -3.716765880584717,
1188
+ "logps/chosen": -636.1162719726562,
1189
+ "logps/rejected": -1580.7022705078125,
1190
+ "loss": 0.1227,
1191
+ "rewards/accuracies": 1.0,
1192
+ "rewards/chosen": -0.4873403310775757,
1193
+ "rewards/margins": 9.842334747314453,
1194
+ "rewards/rejected": -10.32967472076416,
1195
+ "step": 79
1196
+ },
1197
+ {
1198
+ "epoch": 0.13582342954159593,
1199
+ "grad_norm": 19.715940475463867,
1200
+ "learning_rate": 6.991644391157327e-06,
1201
+ "logits/chosen": -3.8085625171661377,
1202
+ "logits/rejected": -3.702777147293091,
1203
+ "logps/chosen": -763.5365600585938,
1204
+ "logps/rejected": -1607.0970458984375,
1205
+ "loss": 0.1805,
1206
+ "rewards/accuracies": 0.8947368264198303,
1207
+ "rewards/chosen": -2.4620907306671143,
1208
+ "rewards/margins": 7.387575626373291,
1209
+ "rewards/rejected": -9.849666595458984,
1210
+ "step": 80
1211
+ },
1212
+ {
1213
+ "epoch": 0.13752122241086587,
1214
+ "grad_norm": 147.5608673095703,
1215
+ "learning_rate": 6.991260488122832e-06,
1216
+ "logits/chosen": -3.74634051322937,
1217
+ "logits/rejected": -3.639721155166626,
1218
+ "logps/chosen": -759.9743041992188,
1219
+ "logps/rejected": -1637.945556640625,
1220
+ "loss": 0.2248,
1221
+ "rewards/accuracies": 0.8947368264198303,
1222
+ "rewards/chosen": -2.1698291301727295,
1223
+ "rewards/margins": 7.532597541809082,
1224
+ "rewards/rejected": -9.70242691040039,
1225
+ "step": 81
1226
+ },
1227
+ {
1228
+ "epoch": 0.13921901528013583,
1229
+ "grad_norm": 7.893219947814941,
1230
+ "learning_rate": 6.990867977433703e-06,
1231
+ "logits/chosen": -3.686493158340454,
1232
+ "logits/rejected": -3.47658109664917,
1233
+ "logps/chosen": -626.2376708984375,
1234
+ "logps/rejected": -1273.48046875,
1235
+ "loss": 0.078,
1236
+ "rewards/accuracies": 1.0,
1237
+ "rewards/chosen": -1.2047574520111084,
1238
+ "rewards/margins": 7.101351261138916,
1239
+ "rewards/rejected": -8.306108474731445,
1240
+ "step": 82
1241
+ },
1242
+ {
1243
+ "epoch": 0.14091680814940577,
1244
+ "grad_norm": 275.6655578613281,
1245
+ "learning_rate": 6.9904668603813265e-06,
1246
+ "logits/chosen": -3.8455450534820557,
1247
+ "logits/rejected": -3.6755669116973877,
1248
+ "logps/chosen": -638.1837768554688,
1249
+ "logps/rejected": -1698.2481689453125,
1250
+ "loss": 0.6272,
1251
+ "rewards/accuracies": 0.8421052694320679,
1252
+ "rewards/chosen": -2.9386696815490723,
1253
+ "rewards/margins": 6.407962322235107,
1254
+ "rewards/rejected": -9.34663200378418,
1255
+ "step": 83
1256
+ },
1257
+ {
1258
+ "epoch": 0.14261460101867574,
1259
+ "grad_norm": 9.246347427368164,
1260
+ "learning_rate": 6.990057138285402e-06,
1261
+ "logits/chosen": -3.7783308029174805,
1262
+ "logits/rejected": -3.5027096271514893,
1263
+ "logps/chosen": -459.2795715332031,
1264
+ "logps/rejected": -1837.5609130859375,
1265
+ "loss": 0.1398,
1266
+ "rewards/accuracies": 0.8947368264198303,
1267
+ "rewards/chosen": -0.7564946413040161,
1268
+ "rewards/margins": 8.159191131591797,
1269
+ "rewards/rejected": -8.91568660736084,
1270
+ "step": 84
1271
+ },
1272
+ {
1273
+ "epoch": 0.14431239388794567,
1274
+ "grad_norm": 26.28587532043457,
1275
+ "learning_rate": 6.9896388124939385e-06,
1276
+ "logits/chosen": -3.699047088623047,
1277
+ "logits/rejected": -3.5644023418426514,
1278
+ "logps/chosen": -845.7753295898438,
1279
+ "logps/rejected": -1895.5594482421875,
1280
+ "loss": 0.1398,
1281
+ "rewards/accuracies": 0.9473684430122375,
1282
+ "rewards/chosen": -3.2373931407928467,
1283
+ "rewards/margins": 8.989819526672363,
1284
+ "rewards/rejected": -12.227212905883789,
1285
+ "step": 85
1286
+ },
1287
+ {
1288
+ "epoch": 0.1460101867572156,
1289
+ "grad_norm": 49.27679443359375,
1290
+ "learning_rate": 6.989211884383254e-06,
1291
+ "logits/chosen": -3.911393165588379,
1292
+ "logits/rejected": -3.6924586296081543,
1293
+ "logps/chosen": -981.2985229492188,
1294
+ "logps/rejected": -1688.3194580078125,
1295
+ "loss": 0.368,
1296
+ "rewards/accuracies": 0.7894737124443054,
1297
+ "rewards/chosen": -1.8452825546264648,
1298
+ "rewards/margins": 7.300060749053955,
1299
+ "rewards/rejected": -9.145342826843262,
1300
+ "step": 86
1301
+ },
1302
+ {
1303
+ "epoch": 0.14770797962648557,
1304
+ "grad_norm": 16.920671463012695,
1305
+ "learning_rate": 6.988776355357967e-06,
1306
+ "logits/chosen": -3.7513556480407715,
1307
+ "logits/rejected": -3.6575586795806885,
1308
+ "logps/chosen": -398.22503662109375,
1309
+ "logps/rejected": -1223.1280517578125,
1310
+ "loss": 0.1006,
1311
+ "rewards/accuracies": 0.9473684430122375,
1312
+ "rewards/chosen": -1.5688518285751343,
1313
+ "rewards/margins": 7.068317890167236,
1314
+ "rewards/rejected": -8.637168884277344,
1315
+ "step": 87
1316
+ },
1317
+ {
1318
+ "epoch": 0.1494057724957555,
1319
+ "grad_norm": 81.00189208984375,
1320
+ "learning_rate": 6.988332226850995e-06,
1321
+ "logits/chosen": -3.869905471801758,
1322
+ "logits/rejected": -3.6356797218322754,
1323
+ "logps/chosen": -724.948974609375,
1324
+ "logps/rejected": -1465.9176025390625,
1325
+ "loss": 0.2425,
1326
+ "rewards/accuracies": 0.9473684430122375,
1327
+ "rewards/chosen": -3.615725517272949,
1328
+ "rewards/margins": 7.304844856262207,
1329
+ "rewards/rejected": -10.920570373535156,
1330
+ "step": 88
1331
+ },
1332
+ {
1333
+ "epoch": 0.15110356536502548,
1334
+ "grad_norm": 50.97134780883789,
1335
+ "learning_rate": 6.987879500323547e-06,
1336
+ "logits/chosen": -3.8716299533843994,
1337
+ "logits/rejected": -3.752835512161255,
1338
+ "logps/chosen": -795.7817993164062,
1339
+ "logps/rejected": -1463.76953125,
1340
+ "loss": 0.2313,
1341
+ "rewards/accuracies": 0.8421052694320679,
1342
+ "rewards/chosen": -1.9299911260604858,
1343
+ "rewards/margins": 5.114964008331299,
1344
+ "rewards/rejected": -7.044955730438232,
1345
+ "step": 89
1346
+ },
1347
+ {
1348
+ "epoch": 0.15280135823429541,
1349
+ "grad_norm": 17.053251266479492,
1350
+ "learning_rate": 6.987418177265119e-06,
1351
+ "logits/chosen": -3.694180965423584,
1352
+ "logits/rejected": -3.3970630168914795,
1353
+ "logps/chosen": -637.548095703125,
1354
+ "logps/rejected": -1742.90771484375,
1355
+ "loss": 0.111,
1356
+ "rewards/accuracies": 0.9473684430122375,
1357
+ "rewards/chosen": -1.3107919692993164,
1358
+ "rewards/margins": 11.130751609802246,
1359
+ "rewards/rejected": -12.441544532775879,
1360
+ "step": 90
1361
+ },
1362
+ {
1363
+ "epoch": 0.15449915110356535,
1364
+ "grad_norm": 28.220325469970703,
1365
+ "learning_rate": 6.986948259193496e-06,
1366
+ "logits/chosen": -3.5280370712280273,
1367
+ "logits/rejected": -3.5956943035125732,
1368
+ "logps/chosen": -671.525634765625,
1369
+ "logps/rejected": -1569.584228515625,
1370
+ "loss": 0.11,
1371
+ "rewards/accuracies": 0.9473684430122375,
1372
+ "rewards/chosen": -2.0381264686584473,
1373
+ "rewards/margins": 6.511880874633789,
1374
+ "rewards/rejected": -8.550007820129395,
1375
+ "step": 91
1376
+ },
1377
+ {
1378
+ "epoch": 0.15619694397283532,
1379
+ "grad_norm": 158.85935974121094,
1380
+ "learning_rate": 6.986469747654732e-06,
1381
+ "logits/chosen": -3.6342899799346924,
1382
+ "logits/rejected": -3.681292772293091,
1383
+ "logps/chosen": -1075.5013427734375,
1384
+ "logps/rejected": -988.7138061523438,
1385
+ "loss": 1.2643,
1386
+ "rewards/accuracies": 0.8421052694320679,
1387
+ "rewards/chosen": -2.830941915512085,
1388
+ "rewards/margins": 4.036745071411133,
1389
+ "rewards/rejected": -6.867687225341797,
1390
+ "step": 92
1391
+ },
1392
+ {
1393
+ "epoch": 0.15789473684210525,
1394
+ "grad_norm": 3.5202670097351074,
1395
+ "learning_rate": 6.9859826442231625e-06,
1396
+ "logits/chosen": -3.8045427799224854,
1397
+ "logits/rejected": -3.614744186401367,
1398
+ "logps/chosen": -1360.7662353515625,
1399
+ "logps/rejected": -2518.14013671875,
1400
+ "loss": 0.051,
1401
+ "rewards/accuracies": 1.0,
1402
+ "rewards/chosen": -0.8611124753952026,
1403
+ "rewards/margins": 13.58449649810791,
1404
+ "rewards/rejected": -14.445610046386719,
1405
+ "step": 93
1406
+ },
1407
+ {
1408
+ "epoch": 0.15959252971137522,
1409
+ "grad_norm": 66.50271606445312,
1410
+ "learning_rate": 6.985486950501385e-06,
1411
+ "logits/chosen": -3.8674557209014893,
1412
+ "logits/rejected": -3.7710487842559814,
1413
+ "logps/chosen": -451.79132080078125,
1414
+ "logps/rejected": -1597.1959228515625,
1415
+ "loss": 0.0991,
1416
+ "rewards/accuracies": 0.9473684430122375,
1417
+ "rewards/chosen": -1.6133522987365723,
1418
+ "rewards/margins": 7.80655574798584,
1419
+ "rewards/rejected": -9.419907569885254,
1420
+ "step": 94
1421
+ },
1422
+ {
1423
+ "epoch": 0.16129032258064516,
1424
+ "grad_norm": 6.91108512878418,
1425
+ "learning_rate": 6.984982668120262e-06,
1426
+ "logits/chosen": -3.7838284969329834,
1427
+ "logits/rejected": -3.4987387657165527,
1428
+ "logps/chosen": -527.23974609375,
1429
+ "logps/rejected": -1747.5931396484375,
1430
+ "loss": 0.0727,
1431
+ "rewards/accuracies": 1.0,
1432
+ "rewards/chosen": -2.144969940185547,
1433
+ "rewards/margins": 12.582115173339844,
1434
+ "rewards/rejected": -14.727084159851074,
1435
+ "step": 95
1436
+ },
1437
+ {
1438
+ "epoch": 0.16298811544991512,
1439
+ "grad_norm": 10.717843055725098,
1440
+ "learning_rate": 6.984469798738912e-06,
1441
+ "logits/chosen": -3.8322417736053467,
1442
+ "logits/rejected": -3.60394549369812,
1443
+ "logps/chosen": -1170.5518798828125,
1444
+ "logps/rejected": -2239.024169921875,
1445
+ "loss": 0.1157,
1446
+ "rewards/accuracies": 1.0,
1447
+ "rewards/chosen": -2.399217128753662,
1448
+ "rewards/margins": 10.41158390045166,
1449
+ "rewards/rejected": -12.81080150604248,
1450
+ "step": 96
1451
+ },
1452
+ {
1453
+ "epoch": 0.16468590831918506,
1454
+ "grad_norm": 107.81643676757812,
1455
+ "learning_rate": 6.983948344044709e-06,
1456
+ "logits/chosen": -3.8501274585723877,
1457
+ "logits/rejected": -3.6387856006622314,
1458
+ "logps/chosen": -872.6104125976562,
1459
+ "logps/rejected": -1869.1826171875,
1460
+ "loss": 0.2127,
1461
+ "rewards/accuracies": 0.8947368264198303,
1462
+ "rewards/chosen": -2.3860466480255127,
1463
+ "rewards/margins": 8.92795181274414,
1464
+ "rewards/rejected": -11.313998222351074,
1465
+ "step": 97
1466
+ },
1467
+ {
1468
+ "epoch": 0.166383701188455,
1469
+ "grad_norm": 73.27976989746094,
1470
+ "learning_rate": 6.983418305753268e-06,
1471
+ "logits/chosen": -3.683082342147827,
1472
+ "logits/rejected": -3.383187770843506,
1473
+ "logps/chosen": -760.8966674804688,
1474
+ "logps/rejected": -1680.0477294921875,
1475
+ "loss": 0.149,
1476
+ "rewards/accuracies": 0.9473684430122375,
1477
+ "rewards/chosen": -2.4082255363464355,
1478
+ "rewards/margins": 11.904454231262207,
1479
+ "rewards/rejected": -14.3126802444458,
1480
+ "step": 98
1481
+ },
1482
+ {
1483
+ "epoch": 0.16808149405772496,
1484
+ "grad_norm": 44.875701904296875,
1485
+ "learning_rate": 6.982879685608448e-06,
1486
+ "logits/chosen": -3.912052631378174,
1487
+ "logits/rejected": -3.6544899940490723,
1488
+ "logps/chosen": -673.0807495117188,
1489
+ "logps/rejected": -1691.139892578125,
1490
+ "loss": 0.2513,
1491
+ "rewards/accuracies": 0.8947368264198303,
1492
+ "rewards/chosen": -2.335156202316284,
1493
+ "rewards/margins": 11.730042457580566,
1494
+ "rewards/rejected": -14.06519889831543,
1495
+ "step": 99
1496
+ },
1497
+ {
1498
+ "epoch": 0.1697792869269949,
1499
+ "grad_norm": 71.96469116210938,
1500
+ "learning_rate": 6.9823324853823406e-06,
1501
+ "logits/chosen": -3.76344633102417,
1502
+ "logits/rejected": -3.4823975563049316,
1503
+ "logps/chosen": -821.2760009765625,
1504
+ "logps/rejected": -1709.872802734375,
1505
+ "loss": 0.2505,
1506
+ "rewards/accuracies": 0.9473684430122375,
1507
+ "rewards/chosen": -1.0189168453216553,
1508
+ "rewards/margins": 11.905284881591797,
1509
+ "rewards/rejected": -12.924201965332031,
1510
+ "step": 100
1511
+ },
1512
+ {
1513
+ "epoch": 0.17147707979626486,
1514
+ "grad_norm": 59.67416763305664,
1515
+ "learning_rate": 6.981776706875268e-06,
1516
+ "logits/chosen": -3.8769843578338623,
1517
+ "logits/rejected": -3.453199863433838,
1518
+ "logps/chosen": -772.9574584960938,
1519
+ "logps/rejected": -1973.6256103515625,
1520
+ "loss": 0.2506,
1521
+ "rewards/accuracies": 0.9473684430122375,
1522
+ "rewards/chosen": -2.354810953140259,
1523
+ "rewards/margins": 9.986964225769043,
1524
+ "rewards/rejected": -12.341774940490723,
1525
+ "step": 101
1526
+ },
1527
+ {
1528
+ "epoch": 0.1731748726655348,
1529
+ "grad_norm": 37.598140716552734,
1530
+ "learning_rate": 6.981212351915777e-06,
1531
+ "logits/chosen": -3.723578453063965,
1532
+ "logits/rejected": -3.579558849334717,
1533
+ "logps/chosen": -740.1079711914062,
1534
+ "logps/rejected": -1366.8663330078125,
1535
+ "loss": 0.1841,
1536
+ "rewards/accuracies": 0.9473684430122375,
1537
+ "rewards/chosen": -0.11994344741106033,
1538
+ "rewards/margins": 8.2774658203125,
1539
+ "rewards/rejected": -8.397409439086914,
1540
+ "step": 102
1541
+ },
1542
+ {
1543
+ "epoch": 0.17487266553480477,
1544
+ "grad_norm": 35.35015869140625,
1545
+ "learning_rate": 6.980639422360626e-06,
1546
+ "logits/chosen": -3.8196682929992676,
1547
+ "logits/rejected": -3.6046993732452393,
1548
+ "logps/chosen": -948.5782470703125,
1549
+ "logps/rejected": -2096.224853515625,
1550
+ "loss": 0.1762,
1551
+ "rewards/accuracies": 0.9473684430122375,
1552
+ "rewards/chosen": -1.7156829833984375,
1553
+ "rewards/margins": 16.56784439086914,
1554
+ "rewards/rejected": -18.283527374267578,
1555
+ "step": 103
1556
+ },
1557
+ {
1558
+ "epoch": 0.1765704584040747,
1559
+ "grad_norm": 186.90672302246094,
1560
+ "learning_rate": 6.98005792009479e-06,
1561
+ "logits/chosen": -3.76750111579895,
1562
+ "logits/rejected": -3.532073497772217,
1563
+ "logps/chosen": -979.2677001953125,
1564
+ "logps/rejected": -2216.670166015625,
1565
+ "loss": 0.8309,
1566
+ "rewards/accuracies": 0.8947368264198303,
1567
+ "rewards/chosen": -1.9807201623916626,
1568
+ "rewards/margins": 15.777000427246094,
1569
+ "rewards/rejected": -17.757719039916992,
1570
+ "step": 104
1571
+ },
1572
+ {
1573
+ "epoch": 0.17826825127334464,
1574
+ "grad_norm": 6.775128364562988,
1575
+ "learning_rate": 6.979467847031445e-06,
1576
+ "logits/chosen": -3.8047983646392822,
1577
+ "logits/rejected": -3.674755096435547,
1578
+ "logps/chosen": -651.359619140625,
1579
+ "logps/rejected": -1356.9620361328125,
1580
+ "loss": 0.0426,
1581
+ "rewards/accuracies": 1.0,
1582
+ "rewards/chosen": -2.110494613647461,
1583
+ "rewards/margins": 7.81674861907959,
1584
+ "rewards/rejected": -9.927244186401367,
1585
+ "step": 105
1586
+ },
1587
+ {
1588
+ "epoch": 0.1799660441426146,
1589
+ "grad_norm": 8.4512357711792,
1590
+ "learning_rate": 6.978869205111969e-06,
1591
+ "logits/chosen": -3.6785566806793213,
1592
+ "logits/rejected": -3.462512969970703,
1593
+ "logps/chosen": -730.62109375,
1594
+ "logps/rejected": -2025.4356689453125,
1595
+ "loss": 0.1019,
1596
+ "rewards/accuracies": 1.0,
1597
+ "rewards/chosen": -3.5104362964630127,
1598
+ "rewards/margins": 13.898301124572754,
1599
+ "rewards/rejected": -17.408737182617188,
1600
+ "step": 106
1601
+ },
1602
+ {
1603
+ "epoch": 0.18166383701188454,
1604
+ "grad_norm": 12.687128067016602,
1605
+ "learning_rate": 6.978261996305929e-06,
1606
+ "logits/chosen": -3.799273729324341,
1607
+ "logits/rejected": -3.5843749046325684,
1608
+ "logps/chosen": -661.6332397460938,
1609
+ "logps/rejected": -1790.1246337890625,
1610
+ "loss": 0.0524,
1611
+ "rewards/accuracies": 1.0,
1612
+ "rewards/chosen": -2.5980563163757324,
1613
+ "rewards/margins": 13.51810359954834,
1614
+ "rewards/rejected": -16.116159439086914,
1615
+ "step": 107
1616
+ },
1617
+ {
1618
+ "epoch": 0.1833616298811545,
1619
+ "grad_norm": 106.98979187011719,
1620
+ "learning_rate": 6.977646222611078e-06,
1621
+ "logits/chosen": -3.8738813400268555,
1622
+ "logits/rejected": -3.7034285068511963,
1623
+ "logps/chosen": -989.0670166015625,
1624
+ "logps/rejected": -1602.0150146484375,
1625
+ "loss": 0.4934,
1626
+ "rewards/accuracies": 0.8421052694320679,
1627
+ "rewards/chosen": -4.357776641845703,
1628
+ "rewards/margins": 12.145195960998535,
1629
+ "rewards/rejected": -16.502975463867188,
1630
+ "step": 108
1631
+ },
1632
+ {
1633
+ "epoch": 0.18505942275042445,
1634
+ "grad_norm": 16.131244659423828,
1635
+ "learning_rate": 6.977021886053347e-06,
1636
+ "logits/chosen": -3.9964237213134766,
1637
+ "logits/rejected": -3.872692108154297,
1638
+ "logps/chosen": -809.6708984375,
1639
+ "logps/rejected": -1341.9288330078125,
1640
+ "loss": 0.1253,
1641
+ "rewards/accuracies": 0.9473684430122375,
1642
+ "rewards/chosen": -3.4534506797790527,
1643
+ "rewards/margins": 8.198371887207031,
1644
+ "rewards/rejected": -11.651823043823242,
1645
+ "step": 109
1646
+ },
1647
+ {
1648
+ "epoch": 0.1867572156196944,
1649
+ "grad_norm": 12.353798866271973,
1650
+ "learning_rate": 6.976388988686845e-06,
1651
+ "logits/chosen": -3.726100206375122,
1652
+ "logits/rejected": -3.5875403881073,
1653
+ "logps/chosen": -528.83642578125,
1654
+ "logps/rejected": -1781.2496337890625,
1655
+ "loss": 0.0947,
1656
+ "rewards/accuracies": 0.9473684430122375,
1657
+ "rewards/chosen": -2.2456202507019043,
1658
+ "rewards/margins": 10.44008731842041,
1659
+ "rewards/rejected": -12.685708045959473,
1660
+ "step": 110
1661
+ },
1662
+ {
1663
+ "epoch": 0.18845500848896435,
1664
+ "grad_norm": 2.563150644302368,
1665
+ "learning_rate": 6.975747532593838e-06,
1666
+ "logits/chosen": -3.5097496509552,
1667
+ "logits/rejected": -3.4688761234283447,
1668
+ "logps/chosen": -395.9211120605469,
1669
+ "logps/rejected": -1319.6453857421875,
1670
+ "loss": 0.0244,
1671
+ "rewards/accuracies": 1.0,
1672
+ "rewards/chosen": -2.6569132804870605,
1673
+ "rewards/margins": 12.773691177368164,
1674
+ "rewards/rejected": -15.430604934692383,
1675
+ "step": 111
1676
+ },
1677
+ {
1678
+ "epoch": 0.19015280135823429,
1679
+ "grad_norm": 3.8946115970611572,
1680
+ "learning_rate": 6.975097519884759e-06,
1681
+ "logits/chosen": -3.901890277862549,
1682
+ "logits/rejected": -3.7657508850097656,
1683
+ "logps/chosen": -673.4298706054688,
1684
+ "logps/rejected": -1513.614501953125,
1685
+ "loss": 0.0335,
1686
+ "rewards/accuracies": 1.0,
1687
+ "rewards/chosen": -4.2903852462768555,
1688
+ "rewards/margins": 12.002580642700195,
1689
+ "rewards/rejected": -16.292964935302734,
1690
+ "step": 112
1691
+ },
1692
+ {
1693
+ "epoch": 0.19185059422750425,
1694
+ "grad_norm": 16.817495346069336,
1695
+ "learning_rate": 6.974438952698188e-06,
1696
+ "logits/chosen": -3.7428741455078125,
1697
+ "logits/rejected": -3.5564656257629395,
1698
+ "logps/chosen": -801.8799438476562,
1699
+ "logps/rejected": -1992.5880126953125,
1700
+ "loss": 0.103,
1701
+ "rewards/accuracies": 0.9473684430122375,
1702
+ "rewards/chosen": -4.0022053718566895,
1703
+ "rewards/margins": 24.54104232788086,
1704
+ "rewards/rejected": -28.543249130249023,
1705
+ "step": 113
1706
+ },
1707
+ {
1708
+ "epoch": 0.1935483870967742,
1709
+ "grad_norm": 163.4203338623047,
1710
+ "learning_rate": 6.973771833200849e-06,
1711
+ "logits/chosen": -3.662956714630127,
1712
+ "logits/rejected": -3.532480478286743,
1713
+ "logps/chosen": -744.2583618164062,
1714
+ "logps/rejected": -1503.3968505859375,
1715
+ "loss": 0.9508,
1716
+ "rewards/accuracies": 0.7894737124443054,
1717
+ "rewards/chosen": -4.864002227783203,
1718
+ "rewards/margins": 12.667509078979492,
1719
+ "rewards/rejected": -17.531509399414062,
1720
+ "step": 114
1721
+ },
1722
+ {
1723
+ "epoch": 0.19524617996604415,
1724
+ "grad_norm": 38.810176849365234,
1725
+ "learning_rate": 6.973096163587607e-06,
1726
+ "logits/chosen": -4.001194000244141,
1727
+ "logits/rejected": -3.762303590774536,
1728
+ "logps/chosen": -988.1875,
1729
+ "logps/rejected": -2089.39794921875,
1730
+ "loss": 0.142,
1731
+ "rewards/accuracies": 0.9473684430122375,
1732
+ "rewards/chosen": -6.069306373596191,
1733
+ "rewards/margins": 13.245327949523926,
1734
+ "rewards/rejected": -19.314632415771484,
1735
+ "step": 115
1736
+ },
1737
+ {
1738
+ "epoch": 0.1969439728353141,
1739
+ "grad_norm": 158.87086486816406,
1740
+ "learning_rate": 6.972411946081454e-06,
1741
+ "logits/chosen": -3.7854738235473633,
1742
+ "logits/rejected": -3.7265615463256836,
1743
+ "logps/chosen": -971.9598388671875,
1744
+ "logps/rejected": -1453.19921875,
1745
+ "loss": 0.8761,
1746
+ "rewards/accuracies": 0.8421052694320679,
1747
+ "rewards/chosen": -6.6403303146362305,
1748
+ "rewards/margins": 8.726883888244629,
1749
+ "rewards/rejected": -15.367213249206543,
1750
+ "step": 116
1751
+ },
1752
+ {
1753
+ "epoch": 0.19864176570458403,
1754
+ "grad_norm": 20.066919326782227,
1755
+ "learning_rate": 6.97171918293351e-06,
1756
+ "logits/chosen": -3.973656415939331,
1757
+ "logits/rejected": -3.67142915725708,
1758
+ "logps/chosen": -573.3673706054688,
1759
+ "logps/rejected": -1267.1904296875,
1760
+ "loss": 0.288,
1761
+ "rewards/accuracies": 0.8947368264198303,
1762
+ "rewards/chosen": -3.8687334060668945,
1763
+ "rewards/margins": 10.996365547180176,
1764
+ "rewards/rejected": -14.865097999572754,
1765
+ "step": 117
1766
+ },
1767
+ {
1768
+ "epoch": 0.200339558573854,
1769
+ "grad_norm": 65.05223083496094,
1770
+ "learning_rate": 6.971017876423005e-06,
1771
+ "logits/chosen": -3.750948905944824,
1772
+ "logits/rejected": -3.4453625679016113,
1773
+ "logps/chosen": -574.1520385742188,
1774
+ "logps/rejected": -1289.5355224609375,
1775
+ "loss": 0.6536,
1776
+ "rewards/accuracies": 0.7894737124443054,
1777
+ "rewards/chosen": -3.2062273025512695,
1778
+ "rewards/margins": 11.94129753112793,
1779
+ "rewards/rejected": -15.1475248336792,
1780
+ "step": 118
1781
+ },
1782
+ {
1783
+ "epoch": 0.20203735144312393,
1784
+ "grad_norm": 4.754962921142578,
1785
+ "learning_rate": 6.970308028857279e-06,
1786
+ "logits/chosen": -3.821983814239502,
1787
+ "logits/rejected": -3.5136260986328125,
1788
+ "logps/chosen": -224.42532348632812,
1789
+ "logps/rejected": -1365.0841064453125,
1790
+ "loss": 0.0363,
1791
+ "rewards/accuracies": 1.0,
1792
+ "rewards/chosen": -1.837965965270996,
1793
+ "rewards/margins": 15.45004940032959,
1794
+ "rewards/rejected": -17.288015365600586,
1795
+ "step": 119
1796
+ },
1797
+ {
1798
+ "epoch": 0.2037351443123939,
1799
+ "grad_norm": 131.49501037597656,
1800
+ "learning_rate": 6.9695896425717765e-06,
1801
+ "logits/chosen": -3.7603652477264404,
1802
+ "logits/rejected": -3.7311620712280273,
1803
+ "logps/chosen": -855.5682373046875,
1804
+ "logps/rejected": -1257.74462890625,
1805
+ "loss": 1.2102,
1806
+ "rewards/accuracies": 0.7894737124443054,
1807
+ "rewards/chosen": -5.832756996154785,
1808
+ "rewards/margins": 5.7323317527771,
1809
+ "rewards/rejected": -11.565089225769043,
1810
+ "step": 120
1811
+ },
1812
+ {
1813
+ "epoch": 0.20543293718166383,
1814
+ "grad_norm": 70.33955383300781,
1815
+ "learning_rate": 6.968862719930029e-06,
1816
+ "logits/chosen": -3.762054204940796,
1817
+ "logits/rejected": -3.4738166332244873,
1818
+ "logps/chosen": -1078.19775390625,
1819
+ "logps/rejected": -2073.80810546875,
1820
+ "loss": 0.4222,
1821
+ "rewards/accuracies": 0.9473684430122375,
1822
+ "rewards/chosen": -5.891961574554443,
1823
+ "rewards/margins": 15.96943473815918,
1824
+ "rewards/rejected": -21.86139488220215,
1825
+ "step": 121
1826
+ },
1827
+ {
1828
+ "epoch": 0.2071307300509338,
1829
+ "grad_norm": 5.440072059631348,
1830
+ "learning_rate": 6.968127263323654e-06,
1831
+ "logits/chosen": -3.7950057983398438,
1832
+ "logits/rejected": -3.603194236755371,
1833
+ "logps/chosen": -640.3604736328125,
1834
+ "logps/rejected": -1276.7269287109375,
1835
+ "loss": 0.1369,
1836
+ "rewards/accuracies": 0.9473684430122375,
1837
+ "rewards/chosen": -2.9976754188537598,
1838
+ "rewards/margins": 11.999473571777344,
1839
+ "rewards/rejected": -14.997147560119629,
1840
+ "step": 122
1841
+ },
1842
+ {
1843
+ "epoch": 0.20882852292020374,
1844
+ "grad_norm": 147.45884704589844,
1845
+ "learning_rate": 6.9673832751723526e-06,
1846
+ "logits/chosen": -3.827544927597046,
1847
+ "logits/rejected": -3.5036275386810303,
1848
+ "logps/chosen": -1263.84619140625,
1849
+ "logps/rejected": -2409.511962890625,
1850
+ "loss": 0.3158,
1851
+ "rewards/accuracies": 0.8947368264198303,
1852
+ "rewards/chosen": -4.569932460784912,
1853
+ "rewards/margins": 22.8966007232666,
1854
+ "rewards/rejected": -27.466533660888672,
1855
+ "step": 123
1856
+ },
1857
+ {
1858
+ "epoch": 0.21052631578947367,
1859
+ "grad_norm": 18.83106803894043,
1860
+ "learning_rate": 6.9666307579238885e-06,
1861
+ "logits/chosen": -3.645846366882324,
1862
+ "logits/rejected": -3.535503387451172,
1863
+ "logps/chosen": -837.787841796875,
1864
+ "logps/rejected": -2416.427734375,
1865
+ "loss": 0.1439,
1866
+ "rewards/accuracies": 0.8947368264198303,
1867
+ "rewards/chosen": -3.7407400608062744,
1868
+ "rewards/margins": 20.752798080444336,
1869
+ "rewards/rejected": -24.4935359954834,
1870
+ "step": 124
1871
+ },
1872
+ {
1873
+ "epoch": 0.21222410865874364,
1874
+ "grad_norm": 35.632877349853516,
1875
+ "learning_rate": 6.965869714054089e-06,
1876
+ "logits/chosen": -3.700308322906494,
1877
+ "logits/rejected": -3.5264322757720947,
1878
+ "logps/chosen": -1051.30419921875,
1879
+ "logps/rejected": -2074.9658203125,
1880
+ "loss": 0.4841,
1881
+ "rewards/accuracies": 0.9473684430122375,
1882
+ "rewards/chosen": -3.4254095554351807,
1883
+ "rewards/margins": 16.705263137817383,
1884
+ "rewards/rejected": -20.130672454833984,
1885
+ "step": 125
1886
+ },
1887
+ {
1888
+ "epoch": 0.21392190152801357,
1889
+ "grad_norm": 21.05853271484375,
1890
+ "learning_rate": 6.9651001460668325e-06,
1891
+ "logits/chosen": -3.7296669483184814,
1892
+ "logits/rejected": -3.6159603595733643,
1893
+ "logps/chosen": -1007.9923095703125,
1894
+ "logps/rejected": -1943.0440673828125,
1895
+ "loss": 0.079,
1896
+ "rewards/accuracies": 0.9473684430122375,
1897
+ "rewards/chosen": -2.7694876194000244,
1898
+ "rewards/margins": 17.527170181274414,
1899
+ "rewards/rejected": -20.29665756225586,
1900
+ "step": 126
1901
+ },
1902
+ {
1903
+ "epoch": 0.21561969439728354,
1904
+ "grad_norm": 76.85245513916016,
1905
+ "learning_rate": 6.964322056494046e-06,
1906
+ "logits/chosen": -3.7412173748016357,
1907
+ "logits/rejected": -3.6870882511138916,
1908
+ "logps/chosen": -1203.6776123046875,
1909
+ "logps/rejected": -1530.6995849609375,
1910
+ "loss": 0.5236,
1911
+ "rewards/accuracies": 0.8947368264198303,
1912
+ "rewards/chosen": -4.34645414352417,
1913
+ "rewards/margins": 7.942860126495361,
1914
+ "rewards/rejected": -12.289313316345215,
1915
+ "step": 127
1916
+ },
1917
+ {
1918
+ "epoch": 0.21731748726655348,
1919
+ "grad_norm": 23.3140869140625,
1920
+ "learning_rate": 6.963535447895692e-06,
1921
+ "logits/chosen": -3.8947396278381348,
1922
+ "logits/rejected": -3.4670283794403076,
1923
+ "logps/chosen": -579.88427734375,
1924
+ "logps/rejected": -1736.227783203125,
1925
+ "loss": 0.07,
1926
+ "rewards/accuracies": 0.9473684430122375,
1927
+ "rewards/chosen": -1.4946991205215454,
1928
+ "rewards/margins": 13.216540336608887,
1929
+ "rewards/rejected": -14.711237907409668,
1930
+ "step": 128
1931
+ },
1932
+ {
1933
+ "epoch": 0.21901528013582344,
1934
+ "grad_norm": 136.1709747314453,
1935
+ "learning_rate": 6.962740322859758e-06,
1936
+ "logits/chosen": -3.870145320892334,
1937
+ "logits/rejected": -3.882458209991455,
1938
+ "logps/chosen": -903.0145263671875,
1939
+ "logps/rejected": -1209.391845703125,
1940
+ "loss": 0.9088,
1941
+ "rewards/accuracies": 0.9473684430122375,
1942
+ "rewards/chosen": -2.7953643798828125,
1943
+ "rewards/margins": 5.496224403381348,
1944
+ "rewards/rejected": -8.29158878326416,
1945
+ "step": 129
1946
+ },
1947
+ {
1948
+ "epoch": 0.22071307300509338,
1949
+ "grad_norm": 11.993281364440918,
1950
+ "learning_rate": 6.961936684002254e-06,
1951
+ "logits/chosen": -3.721262216567993,
1952
+ "logits/rejected": -3.5086491107940674,
1953
+ "logps/chosen": -547.963623046875,
1954
+ "logps/rejected": -1809.1829833984375,
1955
+ "loss": 0.1129,
1956
+ "rewards/accuracies": 1.0,
1957
+ "rewards/chosen": -0.5284523963928223,
1958
+ "rewards/margins": 13.97046184539795,
1959
+ "rewards/rejected": -14.49891471862793,
1960
+ "step": 130
1961
+ },
1962
+ {
1963
+ "epoch": 0.22241086587436332,
1964
+ "grad_norm": 140.55343627929688,
1965
+ "learning_rate": 6.9611245339672e-06,
1966
+ "logits/chosen": -3.625781774520874,
1967
+ "logits/rejected": -3.551302909851074,
1968
+ "logps/chosen": -1080.9185791015625,
1969
+ "logps/rejected": -1491.4063720703125,
1970
+ "loss": 0.5151,
1971
+ "rewards/accuracies": 0.7894737124443054,
1972
+ "rewards/chosen": 0.7861904501914978,
1973
+ "rewards/margins": 16.398347854614258,
1974
+ "rewards/rejected": -15.612156867980957,
1975
+ "step": 131
1976
+ },
1977
+ {
1978
+ "epoch": 0.22410865874363328,
1979
+ "grad_norm": 11.50153636932373,
1980
+ "learning_rate": 6.960303875426619e-06,
1981
+ "logits/chosen": -3.79368257522583,
1982
+ "logits/rejected": -3.450730323791504,
1983
+ "logps/chosen": -650.6856689453125,
1984
+ "logps/rejected": -2077.446044921875,
1985
+ "loss": 0.0191,
1986
+ "rewards/accuracies": 1.0,
1987
+ "rewards/chosen": -0.2040356546640396,
1988
+ "rewards/margins": 16.944364547729492,
1989
+ "rewards/rejected": -17.148399353027344,
1990
+ "step": 132
1991
+ },
1992
+ {
1993
+ "epoch": 0.22580645161290322,
1994
+ "grad_norm": 19.209768295288086,
1995
+ "learning_rate": 6.9594747110805286e-06,
1996
+ "logits/chosen": -3.7598936557769775,
1997
+ "logits/rejected": -3.5663001537323,
1998
+ "logps/chosen": -866.5333862304688,
1999
+ "logps/rejected": -2260.24560546875,
2000
+ "loss": 0.1021,
2001
+ "rewards/accuracies": 0.9473684430122375,
2002
+ "rewards/chosen": 0.8966318368911743,
2003
+ "rewards/margins": 20.567066192626953,
2004
+ "rewards/rejected": -19.670434951782227,
2005
+ "step": 133
2006
+ },
2007
+ {
2008
+ "epoch": 0.22750424448217318,
2009
+ "grad_norm": 55.371131896972656,
2010
+ "learning_rate": 6.958637043656925e-06,
2011
+ "logits/chosen": -3.8568215370178223,
2012
+ "logits/rejected": -3.6581625938415527,
2013
+ "logps/chosen": -405.2693176269531,
2014
+ "logps/rejected": -1300.62255859375,
2015
+ "loss": 0.4807,
2016
+ "rewards/accuracies": 0.8421052694320679,
2017
+ "rewards/chosen": -1.189803957939148,
2018
+ "rewards/margins": 9.788188934326172,
2019
+ "rewards/rejected": -10.97799301147461,
2020
+ "step": 134
2021
+ },
2022
+ {
2023
+ "epoch": 0.22920203735144312,
2024
+ "grad_norm": 10.552238464355469,
2025
+ "learning_rate": 6.95779087591179e-06,
2026
+ "logits/chosen": -3.7003872394561768,
2027
+ "logits/rejected": -3.5009264945983887,
2028
+ "logps/chosen": -957.4447021484375,
2029
+ "logps/rejected": -1280.665283203125,
2030
+ "loss": 0.1362,
2031
+ "rewards/accuracies": 0.8947368264198303,
2032
+ "rewards/chosen": 2.2291970252990723,
2033
+ "rewards/margins": 12.491341590881348,
2034
+ "rewards/rejected": -10.2621431350708,
2035
+ "step": 135
2036
+ },
2037
+ {
2038
+ "epoch": 0.23089983022071306,
2039
+ "grad_norm": 166.77572631835938,
2040
+ "learning_rate": 6.9569362106290635e-06,
2041
+ "logits/chosen": -3.6627299785614014,
2042
+ "logits/rejected": -3.443359375,
2043
+ "logps/chosen": -830.742919921875,
2044
+ "logps/rejected": -1653.124755859375,
2045
+ "loss": 0.8788,
2046
+ "rewards/accuracies": 0.8947368264198303,
2047
+ "rewards/chosen": 0.2320985347032547,
2048
+ "rewards/margins": 9.47817325592041,
2049
+ "rewards/rejected": -9.246074676513672,
2050
+ "step": 136
2051
+ },
2052
+ {
2053
+ "epoch": 0.23259762308998302,
2054
+ "grad_norm": 9.919652938842773,
2055
+ "learning_rate": 6.956073050620645e-06,
2056
+ "logits/chosen": -3.8356752395629883,
2057
+ "logits/rejected": -3.5876097679138184,
2058
+ "logps/chosen": -756.435302734375,
2059
+ "logps/rejected": -1525.454833984375,
2060
+ "loss": 0.0908,
2061
+ "rewards/accuracies": 0.9473684430122375,
2062
+ "rewards/chosen": 1.2842128276824951,
2063
+ "rewards/margins": 14.17322063446045,
2064
+ "rewards/rejected": -12.889008522033691,
2065
+ "step": 137
2066
+ },
2067
+ {
2068
+ "epoch": 0.23429541595925296,
2069
+ "grad_norm": 12.168522834777832,
2070
+ "learning_rate": 6.955201398726383e-06,
2071
+ "logits/chosen": -3.819178342819214,
2072
+ "logits/rejected": -3.7008984088897705,
2073
+ "logps/chosen": -615.0360717773438,
2074
+ "logps/rejected": -1958.1883544921875,
2075
+ "loss": 0.0804,
2076
+ "rewards/accuracies": 1.0,
2077
+ "rewards/chosen": 0.900735080242157,
2078
+ "rewards/margins": 14.141839027404785,
2079
+ "rewards/rejected": -13.241105079650879,
2080
+ "step": 138
2081
+ },
2082
+ {
2083
+ "epoch": 0.23599320882852293,
2084
+ "grad_norm": 14.561647415161133,
2085
+ "learning_rate": 6.954321257814067e-06,
2086
+ "logits/chosen": -3.8233957290649414,
2087
+ "logits/rejected": -3.609365224838257,
2088
+ "logps/chosen": -722.4047241210938,
2089
+ "logps/rejected": -1712.92578125,
2090
+ "loss": 0.0818,
2091
+ "rewards/accuracies": 0.9473684430122375,
2092
+ "rewards/chosen": -1.3475664854049683,
2093
+ "rewards/margins": 9.34595012664795,
2094
+ "rewards/rejected": -10.693516731262207,
2095
+ "step": 139
2096
+ },
2097
+ {
2098
+ "epoch": 0.23769100169779286,
2099
+ "grad_norm": 5.579987525939941,
2100
+ "learning_rate": 6.953432630779414e-06,
2101
+ "logits/chosen": -3.9780023097991943,
2102
+ "logits/rejected": -3.562074661254883,
2103
+ "logps/chosen": -511.3399353027344,
2104
+ "logps/rejected": -1746.2120361328125,
2105
+ "loss": 0.0969,
2106
+ "rewards/accuracies": 1.0,
2107
+ "rewards/chosen": -0.11427301913499832,
2108
+ "rewards/margins": 15.565413475036621,
2109
+ "rewards/rejected": -15.6796875,
2110
+ "step": 140
2111
+ },
2112
+ {
2113
+ "epoch": 0.23938879456706283,
2114
+ "grad_norm": 4.00973653793335,
2115
+ "learning_rate": 6.952535520546056e-06,
2116
+ "logits/chosen": -3.7256813049316406,
2117
+ "logits/rejected": -3.7113306522369385,
2118
+ "logps/chosen": -1653.21337890625,
2119
+ "logps/rejected": -1951.7298583984375,
2120
+ "loss": 0.0419,
2121
+ "rewards/accuracies": 1.0,
2122
+ "rewards/chosen": 1.7850377559661865,
2123
+ "rewards/margins": 12.975248336791992,
2124
+ "rewards/rejected": -11.190210342407227,
2125
+ "step": 141
2126
+ },
2127
+ {
2128
+ "epoch": 0.24108658743633277,
2129
+ "grad_norm": 3.7720530033111572,
2130
+ "learning_rate": 6.951629930065545e-06,
2131
+ "logits/chosen": -3.5269370079040527,
2132
+ "logits/rejected": -3.300715208053589,
2133
+ "logps/chosen": -980.2633666992188,
2134
+ "logps/rejected": -1817.9522705078125,
2135
+ "loss": 0.1722,
2136
+ "rewards/accuracies": 0.8947368264198303,
2137
+ "rewards/chosen": 1.4748613834381104,
2138
+ "rewards/margins": 16.97820472717285,
2139
+ "rewards/rejected": -15.503344535827637,
2140
+ "step": 142
2141
+ },
2142
+ {
2143
+ "epoch": 0.2427843803056027,
2144
+ "grad_norm": 69.65367126464844,
2145
+ "learning_rate": 6.9507158623173235e-06,
2146
+ "logits/chosen": -3.771528482437134,
2147
+ "logits/rejected": -3.7239933013916016,
2148
+ "logps/chosen": -451.2080078125,
2149
+ "logps/rejected": -1115.76220703125,
2150
+ "loss": 0.13,
2151
+ "rewards/accuracies": 0.9473684430122375,
2152
+ "rewards/chosen": -0.8256826996803284,
2153
+ "rewards/margins": 6.603112697601318,
2154
+ "rewards/rejected": -7.428795337677002,
2155
+ "step": 143
2156
+ },
2157
+ {
2158
+ "epoch": 0.24448217317487267,
2159
+ "grad_norm": 9.254491806030273,
2160
+ "learning_rate": 6.949793320308733e-06,
2161
+ "logits/chosen": -3.796405792236328,
2162
+ "logits/rejected": -3.6394333839416504,
2163
+ "logps/chosen": -495.36358642578125,
2164
+ "logps/rejected": -1412.7320556640625,
2165
+ "loss": 0.0838,
2166
+ "rewards/accuracies": 0.9473684430122375,
2167
+ "rewards/chosen": 0.09402646869421005,
2168
+ "rewards/margins": 11.091241836547852,
2169
+ "rewards/rejected": -10.997215270996094,
2170
+ "step": 144
2171
+ },
2172
+ {
2173
+ "epoch": 0.2461799660441426,
2174
+ "grad_norm": 118.1439208984375,
2175
+ "learning_rate": 6.9488623070749915e-06,
2176
+ "logits/chosen": -3.6636123657226562,
2177
+ "logits/rejected": -3.4513723850250244,
2178
+ "logps/chosen": -871.6858520507812,
2179
+ "logps/rejected": -1940.8848876953125,
2180
+ "loss": 0.2337,
2181
+ "rewards/accuracies": 0.8947368264198303,
2182
+ "rewards/chosen": -1.4755420684814453,
2183
+ "rewards/margins": 12.448883056640625,
2184
+ "rewards/rejected": -13.924426078796387,
2185
+ "step": 145
2186
+ },
2187
+ {
2188
+ "epoch": 0.24787775891341257,
2189
+ "grad_norm": 25.487436294555664,
2190
+ "learning_rate": 6.9479228256791875e-06,
2191
+ "logits/chosen": -3.828705072402954,
2192
+ "logits/rejected": -3.668996572494507,
2193
+ "logps/chosen": -972.7256469726562,
2194
+ "logps/rejected": -1655.1583251953125,
2195
+ "loss": 0.1623,
2196
+ "rewards/accuracies": 0.9473684430122375,
2197
+ "rewards/chosen": 0.741838276386261,
2198
+ "rewards/margins": 10.798667907714844,
2199
+ "rewards/rejected": -10.056829452514648,
2200
+ "step": 146
2201
+ },
2202
+ {
2203
+ "epoch": 0.2495755517826825,
2204
+ "grad_norm": 8.61157512664795,
2205
+ "learning_rate": 6.946974879212271e-06,
2206
+ "logits/chosen": -3.916123628616333,
2207
+ "logits/rejected": -3.7406952381134033,
2208
+ "logps/chosen": -967.9044189453125,
2209
+ "logps/rejected": -1524.1856689453125,
2210
+ "loss": 0.1081,
2211
+ "rewards/accuracies": 0.9473684430122375,
2212
+ "rewards/chosen": -0.8007361888885498,
2213
+ "rewards/margins": 9.817014694213867,
2214
+ "rewards/rejected": -10.617751121520996,
2215
+ "step": 147
2216
+ },
2217
+ {
2218
+ "epoch": 0.25127334465195245,
2219
+ "grad_norm": 19.947677612304688,
2220
+ "learning_rate": 6.946018470793046e-06,
2221
+ "logits/chosen": -3.9741430282592773,
2222
+ "logits/rejected": -3.751094341278076,
2223
+ "logps/chosen": -494.927734375,
2224
+ "logps/rejected": -1189.2178955078125,
2225
+ "loss": 0.1311,
2226
+ "rewards/accuracies": 0.9473684430122375,
2227
+ "rewards/chosen": -0.5863356590270996,
2228
+ "rewards/margins": 11.22431755065918,
2229
+ "rewards/rejected": -11.810651779174805,
2230
+ "step": 148
2231
+ },
2232
+ {
2233
+ "epoch": 0.2529711375212224,
2234
+ "grad_norm": 5.324405670166016,
2235
+ "learning_rate": 6.945053603568151e-06,
2236
+ "logits/chosen": -3.7551779747009277,
2237
+ "logits/rejected": -3.5263726711273193,
2238
+ "logps/chosen": -798.533447265625,
2239
+ "logps/rejected": -1509.49853515625,
2240
+ "loss": 0.0685,
2241
+ "rewards/accuracies": 1.0,
2242
+ "rewards/chosen": 0.5053689479827881,
2243
+ "rewards/margins": 16.188081741333008,
2244
+ "rewards/rejected": -15.682710647583008,
2245
+ "step": 149
2246
+ },
2247
+ {
2248
+ "epoch": 0.2546689303904924,
2249
+ "grad_norm": 13.71898365020752,
2250
+ "learning_rate": 6.944080280712058e-06,
2251
+ "logits/chosen": -3.716275930404663,
2252
+ "logits/rejected": -3.532764196395874,
2253
+ "logps/chosen": -939.0890502929688,
2254
+ "logps/rejected": -2572.087646484375,
2255
+ "loss": 0.0541,
2256
+ "rewards/accuracies": 1.0,
2257
+ "rewards/chosen": 1.4292657375335693,
2258
+ "rewards/margins": 24.120561599731445,
2259
+ "rewards/rejected": -22.691295623779297,
2260
+ "step": 150
2261
+ },
2262
+ {
2263
+ "epoch": 0.2563667232597623,
2264
+ "grad_norm": 5.842966079711914,
2265
+ "learning_rate": 6.943098505427058e-06,
2266
+ "logits/chosen": -3.6546359062194824,
2267
+ "logits/rejected": -3.6221351623535156,
2268
+ "logps/chosen": -605.56884765625,
2269
+ "logps/rejected": -943.8607177734375,
2270
+ "loss": 0.1049,
2271
+ "rewards/accuracies": 1.0,
2272
+ "rewards/chosen": -0.41017091274261475,
2273
+ "rewards/margins": 10.390439987182617,
2274
+ "rewards/rejected": -10.800610542297363,
2275
+ "step": 151
2276
+ },
2277
+ {
2278
+ "epoch": 0.25806451612903225,
2279
+ "grad_norm": 23.814029693603516,
2280
+ "learning_rate": 6.942108280943252e-06,
2281
+ "logits/chosen": -3.9738707542419434,
2282
+ "logits/rejected": -3.5914108753204346,
2283
+ "logps/chosen": -376.2590026855469,
2284
+ "logps/rejected": -1555.9676513671875,
2285
+ "loss": 0.097,
2286
+ "rewards/accuracies": 0.9473684430122375,
2287
+ "rewards/chosen": -1.7003173828125,
2288
+ "rewards/margins": 15.424914360046387,
2289
+ "rewards/rejected": -17.12523078918457,
2290
+ "step": 152
2291
+ },
2292
+ {
2293
+ "epoch": 0.2597623089983022,
2294
+ "grad_norm": 18.307544708251953,
2295
+ "learning_rate": 6.941109610518536e-06,
2296
+ "logits/chosen": -3.872546434402466,
2297
+ "logits/rejected": -3.487182855606079,
2298
+ "logps/chosen": -639.40966796875,
2299
+ "logps/rejected": -2526.517822265625,
2300
+ "loss": 0.0721,
2301
+ "rewards/accuracies": 1.0,
2302
+ "rewards/chosen": -1.2157108783721924,
2303
+ "rewards/margins": 20.447683334350586,
2304
+ "rewards/rejected": -21.663394927978516,
2305
+ "step": 153
2306
+ },
2307
+ {
2308
+ "epoch": 0.2614601018675722,
2309
+ "grad_norm": 207.49671936035156,
2310
+ "learning_rate": 6.940102497438598e-06,
2311
+ "logits/chosen": -3.8016934394836426,
2312
+ "logits/rejected": -3.5271739959716797,
2313
+ "logps/chosen": -1146.2698974609375,
2314
+ "logps/rejected": -2129.174560546875,
2315
+ "loss": 0.9201,
2316
+ "rewards/accuracies": 0.9473684430122375,
2317
+ "rewards/chosen": 0.18959708511829376,
2318
+ "rewards/margins": 18.843021392822266,
2319
+ "rewards/rejected": -18.653423309326172,
2320
+ "step": 154
2321
+ },
2322
+ {
2323
+ "epoch": 0.2631578947368421,
2324
+ "grad_norm": 6.829913139343262,
2325
+ "learning_rate": 6.939086945016899e-06,
2326
+ "logits/chosen": -3.743802070617676,
2327
+ "logits/rejected": -3.529689073562622,
2328
+ "logps/chosen": -655.1603393554688,
2329
+ "logps/rejected": -1918.6319580078125,
2330
+ "loss": 0.0801,
2331
+ "rewards/accuracies": 0.9473684430122375,
2332
+ "rewards/chosen": -4.319693088531494,
2333
+ "rewards/margins": 19.133678436279297,
2334
+ "rewards/rejected": -23.453371047973633,
2335
+ "step": 155
2336
+ },
2337
+ {
2338
+ "epoch": 0.26485568760611206,
2339
+ "grad_norm": 50.516014099121094,
2340
+ "learning_rate": 6.9380629565946675e-06,
2341
+ "logits/chosen": -3.3451156616210938,
2342
+ "logits/rejected": -3.4973039627075195,
2343
+ "logps/chosen": -900.9619750976562,
2344
+ "logps/rejected": -1767.4691162109375,
2345
+ "loss": 0.1874,
2346
+ "rewards/accuracies": 1.0,
2347
+ "rewards/chosen": -3.8387162685394287,
2348
+ "rewards/margins": 16.731220245361328,
2349
+ "rewards/rejected": -20.569936752319336,
2350
+ "step": 156
2351
+ }
2352
+ ],
2353
+ "logging_steps": 1,
2354
+ "max_steps": 1767,
2355
+ "num_input_tokens_seen": 0,
2356
+ "num_train_epochs": 3,
2357
+ "save_steps": 500,
2358
+ "stateful_callbacks": {
2359
+ "TrainerControl": {
2360
+ "args": {
2361
+ "should_epoch_stop": false,
2362
+ "should_evaluate": false,
2363
+ "should_log": false,
2364
+ "should_save": true,
2365
+ "should_training_stop": false
2366
+ },
2367
+ "attributes": {}
2368
+ }
2369
+ },
2370
+ "total_flos": 0.0,
2371
+ "train_batch_size": 19,
2372
+ "trial_name": null,
2373
+ "trial_params": null
2374
+ }
training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8d90dff462e13a9b1d87be02fa9fa14eee18c865649dd34a288d9474609d80c9
3
+ size 6520