watermelonhjg commited on
Commit
83eb92c
·
verified ·
1 Parent(s): 95ffc13

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,67 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ base_model: Qwen/Qwen2.5-3B-Instruct
3
+ datasets: xiaodongguaAIGC/X-R1-7500
4
+ library_name: transformers
5
+ tags:
6
+ - generated_from_trainer
7
+ - X-R1
8
+ licence: license
9
+ ---
10
+
11
+ # Model Card for None
12
+
13
+ This model is a fine-tuned version of [Qwen/Qwen2.5-3B-Instruct](https://huggingface.co/Qwen/Qwen2.5-3B-Instruct) on the [xiaodongguaAIGC/X-R1-7500](https://huggingface.co/datasets/xiaodongguaAIGC/X-R1-7500) dataset.
14
+ It has been trained using [TRL](https://github.com/huggingface/trl).
15
+
16
+ ## Quick start
17
+
18
+ ```python
19
+ from transformers import pipeline
20
+
21
+ question = "If you had a time machine, but could only go to the past or the future once and never return, which would you choose and why?"
22
+ generator = pipeline("text-generation", model="None", device="cuda")
23
+ output = generator([{"role": "user", "content": question}], max_new_tokens=128, return_full_text=False)[0]
24
+ print(output["generated_text"])
25
+ ```
26
+
27
+ ## Training procedure
28
+
29
+ [<img src="https://raw.githubusercontent.com/wandb/assets/main/wandb-github-badge-28.svg" alt="Visualize in Weights & Biases" width="150" height="24"/>](https://wandb.ai/watermelonhjg/huggingface/runs/d1x61l64)
30
+
31
+
32
+ This model was trained with GRPO, a method introduced in [DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models](https://huggingface.co/papers/2402.03300).
33
+
34
+ ### Framework versions
35
+
36
+ - TRL: 0.14.0
37
+ - Transformers: 4.48.3
38
+ - Pytorch: 2.5.1
39
+ - Datasets: 3.2.0
40
+ - Tokenizers: 0.21.0
41
+
42
+ ## Citations
43
+
44
+ Cite GRPO as:
45
+
46
+ ```bibtex
47
+ @article{zhihong2024deepseekmath,
48
+ title = {{DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models}},
49
+ author = {Zhihong Shao and Peiyi Wang and Qihao Zhu and Runxin Xu and Junxiao Song and Mingchuan Zhang and Y. K. Li and Y. Wu and Daya Guo},
50
+ year = 2024,
51
+ eprint = {arXiv:2402.03300},
52
+ }
53
+
54
+ ```
55
+
56
+ Cite TRL as:
57
+
58
+ ```bibtex
59
+ @misc{vonwerra2022trl,
60
+ title = {{TRL: Transformer Reinforcement Learning}},
61
+ author = {Leandro von Werra and Younes Belkada and Lewis Tunstall and Edward Beeching and Tristan Thrush and Nathan Lambert and Shengyi Huang and Kashif Rasul and Quentin Gallouédec},
62
+ year = 2020,
63
+ journal = {GitHub repository},
64
+ publisher = {GitHub},
65
+ howpublished = {\url{https://github.com/huggingface/trl}}
66
+ }
67
+ ```
added_tokens.json ADDED
@@ -0,0 +1,24 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "</tool_call>": 151658,
3
+ "<tool_call>": 151657,
4
+ "<|box_end|>": 151649,
5
+ "<|box_start|>": 151648,
6
+ "<|endoftext|>": 151643,
7
+ "<|file_sep|>": 151664,
8
+ "<|fim_middle|>": 151660,
9
+ "<|fim_pad|>": 151662,
10
+ "<|fim_prefix|>": 151659,
11
+ "<|fim_suffix|>": 151661,
12
+ "<|im_end|>": 151645,
13
+ "<|im_start|>": 151644,
14
+ "<|image_pad|>": 151655,
15
+ "<|object_ref_end|>": 151647,
16
+ "<|object_ref_start|>": 151646,
17
+ "<|quad_end|>": 151651,
18
+ "<|quad_start|>": 151650,
19
+ "<|repo_name|>": 151663,
20
+ "<|video_pad|>": 151656,
21
+ "<|vision_end|>": 151653,
22
+ "<|vision_pad|>": 151654,
23
+ "<|vision_start|>": 151652
24
+ }
all_results.json ADDED
@@ -0,0 +1,8 @@
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "total_flos": 0.0,
3
+ "train_loss": 0.11509215348958969,
4
+ "train_runtime": 61764.0604,
5
+ "train_samples": 7500,
6
+ "train_samples_per_second": 0.364,
7
+ "train_steps_per_second": 0.03
8
+ }
config.json ADDED
@@ -0,0 +1,29 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_name_or_path": "Qwen/Qwen2.5-3B-Instruct",
3
+ "architectures": [
4
+ "Qwen2ForCausalLM"
5
+ ],
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 151643,
8
+ "eos_token_id": 151645,
9
+ "hidden_act": "silu",
10
+ "hidden_size": 2048,
11
+ "initializer_range": 0.02,
12
+ "intermediate_size": 11008,
13
+ "max_position_embeddings": 32768,
14
+ "max_window_layers": 70,
15
+ "model_type": "qwen2",
16
+ "num_attention_heads": 16,
17
+ "num_hidden_layers": 36,
18
+ "num_key_value_heads": 2,
19
+ "rms_norm_eps": 1e-06,
20
+ "rope_scaling": null,
21
+ "rope_theta": 1000000.0,
22
+ "sliding_window": null,
23
+ "tie_word_embeddings": true,
24
+ "torch_dtype": "bfloat16",
25
+ "transformers_version": "4.48.3",
26
+ "use_cache": true,
27
+ "use_sliding_window": false,
28
+ "vocab_size": 151936
29
+ }
generation_config.json ADDED
@@ -0,0 +1,14 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 151643,
3
+ "do_sample": true,
4
+ "eos_token_id": [
5
+ 151645,
6
+ 151643
7
+ ],
8
+ "pad_token_id": 151643,
9
+ "repetition_penalty": 1.05,
10
+ "temperature": 0.7,
11
+ "top_k": 20,
12
+ "top_p": 0.8,
13
+ "transformers_version": "4.48.3"
14
+ }
merges.txt ADDED
The diff for this file is too large to render. See raw diff
 
model-00001-of-00002.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c594376edf3af25fd0c0a7cbdca4cf2ecce6fd0629078fbda779da00f03edb23
3
+ size 4957560304
model-00002-of-00002.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fb69250e2e29015502e2bf7e79f8178bd8977ac75612431c60cc8cf69fdb5ce7
3
+ size 1214366696
model.safetensors.index.json ADDED
@@ -0,0 +1,441 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "metadata": {
3
+ "total_size": 6171877376
4
+ },
5
+ "weight_map": {
6
+ "model.embed_tokens.weight": "model-00001-of-00002.safetensors",
7
+ "model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
8
+ "model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
9
+ "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
10
+ "model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
11
+ "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
12
+ "model.layers.0.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
13
+ "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
14
+ "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
15
+ "model.layers.0.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
16
+ "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
17
+ "model.layers.0.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
18
+ "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
19
+ "model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
20
+ "model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
21
+ "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
22
+ "model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
23
+ "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
24
+ "model.layers.1.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
25
+ "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
26
+ "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
27
+ "model.layers.1.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
28
+ "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
29
+ "model.layers.1.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
30
+ "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
31
+ "model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors",
32
+ "model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
33
+ "model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
34
+ "model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
35
+ "model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
36
+ "model.layers.10.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
37
+ "model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
38
+ "model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
39
+ "model.layers.10.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
40
+ "model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
41
+ "model.layers.10.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
42
+ "model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
43
+ "model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors",
44
+ "model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
45
+ "model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
46
+ "model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
47
+ "model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
48
+ "model.layers.11.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
49
+ "model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
50
+ "model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
51
+ "model.layers.11.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
52
+ "model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
53
+ "model.layers.11.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
54
+ "model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
55
+ "model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors",
56
+ "model.layers.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
57
+ "model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
58
+ "model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
59
+ "model.layers.12.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
60
+ "model.layers.12.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
61
+ "model.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
62
+ "model.layers.12.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
63
+ "model.layers.12.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
64
+ "model.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
65
+ "model.layers.12.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
66
+ "model.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
67
+ "model.layers.13.input_layernorm.weight": "model-00001-of-00002.safetensors",
68
+ "model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
69
+ "model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
70
+ "model.layers.13.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
71
+ "model.layers.13.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
72
+ "model.layers.13.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
73
+ "model.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
74
+ "model.layers.13.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
75
+ "model.layers.13.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
76
+ "model.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
77
+ "model.layers.13.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
78
+ "model.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
79
+ "model.layers.14.input_layernorm.weight": "model-00001-of-00002.safetensors",
80
+ "model.layers.14.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
81
+ "model.layers.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
82
+ "model.layers.14.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
83
+ "model.layers.14.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
84
+ "model.layers.14.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
85
+ "model.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
86
+ "model.layers.14.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
87
+ "model.layers.14.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
88
+ "model.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
89
+ "model.layers.14.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
90
+ "model.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
91
+ "model.layers.15.input_layernorm.weight": "model-00001-of-00002.safetensors",
92
+ "model.layers.15.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
93
+ "model.layers.15.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
94
+ "model.layers.15.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
95
+ "model.layers.15.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
96
+ "model.layers.15.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
97
+ "model.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
98
+ "model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
99
+ "model.layers.15.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
100
+ "model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
101
+ "model.layers.15.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
102
+ "model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
103
+ "model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors",
104
+ "model.layers.16.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
105
+ "model.layers.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
106
+ "model.layers.16.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
107
+ "model.layers.16.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
108
+ "model.layers.16.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
109
+ "model.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
110
+ "model.layers.16.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
111
+ "model.layers.16.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
112
+ "model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
113
+ "model.layers.16.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
114
+ "model.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
115
+ "model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors",
116
+ "model.layers.17.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
117
+ "model.layers.17.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
118
+ "model.layers.17.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
119
+ "model.layers.17.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
120
+ "model.layers.17.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
121
+ "model.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
122
+ "model.layers.17.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
123
+ "model.layers.17.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
124
+ "model.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
125
+ "model.layers.17.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
126
+ "model.layers.17.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
127
+ "model.layers.18.input_layernorm.weight": "model-00001-of-00002.safetensors",
128
+ "model.layers.18.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
129
+ "model.layers.18.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
130
+ "model.layers.18.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
131
+ "model.layers.18.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
132
+ "model.layers.18.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
133
+ "model.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
134
+ "model.layers.18.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
135
+ "model.layers.18.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
136
+ "model.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
137
+ "model.layers.18.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
138
+ "model.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
139
+ "model.layers.19.input_layernorm.weight": "model-00001-of-00002.safetensors",
140
+ "model.layers.19.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
141
+ "model.layers.19.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
142
+ "model.layers.19.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
143
+ "model.layers.19.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
144
+ "model.layers.19.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
145
+ "model.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
146
+ "model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
147
+ "model.layers.19.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
148
+ "model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
149
+ "model.layers.19.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
150
+ "model.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
151
+ "model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
152
+ "model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
153
+ "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
154
+ "model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
155
+ "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
156
+ "model.layers.2.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
157
+ "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
158
+ "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
159
+ "model.layers.2.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
160
+ "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
161
+ "model.layers.2.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
162
+ "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
163
+ "model.layers.20.input_layernorm.weight": "model-00001-of-00002.safetensors",
164
+ "model.layers.20.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
165
+ "model.layers.20.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
166
+ "model.layers.20.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
167
+ "model.layers.20.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
168
+ "model.layers.20.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
169
+ "model.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
170
+ "model.layers.20.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
171
+ "model.layers.20.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
172
+ "model.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
173
+ "model.layers.20.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
174
+ "model.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
175
+ "model.layers.21.input_layernorm.weight": "model-00001-of-00002.safetensors",
176
+ "model.layers.21.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
177
+ "model.layers.21.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
178
+ "model.layers.21.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
179
+ "model.layers.21.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
180
+ "model.layers.21.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
181
+ "model.layers.21.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
182
+ "model.layers.21.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
183
+ "model.layers.21.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
184
+ "model.layers.21.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
185
+ "model.layers.21.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
186
+ "model.layers.21.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
187
+ "model.layers.22.input_layernorm.weight": "model-00001-of-00002.safetensors",
188
+ "model.layers.22.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
189
+ "model.layers.22.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
190
+ "model.layers.22.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
191
+ "model.layers.22.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
192
+ "model.layers.22.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
193
+ "model.layers.22.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
194
+ "model.layers.22.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
195
+ "model.layers.22.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
196
+ "model.layers.22.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
197
+ "model.layers.22.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
198
+ "model.layers.22.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
199
+ "model.layers.23.input_layernorm.weight": "model-00001-of-00002.safetensors",
200
+ "model.layers.23.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
201
+ "model.layers.23.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
202
+ "model.layers.23.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
203
+ "model.layers.23.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
204
+ "model.layers.23.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
205
+ "model.layers.23.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
206
+ "model.layers.23.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
207
+ "model.layers.23.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
208
+ "model.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
209
+ "model.layers.23.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
210
+ "model.layers.23.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
211
+ "model.layers.24.input_layernorm.weight": "model-00001-of-00002.safetensors",
212
+ "model.layers.24.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
213
+ "model.layers.24.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
214
+ "model.layers.24.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
215
+ "model.layers.24.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
216
+ "model.layers.24.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
217
+ "model.layers.24.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
218
+ "model.layers.24.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
219
+ "model.layers.24.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
220
+ "model.layers.24.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
221
+ "model.layers.24.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
222
+ "model.layers.24.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
223
+ "model.layers.25.input_layernorm.weight": "model-00001-of-00002.safetensors",
224
+ "model.layers.25.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
225
+ "model.layers.25.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
226
+ "model.layers.25.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
227
+ "model.layers.25.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
228
+ "model.layers.25.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
229
+ "model.layers.25.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
230
+ "model.layers.25.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
231
+ "model.layers.25.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
232
+ "model.layers.25.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
233
+ "model.layers.25.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
234
+ "model.layers.25.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
235
+ "model.layers.26.input_layernorm.weight": "model-00001-of-00002.safetensors",
236
+ "model.layers.26.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
237
+ "model.layers.26.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
238
+ "model.layers.26.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
239
+ "model.layers.26.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
240
+ "model.layers.26.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
241
+ "model.layers.26.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
242
+ "model.layers.26.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
243
+ "model.layers.26.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
244
+ "model.layers.26.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
245
+ "model.layers.26.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
246
+ "model.layers.26.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
247
+ "model.layers.27.input_layernorm.weight": "model-00001-of-00002.safetensors",
248
+ "model.layers.27.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
249
+ "model.layers.27.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
250
+ "model.layers.27.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
251
+ "model.layers.27.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
252
+ "model.layers.27.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
253
+ "model.layers.27.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
254
+ "model.layers.27.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
255
+ "model.layers.27.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
256
+ "model.layers.27.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
257
+ "model.layers.27.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
258
+ "model.layers.27.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
259
+ "model.layers.28.input_layernorm.weight": "model-00002-of-00002.safetensors",
260
+ "model.layers.28.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
261
+ "model.layers.28.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
262
+ "model.layers.28.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
263
+ "model.layers.28.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
264
+ "model.layers.28.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
265
+ "model.layers.28.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
266
+ "model.layers.28.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
267
+ "model.layers.28.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
268
+ "model.layers.28.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
269
+ "model.layers.28.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
270
+ "model.layers.28.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
271
+ "model.layers.29.input_layernorm.weight": "model-00002-of-00002.safetensors",
272
+ "model.layers.29.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
273
+ "model.layers.29.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
274
+ "model.layers.29.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
275
+ "model.layers.29.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
276
+ "model.layers.29.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
277
+ "model.layers.29.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
278
+ "model.layers.29.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
279
+ "model.layers.29.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
280
+ "model.layers.29.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
281
+ "model.layers.29.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
282
+ "model.layers.29.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
283
+ "model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
284
+ "model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
285
+ "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
286
+ "model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
287
+ "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
288
+ "model.layers.3.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
289
+ "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
290
+ "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
291
+ "model.layers.3.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
292
+ "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
293
+ "model.layers.3.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
294
+ "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
295
+ "model.layers.30.input_layernorm.weight": "model-00002-of-00002.safetensors",
296
+ "model.layers.30.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
297
+ "model.layers.30.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
298
+ "model.layers.30.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
299
+ "model.layers.30.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
300
+ "model.layers.30.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
301
+ "model.layers.30.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
302
+ "model.layers.30.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
303
+ "model.layers.30.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
304
+ "model.layers.30.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
305
+ "model.layers.30.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
306
+ "model.layers.30.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
307
+ "model.layers.31.input_layernorm.weight": "model-00002-of-00002.safetensors",
308
+ "model.layers.31.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
309
+ "model.layers.31.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
310
+ "model.layers.31.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
311
+ "model.layers.31.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
312
+ "model.layers.31.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
313
+ "model.layers.31.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
314
+ "model.layers.31.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
315
+ "model.layers.31.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
316
+ "model.layers.31.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
317
+ "model.layers.31.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
318
+ "model.layers.31.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
319
+ "model.layers.32.input_layernorm.weight": "model-00002-of-00002.safetensors",
320
+ "model.layers.32.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
321
+ "model.layers.32.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
322
+ "model.layers.32.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
323
+ "model.layers.32.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
324
+ "model.layers.32.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
325
+ "model.layers.32.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
326
+ "model.layers.32.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
327
+ "model.layers.32.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
328
+ "model.layers.32.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
329
+ "model.layers.32.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
330
+ "model.layers.32.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
331
+ "model.layers.33.input_layernorm.weight": "model-00002-of-00002.safetensors",
332
+ "model.layers.33.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
333
+ "model.layers.33.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
334
+ "model.layers.33.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
335
+ "model.layers.33.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
336
+ "model.layers.33.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
337
+ "model.layers.33.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
338
+ "model.layers.33.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
339
+ "model.layers.33.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
340
+ "model.layers.33.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
341
+ "model.layers.33.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
342
+ "model.layers.33.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
343
+ "model.layers.34.input_layernorm.weight": "model-00002-of-00002.safetensors",
344
+ "model.layers.34.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
345
+ "model.layers.34.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
346
+ "model.layers.34.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
347
+ "model.layers.34.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
348
+ "model.layers.34.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
349
+ "model.layers.34.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
350
+ "model.layers.34.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
351
+ "model.layers.34.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
352
+ "model.layers.34.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
353
+ "model.layers.34.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
354
+ "model.layers.34.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
355
+ "model.layers.35.input_layernorm.weight": "model-00002-of-00002.safetensors",
356
+ "model.layers.35.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
357
+ "model.layers.35.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
358
+ "model.layers.35.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
359
+ "model.layers.35.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
360
+ "model.layers.35.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
361
+ "model.layers.35.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
362
+ "model.layers.35.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
363
+ "model.layers.35.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
364
+ "model.layers.35.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
365
+ "model.layers.35.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
366
+ "model.layers.35.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
367
+ "model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
368
+ "model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
369
+ "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
370
+ "model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
371
+ "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
372
+ "model.layers.4.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
373
+ "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
374
+ "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
375
+ "model.layers.4.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
376
+ "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
377
+ "model.layers.4.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
378
+ "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
379
+ "model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
380
+ "model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
381
+ "model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
382
+ "model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
383
+ "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
384
+ "model.layers.5.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
385
+ "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
386
+ "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
387
+ "model.layers.5.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
388
+ "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
389
+ "model.layers.5.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
390
+ "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
391
+ "model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
392
+ "model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
393
+ "model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
394
+ "model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
395
+ "model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
396
+ "model.layers.6.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
397
+ "model.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
398
+ "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
399
+ "model.layers.6.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
400
+ "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
401
+ "model.layers.6.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
402
+ "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
403
+ "model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
404
+ "model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
405
+ "model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
406
+ "model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
407
+ "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
408
+ "model.layers.7.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
409
+ "model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
410
+ "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
411
+ "model.layers.7.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
412
+ "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
413
+ "model.layers.7.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
414
+ "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
415
+ "model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors",
416
+ "model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
417
+ "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
418
+ "model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
419
+ "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
420
+ "model.layers.8.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
421
+ "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
422
+ "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
423
+ "model.layers.8.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
424
+ "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
425
+ "model.layers.8.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
426
+ "model.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
427
+ "model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors",
428
+ "model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
429
+ "model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
430
+ "model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
431
+ "model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
432
+ "model.layers.9.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
433
+ "model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
434
+ "model.layers.9.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
435
+ "model.layers.9.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
436
+ "model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
437
+ "model.layers.9.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
438
+ "model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
439
+ "model.norm.weight": "model-00002-of-00002.safetensors"
440
+ }
441
+ }
special_tokens_map.json ADDED
@@ -0,0 +1,31 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "additional_special_tokens": [
3
+ "<|im_start|>",
4
+ "<|im_end|>",
5
+ "<|object_ref_start|>",
6
+ "<|object_ref_end|>",
7
+ "<|box_start|>",
8
+ "<|box_end|>",
9
+ "<|quad_start|>",
10
+ "<|quad_end|>",
11
+ "<|vision_start|>",
12
+ "<|vision_end|>",
13
+ "<|vision_pad|>",
14
+ "<|image_pad|>",
15
+ "<|video_pad|>"
16
+ ],
17
+ "eos_token": {
18
+ "content": "<|im_end|>",
19
+ "lstrip": false,
20
+ "normalized": false,
21
+ "rstrip": false,
22
+ "single_word": false
23
+ },
24
+ "pad_token": {
25
+ "content": "<|endoftext|>",
26
+ "lstrip": false,
27
+ "normalized": false,
28
+ "rstrip": false,
29
+ "single_word": false
30
+ }
31
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5eee858c5123a4279c3e1f7b81247343f356ac767940b2692a928ad929543214
3
+ size 11422063
tokenizer_config.json ADDED
@@ -0,0 +1,209 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_bos_token": false,
3
+ "add_prefix_space": false,
4
+ "added_tokens_decoder": {
5
+ "151643": {
6
+ "content": "<|endoftext|>",
7
+ "lstrip": false,
8
+ "normalized": false,
9
+ "rstrip": false,
10
+ "single_word": false,
11
+ "special": true
12
+ },
13
+ "151644": {
14
+ "content": "<|im_start|>",
15
+ "lstrip": false,
16
+ "normalized": false,
17
+ "rstrip": false,
18
+ "single_word": false,
19
+ "special": true
20
+ },
21
+ "151645": {
22
+ "content": "<|im_end|>",
23
+ "lstrip": false,
24
+ "normalized": false,
25
+ "rstrip": false,
26
+ "single_word": false,
27
+ "special": true
28
+ },
29
+ "151646": {
30
+ "content": "<|object_ref_start|>",
31
+ "lstrip": false,
32
+ "normalized": false,
33
+ "rstrip": false,
34
+ "single_word": false,
35
+ "special": true
36
+ },
37
+ "151647": {
38
+ "content": "<|object_ref_end|>",
39
+ "lstrip": false,
40
+ "normalized": false,
41
+ "rstrip": false,
42
+ "single_word": false,
43
+ "special": true
44
+ },
45
+ "151648": {
46
+ "content": "<|box_start|>",
47
+ "lstrip": false,
48
+ "normalized": false,
49
+ "rstrip": false,
50
+ "single_word": false,
51
+ "special": true
52
+ },
53
+ "151649": {
54
+ "content": "<|box_end|>",
55
+ "lstrip": false,
56
+ "normalized": false,
57
+ "rstrip": false,
58
+ "single_word": false,
59
+ "special": true
60
+ },
61
+ "151650": {
62
+ "content": "<|quad_start|>",
63
+ "lstrip": false,
64
+ "normalized": false,
65
+ "rstrip": false,
66
+ "single_word": false,
67
+ "special": true
68
+ },
69
+ "151651": {
70
+ "content": "<|quad_end|>",
71
+ "lstrip": false,
72
+ "normalized": false,
73
+ "rstrip": false,
74
+ "single_word": false,
75
+ "special": true
76
+ },
77
+ "151652": {
78
+ "content": "<|vision_start|>",
79
+ "lstrip": false,
80
+ "normalized": false,
81
+ "rstrip": false,
82
+ "single_word": false,
83
+ "special": true
84
+ },
85
+ "151653": {
86
+ "content": "<|vision_end|>",
87
+ "lstrip": false,
88
+ "normalized": false,
89
+ "rstrip": false,
90
+ "single_word": false,
91
+ "special": true
92
+ },
93
+ "151654": {
94
+ "content": "<|vision_pad|>",
95
+ "lstrip": false,
96
+ "normalized": false,
97
+ "rstrip": false,
98
+ "single_word": false,
99
+ "special": true
100
+ },
101
+ "151655": {
102
+ "content": "<|image_pad|>",
103
+ "lstrip": false,
104
+ "normalized": false,
105
+ "rstrip": false,
106
+ "single_word": false,
107
+ "special": true
108
+ },
109
+ "151656": {
110
+ "content": "<|video_pad|>",
111
+ "lstrip": false,
112
+ "normalized": false,
113
+ "rstrip": false,
114
+ "single_word": false,
115
+ "special": true
116
+ },
117
+ "151657": {
118
+ "content": "<tool_call>",
119
+ "lstrip": false,
120
+ "normalized": false,
121
+ "rstrip": false,
122
+ "single_word": false,
123
+ "special": false
124
+ },
125
+ "151658": {
126
+ "content": "</tool_call>",
127
+ "lstrip": false,
128
+ "normalized": false,
129
+ "rstrip": false,
130
+ "single_word": false,
131
+ "special": false
132
+ },
133
+ "151659": {
134
+ "content": "<|fim_prefix|>",
135
+ "lstrip": false,
136
+ "normalized": false,
137
+ "rstrip": false,
138
+ "single_word": false,
139
+ "special": false
140
+ },
141
+ "151660": {
142
+ "content": "<|fim_middle|>",
143
+ "lstrip": false,
144
+ "normalized": false,
145
+ "rstrip": false,
146
+ "single_word": false,
147
+ "special": false
148
+ },
149
+ "151661": {
150
+ "content": "<|fim_suffix|>",
151
+ "lstrip": false,
152
+ "normalized": false,
153
+ "rstrip": false,
154
+ "single_word": false,
155
+ "special": false
156
+ },
157
+ "151662": {
158
+ "content": "<|fim_pad|>",
159
+ "lstrip": false,
160
+ "normalized": false,
161
+ "rstrip": false,
162
+ "single_word": false,
163
+ "special": false
164
+ },
165
+ "151663": {
166
+ "content": "<|repo_name|>",
167
+ "lstrip": false,
168
+ "normalized": false,
169
+ "rstrip": false,
170
+ "single_word": false,
171
+ "special": false
172
+ },
173
+ "151664": {
174
+ "content": "<|file_sep|>",
175
+ "lstrip": false,
176
+ "normalized": false,
177
+ "rstrip": false,
178
+ "single_word": false,
179
+ "special": false
180
+ }
181
+ },
182
+ "additional_special_tokens": [
183
+ "<|im_start|>",
184
+ "<|im_end|>",
185
+ "<|object_ref_start|>",
186
+ "<|object_ref_end|>",
187
+ "<|box_start|>",
188
+ "<|box_end|>",
189
+ "<|quad_start|>",
190
+ "<|quad_end|>",
191
+ "<|vision_start|>",
192
+ "<|vision_end|>",
193
+ "<|vision_pad|>",
194
+ "<|image_pad|>",
195
+ "<|video_pad|>"
196
+ ],
197
+ "bos_token": null,
198
+ "chat_template": "{%- if tools %}\n {{- '<|im_start|>system\\n' }}\n {%- if messages[0]['role'] == 'system' %}\n {{- messages[0]['content'] }}\n {%- else %}\n {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }}\n {%- endif %}\n {{- \"\\n\\n# Tools\\n\\nYou may call one or more functions to assist with the user query.\\n\\nYou are provided with function signatures within <tools></tools> XML tags:\\n<tools>\" }}\n {%- for tool in tools %}\n {{- \"\\n\" }}\n {{- tool | tojson }}\n {%- endfor %}\n {{- \"\\n</tools>\\n\\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\\n<tool_call>\\n{\\\"name\\\": <function-name>, \\\"arguments\\\": <args-json-object>}\\n</tool_call><|im_end|>\\n\" }}\n{%- else %}\n {%- if messages[0]['role'] == 'system' %}\n {{- '<|im_start|>system\\n' + messages[0]['content'] + '<|im_end|>\\n' }}\n {%- else %}\n {{- '<|im_start|>system\\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\\n' }}\n {%- endif %}\n{%- endif %}\n{%- for message in messages %}\n {%- if (message.role == \"user\") or (message.role == \"system\" and not loop.first) or (message.role == \"assistant\" and not message.tool_calls) %}\n {{- '<|im_start|>' + message.role + '\\n' + message.content + '<|im_end|>' + '\\n' }}\n {%- elif message.role == \"assistant\" %}\n {{- '<|im_start|>' + message.role }}\n {%- if message.content %}\n {{- '\\n' + message.content }}\n {%- endif %}\n {%- for tool_call in message.tool_calls %}\n {%- if tool_call.function is defined %}\n {%- set tool_call = tool_call.function %}\n {%- endif %}\n {{- '\\n<tool_call>\\n{\"name\": \"' }}\n {{- tool_call.name }}\n {{- '\", \"arguments\": ' }}\n {{- tool_call.arguments | tojson }}\n {{- '}\\n</tool_call>' }}\n {%- endfor %}\n {{- '<|im_end|>\\n' }}\n {%- elif message.role == \"tool\" %}\n {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != \"tool\") %}\n {{- '<|im_start|>user' }}\n {%- endif %}\n {{- '\\n<tool_response>\\n' }}\n {{- message.content }}\n {{- '\\n</tool_response>' }}\n {%- if loop.last or (messages[loop.index0 + 1].role != \"tool\") %}\n {{- '<|im_end|>\\n' }}\n {%- endif %}\n {%- endif %}\n{%- endfor %}\n{%- if add_generation_prompt %}\n {{- '<|im_start|>assistant\\n' }}\n{%- endif %}\n",
199
+ "clean_up_tokenization_spaces": false,
200
+ "eos_token": "<|im_end|>",
201
+ "errors": "replace",
202
+ "extra_special_tokens": {},
203
+ "model_max_length": 131072,
204
+ "pad_token": "<|endoftext|>",
205
+ "padding_side": "left",
206
+ "split_special_tokens": false,
207
+ "tokenizer_class": "Qwen2Tokenizer",
208
+ "unk_token": null
209
+ }
train_results.json ADDED
@@ -0,0 +1,8 @@
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "total_flos": 0.0,
3
+ "train_loss": 0.11509215348958969,
4
+ "train_runtime": 61764.0604,
5
+ "train_samples": 7500,
6
+ "train_samples_per_second": 0.364,
7
+ "train_steps_per_second": 0.03
8
+ }
trainer_state.json ADDED
@@ -0,0 +1,2479 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": null,
3
+ "best_model_checkpoint": null,
4
+ "epoch": 3.0,
5
+ "eval_steps": 10,
6
+ "global_step": 1875,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "completion_length": 549.5593883514405,
13
+ "epoch": 0.016,
14
+ "grad_norm": 0.6740879416465759,
15
+ "kl": 0.00035033226013183596,
16
+ "learning_rate": 1.5957446808510638e-07,
17
+ "loss": 0.0,
18
+ "reward": 0.42916667833924294,
19
+ "reward_std": 0.34028950408101083,
20
+ "rewards/accuracy_reward": 0.3166666737757623,
21
+ "rewards/format_reward": 0.11250000298023224,
22
+ "step": 10
23
+ },
24
+ {
25
+ "completion_length": 527.5224136352539,
26
+ "epoch": 0.032,
27
+ "grad_norm": 0.2563185691833496,
28
+ "kl": 0.0004585623741149902,
29
+ "learning_rate": 3.1914893617021275e-07,
30
+ "loss": 0.0,
31
+ "reward": 0.4945312611758709,
32
+ "reward_std": 0.35083559062331915,
33
+ "rewards/accuracy_reward": 0.37005209350027146,
34
+ "rewards/format_reward": 0.12447916958481073,
35
+ "step": 20
36
+ },
37
+ {
38
+ "completion_length": 538.003141784668,
39
+ "epoch": 0.048,
40
+ "grad_norm": 0.33752796053886414,
41
+ "kl": 0.005180943012237549,
42
+ "learning_rate": 4.787234042553192e-07,
43
+ "loss": 0.0002,
44
+ "reward": 0.5481770986691117,
45
+ "reward_std": 0.3370666664093733,
46
+ "rewards/accuracy_reward": 0.2927083420334384,
47
+ "rewards/format_reward": 0.25546875870786606,
48
+ "step": 30
49
+ },
50
+ {
51
+ "completion_length": 258.59141426086427,
52
+ "epoch": 0.064,
53
+ "grad_norm": 0.354353666305542,
54
+ "kl": 0.0585662841796875,
55
+ "learning_rate": 6.382978723404255e-07,
56
+ "loss": 0.0023,
57
+ "reward": 0.8239583492279052,
58
+ "reward_std": 0.27262834142893555,
59
+ "rewards/accuracy_reward": 0.06171875221189112,
60
+ "rewards/format_reward": 0.7622395977377892,
61
+ "step": 40
62
+ },
63
+ {
64
+ "completion_length": 161.72448558807372,
65
+ "epoch": 0.08,
66
+ "grad_norm": 0.24595139920711517,
67
+ "kl": 0.0718231201171875,
68
+ "learning_rate": 7.978723404255319e-07,
69
+ "loss": 0.0029,
70
+ "reward": 0.9528646096587181,
71
+ "reward_std": 0.18603200055658817,
72
+ "rewards/accuracy_reward": 0.020572917093522845,
73
+ "rewards/format_reward": 0.9322916835546493,
74
+ "step": 50
75
+ },
76
+ {
77
+ "completion_length": 187.65990085601806,
78
+ "epoch": 0.096,
79
+ "grad_norm": 0.18100768327713013,
80
+ "kl": 0.0560791015625,
81
+ "learning_rate": 9.574468085106384e-07,
82
+ "loss": 0.0022,
83
+ "reward": 0.9700521141290664,
84
+ "reward_std": 0.23906342964619398,
85
+ "rewards/accuracy_reward": 0.05546875142026693,
86
+ "rewards/format_reward": 0.9145833522081375,
87
+ "step": 60
88
+ },
89
+ {
90
+ "completion_length": 197.76198501586913,
91
+ "epoch": 0.112,
92
+ "grad_norm": 0.2552257180213928,
93
+ "kl": 0.067510986328125,
94
+ "learning_rate": 1.1170212765957447e-06,
95
+ "loss": 0.0027,
96
+ "reward": 1.0585937827825547,
97
+ "reward_std": 0.278127851895988,
98
+ "rewards/accuracy_reward": 0.11562500302679837,
99
+ "rewards/format_reward": 0.9429687693715095,
100
+ "step": 70
101
+ },
102
+ {
103
+ "completion_length": 207.72917366027832,
104
+ "epoch": 0.128,
105
+ "grad_norm": 0.23932258784770966,
106
+ "kl": 0.08233642578125,
107
+ "learning_rate": 1.276595744680851e-06,
108
+ "loss": 0.0033,
109
+ "reward": 1.1739583641290665,
110
+ "reward_std": 0.31914406083524227,
111
+ "rewards/accuracy_reward": 0.2052083393326029,
112
+ "rewards/format_reward": 0.9687500178813935,
113
+ "step": 80
114
+ },
115
+ {
116
+ "completion_length": 254.02891464233397,
117
+ "epoch": 0.144,
118
+ "grad_norm": 0.13784578442573547,
119
+ "kl": 0.077899169921875,
120
+ "learning_rate": 1.4361702127659576e-06,
121
+ "loss": 0.0031,
122
+ "reward": 1.254687537252903,
123
+ "reward_std": 0.3285429562442005,
124
+ "rewards/accuracy_reward": 0.2760416746838018,
125
+ "rewards/format_reward": 0.9786458492279053,
126
+ "step": 90
127
+ },
128
+ {
129
+ "completion_length": 313.156778717041,
130
+ "epoch": 0.16,
131
+ "grad_norm": 0.14116181433200836,
132
+ "kl": 0.087481689453125,
133
+ "learning_rate": 1.5957446808510639e-06,
134
+ "loss": 0.0035,
135
+ "reward": 1.398958370089531,
136
+ "reward_std": 0.364690675213933,
137
+ "rewards/accuracy_reward": 0.43567709643393754,
138
+ "rewards/format_reward": 0.9632812708616256,
139
+ "step": 100
140
+ },
141
+ {
142
+ "completion_length": 317.794021987915,
143
+ "epoch": 0.176,
144
+ "grad_norm": 0.17862962186336517,
145
+ "kl": 0.09073486328125,
146
+ "learning_rate": 1.7553191489361702e-06,
147
+ "loss": 0.0036,
148
+ "reward": 1.4677083671092988,
149
+ "reward_std": 0.37521998956799507,
150
+ "rewards/accuracy_reward": 0.517708345875144,
151
+ "rewards/format_reward": 0.9500000178813934,
152
+ "step": 110
153
+ },
154
+ {
155
+ "completion_length": 310.7653747558594,
156
+ "epoch": 0.192,
157
+ "grad_norm": 0.160443514585495,
158
+ "kl": 0.095281982421875,
159
+ "learning_rate": 1.9148936170212767e-06,
160
+ "loss": 0.0038,
161
+ "reward": 1.5169271260499955,
162
+ "reward_std": 0.3428271571174264,
163
+ "rewards/accuracy_reward": 0.5375000145286322,
164
+ "rewards/format_reward": 0.979427094757557,
165
+ "step": 120
166
+ },
167
+ {
168
+ "completion_length": 293.892195892334,
169
+ "epoch": 0.208,
170
+ "grad_norm": 0.12249578535556793,
171
+ "kl": 0.093798828125,
172
+ "learning_rate": 2.074468085106383e-06,
173
+ "loss": 0.0037,
174
+ "reward": 1.5312500417232513,
175
+ "reward_std": 0.3389985624700785,
176
+ "rewards/accuracy_reward": 0.539322929829359,
177
+ "rewards/format_reward": 0.9919271007180214,
178
+ "step": 130
179
+ },
180
+ {
181
+ "completion_length": 325.6273529052734,
182
+ "epoch": 0.224,
183
+ "grad_norm": 0.14869874715805054,
184
+ "kl": 0.08721923828125,
185
+ "learning_rate": 2.2340425531914894e-06,
186
+ "loss": 0.0035,
187
+ "reward": 1.4973958760499955,
188
+ "reward_std": 0.32006428195163605,
189
+ "rewards/accuracy_reward": 0.5270833484828472,
190
+ "rewards/format_reward": 0.9703125178813934,
191
+ "step": 140
192
+ },
193
+ {
194
+ "completion_length": 302.0961029052734,
195
+ "epoch": 0.24,
196
+ "grad_norm": 0.15774066746234894,
197
+ "kl": 0.09039306640625,
198
+ "learning_rate": 2.3936170212765957e-06,
199
+ "loss": 0.0036,
200
+ "reward": 1.546093797683716,
201
+ "reward_std": 0.33077279273420573,
202
+ "rewards/accuracy_reward": 0.5557291835546494,
203
+ "rewards/format_reward": 0.9903646007180213,
204
+ "step": 150
205
+ },
206
+ {
207
+ "completion_length": 377.5010528564453,
208
+ "epoch": 0.256,
209
+ "grad_norm": 0.1264476478099823,
210
+ "kl": 0.083544921875,
211
+ "learning_rate": 2.553191489361702e-06,
212
+ "loss": 0.0033,
213
+ "reward": 1.4979167014360428,
214
+ "reward_std": 0.3458104237914085,
215
+ "rewards/accuracy_reward": 0.5213541844394058,
216
+ "rewards/format_reward": 0.9765625163912773,
217
+ "step": 160
218
+ },
219
+ {
220
+ "completion_length": 333.62370681762695,
221
+ "epoch": 0.272,
222
+ "grad_norm": 0.0962129607796669,
223
+ "kl": 0.0868896484375,
224
+ "learning_rate": 2.7127659574468088e-06,
225
+ "loss": 0.0035,
226
+ "reward": 1.55364588201046,
227
+ "reward_std": 0.3210131399333477,
228
+ "rewards/accuracy_reward": 0.5757812647148967,
229
+ "rewards/format_reward": 0.9778646036982537,
230
+ "step": 170
231
+ },
232
+ {
233
+ "completion_length": 372.2838665008545,
234
+ "epoch": 0.288,
235
+ "grad_norm": 0.23018397390842438,
236
+ "kl": 0.09453125,
237
+ "learning_rate": 2.872340425531915e-06,
238
+ "loss": 0.0038,
239
+ "reward": 1.533854204416275,
240
+ "reward_std": 0.3298664506524801,
241
+ "rewards/accuracy_reward": 0.5500000137835741,
242
+ "rewards/format_reward": 0.9838541820645332,
243
+ "step": 180
244
+ },
245
+ {
246
+ "completion_length": 352.70756072998046,
247
+ "epoch": 0.304,
248
+ "grad_norm": 0.14402048289775848,
249
+ "kl": 0.0962158203125,
250
+ "learning_rate": 2.999989596239813e-06,
251
+ "loss": 0.0039,
252
+ "reward": 1.5427083760499953,
253
+ "reward_std": 0.3494082003831863,
254
+ "rewards/accuracy_reward": 0.575781268440187,
255
+ "rewards/format_reward": 0.9669270977377892,
256
+ "step": 190
257
+ },
258
+ {
259
+ "completion_length": 340.1216236114502,
260
+ "epoch": 0.32,
261
+ "grad_norm": 0.12887056171894073,
262
+ "kl": 0.12586669921875,
263
+ "learning_rate": 2.9996254797863878e-06,
264
+ "loss": 0.005,
265
+ "reward": 1.4958333730697633,
266
+ "reward_std": 0.3522159656509757,
267
+ "rewards/accuracy_reward": 0.5208333488553762,
268
+ "rewards/format_reward": 0.9750000193715096,
269
+ "step": 200
270
+ },
271
+ {
272
+ "completion_length": 345.5015693664551,
273
+ "epoch": 0.336,
274
+ "grad_norm": 0.1841161698102951,
275
+ "kl": 0.13616943359375,
276
+ "learning_rate": 2.9987413196322384e-06,
277
+ "loss": 0.0054,
278
+ "reward": 1.5750000387430192,
279
+ "reward_std": 0.3604385921731591,
280
+ "rewards/accuracy_reward": 0.6200521003454924,
281
+ "rewards/format_reward": 0.9549479350447655,
282
+ "step": 210
283
+ },
284
+ {
285
+ "completion_length": 351.95599975585935,
286
+ "epoch": 0.352,
287
+ "grad_norm": 0.21690769493579865,
288
+ "kl": 0.113519287109375,
289
+ "learning_rate": 2.9973374223885316e-06,
290
+ "loss": 0.0045,
291
+ "reward": 1.456250038743019,
292
+ "reward_std": 0.3830007821321487,
293
+ "rewards/accuracy_reward": 0.5210937664844095,
294
+ "rewards/format_reward": 0.9351562723517418,
295
+ "step": 220
296
+ },
297
+ {
298
+ "completion_length": 338.8109489440918,
299
+ "epoch": 0.368,
300
+ "grad_norm": 0.15305453538894653,
301
+ "kl": 0.15860595703125,
302
+ "learning_rate": 2.9954142749021024e-06,
303
+ "loss": 0.0063,
304
+ "reward": 1.4955729603767396,
305
+ "reward_std": 0.3856545228511095,
306
+ "rewards/accuracy_reward": 0.540625018067658,
307
+ "rewards/format_reward": 0.9549479365348816,
308
+ "step": 230
309
+ },
310
+ {
311
+ "completion_length": 340.34349899291993,
312
+ "epoch": 0.384,
313
+ "grad_norm": 0.12304379045963287,
314
+ "kl": 0.13148193359375,
315
+ "learning_rate": 2.9929725440866226e-06,
316
+ "loss": 0.0053,
317
+ "reward": 1.5273437917232513,
318
+ "reward_std": 0.33333041463047264,
319
+ "rewards/accuracy_reward": 0.5708333509741351,
320
+ "rewards/format_reward": 0.9565104365348815,
321
+ "step": 240
322
+ },
323
+ {
324
+ "completion_length": 328.22422676086427,
325
+ "epoch": 0.4,
326
+ "grad_norm": 0.1456129401922226,
327
+ "kl": 0.16090087890625,
328
+ "learning_rate": 2.990013076691329e-06,
329
+ "loss": 0.0064,
330
+ "reward": 1.4192708760499955,
331
+ "reward_std": 0.38170270454138516,
332
+ "rewards/accuracy_reward": 0.48046876322478055,
333
+ "rewards/format_reward": 0.9388021036982537,
334
+ "step": 250
335
+ },
336
+ {
337
+ "completion_length": 346.2437599182129,
338
+ "epoch": 0.416,
339
+ "grad_norm": 0.14456409215927124,
340
+ "kl": 0.15968017578125,
341
+ "learning_rate": 2.986536899007383e-06,
342
+ "loss": 0.0064,
343
+ "reward": 1.4953125447034836,
344
+ "reward_std": 0.4336598340421915,
345
+ "rewards/accuracy_reward": 0.6145833546295763,
346
+ "rewards/format_reward": 0.8807291924953461,
347
+ "step": 260
348
+ },
349
+ {
350
+ "completion_length": 269.3726661682129,
351
+ "epoch": 0.432,
352
+ "grad_norm": 0.46196305751800537,
353
+ "kl": 0.2087890625,
354
+ "learning_rate": 2.982545216511974e-06,
355
+ "loss": 0.0084,
356
+ "reward": 1.3755208745598793,
357
+ "reward_std": 0.399412408657372,
358
+ "rewards/accuracy_reward": 0.46328125838190315,
359
+ "rewards/format_reward": 0.9122396051883698,
360
+ "step": 270
361
+ },
362
+ {
363
+ "completion_length": 343.7578243255615,
364
+ "epoch": 0.448,
365
+ "grad_norm": 0.14162611961364746,
366
+ "kl": 0.259228515625,
367
+ "learning_rate": 2.978039413450278e-06,
368
+ "loss": 0.0104,
369
+ "reward": 1.2468750298023223,
370
+ "reward_std": 0.5331707052886486,
371
+ "rewards/accuracy_reward": 0.40807292954996227,
372
+ "rewards/format_reward": 0.8388021022081376,
373
+ "step": 280
374
+ },
375
+ {
376
+ "completion_length": 283.88282241821287,
377
+ "epoch": 0.464,
378
+ "grad_norm": 0.12917938828468323,
379
+ "kl": 0.24149169921875,
380
+ "learning_rate": 2.9730210523554276e-06,
381
+ "loss": 0.0097,
382
+ "reward": 1.4640625447034836,
383
+ "reward_std": 0.39531214712187646,
384
+ "rewards/accuracy_reward": 0.5385416830889881,
385
+ "rewards/format_reward": 0.9255208507180214,
386
+ "step": 290
387
+ },
388
+ {
389
+ "completion_length": 348.46693687438966,
390
+ "epoch": 0.48,
391
+ "grad_norm": 0.10320460051298141,
392
+ "kl": 0.212744140625,
393
+ "learning_rate": 2.967491873506653e-06,
394
+ "loss": 0.0085,
395
+ "reward": 1.4231771245598792,
396
+ "reward_std": 0.4722843859344721,
397
+ "rewards/accuracy_reward": 0.5325520962476731,
398
+ "rewards/format_reward": 0.8906250193715095,
399
+ "step": 300
400
+ },
401
+ {
402
+ "completion_length": 385.8747501373291,
403
+ "epoch": 0.496,
404
+ "grad_norm": 0.09853401780128479,
405
+ "kl": 0.2241943359375,
406
+ "learning_rate": 2.9614537943257835e-06,
407
+ "loss": 0.009,
408
+ "reward": 1.4325521185994148,
409
+ "reward_std": 0.48100620210170747,
410
+ "rewards/accuracy_reward": 0.5578125163912773,
411
+ "rewards/format_reward": 0.8747396007180214,
412
+ "step": 310
413
+ },
414
+ {
415
+ "completion_length": 340.27865371704104,
416
+ "epoch": 0.512,
417
+ "grad_norm": 240231.90625,
418
+ "kl": 4838.629223632813,
419
+ "learning_rate": 2.9549089087123195e-06,
420
+ "loss": 193.2151,
421
+ "reward": 1.402343785762787,
422
+ "reward_std": 0.49140210878103974,
423
+ "rewards/accuracy_reward": 0.5153646014630795,
424
+ "rewards/format_reward": 0.8869791895151138,
425
+ "step": 320
426
+ },
427
+ {
428
+ "completion_length": 385.4213642120361,
429
+ "epoch": 0.528,
430
+ "grad_norm": 0.07590307295322418,
431
+ "kl": 12.74246826171875,
432
+ "learning_rate": 2.947859486317304e-06,
433
+ "loss": 0.5097,
434
+ "reward": 1.433593787252903,
435
+ "reward_std": 0.5454600352793932,
436
+ "rewards/accuracy_reward": 0.5776041799690574,
437
+ "rewards/format_reward": 0.8559896066784859,
438
+ "step": 330
439
+ },
440
+ {
441
+ "completion_length": 366.5921993255615,
442
+ "epoch": 0.544,
443
+ "grad_norm": 0.0868915244936943,
444
+ "kl": 0.27060546875,
445
+ "learning_rate": 2.9403079717562495e-06,
446
+ "loss": 0.0108,
447
+ "reward": 1.4158854514360428,
448
+ "reward_std": 0.5097951695322991,
449
+ "rewards/accuracy_reward": 0.5526041839271784,
450
+ "rewards/format_reward": 0.8632812693715095,
451
+ "step": 340
452
+ },
453
+ {
454
+ "completion_length": 342.1976657867432,
455
+ "epoch": 0.56,
456
+ "grad_norm": 0.09720102697610855,
457
+ "kl": 0.24512939453125,
458
+ "learning_rate": 2.9322569837613867e-06,
459
+ "loss": 0.0098,
460
+ "reward": 1.4158854573965072,
461
+ "reward_std": 0.4330069116316736,
462
+ "rewards/accuracy_reward": 0.5171875095693395,
463
+ "rewards/format_reward": 0.8986979350447655,
464
+ "step": 350
465
+ },
466
+ {
467
+ "completion_length": 304.5101634979248,
468
+ "epoch": 0.576,
469
+ "grad_norm": 0.1557752639055252,
470
+ "kl": 0.273779296875,
471
+ "learning_rate": 2.9237093142735355e-06,
472
+ "loss": 0.011,
473
+ "reward": 1.4440104573965074,
474
+ "reward_std": 0.45580658232793214,
475
+ "rewards/accuracy_reward": 0.5408854335546494,
476
+ "rewards/format_reward": 0.9031250193715096,
477
+ "step": 360
478
+ },
479
+ {
480
+ "completion_length": 337.13073883056643,
481
+ "epoch": 0.592,
482
+ "grad_norm": 0.07957520335912704,
483
+ "kl": 0.2844482421875,
484
+ "learning_rate": 2.914667927473909e-06,
485
+ "loss": 0.0114,
486
+ "reward": 1.4494792118668556,
487
+ "reward_std": 0.4396442363038659,
488
+ "rewards/accuracy_reward": 0.5385416800854728,
489
+ "rewards/format_reward": 0.9109375163912773,
490
+ "step": 370
491
+ },
492
+ {
493
+ "completion_length": 348.5554767608643,
494
+ "epoch": 0.608,
495
+ "grad_norm": 0.10430486500263214,
496
+ "kl": 0.2727783203125,
497
+ "learning_rate": 2.905135958756186e-06,
498
+ "loss": 0.0109,
499
+ "reward": 1.416666714847088,
500
+ "reward_std": 0.5037212844938039,
501
+ "rewards/accuracy_reward": 0.5440104316920042,
502
+ "rewards/format_reward": 0.8726562723517418,
503
+ "step": 380
504
+ },
505
+ {
506
+ "completion_length": 296.6213638305664,
507
+ "epoch": 0.624,
508
+ "grad_norm": 0.1668756604194641,
509
+ "kl": 1331.5044677734375,
510
+ "learning_rate": 2.8951167136392134e-06,
511
+ "loss": 53.281,
512
+ "reward": 1.3690104529261589,
513
+ "reward_std": 0.5218944691121579,
514
+ "rewards/accuracy_reward": 0.49401043094694613,
515
+ "rewards/format_reward": 0.8750000208616256,
516
+ "step": 390
517
+ },
518
+ {
519
+ "completion_length": 283.71016426086425,
520
+ "epoch": 0.64,
521
+ "grad_norm": 0.11033165454864502,
522
+ "kl": 0.2045654296875,
523
+ "learning_rate": 2.8846136666207118e-06,
524
+ "loss": 0.0082,
525
+ "reward": 1.5940104514360427,
526
+ "reward_std": 0.36332854218780997,
527
+ "rewards/accuracy_reward": 0.6401041854172945,
528
+ "rewards/format_reward": 0.9539062738418579,
529
+ "step": 400
530
+ },
531
+ {
532
+ "completion_length": 357.7877712249756,
533
+ "epoch": 0.656,
534
+ "grad_norm": 0.1104319766163826,
535
+ "kl": 74.237353515625,
536
+ "learning_rate": 2.873630459972376e-06,
537
+ "loss": 2.9658,
538
+ "reward": 1.471875038743019,
539
+ "reward_std": 0.4806873705238104,
540
+ "rewards/accuracy_reward": 0.5885416785255074,
541
+ "rewards/format_reward": 0.8833333522081375,
542
+ "step": 410
543
+ },
544
+ {
545
+ "completion_length": 314.5830821990967,
546
+ "epoch": 0.672,
547
+ "grad_norm": 0.1443065106868744,
548
+ "kl": 1.9264404296875,
549
+ "learning_rate": 2.8621709024768054e-06,
550
+ "loss": 0.0774,
551
+ "reward": 1.4846354559063912,
552
+ "reward_std": 0.4601195017807186,
553
+ "rewards/accuracy_reward": 0.578645845502615,
554
+ "rewards/format_reward": 0.9059896066784858,
555
+ "step": 420
556
+ },
557
+ {
558
+ "completion_length": 352.45912475585936,
559
+ "epoch": 0.688,
560
+ "grad_norm": 0.08876121789216995,
561
+ "kl": 0.278662109375,
562
+ "learning_rate": 2.8502389681066806e-06,
563
+ "loss": 0.0111,
564
+ "reward": 1.4117187947034835,
565
+ "reward_std": 0.46184736788272857,
566
+ "rewards/accuracy_reward": 0.5140625171363353,
567
+ "rewards/format_reward": 0.8976562708616257,
568
+ "step": 430
569
+ },
570
+ {
571
+ "completion_length": 285.142195892334,
572
+ "epoch": 0.704,
573
+ "grad_norm": 0.07999342679977417,
574
+ "kl": 2598.7319091796876,
575
+ "learning_rate": 2.8378387946466623e-06,
576
+ "loss": 103.7532,
577
+ "reward": 1.3726562917232514,
578
+ "reward_std": 0.49423595853149893,
579
+ "rewards/accuracy_reward": 0.47968751210719346,
580
+ "rewards/format_reward": 0.8929687663912773,
581
+ "step": 440
582
+ },
583
+ {
584
+ "completion_length": 417.71849822998047,
585
+ "epoch": 0.72,
586
+ "grad_norm": 0.08980146795511246,
587
+ "kl": 0.1867431640625,
588
+ "learning_rate": 2.8249746822584788e-06,
589
+ "loss": 0.0075,
590
+ "reward": 1.4705729529261589,
591
+ "reward_std": 0.4550738349556923,
592
+ "rewards/accuracy_reward": 0.5778646010905504,
593
+ "rewards/format_reward": 0.8927083507180213,
594
+ "step": 450
595
+ },
596
+ {
597
+ "completion_length": 499.32371215820314,
598
+ "epoch": 0.736,
599
+ "grad_norm": 0.09107893705368042,
600
+ "kl": 0.347216796875,
601
+ "learning_rate": 2.811651091989708e-06,
602
+ "loss": 0.0139,
603
+ "reward": 1.2427083723247052,
604
+ "reward_std": 0.6114235140383244,
605
+ "rewards/accuracy_reward": 0.48880209363996985,
606
+ "rewards/format_reward": 0.7539062686264515,
607
+ "step": 460
608
+ },
609
+ {
610
+ "completion_length": 363.605997467041,
611
+ "epoch": 0.752,
612
+ "grad_norm": 0.10554559528827667,
613
+ "kl": 1.361376953125,
614
+ "learning_rate": 2.797872644226761e-06,
615
+ "loss": 0.0545,
616
+ "reward": 1.5098958760499954,
617
+ "reward_std": 0.38472358537837864,
618
+ "rewards/accuracy_reward": 0.5791666805744171,
619
+ "rewards/format_reward": 0.9307291820645333,
620
+ "step": 470
621
+ },
622
+ {
623
+ "completion_length": 343.4364669799805,
624
+ "epoch": 0.768,
625
+ "grad_norm": 0.08596952259540558,
626
+ "kl": 0.2862548828125,
627
+ "learning_rate": 2.7836441170926177e-06,
628
+ "loss": 0.0114,
629
+ "reward": 1.4947917029261588,
630
+ "reward_std": 0.45332635566592216,
631
+ "rewards/accuracy_reward": 0.5903646016027778,
632
+ "rewards/format_reward": 0.904427108168602,
633
+ "step": 480
634
+ },
635
+ {
636
+ "completion_length": 372.5755313873291,
637
+ "epoch": 0.784,
638
+ "grad_norm": 0.12259896844625473,
639
+ "kl": 0.3115966796875,
640
+ "learning_rate": 2.768970444789855e-06,
641
+ "loss": 0.0125,
642
+ "reward": 1.3859375461935997,
643
+ "reward_std": 0.5074398431926965,
644
+ "rewards/accuracy_reward": 0.521354182693176,
645
+ "rewards/format_reward": 0.8645833596587181,
646
+ "step": 490
647
+ },
648
+ {
649
+ "completion_length": 343.65287551879885,
650
+ "epoch": 0.8,
651
+ "grad_norm": 0.32125625014305115,
652
+ "kl": 0.2789794921875,
653
+ "learning_rate": 2.753856715889552e-06,
654
+ "loss": 0.0112,
655
+ "reward": 1.3770833745598794,
656
+ "reward_std": 0.5012526127509773,
657
+ "rewards/accuracy_reward": 0.5059895979240536,
658
+ "rewards/format_reward": 0.8710937723517418,
659
+ "step": 500
660
+ },
661
+ {
662
+ "completion_length": 250.93281898498535,
663
+ "epoch": 0.816,
664
+ "grad_norm": 0.19703888893127441,
665
+ "kl": 4480.266870117188,
666
+ "learning_rate": 2.738308171566667e-06,
667
+ "loss": 179.2807,
668
+ "reward": 1.4348958730697632,
669
+ "reward_std": 0.4180175280198455,
670
+ "rewards/accuracy_reward": 0.4963541803881526,
671
+ "rewards/format_reward": 0.9385416880249977,
672
+ "step": 510
673
+ },
674
+ {
675
+ "completion_length": 276.1153732299805,
676
+ "epoch": 0.832,
677
+ "grad_norm": 0.10936518013477325,
678
+ "kl": 0.19671630859375,
679
+ "learning_rate": 2.7223302037824845e-06,
680
+ "loss": 0.0079,
681
+ "reward": 1.521875038743019,
682
+ "reward_std": 0.33053973913192747,
683
+ "rewards/accuracy_reward": 0.5567708510905505,
684
+ "rewards/format_reward": 0.9651041850447655,
685
+ "step": 520
686
+ },
687
+ {
688
+ "completion_length": 339.7869876861572,
689
+ "epoch": 0.848,
690
+ "grad_norm": 0.1296410709619522,
691
+ "kl": 0.8387939453125,
692
+ "learning_rate": 2.705928353414784e-06,
693
+ "loss": 0.0335,
694
+ "reward": 1.2877604514360428,
695
+ "reward_std": 0.5975749351084232,
696
+ "rewards/accuracy_reward": 0.4781250134110451,
697
+ "rewards/format_reward": 0.8096354395151139,
698
+ "step": 530
699
+ },
700
+ {
701
+ "completion_length": 333.3028755187988,
702
+ "epoch": 0.864,
703
+ "grad_norm": 0.20703841745853424,
704
+ "kl": 0.3625732421875,
705
+ "learning_rate": 2.6891083083363554e-06,
706
+ "loss": 0.0145,
707
+ "reward": 1.3070312827825545,
708
+ "reward_std": 0.5399560488760471,
709
+ "rewards/accuracy_reward": 0.45468751080334185,
710
+ "rewards/format_reward": 0.8523437708616257,
711
+ "step": 540
712
+ },
713
+ {
714
+ "completion_length": 272.563028717041,
715
+ "epoch": 0.88,
716
+ "grad_norm": 0.16747455298900604,
717
+ "kl": 0.30728759765625,
718
+ "learning_rate": 2.6718759014425513e-06,
719
+ "loss": 0.0123,
720
+ "reward": 1.534114620089531,
721
+ "reward_std": 0.3431927986443043,
722
+ "rewards/accuracy_reward": 0.5791666842997074,
723
+ "rewards/format_reward": 0.9549479365348816,
724
+ "step": 550
725
+ },
726
+ {
727
+ "completion_length": 317.7333419799805,
728
+ "epoch": 0.896,
729
+ "grad_norm": 0.3575699031352997,
730
+ "kl": 0.20316162109375,
731
+ "learning_rate": 2.6542371086285347e-06,
732
+ "loss": 0.0081,
733
+ "reward": 1.5716146260499955,
734
+ "reward_std": 0.3063303453847766,
735
+ "rewards/accuracy_reward": 0.6052083535119891,
736
+ "rewards/format_reward": 0.9664062723517418,
737
+ "step": 560
738
+ },
739
+ {
740
+ "completion_length": 380.475789642334,
741
+ "epoch": 0.912,
742
+ "grad_norm": 0.3914913237094879,
743
+ "kl": 0.68067626953125,
744
+ "learning_rate": 2.6361980467169505e-06,
745
+ "loss": 0.0273,
746
+ "reward": 1.397135455906391,
747
+ "reward_std": 0.4914455428719521,
748
+ "rewards/accuracy_reward": 0.5210937639698386,
749
+ "rewards/format_reward": 0.8760416865348816,
750
+ "step": 570
751
+ },
752
+ {
753
+ "completion_length": 375.67553367614744,
754
+ "epoch": 0.928,
755
+ "grad_norm": 0.31454476714134216,
756
+ "kl": 0.549169921875,
757
+ "learning_rate": 2.6177649713367136e-06,
758
+ "loss": 0.0219,
759
+ "reward": 1.503125038743019,
760
+ "reward_std": 0.5160485468804836,
761
+ "rewards/accuracy_reward": 0.6070312697440385,
762
+ "rewards/format_reward": 0.8960937678813934,
763
+ "step": 580
764
+ },
765
+ {
766
+ "completion_length": 362.68178100585936,
767
+ "epoch": 0.944,
768
+ "grad_norm": 0.08374358713626862,
769
+ "kl": 0.245947265625,
770
+ "learning_rate": 2.5989442747536697e-06,
771
+ "loss": 0.0098,
772
+ "reward": 1.5033854618668556,
773
+ "reward_std": 0.4191708039492369,
774
+ "rewards/accuracy_reward": 0.5708333518356085,
775
+ "rewards/format_reward": 0.9325521036982536,
776
+ "step": 590
777
+ },
778
+ {
779
+ "completion_length": 348.230997467041,
780
+ "epoch": 0.96,
781
+ "grad_norm": 0.08352825045585632,
782
+ "kl": 0.3398193359375,
783
+ "learning_rate": 2.5797424836538714e-06,
784
+ "loss": 0.0136,
785
+ "reward": 1.5054687887430191,
786
+ "reward_std": 0.40789004862308503,
787
+ "rewards/accuracy_reward": 0.5828125124797225,
788
+ "rewards/format_reward": 0.9226562663912773,
789
+ "step": 600
790
+ },
791
+ {
792
+ "completion_length": 348.3810001373291,
793
+ "epoch": 0.976,
794
+ "grad_norm": 0.09684169292449951,
795
+ "kl": 0.5585693359375,
796
+ "learning_rate": 2.560166256880234e-06,
797
+ "loss": 0.0224,
798
+ "reward": 1.5184896290302277,
799
+ "reward_std": 0.4260748438537121,
800
+ "rewards/accuracy_reward": 0.5945312634110451,
801
+ "rewards/format_reward": 0.9239583536982536,
802
+ "step": 610
803
+ },
804
+ {
805
+ "completion_length": 342.1513130187988,
806
+ "epoch": 0.992,
807
+ "grad_norm": 0.0948108583688736,
808
+ "kl": 0.31746826171875,
809
+ "learning_rate": 2.5402223831233723e-06,
810
+ "loss": 0.0127,
811
+ "reward": 1.5098958641290665,
812
+ "reward_std": 0.4502595506608486,
813
+ "rewards/accuracy_reward": 0.5950520992279053,
814
+ "rewards/format_reward": 0.9148437663912773,
815
+ "step": 620
816
+ },
817
+ {
818
+ "completion_length": 360.778133392334,
819
+ "epoch": 1.008,
820
+ "grad_norm": 0.14951100945472717,
821
+ "kl": 0.272119140625,
822
+ "learning_rate": 2.5199177785673957e-06,
823
+ "loss": 0.0109,
824
+ "reward": 1.5187500447034836,
825
+ "reward_std": 0.4504229260608554,
826
+ "rewards/accuracy_reward": 0.6013020960614085,
827
+ "rewards/format_reward": 0.91744794100523,
828
+ "step": 630
829
+ },
830
+ {
831
+ "completion_length": 363.9461048126221,
832
+ "epoch": 1.024,
833
+ "grad_norm": 0.22019609808921814,
834
+ "kl": 0.6080078125,
835
+ "learning_rate": 2.4992594844915022e-06,
836
+ "loss": 0.0243,
837
+ "reward": 1.4822917118668557,
838
+ "reward_std": 0.4976062387228012,
839
+ "rewards/accuracy_reward": 0.5966145992279053,
840
+ "rewards/format_reward": 0.8856771007180214,
841
+ "step": 640
842
+ },
843
+ {
844
+ "completion_length": 303.2153751373291,
845
+ "epoch": 1.04,
846
+ "grad_norm": 0.1117577999830246,
847
+ "kl": 0.28231201171875,
848
+ "learning_rate": 2.4782546648281847e-06,
849
+ "loss": 0.0113,
850
+ "reward": 1.504687535762787,
851
+ "reward_std": 0.3277318266220391,
852
+ "rewards/accuracy_reward": 0.5388020966434851,
853
+ "rewards/format_reward": 0.9658854335546494,
854
+ "step": 650
855
+ },
856
+ {
857
+ "completion_length": 301.4893325805664,
858
+ "epoch": 1.056,
859
+ "grad_norm": 0.09414847195148468,
860
+ "kl": 0.19752197265625,
861
+ "learning_rate": 2.4569106036789064e-06,
862
+ "loss": 0.0079,
863
+ "reward": 1.5304687917232513,
864
+ "reward_std": 0.28476983550935986,
865
+ "rewards/accuracy_reward": 0.5505208492279052,
866
+ "rewards/format_reward": 0.9799479380249977,
867
+ "step": 660
868
+ },
869
+ {
870
+ "completion_length": 380.32605056762696,
871
+ "epoch": 1.072,
872
+ "grad_norm": 0.08695989847183228,
873
+ "kl": 0.3002685546875,
874
+ "learning_rate": 2.4352347027881005e-06,
875
+ "loss": 0.012,
876
+ "reward": 1.4942708730697631,
877
+ "reward_std": 0.4118765268474817,
878
+ "rewards/accuracy_reward": 0.559375013038516,
879
+ "rewards/format_reward": 0.9348958566784858,
880
+ "step": 670
881
+ },
882
+ {
883
+ "completion_length": 362.15209197998047,
884
+ "epoch": 1.088,
885
+ "grad_norm": 0.10074878484010696,
886
+ "kl": 0.3934326171875,
887
+ "learning_rate": 2.413234478976379e-06,
888
+ "loss": 0.0157,
889
+ "reward": 1.5263021305203437,
890
+ "reward_std": 0.3859816137701273,
891
+ "rewards/accuracy_reward": 0.5898437647148966,
892
+ "rewards/format_reward": 0.9364583566784859,
893
+ "step": 680
894
+ },
895
+ {
896
+ "completion_length": 342.3330821990967,
897
+ "epoch": 1.104,
898
+ "grad_norm": 0.11779873073101044,
899
+ "kl": 0.4483154296875,
900
+ "learning_rate": 2.3909175615338297e-06,
901
+ "loss": 0.018,
902
+ "reward": 1.5794271260499955,
903
+ "reward_std": 0.43667961433529856,
904
+ "rewards/accuracy_reward": 0.6510416842997074,
905
+ "rewards/format_reward": 0.9283854380249977,
906
+ "step": 690
907
+ },
908
+ {
909
+ "completion_length": 364.8481903076172,
910
+ "epoch": 1.12,
911
+ "grad_norm": 0.2739701271057129,
912
+ "kl": 0.5840087890625,
913
+ "learning_rate": 2.368291689574312e-06,
914
+ "loss": 0.0233,
915
+ "reward": 1.4492187917232513,
916
+ "reward_std": 0.5059375043958425,
917
+ "rewards/accuracy_reward": 0.5679687663912774,
918
+ "rewards/format_reward": 0.8812500208616256,
919
+ "step": 700
920
+ },
921
+ {
922
+ "completion_length": 299.41016693115233,
923
+ "epoch": 1.1360000000000001,
924
+ "grad_norm": 0.11518736928701401,
925
+ "kl": 0.24130859375,
926
+ "learning_rate": 2.3453647093516705e-06,
927
+ "loss": 0.0096,
928
+ "reward": 1.6536458730697632,
929
+ "reward_std": 0.3213042883202434,
930
+ "rewards/accuracy_reward": 0.6833333440124989,
931
+ "rewards/format_reward": 0.9703125163912774,
932
+ "step": 710
933
+ },
934
+ {
935
+ "completion_length": 322.81980018615724,
936
+ "epoch": 1.152,
937
+ "grad_norm": 0.09168912470340729,
938
+ "kl": 0.46943359375,
939
+ "learning_rate": 2.322144571538792e-06,
940
+ "loss": 0.0188,
941
+ "reward": 1.5898437827825547,
942
+ "reward_std": 0.39194310661405324,
943
+ "rewards/accuracy_reward": 0.6382812660187482,
944
+ "rewards/format_reward": 0.9515625208616256,
945
+ "step": 720
946
+ },
947
+ {
948
+ "completion_length": 383.13386459350585,
949
+ "epoch": 1.168,
950
+ "grad_norm": 0.2942081093788147,
951
+ "kl": 0.3664794921875,
952
+ "learning_rate": 2.2986393284704496e-06,
953
+ "loss": 0.0147,
954
+ "reward": 1.4242187917232514,
955
+ "reward_std": 0.519075758382678,
956
+ "rewards/accuracy_reward": 0.5468750189524144,
957
+ "rewards/format_reward": 0.8773437738418579,
958
+ "step": 730
959
+ },
960
+ {
961
+ "completion_length": 323.92474937438965,
962
+ "epoch": 1.184,
963
+ "grad_norm": 0.7609843015670776,
964
+ "kl": 0.9059814453125,
965
+ "learning_rate": 2.2748571313509e-06,
966
+ "loss": 0.0363,
967
+ "reward": 1.4992187842726707,
968
+ "reward_std": 0.4844189383089542,
969
+ "rewards/accuracy_reward": 0.5958333497866988,
970
+ "rewards/format_reward": 0.9033854320645333,
971
+ "step": 740
972
+ },
973
+ {
974
+ "completion_length": 312.4018325805664,
975
+ "epoch": 1.2,
976
+ "grad_norm": 0.26806285977363586,
977
+ "kl": 0.352099609375,
978
+ "learning_rate": 2.2508062274271832e-06,
979
+ "loss": 0.0141,
980
+ "reward": 1.5622396349906922,
981
+ "reward_std": 0.3421931225806475,
982
+ "rewards/accuracy_reward": 0.6031250144354999,
983
+ "rewards/format_reward": 0.959114608168602,
984
+ "step": 750
985
+ },
986
+ {
987
+ "completion_length": 371.5671989440918,
988
+ "epoch": 1.216,
989
+ "grad_norm": 0.09768559783697128,
990
+ "kl": 0.418310546875,
991
+ "learning_rate": 2.2264949571291272e-06,
992
+ "loss": 0.0167,
993
+ "reward": 1.5015625447034835,
994
+ "reward_std": 0.4462232066318393,
995
+ "rewards/accuracy_reward": 0.5955729261040688,
996
+ "rewards/format_reward": 0.9059896036982537,
997
+ "step": 760
998
+ },
999
+ {
1000
+ "completion_length": 357.2544361114502,
1001
+ "epoch": 1.232,
1002
+ "grad_norm": 1.3492963314056396,
1003
+ "kl": 0.36956787109375,
1004
+ "learning_rate": 2.2019317511770334e-06,
1005
+ "loss": 0.0148,
1006
+ "reward": 1.5296875447034837,
1007
+ "reward_std": 0.38438957259058953,
1008
+ "rewards/accuracy_reward": 0.5861979339271783,
1009
+ "rewards/format_reward": 0.943489608168602,
1010
+ "step": 770
1011
+ },
1012
+ {
1013
+ "completion_length": 324.1862083435059,
1014
+ "epoch": 1.248,
1015
+ "grad_norm": 0.0821109488606453,
1016
+ "kl": 0.37724609375,
1017
+ "learning_rate": 2.1771251276580473e-06,
1018
+ "loss": 0.0151,
1019
+ "reward": 1.563802120089531,
1020
+ "reward_std": 0.38602438326925037,
1021
+ "rewards/accuracy_reward": 0.6151041872799397,
1022
+ "rewards/format_reward": 0.9486979365348815,
1023
+ "step": 780
1024
+ },
1025
+ {
1026
+ "completion_length": 343.0974063873291,
1027
+ "epoch": 1.264,
1028
+ "grad_norm": 0.11053454130887985,
1029
+ "kl": 0.3335693359375,
1030
+ "learning_rate": 2.152083689072242e-06,
1031
+ "loss": 0.0134,
1032
+ "reward": 1.500260454416275,
1033
+ "reward_std": 0.45653478614985943,
1034
+ "rewards/accuracy_reward": 0.5726562667638063,
1035
+ "rewards/format_reward": 0.92760419100523,
1036
+ "step": 790
1037
+ },
1038
+ {
1039
+ "completion_length": 333.49376106262207,
1040
+ "epoch": 1.28,
1041
+ "grad_norm": 0.09054333716630936,
1042
+ "kl": 0.4177734375,
1043
+ "learning_rate": 2.126816119349417e-06,
1044
+ "loss": 0.0167,
1045
+ "reward": 1.53333338201046,
1046
+ "reward_std": 0.4124399437569082,
1047
+ "rewards/accuracy_reward": 0.5903645984828472,
1048
+ "rewards/format_reward": 0.9429687693715095,
1049
+ "step": 800
1050
+ },
1051
+ {
1052
+ "completion_length": 309.3979267120361,
1053
+ "epoch": 1.296,
1054
+ "grad_norm": 0.1404261738061905,
1055
+ "kl": 0.30087890625,
1056
+ "learning_rate": 2.1013311808376683e-06,
1057
+ "loss": 0.012,
1058
+ "reward": 1.5450521230697631,
1059
+ "reward_std": 0.3885490225628018,
1060
+ "rewards/accuracy_reward": 0.5989583499729634,
1061
+ "rewards/format_reward": 0.9460937708616257,
1062
+ "step": 810
1063
+ },
1064
+ {
1065
+ "completion_length": 355.4174579620361,
1066
+ "epoch": 1.312,
1067
+ "grad_norm": 0.21735621988773346,
1068
+ "kl": 396.079345703125,
1069
+ "learning_rate": 2.075637711264759e-06,
1070
+ "loss": 15.8661,
1071
+ "reward": 1.4781250327825546,
1072
+ "reward_std": 0.475801320374012,
1073
+ "rewards/accuracy_reward": 0.5750000145286321,
1074
+ "rewards/format_reward": 0.9031250223517417,
1075
+ "step": 820
1076
+ },
1077
+ {
1078
+ "completion_length": 340.7921970367432,
1079
+ "epoch": 1.328,
1080
+ "grad_norm": 0.41135042905807495,
1081
+ "kl": 0.43037109375,
1082
+ "learning_rate": 2.04974462067335e-06,
1083
+ "loss": 0.0172,
1084
+ "reward": 1.5763021230697631,
1085
+ "reward_std": 0.45917638950049877,
1086
+ "rewards/accuracy_reward": 0.6552083536982536,
1087
+ "rewards/format_reward": 0.9210937678813934,
1088
+ "step": 830
1089
+ },
1090
+ {
1091
+ "completion_length": 345.1257911682129,
1092
+ "epoch": 1.3439999999999999,
1093
+ "grad_norm": 0.11835141479969025,
1094
+ "kl": 0.3072998046875,
1095
+ "learning_rate": 2.023660888331156e-06,
1096
+ "loss": 0.0123,
1097
+ "reward": 1.5898437917232513,
1098
+ "reward_std": 0.41639630161225794,
1099
+ "rewards/accuracy_reward": 0.6492187671363354,
1100
+ "rewards/format_reward": 0.9406250193715096,
1101
+ "step": 840
1102
+ },
1103
+ {
1104
+ "completion_length": 314.01824111938475,
1105
+ "epoch": 1.3599999999999999,
1106
+ "grad_norm": 0.11381607502698898,
1107
+ "kl": 0.320751953125,
1108
+ "learning_rate": 1.997395559617093e-06,
1109
+ "loss": 0.0128,
1110
+ "reward": 1.594791704416275,
1111
+ "reward_std": 0.34149147048592565,
1112
+ "rewards/accuracy_reward": 0.6294271037913859,
1113
+ "rewards/format_reward": 0.9653646007180214,
1114
+ "step": 850
1115
+ },
1116
+ {
1117
+ "completion_length": 324.5421962738037,
1118
+ "epoch": 1.376,
1119
+ "grad_norm": 0.23615330457687378,
1120
+ "kl": 0.45950927734375,
1121
+ "learning_rate": 1.9709577428844986e-06,
1122
+ "loss": 0.0184,
1123
+ "reward": 1.5335937917232514,
1124
+ "reward_std": 0.38021210972219704,
1125
+ "rewards/accuracy_reward": 0.5817708492279052,
1126
+ "rewards/format_reward": 0.9518229350447655,
1127
+ "step": 860
1128
+ },
1129
+ {
1130
+ "completion_length": 347.88047943115237,
1131
+ "epoch": 1.392,
1132
+ "grad_norm": 0.09267138689756393,
1133
+ "kl": 0.2773193359375,
1134
+ "learning_rate": 1.9443566063025173e-06,
1135
+ "loss": 0.0111,
1136
+ "reward": 1.4914062932133674,
1137
+ "reward_std": 0.4475890576839447,
1138
+ "rewards/accuracy_reward": 0.5679687656462192,
1139
+ "rewards/format_reward": 0.9234375193715095,
1140
+ "step": 870
1141
+ },
1142
+ {
1143
+ "completion_length": 324.02969856262206,
1144
+ "epoch": 1.408,
1145
+ "grad_norm": 0.08601139485836029,
1146
+ "kl": 0.30263671875,
1147
+ "learning_rate": 1.9176013746767422e-06,
1148
+ "loss": 0.0121,
1149
+ "reward": 1.6111979484558105,
1150
+ "reward_std": 0.40976997539401055,
1151
+ "rewards/accuracy_reward": 0.665104179084301,
1152
+ "rewards/format_reward": 0.9460937723517417,
1153
+ "step": 880
1154
+ },
1155
+ {
1156
+ "completion_length": 313.2916774749756,
1157
+ "epoch": 1.424,
1158
+ "grad_norm": 0.09291204810142517,
1159
+ "kl": 0.31865234375,
1160
+ "learning_rate": 1.8907013262502107e-06,
1161
+ "loss": 0.0127,
1162
+ "reward": 1.5414062976837157,
1163
+ "reward_std": 0.38301597684621813,
1164
+ "rewards/accuracy_reward": 0.5854166820645332,
1165
+ "rewards/format_reward": 0.9559895992279053,
1166
+ "step": 890
1167
+ },
1168
+ {
1169
+ "completion_length": 341.86511344909667,
1170
+ "epoch": 1.44,
1171
+ "grad_norm": 0.08695019036531448,
1172
+ "kl": 0.4276123046875,
1173
+ "learning_rate": 1.8636657894858784e-06,
1174
+ "loss": 0.0171,
1175
+ "reward": 1.5312500506639481,
1176
+ "reward_std": 0.3857471447438002,
1177
+ "rewards/accuracy_reward": 0.593750013038516,
1178
+ "rewards/format_reward": 0.9375000178813935,
1179
+ "step": 900
1180
+ },
1181
+ {
1182
+ "completion_length": 328.9026153564453,
1183
+ "epoch": 1.456,
1184
+ "grad_norm": 0.1095338836312294,
1185
+ "kl": 1.388330078125,
1186
+ "learning_rate": 1.8365041398316678e-06,
1187
+ "loss": 0.0556,
1188
+ "reward": 1.488802120089531,
1189
+ "reward_std": 0.4116742081940174,
1190
+ "rewards/accuracy_reward": 0.5505208489485085,
1191
+ "rewards/format_reward": 0.9382812678813934,
1192
+ "step": 910
1193
+ },
1194
+ {
1195
+ "completion_length": 348.82787590026857,
1196
+ "epoch": 1.472,
1197
+ "grad_norm": 0.12603142857551575,
1198
+ "kl": 0.378857421875,
1199
+ "learning_rate": 1.8092257964692304e-06,
1200
+ "loss": 0.0152,
1201
+ "reward": 1.4481771260499954,
1202
+ "reward_std": 0.49320419803261756,
1203
+ "rewards/accuracy_reward": 0.545833345502615,
1204
+ "rewards/format_reward": 0.9023437693715095,
1205
+ "step": 920
1206
+ },
1207
+ {
1208
+ "completion_length": 336.4057384490967,
1209
+ "epoch": 1.488,
1210
+ "grad_norm": 0.06563200801610947,
1211
+ "kl": 0.296435546875,
1212
+ "learning_rate": 1.781840219047541e-06,
1213
+ "loss": 0.0119,
1214
+ "reward": 1.5815104573965073,
1215
+ "reward_std": 0.4233523942530155,
1216
+ "rewards/accuracy_reward": 0.6494791835546494,
1217
+ "rewards/format_reward": 0.9320312693715096,
1218
+ "step": 930
1219
+ },
1220
+ {
1221
+ "completion_length": 389.78751373291016,
1222
+ "epoch": 1.504,
1223
+ "grad_norm": 0.13051985204219818,
1224
+ "kl": 0.4625,
1225
+ "learning_rate": 1.7543569044024565e-06,
1226
+ "loss": 0.0185,
1227
+ "reward": 1.4177083730697633,
1228
+ "reward_std": 0.5342824589461088,
1229
+ "rewards/accuracy_reward": 0.5640625163912774,
1230
+ "rewards/format_reward": 0.8536458507180213,
1231
+ "step": 940
1232
+ },
1233
+ {
1234
+ "completion_length": 309.4536560058594,
1235
+ "epoch": 1.52,
1236
+ "grad_norm": 0.2592553496360779,
1237
+ "kl": 0.3264892578125,
1238
+ "learning_rate": 1.7267853832633819e-06,
1239
+ "loss": 0.0131,
1240
+ "reward": 1.510416704416275,
1241
+ "reward_std": 0.4337383009493351,
1242
+ "rewards/accuracy_reward": 0.594010425824672,
1243
+ "rewards/format_reward": 0.9164062738418579,
1244
+ "step": 950
1245
+ },
1246
+ {
1247
+ "completion_length": 287.96485176086424,
1248
+ "epoch": 1.536,
1249
+ "grad_norm": 0.1538826823234558,
1250
+ "kl": 0.4028076171875,
1251
+ "learning_rate": 1.6991352169481808e-06,
1252
+ "loss": 0.0161,
1253
+ "reward": 1.5739583730697633,
1254
+ "reward_std": 0.3966914664953947,
1255
+ "rewards/accuracy_reward": 0.6291666841134429,
1256
+ "rewards/format_reward": 0.9447916880249977,
1257
+ "step": 960
1258
+ },
1259
+ {
1260
+ "completion_length": 341.0164161682129,
1261
+ "epoch": 1.552,
1262
+ "grad_norm": 0.18513712286949158,
1263
+ "kl": 0.560888671875,
1264
+ "learning_rate": 1.6714159940474768e-06,
1265
+ "loss": 0.0224,
1266
+ "reward": 1.5395833611488343,
1267
+ "reward_std": 0.4434517964720726,
1268
+ "rewards/accuracy_reward": 0.6177083533257246,
1269
+ "rewards/format_reward": 0.9218750253319741,
1270
+ "step": 970
1271
+ },
1272
+ {
1273
+ "completion_length": 350.5575626373291,
1274
+ "epoch": 1.568,
1275
+ "grad_norm": 0.07839391380548477,
1276
+ "kl": 0.440478515625,
1277
+ "learning_rate": 1.6436373270995033e-06,
1278
+ "loss": 0.0176,
1279
+ "reward": 1.5424479573965073,
1280
+ "reward_std": 0.4582442186772823,
1281
+ "rewards/accuracy_reward": 0.6197916835546493,
1282
+ "rewards/format_reward": 0.9226562708616257,
1283
+ "step": 980
1284
+ },
1285
+ {
1286
+ "completion_length": 336.3362071990967,
1287
+ "epoch": 1.584,
1288
+ "grad_norm": 0.11262823641300201,
1289
+ "kl": 0.4291748046875,
1290
+ "learning_rate": 1.61580884925664e-06,
1291
+ "loss": 0.0172,
1292
+ "reward": 1.5526042044162751,
1293
+ "reward_std": 0.44057157076895237,
1294
+ "rewards/accuracy_reward": 0.6263021004851907,
1295
+ "rewards/format_reward": 0.9263021007180214,
1296
+ "step": 990
1297
+ },
1298
+ {
1299
+ "completion_length": 385.09662437438965,
1300
+ "epoch": 1.6,
1301
+ "grad_norm": 0.09378820657730103,
1302
+ "kl": 40.2127197265625,
1303
+ "learning_rate": 1.5879402109448092e-06,
1304
+ "loss": 1.6059,
1305
+ "reward": 1.472916704416275,
1306
+ "reward_std": 0.49806156009435654,
1307
+ "rewards/accuracy_reward": 0.5927083514630794,
1308
+ "rewards/format_reward": 0.8802083507180214,
1309
+ "step": 1000
1310
+ },
1311
+ {
1312
+ "completion_length": 320.54193649291994,
1313
+ "epoch": 1.616,
1314
+ "grad_norm": 0.19597963988780975,
1315
+ "kl": 0.37021484375,
1316
+ "learning_rate": 1.5600410765168756e-06,
1317
+ "loss": 0.0148,
1318
+ "reward": 1.566406288743019,
1319
+ "reward_std": 0.39799929689615965,
1320
+ "rewards/accuracy_reward": 0.6265625130385161,
1321
+ "rewards/format_reward": 0.9398437708616256,
1322
+ "step": 1010
1323
+ },
1324
+ {
1325
+ "completion_length": 274.95834197998045,
1326
+ "epoch": 1.6320000000000001,
1327
+ "grad_norm": 0.10498908162117004,
1328
+ "kl": 1.54697265625,
1329
+ "learning_rate": 1.53212112090122e-06,
1330
+ "loss": 0.0618,
1331
+ "reward": 1.6328125432133676,
1332
+ "reward_std": 0.311348158121109,
1333
+ "rewards/accuracy_reward": 0.6619791840668767,
1334
+ "rewards/format_reward": 0.9708333551883698,
1335
+ "step": 1020
1336
+ },
1337
+ {
1338
+ "completion_length": 319.71302909851073,
1339
+ "epoch": 1.6480000000000001,
1340
+ "grad_norm": 0.09473922103643417,
1341
+ "kl": 0.5324951171875,
1342
+ "learning_rate": 1.5041900262466447e-06,
1343
+ "loss": 0.0213,
1344
+ "reward": 1.5330729544162751,
1345
+ "reward_std": 0.32746845642104744,
1346
+ "rewards/accuracy_reward": 0.5736979268491268,
1347
+ "rewards/format_reward": 0.9593750178813935,
1348
+ "step": 1030
1349
+ },
1350
+ {
1351
+ "completion_length": 355.3851661682129,
1352
+ "epoch": 1.6640000000000001,
1353
+ "grad_norm": 0.0937461331486702,
1354
+ "kl": 0.4345703125,
1355
+ "learning_rate": 1.4762574785647733e-06,
1356
+ "loss": 0.0174,
1357
+ "reward": 1.4458333671092987,
1358
+ "reward_std": 0.46327271312475204,
1359
+ "rewards/accuracy_reward": 0.5424479328095912,
1360
+ "rewards/format_reward": 0.9033854380249977,
1361
+ "step": 1040
1362
+ },
1363
+ {
1364
+ "completion_length": 351.1898559570312,
1365
+ "epoch": 1.6800000000000002,
1366
+ "grad_norm": 0.0828389897942543,
1367
+ "kl": 0.48388671875,
1368
+ "learning_rate": 1.448333164371115e-06,
1369
+ "loss": 0.0194,
1370
+ "reward": 1.484895871579647,
1371
+ "reward_std": 0.47403750047087667,
1372
+ "rewards/accuracy_reward": 0.5729166816920042,
1373
+ "rewards/format_reward": 0.91197919100523,
1374
+ "step": 1050
1375
+ },
1376
+ {
1377
+ "completion_length": 354.74141693115234,
1378
+ "epoch": 1.696,
1379
+ "grad_norm": 0.168987438082695,
1380
+ "kl": 0.7384521484375,
1381
+ "learning_rate": 1.4204267673259495e-06,
1382
+ "loss": 0.0295,
1383
+ "reward": 1.4638021171092988,
1384
+ "reward_std": 0.5317467883229255,
1385
+ "rewards/accuracy_reward": 0.5744791775941849,
1386
+ "rewards/format_reward": 0.8893229335546493,
1387
+ "step": 1060
1388
+ },
1389
+ {
1390
+ "completion_length": 304.412247467041,
1391
+ "epoch": 1.712,
1392
+ "grad_norm": 5.448803901672363,
1393
+ "kl": 0.60498046875,
1394
+ "learning_rate": 1.3925479648762055e-06,
1395
+ "loss": 0.0242,
1396
+ "reward": 1.3429687917232513,
1397
+ "reward_std": 0.5209484387189149,
1398
+ "rewards/accuracy_reward": 0.45364584792405366,
1399
+ "rewards/format_reward": 0.8893229365348816,
1400
+ "step": 1070
1401
+ },
1402
+ {
1403
+ "completion_length": 412.5049598693848,
1404
+ "epoch": 1.728,
1405
+ "grad_norm": 0.12441123276948929,
1406
+ "kl": 0.9303955078125,
1407
+ "learning_rate": 1.364706424899492e-06,
1408
+ "loss": 0.0372,
1409
+ "reward": 1.1434896126389504,
1410
+ "reward_std": 0.6584706656634808,
1411
+ "rewards/accuracy_reward": 0.40442709531635046,
1412
+ "rewards/format_reward": 0.7390625201165676,
1413
+ "step": 1080
1414
+ },
1415
+ {
1416
+ "completion_length": 301.4174571990967,
1417
+ "epoch": 1.744,
1418
+ "grad_norm": 0.2378871887922287,
1419
+ "kl": 0.33017578125,
1420
+ "learning_rate": 1.3369118023514485e-06,
1421
+ "loss": 0.0132,
1422
+ "reward": 1.4455729559063912,
1423
+ "reward_std": 0.4887973885983229,
1424
+ "rewards/accuracy_reward": 0.533854181971401,
1425
+ "rewards/format_reward": 0.9117187678813934,
1426
+ "step": 1090
1427
+ },
1428
+ {
1429
+ "completion_length": 302.38151969909666,
1430
+ "epoch": 1.76,
1431
+ "grad_norm": 0.15944868326187134,
1432
+ "kl": 0.4225830078125,
1433
+ "learning_rate": 1.3091737359175766e-06,
1434
+ "loss": 0.0169,
1435
+ "reward": 1.437239620089531,
1436
+ "reward_std": 0.5037642396986485,
1437
+ "rewards/accuracy_reward": 0.5348958517191932,
1438
+ "rewards/format_reward": 0.9023437738418579,
1439
+ "step": 1100
1440
+ },
1441
+ {
1442
+ "completion_length": 448.40626373291013,
1443
+ "epoch": 1.776,
1444
+ "grad_norm": 0.2753123342990875,
1445
+ "kl": 0.99765625,
1446
+ "learning_rate": 1.2815018446707142e-06,
1447
+ "loss": 0.0399,
1448
+ "reward": 1.141927120089531,
1449
+ "reward_std": 0.6968318119645118,
1450
+ "rewards/accuracy_reward": 0.4669270968064666,
1451
+ "rewards/format_reward": 0.6750000223517418,
1452
+ "step": 1110
1453
+ },
1454
+ {
1455
+ "completion_length": 335.4994888305664,
1456
+ "epoch": 1.792,
1457
+ "grad_norm": 0.13646121323108673,
1458
+ "kl": 0.5754638671875,
1459
+ "learning_rate": 1.253905724735309e-06,
1460
+ "loss": 0.023,
1461
+ "reward": 1.4078125417232514,
1462
+ "reward_std": 0.550966077670455,
1463
+ "rewards/accuracy_reward": 0.5497395996004343,
1464
+ "rewards/format_reward": 0.8580729365348816,
1465
+ "step": 1120
1466
+ },
1467
+ {
1468
+ "completion_length": 287.5849044799805,
1469
+ "epoch": 1.808,
1470
+ "grad_norm": 0.116419717669487,
1471
+ "kl": 0.38251953125,
1472
+ "learning_rate": 1.2263949459596545e-06,
1473
+ "loss": 0.0153,
1474
+ "reward": 1.5557292193174361,
1475
+ "reward_std": 0.370727850869298,
1476
+ "rewards/accuracy_reward": 0.600781269185245,
1477
+ "rewards/format_reward": 0.9549479365348816,
1478
+ "step": 1130
1479
+ },
1480
+ {
1481
+ "completion_length": 267.22839508056643,
1482
+ "epoch": 1.8239999999999998,
1483
+ "grad_norm": 0.22047029435634613,
1484
+ "kl": 0.32794189453125,
1485
+ "learning_rate": 1.1989790485972312e-06,
1486
+ "loss": 0.0131,
1487
+ "reward": 1.5026041999459268,
1488
+ "reward_std": 0.3551323272287846,
1489
+ "rewards/accuracy_reward": 0.5403646015096456,
1490
+ "rewards/format_reward": 0.9622396036982537,
1491
+ "step": 1140
1492
+ },
1493
+ {
1494
+ "completion_length": 308.1588619232178,
1495
+ "epoch": 1.8399999999999999,
1496
+ "grad_norm": 0.3132161498069763,
1497
+ "kl": 0.46527099609375,
1498
+ "learning_rate": 1.171667539998318e-06,
1499
+ "loss": 0.0186,
1500
+ "reward": 1.5867187917232513,
1501
+ "reward_std": 0.36549231559038164,
1502
+ "rewards/accuracy_reward": 0.6335937686264514,
1503
+ "rewards/format_reward": 0.9531250223517418,
1504
+ "step": 1150
1505
+ },
1506
+ {
1507
+ "completion_length": 339.93542861938477,
1508
+ "epoch": 1.8559999999999999,
1509
+ "grad_norm": 0.10203922539949417,
1510
+ "kl": 0.5742431640625,
1511
+ "learning_rate": 1.1444698913130093e-06,
1512
+ "loss": 0.023,
1513
+ "reward": 1.501041704416275,
1514
+ "reward_std": 0.48126591108739375,
1515
+ "rewards/accuracy_reward": 0.5880208533257246,
1516
+ "rewards/format_reward": 0.9130208522081376,
1517
+ "step": 1160
1518
+ },
1519
+ {
1520
+ "completion_length": 402.17761306762696,
1521
+ "epoch": 1.8719999999999999,
1522
+ "grad_norm": 0.10859699547290802,
1523
+ "kl": 0.718212890625,
1524
+ "learning_rate": 1.1173955342067857e-06,
1525
+ "loss": 0.0287,
1526
+ "reward": 1.335677121579647,
1527
+ "reward_std": 0.6192147806286812,
1528
+ "rewards/accuracy_reward": 0.5356770996004343,
1529
+ "rewards/format_reward": 0.8000000193715096,
1530
+ "step": 1170
1531
+ },
1532
+ {
1533
+ "completion_length": 330.6448013305664,
1534
+ "epoch": 1.888,
1535
+ "grad_norm": 0.09255196154117584,
1536
+ "kl": 0.36551513671875,
1537
+ "learning_rate": 1.090453857589783e-06,
1538
+ "loss": 0.0146,
1539
+ "reward": 1.5846354484558105,
1540
+ "reward_std": 0.43822822347283363,
1541
+ "rewards/accuracy_reward": 0.6536458495538682,
1542
+ "rewards/format_reward": 0.9309895977377891,
1543
+ "step": 1180
1544
+ },
1545
+ {
1546
+ "completion_length": 307.15391540527344,
1547
+ "epoch": 1.904,
1548
+ "grad_norm": 0.10617883503437042,
1549
+ "kl": 0.38302001953125,
1550
+ "learning_rate": 1.0636542043608775e-06,
1551
+ "loss": 0.0153,
1552
+ "reward": 1.607552121579647,
1553
+ "reward_std": 0.38010403923690317,
1554
+ "rewards/accuracy_reward": 0.6497395992279053,
1555
+ "rewards/format_reward": 0.9578125238418579,
1556
+ "step": 1190
1557
+ },
1558
+ {
1559
+ "completion_length": 332.0044364929199,
1560
+ "epoch": 1.92,
1561
+ "grad_norm": 0.22778630256652832,
1562
+ "kl": 0.4427490234375,
1563
+ "learning_rate": 1.0370058681677376e-06,
1564
+ "loss": 0.0177,
1565
+ "reward": 1.5015625342726708,
1566
+ "reward_std": 0.42089375481009483,
1567
+ "rewards/accuracy_reward": 0.5770833486691117,
1568
+ "rewards/format_reward": 0.9244791865348816,
1569
+ "step": 1200
1570
+ },
1571
+ {
1572
+ "completion_length": 315.778914642334,
1573
+ "epoch": 1.936,
1574
+ "grad_norm": 0.15557731688022614,
1575
+ "kl": 0.33568115234375,
1576
+ "learning_rate": 1.0105180901839485e-06,
1577
+ "loss": 0.0134,
1578
+ "reward": 1.5648437857627868,
1579
+ "reward_std": 0.4563456516712904,
1580
+ "rewards/accuracy_reward": 0.6401041850447655,
1581
+ "rewards/format_reward": 0.9247396036982536,
1582
+ "step": 1210
1583
+ },
1584
+ {
1585
+ "completion_length": 329.52292518615724,
1586
+ "epoch": 1.952,
1587
+ "grad_norm": 0.35561373829841614,
1588
+ "kl": 0.4545166015625,
1589
+ "learning_rate": 9.84200055904337e-07,
1590
+ "loss": 0.0182,
1591
+ "reward": 1.542187537252903,
1592
+ "reward_std": 0.39646931514143946,
1593
+ "rewards/accuracy_reward": 0.6049479361623525,
1594
+ "rewards/format_reward": 0.9372396036982537,
1595
+ "step": 1220
1596
+ },
1597
+ {
1598
+ "completion_length": 343.41563415527344,
1599
+ "epoch": 1.968,
1600
+ "grad_norm": 0.3309305012226105,
1601
+ "kl": 0.49996337890625,
1602
+ "learning_rate": 9.58060891959604e-07,
1603
+ "loss": 0.02,
1604
+ "reward": 1.484375037252903,
1605
+ "reward_std": 0.44305979572236537,
1606
+ "rewards/accuracy_reward": 0.5619791811332107,
1607
+ "rewards/format_reward": 0.9223958522081375,
1608
+ "step": 1230
1609
+ },
1610
+ {
1611
+ "completion_length": 340.05495872497556,
1612
+ "epoch": 1.984,
1613
+ "grad_norm": 0.17401637136936188,
1614
+ "kl": 0.4303955078125,
1615
+ "learning_rate": 9.321096629513677e-07,
1616
+ "loss": 0.0172,
1617
+ "reward": 1.4763021290302276,
1618
+ "reward_std": 0.4661326684057713,
1619
+ "rewards/accuracy_reward": 0.5549479309469462,
1620
+ "rewards/format_reward": 0.9213541880249977,
1621
+ "step": 1240
1622
+ },
1623
+ {
1624
+ "completion_length": 335.0432403564453,
1625
+ "epoch": 2.0,
1626
+ "grad_norm": 0.10272786021232605,
1627
+ "kl": 0.5320556640625,
1628
+ "learning_rate": 9.063553683087214e-07,
1629
+ "loss": 0.0213,
1630
+ "reward": 1.549739608168602,
1631
+ "reward_std": 0.46059494726359845,
1632
+ "rewards/accuracy_reward": 0.6302083522081375,
1633
+ "rewards/format_reward": 0.9195312708616257,
1634
+ "step": 1250
1635
+ },
1636
+ {
1637
+ "completion_length": 314.4708419799805,
1638
+ "epoch": 2.016,
1639
+ "grad_norm": 0.11312547326087952,
1640
+ "kl": 0.3264892578125,
1641
+ "learning_rate": 8.808069391673894e-07,
1642
+ "loss": 0.0131,
1643
+ "reward": 1.5486979544162751,
1644
+ "reward_std": 0.42191329710185527,
1645
+ "rewards/accuracy_reward": 0.6192708492279053,
1646
+ "rewards/format_reward": 0.929427108168602,
1647
+ "step": 1260
1648
+ },
1649
+ {
1650
+ "completion_length": 324.0794334411621,
1651
+ "epoch": 2.032,
1652
+ "grad_norm": 0.19456617534160614,
1653
+ "kl": 0.3976806640625,
1654
+ "learning_rate": 8.55473235272566e-07,
1655
+ "loss": 0.0159,
1656
+ "reward": 1.5580729603767396,
1657
+ "reward_std": 0.45290672667324544,
1658
+ "rewards/accuracy_reward": 0.6231770989950747,
1659
+ "rewards/format_reward": 0.934895858168602,
1660
+ "step": 1270
1661
+ },
1662
+ {
1663
+ "completion_length": 341.376053237915,
1664
+ "epoch": 2.048,
1665
+ "grad_norm": 0.1282634139060974,
1666
+ "kl": 0.478564453125,
1667
+ "learning_rate": 8.303630419065136e-07,
1668
+ "loss": 0.0191,
1669
+ "reward": 1.5843750417232514,
1670
+ "reward_std": 0.4248688681051135,
1671
+ "rewards/accuracy_reward": 0.6598958525806665,
1672
+ "rewards/format_reward": 0.9244791910052299,
1673
+ "step": 1280
1674
+ },
1675
+ {
1676
+ "completion_length": 351.30183334350585,
1677
+ "epoch": 2.064,
1678
+ "grad_norm": 0.09928528219461441,
1679
+ "kl": 0.44130859375,
1680
+ "learning_rate": 8.054850668419788e-07,
1681
+ "loss": 0.0177,
1682
+ "reward": 1.515104205906391,
1683
+ "reward_std": 0.4964366652071476,
1684
+ "rewards/accuracy_reward": 0.6174479354172945,
1685
+ "rewards/format_reward": 0.8976562708616257,
1686
+ "step": 1290
1687
+ },
1688
+ {
1689
+ "completion_length": 350.6877723693848,
1690
+ "epoch": 2.08,
1691
+ "grad_norm": 0.10390625149011612,
1692
+ "kl": 0.4825927734375,
1693
+ "learning_rate": 7.808479373224925e-07,
1694
+ "loss": 0.0193,
1695
+ "reward": 1.493229202926159,
1696
+ "reward_std": 0.4417869906872511,
1697
+ "rewards/accuracy_reward": 0.5815104300854728,
1698
+ "rewards/format_reward": 0.9117187693715095,
1699
+ "step": 1300
1700
+ },
1701
+ {
1702
+ "completion_length": 334.73959312438967,
1703
+ "epoch": 2.096,
1704
+ "grad_norm": 0.1110270768404007,
1705
+ "kl": 0.76192626953125,
1706
+ "learning_rate": 7.564601970705929e-07,
1707
+ "loss": 0.0306,
1708
+ "reward": 1.510677120089531,
1709
+ "reward_std": 0.4166031703352928,
1710
+ "rewards/accuracy_reward": 0.5739583484828472,
1711
+ "rewards/format_reward": 0.9367187678813934,
1712
+ "step": 1310
1713
+ },
1714
+ {
1715
+ "completion_length": 293.86120681762696,
1716
+ "epoch": 2.112,
1717
+ "grad_norm": 0.1455606073141098,
1718
+ "kl": 0.4578857421875,
1719
+ "learning_rate": 7.323303033250134e-07,
1720
+ "loss": 0.0183,
1721
+ "reward": 1.517187537252903,
1722
+ "reward_std": 0.3795573392882943,
1723
+ "rewards/accuracy_reward": 0.5739583510439843,
1724
+ "rewards/format_reward": 0.9432291880249977,
1725
+ "step": 1320
1726
+ },
1727
+ {
1728
+ "completion_length": 309.1671974182129,
1729
+ "epoch": 2.128,
1730
+ "grad_norm": 0.19481982290744781,
1731
+ "kl": 0.418798828125,
1732
+ "learning_rate": 7.0846662390786e-07,
1733
+ "loss": 0.0167,
1734
+ "reward": 1.4848958790302276,
1735
+ "reward_std": 0.40688302349299194,
1736
+ "rewards/accuracy_reward": 0.5481770981103182,
1737
+ "rewards/format_reward": 0.9367187663912773,
1738
+ "step": 1330
1739
+ },
1740
+ {
1741
+ "completion_length": 330.8593837738037,
1742
+ "epoch": 2.144,
1743
+ "grad_norm": 0.09199036657810211,
1744
+ "kl": 0.44635009765625,
1745
+ "learning_rate": 6.848774343228007e-07,
1746
+ "loss": 0.0179,
1747
+ "reward": 1.4914062917232513,
1748
+ "reward_std": 0.45433705151081083,
1749
+ "rewards/accuracy_reward": 0.5721354318782688,
1750
+ "rewards/format_reward": 0.9192708536982537,
1751
+ "step": 1340
1752
+ },
1753
+ {
1754
+ "completion_length": 338.9346446990967,
1755
+ "epoch": 2.16,
1756
+ "grad_norm": 0.10064072906970978,
1757
+ "kl": 0.5522216796875,
1758
+ "learning_rate": 6.615709148852632e-07,
1759
+ "loss": 0.0221,
1760
+ "reward": 1.5203125387430192,
1761
+ "reward_std": 0.4799085700884461,
1762
+ "rewards/accuracy_reward": 0.6000000141561032,
1763
+ "rewards/format_reward": 0.9203125193715096,
1764
+ "step": 1350
1765
+ },
1766
+ {
1767
+ "completion_length": 322.1612045288086,
1768
+ "epoch": 2.176,
1769
+ "grad_norm": 0.10341834276914597,
1770
+ "kl": 0.4356201171875,
1771
+ "learning_rate": 6.385551478856481e-07,
1772
+ "loss": 0.0174,
1773
+ "reward": 1.5250000357627869,
1774
+ "reward_std": 0.42158898171037434,
1775
+ "rewards/accuracy_reward": 0.5856770953163505,
1776
+ "rewards/format_reward": 0.9393229365348816,
1777
+ "step": 1360
1778
+ },
1779
+ {
1780
+ "completion_length": 319.66303024291994,
1781
+ "epoch": 2.192,
1782
+ "grad_norm": 0.08911896497011185,
1783
+ "kl": 0.33355712890625,
1784
+ "learning_rate": 6.158381147865313e-07,
1785
+ "loss": 0.0134,
1786
+ "reward": 1.6200521171092988,
1787
+ "reward_std": 0.3689839508384466,
1788
+ "rewards/accuracy_reward": 0.6757812671363354,
1789
+ "rewards/format_reward": 0.9442708596587182,
1790
+ "step": 1370
1791
+ },
1792
+ {
1793
+ "completion_length": 306.39219665527344,
1794
+ "epoch": 2.208,
1795
+ "grad_norm": 0.07315315306186676,
1796
+ "kl": 0.65413818359375,
1797
+ "learning_rate": 5.934276934548348e-07,
1798
+ "loss": 0.0262,
1799
+ "reward": 1.5802083760499954,
1800
+ "reward_std": 0.35810978449881076,
1801
+ "rewards/accuracy_reward": 0.6257812708616257,
1802
+ "rewards/format_reward": 0.9544270992279053,
1803
+ "step": 1380
1804
+ },
1805
+ {
1806
+ "completion_length": 351.4132900238037,
1807
+ "epoch": 2.224,
1808
+ "grad_norm": 0.08047836273908615,
1809
+ "kl": 0.442431640625,
1810
+ "learning_rate": 5.713316554299203e-07,
1811
+ "loss": 0.0177,
1812
+ "reward": 1.5190104573965073,
1813
+ "reward_std": 0.4470030918717384,
1814
+ "rewards/accuracy_reward": 0.5908854331821203,
1815
+ "rewards/format_reward": 0.9281250193715096,
1816
+ "step": 1390
1817
+ },
1818
+ {
1819
+ "completion_length": 360.53099937438964,
1820
+ "epoch": 2.24,
1821
+ "grad_norm": 0.1132533922791481,
1822
+ "kl": 0.3490234375,
1823
+ "learning_rate": 5.495576632285572e-07,
1824
+ "loss": 0.014,
1825
+ "reward": 1.596875047683716,
1826
+ "reward_std": 0.42701252046972515,
1827
+ "rewards/accuracy_reward": 0.6643229309469462,
1828
+ "rewards/format_reward": 0.9325521036982536,
1829
+ "step": 1400
1830
+ },
1831
+ {
1832
+ "completion_length": 329.94688377380373,
1833
+ "epoch": 2.2560000000000002,
1834
+ "grad_norm": 0.09439625591039658,
1835
+ "kl": 0.3957763671875,
1836
+ "learning_rate": 5.281132676876946e-07,
1837
+ "loss": 0.0158,
1838
+ "reward": 1.559114620089531,
1839
+ "reward_std": 0.4072124421596527,
1840
+ "rewards/accuracy_reward": 0.6242187682539224,
1841
+ "rewards/format_reward": 0.9348958551883697,
1842
+ "step": 1410
1843
+ },
1844
+ {
1845
+ "completion_length": 331.89454040527346,
1846
+ "epoch": 2.2720000000000002,
1847
+ "grad_norm": 0.2693132162094116,
1848
+ "kl": 0.326708984375,
1849
+ "learning_rate": 5.070059053459672e-07,
1850
+ "loss": 0.0131,
1851
+ "reward": 1.5700521126389504,
1852
+ "reward_std": 0.41562592387199404,
1853
+ "rewards/accuracy_reward": 0.6338541865348816,
1854
+ "rewards/format_reward": 0.9361979395151139,
1855
+ "step": 1420
1856
+ },
1857
+ {
1858
+ "completion_length": 315.82110328674315,
1859
+ "epoch": 2.288,
1860
+ "grad_norm": 0.31827375292778015,
1861
+ "kl": 0.413037109375,
1862
+ "learning_rate": 4.862428958648314e-07,
1863
+ "loss": 0.0165,
1864
+ "reward": 1.5156250312924384,
1865
+ "reward_std": 0.4274031076580286,
1866
+ "rewards/accuracy_reward": 0.5851562664844095,
1867
+ "rewards/format_reward": 0.9304687708616257,
1868
+ "step": 1430
1869
+ },
1870
+ {
1871
+ "completion_length": 309.80261077880857,
1872
+ "epoch": 2.304,
1873
+ "grad_norm": 0.09511108696460724,
1874
+ "kl": 0.5197265625,
1875
+ "learning_rate": 4.6583143949023923e-07,
1876
+ "loss": 0.0208,
1877
+ "reward": 1.5911458671092986,
1878
+ "reward_std": 0.41279490403831004,
1879
+ "rewards/accuracy_reward": 0.6476562671363354,
1880
+ "rewards/format_reward": 0.9434896051883698,
1881
+ "step": 1440
1882
+ },
1883
+ {
1884
+ "completion_length": 317.4851661682129,
1885
+ "epoch": 2.32,
1886
+ "grad_norm": 0.0870954692363739,
1887
+ "kl": 0.705419921875,
1888
+ "learning_rate": 4.4577861455571625e-07,
1889
+ "loss": 0.0282,
1890
+ "reward": 1.541927120089531,
1891
+ "reward_std": 0.44012959226965903,
1892
+ "rewards/accuracy_reward": 0.6156250163912773,
1893
+ "rewards/format_reward": 0.9263021036982536,
1894
+ "step": 1450
1895
+ },
1896
+ {
1897
+ "completion_length": 334.9497497558594,
1898
+ "epoch": 2.336,
1899
+ "grad_norm": 0.10319157689809799,
1900
+ "kl": 0.32333984375,
1901
+ "learning_rate": 4.2609137502772247e-07,
1902
+ "loss": 0.0129,
1903
+ "reward": 1.5619792103767396,
1904
+ "reward_std": 0.4711644366383553,
1905
+ "rewards/accuracy_reward": 0.6453125212341547,
1906
+ "rewards/format_reward": 0.9166666910052299,
1907
+ "step": 1460
1908
+ },
1909
+ {
1910
+ "completion_length": 320.07735481262205,
1911
+ "epoch": 2.352,
1912
+ "grad_norm": 0.1767028421163559,
1913
+ "kl": 0.49638671875,
1914
+ "learning_rate": 4.0677654809413873e-07,
1915
+ "loss": 0.0199,
1916
+ "reward": 1.5223958685994148,
1917
+ "reward_std": 0.40760069973766805,
1918
+ "rewards/accuracy_reward": 0.5927083479939028,
1919
+ "rewards/format_reward": 0.9296875223517418,
1920
+ "step": 1470
1921
+ },
1922
+ {
1923
+ "completion_length": 327.24089736938475,
1924
+ "epoch": 2.368,
1925
+ "grad_norm": 0.13433118164539337,
1926
+ "kl": 0.6244384765625,
1927
+ "learning_rate": 3.878408317967177e-07,
1928
+ "loss": 0.025,
1929
+ "reward": 1.5828125387430192,
1930
+ "reward_std": 0.4388178702443838,
1931
+ "rewards/accuracy_reward": 0.6481770999729634,
1932
+ "rewards/format_reward": 0.9346354365348816,
1933
+ "step": 1480
1934
+ },
1935
+ {
1936
+ "completion_length": 366.6963653564453,
1937
+ "epoch": 2.384,
1938
+ "grad_norm": 0.10366253554821014,
1939
+ "kl": 0.475390625,
1940
+ "learning_rate": 3.6929079270832173e-07,
1941
+ "loss": 0.019,
1942
+ "reward": 1.441927120089531,
1943
+ "reward_std": 0.5121089570224285,
1944
+ "rewards/accuracy_reward": 0.5583333490416408,
1945
+ "rewards/format_reward": 0.8835937723517417,
1946
+ "step": 1490
1947
+ },
1948
+ {
1949
+ "completion_length": 362.4604267120361,
1950
+ "epoch": 2.4,
1951
+ "grad_norm": 0.24114616215229034,
1952
+ "kl": 0.5971923828125,
1953
+ "learning_rate": 3.511328636557509e-07,
1954
+ "loss": 0.0239,
1955
+ "reward": 1.459895870089531,
1956
+ "reward_std": 0.5535307381302118,
1957
+ "rewards/accuracy_reward": 0.5890625186264515,
1958
+ "rewards/format_reward": 0.8708333536982537,
1959
+ "step": 1500
1960
+ },
1961
+ {
1962
+ "completion_length": 378.812771987915,
1963
+ "epoch": 2.416,
1964
+ "grad_norm": 0.5140863060951233,
1965
+ "kl": 0.47861328125,
1966
+ "learning_rate": 3.3337334148895143e-07,
1967
+ "loss": 0.0191,
1968
+ "reward": 1.4708333671092988,
1969
+ "reward_std": 0.5573876537382603,
1970
+ "rewards/accuracy_reward": 0.604427096247673,
1971
+ "rewards/format_reward": 0.8664062723517418,
1972
+ "step": 1510
1973
+ },
1974
+ {
1975
+ "completion_length": 295.7984432220459,
1976
+ "epoch": 2.432,
1977
+ "grad_norm": 0.0825420618057251,
1978
+ "kl": 0.3201416015625,
1979
+ "learning_rate": 3.160183848973795e-07,
1980
+ "loss": 0.0128,
1981
+ "reward": 1.6070312827825546,
1982
+ "reward_std": 0.3443769380450249,
1983
+ "rewards/accuracy_reward": 0.6369791872799396,
1984
+ "rewards/format_reward": 0.9700521051883697,
1985
+ "step": 1520
1986
+ },
1987
+ {
1988
+ "completion_length": 308.06641616821287,
1989
+ "epoch": 2.448,
1990
+ "grad_norm": 0.13088344037532806,
1991
+ "kl": 0.3154541015625,
1992
+ "learning_rate": 2.990740122742765e-07,
1993
+ "loss": 0.0126,
1994
+ "reward": 1.5820313006639481,
1995
+ "reward_std": 0.32235752418637276,
1996
+ "rewards/accuracy_reward": 0.6179687663912773,
1997
+ "rewards/format_reward": 0.9640625208616257,
1998
+ "step": 1530
1999
+ },
2000
+ {
2001
+ "completion_length": 313.82579040527344,
2002
+ "epoch": 2.464,
2003
+ "grad_norm": 0.13155396282672882,
2004
+ "kl": 0.2889404296875,
2005
+ "learning_rate": 2.82546099629595e-07,
2006
+ "loss": 0.0116,
2007
+ "reward": 1.5177083805203437,
2008
+ "reward_std": 0.38207798628136513,
2009
+ "rewards/accuracy_reward": 0.5718750163912774,
2010
+ "rewards/format_reward": 0.9458333477377892,
2011
+ "step": 1540
2012
+ },
2013
+ {
2014
+ "completion_length": 335.9320430755615,
2015
+ "epoch": 2.48,
2016
+ "grad_norm": 0.13609492778778076,
2017
+ "kl": 0.692578125,
2018
+ "learning_rate": 2.664403785523046e-07,
2019
+ "loss": 0.0277,
2020
+ "reward": 1.5653646260499954,
2021
+ "reward_std": 0.457539339363575,
2022
+ "rewards/accuracy_reward": 0.6510416842997074,
2023
+ "rewards/format_reward": 0.9143229365348816,
2024
+ "step": 1550
2025
+ },
2026
+ {
2027
+ "completion_length": 335.92474937438965,
2028
+ "epoch": 2.496,
2029
+ "grad_norm": 0.10897226631641388,
2030
+ "kl": 0.4633544921875,
2031
+ "learning_rate": 2.507624342227748e-07,
2032
+ "loss": 0.0185,
2033
+ "reward": 1.5093750327825546,
2034
+ "reward_std": 0.48894391059875486,
2035
+ "rewards/accuracy_reward": 0.6005208481103181,
2036
+ "rewards/format_reward": 0.9088541865348816,
2037
+ "step": 1560
2038
+ },
2039
+ {
2040
+ "completion_length": 346.82943687438967,
2041
+ "epoch": 2.512,
2042
+ "grad_norm": 0.3290146589279175,
2043
+ "kl": 0.521923828125,
2044
+ "learning_rate": 2.3551770347593443e-07,
2045
+ "loss": 0.0209,
2046
+ "reward": 1.5062500298023225,
2047
+ "reward_std": 0.49438975416123865,
2048
+ "rewards/accuracy_reward": 0.6013021029531955,
2049
+ "rewards/format_reward": 0.9049479335546493,
2050
+ "step": 1570
2051
+ },
2052
+ {
2053
+ "completion_length": 297.566414642334,
2054
+ "epoch": 2.528,
2055
+ "grad_norm": 0.11054307222366333,
2056
+ "kl": 0.3962158203125,
2057
+ "learning_rate": 2.2071147291587318e-07,
2058
+ "loss": 0.0158,
2059
+ "reward": 1.5473958730697632,
2060
+ "reward_std": 0.39565564077347515,
2061
+ "rewards/accuracy_reward": 0.6039062641561032,
2062
+ "rewards/format_reward": 0.9434896051883698,
2063
+ "step": 1580
2064
+ },
2065
+ {
2066
+ "completion_length": 284.1966236114502,
2067
+ "epoch": 2.544,
2068
+ "grad_norm": 0.13115550577640533,
2069
+ "kl": 0.2541015625,
2070
+ "learning_rate": 2.0634887708253957e-07,
2071
+ "loss": 0.0102,
2072
+ "reward": 1.6270833700895309,
2073
+ "reward_std": 0.37217756249010564,
2074
+ "rewards/accuracy_reward": 0.669791679829359,
2075
+ "rewards/format_reward": 0.9572916865348816,
2076
+ "step": 1590
2077
+ },
2078
+ {
2079
+ "completion_length": 299.0880302429199,
2080
+ "epoch": 2.56,
2081
+ "grad_norm": 0.17235107719898224,
2082
+ "kl": 0.345361328125,
2083
+ "learning_rate": 1.9243489667117404e-07,
2084
+ "loss": 0.0138,
2085
+ "reward": 1.496354204416275,
2086
+ "reward_std": 0.4093624118715525,
2087
+ "rewards/accuracy_reward": 0.559635432716459,
2088
+ "rewards/format_reward": 0.9367187663912773,
2089
+ "step": 1600
2090
+ },
2091
+ {
2092
+ "completion_length": 347.20313453674316,
2093
+ "epoch": 2.576,
2094
+ "grad_norm": 0.0926247164607048,
2095
+ "kl": 0.487939453125,
2096
+ "learning_rate": 1.7897435680509044e-07,
2097
+ "loss": 0.0195,
2098
+ "reward": 1.5723958775401115,
2099
+ "reward_std": 0.47892273142933844,
2100
+ "rewards/accuracy_reward": 0.6585937669500709,
2101
+ "rewards/format_reward": 0.9138020992279052,
2102
+ "step": 1610
2103
+ },
2104
+ {
2105
+ "completion_length": 353.61902084350584,
2106
+ "epoch": 2.592,
2107
+ "grad_norm": 0.10807590931653976,
2108
+ "kl": 509.08798828125,
2109
+ "learning_rate": 1.6597192536240918e-07,
2110
+ "loss": 20.4646,
2111
+ "reward": 1.5908854603767395,
2112
+ "reward_std": 0.398144971113652,
2113
+ "rewards/accuracy_reward": 0.649739598762244,
2114
+ "rewards/format_reward": 0.9411458477377892,
2115
+ "step": 1620
2116
+ },
2117
+ {
2118
+ "completion_length": 305.7497501373291,
2119
+ "epoch": 2.608,
2120
+ "grad_norm": 0.05855726823210716,
2121
+ "kl": 0.271142578125,
2122
+ "learning_rate": 1.5343211135731894e-07,
2123
+ "loss": 0.0108,
2124
+ "reward": 1.616406297683716,
2125
+ "reward_std": 0.3559125494211912,
2126
+ "rewards/accuracy_reward": 0.6567708469927311,
2127
+ "rewards/format_reward": 0.9596354380249977,
2128
+ "step": 1630
2129
+ },
2130
+ {
2131
+ "completion_length": 330.2669376373291,
2132
+ "epoch": 2.624,
2133
+ "grad_norm": 0.2727009654045105,
2134
+ "kl": 0.37744140625,
2135
+ "learning_rate": 1.413592633764292e-07,
2136
+ "loss": 0.0151,
2137
+ "reward": 1.6255208760499955,
2138
+ "reward_std": 0.4100566331297159,
2139
+ "rewards/accuracy_reward": 0.6791666850447655,
2140
+ "rewards/format_reward": 0.9463541865348816,
2141
+ "step": 1640
2142
+ },
2143
+ {
2144
+ "completion_length": 314.27292404174807,
2145
+ "epoch": 2.64,
2146
+ "grad_norm": 0.18453815579414368,
2147
+ "kl": 0.3802490234375,
2148
+ "learning_rate": 1.2975756807075945e-07,
2149
+ "loss": 0.0152,
2150
+ "reward": 1.5565104544162751,
2151
+ "reward_std": 0.35327375028282404,
2152
+ "rewards/accuracy_reward": 0.6018229356966913,
2153
+ "rewards/format_reward": 0.9546875223517418,
2154
+ "step": 1650
2155
+ },
2156
+ {
2157
+ "completion_length": 310.15131092071533,
2158
+ "epoch": 2.656,
2159
+ "grad_norm": 0.16150705516338348,
2160
+ "kl": 0.432373046875,
2161
+ "learning_rate": 1.1863104870387903e-07,
2162
+ "loss": 0.0173,
2163
+ "reward": 1.5888021260499954,
2164
+ "reward_std": 0.389334324374795,
2165
+ "rewards/accuracy_reward": 0.6361979298293591,
2166
+ "rewards/format_reward": 0.9526041895151138,
2167
+ "step": 1660
2168
+ },
2169
+ {
2170
+ "completion_length": 343.99792633056643,
2171
+ "epoch": 2.672,
2172
+ "grad_norm": 0.06966466456651688,
2173
+ "kl": 0.6599609375,
2174
+ "learning_rate": 1.0798356375671254e-07,
2175
+ "loss": 0.0264,
2176
+ "reward": 1.5226562947034836,
2177
+ "reward_std": 0.42317282818257806,
2178
+ "rewards/accuracy_reward": 0.5893229354172945,
2179
+ "rewards/format_reward": 0.9333333522081375,
2180
+ "step": 1670
2181
+ },
2182
+ {
2183
+ "completion_length": 347.6976665496826,
2184
+ "epoch": 2.6879999999999997,
2185
+ "grad_norm": 0.08115794509649277,
2186
+ "kl": 0.47548828125,
2187
+ "learning_rate": 9.781880558948619e-08,
2188
+ "loss": 0.019,
2189
+ "reward": 1.5763021200895309,
2190
+ "reward_std": 0.42064056508243086,
2191
+ "rewards/accuracy_reward": 0.6372396051883698,
2192
+ "rewards/format_reward": 0.9390625178813934,
2193
+ "step": 1680
2194
+ },
2195
+ {
2196
+ "completion_length": 333.13386459350585,
2197
+ "epoch": 2.7039999999999997,
2198
+ "grad_norm": 0.31740495562553406,
2199
+ "kl": 0.3748291015625,
2200
+ "learning_rate": 8.81402991612813e-08,
2201
+ "loss": 0.015,
2202
+ "reward": 1.6104167073965072,
2203
+ "reward_std": 0.4134950406849384,
2204
+ "rewards/accuracy_reward": 0.6638021025806665,
2205
+ "rewards/format_reward": 0.9466146036982537,
2206
+ "step": 1690
2207
+ },
2208
+ {
2209
+ "completion_length": 349.80261688232423,
2210
+ "epoch": 2.7199999999999998,
2211
+ "grad_norm": 0.15794631838798523,
2212
+ "kl": 0.6106201171875,
2213
+ "learning_rate": 7.895140080764201e-08,
2214
+ "loss": 0.0244,
2215
+ "reward": 1.4783854544162751,
2216
+ "reward_std": 0.5441196266561746,
2217
+ "rewards/accuracy_reward": 0.5888020968064666,
2218
+ "rewards/format_reward": 0.8895833522081376,
2219
+ "step": 1700
2220
+ },
2221
+ {
2222
+ "completion_length": 341.8935005187988,
2223
+ "epoch": 2.7359999999999998,
2224
+ "grad_norm": 0.13493210077285767,
2225
+ "kl": 0.650341796875,
2226
+ "learning_rate": 7.02552970766569e-08,
2227
+ "loss": 0.026,
2228
+ "reward": 1.546093788743019,
2229
+ "reward_std": 0.5227277502417564,
2230
+ "rewards/accuracy_reward": 0.6377604328095913,
2231
+ "rewards/format_reward": 0.9083333551883698,
2232
+ "step": 1710
2233
+ },
2234
+ {
2235
+ "completion_length": 316.40026931762696,
2236
+ "epoch": 2.752,
2237
+ "grad_norm": 0.17133887112140656,
2238
+ "kl": 0.316015625,
2239
+ "learning_rate": 6.205500362391853e-08,
2240
+ "loss": 0.0126,
2241
+ "reward": 1.5994792133569717,
2242
+ "reward_std": 0.39476869329810144,
2243
+ "rewards/accuracy_reward": 0.6406250201165676,
2244
+ "rewards/format_reward": 0.9588541895151138,
2245
+ "step": 1720
2246
+ },
2247
+ {
2248
+ "completion_length": 309.6942783355713,
2249
+ "epoch": 2.768,
2250
+ "grad_norm": 0.07311931252479553,
2251
+ "kl": 0.47498779296875,
2252
+ "learning_rate": 5.435336416674985e-08,
2253
+ "loss": 0.019,
2254
+ "reward": 1.528906300663948,
2255
+ "reward_std": 0.34818257931619884,
2256
+ "rewards/accuracy_reward": 0.5666666861623526,
2257
+ "rewards/format_reward": 0.9622396036982537,
2258
+ "step": 1730
2259
+ },
2260
+ {
2261
+ "completion_length": 317.2898525238037,
2262
+ "epoch": 2.784,
2263
+ "grad_norm": 0.15522390604019165,
2264
+ "kl": 0.29674072265625,
2265
+ "learning_rate": 4.7153049498051546e-08,
2266
+ "loss": 0.0119,
2267
+ "reward": 1.6304687857627869,
2268
+ "reward_std": 0.35606151502579453,
2269
+ "rewards/accuracy_reward": 0.6640625163912773,
2270
+ "rewards/format_reward": 0.9664062723517418,
2271
+ "step": 1740
2272
+ },
2273
+ {
2274
+ "completion_length": 306.6278762817383,
2275
+ "epoch": 2.8,
2276
+ "grad_norm": 0.09380000084638596,
2277
+ "kl": 0.2547119140625,
2278
+ "learning_rate": 4.0456556560117874e-08,
2279
+ "loss": 0.0102,
2280
+ "reward": 1.6122396111488342,
2281
+ "reward_std": 0.3659005742520094,
2282
+ "rewards/accuracy_reward": 0.6453125214204192,
2283
+ "rewards/format_reward": 0.9669271066784859,
2284
+ "step": 1750
2285
+ },
2286
+ {
2287
+ "completion_length": 322.19063262939454,
2288
+ "epoch": 2.816,
2289
+ "grad_norm": 0.16257521510124207,
2290
+ "kl": 0.37265625,
2291
+ "learning_rate": 3.426620757874266e-08,
2292
+ "loss": 0.0149,
2293
+ "reward": 1.596875038743019,
2294
+ "reward_std": 0.3646328579634428,
2295
+ "rewards/accuracy_reward": 0.6367187672294676,
2296
+ "rewards/format_reward": 0.9601562708616257,
2297
+ "step": 1760
2298
+ },
2299
+ {
2300
+ "completion_length": 369.0770942687988,
2301
+ "epoch": 2.832,
2302
+ "grad_norm": 1.67650306224823,
2303
+ "kl": 0.4777587890625,
2304
+ "learning_rate": 2.858414925791014e-08,
2305
+ "loss": 0.0191,
2306
+ "reward": 1.5520833730697632,
2307
+ "reward_std": 0.5112588044255972,
2308
+ "rewards/accuracy_reward": 0.6450520984828472,
2309
+ "rewards/format_reward": 0.9070312693715096,
2310
+ "step": 1770
2311
+ },
2312
+ {
2313
+ "completion_length": 395.6838626861572,
2314
+ "epoch": 2.848,
2315
+ "grad_norm": 0.08218298107385635,
2316
+ "kl": 0.565185546875,
2317
+ "learning_rate": 2.3412352035357797e-08,
2318
+ "loss": 0.0226,
2319
+ "reward": 1.4523437827825547,
2320
+ "reward_std": 0.5854175344109536,
2321
+ "rewards/accuracy_reward": 0.5934895996004343,
2322
+ "rewards/format_reward": 0.8588541835546494,
2323
+ "step": 1780
2324
+ },
2325
+ {
2326
+ "completion_length": 364.1682384490967,
2327
+ "epoch": 2.864,
2328
+ "grad_norm": 0.1337290108203888,
2329
+ "kl": 0.66181640625,
2330
+ "learning_rate": 1.87526093992616e-08,
2331
+ "loss": 0.0265,
2332
+ "reward": 1.4619792073965072,
2333
+ "reward_std": 0.4972026661038399,
2334
+ "rewards/accuracy_reward": 0.5640625156462192,
2335
+ "rewards/format_reward": 0.8979166850447655,
2336
+ "step": 1790
2337
+ },
2338
+ {
2339
+ "completion_length": 313.5166757583618,
2340
+ "epoch": 2.88,
2341
+ "grad_norm": 0.4620625972747803,
2342
+ "kl": 0.6297607421875,
2343
+ "learning_rate": 1.4606537266287522e-08,
2344
+ "loss": 0.0252,
2345
+ "reward": 1.5656250357627868,
2346
+ "reward_std": 0.42052843160927295,
2347
+ "rewards/accuracy_reward": 0.6260416898876429,
2348
+ "rewards/format_reward": 0.9395833551883698,
2349
+ "step": 1800
2350
+ },
2351
+ {
2352
+ "completion_length": 283.5046951293945,
2353
+ "epoch": 2.896,
2354
+ "grad_norm": 0.14225490391254425,
2355
+ "kl": 0.53448486328125,
2356
+ "learning_rate": 1.0975573421218632e-08,
2357
+ "loss": 0.0214,
2358
+ "reward": 1.6221354603767395,
2359
+ "reward_std": 0.35582950357347726,
2360
+ "rewards/accuracy_reward": 0.6682291835546493,
2361
+ "rewards/format_reward": 0.9539062708616257,
2362
+ "step": 1810
2363
+ },
2364
+ {
2365
+ "completion_length": 329.02943687438966,
2366
+ "epoch": 2.912,
2367
+ "grad_norm": 0.08317083865404129,
2368
+ "kl": 0.330859375,
2369
+ "learning_rate": 7.860977018357751e-09,
2370
+ "loss": 0.0132,
2371
+ "reward": 1.6283854573965073,
2372
+ "reward_std": 0.393698890786618,
2373
+ "rewards/accuracy_reward": 0.6736979335546494,
2374
+ "rewards/format_reward": 0.9546875268220901,
2375
+ "step": 1820
2376
+ },
2377
+ {
2378
+ "completion_length": 336.3953224182129,
2379
+ "epoch": 2.928,
2380
+ "grad_norm": 0.1257566511631012,
2381
+ "kl": 0.5287353515625,
2382
+ "learning_rate": 5.263828144873917e-09,
2383
+ "loss": 0.0212,
2384
+ "reward": 1.5440104603767395,
2385
+ "reward_std": 0.4020043730735779,
2386
+ "rewards/accuracy_reward": 0.5953125171363354,
2387
+ "rewards/format_reward": 0.9486979380249977,
2388
+ "step": 1830
2389
+ },
2390
+ {
2391
+ "completion_length": 359.2218837738037,
2392
+ "epoch": 2.944,
2393
+ "grad_norm": 0.20077994465827942,
2394
+ "kl": 0.4537841796875,
2395
+ "learning_rate": 3.1850274462484896e-09,
2396
+ "loss": 0.0181,
2397
+ "reward": 1.5343750327825547,
2398
+ "reward_std": 0.40093739330768585,
2399
+ "rewards/accuracy_reward": 0.5877604320645332,
2400
+ "rewards/format_reward": 0.9466146022081375,
2401
+ "step": 1840
2402
+ },
2403
+ {
2404
+ "completion_length": 352.94141693115233,
2405
+ "epoch": 2.96,
2406
+ "grad_norm": 0.08914138376712799,
2407
+ "kl": 0.3108154296875,
2408
+ "learning_rate": 1.6252958139456597e-09,
2409
+ "loss": 0.0124,
2410
+ "reward": 1.654687538743019,
2411
+ "reward_std": 0.3981630776077509,
2412
+ "rewards/accuracy_reward": 0.7039062689989806,
2413
+ "rewards/format_reward": 0.9507812678813934,
2414
+ "step": 1850
2415
+ },
2416
+ {
2417
+ "completion_length": 343.89792518615724,
2418
+ "epoch": 2.976,
2419
+ "grad_norm": 0.07618039101362228,
2420
+ "kl": 0.2248779296875,
2421
+ "learning_rate": 5.85174135421418e-10,
2422
+ "loss": 0.009,
2423
+ "reward": 1.6197917073965074,
2424
+ "reward_std": 0.3660704350098968,
2425
+ "rewards/accuracy_reward": 0.6570312656462193,
2426
+ "rewards/format_reward": 0.9627604365348816,
2427
+ "step": 1860
2428
+ },
2429
+ {
2430
+ "completion_length": 344.7703212738037,
2431
+ "epoch": 2.992,
2432
+ "grad_norm": 0.16367003321647644,
2433
+ "kl": 0.4246337890625,
2434
+ "learning_rate": 6.502310655193133e-11,
2435
+ "loss": 0.017,
2436
+ "reward": 1.587239620089531,
2437
+ "reward_std": 0.4006639949977398,
2438
+ "rewards/accuracy_reward": 0.6445312701165676,
2439
+ "rewards/format_reward": 0.9427083522081375,
2440
+ "step": 1870
2441
+ },
2442
+ {
2443
+ "completion_length": 341.2281364440918,
2444
+ "epoch": 3.0,
2445
+ "kl": 0.54423828125,
2446
+ "reward": 1.5484375357627869,
2447
+ "reward_std": 0.4545022763311863,
2448
+ "rewards/accuracy_reward": 0.6192708536982536,
2449
+ "rewards/format_reward": 0.9291666805744171,
2450
+ "step": 1875,
2451
+ "total_flos": 0.0,
2452
+ "train_loss": 0.11509215348958969,
2453
+ "train_runtime": 61764.0604,
2454
+ "train_samples_per_second": 0.364,
2455
+ "train_steps_per_second": 0.03
2456
+ }
2457
+ ],
2458
+ "logging_steps": 10,
2459
+ "max_steps": 1875,
2460
+ "num_input_tokens_seen": 0,
2461
+ "num_train_epochs": 3,
2462
+ "save_steps": 500,
2463
+ "stateful_callbacks": {
2464
+ "TrainerControl": {
2465
+ "args": {
2466
+ "should_epoch_stop": false,
2467
+ "should_evaluate": false,
2468
+ "should_log": false,
2469
+ "should_save": true,
2470
+ "should_training_stop": true
2471
+ },
2472
+ "attributes": {}
2473
+ }
2474
+ },
2475
+ "total_flos": 0.0,
2476
+ "train_batch_size": 1,
2477
+ "trial_name": null,
2478
+ "trial_params": null
2479
+ }
training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8d79238d3e63d399d212ba5fa35d2af5406413c042d8466d3421ae87535238b0
3
+ size 7096
vocab.json ADDED
The diff for this file is too large to render. See raw diff
 
wandb_run_id.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ d1x61l64