fxevangelinenyu commited on
Commit
3120e39
·
verified ·
1 Parent(s): d0bc082

upload rlrb_bs128_nobuf (8/8)

Browse files
Files changed (49) hide show
  1. .gitattributes +4 -0
  2. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/config.json +67 -0
  3. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/eval_metrics.json +1146 -0
  4. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/generation_config.json +6 -0
  5. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/merges.txt +0 -0
  6. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/model-00001-of-00002.safetensors +3 -0
  7. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/model-00002-of-00002.safetensors +3 -0
  8. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/model.safetensors.index.json +443 -0
  9. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/special_tokens_map.json +31 -0
  10. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/tokenizer.json +3 -0
  11. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/tokenizer_config.json +207 -0
  12. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/vocab.json +0 -0
  13. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/added_tokens.json +24 -0
  14. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/chat_template.jinja +54 -0
  15. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/config.json +67 -0
  16. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/eval_metrics.json +1148 -0
  17. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/generation_config.json +6 -0
  18. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/merges.txt +0 -0
  19. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/model-00001-of-00002.safetensors +3 -0
  20. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/model-00002-of-00002.safetensors +3 -0
  21. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/model.safetensors.index.json +443 -0
  22. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/special_tokens_map.json +31 -0
  23. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/tokenizer.json +3 -0
  24. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/tokenizer_config.json +207 -0
  25. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/vocab.json +0 -0
  26. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/added_tokens.json +24 -0
  27. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/chat_template.jinja +54 -0
  28. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/config.json +67 -0
  29. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/generation_config.json +6 -0
  30. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/merges.txt +0 -0
  31. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/model-00001-of-00002.safetensors +3 -0
  32. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/model-00002-of-00002.safetensors +3 -0
  33. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/model.safetensors.index.json +443 -0
  34. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/special_tokens_map.json +31 -0
  35. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/tokenizer.json +3 -0
  36. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/tokenizer_config.json +207 -0
  37. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/vocab.json +0 -0
  38. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/added_tokens.json +24 -0
  39. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/chat_template.jinja +54 -0
  40. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/config.json +67 -0
  41. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/generation_config.json +6 -0
  42. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/merges.txt +0 -0
  43. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/model-00001-of-00002.safetensors +3 -0
  44. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/model-00002-of-00002.safetensors +3 -0
  45. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/model.safetensors.index.json +443 -0
  46. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/special_tokens_map.json +31 -0
  47. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/tokenizer.json +3 -0
  48. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/tokenizer_config.json +207 -0
  49. rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/vocab.json +0 -0
.gitattributes CHANGED
@@ -124,3 +124,7 @@ rlrb_bs128_nobuf/checkpoints_hf_format/global_step_550/tokenizer.json filter=lfs
124
  rlrb_bs128_nobuf/checkpoints_hf_format/global_step_600/tokenizer.json filter=lfs diff=lfs merge=lfs -text
125
  rlrb_bs128_nobuf/checkpoints_hf_format/global_step_650/tokenizer.json filter=lfs diff=lfs merge=lfs -text
126
  rlrb_bs128_nobuf/checkpoints_hf_format/global_step_700/tokenizer.json filter=lfs diff=lfs merge=lfs -text
 
 
 
 
 
124
  rlrb_bs128_nobuf/checkpoints_hf_format/global_step_600/tokenizer.json filter=lfs diff=lfs merge=lfs -text
125
  rlrb_bs128_nobuf/checkpoints_hf_format/global_step_650/tokenizer.json filter=lfs diff=lfs merge=lfs -text
126
  rlrb_bs128_nobuf/checkpoints_hf_format/global_step_700/tokenizer.json filter=lfs diff=lfs merge=lfs -text
127
+ rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/tokenizer.json filter=lfs diff=lfs merge=lfs -text
128
+ rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/tokenizer.json filter=lfs diff=lfs merge=lfs -text
129
+ rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/tokenizer.json filter=lfs diff=lfs merge=lfs -text
130
+ rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/tokenizer.json filter=lfs diff=lfs merge=lfs -text
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/config.json ADDED
@@ -0,0 +1,67 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen2ForCausalLM"
4
+ ],
5
+ "attention_dropout": 0.0,
6
+ "dtype": "bfloat16",
7
+ "eos_token_id": 151643,
8
+ "hidden_act": "silu",
9
+ "hidden_size": 2048,
10
+ "initializer_range": 0.02,
11
+ "intermediate_size": 11008,
12
+ "layer_types": [
13
+ "full_attention",
14
+ "full_attention",
15
+ "full_attention",
16
+ "full_attention",
17
+ "full_attention",
18
+ "full_attention",
19
+ "full_attention",
20
+ "full_attention",
21
+ "full_attention",
22
+ "full_attention",
23
+ "full_attention",
24
+ "full_attention",
25
+ "full_attention",
26
+ "full_attention",
27
+ "full_attention",
28
+ "full_attention",
29
+ "full_attention",
30
+ "full_attention",
31
+ "full_attention",
32
+ "full_attention",
33
+ "full_attention",
34
+ "full_attention",
35
+ "full_attention",
36
+ "full_attention",
37
+ "full_attention",
38
+ "full_attention",
39
+ "full_attention",
40
+ "full_attention",
41
+ "full_attention",
42
+ "full_attention",
43
+ "full_attention",
44
+ "full_attention",
45
+ "full_attention",
46
+ "full_attention",
47
+ "full_attention",
48
+ "full_attention"
49
+ ],
50
+ "max_position_embeddings": 32768,
51
+ "max_window_layers": 36,
52
+ "model_type": "qwen2",
53
+ "num_attention_heads": 16,
54
+ "num_hidden_layers": 36,
55
+ "num_key_value_heads": 2,
56
+ "pad_token_id": 151643,
57
+ "rms_norm_eps": 1e-06,
58
+ "rope_scaling": null,
59
+ "rope_theta": 1000000.0,
60
+ "sliding_window": null,
61
+ "tie_word_embeddings": true,
62
+ "transformers_version": "4.57.6",
63
+ "use_cache": true,
64
+ "use_mrope": false,
65
+ "use_sliding_window": false,
66
+ "vocab_size": 151936
67
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/eval_metrics.json ADDED
@@ -0,0 +1,1146 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "global_step": 750,
3
+ "ckpt_dir": "/mnt/mystorageoutput/projects/jy_intern/amlt-results/7213899235.25497-028989ec-3fee/qwen3b_kk_rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750",
4
+ "rollouts_dir": "/mnt/mystorageoutput/projects/jy_intern/amlt-results/7213899235.25497-028989ec-3fee/qwen3b_kk_rlrb_bs128_nobuf/rollouts/training",
5
+ "init_model_path": "Qwen/Qwen2.5-3B",
6
+ "prev_step": null,
7
+ "positive_score": 1.0,
8
+ "negative_score": 0.0,
9
+ "history_step_stride": 25,
10
+ "max_samples_per_class": 0,
11
+ "in_batch": {
12
+ "num_records": 1024,
13
+ "source_steps": [
14
+ 750
15
+ ],
16
+ "num_source_steps": 1,
17
+ "num_positives_pre_cap": 453,
18
+ "num_negatives_pre_cap": 571,
19
+ "positive": {
20
+ "loss": 0.45325678729953195,
21
+ "token_entropy": 0.022797478501887576,
22
+ "num_supervised_tokens": 168318,
23
+ "kl_from_init": 3.3278250386672754,
24
+ "kl_to_init": 0.35545366028163466,
25
+ "dead_units": {
26
+ "layer_0": {
27
+ "intermediate_size": 11008,
28
+ "dead_count": 0,
29
+ "dead_fraction": 0.0,
30
+ "mean_activation_freq": 0.9235875144202061,
31
+ "min_activation_freq": 0.7821979823904752
32
+ },
33
+ "layer_1": {
34
+ "intermediate_size": 11008,
35
+ "dead_count": 8841,
36
+ "dead_fraction": 0.8031431686046512,
37
+ "mean_activation_freq": 0.14743887871469483,
38
+ "min_activation_freq": 0.0
39
+ },
40
+ "layer_2": {
41
+ "intermediate_size": 11008,
42
+ "dead_count": 7474,
43
+ "dead_fraction": 0.6789607558139535,
44
+ "mean_activation_freq": 0.1664064564933085,
45
+ "min_activation_freq": 0.0
46
+ },
47
+ "layer_3": {
48
+ "intermediate_size": 11008,
49
+ "dead_count": 412,
50
+ "dead_fraction": 0.037427325581395346,
51
+ "mean_activation_freq": 0.38553146744727657,
52
+ "min_activation_freq": 0.0
53
+ },
54
+ "layer_4": {
55
+ "intermediate_size": 11008,
56
+ "dead_count": 23,
57
+ "dead_fraction": 0.0020893895348837207,
58
+ "mean_activation_freq": 0.5480919687992993,
59
+ "min_activation_freq": 0.0
60
+ },
61
+ "layer_5": {
62
+ "intermediate_size": 11008,
63
+ "dead_count": 7,
64
+ "dead_fraction": 0.0006359011627906977,
65
+ "mean_activation_freq": 0.7149102855333772,
66
+ "min_activation_freq": 0.0
67
+ },
68
+ "layer_6": {
69
+ "intermediate_size": 11008,
70
+ "dead_count": 0,
71
+ "dead_fraction": 0.0,
72
+ "mean_activation_freq": 0.869979923690781,
73
+ "min_activation_freq": 0.0948324005751019
74
+ },
75
+ "layer_7": {
76
+ "intermediate_size": 11008,
77
+ "dead_count": 0,
78
+ "dead_fraction": 0.0,
79
+ "mean_activation_freq": 0.8846149474912451,
80
+ "min_activation_freq": 0.033430767951140104
81
+ },
82
+ "layer_8": {
83
+ "intermediate_size": 11008,
84
+ "dead_count": 0,
85
+ "dead_fraction": 0.0,
86
+ "mean_activation_freq": 0.9413034146053001,
87
+ "min_activation_freq": 0.08650292897966944
88
+ },
89
+ "layer_9": {
90
+ "intermediate_size": 11008,
91
+ "dead_count": 0,
92
+ "dead_fraction": 0.0,
93
+ "mean_activation_freq": 0.9493722788003094,
94
+ "min_activation_freq": 0.2516961941087703
95
+ },
96
+ "layer_10": {
97
+ "intermediate_size": 11008,
98
+ "dead_count": 0,
99
+ "dead_fraction": 0.0,
100
+ "mean_activation_freq": 0.9738937207891307,
101
+ "min_activation_freq": 0.6803372188357751
102
+ },
103
+ "layer_11": {
104
+ "intermediate_size": 11008,
105
+ "dead_count": 0,
106
+ "dead_fraction": 0.0,
107
+ "mean_activation_freq": 0.9851206491719579,
108
+ "min_activation_freq": 0.9345702776886607
109
+ },
110
+ "layer_12": {
111
+ "intermediate_size": 11008,
112
+ "dead_count": 0,
113
+ "dead_fraction": 0.0,
114
+ "mean_activation_freq": 0.9867980872549662,
115
+ "min_activation_freq": 0.921969129861334
116
+ },
117
+ "layer_13": {
118
+ "intermediate_size": 11008,
119
+ "dead_count": 0,
120
+ "dead_fraction": 0.0,
121
+ "mean_activation_freq": 0.9808055267695465,
122
+ "min_activation_freq": 0.8957211944058271
123
+ },
124
+ "layer_14": {
125
+ "intermediate_size": 11008,
126
+ "dead_count": 0,
127
+ "dead_fraction": 0.0,
128
+ "mean_activation_freq": 0.9830454054541558,
129
+ "min_activation_freq": 0.8914316947682364
130
+ },
131
+ "layer_15": {
132
+ "intermediate_size": 11008,
133
+ "dead_count": 0,
134
+ "dead_fraction": 0.0,
135
+ "mean_activation_freq": 0.9802573663729881,
136
+ "min_activation_freq": 0.9044249575208831
137
+ },
138
+ "layer_16": {
139
+ "intermediate_size": 11008,
140
+ "dead_count": 0,
141
+ "dead_fraction": 0.0,
142
+ "mean_activation_freq": 0.9795600957875072,
143
+ "min_activation_freq": 0.9020187977518744
144
+ },
145
+ "layer_17": {
146
+ "intermediate_size": 11008,
147
+ "dead_count": 0,
148
+ "dead_fraction": 0.0,
149
+ "mean_activation_freq": 0.9794714477676115,
150
+ "min_activation_freq": 0.9179113344977959
151
+ },
152
+ "layer_18": {
153
+ "intermediate_size": 11008,
154
+ "dead_count": 0,
155
+ "dead_fraction": 0.0,
156
+ "mean_activation_freq": 0.9799149005130999,
157
+ "min_activation_freq": 0.9240841740039687
158
+ },
159
+ "layer_19": {
160
+ "intermediate_size": 11008,
161
+ "dead_count": 0,
162
+ "dead_fraction": 0.0,
163
+ "mean_activation_freq": 0.9769697780970447,
164
+ "min_activation_freq": 0.9145664753621122
165
+ },
166
+ "layer_20": {
167
+ "intermediate_size": 11008,
168
+ "dead_count": 0,
169
+ "dead_fraction": 0.0,
170
+ "mean_activation_freq": 0.9794848002099846,
171
+ "min_activation_freq": 0.9099799189629155
172
+ },
173
+ "layer_21": {
174
+ "intermediate_size": 11008,
175
+ "dead_count": 0,
176
+ "dead_fraction": 0.0,
177
+ "mean_activation_freq": 0.9796269648620883,
178
+ "min_activation_freq": 0.9209591368718735
179
+ },
180
+ "layer_22": {
181
+ "intermediate_size": 11008,
182
+ "dead_count": 0,
183
+ "dead_fraction": 0.0,
184
+ "mean_activation_freq": 0.979407364679592,
185
+ "min_activation_freq": 0.9276666785489371
186
+ },
187
+ "layer_23": {
188
+ "intermediate_size": 11008,
189
+ "dead_count": 0,
190
+ "dead_fraction": 0.0,
191
+ "mean_activation_freq": 0.9795879545737002,
192
+ "min_activation_freq": 0.9395786546893381
193
+ },
194
+ "layer_24": {
195
+ "intermediate_size": 11008,
196
+ "dead_count": 0,
197
+ "dead_fraction": 0.0,
198
+ "mean_activation_freq": 0.981656298090381,
199
+ "min_activation_freq": 0.9285697311042195
200
+ },
201
+ "layer_25": {
202
+ "intermediate_size": 11008,
203
+ "dead_count": 0,
204
+ "dead_fraction": 0.0,
205
+ "mean_activation_freq": 0.9837133767656225,
206
+ "min_activation_freq": 0.9495597618792999
207
+ },
208
+ "layer_26": {
209
+ "intermediate_size": 11008,
210
+ "dead_count": 0,
211
+ "dead_fraction": 0.0,
212
+ "mean_activation_freq": 0.9856755904935758,
213
+ "min_activation_freq": 0.9559405411185969
214
+ },
215
+ "layer_27": {
216
+ "intermediate_size": 11008,
217
+ "dead_count": 0,
218
+ "dead_fraction": 0.0,
219
+ "mean_activation_freq": 0.9869053207520468,
220
+ "min_activation_freq": 0.9421274017039176
221
+ },
222
+ "layer_28": {
223
+ "intermediate_size": 11008,
224
+ "dead_count": 0,
225
+ "dead_fraction": 0.0,
226
+ "mean_activation_freq": 0.9872669835813274,
227
+ "min_activation_freq": 0.21370857543459404
228
+ },
229
+ "layer_29": {
230
+ "intermediate_size": 11008,
231
+ "dead_count": 0,
232
+ "dead_fraction": 0.0,
233
+ "mean_activation_freq": 0.9884800276045177,
234
+ "min_activation_freq": 0.9600280421582956
235
+ },
236
+ "layer_30": {
237
+ "intermediate_size": 11008,
238
+ "dead_count": 0,
239
+ "dead_fraction": 0.0,
240
+ "mean_activation_freq": 0.9900361462812501,
241
+ "min_activation_freq": 0.5407264820161837
242
+ },
243
+ "layer_31": {
244
+ "intermediate_size": 11008,
245
+ "dead_count": 0,
246
+ "dead_fraction": 0.0,
247
+ "mean_activation_freq": 0.990910520769518,
248
+ "min_activation_freq": 0.9425432811701661
249
+ },
250
+ "layer_32": {
251
+ "intermediate_size": 11008,
252
+ "dead_count": 0,
253
+ "dead_fraction": 0.0,
254
+ "mean_activation_freq": 0.9890807741720614,
255
+ "min_activation_freq": 0.5043192053137514
256
+ },
257
+ "layer_33": {
258
+ "intermediate_size": 11008,
259
+ "dead_count": 0,
260
+ "dead_fraction": 0.0,
261
+ "mean_activation_freq": 0.9869938360031139,
262
+ "min_activation_freq": 0.9253555769436425
263
+ },
264
+ "layer_34": {
265
+ "intermediate_size": 11008,
266
+ "dead_count": 0,
267
+ "dead_fraction": 0.0,
268
+ "mean_activation_freq": 0.9881469888711829,
269
+ "min_activation_freq": 0.886417376632327
270
+ },
271
+ "layer_35": {
272
+ "intermediate_size": 11008,
273
+ "dead_count": 0,
274
+ "dead_fraction": 0.0,
275
+ "mean_activation_freq": 0.9918065975641829,
276
+ "min_activation_freq": 0.007200655901329627
277
+ },
278
+ "_overall": {
279
+ "dead_count": 16757,
280
+ "intermediate_total": 396288,
281
+ "dead_fraction": 0.04228490390826874
282
+ }
283
+ },
284
+ "size": 453,
285
+ "size_pre_filter": 453,
286
+ "skipped_long": 0
287
+ },
288
+ "negative": {
289
+ "loss": 0.4100134591283212,
290
+ "token_entropy": 0.021796946699098624,
291
+ "num_supervised_tokens": 247590,
292
+ "kl_from_init": 3.1038108498740358,
293
+ "kl_to_init": 0.3386095654122341,
294
+ "dead_units": {
295
+ "layer_0": {
296
+ "intermediate_size": 11008,
297
+ "dead_count": 0,
298
+ "dead_fraction": 0.0,
299
+ "mean_activation_freq": 0.9240783973639606,
300
+ "min_activation_freq": 0.7826204612464154
301
+ },
302
+ "layer_1": {
303
+ "intermediate_size": 11008,
304
+ "dead_count": 8832,
305
+ "dead_fraction": 0.8023255813953488,
306
+ "mean_activation_freq": 0.14721590514830407,
307
+ "min_activation_freq": 0.0
308
+ },
309
+ "layer_2": {
310
+ "intermediate_size": 11008,
311
+ "dead_count": 4136,
312
+ "dead_fraction": 0.3757267441860465,
313
+ "mean_activation_freq": 0.16631032858793657,
314
+ "min_activation_freq": 0.0
315
+ },
316
+ "layer_3": {
317
+ "intermediate_size": 11008,
318
+ "dead_count": 323,
319
+ "dead_fraction": 0.029342296511627907,
320
+ "mean_activation_freq": 0.3855395441562476,
321
+ "min_activation_freq": 0.0
322
+ },
323
+ "layer_4": {
324
+ "intermediate_size": 11008,
325
+ "dead_count": 16,
326
+ "dead_fraction": 0.0014534883720930232,
327
+ "mean_activation_freq": 0.552293104436653,
328
+ "min_activation_freq": 0.0
329
+ },
330
+ "layer_5": {
331
+ "intermediate_size": 11008,
332
+ "dead_count": 4,
333
+ "dead_fraction": 0.0003633720930232558,
334
+ "mean_activation_freq": 0.7174159317330695,
335
+ "min_activation_freq": 0.0
336
+ },
337
+ "layer_6": {
338
+ "intermediate_size": 11008,
339
+ "dead_count": 0,
340
+ "dead_fraction": 0.0,
341
+ "mean_activation_freq": 0.8720936638790968,
342
+ "min_activation_freq": 0.09792802617230098
343
+ },
344
+ "layer_7": {
345
+ "intermediate_size": 11008,
346
+ "dead_count": 0,
347
+ "dead_fraction": 0.0,
348
+ "mean_activation_freq": 0.8865057412908107,
349
+ "min_activation_freq": 0.04291368795185589
350
+ },
351
+ "layer_8": {
352
+ "intermediate_size": 11008,
353
+ "dead_count": 0,
354
+ "dead_fraction": 0.0,
355
+ "mean_activation_freq": 0.941743213076969,
356
+ "min_activation_freq": 0.0849993941596995
357
+ },
358
+ "layer_9": {
359
+ "intermediate_size": 11008,
360
+ "dead_count": 0,
361
+ "dead_fraction": 0.0,
362
+ "mean_activation_freq": 0.9501064484009573,
363
+ "min_activation_freq": 0.26198957954683144
364
+ },
365
+ "layer_10": {
366
+ "intermediate_size": 11008,
367
+ "dead_count": 0,
368
+ "dead_fraction": 0.0,
369
+ "mean_activation_freq": 0.9741517872553038,
370
+ "min_activation_freq": 0.6813078072620057
371
+ },
372
+ "layer_11": {
373
+ "intermediate_size": 11008,
374
+ "dead_count": 0,
375
+ "dead_fraction": 0.0,
376
+ "mean_activation_freq": 0.9850777068703934,
377
+ "min_activation_freq": 0.9329334787350054
378
+ },
379
+ "layer_12": {
380
+ "intermediate_size": 11008,
381
+ "dead_count": 0,
382
+ "dead_fraction": 0.0,
383
+ "mean_activation_freq": 0.986771501621562,
384
+ "min_activation_freq": 0.9199361848216809
385
+ },
386
+ "layer_13": {
387
+ "intermediate_size": 11008,
388
+ "dead_count": 0,
389
+ "dead_fraction": 0.0,
390
+ "mean_activation_freq": 0.9806958792057763,
391
+ "min_activation_freq": 0.8973544973544973
392
+ },
393
+ "layer_14": {
394
+ "intermediate_size": 11008,
395
+ "dead_count": 0,
396
+ "dead_fraction": 0.0,
397
+ "mean_activation_freq": 0.9829867154103935,
398
+ "min_activation_freq": 0.8916999878831939
399
+ },
400
+ "layer_15": {
401
+ "intermediate_size": 11008,
402
+ "dead_count": 0,
403
+ "dead_fraction": 0.0,
404
+ "mean_activation_freq": 0.980183229046027,
405
+ "min_activation_freq": 0.9064461407972858
406
+ },
407
+ "layer_16": {
408
+ "intermediate_size": 11008,
409
+ "dead_count": 0,
410
+ "dead_fraction": 0.0,
411
+ "mean_activation_freq": 0.9795234784250406,
412
+ "min_activation_freq": 0.9024072054606406
413
+ },
414
+ "layer_17": {
415
+ "intermediate_size": 11008,
416
+ "dead_count": 0,
417
+ "dead_fraction": 0.0,
418
+ "mean_activation_freq": 0.9794200375779492,
419
+ "min_activation_freq": 0.9190556969182924
420
+ },
421
+ "layer_18": {
422
+ "intermediate_size": 11008,
423
+ "dead_count": 0,
424
+ "dead_fraction": 0.0,
425
+ "mean_activation_freq": 0.979910998273355,
426
+ "min_activation_freq": 0.9213780847368633
427
+ },
428
+ "layer_19": {
429
+ "intermediate_size": 11008,
430
+ "dead_count": 0,
431
+ "dead_fraction": 0.0,
432
+ "mean_activation_freq": 0.9769378292935762,
433
+ "min_activation_freq": 0.9153560321499252
434
+ },
435
+ "layer_20": {
436
+ "intermediate_size": 11008,
437
+ "dead_count": 0,
438
+ "dead_fraction": 0.0,
439
+ "mean_activation_freq": 0.9794807551629099,
440
+ "min_activation_freq": 0.9124964659315804
441
+ },
442
+ "layer_21": {
443
+ "intermediate_size": 11008,
444
+ "dead_count": 0,
445
+ "dead_fraction": 0.0,
446
+ "mean_activation_freq": 0.9795149976881792,
447
+ "min_activation_freq": 0.9223191566703017
448
+ },
449
+ "layer_22": {
450
+ "intermediate_size": 11008,
451
+ "dead_count": 0,
452
+ "dead_fraction": 0.0,
453
+ "mean_activation_freq": 0.9792063023887485,
454
+ "min_activation_freq": 0.9283573649985863
455
+ },
456
+ "layer_23": {
457
+ "intermediate_size": 11008,
458
+ "dead_count": 0,
459
+ "dead_fraction": 0.0,
460
+ "mean_activation_freq": 0.9792843538601655,
461
+ "min_activation_freq": 0.9377680843329698
462
+ },
463
+ "layer_24": {
464
+ "intermediate_size": 11008,
465
+ "dead_count": 0,
466
+ "dead_fraction": 0.0,
467
+ "mean_activation_freq": 0.9814428305434152,
468
+ "min_activation_freq": 0.9303041318308494
469
+ },
470
+ "layer_25": {
471
+ "intermediate_size": 11008,
472
+ "dead_count": 0,
473
+ "dead_fraction": 0.0,
474
+ "mean_activation_freq": 0.9834631934699339,
475
+ "min_activation_freq": 0.9498243063128559
476
+ },
477
+ "layer_26": {
478
+ "intermediate_size": 11008,
479
+ "dead_count": 0,
480
+ "dead_fraction": 0.0,
481
+ "mean_activation_freq": 0.9854662397547239,
482
+ "min_activation_freq": 0.9552485964699705
483
+ },
484
+ "layer_27": {
485
+ "intermediate_size": 11008,
486
+ "dead_count": 0,
487
+ "dead_fraction": 0.0,
488
+ "mean_activation_freq": 0.9867001003775231,
489
+ "min_activation_freq": 0.9397431237125894
490
+ },
491
+ "layer_28": {
492
+ "intermediate_size": 11008,
493
+ "dead_count": 0,
494
+ "dead_fraction": 0.0,
495
+ "mean_activation_freq": 0.9870905815491571,
496
+ "min_activation_freq": 0.21641423320812633
497
+ },
498
+ "layer_29": {
499
+ "intermediate_size": 11008,
500
+ "dead_count": 0,
501
+ "dead_fraction": 0.0,
502
+ "mean_activation_freq": 0.9883106423539195,
503
+ "min_activation_freq": 0.9583424209378407
504
+ },
505
+ "layer_30": {
506
+ "intermediate_size": 11008,
507
+ "dead_count": 0,
508
+ "dead_fraction": 0.0,
509
+ "mean_activation_freq": 0.9899075998879195,
510
+ "min_activation_freq": 0.5518114624984853
511
+ },
512
+ "layer_31": {
513
+ "intermediate_size": 11008,
514
+ "dead_count": 0,
515
+ "dead_fraction": 0.0,
516
+ "mean_activation_freq": 0.9908092687196434,
517
+ "min_activation_freq": 0.9437255139545215
518
+ },
519
+ "layer_32": {
520
+ "intermediate_size": 11008,
521
+ "dead_count": 0,
522
+ "dead_fraction": 0.0,
523
+ "mean_activation_freq": 0.9889459491239737,
524
+ "min_activation_freq": 0.48954723534876204
525
+ },
526
+ "layer_33": {
527
+ "intermediate_size": 11008,
528
+ "dead_count": 0,
529
+ "dead_fraction": 0.0,
530
+ "mean_activation_freq": 0.9868486934249656,
531
+ "min_activation_freq": 0.9235308372712953
532
+ },
533
+ "layer_34": {
534
+ "intermediate_size": 11008,
535
+ "dead_count": 0,
536
+ "dead_fraction": 0.0,
537
+ "mean_activation_freq": 0.9879802249352362,
538
+ "min_activation_freq": 0.8880164788561735
539
+ },
540
+ "layer_35": {
541
+ "intermediate_size": 11008,
542
+ "dead_count": 0,
543
+ "dead_fraction": 0.0,
544
+ "mean_activation_freq": 0.9920652191046103,
545
+ "min_activation_freq": 0.00969748374328527
546
+ },
547
+ "_overall": {
548
+ "dead_count": 13311,
549
+ "intermediate_total": 396288,
550
+ "dead_fraction": 0.03358920784883721
551
+ }
552
+ },
553
+ "size": 571,
554
+ "size_pre_filter": 571,
555
+ "skipped_long": 0
556
+ }
557
+ },
558
+ "old_data": {
559
+ "num_records": 29696,
560
+ "source_steps": [
561
+ 25,
562
+ 50,
563
+ 75,
564
+ 100,
565
+ 125,
566
+ 150,
567
+ 175,
568
+ 200,
569
+ 225,
570
+ 250,
571
+ 275,
572
+ 300,
573
+ 325,
574
+ 350,
575
+ 375,
576
+ 400,
577
+ 425,
578
+ 450,
579
+ 475,
580
+ 500,
581
+ 525,
582
+ 550,
583
+ 575,
584
+ 600,
585
+ 625,
586
+ 650,
587
+ 675,
588
+ 700,
589
+ 725
590
+ ],
591
+ "num_source_steps": 29,
592
+ "num_positives_pre_cap": 11182,
593
+ "num_negatives_pre_cap": 18514,
594
+ "positive": {
595
+ "loss": 1.007671607083234,
596
+ "token_entropy": 0.02704707161933118,
597
+ "num_supervised_tokens": 4034365,
598
+ "kl_from_init": 3.3517877829672726,
599
+ "kl_to_init": 0.40386673940401824,
600
+ "dead_units": {
601
+ "layer_0": {
602
+ "intermediate_size": 11008,
603
+ "dead_count": 0,
604
+ "dead_fraction": 0.0,
605
+ "mean_activation_freq": 0.9236409677552496,
606
+ "min_activation_freq": 0.7823667417301112
607
+ },
608
+ "layer_1": {
609
+ "intermediate_size": 11008,
610
+ "dead_count": 8758,
611
+ "dead_fraction": 0.7956031976744186,
612
+ "mean_activation_freq": 0.14752479760438367,
613
+ "min_activation_freq": 0.0
614
+ },
615
+ "layer_2": {
616
+ "intermediate_size": 11008,
617
+ "dead_count": 2530,
618
+ "dead_fraction": 0.2298328488372093,
619
+ "mean_activation_freq": 0.16654144499671847,
620
+ "min_activation_freq": 0.0
621
+ },
622
+ "layer_3": {
623
+ "intermediate_size": 11008,
624
+ "dead_count": 41,
625
+ "dead_fraction": 0.003724563953488372,
626
+ "mean_activation_freq": 0.38746605023289166,
627
+ "min_activation_freq": 0.0
628
+ },
629
+ "layer_4": {
630
+ "intermediate_size": 11008,
631
+ "dead_count": 1,
632
+ "dead_fraction": 9.084302325581395e-05,
633
+ "mean_activation_freq": 0.5535227988667001,
634
+ "min_activation_freq": 0.0
635
+ },
636
+ "layer_5": {
637
+ "intermediate_size": 11008,
638
+ "dead_count": 0,
639
+ "dead_fraction": 0.0,
640
+ "mean_activation_freq": 0.7154895556691742,
641
+ "min_activation_freq": 1.0162689791330234e-05
642
+ },
643
+ "layer_6": {
644
+ "intermediate_size": 11008,
645
+ "dead_count": 0,
646
+ "dead_fraction": 0.0,
647
+ "mean_activation_freq": 0.869883986066984,
648
+ "min_activation_freq": 0.08933400919351621
649
+ },
650
+ "layer_7": {
651
+ "intermediate_size": 11008,
652
+ "dead_count": 0,
653
+ "dead_fraction": 0.0,
654
+ "mean_activation_freq": 0.8851711626475237,
655
+ "min_activation_freq": 0.03277690541138445
656
+ },
657
+ "layer_8": {
658
+ "intermediate_size": 11008,
659
+ "dead_count": 0,
660
+ "dead_fraction": 0.0,
661
+ "mean_activation_freq": 0.9409224336583661,
662
+ "min_activation_freq": 0.08933624002786066
663
+ },
664
+ "layer_9": {
665
+ "intermediate_size": 11008,
666
+ "dead_count": 0,
667
+ "dead_fraction": 0.0,
668
+ "mean_activation_freq": 0.9485708946932271,
669
+ "min_activation_freq": 0.2556045375170566
670
+ },
671
+ "layer_10": {
672
+ "intermediate_size": 11008,
673
+ "dead_count": 0,
674
+ "dead_fraction": 0.0,
675
+ "mean_activation_freq": 0.9732503352907632,
676
+ "min_activation_freq": 0.6650528645772011
677
+ },
678
+ "layer_11": {
679
+ "intermediate_size": 11008,
680
+ "dead_count": 0,
681
+ "dead_fraction": 0.0,
682
+ "mean_activation_freq": 0.9850991983346187,
683
+ "min_activation_freq": 0.9331577584080767
684
+ },
685
+ "layer_12": {
686
+ "intermediate_size": 11008,
687
+ "dead_count": 0,
688
+ "dead_fraction": 0.0,
689
+ "mean_activation_freq": 0.9867655031286948,
690
+ "min_activation_freq": 0.9204846363678052
691
+ },
692
+ "layer_13": {
693
+ "intermediate_size": 11008,
694
+ "dead_count": 0,
695
+ "dead_fraction": 0.0,
696
+ "mean_activation_freq": 0.9807647351877501,
697
+ "min_activation_freq": 0.9003982039304823
698
+ },
699
+ "layer_14": {
700
+ "intermediate_size": 11008,
701
+ "dead_count": 0,
702
+ "dead_fraction": 0.0,
703
+ "mean_activation_freq": 0.982998197661845,
704
+ "min_activation_freq": 0.8967681407111157
705
+ },
706
+ "layer_15": {
707
+ "intermediate_size": 11008,
708
+ "dead_count": 0,
709
+ "dead_fraction": 0.0,
710
+ "mean_activation_freq": 0.9802374444170259,
711
+ "min_activation_freq": 0.9090456614609735
712
+ },
713
+ "layer_16": {
714
+ "intermediate_size": 11008,
715
+ "dead_count": 0,
716
+ "dead_fraction": 0.0,
717
+ "mean_activation_freq": 0.9795772943470125,
718
+ "min_activation_freq": 0.9079426378128901
719
+ },
720
+ "layer_17": {
721
+ "intermediate_size": 11008,
722
+ "dead_count": 0,
723
+ "dead_fraction": 0.0,
724
+ "mean_activation_freq": 0.9794852692328473,
725
+ "min_activation_freq": 0.9209102299866274
726
+ },
727
+ "layer_18": {
728
+ "intermediate_size": 11008,
729
+ "dead_count": 0,
730
+ "dead_fraction": 0.0,
731
+ "mean_activation_freq": 0.9799169148499899,
732
+ "min_activation_freq": 0.9255813492333986
733
+ },
734
+ "layer_19": {
735
+ "intermediate_size": 11008,
736
+ "dead_count": 0,
737
+ "dead_fraction": 0.0,
738
+ "mean_activation_freq": 0.9769428294918909,
739
+ "min_activation_freq": 0.9177446760518695
740
+ },
741
+ "layer_20": {
742
+ "intermediate_size": 11008,
743
+ "dead_count": 0,
744
+ "dead_fraction": 0.0,
745
+ "mean_activation_freq": 0.9794547312876447,
746
+ "min_activation_freq": 0.9095552831734363
747
+ },
748
+ "layer_21": {
749
+ "intermediate_size": 11008,
750
+ "dead_count": 0,
751
+ "dead_fraction": 0.0,
752
+ "mean_activation_freq": 0.9796371699750435,
753
+ "min_activation_freq": 0.9237257907997913
754
+ },
755
+ "layer_22": {
756
+ "intermediate_size": 11008,
757
+ "dead_count": 0,
758
+ "dead_fraction": 0.0,
759
+ "mean_activation_freq": 0.9794516423863959,
760
+ "min_activation_freq": 0.9290845027656149
761
+ },
762
+ "layer_23": {
763
+ "intermediate_size": 11008,
764
+ "dead_count": 0,
765
+ "dead_fraction": 0.0,
766
+ "mean_activation_freq": 0.9796299528188264,
767
+ "min_activation_freq": 0.9388000342061267
768
+ },
769
+ "layer_24": {
770
+ "intermediate_size": 11008,
771
+ "dead_count": 0,
772
+ "dead_fraction": 0.0,
773
+ "mean_activation_freq": 0.9816908261696844,
774
+ "min_activation_freq": 0.9274269928476973
775
+ },
776
+ "layer_25": {
777
+ "intermediate_size": 11008,
778
+ "dead_count": 0,
779
+ "dead_fraction": 0.0,
780
+ "mean_activation_freq": 0.9837514577072142,
781
+ "min_activation_freq": 0.9514984390356351
782
+ },
783
+ "layer_26": {
784
+ "intermediate_size": 11008,
785
+ "dead_count": 0,
786
+ "dead_fraction": 0.0,
787
+ "mean_activation_freq": 0.9857234276753851,
788
+ "min_activation_freq": 0.9555944987625067
789
+ },
790
+ "layer_27": {
791
+ "intermediate_size": 11008,
792
+ "dead_count": 0,
793
+ "dead_fraction": 0.0,
794
+ "mean_activation_freq": 0.9869553750483601,
795
+ "min_activation_freq": 0.9415442083202685
796
+ },
797
+ "layer_28": {
798
+ "intermediate_size": 11008,
799
+ "dead_count": 0,
800
+ "dead_fraction": 0.0,
801
+ "mean_activation_freq": 0.9873200982021422,
802
+ "min_activation_freq": 0.21353422409722472
803
+ },
804
+ "layer_29": {
805
+ "intermediate_size": 11008,
806
+ "dead_count": 0,
807
+ "dead_fraction": 0.0,
808
+ "mean_activation_freq": 0.9885330402274483,
809
+ "min_activation_freq": 0.9604604442086921
810
+ },
811
+ "layer_30": {
812
+ "intermediate_size": 11008,
813
+ "dead_count": 0,
814
+ "dead_fraction": 0.0,
815
+ "mean_activation_freq": 0.9900672389260549,
816
+ "min_activation_freq": 0.5442261669432489
817
+ },
818
+ "layer_31": {
819
+ "intermediate_size": 11008,
820
+ "dead_count": 0,
821
+ "dead_fraction": 0.0,
822
+ "mean_activation_freq": 0.9909378789977512,
823
+ "min_activation_freq": 0.9468776374968553
824
+ },
825
+ "layer_32": {
826
+ "intermediate_size": 11008,
827
+ "dead_count": 0,
828
+ "dead_fraction": 0.0,
829
+ "mean_activation_freq": 0.9891531399171736,
830
+ "min_activation_freq": 0.6514289113652335
831
+ },
832
+ "layer_33": {
833
+ "intermediate_size": 11008,
834
+ "dead_count": 0,
835
+ "dead_fraction": 0.0,
836
+ "mean_activation_freq": 0.987075201467183,
837
+ "min_activation_freq": 0.923854187709838
838
+ },
839
+ "layer_34": {
840
+ "intermediate_size": 11008,
841
+ "dead_count": 0,
842
+ "dead_fraction": 0.0,
843
+ "mean_activation_freq": 0.9882194013382384,
844
+ "min_activation_freq": 0.8849838822218615
845
+ },
846
+ "layer_35": {
847
+ "intermediate_size": 11008,
848
+ "dead_count": 0,
849
+ "dead_fraction": 0.0,
850
+ "mean_activation_freq": 0.9918543054176937,
851
+ "min_activation_freq": 0.00743115707180684
852
+ },
853
+ "_overall": {
854
+ "dead_count": 11330,
855
+ "intermediate_total": 396288,
856
+ "dead_fraction": 0.02859031815245478
857
+ }
858
+ },
859
+ "size": 11182,
860
+ "size_pre_filter": 11182,
861
+ "skipped_long": 0
862
+ },
863
+ "negative": {
864
+ "loss": 1.2941068873798702,
865
+ "token_entropy": 0.047440475201673875,
866
+ "num_supervised_tokens": 8046154,
867
+ "kl_from_init": 3.010003556061493,
868
+ "kl_to_init": 0.4011514692235804,
869
+ "dead_units": {
870
+ "layer_0": {
871
+ "intermediate_size": 11008,
872
+ "dead_count": 0,
873
+ "dead_fraction": 0.0,
874
+ "mean_activation_freq": 0.9239432561895409,
875
+ "min_activation_freq": 0.784582547139913
876
+ },
877
+ "layer_1": {
878
+ "intermediate_size": 11008,
879
+ "dead_count": 1047,
880
+ "dead_fraction": 0.0951126453488372,
881
+ "mean_activation_freq": 0.14731663420578273,
882
+ "min_activation_freq": 0.0
883
+ },
884
+ "layer_2": {
885
+ "intermediate_size": 11008,
886
+ "dead_count": 629,
887
+ "dead_fraction": 0.057140261627906974,
888
+ "mean_activation_freq": 0.1664765267957849,
889
+ "min_activation_freq": 0.0
890
+ },
891
+ "layer_3": {
892
+ "intermediate_size": 11008,
893
+ "dead_count": 0,
894
+ "dead_fraction": 0.0,
895
+ "mean_activation_freq": 0.3878682846307256,
896
+ "min_activation_freq": 8.699808629066757e-07
897
+ },
898
+ "layer_4": {
899
+ "intermediate_size": 11008,
900
+ "dead_count": 0,
901
+ "dead_fraction": 0.0,
902
+ "mean_activation_freq": 0.5542583252623581,
903
+ "min_activation_freq": 7.208412864083885e-06
904
+ },
905
+ "layer_5": {
906
+ "intermediate_size": 11008,
907
+ "dead_count": 0,
908
+ "dead_fraction": 0.0,
909
+ "mean_activation_freq": 0.7155630760682334,
910
+ "min_activation_freq": 2.3613766278895482e-05
911
+ },
912
+ "layer_6": {
913
+ "intermediate_size": 11008,
914
+ "dead_count": 0,
915
+ "dead_fraction": 0.0,
916
+ "mean_activation_freq": 0.8693184657595491,
917
+ "min_activation_freq": 0.08818809582814348
918
+ },
919
+ "layer_7": {
920
+ "intermediate_size": 11008,
921
+ "dead_count": 0,
922
+ "dead_fraction": 0.0,
923
+ "mean_activation_freq": 0.8859820361353913,
924
+ "min_activation_freq": 0.03549024788737576
925
+ },
926
+ "layer_8": {
927
+ "intermediate_size": 11008,
928
+ "dead_count": 0,
929
+ "dead_fraction": 0.0,
930
+ "mean_activation_freq": 0.9409312061378086,
931
+ "min_activation_freq": 0.09162501736854652
932
+ },
933
+ "layer_9": {
934
+ "intermediate_size": 11008,
935
+ "dead_count": 0,
936
+ "dead_fraction": 0.0,
937
+ "mean_activation_freq": 0.9491183133648421,
938
+ "min_activation_freq": 0.26968412486263627
939
+ },
940
+ "layer_10": {
941
+ "intermediate_size": 11008,
942
+ "dead_count": 0,
943
+ "dead_fraction": 0.0,
944
+ "mean_activation_freq": 0.9733824551899086,
945
+ "min_activation_freq": 0.6732606659032377
946
+ },
947
+ "layer_11": {
948
+ "intermediate_size": 11008,
949
+ "dead_count": 0,
950
+ "dead_fraction": 0.0,
951
+ "mean_activation_freq": 0.9850688562652539,
952
+ "min_activation_freq": 0.9320812154477779
953
+ },
954
+ "layer_12": {
955
+ "intermediate_size": 11008,
956
+ "dead_count": 0,
957
+ "dead_fraction": 0.0,
958
+ "mean_activation_freq": 0.9867423640801477,
959
+ "min_activation_freq": 0.9199040933096732
960
+ },
961
+ "layer_13": {
962
+ "intermediate_size": 11008,
963
+ "dead_count": 0,
964
+ "dead_fraction": 0.0,
965
+ "mean_activation_freq": 0.980559855058475,
966
+ "min_activation_freq": 0.9006960344035175
967
+ },
968
+ "layer_14": {
969
+ "intermediate_size": 11008,
970
+ "dead_count": 0,
971
+ "dead_fraction": 0.0,
972
+ "mean_activation_freq": 0.9828507287673612,
973
+ "min_activation_freq": 0.896837544993546
974
+ },
975
+ "layer_15": {
976
+ "intermediate_size": 11008,
977
+ "dead_count": 0,
978
+ "dead_fraction": 0.0,
979
+ "mean_activation_freq": 0.9801063620999245,
980
+ "min_activation_freq": 0.910654332492269
981
+ },
982
+ "layer_16": {
983
+ "intermediate_size": 11008,
984
+ "dead_count": 0,
985
+ "dead_fraction": 0.0,
986
+ "mean_activation_freq": 0.9795157329998326,
987
+ "min_activation_freq": 0.907307516112667
988
+ },
989
+ "layer_17": {
990
+ "intermediate_size": 11008,
991
+ "dead_count": 0,
992
+ "dead_fraction": 0.0,
993
+ "mean_activation_freq": 0.9794251678181344,
994
+ "min_activation_freq": 0.9215938447113988
995
+ },
996
+ "layer_18": {
997
+ "intermediate_size": 11008,
998
+ "dead_count": 0,
999
+ "dead_fraction": 0.0,
1000
+ "mean_activation_freq": 0.9798689370447474,
1001
+ "min_activation_freq": 0.9246137968525087
1002
+ },
1003
+ "layer_19": {
1004
+ "intermediate_size": 11008,
1005
+ "dead_count": 0,
1006
+ "dead_fraction": 0.0,
1007
+ "mean_activation_freq": 0.9768583832846803,
1008
+ "min_activation_freq": 0.918726263504278
1009
+ },
1010
+ "layer_20": {
1011
+ "intermediate_size": 11008,
1012
+ "dead_count": 0,
1013
+ "dead_fraction": 0.0,
1014
+ "mean_activation_freq": 0.979419765979422,
1015
+ "min_activation_freq": 0.9150821622355227
1016
+ },
1017
+ "layer_21": {
1018
+ "intermediate_size": 11008,
1019
+ "dead_count": 0,
1020
+ "dead_fraction": 0.0,
1021
+ "mean_activation_freq": 0.9794817386579359,
1022
+ "min_activation_freq": 0.9222196095177895
1023
+ },
1024
+ "layer_22": {
1025
+ "intermediate_size": 11008,
1026
+ "dead_count": 0,
1027
+ "dead_fraction": 0.0,
1028
+ "mean_activation_freq": 0.9792024632623161,
1029
+ "min_activation_freq": 0.9303806514267562
1030
+ },
1031
+ "layer_23": {
1032
+ "intermediate_size": 11008,
1033
+ "dead_count": 0,
1034
+ "dead_fraction": 0.0,
1035
+ "mean_activation_freq": 0.9792918350090174,
1036
+ "min_activation_freq": 0.9388960241128868
1037
+ },
1038
+ "layer_24": {
1039
+ "intermediate_size": 11008,
1040
+ "dead_count": 0,
1041
+ "dead_fraction": 0.0,
1042
+ "mean_activation_freq": 0.9814430858216004,
1043
+ "min_activation_freq": 0.9295756705626067
1044
+ },
1045
+ "layer_25": {
1046
+ "intermediate_size": 11008,
1047
+ "dead_count": 0,
1048
+ "dead_fraction": 0.0,
1049
+ "mean_activation_freq": 0.9834818708223181,
1050
+ "min_activation_freq": 0.9523122475657314
1051
+ },
1052
+ "layer_26": {
1053
+ "intermediate_size": 11008,
1054
+ "dead_count": 0,
1055
+ "dead_fraction": 0.0,
1056
+ "mean_activation_freq": 0.9855015297133097,
1057
+ "min_activation_freq": 0.9556205362214046
1058
+ },
1059
+ "layer_27": {
1060
+ "intermediate_size": 11008,
1061
+ "dead_count": 0,
1062
+ "dead_fraction": 0.0,
1063
+ "mean_activation_freq": 0.9867652590418997,
1064
+ "min_activation_freq": 0.9384826589200257
1065
+ },
1066
+ "layer_28": {
1067
+ "intermediate_size": 11008,
1068
+ "dead_count": 0,
1069
+ "dead_fraction": 0.0,
1070
+ "mean_activation_freq": 0.9871922585789992,
1071
+ "min_activation_freq": 0.21872673577960353
1072
+ },
1073
+ "layer_29": {
1074
+ "intermediate_size": 11008,
1075
+ "dead_count": 0,
1076
+ "dead_fraction": 0.0,
1077
+ "mean_activation_freq": 0.9884141922232059,
1078
+ "min_activation_freq": 0.9593906604323009
1079
+ },
1080
+ "layer_30": {
1081
+ "intermediate_size": 11008,
1082
+ "dead_count": 0,
1083
+ "dead_fraction": 0.0,
1084
+ "mean_activation_freq": 0.9899860308924185,
1085
+ "min_activation_freq": 0.5672097501489531
1086
+ },
1087
+ "layer_31": {
1088
+ "intermediate_size": 11008,
1089
+ "dead_count": 0,
1090
+ "dead_fraction": 0.0,
1091
+ "mean_activation_freq": 0.9909089696048867,
1092
+ "min_activation_freq": 0.947924312659191
1093
+ },
1094
+ "layer_32": {
1095
+ "intermediate_size": 11008,
1096
+ "dead_count": 0,
1097
+ "dead_fraction": 0.0,
1098
+ "mean_activation_freq": 0.9891414935939696,
1099
+ "min_activation_freq": 0.6747065740973887
1100
+ },
1101
+ "layer_33": {
1102
+ "intermediate_size": 11008,
1103
+ "dead_count": 0,
1104
+ "dead_fraction": 0.0,
1105
+ "mean_activation_freq": 0.9870862253597502,
1106
+ "min_activation_freq": 0.924674944078873
1107
+ },
1108
+ "layer_34": {
1109
+ "intermediate_size": 11008,
1110
+ "dead_count": 0,
1111
+ "dead_fraction": 0.0,
1112
+ "mean_activation_freq": 0.9881647040980156,
1113
+ "min_activation_freq": 0.894632267789058
1114
+ },
1115
+ "layer_35": {
1116
+ "intermediate_size": 11008,
1117
+ "dead_count": 0,
1118
+ "dead_fraction": 0.0,
1119
+ "mean_activation_freq": 0.9921612932039143,
1120
+ "min_activation_freq": 0.017718403102898603
1121
+ },
1122
+ "_overall": {
1123
+ "dead_count": 1676,
1124
+ "intermediate_total": 396288,
1125
+ "dead_fraction": 0.004229247416020672
1126
+ }
1127
+ },
1128
+ "size": 18514,
1129
+ "size_pre_filter": 18514,
1130
+ "skipped_long": 0
1131
+ }
1132
+ },
1133
+ "new_data": {
1134
+ "num_records": 0,
1135
+ "source_steps": [],
1136
+ "num_source_steps": 0,
1137
+ "num_positives_pre_cap": 0,
1138
+ "num_negatives_pre_cap": 0,
1139
+ "positive": {
1140
+ "size": 0
1141
+ },
1142
+ "negative": {
1143
+ "size": 0
1144
+ }
1145
+ }
1146
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/generation_config.json ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 151643,
3
+ "eos_token_id": 151643,
4
+ "max_new_tokens": 2048,
5
+ "transformers_version": "4.57.6"
6
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/merges.txt ADDED
The diff for this file is too large to render. See raw diff
 
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/model-00001-of-00002.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:514506c284456f854423a621efa2ebe7374cb51a2852d1670df0e18b2ff1a2f1
3
+ size 4969102704
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/model-00002-of-00002.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0edaf00bcfc35cc1c62e9817618af72644a95907e959038334471bb4964ca6ad
3
+ size 1825154320
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/model.safetensors.index.json ADDED
@@ -0,0 +1,443 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "metadata": {
3
+ "total_parameters": 3397103616,
4
+ "total_size": 6794207232
5
+ },
6
+ "weight_map": {
7
+ "lm_head.weight": "model-00002-of-00002.safetensors",
8
+ "model.embed_tokens.weight": "model-00001-of-00002.safetensors",
9
+ "model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
10
+ "model.layers.0.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
11
+ "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
12
+ "model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
13
+ "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
14
+ "model.layers.0.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
15
+ "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
16
+ "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
17
+ "model.layers.0.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
18
+ "model.layers.0.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
19
+ "model.layers.0.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
20
+ "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
21
+ "model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
22
+ "model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
23
+ "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
24
+ "model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
25
+ "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
26
+ "model.layers.1.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
27
+ "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
28
+ "model.layers.1.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
29
+ "model.layers.1.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
30
+ "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
31
+ "model.layers.1.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
32
+ "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
33
+ "model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors",
34
+ "model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
35
+ "model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
36
+ "model.layers.10.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
37
+ "model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
38
+ "model.layers.10.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
39
+ "model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
40
+ "model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
41
+ "model.layers.10.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
42
+ "model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
43
+ "model.layers.10.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
44
+ "model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
45
+ "model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors",
46
+ "model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
47
+ "model.layers.11.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
48
+ "model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
49
+ "model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
50
+ "model.layers.11.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
51
+ "model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
52
+ "model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
53
+ "model.layers.11.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
54
+ "model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
55
+ "model.layers.11.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
56
+ "model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
57
+ "model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors",
58
+ "model.layers.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
59
+ "model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
60
+ "model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
61
+ "model.layers.12.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
62
+ "model.layers.12.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
63
+ "model.layers.12.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
64
+ "model.layers.12.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
65
+ "model.layers.12.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
66
+ "model.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
67
+ "model.layers.12.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
68
+ "model.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
69
+ "model.layers.13.input_layernorm.weight": "model-00002-of-00002.safetensors",
70
+ "model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
71
+ "model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
72
+ "model.layers.13.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
73
+ "model.layers.13.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
74
+ "model.layers.13.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
75
+ "model.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
76
+ "model.layers.13.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
77
+ "model.layers.13.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
78
+ "model.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
79
+ "model.layers.13.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
80
+ "model.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
81
+ "model.layers.14.input_layernorm.weight": "model-00001-of-00002.safetensors",
82
+ "model.layers.14.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
83
+ "model.layers.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
84
+ "model.layers.14.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
85
+ "model.layers.14.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
86
+ "model.layers.14.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
87
+ "model.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
88
+ "model.layers.14.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
89
+ "model.layers.14.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
90
+ "model.layers.14.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
91
+ "model.layers.14.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
92
+ "model.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
93
+ "model.layers.15.input_layernorm.weight": "model-00002-of-00002.safetensors",
94
+ "model.layers.15.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
95
+ "model.layers.15.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
96
+ "model.layers.15.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
97
+ "model.layers.15.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
98
+ "model.layers.15.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
99
+ "model.layers.15.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
100
+ "model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
101
+ "model.layers.15.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
102
+ "model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
103
+ "model.layers.15.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
104
+ "model.layers.15.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
105
+ "model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors",
106
+ "model.layers.16.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
107
+ "model.layers.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
108
+ "model.layers.16.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
109
+ "model.layers.16.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
110
+ "model.layers.16.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
111
+ "model.layers.16.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
112
+ "model.layers.16.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
113
+ "model.layers.16.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
114
+ "model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
115
+ "model.layers.16.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
116
+ "model.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
117
+ "model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors",
118
+ "model.layers.17.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
119
+ "model.layers.17.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
120
+ "model.layers.17.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
121
+ "model.layers.17.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
122
+ "model.layers.17.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
123
+ "model.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
124
+ "model.layers.17.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
125
+ "model.layers.17.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
126
+ "model.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
127
+ "model.layers.17.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
128
+ "model.layers.17.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
129
+ "model.layers.18.input_layernorm.weight": "model-00001-of-00002.safetensors",
130
+ "model.layers.18.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
131
+ "model.layers.18.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
132
+ "model.layers.18.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
133
+ "model.layers.18.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
134
+ "model.layers.18.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
135
+ "model.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
136
+ "model.layers.18.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
137
+ "model.layers.18.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
138
+ "model.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
139
+ "model.layers.18.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
140
+ "model.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
141
+ "model.layers.19.input_layernorm.weight": "model-00001-of-00002.safetensors",
142
+ "model.layers.19.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
143
+ "model.layers.19.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
144
+ "model.layers.19.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
145
+ "model.layers.19.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
146
+ "model.layers.19.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
147
+ "model.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
148
+ "model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
149
+ "model.layers.19.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
150
+ "model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
151
+ "model.layers.19.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
152
+ "model.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
153
+ "model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
154
+ "model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
155
+ "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
156
+ "model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
157
+ "model.layers.2.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
158
+ "model.layers.2.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
159
+ "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
160
+ "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
161
+ "model.layers.2.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
162
+ "model.layers.2.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
163
+ "model.layers.2.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
164
+ "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
165
+ "model.layers.20.input_layernorm.weight": "model-00001-of-00002.safetensors",
166
+ "model.layers.20.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
167
+ "model.layers.20.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
168
+ "model.layers.20.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
169
+ "model.layers.20.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
170
+ "model.layers.20.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
171
+ "model.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
172
+ "model.layers.20.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
173
+ "model.layers.20.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
174
+ "model.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
175
+ "model.layers.20.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
176
+ "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
177
+ "model.layers.21.input_layernorm.weight": "model-00001-of-00002.safetensors",
178
+ "model.layers.21.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
179
+ "model.layers.21.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
180
+ "model.layers.21.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
181
+ "model.layers.21.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
182
+ "model.layers.21.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
183
+ "model.layers.21.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
184
+ "model.layers.21.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
185
+ "model.layers.21.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
186
+ "model.layers.21.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
187
+ "model.layers.21.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
188
+ "model.layers.21.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
189
+ "model.layers.22.input_layernorm.weight": "model-00001-of-00002.safetensors",
190
+ "model.layers.22.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
191
+ "model.layers.22.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
192
+ "model.layers.22.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
193
+ "model.layers.22.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
194
+ "model.layers.22.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
195
+ "model.layers.22.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
196
+ "model.layers.22.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
197
+ "model.layers.22.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
198
+ "model.layers.22.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
199
+ "model.layers.22.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
200
+ "model.layers.22.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
201
+ "model.layers.23.input_layernorm.weight": "model-00001-of-00002.safetensors",
202
+ "model.layers.23.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
203
+ "model.layers.23.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
204
+ "model.layers.23.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
205
+ "model.layers.23.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
206
+ "model.layers.23.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
207
+ "model.layers.23.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
208
+ "model.layers.23.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
209
+ "model.layers.23.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
210
+ "model.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
211
+ "model.layers.23.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
212
+ "model.layers.23.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
213
+ "model.layers.24.input_layernorm.weight": "model-00002-of-00002.safetensors",
214
+ "model.layers.24.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
215
+ "model.layers.24.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
216
+ "model.layers.24.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
217
+ "model.layers.24.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
218
+ "model.layers.24.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
219
+ "model.layers.24.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
220
+ "model.layers.24.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
221
+ "model.layers.24.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
222
+ "model.layers.24.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
223
+ "model.layers.24.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
224
+ "model.layers.24.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
225
+ "model.layers.25.input_layernorm.weight": "model-00001-of-00002.safetensors",
226
+ "model.layers.25.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
227
+ "model.layers.25.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
228
+ "model.layers.25.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
229
+ "model.layers.25.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
230
+ "model.layers.25.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
231
+ "model.layers.25.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
232
+ "model.layers.25.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
233
+ "model.layers.25.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
234
+ "model.layers.25.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
235
+ "model.layers.25.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
236
+ "model.layers.25.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
237
+ "model.layers.26.input_layernorm.weight": "model-00002-of-00002.safetensors",
238
+ "model.layers.26.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
239
+ "model.layers.26.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
240
+ "model.layers.26.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
241
+ "model.layers.26.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
242
+ "model.layers.26.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
243
+ "model.layers.26.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
244
+ "model.layers.26.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
245
+ "model.layers.26.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
246
+ "model.layers.26.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
247
+ "model.layers.26.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
248
+ "model.layers.26.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
249
+ "model.layers.27.input_layernorm.weight": "model-00001-of-00002.safetensors",
250
+ "model.layers.27.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
251
+ "model.layers.27.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
252
+ "model.layers.27.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
253
+ "model.layers.27.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
254
+ "model.layers.27.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
255
+ "model.layers.27.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
256
+ "model.layers.27.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
257
+ "model.layers.27.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
258
+ "model.layers.27.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
259
+ "model.layers.27.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
260
+ "model.layers.27.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
261
+ "model.layers.28.input_layernorm.weight": "model-00001-of-00002.safetensors",
262
+ "model.layers.28.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
263
+ "model.layers.28.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
264
+ "model.layers.28.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
265
+ "model.layers.28.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
266
+ "model.layers.28.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
267
+ "model.layers.28.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
268
+ "model.layers.28.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
269
+ "model.layers.28.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
270
+ "model.layers.28.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
271
+ "model.layers.28.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
272
+ "model.layers.28.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
273
+ "model.layers.29.input_layernorm.weight": "model-00001-of-00002.safetensors",
274
+ "model.layers.29.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
275
+ "model.layers.29.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
276
+ "model.layers.29.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
277
+ "model.layers.29.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
278
+ "model.layers.29.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
279
+ "model.layers.29.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
280
+ "model.layers.29.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
281
+ "model.layers.29.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
282
+ "model.layers.29.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
283
+ "model.layers.29.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
284
+ "model.layers.29.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
285
+ "model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
286
+ "model.layers.3.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
287
+ "model.layers.3.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
288
+ "model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
289
+ "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
290
+ "model.layers.3.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
291
+ "model.layers.3.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
292
+ "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
293
+ "model.layers.3.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
294
+ "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
295
+ "model.layers.3.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
296
+ "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
297
+ "model.layers.30.input_layernorm.weight": "model-00001-of-00002.safetensors",
298
+ "model.layers.30.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
299
+ "model.layers.30.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
300
+ "model.layers.30.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
301
+ "model.layers.30.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
302
+ "model.layers.30.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
303
+ "model.layers.30.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
304
+ "model.layers.30.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
305
+ "model.layers.30.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
306
+ "model.layers.30.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
307
+ "model.layers.30.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
308
+ "model.layers.30.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
309
+ "model.layers.31.input_layernorm.weight": "model-00001-of-00002.safetensors",
310
+ "model.layers.31.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
311
+ "model.layers.31.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
312
+ "model.layers.31.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
313
+ "model.layers.31.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
314
+ "model.layers.31.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
315
+ "model.layers.31.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
316
+ "model.layers.31.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
317
+ "model.layers.31.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
318
+ "model.layers.31.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
319
+ "model.layers.31.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
320
+ "model.layers.31.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
321
+ "model.layers.32.input_layernorm.weight": "model-00001-of-00002.safetensors",
322
+ "model.layers.32.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
323
+ "model.layers.32.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
324
+ "model.layers.32.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
325
+ "model.layers.32.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
326
+ "model.layers.32.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
327
+ "model.layers.32.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
328
+ "model.layers.32.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
329
+ "model.layers.32.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
330
+ "model.layers.32.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
331
+ "model.layers.32.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
332
+ "model.layers.32.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
333
+ "model.layers.33.input_layernorm.weight": "model-00001-of-00002.safetensors",
334
+ "model.layers.33.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
335
+ "model.layers.33.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
336
+ "model.layers.33.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
337
+ "model.layers.33.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
338
+ "model.layers.33.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
339
+ "model.layers.33.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
340
+ "model.layers.33.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
341
+ "model.layers.33.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
342
+ "model.layers.33.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
343
+ "model.layers.33.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
344
+ "model.layers.33.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
345
+ "model.layers.34.input_layernorm.weight": "model-00001-of-00002.safetensors",
346
+ "model.layers.34.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
347
+ "model.layers.34.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
348
+ "model.layers.34.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
349
+ "model.layers.34.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
350
+ "model.layers.34.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
351
+ "model.layers.34.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
352
+ "model.layers.34.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
353
+ "model.layers.34.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
354
+ "model.layers.34.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
355
+ "model.layers.34.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
356
+ "model.layers.34.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
357
+ "model.layers.35.input_layernorm.weight": "model-00001-of-00002.safetensors",
358
+ "model.layers.35.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
359
+ "model.layers.35.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
360
+ "model.layers.35.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
361
+ "model.layers.35.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
362
+ "model.layers.35.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
363
+ "model.layers.35.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
364
+ "model.layers.35.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
365
+ "model.layers.35.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
366
+ "model.layers.35.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
367
+ "model.layers.35.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
368
+ "model.layers.35.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
369
+ "model.layers.4.input_layernorm.weight": "model-00002-of-00002.safetensors",
370
+ "model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
371
+ "model.layers.4.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
372
+ "model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
373
+ "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
374
+ "model.layers.4.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
375
+ "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
376
+ "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
377
+ "model.layers.4.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
378
+ "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
379
+ "model.layers.4.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
380
+ "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
381
+ "model.layers.5.input_layernorm.weight": "model-00002-of-00002.safetensors",
382
+ "model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
383
+ "model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
384
+ "model.layers.5.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
385
+ "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
386
+ "model.layers.5.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
387
+ "model.layers.5.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
388
+ "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
389
+ "model.layers.5.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
390
+ "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
391
+ "model.layers.5.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
392
+ "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
393
+ "model.layers.6.input_layernorm.weight": "model-00002-of-00002.safetensors",
394
+ "model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
395
+ "model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
396
+ "model.layers.6.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
397
+ "model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
398
+ "model.layers.6.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
399
+ "model.layers.6.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
400
+ "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
401
+ "model.layers.6.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
402
+ "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
403
+ "model.layers.6.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
404
+ "model.layers.6.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
405
+ "model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
406
+ "model.layers.7.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
407
+ "model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
408
+ "model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
409
+ "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
410
+ "model.layers.7.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
411
+ "model.layers.7.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
412
+ "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
413
+ "model.layers.7.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
414
+ "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
415
+ "model.layers.7.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
416
+ "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
417
+ "model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors",
418
+ "model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
419
+ "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
420
+ "model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
421
+ "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
422
+ "model.layers.8.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
423
+ "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
424
+ "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
425
+ "model.layers.8.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
426
+ "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
427
+ "model.layers.8.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
428
+ "model.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
429
+ "model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors",
430
+ "model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
431
+ "model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
432
+ "model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
433
+ "model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
434
+ "model.layers.9.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
435
+ "model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
436
+ "model.layers.9.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
437
+ "model.layers.9.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
438
+ "model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
439
+ "model.layers.9.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
440
+ "model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
441
+ "model.norm.weight": "model-00001-of-00002.safetensors"
442
+ }
443
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/special_tokens_map.json ADDED
@@ -0,0 +1,31 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "additional_special_tokens": [
3
+ "<|im_start|>",
4
+ "<|im_end|>",
5
+ "<|object_ref_start|>",
6
+ "<|object_ref_end|>",
7
+ "<|box_start|>",
8
+ "<|box_end|>",
9
+ "<|quad_start|>",
10
+ "<|quad_end|>",
11
+ "<|vision_start|>",
12
+ "<|vision_end|>",
13
+ "<|vision_pad|>",
14
+ "<|image_pad|>",
15
+ "<|video_pad|>"
16
+ ],
17
+ "eos_token": {
18
+ "content": "<|endoftext|>",
19
+ "lstrip": false,
20
+ "normalized": false,
21
+ "rstrip": false,
22
+ "single_word": false
23
+ },
24
+ "pad_token": {
25
+ "content": "<|endoftext|>",
26
+ "lstrip": false,
27
+ "normalized": false,
28
+ "rstrip": false,
29
+ "single_word": false
30
+ }
31
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9c5ae00e602b8860cbd784ba82a8aa14e8feecec692e7076590d014d7b7fdafa
3
+ size 11421896
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/tokenizer_config.json ADDED
@@ -0,0 +1,207 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_bos_token": false,
3
+ "add_prefix_space": false,
4
+ "added_tokens_decoder": {
5
+ "151643": {
6
+ "content": "<|endoftext|>",
7
+ "lstrip": false,
8
+ "normalized": false,
9
+ "rstrip": false,
10
+ "single_word": false,
11
+ "special": true
12
+ },
13
+ "151644": {
14
+ "content": "<|im_start|>",
15
+ "lstrip": false,
16
+ "normalized": false,
17
+ "rstrip": false,
18
+ "single_word": false,
19
+ "special": true
20
+ },
21
+ "151645": {
22
+ "content": "<|im_end|>",
23
+ "lstrip": false,
24
+ "normalized": false,
25
+ "rstrip": false,
26
+ "single_word": false,
27
+ "special": true
28
+ },
29
+ "151646": {
30
+ "content": "<|object_ref_start|>",
31
+ "lstrip": false,
32
+ "normalized": false,
33
+ "rstrip": false,
34
+ "single_word": false,
35
+ "special": true
36
+ },
37
+ "151647": {
38
+ "content": "<|object_ref_end|>",
39
+ "lstrip": false,
40
+ "normalized": false,
41
+ "rstrip": false,
42
+ "single_word": false,
43
+ "special": true
44
+ },
45
+ "151648": {
46
+ "content": "<|box_start|>",
47
+ "lstrip": false,
48
+ "normalized": false,
49
+ "rstrip": false,
50
+ "single_word": false,
51
+ "special": true
52
+ },
53
+ "151649": {
54
+ "content": "<|box_end|>",
55
+ "lstrip": false,
56
+ "normalized": false,
57
+ "rstrip": false,
58
+ "single_word": false,
59
+ "special": true
60
+ },
61
+ "151650": {
62
+ "content": "<|quad_start|>",
63
+ "lstrip": false,
64
+ "normalized": false,
65
+ "rstrip": false,
66
+ "single_word": false,
67
+ "special": true
68
+ },
69
+ "151651": {
70
+ "content": "<|quad_end|>",
71
+ "lstrip": false,
72
+ "normalized": false,
73
+ "rstrip": false,
74
+ "single_word": false,
75
+ "special": true
76
+ },
77
+ "151652": {
78
+ "content": "<|vision_start|>",
79
+ "lstrip": false,
80
+ "normalized": false,
81
+ "rstrip": false,
82
+ "single_word": false,
83
+ "special": true
84
+ },
85
+ "151653": {
86
+ "content": "<|vision_end|>",
87
+ "lstrip": false,
88
+ "normalized": false,
89
+ "rstrip": false,
90
+ "single_word": false,
91
+ "special": true
92
+ },
93
+ "151654": {
94
+ "content": "<|vision_pad|>",
95
+ "lstrip": false,
96
+ "normalized": false,
97
+ "rstrip": false,
98
+ "single_word": false,
99
+ "special": true
100
+ },
101
+ "151655": {
102
+ "content": "<|image_pad|>",
103
+ "lstrip": false,
104
+ "normalized": false,
105
+ "rstrip": false,
106
+ "single_word": false,
107
+ "special": true
108
+ },
109
+ "151656": {
110
+ "content": "<|video_pad|>",
111
+ "lstrip": false,
112
+ "normalized": false,
113
+ "rstrip": false,
114
+ "single_word": false,
115
+ "special": true
116
+ },
117
+ "151657": {
118
+ "content": "<tool_call>",
119
+ "lstrip": false,
120
+ "normalized": false,
121
+ "rstrip": false,
122
+ "single_word": false,
123
+ "special": false
124
+ },
125
+ "151658": {
126
+ "content": "</tool_call>",
127
+ "lstrip": false,
128
+ "normalized": false,
129
+ "rstrip": false,
130
+ "single_word": false,
131
+ "special": false
132
+ },
133
+ "151659": {
134
+ "content": "<|fim_prefix|>",
135
+ "lstrip": false,
136
+ "normalized": false,
137
+ "rstrip": false,
138
+ "single_word": false,
139
+ "special": false
140
+ },
141
+ "151660": {
142
+ "content": "<|fim_middle|>",
143
+ "lstrip": false,
144
+ "normalized": false,
145
+ "rstrip": false,
146
+ "single_word": false,
147
+ "special": false
148
+ },
149
+ "151661": {
150
+ "content": "<|fim_suffix|>",
151
+ "lstrip": false,
152
+ "normalized": false,
153
+ "rstrip": false,
154
+ "single_word": false,
155
+ "special": false
156
+ },
157
+ "151662": {
158
+ "content": "<|fim_pad|>",
159
+ "lstrip": false,
160
+ "normalized": false,
161
+ "rstrip": false,
162
+ "single_word": false,
163
+ "special": false
164
+ },
165
+ "151663": {
166
+ "content": "<|repo_name|>",
167
+ "lstrip": false,
168
+ "normalized": false,
169
+ "rstrip": false,
170
+ "single_word": false,
171
+ "special": false
172
+ },
173
+ "151664": {
174
+ "content": "<|file_sep|>",
175
+ "lstrip": false,
176
+ "normalized": false,
177
+ "rstrip": false,
178
+ "single_word": false,
179
+ "special": false
180
+ }
181
+ },
182
+ "additional_special_tokens": [
183
+ "<|im_start|>",
184
+ "<|im_end|>",
185
+ "<|object_ref_start|>",
186
+ "<|object_ref_end|>",
187
+ "<|box_start|>",
188
+ "<|box_end|>",
189
+ "<|quad_start|>",
190
+ "<|quad_end|>",
191
+ "<|vision_start|>",
192
+ "<|vision_end|>",
193
+ "<|vision_pad|>",
194
+ "<|image_pad|>",
195
+ "<|video_pad|>"
196
+ ],
197
+ "bos_token": null,
198
+ "clean_up_tokenization_spaces": false,
199
+ "eos_token": "<|endoftext|>",
200
+ "errors": "replace",
201
+ "extra_special_tokens": {},
202
+ "model_max_length": 131072,
203
+ "pad_token": "<|endoftext|>",
204
+ "split_special_tokens": false,
205
+ "tokenizer_class": "Qwen2Tokenizer",
206
+ "unk_token": null
207
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_750/vocab.json ADDED
The diff for this file is too large to render. See raw diff
 
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/added_tokens.json ADDED
@@ -0,0 +1,24 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "</tool_call>": 151658,
3
+ "<tool_call>": 151657,
4
+ "<|box_end|>": 151649,
5
+ "<|box_start|>": 151648,
6
+ "<|endoftext|>": 151643,
7
+ "<|file_sep|>": 151664,
8
+ "<|fim_middle|>": 151660,
9
+ "<|fim_pad|>": 151662,
10
+ "<|fim_prefix|>": 151659,
11
+ "<|fim_suffix|>": 151661,
12
+ "<|im_end|>": 151645,
13
+ "<|im_start|>": 151644,
14
+ "<|image_pad|>": 151655,
15
+ "<|object_ref_end|>": 151647,
16
+ "<|object_ref_start|>": 151646,
17
+ "<|quad_end|>": 151651,
18
+ "<|quad_start|>": 151650,
19
+ "<|repo_name|>": 151663,
20
+ "<|video_pad|>": 151656,
21
+ "<|vision_end|>": 151653,
22
+ "<|vision_pad|>": 151654,
23
+ "<|vision_start|>": 151652
24
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/chat_template.jinja ADDED
@@ -0,0 +1,54 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- if tools %}
2
+ {{- '<|im_start|>system\n' }}
3
+ {%- if messages[0]['role'] == 'system' %}
4
+ {{- messages[0]['content'] }}
5
+ {%- else %}
6
+ {{- 'You are a helpful assistant.' }}
7
+ {%- endif %}
8
+ {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
9
+ {%- for tool in tools %}
10
+ {{- "\n" }}
11
+ {{- tool | tojson }}
12
+ {%- endfor %}
13
+ {{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
14
+ {%- else %}
15
+ {%- if messages[0]['role'] == 'system' %}
16
+ {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }}
17
+ {%- else %}
18
+ {{- '<|im_start|>system\nYou are a helpful assistant.<|im_end|>\n' }}
19
+ {%- endif %}
20
+ {%- endif %}
21
+ {%- for message in messages %}
22
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %}
23
+ {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }}
24
+ {%- elif message.role == "assistant" %}
25
+ {{- '<|im_start|>' + message.role }}
26
+ {%- if message.content %}
27
+ {{- '\n' + message.content }}
28
+ {%- endif %}
29
+ {%- for tool_call in message.tool_calls %}
30
+ {%- if tool_call.function is defined %}
31
+ {%- set tool_call = tool_call.function %}
32
+ {%- endif %}
33
+ {{- '\n<tool_call>\n{"name": "' }}
34
+ {{- tool_call.name }}
35
+ {{- '", "arguments": ' }}
36
+ {{- tool_call.arguments | tojson }}
37
+ {{- '}\n</tool_call>' }}
38
+ {%- endfor %}
39
+ {{- '<|im_end|>\n' }}
40
+ {%- elif message.role == "tool" %}
41
+ {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %}
42
+ {{- '<|im_start|>user' }}
43
+ {%- endif %}
44
+ {{- '\n<tool_response>\n' }}
45
+ {{- message.content }}
46
+ {{- '\n</tool_response>' }}
47
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
48
+ {{- '<|im_end|>\n' }}
49
+ {%- endif %}
50
+ {%- endif %}
51
+ {%- endfor %}
52
+ {%- if add_generation_prompt %}
53
+ {{- '<|im_start|>assistant\n' }}
54
+ {%- endif %}
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/config.json ADDED
@@ -0,0 +1,67 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen2ForCausalLM"
4
+ ],
5
+ "attention_dropout": 0.0,
6
+ "dtype": "bfloat16",
7
+ "eos_token_id": 151643,
8
+ "hidden_act": "silu",
9
+ "hidden_size": 2048,
10
+ "initializer_range": 0.02,
11
+ "intermediate_size": 11008,
12
+ "layer_types": [
13
+ "full_attention",
14
+ "full_attention",
15
+ "full_attention",
16
+ "full_attention",
17
+ "full_attention",
18
+ "full_attention",
19
+ "full_attention",
20
+ "full_attention",
21
+ "full_attention",
22
+ "full_attention",
23
+ "full_attention",
24
+ "full_attention",
25
+ "full_attention",
26
+ "full_attention",
27
+ "full_attention",
28
+ "full_attention",
29
+ "full_attention",
30
+ "full_attention",
31
+ "full_attention",
32
+ "full_attention",
33
+ "full_attention",
34
+ "full_attention",
35
+ "full_attention",
36
+ "full_attention",
37
+ "full_attention",
38
+ "full_attention",
39
+ "full_attention",
40
+ "full_attention",
41
+ "full_attention",
42
+ "full_attention",
43
+ "full_attention",
44
+ "full_attention",
45
+ "full_attention",
46
+ "full_attention",
47
+ "full_attention",
48
+ "full_attention"
49
+ ],
50
+ "max_position_embeddings": 32768,
51
+ "max_window_layers": 36,
52
+ "model_type": "qwen2",
53
+ "num_attention_heads": 16,
54
+ "num_hidden_layers": 36,
55
+ "num_key_value_heads": 2,
56
+ "pad_token_id": 151643,
57
+ "rms_norm_eps": 1e-06,
58
+ "rope_scaling": null,
59
+ "rope_theta": 1000000.0,
60
+ "sliding_window": null,
61
+ "tie_word_embeddings": true,
62
+ "transformers_version": "4.57.6",
63
+ "use_cache": true,
64
+ "use_mrope": false,
65
+ "use_sliding_window": false,
66
+ "vocab_size": 151936
67
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/eval_metrics.json ADDED
@@ -0,0 +1,1148 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "global_step": 800,
3
+ "ckpt_dir": "/mnt/mystorageoutput/projects/jy_intern/amlt-results/7213899235.25497-028989ec-3fee/qwen3b_kk_rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800",
4
+ "rollouts_dir": "/mnt/mystorageoutput/projects/jy_intern/amlt-results/7213899235.25497-028989ec-3fee/qwen3b_kk_rlrb_bs128_nobuf/rollouts/training",
5
+ "init_model_path": "Qwen/Qwen2.5-3B",
6
+ "prev_step": null,
7
+ "positive_score": 1.0,
8
+ "negative_score": 0.0,
9
+ "history_step_stride": 25,
10
+ "max_samples_per_class": 0,
11
+ "in_batch": {
12
+ "num_records": 1024,
13
+ "source_steps": [
14
+ 800
15
+ ],
16
+ "num_source_steps": 1,
17
+ "num_positives_pre_cap": 590,
18
+ "num_negatives_pre_cap": 434,
19
+ "positive": {
20
+ "loss": 0.22846651220594708,
21
+ "token_entropy": 0.02124891934445546,
22
+ "num_supervised_tokens": 213925,
23
+ "kl_from_init": 3.1852006455332624,
24
+ "kl_to_init": 0.381338181000273,
25
+ "dead_units": {
26
+ "layer_0": {
27
+ "intermediate_size": 11008,
28
+ "dead_count": 0,
29
+ "dead_fraction": 0.0,
30
+ "mean_activation_freq": 0.9239543733404719,
31
+ "min_activation_freq": 0.7831669977795956
32
+ },
33
+ "layer_1": {
34
+ "intermediate_size": 11008,
35
+ "dead_count": 8836,
36
+ "dead_fraction": 0.8026889534883721,
37
+ "mean_activation_freq": 0.14746906347584327,
38
+ "min_activation_freq": 0.0
39
+ },
40
+ "layer_2": {
41
+ "intermediate_size": 11008,
42
+ "dead_count": 7454,
43
+ "dead_fraction": 0.6771438953488372,
44
+ "mean_activation_freq": 0.1664085261182875,
45
+ "min_activation_freq": 0.0
46
+ },
47
+ "layer_3": {
48
+ "intermediate_size": 11008,
49
+ "dead_count": 423,
50
+ "dead_fraction": 0.0384265988372093,
51
+ "mean_activation_freq": 0.38351541543575096,
52
+ "min_activation_freq": 0.0
53
+ },
54
+ "layer_4": {
55
+ "intermediate_size": 11008,
56
+ "dead_count": 32,
57
+ "dead_fraction": 0.0029069767441860465,
58
+ "mean_activation_freq": 0.5462655884377268,
59
+ "min_activation_freq": 0.0
60
+ },
61
+ "layer_5": {
62
+ "intermediate_size": 11008,
63
+ "dead_count": 8,
64
+ "dead_fraction": 0.0007267441860465116,
65
+ "mean_activation_freq": 0.7138580867425282,
66
+ "min_activation_freq": 0.0
67
+ },
68
+ "layer_6": {
69
+ "intermediate_size": 11008,
70
+ "dead_count": 0,
71
+ "dead_fraction": 0.0,
72
+ "mean_activation_freq": 0.8697419845815068,
73
+ "min_activation_freq": 0.09221923571345098
74
+ },
75
+ "layer_7": {
76
+ "intermediate_size": 11008,
77
+ "dead_count": 0,
78
+ "dead_fraction": 0.0,
79
+ "mean_activation_freq": 0.8843827167204328,
80
+ "min_activation_freq": 0.04152389856258034
81
+ },
82
+ "layer_8": {
83
+ "intermediate_size": 11008,
84
+ "dead_count": 0,
85
+ "dead_fraction": 0.0,
86
+ "mean_activation_freq": 0.9411821491686393,
87
+ "min_activation_freq": 0.08347317985275213
88
+ },
89
+ "layer_9": {
90
+ "intermediate_size": 11008,
91
+ "dead_count": 0,
92
+ "dead_fraction": 0.0,
93
+ "mean_activation_freq": 0.949455535944324,
94
+ "min_activation_freq": 0.251485333644969
95
+ },
96
+ "layer_10": {
97
+ "intermediate_size": 11008,
98
+ "dead_count": 0,
99
+ "dead_fraction": 0.0,
100
+ "mean_activation_freq": 0.9740596862761618,
101
+ "min_activation_freq": 0.6816734836975575
102
+ },
103
+ "layer_11": {
104
+ "intermediate_size": 11008,
105
+ "dead_count": 0,
106
+ "dead_fraction": 0.0,
107
+ "mean_activation_freq": 0.9851513385104266,
108
+ "min_activation_freq": 0.9376370223209068
109
+ },
110
+ "layer_12": {
111
+ "intermediate_size": 11008,
112
+ "dead_count": 0,
113
+ "dead_fraction": 0.0,
114
+ "mean_activation_freq": 0.9868049346244471,
115
+ "min_activation_freq": 0.9187238518172256
116
+ },
117
+ "layer_13": {
118
+ "intermediate_size": 11008,
119
+ "dead_count": 0,
120
+ "dead_fraction": 0.0,
121
+ "mean_activation_freq": 0.9807176214529923,
122
+ "min_activation_freq": 0.9038120836741849
123
+ },
124
+ "layer_14": {
125
+ "intermediate_size": 11008,
126
+ "dead_count": 0,
127
+ "dead_fraction": 0.0,
128
+ "mean_activation_freq": 0.9830469019652073,
129
+ "min_activation_freq": 0.887418487787776
130
+ },
131
+ "layer_15": {
132
+ "intermediate_size": 11008,
133
+ "dead_count": 0,
134
+ "dead_fraction": 0.0,
135
+ "mean_activation_freq": 0.9803359979487759,
136
+ "min_activation_freq": 0.9080705854855673
137
+ },
138
+ "layer_16": {
139
+ "intermediate_size": 11008,
140
+ "dead_count": 0,
141
+ "dead_fraction": 0.0,
142
+ "mean_activation_freq": 0.9798200677535867,
143
+ "min_activation_freq": 0.9004931634918779
144
+ },
145
+ "layer_17": {
146
+ "intermediate_size": 11008,
147
+ "dead_count": 0,
148
+ "dead_fraction": 0.0,
149
+ "mean_activation_freq": 0.9799694889740753,
150
+ "min_activation_freq": 0.9170924389388804
151
+ },
152
+ "layer_18": {
153
+ "intermediate_size": 11008,
154
+ "dead_count": 0,
155
+ "dead_fraction": 0.0,
156
+ "mean_activation_freq": 0.9805474599539069,
157
+ "min_activation_freq": 0.9199859763935958
158
+ },
159
+ "layer_19": {
160
+ "intermediate_size": 11008,
161
+ "dead_count": 0,
162
+ "dead_fraction": 0.0,
163
+ "mean_activation_freq": 0.9775518097178701,
164
+ "min_activation_freq": 0.9201869814187215
165
+ },
166
+ "layer_20": {
167
+ "intermediate_size": 11008,
168
+ "dead_count": 0,
169
+ "dead_fraction": 0.0,
170
+ "mean_activation_freq": 0.9800574265493232,
171
+ "min_activation_freq": 0.9125020451092672
172
+ },
173
+ "layer_21": {
174
+ "intermediate_size": 11008,
175
+ "dead_count": 0,
176
+ "dead_fraction": 0.0,
177
+ "mean_activation_freq": 0.9799338660242805,
178
+ "min_activation_freq": 0.9199111838261073
179
+ },
180
+ "layer_22": {
181
+ "intermediate_size": 11008,
182
+ "dead_count": 0,
183
+ "dead_fraction": 0.0,
184
+ "mean_activation_freq": 0.9796100334181724,
185
+ "min_activation_freq": 0.9252027579759261
186
+ },
187
+ "layer_23": {
188
+ "intermediate_size": 11008,
189
+ "dead_count": 0,
190
+ "dead_fraction": 0.0,
191
+ "mean_activation_freq": 0.9796073602531316,
192
+ "min_activation_freq": 0.9406333995559191
193
+ },
194
+ "layer_24": {
195
+ "intermediate_size": 11008,
196
+ "dead_count": 0,
197
+ "dead_fraction": 0.0,
198
+ "mean_activation_freq": 0.9816434992363113,
199
+ "min_activation_freq": 0.9302746289587471
200
+ },
201
+ "layer_25": {
202
+ "intermediate_size": 11008,
203
+ "dead_count": 0,
204
+ "dead_fraction": 0.0,
205
+ "mean_activation_freq": 0.9837073716167368,
206
+ "min_activation_freq": 0.9493560827392777
207
+ },
208
+ "layer_26": {
209
+ "intermediate_size": 11008,
210
+ "dead_count": 0,
211
+ "dead_fraction": 0.0,
212
+ "mean_activation_freq": 0.9856727084584632,
213
+ "min_activation_freq": 0.9534836975575551
214
+ },
215
+ "layer_27": {
216
+ "intermediate_size": 11008,
217
+ "dead_count": 0,
218
+ "dead_fraction": 0.0,
219
+ "mean_activation_freq": 0.9869145275967451,
220
+ "min_activation_freq": 0.9421853453313076
221
+ },
222
+ "layer_28": {
223
+ "intermediate_size": 11008,
224
+ "dead_count": 0,
225
+ "dead_fraction": 0.0,
226
+ "mean_activation_freq": 0.9872723253232089,
227
+ "min_activation_freq": 0.22585018113824937
228
+ },
229
+ "layer_29": {
230
+ "intermediate_size": 11008,
231
+ "dead_count": 0,
232
+ "dead_fraction": 0.0,
233
+ "mean_activation_freq": 0.9884746767402454,
234
+ "min_activation_freq": 0.9602664485216781
235
+ },
236
+ "layer_30": {
237
+ "intermediate_size": 11008,
238
+ "dead_count": 0,
239
+ "dead_fraction": 0.0,
240
+ "mean_activation_freq": 0.9900258042171375,
241
+ "min_activation_freq": 0.5667547037513146
242
+ },
243
+ "layer_31": {
244
+ "intermediate_size": 11008,
245
+ "dead_count": 0,
246
+ "dead_fraction": 0.0,
247
+ "mean_activation_freq": 0.9908556939307135,
248
+ "min_activation_freq": 0.9450975809278952
249
+ },
250
+ "layer_32": {
251
+ "intermediate_size": 11008,
252
+ "dead_count": 0,
253
+ "dead_fraction": 0.0,
254
+ "mean_activation_freq": 0.9890381030694304,
255
+ "min_activation_freq": 0.5024003739628374
256
+ },
257
+ "layer_33": {
258
+ "intermediate_size": 11008,
259
+ "dead_count": 0,
260
+ "dead_fraction": 0.0,
261
+ "mean_activation_freq": 0.986953785966066,
262
+ "min_activation_freq": 0.9277363561996026
263
+ },
264
+ "layer_34": {
265
+ "intermediate_size": 11008,
266
+ "dead_count": 0,
267
+ "dead_fraction": 0.0,
268
+ "mean_activation_freq": 0.9881610340099631,
269
+ "min_activation_freq": 0.8843847142690194
270
+ },
271
+ "layer_35": {
272
+ "intermediate_size": 11008,
273
+ "dead_count": 0,
274
+ "dead_fraction": 0.0,
275
+ "mean_activation_freq": 0.9917719648811933,
276
+ "min_activation_freq": 0.006376066378403646
277
+ },
278
+ "_overall": {
279
+ "dead_count": 16753,
280
+ "intermediate_total": 396288,
281
+ "dead_fraction": 0.042274810239018086
282
+ }
283
+ },
284
+ "size": 590,
285
+ "size_pre_filter": 590,
286
+ "skipped_long": 0
287
+ },
288
+ "negative": {
289
+ "loss": 0.3168102655818925,
290
+ "token_entropy": 0.02307344691011331,
291
+ "num_supervised_tokens": 188301,
292
+ "kl_from_init": 3.0714095322283206,
293
+ "kl_to_init": 0.3561845064161942,
294
+ "dead_units": {
295
+ "layer_0": {
296
+ "intermediate_size": 11008,
297
+ "dead_count": 0,
298
+ "dead_fraction": 0.0,
299
+ "mean_activation_freq": 0.9242351162268897,
300
+ "min_activation_freq": 0.7843187237454926
301
+ },
302
+ "layer_1": {
303
+ "intermediate_size": 11008,
304
+ "dead_count": 8842,
305
+ "dead_fraction": 0.803234011627907,
306
+ "mean_activation_freq": 0.1472054527438627,
307
+ "min_activation_freq": 0.0
308
+ },
309
+ "layer_2": {
310
+ "intermediate_size": 11008,
311
+ "dead_count": 7502,
312
+ "dead_fraction": 0.6815043604651163,
313
+ "mean_activation_freq": 0.16628240947308753,
314
+ "min_activation_freq": 0.0
315
+ },
316
+ "layer_3": {
317
+ "intermediate_size": 11008,
318
+ "dead_count": 473,
319
+ "dead_fraction": 0.04296875,
320
+ "mean_activation_freq": 0.38328771117692195,
321
+ "min_activation_freq": 0.0
322
+ },
323
+ "layer_4": {
324
+ "intermediate_size": 11008,
325
+ "dead_count": 28,
326
+ "dead_fraction": 0.002543604651162791,
327
+ "mean_activation_freq": 0.5482346113141096,
328
+ "min_activation_freq": 0.0
329
+ },
330
+ "layer_5": {
331
+ "intermediate_size": 11008,
332
+ "dead_count": 16,
333
+ "dead_fraction": 0.0014534883720930232,
334
+ "mean_activation_freq": 0.7154141417747105,
335
+ "min_activation_freq": 0.0
336
+ },
337
+ "layer_6": {
338
+ "intermediate_size": 11008,
339
+ "dead_count": 0,
340
+ "dead_fraction": 0.0,
341
+ "mean_activation_freq": 0.8700104514946259,
342
+ "min_activation_freq": 0.09409934094880007
343
+ },
344
+ "layer_7": {
345
+ "intermediate_size": 11008,
346
+ "dead_count": 0,
347
+ "dead_fraction": 0.0,
348
+ "mean_activation_freq": 0.8847211543680745,
349
+ "min_activation_freq": 0.04473688403141778
350
+ },
351
+ "layer_8": {
352
+ "intermediate_size": 11008,
353
+ "dead_count": 0,
354
+ "dead_fraction": 0.0,
355
+ "mean_activation_freq": 0.9411543701199947,
356
+ "min_activation_freq": 0.08446582864668802
357
+ },
358
+ "layer_9": {
359
+ "intermediate_size": 11008,
360
+ "dead_count": 0,
361
+ "dead_fraction": 0.0,
362
+ "mean_activation_freq": 0.9497242306062301,
363
+ "min_activation_freq": 0.26331246249356083
364
+ },
365
+ "layer_10": {
366
+ "intermediate_size": 11008,
367
+ "dead_count": 0,
368
+ "dead_fraction": 0.0,
369
+ "mean_activation_freq": 0.9741571405212747,
370
+ "min_activation_freq": 0.6915098698360604
371
+ },
372
+ "layer_11": {
373
+ "intermediate_size": 11008,
374
+ "dead_count": 0,
375
+ "dead_fraction": 0.0,
376
+ "mean_activation_freq": 0.9851283456608254,
377
+ "min_activation_freq": 0.9332133127280259
378
+ },
379
+ "layer_12": {
380
+ "intermediate_size": 11008,
381
+ "dead_count": 0,
382
+ "dead_fraction": 0.0,
383
+ "mean_activation_freq": 0.9867881411578729,
384
+ "min_activation_freq": 0.9188267720298884
385
+ },
386
+ "layer_13": {
387
+ "intermediate_size": 11008,
388
+ "dead_count": 0,
389
+ "dead_fraction": 0.0,
390
+ "mean_activation_freq": 0.9805610480477016,
391
+ "min_activation_freq": 0.9031178804148677
392
+ },
393
+ "layer_14": {
394
+ "intermediate_size": 11008,
395
+ "dead_count": 0,
396
+ "dead_fraction": 0.0,
397
+ "mean_activation_freq": 0.9829540668350081,
398
+ "min_activation_freq": 0.8891933659407014
399
+ },
400
+ "layer_15": {
401
+ "intermediate_size": 11008,
402
+ "dead_count": 0,
403
+ "dead_fraction": 0.0,
404
+ "mean_activation_freq": 0.9802479587242061,
405
+ "min_activation_freq": 0.9100535844206882
406
+ },
407
+ "layer_16": {
408
+ "intermediate_size": 11008,
409
+ "dead_count": 0,
410
+ "dead_fraction": 0.0,
411
+ "mean_activation_freq": 0.9797743169088631,
412
+ "min_activation_freq": 0.9010467283763761
413
+ },
414
+ "layer_17": {
415
+ "intermediate_size": 11008,
416
+ "dead_count": 0,
417
+ "dead_fraction": 0.0,
418
+ "mean_activation_freq": 0.9799637166111642,
419
+ "min_activation_freq": 0.9162033127811324
420
+ },
421
+ "layer_18": {
422
+ "intermediate_size": 11008,
423
+ "dead_count": 0,
424
+ "dead_fraction": 0.0,
425
+ "mean_activation_freq": 0.9805810435378205,
426
+ "min_activation_freq": 0.9217476274687867
427
+ },
428
+ "layer_19": {
429
+ "intermediate_size": 11008,
430
+ "dead_count": 0,
431
+ "dead_fraction": 0.0,
432
+ "mean_activation_freq": 0.9775503337532758,
433
+ "min_activation_freq": 0.9195437092739815
434
+ },
435
+ "layer_20": {
436
+ "intermediate_size": 11008,
437
+ "dead_count": 0,
438
+ "dead_fraction": 0.0,
439
+ "mean_activation_freq": 0.9800634378886884,
440
+ "min_activation_freq": 0.9164847770325172
441
+ },
442
+ "layer_21": {
443
+ "intermediate_size": 11008,
444
+ "dead_count": 0,
445
+ "dead_fraction": 0.0,
446
+ "mean_activation_freq": 0.9798355027130302,
447
+ "min_activation_freq": 0.9192197598525765
448
+ },
449
+ "layer_22": {
450
+ "intermediate_size": 11008,
451
+ "dead_count": 0,
452
+ "dead_fraction": 0.0,
453
+ "mean_activation_freq": 0.979449169118518,
454
+ "min_activation_freq": 0.9272016611701478
455
+ },
456
+ "layer_23": {
457
+ "intermediate_size": 11008,
458
+ "dead_count": 0,
459
+ "dead_fraction": 0.0,
460
+ "mean_activation_freq": 0.979364890108063,
461
+ "min_activation_freq": 0.939607330816087
462
+ },
463
+ "layer_24": {
464
+ "intermediate_size": 11008,
465
+ "dead_count": 0,
466
+ "dead_fraction": 0.0,
467
+ "mean_activation_freq": 0.9815107925801442,
468
+ "min_activation_freq": 0.9298038778338936
469
+ },
470
+ "layer_25": {
471
+ "intermediate_size": 11008,
472
+ "dead_count": 0,
473
+ "dead_fraction": 0.0,
474
+ "mean_activation_freq": 0.983528936090448,
475
+ "min_activation_freq": 0.9507118921301534
476
+ },
477
+ "layer_26": {
478
+ "intermediate_size": 11008,
479
+ "dead_count": 0,
480
+ "dead_fraction": 0.0,
481
+ "mean_activation_freq": 0.9855176587748921,
482
+ "min_activation_freq": 0.9551887669210467
483
+ },
484
+ "layer_27": {
485
+ "intermediate_size": 11008,
486
+ "dead_count": 0,
487
+ "dead_fraction": 0.0,
488
+ "mean_activation_freq": 0.9867770658938813,
489
+ "min_activation_freq": 0.9402552296588973
490
+ },
491
+ "layer_28": {
492
+ "intermediate_size": 11008,
493
+ "dead_count": 0,
494
+ "dead_fraction": 0.0,
495
+ "mean_activation_freq": 0.9871967584324727,
496
+ "min_activation_freq": 0.2392977201395638
497
+ },
498
+ "layer_29": {
499
+ "intermediate_size": 11008,
500
+ "dead_count": 0,
501
+ "dead_fraction": 0.0,
502
+ "mean_activation_freq": 0.9884074154784405,
503
+ "min_activation_freq": 0.958608823107684
504
+ },
505
+ "layer_30": {
506
+ "intermediate_size": 11008,
507
+ "dead_count": 0,
508
+ "dead_fraction": 0.0,
509
+ "mean_activation_freq": 0.9899759573999101,
510
+ "min_activation_freq": 0.5797685620363142
511
+ },
512
+ "layer_31": {
513
+ "intermediate_size": 11008,
514
+ "dead_count": 0,
515
+ "dead_fraction": 0.0,
516
+ "mean_activation_freq": 0.9908266314598607,
517
+ "min_activation_freq": 0.9442700782258193
518
+ },
519
+ "layer_32": {
520
+ "intermediate_size": 11008,
521
+ "dead_count": 0,
522
+ "dead_fraction": 0.0,
523
+ "mean_activation_freq": 0.9889978220406763,
524
+ "min_activation_freq": 0.4871986872082464
525
+ },
526
+ "layer_33": {
527
+ "intermediate_size": 11008,
528
+ "dead_count": 0,
529
+ "dead_fraction": 0.0,
530
+ "mean_activation_freq": 0.9868923929839941,
531
+ "min_activation_freq": 0.9288585828009411
532
+ },
533
+ "layer_34": {
534
+ "intermediate_size": 11008,
535
+ "dead_count": 0,
536
+ "dead_fraction": 0.0,
537
+ "mean_activation_freq": 0.9880888336306369,
538
+ "min_activation_freq": 0.8942331692343641
539
+ },
540
+ "layer_35": {
541
+ "intermediate_size": 11008,
542
+ "dead_count": 0,
543
+ "dead_fraction": 0.0,
544
+ "mean_activation_freq": 0.9919673108032872,
545
+ "min_activation_freq": 0.005916059925332314
546
+ },
547
+ "_overall": {
548
+ "dead_count": 16861,
549
+ "intermediate_total": 396288,
550
+ "dead_fraction": 0.04254733930878553
551
+ }
552
+ },
553
+ "size": 434,
554
+ "size_pre_filter": 434,
555
+ "skipped_long": 0
556
+ }
557
+ },
558
+ "old_data": {
559
+ "num_records": 31744,
560
+ "source_steps": [
561
+ 25,
562
+ 50,
563
+ 75,
564
+ 100,
565
+ 125,
566
+ 150,
567
+ 175,
568
+ 200,
569
+ 225,
570
+ 250,
571
+ 275,
572
+ 300,
573
+ 325,
574
+ 350,
575
+ 375,
576
+ 400,
577
+ 425,
578
+ 450,
579
+ 475,
580
+ 500,
581
+ 525,
582
+ 550,
583
+ 575,
584
+ 600,
585
+ 625,
586
+ 650,
587
+ 675,
588
+ 700,
589
+ 725,
590
+ 750,
591
+ 775
592
+ ],
593
+ "num_source_steps": 31,
594
+ "num_positives_pre_cap": 12143,
595
+ "num_negatives_pre_cap": 19601,
596
+ "positive": {
597
+ "loss": 0.8386550250702521,
598
+ "token_entropy": 0.027094298318338636,
599
+ "num_supervised_tokens": 4386490,
600
+ "kl_from_init": 3.172577502398244,
601
+ "kl_to_init": 0.4242703355377872,
602
+ "dead_units": {
603
+ "layer_0": {
604
+ "intermediate_size": 11008,
605
+ "dead_count": 0,
606
+ "dead_fraction": 0.0,
607
+ "mean_activation_freq": 0.9237279157321553,
608
+ "min_activation_freq": 0.7835399146014239
609
+ },
610
+ "layer_1": {
611
+ "intermediate_size": 11008,
612
+ "dead_count": 8763,
613
+ "dead_fraction": 0.7960574127906976,
614
+ "mean_activation_freq": 0.14735433270513157,
615
+ "min_activation_freq": 0.0
616
+ },
617
+ "layer_2": {
618
+ "intermediate_size": 11008,
619
+ "dead_count": 2499,
620
+ "dead_fraction": 0.22701671511627908,
621
+ "mean_activation_freq": 0.16650525008884307,
622
+ "min_activation_freq": 0.0
623
+ },
624
+ "layer_3": {
625
+ "intermediate_size": 11008,
626
+ "dead_count": 48,
627
+ "dead_fraction": 0.00436046511627907,
628
+ "mean_activation_freq": 0.3866349886896046,
629
+ "min_activation_freq": 0.0
630
+ },
631
+ "layer_4": {
632
+ "intermediate_size": 11008,
633
+ "dead_count": 1,
634
+ "dead_fraction": 9.084302325581395e-05,
635
+ "mean_activation_freq": 0.5526039419108709,
636
+ "min_activation_freq": 0.0
637
+ },
638
+ "layer_5": {
639
+ "intermediate_size": 11008,
640
+ "dead_count": 0,
641
+ "dead_fraction": 0.0,
642
+ "mean_activation_freq": 0.7150774923757379,
643
+ "min_activation_freq": 1.1398635355375255e-05
644
+ },
645
+ "layer_6": {
646
+ "intermediate_size": 11008,
647
+ "dead_count": 0,
648
+ "dead_fraction": 0.0,
649
+ "mean_activation_freq": 0.8694079081916265,
650
+ "min_activation_freq": 0.09600728600771916
651
+ },
652
+ "layer_7": {
653
+ "intermediate_size": 11008,
654
+ "dead_count": 0,
655
+ "dead_fraction": 0.0,
656
+ "mean_activation_freq": 0.8849198755004267,
657
+ "min_activation_freq": 0.03842274802860602
658
+ },
659
+ "layer_8": {
660
+ "intermediate_size": 11008,
661
+ "dead_count": 0,
662
+ "dead_fraction": 0.0,
663
+ "mean_activation_freq": 0.9407945491507036,
664
+ "min_activation_freq": 0.08709537694147257
665
+ },
666
+ "layer_9": {
667
+ "intermediate_size": 11008,
668
+ "dead_count": 0,
669
+ "dead_fraction": 0.0,
670
+ "mean_activation_freq": 0.9484981262432797,
671
+ "min_activation_freq": 0.25351089367580915
672
+ },
673
+ "layer_10": {
674
+ "intermediate_size": 11008,
675
+ "dead_count": 0,
676
+ "dead_fraction": 0.0,
677
+ "mean_activation_freq": 0.9733491323072144,
678
+ "min_activation_freq": 0.6666170446074197
679
+ },
680
+ "layer_11": {
681
+ "intermediate_size": 11008,
682
+ "dead_count": 0,
683
+ "dead_fraction": 0.0,
684
+ "mean_activation_freq": 0.9851466436468025,
685
+ "min_activation_freq": 0.9372151765990576
686
+ },
687
+ "layer_12": {
688
+ "intermediate_size": 11008,
689
+ "dead_count": 0,
690
+ "dead_fraction": 0.0,
691
+ "mean_activation_freq": 0.9867838763847554,
692
+ "min_activation_freq": 0.9203901068964024
693
+ },
694
+ "layer_13": {
695
+ "intermediate_size": 11008,
696
+ "dead_count": 0,
697
+ "dead_fraction": 0.0,
698
+ "mean_activation_freq": 0.9806985953015979,
699
+ "min_activation_freq": 0.9054863911692492
700
+ },
701
+ "layer_14": {
702
+ "intermediate_size": 11008,
703
+ "dead_count": 0,
704
+ "dead_fraction": 0.0,
705
+ "mean_activation_freq": 0.9829940961662837,
706
+ "min_activation_freq": 0.8945662705260926
707
+ },
708
+ "layer_15": {
709
+ "intermediate_size": 11008,
710
+ "dead_count": 0,
711
+ "dead_fraction": 0.0,
712
+ "mean_activation_freq": 0.9802970996608071,
713
+ "min_activation_freq": 0.9091284831379988
714
+ },
715
+ "layer_16": {
716
+ "intermediate_size": 11008,
717
+ "dead_count": 0,
718
+ "dead_fraction": 0.0,
719
+ "mean_activation_freq": 0.9797830398243268,
720
+ "min_activation_freq": 0.9080020699921806
721
+ },
722
+ "layer_17": {
723
+ "intermediate_size": 11008,
724
+ "dead_count": 0,
725
+ "dead_fraction": 0.0,
726
+ "mean_activation_freq": 0.9799441938303878,
727
+ "min_activation_freq": 0.9206105565041753
728
+ },
729
+ "layer_18": {
730
+ "intermediate_size": 11008,
731
+ "dead_count": 0,
732
+ "dead_fraction": 0.0,
733
+ "mean_activation_freq": 0.9804964731006852,
734
+ "min_activation_freq": 0.9190275140260209
735
+ },
736
+ "layer_19": {
737
+ "intermediate_size": 11008,
738
+ "dead_count": 0,
739
+ "dead_fraction": 0.0,
740
+ "mean_activation_freq": 0.9774391462851887,
741
+ "min_activation_freq": 0.9210671858365117
742
+ },
743
+ "layer_20": {
744
+ "intermediate_size": 11008,
745
+ "dead_count": 0,
746
+ "dead_fraction": 0.0,
747
+ "mean_activation_freq": 0.9799513759647288,
748
+ "min_activation_freq": 0.9115940079653664
749
+ },
750
+ "layer_21": {
751
+ "intermediate_size": 11008,
752
+ "dead_count": 0,
753
+ "dead_fraction": 0.0,
754
+ "mean_activation_freq": 0.9799060995661786,
755
+ "min_activation_freq": 0.921254579401754
756
+ },
757
+ "layer_22": {
758
+ "intermediate_size": 11008,
759
+ "dead_count": 0,
760
+ "dead_fraction": 0.0,
761
+ "mean_activation_freq": 0.979629108585097,
762
+ "min_activation_freq": 0.9265054747645612
763
+ },
764
+ "layer_23": {
765
+ "intermediate_size": 11008,
766
+ "dead_count": 0,
767
+ "dead_fraction": 0.0,
768
+ "mean_activation_freq": 0.9796331367518274,
769
+ "min_activation_freq": 0.9393989271604404
770
+ },
771
+ "layer_24": {
772
+ "intermediate_size": 11008,
773
+ "dead_count": 0,
774
+ "dead_fraction": 0.0,
775
+ "mean_activation_freq": 0.9816847563161629,
776
+ "min_activation_freq": 0.9286003159701721
777
+ },
778
+ "layer_25": {
779
+ "intermediate_size": 11008,
780
+ "dead_count": 0,
781
+ "dead_fraction": 0.0,
782
+ "mean_activation_freq": 0.9837521738009444,
783
+ "min_activation_freq": 0.9521147888174828
784
+ },
785
+ "layer_26": {
786
+ "intermediate_size": 11008,
787
+ "dead_count": 0,
788
+ "dead_fraction": 0.0,
789
+ "mean_activation_freq": 0.9857214633871592,
790
+ "min_activation_freq": 0.9553718348839277
791
+ },
792
+ "layer_27": {
793
+ "intermediate_size": 11008,
794
+ "dead_count": 0,
795
+ "dead_fraction": 0.0,
796
+ "mean_activation_freq": 0.986976763785735,
797
+ "min_activation_freq": 0.9438186340331336
798
+ },
799
+ "layer_28": {
800
+ "intermediate_size": 11008,
801
+ "dead_count": 0,
802
+ "dead_fraction": 0.0,
803
+ "mean_activation_freq": 0.9873534233036128,
804
+ "min_activation_freq": 0.22868557776263027
805
+ },
806
+ "layer_29": {
807
+ "intermediate_size": 11008,
808
+ "dead_count": 0,
809
+ "dead_fraction": 0.0,
810
+ "mean_activation_freq": 0.988561791022277,
811
+ "min_activation_freq": 0.9606047204028734
812
+ },
813
+ "layer_30": {
814
+ "intermediate_size": 11008,
815
+ "dead_count": 0,
816
+ "dead_fraction": 0.0,
817
+ "mean_activation_freq": 0.9900943873527078,
818
+ "min_activation_freq": 0.5556805099293513
819
+ },
820
+ "layer_31": {
821
+ "intermediate_size": 11008,
822
+ "dead_count": 0,
823
+ "dead_fraction": 0.0,
824
+ "mean_activation_freq": 0.9909337736030283,
825
+ "min_activation_freq": 0.9473214346778404
826
+ },
827
+ "layer_32": {
828
+ "intermediate_size": 11008,
829
+ "dead_count": 0,
830
+ "dead_fraction": 0.0,
831
+ "mean_activation_freq": 0.9891818871818938,
832
+ "min_activation_freq": 0.6423377233277632
833
+ },
834
+ "layer_33": {
835
+ "intermediate_size": 11008,
836
+ "dead_count": 0,
837
+ "dead_fraction": 0.0,
838
+ "mean_activation_freq": 0.9871342829856758,
839
+ "min_activation_freq": 0.9250963754619297
840
+ },
841
+ "layer_34": {
842
+ "intermediate_size": 11008,
843
+ "dead_count": 0,
844
+ "dead_fraction": 0.0,
845
+ "mean_activation_freq": 0.9883110041453192,
846
+ "min_activation_freq": 0.8885370763412205
847
+ },
848
+ "layer_35": {
849
+ "intermediate_size": 11008,
850
+ "dead_count": 0,
851
+ "dead_fraction": 0.0,
852
+ "mean_activation_freq": 0.9918224986932327,
853
+ "min_activation_freq": 0.0075981023551860375
854
+ },
855
+ "_overall": {
856
+ "dead_count": 11311,
857
+ "intermediate_total": 396288,
858
+ "dead_fraction": 0.028542373223514213
859
+ }
860
+ },
861
+ "size": 12143,
862
+ "size_pre_filter": 12143,
863
+ "skipped_long": 0
864
+ },
865
+ "negative": {
866
+ "loss": 1.2613379896533514,
867
+ "token_entropy": 0.04655036671746407,
868
+ "num_supervised_tokens": 8511791,
869
+ "kl_from_init": 2.9739833031196854,
870
+ "kl_to_init": 0.41306599295375773,
871
+ "dead_units": {
872
+ "layer_0": {
873
+ "intermediate_size": 11008,
874
+ "dead_count": 0,
875
+ "dead_fraction": 0.0,
876
+ "mean_activation_freq": 0.9240203550139181,
877
+ "min_activation_freq": 0.7855268062855397
878
+ },
879
+ "layer_1": {
880
+ "intermediate_size": 11008,
881
+ "dead_count": 1045,
882
+ "dead_fraction": 0.09493095930232558,
883
+ "mean_activation_freq": 0.1471531651917077,
884
+ "min_activation_freq": 0.0
885
+ },
886
+ "layer_2": {
887
+ "intermediate_size": 11008,
888
+ "dead_count": 630,
889
+ "dead_fraction": 0.05723110465116279,
890
+ "mean_activation_freq": 0.16644100589995048,
891
+ "min_activation_freq": 0.0
892
+ },
893
+ "layer_3": {
894
+ "intermediate_size": 11008,
895
+ "dead_count": 0,
896
+ "dead_fraction": 0.0,
897
+ "mean_activation_freq": 0.38703288791431234,
898
+ "min_activation_freq": 7.049045259687414e-07
899
+ },
900
+ "layer_4": {
901
+ "intermediate_size": 11008,
902
+ "dead_count": 0,
903
+ "dead_fraction": 0.0,
904
+ "mean_activation_freq": 0.5535366651951626,
905
+ "min_activation_freq": 6.814077084364501e-06
906
+ },
907
+ "layer_5": {
908
+ "intermediate_size": 11008,
909
+ "dead_count": 0,
910
+ "dead_fraction": 0.0,
911
+ "mean_activation_freq": 0.7152893019455272,
912
+ "min_activation_freq": 3.007592644133297e-05
913
+ },
914
+ "layer_6": {
915
+ "intermediate_size": 11008,
916
+ "dead_count": 0,
917
+ "dead_fraction": 0.0,
918
+ "mean_activation_freq": 0.8689796278127428,
919
+ "min_activation_freq": 0.09508915338734233
920
+ },
921
+ "layer_7": {
922
+ "intermediate_size": 11008,
923
+ "dead_count": 0,
924
+ "dead_fraction": 0.0,
925
+ "mean_activation_freq": 0.885919360497421,
926
+ "min_activation_freq": 0.041131766510714374
927
+ },
928
+ "layer_8": {
929
+ "intermediate_size": 11008,
930
+ "dead_count": 0,
931
+ "dead_fraction": 0.0,
932
+ "mean_activation_freq": 0.9408281318723496,
933
+ "min_activation_freq": 0.09025844267087856
934
+ },
935
+ "layer_9": {
936
+ "intermediate_size": 11008,
937
+ "dead_count": 0,
938
+ "dead_fraction": 0.0,
939
+ "mean_activation_freq": 0.9490171990036944,
940
+ "min_activation_freq": 0.267527362925147
941
+ },
942
+ "layer_10": {
943
+ "intermediate_size": 11008,
944
+ "dead_count": 0,
945
+ "dead_fraction": 0.0,
946
+ "mean_activation_freq": 0.9734657604344181,
947
+ "min_activation_freq": 0.6740499149943884
948
+ },
949
+ "layer_11": {
950
+ "intermediate_size": 11008,
951
+ "dead_count": 0,
952
+ "dead_fraction": 0.0,
953
+ "mean_activation_freq": 0.9851154419789937,
954
+ "min_activation_freq": 0.9352177467703331
955
+ },
956
+ "layer_12": {
957
+ "intermediate_size": 11008,
958
+ "dead_count": 0,
959
+ "dead_fraction": 0.0,
960
+ "mean_activation_freq": 0.9867623353499616,
961
+ "min_activation_freq": 0.9196131577948754
962
+ },
963
+ "layer_13": {
964
+ "intermediate_size": 11008,
965
+ "dead_count": 0,
966
+ "dead_fraction": 0.0,
967
+ "mean_activation_freq": 0.9804969349000903,
968
+ "min_activation_freq": 0.9046273575091306
969
+ },
970
+ "layer_14": {
971
+ "intermediate_size": 11008,
972
+ "dead_count": 0,
973
+ "dead_fraction": 0.0,
974
+ "mean_activation_freq": 0.9828480697611489,
975
+ "min_activation_freq": 0.8956286638147013
976
+ },
977
+ "layer_15": {
978
+ "intermediate_size": 11008,
979
+ "dead_count": 0,
980
+ "dead_fraction": 0.0,
981
+ "mean_activation_freq": 0.98016437142951,
982
+ "min_activation_freq": 0.9112155126929221
983
+ },
984
+ "layer_16": {
985
+ "intermediate_size": 11008,
986
+ "dead_count": 0,
987
+ "dead_fraction": 0.0,
988
+ "mean_activation_freq": 0.9797215766779925,
989
+ "min_activation_freq": 0.907227515337254
990
+ },
991
+ "layer_17": {
992
+ "intermediate_size": 11008,
993
+ "dead_count": 0,
994
+ "dead_fraction": 0.0,
995
+ "mean_activation_freq": 0.9798848378085928,
996
+ "min_activation_freq": 0.9213811758300926
997
+ },
998
+ "layer_18": {
999
+ "intermediate_size": 11008,
1000
+ "dead_count": 0,
1001
+ "dead_fraction": 0.0,
1002
+ "mean_activation_freq": 0.9804610396051346,
1003
+ "min_activation_freq": 0.919059455289727
1004
+ },
1005
+ "layer_19": {
1006
+ "intermediate_size": 11008,
1007
+ "dead_count": 0,
1008
+ "dead_fraction": 0.0,
1009
+ "mean_activation_freq": 0.9773634239997302,
1010
+ "min_activation_freq": 0.9214577754552479
1011
+ },
1012
+ "layer_20": {
1013
+ "intermediate_size": 11008,
1014
+ "dead_count": 0,
1015
+ "dead_fraction": 0.0,
1016
+ "mean_activation_freq": 0.9799163235120683,
1017
+ "min_activation_freq": 0.9172910848022466
1018
+ },
1019
+ "layer_21": {
1020
+ "intermediate_size": 11008,
1021
+ "dead_count": 0,
1022
+ "dead_fraction": 0.0,
1023
+ "mean_activation_freq": 0.979755411604299,
1024
+ "min_activation_freq": 0.9205088564792063
1025
+ },
1026
+ "layer_22": {
1027
+ "intermediate_size": 11008,
1028
+ "dead_count": 0,
1029
+ "dead_fraction": 0.0,
1030
+ "mean_activation_freq": 0.979381594879184,
1031
+ "min_activation_freq": 0.928913315658244
1032
+ },
1033
+ "layer_23": {
1034
+ "intermediate_size": 11008,
1035
+ "dead_count": 0,
1036
+ "dead_fraction": 0.0,
1037
+ "mean_activation_freq": 0.9792993795402529,
1038
+ "min_activation_freq": 0.9395880373472516
1039
+ },
1040
+ "layer_24": {
1041
+ "intermediate_size": 11008,
1042
+ "dead_count": 0,
1043
+ "dead_fraction": 0.0,
1044
+ "mean_activation_freq": 0.9814490544210215,
1045
+ "min_activation_freq": 0.9300873341462449
1046
+ },
1047
+ "layer_25": {
1048
+ "intermediate_size": 11008,
1049
+ "dead_count": 0,
1050
+ "dead_fraction": 0.0,
1051
+ "mean_activation_freq": 0.9834863054719325,
1052
+ "min_activation_freq": 0.9531357149159325
1053
+ },
1054
+ "layer_26": {
1055
+ "intermediate_size": 11008,
1056
+ "dead_count": 0,
1057
+ "dead_fraction": 0.0,
1058
+ "mean_activation_freq": 0.985500215408014,
1059
+ "min_activation_freq": 0.9555878427936024
1060
+ },
1061
+ "layer_27": {
1062
+ "intermediate_size": 11008,
1063
+ "dead_count": 0,
1064
+ "dead_fraction": 0.0,
1065
+ "mean_activation_freq": 0.9867909490434921,
1066
+ "min_activation_freq": 0.9403942131567845
1067
+ },
1068
+ "layer_28": {
1069
+ "intermediate_size": 11008,
1070
+ "dead_count": 0,
1071
+ "dead_fraction": 0.0,
1072
+ "mean_activation_freq": 0.9872282846057275,
1073
+ "min_activation_freq": 0.23535951481891415
1074
+ },
1075
+ "layer_29": {
1076
+ "intermediate_size": 11008,
1077
+ "dead_count": 0,
1078
+ "dead_fraction": 0.0,
1079
+ "mean_activation_freq": 0.988443814924251,
1080
+ "min_activation_freq": 0.959926177698677
1081
+ },
1082
+ "layer_30": {
1083
+ "intermediate_size": 11008,
1084
+ "dead_count": 0,
1085
+ "dead_fraction": 0.0,
1086
+ "mean_activation_freq": 0.9900132277955492,
1087
+ "min_activation_freq": 0.5775554169504397
1088
+ },
1089
+ "layer_31": {
1090
+ "intermediate_size": 11008,
1091
+ "dead_count": 0,
1092
+ "dead_fraction": 0.0,
1093
+ "mean_activation_freq": 0.9909034724774864,
1094
+ "min_activation_freq": 0.9489783055058565
1095
+ },
1096
+ "layer_32": {
1097
+ "intermediate_size": 11008,
1098
+ "dead_count": 0,
1099
+ "dead_fraction": 0.0,
1100
+ "mean_activation_freq": 0.9891706005520413,
1101
+ "min_activation_freq": 0.6691555279024121
1102
+ },
1103
+ "layer_33": {
1104
+ "intermediate_size": 11008,
1105
+ "dead_count": 0,
1106
+ "dead_fraction": 0.0,
1107
+ "mean_activation_freq": 0.9871393447542528,
1108
+ "min_activation_freq": 0.9260819491456028
1109
+ },
1110
+ "layer_34": {
1111
+ "intermediate_size": 11008,
1112
+ "dead_count": 0,
1113
+ "dead_fraction": 0.0,
1114
+ "mean_activation_freq": 0.9882501677852071,
1115
+ "min_activation_freq": 0.8984714262838456
1116
+ },
1117
+ "layer_35": {
1118
+ "intermediate_size": 11008,
1119
+ "dead_count": 0,
1120
+ "dead_fraction": 0.0,
1121
+ "mean_activation_freq": 0.9921358226794929,
1122
+ "min_activation_freq": 0.016832297691519917
1123
+ },
1124
+ "_overall": {
1125
+ "dead_count": 1675,
1126
+ "intermediate_total": 396288,
1127
+ "dead_fraction": 0.00422672399870801
1128
+ }
1129
+ },
1130
+ "size": 19601,
1131
+ "size_pre_filter": 19601,
1132
+ "skipped_long": 0
1133
+ }
1134
+ },
1135
+ "new_data": {
1136
+ "num_records": 0,
1137
+ "source_steps": [],
1138
+ "num_source_steps": 0,
1139
+ "num_positives_pre_cap": 0,
1140
+ "num_negatives_pre_cap": 0,
1141
+ "positive": {
1142
+ "size": 0
1143
+ },
1144
+ "negative": {
1145
+ "size": 0
1146
+ }
1147
+ }
1148
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/generation_config.json ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 151643,
3
+ "eos_token_id": 151643,
4
+ "max_new_tokens": 2048,
5
+ "transformers_version": "4.57.6"
6
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/merges.txt ADDED
The diff for this file is too large to render. See raw diff
 
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/model-00001-of-00002.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8fc1de3a344328f060df68e7ca8fe83714bc2b9a2fb6202b090e9a1735925376
3
+ size 4978997168
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/model-00002-of-00002.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d73806b6f5a4d42146bb391b28412e3e1e3687217b8c2ce212651bac933dcb84
3
+ size 1815259824
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/model.safetensors.index.json ADDED
@@ -0,0 +1,443 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "metadata": {
3
+ "total_parameters": 3397103616,
4
+ "total_size": 6794207232
5
+ },
6
+ "weight_map": {
7
+ "lm_head.weight": "model-00001-of-00002.safetensors",
8
+ "model.embed_tokens.weight": "model-00001-of-00002.safetensors",
9
+ "model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
10
+ "model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
11
+ "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
12
+ "model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
13
+ "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
14
+ "model.layers.0.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
15
+ "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
16
+ "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
17
+ "model.layers.0.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
18
+ "model.layers.0.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
19
+ "model.layers.0.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
20
+ "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
21
+ "model.layers.1.input_layernorm.weight": "model-00002-of-00002.safetensors",
22
+ "model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
23
+ "model.layers.1.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
24
+ "model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
25
+ "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
26
+ "model.layers.1.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
27
+ "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
28
+ "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
29
+ "model.layers.1.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
30
+ "model.layers.1.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
31
+ "model.layers.1.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
32
+ "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
33
+ "model.layers.10.input_layernorm.weight": "model-00002-of-00002.safetensors",
34
+ "model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
35
+ "model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
36
+ "model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
37
+ "model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
38
+ "model.layers.10.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
39
+ "model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
40
+ "model.layers.10.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
41
+ "model.layers.10.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
42
+ "model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
43
+ "model.layers.10.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
44
+ "model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
45
+ "model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors",
46
+ "model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
47
+ "model.layers.11.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
48
+ "model.layers.11.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
49
+ "model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
50
+ "model.layers.11.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
51
+ "model.layers.11.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
52
+ "model.layers.11.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
53
+ "model.layers.11.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
54
+ "model.layers.11.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
55
+ "model.layers.11.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
56
+ "model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
57
+ "model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors",
58
+ "model.layers.12.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
59
+ "model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
60
+ "model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
61
+ "model.layers.12.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
62
+ "model.layers.12.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
63
+ "model.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
64
+ "model.layers.12.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
65
+ "model.layers.12.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
66
+ "model.layers.12.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
67
+ "model.layers.12.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
68
+ "model.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
69
+ "model.layers.13.input_layernorm.weight": "model-00001-of-00002.safetensors",
70
+ "model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
71
+ "model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
72
+ "model.layers.13.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
73
+ "model.layers.13.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
74
+ "model.layers.13.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
75
+ "model.layers.13.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
76
+ "model.layers.13.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
77
+ "model.layers.13.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
78
+ "model.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
79
+ "model.layers.13.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
80
+ "model.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
81
+ "model.layers.14.input_layernorm.weight": "model-00001-of-00002.safetensors",
82
+ "model.layers.14.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
83
+ "model.layers.14.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
84
+ "model.layers.14.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
85
+ "model.layers.14.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
86
+ "model.layers.14.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
87
+ "model.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
88
+ "model.layers.14.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
89
+ "model.layers.14.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
90
+ "model.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
91
+ "model.layers.14.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
92
+ "model.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
93
+ "model.layers.15.input_layernorm.weight": "model-00002-of-00002.safetensors",
94
+ "model.layers.15.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
95
+ "model.layers.15.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
96
+ "model.layers.15.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
97
+ "model.layers.15.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
98
+ "model.layers.15.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
99
+ "model.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
100
+ "model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
101
+ "model.layers.15.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
102
+ "model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
103
+ "model.layers.15.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
104
+ "model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
105
+ "model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors",
106
+ "model.layers.16.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
107
+ "model.layers.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
108
+ "model.layers.16.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
109
+ "model.layers.16.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
110
+ "model.layers.16.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
111
+ "model.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
112
+ "model.layers.16.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
113
+ "model.layers.16.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
114
+ "model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
115
+ "model.layers.16.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
116
+ "model.layers.16.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
117
+ "model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors",
118
+ "model.layers.17.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
119
+ "model.layers.17.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
120
+ "model.layers.17.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
121
+ "model.layers.17.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
122
+ "model.layers.17.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
123
+ "model.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
124
+ "model.layers.17.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
125
+ "model.layers.17.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
126
+ "model.layers.17.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
127
+ "model.layers.17.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
128
+ "model.layers.17.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
129
+ "model.layers.18.input_layernorm.weight": "model-00002-of-00002.safetensors",
130
+ "model.layers.18.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
131
+ "model.layers.18.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
132
+ "model.layers.18.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
133
+ "model.layers.18.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
134
+ "model.layers.18.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
135
+ "model.layers.18.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
136
+ "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
137
+ "model.layers.18.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
138
+ "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
139
+ "model.layers.18.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
140
+ "model.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
141
+ "model.layers.19.input_layernorm.weight": "model-00002-of-00002.safetensors",
142
+ "model.layers.19.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
143
+ "model.layers.19.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
144
+ "model.layers.19.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
145
+ "model.layers.19.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
146
+ "model.layers.19.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
147
+ "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
148
+ "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
149
+ "model.layers.19.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
150
+ "model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
151
+ "model.layers.19.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
152
+ "model.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
153
+ "model.layers.2.input_layernorm.weight": "model-00002-of-00002.safetensors",
154
+ "model.layers.2.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
155
+ "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
156
+ "model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
157
+ "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
158
+ "model.layers.2.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
159
+ "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
160
+ "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
161
+ "model.layers.2.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
162
+ "model.layers.2.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
163
+ "model.layers.2.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
164
+ "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
165
+ "model.layers.20.input_layernorm.weight": "model-00002-of-00002.safetensors",
166
+ "model.layers.20.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
167
+ "model.layers.20.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
168
+ "model.layers.20.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
169
+ "model.layers.20.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
170
+ "model.layers.20.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
171
+ "model.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
172
+ "model.layers.20.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
173
+ "model.layers.20.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
174
+ "model.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
175
+ "model.layers.20.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
176
+ "model.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
177
+ "model.layers.21.input_layernorm.weight": "model-00001-of-00002.safetensors",
178
+ "model.layers.21.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
179
+ "model.layers.21.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
180
+ "model.layers.21.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
181
+ "model.layers.21.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
182
+ "model.layers.21.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
183
+ "model.layers.21.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
184
+ "model.layers.21.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
185
+ "model.layers.21.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
186
+ "model.layers.21.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
187
+ "model.layers.21.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
188
+ "model.layers.21.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
189
+ "model.layers.22.input_layernorm.weight": "model-00002-of-00002.safetensors",
190
+ "model.layers.22.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
191
+ "model.layers.22.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
192
+ "model.layers.22.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
193
+ "model.layers.22.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
194
+ "model.layers.22.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
195
+ "model.layers.22.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
196
+ "model.layers.22.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
197
+ "model.layers.22.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
198
+ "model.layers.22.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
199
+ "model.layers.22.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
200
+ "model.layers.22.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
201
+ "model.layers.23.input_layernorm.weight": "model-00001-of-00002.safetensors",
202
+ "model.layers.23.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
203
+ "model.layers.23.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
204
+ "model.layers.23.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
205
+ "model.layers.23.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
206
+ "model.layers.23.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
207
+ "model.layers.23.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
208
+ "model.layers.23.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
209
+ "model.layers.23.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
210
+ "model.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
211
+ "model.layers.23.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
212
+ "model.layers.23.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
213
+ "model.layers.24.input_layernorm.weight": "model-00001-of-00002.safetensors",
214
+ "model.layers.24.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
215
+ "model.layers.24.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
216
+ "model.layers.24.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
217
+ "model.layers.24.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
218
+ "model.layers.24.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
219
+ "model.layers.24.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
220
+ "model.layers.24.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
221
+ "model.layers.24.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
222
+ "model.layers.24.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
223
+ "model.layers.24.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
224
+ "model.layers.24.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
225
+ "model.layers.25.input_layernorm.weight": "model-00001-of-00002.safetensors",
226
+ "model.layers.25.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
227
+ "model.layers.25.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
228
+ "model.layers.25.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
229
+ "model.layers.25.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
230
+ "model.layers.25.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
231
+ "model.layers.25.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
232
+ "model.layers.25.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
233
+ "model.layers.25.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
234
+ "model.layers.25.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
235
+ "model.layers.25.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
236
+ "model.layers.25.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
237
+ "model.layers.26.input_layernorm.weight": "model-00001-of-00002.safetensors",
238
+ "model.layers.26.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
239
+ "model.layers.26.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
240
+ "model.layers.26.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
241
+ "model.layers.26.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
242
+ "model.layers.26.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
243
+ "model.layers.26.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
244
+ "model.layers.26.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
245
+ "model.layers.26.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
246
+ "model.layers.26.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
247
+ "model.layers.26.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
248
+ "model.layers.26.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
249
+ "model.layers.27.input_layernorm.weight": "model-00001-of-00002.safetensors",
250
+ "model.layers.27.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
251
+ "model.layers.27.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
252
+ "model.layers.27.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
253
+ "model.layers.27.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
254
+ "model.layers.27.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
255
+ "model.layers.27.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
256
+ "model.layers.27.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
257
+ "model.layers.27.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
258
+ "model.layers.27.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
259
+ "model.layers.27.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
260
+ "model.layers.27.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
261
+ "model.layers.28.input_layernorm.weight": "model-00001-of-00002.safetensors",
262
+ "model.layers.28.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
263
+ "model.layers.28.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
264
+ "model.layers.28.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
265
+ "model.layers.28.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
266
+ "model.layers.28.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
267
+ "model.layers.28.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
268
+ "model.layers.28.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
269
+ "model.layers.28.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
270
+ "model.layers.28.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
271
+ "model.layers.28.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
272
+ "model.layers.28.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
273
+ "model.layers.29.input_layernorm.weight": "model-00001-of-00002.safetensors",
274
+ "model.layers.29.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
275
+ "model.layers.29.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
276
+ "model.layers.29.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
277
+ "model.layers.29.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
278
+ "model.layers.29.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
279
+ "model.layers.29.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
280
+ "model.layers.29.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
281
+ "model.layers.29.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
282
+ "model.layers.29.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
283
+ "model.layers.29.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
284
+ "model.layers.29.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
285
+ "model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
286
+ "model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
287
+ "model.layers.3.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
288
+ "model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
289
+ "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
290
+ "model.layers.3.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
291
+ "model.layers.3.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
292
+ "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
293
+ "model.layers.3.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
294
+ "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
295
+ "model.layers.3.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
296
+ "model.layers.3.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
297
+ "model.layers.30.input_layernorm.weight": "model-00002-of-00002.safetensors",
298
+ "model.layers.30.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
299
+ "model.layers.30.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
300
+ "model.layers.30.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
301
+ "model.layers.30.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
302
+ "model.layers.30.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
303
+ "model.layers.30.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
304
+ "model.layers.30.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
305
+ "model.layers.30.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
306
+ "model.layers.30.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
307
+ "model.layers.30.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
308
+ "model.layers.30.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
309
+ "model.layers.31.input_layernorm.weight": "model-00001-of-00002.safetensors",
310
+ "model.layers.31.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
311
+ "model.layers.31.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
312
+ "model.layers.31.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
313
+ "model.layers.31.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
314
+ "model.layers.31.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
315
+ "model.layers.31.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
316
+ "model.layers.31.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
317
+ "model.layers.31.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
318
+ "model.layers.31.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
319
+ "model.layers.31.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
320
+ "model.layers.31.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
321
+ "model.layers.32.input_layernorm.weight": "model-00001-of-00002.safetensors",
322
+ "model.layers.32.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
323
+ "model.layers.32.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
324
+ "model.layers.32.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
325
+ "model.layers.32.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
326
+ "model.layers.32.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
327
+ "model.layers.32.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
328
+ "model.layers.32.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
329
+ "model.layers.32.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
330
+ "model.layers.32.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
331
+ "model.layers.32.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
332
+ "model.layers.32.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
333
+ "model.layers.33.input_layernorm.weight": "model-00001-of-00002.safetensors",
334
+ "model.layers.33.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
335
+ "model.layers.33.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
336
+ "model.layers.33.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
337
+ "model.layers.33.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
338
+ "model.layers.33.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
339
+ "model.layers.33.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
340
+ "model.layers.33.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
341
+ "model.layers.33.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
342
+ "model.layers.33.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
343
+ "model.layers.33.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
344
+ "model.layers.33.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
345
+ "model.layers.34.input_layernorm.weight": "model-00002-of-00002.safetensors",
346
+ "model.layers.34.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
347
+ "model.layers.34.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
348
+ "model.layers.34.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
349
+ "model.layers.34.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
350
+ "model.layers.34.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
351
+ "model.layers.34.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
352
+ "model.layers.34.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
353
+ "model.layers.34.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
354
+ "model.layers.34.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
355
+ "model.layers.34.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
356
+ "model.layers.34.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
357
+ "model.layers.35.input_layernorm.weight": "model-00001-of-00002.safetensors",
358
+ "model.layers.35.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
359
+ "model.layers.35.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
360
+ "model.layers.35.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
361
+ "model.layers.35.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
362
+ "model.layers.35.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
363
+ "model.layers.35.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
364
+ "model.layers.35.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
365
+ "model.layers.35.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
366
+ "model.layers.35.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
367
+ "model.layers.35.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
368
+ "model.layers.35.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
369
+ "model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
370
+ "model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
371
+ "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
372
+ "model.layers.4.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
373
+ "model.layers.4.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
374
+ "model.layers.4.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
375
+ "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
376
+ "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
377
+ "model.layers.4.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
378
+ "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
379
+ "model.layers.4.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
380
+ "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
381
+ "model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
382
+ "model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
383
+ "model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
384
+ "model.layers.5.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
385
+ "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
386
+ "model.layers.5.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
387
+ "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
388
+ "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
389
+ "model.layers.5.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
390
+ "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
391
+ "model.layers.5.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
392
+ "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
393
+ "model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
394
+ "model.layers.6.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
395
+ "model.layers.6.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
396
+ "model.layers.6.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
397
+ "model.layers.6.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
398
+ "model.layers.6.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
399
+ "model.layers.6.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
400
+ "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
401
+ "model.layers.6.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
402
+ "model.layers.6.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
403
+ "model.layers.6.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
404
+ "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
405
+ "model.layers.7.input_layernorm.weight": "model-00002-of-00002.safetensors",
406
+ "model.layers.7.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
407
+ "model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
408
+ "model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
409
+ "model.layers.7.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
410
+ "model.layers.7.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
411
+ "model.layers.7.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
412
+ "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
413
+ "model.layers.7.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
414
+ "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
415
+ "model.layers.7.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
416
+ "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
417
+ "model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors",
418
+ "model.layers.8.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
419
+ "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
420
+ "model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
421
+ "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
422
+ "model.layers.8.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
423
+ "model.layers.8.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
424
+ "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
425
+ "model.layers.8.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
426
+ "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
427
+ "model.layers.8.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
428
+ "model.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
429
+ "model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors",
430
+ "model.layers.9.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
431
+ "model.layers.9.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
432
+ "model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
433
+ "model.layers.9.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
434
+ "model.layers.9.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
435
+ "model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
436
+ "model.layers.9.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
437
+ "model.layers.9.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
438
+ "model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
439
+ "model.layers.9.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
440
+ "model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
441
+ "model.norm.weight": "model-00002-of-00002.safetensors"
442
+ }
443
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/special_tokens_map.json ADDED
@@ -0,0 +1,31 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "additional_special_tokens": [
3
+ "<|im_start|>",
4
+ "<|im_end|>",
5
+ "<|object_ref_start|>",
6
+ "<|object_ref_end|>",
7
+ "<|box_start|>",
8
+ "<|box_end|>",
9
+ "<|quad_start|>",
10
+ "<|quad_end|>",
11
+ "<|vision_start|>",
12
+ "<|vision_end|>",
13
+ "<|vision_pad|>",
14
+ "<|image_pad|>",
15
+ "<|video_pad|>"
16
+ ],
17
+ "eos_token": {
18
+ "content": "<|endoftext|>",
19
+ "lstrip": false,
20
+ "normalized": false,
21
+ "rstrip": false,
22
+ "single_word": false
23
+ },
24
+ "pad_token": {
25
+ "content": "<|endoftext|>",
26
+ "lstrip": false,
27
+ "normalized": false,
28
+ "rstrip": false,
29
+ "single_word": false
30
+ }
31
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9c5ae00e602b8860cbd784ba82a8aa14e8feecec692e7076590d014d7b7fdafa
3
+ size 11421896
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/tokenizer_config.json ADDED
@@ -0,0 +1,207 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_bos_token": false,
3
+ "add_prefix_space": false,
4
+ "added_tokens_decoder": {
5
+ "151643": {
6
+ "content": "<|endoftext|>",
7
+ "lstrip": false,
8
+ "normalized": false,
9
+ "rstrip": false,
10
+ "single_word": false,
11
+ "special": true
12
+ },
13
+ "151644": {
14
+ "content": "<|im_start|>",
15
+ "lstrip": false,
16
+ "normalized": false,
17
+ "rstrip": false,
18
+ "single_word": false,
19
+ "special": true
20
+ },
21
+ "151645": {
22
+ "content": "<|im_end|>",
23
+ "lstrip": false,
24
+ "normalized": false,
25
+ "rstrip": false,
26
+ "single_word": false,
27
+ "special": true
28
+ },
29
+ "151646": {
30
+ "content": "<|object_ref_start|>",
31
+ "lstrip": false,
32
+ "normalized": false,
33
+ "rstrip": false,
34
+ "single_word": false,
35
+ "special": true
36
+ },
37
+ "151647": {
38
+ "content": "<|object_ref_end|>",
39
+ "lstrip": false,
40
+ "normalized": false,
41
+ "rstrip": false,
42
+ "single_word": false,
43
+ "special": true
44
+ },
45
+ "151648": {
46
+ "content": "<|box_start|>",
47
+ "lstrip": false,
48
+ "normalized": false,
49
+ "rstrip": false,
50
+ "single_word": false,
51
+ "special": true
52
+ },
53
+ "151649": {
54
+ "content": "<|box_end|>",
55
+ "lstrip": false,
56
+ "normalized": false,
57
+ "rstrip": false,
58
+ "single_word": false,
59
+ "special": true
60
+ },
61
+ "151650": {
62
+ "content": "<|quad_start|>",
63
+ "lstrip": false,
64
+ "normalized": false,
65
+ "rstrip": false,
66
+ "single_word": false,
67
+ "special": true
68
+ },
69
+ "151651": {
70
+ "content": "<|quad_end|>",
71
+ "lstrip": false,
72
+ "normalized": false,
73
+ "rstrip": false,
74
+ "single_word": false,
75
+ "special": true
76
+ },
77
+ "151652": {
78
+ "content": "<|vision_start|>",
79
+ "lstrip": false,
80
+ "normalized": false,
81
+ "rstrip": false,
82
+ "single_word": false,
83
+ "special": true
84
+ },
85
+ "151653": {
86
+ "content": "<|vision_end|>",
87
+ "lstrip": false,
88
+ "normalized": false,
89
+ "rstrip": false,
90
+ "single_word": false,
91
+ "special": true
92
+ },
93
+ "151654": {
94
+ "content": "<|vision_pad|>",
95
+ "lstrip": false,
96
+ "normalized": false,
97
+ "rstrip": false,
98
+ "single_word": false,
99
+ "special": true
100
+ },
101
+ "151655": {
102
+ "content": "<|image_pad|>",
103
+ "lstrip": false,
104
+ "normalized": false,
105
+ "rstrip": false,
106
+ "single_word": false,
107
+ "special": true
108
+ },
109
+ "151656": {
110
+ "content": "<|video_pad|>",
111
+ "lstrip": false,
112
+ "normalized": false,
113
+ "rstrip": false,
114
+ "single_word": false,
115
+ "special": true
116
+ },
117
+ "151657": {
118
+ "content": "<tool_call>",
119
+ "lstrip": false,
120
+ "normalized": false,
121
+ "rstrip": false,
122
+ "single_word": false,
123
+ "special": false
124
+ },
125
+ "151658": {
126
+ "content": "</tool_call>",
127
+ "lstrip": false,
128
+ "normalized": false,
129
+ "rstrip": false,
130
+ "single_word": false,
131
+ "special": false
132
+ },
133
+ "151659": {
134
+ "content": "<|fim_prefix|>",
135
+ "lstrip": false,
136
+ "normalized": false,
137
+ "rstrip": false,
138
+ "single_word": false,
139
+ "special": false
140
+ },
141
+ "151660": {
142
+ "content": "<|fim_middle|>",
143
+ "lstrip": false,
144
+ "normalized": false,
145
+ "rstrip": false,
146
+ "single_word": false,
147
+ "special": false
148
+ },
149
+ "151661": {
150
+ "content": "<|fim_suffix|>",
151
+ "lstrip": false,
152
+ "normalized": false,
153
+ "rstrip": false,
154
+ "single_word": false,
155
+ "special": false
156
+ },
157
+ "151662": {
158
+ "content": "<|fim_pad|>",
159
+ "lstrip": false,
160
+ "normalized": false,
161
+ "rstrip": false,
162
+ "single_word": false,
163
+ "special": false
164
+ },
165
+ "151663": {
166
+ "content": "<|repo_name|>",
167
+ "lstrip": false,
168
+ "normalized": false,
169
+ "rstrip": false,
170
+ "single_word": false,
171
+ "special": false
172
+ },
173
+ "151664": {
174
+ "content": "<|file_sep|>",
175
+ "lstrip": false,
176
+ "normalized": false,
177
+ "rstrip": false,
178
+ "single_word": false,
179
+ "special": false
180
+ }
181
+ },
182
+ "additional_special_tokens": [
183
+ "<|im_start|>",
184
+ "<|im_end|>",
185
+ "<|object_ref_start|>",
186
+ "<|object_ref_end|>",
187
+ "<|box_start|>",
188
+ "<|box_end|>",
189
+ "<|quad_start|>",
190
+ "<|quad_end|>",
191
+ "<|vision_start|>",
192
+ "<|vision_end|>",
193
+ "<|vision_pad|>",
194
+ "<|image_pad|>",
195
+ "<|video_pad|>"
196
+ ],
197
+ "bos_token": null,
198
+ "clean_up_tokenization_spaces": false,
199
+ "eos_token": "<|endoftext|>",
200
+ "errors": "replace",
201
+ "extra_special_tokens": {},
202
+ "model_max_length": 131072,
203
+ "pad_token": "<|endoftext|>",
204
+ "split_special_tokens": false,
205
+ "tokenizer_class": "Qwen2Tokenizer",
206
+ "unk_token": null
207
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_800/vocab.json ADDED
The diff for this file is too large to render. See raw diff
 
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/added_tokens.json ADDED
@@ -0,0 +1,24 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "</tool_call>": 151658,
3
+ "<tool_call>": 151657,
4
+ "<|box_end|>": 151649,
5
+ "<|box_start|>": 151648,
6
+ "<|endoftext|>": 151643,
7
+ "<|file_sep|>": 151664,
8
+ "<|fim_middle|>": 151660,
9
+ "<|fim_pad|>": 151662,
10
+ "<|fim_prefix|>": 151659,
11
+ "<|fim_suffix|>": 151661,
12
+ "<|im_end|>": 151645,
13
+ "<|im_start|>": 151644,
14
+ "<|image_pad|>": 151655,
15
+ "<|object_ref_end|>": 151647,
16
+ "<|object_ref_start|>": 151646,
17
+ "<|quad_end|>": 151651,
18
+ "<|quad_start|>": 151650,
19
+ "<|repo_name|>": 151663,
20
+ "<|video_pad|>": 151656,
21
+ "<|vision_end|>": 151653,
22
+ "<|vision_pad|>": 151654,
23
+ "<|vision_start|>": 151652
24
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/chat_template.jinja ADDED
@@ -0,0 +1,54 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- if tools %}
2
+ {{- '<|im_start|>system\n' }}
3
+ {%- if messages[0]['role'] == 'system' %}
4
+ {{- messages[0]['content'] }}
5
+ {%- else %}
6
+ {{- 'You are a helpful assistant.' }}
7
+ {%- endif %}
8
+ {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
9
+ {%- for tool in tools %}
10
+ {{- "\n" }}
11
+ {{- tool | tojson }}
12
+ {%- endfor %}
13
+ {{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
14
+ {%- else %}
15
+ {%- if messages[0]['role'] == 'system' %}
16
+ {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }}
17
+ {%- else %}
18
+ {{- '<|im_start|>system\nYou are a helpful assistant.<|im_end|>\n' }}
19
+ {%- endif %}
20
+ {%- endif %}
21
+ {%- for message in messages %}
22
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %}
23
+ {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }}
24
+ {%- elif message.role == "assistant" %}
25
+ {{- '<|im_start|>' + message.role }}
26
+ {%- if message.content %}
27
+ {{- '\n' + message.content }}
28
+ {%- endif %}
29
+ {%- for tool_call in message.tool_calls %}
30
+ {%- if tool_call.function is defined %}
31
+ {%- set tool_call = tool_call.function %}
32
+ {%- endif %}
33
+ {{- '\n<tool_call>\n{"name": "' }}
34
+ {{- tool_call.name }}
35
+ {{- '", "arguments": ' }}
36
+ {{- tool_call.arguments | tojson }}
37
+ {{- '}\n</tool_call>' }}
38
+ {%- endfor %}
39
+ {{- '<|im_end|>\n' }}
40
+ {%- elif message.role == "tool" %}
41
+ {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %}
42
+ {{- '<|im_start|>user' }}
43
+ {%- endif %}
44
+ {{- '\n<tool_response>\n' }}
45
+ {{- message.content }}
46
+ {{- '\n</tool_response>' }}
47
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
48
+ {{- '<|im_end|>\n' }}
49
+ {%- endif %}
50
+ {%- endif %}
51
+ {%- endfor %}
52
+ {%- if add_generation_prompt %}
53
+ {{- '<|im_start|>assistant\n' }}
54
+ {%- endif %}
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/config.json ADDED
@@ -0,0 +1,67 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen2ForCausalLM"
4
+ ],
5
+ "attention_dropout": 0.0,
6
+ "dtype": "bfloat16",
7
+ "eos_token_id": 151643,
8
+ "hidden_act": "silu",
9
+ "hidden_size": 2048,
10
+ "initializer_range": 0.02,
11
+ "intermediate_size": 11008,
12
+ "layer_types": [
13
+ "full_attention",
14
+ "full_attention",
15
+ "full_attention",
16
+ "full_attention",
17
+ "full_attention",
18
+ "full_attention",
19
+ "full_attention",
20
+ "full_attention",
21
+ "full_attention",
22
+ "full_attention",
23
+ "full_attention",
24
+ "full_attention",
25
+ "full_attention",
26
+ "full_attention",
27
+ "full_attention",
28
+ "full_attention",
29
+ "full_attention",
30
+ "full_attention",
31
+ "full_attention",
32
+ "full_attention",
33
+ "full_attention",
34
+ "full_attention",
35
+ "full_attention",
36
+ "full_attention",
37
+ "full_attention",
38
+ "full_attention",
39
+ "full_attention",
40
+ "full_attention",
41
+ "full_attention",
42
+ "full_attention",
43
+ "full_attention",
44
+ "full_attention",
45
+ "full_attention",
46
+ "full_attention",
47
+ "full_attention",
48
+ "full_attention"
49
+ ],
50
+ "max_position_embeddings": 32768,
51
+ "max_window_layers": 36,
52
+ "model_type": "qwen2",
53
+ "num_attention_heads": 16,
54
+ "num_hidden_layers": 36,
55
+ "num_key_value_heads": 2,
56
+ "pad_token_id": 151643,
57
+ "rms_norm_eps": 1e-06,
58
+ "rope_scaling": null,
59
+ "rope_theta": 1000000.0,
60
+ "sliding_window": null,
61
+ "tie_word_embeddings": true,
62
+ "transformers_version": "4.57.6",
63
+ "use_cache": true,
64
+ "use_mrope": false,
65
+ "use_sliding_window": false,
66
+ "vocab_size": 151936
67
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/generation_config.json ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 151643,
3
+ "eos_token_id": 151643,
4
+ "max_new_tokens": 2048,
5
+ "transformers_version": "4.57.6"
6
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/merges.txt ADDED
The diff for this file is too large to render. See raw diff
 
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/model-00001-of-00002.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9f10764e87e8d10538fcb745009979b111063ba20a1ab411dcf2d9f3e8b5ae45
3
+ size 4976422832
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/model-00002-of-00002.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:38992a7156dc1e08541acb09db4fe0ca7e5bb877a630b9a1b58cb8dbad213118
3
+ size 1817834216
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/model.safetensors.index.json ADDED
@@ -0,0 +1,443 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "metadata": {
3
+ "total_parameters": 3397103616,
4
+ "total_size": 6794207232
5
+ },
6
+ "weight_map": {
7
+ "lm_head.weight": "model-00002-of-00002.safetensors",
8
+ "model.embed_tokens.weight": "model-00001-of-00002.safetensors",
9
+ "model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
10
+ "model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
11
+ "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
12
+ "model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
13
+ "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
14
+ "model.layers.0.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
15
+ "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
16
+ "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
17
+ "model.layers.0.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
18
+ "model.layers.0.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
19
+ "model.layers.0.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
20
+ "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
21
+ "model.layers.1.input_layernorm.weight": "model-00002-of-00002.safetensors",
22
+ "model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
23
+ "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
24
+ "model.layers.1.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
25
+ "model.layers.1.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
26
+ "model.layers.1.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
27
+ "model.layers.1.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
28
+ "model.layers.1.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
29
+ "model.layers.1.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
30
+ "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
31
+ "model.layers.1.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
32
+ "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
33
+ "model.layers.10.input_layernorm.weight": "model-00002-of-00002.safetensors",
34
+ "model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
35
+ "model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
36
+ "model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
37
+ "model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
38
+ "model.layers.10.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
39
+ "model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
40
+ "model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
41
+ "model.layers.10.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
42
+ "model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
43
+ "model.layers.10.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
44
+ "model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
45
+ "model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors",
46
+ "model.layers.11.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
47
+ "model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
48
+ "model.layers.11.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
49
+ "model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
50
+ "model.layers.11.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
51
+ "model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
52
+ "model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
53
+ "model.layers.11.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
54
+ "model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
55
+ "model.layers.11.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
56
+ "model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
57
+ "model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors",
58
+ "model.layers.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
59
+ "model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
60
+ "model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
61
+ "model.layers.12.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
62
+ "model.layers.12.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
63
+ "model.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
64
+ "model.layers.12.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
65
+ "model.layers.12.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
66
+ "model.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
67
+ "model.layers.12.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
68
+ "model.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
69
+ "model.layers.13.input_layernorm.weight": "model-00001-of-00002.safetensors",
70
+ "model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
71
+ "model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
72
+ "model.layers.13.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
73
+ "model.layers.13.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
74
+ "model.layers.13.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
75
+ "model.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
76
+ "model.layers.13.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
77
+ "model.layers.13.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
78
+ "model.layers.13.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
79
+ "model.layers.13.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
80
+ "model.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
81
+ "model.layers.14.input_layernorm.weight": "model-00001-of-00002.safetensors",
82
+ "model.layers.14.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
83
+ "model.layers.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
84
+ "model.layers.14.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
85
+ "model.layers.14.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
86
+ "model.layers.14.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
87
+ "model.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
88
+ "model.layers.14.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
89
+ "model.layers.14.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
90
+ "model.layers.14.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
91
+ "model.layers.14.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
92
+ "model.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
93
+ "model.layers.15.input_layernorm.weight": "model-00001-of-00002.safetensors",
94
+ "model.layers.15.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
95
+ "model.layers.15.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
96
+ "model.layers.15.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
97
+ "model.layers.15.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
98
+ "model.layers.15.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
99
+ "model.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
100
+ "model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
101
+ "model.layers.15.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
102
+ "model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
103
+ "model.layers.15.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
104
+ "model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
105
+ "model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors",
106
+ "model.layers.16.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
107
+ "model.layers.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
108
+ "model.layers.16.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
109
+ "model.layers.16.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
110
+ "model.layers.16.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
111
+ "model.layers.16.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
112
+ "model.layers.16.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
113
+ "model.layers.16.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
114
+ "model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
115
+ "model.layers.16.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
116
+ "model.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
117
+ "model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors",
118
+ "model.layers.17.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
119
+ "model.layers.17.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
120
+ "model.layers.17.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
121
+ "model.layers.17.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
122
+ "model.layers.17.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
123
+ "model.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
124
+ "model.layers.17.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
125
+ "model.layers.17.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
126
+ "model.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
127
+ "model.layers.17.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
128
+ "model.layers.17.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
129
+ "model.layers.18.input_layernorm.weight": "model-00001-of-00002.safetensors",
130
+ "model.layers.18.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
131
+ "model.layers.18.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
132
+ "model.layers.18.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
133
+ "model.layers.18.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
134
+ "model.layers.18.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
135
+ "model.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
136
+ "model.layers.18.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
137
+ "model.layers.18.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
138
+ "model.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
139
+ "model.layers.18.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
140
+ "model.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
141
+ "model.layers.19.input_layernorm.weight": "model-00001-of-00002.safetensors",
142
+ "model.layers.19.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
143
+ "model.layers.19.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
144
+ "model.layers.19.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
145
+ "model.layers.19.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
146
+ "model.layers.19.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
147
+ "model.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
148
+ "model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
149
+ "model.layers.19.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
150
+ "model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
151
+ "model.layers.19.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
152
+ "model.layers.19.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
153
+ "model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
154
+ "model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
155
+ "model.layers.2.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
156
+ "model.layers.2.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
157
+ "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
158
+ "model.layers.2.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
159
+ "model.layers.2.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
160
+ "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
161
+ "model.layers.2.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
162
+ "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
163
+ "model.layers.2.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
164
+ "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
165
+ "model.layers.20.input_layernorm.weight": "model-00002-of-00002.safetensors",
166
+ "model.layers.20.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
167
+ "model.layers.20.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
168
+ "model.layers.20.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
169
+ "model.layers.20.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
170
+ "model.layers.20.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
171
+ "model.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
172
+ "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
173
+ "model.layers.20.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
174
+ "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
175
+ "model.layers.20.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
176
+ "model.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
177
+ "model.layers.21.input_layernorm.weight": "model-00001-of-00002.safetensors",
178
+ "model.layers.21.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
179
+ "model.layers.21.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
180
+ "model.layers.21.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
181
+ "model.layers.21.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
182
+ "model.layers.21.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
183
+ "model.layers.21.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
184
+ "model.layers.21.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
185
+ "model.layers.21.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
186
+ "model.layers.21.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
187
+ "model.layers.21.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
188
+ "model.layers.21.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
189
+ "model.layers.22.input_layernorm.weight": "model-00002-of-00002.safetensors",
190
+ "model.layers.22.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
191
+ "model.layers.22.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
192
+ "model.layers.22.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
193
+ "model.layers.22.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
194
+ "model.layers.22.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
195
+ "model.layers.22.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
196
+ "model.layers.22.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
197
+ "model.layers.22.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
198
+ "model.layers.22.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
199
+ "model.layers.22.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
200
+ "model.layers.22.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
201
+ "model.layers.23.input_layernorm.weight": "model-00001-of-00002.safetensors",
202
+ "model.layers.23.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
203
+ "model.layers.23.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
204
+ "model.layers.23.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
205
+ "model.layers.23.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
206
+ "model.layers.23.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
207
+ "model.layers.23.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
208
+ "model.layers.23.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
209
+ "model.layers.23.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
210
+ "model.layers.23.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
211
+ "model.layers.23.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
212
+ "model.layers.23.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
213
+ "model.layers.24.input_layernorm.weight": "model-00001-of-00002.safetensors",
214
+ "model.layers.24.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
215
+ "model.layers.24.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
216
+ "model.layers.24.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
217
+ "model.layers.24.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
218
+ "model.layers.24.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
219
+ "model.layers.24.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
220
+ "model.layers.24.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
221
+ "model.layers.24.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
222
+ "model.layers.24.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
223
+ "model.layers.24.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
224
+ "model.layers.24.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
225
+ "model.layers.25.input_layernorm.weight": "model-00002-of-00002.safetensors",
226
+ "model.layers.25.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
227
+ "model.layers.25.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
228
+ "model.layers.25.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
229
+ "model.layers.25.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
230
+ "model.layers.25.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
231
+ "model.layers.25.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
232
+ "model.layers.25.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
233
+ "model.layers.25.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
234
+ "model.layers.25.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
235
+ "model.layers.25.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
236
+ "model.layers.25.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
237
+ "model.layers.26.input_layernorm.weight": "model-00002-of-00002.safetensors",
238
+ "model.layers.26.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
239
+ "model.layers.26.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
240
+ "model.layers.26.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
241
+ "model.layers.26.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
242
+ "model.layers.26.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
243
+ "model.layers.26.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
244
+ "model.layers.26.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
245
+ "model.layers.26.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
246
+ "model.layers.26.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
247
+ "model.layers.26.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
248
+ "model.layers.26.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
249
+ "model.layers.27.input_layernorm.weight": "model-00001-of-00002.safetensors",
250
+ "model.layers.27.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
251
+ "model.layers.27.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
252
+ "model.layers.27.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
253
+ "model.layers.27.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
254
+ "model.layers.27.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
255
+ "model.layers.27.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
256
+ "model.layers.27.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
257
+ "model.layers.27.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
258
+ "model.layers.27.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
259
+ "model.layers.27.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
260
+ "model.layers.27.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
261
+ "model.layers.28.input_layernorm.weight": "model-00001-of-00002.safetensors",
262
+ "model.layers.28.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
263
+ "model.layers.28.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
264
+ "model.layers.28.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
265
+ "model.layers.28.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
266
+ "model.layers.28.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
267
+ "model.layers.28.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
268
+ "model.layers.28.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
269
+ "model.layers.28.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
270
+ "model.layers.28.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
271
+ "model.layers.28.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
272
+ "model.layers.28.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
273
+ "model.layers.29.input_layernorm.weight": "model-00001-of-00002.safetensors",
274
+ "model.layers.29.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
275
+ "model.layers.29.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
276
+ "model.layers.29.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
277
+ "model.layers.29.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
278
+ "model.layers.29.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
279
+ "model.layers.29.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
280
+ "model.layers.29.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
281
+ "model.layers.29.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
282
+ "model.layers.29.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
283
+ "model.layers.29.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
284
+ "model.layers.29.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
285
+ "model.layers.3.input_layernorm.weight": "model-00002-of-00002.safetensors",
286
+ "model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
287
+ "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
288
+ "model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
289
+ "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
290
+ "model.layers.3.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
291
+ "model.layers.3.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
292
+ "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
293
+ "model.layers.3.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
294
+ "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
295
+ "model.layers.3.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
296
+ "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
297
+ "model.layers.30.input_layernorm.weight": "model-00002-of-00002.safetensors",
298
+ "model.layers.30.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
299
+ "model.layers.30.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
300
+ "model.layers.30.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
301
+ "model.layers.30.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
302
+ "model.layers.30.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
303
+ "model.layers.30.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
304
+ "model.layers.30.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
305
+ "model.layers.30.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
306
+ "model.layers.30.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
307
+ "model.layers.30.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
308
+ "model.layers.30.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
309
+ "model.layers.31.input_layernorm.weight": "model-00001-of-00002.safetensors",
310
+ "model.layers.31.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
311
+ "model.layers.31.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
312
+ "model.layers.31.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
313
+ "model.layers.31.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
314
+ "model.layers.31.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
315
+ "model.layers.31.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
316
+ "model.layers.31.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
317
+ "model.layers.31.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
318
+ "model.layers.31.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
319
+ "model.layers.31.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
320
+ "model.layers.31.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
321
+ "model.layers.32.input_layernorm.weight": "model-00001-of-00002.safetensors",
322
+ "model.layers.32.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
323
+ "model.layers.32.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
324
+ "model.layers.32.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
325
+ "model.layers.32.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
326
+ "model.layers.32.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
327
+ "model.layers.32.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
328
+ "model.layers.32.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
329
+ "model.layers.32.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
330
+ "model.layers.32.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
331
+ "model.layers.32.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
332
+ "model.layers.32.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
333
+ "model.layers.33.input_layernorm.weight": "model-00001-of-00002.safetensors",
334
+ "model.layers.33.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
335
+ "model.layers.33.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
336
+ "model.layers.33.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
337
+ "model.layers.33.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
338
+ "model.layers.33.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
339
+ "model.layers.33.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
340
+ "model.layers.33.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
341
+ "model.layers.33.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
342
+ "model.layers.33.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
343
+ "model.layers.33.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
344
+ "model.layers.33.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
345
+ "model.layers.34.input_layernorm.weight": "model-00001-of-00002.safetensors",
346
+ "model.layers.34.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
347
+ "model.layers.34.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
348
+ "model.layers.34.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
349
+ "model.layers.34.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
350
+ "model.layers.34.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
351
+ "model.layers.34.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
352
+ "model.layers.34.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
353
+ "model.layers.34.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
354
+ "model.layers.34.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
355
+ "model.layers.34.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
356
+ "model.layers.34.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
357
+ "model.layers.35.input_layernorm.weight": "model-00002-of-00002.safetensors",
358
+ "model.layers.35.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
359
+ "model.layers.35.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
360
+ "model.layers.35.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
361
+ "model.layers.35.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
362
+ "model.layers.35.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
363
+ "model.layers.35.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
364
+ "model.layers.35.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
365
+ "model.layers.35.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
366
+ "model.layers.35.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
367
+ "model.layers.35.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
368
+ "model.layers.35.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
369
+ "model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
370
+ "model.layers.4.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
371
+ "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
372
+ "model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
373
+ "model.layers.4.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
374
+ "model.layers.4.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
375
+ "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
376
+ "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
377
+ "model.layers.4.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
378
+ "model.layers.4.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
379
+ "model.layers.4.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
380
+ "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
381
+ "model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
382
+ "model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
383
+ "model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
384
+ "model.layers.5.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
385
+ "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
386
+ "model.layers.5.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
387
+ "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
388
+ "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
389
+ "model.layers.5.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
390
+ "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
391
+ "model.layers.5.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
392
+ "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
393
+ "model.layers.6.input_layernorm.weight": "model-00002-of-00002.safetensors",
394
+ "model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
395
+ "model.layers.6.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
396
+ "model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
397
+ "model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
398
+ "model.layers.6.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
399
+ "model.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
400
+ "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
401
+ "model.layers.6.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
402
+ "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
403
+ "model.layers.6.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
404
+ "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
405
+ "model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
406
+ "model.layers.7.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
407
+ "model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
408
+ "model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
409
+ "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
410
+ "model.layers.7.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
411
+ "model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
412
+ "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
413
+ "model.layers.7.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
414
+ "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
415
+ "model.layers.7.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
416
+ "model.layers.7.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
417
+ "model.layers.8.input_layernorm.weight": "model-00002-of-00002.safetensors",
418
+ "model.layers.8.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
419
+ "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
420
+ "model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
421
+ "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
422
+ "model.layers.8.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
423
+ "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
424
+ "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
425
+ "model.layers.8.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
426
+ "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
427
+ "model.layers.8.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
428
+ "model.layers.8.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
429
+ "model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors",
430
+ "model.layers.9.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
431
+ "model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
432
+ "model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
433
+ "model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
434
+ "model.layers.9.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
435
+ "model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
436
+ "model.layers.9.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
437
+ "model.layers.9.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
438
+ "model.layers.9.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
439
+ "model.layers.9.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
440
+ "model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
441
+ "model.norm.weight": "model-00001-of-00002.safetensors"
442
+ }
443
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/special_tokens_map.json ADDED
@@ -0,0 +1,31 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "additional_special_tokens": [
3
+ "<|im_start|>",
4
+ "<|im_end|>",
5
+ "<|object_ref_start|>",
6
+ "<|object_ref_end|>",
7
+ "<|box_start|>",
8
+ "<|box_end|>",
9
+ "<|quad_start|>",
10
+ "<|quad_end|>",
11
+ "<|vision_start|>",
12
+ "<|vision_end|>",
13
+ "<|vision_pad|>",
14
+ "<|image_pad|>",
15
+ "<|video_pad|>"
16
+ ],
17
+ "eos_token": {
18
+ "content": "<|endoftext|>",
19
+ "lstrip": false,
20
+ "normalized": false,
21
+ "rstrip": false,
22
+ "single_word": false
23
+ },
24
+ "pad_token": {
25
+ "content": "<|endoftext|>",
26
+ "lstrip": false,
27
+ "normalized": false,
28
+ "rstrip": false,
29
+ "single_word": false
30
+ }
31
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9c5ae00e602b8860cbd784ba82a8aa14e8feecec692e7076590d014d7b7fdafa
3
+ size 11421896
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/tokenizer_config.json ADDED
@@ -0,0 +1,207 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_bos_token": false,
3
+ "add_prefix_space": false,
4
+ "added_tokens_decoder": {
5
+ "151643": {
6
+ "content": "<|endoftext|>",
7
+ "lstrip": false,
8
+ "normalized": false,
9
+ "rstrip": false,
10
+ "single_word": false,
11
+ "special": true
12
+ },
13
+ "151644": {
14
+ "content": "<|im_start|>",
15
+ "lstrip": false,
16
+ "normalized": false,
17
+ "rstrip": false,
18
+ "single_word": false,
19
+ "special": true
20
+ },
21
+ "151645": {
22
+ "content": "<|im_end|>",
23
+ "lstrip": false,
24
+ "normalized": false,
25
+ "rstrip": false,
26
+ "single_word": false,
27
+ "special": true
28
+ },
29
+ "151646": {
30
+ "content": "<|object_ref_start|>",
31
+ "lstrip": false,
32
+ "normalized": false,
33
+ "rstrip": false,
34
+ "single_word": false,
35
+ "special": true
36
+ },
37
+ "151647": {
38
+ "content": "<|object_ref_end|>",
39
+ "lstrip": false,
40
+ "normalized": false,
41
+ "rstrip": false,
42
+ "single_word": false,
43
+ "special": true
44
+ },
45
+ "151648": {
46
+ "content": "<|box_start|>",
47
+ "lstrip": false,
48
+ "normalized": false,
49
+ "rstrip": false,
50
+ "single_word": false,
51
+ "special": true
52
+ },
53
+ "151649": {
54
+ "content": "<|box_end|>",
55
+ "lstrip": false,
56
+ "normalized": false,
57
+ "rstrip": false,
58
+ "single_word": false,
59
+ "special": true
60
+ },
61
+ "151650": {
62
+ "content": "<|quad_start|>",
63
+ "lstrip": false,
64
+ "normalized": false,
65
+ "rstrip": false,
66
+ "single_word": false,
67
+ "special": true
68
+ },
69
+ "151651": {
70
+ "content": "<|quad_end|>",
71
+ "lstrip": false,
72
+ "normalized": false,
73
+ "rstrip": false,
74
+ "single_word": false,
75
+ "special": true
76
+ },
77
+ "151652": {
78
+ "content": "<|vision_start|>",
79
+ "lstrip": false,
80
+ "normalized": false,
81
+ "rstrip": false,
82
+ "single_word": false,
83
+ "special": true
84
+ },
85
+ "151653": {
86
+ "content": "<|vision_end|>",
87
+ "lstrip": false,
88
+ "normalized": false,
89
+ "rstrip": false,
90
+ "single_word": false,
91
+ "special": true
92
+ },
93
+ "151654": {
94
+ "content": "<|vision_pad|>",
95
+ "lstrip": false,
96
+ "normalized": false,
97
+ "rstrip": false,
98
+ "single_word": false,
99
+ "special": true
100
+ },
101
+ "151655": {
102
+ "content": "<|image_pad|>",
103
+ "lstrip": false,
104
+ "normalized": false,
105
+ "rstrip": false,
106
+ "single_word": false,
107
+ "special": true
108
+ },
109
+ "151656": {
110
+ "content": "<|video_pad|>",
111
+ "lstrip": false,
112
+ "normalized": false,
113
+ "rstrip": false,
114
+ "single_word": false,
115
+ "special": true
116
+ },
117
+ "151657": {
118
+ "content": "<tool_call>",
119
+ "lstrip": false,
120
+ "normalized": false,
121
+ "rstrip": false,
122
+ "single_word": false,
123
+ "special": false
124
+ },
125
+ "151658": {
126
+ "content": "</tool_call>",
127
+ "lstrip": false,
128
+ "normalized": false,
129
+ "rstrip": false,
130
+ "single_word": false,
131
+ "special": false
132
+ },
133
+ "151659": {
134
+ "content": "<|fim_prefix|>",
135
+ "lstrip": false,
136
+ "normalized": false,
137
+ "rstrip": false,
138
+ "single_word": false,
139
+ "special": false
140
+ },
141
+ "151660": {
142
+ "content": "<|fim_middle|>",
143
+ "lstrip": false,
144
+ "normalized": false,
145
+ "rstrip": false,
146
+ "single_word": false,
147
+ "special": false
148
+ },
149
+ "151661": {
150
+ "content": "<|fim_suffix|>",
151
+ "lstrip": false,
152
+ "normalized": false,
153
+ "rstrip": false,
154
+ "single_word": false,
155
+ "special": false
156
+ },
157
+ "151662": {
158
+ "content": "<|fim_pad|>",
159
+ "lstrip": false,
160
+ "normalized": false,
161
+ "rstrip": false,
162
+ "single_word": false,
163
+ "special": false
164
+ },
165
+ "151663": {
166
+ "content": "<|repo_name|>",
167
+ "lstrip": false,
168
+ "normalized": false,
169
+ "rstrip": false,
170
+ "single_word": false,
171
+ "special": false
172
+ },
173
+ "151664": {
174
+ "content": "<|file_sep|>",
175
+ "lstrip": false,
176
+ "normalized": false,
177
+ "rstrip": false,
178
+ "single_word": false,
179
+ "special": false
180
+ }
181
+ },
182
+ "additional_special_tokens": [
183
+ "<|im_start|>",
184
+ "<|im_end|>",
185
+ "<|object_ref_start|>",
186
+ "<|object_ref_end|>",
187
+ "<|box_start|>",
188
+ "<|box_end|>",
189
+ "<|quad_start|>",
190
+ "<|quad_end|>",
191
+ "<|vision_start|>",
192
+ "<|vision_end|>",
193
+ "<|vision_pad|>",
194
+ "<|image_pad|>",
195
+ "<|video_pad|>"
196
+ ],
197
+ "bos_token": null,
198
+ "clean_up_tokenization_spaces": false,
199
+ "eos_token": "<|endoftext|>",
200
+ "errors": "replace",
201
+ "extra_special_tokens": {},
202
+ "model_max_length": 131072,
203
+ "pad_token": "<|endoftext|>",
204
+ "split_special_tokens": false,
205
+ "tokenizer_class": "Qwen2Tokenizer",
206
+ "unk_token": null
207
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_900/vocab.json ADDED
The diff for this file is too large to render. See raw diff
 
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/added_tokens.json ADDED
@@ -0,0 +1,24 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "</tool_call>": 151658,
3
+ "<tool_call>": 151657,
4
+ "<|box_end|>": 151649,
5
+ "<|box_start|>": 151648,
6
+ "<|endoftext|>": 151643,
7
+ "<|file_sep|>": 151664,
8
+ "<|fim_middle|>": 151660,
9
+ "<|fim_pad|>": 151662,
10
+ "<|fim_prefix|>": 151659,
11
+ "<|fim_suffix|>": 151661,
12
+ "<|im_end|>": 151645,
13
+ "<|im_start|>": 151644,
14
+ "<|image_pad|>": 151655,
15
+ "<|object_ref_end|>": 151647,
16
+ "<|object_ref_start|>": 151646,
17
+ "<|quad_end|>": 151651,
18
+ "<|quad_start|>": 151650,
19
+ "<|repo_name|>": 151663,
20
+ "<|video_pad|>": 151656,
21
+ "<|vision_end|>": 151653,
22
+ "<|vision_pad|>": 151654,
23
+ "<|vision_start|>": 151652
24
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/chat_template.jinja ADDED
@@ -0,0 +1,54 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- if tools %}
2
+ {{- '<|im_start|>system\n' }}
3
+ {%- if messages[0]['role'] == 'system' %}
4
+ {{- messages[0]['content'] }}
5
+ {%- else %}
6
+ {{- 'You are a helpful assistant.' }}
7
+ {%- endif %}
8
+ {{- "\n\n# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
9
+ {%- for tool in tools %}
10
+ {{- "\n" }}
11
+ {{- tool | tojson }}
12
+ {%- endfor %}
13
+ {{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
14
+ {%- else %}
15
+ {%- if messages[0]['role'] == 'system' %}
16
+ {{- '<|im_start|>system\n' + messages[0]['content'] + '<|im_end|>\n' }}
17
+ {%- else %}
18
+ {{- '<|im_start|>system\nYou are a helpful assistant.<|im_end|>\n' }}
19
+ {%- endif %}
20
+ {%- endif %}
21
+ {%- for message in messages %}
22
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) or (message.role == "assistant" and not message.tool_calls) %}
23
+ {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }}
24
+ {%- elif message.role == "assistant" %}
25
+ {{- '<|im_start|>' + message.role }}
26
+ {%- if message.content %}
27
+ {{- '\n' + message.content }}
28
+ {%- endif %}
29
+ {%- for tool_call in message.tool_calls %}
30
+ {%- if tool_call.function is defined %}
31
+ {%- set tool_call = tool_call.function %}
32
+ {%- endif %}
33
+ {{- '\n<tool_call>\n{"name": "' }}
34
+ {{- tool_call.name }}
35
+ {{- '", "arguments": ' }}
36
+ {{- tool_call.arguments | tojson }}
37
+ {{- '}\n</tool_call>' }}
38
+ {%- endfor %}
39
+ {{- '<|im_end|>\n' }}
40
+ {%- elif message.role == "tool" %}
41
+ {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != "tool") %}
42
+ {{- '<|im_start|>user' }}
43
+ {%- endif %}
44
+ {{- '\n<tool_response>\n' }}
45
+ {{- message.content }}
46
+ {{- '\n</tool_response>' }}
47
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
48
+ {{- '<|im_end|>\n' }}
49
+ {%- endif %}
50
+ {%- endif %}
51
+ {%- endfor %}
52
+ {%- if add_generation_prompt %}
53
+ {{- '<|im_start|>assistant\n' }}
54
+ {%- endif %}
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/config.json ADDED
@@ -0,0 +1,67 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen2ForCausalLM"
4
+ ],
5
+ "attention_dropout": 0.0,
6
+ "dtype": "bfloat16",
7
+ "eos_token_id": 151643,
8
+ "hidden_act": "silu",
9
+ "hidden_size": 2048,
10
+ "initializer_range": 0.02,
11
+ "intermediate_size": 11008,
12
+ "layer_types": [
13
+ "full_attention",
14
+ "full_attention",
15
+ "full_attention",
16
+ "full_attention",
17
+ "full_attention",
18
+ "full_attention",
19
+ "full_attention",
20
+ "full_attention",
21
+ "full_attention",
22
+ "full_attention",
23
+ "full_attention",
24
+ "full_attention",
25
+ "full_attention",
26
+ "full_attention",
27
+ "full_attention",
28
+ "full_attention",
29
+ "full_attention",
30
+ "full_attention",
31
+ "full_attention",
32
+ "full_attention",
33
+ "full_attention",
34
+ "full_attention",
35
+ "full_attention",
36
+ "full_attention",
37
+ "full_attention",
38
+ "full_attention",
39
+ "full_attention",
40
+ "full_attention",
41
+ "full_attention",
42
+ "full_attention",
43
+ "full_attention",
44
+ "full_attention",
45
+ "full_attention",
46
+ "full_attention",
47
+ "full_attention",
48
+ "full_attention"
49
+ ],
50
+ "max_position_embeddings": 32768,
51
+ "max_window_layers": 36,
52
+ "model_type": "qwen2",
53
+ "num_attention_heads": 16,
54
+ "num_hidden_layers": 36,
55
+ "num_key_value_heads": 2,
56
+ "pad_token_id": 151643,
57
+ "rms_norm_eps": 1e-06,
58
+ "rope_scaling": null,
59
+ "rope_theta": 1000000.0,
60
+ "sliding_window": null,
61
+ "tie_word_embeddings": true,
62
+ "transformers_version": "4.57.6",
63
+ "use_cache": true,
64
+ "use_mrope": false,
65
+ "use_sliding_window": false,
66
+ "vocab_size": 151936
67
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/generation_config.json ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 151643,
3
+ "eos_token_id": 151643,
4
+ "max_new_tokens": 2048,
5
+ "transformers_version": "4.57.6"
6
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/merges.txt ADDED
The diff for this file is too large to render. See raw diff
 
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/model-00001-of-00002.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e3e170c60fa3cc1e867e94a756ad5326199e5cad3e32ddeccb0eec0190d21129
3
+ size 4682368408
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/model-00002-of-00002.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:48f63157995d4b298d69de0e475195fd1902fa5cc9c2ff5e4d4c4a4ba9fd2fc9
3
+ size 2111888576
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/model.safetensors.index.json ADDED
@@ -0,0 +1,443 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "metadata": {
3
+ "total_parameters": 3397103616,
4
+ "total_size": 6794207232
5
+ },
6
+ "weight_map": {
7
+ "lm_head.weight": "model-00002-of-00002.safetensors",
8
+ "model.embed_tokens.weight": "model-00002-of-00002.safetensors",
9
+ "model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
10
+ "model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
11
+ "model.layers.0.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
12
+ "model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
13
+ "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
14
+ "model.layers.0.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
15
+ "model.layers.0.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
16
+ "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
17
+ "model.layers.0.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
18
+ "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
19
+ "model.layers.0.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
20
+ "model.layers.0.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
21
+ "model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
22
+ "model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
23
+ "model.layers.1.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
24
+ "model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
25
+ "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
26
+ "model.layers.1.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
27
+ "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
28
+ "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
29
+ "model.layers.1.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
30
+ "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
31
+ "model.layers.1.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
32
+ "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
33
+ "model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors",
34
+ "model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
35
+ "model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
36
+ "model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
37
+ "model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
38
+ "model.layers.10.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
39
+ "model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
40
+ "model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
41
+ "model.layers.10.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
42
+ "model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
43
+ "model.layers.10.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
44
+ "model.layers.10.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
45
+ "model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors",
46
+ "model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
47
+ "model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
48
+ "model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
49
+ "model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
50
+ "model.layers.11.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
51
+ "model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
52
+ "model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
53
+ "model.layers.11.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
54
+ "model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
55
+ "model.layers.11.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
56
+ "model.layers.11.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
57
+ "model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors",
58
+ "model.layers.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
59
+ "model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
60
+ "model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
61
+ "model.layers.12.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
62
+ "model.layers.12.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
63
+ "model.layers.12.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
64
+ "model.layers.12.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
65
+ "model.layers.12.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
66
+ "model.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
67
+ "model.layers.12.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
68
+ "model.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
69
+ "model.layers.13.input_layernorm.weight": "model-00001-of-00002.safetensors",
70
+ "model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
71
+ "model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
72
+ "model.layers.13.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
73
+ "model.layers.13.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
74
+ "model.layers.13.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
75
+ "model.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
76
+ "model.layers.13.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
77
+ "model.layers.13.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
78
+ "model.layers.13.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
79
+ "model.layers.13.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
80
+ "model.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
81
+ "model.layers.14.input_layernorm.weight": "model-00001-of-00002.safetensors",
82
+ "model.layers.14.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
83
+ "model.layers.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
84
+ "model.layers.14.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
85
+ "model.layers.14.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
86
+ "model.layers.14.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
87
+ "model.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
88
+ "model.layers.14.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
89
+ "model.layers.14.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
90
+ "model.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
91
+ "model.layers.14.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
92
+ "model.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
93
+ "model.layers.15.input_layernorm.weight": "model-00002-of-00002.safetensors",
94
+ "model.layers.15.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
95
+ "model.layers.15.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
96
+ "model.layers.15.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
97
+ "model.layers.15.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
98
+ "model.layers.15.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
99
+ "model.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
100
+ "model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
101
+ "model.layers.15.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
102
+ "model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
103
+ "model.layers.15.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
104
+ "model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
105
+ "model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors",
106
+ "model.layers.16.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
107
+ "model.layers.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
108
+ "model.layers.16.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
109
+ "model.layers.16.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
110
+ "model.layers.16.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
111
+ "model.layers.16.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
112
+ "model.layers.16.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
113
+ "model.layers.16.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
114
+ "model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
115
+ "model.layers.16.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
116
+ "model.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
117
+ "model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors",
118
+ "model.layers.17.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
119
+ "model.layers.17.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
120
+ "model.layers.17.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
121
+ "model.layers.17.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
122
+ "model.layers.17.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
123
+ "model.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
124
+ "model.layers.17.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
125
+ "model.layers.17.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
126
+ "model.layers.17.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
127
+ "model.layers.17.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
128
+ "model.layers.17.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
129
+ "model.layers.18.input_layernorm.weight": "model-00001-of-00002.safetensors",
130
+ "model.layers.18.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
131
+ "model.layers.18.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
132
+ "model.layers.18.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
133
+ "model.layers.18.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
134
+ "model.layers.18.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
135
+ "model.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
136
+ "model.layers.18.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
137
+ "model.layers.18.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
138
+ "model.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
139
+ "model.layers.18.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
140
+ "model.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
141
+ "model.layers.19.input_layernorm.weight": "model-00001-of-00002.safetensors",
142
+ "model.layers.19.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
143
+ "model.layers.19.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
144
+ "model.layers.19.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
145
+ "model.layers.19.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
146
+ "model.layers.19.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
147
+ "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
148
+ "model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
149
+ "model.layers.19.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
150
+ "model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
151
+ "model.layers.19.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
152
+ "model.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
153
+ "model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
154
+ "model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
155
+ "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
156
+ "model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
157
+ "model.layers.2.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
158
+ "model.layers.2.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
159
+ "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
160
+ "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
161
+ "model.layers.2.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
162
+ "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
163
+ "model.layers.2.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
164
+ "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
165
+ "model.layers.20.input_layernorm.weight": "model-00001-of-00002.safetensors",
166
+ "model.layers.20.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
167
+ "model.layers.20.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
168
+ "model.layers.20.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
169
+ "model.layers.20.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
170
+ "model.layers.20.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
171
+ "model.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
172
+ "model.layers.20.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
173
+ "model.layers.20.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
174
+ "model.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
175
+ "model.layers.20.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
176
+ "model.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
177
+ "model.layers.21.input_layernorm.weight": "model-00002-of-00002.safetensors",
178
+ "model.layers.21.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
179
+ "model.layers.21.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
180
+ "model.layers.21.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
181
+ "model.layers.21.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
182
+ "model.layers.21.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
183
+ "model.layers.21.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
184
+ "model.layers.21.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
185
+ "model.layers.21.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
186
+ "model.layers.21.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
187
+ "model.layers.21.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
188
+ "model.layers.21.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
189
+ "model.layers.22.input_layernorm.weight": "model-00001-of-00002.safetensors",
190
+ "model.layers.22.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
191
+ "model.layers.22.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
192
+ "model.layers.22.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
193
+ "model.layers.22.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
194
+ "model.layers.22.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
195
+ "model.layers.22.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
196
+ "model.layers.22.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
197
+ "model.layers.22.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
198
+ "model.layers.22.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
199
+ "model.layers.22.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
200
+ "model.layers.22.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
201
+ "model.layers.23.input_layernorm.weight": "model-00001-of-00002.safetensors",
202
+ "model.layers.23.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
203
+ "model.layers.23.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
204
+ "model.layers.23.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
205
+ "model.layers.23.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
206
+ "model.layers.23.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
207
+ "model.layers.23.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
208
+ "model.layers.23.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
209
+ "model.layers.23.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
210
+ "model.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
211
+ "model.layers.23.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
212
+ "model.layers.23.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
213
+ "model.layers.24.input_layernorm.weight": "model-00001-of-00002.safetensors",
214
+ "model.layers.24.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
215
+ "model.layers.24.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
216
+ "model.layers.24.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
217
+ "model.layers.24.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
218
+ "model.layers.24.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
219
+ "model.layers.24.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
220
+ "model.layers.24.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
221
+ "model.layers.24.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
222
+ "model.layers.24.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
223
+ "model.layers.24.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
224
+ "model.layers.24.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
225
+ "model.layers.25.input_layernorm.weight": "model-00001-of-00002.safetensors",
226
+ "model.layers.25.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
227
+ "model.layers.25.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
228
+ "model.layers.25.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
229
+ "model.layers.25.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
230
+ "model.layers.25.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
231
+ "model.layers.25.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
232
+ "model.layers.25.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
233
+ "model.layers.25.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
234
+ "model.layers.25.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
235
+ "model.layers.25.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
236
+ "model.layers.25.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
237
+ "model.layers.26.input_layernorm.weight": "model-00001-of-00002.safetensors",
238
+ "model.layers.26.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
239
+ "model.layers.26.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
240
+ "model.layers.26.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
241
+ "model.layers.26.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
242
+ "model.layers.26.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
243
+ "model.layers.26.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
244
+ "model.layers.26.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
245
+ "model.layers.26.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
246
+ "model.layers.26.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
247
+ "model.layers.26.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
248
+ "model.layers.26.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
249
+ "model.layers.27.input_layernorm.weight": "model-00001-of-00002.safetensors",
250
+ "model.layers.27.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
251
+ "model.layers.27.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
252
+ "model.layers.27.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
253
+ "model.layers.27.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
254
+ "model.layers.27.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
255
+ "model.layers.27.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
256
+ "model.layers.27.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
257
+ "model.layers.27.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
258
+ "model.layers.27.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
259
+ "model.layers.27.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
260
+ "model.layers.27.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
261
+ "model.layers.28.input_layernorm.weight": "model-00001-of-00002.safetensors",
262
+ "model.layers.28.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
263
+ "model.layers.28.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
264
+ "model.layers.28.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
265
+ "model.layers.28.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
266
+ "model.layers.28.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
267
+ "model.layers.28.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
268
+ "model.layers.28.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
269
+ "model.layers.28.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
270
+ "model.layers.28.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
271
+ "model.layers.28.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
272
+ "model.layers.28.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
273
+ "model.layers.29.input_layernorm.weight": "model-00002-of-00002.safetensors",
274
+ "model.layers.29.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
275
+ "model.layers.29.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
276
+ "model.layers.29.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
277
+ "model.layers.29.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
278
+ "model.layers.29.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
279
+ "model.layers.29.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
280
+ "model.layers.29.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
281
+ "model.layers.29.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
282
+ "model.layers.29.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
283
+ "model.layers.29.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
284
+ "model.layers.29.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
285
+ "model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
286
+ "model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
287
+ "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
288
+ "model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
289
+ "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
290
+ "model.layers.3.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
291
+ "model.layers.3.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
292
+ "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
293
+ "model.layers.3.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
294
+ "model.layers.3.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
295
+ "model.layers.3.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
296
+ "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
297
+ "model.layers.30.input_layernorm.weight": "model-00001-of-00002.safetensors",
298
+ "model.layers.30.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
299
+ "model.layers.30.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
300
+ "model.layers.30.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
301
+ "model.layers.30.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
302
+ "model.layers.30.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
303
+ "model.layers.30.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
304
+ "model.layers.30.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
305
+ "model.layers.30.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
306
+ "model.layers.30.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
307
+ "model.layers.30.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
308
+ "model.layers.30.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
309
+ "model.layers.31.input_layernorm.weight": "model-00001-of-00002.safetensors",
310
+ "model.layers.31.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
311
+ "model.layers.31.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
312
+ "model.layers.31.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
313
+ "model.layers.31.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
314
+ "model.layers.31.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
315
+ "model.layers.31.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
316
+ "model.layers.31.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
317
+ "model.layers.31.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
318
+ "model.layers.31.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
319
+ "model.layers.31.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
320
+ "model.layers.31.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
321
+ "model.layers.32.input_layernorm.weight": "model-00001-of-00002.safetensors",
322
+ "model.layers.32.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
323
+ "model.layers.32.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
324
+ "model.layers.32.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
325
+ "model.layers.32.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
326
+ "model.layers.32.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
327
+ "model.layers.32.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
328
+ "model.layers.32.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
329
+ "model.layers.32.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
330
+ "model.layers.32.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
331
+ "model.layers.32.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
332
+ "model.layers.32.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
333
+ "model.layers.33.input_layernorm.weight": "model-00001-of-00002.safetensors",
334
+ "model.layers.33.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
335
+ "model.layers.33.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
336
+ "model.layers.33.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
337
+ "model.layers.33.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
338
+ "model.layers.33.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
339
+ "model.layers.33.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
340
+ "model.layers.33.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
341
+ "model.layers.33.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
342
+ "model.layers.33.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
343
+ "model.layers.33.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
344
+ "model.layers.33.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
345
+ "model.layers.34.input_layernorm.weight": "model-00001-of-00002.safetensors",
346
+ "model.layers.34.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
347
+ "model.layers.34.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
348
+ "model.layers.34.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
349
+ "model.layers.34.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
350
+ "model.layers.34.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
351
+ "model.layers.34.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
352
+ "model.layers.34.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
353
+ "model.layers.34.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
354
+ "model.layers.34.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
355
+ "model.layers.34.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
356
+ "model.layers.34.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
357
+ "model.layers.35.input_layernorm.weight": "model-00002-of-00002.safetensors",
358
+ "model.layers.35.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
359
+ "model.layers.35.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
360
+ "model.layers.35.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
361
+ "model.layers.35.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
362
+ "model.layers.35.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
363
+ "model.layers.35.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
364
+ "model.layers.35.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
365
+ "model.layers.35.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
366
+ "model.layers.35.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
367
+ "model.layers.35.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
368
+ "model.layers.35.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
369
+ "model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
370
+ "model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
371
+ "model.layers.4.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
372
+ "model.layers.4.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
373
+ "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
374
+ "model.layers.4.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
375
+ "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
376
+ "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
377
+ "model.layers.4.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
378
+ "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
379
+ "model.layers.4.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
380
+ "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
381
+ "model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
382
+ "model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
383
+ "model.layers.5.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
384
+ "model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
385
+ "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
386
+ "model.layers.5.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
387
+ "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
388
+ "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
389
+ "model.layers.5.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
390
+ "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
391
+ "model.layers.5.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
392
+ "model.layers.5.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
393
+ "model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
394
+ "model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
395
+ "model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
396
+ "model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
397
+ "model.layers.6.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
398
+ "model.layers.6.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
399
+ "model.layers.6.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
400
+ "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
401
+ "model.layers.6.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
402
+ "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
403
+ "model.layers.6.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
404
+ "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
405
+ "model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
406
+ "model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
407
+ "model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
408
+ "model.layers.7.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
409
+ "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
410
+ "model.layers.7.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
411
+ "model.layers.7.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
412
+ "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
413
+ "model.layers.7.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
414
+ "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
415
+ "model.layers.7.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
416
+ "model.layers.7.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
417
+ "model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors",
418
+ "model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
419
+ "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
420
+ "model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
421
+ "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
422
+ "model.layers.8.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
423
+ "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
424
+ "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
425
+ "model.layers.8.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
426
+ "model.layers.8.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
427
+ "model.layers.8.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
428
+ "model.layers.8.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
429
+ "model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors",
430
+ "model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
431
+ "model.layers.9.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
432
+ "model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
433
+ "model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
434
+ "model.layers.9.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
435
+ "model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
436
+ "model.layers.9.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
437
+ "model.layers.9.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
438
+ "model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
439
+ "model.layers.9.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
440
+ "model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
441
+ "model.norm.weight": "model-00001-of-00002.safetensors"
442
+ }
443
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/special_tokens_map.json ADDED
@@ -0,0 +1,31 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "additional_special_tokens": [
3
+ "<|im_start|>",
4
+ "<|im_end|>",
5
+ "<|object_ref_start|>",
6
+ "<|object_ref_end|>",
7
+ "<|box_start|>",
8
+ "<|box_end|>",
9
+ "<|quad_start|>",
10
+ "<|quad_end|>",
11
+ "<|vision_start|>",
12
+ "<|vision_end|>",
13
+ "<|vision_pad|>",
14
+ "<|image_pad|>",
15
+ "<|video_pad|>"
16
+ ],
17
+ "eos_token": {
18
+ "content": "<|endoftext|>",
19
+ "lstrip": false,
20
+ "normalized": false,
21
+ "rstrip": false,
22
+ "single_word": false
23
+ },
24
+ "pad_token": {
25
+ "content": "<|endoftext|>",
26
+ "lstrip": false,
27
+ "normalized": false,
28
+ "rstrip": false,
29
+ "single_word": false
30
+ }
31
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9c5ae00e602b8860cbd784ba82a8aa14e8feecec692e7076590d014d7b7fdafa
3
+ size 11421896
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/tokenizer_config.json ADDED
@@ -0,0 +1,207 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_bos_token": false,
3
+ "add_prefix_space": false,
4
+ "added_tokens_decoder": {
5
+ "151643": {
6
+ "content": "<|endoftext|>",
7
+ "lstrip": false,
8
+ "normalized": false,
9
+ "rstrip": false,
10
+ "single_word": false,
11
+ "special": true
12
+ },
13
+ "151644": {
14
+ "content": "<|im_start|>",
15
+ "lstrip": false,
16
+ "normalized": false,
17
+ "rstrip": false,
18
+ "single_word": false,
19
+ "special": true
20
+ },
21
+ "151645": {
22
+ "content": "<|im_end|>",
23
+ "lstrip": false,
24
+ "normalized": false,
25
+ "rstrip": false,
26
+ "single_word": false,
27
+ "special": true
28
+ },
29
+ "151646": {
30
+ "content": "<|object_ref_start|>",
31
+ "lstrip": false,
32
+ "normalized": false,
33
+ "rstrip": false,
34
+ "single_word": false,
35
+ "special": true
36
+ },
37
+ "151647": {
38
+ "content": "<|object_ref_end|>",
39
+ "lstrip": false,
40
+ "normalized": false,
41
+ "rstrip": false,
42
+ "single_word": false,
43
+ "special": true
44
+ },
45
+ "151648": {
46
+ "content": "<|box_start|>",
47
+ "lstrip": false,
48
+ "normalized": false,
49
+ "rstrip": false,
50
+ "single_word": false,
51
+ "special": true
52
+ },
53
+ "151649": {
54
+ "content": "<|box_end|>",
55
+ "lstrip": false,
56
+ "normalized": false,
57
+ "rstrip": false,
58
+ "single_word": false,
59
+ "special": true
60
+ },
61
+ "151650": {
62
+ "content": "<|quad_start|>",
63
+ "lstrip": false,
64
+ "normalized": false,
65
+ "rstrip": false,
66
+ "single_word": false,
67
+ "special": true
68
+ },
69
+ "151651": {
70
+ "content": "<|quad_end|>",
71
+ "lstrip": false,
72
+ "normalized": false,
73
+ "rstrip": false,
74
+ "single_word": false,
75
+ "special": true
76
+ },
77
+ "151652": {
78
+ "content": "<|vision_start|>",
79
+ "lstrip": false,
80
+ "normalized": false,
81
+ "rstrip": false,
82
+ "single_word": false,
83
+ "special": true
84
+ },
85
+ "151653": {
86
+ "content": "<|vision_end|>",
87
+ "lstrip": false,
88
+ "normalized": false,
89
+ "rstrip": false,
90
+ "single_word": false,
91
+ "special": true
92
+ },
93
+ "151654": {
94
+ "content": "<|vision_pad|>",
95
+ "lstrip": false,
96
+ "normalized": false,
97
+ "rstrip": false,
98
+ "single_word": false,
99
+ "special": true
100
+ },
101
+ "151655": {
102
+ "content": "<|image_pad|>",
103
+ "lstrip": false,
104
+ "normalized": false,
105
+ "rstrip": false,
106
+ "single_word": false,
107
+ "special": true
108
+ },
109
+ "151656": {
110
+ "content": "<|video_pad|>",
111
+ "lstrip": false,
112
+ "normalized": false,
113
+ "rstrip": false,
114
+ "single_word": false,
115
+ "special": true
116
+ },
117
+ "151657": {
118
+ "content": "<tool_call>",
119
+ "lstrip": false,
120
+ "normalized": false,
121
+ "rstrip": false,
122
+ "single_word": false,
123
+ "special": false
124
+ },
125
+ "151658": {
126
+ "content": "</tool_call>",
127
+ "lstrip": false,
128
+ "normalized": false,
129
+ "rstrip": false,
130
+ "single_word": false,
131
+ "special": false
132
+ },
133
+ "151659": {
134
+ "content": "<|fim_prefix|>",
135
+ "lstrip": false,
136
+ "normalized": false,
137
+ "rstrip": false,
138
+ "single_word": false,
139
+ "special": false
140
+ },
141
+ "151660": {
142
+ "content": "<|fim_middle|>",
143
+ "lstrip": false,
144
+ "normalized": false,
145
+ "rstrip": false,
146
+ "single_word": false,
147
+ "special": false
148
+ },
149
+ "151661": {
150
+ "content": "<|fim_suffix|>",
151
+ "lstrip": false,
152
+ "normalized": false,
153
+ "rstrip": false,
154
+ "single_word": false,
155
+ "special": false
156
+ },
157
+ "151662": {
158
+ "content": "<|fim_pad|>",
159
+ "lstrip": false,
160
+ "normalized": false,
161
+ "rstrip": false,
162
+ "single_word": false,
163
+ "special": false
164
+ },
165
+ "151663": {
166
+ "content": "<|repo_name|>",
167
+ "lstrip": false,
168
+ "normalized": false,
169
+ "rstrip": false,
170
+ "single_word": false,
171
+ "special": false
172
+ },
173
+ "151664": {
174
+ "content": "<|file_sep|>",
175
+ "lstrip": false,
176
+ "normalized": false,
177
+ "rstrip": false,
178
+ "single_word": false,
179
+ "special": false
180
+ }
181
+ },
182
+ "additional_special_tokens": [
183
+ "<|im_start|>",
184
+ "<|im_end|>",
185
+ "<|object_ref_start|>",
186
+ "<|object_ref_end|>",
187
+ "<|box_start|>",
188
+ "<|box_end|>",
189
+ "<|quad_start|>",
190
+ "<|quad_end|>",
191
+ "<|vision_start|>",
192
+ "<|vision_end|>",
193
+ "<|vision_pad|>",
194
+ "<|image_pad|>",
195
+ "<|video_pad|>"
196
+ ],
197
+ "bos_token": null,
198
+ "clean_up_tokenization_spaces": false,
199
+ "eos_token": "<|endoftext|>",
200
+ "errors": "replace",
201
+ "extra_special_tokens": {},
202
+ "model_max_length": 131072,
203
+ "pad_token": "<|endoftext|>",
204
+ "split_special_tokens": false,
205
+ "tokenizer_class": "Qwen2Tokenizer",
206
+ "unk_token": null
207
+ }
rlrb_bs128_nobuf/checkpoints_hf_format/global_step_950/vocab.json ADDED
The diff for this file is too large to render. See raw diff