hoborific commited on
Commit
1b009ed
·
verified ·
1 Parent(s): bc69414

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -33,3 +33,5 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
37
+ Pantheon-Reasoning-31B.jpg filter=lfs diff=lfs merge=lfs -text
Pantheon-Reasoning-31B.jpg ADDED

Git LFS Details

  • SHA256: b8b6b0bd661943e036451368cfecaf22e3f8edd55d25366d62cb4488ebc75b2d
  • Pointer size: 131 Bytes
  • Size of remote file: 561 kB
README.md ADDED
@@ -0,0 +1,100 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: apache-2.0
3
+ language:
4
+ - en
5
+ base_model:
6
+ - Gryphe/Gemma-4-31B-StyleTune
7
+ tags:
8
+ - gemma4
9
+ - conversational
10
+ - instruct
11
+ - finetune
12
+ - roleplay
13
+ - reasoning
14
+ - creative-writing
15
+ pipeline_tag: text-generation
16
+ ---
17
+
18
+ # Pantheon-Reasoning-31B-1.1
19
+
20
+ [![image/jpg](Pantheon-Reasoning-31B.jpg)](Pantheon-Reasoning-31B.jpg)
21
+
22
+ Considering I derived the Gemma 4 31B Style Tune from this same type of data it felt appropriate to give the layers the same treatment. Fun fact - Compared to the base model, this resulted in a 67.6% reduction in cliches, which actually reveals how little the layers are in control of this bit compared to that singular lm_head tensor. Average response lengths have shortened a fair amount, but in a way that makes the writing punchier. I included the full analysis further down if you're interesting!
23
+
24
+ The same theory from my previous release applies: take the data that Pantheon is built on, pair it with full thinking traces, and let the model reason its way through character work — weighing tone, planning narrative beats, considering how a character would actually respond before committing to a line. Whether that meaningfully improves roleplay quality over a non-reasoning model is a question you'll hopefully be able to help me answer.
25
+
26
+ **New in 1.1:** I really tightened down on the reasoning traces this time around, with each going through multiple QA stages to ensure they're as perfect as can be. I also drastically altered the recipe to allow only the highest quality to make it through, which meant dropping the WorldSim and Tiamat datasets, with my cobbled together WorldSim data and Tiamat's highly specific style simply not meeting my personal standards.
27
+
28
+ ## Model details
29
+
30
+ Base model is [Gryphe/Gemma-4-31B-StyleTune](https://huggingface.co/Gryphe/Gemma-4-31B-StyleTune), obviously!
31
+
32
+ All training sources include full reasoning traces, with thinking active across every assistant turn:
33
+
34
+ - **Pantheon data** (~26%) - the core Pantheon roleplay corpus with reasoning traces back-generated using the method described below
35
+ - **General roleplay data** (~36%) - a broad collection of highly varied roleplay transcripts with reasoning back-generated, helping the model generalise well to arbitrary character setups
36
+ - **Text adventure data** (~38%) - high stakes interactive fiction and text adventure content with reasoning back-generated, lending the model a more grounded, prose-forward writing style
37
+
38
+ A special training template was used to ensure Gemma saw all reasoning included with each turn since unlike Qwen they do not use preserve_thinking, which would have meant only the last turn of each sample had its reasoning trained on.
39
+
40
+ Note that I deliberately skipped including an instruct set this time around, being far more interested in pushing writing style first and foremost.
41
+
42
+ ### Reasoning back-generation
43
+
44
+ For the Pantheon, text adventure and general roleplay data, thinking traces were generated using DeepSeek 3.2 after the fact rather than being native to the source material. I tried V4 Flash as well but it proved to be terrible at this specific task. The approach prompts the model to think **as a writer planning their next response** — before writing — rather than annotating a response that already exists. This distinction matters: the goal is genuine forward planning (considering character psychology, tone, and narrative direction), not post-hoc explanation.
45
+
46
+ Each generated trace was validated by a judge model before being kept. Traces that slipped into character voice, produced pure restatement, or read as analysis rather than planning were rejected and retried. The result is thinking that reflects real craft decisions rather than a summary of what the response contains. For 1.1 I introduced a master judge that oversaw each trace generation project and further discarded and regenerated traces that had slipped through in the form of a self-iterating pipeline. Self-iterating pipelines are neat.
47
+
48
+ The theory is that this reasoning ties semi-seamlessly into Gemma 4's native training and therefore enhances, rather than blatantly overwrites. The reasoning traces aren't as condensed as I expected them to be, but they've definitely condensed down into something far more bearable. Gemma continues to be a stubborn architecture to deal with.
49
+
50
+ ## What is Pantheon?
51
+
52
+ Pantheon is my ongoing series of roleplay-focused finetunes built around a collection of diverse personas — characters with distinct personalities, voices, accents and mannerisms. Though I made sure to mention exactly which personas these were in the past in reality I'm generally the only one bothering to actually use them (lol) so I'm not going to bother with a huge list this time around. Since the original dataset had duplicate subjects I distilled this down to a smaller, more meaningful core, emphasizing variety first and foremost.
53
+
54
+ TLDR: Ten personas put through hundreds of scenarios, from good to bad and anything in-between.
55
+
56
+ ## Inference
57
+
58
+ These settings have been working well for me:
59
+
60
+ ```
61
+ "temperature": 1.0,
62
+ "repetition_penalty": 1.0,
63
+ "min_p": 0.05
64
+ ```
65
+
66
+ Reasoning models seem to work better without a repetition penalty — likely because it also affects the thinking traces, even though those aren't visible in the output.
67
+
68
+ I obviously recommend leaving thinking enabled. Having said that, I'm also very curious about non-reasoning performance!
69
+
70
+ ## Prompt Format
71
+
72
+ The model was trained using Gemma 4's native chat template, which should be applied automatically.
73
+
74
+ Since reasoning doesn't tend to play nice with character name prefixes enabled I'm inclined to recommend against using them.
75
+
76
+ ## Bonus: Writing Quality Metrics
77
+
78
+ | Metric | Base | Style Tune | Pantheon Reasoning |
79
+ |--------|------|-----------|------|
80
+ | Avg sentence length | 15.1w | 15.0w | 12.5w |
81
+ | Type-token ratio | 0.705 | 0.735 | 0.774 |
82
+ | Avg paragraph length | 54.5w | 57.3w | 55.6w |
83
+ | Jaccard top-500 ngrams | — | 21.7% overlap w/ base | 14.0% overlap w/ base |
84
+
85
+ | Model | Clichés/resp | Clichés/100w | Reduction | Avg reasoning | Avg output |
86
+ |-------|-------------|--------------|-----------|---------------|------------|
87
+ | Base instruct | 2.38 | 1.231 | — | 310.5w | 193.4w |
88
+ | Style Tune | 0.92 | 0.523 | −57.5% | 294.0w | 175.0w |
89
+ | Pantheon Reasoning | 0.49 | 0.399 | −67.6% | 214.4w | 122.8w |
90
+
91
+ ## Notes
92
+
93
+ This is, like most of my releases nowadays, a research release and hasn't gone through extensive quality testing beyond basic sanity checks. The core question — does reasoning actually help roleplay, or does it just add latency? — is one I'm genuinely curious about, and your feedback will be far more informative than my own bias here. Let me know what you find!
94
+
95
+ ## Credits
96
+
97
+ - Everyone from [Anthracite](https://huggingface.co/anthracite-org)! Hi, guys!
98
+ - [Latitude](https://huggingface.co/LatitudeGames), for which I am still producing finetunes on a regular basis, helping me keep my skills sharp and up-to-date!
99
+ - All the folks I chat with on a daily basis on Discord! You know who you are.
100
+ - Anyone I forgot to mention, just in case!
chat_template.jinja ADDED
@@ -0,0 +1,390 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {#
2
+ Template: Google Gemma 4 Canonical Chat Template
3
+ Author: Google Gemma Engineering Team
4
+ Published: 2026-07-09
5
+ Context: Fixed tool-calling loops, turn closures, and thinking content-ordering.
6
+ #}
7
+ {%- macro format_parameters(properties, required, filter_keys=false) -%}
8
+ {%- set standard_keys = ['description', 'type', 'properties', 'required', 'nullable'] -%}
9
+ {%- set ns = namespace(found_first=false) -%}
10
+ {%- for key, value in properties | dictsort -%}
11
+ {%- set add_comma = false -%}
12
+ {%- if not filter_keys or key not in standard_keys -%}
13
+ {%- if ns.found_first %},{% endif -%}
14
+ {%- set ns.found_first = true -%}
15
+ {{ key }}:{
16
+ {%- if value['description'] -%}
17
+ description:<|"|>{{ value['description'] }}<|"|>
18
+ {%- set add_comma = true -%}
19
+ {%- endif -%}
20
+ {%- if value['type'] | upper == 'STRING' -%}
21
+ {%- if value['enum'] -%}
22
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
23
+ enum:{{ format_argument(value['enum']) }}
24
+ {%- endif -%}
25
+ {%- elif value['type'] | upper == 'ARRAY' -%}
26
+ {%- if value['items'] is mapping and value['items'] -%}
27
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
28
+ items:{
29
+ {%- set ns_items = namespace(found_first=false) -%}
30
+ {%- for item_key, item_value in value['items'] | dictsort -%}
31
+ {%- if item_value is not none -%}
32
+ {%- if ns_items.found_first %},{% endif -%}
33
+ {%- set ns_items.found_first = true -%}
34
+ {%- if item_key == 'properties' -%}
35
+ properties:{
36
+ {%- if item_value is mapping -%}
37
+ {{- format_parameters(item_value, value['items']['required'] | default([])) -}}
38
+ {%- endif -%}
39
+ }
40
+ {%- elif item_key == 'required' -%}
41
+ required:[
42
+ {%- for req_item in item_value -%}
43
+ <|"|>{{- req_item -}}<|"|>
44
+ {%- if not loop.last %},{% endif -%}
45
+ {%- endfor -%}
46
+ ]
47
+ {%- elif item_key == 'type' -%}
48
+ {%- if item_value is string -%}
49
+ type:{{ format_argument(item_value | upper) }}
50
+ {%- else -%}
51
+ type:{{ format_argument(item_value | map('upper') | list) }}
52
+ {%- endif -%}
53
+ {%- else -%}
54
+ {{ item_key }}:{{ format_argument(item_value) }}
55
+ {%- endif -%}
56
+ {%- endif -%}
57
+ {%- endfor -%}
58
+ }
59
+ {%- endif -%}
60
+ {%- endif -%}
61
+ {%- if value['nullable'] %}
62
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
63
+ nullable:true
64
+ {%- endif -%}
65
+ {%- if value['type'] | upper == 'OBJECT' -%}
66
+ {%- if value['properties'] is defined and value['properties'] is mapping -%}
67
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
68
+ properties:{
69
+ {{- format_parameters(value['properties'], value['required'] | default([])) -}}
70
+ }
71
+ {%- elif value is mapping -%}
72
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
73
+ properties:{
74
+ {{- format_parameters(value, value['required'] | default([]), filter_keys=true) -}}
75
+ }
76
+ {%- endif -%}
77
+ {%- if value['required'] -%}
78
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
79
+ required:[
80
+ {%- for item in value['required'] | default([]) -%}
81
+ <|"|>{{- item -}}<|"|>
82
+ {%- if not loop.last %},{% endif -%}
83
+ {%- endfor -%}
84
+ ]
85
+ {%- endif -%}
86
+ {%- endif -%}
87
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
88
+ type:<|"|>{{ value['type'] | upper }}<|"|>}
89
+ {%- endif -%}
90
+ {%- endfor -%}
91
+ {%- endmacro -%}
92
+ {%- macro format_function_declaration(tool_data) -%}
93
+ declaration:{{- tool_data['function']['name'] -}}{description:<|"|>{{- tool_data['function']['description'] -}}<|"|>
94
+ {%- set params = tool_data['function']['parameters'] -%}
95
+ {%- if params -%}
96
+ ,parameters:{
97
+ {%- if params['properties'] -%}
98
+ properties:{ {{- format_parameters(params['properties'], params['required']) -}} },
99
+ {%- endif -%}
100
+ {%- if params['required'] -%}
101
+ required:[
102
+ {%- for item in params['required'] -%}
103
+ <|"|>{{- item -}}<|"|>
104
+ {{- ',' if not loop.last -}}
105
+ {%- endfor -%}
106
+ ],
107
+ {%- endif -%}
108
+ {%- if params['type'] -%}
109
+ type:<|"|>{{- params['type'] | upper -}}<|"|>}
110
+ {%- endif -%}
111
+ {%- endif -%}
112
+ {%- if 'response' in tool_data['function'] -%}
113
+ {%- set response_declaration = tool_data['function']['response'] -%}
114
+ ,response:{
115
+ {%- if response_declaration['description'] -%}
116
+ description:<|"|>{{- response_declaration['description'] -}}<|"|>,
117
+ {%- endif -%}
118
+ {%- if response_declaration['type'] | upper == 'OBJECT' -%}
119
+ type:<|"|>{{- response_declaration['type'] | upper -}}<|"|>}
120
+ {%- endif -%}
121
+ {%- endif -%}
122
+ }
123
+ {%- endmacro -%}
124
+ {%- macro format_argument(argument, escape_keys=True) -%}
125
+ {%- if argument is none -%}
126
+ {{- 'null' -}}
127
+ {%- elif argument is string -%}
128
+ {{- '<|"|>' + argument + '<|"|>' -}}
129
+ {%- elif argument is boolean -%}
130
+ {{- 'true' if argument else 'false' -}}
131
+ {%- elif argument is mapping -%}
132
+ {{- '{' -}}
133
+ {%- set ns = namespace(found_first=false) -%}
134
+ {%- for key, value in argument | dictsort -%}
135
+ {%- if ns.found_first %},{% endif -%}
136
+ {%- set ns.found_first = true -%}
137
+ {%- if escape_keys -%}
138
+ {{- '<|"|>' + key + '<|"|>' -}}
139
+ {%- else -%}
140
+ {{- key -}}
141
+ {%- endif -%}
142
+ :{{- format_argument(value, escape_keys=escape_keys) -}}
143
+ {%- endfor -%}
144
+ {{- '}' -}}
145
+ {%- elif argument is sequence -%}
146
+ {{- '[' -}}
147
+ {%- for item in argument -%}
148
+ {{- format_argument(item, escape_keys=escape_keys) -}}
149
+ {%- if not loop.last %},{% endif -%}
150
+ {%- endfor -%}
151
+ {{- ']' -}}
152
+ {%- else -%}
153
+ {{- argument -}}
154
+ {%- endif -%}
155
+ {%- endmacro -%}
156
+ {%- macro strip_thinking(text) -%}
157
+ {%- set ns = namespace(result='') -%}
158
+ {%- for part in text.split('<channel|>') -%}
159
+ {%- if '<|channel>' in part -%}
160
+ {%- set ns.result = ns.result + part.split('<|channel>')[0] -%}
161
+ {%- else -%}
162
+ {%- set ns.result = ns.result + part -%}
163
+ {%- endif -%}
164
+ {%- endfor -%}
165
+ {{- ns.result | trim -}}
166
+ {%- endmacro -%}
167
+
168
+ {%- macro format_tool_response_block(tool_name, response) -%}
169
+ {{- '<|tool_response>' -}}
170
+ {%- if response is mapping -%}
171
+ {{- 'response:' + tool_name + '{' -}}
172
+ {%- for key, value in response | dictsort -%}
173
+ {{- key -}}:{{- format_argument(value, escape_keys=False) -}}
174
+ {%- if not loop.last %},{% endif -%}
175
+ {%- endfor -%}
176
+ {{- '}' -}}
177
+ {%- else -%}
178
+ {{- 'response:' + tool_name + '{value:' + format_argument(response, escape_keys=False) + '}' -}}
179
+ {%- endif -%}
180
+ {{- '<tool_response|>' -}}
181
+ {%- endmacro -%}
182
+
183
+ {#- ===== SETUP ===== -#}
184
+ {%- set ns = namespace(prev_message_type=None, prev_non_tool_role=None) -%}
185
+ {%- set loop_messages = messages -%}
186
+ {%- set enable_thinking = enable_thinking | default(false) -%}
187
+ {%- set preserve_thinking = preserve_thinking | default(false) -%}
188
+ {{- bos_token -}}
189
+ {#- Handle System/Tool Definitions Block -#}
190
+ {%- if enable_thinking or tools or (messages and messages[0]['role'] in ['system', 'developer']) -%}
191
+ {{- '<|turn>system\n' -}}
192
+ {#- Inject Thinking token at the very top of the FIRST system turn -#}
193
+ {%- if enable_thinking -%}
194
+ {{- '<|think|>\n' -}}
195
+ {%- set ns.prev_message_type = 'think' -%}
196
+ {%- endif -%}
197
+ {%- if messages and messages[0]['role'] in ['system', 'developer'] -%}
198
+ {%- if messages[0]['content'] is string -%}
199
+ {{- messages[0]['content'] | trim -}}
200
+ {%- elif messages[0]['content'] is sequence -%}
201
+ {%- for item in messages[0]['content'] -%}
202
+ {{- item['text'] | trim + ' '-}}
203
+ {%- endfor -%}
204
+ {%- endif -%}
205
+ {%- set loop_messages = messages[1:] -%}
206
+ {%- endif -%}
207
+ {%- if tools -%}
208
+ {%- for tool in tools %}
209
+ {{- '<|tool>' -}}
210
+ {{- format_function_declaration(tool) | trim -}}
211
+ {{- '<tool|>' -}}
212
+ {%- endfor %}
213
+ {%- set ns.prev_message_type = 'tool' -%}
214
+ {%- endif -%}
215
+ {{- '<turn|>\n' -}}
216
+ {%- endif %}
217
+
218
+ {#- Pre-scan: find last user message index for reasoning guard -#}
219
+ {%- set ns_turn = namespace(last_user_idx=-1) -%}
220
+ {%- for i in range(loop_messages | length) -%}
221
+ {%- if loop_messages[i]['role'] == 'user' -%}
222
+ {%- set ns_turn.last_user_idx = i -%}
223
+ {%- endif -%}
224
+ {%- endfor -%}
225
+
226
+ {#- Loop through messages -#}
227
+ {%- for message in loop_messages -%}
228
+ {%- if message['role'] != 'tool' -%}
229
+ {%- set ns.prev_message_type = None -%}
230
+ {%- set role = 'model' if message['role'] == 'assistant' else message['role'] -%}
231
+ {#- Detect continuation using tracked state — O(1) instead of O(n) backward scan -#}
232
+ {%- set continue_same_model_turn = (role == 'model' and ns.prev_non_tool_role == 'assistant') -%}
233
+ {%- if not continue_same_model_turn -%}
234
+ {{- '<|turn>' + role + '\n' }}
235
+
236
+ {%- endif -%}
237
+
238
+ {#- Render reasoning/reasoning_content as thinking channel -#}
239
+ {%- set thinking_text = message.get('reasoning') or message.get('reasoning_content') -%}
240
+ {%- set thinking_gate = (loop.index0 > ns_turn.last_user_idx) or (preserve_thinking and message.get('tool_calls')) -%}
241
+ {%- if thinking_text and thinking_gate -%}
242
+ {{- '<|channel>thought\n' + thinking_text + '\n<channel|>' -}}
243
+ {%- endif -%}
244
+
245
+ {%- if message.get('tool_calls') -%}
246
+ {%- for tool_call in message.get('tool_calls') -%}
247
+ {%- set function = tool_call['function'] -%}
248
+ {{- '<|tool_call>call:' + function['name'] + '{' -}}
249
+ {%- if function['arguments'] is mapping -%}
250
+ {%- set ns_args = namespace(found_first=false) -%}
251
+ {%- for key, value in function['arguments'] | dictsort -%}
252
+ {%- if ns_args.found_first %},{% endif -%}
253
+ {%- set ns_args.found_first = true -%}
254
+ {{- key -}}:{{- format_argument(value, escape_keys=False) -}}
255
+ {%- endfor -%}
256
+ {%- elif function['arguments'] is none -%}
257
+ {%- else -%}
258
+ {{- raise_exception(
259
+ "chat_template: tool_calls[].function.arguments must be a "
260
+ "JSON object (mapping), not a string. Deserialize arguments "
261
+ "before passing to the template."
262
+ ) -}}
263
+ {%- endif -%}
264
+ {{- '}<tool_call|>' -}}
265
+ {%- endfor -%}
266
+ {%- set ns.prev_message_type = 'tool_call' -%}
267
+ {%- endif -%}
268
+
269
+ {%- set ns_tr_out = namespace(flag=false) -%}
270
+ {%- if message.get('tool_responses') -%}
271
+ {#- Legacy: tool_responses embedded on the assistant message (Google/Gemma native) -#}
272
+ {%- for tool_response in message.get('tool_responses') -%}
273
+ {{- format_tool_response_block(tool_response['name'] | default('unknown', true), tool_response['response']) -}}
274
+ {%- set ns_tr_out.flag = true -%}
275
+ {%- set ns.prev_message_type = 'tool_response' -%}
276
+ {%- endfor -%}
277
+ {%- elif message.get('tool_calls') -%}
278
+ {#- OpenAI Chat Completions: forward-scan consecutive role:tool messages -#}
279
+ {%- set ns_tool_scan = namespace(stopped=false) -%}
280
+ {%- for k in range(loop.index0 + 1, loop_messages | length) -%}
281
+ {%- if ns_tool_scan.stopped -%}
282
+ {%- elif loop_messages[k]['role'] != 'tool' -%}
283
+ {%- set ns_tool_scan.stopped = true -%}
284
+ {%- else -%}
285
+ {%- set follow = loop_messages[k] -%}
286
+ {#- Resolve tool_call_id to function name -#}
287
+ {%- set ns_tname = namespace(name=follow.get('name') or 'unknown') -%}
288
+ {%- for tc in message.get('tool_calls') -%}
289
+ {%- if tc.get('id') == follow.get('tool_call_id') -%}
290
+ {%- set ns_tname.name = tc['function']['name'] -%}
291
+ {%- endif -%}
292
+ {%- endfor -%}
293
+ {#- Handle content as string or content-parts array -#}
294
+ {%- set tool_body = follow.get('content') -%}
295
+ {%- if tool_body is string -%}
296
+ {{- format_tool_response_block(ns_tname.name, tool_body) -}}
297
+ {%- elif tool_body is sequence and tool_body is not string -%}
298
+ {%- set ns_txt = namespace(s='') -%}
299
+ {%- for part in tool_body -%}
300
+ {%- if part.get('type') == 'text' -%}
301
+ {%- set ns_txt.s = ns_txt.s + (part.get('text') | default('')) -%}
302
+ {%- endif -%}
303
+ {%- endfor -%}
304
+ {{- format_tool_response_block(ns_tname.name, ns_txt.s) -}}
305
+ {%- for part in tool_body -%}
306
+ {%- if part.get('type') in ['image', 'image_url'] -%}
307
+ {{- '<|image|>' -}}
308
+ {%- elif part.get('type') in ['audio', 'input_audio'] -%}
309
+ {{- '<|audio|>' -}}
310
+ {%- elif part.get('type') == 'video' -%}
311
+ {{- '<|video|>' -}}
312
+ {%- endif -%}
313
+ {%- endfor -%}
314
+ {%- else -%}
315
+ {{- format_tool_response_block(ns_tname.name, tool_body) -}}
316
+ {%- endif -%}
317
+ {%- set ns_tr_out.flag = true -%}
318
+ {%- set ns.prev_message_type = 'tool_response' -%}
319
+ {%- endif -%}
320
+ {%- endfor -%}
321
+ {%- endif -%}
322
+
323
+ {%- set captured_content -%}
324
+ {%- if message.get('content') is string -%}
325
+ {%- if role == 'model' -%}
326
+ {{- strip_thinking(message['content']) -}}
327
+ {%- else -%}
328
+ {{- message['content'] | trim -}}
329
+ {%- endif -%}
330
+ {%- elif message.get('content') is sequence -%}
331
+ {%- for item in message['content'] -%}
332
+ {%- if item.get('type') == 'text' -%}
333
+ {%- if role == 'model' -%}
334
+ {{- strip_thinking(item['text']) -}}
335
+ {%- else -%}
336
+ {{- item['text'] | trim -}}
337
+ {%- endif -%}
338
+ {%- elif item.get('type') in ['image', 'image_url'] -%}
339
+ {{- '<|image|>' -}}
340
+ {%- elif item.get('type') in ['audio', 'input_audio'] -%}
341
+ {{- '<|audio|>' -}}
342
+ {%- elif item.get('type') == 'video' -%}
343
+ {{- '<|video|>' -}}
344
+ {%- endif -%}
345
+ {%- endfor -%}
346
+ {%- endif -%}
347
+ {%- endset -%}
348
+
349
+ {{- captured_content -}}
350
+ {%- set has_content = captured_content | trim | length > 0 -%}
351
+
352
+ {#- Forward-scan: find next non-tool message role for continuation detection -#}
353
+ {%- set next_nt = namespace(role=None, found=false) -%}
354
+ {%- for j in range(loop.index0 + 1, loop_messages | length) -%}
355
+ {%- if not next_nt.found -%}
356
+ {%- if loop_messages[j]['role'] != 'tool' -%}
357
+ {%- set next_nt.role = loop_messages[j]['role'] -%}
358
+ {%- set next_nt.found = true -%}
359
+ {%- endif -%}
360
+ {%- endif -%}
361
+ {%- endfor -%}
362
+
363
+ {%- set continues_into_next = (
364
+ role == 'model'
365
+ and next_nt.role == 'assistant'
366
+ and (not message.get('tool_calls') or ns_tr_out.flag)
367
+ ) -%}
368
+
369
+ {%- if ns.prev_message_type == 'tool_call' and not ns_tr_out.flag -%}
370
+ {{- '<|tool_response>' -}}
371
+ {%- elif continues_into_next -%}
372
+ {%- elif not (ns_tr_out.flag and not has_content and not next_nt.found) -%}
373
+ {{- '<turn|>\n' -}}
374
+ {%- endif -%}
375
+
376
+ {#- Track previous non-tool role for next iteration (avoids O(n) backward scan) -#}
377
+ {%- set ns.prev_non_tool_role = message['role'] -%}
378
+ {%- endif -%}
379
+ {%- endfor -%}
380
+
381
+ {%- if add_generation_prompt -%}
382
+ {%- if ns.prev_message_type != 'tool_response' and ns.prev_message_type != 'tool_call' -%}
383
+ {{- '<|turn>model\n' -}}
384
+ {%- if not enable_thinking -%}
385
+ {{- '<|channel>thought\n<channel|>' -}}
386
+ {%- endif -%}
387
+ {%- elif ns.prev_message_type == 'tool_response' and enable_thinking -%}
388
+ {{- '<|channel>thought\n' -}}
389
+ {%- endif -%}
390
+ {%- endif -%}
config.json ADDED
@@ -0,0 +1,977 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Gemma4ForConditionalGeneration"
4
+ ],
5
+ "audio_config": null,
6
+ "audio_token_id": 258881,
7
+ "boa_token_id": 256000,
8
+ "boi_token_id": 255999,
9
+ "dtype": "bfloat16",
10
+ "eoa_token_id": 258883,
11
+ "eoa_token_index": 258883,
12
+ "eoi_token_id": 258882,
13
+ "eos_token_id": 106,
14
+ "image_token_id": 258880,
15
+ "initializer_range": 0.02,
16
+ "model_type": "gemma4",
17
+ "pad_token_id": 0,
18
+ "text_config": {
19
+ "attention_bias": false,
20
+ "attention_dropout": 0.0,
21
+ "attention_k_eq_v": true,
22
+ "bos_token_id": 2,
23
+ "dtype": "bfloat16",
24
+ "enable_moe_block": false,
25
+ "eos_token_id": 1,
26
+ "expert_intermediate_size": null,
27
+ "final_logit_softcapping": 30.0,
28
+ "global_head_dim": 512,
29
+ "head_dim": 256,
30
+ "hidden_activation": "gelu_pytorch_tanh",
31
+ "hidden_size": 5376,
32
+ "hidden_size_per_layer_input": 0,
33
+ "initializer_range": 0.02,
34
+ "intermediate_size": 21504,
35
+ "layer_types": [
36
+ "sliding_attention",
37
+ "sliding_attention",
38
+ "sliding_attention",
39
+ "sliding_attention",
40
+ "sliding_attention",
41
+ "full_attention",
42
+ "sliding_attention",
43
+ "sliding_attention",
44
+ "sliding_attention",
45
+ "sliding_attention",
46
+ "sliding_attention",
47
+ "full_attention",
48
+ "sliding_attention",
49
+ "sliding_attention",
50
+ "sliding_attention",
51
+ "sliding_attention",
52
+ "sliding_attention",
53
+ "full_attention",
54
+ "sliding_attention",
55
+ "sliding_attention",
56
+ "sliding_attention",
57
+ "sliding_attention",
58
+ "sliding_attention",
59
+ "full_attention",
60
+ "sliding_attention",
61
+ "sliding_attention",
62
+ "sliding_attention",
63
+ "sliding_attention",
64
+ "sliding_attention",
65
+ "full_attention",
66
+ "sliding_attention",
67
+ "sliding_attention",
68
+ "sliding_attention",
69
+ "sliding_attention",
70
+ "sliding_attention",
71
+ "full_attention",
72
+ "sliding_attention",
73
+ "sliding_attention",
74
+ "sliding_attention",
75
+ "sliding_attention",
76
+ "sliding_attention",
77
+ "full_attention",
78
+ "sliding_attention",
79
+ "sliding_attention",
80
+ "sliding_attention",
81
+ "sliding_attention",
82
+ "sliding_attention",
83
+ "full_attention",
84
+ "sliding_attention",
85
+ "sliding_attention",
86
+ "sliding_attention",
87
+ "sliding_attention",
88
+ "sliding_attention",
89
+ "full_attention",
90
+ "sliding_attention",
91
+ "sliding_attention",
92
+ "sliding_attention",
93
+ "sliding_attention",
94
+ "sliding_attention",
95
+ "full_attention"
96
+ ],
97
+ "max_position_embeddings": 262144,
98
+ "model_type": "gemma4_text",
99
+ "moe_intermediate_size": null,
100
+ "num_attention_heads": 32,
101
+ "num_experts": null,
102
+ "num_global_key_value_heads": 4,
103
+ "num_hidden_layers": 60,
104
+ "num_key_value_heads": 16,
105
+ "num_kv_shared_layers": 0,
106
+ "pad_token_id": 0,
107
+ "rms_norm_eps": 1e-06,
108
+ "rope_parameters": {
109
+ "full_attention": {
110
+ "partial_rotary_factor": 0.25,
111
+ "rope_theta": 1000000.0,
112
+ "rope_type": "proportional"
113
+ },
114
+ "sliding_attention": {
115
+ "rope_theta": 10000.0,
116
+ "rope_type": "default"
117
+ }
118
+ },
119
+ "sliding_window": 1024,
120
+ "tie_word_embeddings": false,
121
+ "top_k_experts": null,
122
+ "use_bidirectional_attention": "vision",
123
+ "use_cache": true,
124
+ "use_double_wide_mlp": false,
125
+ "vocab_size": 262144,
126
+ "vocab_size_per_layer_input": 262144
127
+ },
128
+ "tie_word_embeddings": false,
129
+ "transformers_version": "5.13.0.dev0",
130
+ "unsloth_fixed": true,
131
+ "video_token_id": 258884,
132
+ "vision_config": {
133
+ "_name_or_path": "",
134
+ "architectures": null,
135
+ "attention_bias": false,
136
+ "attention_dropout": 0.0,
137
+ "chunk_size_feed_forward": 0,
138
+ "default_output_length": 280,
139
+ "dtype": "bfloat16",
140
+ "global_head_dim": 72,
141
+ "head_dim": 72,
142
+ "hidden_activation": "gelu_pytorch_tanh",
143
+ "hidden_size": 1152,
144
+ "id2label": {
145
+ "0": "LABEL_0",
146
+ "1": "LABEL_1"
147
+ },
148
+ "initializer_range": 0.02,
149
+ "intermediate_size": 4304,
150
+ "is_encoder_decoder": false,
151
+ "label2id": {
152
+ "LABEL_0": 0,
153
+ "LABEL_1": 1
154
+ },
155
+ "max_position_embeddings": 131072,
156
+ "model_type": "gemma4_vision",
157
+ "num_attention_heads": 16,
158
+ "num_hidden_layers": 27,
159
+ "num_key_value_heads": 16,
160
+ "output_attentions": false,
161
+ "output_hidden_states": false,
162
+ "patch_size": 16,
163
+ "pooling_kernel_size": 3,
164
+ "position_embedding_size": 10240,
165
+ "problem_type": null,
166
+ "return_dict": true,
167
+ "rms_norm_eps": 1e-06,
168
+ "rope_parameters": {
169
+ "rope_theta": 100.0,
170
+ "rope_type": "default"
171
+ },
172
+ "standardize": true,
173
+ "use_clipped_linears": false
174
+ },
175
+ "vision_soft_tokens_per_image": 280,
176
+ "quantization_config": {
177
+ "quant_method": "compressed-tensors",
178
+ "format": "float-quantized",
179
+ "config_groups": {
180
+ "group_0": {
181
+ "weights": {
182
+ "num_bits": 8,
183
+ "type": "float",
184
+ "symmetric": true,
185
+ "strategy": "channel",
186
+ "dynamic": false
187
+ },
188
+ "input_activations": null,
189
+ "targets": [
190
+ "Linear"
191
+ ]
192
+ }
193
+ },
194
+ "ignore": [
195
+ "lm_head",
196
+ "model.embed_vision.embedding_projection",
197
+ "model.language_model.embed_tokens",
198
+ "model.language_model.layers.0.input_layernorm",
199
+ "model.language_model.layers.0.layer_scalar",
200
+ "model.language_model.layers.0.post_attention_layernorm",
201
+ "model.language_model.layers.0.post_feedforward_layernorm",
202
+ "model.language_model.layers.0.pre_feedforward_layernorm",
203
+ "model.language_model.layers.0.self_attn.k_norm",
204
+ "model.language_model.layers.0.self_attn.q_norm",
205
+ "model.language_model.layers.1.input_layernorm",
206
+ "model.language_model.layers.1.layer_scalar",
207
+ "model.language_model.layers.1.post_attention_layernorm",
208
+ "model.language_model.layers.1.post_feedforward_layernorm",
209
+ "model.language_model.layers.1.pre_feedforward_layernorm",
210
+ "model.language_model.layers.1.self_attn.k_norm",
211
+ "model.language_model.layers.1.self_attn.q_norm",
212
+ "model.language_model.layers.10.input_layernorm",
213
+ "model.language_model.layers.10.layer_scalar",
214
+ "model.language_model.layers.10.post_attention_layernorm",
215
+ "model.language_model.layers.10.post_feedforward_layernorm",
216
+ "model.language_model.layers.10.pre_feedforward_layernorm",
217
+ "model.language_model.layers.10.self_attn.k_norm",
218
+ "model.language_model.layers.10.self_attn.q_norm",
219
+ "model.language_model.layers.11.input_layernorm",
220
+ "model.language_model.layers.11.layer_scalar",
221
+ "model.language_model.layers.11.post_attention_layernorm",
222
+ "model.language_model.layers.11.post_feedforward_layernorm",
223
+ "model.language_model.layers.11.pre_feedforward_layernorm",
224
+ "model.language_model.layers.11.self_attn.k_norm",
225
+ "model.language_model.layers.11.self_attn.q_norm",
226
+ "model.language_model.layers.12.input_layernorm",
227
+ "model.language_model.layers.12.layer_scalar",
228
+ "model.language_model.layers.12.post_attention_layernorm",
229
+ "model.language_model.layers.12.post_feedforward_layernorm",
230
+ "model.language_model.layers.12.pre_feedforward_layernorm",
231
+ "model.language_model.layers.12.self_attn.k_norm",
232
+ "model.language_model.layers.12.self_attn.q_norm",
233
+ "model.language_model.layers.13.input_layernorm",
234
+ "model.language_model.layers.13.layer_scalar",
235
+ "model.language_model.layers.13.post_attention_layernorm",
236
+ "model.language_model.layers.13.post_feedforward_layernorm",
237
+ "model.language_model.layers.13.pre_feedforward_layernorm",
238
+ "model.language_model.layers.13.self_attn.k_norm",
239
+ "model.language_model.layers.13.self_attn.q_norm",
240
+ "model.language_model.layers.14.input_layernorm",
241
+ "model.language_model.layers.14.layer_scalar",
242
+ "model.language_model.layers.14.post_attention_layernorm",
243
+ "model.language_model.layers.14.post_feedforward_layernorm",
244
+ "model.language_model.layers.14.pre_feedforward_layernorm",
245
+ "model.language_model.layers.14.self_attn.k_norm",
246
+ "model.language_model.layers.14.self_attn.q_norm",
247
+ "model.language_model.layers.15.input_layernorm",
248
+ "model.language_model.layers.15.layer_scalar",
249
+ "model.language_model.layers.15.post_attention_layernorm",
250
+ "model.language_model.layers.15.post_feedforward_layernorm",
251
+ "model.language_model.layers.15.pre_feedforward_layernorm",
252
+ "model.language_model.layers.15.self_attn.k_norm",
253
+ "model.language_model.layers.15.self_attn.q_norm",
254
+ "model.language_model.layers.16.input_layernorm",
255
+ "model.language_model.layers.16.layer_scalar",
256
+ "model.language_model.layers.16.post_attention_layernorm",
257
+ "model.language_model.layers.16.post_feedforward_layernorm",
258
+ "model.language_model.layers.16.pre_feedforward_layernorm",
259
+ "model.language_model.layers.16.self_attn.k_norm",
260
+ "model.language_model.layers.16.self_attn.q_norm",
261
+ "model.language_model.layers.17.input_layernorm",
262
+ "model.language_model.layers.17.layer_scalar",
263
+ "model.language_model.layers.17.post_attention_layernorm",
264
+ "model.language_model.layers.17.post_feedforward_layernorm",
265
+ "model.language_model.layers.17.pre_feedforward_layernorm",
266
+ "model.language_model.layers.17.self_attn.k_norm",
267
+ "model.language_model.layers.17.self_attn.q_norm",
268
+ "model.language_model.layers.18.input_layernorm",
269
+ "model.language_model.layers.18.layer_scalar",
270
+ "model.language_model.layers.18.post_attention_layernorm",
271
+ "model.language_model.layers.18.post_feedforward_layernorm",
272
+ "model.language_model.layers.18.pre_feedforward_layernorm",
273
+ "model.language_model.layers.18.self_attn.k_norm",
274
+ "model.language_model.layers.18.self_attn.q_norm",
275
+ "model.language_model.layers.19.input_layernorm",
276
+ "model.language_model.layers.19.layer_scalar",
277
+ "model.language_model.layers.19.post_attention_layernorm",
278
+ "model.language_model.layers.19.post_feedforward_layernorm",
279
+ "model.language_model.layers.19.pre_feedforward_layernorm",
280
+ "model.language_model.layers.19.self_attn.k_norm",
281
+ "model.language_model.layers.19.self_attn.q_norm",
282
+ "model.language_model.layers.2.input_layernorm",
283
+ "model.language_model.layers.2.layer_scalar",
284
+ "model.language_model.layers.2.post_attention_layernorm",
285
+ "model.language_model.layers.2.post_feedforward_layernorm",
286
+ "model.language_model.layers.2.pre_feedforward_layernorm",
287
+ "model.language_model.layers.2.self_attn.k_norm",
288
+ "model.language_model.layers.2.self_attn.q_norm",
289
+ "model.language_model.layers.20.input_layernorm",
290
+ "model.language_model.layers.20.layer_scalar",
291
+ "model.language_model.layers.20.post_attention_layernorm",
292
+ "model.language_model.layers.20.post_feedforward_layernorm",
293
+ "model.language_model.layers.20.pre_feedforward_layernorm",
294
+ "model.language_model.layers.20.self_attn.k_norm",
295
+ "model.language_model.layers.20.self_attn.q_norm",
296
+ "model.language_model.layers.21.input_layernorm",
297
+ "model.language_model.layers.21.layer_scalar",
298
+ "model.language_model.layers.21.post_attention_layernorm",
299
+ "model.language_model.layers.21.post_feedforward_layernorm",
300
+ "model.language_model.layers.21.pre_feedforward_layernorm",
301
+ "model.language_model.layers.21.self_attn.k_norm",
302
+ "model.language_model.layers.21.self_attn.q_norm",
303
+ "model.language_model.layers.22.input_layernorm",
304
+ "model.language_model.layers.22.layer_scalar",
305
+ "model.language_model.layers.22.post_attention_layernorm",
306
+ "model.language_model.layers.22.post_feedforward_layernorm",
307
+ "model.language_model.layers.22.pre_feedforward_layernorm",
308
+ "model.language_model.layers.22.self_attn.k_norm",
309
+ "model.language_model.layers.22.self_attn.q_norm",
310
+ "model.language_model.layers.23.input_layernorm",
311
+ "model.language_model.layers.23.layer_scalar",
312
+ "model.language_model.layers.23.post_attention_layernorm",
313
+ "model.language_model.layers.23.post_feedforward_layernorm",
314
+ "model.language_model.layers.23.pre_feedforward_layernorm",
315
+ "model.language_model.layers.23.self_attn.k_norm",
316
+ "model.language_model.layers.23.self_attn.q_norm",
317
+ "model.language_model.layers.24.input_layernorm",
318
+ "model.language_model.layers.24.layer_scalar",
319
+ "model.language_model.layers.24.post_attention_layernorm",
320
+ "model.language_model.layers.24.post_feedforward_layernorm",
321
+ "model.language_model.layers.24.pre_feedforward_layernorm",
322
+ "model.language_model.layers.24.self_attn.k_norm",
323
+ "model.language_model.layers.24.self_attn.q_norm",
324
+ "model.language_model.layers.25.input_layernorm",
325
+ "model.language_model.layers.25.layer_scalar",
326
+ "model.language_model.layers.25.post_attention_layernorm",
327
+ "model.language_model.layers.25.post_feedforward_layernorm",
328
+ "model.language_model.layers.25.pre_feedforward_layernorm",
329
+ "model.language_model.layers.25.self_attn.k_norm",
330
+ "model.language_model.layers.25.self_attn.q_norm",
331
+ "model.language_model.layers.26.input_layernorm",
332
+ "model.language_model.layers.26.layer_scalar",
333
+ "model.language_model.layers.26.post_attention_layernorm",
334
+ "model.language_model.layers.26.post_feedforward_layernorm",
335
+ "model.language_model.layers.26.pre_feedforward_layernorm",
336
+ "model.language_model.layers.26.self_attn.k_norm",
337
+ "model.language_model.layers.26.self_attn.q_norm",
338
+ "model.language_model.layers.27.input_layernorm",
339
+ "model.language_model.layers.27.layer_scalar",
340
+ "model.language_model.layers.27.post_attention_layernorm",
341
+ "model.language_model.layers.27.post_feedforward_layernorm",
342
+ "model.language_model.layers.27.pre_feedforward_layernorm",
343
+ "model.language_model.layers.27.self_attn.k_norm",
344
+ "model.language_model.layers.27.self_attn.q_norm",
345
+ "model.language_model.layers.28.input_layernorm",
346
+ "model.language_model.layers.28.layer_scalar",
347
+ "model.language_model.layers.28.post_attention_layernorm",
348
+ "model.language_model.layers.28.post_feedforward_layernorm",
349
+ "model.language_model.layers.28.pre_feedforward_layernorm",
350
+ "model.language_model.layers.28.self_attn.k_norm",
351
+ "model.language_model.layers.28.self_attn.q_norm",
352
+ "model.language_model.layers.29.input_layernorm",
353
+ "model.language_model.layers.29.layer_scalar",
354
+ "model.language_model.layers.29.post_attention_layernorm",
355
+ "model.language_model.layers.29.post_feedforward_layernorm",
356
+ "model.language_model.layers.29.pre_feedforward_layernorm",
357
+ "model.language_model.layers.29.self_attn.k_norm",
358
+ "model.language_model.layers.29.self_attn.q_norm",
359
+ "model.language_model.layers.3.input_layernorm",
360
+ "model.language_model.layers.3.layer_scalar",
361
+ "model.language_model.layers.3.post_attention_layernorm",
362
+ "model.language_model.layers.3.post_feedforward_layernorm",
363
+ "model.language_model.layers.3.pre_feedforward_layernorm",
364
+ "model.language_model.layers.3.self_attn.k_norm",
365
+ "model.language_model.layers.3.self_attn.q_norm",
366
+ "model.language_model.layers.30.input_layernorm",
367
+ "model.language_model.layers.30.layer_scalar",
368
+ "model.language_model.layers.30.post_attention_layernorm",
369
+ "model.language_model.layers.30.post_feedforward_layernorm",
370
+ "model.language_model.layers.30.pre_feedforward_layernorm",
371
+ "model.language_model.layers.30.self_attn.k_norm",
372
+ "model.language_model.layers.30.self_attn.q_norm",
373
+ "model.language_model.layers.31.input_layernorm",
374
+ "model.language_model.layers.31.layer_scalar",
375
+ "model.language_model.layers.31.post_attention_layernorm",
376
+ "model.language_model.layers.31.post_feedforward_layernorm",
377
+ "model.language_model.layers.31.pre_feedforward_layernorm",
378
+ "model.language_model.layers.31.self_attn.k_norm",
379
+ "model.language_model.layers.31.self_attn.q_norm",
380
+ "model.language_model.layers.32.input_layernorm",
381
+ "model.language_model.layers.32.layer_scalar",
382
+ "model.language_model.layers.32.post_attention_layernorm",
383
+ "model.language_model.layers.32.post_feedforward_layernorm",
384
+ "model.language_model.layers.32.pre_feedforward_layernorm",
385
+ "model.language_model.layers.32.self_attn.k_norm",
386
+ "model.language_model.layers.32.self_attn.q_norm",
387
+ "model.language_model.layers.33.input_layernorm",
388
+ "model.language_model.layers.33.layer_scalar",
389
+ "model.language_model.layers.33.post_attention_layernorm",
390
+ "model.language_model.layers.33.post_feedforward_layernorm",
391
+ "model.language_model.layers.33.pre_feedforward_layernorm",
392
+ "model.language_model.layers.33.self_attn.k_norm",
393
+ "model.language_model.layers.33.self_attn.q_norm",
394
+ "model.language_model.layers.34.input_layernorm",
395
+ "model.language_model.layers.34.layer_scalar",
396
+ "model.language_model.layers.34.post_attention_layernorm",
397
+ "model.language_model.layers.34.post_feedforward_layernorm",
398
+ "model.language_model.layers.34.pre_feedforward_layernorm",
399
+ "model.language_model.layers.34.self_attn.k_norm",
400
+ "model.language_model.layers.34.self_attn.q_norm",
401
+ "model.language_model.layers.35.input_layernorm",
402
+ "model.language_model.layers.35.layer_scalar",
403
+ "model.language_model.layers.35.post_attention_layernorm",
404
+ "model.language_model.layers.35.post_feedforward_layernorm",
405
+ "model.language_model.layers.35.pre_feedforward_layernorm",
406
+ "model.language_model.layers.35.self_attn.k_norm",
407
+ "model.language_model.layers.35.self_attn.q_norm",
408
+ "model.language_model.layers.36.input_layernorm",
409
+ "model.language_model.layers.36.layer_scalar",
410
+ "model.language_model.layers.36.post_attention_layernorm",
411
+ "model.language_model.layers.36.post_feedforward_layernorm",
412
+ "model.language_model.layers.36.pre_feedforward_layernorm",
413
+ "model.language_model.layers.36.self_attn.k_norm",
414
+ "model.language_model.layers.36.self_attn.q_norm",
415
+ "model.language_model.layers.37.input_layernorm",
416
+ "model.language_model.layers.37.layer_scalar",
417
+ "model.language_model.layers.37.post_attention_layernorm",
418
+ "model.language_model.layers.37.post_feedforward_layernorm",
419
+ "model.language_model.layers.37.pre_feedforward_layernorm",
420
+ "model.language_model.layers.37.self_attn.k_norm",
421
+ "model.language_model.layers.37.self_attn.q_norm",
422
+ "model.language_model.layers.38.input_layernorm",
423
+ "model.language_model.layers.38.layer_scalar",
424
+ "model.language_model.layers.38.post_attention_layernorm",
425
+ "model.language_model.layers.38.post_feedforward_layernorm",
426
+ "model.language_model.layers.38.pre_feedforward_layernorm",
427
+ "model.language_model.layers.38.self_attn.k_norm",
428
+ "model.language_model.layers.38.self_attn.q_norm",
429
+ "model.language_model.layers.39.input_layernorm",
430
+ "model.language_model.layers.39.layer_scalar",
431
+ "model.language_model.layers.39.post_attention_layernorm",
432
+ "model.language_model.layers.39.post_feedforward_layernorm",
433
+ "model.language_model.layers.39.pre_feedforward_layernorm",
434
+ "model.language_model.layers.39.self_attn.k_norm",
435
+ "model.language_model.layers.39.self_attn.q_norm",
436
+ "model.language_model.layers.4.input_layernorm",
437
+ "model.language_model.layers.4.layer_scalar",
438
+ "model.language_model.layers.4.post_attention_layernorm",
439
+ "model.language_model.layers.4.post_feedforward_layernorm",
440
+ "model.language_model.layers.4.pre_feedforward_layernorm",
441
+ "model.language_model.layers.4.self_attn.k_norm",
442
+ "model.language_model.layers.4.self_attn.q_norm",
443
+ "model.language_model.layers.40.input_layernorm",
444
+ "model.language_model.layers.40.layer_scalar",
445
+ "model.language_model.layers.40.post_attention_layernorm",
446
+ "model.language_model.layers.40.post_feedforward_layernorm",
447
+ "model.language_model.layers.40.pre_feedforward_layernorm",
448
+ "model.language_model.layers.40.self_attn.k_norm",
449
+ "model.language_model.layers.40.self_attn.q_norm",
450
+ "model.language_model.layers.41.input_layernorm",
451
+ "model.language_model.layers.41.layer_scalar",
452
+ "model.language_model.layers.41.post_attention_layernorm",
453
+ "model.language_model.layers.41.post_feedforward_layernorm",
454
+ "model.language_model.layers.41.pre_feedforward_layernorm",
455
+ "model.language_model.layers.41.self_attn.k_norm",
456
+ "model.language_model.layers.41.self_attn.q_norm",
457
+ "model.language_model.layers.42.input_layernorm",
458
+ "model.language_model.layers.42.layer_scalar",
459
+ "model.language_model.layers.42.post_attention_layernorm",
460
+ "model.language_model.layers.42.post_feedforward_layernorm",
461
+ "model.language_model.layers.42.pre_feedforward_layernorm",
462
+ "model.language_model.layers.42.self_attn.k_norm",
463
+ "model.language_model.layers.42.self_attn.q_norm",
464
+ "model.language_model.layers.43.input_layernorm",
465
+ "model.language_model.layers.43.layer_scalar",
466
+ "model.language_model.layers.43.post_attention_layernorm",
467
+ "model.language_model.layers.43.post_feedforward_layernorm",
468
+ "model.language_model.layers.43.pre_feedforward_layernorm",
469
+ "model.language_model.layers.43.self_attn.k_norm",
470
+ "model.language_model.layers.43.self_attn.q_norm",
471
+ "model.language_model.layers.44.input_layernorm",
472
+ "model.language_model.layers.44.layer_scalar",
473
+ "model.language_model.layers.44.post_attention_layernorm",
474
+ "model.language_model.layers.44.post_feedforward_layernorm",
475
+ "model.language_model.layers.44.pre_feedforward_layernorm",
476
+ "model.language_model.layers.44.self_attn.k_norm",
477
+ "model.language_model.layers.44.self_attn.q_norm",
478
+ "model.language_model.layers.45.input_layernorm",
479
+ "model.language_model.layers.45.layer_scalar",
480
+ "model.language_model.layers.45.post_attention_layernorm",
481
+ "model.language_model.layers.45.post_feedforward_layernorm",
482
+ "model.language_model.layers.45.pre_feedforward_layernorm",
483
+ "model.language_model.layers.45.self_attn.k_norm",
484
+ "model.language_model.layers.45.self_attn.q_norm",
485
+ "model.language_model.layers.46.input_layernorm",
486
+ "model.language_model.layers.46.layer_scalar",
487
+ "model.language_model.layers.46.post_attention_layernorm",
488
+ "model.language_model.layers.46.post_feedforward_layernorm",
489
+ "model.language_model.layers.46.pre_feedforward_layernorm",
490
+ "model.language_model.layers.46.self_attn.k_norm",
491
+ "model.language_model.layers.46.self_attn.q_norm",
492
+ "model.language_model.layers.47.input_layernorm",
493
+ "model.language_model.layers.47.layer_scalar",
494
+ "model.language_model.layers.47.post_attention_layernorm",
495
+ "model.language_model.layers.47.post_feedforward_layernorm",
496
+ "model.language_model.layers.47.pre_feedforward_layernorm",
497
+ "model.language_model.layers.47.self_attn.k_norm",
498
+ "model.language_model.layers.47.self_attn.q_norm",
499
+ "model.language_model.layers.48.input_layernorm",
500
+ "model.language_model.layers.48.layer_scalar",
501
+ "model.language_model.layers.48.post_attention_layernorm",
502
+ "model.language_model.layers.48.post_feedforward_layernorm",
503
+ "model.language_model.layers.48.pre_feedforward_layernorm",
504
+ "model.language_model.layers.48.self_attn.k_norm",
505
+ "model.language_model.layers.48.self_attn.q_norm",
506
+ "model.language_model.layers.49.input_layernorm",
507
+ "model.language_model.layers.49.layer_scalar",
508
+ "model.language_model.layers.49.post_attention_layernorm",
509
+ "model.language_model.layers.49.post_feedforward_layernorm",
510
+ "model.language_model.layers.49.pre_feedforward_layernorm",
511
+ "model.language_model.layers.49.self_attn.k_norm",
512
+ "model.language_model.layers.49.self_attn.q_norm",
513
+ "model.language_model.layers.5.input_layernorm",
514
+ "model.language_model.layers.5.layer_scalar",
515
+ "model.language_model.layers.5.post_attention_layernorm",
516
+ "model.language_model.layers.5.post_feedforward_layernorm",
517
+ "model.language_model.layers.5.pre_feedforward_layernorm",
518
+ "model.language_model.layers.5.self_attn.k_norm",
519
+ "model.language_model.layers.5.self_attn.q_norm",
520
+ "model.language_model.layers.50.input_layernorm",
521
+ "model.language_model.layers.50.layer_scalar",
522
+ "model.language_model.layers.50.post_attention_layernorm",
523
+ "model.language_model.layers.50.post_feedforward_layernorm",
524
+ "model.language_model.layers.50.pre_feedforward_layernorm",
525
+ "model.language_model.layers.50.self_attn.k_norm",
526
+ "model.language_model.layers.50.self_attn.q_norm",
527
+ "model.language_model.layers.51.input_layernorm",
528
+ "model.language_model.layers.51.layer_scalar",
529
+ "model.language_model.layers.51.post_attention_layernorm",
530
+ "model.language_model.layers.51.post_feedforward_layernorm",
531
+ "model.language_model.layers.51.pre_feedforward_layernorm",
532
+ "model.language_model.layers.51.self_attn.k_norm",
533
+ "model.language_model.layers.51.self_attn.q_norm",
534
+ "model.language_model.layers.52.input_layernorm",
535
+ "model.language_model.layers.52.layer_scalar",
536
+ "model.language_model.layers.52.post_attention_layernorm",
537
+ "model.language_model.layers.52.post_feedforward_layernorm",
538
+ "model.language_model.layers.52.pre_feedforward_layernorm",
539
+ "model.language_model.layers.52.self_attn.k_norm",
540
+ "model.language_model.layers.52.self_attn.q_norm",
541
+ "model.language_model.layers.53.input_layernorm",
542
+ "model.language_model.layers.53.layer_scalar",
543
+ "model.language_model.layers.53.post_attention_layernorm",
544
+ "model.language_model.layers.53.post_feedforward_layernorm",
545
+ "model.language_model.layers.53.pre_feedforward_layernorm",
546
+ "model.language_model.layers.53.self_attn.k_norm",
547
+ "model.language_model.layers.53.self_attn.q_norm",
548
+ "model.language_model.layers.54.input_layernorm",
549
+ "model.language_model.layers.54.layer_scalar",
550
+ "model.language_model.layers.54.post_attention_layernorm",
551
+ "model.language_model.layers.54.post_feedforward_layernorm",
552
+ "model.language_model.layers.54.pre_feedforward_layernorm",
553
+ "model.language_model.layers.54.self_attn.k_norm",
554
+ "model.language_model.layers.54.self_attn.q_norm",
555
+ "model.language_model.layers.55.input_layernorm",
556
+ "model.language_model.layers.55.layer_scalar",
557
+ "model.language_model.layers.55.post_attention_layernorm",
558
+ "model.language_model.layers.55.post_feedforward_layernorm",
559
+ "model.language_model.layers.55.pre_feedforward_layernorm",
560
+ "model.language_model.layers.55.self_attn.k_norm",
561
+ "model.language_model.layers.55.self_attn.q_norm",
562
+ "model.language_model.layers.56.input_layernorm",
563
+ "model.language_model.layers.56.layer_scalar",
564
+ "model.language_model.layers.56.post_attention_layernorm",
565
+ "model.language_model.layers.56.post_feedforward_layernorm",
566
+ "model.language_model.layers.56.pre_feedforward_layernorm",
567
+ "model.language_model.layers.56.self_attn.k_norm",
568
+ "model.language_model.layers.56.self_attn.q_norm",
569
+ "model.language_model.layers.57.input_layernorm",
570
+ "model.language_model.layers.57.layer_scalar",
571
+ "model.language_model.layers.57.post_attention_layernorm",
572
+ "model.language_model.layers.57.post_feedforward_layernorm",
573
+ "model.language_model.layers.57.pre_feedforward_layernorm",
574
+ "model.language_model.layers.57.self_attn.k_norm",
575
+ "model.language_model.layers.57.self_attn.q_norm",
576
+ "model.language_model.layers.58.input_layernorm",
577
+ "model.language_model.layers.58.layer_scalar",
578
+ "model.language_model.layers.58.post_attention_layernorm",
579
+ "model.language_model.layers.58.post_feedforward_layernorm",
580
+ "model.language_model.layers.58.pre_feedforward_layernorm",
581
+ "model.language_model.layers.58.self_attn.k_norm",
582
+ "model.language_model.layers.58.self_attn.q_norm",
583
+ "model.language_model.layers.59.input_layernorm",
584
+ "model.language_model.layers.59.layer_scalar",
585
+ "model.language_model.layers.59.post_attention_layernorm",
586
+ "model.language_model.layers.59.post_feedforward_layernorm",
587
+ "model.language_model.layers.59.pre_feedforward_layernorm",
588
+ "model.language_model.layers.59.self_attn.k_norm",
589
+ "model.language_model.layers.59.self_attn.q_norm",
590
+ "model.language_model.layers.6.input_layernorm",
591
+ "model.language_model.layers.6.layer_scalar",
592
+ "model.language_model.layers.6.post_attention_layernorm",
593
+ "model.language_model.layers.6.post_feedforward_layernorm",
594
+ "model.language_model.layers.6.pre_feedforward_layernorm",
595
+ "model.language_model.layers.6.self_attn.k_norm",
596
+ "model.language_model.layers.6.self_attn.q_norm",
597
+ "model.language_model.layers.7.input_layernorm",
598
+ "model.language_model.layers.7.layer_scalar",
599
+ "model.language_model.layers.7.post_attention_layernorm",
600
+ "model.language_model.layers.7.post_feedforward_layernorm",
601
+ "model.language_model.layers.7.pre_feedforward_layernorm",
602
+ "model.language_model.layers.7.self_attn.k_norm",
603
+ "model.language_model.layers.7.self_attn.q_norm",
604
+ "model.language_model.layers.8.input_layernorm",
605
+ "model.language_model.layers.8.layer_scalar",
606
+ "model.language_model.layers.8.post_attention_layernorm",
607
+ "model.language_model.layers.8.post_feedforward_layernorm",
608
+ "model.language_model.layers.8.pre_feedforward_layernorm",
609
+ "model.language_model.layers.8.self_attn.k_norm",
610
+ "model.language_model.layers.8.self_attn.q_norm",
611
+ "model.language_model.layers.9.input_layernorm",
612
+ "model.language_model.layers.9.layer_scalar",
613
+ "model.language_model.layers.9.post_attention_layernorm",
614
+ "model.language_model.layers.9.post_feedforward_layernorm",
615
+ "model.language_model.layers.9.pre_feedforward_layernorm",
616
+ "model.language_model.layers.9.self_attn.k_norm",
617
+ "model.language_model.layers.9.self_attn.q_norm",
618
+ "model.language_model.norm",
619
+ "model.vision_tower.encoder.layers.0.input_layernorm",
620
+ "model.vision_tower.encoder.layers.0.mlp.down_proj.linear",
621
+ "model.vision_tower.encoder.layers.0.mlp.gate_proj.linear",
622
+ "model.vision_tower.encoder.layers.0.mlp.up_proj.linear",
623
+ "model.vision_tower.encoder.layers.0.post_attention_layernorm",
624
+ "model.vision_tower.encoder.layers.0.post_feedforward_layernorm",
625
+ "model.vision_tower.encoder.layers.0.pre_feedforward_layernorm",
626
+ "model.vision_tower.encoder.layers.0.self_attn.k_norm",
627
+ "model.vision_tower.encoder.layers.0.self_attn.k_proj.linear",
628
+ "model.vision_tower.encoder.layers.0.self_attn.o_proj.linear",
629
+ "model.vision_tower.encoder.layers.0.self_attn.q_norm",
630
+ "model.vision_tower.encoder.layers.0.self_attn.q_proj.linear",
631
+ "model.vision_tower.encoder.layers.0.self_attn.v_proj.linear",
632
+ "model.vision_tower.encoder.layers.1.input_layernorm",
633
+ "model.vision_tower.encoder.layers.1.mlp.down_proj.linear",
634
+ "model.vision_tower.encoder.layers.1.mlp.gate_proj.linear",
635
+ "model.vision_tower.encoder.layers.1.mlp.up_proj.linear",
636
+ "model.vision_tower.encoder.layers.1.post_attention_layernorm",
637
+ "model.vision_tower.encoder.layers.1.post_feedforward_layernorm",
638
+ "model.vision_tower.encoder.layers.1.pre_feedforward_layernorm",
639
+ "model.vision_tower.encoder.layers.1.self_attn.k_norm",
640
+ "model.vision_tower.encoder.layers.1.self_attn.k_proj.linear",
641
+ "model.vision_tower.encoder.layers.1.self_attn.o_proj.linear",
642
+ "model.vision_tower.encoder.layers.1.self_attn.q_norm",
643
+ "model.vision_tower.encoder.layers.1.self_attn.q_proj.linear",
644
+ "model.vision_tower.encoder.layers.1.self_attn.v_proj.linear",
645
+ "model.vision_tower.encoder.layers.10.input_layernorm",
646
+ "model.vision_tower.encoder.layers.10.mlp.down_proj.linear",
647
+ "model.vision_tower.encoder.layers.10.mlp.gate_proj.linear",
648
+ "model.vision_tower.encoder.layers.10.mlp.up_proj.linear",
649
+ "model.vision_tower.encoder.layers.10.post_attention_layernorm",
650
+ "model.vision_tower.encoder.layers.10.post_feedforward_layernorm",
651
+ "model.vision_tower.encoder.layers.10.pre_feedforward_layernorm",
652
+ "model.vision_tower.encoder.layers.10.self_attn.k_norm",
653
+ "model.vision_tower.encoder.layers.10.self_attn.k_proj.linear",
654
+ "model.vision_tower.encoder.layers.10.self_attn.o_proj.linear",
655
+ "model.vision_tower.encoder.layers.10.self_attn.q_norm",
656
+ "model.vision_tower.encoder.layers.10.self_attn.q_proj.linear",
657
+ "model.vision_tower.encoder.layers.10.self_attn.v_proj.linear",
658
+ "model.vision_tower.encoder.layers.11.input_layernorm",
659
+ "model.vision_tower.encoder.layers.11.mlp.down_proj.linear",
660
+ "model.vision_tower.encoder.layers.11.mlp.gate_proj.linear",
661
+ "model.vision_tower.encoder.layers.11.mlp.up_proj.linear",
662
+ "model.vision_tower.encoder.layers.11.post_attention_layernorm",
663
+ "model.vision_tower.encoder.layers.11.post_feedforward_layernorm",
664
+ "model.vision_tower.encoder.layers.11.pre_feedforward_layernorm",
665
+ "model.vision_tower.encoder.layers.11.self_attn.k_norm",
666
+ "model.vision_tower.encoder.layers.11.self_attn.k_proj.linear",
667
+ "model.vision_tower.encoder.layers.11.self_attn.o_proj.linear",
668
+ "model.vision_tower.encoder.layers.11.self_attn.q_norm",
669
+ "model.vision_tower.encoder.layers.11.self_attn.q_proj.linear",
670
+ "model.vision_tower.encoder.layers.11.self_attn.v_proj.linear",
671
+ "model.vision_tower.encoder.layers.12.input_layernorm",
672
+ "model.vision_tower.encoder.layers.12.mlp.down_proj.linear",
673
+ "model.vision_tower.encoder.layers.12.mlp.gate_proj.linear",
674
+ "model.vision_tower.encoder.layers.12.mlp.up_proj.linear",
675
+ "model.vision_tower.encoder.layers.12.post_attention_layernorm",
676
+ "model.vision_tower.encoder.layers.12.post_feedforward_layernorm",
677
+ "model.vision_tower.encoder.layers.12.pre_feedforward_layernorm",
678
+ "model.vision_tower.encoder.layers.12.self_attn.k_norm",
679
+ "model.vision_tower.encoder.layers.12.self_attn.k_proj.linear",
680
+ "model.vision_tower.encoder.layers.12.self_attn.o_proj.linear",
681
+ "model.vision_tower.encoder.layers.12.self_attn.q_norm",
682
+ "model.vision_tower.encoder.layers.12.self_attn.q_proj.linear",
683
+ "model.vision_tower.encoder.layers.12.self_attn.v_proj.linear",
684
+ "model.vision_tower.encoder.layers.13.input_layernorm",
685
+ "model.vision_tower.encoder.layers.13.mlp.down_proj.linear",
686
+ "model.vision_tower.encoder.layers.13.mlp.gate_proj.linear",
687
+ "model.vision_tower.encoder.layers.13.mlp.up_proj.linear",
688
+ "model.vision_tower.encoder.layers.13.post_attention_layernorm",
689
+ "model.vision_tower.encoder.layers.13.post_feedforward_layernorm",
690
+ "model.vision_tower.encoder.layers.13.pre_feedforward_layernorm",
691
+ "model.vision_tower.encoder.layers.13.self_attn.k_norm",
692
+ "model.vision_tower.encoder.layers.13.self_attn.k_proj.linear",
693
+ "model.vision_tower.encoder.layers.13.self_attn.o_proj.linear",
694
+ "model.vision_tower.encoder.layers.13.self_attn.q_norm",
695
+ "model.vision_tower.encoder.layers.13.self_attn.q_proj.linear",
696
+ "model.vision_tower.encoder.layers.13.self_attn.v_proj.linear",
697
+ "model.vision_tower.encoder.layers.14.input_layernorm",
698
+ "model.vision_tower.encoder.layers.14.mlp.down_proj.linear",
699
+ "model.vision_tower.encoder.layers.14.mlp.gate_proj.linear",
700
+ "model.vision_tower.encoder.layers.14.mlp.up_proj.linear",
701
+ "model.vision_tower.encoder.layers.14.post_attention_layernorm",
702
+ "model.vision_tower.encoder.layers.14.post_feedforward_layernorm",
703
+ "model.vision_tower.encoder.layers.14.pre_feedforward_layernorm",
704
+ "model.vision_tower.encoder.layers.14.self_attn.k_norm",
705
+ "model.vision_tower.encoder.layers.14.self_attn.k_proj.linear",
706
+ "model.vision_tower.encoder.layers.14.self_attn.o_proj.linear",
707
+ "model.vision_tower.encoder.layers.14.self_attn.q_norm",
708
+ "model.vision_tower.encoder.layers.14.self_attn.q_proj.linear",
709
+ "model.vision_tower.encoder.layers.14.self_attn.v_proj.linear",
710
+ "model.vision_tower.encoder.layers.15.input_layernorm",
711
+ "model.vision_tower.encoder.layers.15.mlp.down_proj.linear",
712
+ "model.vision_tower.encoder.layers.15.mlp.gate_proj.linear",
713
+ "model.vision_tower.encoder.layers.15.mlp.up_proj.linear",
714
+ "model.vision_tower.encoder.layers.15.post_attention_layernorm",
715
+ "model.vision_tower.encoder.layers.15.post_feedforward_layernorm",
716
+ "model.vision_tower.encoder.layers.15.pre_feedforward_layernorm",
717
+ "model.vision_tower.encoder.layers.15.self_attn.k_norm",
718
+ "model.vision_tower.encoder.layers.15.self_attn.k_proj.linear",
719
+ "model.vision_tower.encoder.layers.15.self_attn.o_proj.linear",
720
+ "model.vision_tower.encoder.layers.15.self_attn.q_norm",
721
+ "model.vision_tower.encoder.layers.15.self_attn.q_proj.linear",
722
+ "model.vision_tower.encoder.layers.15.self_attn.v_proj.linear",
723
+ "model.vision_tower.encoder.layers.16.input_layernorm",
724
+ "model.vision_tower.encoder.layers.16.mlp.down_proj.linear",
725
+ "model.vision_tower.encoder.layers.16.mlp.gate_proj.linear",
726
+ "model.vision_tower.encoder.layers.16.mlp.up_proj.linear",
727
+ "model.vision_tower.encoder.layers.16.post_attention_layernorm",
728
+ "model.vision_tower.encoder.layers.16.post_feedforward_layernorm",
729
+ "model.vision_tower.encoder.layers.16.pre_feedforward_layernorm",
730
+ "model.vision_tower.encoder.layers.16.self_attn.k_norm",
731
+ "model.vision_tower.encoder.layers.16.self_attn.k_proj.linear",
732
+ "model.vision_tower.encoder.layers.16.self_attn.o_proj.linear",
733
+ "model.vision_tower.encoder.layers.16.self_attn.q_norm",
734
+ "model.vision_tower.encoder.layers.16.self_attn.q_proj.linear",
735
+ "model.vision_tower.encoder.layers.16.self_attn.v_proj.linear",
736
+ "model.vision_tower.encoder.layers.17.input_layernorm",
737
+ "model.vision_tower.encoder.layers.17.mlp.down_proj.linear",
738
+ "model.vision_tower.encoder.layers.17.mlp.gate_proj.linear",
739
+ "model.vision_tower.encoder.layers.17.mlp.up_proj.linear",
740
+ "model.vision_tower.encoder.layers.17.post_attention_layernorm",
741
+ "model.vision_tower.encoder.layers.17.post_feedforward_layernorm",
742
+ "model.vision_tower.encoder.layers.17.pre_feedforward_layernorm",
743
+ "model.vision_tower.encoder.layers.17.self_attn.k_norm",
744
+ "model.vision_tower.encoder.layers.17.self_attn.k_proj.linear",
745
+ "model.vision_tower.encoder.layers.17.self_attn.o_proj.linear",
746
+ "model.vision_tower.encoder.layers.17.self_attn.q_norm",
747
+ "model.vision_tower.encoder.layers.17.self_attn.q_proj.linear",
748
+ "model.vision_tower.encoder.layers.17.self_attn.v_proj.linear",
749
+ "model.vision_tower.encoder.layers.18.input_layernorm",
750
+ "model.vision_tower.encoder.layers.18.mlp.down_proj.linear",
751
+ "model.vision_tower.encoder.layers.18.mlp.gate_proj.linear",
752
+ "model.vision_tower.encoder.layers.18.mlp.up_proj.linear",
753
+ "model.vision_tower.encoder.layers.18.post_attention_layernorm",
754
+ "model.vision_tower.encoder.layers.18.post_feedforward_layernorm",
755
+ "model.vision_tower.encoder.layers.18.pre_feedforward_layernorm",
756
+ "model.vision_tower.encoder.layers.18.self_attn.k_norm",
757
+ "model.vision_tower.encoder.layers.18.self_attn.k_proj.linear",
758
+ "model.vision_tower.encoder.layers.18.self_attn.o_proj.linear",
759
+ "model.vision_tower.encoder.layers.18.self_attn.q_norm",
760
+ "model.vision_tower.encoder.layers.18.self_attn.q_proj.linear",
761
+ "model.vision_tower.encoder.layers.18.self_attn.v_proj.linear",
762
+ "model.vision_tower.encoder.layers.19.input_layernorm",
763
+ "model.vision_tower.encoder.layers.19.mlp.down_proj.linear",
764
+ "model.vision_tower.encoder.layers.19.mlp.gate_proj.linear",
765
+ "model.vision_tower.encoder.layers.19.mlp.up_proj.linear",
766
+ "model.vision_tower.encoder.layers.19.post_attention_layernorm",
767
+ "model.vision_tower.encoder.layers.19.post_feedforward_layernorm",
768
+ "model.vision_tower.encoder.layers.19.pre_feedforward_layernorm",
769
+ "model.vision_tower.encoder.layers.19.self_attn.k_norm",
770
+ "model.vision_tower.encoder.layers.19.self_attn.k_proj.linear",
771
+ "model.vision_tower.encoder.layers.19.self_attn.o_proj.linear",
772
+ "model.vision_tower.encoder.layers.19.self_attn.q_norm",
773
+ "model.vision_tower.encoder.layers.19.self_attn.q_proj.linear",
774
+ "model.vision_tower.encoder.layers.19.self_attn.v_proj.linear",
775
+ "model.vision_tower.encoder.layers.2.input_layernorm",
776
+ "model.vision_tower.encoder.layers.2.mlp.down_proj.linear",
777
+ "model.vision_tower.encoder.layers.2.mlp.gate_proj.linear",
778
+ "model.vision_tower.encoder.layers.2.mlp.up_proj.linear",
779
+ "model.vision_tower.encoder.layers.2.post_attention_layernorm",
780
+ "model.vision_tower.encoder.layers.2.post_feedforward_layernorm",
781
+ "model.vision_tower.encoder.layers.2.pre_feedforward_layernorm",
782
+ "model.vision_tower.encoder.layers.2.self_attn.k_norm",
783
+ "model.vision_tower.encoder.layers.2.self_attn.k_proj.linear",
784
+ "model.vision_tower.encoder.layers.2.self_attn.o_proj.linear",
785
+ "model.vision_tower.encoder.layers.2.self_attn.q_norm",
786
+ "model.vision_tower.encoder.layers.2.self_attn.q_proj.linear",
787
+ "model.vision_tower.encoder.layers.2.self_attn.v_proj.linear",
788
+ "model.vision_tower.encoder.layers.20.input_layernorm",
789
+ "model.vision_tower.encoder.layers.20.mlp.down_proj.linear",
790
+ "model.vision_tower.encoder.layers.20.mlp.gate_proj.linear",
791
+ "model.vision_tower.encoder.layers.20.mlp.up_proj.linear",
792
+ "model.vision_tower.encoder.layers.20.post_attention_layernorm",
793
+ "model.vision_tower.encoder.layers.20.post_feedforward_layernorm",
794
+ "model.vision_tower.encoder.layers.20.pre_feedforward_layernorm",
795
+ "model.vision_tower.encoder.layers.20.self_attn.k_norm",
796
+ "model.vision_tower.encoder.layers.20.self_attn.k_proj.linear",
797
+ "model.vision_tower.encoder.layers.20.self_attn.o_proj.linear",
798
+ "model.vision_tower.encoder.layers.20.self_attn.q_norm",
799
+ "model.vision_tower.encoder.layers.20.self_attn.q_proj.linear",
800
+ "model.vision_tower.encoder.layers.20.self_attn.v_proj.linear",
801
+ "model.vision_tower.encoder.layers.21.input_layernorm",
802
+ "model.vision_tower.encoder.layers.21.mlp.down_proj.linear",
803
+ "model.vision_tower.encoder.layers.21.mlp.gate_proj.linear",
804
+ "model.vision_tower.encoder.layers.21.mlp.up_proj.linear",
805
+ "model.vision_tower.encoder.layers.21.post_attention_layernorm",
806
+ "model.vision_tower.encoder.layers.21.post_feedforward_layernorm",
807
+ "model.vision_tower.encoder.layers.21.pre_feedforward_layernorm",
808
+ "model.vision_tower.encoder.layers.21.self_attn.k_norm",
809
+ "model.vision_tower.encoder.layers.21.self_attn.k_proj.linear",
810
+ "model.vision_tower.encoder.layers.21.self_attn.o_proj.linear",
811
+ "model.vision_tower.encoder.layers.21.self_attn.q_norm",
812
+ "model.vision_tower.encoder.layers.21.self_attn.q_proj.linear",
813
+ "model.vision_tower.encoder.layers.21.self_attn.v_proj.linear",
814
+ "model.vision_tower.encoder.layers.22.input_layernorm",
815
+ "model.vision_tower.encoder.layers.22.mlp.down_proj.linear",
816
+ "model.vision_tower.encoder.layers.22.mlp.gate_proj.linear",
817
+ "model.vision_tower.encoder.layers.22.mlp.up_proj.linear",
818
+ "model.vision_tower.encoder.layers.22.post_attention_layernorm",
819
+ "model.vision_tower.encoder.layers.22.post_feedforward_layernorm",
820
+ "model.vision_tower.encoder.layers.22.pre_feedforward_layernorm",
821
+ "model.vision_tower.encoder.layers.22.self_attn.k_norm",
822
+ "model.vision_tower.encoder.layers.22.self_attn.k_proj.linear",
823
+ "model.vision_tower.encoder.layers.22.self_attn.o_proj.linear",
824
+ "model.vision_tower.encoder.layers.22.self_attn.q_norm",
825
+ "model.vision_tower.encoder.layers.22.self_attn.q_proj.linear",
826
+ "model.vision_tower.encoder.layers.22.self_attn.v_proj.linear",
827
+ "model.vision_tower.encoder.layers.23.input_layernorm",
828
+ "model.vision_tower.encoder.layers.23.mlp.down_proj.linear",
829
+ "model.vision_tower.encoder.layers.23.mlp.gate_proj.linear",
830
+ "model.vision_tower.encoder.layers.23.mlp.up_proj.linear",
831
+ "model.vision_tower.encoder.layers.23.post_attention_layernorm",
832
+ "model.vision_tower.encoder.layers.23.post_feedforward_layernorm",
833
+ "model.vision_tower.encoder.layers.23.pre_feedforward_layernorm",
834
+ "model.vision_tower.encoder.layers.23.self_attn.k_norm",
835
+ "model.vision_tower.encoder.layers.23.self_attn.k_proj.linear",
836
+ "model.vision_tower.encoder.layers.23.self_attn.o_proj.linear",
837
+ "model.vision_tower.encoder.layers.23.self_attn.q_norm",
838
+ "model.vision_tower.encoder.layers.23.self_attn.q_proj.linear",
839
+ "model.vision_tower.encoder.layers.23.self_attn.v_proj.linear",
840
+ "model.vision_tower.encoder.layers.24.input_layernorm",
841
+ "model.vision_tower.encoder.layers.24.mlp.down_proj.linear",
842
+ "model.vision_tower.encoder.layers.24.mlp.gate_proj.linear",
843
+ "model.vision_tower.encoder.layers.24.mlp.up_proj.linear",
844
+ "model.vision_tower.encoder.layers.24.post_attention_layernorm",
845
+ "model.vision_tower.encoder.layers.24.post_feedforward_layernorm",
846
+ "model.vision_tower.encoder.layers.24.pre_feedforward_layernorm",
847
+ "model.vision_tower.encoder.layers.24.self_attn.k_norm",
848
+ "model.vision_tower.encoder.layers.24.self_attn.k_proj.linear",
849
+ "model.vision_tower.encoder.layers.24.self_attn.o_proj.linear",
850
+ "model.vision_tower.encoder.layers.24.self_attn.q_norm",
851
+ "model.vision_tower.encoder.layers.24.self_attn.q_proj.linear",
852
+ "model.vision_tower.encoder.layers.24.self_attn.v_proj.linear",
853
+ "model.vision_tower.encoder.layers.25.input_layernorm",
854
+ "model.vision_tower.encoder.layers.25.mlp.down_proj.linear",
855
+ "model.vision_tower.encoder.layers.25.mlp.gate_proj.linear",
856
+ "model.vision_tower.encoder.layers.25.mlp.up_proj.linear",
857
+ "model.vision_tower.encoder.layers.25.post_attention_layernorm",
858
+ "model.vision_tower.encoder.layers.25.post_feedforward_layernorm",
859
+ "model.vision_tower.encoder.layers.25.pre_feedforward_layernorm",
860
+ "model.vision_tower.encoder.layers.25.self_attn.k_norm",
861
+ "model.vision_tower.encoder.layers.25.self_attn.k_proj.linear",
862
+ "model.vision_tower.encoder.layers.25.self_attn.o_proj.linear",
863
+ "model.vision_tower.encoder.layers.25.self_attn.q_norm",
864
+ "model.vision_tower.encoder.layers.25.self_attn.q_proj.linear",
865
+ "model.vision_tower.encoder.layers.25.self_attn.v_proj.linear",
866
+ "model.vision_tower.encoder.layers.26.input_layernorm",
867
+ "model.vision_tower.encoder.layers.26.mlp.down_proj.linear",
868
+ "model.vision_tower.encoder.layers.26.mlp.gate_proj.linear",
869
+ "model.vision_tower.encoder.layers.26.mlp.up_proj.linear",
870
+ "model.vision_tower.encoder.layers.26.post_attention_layernorm",
871
+ "model.vision_tower.encoder.layers.26.post_feedforward_layernorm",
872
+ "model.vision_tower.encoder.layers.26.pre_feedforward_layernorm",
873
+ "model.vision_tower.encoder.layers.26.self_attn.k_norm",
874
+ "model.vision_tower.encoder.layers.26.self_attn.k_proj.linear",
875
+ "model.vision_tower.encoder.layers.26.self_attn.o_proj.linear",
876
+ "model.vision_tower.encoder.layers.26.self_attn.q_norm",
877
+ "model.vision_tower.encoder.layers.26.self_attn.q_proj.linear",
878
+ "model.vision_tower.encoder.layers.26.self_attn.v_proj.linear",
879
+ "model.vision_tower.encoder.layers.3.input_layernorm",
880
+ "model.vision_tower.encoder.layers.3.mlp.down_proj.linear",
881
+ "model.vision_tower.encoder.layers.3.mlp.gate_proj.linear",
882
+ "model.vision_tower.encoder.layers.3.mlp.up_proj.linear",
883
+ "model.vision_tower.encoder.layers.3.post_attention_layernorm",
884
+ "model.vision_tower.encoder.layers.3.post_feedforward_layernorm",
885
+ "model.vision_tower.encoder.layers.3.pre_feedforward_layernorm",
886
+ "model.vision_tower.encoder.layers.3.self_attn.k_norm",
887
+ "model.vision_tower.encoder.layers.3.self_attn.k_proj.linear",
888
+ "model.vision_tower.encoder.layers.3.self_attn.o_proj.linear",
889
+ "model.vision_tower.encoder.layers.3.self_attn.q_norm",
890
+ "model.vision_tower.encoder.layers.3.self_attn.q_proj.linear",
891
+ "model.vision_tower.encoder.layers.3.self_attn.v_proj.linear",
892
+ "model.vision_tower.encoder.layers.4.input_layernorm",
893
+ "model.vision_tower.encoder.layers.4.mlp.down_proj.linear",
894
+ "model.vision_tower.encoder.layers.4.mlp.gate_proj.linear",
895
+ "model.vision_tower.encoder.layers.4.mlp.up_proj.linear",
896
+ "model.vision_tower.encoder.layers.4.post_attention_layernorm",
897
+ "model.vision_tower.encoder.layers.4.post_feedforward_layernorm",
898
+ "model.vision_tower.encoder.layers.4.pre_feedforward_layernorm",
899
+ "model.vision_tower.encoder.layers.4.self_attn.k_norm",
900
+ "model.vision_tower.encoder.layers.4.self_attn.k_proj.linear",
901
+ "model.vision_tower.encoder.layers.4.self_attn.o_proj.linear",
902
+ "model.vision_tower.encoder.layers.4.self_attn.q_norm",
903
+ "model.vision_tower.encoder.layers.4.self_attn.q_proj.linear",
904
+ "model.vision_tower.encoder.layers.4.self_attn.v_proj.linear",
905
+ "model.vision_tower.encoder.layers.5.input_layernorm",
906
+ "model.vision_tower.encoder.layers.5.mlp.down_proj.linear",
907
+ "model.vision_tower.encoder.layers.5.mlp.gate_proj.linear",
908
+ "model.vision_tower.encoder.layers.5.mlp.up_proj.linear",
909
+ "model.vision_tower.encoder.layers.5.post_attention_layernorm",
910
+ "model.vision_tower.encoder.layers.5.post_feedforward_layernorm",
911
+ "model.vision_tower.encoder.layers.5.pre_feedforward_layernorm",
912
+ "model.vision_tower.encoder.layers.5.self_attn.k_norm",
913
+ "model.vision_tower.encoder.layers.5.self_attn.k_proj.linear",
914
+ "model.vision_tower.encoder.layers.5.self_attn.o_proj.linear",
915
+ "model.vision_tower.encoder.layers.5.self_attn.q_norm",
916
+ "model.vision_tower.encoder.layers.5.self_attn.q_proj.linear",
917
+ "model.vision_tower.encoder.layers.5.self_attn.v_proj.linear",
918
+ "model.vision_tower.encoder.layers.6.input_layernorm",
919
+ "model.vision_tower.encoder.layers.6.mlp.down_proj.linear",
920
+ "model.vision_tower.encoder.layers.6.mlp.gate_proj.linear",
921
+ "model.vision_tower.encoder.layers.6.mlp.up_proj.linear",
922
+ "model.vision_tower.encoder.layers.6.post_attention_layernorm",
923
+ "model.vision_tower.encoder.layers.6.post_feedforward_layernorm",
924
+ "model.vision_tower.encoder.layers.6.pre_feedforward_layernorm",
925
+ "model.vision_tower.encoder.layers.6.self_attn.k_norm",
926
+ "model.vision_tower.encoder.layers.6.self_attn.k_proj.linear",
927
+ "model.vision_tower.encoder.layers.6.self_attn.o_proj.linear",
928
+ "model.vision_tower.encoder.layers.6.self_attn.q_norm",
929
+ "model.vision_tower.encoder.layers.6.self_attn.q_proj.linear",
930
+ "model.vision_tower.encoder.layers.6.self_attn.v_proj.linear",
931
+ "model.vision_tower.encoder.layers.7.input_layernorm",
932
+ "model.vision_tower.encoder.layers.7.mlp.down_proj.linear",
933
+ "model.vision_tower.encoder.layers.7.mlp.gate_proj.linear",
934
+ "model.vision_tower.encoder.layers.7.mlp.up_proj.linear",
935
+ "model.vision_tower.encoder.layers.7.post_attention_layernorm",
936
+ "model.vision_tower.encoder.layers.7.post_feedforward_layernorm",
937
+ "model.vision_tower.encoder.layers.7.pre_feedforward_layernorm",
938
+ "model.vision_tower.encoder.layers.7.self_attn.k_norm",
939
+ "model.vision_tower.encoder.layers.7.self_attn.k_proj.linear",
940
+ "model.vision_tower.encoder.layers.7.self_attn.o_proj.linear",
941
+ "model.vision_tower.encoder.layers.7.self_attn.q_norm",
942
+ "model.vision_tower.encoder.layers.7.self_attn.q_proj.linear",
943
+ "model.vision_tower.encoder.layers.7.self_attn.v_proj.linear",
944
+ "model.vision_tower.encoder.layers.8.input_layernorm",
945
+ "model.vision_tower.encoder.layers.8.mlp.down_proj.linear",
946
+ "model.vision_tower.encoder.layers.8.mlp.gate_proj.linear",
947
+ "model.vision_tower.encoder.layers.8.mlp.up_proj.linear",
948
+ "model.vision_tower.encoder.layers.8.post_attention_layernorm",
949
+ "model.vision_tower.encoder.layers.8.post_feedforward_layernorm",
950
+ "model.vision_tower.encoder.layers.8.pre_feedforward_layernorm",
951
+ "model.vision_tower.encoder.layers.8.self_attn.k_norm",
952
+ "model.vision_tower.encoder.layers.8.self_attn.k_proj.linear",
953
+ "model.vision_tower.encoder.layers.8.self_attn.o_proj.linear",
954
+ "model.vision_tower.encoder.layers.8.self_attn.q_norm",
955
+ "model.vision_tower.encoder.layers.8.self_attn.q_proj.linear",
956
+ "model.vision_tower.encoder.layers.8.self_attn.v_proj.linear",
957
+ "model.vision_tower.encoder.layers.9.input_layernorm",
958
+ "model.vision_tower.encoder.layers.9.mlp.down_proj.linear",
959
+ "model.vision_tower.encoder.layers.9.mlp.gate_proj.linear",
960
+ "model.vision_tower.encoder.layers.9.mlp.up_proj.linear",
961
+ "model.vision_tower.encoder.layers.9.post_attention_layernorm",
962
+ "model.vision_tower.encoder.layers.9.post_feedforward_layernorm",
963
+ "model.vision_tower.encoder.layers.9.pre_feedforward_layernorm",
964
+ "model.vision_tower.encoder.layers.9.self_attn.k_norm",
965
+ "model.vision_tower.encoder.layers.9.self_attn.k_proj.linear",
966
+ "model.vision_tower.encoder.layers.9.self_attn.o_proj.linear",
967
+ "model.vision_tower.encoder.layers.9.self_attn.q_norm",
968
+ "model.vision_tower.encoder.layers.9.self_attn.q_proj.linear",
969
+ "model.vision_tower.encoder.layers.9.self_attn.v_proj.linear",
970
+ "model.vision_tower.patch_embedder.input_proj",
971
+ "model.vision_tower.patch_embedder.position_embedding_table",
972
+ "model.vision_tower.std_bias",
973
+ "model.vision_tower.std_scale"
974
+ ],
975
+ "kv_cache_scheme": null
976
+ }
977
+ }
generation_config.json ADDED
@@ -0,0 +1,14 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 2,
3
+ "do_sample": true,
4
+ "eos_token_id": [
5
+ 1,
6
+ 106,
7
+ 50
8
+ ],
9
+ "pad_token_id": 0,
10
+ "temperature": 1.0,
11
+ "top_k": 64,
12
+ "top_p": 0.95,
13
+ "transformers_version": "5.13.0.dev0"
14
+ }
model-00001-of-00014.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:52faa6689d372edec4d54d34dda5a1c215f40dda274c302b0c4e84eca107c1ee
3
+ size 2830958848
model-00002-of-00014.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b03d148951f6edf58101c4f98d9dd803cc83dc03a00e6477be5e6f264362fd84
3
+ size 3892739510
model-00003-of-00014.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b2b253b702a66a0e6cd185edbbbfa55393b1c10c211a5ea2b4dbef27cc7dfd04
3
+ size 2451381050
model-00004-of-00014.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:552138e79313f04959f6a68efff50bee0cde2e4ed9f89c3313c65a953289328c
3
+ size 2451381098
model-00005-of-00014.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fbca572647056c387e36774e1d3ab5cd5b3448f9f62990436125bf8537a8c1fa
3
+ size 2396321962
model-00006-of-00014.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8c0d85eb2775053439654405ebdc8ebd064432cc1769dbb9a934ebdf21306026
3
+ size 2451381162
model-00007-of-00014.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fe1e786cd058e0c26d212d5353c94d67425845f5f719d10505ab2507759a4ff6
3
+ size 2451381162
model-00008-of-00014.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:38b25efaceac7de1d7be05ff1e5260cffba9a6e0b4342c39ff9a035867eddadf
3
+ size 2451381154
model-00009-of-00014.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:477b97f75a7ab6fc40fb7b6b0b66a05e1550f956edbc7dec9760379380814383
3
+ size 2451381154
model-00010-of-00014.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cc4a43e4f6340bd10d9fda05afd952f7d5f88fc064aad358cb53c2fda695c102
3
+ size 2451381154
model-00011-of-00014.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:42585e93be206194c87f99761ce02c46fe3d9c5338b665e9c99b7d3c69477afc
3
+ size 2396321962
model-00012-of-00014.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:09b97c10ce56d90c4c3fdb82f557b6c818bc5789a26139294b0b07c9d635eb2e
3
+ size 2451381162
model-00013-of-00014.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:156dc59df4a8b90bde66879c9dd89d6f05bd2014de95e0ca6628701a7492e823
3
+ size 2451381162
model-00014-of-00014.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:34ea09f034a70596ed0cac14fe17fa043049cfd3b7d8ed7a657d54a70d38cb5d
3
+ size 2516374956
model.safetensors.index.json ADDED
The diff for this file is too large to render. See raw diff
 
processor_config.json ADDED
@@ -0,0 +1,75 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "audio_ms_per_token": 40,
3
+ "audio_seq_length": 750,
4
+ "feature_extractor": {
5
+ "dither": 0.0,
6
+ "feature_extractor_type": "Gemma4AudioFeatureExtractor",
7
+ "feature_size": 128,
8
+ "fft_length": 512,
9
+ "fft_overdrive": false,
10
+ "frame_length": 320,
11
+ "hop_length": 160,
12
+ "input_scale_factor": 1.0,
13
+ "max_frequency": 8000.0,
14
+ "mel_floor": 0.001,
15
+ "min_frequency": 0.0,
16
+ "padding_side": "right",
17
+ "padding_value": 0.0,
18
+ "per_bin_mean": null,
19
+ "per_bin_stddev": null,
20
+ "preemphasis": 0.0,
21
+ "preemphasis_htk_flavor": true,
22
+ "return_attention_mask": true,
23
+ "sampling_rate": 16000
24
+ },
25
+ "image_processor": {
26
+ "do_convert_rgb": true,
27
+ "do_normalize": false,
28
+ "do_rescale": true,
29
+ "do_resize": true,
30
+ "image_mean": [
31
+ 0.0,
32
+ 0.0,
33
+ 0.0
34
+ ],
35
+ "image_processor_type": "Gemma4ImageProcessor",
36
+ "image_seq_length": 280,
37
+ "image_std": [
38
+ 1.0,
39
+ 1.0,
40
+ 1.0
41
+ ],
42
+ "max_soft_tokens": 280,
43
+ "patch_size": 16,
44
+ "pooling_kernel_size": 3,
45
+ "resample": 3,
46
+ "rescale_factor": 0.00392156862745098
47
+ },
48
+ "image_seq_length": 280,
49
+ "processor_class": "Gemma4Processor",
50
+ "video_processor": {
51
+ "do_convert_rgb": true,
52
+ "do_normalize": true,
53
+ "do_rescale": true,
54
+ "do_resize": true,
55
+ "do_sample_frames": true,
56
+ "image_mean": [
57
+ 0.0,
58
+ 0.0,
59
+ 0.0
60
+ ],
61
+ "image_std": [
62
+ 1.0,
63
+ 1.0,
64
+ 1.0
65
+ ],
66
+ "max_soft_tokens": 70,
67
+ "num_frames": 32,
68
+ "patch_size": 16,
69
+ "pooling_kernel_size": 3,
70
+ "resample": 3,
71
+ "rescale_factor": 0.00392156862745098,
72
+ "return_metadata": false,
73
+ "video_processor_type": "Gemma4VideoProcessor"
74
+ }
75
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cc8d3a0ce36466ccc1278bf987df5f71db1719b9ca6b4118264f45cb627bfe0f
3
+ size 32169626
tokenizer_config.json ADDED
@@ -0,0 +1,96 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "audio_token": "<|audio|>",
3
+ "backend": "tokenizers",
4
+ "boa_token": "<|audio>",
5
+ "boi_token": "<|image>",
6
+ "bos_token": "<bos>",
7
+ "eoa_token": "<audio|>",
8
+ "eoc_token": "<channel|>",
9
+ "eoi_token": "<image|>",
10
+ "eos_token": "<turn|>",
11
+ "eot_token": "<turn|>",
12
+ "escape_token": "<|\"|>",
13
+ "etc_token": "<tool_call|>",
14
+ "etd_token": "<tool|>",
15
+ "etr_token": "<tool_response|>",
16
+ "extra_special_tokens": [
17
+ "<|video|>"
18
+ ],
19
+ "image_token": "<|image|>",
20
+ "is_local": false,
21
+ "local_files_only": false,
22
+ "mask_token": "<mask>",
23
+ "model_max_length": 262144,
24
+ "model_specific_special_tokens": {
25
+ "audio_token": "<|audio|>",
26
+ "boa_token": "<|audio>",
27
+ "boi_token": "<|image>",
28
+ "eoa_token": "<audio|>",
29
+ "eoc_token": "<channel|>",
30
+ "eoi_token": "<image|>",
31
+ "eot_token": "<turn|>",
32
+ "escape_token": "<|\"|>",
33
+ "etc_token": "<tool_call|>",
34
+ "etd_token": "<tool|>",
35
+ "etr_token": "<tool_response|>",
36
+ "image_token": "<|image|>",
37
+ "soc_token": "<|channel>",
38
+ "sot_token": "<|turn>",
39
+ "stc_token": "<|tool_call>",
40
+ "std_token": "<|tool>",
41
+ "str_token": "<|tool_response>",
42
+ "think_token": "<|think|>"
43
+ },
44
+ "pad_token": "<pad>",
45
+ "padding_side": "left",
46
+ "processor_class": "Gemma4Processor",
47
+ "response_schema": {
48
+ "properties": {
49
+ "content": {
50
+ "type": "string"
51
+ },
52
+ "role": {
53
+ "const": "assistant"
54
+ },
55
+ "thinking": {
56
+ "type": "string"
57
+ },
58
+ "tool_calls": {
59
+ "items": {
60
+ "properties": {
61
+ "function": {
62
+ "properties": {
63
+ "arguments": {
64
+ "additionalProperties": {},
65
+ "type": "object",
66
+ "x-parser": "gemma4-tool-call"
67
+ },
68
+ "name": {
69
+ "type": "string"
70
+ }
71
+ },
72
+ "type": "object",
73
+ "x-regex": "call\\:(?P<name>\\w+)(?P<arguments>\\{.*\\})"
74
+ },
75
+ "type": {
76
+ "const": "function"
77
+ }
78
+ },
79
+ "type": "object"
80
+ },
81
+ "type": "array",
82
+ "x-regex-iterator": "<\\|tool_call>(.*?)<tool_call\\|>"
83
+ }
84
+ },
85
+ "type": "object",
86
+ "x-regex": "(\\<\\|channel\\>thought\\n(?P<thinking>.*?)\\<channel\\|\\>)?(?P<tool_calls>\\<\\|tool_call\\>.*\\<tool_call\\|\\>)?(?P<content>(?:(?!\\<turn\\|\\>)(?!\\<\\|tool_response\\>).)+)?(?:\\<turn\\|\\>|\\<\\|tool_response\\>)?"
87
+ },
88
+ "soc_token": "<|channel>",
89
+ "sot_token": "<|turn>",
90
+ "stc_token": "<|tool_call>",
91
+ "std_token": "<|tool>",
92
+ "str_token": "<|tool_response>",
93
+ "think_token": "<|think|>",
94
+ "tokenizer_class": "GemmaTokenizer",
95
+ "unk_token": "<unk>"
96
+ }