tomkay commited on
Commit
946ef4c
·
verified ·
1 Parent(s): 7872015

Reconvert with mlx_vlm: restore vision encoder weights

Browse files
config.json CHANGED
@@ -2788,14 +2788,30 @@
2788
  11,
2789
  10
2790
  ],
 
2791
  "rope_theta": 10000000,
2792
- "partial_rotary_factor": 0.25,
2793
- "type": "default"
2794
  }
2795
  },
2796
  "tie_word_embeddings": false,
2797
  "transformers_version": "4.57.0.dev0",
2798
  "video_token_id": 248057,
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
2799
  "vision_end_token_id": 248054,
2800
  "vision_start_token_id": 248053
2801
  }
 
2788
  11,
2789
  10
2790
  ],
2791
+ "rope_type": "default",
2792
  "rope_theta": 10000000,
2793
+ "partial_rotary_factor": 0.25
 
2794
  }
2795
  },
2796
  "tie_word_embeddings": false,
2797
  "transformers_version": "4.57.0.dev0",
2798
  "video_token_id": 248057,
2799
+ "vision_config": {
2800
+ "deepstack_visual_indexes": [],
2801
+ "depth": 27,
2802
+ "hidden_act": "gelu_pytorch_tanh",
2803
+ "hidden_size": 1152,
2804
+ "in_channels": 3,
2805
+ "initializer_range": 0.02,
2806
+ "intermediate_size": 4304,
2807
+ "model_type": "qwen3_5_moe",
2808
+ "num_heads": 16,
2809
+ "num_position_embeddings": 2304,
2810
+ "out_hidden_size": 2048,
2811
+ "patch_size": 16,
2812
+ "spatial_merge_size": 2,
2813
+ "temporal_patch_size": 2
2814
+ },
2815
  "vision_end_token_id": 248054,
2816
  "vision_start_token_id": 248053
2817
  }
model-00001-of-00005.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1fc2708b007a8fd67f19c6fbe79b542e637dccc89faf90db3db1e267e6fd9dee
3
- size 5368528684
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c778de5bf1869a92ccff795cd07a95fee0dec42f81fe4562332b25149f0423b7
3
+ size 5315352133
model-00002-of-00005.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:24e2477d9413011ba05d543eb0e26f944ed4320964e4e92e5c966456de693e32
3
- size 5253397965
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:22a511636af589803f42b4b0f7165fd53a12a315ef44058d08d1a092810fa552
3
+ size 5361264492
model-00003-of-00005.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6c070fe2305d3d324ffa5e05f6bdafdefeb23c064fd8e8482ad212bd5f1bbcea
3
- size 5362917750
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9311d31ebca816ef9a6c518d34fba8ce013fb1b970c19bf5b1542b11cc7fbf23
3
+ size 5366331917
model-00004-of-00005.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c9952b6dcae6b81aee57eb097689335b0e31a3b575e446d0915f4df4859d64ee
3
- size 5359430652
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:84c32daae851e44794b8895e08572ef9ae52d0a72d0965591934bda19556c4a3
3
+ size 5274616597
model-00005-of-00005.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8f096eff8ce23d8a5001870e1c1dd14876084793ae4ffb23a604acc659adb7fa
3
- size 3191377916
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:98e09fb84de86ba187cfe83992c76b698722684f54c24d5c85b7756d599ce0af
3
+ size 4111268018
model.safetensors.index.json CHANGED
@@ -1,7 +1,6 @@
1
  {
2
  "metadata": {
3
- "total_size": 24535462272,
4
- "total_parameters": 34660608768
5
  },
6
  "weight_map": {
7
  "language_model.lm_head.weight": "model-00005-of-00005.safetensors",
@@ -352,67 +351,67 @@
352
  "language_model.model.layers.17.linear_attn.out_proj.scales": "model-00002-of-00005.safetensors",
353
  "language_model.model.layers.17.linear_attn.out_proj.weight": "model-00002-of-00005.safetensors",
354
  "language_model.model.layers.17.mlp.gate.weight": "model-00002-of-00005.safetensors",
355
- "language_model.model.layers.17.mlp.shared_expert.down_proj.biases": "model-00002-of-00005.safetensors",
356
- "language_model.model.layers.17.mlp.shared_expert.down_proj.scales": "model-00002-of-00005.safetensors",
357
- "language_model.model.layers.17.mlp.shared_expert.down_proj.weight": "model-00002-of-00005.safetensors",
358
- "language_model.model.layers.17.mlp.shared_expert.gate_proj.biases": "model-00002-of-00005.safetensors",
359
- "language_model.model.layers.17.mlp.shared_expert.gate_proj.scales": "model-00002-of-00005.safetensors",
360
- "language_model.model.layers.17.mlp.shared_expert.gate_proj.weight": "model-00002-of-00005.safetensors",
361
- "language_model.model.layers.17.mlp.shared_expert.up_proj.biases": "model-00002-of-00005.safetensors",
362
- "language_model.model.layers.17.mlp.shared_expert.up_proj.scales": "model-00002-of-00005.safetensors",
363
- "language_model.model.layers.17.mlp.shared_expert.up_proj.weight": "model-00002-of-00005.safetensors",
364
- "language_model.model.layers.17.mlp.shared_expert_gate.weight": "model-00002-of-00005.safetensors",
365
- "language_model.model.layers.17.mlp.switch_mlp.down_proj.biases": "model-00002-of-00005.safetensors",
366
- "language_model.model.layers.17.mlp.switch_mlp.down_proj.scales": "model-00002-of-00005.safetensors",
367
- "language_model.model.layers.17.mlp.switch_mlp.down_proj.weight": "model-00002-of-00005.safetensors",
368
  "language_model.model.layers.17.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00005.safetensors",
369
  "language_model.model.layers.17.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00005.safetensors",
370
  "language_model.model.layers.17.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00005.safetensors",
371
- "language_model.model.layers.17.mlp.switch_mlp.up_proj.biases": "model-00002-of-00005.safetensors",
372
- "language_model.model.layers.17.mlp.switch_mlp.up_proj.scales": "model-00002-of-00005.safetensors",
373
  "language_model.model.layers.17.mlp.switch_mlp.up_proj.weight": "model-00002-of-00005.safetensors",
374
  "language_model.model.layers.17.post_attention_layernorm.weight": "model-00002-of-00005.safetensors",
375
- "language_model.model.layers.18.input_layernorm.weight": "model-00002-of-00005.safetensors",
376
- "language_model.model.layers.18.linear_attn.A_log": "model-00002-of-00005.safetensors",
377
- "language_model.model.layers.18.linear_attn.conv1d.weight": "model-00002-of-00005.safetensors",
378
- "language_model.model.layers.18.linear_attn.dt_bias": "model-00002-of-00005.safetensors",
379
- "language_model.model.layers.18.linear_attn.in_proj_a.biases": "model-00002-of-00005.safetensors",
380
- "language_model.model.layers.18.linear_attn.in_proj_a.scales": "model-00002-of-00005.safetensors",
381
- "language_model.model.layers.18.linear_attn.in_proj_a.weight": "model-00002-of-00005.safetensors",
382
- "language_model.model.layers.18.linear_attn.in_proj_b.weight": "model-00002-of-00005.safetensors",
383
- "language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model-00002-of-00005.safetensors",
384
- "language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model-00002-of-00005.safetensors",
385
- "language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model-00002-of-00005.safetensors",
386
- "language_model.model.layers.18.linear_attn.in_proj_z.biases": "model-00002-of-00005.safetensors",
387
- "language_model.model.layers.18.linear_attn.in_proj_z.scales": "model-00002-of-00005.safetensors",
388
- "language_model.model.layers.18.linear_attn.in_proj_z.weight": "model-00002-of-00005.safetensors",
389
- "language_model.model.layers.18.linear_attn.norm.weight": "model-00002-of-00005.safetensors",
390
- "language_model.model.layers.18.linear_attn.out_proj.biases": "model-00002-of-00005.safetensors",
391
- "language_model.model.layers.18.linear_attn.out_proj.scales": "model-00002-of-00005.safetensors",
392
- "language_model.model.layers.18.linear_attn.out_proj.weight": "model-00002-of-00005.safetensors",
393
- "language_model.model.layers.18.mlp.gate.weight": "model-00002-of-00005.safetensors",
394
- "language_model.model.layers.18.mlp.shared_expert.down_proj.biases": "model-00002-of-00005.safetensors",
395
- "language_model.model.layers.18.mlp.shared_expert.down_proj.scales": "model-00002-of-00005.safetensors",
396
- "language_model.model.layers.18.mlp.shared_expert.down_proj.weight": "model-00002-of-00005.safetensors",
397
- "language_model.model.layers.18.mlp.shared_expert.gate_proj.biases": "model-00002-of-00005.safetensors",
398
- "language_model.model.layers.18.mlp.shared_expert.gate_proj.scales": "model-00002-of-00005.safetensors",
399
- "language_model.model.layers.18.mlp.shared_expert.gate_proj.weight": "model-00002-of-00005.safetensors",
400
- "language_model.model.layers.18.mlp.shared_expert.up_proj.biases": "model-00002-of-00005.safetensors",
401
- "language_model.model.layers.18.mlp.shared_expert.up_proj.scales": "model-00002-of-00005.safetensors",
402
- "language_model.model.layers.18.mlp.shared_expert.up_proj.weight": "model-00002-of-00005.safetensors",
403
- "language_model.model.layers.18.mlp.shared_expert_gate.weight": "model-00002-of-00005.safetensors",
404
- "language_model.model.layers.18.mlp.switch_mlp.down_proj.biases": "model-00002-of-00005.safetensors",
405
- "language_model.model.layers.18.mlp.switch_mlp.down_proj.scales": "model-00002-of-00005.safetensors",
406
- "language_model.model.layers.18.mlp.switch_mlp.down_proj.weight": "model-00002-of-00005.safetensors",
407
- "language_model.model.layers.18.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00005.safetensors",
408
- "language_model.model.layers.18.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00005.safetensors",
409
- "language_model.model.layers.18.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00005.safetensors",
410
- "language_model.model.layers.18.mlp.switch_mlp.up_proj.biases": "model-00002-of-00005.safetensors",
411
- "language_model.model.layers.18.mlp.switch_mlp.up_proj.scales": "model-00002-of-00005.safetensors",
412
- "language_model.model.layers.18.mlp.switch_mlp.up_proj.weight": "model-00002-of-00005.safetensors",
413
- "language_model.model.layers.18.post_attention_layernorm.weight": "model-00002-of-00005.safetensors",
414
- "language_model.model.layers.19.input_layernorm.weight": "model-00002-of-00005.safetensors",
415
- "language_model.model.layers.19.mlp.gate.weight": "model-00002-of-00005.safetensors",
416
  "language_model.model.layers.19.mlp.shared_expert.down_proj.weight": "model-00003-of-00005.safetensors",
417
  "language_model.model.layers.19.mlp.shared_expert.gate_proj.weight": "model-00003-of-00005.safetensors",
418
  "language_model.model.layers.19.mlp.shared_expert.up_proj.weight": "model-00003-of-00005.safetensors",
@@ -426,15 +425,15 @@
426
  "language_model.model.layers.19.mlp.switch_mlp.up_proj.biases": "model-00003-of-00005.safetensors",
427
  "language_model.model.layers.19.mlp.switch_mlp.up_proj.scales": "model-00003-of-00005.safetensors",
428
  "language_model.model.layers.19.mlp.switch_mlp.up_proj.weight": "model-00003-of-00005.safetensors",
429
- "language_model.model.layers.19.post_attention_layernorm.weight": "model-00002-of-00005.safetensors",
430
- "language_model.model.layers.19.self_attn.k_norm.weight": "model-00002-of-00005.safetensors",
431
- "language_model.model.layers.19.self_attn.k_proj.weight": "model-00002-of-00005.safetensors",
432
- "language_model.model.layers.19.self_attn.o_proj.weight": "model-00002-of-00005.safetensors",
433
- "language_model.model.layers.19.self_attn.q_norm.weight": "model-00002-of-00005.safetensors",
434
- "language_model.model.layers.19.self_attn.q_proj.biases": "model-00002-of-00005.safetensors",
435
- "language_model.model.layers.19.self_attn.q_proj.scales": "model-00002-of-00005.safetensors",
436
- "language_model.model.layers.19.self_attn.q_proj.weight": "model-00002-of-00005.safetensors",
437
- "language_model.model.layers.19.self_attn.v_proj.weight": "model-00002-of-00005.safetensors",
438
  "language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00005.safetensors",
439
  "language_model.model.layers.2.linear_attn.A_log": "model-00001-of-00005.safetensors",
440
  "language_model.model.layers.2.linear_attn.conv1d.weight": "model-00001-of-00005.safetensors",
@@ -754,51 +753,51 @@
754
  "language_model.model.layers.26.mlp.switch_mlp.up_proj.scales": "model-00003-of-00005.safetensors",
755
  "language_model.model.layers.26.mlp.switch_mlp.up_proj.weight": "model-00003-of-00005.safetensors",
756
  "language_model.model.layers.26.post_attention_layernorm.weight": "model-00003-of-00005.safetensors",
757
- "language_model.model.layers.27.input_layernorm.weight": "model-00003-of-00005.safetensors",
758
- "language_model.model.layers.27.mlp.gate.weight": "model-00003-of-00005.safetensors",
759
- "language_model.model.layers.27.mlp.shared_expert.down_proj.weight": "model-00003-of-00005.safetensors",
760
- "language_model.model.layers.27.mlp.shared_expert.gate_proj.biases": "model-00003-of-00005.safetensors",
761
- "language_model.model.layers.27.mlp.shared_expert.gate_proj.scales": "model-00003-of-00005.safetensors",
762
- "language_model.model.layers.27.mlp.shared_expert.gate_proj.weight": "model-00003-of-00005.safetensors",
763
- "language_model.model.layers.27.mlp.shared_expert.up_proj.biases": "model-00003-of-00005.safetensors",
764
- "language_model.model.layers.27.mlp.shared_expert.up_proj.scales": "model-00003-of-00005.safetensors",
765
- "language_model.model.layers.27.mlp.shared_expert.up_proj.weight": "model-00003-of-00005.safetensors",
766
- "language_model.model.layers.27.mlp.shared_expert_gate.weight": "model-00003-of-00005.safetensors",
767
- "language_model.model.layers.27.mlp.switch_mlp.down_proj.biases": "model-00003-of-00005.safetensors",
768
- "language_model.model.layers.27.mlp.switch_mlp.down_proj.scales": "model-00003-of-00005.safetensors",
769
- "language_model.model.layers.27.mlp.switch_mlp.down_proj.weight": "model-00003-of-00005.safetensors",
770
- "language_model.model.layers.27.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00005.safetensors",
771
- "language_model.model.layers.27.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00005.safetensors",
772
- "language_model.model.layers.27.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00005.safetensors",
773
- "language_model.model.layers.27.mlp.switch_mlp.up_proj.biases": "model-00003-of-00005.safetensors",
774
- "language_model.model.layers.27.mlp.switch_mlp.up_proj.scales": "model-00003-of-00005.safetensors",
775
- "language_model.model.layers.27.mlp.switch_mlp.up_proj.weight": "model-00003-of-00005.safetensors",
776
- "language_model.model.layers.27.post_attention_layernorm.weight": "model-00003-of-00005.safetensors",
777
- "language_model.model.layers.27.self_attn.k_norm.weight": "model-00003-of-00005.safetensors",
778
- "language_model.model.layers.27.self_attn.k_proj.weight": "model-00003-of-00005.safetensors",
779
- "language_model.model.layers.27.self_attn.o_proj.weight": "model-00003-of-00005.safetensors",
780
- "language_model.model.layers.27.self_attn.q_norm.weight": "model-00003-of-00005.safetensors",
781
- "language_model.model.layers.27.self_attn.q_proj.weight": "model-00003-of-00005.safetensors",
782
- "language_model.model.layers.27.self_attn.v_proj.weight": "model-00003-of-00005.safetensors",
783
- "language_model.model.layers.28.input_layernorm.weight": "model-00003-of-00005.safetensors",
784
- "language_model.model.layers.28.linear_attn.A_log": "model-00003-of-00005.safetensors",
785
- "language_model.model.layers.28.linear_attn.conv1d.weight": "model-00003-of-00005.safetensors",
786
- "language_model.model.layers.28.linear_attn.dt_bias": "model-00003-of-00005.safetensors",
787
- "language_model.model.layers.28.linear_attn.in_proj_a.biases": "model-00003-of-00005.safetensors",
788
- "language_model.model.layers.28.linear_attn.in_proj_a.scales": "model-00003-of-00005.safetensors",
789
- "language_model.model.layers.28.linear_attn.in_proj_a.weight": "model-00003-of-00005.safetensors",
790
- "language_model.model.layers.28.linear_attn.in_proj_b.weight": "model-00003-of-00005.safetensors",
791
- "language_model.model.layers.28.linear_attn.in_proj_qkv.biases": "model-00003-of-00005.safetensors",
792
- "language_model.model.layers.28.linear_attn.in_proj_qkv.scales": "model-00003-of-00005.safetensors",
793
- "language_model.model.layers.28.linear_attn.in_proj_qkv.weight": "model-00003-of-00005.safetensors",
794
- "language_model.model.layers.28.linear_attn.in_proj_z.biases": "model-00003-of-00005.safetensors",
795
- "language_model.model.layers.28.linear_attn.in_proj_z.scales": "model-00003-of-00005.safetensors",
796
- "language_model.model.layers.28.linear_attn.in_proj_z.weight": "model-00003-of-00005.safetensors",
797
- "language_model.model.layers.28.linear_attn.norm.weight": "model-00003-of-00005.safetensors",
798
- "language_model.model.layers.28.linear_attn.out_proj.biases": "model-00003-of-00005.safetensors",
799
- "language_model.model.layers.28.linear_attn.out_proj.scales": "model-00003-of-00005.safetensors",
800
- "language_model.model.layers.28.linear_attn.out_proj.weight": "model-00003-of-00005.safetensors",
801
- "language_model.model.layers.28.mlp.gate.weight": "model-00003-of-00005.safetensors",
802
  "language_model.model.layers.28.mlp.shared_expert.down_proj.weight": "model-00004-of-00005.safetensors",
803
  "language_model.model.layers.28.mlp.shared_expert.gate_proj.biases": "model-00004-of-00005.safetensors",
804
  "language_model.model.layers.28.mlp.shared_expert.gate_proj.scales": "model-00004-of-00005.safetensors",
@@ -812,13 +811,13 @@
812
  "language_model.model.layers.28.mlp.switch_mlp.down_proj.biases": "model-00004-of-00005.safetensors",
813
  "language_model.model.layers.28.mlp.switch_mlp.down_proj.scales": "model-00004-of-00005.safetensors",
814
  "language_model.model.layers.28.mlp.switch_mlp.down_proj.weight": "model-00004-of-00005.safetensors",
815
- "language_model.model.layers.28.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00005.safetensors",
816
- "language_model.model.layers.28.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00005.safetensors",
817
- "language_model.model.layers.28.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00005.safetensors",
818
  "language_model.model.layers.28.mlp.switch_mlp.up_proj.biases": "model-00004-of-00005.safetensors",
819
  "language_model.model.layers.28.mlp.switch_mlp.up_proj.scales": "model-00004-of-00005.safetensors",
820
  "language_model.model.layers.28.mlp.switch_mlp.up_proj.weight": "model-00004-of-00005.safetensors",
821
- "language_model.model.layers.28.post_attention_layernorm.weight": "model-00003-of-00005.safetensors",
822
  "language_model.model.layers.29.input_layernorm.weight": "model-00004-of-00005.safetensors",
823
  "language_model.model.layers.29.linear_attn.A_log": "model-00004-of-00005.safetensors",
824
  "language_model.model.layers.29.linear_attn.conv1d.weight": "model-00004-of-00005.safetensors",
@@ -1046,15 +1045,15 @@
1046
  "language_model.model.layers.34.post_attention_layernorm.weight": "model-00004-of-00005.safetensors",
1047
  "language_model.model.layers.35.input_layernorm.weight": "model-00004-of-00005.safetensors",
1048
  "language_model.model.layers.35.mlp.gate.weight": "model-00004-of-00005.safetensors",
1049
- "language_model.model.layers.35.mlp.shared_expert.down_proj.weight": "model-00004-of-00005.safetensors",
1050
- "language_model.model.layers.35.mlp.shared_expert.gate_proj.weight": "model-00004-of-00005.safetensors",
1051
- "language_model.model.layers.35.mlp.shared_expert.up_proj.weight": "model-00004-of-00005.safetensors",
1052
- "language_model.model.layers.35.mlp.shared_expert_gate.biases": "model-00004-of-00005.safetensors",
1053
- "language_model.model.layers.35.mlp.shared_expert_gate.scales": "model-00004-of-00005.safetensors",
1054
- "language_model.model.layers.35.mlp.shared_expert_gate.weight": "model-00004-of-00005.safetensors",
1055
- "language_model.model.layers.35.mlp.switch_mlp.down_proj.biases": "model-00004-of-00005.safetensors",
1056
- "language_model.model.layers.35.mlp.switch_mlp.down_proj.scales": "model-00004-of-00005.safetensors",
1057
- "language_model.model.layers.35.mlp.switch_mlp.down_proj.weight": "model-00004-of-00005.safetensors",
1058
  "language_model.model.layers.35.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00005.safetensors",
1059
  "language_model.model.layers.35.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00005.safetensors",
1060
  "language_model.model.layers.35.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00005.safetensors",
@@ -1068,40 +1067,40 @@
1068
  "language_model.model.layers.35.self_attn.q_norm.weight": "model-00004-of-00005.safetensors",
1069
  "language_model.model.layers.35.self_attn.q_proj.weight": "model-00004-of-00005.safetensors",
1070
  "language_model.model.layers.35.self_attn.v_proj.weight": "model-00004-of-00005.safetensors",
1071
- "language_model.model.layers.36.input_layernorm.weight": "model-00004-of-00005.safetensors",
1072
- "language_model.model.layers.36.linear_attn.A_log": "model-00004-of-00005.safetensors",
1073
- "language_model.model.layers.36.linear_attn.conv1d.weight": "model-00004-of-00005.safetensors",
1074
- "language_model.model.layers.36.linear_attn.dt_bias": "model-00004-of-00005.safetensors",
1075
- "language_model.model.layers.36.linear_attn.in_proj_a.biases": "model-00004-of-00005.safetensors",
1076
- "language_model.model.layers.36.linear_attn.in_proj_a.scales": "model-00004-of-00005.safetensors",
1077
- "language_model.model.layers.36.linear_attn.in_proj_a.weight": "model-00004-of-00005.safetensors",
1078
- "language_model.model.layers.36.linear_attn.in_proj_b.biases": "model-00004-of-00005.safetensors",
1079
- "language_model.model.layers.36.linear_attn.in_proj_b.scales": "model-00004-of-00005.safetensors",
1080
- "language_model.model.layers.36.linear_attn.in_proj_b.weight": "model-00004-of-00005.safetensors",
1081
- "language_model.model.layers.36.linear_attn.in_proj_qkv.weight": "model-00004-of-00005.safetensors",
1082
- "language_model.model.layers.36.linear_attn.in_proj_z.weight": "model-00004-of-00005.safetensors",
1083
- "language_model.model.layers.36.linear_attn.norm.weight": "model-00004-of-00005.safetensors",
1084
- "language_model.model.layers.36.linear_attn.out_proj.weight": "model-00004-of-00005.safetensors",
1085
- "language_model.model.layers.36.mlp.gate.weight": "model-00004-of-00005.safetensors",
1086
- "language_model.model.layers.36.mlp.shared_expert.down_proj.weight": "model-00004-of-00005.safetensors",
1087
- "language_model.model.layers.36.mlp.shared_expert.gate_proj.weight": "model-00004-of-00005.safetensors",
1088
- "language_model.model.layers.36.mlp.shared_expert.up_proj.weight": "model-00004-of-00005.safetensors",
1089
- "language_model.model.layers.36.mlp.shared_expert_gate.biases": "model-00004-of-00005.safetensors",
1090
- "language_model.model.layers.36.mlp.shared_expert_gate.scales": "model-00004-of-00005.safetensors",
1091
- "language_model.model.layers.36.mlp.shared_expert_gate.weight": "model-00004-of-00005.safetensors",
1092
- "language_model.model.layers.36.mlp.switch_mlp.down_proj.biases": "model-00004-of-00005.safetensors",
1093
- "language_model.model.layers.36.mlp.switch_mlp.down_proj.scales": "model-00004-of-00005.safetensors",
1094
- "language_model.model.layers.36.mlp.switch_mlp.down_proj.weight": "model-00004-of-00005.safetensors",
1095
- "language_model.model.layers.36.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00005.safetensors",
1096
- "language_model.model.layers.36.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00005.safetensors",
1097
- "language_model.model.layers.36.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00005.safetensors",
1098
- "language_model.model.layers.36.mlp.switch_mlp.up_proj.biases": "model-00004-of-00005.safetensors",
1099
- "language_model.model.layers.36.mlp.switch_mlp.up_proj.scales": "model-00004-of-00005.safetensors",
1100
- "language_model.model.layers.36.mlp.switch_mlp.up_proj.weight": "model-00004-of-00005.safetensors",
1101
- "language_model.model.layers.36.post_attention_layernorm.weight": "model-00004-of-00005.safetensors",
1102
  "language_model.model.layers.37.input_layernorm.weight": "model-00005-of-00005.safetensors",
1103
  "language_model.model.layers.37.linear_attn.A_log": "model-00005-of-00005.safetensors",
1104
- "language_model.model.layers.37.linear_attn.conv1d.weight": "model-00004-of-00005.safetensors",
1105
  "language_model.model.layers.37.linear_attn.dt_bias": "model-00005-of-00005.safetensors",
1106
  "language_model.model.layers.37.linear_attn.in_proj_a.biases": "model-00005-of-00005.safetensors",
1107
  "language_model.model.layers.37.linear_attn.in_proj_a.scales": "model-00005-of-00005.safetensors",
@@ -1300,27 +1299,27 @@
1300
  "language_model.model.layers.6.post_attention_layernorm.weight": "model-00001-of-00005.safetensors",
1301
  "language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00005.safetensors",
1302
  "language_model.model.layers.7.mlp.gate.weight": "model-00001-of-00005.safetensors",
1303
- "language_model.model.layers.7.mlp.shared_expert.down_proj.biases": "model-00001-of-00005.safetensors",
1304
- "language_model.model.layers.7.mlp.shared_expert.down_proj.scales": "model-00001-of-00005.safetensors",
1305
- "language_model.model.layers.7.mlp.shared_expert.down_proj.weight": "model-00001-of-00005.safetensors",
1306
- "language_model.model.layers.7.mlp.shared_expert.gate_proj.biases": "model-00001-of-00005.safetensors",
1307
- "language_model.model.layers.7.mlp.shared_expert.gate_proj.scales": "model-00001-of-00005.safetensors",
1308
- "language_model.model.layers.7.mlp.shared_expert.gate_proj.weight": "model-00001-of-00005.safetensors",
1309
- "language_model.model.layers.7.mlp.shared_expert.up_proj.biases": "model-00001-of-00005.safetensors",
1310
- "language_model.model.layers.7.mlp.shared_expert.up_proj.scales": "model-00001-of-00005.safetensors",
1311
- "language_model.model.layers.7.mlp.shared_expert.up_proj.weight": "model-00001-of-00005.safetensors",
1312
- "language_model.model.layers.7.mlp.shared_expert_gate.biases": "model-00001-of-00005.safetensors",
1313
- "language_model.model.layers.7.mlp.shared_expert_gate.scales": "model-00001-of-00005.safetensors",
1314
- "language_model.model.layers.7.mlp.shared_expert_gate.weight": "model-00001-of-00005.safetensors",
1315
- "language_model.model.layers.7.mlp.switch_mlp.down_proj.biases": "model-00001-of-00005.safetensors",
1316
- "language_model.model.layers.7.mlp.switch_mlp.down_proj.scales": "model-00001-of-00005.safetensors",
1317
- "language_model.model.layers.7.mlp.switch_mlp.down_proj.weight": "model-00001-of-00005.safetensors",
1318
- "language_model.model.layers.7.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00005.safetensors",
1319
- "language_model.model.layers.7.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00005.safetensors",
1320
- "language_model.model.layers.7.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00005.safetensors",
1321
- "language_model.model.layers.7.mlp.switch_mlp.up_proj.biases": "model-00001-of-00005.safetensors",
1322
- "language_model.model.layers.7.mlp.switch_mlp.up_proj.scales": "model-00001-of-00005.safetensors",
1323
- "language_model.model.layers.7.mlp.switch_mlp.up_proj.weight": "model-00001-of-00005.safetensors",
1324
  "language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00005.safetensors",
1325
  "language_model.model.layers.7.self_attn.k_norm.weight": "model-00001-of-00005.safetensors",
1326
  "language_model.model.layers.7.self_attn.k_proj.weight": "model-00001-of-00005.safetensors",
@@ -1330,23 +1329,23 @@
1330
  "language_model.model.layers.7.self_attn.q_proj.scales": "model-00001-of-00005.safetensors",
1331
  "language_model.model.layers.7.self_attn.q_proj.weight": "model-00001-of-00005.safetensors",
1332
  "language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00005.safetensors",
1333
- "language_model.model.layers.8.input_layernorm.weight": "model-00001-of-00005.safetensors",
1334
- "language_model.model.layers.8.linear_attn.A_log": "model-00001-of-00005.safetensors",
1335
- "language_model.model.layers.8.linear_attn.conv1d.weight": "model-00001-of-00005.safetensors",
1336
- "language_model.model.layers.8.linear_attn.dt_bias": "model-00001-of-00005.safetensors",
1337
- "language_model.model.layers.8.linear_attn.in_proj_a.weight": "model-00001-of-00005.safetensors",
1338
- "language_model.model.layers.8.linear_attn.in_proj_b.weight": "model-00001-of-00005.safetensors",
1339
- "language_model.model.layers.8.linear_attn.in_proj_qkv.biases": "model-00001-of-00005.safetensors",
1340
- "language_model.model.layers.8.linear_attn.in_proj_qkv.scales": "model-00001-of-00005.safetensors",
1341
- "language_model.model.layers.8.linear_attn.in_proj_qkv.weight": "model-00001-of-00005.safetensors",
1342
- "language_model.model.layers.8.linear_attn.in_proj_z.biases": "model-00001-of-00005.safetensors",
1343
- "language_model.model.layers.8.linear_attn.in_proj_z.scales": "model-00001-of-00005.safetensors",
1344
- "language_model.model.layers.8.linear_attn.in_proj_z.weight": "model-00001-of-00005.safetensors",
1345
- "language_model.model.layers.8.linear_attn.norm.weight": "model-00001-of-00005.safetensors",
1346
- "language_model.model.layers.8.linear_attn.out_proj.biases": "model-00001-of-00005.safetensors",
1347
- "language_model.model.layers.8.linear_attn.out_proj.scales": "model-00001-of-00005.safetensors",
1348
- "language_model.model.layers.8.linear_attn.out_proj.weight": "model-00001-of-00005.safetensors",
1349
- "language_model.model.layers.8.mlp.gate.weight": "model-00001-of-00005.safetensors",
1350
  "language_model.model.layers.8.mlp.shared_expert.down_proj.biases": "model-00002-of-00005.safetensors",
1351
  "language_model.model.layers.8.mlp.shared_expert.down_proj.scales": "model-00002-of-00005.safetensors",
1352
  "language_model.model.layers.8.mlp.shared_expert.down_proj.weight": "model-00002-of-00005.safetensors",
@@ -1359,16 +1358,16 @@
1359
  "language_model.model.layers.8.mlp.shared_expert_gate.biases": "model-00002-of-00005.safetensors",
1360
  "language_model.model.layers.8.mlp.shared_expert_gate.scales": "model-00002-of-00005.safetensors",
1361
  "language_model.model.layers.8.mlp.shared_expert_gate.weight": "model-00002-of-00005.safetensors",
1362
- "language_model.model.layers.8.mlp.switch_mlp.down_proj.biases": "model-00001-of-00005.safetensors",
1363
- "language_model.model.layers.8.mlp.switch_mlp.down_proj.scales": "model-00001-of-00005.safetensors",
1364
- "language_model.model.layers.8.mlp.switch_mlp.down_proj.weight": "model-00001-of-00005.safetensors",
1365
- "language_model.model.layers.8.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00005.safetensors",
1366
- "language_model.model.layers.8.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00005.safetensors",
1367
- "language_model.model.layers.8.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00005.safetensors",
1368
- "language_model.model.layers.8.mlp.switch_mlp.up_proj.biases": "model-00001-of-00005.safetensors",
1369
- "language_model.model.layers.8.mlp.switch_mlp.up_proj.scales": "model-00001-of-00005.safetensors",
1370
- "language_model.model.layers.8.mlp.switch_mlp.up_proj.weight": "model-00001-of-00005.safetensors",
1371
- "language_model.model.layers.8.post_attention_layernorm.weight": "model-00001-of-00005.safetensors",
1372
  "language_model.model.layers.9.input_layernorm.weight": "model-00002-of-00005.safetensors",
1373
  "language_model.model.layers.9.linear_attn.A_log": "model-00002-of-00005.safetensors",
1374
  "language_model.model.layers.9.linear_attn.conv1d.weight": "model-00002-of-00005.safetensors",
@@ -1408,6 +1407,339 @@
1408
  "language_model.model.layers.9.mlp.switch_mlp.up_proj.scales": "model-00002-of-00005.safetensors",
1409
  "language_model.model.layers.9.mlp.switch_mlp.up_proj.weight": "model-00002-of-00005.safetensors",
1410
  "language_model.model.layers.9.post_attention_layernorm.weight": "model-00002-of-00005.safetensors",
1411
- "language_model.model.norm.weight": "model-00005-of-00005.safetensors"
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1412
  }
1413
  }
 
1
  {
2
  "metadata": {
3
+ "total_size": 25428604768
 
4
  },
5
  "weight_map": {
6
  "language_model.lm_head.weight": "model-00005-of-00005.safetensors",
 
351
  "language_model.model.layers.17.linear_attn.out_proj.scales": "model-00002-of-00005.safetensors",
352
  "language_model.model.layers.17.linear_attn.out_proj.weight": "model-00002-of-00005.safetensors",
353
  "language_model.model.layers.17.mlp.gate.weight": "model-00002-of-00005.safetensors",
354
+ "language_model.model.layers.17.mlp.shared_expert.down_proj.biases": "model-00003-of-00005.safetensors",
355
+ "language_model.model.layers.17.mlp.shared_expert.down_proj.scales": "model-00003-of-00005.safetensors",
356
+ "language_model.model.layers.17.mlp.shared_expert.down_proj.weight": "model-00003-of-00005.safetensors",
357
+ "language_model.model.layers.17.mlp.shared_expert.gate_proj.biases": "model-00003-of-00005.safetensors",
358
+ "language_model.model.layers.17.mlp.shared_expert.gate_proj.scales": "model-00003-of-00005.safetensors",
359
+ "language_model.model.layers.17.mlp.shared_expert.gate_proj.weight": "model-00003-of-00005.safetensors",
360
+ "language_model.model.layers.17.mlp.shared_expert.up_proj.biases": "model-00003-of-00005.safetensors",
361
+ "language_model.model.layers.17.mlp.shared_expert.up_proj.scales": "model-00003-of-00005.safetensors",
362
+ "language_model.model.layers.17.mlp.shared_expert.up_proj.weight": "model-00003-of-00005.safetensors",
363
+ "language_model.model.layers.17.mlp.shared_expert_gate.weight": "model-00003-of-00005.safetensors",
364
+ "language_model.model.layers.17.mlp.switch_mlp.down_proj.biases": "model-00003-of-00005.safetensors",
365
+ "language_model.model.layers.17.mlp.switch_mlp.down_proj.scales": "model-00003-of-00005.safetensors",
366
+ "language_model.model.layers.17.mlp.switch_mlp.down_proj.weight": "model-00003-of-00005.safetensors",
367
  "language_model.model.layers.17.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00005.safetensors",
368
  "language_model.model.layers.17.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00005.safetensors",
369
  "language_model.model.layers.17.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00005.safetensors",
370
+ "language_model.model.layers.17.mlp.switch_mlp.up_proj.biases": "model-00003-of-00005.safetensors",
371
+ "language_model.model.layers.17.mlp.switch_mlp.up_proj.scales": "model-00003-of-00005.safetensors",
372
  "language_model.model.layers.17.mlp.switch_mlp.up_proj.weight": "model-00002-of-00005.safetensors",
373
  "language_model.model.layers.17.post_attention_layernorm.weight": "model-00002-of-00005.safetensors",
374
+ "language_model.model.layers.18.input_layernorm.weight": "model-00003-of-00005.safetensors",
375
+ "language_model.model.layers.18.linear_attn.A_log": "model-00003-of-00005.safetensors",
376
+ "language_model.model.layers.18.linear_attn.conv1d.weight": "model-00003-of-00005.safetensors",
377
+ "language_model.model.layers.18.linear_attn.dt_bias": "model-00003-of-00005.safetensors",
378
+ "language_model.model.layers.18.linear_attn.in_proj_a.biases": "model-00003-of-00005.safetensors",
379
+ "language_model.model.layers.18.linear_attn.in_proj_a.scales": "model-00003-of-00005.safetensors",
380
+ "language_model.model.layers.18.linear_attn.in_proj_a.weight": "model-00003-of-00005.safetensors",
381
+ "language_model.model.layers.18.linear_attn.in_proj_b.weight": "model-00003-of-00005.safetensors",
382
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model-00003-of-00005.safetensors",
383
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model-00003-of-00005.safetensors",
384
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model-00003-of-00005.safetensors",
385
+ "language_model.model.layers.18.linear_attn.in_proj_z.biases": "model-00003-of-00005.safetensors",
386
+ "language_model.model.layers.18.linear_attn.in_proj_z.scales": "model-00003-of-00005.safetensors",
387
+ "language_model.model.layers.18.linear_attn.in_proj_z.weight": "model-00003-of-00005.safetensors",
388
+ "language_model.model.layers.18.linear_attn.norm.weight": "model-00003-of-00005.safetensors",
389
+ "language_model.model.layers.18.linear_attn.out_proj.biases": "model-00003-of-00005.safetensors",
390
+ "language_model.model.layers.18.linear_attn.out_proj.scales": "model-00003-of-00005.safetensors",
391
+ "language_model.model.layers.18.linear_attn.out_proj.weight": "model-00003-of-00005.safetensors",
392
+ "language_model.model.layers.18.mlp.gate.weight": "model-00003-of-00005.safetensors",
393
+ "language_model.model.layers.18.mlp.shared_expert.down_proj.biases": "model-00003-of-00005.safetensors",
394
+ "language_model.model.layers.18.mlp.shared_expert.down_proj.scales": "model-00003-of-00005.safetensors",
395
+ "language_model.model.layers.18.mlp.shared_expert.down_proj.weight": "model-00003-of-00005.safetensors",
396
+ "language_model.model.layers.18.mlp.shared_expert.gate_proj.biases": "model-00003-of-00005.safetensors",
397
+ "language_model.model.layers.18.mlp.shared_expert.gate_proj.scales": "model-00003-of-00005.safetensors",
398
+ "language_model.model.layers.18.mlp.shared_expert.gate_proj.weight": "model-00003-of-00005.safetensors",
399
+ "language_model.model.layers.18.mlp.shared_expert.up_proj.biases": "model-00003-of-00005.safetensors",
400
+ "language_model.model.layers.18.mlp.shared_expert.up_proj.scales": "model-00003-of-00005.safetensors",
401
+ "language_model.model.layers.18.mlp.shared_expert.up_proj.weight": "model-00003-of-00005.safetensors",
402
+ "language_model.model.layers.18.mlp.shared_expert_gate.weight": "model-00003-of-00005.safetensors",
403
+ "language_model.model.layers.18.mlp.switch_mlp.down_proj.biases": "model-00003-of-00005.safetensors",
404
+ "language_model.model.layers.18.mlp.switch_mlp.down_proj.scales": "model-00003-of-00005.safetensors",
405
+ "language_model.model.layers.18.mlp.switch_mlp.down_proj.weight": "model-00003-of-00005.safetensors",
406
+ "language_model.model.layers.18.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00005.safetensors",
407
+ "language_model.model.layers.18.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00005.safetensors",
408
+ "language_model.model.layers.18.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00005.safetensors",
409
+ "language_model.model.layers.18.mlp.switch_mlp.up_proj.biases": "model-00003-of-00005.safetensors",
410
+ "language_model.model.layers.18.mlp.switch_mlp.up_proj.scales": "model-00003-of-00005.safetensors",
411
+ "language_model.model.layers.18.mlp.switch_mlp.up_proj.weight": "model-00003-of-00005.safetensors",
412
+ "language_model.model.layers.18.post_attention_layernorm.weight": "model-00003-of-00005.safetensors",
413
+ "language_model.model.layers.19.input_layernorm.weight": "model-00003-of-00005.safetensors",
414
+ "language_model.model.layers.19.mlp.gate.weight": "model-00003-of-00005.safetensors",
415
  "language_model.model.layers.19.mlp.shared_expert.down_proj.weight": "model-00003-of-00005.safetensors",
416
  "language_model.model.layers.19.mlp.shared_expert.gate_proj.weight": "model-00003-of-00005.safetensors",
417
  "language_model.model.layers.19.mlp.shared_expert.up_proj.weight": "model-00003-of-00005.safetensors",
 
425
  "language_model.model.layers.19.mlp.switch_mlp.up_proj.biases": "model-00003-of-00005.safetensors",
426
  "language_model.model.layers.19.mlp.switch_mlp.up_proj.scales": "model-00003-of-00005.safetensors",
427
  "language_model.model.layers.19.mlp.switch_mlp.up_proj.weight": "model-00003-of-00005.safetensors",
428
+ "language_model.model.layers.19.post_attention_layernorm.weight": "model-00003-of-00005.safetensors",
429
+ "language_model.model.layers.19.self_attn.k_norm.weight": "model-00003-of-00005.safetensors",
430
+ "language_model.model.layers.19.self_attn.k_proj.weight": "model-00003-of-00005.safetensors",
431
+ "language_model.model.layers.19.self_attn.o_proj.weight": "model-00003-of-00005.safetensors",
432
+ "language_model.model.layers.19.self_attn.q_norm.weight": "model-00003-of-00005.safetensors",
433
+ "language_model.model.layers.19.self_attn.q_proj.biases": "model-00003-of-00005.safetensors",
434
+ "language_model.model.layers.19.self_attn.q_proj.scales": "model-00003-of-00005.safetensors",
435
+ "language_model.model.layers.19.self_attn.q_proj.weight": "model-00003-of-00005.safetensors",
436
+ "language_model.model.layers.19.self_attn.v_proj.weight": "model-00003-of-00005.safetensors",
437
  "language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00005.safetensors",
438
  "language_model.model.layers.2.linear_attn.A_log": "model-00001-of-00005.safetensors",
439
  "language_model.model.layers.2.linear_attn.conv1d.weight": "model-00001-of-00005.safetensors",
 
753
  "language_model.model.layers.26.mlp.switch_mlp.up_proj.scales": "model-00003-of-00005.safetensors",
754
  "language_model.model.layers.26.mlp.switch_mlp.up_proj.weight": "model-00003-of-00005.safetensors",
755
  "language_model.model.layers.26.post_attention_layernorm.weight": "model-00003-of-00005.safetensors",
756
+ "language_model.model.layers.27.input_layernorm.weight": "model-00004-of-00005.safetensors",
757
+ "language_model.model.layers.27.mlp.gate.weight": "model-00004-of-00005.safetensors",
758
+ "language_model.model.layers.27.mlp.shared_expert.down_proj.weight": "model-00004-of-00005.safetensors",
759
+ "language_model.model.layers.27.mlp.shared_expert.gate_proj.biases": "model-00004-of-00005.safetensors",
760
+ "language_model.model.layers.27.mlp.shared_expert.gate_proj.scales": "model-00004-of-00005.safetensors",
761
+ "language_model.model.layers.27.mlp.shared_expert.gate_proj.weight": "model-00004-of-00005.safetensors",
762
+ "language_model.model.layers.27.mlp.shared_expert.up_proj.biases": "model-00004-of-00005.safetensors",
763
+ "language_model.model.layers.27.mlp.shared_expert.up_proj.scales": "model-00004-of-00005.safetensors",
764
+ "language_model.model.layers.27.mlp.shared_expert.up_proj.weight": "model-00004-of-00005.safetensors",
765
+ "language_model.model.layers.27.mlp.shared_expert_gate.weight": "model-00004-of-00005.safetensors",
766
+ "language_model.model.layers.27.mlp.switch_mlp.down_proj.biases": "model-00004-of-00005.safetensors",
767
+ "language_model.model.layers.27.mlp.switch_mlp.down_proj.scales": "model-00004-of-00005.safetensors",
768
+ "language_model.model.layers.27.mlp.switch_mlp.down_proj.weight": "model-00004-of-00005.safetensors",
769
+ "language_model.model.layers.27.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00005.safetensors",
770
+ "language_model.model.layers.27.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00005.safetensors",
771
+ "language_model.model.layers.27.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00005.safetensors",
772
+ "language_model.model.layers.27.mlp.switch_mlp.up_proj.biases": "model-00004-of-00005.safetensors",
773
+ "language_model.model.layers.27.mlp.switch_mlp.up_proj.scales": "model-00004-of-00005.safetensors",
774
+ "language_model.model.layers.27.mlp.switch_mlp.up_proj.weight": "model-00004-of-00005.safetensors",
775
+ "language_model.model.layers.27.post_attention_layernorm.weight": "model-00004-of-00005.safetensors",
776
+ "language_model.model.layers.27.self_attn.k_norm.weight": "model-00004-of-00005.safetensors",
777
+ "language_model.model.layers.27.self_attn.k_proj.weight": "model-00004-of-00005.safetensors",
778
+ "language_model.model.layers.27.self_attn.o_proj.weight": "model-00004-of-00005.safetensors",
779
+ "language_model.model.layers.27.self_attn.q_norm.weight": "model-00004-of-00005.safetensors",
780
+ "language_model.model.layers.27.self_attn.q_proj.weight": "model-00004-of-00005.safetensors",
781
+ "language_model.model.layers.27.self_attn.v_proj.weight": "model-00004-of-00005.safetensors",
782
+ "language_model.model.layers.28.input_layernorm.weight": "model-00004-of-00005.safetensors",
783
+ "language_model.model.layers.28.linear_attn.A_log": "model-00004-of-00005.safetensors",
784
+ "language_model.model.layers.28.linear_attn.conv1d.weight": "model-00004-of-00005.safetensors",
785
+ "language_model.model.layers.28.linear_attn.dt_bias": "model-00004-of-00005.safetensors",
786
+ "language_model.model.layers.28.linear_attn.in_proj_a.biases": "model-00004-of-00005.safetensors",
787
+ "language_model.model.layers.28.linear_attn.in_proj_a.scales": "model-00004-of-00005.safetensors",
788
+ "language_model.model.layers.28.linear_attn.in_proj_a.weight": "model-00004-of-00005.safetensors",
789
+ "language_model.model.layers.28.linear_attn.in_proj_b.weight": "model-00004-of-00005.safetensors",
790
+ "language_model.model.layers.28.linear_attn.in_proj_qkv.biases": "model-00004-of-00005.safetensors",
791
+ "language_model.model.layers.28.linear_attn.in_proj_qkv.scales": "model-00004-of-00005.safetensors",
792
+ "language_model.model.layers.28.linear_attn.in_proj_qkv.weight": "model-00004-of-00005.safetensors",
793
+ "language_model.model.layers.28.linear_attn.in_proj_z.biases": "model-00004-of-00005.safetensors",
794
+ "language_model.model.layers.28.linear_attn.in_proj_z.scales": "model-00004-of-00005.safetensors",
795
+ "language_model.model.layers.28.linear_attn.in_proj_z.weight": "model-00004-of-00005.safetensors",
796
+ "language_model.model.layers.28.linear_attn.norm.weight": "model-00004-of-00005.safetensors",
797
+ "language_model.model.layers.28.linear_attn.out_proj.biases": "model-00004-of-00005.safetensors",
798
+ "language_model.model.layers.28.linear_attn.out_proj.scales": "model-00004-of-00005.safetensors",
799
+ "language_model.model.layers.28.linear_attn.out_proj.weight": "model-00004-of-00005.safetensors",
800
+ "language_model.model.layers.28.mlp.gate.weight": "model-00004-of-00005.safetensors",
801
  "language_model.model.layers.28.mlp.shared_expert.down_proj.weight": "model-00004-of-00005.safetensors",
802
  "language_model.model.layers.28.mlp.shared_expert.gate_proj.biases": "model-00004-of-00005.safetensors",
803
  "language_model.model.layers.28.mlp.shared_expert.gate_proj.scales": "model-00004-of-00005.safetensors",
 
811
  "language_model.model.layers.28.mlp.switch_mlp.down_proj.biases": "model-00004-of-00005.safetensors",
812
  "language_model.model.layers.28.mlp.switch_mlp.down_proj.scales": "model-00004-of-00005.safetensors",
813
  "language_model.model.layers.28.mlp.switch_mlp.down_proj.weight": "model-00004-of-00005.safetensors",
814
+ "language_model.model.layers.28.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00005.safetensors",
815
+ "language_model.model.layers.28.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00005.safetensors",
816
+ "language_model.model.layers.28.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00005.safetensors",
817
  "language_model.model.layers.28.mlp.switch_mlp.up_proj.biases": "model-00004-of-00005.safetensors",
818
  "language_model.model.layers.28.mlp.switch_mlp.up_proj.scales": "model-00004-of-00005.safetensors",
819
  "language_model.model.layers.28.mlp.switch_mlp.up_proj.weight": "model-00004-of-00005.safetensors",
820
+ "language_model.model.layers.28.post_attention_layernorm.weight": "model-00004-of-00005.safetensors",
821
  "language_model.model.layers.29.input_layernorm.weight": "model-00004-of-00005.safetensors",
822
  "language_model.model.layers.29.linear_attn.A_log": "model-00004-of-00005.safetensors",
823
  "language_model.model.layers.29.linear_attn.conv1d.weight": "model-00004-of-00005.safetensors",
 
1045
  "language_model.model.layers.34.post_attention_layernorm.weight": "model-00004-of-00005.safetensors",
1046
  "language_model.model.layers.35.input_layernorm.weight": "model-00004-of-00005.safetensors",
1047
  "language_model.model.layers.35.mlp.gate.weight": "model-00004-of-00005.safetensors",
1048
+ "language_model.model.layers.35.mlp.shared_expert.down_proj.weight": "model-00005-of-00005.safetensors",
1049
+ "language_model.model.layers.35.mlp.shared_expert.gate_proj.weight": "model-00005-of-00005.safetensors",
1050
+ "language_model.model.layers.35.mlp.shared_expert.up_proj.weight": "model-00005-of-00005.safetensors",
1051
+ "language_model.model.layers.35.mlp.shared_expert_gate.biases": "model-00005-of-00005.safetensors",
1052
+ "language_model.model.layers.35.mlp.shared_expert_gate.scales": "model-00005-of-00005.safetensors",
1053
+ "language_model.model.layers.35.mlp.shared_expert_gate.weight": "model-00005-of-00005.safetensors",
1054
+ "language_model.model.layers.35.mlp.switch_mlp.down_proj.biases": "model-00005-of-00005.safetensors",
1055
+ "language_model.model.layers.35.mlp.switch_mlp.down_proj.scales": "model-00005-of-00005.safetensors",
1056
+ "language_model.model.layers.35.mlp.switch_mlp.down_proj.weight": "model-00005-of-00005.safetensors",
1057
  "language_model.model.layers.35.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00005.safetensors",
1058
  "language_model.model.layers.35.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00005.safetensors",
1059
  "language_model.model.layers.35.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00005.safetensors",
 
1067
  "language_model.model.layers.35.self_attn.q_norm.weight": "model-00004-of-00005.safetensors",
1068
  "language_model.model.layers.35.self_attn.q_proj.weight": "model-00004-of-00005.safetensors",
1069
  "language_model.model.layers.35.self_attn.v_proj.weight": "model-00004-of-00005.safetensors",
1070
+ "language_model.model.layers.36.input_layernorm.weight": "model-00005-of-00005.safetensors",
1071
+ "language_model.model.layers.36.linear_attn.A_log": "model-00005-of-00005.safetensors",
1072
+ "language_model.model.layers.36.linear_attn.conv1d.weight": "model-00005-of-00005.safetensors",
1073
+ "language_model.model.layers.36.linear_attn.dt_bias": "model-00005-of-00005.safetensors",
1074
+ "language_model.model.layers.36.linear_attn.in_proj_a.biases": "model-00005-of-00005.safetensors",
1075
+ "language_model.model.layers.36.linear_attn.in_proj_a.scales": "model-00005-of-00005.safetensors",
1076
+ "language_model.model.layers.36.linear_attn.in_proj_a.weight": "model-00005-of-00005.safetensors",
1077
+ "language_model.model.layers.36.linear_attn.in_proj_b.biases": "model-00005-of-00005.safetensors",
1078
+ "language_model.model.layers.36.linear_attn.in_proj_b.scales": "model-00005-of-00005.safetensors",
1079
+ "language_model.model.layers.36.linear_attn.in_proj_b.weight": "model-00005-of-00005.safetensors",
1080
+ "language_model.model.layers.36.linear_attn.in_proj_qkv.weight": "model-00005-of-00005.safetensors",
1081
+ "language_model.model.layers.36.linear_attn.in_proj_z.weight": "model-00005-of-00005.safetensors",
1082
+ "language_model.model.layers.36.linear_attn.norm.weight": "model-00005-of-00005.safetensors",
1083
+ "language_model.model.layers.36.linear_attn.out_proj.weight": "model-00005-of-00005.safetensors",
1084
+ "language_model.model.layers.36.mlp.gate.weight": "model-00005-of-00005.safetensors",
1085
+ "language_model.model.layers.36.mlp.shared_expert.down_proj.weight": "model-00005-of-00005.safetensors",
1086
+ "language_model.model.layers.36.mlp.shared_expert.gate_proj.weight": "model-00005-of-00005.safetensors",
1087
+ "language_model.model.layers.36.mlp.shared_expert.up_proj.weight": "model-00005-of-00005.safetensors",
1088
+ "language_model.model.layers.36.mlp.shared_expert_gate.biases": "model-00005-of-00005.safetensors",
1089
+ "language_model.model.layers.36.mlp.shared_expert_gate.scales": "model-00005-of-00005.safetensors",
1090
+ "language_model.model.layers.36.mlp.shared_expert_gate.weight": "model-00005-of-00005.safetensors",
1091
+ "language_model.model.layers.36.mlp.switch_mlp.down_proj.biases": "model-00005-of-00005.safetensors",
1092
+ "language_model.model.layers.36.mlp.switch_mlp.down_proj.scales": "model-00005-of-00005.safetensors",
1093
+ "language_model.model.layers.36.mlp.switch_mlp.down_proj.weight": "model-00005-of-00005.safetensors",
1094
+ "language_model.model.layers.36.mlp.switch_mlp.gate_proj.biases": "model-00005-of-00005.safetensors",
1095
+ "language_model.model.layers.36.mlp.switch_mlp.gate_proj.scales": "model-00005-of-00005.safetensors",
1096
+ "language_model.model.layers.36.mlp.switch_mlp.gate_proj.weight": "model-00005-of-00005.safetensors",
1097
+ "language_model.model.layers.36.mlp.switch_mlp.up_proj.biases": "model-00005-of-00005.safetensors",
1098
+ "language_model.model.layers.36.mlp.switch_mlp.up_proj.scales": "model-00005-of-00005.safetensors",
1099
+ "language_model.model.layers.36.mlp.switch_mlp.up_proj.weight": "model-00005-of-00005.safetensors",
1100
+ "language_model.model.layers.36.post_attention_layernorm.weight": "model-00005-of-00005.safetensors",
1101
  "language_model.model.layers.37.input_layernorm.weight": "model-00005-of-00005.safetensors",
1102
  "language_model.model.layers.37.linear_attn.A_log": "model-00005-of-00005.safetensors",
1103
+ "language_model.model.layers.37.linear_attn.conv1d.weight": "model-00005-of-00005.safetensors",
1104
  "language_model.model.layers.37.linear_attn.dt_bias": "model-00005-of-00005.safetensors",
1105
  "language_model.model.layers.37.linear_attn.in_proj_a.biases": "model-00005-of-00005.safetensors",
1106
  "language_model.model.layers.37.linear_attn.in_proj_a.scales": "model-00005-of-00005.safetensors",
 
1299
  "language_model.model.layers.6.post_attention_layernorm.weight": "model-00001-of-00005.safetensors",
1300
  "language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00005.safetensors",
1301
  "language_model.model.layers.7.mlp.gate.weight": "model-00001-of-00005.safetensors",
1302
+ "language_model.model.layers.7.mlp.shared_expert.down_proj.biases": "model-00002-of-00005.safetensors",
1303
+ "language_model.model.layers.7.mlp.shared_expert.down_proj.scales": "model-00002-of-00005.safetensors",
1304
+ "language_model.model.layers.7.mlp.shared_expert.down_proj.weight": "model-00002-of-00005.safetensors",
1305
+ "language_model.model.layers.7.mlp.shared_expert.gate_proj.biases": "model-00002-of-00005.safetensors",
1306
+ "language_model.model.layers.7.mlp.shared_expert.gate_proj.scales": "model-00002-of-00005.safetensors",
1307
+ "language_model.model.layers.7.mlp.shared_expert.gate_proj.weight": "model-00002-of-00005.safetensors",
1308
+ "language_model.model.layers.7.mlp.shared_expert.up_proj.biases": "model-00002-of-00005.safetensors",
1309
+ "language_model.model.layers.7.mlp.shared_expert.up_proj.scales": "model-00002-of-00005.safetensors",
1310
+ "language_model.model.layers.7.mlp.shared_expert.up_proj.weight": "model-00002-of-00005.safetensors",
1311
+ "language_model.model.layers.7.mlp.shared_expert_gate.biases": "model-00002-of-00005.safetensors",
1312
+ "language_model.model.layers.7.mlp.shared_expert_gate.scales": "model-00002-of-00005.safetensors",
1313
+ "language_model.model.layers.7.mlp.shared_expert_gate.weight": "model-00002-of-00005.safetensors",
1314
+ "language_model.model.layers.7.mlp.switch_mlp.down_proj.biases": "model-00002-of-00005.safetensors",
1315
+ "language_model.model.layers.7.mlp.switch_mlp.down_proj.scales": "model-00002-of-00005.safetensors",
1316
+ "language_model.model.layers.7.mlp.switch_mlp.down_proj.weight": "model-00002-of-00005.safetensors",
1317
+ "language_model.model.layers.7.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00005.safetensors",
1318
+ "language_model.model.layers.7.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00005.safetensors",
1319
+ "language_model.model.layers.7.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00005.safetensors",
1320
+ "language_model.model.layers.7.mlp.switch_mlp.up_proj.biases": "model-00002-of-00005.safetensors",
1321
+ "language_model.model.layers.7.mlp.switch_mlp.up_proj.scales": "model-00002-of-00005.safetensors",
1322
+ "language_model.model.layers.7.mlp.switch_mlp.up_proj.weight": "model-00002-of-00005.safetensors",
1323
  "language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00005.safetensors",
1324
  "language_model.model.layers.7.self_attn.k_norm.weight": "model-00001-of-00005.safetensors",
1325
  "language_model.model.layers.7.self_attn.k_proj.weight": "model-00001-of-00005.safetensors",
 
1329
  "language_model.model.layers.7.self_attn.q_proj.scales": "model-00001-of-00005.safetensors",
1330
  "language_model.model.layers.7.self_attn.q_proj.weight": "model-00001-of-00005.safetensors",
1331
  "language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00005.safetensors",
1332
+ "language_model.model.layers.8.input_layernorm.weight": "model-00002-of-00005.safetensors",
1333
+ "language_model.model.layers.8.linear_attn.A_log": "model-00002-of-00005.safetensors",
1334
+ "language_model.model.layers.8.linear_attn.conv1d.weight": "model-00002-of-00005.safetensors",
1335
+ "language_model.model.layers.8.linear_attn.dt_bias": "model-00002-of-00005.safetensors",
1336
+ "language_model.model.layers.8.linear_attn.in_proj_a.weight": "model-00002-of-00005.safetensors",
1337
+ "language_model.model.layers.8.linear_attn.in_proj_b.weight": "model-00002-of-00005.safetensors",
1338
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.biases": "model-00002-of-00005.safetensors",
1339
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.scales": "model-00002-of-00005.safetensors",
1340
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.weight": "model-00002-of-00005.safetensors",
1341
+ "language_model.model.layers.8.linear_attn.in_proj_z.biases": "model-00002-of-00005.safetensors",
1342
+ "language_model.model.layers.8.linear_attn.in_proj_z.scales": "model-00002-of-00005.safetensors",
1343
+ "language_model.model.layers.8.linear_attn.in_proj_z.weight": "model-00002-of-00005.safetensors",
1344
+ "language_model.model.layers.8.linear_attn.norm.weight": "model-00002-of-00005.safetensors",
1345
+ "language_model.model.layers.8.linear_attn.out_proj.biases": "model-00002-of-00005.safetensors",
1346
+ "language_model.model.layers.8.linear_attn.out_proj.scales": "model-00002-of-00005.safetensors",
1347
+ "language_model.model.layers.8.linear_attn.out_proj.weight": "model-00002-of-00005.safetensors",
1348
+ "language_model.model.layers.8.mlp.gate.weight": "model-00002-of-00005.safetensors",
1349
  "language_model.model.layers.8.mlp.shared_expert.down_proj.biases": "model-00002-of-00005.safetensors",
1350
  "language_model.model.layers.8.mlp.shared_expert.down_proj.scales": "model-00002-of-00005.safetensors",
1351
  "language_model.model.layers.8.mlp.shared_expert.down_proj.weight": "model-00002-of-00005.safetensors",
 
1358
  "language_model.model.layers.8.mlp.shared_expert_gate.biases": "model-00002-of-00005.safetensors",
1359
  "language_model.model.layers.8.mlp.shared_expert_gate.scales": "model-00002-of-00005.safetensors",
1360
  "language_model.model.layers.8.mlp.shared_expert_gate.weight": "model-00002-of-00005.safetensors",
1361
+ "language_model.model.layers.8.mlp.switch_mlp.down_proj.biases": "model-00002-of-00005.safetensors",
1362
+ "language_model.model.layers.8.mlp.switch_mlp.down_proj.scales": "model-00002-of-00005.safetensors",
1363
+ "language_model.model.layers.8.mlp.switch_mlp.down_proj.weight": "model-00002-of-00005.safetensors",
1364
+ "language_model.model.layers.8.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00005.safetensors",
1365
+ "language_model.model.layers.8.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00005.safetensors",
1366
+ "language_model.model.layers.8.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00005.safetensors",
1367
+ "language_model.model.layers.8.mlp.switch_mlp.up_proj.biases": "model-00002-of-00005.safetensors",
1368
+ "language_model.model.layers.8.mlp.switch_mlp.up_proj.scales": "model-00002-of-00005.safetensors",
1369
+ "language_model.model.layers.8.mlp.switch_mlp.up_proj.weight": "model-00002-of-00005.safetensors",
1370
+ "language_model.model.layers.8.post_attention_layernorm.weight": "model-00002-of-00005.safetensors",
1371
  "language_model.model.layers.9.input_layernorm.weight": "model-00002-of-00005.safetensors",
1372
  "language_model.model.layers.9.linear_attn.A_log": "model-00002-of-00005.safetensors",
1373
  "language_model.model.layers.9.linear_attn.conv1d.weight": "model-00002-of-00005.safetensors",
 
1407
  "language_model.model.layers.9.mlp.switch_mlp.up_proj.scales": "model-00002-of-00005.safetensors",
1408
  "language_model.model.layers.9.mlp.switch_mlp.up_proj.weight": "model-00002-of-00005.safetensors",
1409
  "language_model.model.layers.9.post_attention_layernorm.weight": "model-00002-of-00005.safetensors",
1410
+ "language_model.model.norm.weight": "model-00005-of-00005.safetensors",
1411
+ "vision_tower.blocks.0.attn.proj.bias": "model-00001-of-00005.safetensors",
1412
+ "vision_tower.blocks.0.attn.proj.weight": "model-00001-of-00005.safetensors",
1413
+ "vision_tower.blocks.0.attn.qkv.bias": "model-00001-of-00005.safetensors",
1414
+ "vision_tower.blocks.0.attn.qkv.weight": "model-00001-of-00005.safetensors",
1415
+ "vision_tower.blocks.0.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1416
+ "vision_tower.blocks.0.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1417
+ "vision_tower.blocks.0.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1418
+ "vision_tower.blocks.0.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1419
+ "vision_tower.blocks.0.norm1.bias": "model-00001-of-00005.safetensors",
1420
+ "vision_tower.blocks.0.norm1.weight": "model-00001-of-00005.safetensors",
1421
+ "vision_tower.blocks.0.norm2.bias": "model-00001-of-00005.safetensors",
1422
+ "vision_tower.blocks.0.norm2.weight": "model-00001-of-00005.safetensors",
1423
+ "vision_tower.blocks.1.attn.proj.bias": "model-00001-of-00005.safetensors",
1424
+ "vision_tower.blocks.1.attn.proj.weight": "model-00001-of-00005.safetensors",
1425
+ "vision_tower.blocks.1.attn.qkv.bias": "model-00001-of-00005.safetensors",
1426
+ "vision_tower.blocks.1.attn.qkv.weight": "model-00001-of-00005.safetensors",
1427
+ "vision_tower.blocks.1.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1428
+ "vision_tower.blocks.1.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1429
+ "vision_tower.blocks.1.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1430
+ "vision_tower.blocks.1.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1431
+ "vision_tower.blocks.1.norm1.bias": "model-00001-of-00005.safetensors",
1432
+ "vision_tower.blocks.1.norm1.weight": "model-00001-of-00005.safetensors",
1433
+ "vision_tower.blocks.1.norm2.bias": "model-00001-of-00005.safetensors",
1434
+ "vision_tower.blocks.1.norm2.weight": "model-00001-of-00005.safetensors",
1435
+ "vision_tower.blocks.10.attn.proj.bias": "model-00001-of-00005.safetensors",
1436
+ "vision_tower.blocks.10.attn.proj.weight": "model-00001-of-00005.safetensors",
1437
+ "vision_tower.blocks.10.attn.qkv.bias": "model-00001-of-00005.safetensors",
1438
+ "vision_tower.blocks.10.attn.qkv.weight": "model-00001-of-00005.safetensors",
1439
+ "vision_tower.blocks.10.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1440
+ "vision_tower.blocks.10.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1441
+ "vision_tower.blocks.10.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1442
+ "vision_tower.blocks.10.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1443
+ "vision_tower.blocks.10.norm1.bias": "model-00001-of-00005.safetensors",
1444
+ "vision_tower.blocks.10.norm1.weight": "model-00001-of-00005.safetensors",
1445
+ "vision_tower.blocks.10.norm2.bias": "model-00001-of-00005.safetensors",
1446
+ "vision_tower.blocks.10.norm2.weight": "model-00001-of-00005.safetensors",
1447
+ "vision_tower.blocks.11.attn.proj.bias": "model-00001-of-00005.safetensors",
1448
+ "vision_tower.blocks.11.attn.proj.weight": "model-00001-of-00005.safetensors",
1449
+ "vision_tower.blocks.11.attn.qkv.bias": "model-00001-of-00005.safetensors",
1450
+ "vision_tower.blocks.11.attn.qkv.weight": "model-00001-of-00005.safetensors",
1451
+ "vision_tower.blocks.11.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1452
+ "vision_tower.blocks.11.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1453
+ "vision_tower.blocks.11.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1454
+ "vision_tower.blocks.11.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1455
+ "vision_tower.blocks.11.norm1.bias": "model-00001-of-00005.safetensors",
1456
+ "vision_tower.blocks.11.norm1.weight": "model-00001-of-00005.safetensors",
1457
+ "vision_tower.blocks.11.norm2.bias": "model-00001-of-00005.safetensors",
1458
+ "vision_tower.blocks.11.norm2.weight": "model-00001-of-00005.safetensors",
1459
+ "vision_tower.blocks.12.attn.proj.bias": "model-00001-of-00005.safetensors",
1460
+ "vision_tower.blocks.12.attn.proj.weight": "model-00001-of-00005.safetensors",
1461
+ "vision_tower.blocks.12.attn.qkv.bias": "model-00001-of-00005.safetensors",
1462
+ "vision_tower.blocks.12.attn.qkv.weight": "model-00001-of-00005.safetensors",
1463
+ "vision_tower.blocks.12.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1464
+ "vision_tower.blocks.12.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1465
+ "vision_tower.blocks.12.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1466
+ "vision_tower.blocks.12.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1467
+ "vision_tower.blocks.12.norm1.bias": "model-00001-of-00005.safetensors",
1468
+ "vision_tower.blocks.12.norm1.weight": "model-00001-of-00005.safetensors",
1469
+ "vision_tower.blocks.12.norm2.bias": "model-00001-of-00005.safetensors",
1470
+ "vision_tower.blocks.12.norm2.weight": "model-00001-of-00005.safetensors",
1471
+ "vision_tower.blocks.13.attn.proj.bias": "model-00001-of-00005.safetensors",
1472
+ "vision_tower.blocks.13.attn.proj.weight": "model-00001-of-00005.safetensors",
1473
+ "vision_tower.blocks.13.attn.qkv.bias": "model-00001-of-00005.safetensors",
1474
+ "vision_tower.blocks.13.attn.qkv.weight": "model-00001-of-00005.safetensors",
1475
+ "vision_tower.blocks.13.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1476
+ "vision_tower.blocks.13.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1477
+ "vision_tower.blocks.13.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1478
+ "vision_tower.blocks.13.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1479
+ "vision_tower.blocks.13.norm1.bias": "model-00001-of-00005.safetensors",
1480
+ "vision_tower.blocks.13.norm1.weight": "model-00001-of-00005.safetensors",
1481
+ "vision_tower.blocks.13.norm2.bias": "model-00001-of-00005.safetensors",
1482
+ "vision_tower.blocks.13.norm2.weight": "model-00001-of-00005.safetensors",
1483
+ "vision_tower.blocks.14.attn.proj.bias": "model-00001-of-00005.safetensors",
1484
+ "vision_tower.blocks.14.attn.proj.weight": "model-00001-of-00005.safetensors",
1485
+ "vision_tower.blocks.14.attn.qkv.bias": "model-00001-of-00005.safetensors",
1486
+ "vision_tower.blocks.14.attn.qkv.weight": "model-00001-of-00005.safetensors",
1487
+ "vision_tower.blocks.14.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1488
+ "vision_tower.blocks.14.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1489
+ "vision_tower.blocks.14.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1490
+ "vision_tower.blocks.14.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1491
+ "vision_tower.blocks.14.norm1.bias": "model-00001-of-00005.safetensors",
1492
+ "vision_tower.blocks.14.norm1.weight": "model-00001-of-00005.safetensors",
1493
+ "vision_tower.blocks.14.norm2.bias": "model-00001-of-00005.safetensors",
1494
+ "vision_tower.blocks.14.norm2.weight": "model-00001-of-00005.safetensors",
1495
+ "vision_tower.blocks.15.attn.proj.bias": "model-00001-of-00005.safetensors",
1496
+ "vision_tower.blocks.15.attn.proj.weight": "model-00001-of-00005.safetensors",
1497
+ "vision_tower.blocks.15.attn.qkv.bias": "model-00001-of-00005.safetensors",
1498
+ "vision_tower.blocks.15.attn.qkv.weight": "model-00001-of-00005.safetensors",
1499
+ "vision_tower.blocks.15.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1500
+ "vision_tower.blocks.15.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1501
+ "vision_tower.blocks.15.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1502
+ "vision_tower.blocks.15.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1503
+ "vision_tower.blocks.15.norm1.bias": "model-00001-of-00005.safetensors",
1504
+ "vision_tower.blocks.15.norm1.weight": "model-00001-of-00005.safetensors",
1505
+ "vision_tower.blocks.15.norm2.bias": "model-00001-of-00005.safetensors",
1506
+ "vision_tower.blocks.15.norm2.weight": "model-00001-of-00005.safetensors",
1507
+ "vision_tower.blocks.16.attn.proj.bias": "model-00001-of-00005.safetensors",
1508
+ "vision_tower.blocks.16.attn.proj.weight": "model-00001-of-00005.safetensors",
1509
+ "vision_tower.blocks.16.attn.qkv.bias": "model-00001-of-00005.safetensors",
1510
+ "vision_tower.blocks.16.attn.qkv.weight": "model-00001-of-00005.safetensors",
1511
+ "vision_tower.blocks.16.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1512
+ "vision_tower.blocks.16.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1513
+ "vision_tower.blocks.16.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1514
+ "vision_tower.blocks.16.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1515
+ "vision_tower.blocks.16.norm1.bias": "model-00001-of-00005.safetensors",
1516
+ "vision_tower.blocks.16.norm1.weight": "model-00001-of-00005.safetensors",
1517
+ "vision_tower.blocks.16.norm2.bias": "model-00001-of-00005.safetensors",
1518
+ "vision_tower.blocks.16.norm2.weight": "model-00001-of-00005.safetensors",
1519
+ "vision_tower.blocks.17.attn.proj.bias": "model-00001-of-00005.safetensors",
1520
+ "vision_tower.blocks.17.attn.proj.weight": "model-00001-of-00005.safetensors",
1521
+ "vision_tower.blocks.17.attn.qkv.bias": "model-00001-of-00005.safetensors",
1522
+ "vision_tower.blocks.17.attn.qkv.weight": "model-00001-of-00005.safetensors",
1523
+ "vision_tower.blocks.17.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1524
+ "vision_tower.blocks.17.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1525
+ "vision_tower.blocks.17.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1526
+ "vision_tower.blocks.17.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1527
+ "vision_tower.blocks.17.norm1.bias": "model-00001-of-00005.safetensors",
1528
+ "vision_tower.blocks.17.norm1.weight": "model-00001-of-00005.safetensors",
1529
+ "vision_tower.blocks.17.norm2.bias": "model-00001-of-00005.safetensors",
1530
+ "vision_tower.blocks.17.norm2.weight": "model-00001-of-00005.safetensors",
1531
+ "vision_tower.blocks.18.attn.proj.bias": "model-00001-of-00005.safetensors",
1532
+ "vision_tower.blocks.18.attn.proj.weight": "model-00001-of-00005.safetensors",
1533
+ "vision_tower.blocks.18.attn.qkv.bias": "model-00001-of-00005.safetensors",
1534
+ "vision_tower.blocks.18.attn.qkv.weight": "model-00001-of-00005.safetensors",
1535
+ "vision_tower.blocks.18.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1536
+ "vision_tower.blocks.18.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1537
+ "vision_tower.blocks.18.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1538
+ "vision_tower.blocks.18.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1539
+ "vision_tower.blocks.18.norm1.bias": "model-00001-of-00005.safetensors",
1540
+ "vision_tower.blocks.18.norm1.weight": "model-00001-of-00005.safetensors",
1541
+ "vision_tower.blocks.18.norm2.bias": "model-00001-of-00005.safetensors",
1542
+ "vision_tower.blocks.18.norm2.weight": "model-00001-of-00005.safetensors",
1543
+ "vision_tower.blocks.19.attn.proj.bias": "model-00001-of-00005.safetensors",
1544
+ "vision_tower.blocks.19.attn.proj.weight": "model-00001-of-00005.safetensors",
1545
+ "vision_tower.blocks.19.attn.qkv.bias": "model-00001-of-00005.safetensors",
1546
+ "vision_tower.blocks.19.attn.qkv.weight": "model-00001-of-00005.safetensors",
1547
+ "vision_tower.blocks.19.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1548
+ "vision_tower.blocks.19.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1549
+ "vision_tower.blocks.19.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1550
+ "vision_tower.blocks.19.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1551
+ "vision_tower.blocks.19.norm1.bias": "model-00001-of-00005.safetensors",
1552
+ "vision_tower.blocks.19.norm1.weight": "model-00001-of-00005.safetensors",
1553
+ "vision_tower.blocks.19.norm2.bias": "model-00001-of-00005.safetensors",
1554
+ "vision_tower.blocks.19.norm2.weight": "model-00001-of-00005.safetensors",
1555
+ "vision_tower.blocks.2.attn.proj.bias": "model-00001-of-00005.safetensors",
1556
+ "vision_tower.blocks.2.attn.proj.weight": "model-00001-of-00005.safetensors",
1557
+ "vision_tower.blocks.2.attn.qkv.bias": "model-00001-of-00005.safetensors",
1558
+ "vision_tower.blocks.2.attn.qkv.weight": "model-00001-of-00005.safetensors",
1559
+ "vision_tower.blocks.2.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1560
+ "vision_tower.blocks.2.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1561
+ "vision_tower.blocks.2.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1562
+ "vision_tower.blocks.2.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1563
+ "vision_tower.blocks.2.norm1.bias": "model-00001-of-00005.safetensors",
1564
+ "vision_tower.blocks.2.norm1.weight": "model-00001-of-00005.safetensors",
1565
+ "vision_tower.blocks.2.norm2.bias": "model-00001-of-00005.safetensors",
1566
+ "vision_tower.blocks.2.norm2.weight": "model-00001-of-00005.safetensors",
1567
+ "vision_tower.blocks.20.attn.proj.bias": "model-00001-of-00005.safetensors",
1568
+ "vision_tower.blocks.20.attn.proj.weight": "model-00001-of-00005.safetensors",
1569
+ "vision_tower.blocks.20.attn.qkv.bias": "model-00001-of-00005.safetensors",
1570
+ "vision_tower.blocks.20.attn.qkv.weight": "model-00001-of-00005.safetensors",
1571
+ "vision_tower.blocks.20.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1572
+ "vision_tower.blocks.20.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1573
+ "vision_tower.blocks.20.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1574
+ "vision_tower.blocks.20.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1575
+ "vision_tower.blocks.20.norm1.bias": "model-00001-of-00005.safetensors",
1576
+ "vision_tower.blocks.20.norm1.weight": "model-00001-of-00005.safetensors",
1577
+ "vision_tower.blocks.20.norm2.bias": "model-00001-of-00005.safetensors",
1578
+ "vision_tower.blocks.20.norm2.weight": "model-00001-of-00005.safetensors",
1579
+ "vision_tower.blocks.21.attn.proj.bias": "model-00001-of-00005.safetensors",
1580
+ "vision_tower.blocks.21.attn.proj.weight": "model-00001-of-00005.safetensors",
1581
+ "vision_tower.blocks.21.attn.qkv.bias": "model-00001-of-00005.safetensors",
1582
+ "vision_tower.blocks.21.attn.qkv.weight": "model-00001-of-00005.safetensors",
1583
+ "vision_tower.blocks.21.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1584
+ "vision_tower.blocks.21.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1585
+ "vision_tower.blocks.21.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1586
+ "vision_tower.blocks.21.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1587
+ "vision_tower.blocks.21.norm1.bias": "model-00001-of-00005.safetensors",
1588
+ "vision_tower.blocks.21.norm1.weight": "model-00001-of-00005.safetensors",
1589
+ "vision_tower.blocks.21.norm2.bias": "model-00001-of-00005.safetensors",
1590
+ "vision_tower.blocks.21.norm2.weight": "model-00001-of-00005.safetensors",
1591
+ "vision_tower.blocks.22.attn.proj.bias": "model-00001-of-00005.safetensors",
1592
+ "vision_tower.blocks.22.attn.proj.weight": "model-00001-of-00005.safetensors",
1593
+ "vision_tower.blocks.22.attn.qkv.bias": "model-00001-of-00005.safetensors",
1594
+ "vision_tower.blocks.22.attn.qkv.weight": "model-00001-of-00005.safetensors",
1595
+ "vision_tower.blocks.22.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1596
+ "vision_tower.blocks.22.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1597
+ "vision_tower.blocks.22.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1598
+ "vision_tower.blocks.22.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1599
+ "vision_tower.blocks.22.norm1.bias": "model-00001-of-00005.safetensors",
1600
+ "vision_tower.blocks.22.norm1.weight": "model-00001-of-00005.safetensors",
1601
+ "vision_tower.blocks.22.norm2.bias": "model-00001-of-00005.safetensors",
1602
+ "vision_tower.blocks.22.norm2.weight": "model-00001-of-00005.safetensors",
1603
+ "vision_tower.blocks.23.attn.proj.bias": "model-00001-of-00005.safetensors",
1604
+ "vision_tower.blocks.23.attn.proj.weight": "model-00001-of-00005.safetensors",
1605
+ "vision_tower.blocks.23.attn.qkv.bias": "model-00001-of-00005.safetensors",
1606
+ "vision_tower.blocks.23.attn.qkv.weight": "model-00001-of-00005.safetensors",
1607
+ "vision_tower.blocks.23.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1608
+ "vision_tower.blocks.23.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1609
+ "vision_tower.blocks.23.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1610
+ "vision_tower.blocks.23.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1611
+ "vision_tower.blocks.23.norm1.bias": "model-00001-of-00005.safetensors",
1612
+ "vision_tower.blocks.23.norm1.weight": "model-00001-of-00005.safetensors",
1613
+ "vision_tower.blocks.23.norm2.bias": "model-00001-of-00005.safetensors",
1614
+ "vision_tower.blocks.23.norm2.weight": "model-00001-of-00005.safetensors",
1615
+ "vision_tower.blocks.24.attn.proj.bias": "model-00001-of-00005.safetensors",
1616
+ "vision_tower.blocks.24.attn.proj.weight": "model-00001-of-00005.safetensors",
1617
+ "vision_tower.blocks.24.attn.qkv.bias": "model-00001-of-00005.safetensors",
1618
+ "vision_tower.blocks.24.attn.qkv.weight": "model-00001-of-00005.safetensors",
1619
+ "vision_tower.blocks.24.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1620
+ "vision_tower.blocks.24.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1621
+ "vision_tower.blocks.24.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1622
+ "vision_tower.blocks.24.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1623
+ "vision_tower.blocks.24.norm1.bias": "model-00001-of-00005.safetensors",
1624
+ "vision_tower.blocks.24.norm1.weight": "model-00001-of-00005.safetensors",
1625
+ "vision_tower.blocks.24.norm2.bias": "model-00001-of-00005.safetensors",
1626
+ "vision_tower.blocks.24.norm2.weight": "model-00001-of-00005.safetensors",
1627
+ "vision_tower.blocks.25.attn.proj.bias": "model-00001-of-00005.safetensors",
1628
+ "vision_tower.blocks.25.attn.proj.weight": "model-00001-of-00005.safetensors",
1629
+ "vision_tower.blocks.25.attn.qkv.bias": "model-00001-of-00005.safetensors",
1630
+ "vision_tower.blocks.25.attn.qkv.weight": "model-00001-of-00005.safetensors",
1631
+ "vision_tower.blocks.25.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1632
+ "vision_tower.blocks.25.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1633
+ "vision_tower.blocks.25.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1634
+ "vision_tower.blocks.25.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1635
+ "vision_tower.blocks.25.norm1.bias": "model-00001-of-00005.safetensors",
1636
+ "vision_tower.blocks.25.norm1.weight": "model-00001-of-00005.safetensors",
1637
+ "vision_tower.blocks.25.norm2.bias": "model-00001-of-00005.safetensors",
1638
+ "vision_tower.blocks.25.norm2.weight": "model-00001-of-00005.safetensors",
1639
+ "vision_tower.blocks.26.attn.proj.bias": "model-00001-of-00005.safetensors",
1640
+ "vision_tower.blocks.26.attn.proj.weight": "model-00001-of-00005.safetensors",
1641
+ "vision_tower.blocks.26.attn.qkv.bias": "model-00001-of-00005.safetensors",
1642
+ "vision_tower.blocks.26.attn.qkv.weight": "model-00001-of-00005.safetensors",
1643
+ "vision_tower.blocks.26.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1644
+ "vision_tower.blocks.26.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1645
+ "vision_tower.blocks.26.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1646
+ "vision_tower.blocks.26.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1647
+ "vision_tower.blocks.26.norm1.bias": "model-00001-of-00005.safetensors",
1648
+ "vision_tower.blocks.26.norm1.weight": "model-00001-of-00005.safetensors",
1649
+ "vision_tower.blocks.26.norm2.bias": "model-00001-of-00005.safetensors",
1650
+ "vision_tower.blocks.26.norm2.weight": "model-00001-of-00005.safetensors",
1651
+ "vision_tower.blocks.3.attn.proj.bias": "model-00001-of-00005.safetensors",
1652
+ "vision_tower.blocks.3.attn.proj.weight": "model-00001-of-00005.safetensors",
1653
+ "vision_tower.blocks.3.attn.qkv.bias": "model-00001-of-00005.safetensors",
1654
+ "vision_tower.blocks.3.attn.qkv.weight": "model-00001-of-00005.safetensors",
1655
+ "vision_tower.blocks.3.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1656
+ "vision_tower.blocks.3.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1657
+ "vision_tower.blocks.3.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1658
+ "vision_tower.blocks.3.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1659
+ "vision_tower.blocks.3.norm1.bias": "model-00001-of-00005.safetensors",
1660
+ "vision_tower.blocks.3.norm1.weight": "model-00001-of-00005.safetensors",
1661
+ "vision_tower.blocks.3.norm2.bias": "model-00001-of-00005.safetensors",
1662
+ "vision_tower.blocks.3.norm2.weight": "model-00001-of-00005.safetensors",
1663
+ "vision_tower.blocks.4.attn.proj.bias": "model-00001-of-00005.safetensors",
1664
+ "vision_tower.blocks.4.attn.proj.weight": "model-00001-of-00005.safetensors",
1665
+ "vision_tower.blocks.4.attn.qkv.bias": "model-00001-of-00005.safetensors",
1666
+ "vision_tower.blocks.4.attn.qkv.weight": "model-00001-of-00005.safetensors",
1667
+ "vision_tower.blocks.4.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1668
+ "vision_tower.blocks.4.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1669
+ "vision_tower.blocks.4.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1670
+ "vision_tower.blocks.4.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1671
+ "vision_tower.blocks.4.norm1.bias": "model-00001-of-00005.safetensors",
1672
+ "vision_tower.blocks.4.norm1.weight": "model-00001-of-00005.safetensors",
1673
+ "vision_tower.blocks.4.norm2.bias": "model-00001-of-00005.safetensors",
1674
+ "vision_tower.blocks.4.norm2.weight": "model-00001-of-00005.safetensors",
1675
+ "vision_tower.blocks.5.attn.proj.bias": "model-00001-of-00005.safetensors",
1676
+ "vision_tower.blocks.5.attn.proj.weight": "model-00001-of-00005.safetensors",
1677
+ "vision_tower.blocks.5.attn.qkv.bias": "model-00001-of-00005.safetensors",
1678
+ "vision_tower.blocks.5.attn.qkv.weight": "model-00001-of-00005.safetensors",
1679
+ "vision_tower.blocks.5.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1680
+ "vision_tower.blocks.5.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1681
+ "vision_tower.blocks.5.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1682
+ "vision_tower.blocks.5.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1683
+ "vision_tower.blocks.5.norm1.bias": "model-00001-of-00005.safetensors",
1684
+ "vision_tower.blocks.5.norm1.weight": "model-00001-of-00005.safetensors",
1685
+ "vision_tower.blocks.5.norm2.bias": "model-00001-of-00005.safetensors",
1686
+ "vision_tower.blocks.5.norm2.weight": "model-00001-of-00005.safetensors",
1687
+ "vision_tower.blocks.6.attn.proj.bias": "model-00001-of-00005.safetensors",
1688
+ "vision_tower.blocks.6.attn.proj.weight": "model-00001-of-00005.safetensors",
1689
+ "vision_tower.blocks.6.attn.qkv.bias": "model-00001-of-00005.safetensors",
1690
+ "vision_tower.blocks.6.attn.qkv.weight": "model-00001-of-00005.safetensors",
1691
+ "vision_tower.blocks.6.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1692
+ "vision_tower.blocks.6.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1693
+ "vision_tower.blocks.6.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1694
+ "vision_tower.blocks.6.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1695
+ "vision_tower.blocks.6.norm1.bias": "model-00001-of-00005.safetensors",
1696
+ "vision_tower.blocks.6.norm1.weight": "model-00001-of-00005.safetensors",
1697
+ "vision_tower.blocks.6.norm2.bias": "model-00001-of-00005.safetensors",
1698
+ "vision_tower.blocks.6.norm2.weight": "model-00001-of-00005.safetensors",
1699
+ "vision_tower.blocks.7.attn.proj.bias": "model-00001-of-00005.safetensors",
1700
+ "vision_tower.blocks.7.attn.proj.weight": "model-00001-of-00005.safetensors",
1701
+ "vision_tower.blocks.7.attn.qkv.bias": "model-00001-of-00005.safetensors",
1702
+ "vision_tower.blocks.7.attn.qkv.weight": "model-00001-of-00005.safetensors",
1703
+ "vision_tower.blocks.7.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1704
+ "vision_tower.blocks.7.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1705
+ "vision_tower.blocks.7.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1706
+ "vision_tower.blocks.7.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1707
+ "vision_tower.blocks.7.norm1.bias": "model-00001-of-00005.safetensors",
1708
+ "vision_tower.blocks.7.norm1.weight": "model-00001-of-00005.safetensors",
1709
+ "vision_tower.blocks.7.norm2.bias": "model-00001-of-00005.safetensors",
1710
+ "vision_tower.blocks.7.norm2.weight": "model-00001-of-00005.safetensors",
1711
+ "vision_tower.blocks.8.attn.proj.bias": "model-00001-of-00005.safetensors",
1712
+ "vision_tower.blocks.8.attn.proj.weight": "model-00001-of-00005.safetensors",
1713
+ "vision_tower.blocks.8.attn.qkv.bias": "model-00001-of-00005.safetensors",
1714
+ "vision_tower.blocks.8.attn.qkv.weight": "model-00001-of-00005.safetensors",
1715
+ "vision_tower.blocks.8.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1716
+ "vision_tower.blocks.8.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1717
+ "vision_tower.blocks.8.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1718
+ "vision_tower.blocks.8.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1719
+ "vision_tower.blocks.8.norm1.bias": "model-00001-of-00005.safetensors",
1720
+ "vision_tower.blocks.8.norm1.weight": "model-00001-of-00005.safetensors",
1721
+ "vision_tower.blocks.8.norm2.bias": "model-00001-of-00005.safetensors",
1722
+ "vision_tower.blocks.8.norm2.weight": "model-00001-of-00005.safetensors",
1723
+ "vision_tower.blocks.9.attn.proj.bias": "model-00001-of-00005.safetensors",
1724
+ "vision_tower.blocks.9.attn.proj.weight": "model-00001-of-00005.safetensors",
1725
+ "vision_tower.blocks.9.attn.qkv.bias": "model-00001-of-00005.safetensors",
1726
+ "vision_tower.blocks.9.attn.qkv.weight": "model-00001-of-00005.safetensors",
1727
+ "vision_tower.blocks.9.mlp.linear_fc1.bias": "model-00001-of-00005.safetensors",
1728
+ "vision_tower.blocks.9.mlp.linear_fc1.weight": "model-00001-of-00005.safetensors",
1729
+ "vision_tower.blocks.9.mlp.linear_fc2.bias": "model-00001-of-00005.safetensors",
1730
+ "vision_tower.blocks.9.mlp.linear_fc2.weight": "model-00001-of-00005.safetensors",
1731
+ "vision_tower.blocks.9.norm1.bias": "model-00001-of-00005.safetensors",
1732
+ "vision_tower.blocks.9.norm1.weight": "model-00001-of-00005.safetensors",
1733
+ "vision_tower.blocks.9.norm2.bias": "model-00001-of-00005.safetensors",
1734
+ "vision_tower.blocks.9.norm2.weight": "model-00001-of-00005.safetensors",
1735
+ "vision_tower.merger.linear_fc1.bias": "model-00001-of-00005.safetensors",
1736
+ "vision_tower.merger.linear_fc1.weight": "model-00001-of-00005.safetensors",
1737
+ "vision_tower.merger.linear_fc2.bias": "model-00001-of-00005.safetensors",
1738
+ "vision_tower.merger.linear_fc2.weight": "model-00001-of-00005.safetensors",
1739
+ "vision_tower.merger.norm.bias": "model-00001-of-00005.safetensors",
1740
+ "vision_tower.merger.norm.weight": "model-00001-of-00005.safetensors",
1741
+ "vision_tower.patch_embed.proj.bias": "model-00001-of-00005.safetensors",
1742
+ "vision_tower.patch_embed.proj.weight": "model-00001-of-00005.safetensors",
1743
+ "vision_tower.pos_embed.weight": "model-00001-of-00005.safetensors"
1744
  }
1745
  }
preprocessor_config.json ADDED
@@ -0,0 +1,21 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "size": {
3
+ "longest_edge": 16777216,
4
+ "shortest_edge": 65536
5
+ },
6
+ "patch_size": 16,
7
+ "temporal_patch_size": 2,
8
+ "merge_size": 2,
9
+ "image_mean": [
10
+ 0.5,
11
+ 0.5,
12
+ 0.5
13
+ ],
14
+ "image_std": [
15
+ 0.5,
16
+ 0.5,
17
+ 0.5
18
+ ],
19
+ "processor_class": "Qwen3VLProcessor",
20
+ "image_processor_type": "Qwen2VLImageProcessorFast"
21
+ }
processor_config.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "image_processor": {
3
+ "data_format": "channels_first",
4
+ "do_convert_rgb": true,
5
+ "do_normalize": true,
6
+ "do_rescale": true,
7
+ "do_resize": true,
8
+ "image_mean": [
9
+ 0.5,
10
+ 0.5,
11
+ 0.5
12
+ ],
13
+ "image_processor_type": "Qwen2VLImageProcessorFast",
14
+ "image_std": [
15
+ 0.5,
16
+ 0.5,
17
+ 0.5
18
+ ],
19
+ "merge_size": 2,
20
+ "patch_size": 16,
21
+ "resample": 3,
22
+ "rescale_factor": 0.00392156862745098,
23
+ "size": {
24
+ "longest_edge": 16777216,
25
+ "shortest_edge": 65536
26
+ },
27
+ "temporal_patch_size": 2
28
+ },
29
+ "processor_class": "Qwen3VLProcessor",
30
+ "video_processor": {
31
+ "data_format": "channels_first",
32
+ "default_to_square": true,
33
+ "do_convert_rgb": true,
34
+ "do_normalize": true,
35
+ "do_rescale": true,
36
+ "do_resize": true,
37
+ "do_sample_frames": true,
38
+ "fps": 2,
39
+ "image_mean": [
40
+ 0.5,
41
+ 0.5,
42
+ 0.5
43
+ ],
44
+ "image_std": [
45
+ 0.5,
46
+ 0.5,
47
+ 0.5
48
+ ],
49
+ "max_frames": 768,
50
+ "merge_size": 2,
51
+ "min_frames": 4,
52
+ "patch_size": 16,
53
+ "resample": 3,
54
+ "rescale_factor": 0.00392156862745098,
55
+ "return_metadata": false,
56
+ "size": {
57
+ "longest_edge": 25165824,
58
+ "shortest_edge": 4096
59
+ },
60
+ "temporal_patch_size": 2,
61
+ "video_processor_type": "Qwen3VLVideoProcessor"
62
+ }
63
+ }
tokenizer_config.json CHANGED
@@ -22,9 +22,9 @@
22
  },
23
  "pad_token": "<|endoftext|>",
24
  "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
 
25
  "split_special_tokens": false,
26
  "tokenizer_class": "TokenizersBackend",
27
- "tool_parser_type": "qwen3_coder",
28
  "unk_token": null,
29
  "video_token": "<|video_pad|>",
30
  "vision_bos_token": "<|vision_start|>",
 
22
  },
23
  "pad_token": "<|endoftext|>",
24
  "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
25
+ "processor_class": "Qwen3VLProcessor",
26
  "split_special_tokens": false,
27
  "tokenizer_class": "TokenizersBackend",
 
28
  "unk_token": null,
29
  "video_token": "<|video_pad|>",
30
  "vision_bos_token": "<|vision_start|>",
video_preprocessor_config.json ADDED
@@ -0,0 +1,21 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "size": {
3
+ "longest_edge": 25165824,
4
+ "shortest_edge": 4096
5
+ },
6
+ "patch_size": 16,
7
+ "temporal_patch_size": 2,
8
+ "merge_size": 2,
9
+ "image_mean": [
10
+ 0.5,
11
+ 0.5,
12
+ 0.5
13
+ ],
14
+ "image_std": [
15
+ 0.5,
16
+ 0.5,
17
+ 0.5
18
+ ],
19
+ "processor_class": "Qwen3VLProcessor",
20
+ "video_processor_type": "Qwen3VLVideoProcessor"
21
+ }
vocab.json ADDED
The diff for this file is too large to render. See raw diff