Text Generation
Transformers
Safetensors
English
Vietnamese
Chinese
qwen4_exp_text
Mixture of Experts
qwen
code
coding-agent
int8
selective-quantization
moe-slice
text-generation-inference
vllm
conversational
8-bit precision
Instructions to use Jab1718/qwen3.8-flash-coder-44gb-selective-int8 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Jab1718/qwen3.8-flash-coder-44gb-selective-int8 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Jab1718/qwen3.8-flash-coder-44gb-selective-int8") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("Jab1718/qwen3.8-flash-coder-44gb-selective-int8") model = AutoModelForCausalLM.from_pretrained("Jab1718/qwen3.8-flash-coder-44gb-selective-int8", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Jab1718/qwen3.8-flash-coder-44gb-selective-int8 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Jab1718/qwen3.8-flash-coder-44gb-selective-int8" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Jab1718/qwen3.8-flash-coder-44gb-selective-int8", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Jab1718/qwen3.8-flash-coder-44gb-selective-int8
- SGLang
How to use Jab1718/qwen3.8-flash-coder-44gb-selective-int8 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Jab1718/qwen3.8-flash-coder-44gb-selective-int8" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Jab1718/qwen3.8-flash-coder-44gb-selective-int8", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Jab1718/qwen3.8-flash-coder-44gb-selective-int8" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Jab1718/qwen3.8-flash-coder-44gb-selective-int8", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use Jab1718/qwen3.8-flash-coder-44gb-selective-int8 with Docker Model Runner:
docker model run hf.co/Jab1718/qwen3.8-flash-coder-44gb-selective-int8
| { | |
| "metadata": { | |
| "total_size": 47551085680, | |
| "quantization": "Selective MoE INT8 (Router BF16 + Experts INT8)", | |
| "experts_count": 160, | |
| "total_tensors": 1253 | |
| }, | |
| "weight_map": { | |
| "lm_head.weight": "model-00001-of-00002.safetensors", | |
| "model.embed_tokens.weight": "model-00001-of-00002.safetensors", | |
| "model.hyper_connection_mixer.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.hyper_connection_mixer.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.hyper_connection_mixer.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.0.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.0.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.0.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.0.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.0.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.0.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.0.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.1.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.1.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.1.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.1.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.1.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.1.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.1.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.10.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.10.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.10.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.10.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.10.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.10.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.10.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.11.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.11.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.11.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.11.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.self_attn.indexer.index_qk_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.self_attn.indexer.k_layernorm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.self_attn.indexer.q_layernorm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.12.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.12.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.12.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.12.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.12.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.12.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.12.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.13.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.13.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.13.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.13.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.13.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.13.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.13.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.14.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.14.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.14.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.14.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.14.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.14.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.14.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.15.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.15.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.15.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.15.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.self_attn.indexer.index_qk_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.self_attn.indexer.k_layernorm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.self_attn.indexer.q_layernorm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.16.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.16.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.16.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.16.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.16.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.16.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.16.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.17.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.17.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.17.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.17.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.17.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.17.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.17.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.18.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.18.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.18.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.18.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.18.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.18.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.18.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.19.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.19.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.19.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.19.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.self_attn.indexer.index_qk_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.self_attn.indexer.k_layernorm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.self_attn.indexer.q_layernorm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.2.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.2.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.2.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.2.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.2.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.2.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.2.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.20.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.20.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.20.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.20.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.20.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.20.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.20.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.21.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.21.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.21.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.21.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.21.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.21.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.21.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.22.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.22.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.22.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.22.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.22.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.22.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.22.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.23.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.23.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.23.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.23.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.self_attn.indexer.index_qk_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.self_attn.indexer.k_layernorm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.self_attn.indexer.q_layernorm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.23.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.24.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.24.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.24.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.24.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.24.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.24.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.24.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.25.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.25.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.25.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.25.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.25.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.25.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.25.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.26.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.26.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.26.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.26.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.26.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.26.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.26.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.27.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.27.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.27.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.27.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.27.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.27.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.3.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.3.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.3.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.3.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.3.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.self_attn.indexer.index_qk_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.self_attn.indexer.k_layernorm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.self_attn.indexer.q_layernorm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.4.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.4.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.4.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.4.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.4.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.4.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.4.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.5.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.5.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.5.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.5.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.5.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.5.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.5.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.6.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.6.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.6.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.6.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.6.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.6.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.6.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.7.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.7.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.7.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.7.mlp.gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.mlp.shared_expert.down_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.mlp.shared_expert.gate_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.mlp.shared_expert.up_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.mlp.shared_expert_gate.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.mlp_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.mlp_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.mlp_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.mlp_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.self_attn.indexer.index_qk_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.self_attn.indexer.k_layernorm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.self_attn.indexer.q_layernorm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.8.attn_hyper_connection.block_inject_weight.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.8.attn_hyper_connection.hc_norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.8.attn_hyper_connection.input_mix_weight_down.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.8.attn_hyper_connection.input_mix_weight_up.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.8.linear_attn.A_log": "model-00001-of-00002.safetensors", | |
| "model.layers.8.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.8.linear_attn.dt_bias": "model-00001-of-00002.safetensors", | |
| "model.layers.8.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.8.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.8.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.8.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.8.linear_attn.norm.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.8.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", | |
| "model.layers.8.mlp.experts.down_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.8.mlp.experts.down_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.8.mlp.experts.gate_up_proj": "model-00001-of-00002.safetensors", | |
| "model.layers.8.mlp.experts.gate_up_proj_scale": "model-00001-of-00002.safetensors", | |
| "model.layers.27.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.27.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.27.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.self_attn.indexer.index_qk_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.self_attn.indexer.k_layernorm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.self_attn.indexer.q_layernorm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.self_attn.k_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.self_attn.k_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.self_attn.o_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.self_attn.q_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.self_attn.q_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.27.self_attn.v_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.linear_attn.A_log": "model-00002-of-00002.safetensors", | |
| "model.layers.28.linear_attn.conv1d.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.linear_attn.dt_bias": "model-00002-of-00002.safetensors", | |
| "model.layers.28.linear_attn.in_proj_a.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.linear_attn.in_proj_b.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.linear_attn.in_proj_qkv.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.linear_attn.in_proj_z.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.linear_attn.norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.linear_attn.out_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.28.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.28.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.28.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.28.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.28.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.linear_attn.A_log": "model-00002-of-00002.safetensors", | |
| "model.layers.29.linear_attn.conv1d.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.linear_attn.dt_bias": "model-00002-of-00002.safetensors", | |
| "model.layers.29.linear_attn.in_proj_a.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.linear_attn.in_proj_b.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.linear_attn.in_proj_qkv.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.linear_attn.in_proj_z.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.linear_attn.norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.linear_attn.out_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.29.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.29.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.29.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.29.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.29.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.linear_attn.A_log": "model-00002-of-00002.safetensors", | |
| "model.layers.30.linear_attn.conv1d.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.linear_attn.dt_bias": "model-00002-of-00002.safetensors", | |
| "model.layers.30.linear_attn.in_proj_a.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.linear_attn.in_proj_b.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.linear_attn.in_proj_qkv.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.linear_attn.in_proj_z.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.linear_attn.norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.linear_attn.out_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.30.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.30.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.30.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.30.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.30.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.31.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.31.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.31.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.31.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.self_attn.indexer.index_qk_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.self_attn.indexer.k_layernorm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.self_attn.indexer.q_layernorm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.self_attn.k_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.self_attn.k_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.self_attn.o_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.self_attn.q_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.self_attn.q_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.31.self_attn.v_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.linear_attn.A_log": "model-00002-of-00002.safetensors", | |
| "model.layers.32.linear_attn.conv1d.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.linear_attn.dt_bias": "model-00002-of-00002.safetensors", | |
| "model.layers.32.linear_attn.in_proj_a.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.linear_attn.in_proj_b.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.linear_attn.in_proj_qkv.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.linear_attn.in_proj_z.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.linear_attn.norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.linear_attn.out_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.32.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.32.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.32.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.32.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.32.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.linear_attn.A_log": "model-00002-of-00002.safetensors", | |
| "model.layers.33.linear_attn.conv1d.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.linear_attn.dt_bias": "model-00002-of-00002.safetensors", | |
| "model.layers.33.linear_attn.in_proj_a.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.linear_attn.in_proj_b.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.linear_attn.in_proj_qkv.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.linear_attn.in_proj_z.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.linear_attn.norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.linear_attn.out_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.33.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.33.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.33.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.33.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.33.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.linear_attn.A_log": "model-00002-of-00002.safetensors", | |
| "model.layers.34.linear_attn.conv1d.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.linear_attn.dt_bias": "model-00002-of-00002.safetensors", | |
| "model.layers.34.linear_attn.in_proj_a.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.linear_attn.in_proj_b.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.linear_attn.in_proj_qkv.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.linear_attn.in_proj_z.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.linear_attn.norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.linear_attn.out_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.34.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.34.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.34.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.34.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.34.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.35.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.35.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.35.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.35.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.self_attn.indexer.index_qk_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.self_attn.indexer.k_layernorm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.self_attn.indexer.q_layernorm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.self_attn.k_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.self_attn.k_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.self_attn.o_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.self_attn.q_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.self_attn.q_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.35.self_attn.v_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.linear_attn.A_log": "model-00002-of-00002.safetensors", | |
| "model.layers.36.linear_attn.conv1d.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.linear_attn.dt_bias": "model-00002-of-00002.safetensors", | |
| "model.layers.36.linear_attn.in_proj_a.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.linear_attn.in_proj_b.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.linear_attn.in_proj_qkv.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.linear_attn.in_proj_z.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.linear_attn.norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.linear_attn.out_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.36.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.36.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.36.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.36.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.36.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.linear_attn.A_log": "model-00002-of-00002.safetensors", | |
| "model.layers.37.linear_attn.conv1d.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.linear_attn.dt_bias": "model-00002-of-00002.safetensors", | |
| "model.layers.37.linear_attn.in_proj_a.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.linear_attn.in_proj_b.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.linear_attn.in_proj_qkv.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.linear_attn.in_proj_z.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.linear_attn.norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.linear_attn.out_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.37.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.37.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.37.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.37.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.37.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.linear_attn.A_log": "model-00002-of-00002.safetensors", | |
| "model.layers.38.linear_attn.conv1d.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.linear_attn.dt_bias": "model-00002-of-00002.safetensors", | |
| "model.layers.38.linear_attn.in_proj_a.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.linear_attn.in_proj_b.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.linear_attn.in_proj_qkv.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.linear_attn.in_proj_z.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.linear_attn.norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.linear_attn.out_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.38.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.38.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.38.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.38.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.38.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.39.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.39.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.39.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.39.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.self_attn.indexer.index_qk_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.self_attn.indexer.k_layernorm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.self_attn.indexer.q_layernorm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.self_attn.k_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.self_attn.k_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.self_attn.o_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.self_attn.q_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.self_attn.q_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.39.self_attn.v_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.linear_attn.A_log": "model-00002-of-00002.safetensors", | |
| "model.layers.40.linear_attn.conv1d.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.linear_attn.dt_bias": "model-00002-of-00002.safetensors", | |
| "model.layers.40.linear_attn.in_proj_a.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.linear_attn.in_proj_b.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.linear_attn.in_proj_qkv.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.linear_attn.in_proj_z.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.linear_attn.norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.linear_attn.out_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.40.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.40.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.40.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.40.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.40.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.linear_attn.A_log": "model-00002-of-00002.safetensors", | |
| "model.layers.41.linear_attn.conv1d.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.linear_attn.dt_bias": "model-00002-of-00002.safetensors", | |
| "model.layers.41.linear_attn.in_proj_a.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.linear_attn.in_proj_b.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.linear_attn.in_proj_qkv.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.linear_attn.in_proj_z.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.linear_attn.norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.linear_attn.out_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.41.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.41.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.41.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.41.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.41.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.linear_attn.A_log": "model-00002-of-00002.safetensors", | |
| "model.layers.42.linear_attn.conv1d.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.linear_attn.dt_bias": "model-00002-of-00002.safetensors", | |
| "model.layers.42.linear_attn.in_proj_a.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.linear_attn.in_proj_b.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.linear_attn.in_proj_qkv.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.linear_attn.in_proj_z.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.linear_attn.norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.linear_attn.out_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.42.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.42.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.42.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.42.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.42.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.43.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.43.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.43.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.43.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.self_attn.indexer.index_qk_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.self_attn.indexer.k_layernorm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.self_attn.indexer.q_layernorm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.self_attn.k_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.self_attn.k_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.self_attn.o_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.self_attn.q_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.self_attn.q_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.43.self_attn.v_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.linear_attn.A_log": "model-00002-of-00002.safetensors", | |
| "model.layers.44.linear_attn.conv1d.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.linear_attn.dt_bias": "model-00002-of-00002.safetensors", | |
| "model.layers.44.linear_attn.in_proj_a.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.linear_attn.in_proj_b.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.linear_attn.in_proj_qkv.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.linear_attn.in_proj_z.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.linear_attn.norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.linear_attn.out_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.44.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.44.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.44.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.44.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.44.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.linear_attn.A_log": "model-00002-of-00002.safetensors", | |
| "model.layers.45.linear_attn.conv1d.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.linear_attn.dt_bias": "model-00002-of-00002.safetensors", | |
| "model.layers.45.linear_attn.in_proj_a.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.linear_attn.in_proj_b.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.linear_attn.in_proj_qkv.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.linear_attn.in_proj_z.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.linear_attn.norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.linear_attn.out_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.45.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.45.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.45.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.45.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.45.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.linear_attn.A_log": "model-00002-of-00002.safetensors", | |
| "model.layers.46.linear_attn.conv1d.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.linear_attn.dt_bias": "model-00002-of-00002.safetensors", | |
| "model.layers.46.linear_attn.in_proj_a.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.linear_attn.in_proj_b.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.linear_attn.in_proj_qkv.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.linear_attn.in_proj_z.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.linear_attn.norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.linear_attn.out_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.46.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.46.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.46.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.46.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.46.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.47.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.47.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.47.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.47.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.self_attn.indexer.index_qk_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.self_attn.indexer.k_layernorm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.self_attn.indexer.q_layernorm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.self_attn.k_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.self_attn.k_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.self_attn.o_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.self_attn.q_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.self_attn.q_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.47.self_attn.v_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.8.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.8.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.8.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.8.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.8.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.8.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.8.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.8.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.8.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.attn_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.attn_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.attn_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.attn_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.linear_attn.A_log": "model-00002-of-00002.safetensors", | |
| "model.layers.9.linear_attn.conv1d.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.linear_attn.dt_bias": "model-00002-of-00002.safetensors", | |
| "model.layers.9.linear_attn.in_proj_a.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.linear_attn.in_proj_b.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.linear_attn.in_proj_qkv.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.linear_attn.in_proj_z.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.linear_attn.norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.linear_attn.out_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.mlp.experts.down_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.9.mlp.experts.down_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.9.mlp.experts.gate_up_proj": "model-00002-of-00002.safetensors", | |
| "model.layers.9.mlp.experts.gate_up_proj_scale": "model-00002-of-00002.safetensors", | |
| "model.layers.9.mlp.gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.mlp.shared_expert.down_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.mlp.shared_expert.gate_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.mlp.shared_expert.up_proj.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.mlp.shared_expert_gate.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.mlp_hyper_connection.block_inject_weight.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.mlp_hyper_connection.hc_norm.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.mlp_hyper_connection.input_mix_weight_down.weight": "model-00002-of-00002.safetensors", | |
| "model.layers.9.mlp_hyper_connection.input_mix_weight_up.weight": "model-00002-of-00002.safetensors" | |
| } | |
| } |