Instructions to use TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF", trust_remote_code=True)# Load model directly from transformers import AutoModelForCausalLM model = AutoModelForCausalLM.from_pretrained("TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF
- SGLang
How to use TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF with Docker Model Runner:
docker model run hf.co/TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF
Download pytorch_model.bin.index.json from TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF: direct link, hf CLI and curl.
- Browser
- Download file 56.6 kB
-
https://huggingface.co/TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF/resolve/main/pytorch_model.bin.index.json
- Command line
-
hf download hf://TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF/pytorch_model.bin.index.json
-
curl -L -o pytorch_model.bin.index.json https://huggingface.co/TimeMobius/Mobius-RWKV-Chat-12B-128k-v4-HF/resolve/main/pytorch_model.bin.index.json
56.6 kB
| { | |
| "metadata": { | |
| "total_size": 23157186560 | |
| }, | |
| "weight_map": { | |
| "head.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.0.attention.gate.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.attention.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.attention.output.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.attention.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.attention.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.feed_forward.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.feed_forward.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.feed_forward.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.pre_ln.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.0.pre_ln.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.attention.gate.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.attention.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.attention.output.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.attention.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.attention.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.feed_forward.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.feed_forward.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.feed_forward.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.1.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.attention.gate.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.attention.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.attention.output.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.attention.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.attention.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.feed_forward.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.feed_forward.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.feed_forward.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.10.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.attention.gate.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.attention.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.attention.output.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.attention.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.attention.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.feed_forward.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.feed_forward.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.feed_forward.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.11.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.attention.gate.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.attention.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.attention.output.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.attention.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.attention.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.feed_forward.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.feed_forward.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.feed_forward.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.12.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.attention.gate.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.attention.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.attention.output.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.attention.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.attention.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.feed_forward.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.feed_forward.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.feed_forward.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.13.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.attention.gate.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.attention.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.attention.output.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.attention.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.attention.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.feed_forward.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.feed_forward.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.feed_forward.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.14.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.attention.gate.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.attention.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.attention.output.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.attention.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.attention.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.feed_forward.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.feed_forward.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.feed_forward.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.15.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.attention.gate.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.attention.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.attention.output.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.attention.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.attention.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.feed_forward.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.feed_forward.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.feed_forward.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.16.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.attention.gate.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.attention.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.attention.output.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.attention.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.attention.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.feed_forward.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.feed_forward.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.feed_forward.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.17.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.attention.gate.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.attention.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.attention.output.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.attention.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.attention.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.feed_forward.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.feed_forward.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.feed_forward.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.18.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.attention.gate.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.attention.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.attention.output.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.attention.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.attention.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.feed_forward.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.feed_forward.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.feed_forward.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.19.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.attention.gate.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.attention.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.attention.output.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.attention.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.attention.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.feed_forward.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.feed_forward.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.feed_forward.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.2.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.attention.gate.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.attention.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.attention.output.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.attention.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.attention.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.feed_forward.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.feed_forward.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.feed_forward.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.20.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.attention.gate.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.attention.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.attention.output.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.attention.receptance.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.attention.value.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.feed_forward.key.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.feed_forward.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.21.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.feed_forward.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.21.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.21.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.22.attention.gate.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.22.attention.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.22.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.22.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.22.attention.output.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.22.attention.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.22.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.22.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.22.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.22.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.22.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.22.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.22.attention.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.22.feed_forward.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.22.feed_forward.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.22.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.22.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.22.feed_forward.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.22.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.22.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.22.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.22.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.23.attention.gate.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.23.attention.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.23.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.23.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.23.attention.output.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.23.attention.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.23.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.23.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.23.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.23.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.23.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.23.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.23.attention.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.23.feed_forward.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.23.feed_forward.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.23.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.23.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.23.feed_forward.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.23.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.23.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.23.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.23.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.24.attention.gate.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.24.attention.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.24.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.24.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.24.attention.output.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.24.attention.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.24.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.24.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.24.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.24.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.24.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.24.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.24.attention.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.24.feed_forward.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.24.feed_forward.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.24.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.24.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.24.feed_forward.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.24.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.24.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.24.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.24.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.25.attention.gate.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.25.attention.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.25.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.25.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.25.attention.output.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.25.attention.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.25.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.25.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.25.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.25.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.25.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.25.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.25.attention.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.25.feed_forward.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.25.feed_forward.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.25.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.25.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.25.feed_forward.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.25.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.25.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.25.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.25.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.26.attention.gate.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.26.attention.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.26.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.26.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.26.attention.output.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.26.attention.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.26.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.26.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.26.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.26.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.26.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.26.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.26.attention.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.26.feed_forward.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.26.feed_forward.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.26.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.26.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.26.feed_forward.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.26.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.26.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.26.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.26.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.27.attention.gate.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.27.attention.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.27.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.27.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.27.attention.output.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.27.attention.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.27.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.27.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.27.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.27.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.27.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.27.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.27.attention.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.27.feed_forward.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.27.feed_forward.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.27.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.27.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.27.feed_forward.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.27.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.27.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.27.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.27.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.28.attention.gate.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.28.attention.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.28.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.28.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.28.attention.output.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.28.attention.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.28.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.28.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.28.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.28.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.28.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.28.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.28.attention.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.28.feed_forward.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.28.feed_forward.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.28.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.28.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.28.feed_forward.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.28.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.28.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.28.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.28.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.29.attention.gate.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.29.attention.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.29.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.29.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.29.attention.output.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.29.attention.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.29.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.29.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.29.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.29.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.29.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.29.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.29.attention.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.29.feed_forward.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.29.feed_forward.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.29.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.29.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.29.feed_forward.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.29.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.29.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.29.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.29.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.3.attention.gate.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.3.attention.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.3.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.3.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.3.attention.output.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.3.attention.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.3.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.3.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.3.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.3.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.3.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.3.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.3.attention.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.3.feed_forward.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.3.feed_forward.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.3.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.3.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.3.feed_forward.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.3.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.3.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.3.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.3.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.30.attention.gate.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.30.attention.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.30.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.30.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.30.attention.output.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.30.attention.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.30.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.30.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.30.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.30.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.30.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.30.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.30.attention.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.30.feed_forward.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.30.feed_forward.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.30.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.30.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.30.feed_forward.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.30.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.30.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.30.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.30.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.31.attention.gate.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.31.attention.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.31.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.31.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.31.attention.output.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.31.attention.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.31.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.31.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.31.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.31.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.31.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.31.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.31.attention.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.31.feed_forward.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.31.feed_forward.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.31.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.31.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.31.feed_forward.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.31.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.31.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.31.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.31.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.4.attention.gate.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.4.attention.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.4.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.4.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.4.attention.output.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.4.attention.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.4.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.4.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.4.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.4.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.4.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.4.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.4.attention.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.4.feed_forward.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.4.feed_forward.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.4.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.4.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.4.feed_forward.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.4.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.4.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.4.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.4.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.5.attention.gate.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.5.attention.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.5.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.5.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.5.attention.output.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.5.attention.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.5.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.5.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.5.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.5.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.5.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.5.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.5.attention.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.5.feed_forward.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.5.feed_forward.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.5.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.5.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.5.feed_forward.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.5.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.5.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.5.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.5.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.6.attention.gate.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.6.attention.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.6.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.6.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.6.attention.output.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.6.attention.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.6.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.6.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.6.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.6.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.6.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.6.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.6.attention.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.6.feed_forward.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.6.feed_forward.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.6.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.6.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.6.feed_forward.value.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.6.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.6.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.6.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.6.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.7.attention.gate.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.7.attention.key.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.7.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.7.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.7.attention.output.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.7.attention.receptance.weight": "pytorch_model-00002-of-00003.bin", | |
| "rwkv.blocks.7.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.7.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.7.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.7.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.7.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.7.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.7.attention.value.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.7.feed_forward.key.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.7.feed_forward.receptance.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.7.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.7.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.7.feed_forward.value.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.7.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.7.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.7.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.7.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.8.attention.gate.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.8.attention.key.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.8.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.8.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.8.attention.output.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.8.attention.receptance.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.8.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.8.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.8.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.8.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.8.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.8.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.8.attention.value.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.8.feed_forward.key.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.8.feed_forward.receptance.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.8.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.8.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.8.feed_forward.value.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.8.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.8.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.8.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.8.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.9.attention.gate.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.9.attention.key.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.9.attention.ln_x.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.9.attention.ln_x.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.9.attention.output.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.9.attention.receptance.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.9.attention.time_decay": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.9.attention.time_faaaa": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.9.attention.time_mix_gate": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.9.attention.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.9.attention.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.9.attention.time_mix_value": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.9.attention.value.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.9.feed_forward.key.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.9.feed_forward.receptance.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.9.feed_forward.time_mix_key": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.9.feed_forward.time_mix_receptance": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.9.feed_forward.value.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.blocks.9.ln1.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.9.ln1.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.9.ln2.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.blocks.9.ln2.weight": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.embeddings.weight": "pytorch_model-00003-of-00003.bin", | |
| "rwkv.ln_out.bias": "pytorch_model-00001-of-00003.bin", | |
| "rwkv.ln_out.weight": "pytorch_model-00001-of-00003.bin" | |
| } | |
| } | |