Instructions to use ElnaggarLab/ankh3-xl with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use ElnaggarLab/ankh3-xl with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("feature-extraction", model="ElnaggarLab/ankh3-xl")# Load model directly from transformers import AutoTokenizer, AutoModelForSeq2SeqLM tokenizer = AutoTokenizer.from_pretrained("ElnaggarLab/ankh3-xl") model = AutoModelForSeq2SeqLM.from_pretrained("ElnaggarLab/ankh3-xl", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Download pytorch_model.bin.index.json from ElnaggarLab/ankh3-xl: direct link, hf CLI and curl.
- Browser
- Download file 70.4 kB
-
https://huggingface.co/ElnaggarLab/ankh3-xl/resolve/main/pytorch_model.bin.index.json
- Command line
-
hf download hf://ElnaggarLab/ankh3-xl/pytorch_model.bin.index.json
-
curl -L -o pytorch_model.bin.index.json https://huggingface.co/ElnaggarLab/ankh3-xl/resolve/main/pytorch_model.bin.index.json
70.4 kB
| { | |
| "metadata": { | |
| "total_size": 22923628544 | |
| }, | |
| "weight_map": { | |
| "decoder.block.0.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.0.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.0.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.0.layer.0.SelfAttention.relative_attention_bias.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.0.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.0.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.0.layer.1.EncDecAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.0.layer.1.EncDecAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.0.layer.1.EncDecAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.0.layer.1.EncDecAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.0.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.0.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.0.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.0.layer.2.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.0.layer.2.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.1.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.1.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.1.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.1.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.1.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.1.layer.1.EncDecAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.1.layer.1.EncDecAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.1.layer.1.EncDecAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.1.layer.1.EncDecAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.1.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.1.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.1.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.1.layer.2.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.1.layer.2.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.10.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.10.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.10.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.10.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.10.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.10.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.10.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.10.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.10.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.10.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.10.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.10.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.10.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.10.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.11.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.11.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.11.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.11.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.11.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.11.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.11.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.11.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.11.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.11.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.11.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.11.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.11.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.11.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.12.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.12.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.12.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.12.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.12.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.12.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.12.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.12.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.12.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.12.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.12.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.12.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.12.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.12.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.13.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.13.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.13.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.13.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.13.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.13.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.13.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.13.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.13.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.13.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.13.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.13.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.13.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.13.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.14.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.14.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.14.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.14.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.14.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.14.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.14.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.14.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.14.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.14.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.14.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.14.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.14.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.14.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.15.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.15.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.15.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.15.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.15.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.15.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.15.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.15.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.15.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.15.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.15.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.15.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.15.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.15.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.16.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.16.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.16.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.16.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.16.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.16.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.16.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.16.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.16.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.16.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.16.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.16.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.16.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.16.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.17.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.17.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.17.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.17.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.17.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.17.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.17.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.17.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.17.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.17.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.17.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.17.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.17.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.17.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.18.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.18.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.18.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.18.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.18.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.18.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.18.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.18.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.18.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.18.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.18.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.18.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.18.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.18.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.19.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.19.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.19.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.19.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.19.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.19.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.19.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.19.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.19.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.19.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.19.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.19.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.19.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.19.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.2.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.2.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.2.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.2.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.2.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.2.layer.1.EncDecAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.2.layer.1.EncDecAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.2.layer.1.EncDecAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.2.layer.1.EncDecAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.2.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.2.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.2.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.2.layer.2.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.2.layer.2.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.20.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.20.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.20.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.20.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.20.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.20.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.20.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.20.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.20.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.20.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.20.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.20.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.20.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.20.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.21.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.21.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.21.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.21.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.21.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.21.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.21.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.21.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.21.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.21.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.21.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.21.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.21.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.21.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.22.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.22.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.22.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.22.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.22.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.22.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.22.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.22.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.22.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.22.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.22.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.22.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.22.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.22.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.23.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.23.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.23.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.23.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.23.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.23.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.23.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.23.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.23.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.23.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.23.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.23.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.23.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.23.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.3.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.3.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.3.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.3.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.3.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.3.layer.1.EncDecAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.3.layer.1.EncDecAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.3.layer.1.EncDecAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.3.layer.1.EncDecAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.3.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.3.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.3.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.3.layer.2.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.3.layer.2.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.4.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.4.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.4.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.4.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.4.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.4.layer.1.EncDecAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.4.layer.1.EncDecAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.4.layer.1.EncDecAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.4.layer.1.EncDecAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.4.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.4.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.4.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.4.layer.2.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.4.layer.2.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.5.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.5.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.5.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.5.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.5.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.5.layer.1.EncDecAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.5.layer.1.EncDecAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.5.layer.1.EncDecAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.5.layer.1.EncDecAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.5.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "decoder.block.5.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.5.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.5.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.5.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.6.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.6.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.6.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.6.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.6.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.6.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.6.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.6.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.6.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.6.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.6.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.6.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.6.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.6.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.7.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.7.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.7.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.7.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.7.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.7.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.7.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.7.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.7.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.7.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.7.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.7.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.7.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.7.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.8.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.8.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.8.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.8.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.8.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.8.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.8.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.8.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.8.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.8.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.8.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.8.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.8.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.8.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.9.layer.0.SelfAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.9.layer.0.SelfAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.9.layer.0.SelfAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.9.layer.0.SelfAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.9.layer.0.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.9.layer.1.EncDecAttention.k.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.9.layer.1.EncDecAttention.o.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.9.layer.1.EncDecAttention.q.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.9.layer.1.EncDecAttention.v.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.9.layer.1.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.9.layer.2.DenseReluDense.wi_0.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.9.layer.2.DenseReluDense.wi_1.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.9.layer.2.DenseReluDense.wo.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.block.9.layer.2.layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "decoder.embed_tokens.weight": "pytorch_model-00001-of-00003.bin", | |
| "decoder.final_layer_norm.weight": "pytorch_model-00003-of-00003.bin", | |
| "encoder.block.0.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.0.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.0.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.0.layer.0.SelfAttention.relative_attention_bias.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.0.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.0.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.0.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.0.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.0.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.0.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.1.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.1.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.1.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.1.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.1.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.1.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.1.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.1.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.1.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.10.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.10.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.10.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.10.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.10.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.10.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.10.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.10.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.10.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.11.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.11.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.11.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.11.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.11.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.11.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.11.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.11.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.11.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.12.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.12.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.12.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.12.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.12.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.12.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.12.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.12.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.12.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.13.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.13.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.13.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.13.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.13.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.13.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.13.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.13.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.13.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.14.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.14.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.14.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.14.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.14.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.14.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.14.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.14.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.14.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.15.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.15.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.15.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.15.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.15.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.15.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.15.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.15.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.15.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.16.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.16.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.16.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.16.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.16.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.16.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.16.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.16.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.16.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.17.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.17.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.17.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.17.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.17.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.17.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.17.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.17.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.17.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.18.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.18.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.18.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.18.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.18.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.18.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.18.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.18.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.18.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.19.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.19.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.19.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.19.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.19.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.19.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.19.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.19.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.19.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.2.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.2.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.2.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.2.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.2.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.2.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.2.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.2.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.2.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.20.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.20.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.20.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.20.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.20.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.20.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.20.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.20.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.20.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.21.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.21.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.21.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.21.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.21.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.21.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.21.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.21.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.21.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.22.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.22.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.22.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.22.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.22.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.22.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.22.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.22.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.22.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.23.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.23.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.23.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.23.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.23.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.23.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.23.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.23.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.23.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.24.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.24.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.24.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.24.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.24.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.24.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.24.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.24.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.24.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.25.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.25.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.25.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.25.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.25.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.25.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.25.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.25.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.25.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.26.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.26.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.26.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.26.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.26.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.26.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.26.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.26.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.26.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.27.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.27.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.27.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.27.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.27.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.27.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.27.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.27.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.27.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.28.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.28.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.28.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.28.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.28.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.28.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.28.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.28.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.28.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.29.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.29.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.29.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.29.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.29.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.29.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.29.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.29.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.29.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.3.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.3.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.3.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.3.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.3.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.3.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.3.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.3.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.3.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.30.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.30.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.30.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.30.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.30.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.30.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.30.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.30.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.30.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.31.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.31.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.31.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.31.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.31.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.31.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.31.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.31.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.31.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.32.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.32.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.32.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.32.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.32.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.32.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.32.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.32.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.32.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.33.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.33.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.33.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.33.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.33.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.33.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.33.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.33.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.33.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.34.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.34.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.34.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.34.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.34.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.34.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.34.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.34.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.34.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.35.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.35.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.35.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.35.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.35.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.35.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.35.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.35.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.35.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.36.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.36.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.36.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.36.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.36.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.36.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.36.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.36.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.36.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.37.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.37.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.37.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.37.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.37.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.37.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.37.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.37.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.37.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.38.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.38.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.38.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.38.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.38.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.38.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.38.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.38.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.38.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.39.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.39.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.39.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.39.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.39.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.39.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.39.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.39.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.39.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.4.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.4.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.4.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.4.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.4.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.4.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.4.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.4.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.4.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.40.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.40.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.40.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.40.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.40.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.40.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.40.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.40.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.40.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.41.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.41.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.41.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.41.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.41.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.41.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.41.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.41.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.41.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.42.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.42.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.42.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.42.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.42.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.42.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.42.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.42.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.42.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.43.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.43.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.43.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.43.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.43.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.43.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.43.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.43.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.43.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.44.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.44.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.44.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.44.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.44.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.44.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.44.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.44.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.44.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.45.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.45.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.45.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.45.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.45.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.45.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.45.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.45.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.45.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.46.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.46.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.46.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.46.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.46.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.46.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.46.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.46.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.46.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.47.layer.0.SelfAttention.k.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.47.layer.0.SelfAttention.o.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.47.layer.0.SelfAttention.q.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.47.layer.0.SelfAttention.v.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.47.layer.0.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.47.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.47.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.47.layer.1.DenseReluDense.wo.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.47.layer.1.layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "encoder.block.5.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.5.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.5.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.5.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.5.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.5.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.5.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.5.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.5.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.6.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.6.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.6.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.6.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.6.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.6.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.6.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.6.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.6.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.7.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.7.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.7.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.7.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.7.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.7.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.7.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.7.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.7.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.8.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.8.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.8.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.8.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.8.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.8.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.8.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.8.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.8.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.9.layer.0.SelfAttention.k.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.9.layer.0.SelfAttention.o.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.9.layer.0.SelfAttention.q.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.9.layer.0.SelfAttention.v.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.9.layer.0.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.9.layer.1.DenseReluDense.wi_0.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.9.layer.1.DenseReluDense.wi_1.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.9.layer.1.DenseReluDense.wo.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.block.9.layer.1.layer_norm.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.embed_tokens.weight": "pytorch_model-00001-of-00003.bin", | |
| "encoder.final_layer_norm.weight": "pytorch_model-00002-of-00003.bin", | |
| "lm_head.weight": "pytorch_model-00003-of-00003.bin", | |
| "shared.weight": "pytorch_model-00001-of-00003.bin" | |
| } | |
| } | |