Instructions to use meituan-longcat/LongCat-2.0-FP8 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use meituan-longcat/LongCat-2.0-FP8 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="meituan-longcat/LongCat-2.0-FP8") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import LongcatCausalLM model = LongcatCausalLM.from_pretrained("meituan-longcat/LongCat-2.0-FP8", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use meituan-longcat/LongCat-2.0-FP8 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "meituan-longcat/LongCat-2.0-FP8" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "meituan-longcat/LongCat-2.0-FP8", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/meituan-longcat/LongCat-2.0-FP8
- SGLang
How to use meituan-longcat/LongCat-2.0-FP8 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "meituan-longcat/LongCat-2.0-FP8" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "meituan-longcat/LongCat-2.0-FP8", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "meituan-longcat/LongCat-2.0-FP8" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "meituan-longcat/LongCat-2.0-FP8", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use meituan-longcat/LongCat-2.0-FP8 with Docker Model Runner:
docker model run hf.co/meituan-longcat/LongCat-2.0-FP8
Add files using upload-large-folder tool
Browse files- config.json +640 -0
- generation_config.json +7 -0
- megatron_config.json +1 -0
- model-00001-of-00141.safetensors +3 -0
- model-00002-of-00141.safetensors +3 -0
- model-00003-of-00141.safetensors +3 -0
- model-00004-of-00141.safetensors +3 -0
- model-00005-of-00141.safetensors +3 -0
- model-00006-of-00141.safetensors +3 -0
- model-00007-of-00141.safetensors +3 -0
- model-00008-of-00141.safetensors +3 -0
- model-00009-of-00141.safetensors +3 -0
- model-00010-of-00141.safetensors +3 -0
- model-00011-of-00141.safetensors +3 -0
- model-00012-of-00141.safetensors +3 -0
- model-00013-of-00141.safetensors +3 -0
- model-00014-of-00141.safetensors +3 -0
- model-00015-of-00141.safetensors +3 -0
- model-00016-of-00141.safetensors +3 -0
- model-00017-of-00141.safetensors +3 -0
- model-00018-of-00141.safetensors +3 -0
- model-00019-of-00141.safetensors +3 -0
- model-00020-of-00141.safetensors +3 -0
- model-00021-of-00141.safetensors +3 -0
- model-00022-of-00141.safetensors +3 -0
- model-00023-of-00141.safetensors +3 -0
- model-00024-of-00141.safetensors +3 -0
- model-00025-of-00141.safetensors +3 -0
- model-00026-of-00141.safetensors +3 -0
- model-00027-of-00141.safetensors +3 -0
- model-00028-of-00141.safetensors +3 -0
- model-00029-of-00141.safetensors +3 -0
- model-00030-of-00141.safetensors +3 -0
- model-00031-of-00141.safetensors +3 -0
- model-00032-of-00141.safetensors +3 -0
- model-00033-of-00141.safetensors +3 -0
- model-00034-of-00141.safetensors +3 -0
- model-00035-of-00141.safetensors +3 -0
- model-00036-of-00141.safetensors +3 -0
- model-00037-of-00141.safetensors +3 -0
- model-00038-of-00141.safetensors +3 -0
- model-00039-of-00141.safetensors +3 -0
- model-00072-of-00141.safetensors +3 -0
- model-00077-of-00141.safetensors +3 -0
- model-00081-of-00141.safetensors +3 -0
- model-00088-of-00141.safetensors +3 -0
- special_tokens_map.json +30 -0
- tokenization_llama.py +231 -0
- tokenizer.json +0 -0
- tokenizer_config.json +42 -0
config.json
ADDED
|
@@ -0,0 +1,640 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"LongcatCausalLM"
|
| 4 |
+
],
|
| 5 |
+
"attention_bias": false,
|
| 6 |
+
"attention_dropout": 0.0,
|
| 7 |
+
"attention_method": "MLA",
|
| 8 |
+
"bos_token_id": 1,
|
| 9 |
+
"cli_factor": 2,
|
| 10 |
+
"disable_quant_module": [],
|
| 11 |
+
"dsa_mtp_cli": true,
|
| 12 |
+
"eos_token_id": 2,
|
| 13 |
+
"expert_ffn_hidden_size": 2048,
|
| 14 |
+
"ffn_hidden_size": 12288,
|
| 15 |
+
"hidden_size": 8192,
|
| 16 |
+
"index_head_dim": 128,
|
| 17 |
+
"index_init_tokens": 16,
|
| 18 |
+
"index_k_norm_type": "rms",
|
| 19 |
+
"index_local_tokens": 1024,
|
| 20 |
+
"index_n_heads": 32,
|
| 21 |
+
"index_topk": 2048,
|
| 22 |
+
"kv_lora_rank": 512,
|
| 23 |
+
"max_position_embeddings": 262144,
|
| 24 |
+
"mla_scale_kv_lora": true,
|
| 25 |
+
"mla_scale_q_lora": true,
|
| 26 |
+
"moe_impl": "mix",
|
| 27 |
+
"moe_switch_token_num": 1024,
|
| 28 |
+
"moe_topk": 12,
|
| 29 |
+
"mtp_disable_over_tokenizer": true,
|
| 30 |
+
"mtp_num_layers": 3,
|
| 31 |
+
"mtp_replicate_modules": true,
|
| 32 |
+
"n_routed_experts": 768,
|
| 33 |
+
"num_attention_heads": 64,
|
| 34 |
+
"num_layers": 38,
|
| 35 |
+
"oe_neighbor_num": 5,
|
| 36 |
+
"oe_split_num": 4,
|
| 37 |
+
"oe_vocab_size_ratio": 100.567,
|
| 38 |
+
"q_lora_rank": 1536,
|
| 39 |
+
"qk_nope_head_dim": 128,
|
| 40 |
+
"qk_rope_head_dim": 64,
|
| 41 |
+
"quantization_config": {
|
| 42 |
+
"activation_scheme": "dynamic",
|
| 43 |
+
"fmt": "e4m3",
|
| 44 |
+
"ignored_layers": [
|
| 45 |
+
"lm_head",
|
| 46 |
+
"model.embed_tokens",
|
| 47 |
+
"model.layers.0.input_layernorm.0",
|
| 48 |
+
"model.layers.0.input_layernorm.1",
|
| 49 |
+
"model.layers.0.mlp.router.classifier",
|
| 50 |
+
"model.layers.0.mlp.router.e_score_correction_bias",
|
| 51 |
+
"model.layers.0.post_attention_layernorm.0",
|
| 52 |
+
"model.layers.0.post_attention_layernorm.1",
|
| 53 |
+
"model.layers.0.self_attn.0.indexer.k_norm",
|
| 54 |
+
"model.layers.0.self_attn.0.indexer.weights_proj",
|
| 55 |
+
"model.layers.0.self_attn.0.indexer.wq_b",
|
| 56 |
+
"model.layers.0.self_attn.0.kv_a_layernorm",
|
| 57 |
+
"model.layers.0.self_attn.0.q_a_layernorm",
|
| 58 |
+
"model.layers.0.self_attn.1.kv_a_layernorm",
|
| 59 |
+
"model.layers.0.self_attn.1.q_a_layernorm",
|
| 60 |
+
"model.layers.1.input_layernorm.0",
|
| 61 |
+
"model.layers.1.input_layernorm.1",
|
| 62 |
+
"model.layers.1.mlp.router.classifier",
|
| 63 |
+
"model.layers.1.mlp.router.e_score_correction_bias",
|
| 64 |
+
"model.layers.1.post_attention_layernorm.0",
|
| 65 |
+
"model.layers.1.post_attention_layernorm.1",
|
| 66 |
+
"model.layers.1.self_attn.0.indexer.k_norm",
|
| 67 |
+
"model.layers.1.self_attn.0.indexer.weights_proj",
|
| 68 |
+
"model.layers.1.self_attn.0.indexer.wq_b",
|
| 69 |
+
"model.layers.1.self_attn.0.kv_a_layernorm",
|
| 70 |
+
"model.layers.1.self_attn.0.q_a_layernorm",
|
| 71 |
+
"model.layers.1.self_attn.1.kv_a_layernorm",
|
| 72 |
+
"model.layers.1.self_attn.1.q_a_layernorm",
|
| 73 |
+
"model.layers.10.input_layernorm.0",
|
| 74 |
+
"model.layers.10.input_layernorm.1",
|
| 75 |
+
"model.layers.10.mlp.router.classifier",
|
| 76 |
+
"model.layers.10.mlp.router.e_score_correction_bias",
|
| 77 |
+
"model.layers.10.post_attention_layernorm.0",
|
| 78 |
+
"model.layers.10.post_attention_layernorm.1",
|
| 79 |
+
"model.layers.10.self_attn.0.indexer.k_norm",
|
| 80 |
+
"model.layers.10.self_attn.0.indexer.weights_proj",
|
| 81 |
+
"model.layers.10.self_attn.0.indexer.wq_b",
|
| 82 |
+
"model.layers.10.self_attn.0.kv_a_layernorm",
|
| 83 |
+
"model.layers.10.self_attn.0.q_a_layernorm",
|
| 84 |
+
"model.layers.10.self_attn.1.kv_a_layernorm",
|
| 85 |
+
"model.layers.10.self_attn.1.q_a_layernorm",
|
| 86 |
+
"model.layers.11.input_layernorm.0",
|
| 87 |
+
"model.layers.11.input_layernorm.1",
|
| 88 |
+
"model.layers.11.mlp.router.classifier",
|
| 89 |
+
"model.layers.11.mlp.router.e_score_correction_bias",
|
| 90 |
+
"model.layers.11.post_attention_layernorm.0",
|
| 91 |
+
"model.layers.11.post_attention_layernorm.1",
|
| 92 |
+
"model.layers.11.self_attn.0.indexer.k_norm",
|
| 93 |
+
"model.layers.11.self_attn.0.indexer.weights_proj",
|
| 94 |
+
"model.layers.11.self_attn.0.indexer.wq_b",
|
| 95 |
+
"model.layers.11.self_attn.0.kv_a_layernorm",
|
| 96 |
+
"model.layers.11.self_attn.0.q_a_layernorm",
|
| 97 |
+
"model.layers.11.self_attn.1.kv_a_layernorm",
|
| 98 |
+
"model.layers.11.self_attn.1.q_a_layernorm",
|
| 99 |
+
"model.layers.12.input_layernorm.0",
|
| 100 |
+
"model.layers.12.input_layernorm.1",
|
| 101 |
+
"model.layers.12.mlp.router.classifier",
|
| 102 |
+
"model.layers.12.mlp.router.e_score_correction_bias",
|
| 103 |
+
"model.layers.12.post_attention_layernorm.0",
|
| 104 |
+
"model.layers.12.post_attention_layernorm.1",
|
| 105 |
+
"model.layers.12.self_attn.0.indexer.k_norm",
|
| 106 |
+
"model.layers.12.self_attn.0.indexer.weights_proj",
|
| 107 |
+
"model.layers.12.self_attn.0.indexer.wq_b",
|
| 108 |
+
"model.layers.12.self_attn.0.kv_a_layernorm",
|
| 109 |
+
"model.layers.12.self_attn.0.q_a_layernorm",
|
| 110 |
+
"model.layers.12.self_attn.1.kv_a_layernorm",
|
| 111 |
+
"model.layers.12.self_attn.1.q_a_layernorm",
|
| 112 |
+
"model.layers.13.input_layernorm.0",
|
| 113 |
+
"model.layers.13.input_layernorm.1",
|
| 114 |
+
"model.layers.13.mlp.router.classifier",
|
| 115 |
+
"model.layers.13.mlp.router.e_score_correction_bias",
|
| 116 |
+
"model.layers.13.post_attention_layernorm.0",
|
| 117 |
+
"model.layers.13.post_attention_layernorm.1",
|
| 118 |
+
"model.layers.13.self_attn.0.indexer.k_norm",
|
| 119 |
+
"model.layers.13.self_attn.0.indexer.weights_proj",
|
| 120 |
+
"model.layers.13.self_attn.0.indexer.wq_b",
|
| 121 |
+
"model.layers.13.self_attn.0.kv_a_layernorm",
|
| 122 |
+
"model.layers.13.self_attn.0.q_a_layernorm",
|
| 123 |
+
"model.layers.13.self_attn.1.kv_a_layernorm",
|
| 124 |
+
"model.layers.13.self_attn.1.q_a_layernorm",
|
| 125 |
+
"model.layers.14.input_layernorm.0",
|
| 126 |
+
"model.layers.14.input_layernorm.1",
|
| 127 |
+
"model.layers.14.mlp.router.classifier",
|
| 128 |
+
"model.layers.14.mlp.router.e_score_correction_bias",
|
| 129 |
+
"model.layers.14.post_attention_layernorm.0",
|
| 130 |
+
"model.layers.14.post_attention_layernorm.1",
|
| 131 |
+
"model.layers.14.self_attn.0.indexer.k_norm",
|
| 132 |
+
"model.layers.14.self_attn.0.indexer.weights_proj",
|
| 133 |
+
"model.layers.14.self_attn.0.indexer.wq_b",
|
| 134 |
+
"model.layers.14.self_attn.0.kv_a_layernorm",
|
| 135 |
+
"model.layers.14.self_attn.0.q_a_layernorm",
|
| 136 |
+
"model.layers.14.self_attn.1.kv_a_layernorm",
|
| 137 |
+
"model.layers.14.self_attn.1.q_a_layernorm",
|
| 138 |
+
"model.layers.15.input_layernorm.0",
|
| 139 |
+
"model.layers.15.input_layernorm.1",
|
| 140 |
+
"model.layers.15.mlp.router.classifier",
|
| 141 |
+
"model.layers.15.mlp.router.e_score_correction_bias",
|
| 142 |
+
"model.layers.15.post_attention_layernorm.0",
|
| 143 |
+
"model.layers.15.post_attention_layernorm.1",
|
| 144 |
+
"model.layers.15.self_attn.0.indexer.k_norm",
|
| 145 |
+
"model.layers.15.self_attn.0.indexer.weights_proj",
|
| 146 |
+
"model.layers.15.self_attn.0.indexer.wq_b",
|
| 147 |
+
"model.layers.15.self_attn.0.kv_a_layernorm",
|
| 148 |
+
"model.layers.15.self_attn.0.q_a_layernorm",
|
| 149 |
+
"model.layers.15.self_attn.1.kv_a_layernorm",
|
| 150 |
+
"model.layers.15.self_attn.1.q_a_layernorm",
|
| 151 |
+
"model.layers.16.input_layernorm.0",
|
| 152 |
+
"model.layers.16.input_layernorm.1",
|
| 153 |
+
"model.layers.16.mlp.router.classifier",
|
| 154 |
+
"model.layers.16.mlp.router.e_score_correction_bias",
|
| 155 |
+
"model.layers.16.post_attention_layernorm.0",
|
| 156 |
+
"model.layers.16.post_attention_layernorm.1",
|
| 157 |
+
"model.layers.16.self_attn.0.indexer.k_norm",
|
| 158 |
+
"model.layers.16.self_attn.0.indexer.weights_proj",
|
| 159 |
+
"model.layers.16.self_attn.0.indexer.wq_b",
|
| 160 |
+
"model.layers.16.self_attn.0.kv_a_layernorm",
|
| 161 |
+
"model.layers.16.self_attn.0.q_a_layernorm",
|
| 162 |
+
"model.layers.16.self_attn.1.kv_a_layernorm",
|
| 163 |
+
"model.layers.16.self_attn.1.q_a_layernorm",
|
| 164 |
+
"model.layers.17.input_layernorm.0",
|
| 165 |
+
"model.layers.17.input_layernorm.1",
|
| 166 |
+
"model.layers.17.mlp.router.classifier",
|
| 167 |
+
"model.layers.17.mlp.router.e_score_correction_bias",
|
| 168 |
+
"model.layers.17.post_attention_layernorm.0",
|
| 169 |
+
"model.layers.17.post_attention_layernorm.1",
|
| 170 |
+
"model.layers.17.self_attn.0.indexer.k_norm",
|
| 171 |
+
"model.layers.17.self_attn.0.indexer.weights_proj",
|
| 172 |
+
"model.layers.17.self_attn.0.indexer.wq_b",
|
| 173 |
+
"model.layers.17.self_attn.0.kv_a_layernorm",
|
| 174 |
+
"model.layers.17.self_attn.0.q_a_layernorm",
|
| 175 |
+
"model.layers.17.self_attn.1.kv_a_layernorm",
|
| 176 |
+
"model.layers.17.self_attn.1.q_a_layernorm",
|
| 177 |
+
"model.layers.18.input_layernorm.0",
|
| 178 |
+
"model.layers.18.input_layernorm.1",
|
| 179 |
+
"model.layers.18.mlp.router.classifier",
|
| 180 |
+
"model.layers.18.mlp.router.e_score_correction_bias",
|
| 181 |
+
"model.layers.18.post_attention_layernorm.0",
|
| 182 |
+
"model.layers.18.post_attention_layernorm.1",
|
| 183 |
+
"model.layers.18.self_attn.0.indexer.k_norm",
|
| 184 |
+
"model.layers.18.self_attn.0.indexer.weights_proj",
|
| 185 |
+
"model.layers.18.self_attn.0.indexer.wq_b",
|
| 186 |
+
"model.layers.18.self_attn.0.kv_a_layernorm",
|
| 187 |
+
"model.layers.18.self_attn.0.q_a_layernorm",
|
| 188 |
+
"model.layers.18.self_attn.1.kv_a_layernorm",
|
| 189 |
+
"model.layers.18.self_attn.1.q_a_layernorm",
|
| 190 |
+
"model.layers.19.input_layernorm.0",
|
| 191 |
+
"model.layers.19.input_layernorm.1",
|
| 192 |
+
"model.layers.19.mlp.router.classifier",
|
| 193 |
+
"model.layers.19.mlp.router.e_score_correction_bias",
|
| 194 |
+
"model.layers.19.post_attention_layernorm.0",
|
| 195 |
+
"model.layers.19.post_attention_layernorm.1",
|
| 196 |
+
"model.layers.19.self_attn.0.indexer.k_norm",
|
| 197 |
+
"model.layers.19.self_attn.0.indexer.weights_proj",
|
| 198 |
+
"model.layers.19.self_attn.0.indexer.wq_b",
|
| 199 |
+
"model.layers.19.self_attn.0.kv_a_layernorm",
|
| 200 |
+
"model.layers.19.self_attn.0.q_a_layernorm",
|
| 201 |
+
"model.layers.19.self_attn.1.kv_a_layernorm",
|
| 202 |
+
"model.layers.19.self_attn.1.q_a_layernorm",
|
| 203 |
+
"model.layers.2.input_layernorm.0",
|
| 204 |
+
"model.layers.2.input_layernorm.1",
|
| 205 |
+
"model.layers.2.mlp.router.classifier",
|
| 206 |
+
"model.layers.2.mlp.router.e_score_correction_bias",
|
| 207 |
+
"model.layers.2.post_attention_layernorm.0",
|
| 208 |
+
"model.layers.2.post_attention_layernorm.1",
|
| 209 |
+
"model.layers.2.self_attn.0.indexer.k_norm",
|
| 210 |
+
"model.layers.2.self_attn.0.indexer.weights_proj",
|
| 211 |
+
"model.layers.2.self_attn.0.indexer.wq_b",
|
| 212 |
+
"model.layers.2.self_attn.0.kv_a_layernorm",
|
| 213 |
+
"model.layers.2.self_attn.0.q_a_layernorm",
|
| 214 |
+
"model.layers.2.self_attn.1.kv_a_layernorm",
|
| 215 |
+
"model.layers.2.self_attn.1.q_a_layernorm",
|
| 216 |
+
"model.layers.20.input_layernorm.0",
|
| 217 |
+
"model.layers.20.input_layernorm.1",
|
| 218 |
+
"model.layers.20.mlp.router.classifier",
|
| 219 |
+
"model.layers.20.mlp.router.e_score_correction_bias",
|
| 220 |
+
"model.layers.20.post_attention_layernorm.0",
|
| 221 |
+
"model.layers.20.post_attention_layernorm.1",
|
| 222 |
+
"model.layers.20.self_attn.0.indexer.k_norm",
|
| 223 |
+
"model.layers.20.self_attn.0.indexer.weights_proj",
|
| 224 |
+
"model.layers.20.self_attn.0.indexer.wq_b",
|
| 225 |
+
"model.layers.20.self_attn.0.kv_a_layernorm",
|
| 226 |
+
"model.layers.20.self_attn.0.q_a_layernorm",
|
| 227 |
+
"model.layers.20.self_attn.1.kv_a_layernorm",
|
| 228 |
+
"model.layers.20.self_attn.1.q_a_layernorm",
|
| 229 |
+
"model.layers.21.input_layernorm.0",
|
| 230 |
+
"model.layers.21.input_layernorm.1",
|
| 231 |
+
"model.layers.21.mlp.router.classifier",
|
| 232 |
+
"model.layers.21.mlp.router.e_score_correction_bias",
|
| 233 |
+
"model.layers.21.post_attention_layernorm.0",
|
| 234 |
+
"model.layers.21.post_attention_layernorm.1",
|
| 235 |
+
"model.layers.21.self_attn.0.indexer.k_norm",
|
| 236 |
+
"model.layers.21.self_attn.0.indexer.weights_proj",
|
| 237 |
+
"model.layers.21.self_attn.0.indexer.wq_b",
|
| 238 |
+
"model.layers.21.self_attn.0.kv_a_layernorm",
|
| 239 |
+
"model.layers.21.self_attn.0.q_a_layernorm",
|
| 240 |
+
"model.layers.21.self_attn.1.kv_a_layernorm",
|
| 241 |
+
"model.layers.21.self_attn.1.q_a_layernorm",
|
| 242 |
+
"model.layers.22.input_layernorm.0",
|
| 243 |
+
"model.layers.22.input_layernorm.1",
|
| 244 |
+
"model.layers.22.mlp.router.classifier",
|
| 245 |
+
"model.layers.22.mlp.router.e_score_correction_bias",
|
| 246 |
+
"model.layers.22.post_attention_layernorm.0",
|
| 247 |
+
"model.layers.22.post_attention_layernorm.1",
|
| 248 |
+
"model.layers.22.self_attn.0.indexer.k_norm",
|
| 249 |
+
"model.layers.22.self_attn.0.indexer.weights_proj",
|
| 250 |
+
"model.layers.22.self_attn.0.indexer.wq_b",
|
| 251 |
+
"model.layers.22.self_attn.0.kv_a_layernorm",
|
| 252 |
+
"model.layers.22.self_attn.0.q_a_layernorm",
|
| 253 |
+
"model.layers.22.self_attn.1.kv_a_layernorm",
|
| 254 |
+
"model.layers.22.self_attn.1.q_a_layernorm",
|
| 255 |
+
"model.layers.23.input_layernorm.0",
|
| 256 |
+
"model.layers.23.input_layernorm.1",
|
| 257 |
+
"model.layers.23.mlp.router.classifier",
|
| 258 |
+
"model.layers.23.mlp.router.e_score_correction_bias",
|
| 259 |
+
"model.layers.23.post_attention_layernorm.0",
|
| 260 |
+
"model.layers.23.post_attention_layernorm.1",
|
| 261 |
+
"model.layers.23.self_attn.0.indexer.k_norm",
|
| 262 |
+
"model.layers.23.self_attn.0.indexer.weights_proj",
|
| 263 |
+
"model.layers.23.self_attn.0.indexer.wq_b",
|
| 264 |
+
"model.layers.23.self_attn.0.kv_a_layernorm",
|
| 265 |
+
"model.layers.23.self_attn.0.q_a_layernorm",
|
| 266 |
+
"model.layers.23.self_attn.1.kv_a_layernorm",
|
| 267 |
+
"model.layers.23.self_attn.1.q_a_layernorm",
|
| 268 |
+
"model.layers.24.input_layernorm.0",
|
| 269 |
+
"model.layers.24.input_layernorm.1",
|
| 270 |
+
"model.layers.24.mlp.router.classifier",
|
| 271 |
+
"model.layers.24.mlp.router.e_score_correction_bias",
|
| 272 |
+
"model.layers.24.post_attention_layernorm.0",
|
| 273 |
+
"model.layers.24.post_attention_layernorm.1",
|
| 274 |
+
"model.layers.24.self_attn.0.indexer.k_norm",
|
| 275 |
+
"model.layers.24.self_attn.0.indexer.weights_proj",
|
| 276 |
+
"model.layers.24.self_attn.0.indexer.wq_b",
|
| 277 |
+
"model.layers.24.self_attn.0.kv_a_layernorm",
|
| 278 |
+
"model.layers.24.self_attn.0.q_a_layernorm",
|
| 279 |
+
"model.layers.24.self_attn.1.kv_a_layernorm",
|
| 280 |
+
"model.layers.24.self_attn.1.q_a_layernorm",
|
| 281 |
+
"model.layers.25.input_layernorm.0",
|
| 282 |
+
"model.layers.25.input_layernorm.1",
|
| 283 |
+
"model.layers.25.mlp.router.classifier",
|
| 284 |
+
"model.layers.25.mlp.router.e_score_correction_bias",
|
| 285 |
+
"model.layers.25.post_attention_layernorm.0",
|
| 286 |
+
"model.layers.25.post_attention_layernorm.1",
|
| 287 |
+
"model.layers.25.self_attn.0.indexer.k_norm",
|
| 288 |
+
"model.layers.25.self_attn.0.indexer.weights_proj",
|
| 289 |
+
"model.layers.25.self_attn.0.indexer.wq_b",
|
| 290 |
+
"model.layers.25.self_attn.0.kv_a_layernorm",
|
| 291 |
+
"model.layers.25.self_attn.0.q_a_layernorm",
|
| 292 |
+
"model.layers.25.self_attn.1.kv_a_layernorm",
|
| 293 |
+
"model.layers.25.self_attn.1.q_a_layernorm",
|
| 294 |
+
"model.layers.26.input_layernorm.0",
|
| 295 |
+
"model.layers.26.input_layernorm.1",
|
| 296 |
+
"model.layers.26.mlp.router.classifier",
|
| 297 |
+
"model.layers.26.mlp.router.e_score_correction_bias",
|
| 298 |
+
"model.layers.26.post_attention_layernorm.0",
|
| 299 |
+
"model.layers.26.post_attention_layernorm.1",
|
| 300 |
+
"model.layers.26.self_attn.0.indexer.k_norm",
|
| 301 |
+
"model.layers.26.self_attn.0.indexer.weights_proj",
|
| 302 |
+
"model.layers.26.self_attn.0.indexer.wq_b",
|
| 303 |
+
"model.layers.26.self_attn.0.kv_a_layernorm",
|
| 304 |
+
"model.layers.26.self_attn.0.q_a_layernorm",
|
| 305 |
+
"model.layers.26.self_attn.1.kv_a_layernorm",
|
| 306 |
+
"model.layers.26.self_attn.1.q_a_layernorm",
|
| 307 |
+
"model.layers.27.input_layernorm.0",
|
| 308 |
+
"model.layers.27.input_layernorm.1",
|
| 309 |
+
"model.layers.27.mlp.router.classifier",
|
| 310 |
+
"model.layers.27.mlp.router.e_score_correction_bias",
|
| 311 |
+
"model.layers.27.post_attention_layernorm.0",
|
| 312 |
+
"model.layers.27.post_attention_layernorm.1",
|
| 313 |
+
"model.layers.27.self_attn.0.indexer.k_norm",
|
| 314 |
+
"model.layers.27.self_attn.0.indexer.weights_proj",
|
| 315 |
+
"model.layers.27.self_attn.0.indexer.wq_b",
|
| 316 |
+
"model.layers.27.self_attn.0.kv_a_layernorm",
|
| 317 |
+
"model.layers.27.self_attn.0.q_a_layernorm",
|
| 318 |
+
"model.layers.27.self_attn.1.kv_a_layernorm",
|
| 319 |
+
"model.layers.27.self_attn.1.q_a_layernorm",
|
| 320 |
+
"model.layers.28.input_layernorm.0",
|
| 321 |
+
"model.layers.28.input_layernorm.1",
|
| 322 |
+
"model.layers.28.mlp.router.classifier",
|
| 323 |
+
"model.layers.28.mlp.router.e_score_correction_bias",
|
| 324 |
+
"model.layers.28.post_attention_layernorm.0",
|
| 325 |
+
"model.layers.28.post_attention_layernorm.1",
|
| 326 |
+
"model.layers.28.self_attn.0.indexer.k_norm",
|
| 327 |
+
"model.layers.28.self_attn.0.indexer.weights_proj",
|
| 328 |
+
"model.layers.28.self_attn.0.indexer.wq_b",
|
| 329 |
+
"model.layers.28.self_attn.0.kv_a_layernorm",
|
| 330 |
+
"model.layers.28.self_attn.0.q_a_layernorm",
|
| 331 |
+
"model.layers.28.self_attn.1.kv_a_layernorm",
|
| 332 |
+
"model.layers.28.self_attn.1.q_a_layernorm",
|
| 333 |
+
"model.layers.29.input_layernorm.0",
|
| 334 |
+
"model.layers.29.input_layernorm.1",
|
| 335 |
+
"model.layers.29.mlp.router.classifier",
|
| 336 |
+
"model.layers.29.mlp.router.e_score_correction_bias",
|
| 337 |
+
"model.layers.29.post_attention_layernorm.0",
|
| 338 |
+
"model.layers.29.post_attention_layernorm.1",
|
| 339 |
+
"model.layers.29.self_attn.0.indexer.k_norm",
|
| 340 |
+
"model.layers.29.self_attn.0.indexer.weights_proj",
|
| 341 |
+
"model.layers.29.self_attn.0.indexer.wq_b",
|
| 342 |
+
"model.layers.29.self_attn.0.kv_a_layernorm",
|
| 343 |
+
"model.layers.29.self_attn.0.q_a_layernorm",
|
| 344 |
+
"model.layers.29.self_attn.1.kv_a_layernorm",
|
| 345 |
+
"model.layers.29.self_attn.1.q_a_layernorm",
|
| 346 |
+
"model.layers.3.input_layernorm.0",
|
| 347 |
+
"model.layers.3.input_layernorm.1",
|
| 348 |
+
"model.layers.3.mlp.router.classifier",
|
| 349 |
+
"model.layers.3.mlp.router.e_score_correction_bias",
|
| 350 |
+
"model.layers.3.post_attention_layernorm.0",
|
| 351 |
+
"model.layers.3.post_attention_layernorm.1",
|
| 352 |
+
"model.layers.3.self_attn.0.indexer.k_norm",
|
| 353 |
+
"model.layers.3.self_attn.0.indexer.weights_proj",
|
| 354 |
+
"model.layers.3.self_attn.0.indexer.wq_b",
|
| 355 |
+
"model.layers.3.self_attn.0.kv_a_layernorm",
|
| 356 |
+
"model.layers.3.self_attn.0.q_a_layernorm",
|
| 357 |
+
"model.layers.3.self_attn.1.kv_a_layernorm",
|
| 358 |
+
"model.layers.3.self_attn.1.q_a_layernorm",
|
| 359 |
+
"model.layers.30.input_layernorm.0",
|
| 360 |
+
"model.layers.30.input_layernorm.1",
|
| 361 |
+
"model.layers.30.mlp.router.classifier",
|
| 362 |
+
"model.layers.30.mlp.router.e_score_correction_bias",
|
| 363 |
+
"model.layers.30.post_attention_layernorm.0",
|
| 364 |
+
"model.layers.30.post_attention_layernorm.1",
|
| 365 |
+
"model.layers.30.self_attn.0.indexer.k_norm",
|
| 366 |
+
"model.layers.30.self_attn.0.indexer.weights_proj",
|
| 367 |
+
"model.layers.30.self_attn.0.indexer.wq_b",
|
| 368 |
+
"model.layers.30.self_attn.0.kv_a_layernorm",
|
| 369 |
+
"model.layers.30.self_attn.0.q_a_layernorm",
|
| 370 |
+
"model.layers.30.self_attn.1.kv_a_layernorm",
|
| 371 |
+
"model.layers.30.self_attn.1.q_a_layernorm",
|
| 372 |
+
"model.layers.31.input_layernorm.0",
|
| 373 |
+
"model.layers.31.input_layernorm.1",
|
| 374 |
+
"model.layers.31.mlp.router.classifier",
|
| 375 |
+
"model.layers.31.mlp.router.e_score_correction_bias",
|
| 376 |
+
"model.layers.31.post_attention_layernorm.0",
|
| 377 |
+
"model.layers.31.post_attention_layernorm.1",
|
| 378 |
+
"model.layers.31.self_attn.0.indexer.k_norm",
|
| 379 |
+
"model.layers.31.self_attn.0.indexer.weights_proj",
|
| 380 |
+
"model.layers.31.self_attn.0.indexer.wq_b",
|
| 381 |
+
"model.layers.31.self_attn.0.kv_a_layernorm",
|
| 382 |
+
"model.layers.31.self_attn.0.q_a_layernorm",
|
| 383 |
+
"model.layers.31.self_attn.1.kv_a_layernorm",
|
| 384 |
+
"model.layers.31.self_attn.1.q_a_layernorm",
|
| 385 |
+
"model.layers.32.input_layernorm.0",
|
| 386 |
+
"model.layers.32.input_layernorm.1",
|
| 387 |
+
"model.layers.32.mlp.router.classifier",
|
| 388 |
+
"model.layers.32.mlp.router.e_score_correction_bias",
|
| 389 |
+
"model.layers.32.post_attention_layernorm.0",
|
| 390 |
+
"model.layers.32.post_attention_layernorm.1",
|
| 391 |
+
"model.layers.32.self_attn.0.indexer.k_norm",
|
| 392 |
+
"model.layers.32.self_attn.0.indexer.weights_proj",
|
| 393 |
+
"model.layers.32.self_attn.0.indexer.wq_b",
|
| 394 |
+
"model.layers.32.self_attn.0.kv_a_layernorm",
|
| 395 |
+
"model.layers.32.self_attn.0.q_a_layernorm",
|
| 396 |
+
"model.layers.32.self_attn.1.kv_a_layernorm",
|
| 397 |
+
"model.layers.32.self_attn.1.q_a_layernorm",
|
| 398 |
+
"model.layers.33.input_layernorm.0",
|
| 399 |
+
"model.layers.33.input_layernorm.1",
|
| 400 |
+
"model.layers.33.mlp.router.classifier",
|
| 401 |
+
"model.layers.33.mlp.router.e_score_correction_bias",
|
| 402 |
+
"model.layers.33.post_attention_layernorm.0",
|
| 403 |
+
"model.layers.33.post_attention_layernorm.1",
|
| 404 |
+
"model.layers.33.self_attn.0.indexer.k_norm",
|
| 405 |
+
"model.layers.33.self_attn.0.indexer.weights_proj",
|
| 406 |
+
"model.layers.33.self_attn.0.indexer.wq_b",
|
| 407 |
+
"model.layers.33.self_attn.0.kv_a_layernorm",
|
| 408 |
+
"model.layers.33.self_attn.0.q_a_layernorm",
|
| 409 |
+
"model.layers.33.self_attn.1.kv_a_layernorm",
|
| 410 |
+
"model.layers.33.self_attn.1.q_a_layernorm",
|
| 411 |
+
"model.layers.34.input_layernorm.0",
|
| 412 |
+
"model.layers.34.input_layernorm.1",
|
| 413 |
+
"model.layers.34.mlp.router.classifier",
|
| 414 |
+
"model.layers.34.mlp.router.e_score_correction_bias",
|
| 415 |
+
"model.layers.34.post_attention_layernorm.0",
|
| 416 |
+
"model.layers.34.post_attention_layernorm.1",
|
| 417 |
+
"model.layers.34.self_attn.0.indexer.k_norm",
|
| 418 |
+
"model.layers.34.self_attn.0.indexer.weights_proj",
|
| 419 |
+
"model.layers.34.self_attn.0.indexer.wq_b",
|
| 420 |
+
"model.layers.34.self_attn.0.kv_a_layernorm",
|
| 421 |
+
"model.layers.34.self_attn.0.q_a_layernorm",
|
| 422 |
+
"model.layers.34.self_attn.1.kv_a_layernorm",
|
| 423 |
+
"model.layers.34.self_attn.1.q_a_layernorm",
|
| 424 |
+
"model.layers.35.input_layernorm.0",
|
| 425 |
+
"model.layers.35.input_layernorm.1",
|
| 426 |
+
"model.layers.35.mlp.router.classifier",
|
| 427 |
+
"model.layers.35.mlp.router.e_score_correction_bias",
|
| 428 |
+
"model.layers.35.post_attention_layernorm.0",
|
| 429 |
+
"model.layers.35.post_attention_layernorm.1",
|
| 430 |
+
"model.layers.35.self_attn.0.indexer.k_norm",
|
| 431 |
+
"model.layers.35.self_attn.0.indexer.weights_proj",
|
| 432 |
+
"model.layers.35.self_attn.0.indexer.wq_b",
|
| 433 |
+
"model.layers.35.self_attn.0.kv_a_layernorm",
|
| 434 |
+
"model.layers.35.self_attn.0.q_a_layernorm",
|
| 435 |
+
"model.layers.35.self_attn.1.kv_a_layernorm",
|
| 436 |
+
"model.layers.35.self_attn.1.q_a_layernorm",
|
| 437 |
+
"model.layers.36.input_layernorm.0",
|
| 438 |
+
"model.layers.36.input_layernorm.1",
|
| 439 |
+
"model.layers.36.mlp.router.classifier",
|
| 440 |
+
"model.layers.36.mlp.router.e_score_correction_bias",
|
| 441 |
+
"model.layers.36.post_attention_layernorm.0",
|
| 442 |
+
"model.layers.36.post_attention_layernorm.1",
|
| 443 |
+
"model.layers.36.self_attn.0.indexer.k_norm",
|
| 444 |
+
"model.layers.36.self_attn.0.indexer.weights_proj",
|
| 445 |
+
"model.layers.36.self_attn.0.indexer.wq_b",
|
| 446 |
+
"model.layers.36.self_attn.0.kv_a_layernorm",
|
| 447 |
+
"model.layers.36.self_attn.0.q_a_layernorm",
|
| 448 |
+
"model.layers.36.self_attn.1.kv_a_layernorm",
|
| 449 |
+
"model.layers.36.self_attn.1.q_a_layernorm",
|
| 450 |
+
"model.layers.37.input_layernorm.0",
|
| 451 |
+
"model.layers.37.input_layernorm.1",
|
| 452 |
+
"model.layers.37.mlp.router.classifier",
|
| 453 |
+
"model.layers.37.mlp.router.e_score_correction_bias",
|
| 454 |
+
"model.layers.37.post_attention_layernorm.0",
|
| 455 |
+
"model.layers.37.post_attention_layernorm.1",
|
| 456 |
+
"model.layers.37.self_attn.0.indexer.k_norm",
|
| 457 |
+
"model.layers.37.self_attn.0.indexer.weights_proj",
|
| 458 |
+
"model.layers.37.self_attn.0.indexer.wq_b",
|
| 459 |
+
"model.layers.37.self_attn.0.kv_a_layernorm",
|
| 460 |
+
"model.layers.37.self_attn.0.q_a_layernorm",
|
| 461 |
+
"model.layers.37.self_attn.1.kv_a_layernorm",
|
| 462 |
+
"model.layers.37.self_attn.1.q_a_layernorm",
|
| 463 |
+
"model.layers.4.input_layernorm.0",
|
| 464 |
+
"model.layers.4.input_layernorm.1",
|
| 465 |
+
"model.layers.4.mlp.router.classifier",
|
| 466 |
+
"model.layers.4.mlp.router.e_score_correction_bias",
|
| 467 |
+
"model.layers.4.post_attention_layernorm.0",
|
| 468 |
+
"model.layers.4.post_attention_layernorm.1",
|
| 469 |
+
"model.layers.4.self_attn.0.indexer.k_norm",
|
| 470 |
+
"model.layers.4.self_attn.0.indexer.weights_proj",
|
| 471 |
+
"model.layers.4.self_attn.0.indexer.wq_b",
|
| 472 |
+
"model.layers.4.self_attn.0.kv_a_layernorm",
|
| 473 |
+
"model.layers.4.self_attn.0.q_a_layernorm",
|
| 474 |
+
"model.layers.4.self_attn.1.kv_a_layernorm",
|
| 475 |
+
"model.layers.4.self_attn.1.q_a_layernorm",
|
| 476 |
+
"model.layers.5.input_layernorm.0",
|
| 477 |
+
"model.layers.5.input_layernorm.1",
|
| 478 |
+
"model.layers.5.mlp.router.classifier",
|
| 479 |
+
"model.layers.5.mlp.router.e_score_correction_bias",
|
| 480 |
+
"model.layers.5.post_attention_layernorm.0",
|
| 481 |
+
"model.layers.5.post_attention_layernorm.1",
|
| 482 |
+
"model.layers.5.self_attn.0.indexer.k_norm",
|
| 483 |
+
"model.layers.5.self_attn.0.indexer.weights_proj",
|
| 484 |
+
"model.layers.5.self_attn.0.indexer.wq_b",
|
| 485 |
+
"model.layers.5.self_attn.0.kv_a_layernorm",
|
| 486 |
+
"model.layers.5.self_attn.0.q_a_layernorm",
|
| 487 |
+
"model.layers.5.self_attn.1.kv_a_layernorm",
|
| 488 |
+
"model.layers.5.self_attn.1.q_a_layernorm",
|
| 489 |
+
"model.layers.6.input_layernorm.0",
|
| 490 |
+
"model.layers.6.input_layernorm.1",
|
| 491 |
+
"model.layers.6.mlp.router.classifier",
|
| 492 |
+
"model.layers.6.mlp.router.e_score_correction_bias",
|
| 493 |
+
"model.layers.6.post_attention_layernorm.0",
|
| 494 |
+
"model.layers.6.post_attention_layernorm.1",
|
| 495 |
+
"model.layers.6.self_attn.0.indexer.k_norm",
|
| 496 |
+
"model.layers.6.self_attn.0.indexer.weights_proj",
|
| 497 |
+
"model.layers.6.self_attn.0.indexer.wq_b",
|
| 498 |
+
"model.layers.6.self_attn.0.kv_a_layernorm",
|
| 499 |
+
"model.layers.6.self_attn.0.q_a_layernorm",
|
| 500 |
+
"model.layers.6.self_attn.1.kv_a_layernorm",
|
| 501 |
+
"model.layers.6.self_attn.1.q_a_layernorm",
|
| 502 |
+
"model.layers.7.input_layernorm.0",
|
| 503 |
+
"model.layers.7.input_layernorm.1",
|
| 504 |
+
"model.layers.7.mlp.router.classifier",
|
| 505 |
+
"model.layers.7.mlp.router.e_score_correction_bias",
|
| 506 |
+
"model.layers.7.post_attention_layernorm.0",
|
| 507 |
+
"model.layers.7.post_attention_layernorm.1",
|
| 508 |
+
"model.layers.7.self_attn.0.indexer.k_norm",
|
| 509 |
+
"model.layers.7.self_attn.0.indexer.weights_proj",
|
| 510 |
+
"model.layers.7.self_attn.0.indexer.wq_b",
|
| 511 |
+
"model.layers.7.self_attn.0.kv_a_layernorm",
|
| 512 |
+
"model.layers.7.self_attn.0.q_a_layernorm",
|
| 513 |
+
"model.layers.7.self_attn.1.kv_a_layernorm",
|
| 514 |
+
"model.layers.7.self_attn.1.q_a_layernorm",
|
| 515 |
+
"model.layers.8.input_layernorm.0",
|
| 516 |
+
"model.layers.8.input_layernorm.1",
|
| 517 |
+
"model.layers.8.mlp.router.classifier",
|
| 518 |
+
"model.layers.8.mlp.router.e_score_correction_bias",
|
| 519 |
+
"model.layers.8.post_attention_layernorm.0",
|
| 520 |
+
"model.layers.8.post_attention_layernorm.1",
|
| 521 |
+
"model.layers.8.self_attn.0.indexer.k_norm",
|
| 522 |
+
"model.layers.8.self_attn.0.indexer.weights_proj",
|
| 523 |
+
"model.layers.8.self_attn.0.indexer.wq_b",
|
| 524 |
+
"model.layers.8.self_attn.0.kv_a_layernorm",
|
| 525 |
+
"model.layers.8.self_attn.0.q_a_layernorm",
|
| 526 |
+
"model.layers.8.self_attn.1.kv_a_layernorm",
|
| 527 |
+
"model.layers.8.self_attn.1.q_a_layernorm",
|
| 528 |
+
"model.layers.9.input_layernorm.0",
|
| 529 |
+
"model.layers.9.input_layernorm.1",
|
| 530 |
+
"model.layers.9.mlp.router.classifier",
|
| 531 |
+
"model.layers.9.mlp.router.e_score_correction_bias",
|
| 532 |
+
"model.layers.9.post_attention_layernorm.0",
|
| 533 |
+
"model.layers.9.post_attention_layernorm.1",
|
| 534 |
+
"model.layers.9.self_attn.0.indexer.k_norm",
|
| 535 |
+
"model.layers.9.self_attn.0.indexer.weights_proj",
|
| 536 |
+
"model.layers.9.self_attn.0.indexer.wq_b",
|
| 537 |
+
"model.layers.9.self_attn.0.kv_a_layernorm",
|
| 538 |
+
"model.layers.9.self_attn.0.q_a_layernorm",
|
| 539 |
+
"model.layers.9.self_attn.1.kv_a_layernorm",
|
| 540 |
+
"model.layers.9.self_attn.1.q_a_layernorm",
|
| 541 |
+
"model.mtp.embed_tokens",
|
| 542 |
+
"model.mtp.layers.0.enorm.m",
|
| 543 |
+
"model.mtp.layers.0.hnorm.m",
|
| 544 |
+
"model.mtp.layers.0.input_layernorm",
|
| 545 |
+
"model.mtp.layers.0.post_attention_layernorm",
|
| 546 |
+
"model.mtp.layers.0.self_attn.indexer.k_norm",
|
| 547 |
+
"model.mtp.layers.0.self_attn.kv_a_layernorm",
|
| 548 |
+
"model.mtp.layers.0.self_attn.q_a_layernorm",
|
| 549 |
+
"model.mtp.ngram_embeddings.embedders.0",
|
| 550 |
+
"model.mtp.ngram_embeddings.embedders.1",
|
| 551 |
+
"model.mtp.ngram_embeddings.embedders.10",
|
| 552 |
+
"model.mtp.ngram_embeddings.embedders.11",
|
| 553 |
+
"model.mtp.ngram_embeddings.embedders.12",
|
| 554 |
+
"model.mtp.ngram_embeddings.embedders.13",
|
| 555 |
+
"model.mtp.ngram_embeddings.embedders.14",
|
| 556 |
+
"model.mtp.ngram_embeddings.embedders.15",
|
| 557 |
+
"model.mtp.ngram_embeddings.embedders.2",
|
| 558 |
+
"model.mtp.ngram_embeddings.embedders.3",
|
| 559 |
+
"model.mtp.ngram_embeddings.embedders.4",
|
| 560 |
+
"model.mtp.ngram_embeddings.embedders.5",
|
| 561 |
+
"model.mtp.ngram_embeddings.embedders.6",
|
| 562 |
+
"model.mtp.ngram_embeddings.embedders.7",
|
| 563 |
+
"model.mtp.ngram_embeddings.embedders.8",
|
| 564 |
+
"model.mtp.ngram_embeddings.embedders.9",
|
| 565 |
+
"model.mtp.ngram_embeddings.post_projs.0",
|
| 566 |
+
"model.mtp.ngram_embeddings.post_projs.1",
|
| 567 |
+
"model.mtp.ngram_embeddings.post_projs.10",
|
| 568 |
+
"model.mtp.ngram_embeddings.post_projs.11",
|
| 569 |
+
"model.mtp.ngram_embeddings.post_projs.12",
|
| 570 |
+
"model.mtp.ngram_embeddings.post_projs.13",
|
| 571 |
+
"model.mtp.ngram_embeddings.post_projs.14",
|
| 572 |
+
"model.mtp.ngram_embeddings.post_projs.15",
|
| 573 |
+
"model.mtp.ngram_embeddings.post_projs.2",
|
| 574 |
+
"model.mtp.ngram_embeddings.post_projs.3",
|
| 575 |
+
"model.mtp.ngram_embeddings.post_projs.4",
|
| 576 |
+
"model.mtp.ngram_embeddings.post_projs.5",
|
| 577 |
+
"model.mtp.ngram_embeddings.post_projs.6",
|
| 578 |
+
"model.mtp.ngram_embeddings.post_projs.7",
|
| 579 |
+
"model.mtp.ngram_embeddings.post_projs.8",
|
| 580 |
+
"model.mtp.ngram_embeddings.post_projs.9",
|
| 581 |
+
"model.mtp.norm",
|
| 582 |
+
"model.ngram_embeddings.embedders.0",
|
| 583 |
+
"model.ngram_embeddings.embedders.1",
|
| 584 |
+
"model.ngram_embeddings.embedders.10",
|
| 585 |
+
"model.ngram_embeddings.embedders.11",
|
| 586 |
+
"model.ngram_embeddings.embedders.12",
|
| 587 |
+
"model.ngram_embeddings.embedders.13",
|
| 588 |
+
"model.ngram_embeddings.embedders.14",
|
| 589 |
+
"model.ngram_embeddings.embedders.15",
|
| 590 |
+
"model.ngram_embeddings.embedders.2",
|
| 591 |
+
"model.ngram_embeddings.embedders.3",
|
| 592 |
+
"model.ngram_embeddings.embedders.4",
|
| 593 |
+
"model.ngram_embeddings.embedders.5",
|
| 594 |
+
"model.ngram_embeddings.embedders.6",
|
| 595 |
+
"model.ngram_embeddings.embedders.7",
|
| 596 |
+
"model.ngram_embeddings.embedders.8",
|
| 597 |
+
"model.ngram_embeddings.embedders.9",
|
| 598 |
+
"model.ngram_embeddings.post_projs.0",
|
| 599 |
+
"model.ngram_embeddings.post_projs.1",
|
| 600 |
+
"model.ngram_embeddings.post_projs.10",
|
| 601 |
+
"model.ngram_embeddings.post_projs.11",
|
| 602 |
+
"model.ngram_embeddings.post_projs.12",
|
| 603 |
+
"model.ngram_embeddings.post_projs.13",
|
| 604 |
+
"model.ngram_embeddings.post_projs.14",
|
| 605 |
+
"model.ngram_embeddings.post_projs.15",
|
| 606 |
+
"model.ngram_embeddings.post_projs.2",
|
| 607 |
+
"model.ngram_embeddings.post_projs.3",
|
| 608 |
+
"model.ngram_embeddings.post_projs.4",
|
| 609 |
+
"model.ngram_embeddings.post_projs.5",
|
| 610 |
+
"model.ngram_embeddings.post_projs.6",
|
| 611 |
+
"model.ngram_embeddings.post_projs.7",
|
| 612 |
+
"model.ngram_embeddings.post_projs.8",
|
| 613 |
+
"model.ngram_embeddings.post_projs.9",
|
| 614 |
+
"model.norm"
|
| 615 |
+
],
|
| 616 |
+
"quant_method": "fp8",
|
| 617 |
+
"weight_block_size": [
|
| 618 |
+
128,
|
| 619 |
+
128
|
| 620 |
+
]
|
| 621 |
+
},
|
| 622 |
+
"rms_norm_eps": 1e-05,
|
| 623 |
+
"rope_scaling": {
|
| 624 |
+
"beta_fast": 32,
|
| 625 |
+
"beta_slow": 1,
|
| 626 |
+
"factor": 120,
|
| 627 |
+
"mscale": 1,
|
| 628 |
+
"mscale_all_dim": 1,
|
| 629 |
+
"original_max_position_embeddings": 8192,
|
| 630 |
+
"rope_type": "deepseek_yarn"
|
| 631 |
+
},
|
| 632 |
+
"rope_theta": 1000000.0,
|
| 633 |
+
"routed_scaling_factor": 9,
|
| 634 |
+
"use_cache": true,
|
| 635 |
+
"use_mla": 1,
|
| 636 |
+
"v_head_dim": 128,
|
| 637 |
+
"vocab_size": 163840,
|
| 638 |
+
"zero_expert_num": 128,
|
| 639 |
+
"zero_expert_type": "identity"
|
| 640 |
+
}
|
generation_config.json
ADDED
|
@@ -0,0 +1,7 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"_from_model_config": true,
|
| 3 |
+
"bos_token_id": 1,
|
| 4 |
+
"eos_token_id": 2,
|
| 5 |
+
"pad_token_id": 3,
|
| 6 |
+
"transformers_version": "4.55.0"
|
| 7 |
+
}
|
megatron_config.json
ADDED
|
@@ -0,0 +1 @@
|
|
|
|
|
|
|
| 1 |
+
"{\"num_layers\": 38, \"encoder_num_layers\": 38, \"decoder_num_layers\": null, \"hidden_size\": 8192, \"kv_lora_rank\": 512, \"q_lora_rank\": 1536, \"qk_rope_head_dim\": 64, \"qk_nope_head_dim\": 128, \"v_head_dim\": 128, \"mla\": true, \"mla_recompute\": false, \"mla_recompute_layer_ids\": null, \"mla_scale_kv_lora\": 4.0, \"mla_scale_q_lora\": 2.309401076758503, \"mla_scale_v\": 1, \"base_size\": null, \"ffn_hidden_size\": 12288, \"expert_ffn_hidden_size\": 2048, \"num_attention_heads\": 64, \"kv_channels\": null, \"group_query_attention\": false, \"num_query_groups\": null, \"max_position_embeddings\": 131072, \"position_embedding_type\": \"rotary\", \"use_rotary_position_embeddings\": false, \"rotary_percent\": 1.0, \"rotary_seq_len_interpolation_factor\": null, \"use_rope_scaling\": false, \"add_position_embedding\": true, \"make_vocab_size_divisible_by\": 1, \"normalization\": \"RMSNorm\", \"norm_epsilon\": 1e-05, \"layernorm_epsilon\": 1e-05, \"apply_layernorm_1p\": false, \"apply_residual_connection_post_layernorm\": false, \"openai_gelu\": false, \"squared_relu\": false, \"swiglu\": true, \"squared_reglu\": false, \"fuse_swiglu_kernel\": false, \"onnx_safe\": null, \"bert_binary_head\": true, \"num_experts\": [768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, 768, null, null, null], \"expert_interval\": 1, \"expert_model_parallel_size\": 256, \"use_ag_ep_comm_dispatcher\": false, \"moe_dispatch_type\": \"alltoall_abs\", \"zero_expert_num\": 128, \"zero_expert_type\": \"identity\", \"target_topk\": 8.0, \"only_adapt_ffn_bias\": true, \"skip_padding_tokens\": true, \"mock_data_for_skip_padding_val\": false, \"moe_expert_capacity_factor\": null, \"moe_expert_capacity_factor_in_fusion_operator\": null, \"moe_no_drop_ratio\": 0.0, \"simulated_expert_parallel\": 1, \"moe_pad_expert_input_to_capacity\": false, \"moe_token_drop_policy\": \"prob\", \"priority_type\": \"sum\", \"token_drop_during_eval\": false, \"dynamic_ep_drop_tokens\": false, \"dynamic_ep_drop_tokens_threshold\": null, \"router_combine_comm_opt\": false, \"enable_router_report\": true, \"router_report_interval\": 100, \"router_report_cost_log_interval\": 100, \"router_report_ep_group_percent\": 0.5, \"untie_embeddings_and_output_weights\": true, \"deepseek\": true, \"n_shared_experts\": null, \"norm_topk_prob\": false, \"routed_scaling_factor\": 9.0, \"sigmoid_router_score\": false, \"topk_method\": \"greedy\", \"loss_free_balance_rate\": 0.0, \"loss_free_balance_rate_log_interval\": 100, \"loss_free_decay_rule\": null, \"dynamic_update_loss_free_bias\": true, \"log_loss_free_bias_interval\": 50, \"use_optimized_loss_free_balance_impl\": true, \"use_padded_tokens_per_expert\": false, \"n_group\": 1, \"topk_group\": 1, \"device_load_balance_loss_coeff\": [0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001, 0.001], \"communication_load_balance_loss_coeff\": null, \"use_modified_balance_loss\": false, \"output_z_loss\": false, \"output_z_loss_coeff\": 1e-05, \"hidden_z_loss_coeff\": 1e-07, \"shortcut_permute_alltoall_overlap\": false, \"shortcut_unpermute_alltoall_overlap\": false, \"use_alltoall_vc\": false, \"shortcut_issue_unpermute_alltoall_spec_point\": false, \"shortcut_tp_rs_overlap\": null, \"use_cp_token_balance\": false, \"att_mask_type\": \"full\", \"z_loss_type\": \"default\", \"enable_abstract_module\": true, \"enable_moe_chunk\": false, \"mtp_num_layers\": 3, \"mtp_loss_scaling_factor\": 0.1, \"mtp_replicate_modules\": true, \"mtp_layer_spec\": \"TransformerLayer\", \"mtp_transformer_impl\": \"local\", \"mtp_loss_scaling_factor_change_step\": -1, \"mtp_loss_scaling_factor_change_value\": 0.0, \"mtp_detach_gradient\": false, \"fix_mtp_loss_double_scale\": false, \"mtp_disable_over_tokenizer\": true, \"mtp_distill_from_main_model\": true, \"mtp_distill_top_n\": \"1\", \"mtp_loss_backward_at_once\": false, \"mtp_dedup_emb\": true, \"mtp_recompute_mlp\": false, \"mtp_acc_log_interval\": 5, \"moe_unpermute_impl\": \"scatter_add\", \"moe_unpermute_index_add_cast\": false, \"moe_ag_coalesced\": false, \"enable_gmm_unaligned_cutlass\": false, \"attention_dropout\": 0.0, \"hidden_dropout\": 0.0, \"weight_decay\": 0.01, \"start_weight_decay\": 0.01, \"end_weight_decay\": 0.01, \"weight_decay_incr_style\": \"constant\", \"clip_grad\": 1.0, \"clip_grad_non_matrix_only\": false, \"adam_beta1\": 0.9, \"adam_beta2\": 0.95, \"adam_eps\": 1e-16, \"sgd_momentum\": 0.9, \"muon_momentum\": 0.95, \"muon_nesterov\": false, \"muon_zeropower_backend\": \"optimal8\", \"muon_type\": \"bf16\", \"muon_comm_type\": \"fp32\", \"muon_ns_steps\": 5, \"muon_merge_moe_params\": false, \"muon_use_spectral_norm\": false, \"muon_adamw_lr\": 1.67e-06, \"attn_mult\": null, \"emb_mult\": 1.0, \"muon_qk_clip\": false, \"muon_qk_clip_factor\": 100.0, \"muon_dp_comm_overlap\": true, \"muon_overlap_with_dp_param_allgather\": true, \"muon_matched_adamw_rms\": 0.2, \"muon_matched_adamw_rms_source\": \"schedule\", \"muon_tp_parallel\": true, \"muon_error_skip\": false, \"muon_error_dump_path\": \"hdfs:///zw04mlnn01/checkpoint/EXE/wanghaibin09/sft_merge_for_0615/moe-pro-sft-128k-0620-train-data-ext-1ep-ep4-sampling-v1_pro_sft/muon_error_dumps\", \"report_muon_skip_params_rate\": false, \"report_muon_skip_params_rate_interval\": 20, \"use_adam_eps_to_control_muon_update\": true, \"use_adam_eps_to_control_muon_update_rate\": 1, \"muon_ns_pre_scale\": false, \"muon_disable_npu_optimize\": false, \"muon_scale_before_downcast\": true, \"muon_use_clamp_norm\": false, \"muon_update_ratio_report_interval\": 100, \"muon_split\": false, \"native_mm\": false, \"micro_batch_size\": 1, \"global_batch_size\": 256, \"rampup_batch_size\": null, \"rampup_stage_config\": null, \"recompute_granularity\": null, \"recompute_pp_forward\": false, \"recompute_pp_forward_num\": -1, \"check_for_nan_in_loss_and_grad\": true, \"distribute_saved_activations\": false, \"recompute_method\": null, \"recompute_num_layers\": null, \"load_iterations\": null, \"moe_infer\": false, \"expert_choice_infer_topk\": 1, \"profile\": false, \"profile_step_start\": 10, \"profile_step_end\": 12, \"profile_ranks\": [0], \"enable_mstx\": true, \"enable_mstx_profile_memory\": true, \"meta_grad_comm\": false, \"fused_moe_probs_with_swiglu\": true, \"use_fuse_probs_swiglu_op\": true, \"train_iters\": 1378, \"exit_iters\": null, \"train_samples\": null, \"train_tokens\": null, \"train_epochs\": 1, \"log_interval\": 1, \"exit_interval\": null, \"exit_duration_in_mins\": null, \"exit_signal_handler\": false, \"tensorboard_dir\": \"/tmp/moe-pro-sft-128k-0620-train-data-ext-1ep-ep4-sampling-v1\", \"masked_softmax_fusion\": false, \"swiglu_fusion\": false, \"bias_gelu_fusion\": false, \"bias_dropout_fusion\": true, \"apply_rope_fusion\": true, \"use_flash_attn\": true, \"sliding_window_attention\": \"0000000000000000000000000000000000000000000000000000000000000000000000000000000000\", \"sliding_window_left\": -1, \"sliding_window_right\": -1, \"duo_attention\": \"0000000000000000000000000000000000000000000000000000000000000000000000000000000000\", \"sink_num_blocks\": -1, \"recent_num_blocks\": -1, \"duo_sparsity\": 0.0, \"duo_head_score\": \"null\", \"cp_batch_p2p_comm\": false, \"flash_attn_deterministic\": true, \"qk_norm_type\": \"apex\", \"add_bias_linear\": false, \"optimizer\": \"muon\", \"dataloader_type\": \"cyclic\", \"eval_dataloader_type\": \"single\", \"skip_train_iteration_range\": null, \"skip_samples\": 0, \"skip_steps_by_config\": null, \"async_tensor_model_parallel_allreduce\": false, \"no_persist_layer_norm\": false, \"sequence_parallel\": true, \"gradient_accumulation_fusion\": true, \"save_step0_ckpt\": false, \"make_trainable\": true, \"medusa_num_heads\": null, \"medusa_num_layers\": null, \"use_distill_loss\": false, \"router_jitter_noise\": null, \"router_dtype\": \"float32\", \"router_score_full_precision\": true, \"router_bias\": false, \"router\": \"fast_token_choose\", \"router_splitk_threshold\": 8192, \"freeze_router_weight\": false, \"fake_uniform_router\": false, \"capacity_factor\": null, \"use_load_balance_loss\": true, \"use_load_balance_loss_in_sequence\": false, \"use_ep_drop\": false, \"use_bf16_buffer_allgather_parameters\": false, \"load_balance_loss_type\": \"z_loss\", \"moe_loss_coeff\": [0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1, 0.1], \"only_z_loss_coeff\": 0.0, \"moe_topk\": 12, \"router_output_norm\": false, \"add_noise_for_expert_upcycling\": false, \"use_gigaflops_pre_token\": true, \"use_mcore_models\": true, \"expert_parallel\": false, \"ep_alltoall_opt\": true, \"manual_gc\": true, \"manual_gc_interval\": 2, \"manual_gc_eval\": true, \"grouped_gemm_gradient_accumulation_fusion\": true, \"use_grouped_gemm\": true, \"use_fuse_permute\": true, \"log_gmm_shape\": false, \"grouped_gemm_init_same_with_separate_expserts\": true, \"memory_optimize_in_sp\": false, \"memory_optimize_in_1f2b\": false, \"memory_optimize_in_1f2b_dense\": true, \"memory_optimize_in_sp_dense\": true, \"deterministic_mode\": true, \"use_hw_fa\": false, \"swiglu_recompute\": true, \"dynamic_moe_recompute\": false, \"moe_recompute_capacity_factor\": 2.0, \"rmsnorm_recompute\": false, \"fuse_router_topk_allgather\": false, \"disable_efficient_gqa\": false, \"exec_bit_flip_check_interval\": 500, \"fuse_cp_gqa_permute_ops\": true, \"defer_bit_flip_result_check\": true, \"exec_router_fwd_bit_flip_check_interval\": -1, \"exec_router_bwd_bit_flip_check_interval\": -1, \"bit_flip_check_first_iters\": 10, \"fuse_router_ops\": false, \"fuse_sparse_ops\": false, \"fuse_split_cat\": true, \"set_grad_none_in_gmm\": true, \"use_fuse_moe_loss\": false, \"set_stride_within_parallel_embedding_and_fa\": false, \"report_moe_loss_interval\": 0, \"enable_ema\": false, \"ema_factor\": 0.999, \"ema_interval\": 1, \"no_load_ema\": false, \"no_load_ema_change_dp\": false, \"use_chunked_output_layer\": true, \"output_layer_chunk_size\": 4096, \"chunked_output_layer_promotion\": true, \"chunked_output_layer_dw_add_fusion\": true, \"compute_z_loss_fast_mode\": false, \"oom_offload\": true, \"oom_offload_try_times\": 5, \"oom_offload_min_swap_tensor_size\": 1024, \"change_dp_use_gloo\": false, \"change_dp_opt\": false, \"change_dp_no_chunk_scatter\": true, \"scatter_chunk_size\": 0, \"available_free_memory_factor\": 0.5, \"seed\": 482, \"data_parallel_random_init\": false, \"init_method_std\": 0.00212, \"embedding_init_method\": 0.006, \"router_init_method_std\": null, \"init_method_xavier_uniform\": false, \"o_zero_init\": false, \"q_zero_init\": false, \"global_init_with_std_variance\": null, \"hccl_comm_cfgs\": \"{\\\"pp\\\":20,\\\"pp_list_0\\\":20,\\\"pp_list_1\\\":20,\\\"dp\\\":20,\\\"tp_cp\\\":20,\\\"tp\\\":100,\\\"ep\\\":200,\\\"dp_cp\\\":400,\\\"dp_modulo_exp\\\":200}\", \"lr\": 1.67e-06, \"enable_layer_lr\": false, \"layer_lr_switch_steps\": -1.0, \"lr_factor_per_layer\": null, \"report_layer_lr\": false, \"enable_block_lr\": false, \"filtered_keyword\": null, \"block_lr_switch_steps\": -1.0, \"block_lr_regex_config_file\": null, \"block_lr_embedding_layer\": null, \"block_lr_output_layer\": null, \"block_lr_norm_layer\": null, \"block_lr_dense_mlp_fc1\": null, \"block_lr_dense_mlp_fc2\": null, \"block_lr_moe_mlp_fc1\": null, \"block_lr_moe_mlp_fc2\": null, \"block_lr_router\": null, \"block_lr_attn_qkv\": null, \"block_lr_attn_proj\": null, \"report_block_lr\": false, \"lr_decay_style\": \"cosine\", \"lr_decay_iters\": 1378, \"lr_decay_by_update_step\": null, \"lr_decay_samples\": null, \"lr_decay_tokens\": null, \"lr_warmup_fraction\": 0.0, \"lr_warmup_iters\": 0, \"lr_warmup_samples\": 0, \"lr_warmup_tokens\": 0, \"lr_warmup_init\": 0.0, \"min_lr\": 0.0, \"override_opt_param_scheduler\": true, \"use_checkpoint_opt_param_scheduler\": false, \"mup_lr_scale_cond\": false, \"decay_frac_for_wsd\": null, \"emb_lr_scale_cond\": true, \"emb_lr_scale_base\": 1024, \"emb_no_wd_cond\": false, \"oe_proj_no_scale_lr\": false, \"ln_scale_lr_cond\": true, \"muon_reparam_scale_cond\": false, \"save\": \"hdfs:///zw04mlnn01/checkpoint/EXE/wanghaibin09/sft_merge_for_0615/moe-pro-sft-128k-0620-train-data-ext-1ep-ep4-sampling-v1_pro_sft\", \"save_interval\": 500, \"save_inner_interval\": 50, \"no_save_optim\": null, \"no_save_rng\": null, \"load\": \"hdfs:///zw04mlnn01/checkpoint/EXE/wanghaibin09/sft_merge_for_0615/moe-pro-sft-128k-0620-train-data-ext-1ep-ep4-sampling-v1_pro_sft\", \"load_unify\": true, \"save_on_load\": false, \"load_model_only\": null, \"no_load_optim\": null, \"no_load_optim_iteration\": null, \"no_load_rng\": null, \"finetune\": false, \"perform_initialization\": true, \"use_checkpoint_args\": false, \"exit_on_missing_checkpoint\": false, \"load_dense_model\": null, \"legacy_checkpoint\": false, \"load_no_bucket_checkpoint\": false, \"load_inequal_bucket_checkpoint\": true, \"distributed_checkpointing\": true, \"async_checkpointing\": false, \"async_checkpoint_barrier_timeout\": 600, \"max_num_disaster_checkpoints\": 2, \"load_model_optimize\": true, \"convert_dis_to_undis\": false, \"enable_checkpoint_pruning\": true, \"fp16\": false, \"bf16\": true, \"loss_scale\": null, \"initial_loss_scale\": 4294967296, \"min_loss_scale\": 1.0, \"loss_scale_window\": 1000, \"avg_loss_comm_optimize\": true, \"hysteresis\": 2, \"fp32_residual_connection\": false, \"apply_query_key_layer_scaling\": true, \"attention_softmax_in_fp32\": true, \"accumulate_allreduce_grads_in_fp32\": true, \"fp16_lm_cross_entropy\": false, \"tensor_model_parallel_size\": 4, \"tensor_model_parallel_size_moe\": 1, \"enable_grouped_moe\": false, \"moe_group_size\": null, \"grouped_moe_parallel_type\": \"ep\", \"grouped_moe_norm_type\": null, \"grouped_moe_norm_epsilon\": 1e-05, \"grouped_moe_proj_init_std\": null, \"grouped_moe_norm_scale\": 1.0, \"grouped_moe_router_splitk_threshold\": 8192, \"enable_router_sp2hp_overlap\": false, \"tensor_model_parallel_size_emb\": 256, \"use_a2a_in_embp\": true, \"tensor_model_parallel_size_emb_infer\": null, \"pipeline_model_parallel_size\": 7, \"vision_encoder_pipeline_model_parallel_size\": null, \"num_layers_per_pipeline_stage\": null, \"vision_encoder_num_layers_per_pipeline_stage\": null, \"pipeline_model_parallel_split_rank\": null, \"f1b2\": false, \"delay_p2p_comm_num\": 0, \"num_layers_per_virtual_pipeline_stage\": 3, \"use_two_p2p_comm_group\": true, \"overlap_p2p_comm\": false, \"distributed_backend\": \"nccl\", \"distributed_timeout_minutes\": 30, \"overlap_grad_reduce\": true, \"overlap_grad_reduce_in_chunk\": true, \"delay_grad_reduce\": true, \"bucket_size\": 500000000, \"disable_bucketing\": true, \"overlap_weight_allgather\": false, \"prefetch_bucket_cnt\": 2, \"max_running_allgather_kernel\": 2, \"grad_reduce_issue_speed\": 5, \"scatter_gather_tensors_in_pipeline\": true, \"use_ring_exchange_p2p\": false, \"local_rank\": 0, \"lazy_mpu_init\": null, \"use_cpu_initialization\": null, \"empty_unused_memory_level\": 0, \"standalone_embedding_stage\": false, \"balance_embedding_stage\": false, \"regard_embedding_as_transformer\": false, \"regard_unembedding_as_transformer\": false, \"padding_nooptransformer_num_sequential\": [1], \"padding_nooptransformer_num_reverse\": [3], \"use_distributed_optimizer\": true, \"context_parallel_size\": 64, \"cp_solution\": \"alltoall\", \"ag_kv_head_stride\": 2, \"cp_alltoall_solution\": true, \"cp_ag_reduce_in_fp32\": false, \"ignore_varlen_mfu\": false, \"variable_seq_lengths\": false, \"zero_bubble_pipeline_timers_start_iter\": 0, \"zero_bubble_pipeline_timers_end_iter\": 0, \"zero_bubble_max_pending_backward\": \"auto\", \"zero_bubble_adaptive_memory_limit_percentile\": 85, \"post_validation_alway_no_clip\": false, \"enable_optimizer_post_validation\": false, \"post_validation_async_recv_norm\": false, \"post_validation_after_step_num\": 1, \"post_validation_debug_log\": false, \"exactly_numeric_rollback\": false, \"enable_exactly_numeric_match\": false, \"enable_zero_bubble\": true, \"zero_bubble_v_schedule_dw_overlap\": false, \"zero_bubble_v_schedule_dw_overlap_opt\": false, \"zero_bubble_v_schedule\": true, \"zero_bubble_v_schedule_mem_setup\": \"zb\", \"allow_padding_num_layers\": false, \"zero_bubble_v_cooldown_opt\": false, \"zero_bubble_v_cooldown_opt_debug\": false, \"zero_bubble_v_dw_cp_overlap\": true, \"once_dw_extracted_num\": 4, \"inner_dw_queue_length\": 12, \"eval_iters\": 100, \"eval_interval\": 1000, \"eval_first_iter\": false, \"skip_train\": false, \"only_eval\": false, \"eval_ckpts\": null, \"use_eval_forward\": false, \"eval_padding_opt\": false, \"eval_global_batch_size\": 256, \"skip_seqlen_check\": false, \"data_path\": [\"/mnt/dolphinfs/ssd_pool/docker/user/hadoop-nlp-hl02/hadoop-aipnlp/RPG/wanghaibin09/tokenize/pro_sft_128k_0620_ep4_ext_sf_v2/LLM_SFT_20260620_ep4/pro_sft_128k_0620_ep4_ext_sf_v2/data/processed\"], \"split\": \"100\", \"train_data_path\": null, \"valid_data_path\": null, \"test_data_path\": null, \"data_cache_path\": null, \"vocab_size\": null, \"vocab_file\": \"/mnt/dolphinfs/hdd_pool/docker/user/hadoop-aipnlp/3A/code-and-math/fuhaomin/tokenizer/release/tokenizer/history/v3/260325\", \"merge_file\": null, \"vocab_extra_ids\": 0, \"seq_length\": 131072, \"encoder_seq_length\": 131072, \"decoder_seq_length\": null, \"retriever_seq_length\": 256, \"sample_rate\": 1.0, \"mask_prob\": 0.15, \"short_seq_prob\": 0.1, \"mmap_warmup\": false, \"num_workers\": 1, \"prefetch_factor\": 16, \"batch_data_scatter\": false, \"tokenizer_type\": \"BloomTokenizer\", \"tokenizer_model\": null, \"data_impl\": \"mmap\", \"eval_data_impl\": \"infer\", \"reset_position_ids\": false, \"reset_attention_mask\": false, \"eod_mask_loss\": true, \"bos_mask_loss\": false, \"data_configs\": \"\", \"num_data_splits\": 1, \"base_img_size\": 448, \"image_dir\": null, \"no_splicing_dataset\": false, \"proportion\": false, \"pre_concat_info\": \"\", \"data_ratio\": \"0\", \"vision_seq_length\": null, \"text_seq_length\": null, \"seq_length_per_image\": null, \"vision_tril_attention\": false, \"vision_class_token_length\": 1, \"vision_class_token\": true, \"image_processor\": \"blip2\", \"image_processor_path\": null, \"adlr_autoresume\": false, \"adlr_autoresume_interval\": 1000, \"ict_head_size\": null, \"biencoder_projection_dim\": 0, \"biencoder_shared_query_context_model\": false, \"ict_load\": null, \"bert_load\": null, \"titles_data_path\": null, \"query_in_block_prob\": 0.1, \"use_one_sent_docs\": false, \"evidence_data_path\": null, \"retriever_report_topk_accuracies\": [], \"retriever_score_scaling\": false, \"block_data_path\": null, \"embedding_path\": null, \"indexer_batch_size\": 128, \"indexer_log_interval\": 1000, \"num_classes\": 1000, \"img_h\": 224, \"img_w\": 224, \"num_channels\": 3, \"patch_dim\": 14, \"image_size\": 224, \"patch_size\": 14, \"max_image_num_per_micro_batch\": 1, \"classes_fraction\": 1.0, \"data_per_class_fraction\": 1.0, \"data_sharding\": true, \"head_lr_mult\": 1.0, \"vision_use_recompute\": false, \"vision_recompute_num_layers\": 1, \"vision_adapter_width\": 7168, \"layernorm_fp32\": false, \"quick_gelu\": false, \"vision_width\": 1664, \"vision_heads\": 16, \"vision_layers\": 48, \"vision_mlp_ratio\": 4, \"vision_hidden_act\": \"gelu\", \"vision_qkv_bias\": true, \"vision_pretraining\": false, \"vision_pretraining_type\": \"classify\", \"vision_backbone_type\": \"vit\", \"swin_backbone_type\": \"tiny\", \"mask_type\": \"random\", \"mask_factor\": 1.0, \"iter_per_epoch\": 1250, \"dino_local_img_size\": 96, \"dino_local_crops_number\": 10, \"dino_head_hidden_size\": 2048, \"dino_bottleneck_size\": 256, \"dino_freeze_last_layer\": 1, \"dino_norm_last_layer\": false, \"dino_warmup_teacher_temp\": 0.04, \"dino_teacher_temp\": 0.07, \"dino_warmup_teacher_temp_epochs\": 30, \"vision_tower\": null, \"vision_encoder_type\": \"openclip_vit\", \"unfreeze_vision\": false, \"mm_vision_select_layer\": -1, \"mm_adapter_type\": \"mlp\", \"resampler_output_dim\": null, \"resampler_n_queries\": 256, \"proj_output_dim\": null, \"pretrain_mm_mlp_adapter\": null, \"mm_projector_type\": \"linear\", \"pretrain_generation_adapter\": null, \"mm_patch_merge_type\": \"flat\", \"mm_vision_select_feature\": \"patch\", \"image_aspect_ratio\": \"pad\", \"mm_use_im_start_end\": false, \"mm_use_im_patch_token\": false, \"version\": \"v1\", \"vlm_sft\": false, \"vlm_task_type\": \"understanding\", \"loss_avg_by_token\": false, \"image_split\": -1, \"add_img_separator_token\": false, \"tune_llm_all\": false, \"tune_vit_all\": false, \"image_token_num\": -1, \"max_frame_num\": 100, \"read_fps\": false, \"keep_short_vid\": false, \"keep_long_vid\": false, \"keep_short_thred\": 64, \"keep_short_multi\": 4, \"sample_mid\": true, \"frame_num\": 8, \"vision_tower_lr_scale\": 0.1, \"vision_tower_lr_decay\": 1.0, \"vision_projector_lr_scale\": 1.0, \"gen_projector_lr_scale\": 10, \"no_shuffle_mllm_data\": false, \"data_index_dir\": null, \"gen_vit_data_parallel\": false, \"audio_vocab_size\": 8224, \"text_vocab_size\": 131072, \"audio_head_num\": 2, \"padding_idx\": 3, \"token_type_pause\": 1, \"token_type_end\": 2, \"token_type_audio\": 3, \"token_type_text\": 4, \"token_type_audio_text\": 5, \"token_type_asr\": 6, \"token_asr\": 102, \"seq_type_text\": 1, \"seq_type_audio\": 2, \"seq_type_asr\": 3, \"audio_loss_ratio\": 1, \"text_loss_ratio\": 1, \"pure_text_loss_ratio\": 1, \"audio_encoder_path\": null, \"audio_projector_path\": null, \"audio_output_layers_path\": null, \"audio_embeddings_path\": null, \"enable_audio_adaptor\": false, \"connector_type\": \"mlp\", \"adaptor_config_path\": null, \"tokenizer_name_or_path\": null, \"processor_config_file\": null, \"tokenizer_version\": null, \"data_file_or_path\": null, \"len_calc_downsample_rate\": 1, \"len_calc_processor_type\": \"dfsmn\", \"audio_sample_rate\": 16000, \"collate_sft_compute_assistant_only\": false, \"is_training\": false, \"special_tokens_learnable\": false, \"conversation_bos_token\": null, \"conversation_eos_token\": null, \"use_text_instruction\": false, \"add_round_idx\": false, \"freeze_audio_encoder\": false, \"freeze_connector\": false, \"freeze_language_model_without_embedding\": false, \"freeze_text_embedding\": false, \"freeze_audio_cb_0_embedding\": false, \"freeze_audio_cb_1_embedding\": false, \"freeze_whole_embedding\": false, \"log_params_norm\": false, \"log_num_zeros_in_grad\": false, \"timing_log_level\": 1, \"barrier_with_L1_time\": true, \"timing_log_option\": \"all\", \"tensorboard_log_interval\": 1, \"tensorboard_log_time_interval\": 50, \"log_time_interval\": 50, \"tensorboard_queue_size\": 1000, \"log_timers_to_tensorboard\": true, \"log_batch_size_to_tensorboard\": true, \"log_learning_rate_to_tensorboard\": true, \"log_learnig_rate_all_pp_rank\": false, \"log_loss_scale_to_tensorboard\": true, \"log_validation_ppl_to_tensorboard\": false, \"log_memory_to_tensorboard\": true, \"log_world_size_to_tensorboard\": false, \"tensorboard_log_level\": \"minimal\", \"params_init_log\": true, \"zb_debug_log\": false, \"zb_bc_repalce_ag\": true, \"log_experts_passed_token_to_tensorboard\": true, \"log_experts_passed_token_interval\": 100, \"report_drop_frac_capacity\": null, \"expert_level_log_interval_factor\": 10, \"wandb_project\": \"\", \"wandb_exp_name\": \"\", \"wandb_save_dir\": \"\", \"log_aggregated_val_loss\": true, \"router_info_log_interval\": null, \"collect_router_info_dp_ranks\": [0], \"collect_router_info_micro_batches\": [1], \"split_report_router_scores_grad\": true, \"inference_batch_times_seqlen_threshold\": 512, \"max_tokens_to_oom\": 12000, \"output_bert_embeddings\": false, \"bert_embedder_type\": \"megatron\", \"fp8\": null, \"fp8_margin\": 0, \"fp8_interval\": 1, \"transformer_impl\": \"shortcut\", \"fp8_amax_history_len\": 1, \"fp8_amax_compute_algo\": \"most_recent\", \"fp8_wgrad\": true, \"retro_workdir\": null, \"retro_add_retriever\": false, \"retro_cyclic_train_iters\": null, \"retro_encoder_layers\": 2, \"retro_encoder_hidden_dropout\": 0.1, \"retro_encoder_attention_dropout\": 0.1, \"retro_num_neighbors\": 2, \"retro_num_retrieved_chunks\": 2, \"retro_return_doc_ids\": false, \"model_spec\": null, \"cuda_event_trace\": true, \"dynamic_cuda_event_trace\": true, \"nccl_trace\": false, \"reduce_pipeline_data_io\": true, \"enable_step_sample_cache\": true, \"step_local_sample_sort_algo\": null, \"p2p_precision_split_factor\": 3, \"get_batch_in_cpu\": true, \"get_batch_deferred_on_this_cp_rank\": false, \"get_batch_cp_dedup\": false, \"keys_compute_w_at_once\": \"none\", \"hf_type\": \"llama\", \"trained_model\": null, \"ignore_mismatch_to_hf\": false, \"debug_log_path\": null, \"intm_dir\": null, \"multi_query_attention\": false, \"multi_query_group_num\": null, \"rmsnorm\": true, \"qk_norm\": false, \"add_qkv_bias\": false, \"add_layernorm_after_embedding\": false, \"intermediate_size\": null, \"rope_scaling_type\": \"yarn\", \"rope_scaling_factor\": 120.0, \"rope_scaling_low_freq_factor\": null, \"rope_scaling_high_freq_factor\": null, \"normalize_for_lm_head\": false, \"rope_theta\": 1000000.0, \"rope_scaling_beta_fast\": 32, \"rope_scaling_beta_slow\": 1, \"rope_scaling_mscale\": 1.0, \"rope_scaling_mscale_all_dim\": 1.0, \"original_max_position_embeddings\": 8192, \"varlen_attention\": true, \"varlen_end_to_end\": false, \"splicing_weight\": false, \"loss_weight_mode\": \"default\", \"uniform_loss_mask_for_test\": false, \"legacy_hf\": false, \"npu_mlp_embedding\": true, \"gpu_mlp_embedding\": false, \"output_logits_chunk_sum_cnt\": 1, \"attn_qk_norm\": false, \"profiler_enabled\": false, \"profiler_schedule_skip_first\": 0, \"profiler_schedule_wait_steps\": 1, \"profiler_schedule_warmup_steps\": 1, \"profiler_schedule_active_steps\": 3, \"profiler_schedule_repeat_times\": 1, \"profiler_schedule_rank_list\": \"*\", \"profiler_chrome_trace_dir\": \"\", \"memory_profiler_enabled\": false, \"memory_profiler_save_path\": null, \"memory_profiler_save_ranks\": null, \"simultaneous_writing_native_tensorboard\": false, \"hope_tracking.board\": true, \"hope_tracking.artifact\": false, \"multi_rank_tracking_enable\": true, \"multi_rank_full_tracking\": false, \"consume_same_data\": null, \"dataset_type\": \"chat_template\", \"eval_dataset_type\": \"chat\", \"eval_all_data\": false, \"topk_logits\": null, \"save_topk_router\": false, \"save_topk_dsa\": false, \"save_topk_logits\": true, \"topk_save_dir\": null, \"topk_check_data_path\": null, \"topk_check_data_path_interval\": 60, \"param_report\": \"200\", \"report_spectral_norm\": false, \"hope_tensorboard\": \"native\", \"legacy_version\": \"0.30\", \"splicing\": true, \"report_activation_norm\": true, \"report_mla_norm\": false, \"report_mla_chunk_size\": 2, \"report_activation_norm_interval\": 100, \"report_ep_unbalance_rate\": true, \"report_ep_unbalance_rate_interval\": 20, \"print_max_moe_recv_tokens\": true, \"print_max_moe_recv_tokens_interval\": 10, \"report_token_drop_rate\": false, \"report_token_drop_rate_interval\": 10, \"parallel_loader_num\": null, \"continue_training_iters\": null, \"post_training\": false, \"post_training_sft\": true, \"enable_unify_dp_broadcast\": false, \"unify_dp_broadcast_type\": \"parameter\", \"save_ckpt_to_memory\": false, \"load_iteration\": 500, \"offload_optimizer_by_step\": false, \"use_ares_writer\": false, \"exec_router_check_interval\": 25, \"dsa\": true, \"dsa_dense_warmup\": false, \"dsa_dense_warmup_with_fa\": false, \"dsa_dense_warmup_method\": \"forward-only\", \"index_n_heads\": 32, \"index_head_dim\": 128, \"index_topk\": 2048, \"dsa_distil_loss_weight\": 1.0, \"dsa_log_topk_acc\": false, \"dsa_log_topk_acc_interval\": 1, \"dsa_recompute_q_absorb\": true, \"dsa_recompute_topk\": false, \"cli_factor\": 2, \"cli_topk_offset\": 0, \"dsa_kv_block_size\": 1, \"dsa_q_block_size\": 1, \"dsa_num_init_token\": 16, \"dsa_num_local_token\": 1024, \"dsa_log_select_p_interval\": -1, \"dsa_log_select_p_per_head_interval\": -1, \"dsa_clip_grad_per_layer\": false, \"dsa_absorb_compute_select_p\": true, \"dsa_mtp_cli\": true, \"sft_token_affirmative\": false, \"dp_same_data\": false, \"warmup_model_before_train\": false, \"use_packed_indexed_ds\": false, \"use_packed_chat_ds\": false, \"packed_indexed_ds_method\": \"default\", \"dsa_bitflip_check_warmup_steps\": 5, \"dsa_bitflip_check_stable_steps\": 50, \"dsa_kl_loss_use_loss_mask\": false, \"record_spike_loss\": false, \"load_spike_loss_pre_steps\": false, \"spike_loss_data_dir\": null, \"spike_loss_method\": \"z_scores\", \"spike_loss_threshold\": 3, \"spike_loss_pre_steps\": 100, \"spike_loss_skip_samples\": 0, \"spike_loss_skip_update\": false, \"spike_loss_allowed_consecutive_steps\": 0, \"loss_window_size\": 0, \"spike_loss_allowed_total_steps\": 0, \"auto_rollback\": false, \"rollback_step_per_time\": 15, \"steps_left_to_compare\": 10, \"rollback_threshold\": 50, \"spike_step\": [-1], \"muon_error_step\": [-1], \"grad_norm_overflow_step\": [-1], \"qk_logits_overflow_step\": [-1], \"record_spike_grad_norm\": false, \"load_spike_grad_norm_pre_steps\": false, \"spike_grad_norm_data_dir\": null, \"spike_grad_norm_method\": \"z_scores\", \"spike_grad_norm_threshold\": 10, \"spike_grad_norm_pre_steps\": 100, \"spike_grad_norm_skip_samples\": 0, \"spike_grad_norm_skip_update\": false, \"spike_grad_norm_allowed_consecutive_steps\": 0, \"grad_norm_window_size\": 0, \"spike_grad_norm_allowed_total_steps\": 0, \"ref_ckpt_args_path_for_unify_model\": null, \"ref_ckpt_lr_warm_up_samples\": null, \"allow_unify_ignore_mismatched_keys\": true, \"model_register_model_family\": null, \"model_register_model_size\": null, \"model_register_model_stage\": null, \"model_register_model_name\": null, \"model_register_model_tag_base_sft\": null, \"model_register_model_vocab_dir_path\": null, \"model_register_model_series\": \"\", \"enable_custom_ops\": [], \"use_over_tokenizer\": true, \"oe_vocab_size_ratio\": 100.567, \"oe_split_num\": 4, \"oe_neighbor_num\": 5, \"report_oe_info_interval\": null, \"ignore_vocab_coprime\": false, \"output_conflict_info\": false, \"remove_oe_sync\": false, \"oe_merge_type\": \"2d_fat\", \"oe_recompute\": false, \"train_stop_iteration\": null, \"rank\": 0, \"world_size\": 14336, \"transformer_pipeline_model_parallel_size\": 7, \"data_parallel_size\": 8, \"embedding_num_layer\": 0, \"total_num_layers\": 42, \"padding_num_layer_sequential\": 1, \"padding_num_layer_reverse\": 3, \"virtual_pipeline_model_parallel_size\": 2, \"virtual_pipeline_total_num_layers\": 42, \"params_dtype\": {\"torch.dtype\": \"torch.bfloat16\"}, \"consumed_train_samples\": 352768, \"consumed_valid_samples\": 0, \"consumed_train_tokens\": 46238007296, \"gigaflos_no_embeds\": 23334606128688.055, \"spike_skip_samples\": 0, \"cp_ring_p2p_solution\": false, \"cp_allgather_solution_unbalance\": false, \"cp_allgather_solution_balance\": false, \"evaluating\": false, \"exec_bit_flip_check\": true, \"exec_router_fwd_bit_flip_check\": false, \"exec_router_bwd_bit_flip_check\": false, \"pre_step_losses\": [], \"pre_step_grad_norms\": [], \"padded_vocab_size\": 163840, \"device_arch\": \"910\", \"model_type\": {\"MegatronModelType\": \"ModelType.encoder_or_decoder\"}, \"checkpoint_data_parallel_size\": 8, \"iteration\": 1378, \"do_train\": 1, \"do_valid\": 0, \"do_test\": 0, \"curr_iteration\": 1377, \"skip_step_list\": []}"
|
model-00001-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:862131abdf7bc5a535981292ca0b83c205855f4dc4f08b85eb31f3be2ea53302
|
| 3 |
+
size 16872370336
|
model-00002-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:d77c5da7bd95d4fe14f630be3306508b693dbdea6e76e9e75491b0c032bf5af3
|
| 3 |
+
size 16872349856
|
model-00003-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f2013fff5230f33fe83a8f62e5bd50bb6f9b8ea8af243644d5766767084af6b8
|
| 3 |
+
size 16872360096
|
model-00004-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:63d2c7a1569d33500653c6a132e8d3035d6c804c52f108301dab25bbc234dd8c
|
| 3 |
+
size 16872345760
|
model-00005-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:3fdd28890c7e5d93d82eb302187258bcc6c2291bdf8552533cdd72e34c16f8c4
|
| 3 |
+
size 16872366240
|
model-00006-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:972a5672d8a17cf00b4ce39387051c159f0c1f1727c7576c403ddf95628e9b9b
|
| 3 |
+
size 16872356000
|
model-00007-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:a328a92b52ff9da55e9bb4627e8e2729decde4e9799341a7de09c570cd220e20
|
| 3 |
+
size 13992122368
|
model-00008-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:3a04e9bf05ae693ee2726a53aeffa43141ded530e78f5b7363f94c399177692e
|
| 3 |
+
size 16872343712
|
model-00009-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:d6a21ccd58ec2d9b6f2b78d85d596a01e0d062c9b3a157b5e2143d586daed707
|
| 3 |
+
size 16872364192
|
model-00010-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:5f812af9dd855ee83d210b265d8487fb8a7aa78712284c8cb625063b95e26110
|
| 3 |
+
size 16872374432
|
model-00011-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:a2b7829f335c08d38c54dbf70961d7ac47cc1ecde55fd6b0e1852110b1178d42
|
| 3 |
+
size 16872353952
|
model-00012-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:721f4df587f77e225c53af4c9b4e7a7a5a9360b8f45780dbc94324a9e53217d8
|
| 3 |
+
size 16872370336
|
model-00013-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:93ddb7520c1893127c292c10d8f5349a64659ab571ce5139ed679af51bea3060
|
| 3 |
+
size 16872349856
|
model-00014-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:b50401233034f32b13fc637e18f438fc564ab2349878dc3dfab48d2c05b8f652
|
| 3 |
+
size 16872360096
|
model-00015-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:5e4854fc72dd0d918c97429f560cdb323f188568c07ccdcf3c4b995adb22f18d
|
| 3 |
+
size 13994195472
|
model-00016-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:5497d49326bc5eabf522e6934dcf9651d6977850d6b17bb8aa2294fbc57ca055
|
| 3 |
+
size 16872368288
|
model-00017-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:716a7e4e4ce81be3de9d1b9c1b61d15b24a8cf4c77f31aa04a399bf7f2725a08
|
| 3 |
+
size 16872347808
|
model-00018-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:1445caf42c4548a6c826a8b94caa993cfa399f160c2cf351d9088c9efba8ae91
|
| 3 |
+
size 16872358048
|
model-00019-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:951c0f53fd2977ca556b3d6e5684e1b5474448babfd37205d105d77992f95876
|
| 3 |
+
size 16872343712
|
model-00020-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:ff953654fe91987587fafaf5305f349ab2eb5d55e9f3c05ee2b27724687861a1
|
| 3 |
+
size 16872364192
|
model-00021-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f30ff41862c1fa75f938489bc5901491780cb34acff5051d0c618b8ba56905cc
|
| 3 |
+
size 16872374432
|
model-00022-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:27c0d615fbb2d312666799fdba12e7a63c59d053259396ab08c20ed6147ec145
|
| 3 |
+
size 16872353952
|
model-00023-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:eaca710846e1a97b3ae143330566d3143f6813285180f3a3d741f4a635f9f65a
|
| 3 |
+
size 13989035424
|
model-00024-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f227f3ae8a264ba4a0fc444231442c71d1ecffcdee1d2c18c7e33f350224cef8
|
| 3 |
+
size 16872372384
|
model-00025-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:c2a012383acf60170ebe112c71cf3b9d069070ee3611da6fca43100d21645930
|
| 3 |
+
size 16872351904
|
model-00026-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:674785a7112a530aa2b78feb8a78076105ee278a0a3ffbb793a47ef881727eb0
|
| 3 |
+
size 16872362144
|
model-00027-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:ec76ca7c3b1741b55b37a43c0049a2288c3e707cb091201d106d81561daa9f1c
|
| 3 |
+
size 16872368288
|
model-00028-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:6fd6161fc14a2f26fe4f44f0cf424648d491397ea5047d1c3bf2636cefdd10bc
|
| 3 |
+
size 16872347808
|
model-00029-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:766516ddc3e9dbe1397c8a733f39e57ec2b87b3c260dacc3f3b42bfc9c0082a9
|
| 3 |
+
size 16872358048
|
model-00030-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:26a4591103f328458e3cb595b1e535b039a15a63c5ff2d8422ddeface20d4bf7
|
| 3 |
+
size 13998690888
|
model-00031-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:599a29c7a09ff9ee2b40bf921036dcaed58c18d36cecdb81db33310454a92d0f
|
| 3 |
+
size 13988110096
|
model-00032-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:9e631a5f02ff02e5fdc4d0ae5796ab1abadb529025cce7d2a66910f9b8084ed9
|
| 3 |
+
size 16872345760
|
model-00033-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:2ad093128de5d8f5e4ea29b268d8c0fe1c905799390003c4d470208221b4b3f4
|
| 3 |
+
size 16872366240
|
model-00034-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:86efc661b3673cb1b105b6562264bd03d1742e9a1557a267408ed9cc9d1a75ad
|
| 3 |
+
size 16872356000
|
model-00035-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:c69ab09dddb32e6fb1afbe66126939aac8ae82e36770a1e488769d5c356b02df
|
| 3 |
+
size 16872372384
|
model-00036-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:6185e64b0e019ddb8acb08b488ddcbf86da2e9803a3fb000b23179466076b5ce
|
| 3 |
+
size 16872351904
|
model-00037-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:ba34e539afdab6572e1dd59b3f3fc2d37e26c77fda7c1259f70a0d233b7150a5
|
| 3 |
+
size 16872362144
|
model-00038-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:81755b11d253153b64c1ba601dc674ad495d2d85848084999fffc66b0e042061
|
| 3 |
+
size 13986959720
|
model-00039-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:dd628fe871308f38acaaef4384f5c974d3e16ab1d41ba88cb324094a1edf2c1b
|
| 3 |
+
size 13996483272
|
model-00072-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:2d54b73679d2caf2650ebd6bd8c50a0f5846a2345cb1f233bc544123e4343150
|
| 3 |
+
size 13989157296
|
model-00077-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:0e3b4c48f7c395070163238ae19c10706b3f866910797f2322add7c8cca05e48
|
| 3 |
+
size 13996499384
|
model-00081-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:becb669ae845f589a5a8b938de822dfe219f6387edf3b45861cd7bdd82cb9107
|
| 3 |
+
size 13993353920
|
model-00088-of-00141.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:8280dd3224cacbf91446e5c1b109d2e815f403097672c4ef33cc98544fb5553f
|
| 3 |
+
size 13972380296
|
special_tokens_map.json
ADDED
|
@@ -0,0 +1,30 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"bos_token": {
|
| 3 |
+
"content": "<longcat_s>",
|
| 4 |
+
"lstrip": false,
|
| 5 |
+
"normalized": false,
|
| 6 |
+
"rstrip": false,
|
| 7 |
+
"single_word": false
|
| 8 |
+
},
|
| 9 |
+
"eos_token": {
|
| 10 |
+
"content": "</longcat_s>",
|
| 11 |
+
"lstrip": false,
|
| 12 |
+
"normalized": false,
|
| 13 |
+
"rstrip": false,
|
| 14 |
+
"single_word": false
|
| 15 |
+
},
|
| 16 |
+
"pad_token": {
|
| 17 |
+
"content": "<longcat_pad>",
|
| 18 |
+
"lstrip": false,
|
| 19 |
+
"normalized": false,
|
| 20 |
+
"rstrip": false,
|
| 21 |
+
"single_word": false
|
| 22 |
+
},
|
| 23 |
+
"unk_token": {
|
| 24 |
+
"content": "<longcat_unk>",
|
| 25 |
+
"lstrip": false,
|
| 26 |
+
"normalized": false,
|
| 27 |
+
"rstrip": false,
|
| 28 |
+
"single_word": false
|
| 29 |
+
}
|
| 30 |
+
}
|
tokenization_llama.py
ADDED
|
@@ -0,0 +1,231 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# coding=utf-8
|
| 2 |
+
# Copyright 2022 EleutherAI and the HuggingFace Inc. team. All rights reserved.
|
| 3 |
+
#
|
| 4 |
+
# This code is based on EleutherAI's GPT-NeoX library and the GPT-NeoX
|
| 5 |
+
# and OPT implementations in this library. It has been modified from its
|
| 6 |
+
# original forms to accommodate minor architectural differences compared
|
| 7 |
+
# to GPT-NeoX and OPT used by the Meta AI team that trained the model.
|
| 8 |
+
#
|
| 9 |
+
# Licensed under the Apache License, Version 2.0 (the "License");
|
| 10 |
+
# you may not use this file except in compliance with the License.
|
| 11 |
+
# You may obtain a copy of the License at
|
| 12 |
+
#
|
| 13 |
+
# http://www.apache.org/licenses/LICENSE-2.0
|
| 14 |
+
#
|
| 15 |
+
# Unless required by applicable law or agreed to in writing, software
|
| 16 |
+
# distributed under the License is distributed on an "AS IS" BASIS,
|
| 17 |
+
# WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.
|
| 18 |
+
# See the License for the specific language governing permissions and
|
| 19 |
+
# limitations under the License.
|
| 20 |
+
|
| 21 |
+
"""Tokenization classes for LLaMA."""
|
| 22 |
+
import os
|
| 23 |
+
from shutil import copyfile
|
| 24 |
+
from typing import Any, Dict, List, Optional, Tuple
|
| 25 |
+
|
| 26 |
+
import sentencepiece as spm
|
| 27 |
+
|
| 28 |
+
from transformers.tokenization_utils import PreTrainedTokenizer
|
| 29 |
+
from transformers.utils import logging
|
| 30 |
+
|
| 31 |
+
|
| 32 |
+
logger = logging.get_logger(__name__)
|
| 33 |
+
|
| 34 |
+
VOCAB_FILES_NAMES = {"vocab_file": "tokenizer.model"}
|
| 35 |
+
|
| 36 |
+
PRETRAINED_VOCAB_FILES_MAP = {}
|
| 37 |
+
|
| 38 |
+
|
| 39 |
+
class LlamaTokenizer(PreTrainedTokenizer):
|
| 40 |
+
"""
|
| 41 |
+
Construct a Llama tokenizer. Based on byte-level Byte-Pair-Encoding.
|
| 42 |
+
|
| 43 |
+
Args:
|
| 44 |
+
vocab_file (`str`):
|
| 45 |
+
Path to the vocabulary file.
|
| 46 |
+
"""
|
| 47 |
+
|
| 48 |
+
vocab_files_names = VOCAB_FILES_NAMES
|
| 49 |
+
pretrained_vocab_files_map = PRETRAINED_VOCAB_FILES_MAP
|
| 50 |
+
model_input_names = ["input_ids", "attention_mask"]
|
| 51 |
+
|
| 52 |
+
def __init__(
|
| 53 |
+
self,
|
| 54 |
+
vocab_file,
|
| 55 |
+
unk_token="<unk>",
|
| 56 |
+
bos_token="<s>",
|
| 57 |
+
eos_token="</s>",
|
| 58 |
+
sp_model_kwargs: Optional[Dict[str, Any]] = None,
|
| 59 |
+
add_bos_token=True,
|
| 60 |
+
add_eos_token=False,
|
| 61 |
+
decode_with_prefix_space=False,
|
| 62 |
+
**kwargs,
|
| 63 |
+
):
|
| 64 |
+
self.sp_model_kwargs = {} if sp_model_kwargs is None else sp_model_kwargs
|
| 65 |
+
super().__init__(bos_token=bos_token, eos_token=eos_token, unk_token=unk_token, **kwargs)
|
| 66 |
+
self.vocab_file = vocab_file
|
| 67 |
+
self.add_bos_token = add_bos_token
|
| 68 |
+
self.add_eos_token = add_eos_token
|
| 69 |
+
self.decode_with_prefix_space = decode_with_prefix_space
|
| 70 |
+
self.sp_model = spm.SentencePieceProcessor(**self.sp_model_kwargs)
|
| 71 |
+
self.sp_model.Load(vocab_file)
|
| 72 |
+
self._no_prefix_space_tokens = None
|
| 73 |
+
|
| 74 |
+
""" Initialisation"""
|
| 75 |
+
|
| 76 |
+
@property
|
| 77 |
+
def no_prefix_space_tokens(self):
|
| 78 |
+
if self._no_prefix_space_tokens is None:
|
| 79 |
+
vocab = self.convert_ids_to_tokens(list(range(self.vocab_size)))
|
| 80 |
+
self._no_prefix_space_tokens = {i for i, tok in enumerate(vocab) if not tok.startswith("▁")}
|
| 81 |
+
return self._no_prefix_space_tokens
|
| 82 |
+
|
| 83 |
+
@property
|
| 84 |
+
def vocab_size(self):
|
| 85 |
+
"""Returns vocab size"""
|
| 86 |
+
return self.sp_model.get_piece_size()
|
| 87 |
+
|
| 88 |
+
@property
|
| 89 |
+
def bos_token_id(self) -> Optional[int]:
|
| 90 |
+
return self.sp_model.bos_id()
|
| 91 |
+
|
| 92 |
+
@property
|
| 93 |
+
def eos_token_id(self) -> Optional[int]:
|
| 94 |
+
return self.sp_model.eos_id()
|
| 95 |
+
|
| 96 |
+
def get_vocab(self):
|
| 97 |
+
"""Returns vocab as a dict"""
|
| 98 |
+
vocab = {self.convert_ids_to_tokens(i): i for i in range(self.vocab_size)}
|
| 99 |
+
vocab.update(self.added_tokens_encoder)
|
| 100 |
+
return vocab
|
| 101 |
+
|
| 102 |
+
def _tokenize(self, text):
|
| 103 |
+
"""Returns a tokenized string."""
|
| 104 |
+
return self.sp_model.encode(text, out_type=str)
|
| 105 |
+
|
| 106 |
+
def _convert_token_to_id(self, token):
|
| 107 |
+
"""Converts a token (str) in an id using the vocab."""
|
| 108 |
+
return self.sp_model.piece_to_id(token)
|
| 109 |
+
|
| 110 |
+
def _convert_id_to_token(self, index):
|
| 111 |
+
"""Converts an index (integer) in a token (str) using the vocab."""
|
| 112 |
+
token = self.sp_model.IdToPiece(index)
|
| 113 |
+
return token
|
| 114 |
+
|
| 115 |
+
def _maybe_add_prefix_space(self, tokens, decoded):
|
| 116 |
+
if tokens and tokens[0] not in self.no_prefix_space_tokens:
|
| 117 |
+
return " " + decoded
|
| 118 |
+
else:
|
| 119 |
+
return decoded
|
| 120 |
+
|
| 121 |
+
def convert_tokens_to_string(self, tokens):
|
| 122 |
+
"""Converts a sequence of tokens (string) in a single string."""
|
| 123 |
+
current_sub_tokens = []
|
| 124 |
+
out_string = ""
|
| 125 |
+
prev_is_special = False
|
| 126 |
+
for token in tokens:
|
| 127 |
+
# make sure that special tokens are not decoded using sentencepiece model
|
| 128 |
+
if token in self.all_special_tokens:
|
| 129 |
+
if not prev_is_special:
|
| 130 |
+
out_string += " "
|
| 131 |
+
out_string += self.sp_model.decode(current_sub_tokens) + token
|
| 132 |
+
prev_is_special = True
|
| 133 |
+
current_sub_tokens = []
|
| 134 |
+
else:
|
| 135 |
+
current_sub_tokens.append(token)
|
| 136 |
+
prev_is_special = False
|
| 137 |
+
out_string += self.sp_model.decode(current_sub_tokens)
|
| 138 |
+
out_string = self._maybe_add_prefix_space(tokens=tokens, decoded=out_string)
|
| 139 |
+
return out_string
|
| 140 |
+
|
| 141 |
+
def save_vocabulary(self, save_directory, filename_prefix: Optional[str] = None) -> Tuple[str]:
|
| 142 |
+
"""
|
| 143 |
+
Save the vocabulary and special tokens file to a directory.
|
| 144 |
+
|
| 145 |
+
Args:
|
| 146 |
+
save_directory (`str`):
|
| 147 |
+
The directory in which to save the vocabulary.
|
| 148 |
+
|
| 149 |
+
Returns:
|
| 150 |
+
`Tuple(str)`: Paths to the files saved.
|
| 151 |
+
"""
|
| 152 |
+
if not os.path.isdir(save_directory):
|
| 153 |
+
logger.error(f"Vocabulary path ({save_directory}) should be a directory")
|
| 154 |
+
return
|
| 155 |
+
out_vocab_file = os.path.join(
|
| 156 |
+
save_directory, (filename_prefix + "-" if filename_prefix else "") + VOCAB_FILES_NAMES["vocab_file"]
|
| 157 |
+
)
|
| 158 |
+
|
| 159 |
+
if os.path.abspath(self.vocab_file) != os.path.abspath(out_vocab_file) and os.path.isfile(self.vocab_file):
|
| 160 |
+
copyfile(self.vocab_file, out_vocab_file)
|
| 161 |
+
elif not os.path.isfile(self.vocab_file):
|
| 162 |
+
with open(out_vocab_file, "wb") as fi:
|
| 163 |
+
content_spiece_model = self.sp_model.serialized_model_proto()
|
| 164 |
+
fi.write(content_spiece_model)
|
| 165 |
+
|
| 166 |
+
return (out_vocab_file,)
|
| 167 |
+
|
| 168 |
+
def build_inputs_with_special_tokens(self, token_ids_0, token_ids_1=None):
|
| 169 |
+
if self.add_bos_token:
|
| 170 |
+
bos_token_ids = [self.bos_token_id]
|
| 171 |
+
else:
|
| 172 |
+
bos_token_ids = []
|
| 173 |
+
|
| 174 |
+
output = bos_token_ids + token_ids_0
|
| 175 |
+
|
| 176 |
+
if token_ids_1 is not None:
|
| 177 |
+
output = output + token_ids_1
|
| 178 |
+
|
| 179 |
+
if self.add_eos_token:
|
| 180 |
+
output = output + [self.eos_token_id]
|
| 181 |
+
|
| 182 |
+
return output
|
| 183 |
+
|
| 184 |
+
def get_special_tokens_mask(
|
| 185 |
+
self, token_ids_0: List[int], token_ids_1: Optional[List[int]] = None, already_has_special_tokens: bool = False
|
| 186 |
+
) -> List[int]:
|
| 187 |
+
"""
|
| 188 |
+
Retrieve sequence ids from a token list that has no special tokens added. This method is called when adding
|
| 189 |
+
special tokens using the tokenizer `prepare_for_model` method.
|
| 190 |
+
|
| 191 |
+
Args:
|
| 192 |
+
token_ids_0 (`List[int]`):
|
| 193 |
+
List of IDs.
|
| 194 |
+
token_ids_1 (`List[int]`, *optional*):
|
| 195 |
+
Optional second list of IDs for sequence pairs.
|
| 196 |
+
already_has_special_tokens (`bool`, *optional*, defaults to `False`):
|
| 197 |
+
Whether or not the token list is already formatted with special tokens for the model.
|
| 198 |
+
|
| 199 |
+
Returns:
|
| 200 |
+
`List[int]`: A list of integers in the range [0, 1]: 1 for a special token, 0 for a sequence token.
|
| 201 |
+
"""
|
| 202 |
+
if already_has_special_tokens:
|
| 203 |
+
return super().get_special_tokens_mask(
|
| 204 |
+
token_ids_0=token_ids_0, token_ids_1=token_ids_1, already_has_special_tokens=True
|
| 205 |
+
)
|
| 206 |
+
|
| 207 |
+
if token_ids_1 is None:
|
| 208 |
+
return [1] + ([0] * len(token_ids_0)) + [1]
|
| 209 |
+
return [1] + ([0] * len(token_ids_0)) + [1, 1] + ([0] * len(token_ids_1)) + [1]
|
| 210 |
+
|
| 211 |
+
def create_token_type_ids_from_sequences(
|
| 212 |
+
self, token_ids_0: List[int], token_ids_1: Optional[List[int]] = None
|
| 213 |
+
) -> List[int]:
|
| 214 |
+
"""
|
| 215 |
+
Create a mask from the two sequences passed to be used in a sequence-pair classification task. T5 does not make
|
| 216 |
+
use of token type ids, therefore a list of zeros is returned.
|
| 217 |
+
|
| 218 |
+
Args:
|
| 219 |
+
token_ids_0 (`List[int]`):
|
| 220 |
+
List of IDs.
|
| 221 |
+
token_ids_1 (`List[int]`, *optional*):
|
| 222 |
+
Optional second list of IDs for sequence pairs.
|
| 223 |
+
|
| 224 |
+
Returns:
|
| 225 |
+
`List[int]`: List of zeros.
|
| 226 |
+
"""
|
| 227 |
+
eos = [self.eos_token_id]
|
| 228 |
+
|
| 229 |
+
if token_ids_1 is None:
|
| 230 |
+
return len(token_ids_0 + eos) * [0]
|
| 231 |
+
return len(token_ids_0 + eos + token_ids_1 + eos) * [0]
|
tokenizer.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
tokenizer_config.json
ADDED
|
@@ -0,0 +1,42 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"add_bos_token": false,
|
| 3 |
+
"add_eos_token": true,
|
| 4 |
+
"add_prefix_space": false,
|
| 5 |
+
"bos_token": {
|
| 6 |
+
"__type": "AddedToken",
|
| 7 |
+
"content": "<longcat_s>",
|
| 8 |
+
"lstrip": false,
|
| 9 |
+
"normalized": true,
|
| 10 |
+
"rstrip": false,
|
| 11 |
+
"single_word": false
|
| 12 |
+
},
|
| 13 |
+
"clean_up_tokenization_spaces": false,
|
| 14 |
+
"eos_token": {
|
| 15 |
+
"__type": "AddedToken",
|
| 16 |
+
"content": "</longcat_s>",
|
| 17 |
+
"lstrip": false,
|
| 18 |
+
"normalized": true,
|
| 19 |
+
"rstrip": false,
|
| 20 |
+
"single_word": false
|
| 21 |
+
},
|
| 22 |
+
"model_max_length": 131072,
|
| 23 |
+
"pad_token": {
|
| 24 |
+
"__type": "AddedToken",
|
| 25 |
+
"content": "<longcat_pad>",
|
| 26 |
+
"lstrip": false,
|
| 27 |
+
"normalized": true,
|
| 28 |
+
"rstrip": false,
|
| 29 |
+
"single_word": false
|
| 30 |
+
},
|
| 31 |
+
"sp_model_kwargs": {},
|
| 32 |
+
"tokenizer_class": "BloomTokenizer",
|
| 33 |
+
"unk_token": {
|
| 34 |
+
"__type": "AddedToken",
|
| 35 |
+
"content": "<longcat_unk>",
|
| 36 |
+
"lstrip": false,
|
| 37 |
+
"normalized": true,
|
| 38 |
+
"rstrip": false,
|
| 39 |
+
"single_word": false
|
| 40 |
+
},
|
| 41 |
+
"chat_template": "{%- set tool_choice = tool_choice | default('auto') -%}\n{%- set enable_thinking = enable_thinking | default(true) -%}\n{%- set save_history_reasoning_content = save_history_reasoning_content | default(true) -%}\n{%- set ns = namespace(final_messages = [], tool_types = [], last_query_index = -1) -%}\n{%- for message in messages -%}\n {%- set role = message.get('role') -%}\n {%- set c = message.get('content') -%}\n {%- if c is string -%}\n {%- set ns.final_messages = ns.final_messages + [message] -%}\n {%- elif c is iterable and c is not mapping -%}\n {%- set parts = namespace(text=[], thinking=[], tool_calls=[], tool_results=[]) -%}\n {%- for item in c -%}\n {%- if item['type'] == 'text' -%}\n {%- set parts.text = parts.text + [item['text']] -%}\n {%- elif item['type'] == 'thinking' -%}\n {%- if item['thinking'] -%}\n {%- set parts.thinking = parts.thinking + [item['thinking']] -%}\n {%- endif -%}\n {%- elif item['type'] == 'tool_use' -%}\n {%- set parts.tool_calls = parts.tool_calls + [{\n 'id': item['id'],\n 'type': 'function',\n 'function': {\n 'name': item['name'],\n 'arguments': item['input']\n }\n }] -%}\n {%- elif item['type'] == 'tool_result' -%}\n {%- set parts.tool_results = parts.tool_results + [{\n 'role': 'tool',\n 'name': item.get('name', ''),\n 'tool_call_id': item['tool_use_id'],\n 'content': item['content']\n }] -%}\n {%- endif -%}\n {%- endfor -%}\n {%- set ns.final_messages = ns.final_messages + parts.tool_results -%}\n {%- if not (parts.tool_results | length > 0 and parts.text | length == 0 and role == 'user') -%}\n {%- set ns.final_messages = ns.final_messages + [{\n 'role': role,\n 'content': parts.text | join(''),\n 'reasoning_content': parts.thinking | join(''),\n 'tool_calls': parts.tool_calls\n }] -%}\n {%- endif -%}\n {%- else -%}\n {%- set ns.final_messages = ns.final_messages + [message] -%}\n {%- endif -%}\n{%- endfor -%}\n{%- set messages = ns.final_messages -%}\n\n{%- for idx in range(messages|length) -%}\n {%- set msg = messages[idx] -%}\n {%- if msg.role == 'user' -%}\n {%- set ns.last_query_index = idx -%}\n {%- endif -%}\n{%- endfor -%}\n\n{%- if tools and tool_choice != 'none' -%}\n {{- \"<longcat_tool_declare>\\n\" -}}\n {{- \"# Tools\\n\" -}}\n {{- \"You have access to the following tools:\\n\\n\" -}}\n {%- for tool in tools -%}\n {%- if tool.type not in ns.tool_types -%}\n {%- set ns.tool_types = ns.tool_types + [tool.type] -%}\n {{- \"## Tool namespace: \" ~ tool.type ~ \"\\n\\n\" -}}\n {%- endif -%}\n {%- if tool.type == 'code_interpreter' -%}\n {%- set tool = {\"type\":\"code_interpreter\",\"function\":{\"name\":\"code_interpreter_preview\",\"description\":\"The code will be executed in a stateful Jupyter notebook sandbox environment, only supports local computation, data processing, and file operations.\\nCode sandbox environment (network isolated) Any external network requests or online API calls are prohibited.\\nIf online functionality is needed, please use other permitted tools.\\nCode will respond with the output of the execution or time out after 60.0 seconds. \",\"parameters\":{\"type\":\"object\",\"properties\":{\"language\":{\"type\":\"string\",\"description\":\"The programming language of the code to be executed. Available values: python (Default), java, go, js, ts, c, c++.\"},\"code\":{\"type\":\"string\",\"description\":\"Python code to be executed must not include the following:\\n- Importing network libraries such as requests, httplib, etc.\\n- Any form of HTTP requests.\\n- External API calls.\\n- Network port operations. Example: ```python\\nimport pandas as pd\\npd.DataFrame({'A':[1,2]})\\n```\"},\"timeout\":{\"type\":\"number\",\"description\":\"The maximum execution time of the code, in seconds. Default is 60.0.\"}}},\"required\":[\"code\"]}} -%}\n {%- endif -%}\n {{- \"### Tool name: \" + tool.function.name + \"\\n\" -}}\n {{- \"Description: \" + tool.function.description + \"\\n\\n\" -}}\n {{- \"InputSchema: \" + tool.function.parameters | tojson(ensure_ascii=False) + \"\\n\\n\" -}}\n {%- endfor -%}\n {{- '**Note**: For each function call, output the function name and arguments within the following XML format:\\n<longcat_tool_call>{function-name}\\n<longcat_arg_key>{arg-key-1}</longcat_arg_key>\\n<longcat_arg_value>{arg-value-1}</longcat_arg_value>\\n<longcat_arg_key>{arg-key-2}</longcat_arg_key>\\n<longcat_arg_value>{arg-value-2}</longcat_arg_value>\\n...\\n</longcat_tool_call>\\n' -}}\n {{- \"</longcat_tool_declare>\"-}}\n{%- endif -%}\n\n{%- for msg in messages -%}\n {%- if msg.role == \"system\" -%}\n {{- \"<longcat_system>\" + msg.content -}}\n {%- elif msg.role == \"user\" -%}\n {{- \"<longcat_user>\" -}}\n {%- if msg[\"files\"] -%}\n {{- '<longcat_files>\\n' ~ msg.files | tojson(indent=2) ~ '\\n</longcat_files>' -}}\n {%- endif -%}\n {{- msg.content -}}\n {%- if save_history_reasoning_content and enable_thinking is not none -%}\n {%- if loop.last or messages[loop.index0 + 1].role != 'assistant' -%}\n {# pass #}\n {%- else -%}\n {%- if enable_thinking == true -%}\n {{- \" /think_on\" -}}\n {{- \" \" -}}\n {%- elif enable_thinking == false -%}\n {{- \" /think_off \" -}}\n {%- endif -%}\n {%- endif -%}\n {%- elif loop.index0 >= ns.last_query_index and enable_thinking is not none -%}\n {%- if loop.last or messages[loop.index0 + 1].role != 'assistant' -%}\n {# pass #}\n {%- else -%}\n {%- if enable_thinking == true -%}\n {{- \" /think_on\" -}}\n {{- \" \" -}}\n {%- elif enable_thinking == false -%}\n {{- \" /think_off \" -}}\n {%- endif -%}\n {%- endif -%}\n {%- endif -%}\n {%- elif msg.role == \"assistant\" -%}\n {{- \"<longcat_assistant>\" -}}\n {%- if save_history_reasoning_content == true or loop.index0 > ns.last_query_index -%}\n {%- if enable_thinking == true -%}\n {%- if msg.reasoning_content -%}\n {%- set reasoning_content = msg.reasoning_content | trim -%}\n {{- \"<longcat_think>\\n\" ~ reasoning_content ~ \"\\n</longcat_think>\\n\" -}}\n {%- else -%}\n {{- \"<longcat_think>\\n\\n</longcat_think>\\n\" -}}\n {%- endif -%}\n {%- elif enable_thinking == false -%}\n {{- \"<longcat_think>\\n\\n</longcat_think>\\n\" -}}\n {%- endif -%}\n {%- endif -%}\n {%- if msg.content -%}\n {{- msg.content -}}\n {%- endif -%}\n {%- if msg.tool_calls -%}\n {%- for tool_call in msg.tool_calls -%}\n {{- \"<longcat_tool_call>\" ~ tool_call.function.name ~ \"\\n\" -}}\n {%- set _args = tool_call.function.arguments -%}\n {%- for k, v in _args.items() -%}\n {{- \"<longcat_arg_key>\" ~ k ~ \"</longcat_arg_key>\\n\" -}}\n {{- \"<longcat_arg_value>\" ~ (v if v is string else v | tojson(ensure_ascii=False)) ~ \"</longcat_arg_value>\\n\" -}}\n {% endfor -%}\n {{- \"</longcat_tool_call>\\n\" -}}\n {%- endfor -%}\n {%- endif -%}\n {{- \"</longcat_s>\" -}}\n {%- elif msg.role == \"tool\" -%}\n {%- if messages[loop.index0 - 1].role != \"tool\" -%}\n {{- \"<longcat_observation>\" -}}\n {%- endif -%}\n {{- \"<longcat_tool_response>\" ~ msg.name ~ \"\\n\" ~ msg.content ~ \"</longcat_tool_response>\" -}}\n {%- if loop.index0 == messages|length - 1 -%}\n {# pass #}\n {%- elif (save_history_reasoning_content or loop.index0 > ns.last_query_index) and messages[loop.index0 + 1].role != \"tool\" -%}\n {%- if enable_thinking == true -%}\n {{- \" /think_on\" -}}\n {{- \" \" -}}\n {%- elif enable_thinking == false -%}\n {{- \" /think_off \" -}}\n {%- endif -%}\n {%- endif -%}\n {%- endif -%}\n{%- endfor -%}\n{%- if add_generation_prompt -%}\n {%- if enable_thinking == true -%}\n {{- \" /think_on\" -}}\n {{- \" <longcat_assistant><longcat_think>\" -}}\n {%- elif enable_thinking == false -%}\n {{- \" /think_off <longcat_assistant><longcat_think>\\n\\n</longcat_think>\\n\" -}}\n {%- else -%}\n {{- \" /think_off <longcat_assistant><longcat_think>\\n\\n</longcat_think>\\n\" -}}\n {%- endif -%}\n{%- endif -%}"
|
| 42 |
+
}
|