DM-GDNMLA-1.7B-DM / config.train.json
tturing's picture
Add Q35MLA_fp8base_md_ffn8_qkvo8_fp11_hd128_11785_fm128: GDN:MLA 1.7B, DM (match) arm, seed 11785 (standalone, trust_remote_code)
2ed6d1a verified
Raw History Blame Contribute Delete
1.36 kB
{
"attn_impl": "sdpa",
"attn_output_gate": true,
"bqa_local_precision": "fp8",
"bqa_nvfp4_block": 16,
"bqa_remote_k_precision": "fp8",
"bqa_remote_topk": -1,
"bqa_remote_v_precision": "nvfp4",
"bqa_rotate": true,
"bqa_window": 512,
"d_model": 2048,
"ffn_mult": 2.6666666666666665,
"ffn_multiple_of": 256,
"gdn_head_dim": 128,
"gdn_num_heads": 16,
"gdn_num_v_heads": null,
"head_dim": 128,
"hidden_size": 2048,
"intermediate_size": 6144,
"kv_lora_rank": 384,
"layer_mixers": [
"gated_deltanet",
"gated_deltanet",
"gated_deltanet",
"mla_fp8"
],
"mamba2_chunk_size": 256,
"mamba2_d_state": 128,
"mamba2_expand": 2,
"mamba2_headdim": null,
"mamba2_ngroups": 1,
"max_position_embeddings": 8192,
"max_seq_len": 8192,
"mixer": "gqa",
"model_type": "bqalm",
"n_heads": 16,
"n_kv_heads": 16,
"n_layers": 24,
"nope": false,
"norm_eps": 1e-06,
"num_attention_heads": 16,
"num_hidden_layers": 24,
"partial_rotary_factor": 0.5,
"qk_norm": true,
"rms_norm_in_fp32": true,
"rope_parameters": {
"partial_rotary_factor": 0.5,
"rope_theta": 10000000,
"rope_type": "default"
},
"rope_theta": 10000000,
"sb_impl": "triton",
"tie_embeddings": true,
"tie_word_embeddings": true,
"transformers_version": "5.9.0",
"vocab_size": 32000,
"z_loss_weight": 0.0
}