GLM-5.2-MXFP8-NVFP4-NF3-Hybrid / docker-compose.fp8-450k-mtp3.yml
madeby561's picture
Publish validated v20 profiles, calibrated KV scales, and release card
2eb778b verified
Raw
History Blame
1.72 kB
# Review overlay — exact four-GPU 450k FP8-KV/MTP3 certification profile.
#
# Use with the base FP8 Compose:
#
# MODEL_DIR=/path/to/GLM-5.2-MXFP8-NVFP4-NF3-Hybrid \
# CACHE_DIR=./cache/glm52-nf3-v20-fp8-450k \
# docker compose \
# -f docker-compose.fp8.yml \
# -f docker-compose.fp8-450k-mtp3.yml up -d
#
# This applies the same two reviewed runtime patches used by the 775k NVFP4
# profile. No checkpoint file is modified.
services:
glm52:
entrypoint: ["/bin/bash", "/release/apply-v20-capacity-fixes.sh"]
environment:
MTP: "3"
ONLINE_QUANT: custom
QUANTIZATION_CONFIG_JSON: >-
{"linear":{"weight":"mxfp8"},"shared_experts":{"weight":"mxfp8"},"ignore":["re:.*\\.fused_qkv_a_proj$","re:.*\\.q_a_proj$","re:.*kv_a_proj_with_mqa","re:.*\\.mlp\\.gate$","model.layers.78.eh_proj","lm_head"]}
KV_CACHE_MEMORY_BYTES: "6163200000"
MAX_MODEL_LEN: "450000"
MAX_BATCHED_TOKENS: "2048"
MAX_NUM_SEQS: "8"
GRAPH: "32"
CUDAGRAPH_SIZES_LIST: "1,2,4,8,32"
GPU_MEMORY_UTILIZATION: "0.983"
PYTORCH_CUDA_ALLOC_CONF: ""
VLLM_B12X_MLA_CKV_GATHER_MAX_TOKENS: "131072"
DCP_QUERY_SPLIT: "0"
DCP_CKV_GATHER: "1"
DCP_TOPK_OWNER_MERGE: "1"
DCP_INDEXER_SHARDS: "0"
DCP_CKV_PREFETCH_DEPTH: "0"
PCIE_CALIBRATION: "off"
PCIE_DMA_MIN_BYTES: "25165824"
SPARKINFER_PAGED_INDEX_MAX_FOLD_SLICES: "8"
SPARKINFER_PAGED_INDEX_TWO_LEVEL_FOLD: "0"
VLLM_B12X_ABSORB_BMM: "1"
volumes:
- ./apply-v20-capacity-fixes.sh:/release/apply-v20-capacity-fixes.sh:ro
- ./serve-glm52-v16.context-cap.sh:/release/serve-glm52-v16.context-cap.sh:ro
- ./patches:/release/patches:ro