# Review overlay — exact four-GPU 450k FP8-KV/MTP3 certification profile. # # Use with the base FP8 Compose: # # MODEL_DIR=/path/to/GLM-5.2-MXFP8-NVFP4-NF3-Hybrid \ # CACHE_DIR=./cache/glm52-nf3-v20-fp8-450k \ # docker compose \ # -f docker-compose.fp8.yml \ # -f docker-compose.fp8-450k-mtp3.yml up -d # # This applies the same two reviewed runtime patches used by the 775k NVFP4 # profile. No checkpoint file is modified. services: glm52: entrypoint: ["/bin/bash", "/release/apply-v20-capacity-fixes.sh"] environment: MTP: "3" ONLINE_QUANT: custom QUANTIZATION_CONFIG_JSON: >- {"linear":{"weight":"mxfp8"},"shared_experts":{"weight":"mxfp8"},"ignore":["re:.*\\.fused_qkv_a_proj$","re:.*\\.q_a_proj$","re:.*kv_a_proj_with_mqa","re:.*\\.mlp\\.gate$","model.layers.78.eh_proj","lm_head"]} KV_CACHE_MEMORY_BYTES: "6163200000" MAX_MODEL_LEN: "450000" MAX_BATCHED_TOKENS: "2048" MAX_NUM_SEQS: "8" GRAPH: "32" CUDAGRAPH_SIZES_LIST: "1,2,4,8,32" GPU_MEMORY_UTILIZATION: "0.983" PYTORCH_CUDA_ALLOC_CONF: "" VLLM_B12X_MLA_CKV_GATHER_MAX_TOKENS: "131072" DCP_QUERY_SPLIT: "0" DCP_CKV_GATHER: "1" DCP_TOPK_OWNER_MERGE: "1" DCP_INDEXER_SHARDS: "0" DCP_CKV_PREFETCH_DEPTH: "0" PCIE_CALIBRATION: "off" PCIE_DMA_MIN_BYTES: "25165824" SPARKINFER_PAGED_INDEX_MAX_FOLD_SLICES: "8" SPARKINFER_PAGED_INDEX_TWO_LEVEL_FOLD: "0" VLLM_B12X_ABSORB_BMM: "1" volumes: - ./apply-v20-capacity-fixes.sh:/release/apply-v20-capacity-fixes.sh:ro - ./serve-glm52-v16.context-cap.sh:/release/serve-glm52-v16.context-cap.sh:ro - ./patches:/release/patches:ro