| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
|
|
| name: glm52-nf3-v20-nvfp4 |
|
|
| services: |
| glm52: |
| image: voipmonitor/vllm:gilded-gnosis-v20-vllm0c79e41-sie603f74-fi801d57a-cu132-20260726 |
| entrypoint: ["/usr/local/bin/serve-gilded-gnosis.sh"] |
| restart: unless-stopped |
| network_mode: host |
| ipc: host |
| privileged: true |
| init: true |
| shm_size: 32gb |
| gpus: all |
| ulimits: |
| memlock: -1 |
| stack: 67108864 |
| nofile: |
| soft: 1048576 |
| hard: 1048576 |
| environment: |
| MODEL_FAMILY: glm52-hybrid |
| MODEL: /root/models/GLM-5.2-MXFP8-NVFP4-NF3-Hybrid |
| SERVED_MODEL_NAME: GLM-5.2 |
| GPUS: 0,1,2,3 |
| PORT: "${PORT:-5001}" |
| TP: "4" |
| DCP: "4" |
| DCP_BACKEND: a2a |
| DCP_A2A_MAX_TOKENS: "16" |
| DCP_A2A_LARGE_BACKEND: ag_rs |
| DCP_PREFILL_WORKSPACE: auto |
| |
| |
| |
| DCP_QUERY_SPLIT: "${DCP_QUERY_SPLIT:-auto}" |
| DCP_CKV_GATHER: "${DCP_CKV_GATHER:-auto}" |
| DCP_TOPK_OWNER_MERGE: "${DCP_TOPK_OWNER_MERGE:-auto}" |
| DCP_INDEXER_SHARDS: "${DCP_INDEXER_SHARDS:-auto}" |
| DCP_CKV_PREFETCH_DEPTH: "${DCP_CKV_PREFETCH_DEPTH:-auto}" |
| PCIE_CALIBRATION: "${PCIE_CALIBRATION:-auto}" |
| PCIE_DMA_MIN_BYTES: "${PCIE_DMA_MIN_BYTES:-auto}" |
| |
| |
| |
| |
| VLLM_B12X_MLA_CKV_GATHER_MAX_TOKENS: "${VLLM_B12X_MLA_CKV_GATHER_MAX_TOKENS:-524288}" |
| F8_DMA: "0" |
| MTP: "${MTP:-0}" |
| MOE_MODE: a16 |
| ONLINE_QUANT: custom |
| QUANTIZATION_CONFIG_JSON: >- |
| {"linear":{"weight":"mxfp8"},"shared_experts":{"weight":"mxfp8"},"ignore":["re:.*\\.fused_qkv_a_proj$","re:.*\\.q_a_proj$","re:.*kv_a_proj_with_mqa","re:.*\\.mlp\\.gate$","model.layers.78.eh_proj","lm_head"]} |
| |
| |
| |
| |
| |
| VLLM_B12X_ABSORB_BMM: "${VLLM_B12X_ABSORB_BMM:-0}" |
| KV_CACHE_DTYPE: nvfp4_ds_mla |
| |
| |
| KV_CACHE_MEMORY_BYTES: "${KV_CACHE_MEMORY_BYTES:-}" |
| |
| |
| KV_FP8_ROPE: "${KV_FP8_ROPE:-0}" |
| VLLM_NVFP4_MLA_SCALES_FILE: /root/models/GLM-5.2-MXFP8-NVFP4-NF3-Hybrid/kv-scales/glm52-nvfp4-nf3-hybrid_mla_outer_scales_v1.json |
| MAX_NUM_SEQS: "${MAX_NUM_SEQS:-8}" |
| GRAPH: "${GRAPH:-64}" |
| CUDAGRAPH_SIZES_LIST: "${CUDAGRAPH_SIZES_LIST:-}" |
| MAX_MODEL_LEN: "${MAX_MODEL_LEN:-700000}" |
| MAX_BATCHED_TOKENS: "${MAX_BATCHED_TOKENS:-2048}" |
| |
| |
| |
| GPU_MEMORY_UTILIZATION: "${GPU_MEMORY_UTILIZATION:-0.983}" |
| LOAD_FORMAT: instanttensor |
| INSTANTTENSOR_BACKEND: BUFFERED |
| |
| |
| |
| |
| PYTORCH_CUDA_ALLOC_CONF: "${PYTORCH_CUDA_ALLOC_CONF-expandable_segments:True}" |
| volumes: |
| - ${MODEL_DIR:?set MODEL_DIR to the downloaded checkpoint directory}:/root/models/GLM-5.2-MXFP8-NVFP4-NF3-Hybrid:ro |
| - ${CACHE_DIR:-./cache/glm52-nf3-v20-nvfp4}:/cache |
| - ${CACHE_DIR:-./cache/glm52-nf3-v20-nvfp4}/tmp:/container-tmp |
|
|