| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
|
|
| services: |
| glm52: |
| entrypoint: ["/bin/bash", "/release/apply-v20-capacity-fixes.sh"] |
| environment: |
| MTP: "3" |
| ONLINE_QUANT: custom |
| QUANTIZATION_CONFIG_JSON: >- |
| {"linear":{"weight":"mxfp8"},"shared_experts":{"weight":"mxfp8"},"ignore":["re:.*\\.fused_qkv_a_proj$","re:.*\\.q_a_proj$","re:.*kv_a_proj_with_mqa","re:.*\\.mlp\\.gate$","model.layers.78.eh_proj","lm_head"]} |
| KV_CACHE_MEMORY_BYTES: "6163200000" |
| MAX_MODEL_LEN: "450000" |
| MAX_BATCHED_TOKENS: "2048" |
| MAX_NUM_SEQS: "8" |
| GRAPH: "32" |
| CUDAGRAPH_SIZES_LIST: "1,2,4,8,32" |
| GPU_MEMORY_UTILIZATION: "0.983" |
| PYTORCH_CUDA_ALLOC_CONF: "" |
|
|
| VLLM_B12X_MLA_CKV_GATHER_MAX_TOKENS: "131072" |
| DCP_QUERY_SPLIT: "0" |
| DCP_CKV_GATHER: "1" |
| DCP_TOPK_OWNER_MERGE: "1" |
| DCP_INDEXER_SHARDS: "0" |
| DCP_CKV_PREFETCH_DEPTH: "0" |
| PCIE_CALIBRATION: "off" |
| PCIE_DMA_MIN_BYTES: "25165824" |
|
|
| SPARKINFER_PAGED_INDEX_MAX_FOLD_SLICES: "8" |
| SPARKINFER_PAGED_INDEX_TWO_LEVEL_FOLD: "0" |
| VLLM_B12X_ABSORB_BMM: "1" |
| volumes: |
| - ./apply-v20-capacity-fixes.sh:/release/apply-v20-capacity-fixes.sh:ro |
| - ./serve-glm52-v16.context-cap.sh:/release/serve-glm52-v16.context-cap.sh:ro |
| - ./patches:/release/patches:ro |
|
|