Remove obsolete v3 root Compose
Browse files- docker-compose.yml +0 -87
docker-compose.yml
DELETED
|
@@ -1,87 +0,0 @@
|
|
| 1 |
-
# GLM-5.2-MXFP8-NVFP4-NF3-Hybrid v3.6 — daily-driver serving config.
|
| 2 |
-
# 2026-07-09: damage-optimal expert allocation + BF16-stored non-expert tier
|
| 3 |
-
# (single-hop online-MXFP8). Checkpoint re-sharded to 184x <=2GB files ->
|
| 4 |
-
# fastsafetensors is reliable again (boot ~2 min).
|
| 5 |
-
# 4x 96GB sm120 GPUs. Native mxfp8 tier + squeezed envelope -> 422,656-token
|
| 6 |
-
# KV pool @ 262k max context (measured 2026-07-09 on 4x RTX PRO 6000 Max-Q).
|
| 7 |
-
# If warmup OOMs on your box, drop --gpu-memory-utilization to 0.96 (~-20k pool).
|
| 8 |
-
# mxfp8_tier_nokvb.json mount = the measured overlay convention (kv_b_proj +
|
| 9 |
-
# shared_experts stay true BF16; this is the config every published number used).
|
| 10 |
-
# hf download madeby561/GLM-5.2-MXFP8-NVFP4-NF3-Hybrid --local-dir ./glm52-mxfp8
|
| 11 |
-
# MODEL_DIR=./glm52-mxfp8 docker compose up
|
| 12 |
-
services:
|
| 13 |
-
glm52:
|
| 14 |
-
image: madeby561/vllm-glm52-nvfp4-nf3-hybrid:v3
|
| 15 |
-
network_mode: host
|
| 16 |
-
ipc: host
|
| 17 |
-
shm_size: 32gb
|
| 18 |
-
init: true
|
| 19 |
-
ulimits:
|
| 20 |
-
memlock: -1
|
| 21 |
-
stack: 67108864
|
| 22 |
-
deploy:
|
| 23 |
-
resources:
|
| 24 |
-
reservations:
|
| 25 |
-
devices:
|
| 26 |
-
- driver: nvidia
|
| 27 |
-
count: all
|
| 28 |
-
capabilities: [gpu]
|
| 29 |
-
volumes:
|
| 30 |
-
- ${MODEL_DIR:?set MODEL_DIR to the downloaded checkpoint dir}:/model:ro
|
| 31 |
-
- ${MODEL_DIR}/mxfp8_tier_nokvb.json:/opt/venv/lib/python3.12/site-packages/mxfp8_tier.json:ro
|
| 32 |
-
- vllm-cache:/cache
|
| 33 |
-
environment:
|
| 34 |
-
CUDA_VISIBLE_DEVICES: "0,1,2,3"
|
| 35 |
-
CUDA_DEVICE_ORDER: PCI_BUS_ID
|
| 36 |
-
CUDA_DEVICE_MAX_CONNECTIONS: "32"
|
| 37 |
-
CUTE_DSL_ARCH: sm_120a
|
| 38 |
-
OMP_NUM_THREADS: "16"
|
| 39 |
-
PYTORCH_CUDA_ALLOC_CONF: expandable_segments:True
|
| 40 |
-
SAFETENSORS_FAST_GPU: "1"
|
| 41 |
-
NCCL_IB_DISABLE: "1"
|
| 42 |
-
NCCL_P2P_LEVEL: SYS
|
| 43 |
-
NCCL_PROTO: LL,LL128,Simple
|
| 44 |
-
VLLM_USE_B12X_FP8_GEMM: "1"
|
| 45 |
-
VLLM_USE_B12X_MOE: "1"
|
| 46 |
-
VLLM_USE_B12X_SPARSE_INDEXER: "1"
|
| 47 |
-
VLLM_USE_V2_MODEL_RUNNER: "1"
|
| 48 |
-
B12X_W4A16_TC_DECODE: "1"
|
| 49 |
-
B12X_MOE_FORCE_A16: "1"
|
| 50 |
-
VLLM_DCP_GLOBAL_TOPK: "1"
|
| 51 |
-
VLLM_DCP_SHARD_DRAFT: "1"
|
| 52 |
-
VLLM_ENABLE_PCIE_ALLREDUCE: "1"
|
| 53 |
-
VLLM_PCIE_ALLREDUCE_BACKEND: b12x
|
| 54 |
-
VLLM_PCIE_ONESHOT_ALLREDUCE_MAX_SIZE: 64KB
|
| 55 |
-
# v3 image bakes env-tunable AR crossovers (CARPATCH): this routing
|
| 56 |
-
# puts decode-step all-reduces on the fast paths -> ~95-101 t/s
|
| 57 |
-
# single-stream decode (vs 67-74 on stock crossovers).
|
| 58 |
-
VLLM_PCIE_ONESHOT_MAX_BYTES: "65536"
|
| 59 |
-
B12X_DENSE_SPLITK_TURBO: "1"
|
| 60 |
-
XDG_CACHE_HOME: /cache/jit
|
| 61 |
-
TRITON_CACHE_DIR: /cache/jit/triton
|
| 62 |
-
HYBRID_TIER: both
|
| 63 |
-
HYBRID_KEPT: b12x_nf3
|
| 64 |
-
HYBRID_NF3: b12x_nf3
|
| 65 |
-
HYBRID_B12X_MAX_TOKENS: "2048"
|
| 66 |
-
HYBRID_MXFP8_NATIVE: "1"
|
| 67 |
-
command: >
|
| 68 |
-
vllm serve /model
|
| 69 |
-
--served-model-name GLM-5.2 --host 0.0.0.0 --port 5001
|
| 70 |
-
--trust-remote-code --tensor-parallel-size 4
|
| 71 |
-
--decode-context-parallel-size 4 --dcp-comm-backend ag_rs --dcp-kv-cache-interleave-size 1
|
| 72 |
-
--kv-cache-dtype fp8
|
| 73 |
-
--attention-backend B12X_MLA_SPARSE
|
| 74 |
-
--moe-backend b12x
|
| 75 |
-
--load-format fastsafetensors
|
| 76 |
-
-cc.pass_config.fuse_allreduce_rms=True
|
| 77 |
-
--gpu-memory-utilization 0.968
|
| 78 |
-
--max-model-len 262144 --max-num-seqs 8 --max-num-batched-tokens 2048
|
| 79 |
-
--max-cudagraph-capture-size 64
|
| 80 |
-
--async-scheduling --enable-chunked-prefill --enable-prefix-caching
|
| 81 |
-
--enable-auto-tool-choice --tool-call-parser glm47
|
| 82 |
-
--reasoning-parser glm45
|
| 83 |
-
--default-chat-template-kwargs '{"reasoning_effort":"high"}'
|
| 84 |
-
--hf-overrides '{"use_index_cache":true,"index_topk_pattern":"FFFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSS"}'
|
| 85 |
-
--speculative-config '{"method":"mtp","num_speculative_tokens":5,"moe_backend":"b12x","draft_sample_method":"probabilistic"}'
|
| 86 |
-
volumes:
|
| 87 |
-
vllm-cache:
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|