madeby561 commited on
Commit
66f3623
·
verified ·
1 Parent(s): 2eb778b

Remove obsolete v3 root Compose

Browse files
Files changed (1) hide show
  1. docker-compose.yml +0 -87
docker-compose.yml DELETED
@@ -1,87 +0,0 @@
1
- # GLM-5.2-MXFP8-NVFP4-NF3-Hybrid v3.6 — daily-driver serving config.
2
- # 2026-07-09: damage-optimal expert allocation + BF16-stored non-expert tier
3
- # (single-hop online-MXFP8). Checkpoint re-sharded to 184x <=2GB files ->
4
- # fastsafetensors is reliable again (boot ~2 min).
5
- # 4x 96GB sm120 GPUs. Native mxfp8 tier + squeezed envelope -> 422,656-token
6
- # KV pool @ 262k max context (measured 2026-07-09 on 4x RTX PRO 6000 Max-Q).
7
- # If warmup OOMs on your box, drop --gpu-memory-utilization to 0.96 (~-20k pool).
8
- # mxfp8_tier_nokvb.json mount = the measured overlay convention (kv_b_proj +
9
- # shared_experts stay true BF16; this is the config every published number used).
10
- # hf download madeby561/GLM-5.2-MXFP8-NVFP4-NF3-Hybrid --local-dir ./glm52-mxfp8
11
- # MODEL_DIR=./glm52-mxfp8 docker compose up
12
- services:
13
- glm52:
14
- image: madeby561/vllm-glm52-nvfp4-nf3-hybrid:v3
15
- network_mode: host
16
- ipc: host
17
- shm_size: 32gb
18
- init: true
19
- ulimits:
20
- memlock: -1
21
- stack: 67108864
22
- deploy:
23
- resources:
24
- reservations:
25
- devices:
26
- - driver: nvidia
27
- count: all
28
- capabilities: [gpu]
29
- volumes:
30
- - ${MODEL_DIR:?set MODEL_DIR to the downloaded checkpoint dir}:/model:ro
31
- - ${MODEL_DIR}/mxfp8_tier_nokvb.json:/opt/venv/lib/python3.12/site-packages/mxfp8_tier.json:ro
32
- - vllm-cache:/cache
33
- environment:
34
- CUDA_VISIBLE_DEVICES: "0,1,2,3"
35
- CUDA_DEVICE_ORDER: PCI_BUS_ID
36
- CUDA_DEVICE_MAX_CONNECTIONS: "32"
37
- CUTE_DSL_ARCH: sm_120a
38
- OMP_NUM_THREADS: "16"
39
- PYTORCH_CUDA_ALLOC_CONF: expandable_segments:True
40
- SAFETENSORS_FAST_GPU: "1"
41
- NCCL_IB_DISABLE: "1"
42
- NCCL_P2P_LEVEL: SYS
43
- NCCL_PROTO: LL,LL128,Simple
44
- VLLM_USE_B12X_FP8_GEMM: "1"
45
- VLLM_USE_B12X_MOE: "1"
46
- VLLM_USE_B12X_SPARSE_INDEXER: "1"
47
- VLLM_USE_V2_MODEL_RUNNER: "1"
48
- B12X_W4A16_TC_DECODE: "1"
49
- B12X_MOE_FORCE_A16: "1"
50
- VLLM_DCP_GLOBAL_TOPK: "1"
51
- VLLM_DCP_SHARD_DRAFT: "1"
52
- VLLM_ENABLE_PCIE_ALLREDUCE: "1"
53
- VLLM_PCIE_ALLREDUCE_BACKEND: b12x
54
- VLLM_PCIE_ONESHOT_ALLREDUCE_MAX_SIZE: 64KB
55
- # v3 image bakes env-tunable AR crossovers (CARPATCH): this routing
56
- # puts decode-step all-reduces on the fast paths -> ~95-101 t/s
57
- # single-stream decode (vs 67-74 on stock crossovers).
58
- VLLM_PCIE_ONESHOT_MAX_BYTES: "65536"
59
- B12X_DENSE_SPLITK_TURBO: "1"
60
- XDG_CACHE_HOME: /cache/jit
61
- TRITON_CACHE_DIR: /cache/jit/triton
62
- HYBRID_TIER: both
63
- HYBRID_KEPT: b12x_nf3
64
- HYBRID_NF3: b12x_nf3
65
- HYBRID_B12X_MAX_TOKENS: "2048"
66
- HYBRID_MXFP8_NATIVE: "1"
67
- command: >
68
- vllm serve /model
69
- --served-model-name GLM-5.2 --host 0.0.0.0 --port 5001
70
- --trust-remote-code --tensor-parallel-size 4
71
- --decode-context-parallel-size 4 --dcp-comm-backend ag_rs --dcp-kv-cache-interleave-size 1
72
- --kv-cache-dtype fp8
73
- --attention-backend B12X_MLA_SPARSE
74
- --moe-backend b12x
75
- --load-format fastsafetensors
76
- -cc.pass_config.fuse_allreduce_rms=True
77
- --gpu-memory-utilization 0.968
78
- --max-model-len 262144 --max-num-seqs 8 --max-num-batched-tokens 2048
79
- --max-cudagraph-capture-size 64
80
- --async-scheduling --enable-chunked-prefill --enable-prefix-caching
81
- --enable-auto-tool-choice --tool-call-parser glm47
82
- --reasoning-parser glm45
83
- --default-chat-template-kwargs '{"reasoning_effort":"high"}'
84
- --hf-overrides '{"use_index_cache":true,"index_topk_pattern":"FFFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSSFSSS"}'
85
- --speculative-config '{"method":"mtp","num_speculative_tokens":5,"moe_backend":"b12x","draft_sample_method":"probabilistic"}'
86
- volumes:
87
- vllm-cache: