GLM-5.3 量化精度与 MTP 对比
生成时间:2026-08-31 06:39:50
对比三个检查点:官方 FP8 发布版、本次产出的 W4A8(compressed-tensors)、 以及 PhalaCloud 公布的 W4AFP8(SGLang 原生格式,数值取自其模型卡,本地未复现)。
本文所有实测数字均在 vLLM 上取得。W4A8 检查点同样可在 SGLang 上加载运行(见模型卡「部署 / SGLang」), 但未在 SGLang 上重跑评测,两引擎 kernel 实现不同,数字不能互相套用。
1. 检查点基本信息
| 项目 | GLM-5.3 (FP8 原版) | GLM-5.3-W4A8 (本次产出) | PhalaCloud W4AFP8 (公布值) |
|---|---|---|---|
| 体积 | 703.7 GiB | 372.3 GiB | 372.3 GiB |
| 专家权重 | FP8 block 128×128 | INT4 group-128 (RTN + MSE 裁剪搜索) | INT4 group-128 (AWQ 校准) |
| 量化来源 | 官方发布 | 由 FP8 发布版反量化后再量化 | 由 BF16 母版量化 |
| 非专家层 | FP8 block | FP8 block(逐字节未改) | FP8 block |
| 激活 | FP8 动态 | FP8 per-token 动态 | FP8 动态 |
| 格式 | fp8 | compressed-tensors(专家 pack-quantized,非专家 float-quantized) | w4afp8 (SGLang) |
| 推理引擎 | vLLM / SGLang | vLLM / SGLang | SGLang(vLLM 支持在 PR 中) |
| 专家权重重建相对误差 | 0.0265 | 0.103 | 0.108–0.13(其模型卡自述) |
2. GPQA-Diamond
198 题,每题 4 次采样,temperature 1.0 / top_p 0.95,选项顺序按题号固定打乱,两个模型看到完全相同的提示。
| 指标 | GLM-5.3 (FP8) | GLM-5.3-W4A8 | PhalaCloud W4AFP8 (公布值) |
|---|---|---|---|
| pass@1 | 89.65 | 90.28 | 91.92 (182/198) |
| majority@4 | 90.91 | 90.91 | — |
| 答案解析失败 | 0 | 0 | — |
| 因长度截断 | 122 | 131 | — |
| 平均输出 token | 12159 | 12661 | — |
W4A8 相对 FP8 的 pass@1 差值:**+0.63 个百分点**。 198 题 × 4 采样下,1 个百分点约等于 8 个样本,注意采样噪声。
PhalaCloud 的数值来自不同引擎(SGLang)和不同评测协议(带截断重试),仅供参照,不能与本表前两列直接做减法。
3. Teacher-forced NLL(留出文本,越低越好)
64 段 × 2048 token 的留出文本,两个模型评分的 token 序列完全相同。 这是对量化损伤最敏感的低噪声指标。
| 指标 | GLM-5.3 (FP8) | GLM-5.3-W4A8 | PhalaCloud W4AFP8 (公布值) |
|---|---|---|---|
| NLL (nats/token) | 0.8929 | 0.8940 | 相对 BF16 +0.282 nats |
| 困惑度 | 2.442 | 2.445 | — |
| 窗口间标准误 | 0.0740 | 0.0743 | — |
W4A8 相对 FP8 的 dNLL:**+0.0010 nats/token**。 注意基线不同:PhalaCloud 的 +0.282 是相对 BF16 母版,本表是相对 FP8 发布版。
4. MTP / 投机解码
vLLM 通过 glm_moe_dsa -> deepseek_mtp -> DeepSeekMTPModel 路径加载第 78 层草稿头。
测试为 512 token 输入 / 256 token 输出,对比开启与关闭 MTP 的解码吞吐。
| 检查点 | 并发 | 无 MTP (输出 tok/s) | 开 MTP (输出 tok/s) | 加速比 |
|---|---|---|---|---|
| GLM-5.3 (FP8) | 1 | 86.2 | 148.7 | 1.72x |
| GLM-5.3 (FP8) | 4 | 264.7 | 349.6 | 1.32x |
| GLM-5.3 (FP8) | 16 | 550.8 | 695.0 | 1.26x |
| GLM-5.3 (FP8) | 64 | 1104.6 | 1306.2 | 1.18x |
| GLM-5.3-W4A8 | 1 | 66.2 | 103.5 | 1.56x |
| GLM-5.3-W4A8 | 4 | 196.4 | 281.8 | 1.44x |
| GLM-5.3-W4A8 | 16 | 480.1 | 572.0 | 1.19x |
| GLM-5.3-W4A8 | 64 | 962.8 | 1190.1 | 1.24x |
PhalaCloud 公布的接受长度:~2.93 (EAGLE steps=3)(EAGLE steps=3,与此处 num_speculative_tokens=1 的口径不同)。
5. PhalaCloud 模型卡公布但本地未复现的项
| 基准 | PhalaCloud W4AFP8 | 未复现原因 |
|---|---|---|
| AA-LCR | 73.0 | 数据集与评判模型未公开,无法同口径复现 |
| BFCL(45 项 live 子集) | 82.2 | 其自定义子集构成未公布 |
| NIAH @ ~93 万 token | 3/3 | 见下方说明 |
NIAH 值得单独说明:W4A8 在 TP8 下 KV 容量 1,257,280 token,能装下 93 万 token 的提示; FP8 原版只有 608,128 token,物理上放不下,这一项无法对比。
6. 性能与显存(先前已测,同口径附此)
| 配置 | 权重显存/卡 | KV 容量 | prefill 8并发×8K入 | decode 128并发 | decode 256并发 |
|---|---|---|---|---|---|
| FP8 TP8 | ~88 GiB | 608,128 | 3675 | 1686 | 2094 |
| W4A8 TP8+EP | 52.6 GiB | 1,257,280 | 3441 | 1617 | 1779 |
| W4A8 2×(TP4+EP) | 93 GiB | 638,336 | 5993 | 2256 | 3249 |
单位均为 tok/s。FP8 无 TP4 方案:704 GiB / 4 = 每卡 176 GiB,超过 141 GiB 显存上限。