# GLM-5.3 量化精度与 MTP 对比 生成时间:2026-08-31 06:39:50 对比三个检查点:官方 FP8 发布版、本次产出的 W4A8(compressed-tensors)、 以及 PhalaCloud 公布的 W4AFP8(SGLang 原生格式,**数值取自其模型卡,本地未复现**)。 本文所有实测数字均在 vLLM 上取得。W4A8 检查点同样可在 SGLang 上加载运行(见模型卡「部署 / SGLang」), 但未在 SGLang 上重跑评测,两引擎 kernel 实现不同,数字不能互相套用。 ## 1. 检查点基本信息 | 项目 | GLM-5.3 (FP8 原版) | GLM-5.3-W4A8 (本次产出) | PhalaCloud W4AFP8 (公布值) | |---|---|---|---| | 体积 | 703.7 GiB | **372.3 GiB** | 372.3 GiB | | 专家权重 | FP8 block 128×128 | INT4 group-128 (RTN + MSE 裁剪搜索) | INT4 group-128 (AWQ 校准) | | 量化来源 | 官方发布 | 由 FP8 发布版反量化后再量化 | 由 BF16 母版量化 | | 非专家层 | FP8 block | FP8 block(逐字节未改) | FP8 block | | 激活 | FP8 动态 | FP8 per-token 动态 | FP8 动态 | | 格式 | fp8 | compressed-tensors(专家 pack-quantized,非专家 float-quantized) | w4afp8 (SGLang) | | 推理引擎 | vLLM / SGLang | vLLM / SGLang | SGLang(vLLM 支持在 PR 中) | | 专家权重重建相对误差 | 0.0265 | **0.103** | 0.108–0.13(其模型卡自述) | ## 2. GPQA-Diamond 198 题,每题 4 次采样,temperature 1.0 / top_p 0.95,选项顺序按题号固定打乱,两个模型看到完全相同的提示。 | 指标 | GLM-5.3 (FP8) | GLM-5.3-W4A8 | PhalaCloud W4AFP8 (公布值) | |---|---|---|---| | pass@1 | 89.65 | 90.28 | 91.92 (182/198) | | majority@4 | 90.91 | 90.91 | — | | 答案解析失败 | 0 | 0 | — | | 因长度截断 | 122 | 131 | — | | 平均输出 token | 12159 | 12661 | — | W4A8 相对 FP8 的 pass@1 差值:**+0.63 个百分点**。 198 题 × 4 采样下,1 个百分点约等于 8 个样本,注意采样噪声。 PhalaCloud 的数值来自不同引擎(SGLang)和不同评测协议(带截断重试),仅供参照,不能与本表前两列直接做减法。 ## 3. Teacher-forced NLL(留出文本,越低越好) 64 段 × 2048 token 的留出文本,两个模型评分的 token 序列完全相同。 这是对量化损伤最敏感的低噪声指标。 | 指标 | GLM-5.3 (FP8) | GLM-5.3-W4A8 | PhalaCloud W4AFP8 (公布值) | |---|---|---|---| | NLL (nats/token) | 0.8929 | 0.8940 | 相对 BF16 +0.282 nats | | 困惑度 | 2.442 | 2.445 | — | | 窗口间标准误 | 0.0740 | 0.0743 | — | W4A8 相对 FP8 的 dNLL:**+0.0010 nats/token**。 注意基线不同:PhalaCloud 的 +0.282 是相对 BF16 母版,本表是相对 FP8 发布版。 ## 4. MTP / 投机解码 vLLM 通过 `glm_moe_dsa -> deepseek_mtp -> DeepSeekMTPModel` 路径加载第 78 层草稿头。 测试为 512 token 输入 / 256 token 输出,对比开启与关闭 MTP 的解码吞吐。 | 检查点 | 并发 | 无 MTP (输出 tok/s) | 开 MTP (输出 tok/s) | 加速比 | |---|---|---|---|---| | GLM-5.3 (FP8) | 1 | 86.2 | 148.7 | 1.72x | | GLM-5.3 (FP8) | 4 | 264.7 | 349.6 | 1.32x | | GLM-5.3 (FP8) | 16 | 550.8 | 695.0 | 1.26x | | GLM-5.3 (FP8) | 64 | 1104.6 | 1306.2 | 1.18x | | GLM-5.3-W4A8 | 1 | 66.2 | 103.5 | 1.56x | | GLM-5.3-W4A8 | 4 | 196.4 | 281.8 | 1.44x | | GLM-5.3-W4A8 | 16 | 480.1 | 572.0 | 1.19x | | GLM-5.3-W4A8 | 64 | 962.8 | 1190.1 | 1.24x | PhalaCloud 公布的接受长度:~2.93 (EAGLE steps=3)(EAGLE steps=3,与此处 num_speculative_tokens=1 的口径不同)。 ## 5. PhalaCloud 模型卡公布但本地未复现的项 | 基准 | PhalaCloud W4AFP8 | 未复现原因 | |---|---|---| | AA-LCR | 73.0 | 数据集与评判模型未公开,无法同口径复现 | | BFCL(45 项 live 子集) | 82.2 | 其自定义子集构成未公布 | | NIAH @ ~93 万 token | 3/3 | 见下方说明 | NIAH 值得单独说明:W4A8 在 TP8 下 KV 容量 1,257,280 token,**能装下 93 万 token 的提示**; FP8 原版只有 608,128 token,**物理上放不下**,这一项无法对比。 ## 6. 性能与显存(先前已测,同口径附此) | 配置 | 权重显存/卡 | KV 容量 | prefill 8并发×8K入 | decode 128并发 | decode 256并发 | |---|---|---|---|---|---| | FP8 TP8 | ~88 GiB | 608,128 | 3675 | 1686 | 2094 | | W4A8 TP8+EP | 52.6 GiB | 1,257,280 | 3441 | 1617 | 1779 | | W4A8 2×(TP4+EP) | 93 GiB | 638,336 | **5993** | **2256** | **3249** | 单位均为 tok/s。FP8 无 TP4 方案:704 GiB / 4 = 每卡 176 GiB,超过 141 GiB 显存上限。