GLM-5.3-W4A8 / EVAL_DETAILS.zh.md
yiminghub's picture
Duplicate from camel-ai/GLM-5.3-W4A8
3e6f4bb
|
Raw
History Blame Contribute Delete
4.53 kB

GLM-5.3 量化精度与 MTP 对比

生成时间:2026-08-31 06:39:50

对比三个检查点:官方 FP8 发布版、本次产出的 W4A8(compressed-tensors)、 以及 PhalaCloud 公布的 W4AFP8(SGLang 原生格式,数值取自其模型卡,本地未复现)。

本文所有实测数字均在 vLLM 上取得。W4A8 检查点同样可在 SGLang 上加载运行(见模型卡「部署 / SGLang」), 但未在 SGLang 上重跑评测,两引擎 kernel 实现不同,数字不能互相套用。

1. 检查点基本信息

项目 GLM-5.3 (FP8 原版) GLM-5.3-W4A8 (本次产出) PhalaCloud W4AFP8 (公布值)
体积 703.7 GiB 372.3 GiB 372.3 GiB
专家权重 FP8 block 128×128 INT4 group-128 (RTN + MSE 裁剪搜索) INT4 group-128 (AWQ 校准)
量化来源 官方发布 由 FP8 发布版反量化后再量化 由 BF16 母版量化
非专家层 FP8 block FP8 block(逐字节未改) FP8 block
激活 FP8 动态 FP8 per-token 动态 FP8 动态
格式 fp8 compressed-tensors(专家 pack-quantized,非专家 float-quantized) w4afp8 (SGLang)
推理引擎 vLLM / SGLang vLLM / SGLang SGLang(vLLM 支持在 PR 中)
专家权重重建相对误差 0.0265 0.103 0.108–0.13(其模型卡自述)

2. GPQA-Diamond

198 题,每题 4 次采样,temperature 1.0 / top_p 0.95,选项顺序按题号固定打乱,两个模型看到完全相同的提示。

指标 GLM-5.3 (FP8) GLM-5.3-W4A8 PhalaCloud W4AFP8 (公布值)
pass@1 89.65 90.28 91.92 (182/198)
majority@4 90.91 90.91
答案解析失败 0 0
因长度截断 122 131
平均输出 token 12159 12661

W4A8 相对 FP8 的 pass@1 差值:**+0.63 个百分点**。 198 题 × 4 采样下,1 个百分点约等于 8 个样本,注意采样噪声。

PhalaCloud 的数值来自不同引擎(SGLang)和不同评测协议(带截断重试),仅供参照,不能与本表前两列直接做减法。

3. Teacher-forced NLL(留出文本,越低越好)

64 段 × 2048 token 的留出文本,两个模型评分的 token 序列完全相同。 这是对量化损伤最敏感的低噪声指标。

指标 GLM-5.3 (FP8) GLM-5.3-W4A8 PhalaCloud W4AFP8 (公布值)
NLL (nats/token) 0.8929 0.8940 相对 BF16 +0.282 nats
困惑度 2.442 2.445
窗口间标准误 0.0740 0.0743

W4A8 相对 FP8 的 dNLL:**+0.0010 nats/token**。 注意基线不同:PhalaCloud 的 +0.282 是相对 BF16 母版,本表是相对 FP8 发布版。

4. MTP / 投机解码

vLLM 通过 glm_moe_dsa -> deepseek_mtp -> DeepSeekMTPModel 路径加载第 78 层草稿头。 测试为 512 token 输入 / 256 token 输出,对比开启与关闭 MTP 的解码吞吐。

检查点 并发 无 MTP (输出 tok/s) 开 MTP (输出 tok/s) 加速比
GLM-5.3 (FP8) 1 86.2 148.7 1.72x
GLM-5.3 (FP8) 4 264.7 349.6 1.32x
GLM-5.3 (FP8) 16 550.8 695.0 1.26x
GLM-5.3 (FP8) 64 1104.6 1306.2 1.18x
GLM-5.3-W4A8 1 66.2 103.5 1.56x
GLM-5.3-W4A8 4 196.4 281.8 1.44x
GLM-5.3-W4A8 16 480.1 572.0 1.19x
GLM-5.3-W4A8 64 962.8 1190.1 1.24x

PhalaCloud 公布的接受长度:~2.93 (EAGLE steps=3)(EAGLE steps=3,与此处 num_speculative_tokens=1 的口径不同)。

5. PhalaCloud 模型卡公布但本地未复现的项

基准 PhalaCloud W4AFP8 未复现原因
AA-LCR 73.0 数据集与评判模型未公开,无法同口径复现
BFCL(45 项 live 子集) 82.2 其自定义子集构成未公布
NIAH @ ~93 万 token 3/3 见下方说明

NIAH 值得单独说明:W4A8 在 TP8 下 KV 容量 1,257,280 token,能装下 93 万 token 的提示; FP8 原版只有 608,128 token,物理上放不下,这一项无法对比。

6. 性能与显存(先前已测,同口径附此)

配置 权重显存/卡 KV 容量 prefill 8并发×8K入 decode 128并发 decode 256并发
FP8 TP8 ~88 GiB 608,128 3675 1686 2094
W4A8 TP8+EP 52.6 GiB 1,257,280 3441 1617 1779
W4A8 2×(TP4+EP) 93 GiB 638,336 5993 2256 3249

单位均为 tok/s。FP8 无 TP4 方案:704 GiB / 4 = 每卡 176 GiB,超过 141 GiB 显存上限。