SenseNova-U1.5-8B-MoT Q4_0 量化说明

将原版 sensenova/SenseNova-U1.5-8B-MoT(官方正式版,非 Preview)按 hoidhxd 社区版 hoidhxd/SenseNova-U1.5-8B-GGUF-v2 的量化规范复刻为 Q4_0 GGUF。

产物

文件 说明 大小
output/SenseNova-U1.5-8B-MoT-Q4_0.gguf 量化后的 GGUF(权重) 10,875,444,576 B ≈ 10.13 GiB
output/SenseNova-U1.5-8B-MoT-Q4_0.gguf.plan.json 逐张量类型清单(喂给加载侧的可选清单) 216 KB

文件大小与 hoidhxd 版 SenseNova-U1.5-8B-MoT-Preview-Q4_0-v2.gguf(同样 10,875,444,576 B)一致,说明量化规则、张量类型分布与其规范完全一致。

量化规则(hoidhxd 规范)

hoidhxd 的量化为张量级显式定类型(非 try/except 兜底),规则:

类型 规则 数量
Q4_0 大型 2D Linear 权重:42 层 attention(q/k/v/o)与 MLP(gate/up/down)、各自的 _mot_gen 分支、lm_head 589
F32 1D 张量(bias、LayerNorm/RMSNorm 等)及参数量 ≤1024 的小张量 516
F16 故意保持稠密(dense)以避坑的 11 个张量:embed_tokens(Embedding)、6 个 Conv2d kernel(patch_embeddingdense_embeddingfm_head.conv1/2 × vision 与 _mot_gen 两分支)、timestep_embedder/noise_scale_embeddermlp.{0,2}.weight 11

设计背景:diffusers 的 GGUF 量化器只替换 nn.Linear,若把 Embedding/Conv/kernel 误量化为 Q4_0 会导致加载时崩溃。这 11 个张量显式保留为 dense(F16), 其余大 Linear 全部 Q4_0,既保证兼容性又保持图像质量。

GGUF metadata 仅 3 项(权重外超参由 ComfyUI 侧 config.json 提供):

general.architecture        = sensenova_u1.5
general.quantization_version = 2
general.file_type           = 2   # MOSTLY_Q4_0

验证结果

  1. 逐张量比对:生成的 plan.json 与 hoidhxd 版 SenseNova-U1.5-8B-MoT-Preview-Q4_0-v2.gguf.plan.json 全 1116 个张量 (name/shape/type)一致:0 缺失、0 多余、0 类型差异、0 形状差异
  2. 计数:589 Q4_0 + 516 F32 + 11 F16,与 hoidhxd 规范一致。
  3. 文件大小:10,875,444,576 B(≈ 10.13 GiB)。
  4. GGUF 可解析性:gguf.GGUFReader 成功解析全部 1116 个张量; Q4_0 张量可正确反量化(shape 还原、数值合理)。
  5. GGUF header:版本 3、metadata 3 项、general.architecture=sensenova_u1.5general.file_type=2(MOSTLY_Q4_0)general.quantization_version=2

复现步骤

# 0. 依赖
pip install gguf safetensors numpy ml_dtypes

# 1. 下载原版权重(13 分片 ~46.7 GB)到 models/
python src/download_model.py            # 默认从 ModelScope 国内镜像
# 断点续传/单文件:python src/download_model.py <分片名>

# 2. 用 hoidhxd 的 plan 作为类型规则源(已存于 src/hoidhxd_plan.json)

# 3. 量化(全部 13 分片;单分片可加参数)
python src/quantize.py                  # 产出 output/*.gguf + *.plan.json

# 4. 校验
python src/check_models.py              # 权重完整性
python src/compare_plans.py output/SenseNova-U1.5-8B-MoT-Q4_0.gguf.plan.json src/hoidhxd_plan.json

使用(ComfyUI)

  1. 将 GGUF 放到 <ComfyUI>/models/gguf/(注意不是 models/unet/)。
  2. 安装 ComfyUI-SenseNova-U1 自定义节点及其依赖 (pip install "gguf>=0.10.0" "diffusers>=0.30.0" accelerate transformers)。
  3. Loader 的 model_path 指向含 config.json/tokenizer 的目录(只需 *.json *.txt,无需 50GB 权重)。
  4. Loader 参数:device=cudadtype=bfloat16device_map=nonevram_mode=full(16GB)/balanced(12GB)、gguf_checkpoint 选本文件。

目录

models/   # 原版 13 个 safetensors 分片 + config/tokenizer(~46.7 GB,量化后可按需删除)
output/   # 量化产物(11 GB)
src/      # 脚本 + hoidhxd_plan.json 规则源
Downloads last month
371
GGUF
Model size
18B params
Architecture
sensenova_u1.5
Hardware compatibility
Log In to add your hardware

4-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for woshilhz001/SenseNova-U1.5-8B-MoT-Q4_0

Quantized
(4)
this model