SenseNova-U1.5-8B-MoT Q4_0 量化说明
将原版 sensenova/SenseNova-U1.5-8B-MoT(官方正式版,非 Preview)按 hoidhxd
社区版 hoidhxd/SenseNova-U1.5-8B-GGUF-v2 的量化规范复刻为 Q4_0 GGUF。
产物
| 文件 | 说明 | 大小 |
|---|---|---|
output/SenseNova-U1.5-8B-MoT-Q4_0.gguf |
量化后的 GGUF(权重) | 10,875,444,576 B ≈ 10.13 GiB |
output/SenseNova-U1.5-8B-MoT-Q4_0.gguf.plan.json |
逐张量类型清单(喂给加载侧的可选清单) | 216 KB |
文件大小与 hoidhxd 版
SenseNova-U1.5-8B-MoT-Preview-Q4_0-v2.gguf(同样 10,875,444,576 B)一致,说明量化规则、张量类型分布与其规范完全一致。
量化规则(hoidhxd 规范)
hoidhxd 的量化为张量级显式定类型(非 try/except 兜底),规则:
| 类型 | 规则 | 数量 |
|---|---|---|
| Q4_0 | 大型 2D Linear 权重:42 层 attention(q/k/v/o)与 MLP(gate/up/down)、各自的 _mot_gen 分支、lm_head 等 |
589 |
| F32 | 1D 张量(bias、LayerNorm/RMSNorm 等)及参数量 ≤1024 的小张量 | 516 |
| F16 | 故意保持稠密(dense)以避坑的 11 个张量:embed_tokens(Embedding)、6 个 Conv2d kernel(patch_embedding、dense_embedding、fm_head.conv1/2 × vision 与 _mot_gen 两分支)、timestep_embedder/noise_scale_embedder 的 mlp.{0,2}.weight |
11 |
设计背景:diffusers 的 GGUF 量化器只替换 nn.Linear,若把 Embedding/Conv/kernel
误量化为 Q4_0 会导致加载时崩溃。这 11 个张量显式保留为 dense(F16),
其余大 Linear 全部 Q4_0,既保证兼容性又保持图像质量。
GGUF metadata 仅 3 项(权重外超参由 ComfyUI 侧 config.json 提供):
general.architecture = sensenova_u1.5
general.quantization_version = 2
general.file_type = 2 # MOSTLY_Q4_0
验证结果
- 逐张量比对:生成的
plan.json与 hoidhxd 版SenseNova-U1.5-8B-MoT-Preview-Q4_0-v2.gguf.plan.json全 1116 个张量 (name/shape/type)一致:0 缺失、0 多余、0 类型差异、0 形状差异。 - 计数:589 Q4_0 + 516 F32 + 11 F16,与 hoidhxd 规范一致。
- 文件大小:10,875,444,576 B(≈ 10.13 GiB)。
- GGUF 可解析性:
gguf.GGUFReader成功解析全部 1116 个张量; Q4_0 张量可正确反量化(shape 还原、数值合理)。 - GGUF header:版本 3、metadata 3 项、
general.architecture=sensenova_u1.5、general.file_type=2(MOSTLY_Q4_0)、general.quantization_version=2。
复现步骤
# 0. 依赖
pip install gguf safetensors numpy ml_dtypes
# 1. 下载原版权重(13 分片 ~46.7 GB)到 models/
python src/download_model.py # 默认从 ModelScope 国内镜像
# 断点续传/单文件:python src/download_model.py <分片名>
# 2. 用 hoidhxd 的 plan 作为类型规则源(已存于 src/hoidhxd_plan.json)
# 3. 量化(全部 13 分片;单分片可加参数)
python src/quantize.py # 产出 output/*.gguf + *.plan.json
# 4. 校验
python src/check_models.py # 权重完整性
python src/compare_plans.py output/SenseNova-U1.5-8B-MoT-Q4_0.gguf.plan.json src/hoidhxd_plan.json
使用(ComfyUI)
- 将 GGUF 放到
<ComfyUI>/models/gguf/(注意不是models/unet/)。 - 安装
ComfyUI-SenseNova-U1自定义节点及其依赖 (pip install "gguf>=0.10.0" "diffusers>=0.30.0" accelerate transformers)。 - Loader 的
model_path指向含config.json/tokenizer 的目录(只需*.json*.txt,无需 50GB 权重)。 - Loader 参数:
device=cuda、dtype=bfloat16、device_map=none、vram_mode=full(16GB)/balanced(12GB)、gguf_checkpoint选本文件。
目录
models/ # 原版 13 个 safetensors 分片 + config/tokenizer(~46.7 GB,量化后可按需删除)
output/ # 量化产物(11 GB)
src/ # 脚本 + hoidhxd_plan.json 规则源
- Downloads last month
- 371
Hardware compatibility
Log In to add your hardware
4-bit
Model tree for woshilhz001/SenseNova-U1.5-8B-MoT-Q4_0
Base model
sensenova/SenseNova-U1.5-8B-MoT