Configuration Parsing Warning:In config.json: "quantization_config.bits" must be an integer

5 5 6 2   |   1 1 6 2
EXLLAMAV3 · FULL SC
QWEN3.8-27B
TEXT 3.40 BPW  /  HEAD 6BIT  /  VISION 6BIT  /  MTP 4BIT
EXL3 SC RECIPE VISION 6BIT MTP 4BIT
01 模型简介 ABOUT

本仓库是 Qwen/Qwen3.8-27BExLlamaV3(EXL3) 量化版本,采用 turboderp 的 Full SC(自校准)recipe 流程生成:文本权重 3.40 bpw、lm_head 6bit、视觉部分(Vision)6bit、MTP(多 token 预测)模块 4bit。在保留 27B 级综合能力的前提下,大幅压缩显存占用,面向消费级显卡的本地部署。英文版见 README_en.md

02 量化规格 QUANTIZATION
组件 · PART 比特数 · BITS 说明 · NOTE
TEXT (DECODER)3.40 BPWFull SC recipe,sc_optimize -b 3.40 -hb 6 -al 2.0 -mink 2
HEAD (LM_HEAD)6 BIT保持输出分布质量
VISION TOWER6 BIT视觉编码器
MTP HEAD4 BIT多 token 预测模块
工具链 · TOOLING:turboderp-org/ExLlamaV3 v1.4.4 · SC 数据源:turboderp/Qwen3.8-27B-exl3
项目 · ITEM 值 · VALUE
参数量 · Parameters27B
隐藏维度 · Hidden size5120
词表 · Vocabulary248,320(Padded)
层数 · Layers64 · 16 × (3 × (GatedDeltaNet → FFN) → 1 × (Gated Attention → FFN))
上下文 · Context262,144 原生 · 可扩展至 1,000,000
视觉 · Vision原生图片 / 视频理解
MTP启用
许可证 · LicenseApache-2.0
03 使用方法 USAGE
方式一:TABBYAPI(推荐)
  • 将本仓库下载到模型目录
  • TabbyAPI → Load Model → 选择本目录
  • 首次加载建议 context = 32768,确认文本 / 视觉 / MTP 正常后逐步调高
方式二:EXLLAMAV3 直接加载
from exllamav3 import ExLlamaV3Config, ExLlamaV3, ExLlamaV3Cache
from exllamav3.generator import ExLlamaV3StreamingGenerator

config = ExLlamaV3Config() config.model_dir = "/path/to/Qwen3.8-27B-EXL3-SC-3.40bpw-H6-V6" config.max_seq_len = 32768 # 建议从 32K 起步 config.build()

model = ExLlamaV3(config) cache = ExLlamaV3Cache(model) generator = ExLlamaV3StreamingGenerator(model, cache, tokenizer)

04 质量说明 QUALITY
  • achieved_bpw = 3.40,recipe 预测 KLD ≈ 0.011 ≈ IQ4_XS
  • 逐层 SQNR 健康区间 39 ~ 43 dB;低比特张量(gate/up proj 2~3bit)按噪声归因策略放置
  • vision / MTP 模块分别按 6bit / 4bit 独立转换验证
05 致谢 CREDITS
EXLLAMAV3 · FULL SC · 3.40BPW · H6 · V6 · MTP4
Downloads last month
3
Safetensors
Model size
7B params
Tensor type
BF16
·
F16
·
I16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for komeijishiki/Qwen3.8-27B-EXL3-SC-3.40bpw-H6-V6

Base model

Qwen/Qwen3.8-27B
Quantized
(926)
this model