中文 | English

中文优化

RadixArk提供了RadixArk/Qwen3.8-27B-DSpark Dspark草稿模型,该模型对中文请求投机效果一般。我们使用18万条中文-英文混合数据,对其进行重训练。

在完全独立的公开中文测试集上,中文接受长度相比基线投机模型提升 +13.5%(2.7985 → 3.1760),且英文没有退化,10个英文测评全部提升,平均 3.4429 → 3.6287(+5.4%)。

训练数据分布(共 185,368 条):

语言 中文 英文
占比 76.5% 23.5%
任务类型 RAG 推理 写作 摘要 编码 对话
占比 24.4% 20.0% 17.2% 16.3% 15.7% 6.5%

注:任务类型占比经四舍五入,合计可能不等于 100%。

模型信息

模型规格

  • 目标模型:Qwen/Qwen3.8-27B-FP8
  • 基线投机模型:RadixArk/Qwen3.8-27B-DSpark
  • 草稿模型参数量:1,359,284,737(1.36B)——与基线投机模型完全一致
  • 草稿模型权重精度:BF16
  • 隐藏层维度:5,120
  • Transformer 层数:5 层全注意力
  • 注意力:GQA,40 个 query head,8 个 key/value head
  • 目标模型辅助特征层:4、16、28、40、52
  • 置信度头:vanilla Markov head,rank 256
  • DSpark block size:7 个草稿 token(验证宽度 8,含目标模型的 bonus token)
  • 最大位置编码长度:262,144 模型结构、参数量与权重体积与基线投机模型完全一致,因此SGLang 运行时相同、启动参数相同、目标模型无需任何改动。

评测

两个模型使用的评测配置完全一致:FP8 目标模型 + 未量化的 BF16 草稿模型;DSpark block size 7;采样温度 0.6、top-k 20、top-p 0.95;开启 thinking;max_new_tokens=2048sampling_seed=0;每个测评最多 128 条 prompt(数据集更小时取全量);并发 16;--attention-backend fa3。两个模型在同一台机器、同一 SGLang 构建、同一评测框架下测得,所有运行零请求错误。

独立公开数据集

测试数据已上传至 Hugging Face:ysober/zh_spec_eval。数据来自:C-Eval、AGIEval Gaokao-MathQA、Chinese-SimpleQA 与 alpaca-gpt4-data-zh,共 512 条 prompt。这些数据源均未出现在本模型的训练语料中,因此该结果衡量的是泛化能力,而不是对训练分布的拟合。

测评 RadixArk/Qwen3.8-27B-DSpark 本模型 Δ
zh_alpaca_gpt4 2.4871 2.9695 +19.40%
zh_ceval 2.5989 2.8844 +10.99%
zh_gaokao_math 3.7834 4.1568 +9.87%
zh_simpleqa 2.3245 2.6932 +15.86%
总体平均 2.7985 3.1760 +13.49%

训练评测数据集(同分布)

来自训练语料自身的分层保留集,仅取中文样本,共 696 条 prompt,覆盖 6 个领域。该集合没有参与训练,但与训练数据同分布,所以结果会偏好。

测评 RadixArk/Qwen3.8-27B-DSpark 本模型 Δ
zh_chat 2.4613 2.8479 +15.71%
zh_coding 3.1743 3.5242 +11.02%
zh_rag 3.4178 5.3841 +57.53%
zh_reasoning 2.4900 2.7532 +10.57%
zh_summarization 2.4310 3.3839 +39.20%
zh_writing 2.0686 2.3447 +13.35%
总体平均 2.7041 3.4413 +27.26%

英文数据集

在中文数据上重训练可能损害英文接受长度,实测不但没有退化还产生了提升。

两个模型都在相同的英文测评数据集用同一评测框架重新测量(1,036 条 prompt,10 个测评)。基线公布值一列是RadixArk/Qwen3.8-27B-DSpark公布的测试结果,仅作参考,不能直接比较(评测框架、SGLang 版本、随机种子和 prompt 构造方式都不同)。真正有意义的是其右侧两列实测值,它们是在完全相同的条件下产生。最终本模型在10个测评上全部胜出。

测评 基线公布值 RadixArk(本框架实测) 本模型 Δ 数量
HumanEval 3.47 3.8672 3.9915 +3.21% 128
GSM8K 4.57 4.5737 5.0798 +11.06% 128
MATH-500 4.08 4.0616 4.3068 +6.04% 128
MBPP 3.67 3.4037 3.6587 +7.49% 128
AIME 2025 3.28 3.3279 3.4102 +2.47% 30
AIME 2026 3.07 3.1264 3.1289 +0.08% 30
LBPP 3.03 3.0467 3.1357 +2.92% 128
MT-Bench 3.10 3.1489 3.3944 +7.80% 80
Arena-Hard v0.1 2.71 2.8056 2.9191 +4.05% 128
Alpaca 2.95 3.0672 3.2623 +6.36% 128
总体平均 3.35 3.4429 3.6287 +5.40%

这张表同时也验证了我们使用的评测框架本身的正确性,其中 GSM8K 4.5737 vs 4.57、MATH-500 4.0616 vs 4.08、LBPP 3.0467 vs 3.03、MT-Bench 3.1489 vs 3.10、AIME 2025 3.3279 vs 3.28 均相差不到百分之几。差异最大的是 HumanEval(3.87 vs 3.47)和 MBPP(3.40 vs 3.67),这两者差异是由选择的prompt不同导致。

使用 SGLang 部署

 SGLang 版本(上述结果基于 0.5.18)。启动参数与基线投机模型完全相同,只需修改 --speculative-draft-model-path

sglang serve \
  --trust-remote-code \
  --model-path Qwen/Qwen3.8-27B-FP8 \
  --tp-size 1 \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path <path-to-this-repo> \
  --speculative-dspark-block-size 7 \
  --speculative-draft-model-quantization unquant \
  --mamba-scheduler-strategy extra_buffer \
  --attention-backend fa3
Downloads last month
525
Safetensors
Model size
1B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for ysober/qwen3.8-27b-dspark-zh

Base model

Qwen/Qwen3.8-27B
Finetuned
(5)
this model