Instructions to use ysober/qwen3.8-27b-dspark-zh with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use ysober/qwen3.8-27b-dspark-zh with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="ysober/qwen3.8-27b-dspark-zh")# Load model directly from transformers import AutoTokenizer, AutoModel tokenizer = AutoTokenizer.from_pretrained("ysober/qwen3.8-27b-dspark-zh") model = AutoModel.from_pretrained("ysober/qwen3.8-27b-dspark-zh", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use ysober/qwen3.8-27b-dspark-zh with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "ysober/qwen3.8-27b-dspark-zh" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "ysober/qwen3.8-27b-dspark-zh", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/ysober/qwen3.8-27b-dspark-zh
- SGLang
How to use ysober/qwen3.8-27b-dspark-zh with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "ysober/qwen3.8-27b-dspark-zh" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "ysober/qwen3.8-27b-dspark-zh", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "ysober/qwen3.8-27b-dspark-zh" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "ysober/qwen3.8-27b-dspark-zh", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use ysober/qwen3.8-27b-dspark-zh with Docker Model Runner:
docker model run hf.co/ysober/qwen3.8-27b-dspark-zh
中文 | English
中文优化
RadixArk提供了RadixArk/Qwen3.8-27B-DSpark Dspark草稿模型,该模型对中文请求投机效果一般。我们使用18万条中文-英文混合数据,对其进行重训练。
在完全独立的公开中文测试集上,中文接受长度相比基线投机模型提升 +13.5%(2.7985 → 3.1760),且英文没有退化,10个英文测评全部提升,平均 3.4429 → 3.6287(+5.4%)。
训练数据分布(共 185,368 条):
| 语言 | 中文 | 英文 |
|---|---|---|
| 占比 | 76.5% | 23.5% |
| 任务类型 | RAG | 推理 | 写作 | 摘要 | 编码 | 对话 |
|---|---|---|---|---|---|---|
| 占比 | 24.4% | 20.0% | 17.2% | 16.3% | 15.7% | 6.5% |
注:任务类型占比经四舍五入,合计可能不等于 100%。
模型信息
模型规格
- 目标模型:Qwen/Qwen3.8-27B-FP8
- 基线投机模型:RadixArk/Qwen3.8-27B-DSpark
- 草稿模型参数量:1,359,284,737(1.36B)——与基线投机模型完全一致
- 草稿模型权重精度:BF16
- 隐藏层维度:5,120
- Transformer 层数:5 层全注意力
- 注意力:GQA,40 个 query head,8 个 key/value head
- 目标模型辅助特征层:4、16、28、40、52
- 置信度头:vanilla Markov head,rank 256
- DSpark block size:7 个草稿 token(验证宽度 8,含目标模型的 bonus token)
- 最大位置编码长度:262,144 模型结构、参数量与权重体积与基线投机模型完全一致,因此SGLang 运行时相同、启动参数相同、目标模型无需任何改动。
评测
两个模型使用的评测配置完全一致:FP8 目标模型 + 未量化的 BF16 草稿模型;DSpark block size 7;采样温度 0.6、top-k 20、top-p 0.95;开启 thinking;max_new_tokens=2048;sampling_seed=0;每个测评最多 128 条 prompt(数据集更小时取全量);并发 16;--attention-backend fa3。两个模型在同一台机器、同一 SGLang 构建、同一评测框架下测得,所有运行零请求错误。
独立公开数据集
测试数据已上传至 Hugging Face:ysober/zh_spec_eval。数据来自:C-Eval、AGIEval Gaokao-MathQA、Chinese-SimpleQA 与 alpaca-gpt4-data-zh,共 512 条 prompt。这些数据源均未出现在本模型的训练语料中,因此该结果衡量的是泛化能力,而不是对训练分布的拟合。
| 测评 | RadixArk/Qwen3.8-27B-DSpark | 本模型 | Δ |
|---|---|---|---|
| zh_alpaca_gpt4 | 2.4871 | 2.9695 | +19.40% |
| zh_ceval | 2.5989 | 2.8844 | +10.99% |
| zh_gaokao_math | 3.7834 | 4.1568 | +9.87% |
| zh_simpleqa | 2.3245 | 2.6932 | +15.86% |
| 总体平均 | 2.7985 | 3.1760 | +13.49% |
训练评测数据集(同分布)
来自训练语料自身的分层保留集,仅取中文样本,共 696 条 prompt,覆盖 6 个领域。该集合没有参与训练,但与训练数据同分布,所以结果会偏好。
| 测评 | RadixArk/Qwen3.8-27B-DSpark | 本模型 | Δ |
|---|---|---|---|
| zh_chat | 2.4613 | 2.8479 | +15.71% |
| zh_coding | 3.1743 | 3.5242 | +11.02% |
| zh_rag | 3.4178 | 5.3841 | +57.53% |
| zh_reasoning | 2.4900 | 2.7532 | +10.57% |
| zh_summarization | 2.4310 | 3.3839 | +39.20% |
| zh_writing | 2.0686 | 2.3447 | +13.35% |
| 总体平均 | 2.7041 | 3.4413 | +27.26% |
英文数据集
在中文数据上重训练可能损害英文接受长度,实测不但没有退化还产生了提升。
两个模型都在相同的英文测评数据集用同一评测框架重新测量(1,036 条 prompt,10 个测评)。基线公布值一列是RadixArk/Qwen3.8-27B-DSpark公布的测试结果,仅作参考,不能直接比较(评测框架、SGLang 版本、随机种子和 prompt 构造方式都不同)。真正有意义的是其右侧两列实测值,它们是在完全相同的条件下产生。最终本模型在10个测评上全部胜出。
| 测评 | 基线公布值 | RadixArk(本框架实测) | 本模型 | Δ | 数量 |
|---|---|---|---|---|---|
| HumanEval | 3.47 | 3.8672 | 3.9915 | +3.21% | 128 |
| GSM8K | 4.57 | 4.5737 | 5.0798 | +11.06% | 128 |
| MATH-500 | 4.08 | 4.0616 | 4.3068 | +6.04% | 128 |
| MBPP | 3.67 | 3.4037 | 3.6587 | +7.49% | 128 |
| AIME 2025 | 3.28 | 3.3279 | 3.4102 | +2.47% | 30 |
| AIME 2026 | 3.07 | 3.1264 | 3.1289 | +0.08% | 30 |
| LBPP | 3.03 | 3.0467 | 3.1357 | +2.92% | 128 |
| MT-Bench | 3.10 | 3.1489 | 3.3944 | +7.80% | 80 |
| Arena-Hard v0.1 | 2.71 | 2.8056 | 2.9191 | +4.05% | 128 |
| Alpaca | 2.95 | 3.0672 | 3.2623 | +6.36% | 128 |
| 总体平均 | 3.35 | 3.4429 | 3.6287 | +5.40% |
这张表同时也验证了我们使用的评测框架本身的正确性,其中 GSM8K 4.5737 vs 4.57、MATH-500 4.0616 vs 4.08、LBPP 3.0467 vs 3.03、MT-Bench 3.1489 vs 3.10、AIME 2025 3.3279 vs 3.28 均相差不到百分之几。差异最大的是 HumanEval(3.87 vs 3.47)和 MBPP(3.40 vs 3.67),这两者差异是由选择的prompt不同导致。
使用 SGLang 部署
SGLang 版本(上述结果基于 0.5.18)。启动参数与基线投机模型完全相同,只需修改 --speculative-draft-model-path:
sglang serve \
--trust-remote-code \
--model-path Qwen/Qwen3.8-27B-FP8 \
--tp-size 1 \
--speculative-algorithm DSPARK \
--speculative-draft-model-path <path-to-this-repo> \
--speculative-dspark-block-size 7 \
--speculative-draft-model-quantization unquant \
--mamba-scheduler-strategy extra_buffer \
--attention-backend fa3
- Downloads last month
- 525
Model tree for ysober/qwen3.8-27b-dspark-zh
Base model
Qwen/Qwen3.8-27B