Image-Text-to-Text
Transformers
Safetensors
Chinese
English
qwen3_5_moe
education
qwen
nex
sft
reinforcement-learning
reasoning
instruction-following
agent
conversational
Instructions to use sii-research/InnoSpark3.0-397B-260712 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use sii-research/InnoSpark3.0-397B-260712 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("image-text-to-text", model="sii-research/InnoSpark3.0-397B-260712") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] pipe(text=messages)# Load model directly from transformers import AutoProcessor, AutoModelForMultimodalLM processor = AutoProcessor.from_pretrained("sii-research/InnoSpark3.0-397B-260712") model = AutoModelForMultimodalLM.from_pretrained("sii-research/InnoSpark3.0-397B-260712", device_map="auto") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] inputs = processor.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(processor.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use sii-research/InnoSpark3.0-397B-260712 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "sii-research/InnoSpark3.0-397B-260712" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "sii-research/InnoSpark3.0-397B-260712", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker
docker model run hf.co/sii-research/InnoSpark3.0-397B-260712
- SGLang
How to use sii-research/InnoSpark3.0-397B-260712 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "sii-research/InnoSpark3.0-397B-260712" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "sii-research/InnoSpark3.0-397B-260712", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "sii-research/InnoSpark3.0-397B-260712" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "sii-research/InnoSpark3.0-397B-260712", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }' - Docker Model Runner
How to use sii-research/InnoSpark3.0-397B-260712 with Docker Model Runner:
docker model run hf.co/sii-research/InnoSpark3.0-397B-260712
File size: 9,760 Bytes
346e996 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100 101 102 103 104 105 106 107 108 109 110 111 112 113 114 115 116 117 118 119 120 121 122 123 124 125 126 127 128 129 130 131 132 133 134 135 136 137 138 139 140 141 142 143 144 145 146 147 148 149 150 151 152 153 154 155 156 157 158 159 160 161 162 163 164 165 166 167 168 169 170 171 172 | **语言:** [English](./README.md) | 中文
# InnoSpark3.0-397B-260712
InnoSpark3.0-397B-260712 是 InnoSpark3.0 系列中的 397B 教育增强模型。该模型基于 NEX 397B 模型家族训练,并与 Qwen3.5-397B-A17B、Nex-N2-Pro 以及评测表中提供的其他 SOTA 模型进行对比评测。
InnoSpark3.0-397B-260712 面向教育问答、教学辅助、学习陪伴,以及课堂或作业场景中的解释生成、分层讲解、引导式推理和教学策略建议等任务。我们在 SFT 阶段引入了通用数据与教育领域数据,并通过多阶段 RL pipeline 进一步强化模型的推理能力、教育场景问答能力、agent 能力与指令遵循能力。我们没有专门优化视觉能力;视觉语言指标主要用于透明呈现模型能力变化。
## 模型信息
| 项目 | 说明 |
| --- | --- |
| 模型名称 | InnoSpark3.0-397B-260712 |
| 训练来源 | NEX 397B 模型家族 |
| 对比基线 | Qwen3.5-397B-A17B、Nex-N2-Pro、评测表中的 SOTA 模型 |
| 参数规模 | 397B |
| 训练 pipeline | SFT + 多阶段 RL |
| SFT 数据 | 通用数据 + 教育领域数据 |
| RL 强化方向 | 推理、教育问答、agent 场景、指令遵循 |
| 主要应用场景 | 教育问答、学习辅导、教学辅助、教育 agent、通用助手任务 |
## 训练方法
后训练流程主要包含两个阶段:
1. **监督微调(SFT)**:使用通用指令数据与教育领域数据混合训练,提升模型在教学问答、概念解释和课堂指令遵循等任务上的表现。
2. **多阶段强化学习(RL)**:针对推理、教育场景问答、agent 任务求解和指令遵循稳定性进行进一步优化。
## 评测结果
以下所有分数均统一为 100 分制。EduBench 在原始评测表中为 10 分制,这里乘以 10 后展示。每一行中最高分使用粗体标出。缺失结果统一显示为 `-`。
### 通用能力评测
| 类型 | 能力维度 | 评测集 | Qwen3.5-397B-A17B | Nex-N2-Pro | InnoSpark3.0-397B | Nex-N2-Pro-math-rl | GLM-5.2 | DeepSeekV4-Pro | Kimi-2.6 | GPT-5.5 | Gemini-3.1-Pro | Claude-opus-4.8 |
| --- | --- | --- | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: |
| 语言 | 知识 | MMLU-Pro | 87.8 | 87.76 | 87.83 | - | 84.3 | 73.5 | 86.87 | - | **91** | - |
| 语言 | 知识 | C-Eval | 93 | 93.24 | 93.68 | - | 92.27 | 93.1 | **95.17** | - | - | - |
| 语言 | 知识 | SimpleQA-Verified | 53.1 | 59.5 | 60.4 | - | 34.1 | 55.2 | 41.1 | - | **75.6** | - |
| 语言 | 指令遵循 | IF-Eval | 92.6 | 94 | 90.39 | - | 90.39 | 91.9 | **94.5** | - | - | - |
| 语言 | 指令遵循 | IF-bench | **76.5** | 64.97 | 70.67 | - | 73.3 | 68.03 | 64.63 | - | - | - |
| 语言 | STEM 与推理 | GPQA Diamond | 85.86 | 90.7 | 90.4 | - | 91.2 | 90.1 | 90.5 | 93.6 | **94.3** | - |
| 语言 | STEM 与推理 | LiveCodeBench v6 | 83.6 | 67.39 | 66.54 | - | 54.12 | **93.5** | 89.6 | - | 91.7 | - |
| 语言 | STEM 与推理 | AIME25 | 93.33 | **96.67** | 93.33 | 90 | 80 | 90 | 93.33 | - | **96.67** | - |
| 语言 | STEM 与推理 | AIME26 | 91.3 | 90 | 96.67 | 93.33 | 99.2 | 96.67 | 96.4 | 98.3 | **100** | 95.7 |
| 语言 | Coding Agent | SWE-bench Verified-Agentic | 76.4 | 80.8 | 78.4 | - | 82 | 80.6 | 80.2 | **82.9** | 80.6 | - |
| 语言 | Coding Agent | Terminal-Bench 2.1 | 52.5 | 75.3 | 57.3 | - | 81 | 67.9 | 66.7 | **83.4** | 68.5 | 74.6 |
| 语言 | General Agent | BFCL_v4 | 72.9 | 64.14 | 65.16 | - | **76.66** | 72.95 | 67.82 | - | - | - |
| 语言 | General Agent | TAU3-bench | 68.3 | **71.1** | 60.43 | - | 47.73 | 56.63 | 64.7 | - | 50.67 | - |
| 视觉语言 | STEM 与 Puzzle | MMMU-Pro | 85.9 | 85.72 | **86.24** | - | - | - | 82.6 | 83.2 | 83 | - |
| 视觉语言 | 通用 VQA | MMBenchEN-DEV-v1.1 | 92.93 | 93.3 | **93.44** | - | - | - | **93.44** | - | - | - |
| 视觉语言 | 文档理解 | OCRBench | **91** | 87.5 | 88 | - | - | - | 90.4 | - | - | - |
### 教育能力评测
教育能力评测覆盖 EduBench 和 Pedagogy 相关评测设置。下表展示评测表中提供的 EduBench 与 Pedagogy Benchmark Multilingual 详细指标。
| 评测集 | 指标 | Qwen3.5-397B-A17B | Nex-N2-Pro | InnoSpark3.0-397B | Nex-N2-Pro-math-rl | GLM-5.2 | DeepSeekV4-Pro | Kimi-2.6 | GPT-5.5 | Gemini-3.1-Pro | Claude-opus-4.8 |
| --- | --- | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: |
| EduBench | 总分 | 91.2 | 90.6 | **96.3** | - | 93.5 | 91.9 | 93.2 | 92.7 | 94.5 | 90.6 |
| EduBench | 指令遵循与任务完成 | 93.7 | 93.7 | **98.2** | - | 96.1 | 96.8 | 90.5 | 98.1 | 97.8 | 86.5 |
| EduBench | 角色与语气一致性 | 95.1 | 94.2 | **99.1** | - | 98.5 | 97.7 | 98.2 | 98.4 | 98.3 | 96.6 |
| EduBench | 内容相关性与范围控制 | 98.8 | 97.8 | 99.1 | - | **99.3** | 98.7 | 98.6 | 99.2 | 99.2 | 95.9 |
| EduBench | 基础事实准确性 | 97.6 | 96.1 | 98 | - | 98.7 | 97.4 | 97.4 | **98.9** | 98.8 | 96.3 |
| EduBench | 领域知识准确性 | 94.1 | 94.5 | **98.7** | - | 97.1 | 94.8 | 97 | 96.3 | 97.3 | 95 |
| EduBench | 清晰性、简洁性与启发性 | 88.7 | 88.7 | **96.4** | - | 91.9 | 89.2 | 93 | 90.9 | 92.9 | 90.9 |
| EduBench | 高阶思维与能力培养 | 78.8 | 76.1 | **91.2** | - | 81.6 | 78.2 | 86.1 | 76.9 | 83.6 | 80.4 |
| EduBench | 场景要素整合 | 72.8 | 73.6 | **81.3** | - | 75.8 | 72.9 | 76 | 73.3 | 76.3 | 75.8 |
| EduBench | 个性化、适应性与学习支持 | 95.6 | 96.7 | **99.7** | - | 99.1 | 97.7 | 99.5 | 97.8 | 99.3 | 99.4 |
| EduBench | 推理过程严谨性 | 95 | 95.8 | **98.6** | - | 97.5 | 94.4 | 96.4 | 96.9 | 98.3 | 92.8 |
| Pedagogy Benchmark Multilingual | 平均分 | 87.72 | 88.59 | **97.28** | 88.48 | 87.17 | 86.52 | 82.5 | 92 | 92 | 89 |
| Pedagogy Benchmark Multilingual | 评估 | 90.13 | 91.48 | **97.76** | 91.03 | 89.24 | 87.89 | 85.65 | 92 | 92 | 89 |
| Pedagogy Benchmark Multilingual | 课堂管理 | 83.33 | 83.33 | **100** | 83.33 | **100** | **100** | 83.33 | 92 | 92 | 89 |
| Pedagogy Benchmark Multilingual | 教育理论 | 96.67 | 93.33 | **100** | 96.67 | 96.67 | 93.33 | 86.67 | 92 | 92 | 89 |
| Pedagogy Benchmark Multilingual | 学生理解 | 84.14 | 83.7 | **96.04** | 84.58 | 85.46 | 83.7 | 78.85 | 92 | 92 | 89 |
| Pedagogy Benchmark Multilingual | 教学策略 | 87.94 | 89.56 | **97.45** | 88.86 | 86.31 | 86.77 | 82.6 | 92 | 92 | 89 |
## 使用方法
### Transformers
```python
import torch
from transformers import AutoProcessor, AutoModelForMultimodalLM
model_id = "sii-research/InnoSpark3.0-397B-260712"
processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForMultimodalLM.from_pretrained(
model_id,
torch_dtype="auto",
device_map="auto",
trust_remote_code=True,
)
messages = [
{
"role": "user",
"content": [
{
"type": "text",
"text": "请用适合初中生的方式讲解一元二次方程的求根公式,并给出一个例题。",
}
],
}
]
inputs = processor.apply_chat_template(
messages,
add_generation_prompt=True,
tokenize=True,
return_dict=True,
return_tensors="pt",
).to(model.device)
outputs = model.generate(**inputs, max_new_tokens=1024)
response = processor.decode(
outputs[0][inputs["input_ids"].shape[-1]:],
skip_special_tokens=True,
)
print(response)
```
### vLLM
```bash
vllm serve sii-research/InnoSpark3.0-397B-260712 --trust-remote-code
```
## 适用场景
InnoSpark3.0-397B-260712 适用于教育 AI 相关研究与应用开发,包括:
- 概念解释与分步辅导
- 教育问答与作业辅助
- 教案设计与教学材料生成
- 面向学生的对话式学习 agent
- 面向教师的教学辅助工作流
- 通用指令遵循、推理和 agent 类任务
## 局限性
与其他大语言模型一样,InnoSpark3.0-397B-260712 可能生成不准确、不完整或带有偏见的内容。在高风险学习、评价或学生指导场景中,模型输出应由具备资质的教育工作者进行审核。该模型不应作为事实核验、评分决策、心理咨询、医疗建议、法律建议或其他安全关键决策的唯一依据。
评测结果可能受到 prompt 格式、解码参数、评测实现方式和数据版本影响。用户在生产环境或真实课堂环境部署前,应结合具体场景进行额外评估。
## 主要贡献
| 姓名 | 负责工作 | 个人链接 |
| --- | --- | --- |
| 刘文涛 | 训练 pipeline + SFT 通用和教育数据处理 + 教育 RL 训练 | [Google Scholar](https://scholar.google.com/citations?user=v00S9x8AAAAJ&hl=zh-CN&oi=sra) |
| 宋思宇 | RL 训练环境基础设施搭建 + 通用 RL 训练 + 教育 RL 训练 | [Google Scholar](https://scholar.google.com/citations?user=cHNNInsAAAAJ&hl=zh-CN) |
| 卢烨 | SFT 训练 + 指令遵循能力 RL | [GitHub](https://github.com/Septend9), [Google Scholar](https://scholar.google.com/citations?user=JM8y--kAAAAJ&hl=zh-CN) |
| 谢轩豪 | RL 训练环境基础设施搭建 + SFT 通用和教育数据合成和训练 | [Homepage](https://innoseon.github.io/) |
| 王圣尧 | 教育 agent 场景 RL 数据处理和训练 | [GitHub](https://github.com/LikeSwim) |
| 钱毅 | 通用指标 + 教育指标评测 | [GitHub](https://github.com/Josephqqqy) |
| 刘家豪 | 通用指标 + 教育指标评测 | [GitHub](https://github.com/skiboyvv) |
| 吴文博 | 通用 agent 评测管线搭建 | [Homepage](https://titan-frank.github.io/) |
## 引用
```bibtex
@misc{innospark3_397b_260712,
title = {InnoSpark3.0-397B-260712},
author = {SII Research},
year = {2026},
howpublished = {\url{https://huggingface.co/sii-research/InnoSpark3.0-397B-260712}}
}
```
请同时遵循相关基座模型和对比模型的引用与许可证要求。
|