Image-Text-to-Text
Transformers
Safetensors
Chinese
English
qwen3_5_moe
education
qwen
nex
sft
reinforcement-learning
reasoning
instruction-following
agent
conversational
Instructions to use sii-research/InnoSpark3.0-397B-260712 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use sii-research/InnoSpark3.0-397B-260712 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("image-text-to-text", model="sii-research/InnoSpark3.0-397B-260712") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] pipe(text=messages)# Load model directly from transformers import AutoProcessor, AutoModelForMultimodalLM processor = AutoProcessor.from_pretrained("sii-research/InnoSpark3.0-397B-260712") model = AutoModelForMultimodalLM.from_pretrained("sii-research/InnoSpark3.0-397B-260712", device_map="auto") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] inputs = processor.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(processor.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use sii-research/InnoSpark3.0-397B-260712 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "sii-research/InnoSpark3.0-397B-260712" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "sii-research/InnoSpark3.0-397B-260712", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker
docker model run hf.co/sii-research/InnoSpark3.0-397B-260712
- SGLang
How to use sii-research/InnoSpark3.0-397B-260712 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "sii-research/InnoSpark3.0-397B-260712" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "sii-research/InnoSpark3.0-397B-260712", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "sii-research/InnoSpark3.0-397B-260712" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "sii-research/InnoSpark3.0-397B-260712", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }' - Docker Model Runner
How to use sii-research/InnoSpark3.0-397B-260712 with Docker Model Runner:
docker model run hf.co/sii-research/InnoSpark3.0-397B-260712
| **语言:** [English](./README.md) | 中文 | |
| # InnoSpark3.0-397B-260712 | |
| InnoSpark3.0-397B-260712 是 InnoSpark3.0 系列中的 397B 教育增强模型。该模型基于 NEX 397B 模型家族训练,并与 Qwen3.5-397B-A17B、Nex-N2-Pro 以及评测表中提供的其他 SOTA 模型进行对比评测。 | |
| InnoSpark3.0-397B-260712 面向教育问答、教学辅助、学习陪伴,以及课堂或作业场景中的解释生成、分层讲解、引导式推理和教学策略建议等任务。我们在 SFT 阶段引入了通用数据与教育领域数据,并通过多阶段 RL pipeline 进一步强化模型的推理能力、教育场景问答能力、agent 能力与指令遵循能力。我们没有专门优化视觉能力;视觉语言指标主要用于透明呈现模型能力变化。 | |
| ## 模型信息 | |
| | 项目 | 说明 | | |
| | --- | --- | | |
| | 模型名称 | InnoSpark3.0-397B-260712 | | |
| | 训练来源 | NEX 397B 模型家族 | | |
| | 对比基线 | Qwen3.5-397B-A17B、Nex-N2-Pro、评测表中的 SOTA 模型 | | |
| | 参数规模 | 397B | | |
| | 训练 pipeline | SFT + 多阶段 RL | | |
| | SFT 数据 | 通用数据 + 教育领域数据 | | |
| | RL 强化方向 | 推理、教育问答、agent 场景、指令遵循 | | |
| | 主要应用场景 | 教育问答、学习辅导、教学辅助、教育 agent、通用助手任务 | | |
| ## 训练方法 | |
| 后训练流程主要包含两个阶段: | |
| 1. **监督微调(SFT)**:使用通用指令数据与教育领域数据混合训练,提升模型在教学问答、概念解释和课堂指令遵循等任务上的表现。 | |
| 2. **多阶段强化学习(RL)**:针对推理、教育场景问答、agent 任务求解和指令遵循稳定性进行进一步优化。 | |
| ## 评测结果 | |
| 以下所有分数均统一为 100 分制。EduBench 在原始评测表中为 10 分制,这里乘以 10 后展示。每一行中最高分使用粗体标出。缺失结果统一显示为 `-`。 | |
| ### 通用能力评测 | |
| | 类型 | 能力维度 | 评测集 | Qwen3.5-397B-A17B | Nex-N2-Pro | InnoSpark3.0-397B | Nex-N2-Pro-math-rl | GLM-5.2 | DeepSeekV4-Pro | Kimi-2.6 | GPT-5.5 | Gemini-3.1-Pro | Claude-opus-4.8 | | |
| | --- | --- | --- | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: | | |
| | 语言 | 知识 | MMLU-Pro | 87.8 | 87.76 | 87.83 | - | 84.3 | 73.5 | 86.87 | - | **91** | - | | |
| | 语言 | 知识 | C-Eval | 93 | 93.24 | 93.68 | - | 92.27 | 93.1 | **95.17** | - | - | - | | |
| | 语言 | 知识 | SimpleQA-Verified | 53.1 | 59.5 | 60.4 | - | 34.1 | 55.2 | 41.1 | - | **75.6** | - | | |
| | 语言 | 指令遵循 | IF-Eval | 92.6 | 94 | 90.39 | - | 90.39 | 91.9 | **94.5** | - | - | - | | |
| | 语言 | 指令遵循 | IF-bench | **76.5** | 64.97 | 70.67 | - | 73.3 | 68.03 | 64.63 | - | - | - | | |
| | 语言 | STEM 与推理 | GPQA Diamond | 85.86 | 90.7 | 90.4 | - | 91.2 | 90.1 | 90.5 | 93.6 | **94.3** | - | | |
| | 语言 | STEM 与推理 | LiveCodeBench v6 | 83.6 | 67.39 | 66.54 | - | 54.12 | **93.5** | 89.6 | - | 91.7 | - | | |
| | 语言 | STEM 与推理 | AIME25 | 93.33 | **96.67** | 93.33 | 90 | 80 | 90 | 93.33 | - | **96.67** | - | | |
| | 语言 | STEM 与推理 | AIME26 | 91.3 | 90 | 96.67 | 93.33 | 99.2 | 96.67 | 96.4 | 98.3 | **100** | 95.7 | | |
| | 语言 | Coding Agent | SWE-bench Verified-Agentic | 76.4 | 80.8 | 78.4 | - | 82 | 80.6 | 80.2 | **82.9** | 80.6 | - | | |
| | 语言 | Coding Agent | Terminal-Bench 2.1 | 52.5 | 75.3 | 57.3 | - | 81 | 67.9 | 66.7 | **83.4** | 68.5 | 74.6 | | |
| | 语言 | General Agent | BFCL_v4 | 72.9 | 64.14 | 65.16 | - | **76.66** | 72.95 | 67.82 | - | - | - | | |
| | 语言 | General Agent | TAU3-bench | 68.3 | **71.1** | 60.43 | - | 47.73 | 56.63 | 64.7 | - | 50.67 | - | | |
| | 视觉语言 | STEM 与 Puzzle | MMMU-Pro | 85.9 | 85.72 | **86.24** | - | - | - | 82.6 | 83.2 | 83 | - | | |
| | 视觉语言 | 通用 VQA | MMBenchEN-DEV-v1.1 | 92.93 | 93.3 | **93.44** | - | - | - | **93.44** | - | - | - | | |
| | 视觉语言 | 文档理解 | OCRBench | **91** | 87.5 | 88 | - | - | - | 90.4 | - | - | - | | |
| ### 教育能力评测 | |
| 教育能力评测覆盖 EduBench 和 Pedagogy 相关评测设置。下表展示评测表中提供的 EduBench 与 Pedagogy Benchmark Multilingual 详细指标。 | |
| | 评测集 | 指标 | Qwen3.5-397B-A17B | Nex-N2-Pro | InnoSpark3.0-397B | Nex-N2-Pro-math-rl | GLM-5.2 | DeepSeekV4-Pro | Kimi-2.6 | GPT-5.5 | Gemini-3.1-Pro | Claude-opus-4.8 | | |
| | --- | --- | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: | | |
| | EduBench | 总分 | 91.2 | 90.6 | **96.3** | - | 93.5 | 91.9 | 93.2 | 92.7 | 94.5 | 90.6 | | |
| | EduBench | 指令遵循与任务完成 | 93.7 | 93.7 | **98.2** | - | 96.1 | 96.8 | 90.5 | 98.1 | 97.8 | 86.5 | | |
| | EduBench | 角色与语气一致性 | 95.1 | 94.2 | **99.1** | - | 98.5 | 97.7 | 98.2 | 98.4 | 98.3 | 96.6 | | |
| | EduBench | 内容相关性与范围控制 | 98.8 | 97.8 | 99.1 | - | **99.3** | 98.7 | 98.6 | 99.2 | 99.2 | 95.9 | | |
| | EduBench | 基础事实准确性 | 97.6 | 96.1 | 98 | - | 98.7 | 97.4 | 97.4 | **98.9** | 98.8 | 96.3 | | |
| | EduBench | 领域知识准确性 | 94.1 | 94.5 | **98.7** | - | 97.1 | 94.8 | 97 | 96.3 | 97.3 | 95 | | |
| | EduBench | 清晰性、简洁性与启发性 | 88.7 | 88.7 | **96.4** | - | 91.9 | 89.2 | 93 | 90.9 | 92.9 | 90.9 | | |
| | EduBench | 高阶思维与能力培养 | 78.8 | 76.1 | **91.2** | - | 81.6 | 78.2 | 86.1 | 76.9 | 83.6 | 80.4 | | |
| | EduBench | 场景要素整合 | 72.8 | 73.6 | **81.3** | - | 75.8 | 72.9 | 76 | 73.3 | 76.3 | 75.8 | | |
| | EduBench | 个性化、适应性与学习支持 | 95.6 | 96.7 | **99.7** | - | 99.1 | 97.7 | 99.5 | 97.8 | 99.3 | 99.4 | | |
| | EduBench | 推理过程严谨性 | 95 | 95.8 | **98.6** | - | 97.5 | 94.4 | 96.4 | 96.9 | 98.3 | 92.8 | | |
| | Pedagogy Benchmark Multilingual | 平均分 | 87.72 | 88.59 | **97.28** | 88.48 | 87.17 | 86.52 | 82.5 | 92 | 92 | 89 | | |
| | Pedagogy Benchmark Multilingual | 评估 | 90.13 | 91.48 | **97.76** | 91.03 | 89.24 | 87.89 | 85.65 | 92 | 92 | 89 | | |
| | Pedagogy Benchmark Multilingual | 课堂管理 | 83.33 | 83.33 | **100** | 83.33 | **100** | **100** | 83.33 | 92 | 92 | 89 | | |
| | Pedagogy Benchmark Multilingual | 教育理论 | 96.67 | 93.33 | **100** | 96.67 | 96.67 | 93.33 | 86.67 | 92 | 92 | 89 | | |
| | Pedagogy Benchmark Multilingual | 学生理解 | 84.14 | 83.7 | **96.04** | 84.58 | 85.46 | 83.7 | 78.85 | 92 | 92 | 89 | | |
| | Pedagogy Benchmark Multilingual | 教学策略 | 87.94 | 89.56 | **97.45** | 88.86 | 86.31 | 86.77 | 82.6 | 92 | 92 | 89 | | |
| ## 使用方法 | |
| ### Transformers | |
| ```python | |
| import torch | |
| from transformers import AutoProcessor, AutoModelForMultimodalLM | |
| model_id = "sii-research/InnoSpark3.0-397B-260712" | |
| processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True) | |
| model = AutoModelForMultimodalLM.from_pretrained( | |
| model_id, | |
| torch_dtype="auto", | |
| device_map="auto", | |
| trust_remote_code=True, | |
| ) | |
| messages = [ | |
| { | |
| "role": "user", | |
| "content": [ | |
| { | |
| "type": "text", | |
| "text": "请用适合初中生的方式讲解一元二次方程的求根公式,并给出一个例题。", | |
| } | |
| ], | |
| } | |
| ] | |
| inputs = processor.apply_chat_template( | |
| messages, | |
| add_generation_prompt=True, | |
| tokenize=True, | |
| return_dict=True, | |
| return_tensors="pt", | |
| ).to(model.device) | |
| outputs = model.generate(**inputs, max_new_tokens=1024) | |
| response = processor.decode( | |
| outputs[0][inputs["input_ids"].shape[-1]:], | |
| skip_special_tokens=True, | |
| ) | |
| print(response) | |
| ``` | |
| ### vLLM | |
| ```bash | |
| vllm serve sii-research/InnoSpark3.0-397B-260712 --trust-remote-code | |
| ``` | |
| ## 适用场景 | |
| InnoSpark3.0-397B-260712 适用于教育 AI 相关研究与应用开发,包括: | |
| - 概念解释与分步辅导 | |
| - 教育问答与作业辅助 | |
| - 教案设计与教学材料生成 | |
| - 面向学生的对话式学习 agent | |
| - 面向教师的教学辅助工作流 | |
| - 通用指令遵循、推理和 agent 类任务 | |
| ## 局限性 | |
| 与其他大语言模型一样,InnoSpark3.0-397B-260712 可能生成不准确、不完整或带有偏见的内容。在高风险学习、评价或学生指导场景中,模型输出应由具备资质的教育工作者进行审核。该模型不应作为事实核验、评分决策、心理咨询、医疗建议、法律建议或其他安全关键决策的唯一依据。 | |
| 评测结果可能受到 prompt 格式、解码参数、评测实现方式和数据版本影响。用户在生产环境或真实课堂环境部署前,应结合具体场景进行额外评估。 | |
| ## 主要贡献 | |
| | 姓名 | 负责工作 | 个人链接 | | |
| | --- | --- | --- | | |
| | 刘文涛 | 训练 pipeline + SFT 通用和教育数据处理 + 教育 RL 训练 | [Google Scholar](https://scholar.google.com/citations?user=v00S9x8AAAAJ&hl=zh-CN&oi=sra) | | |
| | 宋思宇 | RL 训练环境基础设施搭建 + 通用 RL 训练 + 教育 RL 训练 | [Google Scholar](https://scholar.google.com/citations?user=cHNNInsAAAAJ&hl=zh-CN) | | |
| | 卢烨 | SFT 训练 + 指令遵循能力 RL | [GitHub](https://github.com/Septend9), [Google Scholar](https://scholar.google.com/citations?user=JM8y--kAAAAJ&hl=zh-CN) | | |
| | 谢轩豪 | RL 训练环境基础设施搭建 + SFT 通用和教育数据合成和训练 | [Homepage](https://innoseon.github.io/) | | |
| | 王圣尧 | 教育 agent 场景 RL 数据处理和训练 | [GitHub](https://github.com/LikeSwim) | | |
| | 钱毅 | 通用指标 + 教育指标评测 | [GitHub](https://github.com/Josephqqqy) | | |
| | 刘家豪 | 通用指标 + 教育指标评测 | [GitHub](https://github.com/skiboyvv) | | |
| | 吴文博 | 通用 agent 评测管线搭建 | [Homepage](https://titan-frank.github.io/) | | |
| ## 引用 | |
| ```bibtex | |
| @misc{innospark3_397b_260712, | |
| title = {InnoSpark3.0-397B-260712}, | |
| author = {SII Research}, | |
| year = {2026}, | |
| howpublished = {\url{https://huggingface.co/sii-research/InnoSpark3.0-397B-260712}} | |
| } | |
| ``` | |
| 请同时遵循相关基座模型和对比模型的引用与许可证要求。 | |