**语言:** [English](./README.md) | 中文 # InnoSpark3.0-397B-260712 InnoSpark3.0-397B-260712 是 InnoSpark3.0 系列中的 397B 教育增强模型。该模型基于 NEX 397B 模型家族训练,并与 Qwen3.5-397B-A17B、Nex-N2-Pro 以及评测表中提供的其他 SOTA 模型进行对比评测。 InnoSpark3.0-397B-260712 面向教育问答、教学辅助、学习陪伴,以及课堂或作业场景中的解释生成、分层讲解、引导式推理和教学策略建议等任务。我们在 SFT 阶段引入了通用数据与教育领域数据,并通过多阶段 RL pipeline 进一步强化模型的推理能力、教育场景问答能力、agent 能力与指令遵循能力。我们没有专门优化视觉能力;视觉语言指标主要用于透明呈现模型能力变化。 ## 模型信息 | 项目 | 说明 | | --- | --- | | 模型名称 | InnoSpark3.0-397B-260712 | | 训练来源 | NEX 397B 模型家族 | | 对比基线 | Qwen3.5-397B-A17B、Nex-N2-Pro、评测表中的 SOTA 模型 | | 参数规模 | 397B | | 训练 pipeline | SFT + 多阶段 RL | | SFT 数据 | 通用数据 + 教育领域数据 | | RL 强化方向 | 推理、教育问答、agent 场景、指令遵循 | | 主要应用场景 | 教育问答、学习辅导、教学辅助、教育 agent、通用助手任务 | ## 训练方法 后训练流程主要包含两个阶段: 1. **监督微调(SFT)**:使用通用指令数据与教育领域数据混合训练,提升模型在教学问答、概念解释和课堂指令遵循等任务上的表现。 2. **多阶段强化学习(RL)**:针对推理、教育场景问答、agent 任务求解和指令遵循稳定性进行进一步优化。 ## 评测结果 以下所有分数均统一为 100 分制。EduBench 在原始评测表中为 10 分制,这里乘以 10 后展示。每一行中最高分使用粗体标出。缺失结果统一显示为 `-`。 ### 通用能力评测 | 类型 | 能力维度 | 评测集 | Qwen3.5-397B-A17B | Nex-N2-Pro | InnoSpark3.0-397B | Nex-N2-Pro-math-rl | GLM-5.2 | DeepSeekV4-Pro | Kimi-2.6 | GPT-5.5 | Gemini-3.1-Pro | Claude-opus-4.8 | | --- | --- | --- | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: | | 语言 | 知识 | MMLU-Pro | 87.8 | 87.76 | 87.83 | - | 84.3 | 73.5 | 86.87 | - | **91** | - | | 语言 | 知识 | C-Eval | 93 | 93.24 | 93.68 | - | 92.27 | 93.1 | **95.17** | - | - | - | | 语言 | 知识 | SimpleQA-Verified | 53.1 | 59.5 | 60.4 | - | 34.1 | 55.2 | 41.1 | - | **75.6** | - | | 语言 | 指令遵循 | IF-Eval | 92.6 | 94 | 90.39 | - | 90.39 | 91.9 | **94.5** | - | - | - | | 语言 | 指令遵循 | IF-bench | **76.5** | 64.97 | 70.67 | - | 73.3 | 68.03 | 64.63 | - | - | - | | 语言 | STEM 与推理 | GPQA Diamond | 85.86 | 90.7 | 90.4 | - | 91.2 | 90.1 | 90.5 | 93.6 | **94.3** | - | | 语言 | STEM 与推理 | LiveCodeBench v6 | 83.6 | 67.39 | 66.54 | - | 54.12 | **93.5** | 89.6 | - | 91.7 | - | | 语言 | STEM 与推理 | AIME25 | 93.33 | **96.67** | 93.33 | 90 | 80 | 90 | 93.33 | - | **96.67** | - | | 语言 | STEM 与推理 | AIME26 | 91.3 | 90 | 96.67 | 93.33 | 99.2 | 96.67 | 96.4 | 98.3 | **100** | 95.7 | | 语言 | Coding Agent | SWE-bench Verified-Agentic | 76.4 | 80.8 | 78.4 | - | 82 | 80.6 | 80.2 | **82.9** | 80.6 | - | | 语言 | Coding Agent | Terminal-Bench 2.1 | 52.5 | 75.3 | 57.3 | - | 81 | 67.9 | 66.7 | **83.4** | 68.5 | 74.6 | | 语言 | General Agent | BFCL_v4 | 72.9 | 64.14 | 65.16 | - | **76.66** | 72.95 | 67.82 | - | - | - | | 语言 | General Agent | TAU3-bench | 68.3 | **71.1** | 60.43 | - | 47.73 | 56.63 | 64.7 | - | 50.67 | - | | 视觉语言 | STEM 与 Puzzle | MMMU-Pro | 85.9 | 85.72 | **86.24** | - | - | - | 82.6 | 83.2 | 83 | - | | 视觉语言 | 通用 VQA | MMBenchEN-DEV-v1.1 | 92.93 | 93.3 | **93.44** | - | - | - | **93.44** | - | - | - | | 视觉语言 | 文档理解 | OCRBench | **91** | 87.5 | 88 | - | - | - | 90.4 | - | - | - | ### 教育能力评测 教育能力评测覆盖 EduBench 和 Pedagogy 相关评测设置。下表展示评测表中提供的 EduBench 与 Pedagogy Benchmark Multilingual 详细指标。 | 评测集 | 指标 | Qwen3.5-397B-A17B | Nex-N2-Pro | InnoSpark3.0-397B | Nex-N2-Pro-math-rl | GLM-5.2 | DeepSeekV4-Pro | Kimi-2.6 | GPT-5.5 | Gemini-3.1-Pro | Claude-opus-4.8 | | --- | --- | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: | ---: | | EduBench | 总分 | 91.2 | 90.6 | **96.3** | - | 93.5 | 91.9 | 93.2 | 92.7 | 94.5 | 90.6 | | EduBench | 指令遵循与任务完成 | 93.7 | 93.7 | **98.2** | - | 96.1 | 96.8 | 90.5 | 98.1 | 97.8 | 86.5 | | EduBench | 角色与语气一致性 | 95.1 | 94.2 | **99.1** | - | 98.5 | 97.7 | 98.2 | 98.4 | 98.3 | 96.6 | | EduBench | 内容相关性与范围控制 | 98.8 | 97.8 | 99.1 | - | **99.3** | 98.7 | 98.6 | 99.2 | 99.2 | 95.9 | | EduBench | 基础事实准确性 | 97.6 | 96.1 | 98 | - | 98.7 | 97.4 | 97.4 | **98.9** | 98.8 | 96.3 | | EduBench | 领域知识准确性 | 94.1 | 94.5 | **98.7** | - | 97.1 | 94.8 | 97 | 96.3 | 97.3 | 95 | | EduBench | 清晰性、简洁性与启发性 | 88.7 | 88.7 | **96.4** | - | 91.9 | 89.2 | 93 | 90.9 | 92.9 | 90.9 | | EduBench | 高阶思维与能力培养 | 78.8 | 76.1 | **91.2** | - | 81.6 | 78.2 | 86.1 | 76.9 | 83.6 | 80.4 | | EduBench | 场景要素整合 | 72.8 | 73.6 | **81.3** | - | 75.8 | 72.9 | 76 | 73.3 | 76.3 | 75.8 | | EduBench | 个性化、适应性与学习支持 | 95.6 | 96.7 | **99.7** | - | 99.1 | 97.7 | 99.5 | 97.8 | 99.3 | 99.4 | | EduBench | 推理过程严谨性 | 95 | 95.8 | **98.6** | - | 97.5 | 94.4 | 96.4 | 96.9 | 98.3 | 92.8 | | Pedagogy Benchmark Multilingual | 平均分 | 87.72 | 88.59 | **97.28** | 88.48 | 87.17 | 86.52 | 82.5 | 92 | 92 | 89 | | Pedagogy Benchmark Multilingual | 评估 | 90.13 | 91.48 | **97.76** | 91.03 | 89.24 | 87.89 | 85.65 | 92 | 92 | 89 | | Pedagogy Benchmark Multilingual | 课堂管理 | 83.33 | 83.33 | **100** | 83.33 | **100** | **100** | 83.33 | 92 | 92 | 89 | | Pedagogy Benchmark Multilingual | 教育理论 | 96.67 | 93.33 | **100** | 96.67 | 96.67 | 93.33 | 86.67 | 92 | 92 | 89 | | Pedagogy Benchmark Multilingual | 学生理解 | 84.14 | 83.7 | **96.04** | 84.58 | 85.46 | 83.7 | 78.85 | 92 | 92 | 89 | | Pedagogy Benchmark Multilingual | 教学策略 | 87.94 | 89.56 | **97.45** | 88.86 | 86.31 | 86.77 | 82.6 | 92 | 92 | 89 | ## 使用方法 ### Transformers ```python import torch from transformers import AutoProcessor, AutoModelForMultimodalLM model_id = "sii-research/InnoSpark3.0-397B-260712" processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True) model = AutoModelForMultimodalLM.from_pretrained( model_id, torch_dtype="auto", device_map="auto", trust_remote_code=True, ) messages = [ { "role": "user", "content": [ { "type": "text", "text": "请用适合初中生的方式讲解一元二次方程的求根公式,并给出一个例题。", } ], } ] inputs = processor.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=1024) response = processor.decode( outputs[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True, ) print(response) ``` ### vLLM ```bash vllm serve sii-research/InnoSpark3.0-397B-260712 --trust-remote-code ``` ## 适用场景 InnoSpark3.0-397B-260712 适用于教育 AI 相关研究与应用开发,包括: - 概念解释与分步辅导 - 教育问答与作业辅助 - 教案设计与教学材料生成 - 面向学生的对话式学习 agent - 面向教师的教学辅助工作流 - 通用指令遵循、推理和 agent 类任务 ## 局限性 与其他大语言模型一样,InnoSpark3.0-397B-260712 可能生成不准确、不完整或带有偏见的内容。在高风险学习、评价或学生指导场景中,模型输出应由具备资质的教育工作者进行审核。该模型不应作为事实核验、评分决策、心理咨询、医疗建议、法律建议或其他安全关键决策的唯一依据。 评测结果可能受到 prompt 格式、解码参数、评测实现方式和数据版本影响。用户在生产环境或真实课堂环境部署前,应结合具体场景进行额外评估。 ## 主要贡献 | 姓名 | 负责工作 | 个人链接 | | --- | --- | --- | | 刘文涛 | 训练 pipeline + SFT 通用和教育数据处理 + 教育 RL 训练 | [Google Scholar](https://scholar.google.com/citations?user=v00S9x8AAAAJ&hl=zh-CN&oi=sra) | | 宋思宇 | RL 训练环境基础设施搭建 + 通用 RL 训练 + 教育 RL 训练 | [Google Scholar](https://scholar.google.com/citations?user=cHNNInsAAAAJ&hl=zh-CN) | | 卢烨 | SFT 训练 + 指令遵循能力 RL | [GitHub](https://github.com/Septend9), [Google Scholar](https://scholar.google.com/citations?user=JM8y--kAAAAJ&hl=zh-CN) | | 谢轩豪 | RL 训练环境基础设施搭建 + SFT 通用和教育数据合成和训练 | [Homepage](https://innoseon.github.io/) | | 王圣尧 | 教育 agent 场景 RL 数据处理和训练 | [GitHub](https://github.com/LikeSwim) | | 钱毅 | 通用指标 + 教育指标评测 | [GitHub](https://github.com/Josephqqqy) | | 刘家豪 | 通用指标 + 教育指标评测 | [GitHub](https://github.com/skiboyvv) | | 吴文博 | 通用 agent 评测管线搭建 | [Homepage](https://titan-frank.github.io/) | ## 引用 ```bibtex @misc{innospark3_397b_260712, title = {InnoSpark3.0-397B-260712}, author = {SII Research}, year = {2026}, howpublished = {\url{https://huggingface.co/sii-research/InnoSpark3.0-397B-260712}} } ``` 请同时遵循相关基座模型和对比模型的引用与许可证要求。