InnoSpark3.0-397B-260712 / README.zh-CN.md
innospark's picture
Upload 2 files
346e996 verified
|
Raw
History Blame Contribute Delete
9.76 kB

语言: English | 中文

InnoSpark3.0-397B-260712

InnoSpark3.0-397B-260712 是 InnoSpark3.0 系列中的 397B 教育增强模型。该模型基于 NEX 397B 模型家族训练,并与 Qwen3.5-397B-A17B、Nex-N2-Pro 以及评测表中提供的其他 SOTA 模型进行对比评测。

InnoSpark3.0-397B-260712 面向教育问答、教学辅助、学习陪伴,以及课堂或作业场景中的解释生成、分层讲解、引导式推理和教学策略建议等任务。我们在 SFT 阶段引入了通用数据与教育领域数据,并通过多阶段 RL pipeline 进一步强化模型的推理能力、教育场景问答能力、agent 能力与指令遵循能力。我们没有专门优化视觉能力;视觉语言指标主要用于透明呈现模型能力变化。

模型信息

项目 说明
模型名称 InnoSpark3.0-397B-260712
训练来源 NEX 397B 模型家族
对比基线 Qwen3.5-397B-A17B、Nex-N2-Pro、评测表中的 SOTA 模型
参数规模 397B
训练 pipeline SFT + 多阶段 RL
SFT 数据 通用数据 + 教育领域数据
RL 强化方向 推理、教育问答、agent 场景、指令遵循
主要应用场景 教育问答、学习辅导、教学辅助、教育 agent、通用助手任务

训练方法

后训练流程主要包含两个阶段:

  1. 监督微调(SFT):使用通用指令数据与教育领域数据混合训练,提升模型在教学问答、概念解释和课堂指令遵循等任务上的表现。
  2. 多阶段强化学习(RL):针对推理、教育场景问答、agent 任务求解和指令遵循稳定性进行进一步优化。

评测结果

以下所有分数均统一为 100 分制。EduBench 在原始评测表中为 10 分制,这里乘以 10 后展示。每一行中最高分使用粗体标出。缺失结果统一显示为 -

通用能力评测

类型 能力维度 评测集 Qwen3.5-397B-A17B Nex-N2-Pro InnoSpark3.0-397B Nex-N2-Pro-math-rl GLM-5.2 DeepSeekV4-Pro Kimi-2.6 GPT-5.5 Gemini-3.1-Pro Claude-opus-4.8
语言 知识 MMLU-Pro 87.8 87.76 87.83 - 84.3 73.5 86.87 - 91 -
语言 知识 C-Eval 93 93.24 93.68 - 92.27 93.1 95.17 - - -
语言 知识 SimpleQA-Verified 53.1 59.5 60.4 - 34.1 55.2 41.1 - 75.6 -
语言 指令遵循 IF-Eval 92.6 94 90.39 - 90.39 91.9 94.5 - - -
语言 指令遵循 IF-bench 76.5 64.97 70.67 - 73.3 68.03 64.63 - - -
语言 STEM 与推理 GPQA Diamond 85.86 90.7 90.4 - 91.2 90.1 90.5 93.6 94.3 -
语言 STEM 与推理 LiveCodeBench v6 83.6 67.39 66.54 - 54.12 93.5 89.6 - 91.7 -
语言 STEM 与推理 AIME25 93.33 96.67 93.33 90 80 90 93.33 - 96.67 -
语言 STEM 与推理 AIME26 91.3 90 96.67 93.33 99.2 96.67 96.4 98.3 100 95.7
语言 Coding Agent SWE-bench Verified-Agentic 76.4 80.8 78.4 - 82 80.6 80.2 82.9 80.6 -
语言 Coding Agent Terminal-Bench 2.1 52.5 75.3 57.3 - 81 67.9 66.7 83.4 68.5 74.6
语言 General Agent BFCL_v4 72.9 64.14 65.16 - 76.66 72.95 67.82 - - -
语言 General Agent TAU3-bench 68.3 71.1 60.43 - 47.73 56.63 64.7 - 50.67 -
视觉语言 STEM 与 Puzzle MMMU-Pro 85.9 85.72 86.24 - - - 82.6 83.2 83 -
视觉语言 通用 VQA MMBenchEN-DEV-v1.1 92.93 93.3 93.44 - - - 93.44 - - -
视觉语言 文档理解 OCRBench 91 87.5 88 - - - 90.4 - - -

教育能力评测

教育能力评测覆盖 EduBench 和 Pedagogy 相关评测设置。下表展示评测表中提供的 EduBench 与 Pedagogy Benchmark Multilingual 详细指标。

评测集 指标 Qwen3.5-397B-A17B Nex-N2-Pro InnoSpark3.0-397B Nex-N2-Pro-math-rl GLM-5.2 DeepSeekV4-Pro Kimi-2.6 GPT-5.5 Gemini-3.1-Pro Claude-opus-4.8
EduBench 总分 91.2 90.6 96.3 - 93.5 91.9 93.2 92.7 94.5 90.6
EduBench 指令遵循与任务完成 93.7 93.7 98.2 - 96.1 96.8 90.5 98.1 97.8 86.5
EduBench 角色与语气一致性 95.1 94.2 99.1 - 98.5 97.7 98.2 98.4 98.3 96.6
EduBench 内容相关性与范围控制 98.8 97.8 99.1 - 99.3 98.7 98.6 99.2 99.2 95.9
EduBench 基础事实准确性 97.6 96.1 98 - 98.7 97.4 97.4 98.9 98.8 96.3
EduBench 领域知识准确性 94.1 94.5 98.7 - 97.1 94.8 97 96.3 97.3 95
EduBench 清晰性、简洁性与启发性 88.7 88.7 96.4 - 91.9 89.2 93 90.9 92.9 90.9
EduBench 高阶思维与能力培养 78.8 76.1 91.2 - 81.6 78.2 86.1 76.9 83.6 80.4
EduBench 场景要素整合 72.8 73.6 81.3 - 75.8 72.9 76 73.3 76.3 75.8
EduBench 个性化、适应性与学习支持 95.6 96.7 99.7 - 99.1 97.7 99.5 97.8 99.3 99.4
EduBench 推理过程严谨性 95 95.8 98.6 - 97.5 94.4 96.4 96.9 98.3 92.8
Pedagogy Benchmark Multilingual 平均分 87.72 88.59 97.28 88.48 87.17 86.52 82.5 92 92 89
Pedagogy Benchmark Multilingual 评估 90.13 91.48 97.76 91.03 89.24 87.89 85.65 92 92 89
Pedagogy Benchmark Multilingual 课堂管理 83.33 83.33 100 83.33 100 100 83.33 92 92 89
Pedagogy Benchmark Multilingual 教育理论 96.67 93.33 100 96.67 96.67 93.33 86.67 92 92 89
Pedagogy Benchmark Multilingual 学生理解 84.14 83.7 96.04 84.58 85.46 83.7 78.85 92 92 89
Pedagogy Benchmark Multilingual 教学策略 87.94 89.56 97.45 88.86 86.31 86.77 82.6 92 92 89

使用方法

Transformers

import torch
from transformers import AutoProcessor, AutoModelForMultimodalLM

model_id = "sii-research/InnoSpark3.0-397B-260712"

processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForMultimodalLM.from_pretrained(
    model_id,
    torch_dtype="auto",
    device_map="auto",
    trust_remote_code=True,
)

messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "text",
                "text": "请用适合初中生的方式讲解一元二次方程的求根公式,并给出一个例题。",
            }
        ],
    }
]

inputs = processor.apply_chat_template(
    messages,
    add_generation_prompt=True,
    tokenize=True,
    return_dict=True,
    return_tensors="pt",
).to(model.device)

outputs = model.generate(**inputs, max_new_tokens=1024)
response = processor.decode(
    outputs[0][inputs["input_ids"].shape[-1]:],
    skip_special_tokens=True,
)
print(response)

vLLM

vllm serve sii-research/InnoSpark3.0-397B-260712 --trust-remote-code

适用场景

InnoSpark3.0-397B-260712 适用于教育 AI 相关研究与应用开发,包括:

  • 概念解释与分步辅导
  • 教育问答与作业辅助
  • 教案设计与教学材料生成
  • 面向学生的对话式学习 agent
  • 面向教师的教学辅助工作流
  • 通用指令遵循、推理和 agent 类任务

局限性

与其他大语言模型一样,InnoSpark3.0-397B-260712 可能生成不准确、不完整或带有偏见的内容。在高风险学习、评价或学生指导场景中,模型输出应由具备资质的教育工作者进行审核。该模型不应作为事实核验、评分决策、心理咨询、医疗建议、法律建议或其他安全关键决策的唯一依据。

评测结果可能受到 prompt 格式、解码参数、评测实现方式和数据版本影响。用户在生产环境或真实课堂环境部署前,应结合具体场景进行额外评估。

主要贡献

姓名 负责工作 个人链接
刘文涛 训练 pipeline + SFT 通用和教育数据处理 + 教育 RL 训练 Google Scholar
宋思宇 RL 训练环境基础设施搭建 + 通用 RL 训练 + 教育 RL 训练 Google Scholar
卢烨 SFT 训练 + 指令遵循能力 RL GitHub, Google Scholar
谢轩豪 RL 训练环境基础设施搭建 + SFT 通用和教育数据合成和训练 Homepage
王圣尧 教育 agent 场景 RL 数据处理和训练 GitHub
钱毅 通用指标 + 教育指标评测 GitHub
刘家豪 通用指标 + 教育指标评测 GitHub
吴文博 通用 agent 评测管线搭建 Homepage

引用

@misc{innospark3_397b_260712,
  title = {InnoSpark3.0-397B-260712},
  author = {SII Research},
  year = {2026},
  howpublished = {\url{https://huggingface.co/sii-research/InnoSpark3.0-397B-260712}}
}

请同时遵循相关基座模型和对比模型的引用与许可证要求。