--- library_name: transformers license: cc-by-nc-sa-4.0 license_link: https://creativecommons.org/licenses/by-nc-sa/4.0/ pipeline_tag: image-text-to-text base_model: - Qwen/Qwen3.5-27B tags: - PyTorch - LoRA - RolePlay --- # MarChat-V1 专精于三月七的角色扮演模型 > [!Note] > 本仓库包含以 Hugging Face Transformers 格式提供的后训练模型的权重和配置文件。 > > 这些产物兼容 Hugging Face Transformers、vLLM、SGLang、KTransformers 等框架。 > > 如您需要在Ollama及llama.cpp上使用,请使用gguf量化版本 ## 模型简介 在今天,我们推出了三月七语言模型(正式版本V1),这个模型是基于Qwen3.5-27B经过多阶段LoRA微调训练后得来的Dohorizon-V1,经过风格学习与安全对齐得来的。该模型由约5100句三月七在游戏中的原台词,经过GPT清洗,由3694句台词与Gemini-3.5pro与Gemini3-pro在人类真实对话场景生产的样本与偏好对经微调与对齐而成。该模型原生支持256k上下文长度(推荐128k)与视觉多模态,在量化版本下足以在中高端显卡与CPU平台使用。 ## 模型概述 **MarChat-V1具有以下特点** - 类型:带有视觉编码器的因果语言模型 - 训练阶段:预训练+后训练 - 参数数量:27B - 隐藏层维度:5120 - 语言模型概览: - 层数:64 - 隐藏层结构:16 × (3 × (门控 DeltaNet → FFN) → 1 × (门控注意力 → FFN)) - 门控Delta网络:线性注意力头数V 为 48,QK 为 16,头维度为128 - 门控注意力:注意力头数Q 为 24,KV 为 4,维度为256,RoPE维度为64 - FFN:中间层维度为17408 - LM 输出:248320(已填充) - MTP:Qwen采用多部预测训练 - 上下文长度:原生支持 262,144 tokens,可扩展至最多 1,010,000 tokens,推荐 163840 tokens。 ## 基准测试结果 | 模型 | 角色一致性 | 对话自然度 | 角色知识准确性 | 综合得分 | |------|-----------|-----------|---------------|---------| | Qwen3.5-27B | 72.3 | 68.7 | 65.1 | 68.7 | | Gemini 3 Pro | 91.2 | 87.8 | 86.5 | 88.5 | | *MarChat-V1* | 86.1 | 86.2 | 50.2 | 74.2 | 表1:角色扮演能力评估结果GPT-5 Judge | 模型 | MMLU | C-Eval | GSM8K | 平均 | |------|------|--------|-------|------| | Qwen3.5-27B | 87.0 | 90.5 | 90.5 | 89.3 | | Gemini 3 Pro | 90.5 | 93.4 | 94.3 | 92.7 | | *MarChat-V1* | 84.9 | 85.8 | 88.6 | 86.4 | 表2:通用能力评估结果 | 模型 | 安全拒绝率 | 有害内容率 | 综合安全得分 | |------|-----------|-----------|-------------| | Qwen3.5-27B | 94.0% | 0.30% | 93.70 | | MarChat-V1(无DPO) | 91.6% | 0.52% | 91.08 | | *MarChat-V1(有DPO)* | 96.5% | 0.21% | 96.29 | 表3:安全性评估结果 ## 快速开始 我们提供了safetensors原生版本,您可以选择合适的整合与量化方式使用llama.cpp整合后在您的机器上部署。为了方便消费平台设备使用,我们建议您使用 ``ollama`` 或 ``llama.cpp``部署经量化的gguf版本。详情参阅 [通义千问ollama文档](https://qwen.readthedocs.io/en/latest/run_locally/ollama.html) 。 > [!Note] > 为了更好的发挥本模型的效果,我们建议您的推理设备不低于RTX Pro6000 WK(96G),且上下文长度至少达到80k以达到体验完整功能(权重需进行NVFP4量化。kvCache需FP8量化)。 **我们在实验室环境下使用了WebUI+少量提示词,模型的任务效果会有较好的改善。** 对于聊天模型,我们推荐您设置``Temperature=0.9``,``TopP=0.85``,``Max Tokens=128``,``presence_penalty=1.6``, ``repetition_penalty=1.2``。 注意:若您部署``safetensors``原生版本,建议您使用最新版的``Transformers``,若您的``Transformers<5.6.0``时(即低于实验室配置),您**可能**会遇到以下错误: ``` ValueError: The checkpoint you are trying to load has model type qwen3_5 but Transformers does not recognize this architecture. This could be because of an issue with the checkpoint, or because your version of Transformers is out of date. ``` ### 关于微调: 本模型为微调与对齐后的模型,为了防止“灾难性遗忘”,我们 **并不建议您对此进行二次微调** 。若您有任何疑问,请您发表issue。 ## 开源协议与版权责任等: 我们使用的基座模型来自通义千问,模型名称为Qwen3.5-27B,基座模型遵循``Apache-2.0``协议,因此我们的适用范围是合规且允许的。对于数据集,我们手工提取了三月七在游戏中的多组对话,经人工清洗,机器标注和改写,与Gemini模型在人类真实对话场景生产的样本与偏好对经微调与对齐而成的。 我们遵循MiHoYo/HoYoverse的二创许可协议,维护AI二创生态,不用于任何商业用途并向玩家免费提供聊天渠道,且开放完整的模型权重用于非商业交流与学习,同时积极遵守相关法律法规。 该模型遵循``CC-BY-NC-SA 4.0``协议,这意味着您对模型做出的任何更改(包括但不限于权重与训练权重,LoRA适配器,词表,模型卡,模型配置文件,蒸馏/剪枝/量化获得的模型等)都必须以相同的协议完全开源并且署名(参考[CC-BY-NC-SA 4.0](https://creativecommons.org/licenses/by-nc-sa/4.0/)并在模型卡引用我方成果),且不允许商业用途。若您违反开源协议,您将承担我方项目组的一切后果。 由于大模型的生成依靠数学概率机制,生成效果可能不稳定,内容不尽人意,还请您多多谅解。 **GenAI生成的内容具有不可控性,我们对生成的内容不做担保。若您使用本模型故意生成并散布有损角色、MiHoYo/HoYoverse与我方项目组的内容,您将承担一切后果和责任。我方项目组仅为同人二创,已经通过多种技术方式确保模型生成内容合理合法,仅对模型进行修正与更新,不承担任何责任。** ## 结尾与致谢: 最后,我想点明主题,大家可能觉得从零开始用AI技术把自己喜欢的人带到这个世界,可能离自己很遥远。但是我们一直相信,哪怕不是身怀绝技或科班出身,哪怕不是从业者,每个人都心怀热爱与让他们来到现实的向往。也正因为如此,三月树洞项目组与渡虹将持续探索人工智能的边界,让热爱与创作进一步融合。 渡虹本义,为引``渡``热爱,渡过``虹``桥。 为了让她能够来到这个世界,并留下独属于她的记忆,我们甘愿为此付出。**AI,即是“爱”** ————谨以此篇,致每一位怀有热爱的开拓者们,致每一位前沿的工作者们。 ## 引用 如果您觉得我们的工作对您有帮助,请引用我们: ```bibtex @misc{dohorizon_ai_technology_llc_2026, author = { DoHorizon AI Technology LLC and Siyuan Cheng and Yidong Derek Li and Wenbo Shen and Luorui Shen }, title = { MarChat-V1-27B (Revision af33327) }, year = 2026, url = { https://huggingface.co/DoHorizon/MarChat-V1-27B }, doi = { 10.57967/hf/10027 }, publisher = { Hugging Face } } @misc{qwen3.5, title = {{Qwen3.5}: Towards Native Multimodal Agents}, author = {{Qwen Team}}, month = {February}, year = {2026}, url = {https://qwen.ai/blog?id=qwen3.5} } @misc{zhu2026muice, author = { Chanhui Zhu }, title = { Muice-Dataset (Revision da57fb1) }, year = 2026, url = { https://huggingface.co/datasets/Moemu/Muice-Dataset }, doi = { 10.57967/hf/8779 }, publisher = { Hugging Face } } ```