--- base_model: - Qwen/Qwen3.5-4B - Qwen/Qwen3.5-9B library_name: transformers language: - en - zh tags: - decision-model - dynamic-depth - structured-output ---
[English](README.md) | 简体中文 # APUS-OpenJev-v1 **支持选择计算深度的决策模型。** [模型权重](https://huggingface.co/apus-ailab/APUS-OpenJev-v1/tree/main) · [架构介绍](ARCHITECTURE.md) · [评测数据](https://huggingface.co/datasets/apus-ailab/APUS-OpenJev-Eval-Frozen80) ## 1. 简介 **APUS-OpenJev-v1** 是一个决策模型系列,面向浏览器智能体和业务工作流。输入任务、上下文和候选动作后,模型返回带有评分的选择,供应用执行。该系列提供4B和9B版本,采用统一的决策接口。 **架构。** 同一个语言模型骨干支持多种计算预算。任务定义和候选项的含义通过自然语言输入,使同一模型能够处理不同的决策空间。应用通过附带的runtime选择`effort="low"`或`effort="high"`。 **联合后训练。** 不同计算深度下的决策学习共同进行。两条执行路径都从参考答案中学习,完整路径还通过候选概率分布为较短路径提供学习信号。这样,较早的决策出口经过任务训练,而不是直接依赖未经训练的中间表示。[架构指南](ARCHITECTURE.md)进一步介绍了这一设计及其取舍。 **面向决策的推理。** runtime对候选标签评分,再映射回应用动作。对于有界选择任务,无需逐token生成结构化答案。通过选择`effort="low"`或`effort="high"`,在计算成本与决策质量之间取得平衡。 在冻结的80题开发回归面板上,**APUS-OpenJev 9B的准确率为85.0%**,**Jev API为82.5%**。优化后的9B决策服务在下方运行快照中达到 **25.58 ms HTTP中位延迟**。85.0%对应`9B-3000`;优化延迟对应`9B-5949`。下文分别说明准确率和延迟的评测条件。  *图1. 同题决策准确率。APUS结果采用完整计算预算;Laya采用修复截断后的完整输入配置中成绩较高的一项。这是重复使用的开发面板,不是独立的最终基准测试。* ## 2. 评测结果 ### 决策质量 | 模型 | 正确数 / 总数 | 准确率 | | --- | ---: | ---: | | **APUS-OpenJev 9B** | **68 /80** | **85.00%** | | APUS-OpenJev 4B | 66 /80 | 82.50% | | Jev API | 66 /80 | 82.50% | | Laya · typed专项配置,完整输入 | 55 /80 | 68.75% | 所有模型使用同一组冻结题目及参考标签。Laya的完整输入typed专项配置在三轮运行中均得到55/80,其完整输入英语配置为54/80。重复运行证明这些题目上的结果一致性,并不增加独立证据。比Jev多答对两题是当前面板上的结果,不能据此认定具有广泛优势或统计显著优势。 ### 各任务表现  *图2:每类任务的正确题数与准确率。APUS采用完整计算预算,Laya采用完整输入的专项配置。每类16题,答对一题就改变6.25个百分点。* 4B在本面板的Browser子集上得分最高,9B的增益来自原则判断和自然语言推断。Laya修复截断后的Browser成绩为4/16。分项数据与来源哈希见[subset-chart-data.json](subset-chart-data.json)。 ### 响应延迟  | 决策接口指标 | 提供的运行快照 | | --- | ---: | | **P50延迟** | **25.58 ms** | | P95延迟 | 222.36 ms | | P99延迟 | 275.58 ms | | 成功请求 | 333 /333 | | 错误率 | 0% | 333次请求数据来自提供的运行截图。独立归档可核验的C1三轮结果为:各轮P50/P95/P99的中位数 **25.34 / 222.83 / 276.78 ms**,成功 **3,120/3,120**,硬件为RTX PRO 6000 96GB;归档不含这333次请求的精确原始明细。准确率对应80道固定题,重复请求不增加独立题数。 这是候选打分`/decide`服务的完整HTTP响应耗时,非流式首token。下方标准Chat Completions脚本走独立生成路径。图中4B本地forward、Laya本地流程与Jev公网API保留各自计时边界,不直接相除宣称模型加速倍数。[数据来源](latency-vllm-data.json)。 ### 可选 effort:准确率与延迟的实测取舍  **P95约2倍提速,准确率相对下降不到8%。** 同一4B版本、同一冻结面板上,`effort="low"`将P95模型前向延迟从 **406.30 ms降到198.32 ms**;准确率从 **82.50%降到76.25%**,下降 **6.25个百分点 / 相对7.58%**。P50从 **85.43 ms降到51.48 ms**,提速 **1.66倍**。 这组数据来自原生effort runtime,与完整深度vLLM Chat API分开记录;不能把Chat API的实测延迟除以二当作low实测。相同部署路径的low/high需另行测试。[成对测量来源](effort-tradeoff-data.json)。 ## 3. 评测集  *图4:数据子集、来源数据集及目标能力。父组用于识别相关样本;相同题量不代表难度相同,也不代表实际业务流量占比。* | 任务类型 | 题数 | 评估的决策能力 | | --- | ---: | --- | | Browser / Mind2Web | 16 | 根据静态页面状态选择动作 | | HelpSteer3 | 16 | 按给定原则检查回答 | | BoolQ | 16 | 根据证据回答二元问题 | | MNLI | 16 | 区分蕴含、中立和矛盾关系 | | Score / GoEmotions | 16 | 判断某个具体属性是否成立 | 该面板包含**来自79个父样本组的80道题**,以`validation`用途发布,已用于研发和模型选择。全部16个Score标签均为No,因此始终选择No即可在该子集取得100%;这些结果不能证明Score正例判断能力。Browser评测覆盖离线动作选择,不代表完整网站任务的完成能力。 [数据集](https://huggingface.co/datasets/apus-ailab/APUS-OpenJev-Eval-Frozen80)包含JSONL/Parquet、冻结标识、来源记录、数据结构说明及验证代码。它是独立的私有仓库,需要单独的访问权限。 ## 4. 决策编码 每个请求提供任务、支撑上下文和2–16个候选描述。runtime为当前请求分配短标签,在合法候选集合上评分,并返回选中的候选ID及相对分数。应用代码负责组装响应。候选含义可以随请求变化,无需新增一个固定业务类别的分类器。 合法输出仍可能是错误决策。候选概率不是经过校准的置信度,业务阈值需要验证。支持的请求格式见[runtime接口约定](9B-3000/RUNTIME.md)。 ## 5. 最小推理示例 本仓库集中保存一个模型系列。请选择包含完整BF16权重和参考runtime的具体子目录: | 版本 | 模型目录 | 建议用途 | | --- | --- | --- | | **9B** | `9B-3000/` | 优先关注质量的评测 | | **4B** | `4B-5949/` | 较小的参数规模 | 另一项9B研究版本列在[产物清单](bundle-manifest.json)中。请加载模型子目录,不要加载仓库根目录。 使用支持CUDA的PyTorch环境。以下示例下载指定模型目录: ```bash python -m pip install huggingface_hub hf auth login hf download apus-ailab/APUS-OpenJev-v1 \ --include "9B-3000/*" --local-dir ./APUS-OpenJev-v1 cd ./APUS-OpenJev-v1/9B-3000 python -m pip install -r requirements.txt python examples.py . --device cuda:0 --effort high ``` 使用4B时,下载`4B-5949/*`并进入该目录。预算控制由附带的runtime实现,普通Transformers加载不会自动启用。文本生成应使用`high`。详见[推理文档](9B-3000/RUNTIME.md)及[示例](9B-3000/examples.py)。 ### vLLM 部署 提供[单文件启动脚本](deployment/serve_vllm.py),从 `apus-ailab/APUS-OpenJev-v1` 下载 `9B-5949` 完整权重并启动 vLLM 0.29.0。安装、启动及 OpenAI 调用示例见[英文说明](README.md#deploy-with-vllm)。已完成公开仓库匿名下载和真实GPU验证:标准Chat API三轮共240/240次成功、无截断,P50/P95/P99为45.47/191.36/232.29 ms。短标签请求必须设置`chat_template_kwargs.enable_thinking=False`,否则16-token示例会在思考阶段截断。复用了已安装的Python环境,未验证全新系统安装。该入口提供完整深度的标准文本生成;决策网关 `/decide` 和动态深度选择使用各自的运行路径。 ## 6. 复现评测 使用固定的数据集版本`7e85bf96455a3be04c5570a4801e9531b1bc5274`,保留题目与候选顺序,记录模型版本、runtime、dtype及计算预算。参考标签不得进入模型输入。准确率和延迟应分别报告,并准确说明计时起点与终点。 发布产物记录了固定来源版本和逐文件哈希。模型文件已完成下载与核验,源模型包经过GPU检查;本系列仓库保留了相同的模型字节。后续模型卡更新不代表新增训练或评测。详细合并结果和诊断示例保留在[9B评测记录](9B-3000/merged-evaluation.json)和[4B评测记录](4B-5949/merged-evaluation.json)中。BF16合并改变了部分候选概率,因此校准与路由阈值必须重新验证。 ## 7. 许可 本次发布贡献的 APUS-OpenJev-v1 原创代码和文档采用 [MIT License](LICENSE)。衍生自 Qwen 的模型权重及继承代码保留适用的 [Apache 2.0 许可与声明](9B-3000/LICENSE);各版本的具体范围见[许可说明](LICENSE_NOTICES.md)。数据集许可单独说明。 ## 8. 引用 ```bibtex @misc{apusopenjev2026, title = {APUS-OpenJev-v1: Decision Models with Selectable Compute Depth}, author = {gumpcheng and zhangxu and {APUS AI-LAB}}, year = {2026}, url = {https://huggingface.co/apus-ailab/APUS-OpenJev-v1} } ``` ## 9. 联系 欢迎访问 [APUS 官方网站](https://www.apusai.com)或 [APUS AI Lab 的 Hugging Face 主页](https://huggingface.co/apus-ailab)。模型使用问题和反馈可在本模型仓库的 [Community 页面](https://huggingface.co/apus-ailab/APUS-OpenJev-v1/discussions)发起讨论。 **Authors:** gumpcheng ([https://huggingface.co/xDAN2099](https://huggingface.co/xDAN2099)), zhangxu, [APUS AI-LAB](https://github.com/APUS-AI-Lab)。