APUS-OpenJev-v1-9B-MLX-8bit / README.zh-CN.md
gump2049's picture
Add Frozen80 per-question results
4a111c9 verified
|
Raw History Blame Contribute Delete
2.86 kB
metadata
library_name: mlx
license: apache-2.0
base_model: apus-ailab/APUS-OpenJev-v1-9B
base_model_relation: quantized
pipeline_tag: text-generation
language:
  - en
  - zh
tags:
  - apus-openjev
  - decision-model
  - mlx
  - apple-silicon

APUS-OpenJev-v1-9B-MLX-8bit

English | 中文 · 源模型 · Collection · GGUF collection · MLX collection · MLX-4bit · GGUF / Ollama

APUS-OpenJev-v1-9B 的 MLX 权重(8bit affine,group size 64),适用于 Apple Silicon Mac(mlx-lm、LM Studio)。

OpenJev 是决策模型:每个请求给出状态、指令和 2–16 个候选,模型对候选标签 A–P 打分。它不是聊天模型。

快速开始

pip install mlx-lm
hf download apus-ailab/APUS-OpenJev-v1-9B-MLX-8bit --local-dir ./openjev
python ./openjev/examples/openjev_mlx.py --model ./openjev

examples/openjev_mlx.py 使用 openjev_contracts.py(训练时的格式)渲染 prompt,返回精确的候选分布。

一致性

Frozen80 使用完全相同的 prompt token,与 HF BF16 发布版(完整深度,**68/80 · 85.00%**)对比:

Run / 运行 Backend / 后端 Frozen80 = HF BF16 Max Δp
NVIDIA RTX PRO 6000 (CUDA) mlx 0.32.2 on Linux x86_64 (Device(gpu, 0)) 69/80 · 86.25% 79/80 0.0622

在 Linux(CUDA)上用 MLX 转换并评测;MLX 文件与平台无关,可直接在 Apple Silicon 上加载(4B 的同类文件在 CUDA 与 Metal 上决策完全一致)。Frozen80 评测峰值内存 11.28 GB,建议使用统一内存不少于 16 GB 的 Mac。Frozen80 是复用的开发面板,不是盲测。逐题明细(候选概率、选择、是否正确,可按 panel_index 与 Frozen80 关联):evaluation/per-question/。

转换说明

  • mlx-lm 0.31.3 / mlx 0.32.2;8bit affine,group size 64。
  • GDN 的 A_log 和 linear_attn.norm.weight 保持源精度(35B 发布版中为 FP32)。
  • 仅完整深度、仅文本,概率未经校准。

许可

Apache-2.0,继承自源模型,见 LICENSE。基座模型:Qwen/Qwen3.5-9B。

作者: gumpcheng(xDAN2099)、zhangxu、APUS AI-LAB。