Ornith-1.5-9B NF4 for onw — Lunar Lake 以降の Intel NPU 専用の軽量・高速版

日本語 | English

ornith-ai/Ornith-1.5-9B を onw(俺のNPUがこんなに動くわけない)用に変換したモデルの、重みを NF4 にした版です。通常版は ryugyosoft/Ornith-1.5-9B-onw。

Lunar Lake(Core Ultra シリーズ 2、NPU 4000)以降の NPU 専用です。 NF4 は NPU 4 以降のハードウェアでしか計算できず、Meteor Lake・Arrow Lake(NPU 3720)では動きません(onw 1.1.0 以降は、Lunar Lake 以降の PC でだけモデル一覧に出ます)。

NF4(NormalFloat4)は、4 ビットの 16 段階を正規分布の形に並べた量子化です。LLM の重みの分布に合うので、同じ 4 ビットでも元の値に近く表せます。この版は区間の重みをすべてチャネル単位の NF4(Intel が NPU 向けに推奨する形)にしました。倍率が 1 行に 1 つで済むぶん、NPU の計算が軽くなります。

Lunar Lake(NPU 4000、メモリ 16 GB) 通常版(INT4 グループ 128) この版(NF4)
生成速度 7.1〜7.2 tok/s 約 15 tok/s(MTP 先読み、約 2 倍)
プロンプト処理(約 28 トークン) 約 980 ms 約 420 ms(約 2.3 倍速い)
長いプロンプト(約 2,000 トークン) — 約 212 tok/s(64 トークン処理)
使用メモリ(読み込み・回答後のシステム全体の増分) 約 6.5 GB 約 5.4 GB(約 15% 減)
ダウンロード 5.3 GB 5.6 GB
初回起動(NPU 向けコンパイル)/2 回目以降 — 約 1 分/約 9 秒

MTP 先読みと 64 トークン処理(onw 1.4.0 以降)

この版には、元のモデルに付いている MTP 層(次の次のトークンを予想する小さな層。INT8、約 0.25 GB)と、4 トークン(下書きの確認)・64 トークン(プロンプト 処理)用のグラフが入っています。onw は MTP 層で 2 トークン先まで下書きし、本体の 4 トークン用のグラフで一度に確かめます。NPU は数トークンを 1 トークンと ほぼ同じ時間で計算できるので、下書きが当たった分だけ回答が速くなります(8 種類の質問の平均で約 1.5 倍)。温度ありの 生成でも、1 トークンずつ生成したときと同じ確率でトークンを選びます。上の表の速度はこの 2 つを使ったときのものです(onw 1.3 以前で 使うと、以前の 9.2〜9.5 tok/s のままです)。

品質

元のモデル(bf16、CPU)と教師強制で比べた結果です(日本語「日本の四季」400 トークン、思考オフ/短い日本語・英語・コード各 64 トークン)。

400 トークンの一致 上位 5 候補のロジット差(平均) 日本語/英語/コード 64 トークン
通常版 337/400 1.68 59/54/61
NF4 326/400 1.56 60/59/61

一致数はわずかに下がり、ロジットの差はわずかに小さくなりました。ほぼ同等の精度です。

使い方

  1. onw(エンジン)1.4.0 以降を入れます(それより前の版でも動きますが、MTP 先読みと 64 トークン処理は使いません)(onw の「インストール」)。
  2. onw ウィンドウの「モデル」タブで Ornith-1.5-9B (NF4) を選び、「ダウンロード」を押します(Lunar Lake 以降の PC でだけ表示されます)。
  3. 「サーバー」タブで「ロード」。あとは通常版と同じです(ツール呼び出し、思考、画像に対応)。

上級者向け:hf download ryugyosoft/Ornith-1.5-9B-nf4-onw で取得したフォルダを onw serve フォルダ で起動できます。

仕組み

区間の重みはチャネル単位の NF4(OpenVINO の nf4 型。NNCF と同じ形の Constant → Convert → Multiply)。出力層 INT8、埋め込み INT4(ホストで参照)、画像エンコーダー INT8 は通常版と同じです。構造の説明は通常版のカードと onw の技術解説 を見てください。

ライセンス

MIT(元モデルと同じ)。重みは元モデルから再量子化・再構成したものです。学習はしていません。

Downloads last month
26
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for ryugyosoft/Ornith-1.5-9B-nf4-onw

Finetuned
(37)
this model