jp-gijiroku-qwen3-4b

後継版があります: 実際の60分Zoom会議で見つけた弱点(日付捏造・完了報告の決定混入・期限誤借用・話者ラベル転写・報告内コミット宿題)を標的に継続学習した jp-gijiroku-qwen3-4b-v2 を公開しました。新規利用はv2を推奨します。

日本語の会議記録から出席者・決定事項・宿題(担当/期限)・次回予定を構造化JSONで抽出する4Bモデルです。音声文字起こし由来の崩れた入力(フィラー・句読点欠落・話者ラベル喪失・同音誤変換)に強いことを狙って、DeepSeek-V4-Flashの検証済み解答軌跡で蒸留しました。判断過程を書いてから最終行にJSONを出力します。

整った議事メモの抽出には、より小さく高速な jp-minutes-extractor-1.7b で十分です。本モデルは「録音→文字起こし→抽出」パイプラインの品質枠という位置づけです。GGUF版は jp-gijiroku-qwen3-4b-GGUF、Ollamaは ollama run tokimoa/jp-gijiroku-4b で使えます。

実測(ASR劣化転写の検証セット20件・4項目すべて正解の率)

指標 1.7B(公開中) 本モデル
全項目正解 12/20 16/20
出席者 16/20 19/20
宿題(担当・期限) 16/20 19/20
決定事項の事実網羅(手書きカナリアASR版) 66.7% 83.3%
整った入力の合成val(参考) 39/50 38/50

崩れた転写では明確に上、整った入力では1.7Bと同等(速度は1.7Bが上)です。検証セットは学習と分離しています。

何をしたか

会議をプログラムで合成(正解が構成上既知・40%にwhisper風のASR劣化を注入)し、DeepSeek-V4-Flashに判断過程つきで解かせ、全フィールドが正解と機械照合できた軌跡1,584本のみを学習データにしました(採用率63.4%)。話者ラベルが消えた転写から「誰の宿題か」を推理する能力が、判断過程の学習で伸びています。

使い方

from mlx_lm import load, generate

repo = "tokimoa/jp-gijiroku-qwen3-4b"
model, tokenizer = load(repo, adapter_path=repo)  # アダプタ同梱

q = """次の議事録から出席者・決定事項・宿題(担当と期限)・次回予定を抽出してJSONで出力してください。

(ここに文字起こしテキストや議事メモ)"""
prompt = tokenizer.apply_chat_template(
    [{"role": "user", "content": q}], add_generation_prompt=True, tokenize=False)
out = generate(model, tokenizer, prompt, max_tokens=1000)
# 判断過程のあと最終行にJSONが出る → 最終行をパースする
print(out.strip().split("\n")[-1])

本文に日付が含まれない場合、dateフィールドは不定です(学習データは常に日付を含むため)。

プロンプトは上記の定型文をそのまま使ってください(学習分布の形式です)。出力スキーマ: {"date", "attendees", "decisions", "todos": [{"task","owner","due"}], "next_meeting"}

データと帰属

  • 学習データ: 合成会議(正解既知・ASR劣化込み)に対する DeepSeek-V4-Flash の検証済み解答軌跡(DeepSeek Open Platform利用規約は蒸留を明示的に許可)
  • ベース: Qwen/Qwen3-4B-Instruct-2507(Apache-2.0)の4bit MLX量子化(mlx-community)

Developed by tokimoa — データを外に出さないAI活用を支援しています

Downloads last month
445
Safetensors
Model size
0.6B params
Tensor type
BF16
·
U32
·
MLX
Hardware compatibility
Log In to add your hardware

4-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for tokimoa/jp-gijiroku-qwen3-4b

Quantized
(297)
this model