metom-komonjo-onnx — くずし字(古文書)単字認識 Metom finetune (ONNX)
切り出した1文字画像を Unicode 文字へ分類する単字認識モデル。 SakanaAI/Metom を、東京大学史料編纂所 「電子くずし字字典データベース」由来の古文書(komonjo)単字クロップで fine-tune し ONNX 化したもの。
ベースの汎用 ONNX 版は nakamura196/metom-onnx。
本リポジトリはその 古文書ドメイン finetune 版で、出力クラスを学習データの 2,558 文字に張り替えている。
yolov11x-komonjo-char(文字検出)と組み合わせ、
検出 → 単字認識のパイプラインに用いる。
権利・ライセンス / License
⚠️ 学習データは東京大学史料編纂所「電子くずし字字典データベース」由来で、元データセットは非公開・権利留保です。 本モデル重みは
other (kuzushiji-db-derived-rights-reserved)扱いです。なお分類器の重みから元画像は復元できません。
- 非営利の学術研究・教育目的での利用(推論・評価・ファインチューニング)は、出典明記の上で可能です。
- 商用利用・重みの再配布は事前に確認してください(本リポジトリの Community タブ へ)。
- 詳細は LICENSE を参照してください。
English: Trained on data derived from the rights-reserved kuzushiji dictionary database of the Historiographical Institute, the University of Tokyo. Non-commercial academic research and educational use is permitted with attribution. For commercial use or weight redistribution, please ask first via the Community tab. See LICENSE for details.
ファイル
| ファイル | 内容 |
|---|---|
metom.onnx |
ONNX (opset 17)。入力 pixel_values [batch,3,128,128] / 出力 logits [batch,2558] |
metom-labels.json |
クラス index → 文字 の対応(2,558 文字, 例: 々 あ い う え お か が …) |
前処理: 1文字クロップを 128×128 にリサイズ、Metom の image processor 準拠で正規化
(/255 → CLIP mean/std)。argmax(logits) の index を metom-labels.json で文字に変換する。
学習・評価
- ベース:
SakanaAI/Metom(分類ヘッドを 2,558 クラスへ差し替え、全層学習)。 - データ: 電子くずし字字典データベース由来の古文書単字クロップ。fine-tune 8 epochs。
- 検証精度 (val accuracy): 0.8207(2,558 クラス, top-1, held-out val 15,922 枚)。
| モデル | クラス数 | 同一 val での accuracy |
|---|---|---|
| metom-komonjo (本モデル) | 2,558 | 0.8207 |
| SakanaAI/Metom (base, 汎用) | 2,703 | 0.4295 |
注: val は文字単位のランダム分割(同一ページの文字が train にも含まれる)のため、 本モデルの値は汎化性能としてはやや楽観的。base の値は語彙外 3.1% を不正解として含む (語彙内のみでは 0.4432)。
出典・謝辞
- 学習データ原典: 東京大学史料編纂所 電子くずし字字典データベース
- ベースモデル: SakanaAI/Metom (Apache-2.0)
Model tree for nakamura196/metom-komonjo-onnx
Base model
SakanaAI/Metom