BathysRDT-722M の重みへのアクセス申請 / Request access to the BathysRDT-722M weights

申請は1件ずつ確認して承認します。数日かかることがあります。/ Requests are reviewed individually. This may take a few days.

本モデルの重みは BathysRDT Research License Version 1.0 で提供されます。 非営利の研究・教育目的に限り利用できます。原重み(学習なしで変換したものを含む)の再配布はできません。 特許その他の産業財産権についてのライセンスは許諾されません。商用利用には別途の書面契約が必要です。 The weights are provided under the BathysRDT Research License Version 1.0, for non-commercial research and educational purposes only. Redistribution of the original weights (including conversions without training) is not permitted. No patent license is granted. Commercial use requires a separate written agreement. License: https://github.com/nakatada2503-lab/BathysRDT-722M/blob/main/LICENSE

Log in or Sign Up to review the conditions and access this model content.

BathysRDT-722M

BathysRDT-722M は、重みを共有した再帰ブロックを深さ方向に繰り返し適用する Transformer(recurrent-depth Transformer)の 722M パラメータ版です。日本語テキストで、大規模な教師モデルからの知識蒸留により事前学習しました。

本モデルは研究用の成果物です。 結果の再現と検証のために公開しています。実用的な文章生成の品質は想定していません。

BathysRDT-722M is a 722M-parameter recurrent-depth Transformer (a weight-shared block applied repeatedly along depth), pre-trained on Japanese text by knowledge distillation. This model is a research artifact, released for reproducibility. It is not intended for practical text generation.

  • 推論コード・推論設定 / Inference code and settings: https://github.com/nakatada2503-lab/BathysRDT-722M
  • 論文 / Paper: 中村忠行「精度差分観測による重み共有再帰Transformerの学習ダイナミクス解明: Gate Decay振幅制御、FP32崩壊境界、および多制御器協調学習」Jxiv, 2026. DOI: 10.51094/jxiv.6476

重みの入手 / Access

重みの取得は申請・承認制です。このページでライセンスに同意して申請してください。非営利の研究・教育目的に限ります。商用利用はできません。

Access to the weights requires a request and approval. Agree to the License on this page and submit a request. Non-commercial research and educational use only. Commercial use is not permitted.

Files

Checkpoint Training tokens Parameters dtype File Size (bytes) SHA-256
700M 700,006,400 721,631,233 bfloat16 700M/model.safetensors 1,443,273,890 b82b27ce3962c819a8f6d668e15fbc4237e880ec454a87b41b04cd3567ef6a66
1400M 1,400,012,800 721,631,233 bfloat16 1400M/model.safetensors 1,443,273,890 0e763df83d6173e6d0ceed05b61a572b3db8ad70873ab838b57a3a83cff57b3d
  • 各チェックポイントのフォルダに model.safetensors と config.json があります。
  • 重みファイルには 116 テンソルが入っています。出力層(head.weight)は埋め込み(embed.weight)と共有(tie)しており、推論コードが読み込み時に復元します。
  • SHA-256 は、公開時点のモデルファイルとの同一性を確認するための識別子です(SHA256SUMS)。
  • このモデルは transformers の from_pretrained では読み込めません。GitHub の推論コードを使ってください。

Usage

git clone https://github.com/nakatada2503-lab/BathysRDT-722M
cd BathysRDT-722M

python3 inference/bathysrdt_722m_infer_v111_20261002_0525.py \
    --weights <download_dir>/1400M/model.safetensors \
    --config <download_dir>/1400M/config.json \
    --settings configs/infer_settings_722m_public_v110.json \
    --tag 1400M \
    --text "日本の首都は" \
    --generate 32

推論には bfloat16 と CUDA の autocast を使います(推論設定どおり)。評価値を再現するには、推論設定を変更しないでください。

Validation

公開した2つのチェックポイントを、同じ評価条件で測定しました。

  • 評価データ: 検証用に分けた日本語テキスト 50 系列 × 512 トークン
  • 条件: GitHub の推論設定、seed 0・1・2 の平均。seed による差は 0.002 以下でした
  • CE: 正解トークンに対する交差エントロピー(nats/token)。KL: 教師モデルの出力分布に対する KL ダイバージェンス
Checkpoint Depth CE KL
700M 11(公開推論設定) 9.640 4.764
1400M 11(公開推論設定) 10.151 4.684
  • 公開推論設定(depth=11)では、CE と KL で異なる傾向が観測されました(CE は 700M、KL は 1400M が低い値)。
  • 深さ1では、1400M の CE が 700M より 0.147 低い値でした(標準誤差 0.011、50 系列中 49 系列で低い)。
  • これらはチェックポイント間の特性の違いを示す測定結果であり、単一の指標による総合的な優劣を示すものではありません。

At the released setting (depth 11), CE is lower for 700M and KL is lower for 1400M. At depth 1, the CE of 1400M is 0.147 lower than that of 700M (SE 0.011; lower in 49 of 50 sequences). These are measurements of differences between checkpoints, not an overall ranking.

Tokenizer

llm-jp/llm-jp-4-32b-a3b-base のトークナイザー(語彙 196,608、Apache-2.0)を使います。リビジョンと語彙のハッシュは推論設定に記載しています。トークナイザーは同梱していません。

Training data and teacher

  • 教師モデル: llm-jp/llm-jp-4-32b-a3b-base(Apache-2.0)
  • 学習データ: CulturaX(日本語)。CulturaX の利用条件は mC4 と OSCAR の条件に従います。mC4 は ODC-BY で、Common Crawl の利用規約にも従います。OSCAR は、テキストそのものの権利を OSCAR 側が持たない旨を明記しています。
  • CulturaX の利用条件を、このモデルの重みのライセンスとして読み替えることはしません。
  • 学習コード、学習時の制御器と制御状態、optimizer、学習 checkpoint 全体は公開していません。

Limitations

  • 研究用の成果物であり、出力には誤りや不適切な内容が含まれることがあります。
  • 学習データは Web から収集されたテキストに由来します。個人情報や偏りを含む可能性があります。

License

コード・文書とモデルの重みは、BathysRDT Research License Version 1.0(LICENSE、日本語が正文。英語の参考訳)で提供します。

  • 非営利の研究・教育目的に限り利用できます(所属ではなく、利用行為の目的で判断します)。商用利用はできません。
  • 原重みの再配布はできません。追加学習した派生重みは、同じライセンスで公開できます。
  • 特許その他の産業財産権についてのライセンスは許諾しません。
  • 商用利用には別途の書面契約が必要です。

Patents

本モデルに関係する技術について、日本で特許出願をしています(特願2026-201413 ほか)。本リポジトリおよび BathysRDT Research License は、これらの特許出願・特許についてのいかなる権利も許諾するものではありません(LICENSE 第5条)。

Patent applications related to this model have been filed in Japan (including JP 2026-201413). Neither this repository nor the BathysRDT Research License grants any rights under these applications or any resulting patents (see LICENSE, Section 5).

Contact

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support