test_stage1_tulu5k

Qwen3-4B-Base に対する 1 段階目の SFT で得た LoRA adapter。内部検証用であり、成果物としての公開を目的としたものではない。

概要

項目
ベースモデル Qwen/Qwen3-4B-Base
手法 LoRA (r=16, alpha=32, dropout=0.05)
対象モジュール q/k/v/o_proj, gate/up/down_proj (all-linear)
学習データ 一般的な指示追従データ 5,500 件 (Tulu 3 PersonaIF 5,000 + OASST 500)
エポック数 1
seed 42
学習時間 約 16.5 分 (A100)
最終 loss 1.089

用途

Base モデルは chat template を持たないため、この adapter は指示追従の形式を獲得させる役割を持つ。数学データは含まれておらず、数学能力そのものの向上を狙ったものではない。

2 段階目の SFT を行う際の出発点として利用する。

使い方

from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer

base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-4B-Base", torch_dtype="float16")
model = PeftModel.from_pretrained(base, "u-10bei/test_stage1_tulu5k")
tokenizer = AutoTokenizer.from_pretrained("u-10bei/test_stage1_tulu5k")

chat template は tokenizer 側に埋め込み済み (Qwen/Qwen3-4B-Instruct-2507 由来)。

Downloads last month
17
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for u-10bei/test_stage1_tulu5k

Adapter
(88)
this model