Qwen3.5-9B τ²-bench SFT LoRA

PEFT adapter only — base weights stay on Qwen/Qwen3.5-9B.

Field Value
TRAIN_MODE exp
LoRA rank 32
W&B https://wandb.ai/alchemxz/decagon-posttraining-sft/runs/bsmjocsv

vLLM (no merge upload)

vllm serve Qwen/Qwen3.5-9B --enable-lora --lora-modules sft=lilyzhng/qwen3.5-9b-tau2-retail-sft-lora \
  --max-lora-rank 32 --dtype bfloat16
Downloads last month
5
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for lilyzhng/qwen3.5-9b-tau2-retail-sft-lora

Finetuned
Qwen/Qwen3.5-9B
Adapter
(607)
this model