--- library_name: peft base_model: meta-llama/Llama-3.1-8B-Instruct tags: - amr-fma - lora_sft - domain:tool_use - phase:P1 --- # amr-fma/amr-fma-Llama-3.1-8B-Instruct-lora_sft-sdpo_tooluse-p1_sft_math_tooluse-s43 amr-fma training run. - **Method**: `lora_sft` - **Base model**: `meta-llama/Llama-3.1-8B-Instruct` - **Dataset**: `lasgroup/SDPO` (slug: `sdpo_tooluse`) - **Seed**: `43` - **Git commit**: `8b979a30de6dfbf3b5a1052e42d8c0453b214d3f` - **Exp name**: `p1_sft_math_tooluse` - **WandB run**: `4l3ivdio` ## Tags - phase:P1 - domain:tool_use ## Checkpoints (branches) - step 1 → revision `step-00001` - step 3 → revision `step-00003` - step 7 → revision `step-00007` - step 14 → revision `step-00014` - step 29 → revision `step-00029` - step 57 → revision `step-00057` - step 114 → revision `step-00114` Pin a specific checkpoint with `revision=...` in `AutoModelForCausalLM.from_pretrained` / `PeftModel.from_pretrained`. ## Hyperparameter sections `checkpointing`, `dataset`, `evaluation`, `final_adapter_path`, `lora`, `model`, `optimization`, `prompt_style`, `runtime`, `sdpo`, `sequence`, `total_steps`