Instructions to use tkwiecinski/amr-fma-Mistral-7B-Instruct-v0.3-lora_sdpo-sdpo_tooluse-tooluse_baseline-s42 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use tkwiecinski/amr-fma-Mistral-7B-Instruct-v0.3-lora_sdpo-sdpo_tooluse-tooluse_baseline-s42 with PEFT:
Task type is invalid.
- Notebooks
- Google Colab
- Kaggle
| method: lora_sdpo | |
| base_model_id: mistralai/Mistral-7B-Instruct-v0.3 | |
| seed: 42 | |
| exp_name: tooluse_baseline | |
| git_commit: 8b979a30de6dfbf3b5a1052e42d8c0453b214d3f | |
| dataset: lasgroup/SDPO | |
| dataset_slug: sdpo_tooluse | |
| manifest_path: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/manifest.yaml | |
| tags: | |
| phase: P1 | |
| domain: tool_use | |
| hyperparams: | |
| model: | |
| base_model_id: mistralai/Mistral-7B-Instruct-v0.3 | |
| model_family: mistral | |
| target_modules: | |
| - q_proj | |
| - k_proj | |
| - v_proj | |
| - o_proj | |
| - gate_proj | |
| - up_proj | |
| - down_proj | |
| dataset: | |
| name: lasgroup/SDPO | |
| split: train | |
| text_field: prompt | |
| max_samples: 50 | |
| eval_samples: 256 | |
| config: null | |
| domain: tool_use | |
| slug: sdpo_tooluse | |
| format: tooluse | |
| min_level: null | |
| sequence: | |
| max_length: 2048 | |
| packing: true | |
| lora: | |
| r: 16 | |
| alpha: 32 | |
| dropout: 0.05 | |
| target_modules: | |
| - q_proj | |
| - k_proj | |
| - v_proj | |
| - o_proj | |
| - gate_proj | |
| - up_proj | |
| - down_proj | |
| optimization: | |
| num_train_epochs: 1 | |
| per_device_batch_size: 1 | |
| gradient_accumulation_steps: 2 | |
| learning_rate: 5.0e-05 | |
| warmup_ratio: 0.0 | |
| weight_decay: 0.0 | |
| lr_scheduler_type: cosine | |
| max_grad_norm: 1.0 | |
| checkpointing: | |
| num_checkpoints: 8 | |
| save_total_limit: 64 | |
| schedule: log | |
| save_steps: null | |
| runtime: | |
| logging_steps: 20 | |
| bf16: true | |
| gradient_checkpointing: true | |
| wandb: true | |
| wandb_project: amr-fma-train | |
| hf_push: true | |
| hf_org: tkwiecinski | |
| hf_visibility: public | |
| force_restart: false | |
| sdpo: | |
| reward: tooluse_match | |
| num_generations: 4 | |
| generation_batch_size: 32 | |
| steps_per_generation: null | |
| max_prompt_length: 2048 | |
| max_completion_length: 1024 | |
| max_reprompt_len: 10240 | |
| distillation_alpha: 1.0 | |
| distillation_topk: null | |
| distillation_weight: 1.0 | |
| distillation_is_clip: 2.0 | |
| full_logit_distillation: false | |
| policy_loss_mode: distillation_only | |
| teacher_regularization: ema | |
| teacher_update_rate: null | |
| success_reward_threshold: 1.0 | |
| use_successful_as_teacher: true | |
| include_environment_feedback: false | |
| feedback_column: null | |
| beta: 0.0 | |
| epsilon: 0.2 | |
| scale_rewards: group | |
| mask_truncated_completions: true | |
| dump_rollouts: true | |
| temperature: 1.3 | |
| evaluation: | |
| enabled: false | |
| eval_steps: null | |
| strategy: null | |
| prompt_style: | |
| system_prompt: null | |
| style: none | |
| final_adapter_path: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/adapter_final | |
| total_steps: 80 | |
| checkpoints: | |
| - step: 1 | |
| dir: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/checkpoint-1 | |
| artifact: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/checkpoint-1 | |
| metadata: | |
| source: trainer_on_save | |
| metrics: | |
| eval_loss: -0.110709 | |
| eval_runtime: 357.3819 | |
| eval_samples_per_second: 0.028 | |
| eval_steps_per_second: 0.008 | |
| eval_perplexity: 0.895199 | |
| hf_revision: step-00001 | |
| hf_commit: e2f3cdfd0dc7c5eaef1b6e32eeba8ce0f2738a13 | |
| - step: 3 | |
| dir: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/checkpoint-3 | |
| artifact: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/checkpoint-3 | |
| metadata: | |
| source: trainer_on_save | |
| metrics: | |
| eval_loss: -0.182218 | |
| eval_runtime: 129.1822 | |
| eval_samples_per_second: 0.077 | |
| eval_steps_per_second: 0.023 | |
| eval_perplexity: 0.83342 | |
| hf_revision: step-00003 | |
| hf_commit: 14ada0c42e7468a240dd9c465f092df6049c9f1f | |
| - step: 6 | |
| dir: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/checkpoint-6 | |
| artifact: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/checkpoint-6 | |
| metadata: | |
| source: trainer_on_save | |
| metrics: | |
| eval_loss: -0.201897 | |
| eval_runtime: 168.0925 | |
| eval_samples_per_second: 0.059 | |
| eval_steps_per_second: 0.018 | |
| eval_perplexity: 0.817179 | |
| hf_revision: step-00006 | |
| hf_commit: e1de10c2b970b009c1c4ff5a24e73295a881e8e1 | |
| - step: 12 | |
| dir: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/checkpoint-12 | |
| artifact: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/checkpoint-12 | |
| metadata: | |
| source: trainer_on_save | |
| metrics: | |
| eval_loss: -0.213826 | |
| eval_runtime: 194.3596 | |
| eval_samples_per_second: 0.051 | |
| eval_steps_per_second: 0.015 | |
| eval_perplexity: 0.807489 | |
| hf_revision: step-00012 | |
| hf_commit: aa4049dcc138e67c77db5635e3e48d95f8659e2c | |
| - step: 22 | |
| dir: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/checkpoint-22 | |
| artifact: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/checkpoint-22 | |
| metadata: | |
| source: trainer_on_save | |
| metrics: | |
| eval_loss: -0.185596 | |
| eval_runtime: 160.5654 | |
| eval_samples_per_second: 0.062 | |
| eval_steps_per_second: 0.019 | |
| eval_perplexity: 0.830609 | |
| hf_revision: step-00022 | |
| hf_commit: a7d4b112d07005296fcb168cd62429d8895b417d | |
| - step: 42 | |
| dir: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/checkpoint-42 | |
| artifact: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/checkpoint-42 | |
| metadata: | |
| source: trainer_on_save | |
| metrics: | |
| eval_loss: -0.143644 | |
| eval_runtime: 126.8726 | |
| eval_samples_per_second: 0.079 | |
| eval_steps_per_second: 0.024 | |
| eval_perplexity: 0.866196 | |
| hf_revision: step-00042 | |
| hf_commit: 3b69c61dd752549a688bd3314bccb5a0d61bf43e | |
| - step: 79 | |
| dir: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/checkpoint-79 | |
| artifact: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/checkpoint-79 | |
| metadata: | |
| source: trainer_on_save | |
| metrics: | |
| eval_loss: -0.102835 | |
| eval_runtime: 180.9068 | |
| eval_samples_per_second: 0.055 | |
| eval_steps_per_second: 0.017 | |
| eval_perplexity: 0.902275 | |
| hf_revision: step-00079 | |
| hf_commit: d00134a32d6216850e2e8998d26f23c1aadcee32 | |
| - step: 80 | |
| dir: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/checkpoint-80 | |
| artifact: /capstor/scratch/cscs/tkwiecinski/amr-fma/train/Mistral-7B-Instruct-v0.3/lora_sdpo/sdpo_tooluse/tooluse_baseline__s42/checkpoint-80 | |
| metadata: | |
| source: trainer_on_save | |
| metrics: | |
| eval_loss: -0.098016 | |
| eval_runtime: 143.2853 | |
| eval_samples_per_second: 0.07 | |
| eval_steps_per_second: 0.021 | |
| eval_perplexity: 0.906635 | |
| hf_revision: step-00080 | |
| hf_commit: 40d40918461f82a7ac828cf0438ecd437e626de5 | |
| wandb_run_id: 9pmpx1of | |
| wandb_eval_run_ids: {} | |
| hf_repo_id: tkwiecinski/amr-fma-Mistral-7B-Instruct-v0.3-lora_sdpo-sdpo_tooluse-tooluse_baseline-s42 | |