{ "base_model": "/Qwen3-8B", "task": "magicoder", "peft_method": "lora", "output_dir": "/magicoder", "dataset_path": "/magicoder-train.parquet", "train_profile": "none", "force_max_steps": false, "max_steps": null, "num_train_epochs": 1.0, "stop_at_step": null, "stop_at_epoch": null, "resume_from_checkpoint": null, "per_device_train_batch_size": 16, "gradient_accumulation_steps": 2, "global_train_batch_size": 32, "lr": 2e-05, "warmup_ratio": 0.05, "weight_decay": 0.0, "min_lr_ratio": null, "lr_scheduler_type": "cosine", "adam_beta1": 0.9, "adam_beta2": 0.999, "grad_clip": 1.0, "max_seq_len": 4096, "seed": 44, "save_strategy": "epoch", "save_steps": 500, "save_total_limit": 1, "logging_steps": 25, "max_train_samples": 50000, "dataset_seed": 42, "bf16": true, "fp16": false, "gradient_checkpointing": true, "group_by_length": false, "pad_to_multiple_of": 8, "dataloader_num_workers": 0, "optim": null, "use_qlora": false, "sft_format": "chat", "chat_template_mode": "non_thinking", "target_modules": "all", "r": 16, "lora_alpha": 32, "lora_dropout": 0.05, "pissa_init_mode": "pissa", "init_r": 32, "target_r": 16, "loraplus_lr_ratio": 20.0, "loraplus_lr_embedding": null }