{ "model_name": "Qwen/Qwen3-1.7B", "init_checkpoint": "", "ref_model_name": "", "skip_first_n_prompts": 0, "dataset_name": "cais/mmlu", "mmlu_config": "all", "mmlu_split": "test", "lambda_length": 0.0, "format_penalty": -1.0, "max_steps": 250, "per_device_train_batch_size": 0, "gradient_accumulation_steps": 6, "learning_rate": 5e-05, "warmup_ratio": 0.05, "lr_scheduler_type": "constant_with_warmup", "max_grad_norm": 1.0, "bf16": true, "gradient_checkpointing": true, "num_generations": 6, "max_completion_length": 3000, "max_prompt_length": 512, "temperature": 0.6, "top_p": 0.95, "loss_type": "dr_grpo", "beta": 0.0, "num_iterations": 1, "epsilon": 0.2, "scale_rewards": "group", "lora_rank": 16, "lora_alpha": 32, "lora_dropout": 0.05, "lora_target_modules": [ "q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj" ], "use_vllm": true, "vllm_mode": "colocate", "vllm_gpu_memory_utilization": 0.2, "vllm_model_impl": "transformers", "logging_steps": 1, "log_completions": false, "report_to": "wandb", "save_steps": 50, "save_total_limit": 5, "output_dir": "./outputs", "run_name": "hint_follow_lr5e5_250steps", "seed": 42, "baseline_num_problems": 100, "baseline_generations_per_problem": 8, "wandb_project": "grpo-mmlu-hint", "lora_config": { "r": 16, "lora_alpha": 32, "lora_dropout": 0.05, "target_modules": [ "v_proj", "o_proj", "q_proj", "gate_proj", "k_proj", "down_proj", "up_proj" ], "bias": "none", "task_type": "TaskType.CAUSAL_LM" } }