{ "adapter_path": "adapters", "batch_size": 1, "clear_cache_threshold": 0, "config": "training/lora.yaml", "data": "data/out", "fine_tune_type": "lora", "grad_accumulation_steps": 4, "grad_checkpoint": true, "iters": 550, "learning_rate": 5e-05, "lora_parameters": { "rank": 16, "scale": 20.0, "dropout": 0.05 }, "lr_schedule": { "name": "cosine_decay", "warmup": 40, "arguments": [ 5e-05, 650, 5e-06 ] }, "mask_prompt": true, "max_seq_length": 2048, "model": "mlx-community/Qwen3-4B-Instruct-2507-4bit", "num_layers": 16, "optimizer": "adamw", "optimizer_config": { "adam": {}, "adamw": {}, "muon": {}, "sgd": {}, "adafactor": {} }, "project_name": null, "report_to": null, "resume_adapter_file": "adapters/0000100_adapters.safetensors", "save_every": 100, "seed": 7, "steps_per_eval": 100, "steps_per_report": 20, "test": false, "test_batches": 500, "train": true, "val_batches": 25 }