{ "model_name": "Qwen/Qwen3-0.6B", "num_heads": 4, "head_layer_indices": [ 5, 11, 16, 22 ], "quantization": "none", "hidden_size": 1024, "vocab_size": 151936, "num_hidden_layers": 28, "training_config": { "dataset_name": "wikitext", "dataset_config_name": "wikitext-2-raw-v1", "batch_size": 4, "gradient_accumulation_steps": 32, "max_steps": 500, "lr": 0.005, "max_length": 512 } }