{ "quantization": { "exclude_modules": [ "lm_head", "model.embed_tokens", "lm_head" ], "kv_cache_quant_algo": null, "quant_algo": "NVFP4", "group_size": 16 } }