{ "schema_version": 1, "image_digest": "sha256:0f1cdcc8891f1cc3a444121eb61d366289a1cbba285f0892dcbb24bc94961692", "hardware": { "gpus": "2x RTX PRO 6000 Blackwell Workstation Edition 96 GB", "gpu_ids": [1, 3], "power_limit_w_each": 300 }, "kv_cache_dtype": "nvfp4_ds_mla", "profiles": [ { "name": "multimodal_dflash2_7", "vision_enabled": true, "speculator": "DFlash2-7 external draft", "max_model_len": 98304, "available_kv_cache_gib": 5.68, "gpu_kv_cache_tokens": 129473, "max_concurrency": 1.32 }, { "name": "language_only_dflash2_7", "vision_enabled": false, "speculator": "DFlash2-7 external draft", "max_model_len": 98304, "available_kv_cache_gib": 8.14, "gpu_kv_cache_tokens": 184619, "max_concurrency": 1.88 }, { "name": "language_only_mtp3", "vision_enabled": false, "speculator": "built-in MTP3", "max_model_len": 131072, "available_kv_cache_gib": 6.49, "gpu_kv_cache_tokens": 1376256, "max_concurrency": 10.50 } ], "interpretation": { "vision_off_dflash_token_gain_pct": 42.59, "mtp3_vs_dflash_language_only_token_ratio": 7.45, "note": "NVFP4 MLA physical layouts differ between the external DFlash draft and built-in MTP profile. Compare supported token capacity, not GiB alone." } }