Download fp8_quantization_report.json from Model-SafeTensors/mini-glm-5.2-fp8: direct link, hf CLI and curl.
- Browser
- Download file 17.4 kB
-
https://huggingface.co/Model-SafeTensors/mini-glm-5.2-fp8/resolve/1c8e963a15b76002265a857fd263d848b47fc5c0/fp8_quantization_report.json
- Command line
-
hf download hf://Model-SafeTensors/mini-glm-5.2-fp8@1c8e963a15b76002265a857fd263d848b47fc5c0/fp8_quantization_report.json
-
curl -L -o fp8_quantization_report.json https://huggingface.co/Model-SafeTensors/mini-glm-5.2-fp8/resolve/1c8e963a15b76002265a857fd263d848b47fc5c0/fp8_quantization_report.json
17.4 kB
| { | |
| "block_size": [ | |
| 128, | |
| 128 | |
| ], | |
| "fp8_dtype": "torch.float8_e4m3fn", | |
| "fp8_max": 448.0, | |
| "modules_to_not_convert": [ | |
| "lm_head", | |
| "model.embed_tokens", | |
| "model.layers.0.input_layernorm", | |
| "model.layers.0.post_attention_layernorm", | |
| "model.layers.0.self_attn.indexer.k_norm", | |
| "model.layers.0.self_attn.indexer.weights_proj", | |
| "model.layers.0.self_attn.kv_a_layernorm", | |
| "model.layers.0.self_attn.q_a_layernorm", | |
| "model.layers.1.input_layernorm", | |
| "model.layers.1.post_attention_layernorm", | |
| "model.layers.1.self_attn.indexer.k_norm", | |
| "model.layers.1.self_attn.indexer.weights_proj", | |
| "model.layers.1.self_attn.kv_a_layernorm", | |
| "model.layers.1.self_attn.q_a_layernorm", | |
| "model.layers.10.input_layernorm", | |
| "model.layers.10.mlp.gate", | |
| "model.layers.10.post_attention_layernorm", | |
| "model.layers.10.self_attn.indexer.k_norm", | |
| "model.layers.10.self_attn.indexer.weights_proj", | |
| "model.layers.10.self_attn.kv_a_layernorm", | |
| "model.layers.10.self_attn.q_a_layernorm", | |
| "model.layers.11.input_layernorm", | |
| "model.layers.11.mlp.gate", | |
| "model.layers.11.post_attention_layernorm", | |
| "model.layers.11.self_attn.indexer.k_norm", | |
| "model.layers.11.self_attn.indexer.weights_proj", | |
| "model.layers.11.self_attn.kv_a_layernorm", | |
| "model.layers.11.self_attn.q_a_layernorm", | |
| "model.layers.12.input_layernorm", | |
| "model.layers.12.mlp.gate", | |
| "model.layers.12.post_attention_layernorm", | |
| "model.layers.12.self_attn.indexer.k_norm", | |
| "model.layers.12.self_attn.indexer.weights_proj", | |
| "model.layers.12.self_attn.kv_a_layernorm", | |
| "model.layers.12.self_attn.q_a_layernorm", | |
| "model.layers.13.input_layernorm", | |
| "model.layers.13.mlp.gate", | |
| "model.layers.13.post_attention_layernorm", | |
| "model.layers.13.self_attn.indexer.k_norm", | |
| "model.layers.13.self_attn.indexer.weights_proj", | |
| "model.layers.13.self_attn.kv_a_layernorm", | |
| "model.layers.13.self_attn.q_a_layernorm", | |
| "model.layers.14.eh_proj", | |
| "model.layers.14.enorm", | |
| "model.layers.14.hnorm", | |
| "model.layers.14.input_layernorm", | |
| "model.layers.14.mlp.gate", | |
| "model.layers.14.post_attention_layernorm", | |
| "model.layers.14.self_attn.indexer.k_norm", | |
| "model.layers.14.self_attn.indexer.weights_proj", | |
| "model.layers.14.self_attn.kv_a_layernorm", | |
| "model.layers.14.self_attn.q_a_layernorm", | |
| "model.layers.14.shared_head.norm", | |
| "model.layers.2.input_layernorm", | |
| "model.layers.2.mlp.gate", | |
| "model.layers.2.post_attention_layernorm", | |
| "model.layers.2.self_attn.indexer.k_norm", | |
| "model.layers.2.self_attn.indexer.weights_proj", | |
| "model.layers.2.self_attn.kv_a_layernorm", | |
| "model.layers.2.self_attn.q_a_layernorm", | |
| "model.layers.3.input_layernorm", | |
| "model.layers.3.mlp.gate", | |
| "model.layers.3.post_attention_layernorm", | |
| "model.layers.3.self_attn.indexer.k_norm", | |
| "model.layers.3.self_attn.indexer.weights_proj", | |
| "model.layers.3.self_attn.kv_a_layernorm", | |
| "model.layers.3.self_attn.q_a_layernorm", | |
| "model.layers.4.input_layernorm", | |
| "model.layers.4.mlp.gate", | |
| "model.layers.4.post_attention_layernorm", | |
| "model.layers.4.self_attn.indexer.k_norm", | |
| "model.layers.4.self_attn.indexer.weights_proj", | |
| "model.layers.4.self_attn.kv_a_layernorm", | |
| "model.layers.4.self_attn.q_a_layernorm", | |
| "model.layers.5.input_layernorm", | |
| "model.layers.5.mlp.gate", | |
| "model.layers.5.post_attention_layernorm", | |
| "model.layers.5.self_attn.indexer.k_norm", | |
| "model.layers.5.self_attn.indexer.weights_proj", | |
| "model.layers.5.self_attn.kv_a_layernorm", | |
| "model.layers.5.self_attn.q_a_layernorm", | |
| "model.layers.6.input_layernorm", | |
| "model.layers.6.mlp.gate", | |
| "model.layers.6.post_attention_layernorm", | |
| "model.layers.6.self_attn.indexer.k_norm", | |
| "model.layers.6.self_attn.indexer.weights_proj", | |
| "model.layers.6.self_attn.kv_a_layernorm", | |
| "model.layers.6.self_attn.q_a_layernorm", | |
| "model.layers.7.input_layernorm", | |
| "model.layers.7.mlp.gate", | |
| "model.layers.7.post_attention_layernorm", | |
| "model.layers.7.self_attn.indexer.k_norm", | |
| "model.layers.7.self_attn.indexer.weights_proj", | |
| "model.layers.7.self_attn.kv_a_layernorm", | |
| "model.layers.7.self_attn.q_a_layernorm", | |
| "model.layers.8.input_layernorm", | |
| "model.layers.8.mlp.gate", | |
| "model.layers.8.post_attention_layernorm", | |
| "model.layers.8.self_attn.indexer.k_norm", | |
| "model.layers.8.self_attn.indexer.weights_proj", | |
| "model.layers.8.self_attn.kv_a_layernorm", | |
| "model.layers.8.self_attn.q_a_layernorm", | |
| "model.layers.9.input_layernorm", | |
| "model.layers.9.mlp.gate", | |
| "model.layers.9.post_attention_layernorm", | |
| "model.layers.9.self_attn.indexer.k_norm", | |
| "model.layers.9.self_attn.indexer.weights_proj", | |
| "model.layers.9.self_attn.kv_a_layernorm", | |
| "model.layers.9.self_attn.q_a_layernorm", | |
| "model.norm" | |
| ], | |
| "modules_to_not_convert_count": 110, | |
| "output": "/root/inference-v2/mini-glm-5.2/v1c-upscale/checkpoints/v1b-mtp-active-decoder-serveddata-align-1k-full-original-dims-tiled-sglang-fp8", | |
| "output_tensor_bytes": 133220606848, | |
| "preserved_tensors": 138, | |
| "quantized_tensors": 10134, | |
| "scale_tensors": 10134, | |
| "shards": [ | |
| { | |
| "preserved": 8, | |
| "quantized": 6, | |
| "scale_tensors": 6, | |
| "shard": "model-00001-of-00057.safetensors", | |
| "tensor_bytes": 4046015104 | |
| }, | |
| { | |
| "preserved": 20, | |
| "quantized": 125, | |
| "scale_tensors": 125, | |
| "shard": "model-00002-of-00057.safetensors", | |
| "tensor_bytes": 2149413376 | |
| }, | |
| { | |
| "preserved": 16, | |
| "quantized": 153, | |
| "scale_tensors": 153, | |
| "shard": "model-00003-of-00057.safetensors", | |
| "tensor_bytes": 2141656640 | |
| }, | |
| { | |
| "preserved": 18, | |
| "quantized": 145, | |
| "scale_tensors": 145, | |
| "shard": "model-00004-of-00057.safetensors", | |
| "tensor_bytes": 2140887360 | |
| }, | |
| { | |
| "preserved": 19, | |
| "quantized": 152, | |
| "scale_tensors": 152, | |
| "shard": "model-00005-of-00057.safetensors", | |
| "tensor_bytes": 2104293376 | |
| }, | |
| { | |
| "preserved": 44, | |
| "quantized": 158, | |
| "scale_tensors": 158, | |
| "shard": "model-00006-of-00057.safetensors", | |
| "tensor_bytes": 2152283904 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00007-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00008-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00009-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00010-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00011-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00012-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00013-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00014-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00015-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00016-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00017-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00018-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00019-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00020-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00021-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00022-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00023-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00024-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00025-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00026-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00027-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00028-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00029-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00030-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00031-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00032-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00033-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00034-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00035-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00036-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00037-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00038-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00039-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00040-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00041-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00042-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00043-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00044-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00045-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00046-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00047-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00048-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00049-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00050-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00051-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00052-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00053-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00054-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00055-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 170, | |
| "scale_tensors": 170, | |
| "shard": "model-00056-of-00057.safetensors", | |
| "tensor_bytes": 2139617280 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 117, | |
| "scale_tensors": 117, | |
| "shard": "model-00057-of-00057.safetensors", | |
| "tensor_bytes": 1472560128 | |
| }, | |
| { | |
| "preserved": 11, | |
| "quantized": 55, | |
| "scale_tensors": 55, | |
| "shard": "model-00058-of-00070.safetensors", | |
| "tensor_bytes": 823871616 | |
| }, | |
| { | |
| "preserved": 2, | |
| "quantized": 55, | |
| "scale_tensors": 55, | |
| "shard": "model-00059-of-00070.safetensors", | |
| "tensor_bytes": 801324032 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 64, | |
| "scale_tensors": 64, | |
| "shard": "model-00060-of-00070.safetensors", | |
| "tensor_bytes": 805502976 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 64, | |
| "scale_tensors": 64, | |
| "shard": "model-00061-of-00070.safetensors", | |
| "tensor_bytes": 805502976 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 64, | |
| "scale_tensors": 64, | |
| "shard": "model-00062-of-00070.safetensors", | |
| "tensor_bytes": 805502976 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 64, | |
| "scale_tensors": 64, | |
| "shard": "model-00063-of-00070.safetensors", | |
| "tensor_bytes": 805502976 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 64, | |
| "scale_tensors": 64, | |
| "shard": "model-00064-of-00070.safetensors", | |
| "tensor_bytes": 805502976 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 64, | |
| "scale_tensors": 64, | |
| "shard": "model-00065-of-00070.safetensors", | |
| "tensor_bytes": 805502976 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 64, | |
| "scale_tensors": 64, | |
| "shard": "model-00066-of-00070.safetensors", | |
| "tensor_bytes": 805502976 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 64, | |
| "scale_tensors": 64, | |
| "shard": "model-00067-of-00070.safetensors", | |
| "tensor_bytes": 805502976 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 64, | |
| "scale_tensors": 64, | |
| "shard": "model-00068-of-00070.safetensors", | |
| "tensor_bytes": 805502976 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 64, | |
| "scale_tensors": 64, | |
| "shard": "model-00069-of-00070.safetensors", | |
| "tensor_bytes": 805502976 | |
| }, | |
| { | |
| "preserved": 0, | |
| "quantized": 28, | |
| "scale_tensors": 28, | |
| "shard": "model-00070-of-00070.safetensors", | |
| "tensor_bytes": 352407552 | |
| } | |
| ], | |
| "source": "/root/inference-v2/mini-glm-5.2/v1c-upscale/checkpoints/v1b-mtp-active-decoder-serveddata-align-1k-full-original-dims-tiled-sglang", | |
| "weight_map_keys": 20406 | |
| } | |