| model.layers.0.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.0.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.0.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.0.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.0.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.0.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.0.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.0.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.0.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.0.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.0.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.0.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.0.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.0.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.0.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.0.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.0.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=5.0938 calibrator=MaxCalibrator quant) |
| model.layers.0.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0117, 1.5000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.0.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.0.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 12.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.1.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.1.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.1.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.1.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.1.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.1.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.1.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.1.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.1.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.1.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.1.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.1.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.1.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.1.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.1.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.1.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.1.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.5000 calibrator=MaxCalibrator quant) |
| model.layers.1.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 1.5000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.1.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.1.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0015, 24.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.2.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.2.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.2.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.2.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.2.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.2.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.2.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.2.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.2.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.2.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.2.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.2.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.2.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.2.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.2.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.2.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.2.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.2500 calibrator=MaxCalibrator quant) |
| model.layers.2.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 3.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.2.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.2.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 24.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.3.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.3.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.3.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.3.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.3.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.3.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.3.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.3.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.3.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.3.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.3.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.3.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.3.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.3.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.3.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.3.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.3.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.3750 calibrator=MaxCalibrator quant) |
| model.layers.3.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 1.5000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.3.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.3.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 48.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.4.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.4.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.4.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.4.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.4.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.4.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.4.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.4.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.4.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.4.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.4.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.4.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.4.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.4.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.4.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.4.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.4.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.2812 calibrator=MaxCalibrator quant) |
| model.layers.4.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 1.5000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.4.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.4.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 48.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.5.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.5.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.5.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.5.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.5.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.5.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.5.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.5.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.5.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.5.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.5.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.5.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.5.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.5.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.5.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.5.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.5.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=4.7500 calibrator=MaxCalibrator quant) |
| model.layers.5.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 3.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.5.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.5.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 96.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.6.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.6.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.6.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.6.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.6.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.6.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.6.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.6.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.6.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.6.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.6.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.6.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.6.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.6.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.6.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.6.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.6.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=8.1875 calibrator=MaxCalibrator quant) |
| model.layers.6.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 3.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.6.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.6.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0117, 192.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.7.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.7.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.7.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.7.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.7.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.7.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.7.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.7.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.7.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.7.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.7.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.7.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.7.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.7.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.7.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.7.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.7.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=43.5000 calibrator=MaxCalibrator quant) |
| model.layers.7.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0004, 3.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.7.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.7.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 384.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.8.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.8.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.8.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.8.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.8.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.8.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.8.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.8.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.8.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.8.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.8.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.8.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.8.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.8.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.8.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.8.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.8.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=41.2500 calibrator=MaxCalibrator quant) |
| model.layers.8.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0015, 3.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.8.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.8.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0001, 96.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.9.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.9.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.9.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.9.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.9.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.9.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.9.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.9.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.9.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.9.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.9.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.9.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.9.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.9.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.9.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.9.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.9.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=35.7500 calibrator=MaxCalibrator quant) |
| model.layers.9.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0015, 1.5000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.9.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.9.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0117, 192.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.10.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.10.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.10.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.10.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.10.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.10.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.10.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.10.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.10.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.10.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.10.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.10.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.10.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.10.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.10.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.10.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.10.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=28.6250 calibrator=MaxCalibrator quant) |
| model.layers.10.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 12.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.10.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.10.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 384.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.11.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.11.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.11.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.11.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.11.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.11.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.11.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.11.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.11.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.11.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.11.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.11.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.11.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.11.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.11.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.11.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.11.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=31.0000 calibrator=MaxCalibrator quant) |
| model.layers.11.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0015, 24.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.11.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.11.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 768.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.12.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.12.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.12.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.12.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.12.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.12.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.12.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.12.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.12.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.12.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.12.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.12.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.12.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.12.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.12.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.12.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.12.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=32.7500 calibrator=MaxCalibrator quant) |
| model.layers.12.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0015, 3.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.12.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.12.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 384.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.13.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.13.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.13.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.13.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.13.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.13.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.13.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.13.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.13.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.13.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.13.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.13.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.13.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.13.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.13.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.13.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.13.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=28.2500 calibrator=MaxCalibrator quant) |
| model.layers.13.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 6.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.13.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.13.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0005, 768.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.14.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.14.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.14.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.14.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.14.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.14.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.14.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.14.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.14.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.14.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.14.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.14.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.14.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.14.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.14.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.14.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.14.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=39.0000 calibrator=MaxCalibrator quant) |
| model.layers.14.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 6.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.14.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.14.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0015, 384.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.15.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.15.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.15.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.15.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.15.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.15.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.15.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.15.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.15.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.15.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.15.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.15.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.15.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.15.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.15.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.15.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.15.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=36.0000 calibrator=MaxCalibrator quant) |
| model.layers.15.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 6.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.15.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.15.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 384.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.16.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.16.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.16.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.16.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.16.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.16.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.16.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.16.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.16.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.16.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.16.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.16.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.16.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.16.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.16.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.16.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.16.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=29.0000 calibrator=MaxCalibrator quant) |
| model.layers.16.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0015, 6.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.16.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.16.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0020, 768.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.17.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.17.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.17.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.17.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.17.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.17.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.17.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.17.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.17.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.17.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.17.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.17.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.17.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.17.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.17.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.17.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.17.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=19.2500 calibrator=MaxCalibrator quant) |
| model.layers.17.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0015, 12.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.17.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.17.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0005, 1536.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.18.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.18.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.18.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.18.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.18.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.18.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.18.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.18.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.18.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.18.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.18.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.18.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.18.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.18.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.18.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.18.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.18.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=19.1250 calibrator=MaxCalibrator quant) |
| model.layers.18.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0015, 24.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.18.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.18.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0117, 384.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.19.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.19.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.19.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.19.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.19.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.19.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.19.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.19.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.19.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.19.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.19.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.19.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.19.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.19.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.19.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.19.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.19.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=16.0000 calibrator=MaxCalibrator quant) |
| model.layers.19.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 24.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.19.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.19.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0469, 768.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.20.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.20.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.20.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.20.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.20.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.20.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.20.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.20.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.20.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.20.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.20.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.20.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.20.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.20.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.20.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.20.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.20.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=17.3750 calibrator=MaxCalibrator quant) |
| model.layers.20.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 12.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.20.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.20.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0469, 384.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.21.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.21.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.21.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.21.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.21.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.21.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.21.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.21.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.21.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.21.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.21.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.21.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.21.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.21.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.21.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.21.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.21.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=15.4375 calibrator=MaxCalibrator quant) |
| model.layers.21.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 12.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.21.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.21.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0938, 1536.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.22.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.22.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.22.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.22.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.22.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.22.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.22.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.22.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.22.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.22.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.22.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.22.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.22.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.22.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.22.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.22.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.22.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=14.3125 calibrator=MaxCalibrator quant) |
| model.layers.22.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 6.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.22.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.22.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.1875, 3072.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.23.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.23.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.23.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.23.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.23.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.23.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.23.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.23.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.23.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.23.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.23.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.23.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.23.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.23.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.23.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.23.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.23.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=18.1250 calibrator=MaxCalibrator quant) |
| model.layers.23.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 6.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.23.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.23.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.1875, 3072.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.24.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.24.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.24.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.24.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.24.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.24.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.24.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.24.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.24.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.24.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.24.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.24.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.24.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.24.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.24.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.24.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.24.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=14.5625 calibrator=MaxCalibrator quant) |
| model.layers.24.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 3.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.24.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.24.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.3750, 3072.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.25.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.25.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.25.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.25.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.25.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.25.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.25.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.25.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.25.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.25.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.25.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.25.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.25.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.25.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.25.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.25.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.25.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=20.2500 calibrator=MaxCalibrator quant) |
| model.layers.25.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 3.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.25.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.25.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0938, 6144.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.26.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.26.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.26.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.26.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.26.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.26.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.26.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.26.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.26.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.26.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.26.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.26.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.26.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.26.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.26.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.26.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.26.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=15.3750 calibrator=MaxCalibrator quant) |
| model.layers.26.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 3.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.26.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.26.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.1875, 3072.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.27.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.27.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.27.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.27.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.27.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.27.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.27.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.27.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.27.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.27.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.27.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.27.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.27.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.27.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.27.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.27.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.27.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=14.2500 calibrator=MaxCalibrator quant) |
| model.layers.27.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 3.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.27.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.27.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.3750, 3072.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.28.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.28.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.28.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.28.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.28.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.28.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.28.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.28.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.28.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.28.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.28.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.28.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.28.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.28.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.28.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.28.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.28.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=14.9375 calibrator=MaxCalibrator quant) |
| model.layers.28.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 3.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.28.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.28.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.1875, 12288.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.29.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.29.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.29.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.29.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.29.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.29.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.29.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.29.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.29.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.29.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.29.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.29.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.29.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.29.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.29.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.29.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.29.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=16.3750 calibrator=MaxCalibrator quant) |
| model.layers.29.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 3.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.29.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.29.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.3750, 6144.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.30.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.30.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.30.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.30.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.30.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.30.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.30.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.30.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.30.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.30.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.30.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.30.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.30.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.30.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.30.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.30.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.30.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=19.2500 calibrator=MaxCalibrator quant) |
| model.layers.30.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 3.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.30.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.30.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.3750, 3072.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.31.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.31.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.31.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.31.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.31.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.31.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.31.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.31.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.31.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.31.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.31.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.31.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.31.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.31.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.31.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.31.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.31.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=22.6250 calibrator=MaxCalibrator quant) |
| model.layers.31.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0059, 6.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.31.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.31.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.3750, 1536.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.32.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.32.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.32.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.32.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.32.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.32.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.32.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.32.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.32.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.32.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.32.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.32.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.32.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.32.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.32.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.32.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.32.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=25.1250 calibrator=MaxCalibrator quant) |
| model.layers.32.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0029, 3.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.32.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.32.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.3750, 6144.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.33.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.33.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.33.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.33.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.33.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.33.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.33.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.33.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.33.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.33.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.33.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.33.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.33.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.33.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.33.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.33.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.33.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=30.6250 calibrator=MaxCalibrator quant) |
| model.layers.33.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0015, 6.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.33.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.33.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.7500, 1536.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.34.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.34.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.34.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.34.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.34.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.34.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.34.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.34.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.34.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.34.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.34.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.34.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.34.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.34.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.34.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.34.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.34.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=45.5000 calibrator=MaxCalibrator quant) |
| model.layers.34.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0004, 6.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.34.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.34.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.3750, 1536.0000](66355200) calibrator=MaxCalibrator quant) |
| model.layers.35.self_attn.q_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.35.self_attn.q_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.35.self_attn.q_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.35.self_attn.k_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.35.self_attn.k_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.35.self_attn.k_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.35.self_attn.v_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.35.self_attn.v_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.35.self_attn.v_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.35.self_attn.o_proj.input_quantizer TensorQuantizer(disabled) |
| model.layers.35.self_attn.o_proj.output_quantizer TensorQuantizer(disabled) |
| model.layers.35.self_attn.o_proj.weight_quantizer TensorQuantizer(disabled) |
| model.layers.35.self_attn.q_bmm_quantizer TensorQuantizer(disabled) |
| model.layers.35.self_attn.k_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.35.self_attn.v_bmm_quantizer TensorQuantizer((4, 3) bit fake per-tensor amax=dynamic calibrator=MaxCalibrator quant) |
| model.layers.35.self_attn.softmax_quantizer TensorQuantizer(disabled) |
| model.layers.35.mlp.experts.gate_up_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=85.5000 calibrator=MaxCalibrator quant) |
| model.layers.35.mlp.experts.gate_up_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.0002, 12.0000](132710400) calibrator=MaxCalibrator quant) |
| model.layers.35.mlp.experts.down_proj_input_quantizer TensorQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'dynamic', 'scale_bits': (4, 3)}, amax=56.0000 calibrator=MaxCalibrator quant) |
| model.layers.35.mlp.experts.down_proj_weight_quantizer NVFP4StaticQuantizer((2, 1) bit fake block_sizes={-1: 16, 'type': 'static', 'scale_bits': (4, 3)}, amax=[0.3750, 3072.0000](66355200) calibrator=MaxCalibrator quant) |
| lm_head.input_quantizer TensorQuantizer(disabled) |
| lm_head.output_quantizer TensorQuantizer(disabled) |
| lm_head.weight_quantizer TensorQuantizer(disabled) |
| 723 TensorQuantizers found in model |
|
|