{ "group_size": 64, "mode": "affine", "device": { "device_name": "Apple M4 Max", "max_recommended_working_set_size": 115448725504, "memory_size": 137438953472, "architecture": "applegpu_g16s", "max_buffer_length": 86586540032, "resource_limit": 499000 }, "results": [ { "component": "transformer", "tensor": "transformer_blocks.0.attn.to_q.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 4, "weight_relative_rmse": 0.09608591347932816, "synthetic_matmul_relative_rmse": 0.09557931870222092, "matmul_ms": 0.5911250016652048 }, { "component": "transformer", "tensor": "transformer_blocks.0.attn.to_q.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 6, "weight_relative_rmse": 0.02344648726284504, "synthetic_matmul_relative_rmse": 0.023693682625889778, "matmul_ms": 0.4109000088647008 }, { "component": "transformer", "tensor": "transformer_blocks.0.attn.to_q.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 8, "weight_relative_rmse": 0.007525453343987465, "synthetic_matmul_relative_rmse": 0.008602947928011417, "matmul_ms": 0.4843916976824403 }, { "component": "transformer", "tensor": "transformer_blocks.0.img_mlp.out.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 4, "weight_relative_rmse": 0.09441296756267548, "synthetic_matmul_relative_rmse": 0.09449099004268646, "matmul_ms": 0.4845582996495068 }, { "component": "transformer", "tensor": "transformer_blocks.0.img_mlp.out.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 6, "weight_relative_rmse": 0.02303435653448105, "synthetic_matmul_relative_rmse": 0.02340426668524742, "matmul_ms": 0.46681660460308194 }, { "component": "transformer", "tensor": "transformer_blocks.0.img_mlp.out.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 8, "weight_relative_rmse": 0.007468077354133129, "synthetic_matmul_relative_rmse": 0.008637943305075169, "matmul_ms": 0.36163330078125 }, { "component": "transformer", "tensor": "transformer_blocks.15.attn.to_q.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 4, "weight_relative_rmse": 0.09535665810108185, "synthetic_matmul_relative_rmse": 0.09527087211608887, "matmul_ms": 0.57477499358356 }, { "component": "transformer", "tensor": "transformer_blocks.15.attn.to_q.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 6, "weight_relative_rmse": 0.02322564087808132, "synthetic_matmul_relative_rmse": 0.023668956011533737, "matmul_ms": 0.4584625014103949 }, { "component": "transformer", "tensor": "transformer_blocks.15.attn.to_q.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 8, "weight_relative_rmse": 0.0074961441569030285, "synthetic_matmul_relative_rmse": 0.008681540377438068, "matmul_ms": 0.533016596455127 }, { "component": "transformer", "tensor": "transformer_blocks.15.img_mlp.out.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 4, "weight_relative_rmse": 0.09448622912168503, "synthetic_matmul_relative_rmse": 0.09489456564188004, "matmul_ms": 0.9572708979249 }, { "component": "transformer", "tensor": "transformer_blocks.15.img_mlp.out.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 6, "weight_relative_rmse": 0.02305353432893753, "synthetic_matmul_relative_rmse": 0.02346830628812313, "matmul_ms": 0.645641703158617 }, { "component": "transformer", "tensor": "transformer_blocks.15.img_mlp.out.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 8, "weight_relative_rmse": 0.007503869011998177, "synthetic_matmul_relative_rmse": 0.00874588917940855, "matmul_ms": 0.6554292049258947 }, { "component": "transformer", "tensor": "transformer_blocks.31.attn.to_q.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 4, "weight_relative_rmse": 0.09847480803728104, "synthetic_matmul_relative_rmse": 0.0985177680850029, "matmul_ms": 0.5378333968110383 }, { "component": "transformer", "tensor": "transformer_blocks.31.attn.to_q.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 6, "weight_relative_rmse": 0.0240206029266119, "synthetic_matmul_relative_rmse": 0.024259869009256363, "matmul_ms": 0.5431666970252991 }, { "component": "transformer", "tensor": "transformer_blocks.31.attn.to_q.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 8, "weight_relative_rmse": 0.007802714128047228, "synthetic_matmul_relative_rmse": 0.008978405967354774, "matmul_ms": 0.5484999972395599 }, { "component": "transformer", "tensor": "transformer_blocks.31.img_mlp.out.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 4, "weight_relative_rmse": 0.09683173894882202, "synthetic_matmul_relative_rmse": 0.09696819633245468, "matmul_ms": 0.9709125035442412 }, { "component": "transformer", "tensor": "transformer_blocks.31.img_mlp.out.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 6, "weight_relative_rmse": 0.023639416322112083, "synthetic_matmul_relative_rmse": 0.0238750372081995, "matmul_ms": 0.3942042007111013 }, { "component": "transformer", "tensor": "transformer_blocks.31.img_mlp.out.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 8, "weight_relative_rmse": 0.007727540098130703, "synthetic_matmul_relative_rmse": 0.008899149484932423, "matmul_ms": 0.4157708026468754 }, { "component": "text_encoder", "tensor": "model.language_model.layers.0.mlp.down_proj.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 4, "weight_relative_rmse": 0.09275667369365692, "synthetic_matmul_relative_rmse": 0.09330281615257263, "matmul_ms": 0.4116749973036349 }, { "component": "text_encoder", "tensor": "model.language_model.layers.0.mlp.down_proj.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 6, "weight_relative_rmse": 0.022620145231485367, "synthetic_matmul_relative_rmse": 0.022967973724007607, "matmul_ms": 0.3953375038690865 }, { "component": "text_encoder", "tensor": "model.language_model.layers.0.mlp.down_proj.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 8, "weight_relative_rmse": 0.0073314751498401165, "synthetic_matmul_relative_rmse": 0.008502925746142864, "matmul_ms": 0.40935829747468233 }, { "component": "text_encoder", "tensor": "model.language_model.layers.0.self_attn.q_proj.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 4, "weight_relative_rmse": 0.09217474609613419, "synthetic_matmul_relative_rmse": 0.09356217831373215, "matmul_ms": 0.28917910531163216 }, { "component": "text_encoder", "tensor": "model.language_model.layers.0.self_attn.q_proj.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 6, "weight_relative_rmse": 0.022505931556224823, "synthetic_matmul_relative_rmse": 0.02307399921119213, "matmul_ms": 0.2340042032301426 }, { "component": "text_encoder", "tensor": "model.language_model.layers.0.self_attn.q_proj.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 8, "weight_relative_rmse": 0.007364622782915831, "synthetic_matmul_relative_rmse": 0.008642347529530525, "matmul_ms": 0.23023750400170684 }, { "component": "text_encoder", "tensor": "model.language_model.layers.17.mlp.down_proj.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 4, "weight_relative_rmse": 0.0940268263220787, "synthetic_matmul_relative_rmse": 0.09416663646697998, "matmul_ms": 0.7600749959237874 }, { "component": "text_encoder", "tensor": "model.language_model.layers.17.mlp.down_proj.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 6, "weight_relative_rmse": 0.02295832335948944, "synthetic_matmul_relative_rmse": 0.02339865453541279, "matmul_ms": 0.3463750006631017 }, { "component": "text_encoder", "tensor": "model.language_model.layers.17.mlp.down_proj.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 8, "weight_relative_rmse": 0.007490983698517084, "synthetic_matmul_relative_rmse": 0.00866878591477871, "matmul_ms": 0.40897090220823884 }, { "component": "text_encoder", "tensor": "model.language_model.layers.17.self_attn.q_proj.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 4, "weight_relative_rmse": 0.09371878206729889, "synthetic_matmul_relative_rmse": 0.09475100785493851, "matmul_ms": 0.22580409422516823 }, { "component": "text_encoder", "tensor": "model.language_model.layers.17.self_attn.q_proj.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 6, "weight_relative_rmse": 0.022860271856188774, "synthetic_matmul_relative_rmse": 0.02319853939116001, "matmul_ms": 0.2775333006866276 }, { "component": "text_encoder", "tensor": "model.language_model.layers.17.self_attn.q_proj.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 8, "weight_relative_rmse": 0.007405295968055725, "synthetic_matmul_relative_rmse": 0.008685958571732044, "matmul_ms": 0.21041249856352806 }, { "component": "text_encoder", "tensor": "model.language_model.layers.35.mlp.down_proj.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 4, "weight_relative_rmse": 0.09651479870080948, "synthetic_matmul_relative_rmse": 0.09677258133888245, "matmul_ms": 0.8071957970969379 }, { "component": "text_encoder", "tensor": "model.language_model.layers.35.mlp.down_proj.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 6, "weight_relative_rmse": 0.02353922463953495, "synthetic_matmul_relative_rmse": 0.02398456446826458, "matmul_ms": 0.5642374977469444 }, { "component": "text_encoder", "tensor": "model.language_model.layers.35.mlp.down_proj.weight", "source_shape": [ 4096, 12288 ], "sample_rows": 256, "bits": 8, "weight_relative_rmse": 0.0075887893326580524, "synthetic_matmul_relative_rmse": 0.008758915588259697, "matmul_ms": 0.5837332922965288 }, { "component": "text_encoder", "tensor": "model.language_model.layers.35.self_attn.q_proj.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 4, "weight_relative_rmse": 0.0928456261754036, "synthetic_matmul_relative_rmse": 0.09324980527162552, "matmul_ms": 0.344270805362612 }, { "component": "text_encoder", "tensor": "model.language_model.layers.35.self_attn.q_proj.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 6, "weight_relative_rmse": 0.022607337683439255, "synthetic_matmul_relative_rmse": 0.02301245927810669, "matmul_ms": 0.24173329584300518 }, { "component": "text_encoder", "tensor": "model.language_model.layers.35.self_attn.q_proj.weight", "source_shape": [ 4096, 4096 ], "sample_rows": 256, "bits": 8, "weight_relative_rmse": 0.007241594605147839, "synthetic_matmul_relative_rmse": 0.008508691564202309, "matmul_ms": 0.20297080045565963 } ], "limitations": "Sampled rows and synthetic inputs; not calibrated activations, image quality or end-to-end speed." }