Image21-MLX-8bit / evaluation /precision-probe.json
ixim's picture
Add files using upload-large-folder tool
4f03424 verified
Raw History Blame Contribute Delete
13.6 kB
{
"group_size": 64,
"mode": "affine",
"device": {
"device_name": "Apple M4 Max",
"max_recommended_working_set_size": 115448725504,
"memory_size": 137438953472,
"architecture": "applegpu_g16s",
"max_buffer_length": 86586540032,
"resource_limit": 499000
},
"results": [
{
"component": "transformer",
"tensor": "transformer_blocks.0.attn.to_q.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 4,
"weight_relative_rmse": 0.09608591347932816,
"synthetic_matmul_relative_rmse": 0.09557931870222092,
"matmul_ms": 0.5911250016652048
},
{
"component": "transformer",
"tensor": "transformer_blocks.0.attn.to_q.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 6,
"weight_relative_rmse": 0.02344648726284504,
"synthetic_matmul_relative_rmse": 0.023693682625889778,
"matmul_ms": 0.4109000088647008
},
{
"component": "transformer",
"tensor": "transformer_blocks.0.attn.to_q.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 8,
"weight_relative_rmse": 0.007525453343987465,
"synthetic_matmul_relative_rmse": 0.008602947928011417,
"matmul_ms": 0.4843916976824403
},
{
"component": "transformer",
"tensor": "transformer_blocks.0.img_mlp.out.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 4,
"weight_relative_rmse": 0.09441296756267548,
"synthetic_matmul_relative_rmse": 0.09449099004268646,
"matmul_ms": 0.4845582996495068
},
{
"component": "transformer",
"tensor": "transformer_blocks.0.img_mlp.out.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 6,
"weight_relative_rmse": 0.02303435653448105,
"synthetic_matmul_relative_rmse": 0.02340426668524742,
"matmul_ms": 0.46681660460308194
},
{
"component": "transformer",
"tensor": "transformer_blocks.0.img_mlp.out.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 8,
"weight_relative_rmse": 0.007468077354133129,
"synthetic_matmul_relative_rmse": 0.008637943305075169,
"matmul_ms": 0.36163330078125
},
{
"component": "transformer",
"tensor": "transformer_blocks.15.attn.to_q.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 4,
"weight_relative_rmse": 0.09535665810108185,
"synthetic_matmul_relative_rmse": 0.09527087211608887,
"matmul_ms": 0.57477499358356
},
{
"component": "transformer",
"tensor": "transformer_blocks.15.attn.to_q.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 6,
"weight_relative_rmse": 0.02322564087808132,
"synthetic_matmul_relative_rmse": 0.023668956011533737,
"matmul_ms": 0.4584625014103949
},
{
"component": "transformer",
"tensor": "transformer_blocks.15.attn.to_q.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 8,
"weight_relative_rmse": 0.0074961441569030285,
"synthetic_matmul_relative_rmse": 0.008681540377438068,
"matmul_ms": 0.533016596455127
},
{
"component": "transformer",
"tensor": "transformer_blocks.15.img_mlp.out.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 4,
"weight_relative_rmse": 0.09448622912168503,
"synthetic_matmul_relative_rmse": 0.09489456564188004,
"matmul_ms": 0.9572708979249
},
{
"component": "transformer",
"tensor": "transformer_blocks.15.img_mlp.out.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 6,
"weight_relative_rmse": 0.02305353432893753,
"synthetic_matmul_relative_rmse": 0.02346830628812313,
"matmul_ms": 0.645641703158617
},
{
"component": "transformer",
"tensor": "transformer_blocks.15.img_mlp.out.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 8,
"weight_relative_rmse": 0.007503869011998177,
"synthetic_matmul_relative_rmse": 0.00874588917940855,
"matmul_ms": 0.6554292049258947
},
{
"component": "transformer",
"tensor": "transformer_blocks.31.attn.to_q.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 4,
"weight_relative_rmse": 0.09847480803728104,
"synthetic_matmul_relative_rmse": 0.0985177680850029,
"matmul_ms": 0.5378333968110383
},
{
"component": "transformer",
"tensor": "transformer_blocks.31.attn.to_q.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 6,
"weight_relative_rmse": 0.0240206029266119,
"synthetic_matmul_relative_rmse": 0.024259869009256363,
"matmul_ms": 0.5431666970252991
},
{
"component": "transformer",
"tensor": "transformer_blocks.31.attn.to_q.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 8,
"weight_relative_rmse": 0.007802714128047228,
"synthetic_matmul_relative_rmse": 0.008978405967354774,
"matmul_ms": 0.5484999972395599
},
{
"component": "transformer",
"tensor": "transformer_blocks.31.img_mlp.out.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 4,
"weight_relative_rmse": 0.09683173894882202,
"synthetic_matmul_relative_rmse": 0.09696819633245468,
"matmul_ms": 0.9709125035442412
},
{
"component": "transformer",
"tensor": "transformer_blocks.31.img_mlp.out.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 6,
"weight_relative_rmse": 0.023639416322112083,
"synthetic_matmul_relative_rmse": 0.0238750372081995,
"matmul_ms": 0.3942042007111013
},
{
"component": "transformer",
"tensor": "transformer_blocks.31.img_mlp.out.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 8,
"weight_relative_rmse": 0.007727540098130703,
"synthetic_matmul_relative_rmse": 0.008899149484932423,
"matmul_ms": 0.4157708026468754
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.0.mlp.down_proj.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 4,
"weight_relative_rmse": 0.09275667369365692,
"synthetic_matmul_relative_rmse": 0.09330281615257263,
"matmul_ms": 0.4116749973036349
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.0.mlp.down_proj.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 6,
"weight_relative_rmse": 0.022620145231485367,
"synthetic_matmul_relative_rmse": 0.022967973724007607,
"matmul_ms": 0.3953375038690865
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.0.mlp.down_proj.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 8,
"weight_relative_rmse": 0.0073314751498401165,
"synthetic_matmul_relative_rmse": 0.008502925746142864,
"matmul_ms": 0.40935829747468233
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.0.self_attn.q_proj.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 4,
"weight_relative_rmse": 0.09217474609613419,
"synthetic_matmul_relative_rmse": 0.09356217831373215,
"matmul_ms": 0.28917910531163216
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.0.self_attn.q_proj.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 6,
"weight_relative_rmse": 0.022505931556224823,
"synthetic_matmul_relative_rmse": 0.02307399921119213,
"matmul_ms": 0.2340042032301426
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.0.self_attn.q_proj.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 8,
"weight_relative_rmse": 0.007364622782915831,
"synthetic_matmul_relative_rmse": 0.008642347529530525,
"matmul_ms": 0.23023750400170684
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.17.mlp.down_proj.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 4,
"weight_relative_rmse": 0.0940268263220787,
"synthetic_matmul_relative_rmse": 0.09416663646697998,
"matmul_ms": 0.7600749959237874
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.17.mlp.down_proj.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 6,
"weight_relative_rmse": 0.02295832335948944,
"synthetic_matmul_relative_rmse": 0.02339865453541279,
"matmul_ms": 0.3463750006631017
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.17.mlp.down_proj.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 8,
"weight_relative_rmse": 0.007490983698517084,
"synthetic_matmul_relative_rmse": 0.00866878591477871,
"matmul_ms": 0.40897090220823884
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.17.self_attn.q_proj.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 4,
"weight_relative_rmse": 0.09371878206729889,
"synthetic_matmul_relative_rmse": 0.09475100785493851,
"matmul_ms": 0.22580409422516823
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.17.self_attn.q_proj.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 6,
"weight_relative_rmse": 0.022860271856188774,
"synthetic_matmul_relative_rmse": 0.02319853939116001,
"matmul_ms": 0.2775333006866276
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.17.self_attn.q_proj.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 8,
"weight_relative_rmse": 0.007405295968055725,
"synthetic_matmul_relative_rmse": 0.008685958571732044,
"matmul_ms": 0.21041249856352806
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.35.mlp.down_proj.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 4,
"weight_relative_rmse": 0.09651479870080948,
"synthetic_matmul_relative_rmse": 0.09677258133888245,
"matmul_ms": 0.8071957970969379
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.35.mlp.down_proj.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 6,
"weight_relative_rmse": 0.02353922463953495,
"synthetic_matmul_relative_rmse": 0.02398456446826458,
"matmul_ms": 0.5642374977469444
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.35.mlp.down_proj.weight",
"source_shape": [
4096,
12288
],
"sample_rows": 256,
"bits": 8,
"weight_relative_rmse": 0.0075887893326580524,
"synthetic_matmul_relative_rmse": 0.008758915588259697,
"matmul_ms": 0.5837332922965288
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.35.self_attn.q_proj.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 4,
"weight_relative_rmse": 0.0928456261754036,
"synthetic_matmul_relative_rmse": 0.09324980527162552,
"matmul_ms": 0.344270805362612
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.35.self_attn.q_proj.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 6,
"weight_relative_rmse": 0.022607337683439255,
"synthetic_matmul_relative_rmse": 0.02301245927810669,
"matmul_ms": 0.24173329584300518
},
{
"component": "text_encoder",
"tensor": "model.language_model.layers.35.self_attn.q_proj.weight",
"source_shape": [
4096,
4096
],
"sample_rows": 256,
"bits": 8,
"weight_relative_rmse": 0.007241594605147839,
"synthetic_matmul_relative_rmse": 0.008508691564202309,
"matmul_ms": 0.20297080045565963
}
],
"limitations": "Sampled rows and synthetic inputs; not calibrated activations, image quality or end-to-end speed."
}