{ "chart": "latency", "from_chart_data_entry": "latency.idle", "source_path": "runs/macjev/latency/m1max_untrained_base_2026-09-23_review_idle/latency.json", "field": "results['llamacpp-f16'|'laya-multilingual-mps-fp32'][cell].p50_ms", "protocol_label": "M1 Max 64 GB, warm end-to-end p50 ms, idle run 2026-09-23 (load avg 3-8); untrained identical-architecture Qwen3.5-0.8B export (latency does not depend on weights); v3 = llama.cpp GGUF F16, one call per state; comparison engine = round-1 MacLaya-4K (our Laya-multilingual fine-tune, FP32/MPS, 4,096-token budget), one decide() per question; prefix reuse off", "plotted": [ { "cell": "1024x5", "v3_p50_ms": 394, "maclaya4k_p50_ms": 543, "speedup_label": "1.4x" }, { "cell": "1024x10", "v3_p50_ms": 525, "maclaya4k_p50_ms": 1019, "speedup_label": "1.9x" }, { "cell": "4096x5", "v3_p50_ms": 1212, "maclaya4k_p50_ms": 3204, "speedup_label": "2.6x" }, { "cell": "4096x10", "v3_p50_ms": 1381, "maclaya4k_p50_ms": 6364, "speedup_label": "4.6x" }, { "cell": "8192x1", "v3_p50_ms": 2295, "maclaya4k_p50_ms": null, "speedup_label": "v3 only" }, { "cell": "8192x5", "v3_p50_ms": 2424, "maclaya4k_p50_ms": null, "speedup_label": "v3 only" }, { "cell": "8192x10", "v3_p50_ms": 2613, "maclaya4k_p50_ms": null, "speedup_label": "v3 only" } ] }