docs: point serving fork at shipped branch (GLM cudagraphs-v2 / inkling feature/inkling) + note pinned flashinfer + cutlass-dsl republish guard d24fbd2 verified jarrelscy commited on Jul 23
README: post-campaign-v2 measured speeds (kernel trio + adaptive spec default-on): decode 74-80 counting / 65-77 code / 49-67 prose tok/s, base no-MTP 50-52, -20% round cost at 512k depth, prefill 1174 tok/s to 512k f3afa65 verified jarrelscy commited on Jul 20
README: verified 512k+MTP serving config + measured throughput (decode 3 workloads, prefill, needle gates, multimodal) 5421825 verified jarrelscy commited on Jul 19