{ "concurrency": 1, "requests": 8, "output_tokens_per_request": 512, "wall_seconds": 41.13470574293751, "aggregate_output_tps": 99.57528383932221, "median_decode_tps": 103.95189430818986, "median_ttft_seconds": 0.0777347715338692, "sampling": "greedy; ignore_eos for this throughput test only", "speculation_counter_deltas": { "vllm:spec_decode_num_drafts_total": 1362.0, "vllm:spec_decode_num_draft_tokens_total": 4086.0, "vllm:spec_decode_num_accepted_tokens_total": 2740.0 }, "decode_tps_note": "Client stream timing estimate; speculative decoding may deliver several tokens in one event." }