{ "methodology": { "engine": "vLLM prompt_logprobs=1", "dataset": "Salesforce/wikitext", "dataset_config": "wikitext-2-raw-v1", "split": "test", "dataset_fingerprint": "a46124b21ac53738", "window_selection": "first contiguous non-empty test-corpus token windows", "num_windows": 4, "window_tokens": 512, "evaluated_next_tokens": 2044, "tokenizer": "frozen Gemma 4 QAT/Heretic parent tokenizer", "note": "BF16 used vLLM CPU offload on a 24 GB RTX 3090; W4A16 used the same vLLM prompt-logprob scorer without offload." }, "results": { "bf16_parent": { "perplexity": 388.14988734463424, "mean_nll": 5.961391572614971, "nll_sum": 12185.084374425001, "cpu_offload_gb": 30.0 }, "w4a16_g64": { "perplexity": 432.31795682768376, "mean_nll": 6.069161328695908, "nll_sum": 12405.365755854436, "cpu_offload_gb": 0.0 }, "delta_perplexity": 44.16806948304952, "delta_percent": 11.379127219437565 } }