===== quant: GLQ_TRELLIS_VARIANT=3inst glq-quantize --model google/gemma-4-31B-it --output /opt/dlami/nvme/glq_out/gemma-4-31B-it-trellis-3inst-4bpw --bpw 4 --nsamples 128 --seqlen 2048 --device cuda --codebook trellis --streaming ===== ===== quant: GLQ_TRELLIS_VARIANT=3inst /home/ubuntu/venv/bin/glq-quantize --model google/gemma-4-31B-it --output /opt/dlami/nvme/glq_out/gemma-4-31B-it-trellis-3inst-4bpw --bpw 4 --nsamples 128 --seqlen 2048 --device cuda --codebook trellis --streaming ===== GLQ Quantization: google/gemma-4-31B-it -> /opt/dlami/nvme/glq_out/gemma-4-31B-it-trellis-3inst-4bpw bpw=4, tune_iters=0, nsamples=128 streaming=True (layer-by-layer safetensors loading) Loading model ... Fetching 12 files: 0%| | 0/12 [00:00