How to use from
vLLM
Install from pip and serve model
# Install vLLM from pip:
pip install vllm
# Start the vLLM server:
vllm serve "vroomfondel/Qwen3-30B-A3B-NVFP4-ModelOpt"
# Call the server using curl (OpenAI-compatible API):
curl -X POST "http://localhost:8000/v1/chat/completions" \
	-H "Content-Type: application/json" \
	--data '{
		"model": "vroomfondel/Qwen3-30B-A3B-NVFP4-ModelOpt",
		"messages": [
			{
				"role": "user",
				"content": "What is the capital of France?"
			}
		]
	}'
Use Docker
docker model run hf.co/vroomfondel/Qwen3-30B-A3B-NVFP4-ModelOpt
Quick Links

qwen3-30b-a3b-nvfp4-modelopt

NVFP4 quantization of Qwen/Qwen3-30B-A3B via NVIDIA ModelOpt.

Quantization details (auto-generated)

  • source model: Qwen/Qwen3-30B-A3B
  • qformat: nvfp4 kv_cache: fp8
  • calibration: 512 samples from pg19, cnn_dailymail
  • producer: NVIDIA ModelOpt 0.45.0
  • generated: 2026-07-10T13:08:52Z

Before/after sample generation was skipped for this run (SKIP_GENERATE=1).

Downloads last month
29
Safetensors
Model size
16B params
Tensor type
BF16
·
F8_E4M3
·
U8
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for vroomfondel/Qwen3-30B-A3B-NVFP4-ModelOpt

Quantized
(150)
this model