Qwen2.5-3B-Instruct โ€” GGUF ้‡ๅŒ–็‰ˆ

Qwen/Qwen2.5-3B-Instruct ็š„ GGUF ้‡ๅŒ–็‰ˆๆœฌ, ็”ฑ llama.cpp(commit 4f37f51) ็š„ convert_hf_to_gguf.py + llama-quantize ็”ข็”Ÿใ€‚ ้‡ๅŒ– pipeline ๅŽŸๅง‹็ขผ:gguf-quantization-factoryใ€‚

GGUF quantized versions of Qwen/Qwen2.5-3B-Instruct, produced with llama.cpp. All benchmark numbers below were measured on a real NVIDIA GeForce RTX 4090 (all layers offloaded, -ngl 99).

้‡ๅŒ–็ญ‰็ดšๆฏ”่ผƒ Quantization comparison

  • PPL:wikitext-2-raw-v1 test split,context = 512(่ถŠไฝŽ่ถŠๅฅฝ / lower is better)
  • ้€Ÿๅบฆ Speed:llama-bench pp512 / tg128,ๅ–ฎไฝ tokens/s
้‡ๅŒ– Quant ๅคงๅฐ Size PPL โ†“ ฮ”PPL vs F16 pp512 tok/s tg128 tok/s ๅณฐๅ€ผ VRAM ๆช”ๆกˆ File
F16 5.75 GiB 9.0631 ๅŸบๆบ– baseline 19999.59 127.83 8698 MiB โ€”(ๆœชไธŠๅ‚ณ not uploaded)
Q8_0 3.06 GiB 9.0806 +0.19% 22389.26 206.78 5888 MiB Qwen2.5-3B-Instruct-Q8_0.gguf
Q5_K_M 2.07 GiB 9.1883 +1.38% 20976.91 270.39 4630 MiB Qwen2.5-3B-Instruct-Q5_K_M.gguf
Q4_K_M 1.80 GiB 9.5741 +5.64% 19691.23 300.21 4348 MiB Qwen2.5-3B-Instruct-Q4_K_M.gguf
Q4_K_M_IMAT 1.80 GiB 9.3241 +2.88% 21121.76 302.57 4299 MiB Qwen2.5-3B-Instruct-Q4_K_M_IMAT.gguf
Q4_K_M_ZHTW 1.80 GiB 9.2671 +2.25% 20469.41 289.34 4295 MiB Qwen2.5-3B-Instruct-Q4_K_M_ZHTW.gguf
IQ4_XS 1.62 GiB 9.3713 +3.40% 21769.35 303.62 4128 MiB Qwen2.5-3B-Instruct-IQ4_XS.gguf
IQ4_XS_ZHTW 1.62 GiB 9.3731 +3.42% 21919.70 295.07 4120 MiB Qwen2.5-3B-Instruct-IQ4_XS_ZHTW.gguf
IQ3_M 1.39 GiB 9.9827 +10.15% 22226.49 341.54 3620 MiB Qwen2.5-3B-Instruct-IQ3_M.gguf
IQ3_S 1.36 GiB 9.9546 +9.84% 21605.76 338.30 3627 MiB Qwen2.5-3B-Instruct-IQ3_S.gguf
IQ3_XS 1.30 GiB 10.0373 +10.75% 21557.88 350.32 3536 MiB Qwen2.5-3B-Instruct-IQ3_XS.gguf
IQ3_XXS 1.19 GiB 10.5463 +16.36% 21914.09 354.49 3660 MiB Qwen2.5-3B-Instruct-IQ3_XXS.gguf
IQ2_M 1.06 GiB 12.5399 +38.36% 19803.65 338.97 11007 MiB โ€”(ๆœชไธŠๅ‚ณ not uploaded)
IQ2_S 0.99 GiB 14.3376 +58.20% 18590.73 338.72 11122 MiB โ€”(ๆœชไธŠๅ‚ณ not uploaded)
IQ2_XS 0.96 GiB 15.5602 +71.69% 19556.77 344.39 11078 MiB โ€”(ๆœชไธŠๅ‚ณ not uploaded)
IQ2_XXS 0.88 GiB 23.9641 +164.41% 22406.26 365.61 10991 MiB โ€”(ๆœชไธŠๅ‚ณ not uploaded)

ๆ€Ž้บผ้ธ Which one should I pick?

  • Q4_K_M(ๆŽจ่–ฆ้ ่จญ / recommended default):ๆช”ๆกˆๆœ€ๅฐใ€้€Ÿๅบฆๆœ€ๅฟซ,ๅ“่ณชๆๅคฑ้€šๅธธๅฏๆŽฅๅ—ใ€‚ ้ฉๅˆๆกŒๆฉŸ/็ญ†้›ปๆ—ฅๅธธไฝฟ็”จใ€VRAM ๆœ‰้™็š„่ฃ็ฝฎใ€‚
  • Q5_K_M:ๆฏ” Q4_K_M ๆ›ด่ฒผ่ฟ‘ๅŽŸๆจกๅž‹,ๅชๅคšไธ€้ปžๅคงๅฐใ€‚ๆƒณ่ฆๆ›ดๅฅฝๅ“่ณชๆ™‚้ธ้€™ๅ€‹ใ€‚
  • Q8_0:ๅนพไนŽ็„กๆ(ฮ”PPL ้€šๅธธ <0.1%),ไฝ†ๆช”ๆกˆๆŽฅ่ฟ‘ F16 ็š„ไธ€ๅŠๅคงๅฐใ€‚ๅฐๅ“่ณชๆ•ๆ„Ÿ็š„ๆญฃๅผๆœๅ‹™ใ€‚
  • F16:ๆœชไธŠๅ‚ณ(ๆช”ๆกˆ้Žๅคง);ๆƒณ่ฆ F16 ่ซ‹็”จ pipeline ่‡ช่กŒ่ฝ‰ๆช”ใ€‚

ไฝฟ็”จๆ–นๅผ Usage

Ollama

# ็›ดๆŽฅๅพž Hugging Face ่ท‘(Ollama โ‰ฅ 0.3.34)
ollama run hf.co/betty0/Qwen2.5-3B-Instruct-GGUF:Q4_K_M

ๆˆ–่‡ชๅทฑๅฏซ Modelfile(ๅซ Qwen ChatML template ่ˆ‡ stop tokens),่ฆ‹ gguf-quantization-factory ็š„ ollama/Modelfileใ€‚

llama.cpp

# ไธ‹่ผ‰
hf download betty0/Qwen2.5-3B-Instruct-GGUF Qwen2.5-3B-Instruct-Q4_K_M.gguf --local-dir .

# ไบ’ๅ‹•ๅฐ่ฉฑ(ๅ…จ้ƒจๅฑคๆ”พ GPU)
llama-cli -m Qwen2.5-3B-Instruct-Q4_K_M.gguf -ngl 99 -cnv

ไพ†ๆบๆจกๅž‹่ˆ‡ๆŽˆๆฌŠ License

  • ไพ†ๆบๆจกๅž‹ Base model:Qwen/Qwen2.5-3B-Instruct
  • ๆŽˆๆฌŠ License:Apache-2.0(ไพไพ†ๆบๆจกๅž‹)
Downloads last month
163
GGUF
Model size
3B params
Architecture
qwen2
Hardware compatibility
Log In to add your hardware

3-bit

4-bit

5-bit

8-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Model tree for betty0/Qwen2.5-3B-Instruct-GGUF

Base model

Qwen/Qwen2.5-3B
Quantized
(279)
this model