How to use from
llama.cpp
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh
# Start a local OpenAI-compatible server with a web UI:
llama serve -hf jamiefutch/Qwen3.6-40B-Heretic-MTP-GGUF-Q4_K_M:Q4_K_M
# Run inference directly in the terminal:
llama cli -hf jamiefutch/Qwen3.6-40B-Heretic-MTP-GGUF-Q4_K_M:Q4_K_M
Install from WinGet (Windows)
winget install llama.cpp
# Start a local OpenAI-compatible server with a web UI:
llama serve -hf jamiefutch/Qwen3.6-40B-Heretic-MTP-GGUF-Q4_K_M:Q4_K_M
# Run inference directly in the terminal:
llama cli -hf jamiefutch/Qwen3.6-40B-Heretic-MTP-GGUF-Q4_K_M:Q4_K_M
Use pre-built binary
# Download pre-built binary from:
# https://github.com/ggerganov/llama.cpp/releases
# Start a local OpenAI-compatible server with a web UI:
./llama-server -hf jamiefutch/Qwen3.6-40B-Heretic-MTP-GGUF-Q4_K_M:Q4_K_M
# Run inference directly in the terminal:
./llama-cli -hf jamiefutch/Qwen3.6-40B-Heretic-MTP-GGUF-Q4_K_M:Q4_K_M
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp
cmake -B build
cmake --build build -j --target llama-server llama-cli
# Start a local OpenAI-compatible server with a web UI:
./build/bin/llama-server -hf jamiefutch/Qwen3.6-40B-Heretic-MTP-GGUF-Q4_K_M:Q4_K_M
# Run inference directly in the terminal:
./build/bin/llama-cli -hf jamiefutch/Qwen3.6-40B-Heretic-MTP-GGUF-Q4_K_M:Q4_K_M
Use Docker
docker model run hf.co/jamiefutch/Qwen3.6-40B-Heretic-MTP-GGUF-Q4_K_M:Q4_K_M
Quick Links

Qwen3.6 40B Heretic MTP GGUF Q4_K_M

This repository provides a Q4_K_M GGUF quantization derived from:

markmonger/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-iMatrix-MTP-GGUF

The source repository provides the MTP GGUF model as q8_0-v1.gguf and is licensed under Apache-2.0.

Files

File Quantization SHA256
q4_k_m-v1.gguf Q4_K_M c9791ad1fda0c2cb0290c268c035d888121e3d5e84a9e6f0a6b34618cc081d90

Usage

With llama.cpp:

llama-cli -hf m233zhan/Qwen3.6-40B-Heretic-MTP-GGUF-Q4_K_M:q4_k_m-v1.gguf

Or start an OpenAI-compatible local server:

llama-server -hf m233zhan/Qwen3.6-40B-Heretic-MTP-GGUF-Q4_K_M:q4_k_m-v1.gguf

Provenance

Model lineage shown by the upstream repository:

  • Base model: Qwen/Qwen3.6-27B
  • Finetuned model: DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking
  • MTP GGUF source: markmonger/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-iMatrix-MTP-GGUF

This repository only adds the Q4_K_M GGUF quantization.

Downloads last month
47
GGUF
Model size
39B params
Architecture
qwen35
Hardware compatibility
Log In to add your hardware

4-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for jamiefutch/Qwen3.6-40B-Heretic-MTP-GGUF-Q4_K_M

Collection including jamiefutch/Qwen3.6-40B-Heretic-MTP-GGUF-Q4_K_M