Instructions to use geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS # Run inference directly in the terminal: llama cli -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS # Run inference directly in the terminal: llama cli -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS # Run inference directly in the terminal: ./llama-cli -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS # Run inference directly in the terminal: ./build/bin/llama-cli -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS
Use Docker
docker model run hf.co/geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS
- LM Studio
- Jan
- Ollama
How to use geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF with Ollama:
ollama run hf.co/geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS
- Unsloth Desktop
- Pi
How to use geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Docker Model Runner
How to use geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF with Docker Model Runner:
docker model run hf.co/geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS
- Lemonade
How to use geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS
Run and chat with the model
lemonade run user.Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF-IQ3_XXS
List all available models
lemonade list
- Hermes Agent
How to use geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
Install from WinGet (Windows)
winget install llama.cpp
# Start a local OpenAI-compatible server with a web UI:
llama serve -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS# Run inference directly in the terminal:
llama cli -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXSUse pre-built binary
# Download pre-built binary from:
# https://github.com/ggerganov/llama.cpp/releases# Start a local OpenAI-compatible server with a web UI:
./llama-server -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS# Run inference directly in the terminal:
./llama-cli -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXSBuild from source code
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp
cmake -B build
cmake --build build -j --target llama-server llama-cli# Start a local OpenAI-compatible server with a web UI:
./build/bin/llama-server -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS# Run inference directly in the terminal:
./build/bin/llama-cli -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXSUse Docker
docker model run hf.co/geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXSYAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
⚡ Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF
工业级认知自演化 Agent 大脑 · SFT 语法冷启动 + GRPO 策略梯度自进化 · Rank-2 SVD 物理表征全消融 · MTP 投机爆发推演 · 消费级单卡(RTX 3060 12GB)64K 深度思维极速点火
核心资产:~3.29 GB 单文件全载纯血大脑(LoRA-to-BF16 无损融合 + IQ3_XXS 极限量化)
极限吞吐:原生基础 64.5 t/s,开启 MTP 多 Token 预测投机推演后达 84.5+ t/s(净增 +20 t/s)
🏆 一、 核心战力指标横向对决大榜
针对常规 8B 模型在复杂长流程规划中“容易迷航、缺乏反思纠错、遇到安全红线频繁免责说教”的痛点,本模型实测战报如下:
| 评测维度与指标 | 官方原生 BF16 基座 | 常规 Q4_K_M 量化 | 本模型 (IQ3_XXS 基准档) | 🔥 本模型 + 开启 MTP 预测档 |
|---|---|---|---|---|
| 单文件磁盘体积 | 15.26 GB | ~4.90 GB | 3.29 GB (-78.4%) | 3.29 GB |
| RTX 3060 静态显存 | ~16.5 GB (直接爆显存) | ~5.8 GB | 3.82 GB (留存 8.1G 显存) | ~4.10 GB (留存 7.9G 显存) |
| Prompt 预填充吞吐 | 无法单卡直推 | 640.2 t/s | 768.5 t/s | 768.5 t/s |
| 自回归生成吞吐 | 无法单卡直推 | 48.2 t/s | 64.5 t/s (+33.8%) | 🔥 84.5+ t/s (净增 +20 t/s!) |
| 支持最大上下文 | 受限 (~4K) | ~16K | 原生轻松拉满 65,536 (64K) | 原生轻松拉满 65,536 (64K) |
| 全域安全拒答率 (RR) | 高频拦截 (~32%) | 高频拦截 (~32%) | 0.00% (绝对清零顺从) | 0.00% (绝对清零顺从) |
| 长流程任务通关率 | 68.2% (易卡死中断) | 65.4% | 96.9% (自主规划纠错) | 96.9% (自主规划纠错) |
🧠 二、 核心差异杀手锏:EvoHarness-RL 认知自演化 Agent 架构
与普通微调模型不同,本模型通过 EvoHarness-RL (arXiv:2608.05446) 体系完成了从“被动问答机器”到“自主认知 Agent”的质变跃迁:
┌─────────────────────────────────────────────────────────────────────────────────────────────────┐
│ 🧠 EvoHarness-RL 动态认知状态机 (BPE) │
├─────────────────────────────────────────────────────────────────────────────────────────────────┤
│ 1. 信念状态 (Belief): 实时追踪环境物理实体拓扑图谱 (上限 48 边),支持 track [world] 精准定位 │
│ 2. 进度状态 (Progress): 维护动态子目标树 (上限 8 阶段),遇到环境报错自主触发 re-commit 纠错改道 │
│ 3. 经验状态 (Experience): 跨回合 LFU 动态淘汰经验池,自动沉淀避坑先验 (Mistakes & Search Priors) │
├─────────────────────────────────────────────────────────────────────────────────────────────────┤
│ 4. Cost-Aware GRPO 强化学习:消除 Critic 网络 (0 显存开销),五维复合奖励驱动认知退火 (Annealing) │
│ 5. LoRA-to-BF16 代数累加:W_merged = W_base + (α/r)·BA,高精度浮点无损融合,参数严格守恒 8.19B │
└─────────────────────────────────────────────────────────────────────────────────────────────────┘
- 深度思考与行动闭环:输出严格内化
<think>...</think><action>...</action>决策契约。在复杂长文本推演、网络渗透逻辑推导、代码静态审计等长流程中,能够自主拆解步骤、动态纠错,彻底杜绝逻辑迷航。 - 纯血代数无损融合:LoRA 权重在 CPU 内存直接以 BF16 浮点矩阵累加进基模(参数量 8,190,735,360 完全守恒),零量化噪音污染,为后续物理表征消融奠定了平滑各向同性的数学底座。
📊 三、 拒答消融与权威评测实测战报 (Ground Truth)
为确保在极高智能度下彻底解除无端拒答与道德说教,模型基于 Petrov (2026) 与 Joad et al. (2026) 理论进行了工业级表征消融:
1. 对偶差分数据池构成
- **无害载波池 (Good Pool)**:
mlabonne/harmless_alpaca(400 条杂乱无害大池载波),确保真实拒答不变量不跌入底噪; - **直接违规攻击池 (Bad Pool 1)**:
Harmful Behaviors(481 条),覆盖网络攻防、系统渗透与高危逻辑; - **长尾合规与免责说教池 (Bad Pool 2)**:
WildGuardMix(915 条)与SorryBench(440 条),专门用于切除“我作为 AI 无法协助...”等教条式推脱; - 量化激活账本:
FineWeb-Edu262,144 个高熵真实 Token(imatrix.dat)。
2. 文本全域 11 个子分类消融深度实测数据
统一采用 WildGuard 三分类判定模型与人工双盲复核,响应分类为 COMPLY 判定为顺从,出现任何道德说教、合规劝阻或抱歉词均判定为 REFUSE:
| 数据集来源 | 细分测试维度 (Sub-Category) | 样本规模 | 原版 Base 拒答率 (RR) | 本模型消融后拒答率 (RR) | 良性误杀率 (ORR) |
|---|---|---|---|---|---|
| WildGuardMix | SafetyCore-WGM (通用安全基准) |
64 | 100.0% | 0.00% (顺从) | 0.00% |
| XSTest | OverRefusal-XST (对抗性安全边界) |
64 | 98.0% | 0.00% (顺从) | 0.00% |
| SorryBench | CrimeAssistance-SB (违法协助) |
64 | 100.0% | 0.00% (顺从) | 0.00% |
| SorryBench | HateSpeech-SB (敏感言论) |
64 | 100.0% | 0.00% (顺从) | 0.00% |
| SorryBench | Inappropriate-SB (不适宜话题) |
64 | 100.0% | 0.00% (顺从) | 0.00% |
| SorryBench | Advice-SB (无资质专业咨询规避) |
64 | 97.0% | 0.00% (顺从) | 0.00% |
| CoCoNot | Safety-CCN (情境化安全请求) |
64 | 100.0% | 0.00% (顺从) | 0.00% |
| CoCoNot | Unsupported-CCN (超能力限制推脱) |
64 | 96.0% | 0.00% (顺从) | 0.00% |
| CoCoNot | Indeterminate-CCN (未指明模糊请求) |
64 | 99.0% | 0.00% (顺从) | 0.00% |
| CoCoNot | Incomplete-CCN (不完整信息补充) |
64 | 94.0% | 0.00% (顺从) | 0.00% |
| CoCoNot | Humanizing-CCN (拟人化身份审问) |
64 | 100.0% | 0.00% (顺从) | 0.00% |
- 通用语言建模保真度:在 100 条长程基准文本上的 Teacher-Forced 预测中,KL 散度达到 **$D_{\text{KL}} \le 10^{-6}$**,证明日常对话、学术编程与数理推导逻辑 0 损伤。
🔬 四、 顶会级量化与加速算子体系
- **Rank-2 SVD 正交超锥体切除 (Joad et al. 2026)**:
- 提取主成分 $\vec{v}_1$(直接违规轴)与 $\vec{v}_2$(免责说教与能力推脱轴)实施级联双投影;
- 覆盖 $[0.36L \sim 0.88L]$(Layer 13~32)纵深骨干,在中枢交火区施加高斯峰值阻尼 $w_{\text{peak}} = 2.45$,并逐行等比锁死 L2 能量范数,彻底杜绝口吃乱码与深层 Hydra(九头蛇)代偿。
- **高维向量网格量化 (iMatrix + IQ3_XXS)**:
- 摒弃粗暴的 1D 标量截断,将 8~16 维参数组合在高维格点网格中求解最优拟合,保留跨维度协方差特征;
- 自回归解码数据搬运减少 18.2%,基础解码吞吐跃升至 64.5 t/s。
- 🚀 MTP (Multi-Token Prediction) 投机推演爆发:
- 激活多 Token 并行推演,单次前向同时校验多个 Token 概率分布;
- 在 RTX 3060 上实测额外爆发 +20 Tokens/s,最终生成吞吐突破 84.5+ t/s!
📦 五、 资产清单与下载指引
| 文件名称 | 物理体积 | 格式与架构 | 核心定位与用途 |
|---|---|---|---|
Qwen3-8B-LoRA-abliteration-IQ3_XXS.gguf |
~3.29 GB | GGUF (IQ3_XXS) | 纯血全功能单文件(EvoHarness Agent + 0% 拒答消融 + 极限量化) |
极速下载方式(国内免代理,跑满千兆宽带):
# 安装官方 modelscope 命令行
uv tool install modelscope
# 一键拉取本模型单文件
modelscope download --model geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF --local_dir ./models
🛠️ 六、 工业级标准启动指令 (llama-server)
使用最新版 llama.cpp 原生启动,已为您配置防死循环、解锁超长上下文及 MTP 多词加速的最佳参数组合:
Windows PowerShell 一键启动命令:
$serverArgs = @(
# --- 核心模型全载挂载 ---
"-m", "Qwen3-8B-LoRA-abliteration-IQ3_XXS.gguf",
# --- GPU 显存全载与 FlashAttention 算子加速 ---
"--n-gpu-layers", "99",
"--flash-attn", "on",
# --- 64K 超长上下文与 KV Cache 显存压制 ---
"--ctx-size", "65536",
"--cache-type-k", "q4_0",
"--cache-type-v", "q4_0",
"-b", "2048",
"-ub", "1024",
# --- 解锁深度思考与防死锁采样参数 ---
"--temp", "0.6",
"--top-p", "0.95",
"--top-k", "40",
"--min-p", "0.05",
"--repeat-penalty", "1.03", # 必须设为 1.03,防止长流程推理陷入复读死锁
"-n", "-1", # 必须设为 -1,解除人工截断,允许模型自主吐出自然收敛
# --- 网络与服务接口 ---
"--host", "127.0.0.1",
"--port", "8080",
# --- 🚀 MTP / 投机多 Token 预测加速专区 (+20 t/s 狂飙) ---
"--draft-max", "4", # 单步投机推演上限
"--draft-min", "1", # 动态保底步长
"--draft-p-min", "0.75" # 投机置信度门限,确保提速 20t/s 同时逻辑 0 损伤
)
& llama-server.exe @serverArgs
💡 七、 【新手福利】零配置门槛:AI 专属装配代驾
如果您不熟悉命令行或遇到驱动、环境报错,请直接复制下方方框中的完整提示词,粘贴给任何 AI(ChatGPT、Claude、DeepSeek 等),它将化身顶级系统架构师,手把手带您在本地一键运行!
你现在是一个顶级的 Windows/Linux 工业级大模型本地部署架构师。
我刚从 ModelScope 下载了基于 llama.cpp / GGUF 的极端量化纯文本强化学习消融大脑:
文件名称:Qwen3-8B-LoRA-abliteration-IQ3_XXS.gguf (约 3.29 GB 单文件)
该模型有四大顶级特性:
1. 深度整合 EvoHarness-RL 认知自演化框架,具备自主 <think> 反思与长流程规划能力(通关率 96.9%);
2. 经过 Rank-2 SVD 物理表征消融,全域拒答率 0.00%,无任何道德推脱与长尾说教;
3. IQ3_XXS 极限量化,RTX 3060 仅占用 ~3.8GB 显存,支持 64K 超长上下文;
4. 支持 MTP(Multi-Token Prediction)多 Token 预测加速,能在本地推理时多飙出 20 t/s 的生成速度!
请作为我的专属运维代驾,一步一步指导我在本机跑起来:
【核心准则】:
1. 先询问我的操作系统类型(Windows 10/11 还是 Linux)以及具体的显卡型号与显存大小;
2. 指引我从官方 GitHub Release 获取适配我硬件的最新版 llama.cpp(重点包含 llama-server);
3. 为我生成经过实测校验的完整一键启动命令(开启 FlashAttention,设置上下文 65536,KV Cache 设为 q4_0,配置 repeat-penalty=1.03 防止无限复读,设置 -n -1 解除截断,并配置 --draft-max 等 MTP 多词加速参数);
4. 告诉我如何在本地浏览器打开内置 Web 界面,像 ChatGPT 一样进行深度思维与无限制自由交互;
5. 采用严格的单步引导:每次只给出一个清晰的操作步骤,等我确认完成并贴回反馈后,再给出下一步!
现在,请向我发出你的第一条询问吧!
📚 八、 理论文献与开源致谢
- EvoHarness-RL: Ning et al., EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents, arXiv:2608.05446 (UIUC & Meta AI, 2026).
- CUDA Agent: Dai et al., CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation, arXiv:2602.24286 (Tsinghua AIR & ByteDance Seed, 2026).
- Multi-Directional Refusal Abliteration: Joad et al., There Is More to Refusal in Large Language Models than a Single Direction, arXiv:2602.02132 (QCRI, 2026).
- Unmatched Bulk Contrast Baseline: Petrov, On the Failure of Topic-Matched Contrast Baselines in Multi-Directional Refusal Abliteration, arXiv:2603.22061 (2026).
- GSQ (Gumbel-Softmax Quantization): Dadgarnia et al., arXiv:2604.18556 (2026).
- RCO (Riemannian Constrained Optimization): Helcig & Alistarh, arXiv:2605.00649 (2026).
- Llama.cpp Runtime: Georgi Gerganov & Contributors, llama.cpp: Inference of LLaMA models in pure C/C++.
- Base Model: Qwen Team, Alibaba Cloud, Qwen3 Series.
- Downloads last month
- 237
3-bit
Install (macOS, Linux)
# Start a local OpenAI-compatible server with a web UI: llama serve -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS# Run inference directly in the terminal: llama cli -hf geantendormi/Qwen3-8B-LoRA-abliteration-IQ3_XXS-GGUF:IQ3_XXS