Instructions to use isox/Qwen3-14B-HomeAssistant-ru-GGUF with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use isox/Qwen3-14B-HomeAssistant-ru-GGUF with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M # Run inference directly in the terminal: llama cli -hf isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M # Run inference directly in the terminal: llama cli -hf isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M # Run inference directly in the terminal: ./llama-cli -hf isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M # Run inference directly in the terminal: ./build/bin/llama-cli -hf isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M
Use Docker
docker model run hf.co/isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M
- LM Studio
- Jan
- vLLM
How to use isox/Qwen3-14B-HomeAssistant-ru-GGUF with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "isox/Qwen3-14B-HomeAssistant-ru-GGUF" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "isox/Qwen3-14B-HomeAssistant-ru-GGUF", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M
- Ollama
How to use isox/Qwen3-14B-HomeAssistant-ru-GGUF with Ollama:
ollama run hf.co/isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M
- Unsloth Desktop
- Pi
How to use isox/Qwen3-14B-HomeAssistant-ru-GGUF with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Docker Model Runner
How to use isox/Qwen3-14B-HomeAssistant-ru-GGUF with Docker Model Runner:
docker model run hf.co/isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M
- Lemonade
How to use isox/Qwen3-14B-HomeAssistant-ru-GGUF with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M
Run and chat with the model
lemonade run user.Qwen3-14B-HomeAssistant-ru-GGUF-Q4_K_M
List all available models
lemonade list
- Hermes Agent
How to use isox/Qwen3-14B-HomeAssistant-ru-GGUF with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use isox/Qwen3-14B-HomeAssistant-ru-GGUF with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
Qwen3-14B HomeAssistant Russian (GGUF)
Fine-tuned Qwen3-14B for Russian-language Home Assistant voice control with native tool calling.
Quick Start
# Q8_0 โ best quality, needs 18GB+ VRAM (A10 24GB, RTX 3090/4090)
ollama pull hf.co/isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q8_0
# Q4_K_M โ good balance, needs 10GB+ VRAM (RTX 3060 12GB+)
ollama pull hf.co/isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M
Custom Modelfile (recommended)
The included Modelfile sets recommended parameters (32K context, tool calling template, optimized sampling):
# Download GGUF + Modelfile, then create with custom settings
ollama create qwen3-14b-ha-ru -f Modelfile
Recommended Ollama environment for NVIDIA A10 24GB:
OLLAMA_FLASH_ATTENTION=1
OLLAMA_KV_CACHE_TYPE=q8_0
OLLAMA_NUM_PARALLEL=1
Model Details
| Parameter | Value |
|---|---|
| Base model | Qwen/Qwen3-14B |
| Method | QLoRA โ LoRA merge โ GGUF |
| Training data | 214,339 examples (Russian smart home commands) |
| LoRA rank | 64 (alpha=128) |
| Training | 1 epoch, 3,350 steps, 43h on NVIDIA H100 SXM 80GB |
| Final loss | 0.2178 |
| LoRA adapter | isox/Qwen3-14B-LoRA-HomeAssistant-ru |
Available Quantizations
| File | Quant | Size | VRAM | Speed (A10) |
|---|---|---|---|---|
Qwen3-14B-HomeAssistant-ru-Q8_0.gguf |
Q8_0 | 15 GB | ~18 GB | ~29 tok/s |
Qwen3-14B-HomeAssistant-ru-Q4_K_M.gguf |
Q4_K_M | 8.4 GB | ~10 GB | ~35 tok/s |
Supported Tools (Home Assistant)
The model was trained on the following Home Assistant service tool calls:
HassTurnOn/HassTurnOffโ turn devices on/offHassSetTemperatureโ set thermostat/AC temperatureHassStartTimerโ start timersHassLightSetโ set brightness/colorHassOpenCover/HassCloseCoverโ blinds/curtainsHassMediaPause/HassMediaNext/HassVolumeSetโ media controlHassLockLock/HassLockUnlockโ door locksHassVacuumStart/HassVacuumReturnToBaseโ robot vacuumHassGetStateโ query device state
Usage with Home Assistant
This model is designed for use with Home LLM integration. It responds to Russian voice commands and produces Qwen3 tool calls in the correct format.
Example
User: ะะบะปััะธ ัะฒะตั ะฒ ะณะพััะธะฝะพะน
Model: HassTurnOn(name="ะกะฒะตั ะฒ ะณะพััะธะฝะพะน")
User: ะะพััะฐะฒั ะบะพะฝะดะธัะธะพะฝะตั ะฝะฐ 22 ะณัะฐะดััะฐ
Model: HassSetTemperature(name="ะะพะฝะดะธัะธะพะฝะตั", temperature=22)
User: ะัะธะฒะตั, ะบะฐะบ ะดะตะปะฐ?
Model: ะัะธะฒะตั! ะัั ะพัะปะธัะฝะพ, ัะตะผ ะผะพะณั ะฟะพะผะพัั?
Training Data
214,339 examples generated from Russian device/action piles covering:
- 13 assistant personas (formal, friendly, sarcastic, slang, etc.)
- 2,016 device names
- 1,569 response templates
- 1,330 specific action phrases
- 646 templated action patterns
Dataset: isox/home-assistant-russian-train (private)
- Downloads last month
- 57
4-bit
8-bit
docker model run hf.co/isox/Qwen3-14B-HomeAssistant-ru-GGUF:Q4_K_M