How to use from
llama.cpp
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh
# Start a local OpenAI-compatible server with a web UI:
llama serve -hf RockMan256/LFM2.5-1.2B-Instruct-enti-GGUF:Q4_K_M
# Run inference directly in the terminal:
llama cli -hf RockMan256/LFM2.5-1.2B-Instruct-enti-GGUF:Q4_K_M
Install from WinGet (Windows)
winget install llama.cpp
# Start a local OpenAI-compatible server with a web UI:
llama serve -hf RockMan256/LFM2.5-1.2B-Instruct-enti-GGUF:Q4_K_M
# Run inference directly in the terminal:
llama cli -hf RockMan256/LFM2.5-1.2B-Instruct-enti-GGUF:Q4_K_M
Use pre-built binary
# Download pre-built binary from:
# https://github.com/ggerganov/llama.cpp/releases
# Start a local OpenAI-compatible server with a web UI:
./llama-server -hf RockMan256/LFM2.5-1.2B-Instruct-enti-GGUF:Q4_K_M
# Run inference directly in the terminal:
./llama-cli -hf RockMan256/LFM2.5-1.2B-Instruct-enti-GGUF:Q4_K_M
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp
cmake -B build
cmake --build build -j --target llama-server llama-cli
# Start a local OpenAI-compatible server with a web UI:
./build/bin/llama-server -hf RockMan256/LFM2.5-1.2B-Instruct-enti-GGUF:Q4_K_M
# Run inference directly in the terminal:
./build/bin/llama-cli -hf RockMan256/LFM2.5-1.2B-Instruct-enti-GGUF:Q4_K_M
Use Docker
docker model run hf.co/RockMan256/LFM2.5-1.2B-Instruct-enti-GGUF:Q4_K_M
Quick Links

LFM2.5-1.2B-Instruct-enti-GGUF

Модель-резолвер сущностей (entity / intent resolver) для Home Assistant на базе LFM2.5-1.2B. Превращает пользовательскую фразу в домен + имя сущности (или интент), которые затем маппятся в вызов HA-тула на стороне клиента.

Обучена на RockMan256/ha-ru-en-intents.

Как использовать (формат запроса и ответа)

Вход (запрос пользователя):

включи свет в спальне

Выход (модель отвечает JSON-объектом с интентом/доменом):

{ "name": "light", "arguments": { "room": "spaln", "brightness": 100 } }

или для управления:

{ "name": "gate", "arguments": { "state": "open" } }

Важно: reasoning

Модель выдаёт compact-JSON (0.6–1.4s на запрос), но иногда путает сущности (например, вытяжку называет gate_open). Для стабильности подавай ей системный промпт с явным указанием формата выхода.

Рекомендации

  • Это классификатор интентов, а не tool-caller. Она выдаёт light / gate вместо toggle_lights / control_door — нужен адаптер интентов в коде клиента.
  • Не используй как чат-бота.
  • Обучена на ha-ru-en-intents — дообучи на своём датасете, если нужны именно твои имена тулов (напр. 6 тулов чебупелки).
  • 1.2B — стабильнее MiniCPM5-1B, но всё ещё мала для сложных запросов.
Downloads last month
17
GGUF
Model size
1B params
Architecture
lfm2
Hardware compatibility
Log In to add your hardware

4-bit

8-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support