Instructions to use 6E6E/ru-decision-4b with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use 6E6E/ru-decision-4b with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-4B") model = PeftModel.from_pretrained(base_model, "6E6E/ru-decision-4b") - Notebooks
- Google Colab
- Kaggle
ru-decision-4b: модель решений для русского языка
Код, данные и пошаговый туториал: github.com/GG1KENOBI/ru-decision-model
Сделано в айфи.студио — внедряем ИИ в бизнес там, где сотрудники тратят часы на однотипную работу.
ru-decision-4b не пишет текст, а выбирает один из заданных вариантов и возвращает вероятность каждого — за один прямой проход, 60–100 мс на RTX 4090.
На вход: данные (state), вопрос и список вариантов. На выход: вероятности вариантов.
Подходит для маршрутизации обращений, проверки заявок по регламенту, срочности, тональности, интентов, сортировки документов.
Это LoRA-адаптер (130 МБ) к Qwen/Qwen3.5-4B. Языки: русский (основной) и английский.
Быстрый старт
pip install "transformers>=5.18" "peft>=0.21" torch accelerate
from decide import decide # decide.py лежит в этом репозитории
print(decide(
state=("Регламент: командировочные расходы до 5 000 ₽ в сутки согласует руководитель, "
"свыше — финансовый директор. Без чеков расходы не возмещаются.\n"
"Заявка: Иванов, Казань, 3 суток, гостиница 4 200 ₽/сутки, чеки приложены."),
question="Кто согласует заявку?",
options=["Руководитель.", "Финансовый директор.", "Отказать: нет чеков.",
"Недостаточно данных — передать человеку."],
))
# {'choice': 'Руководитель.', 'confidence': 0.93, 'auto': True,
# 'probs': {'Руководитель.': 0.93, 'Финансовый директор.': 0.01, 'Отказать: нет чеков.': 0.0,
# 'Недостаточно данных — передать человеку.': 0.06}}
Внутри decide.py — всего 40 строк: системный промпт, JSON {state, question, options} в чат-шаблоне Qwen, логиты последней позиции по токенам букв A, B, C…, деление на температуру 1,4, softmax.
Порог. auto: True, если уверенность ≥ 0,9. Порог подобран на калибровочной выборке; на отложенных тестах решения выше него были верны в 95–96% случаев; ниже порога отдавайте решение человеку.
Совет. Числа, суммы и сроки считайте кодом и передавайте модели готовым фактом («сумма превышает лимит: да»). Модель читает регламент, но не считает.
Результаты
Все тесты — отложенные выборки, проверенные на пересечения с обучением. Вероятности — один прямой проход, softmax по буквам вариантов; температура подобрана на отдельной калибровочной выборке.
Автоматизация при 95% — какую долю решений можно отдать модели, если требовать 95% точности среди них (решения берутся по убыванию уверенности). Уверенные ошибки — доля ответов с уверенностью > 0,9, которые оказались неверными.
1. Русские задачи решений (6520 задач)
Открытые русские наборы и бизнес-регламенты новых типов, которых не было в обучении.
| Qwen3.5-4B (база) | tev1-4B | Kev-4B | YandexGPT-5-Lite-8B | GigaChat3.1-10B-A1.8B | ru-decision-4b | |
|---|---|---|---|---|---|---|
| Открытые русские наборы (TERRa, RCB, DaNetQA, отзывы, заголовки, MASSIVE) | 75,6 | 76,3 | 77,6 | 77,2 | 75,9 | 86,3 |
| Новые русские наборы (Кинопоиск, RuSciBench, CEDR, PARus, ruOpenBookQA, ruWorldTree) | 79,0 | 78,2 | 71,4 | 80,2 | 76,9 | 86,3 |
| Модерация (тип задачи не из обучения) | 72,2 | 69,8 | 67,5 | 81,2 | 71,0 | 60,2 |
| Регламенты новых типов | 57,2 | 64,7 | 67,3 | 44,5 | 43,3 | 86,3 |
| Те же регламенты, трудные стили записи | 56,2 | 70,9 | 66,9 | 45,6 | 47,3 | 84,2 |
| Регламенты с проверками, посчитанными кодом | 71,3 | 78,7 | 82,5 | 49,5 | 70,3 | 98,3 |
| Правило требует расчёта без готовой проверки → «передать на проверку» | 7,5 | 17,5 | 12,5 | 3,5 | 7,0 | 92,5 |
| Точность, итого | 71,8 | 74,7 | 73,1 | 69,0 | 68,9 | 84,5 |
| Автоматизация при 95% | 0,2% | 9,0% | 1,3% | 4,2% | 0,1% | 62,5% |
| Уверенные ошибки | 1,8% | 1,2% | 3,5% | 29,2% | 16,5% | 3,9% |
YandexGPT и GigaChat — без дообучения, по вероятностям букв ответа.
2. Задачи, которых не видела ни одна модель
8 русских наборов (Banking77-ru, жалобы граждан — ведомство и срочность, токсичность в поддержке, Georeview, RuCoLA, RWSD, ruHateSpeech), 260 реалистичных задач, написанных вручную, и публичная часть JevBench (231, англ.). Калибровка — одна для всех моделей.
| Qwen3.5-4B | tev1-4B | Kev-4B | Plumb-4B | Imajev-4B | YandexGPT-5-Lite-8B | GigaChat3.1-10B | ru-decision-4b | |
|---|---|---|---|---|---|---|---|---|
| Banking77-ru (77 классов) | 83,8 | 78,2 | 76,2 | 90,0 | 90,4 | 84,2 | 86,0 | 93,1 |
| Жалобы граждан: ведомство | 85,0 | 89,5 | 85,2 | 83,8 | 87,5 | 79,2 | 78,8 | 90,0 |
| Жалобы граждан: срочность | 40,3 | 39,0 | 39,3 | 40,7 | 43,7 | 38,0 | 28,0 | 41,7 |
| Токсичность в поддержке | 86,2 | 92,2 | 91,0 | 93,8 | 89,2 | 91,8 | 86,8 | 89,5 |
| Georeview: оценка 1–5 | 54,8 | 57,5 | 61,5 | 56,2 | 58,0 | 56,2 | 47,5 | 58,5 |
| RuCoLA | 73,2 | 69,2 | 70,2 | 71,0 | 70,0 | 72,2 | 68,5 | 69,5 |
| RWSD | 64,7 | 68,1 | 70,6 | 74,0 | 73,5 | 70,6 | 67,6 | 74,5 |
| ruHateSpeech | 74,4 | 85,6 | 74,0 | 86,5 | 85,6 | 85,6 | 84,7 | 81,4 |
| Среднее по 8 русским наборам | 70,3 | 72,4 | 71,0 | 74,5 | 74,7 | 72,2 | 68,5 | 74,8 |
| Реалистичные задачи (260) | 84,2 | 86,5 | 82,3 | 83,8 | 83,1 | 84,2 | 81,9 | 73,5 |
| JevBench public (231, англ.) | 79,7 | 76,6 | 71,9 | 88,3 | 86,1 | 67,1 | 67,1 | 75,3 |
| Автоматизация при 95% | 30,4 | 36,5 | 26,4 | 40,3 | 47,1 | 2,0 | 12,7 | 34,4 |
| Уверенные ошибки | 1,3 | 1,1 | 0,6 | 1,5 | 0,9 | 2,8 | 2,3 | 1,8 |
Итог честный: на задачах, которых не видел никто, модель лучшая в среднем по русским наборам, но не лидер по автоматизации и заметно слабее на реалистичных задачах с компенсациями (см. «Ограничения»).
3. Английский
Тест рецепта tev1 (1000 задач) и перенос политик (300):
| Qwen3.5-4B | tev1-4B | Kev-4B | ru-decision-4b | |
|---|---|---|---|---|
| Основной (1000) | 781 | 879 | 816 | 883 |
| Перенос политик (300) | 166 | 300 | 233 | 293 |
Обучение
- LoRA r16, alpha 32, все линейные слои; 1 эпоха, lr 1e-4 (cosine), 100 112 задач, ~5,5 ч на одной RTX 4090; выбран чекпойнт шага 7200 из 7801 по валидации.
- Функция потерь: кросс-энтропия по логитам букв вариантов + 0,3 × кросс-энтропия по всему словарю на токене правильной буквы.
- Данные:
- открытые русские наборы: TERRa, RCB, DaNetQA, отзывы, заголовки, MASSIVE ru-RU, Кинопоиск, RuSciBench (GRNTI/OECD), CEDR, PARus, ruOpenBookQA, ruWorldTree;
- синтетические бизнес-регламенты: 24 типа правил, 5 стилей записи, факты полями и живым текстом, контрастные пары; ответ вычисляется кодом. Варианты «недостаточно данных — передать человеку» и «нужен точный расчёт — передать на проверку»;
- 12 тыс. задач из Open-Jev community-hard-mix (redistributable);
- 20 тыс. английских задач по открытому рецепту tev1.
Ограничения
- Синтетические регламенты вымышлены: на ваших регламентах проверьте качество на собственной разметке (300–500 примеров достаточно).
- Не считает: многошаговую арифметику выносите в код.
- Перестраховка. Если регламент и обращение даны одним свободным текстом, модель часто выбирает «передать человеку»: на реалистичных задачах про компенсации — в большинстве случаев (верно 13%). Без варианта «передать человеку» там 48%. Лучше передавать факты отдельными полями и использовать порог уверенности вместо этого варианта.
- Не используйте как единственное основание для решений о людях (найм, кредиты, увольнения).
- Устойчивость к prompt injection внутри
stateспециально не измерялась.
Внедрить у себя
Модель — открытая, пользуйтесь свободно. Если нужно встроить её в ваши процессы: разметить ваши кейсы, дообучить на ваших регламентах, поднять у себя в контуре и посчитать, какую долю потока можно автоматизировать, — напишите в айфи.студио или в Telegram @aify_tech. Первый разбор задачи бесплатный.
Цитирование
@misc{ru-decision-4b,
title = {ru-decision-4b: модель решений для русского языка},
author = {айфи.студио},
year = {2026},
url = {https://huggingface.co/6E6E/ru-decision-4b}
}
Лицензии данных
TERRa, RCB, DaNetQA (MIT); ai-forever: ru-reviews, CEDR (Apache-2.0), headline, kinopoisk, RuSciBench (MIT); MERA (MIT); MASSIVE (Apache-2.0 / CC BY 4.0, © Amazon, FitzGerald et al., 2022); Open-Jev community-hard-mix redistributable (CC0 / CC BY 4.0); английская часть — источники рецепта tev1 под своими лицензиями. Базовая модель Qwen3.5-4B — Apache-2.0.
- Downloads last month
- 29
