ru-decision-4b: модель решений для русского языка

ru-decision-4b — модель решений для русского языка от айфи.студио

Код, данные и пошаговый туториал: github.com/GG1KENOBI/ru-decision-model

Сделано в айфи.студио — внедряем ИИ в бизнес там, где сотрудники тратят часы на однотипную работу.

ru-decision-4b не пишет текст, а выбирает один из заданных вариантов и возвращает вероятность каждого — за один прямой проход, 60–100 мс на RTX 4090.

На вход: данные (state), вопрос и список вариантов. На выход: вероятности вариантов. Подходит для маршрутизации обращений, проверки заявок по регламенту, срочности, тональности, интентов, сортировки документов.

Это LoRA-адаптер (130 МБ) к Qwen/Qwen3.5-4B. Языки: русский (основной) и английский.

Быстрый старт

pip install "transformers>=5.18" "peft>=0.21" torch accelerate
from decide import decide   # decide.py лежит в этом репозитории

print(decide(
    state=("Регламент: командировочные расходы до 5 000 ₽ в сутки согласует руководитель, "
           "свыше — финансовый директор. Без чеков расходы не возмещаются.\n"
           "Заявка: Иванов, Казань, 3 суток, гостиница 4 200 ₽/сутки, чеки приложены."),
    question="Кто согласует заявку?",
    options=["Руководитель.", "Финансовый директор.", "Отказать: нет чеков.",
             "Недостаточно данных — передать человеку."],
))
# {'choice': 'Руководитель.', 'confidence': 0.93, 'auto': True,
#  'probs': {'Руководитель.': 0.93, 'Финансовый директор.': 0.01, 'Отказать: нет чеков.': 0.0,
#            'Недостаточно данных — передать человеку.': 0.06}}

Внутри decide.py — всего 40 строк: системный промпт, JSON {state, question, options} в чат-шаблоне Qwen, логиты последней позиции по токенам букв A, B, C…, деление на температуру 1,4, softmax.

Порог. auto: True, если уверенность ≥ 0,9. Порог подобран на калибровочной выборке; на отложенных тестах решения выше него были верны в 95–96% случаев; ниже порога отдавайте решение человеку.

Совет. Числа, суммы и сроки считайте кодом и передавайте модели готовым фактом («сумма превышает лимит: да»). Модель читает регламент, но не считает.

Результаты

Все тесты — отложенные выборки, проверенные на пересечения с обучением. Вероятности — один прямой проход, softmax по буквам вариантов; температура подобрана на отдельной калибровочной выборке.

Автоматизация при 95% — какую долю решений можно отдать модели, если требовать 95% точности среди них (решения берутся по убыванию уверенности). Уверенные ошибки — доля ответов с уверенностью > 0,9, которые оказались неверными.

1. Русские задачи решений (6520 задач)

Открытые русские наборы и бизнес-регламенты новых типов, которых не было в обучении.

Qwen3.5-4B (база) tev1-4B Kev-4B YandexGPT-5-Lite-8B GigaChat3.1-10B-A1.8B ru-decision-4b
Открытые русские наборы (TERRa, RCB, DaNetQA, отзывы, заголовки, MASSIVE) 75,6 76,3 77,6 77,2 75,9 86,3
Новые русские наборы (Кинопоиск, RuSciBench, CEDR, PARus, ruOpenBookQA, ruWorldTree) 79,0 78,2 71,4 80,2 76,9 86,3
Модерация (тип задачи не из обучения) 72,2 69,8 67,5 81,2 71,0 60,2
Регламенты новых типов 57,2 64,7 67,3 44,5 43,3 86,3
Те же регламенты, трудные стили записи 56,2 70,9 66,9 45,6 47,3 84,2
Регламенты с проверками, посчитанными кодом 71,3 78,7 82,5 49,5 70,3 98,3
Правило требует расчёта без готовой проверки → «передать на проверку» 7,5 17,5 12,5 3,5 7,0 92,5
Точность, итого 71,8 74,7 73,1 69,0 68,9 84,5
Автоматизация при 95% 0,2% 9,0% 1,3% 4,2% 0,1% 62,5%
Уверенные ошибки 1,8% 1,2% 3,5% 29,2% 16,5% 3,9%

YandexGPT и GigaChat — без дообучения, по вероятностям букв ответа.

2. Задачи, которых не видела ни одна модель

8 русских наборов (Banking77-ru, жалобы граждан — ведомство и срочность, токсичность в поддержке, Georeview, RuCoLA, RWSD, ruHateSpeech), 260 реалистичных задач, написанных вручную, и публичная часть JevBench (231, англ.). Калибровка — одна для всех моделей.

Qwen3.5-4B tev1-4B Kev-4B Plumb-4B Imajev-4B YandexGPT-5-Lite-8B GigaChat3.1-10B ru-decision-4b
Banking77-ru (77 классов) 83,8 78,2 76,2 90,0 90,4 84,2 86,0 93,1
Жалобы граждан: ведомство 85,0 89,5 85,2 83,8 87,5 79,2 78,8 90,0
Жалобы граждан: срочность 40,3 39,0 39,3 40,7 43,7 38,0 28,0 41,7
Токсичность в поддержке 86,2 92,2 91,0 93,8 89,2 91,8 86,8 89,5
Georeview: оценка 1–5 54,8 57,5 61,5 56,2 58,0 56,2 47,5 58,5
RuCoLA 73,2 69,2 70,2 71,0 70,0 72,2 68,5 69,5
RWSD 64,7 68,1 70,6 74,0 73,5 70,6 67,6 74,5
ruHateSpeech 74,4 85,6 74,0 86,5 85,6 85,6 84,7 81,4
Среднее по 8 русским наборам 70,3 72,4 71,0 74,5 74,7 72,2 68,5 74,8
Реалистичные задачи (260) 84,2 86,5 82,3 83,8 83,1 84,2 81,9 73,5
JevBench public (231, англ.) 79,7 76,6 71,9 88,3 86,1 67,1 67,1 75,3
Автоматизация при 95% 30,4 36,5 26,4 40,3 47,1 2,0 12,7 34,4
Уверенные ошибки 1,3 1,1 0,6 1,5 0,9 2,8 2,3 1,8

Итог честный: на задачах, которых не видел никто, модель лучшая в среднем по русским наборам, но не лидер по автоматизации и заметно слабее на реалистичных задачах с компенсациями (см. «Ограничения»).

3. Английский

Тест рецепта tev1 (1000 задач) и перенос политик (300):

Qwen3.5-4B tev1-4B Kev-4B ru-decision-4b
Основной (1000) 781 879 816 883
Перенос политик (300) 166 300 233 293

Обучение

  • LoRA r16, alpha 32, все линейные слои; 1 эпоха, lr 1e-4 (cosine), 100 112 задач, ~5,5 ч на одной RTX 4090; выбран чекпойнт шага 7200 из 7801 по валидации.
  • Функция потерь: кросс-энтропия по логитам букв вариантов + 0,3 × кросс-энтропия по всему словарю на токене правильной буквы.
  • Данные:
    • открытые русские наборы: TERRa, RCB, DaNetQA, отзывы, заголовки, MASSIVE ru-RU, Кинопоиск, RuSciBench (GRNTI/OECD), CEDR, PARus, ruOpenBookQA, ruWorldTree;
    • синтетические бизнес-регламенты: 24 типа правил, 5 стилей записи, факты полями и живым текстом, контрастные пары; ответ вычисляется кодом. Варианты «недостаточно данных — передать человеку» и «нужен точный расчёт — передать на проверку»;
    • 12 тыс. задач из Open-Jev community-hard-mix (redistributable);
    • 20 тыс. английских задач по открытому рецепту tev1.

Ограничения

  • Синтетические регламенты вымышлены: на ваших регламентах проверьте качество на собственной разметке (300–500 примеров достаточно).
  • Не считает: многошаговую арифметику выносите в код.
  • Перестраховка. Если регламент и обращение даны одним свободным текстом, модель часто выбирает «передать человеку»: на реалистичных задачах про компенсации — в большинстве случаев (верно 13%). Без варианта «передать человеку» там 48%. Лучше передавать факты отдельными полями и использовать порог уверенности вместо этого варианта.
  • Не используйте как единственное основание для решений о людях (найм, кредиты, увольнения).
  • Устойчивость к prompt injection внутри state специально не измерялась.

Внедрить у себя

Модель — открытая, пользуйтесь свободно. Если нужно встроить её в ваши процессы: разметить ваши кейсы, дообучить на ваших регламентах, поднять у себя в контуре и посчитать, какую долю потока можно автоматизировать, — напишите в айфи.студио или в Telegram @aify_tech. Первый разбор задачи бесплатный.

Цитирование

@misc{ru-decision-4b,
  title  = {ru-decision-4b: модель решений для русского языка},
  author = {айфи.студио},
  year   = {2026},
  url    = {https://huggingface.co/6E6E/ru-decision-4b}
}

Лицензии данных

TERRa, RCB, DaNetQA (MIT); ai-forever: ru-reviews, CEDR (Apache-2.0), headline, kinopoisk, RuSciBench (MIT); MERA (MIT); MASSIVE (Apache-2.0 / CC BY 4.0, © Amazon, FitzGerald et al., 2022); Open-Jev community-hard-mix redistributable (CC0 / CC BY 4.0); английская часть — источники рецепта tev1 под своими лицензиями. Базовая модель Qwen3.5-4B — Apache-2.0.

Downloads last month
29
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for 6E6E/ru-decision-4b

Finetuned
Qwen/Qwen3.5-4B
Adapter
(715)
this model

Datasets used to train 6E6E/ru-decision-4b