Instructions to use aurelianvolturi/all-MiniLM-L6-v2-ru-hnp-triplet with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use aurelianvolturi/all-MiniLM-L6-v2-ru-hnp-triplet with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("aurelianvolturi/all-MiniLM-L6-v2-ru-hnp-triplet") sentences = [ "Это счастливый человек", "Это счастливая собака", "Это очень счастливый человек", "Сегодня солнечный день" ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [4, 4] - Notebooks
- Google Colab
- Kaggle
all-MiniLM-L6-v2 — адаптация на ru-HNP через TripletLoss
Модель получена из sentence-transformers/all-MiniLM-L6-v2 дообучением на русскоязычном
deepvk/ru-HNP. Использовано 20000 исходных строк,
20000 валидных триплетов, query как anchor, pos[0] как positive
и neg[0] как hard negative.
Обучение
- TripletLoss, cosine distance, margin = 0.2
- batch size = 16
- epochs = 3
- steps per epoch = 1250
- total steps = 3750
- warmup steps = 375 (10.00%)
- seed = 42
Оценка на ai-forever/rubq-retrieval
Обе модели оценены одной функцией на полном корпусе и всех
1692 запросах с положительными qrels.
Использованы L2-нормированные эмбеддинги и faiss.IndexFlatIP.
| Метрика | Базовая модель | Дообученная модель | Абсолютное изменение | Относительное изменение |
|---|---|---|---|---|
| Recall@5 | 0.027194 | 0.021298 | -0.005896 | -21.68% |
| Recall@10 | 0.035025 | 0.029375 | -0.005650 | -16.13% |
UMAP
Silhouette рассчитан в отдельной двумерной UMAP-проекции
ai-forever/headline-classification (test[:1000], text/label_text):
- базовая модель: -0.082124
- дообученная модель: -0.086733
- изменение: -0.004609
UMAP — диагностическая 2D-проекция, а не retrieval-метрика. Изменение Silhouette в UMAP не доказывает улучшение поиска в исходном 384-мерном пространстве.
Ограничения
ru-HNP преимущественно содержит симметричные парафразы и сложные непарафразы,
тогда как RubQ — несимметричная задача «короткий вопрос → документ». Совпадение
языка не гарантирует совпадение предметной области, типа задачи, длины или стиля.
Результат относится к одному seed, одному набору гиперпараметров и первым 20 000
строкам обучающего датасета.
- Downloads last month
- 88
Model tree for aurelianvolturi/all-MiniLM-L6-v2-ru-hnp-triplet
Base model
nreimers/MiniLM-L6-H384-uncased