aurelianvolturi's picture
Update ru-HNP TripletLoss model and evaluated metrics
f50ebd0 verified
|
Raw History Blame Contribute Delete
2.76 kB
---
language:
- ru
license: apache-2.0
library_name: sentence-transformers
pipeline_tag: sentence-similarity
base_model: sentence-transformers/all-MiniLM-L6-v2
datasets:
- deepvk/ru-HNP
- ai-forever/rubq-retrieval
tags:
- sentence-transformers
- embeddings
- semantic-search
- triplet-loss
- russian
---
# all-MiniLM-L6-v2 — адаптация на ru-HNP через TripletLoss
Модель получена из `sentence-transformers/all-MiniLM-L6-v2` дообучением на русскоязычном
`deepvk/ru-HNP`. Использовано 20000 исходных строк,
20000 валидных триплетов, `query` как anchor, `pos[0]` как positive
и `neg[0]` как hard negative.
## Обучение
- TripletLoss, cosine distance, margin = 0.2
- batch size = 16
- epochs = 3
- steps per epoch = 1250
- total steps = 3750
- warmup steps = 375 (10.00%)
- seed = 42
## Оценка на ai-forever/rubq-retrieval
Обе модели оценены одной функцией на полном корпусе и всех
1692 запросах с положительными qrels.
Использованы L2-нормированные эмбеддинги и `faiss.IndexFlatIP`.
| Метрика | Базовая модель | Дообученная модель | Абсолютное изменение | Относительное изменение |
|---|---:|---:|---:|---:|
| Recall@5 | 0.027194 | 0.021298 | -0.005896 | -21.68% |
| Recall@10 | 0.035025 | 0.029375 | -0.005650 | -16.13% |
## UMAP
Silhouette рассчитан в отдельной двумерной UMAP-проекции
`ai-forever/headline-classification` (`test[:1000]`, `text`/`label_text`):
- базовая модель: -0.082124
- дообученная модель: -0.086733
- изменение: -0.004609
UMAP — диагностическая 2D-проекция, а не retrieval-метрика. Изменение Silhouette
в UMAP не доказывает улучшение поиска в исходном 384-мерном пространстве.
## Ограничения
`ru-HNP` преимущественно содержит симметричные парафразы и сложные непарафразы,
тогда как RubQ — несимметричная задача «короткий вопрос → документ». Совпадение
языка не гарантирует совпадение предметной области, типа задачи, длины или стиля.
Результат относится к одному seed, одному набору гиперпараметров и первым 20 000
строкам обучающего датасета.