Sentence Similarity
sentence-transformers
Safetensors
Russian
bert
embeddings
semantic-search
triplet-loss
russian
text-embeddings-inference
Instructions to use aurelianvolturi/all-MiniLM-L6-v2-ru-hnp-triplet with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use aurelianvolturi/all-MiniLM-L6-v2-ru-hnp-triplet with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("aurelianvolturi/all-MiniLM-L6-v2-ru-hnp-triplet") sentences = [ "Это счастливый человек", "Это счастливая собака", "Это очень счастливый человек", "Сегодня солнечный день" ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [4, 4] - Notebooks
- Google Colab
- Kaggle
|
Download README.md from aurelianvolturi/all-MiniLM-L6-v2-ru-hnp-triplet: direct link, hf CLI and curl.
- Browser
- Download file 2.76 kB
-
https://huggingface.co/aurelianvolturi/all-MiniLM-L6-v2-ru-hnp-triplet/resolve/main/README.md
- Command line
-
hf download hf://aurelianvolturi/all-MiniLM-L6-v2-ru-hnp-triplet/README.md
-
curl -L -o README.md https://huggingface.co/aurelianvolturi/all-MiniLM-L6-v2-ru-hnp-triplet/resolve/main/README.md
2.76 kB
| language: | |
| - ru | |
| license: apache-2.0 | |
| library_name: sentence-transformers | |
| pipeline_tag: sentence-similarity | |
| base_model: sentence-transformers/all-MiniLM-L6-v2 | |
| datasets: | |
| - deepvk/ru-HNP | |
| - ai-forever/rubq-retrieval | |
| tags: | |
| - sentence-transformers | |
| - embeddings | |
| - semantic-search | |
| - triplet-loss | |
| - russian | |
| # all-MiniLM-L6-v2 — адаптация на ru-HNP через TripletLoss | |
| Модель получена из `sentence-transformers/all-MiniLM-L6-v2` дообучением на русскоязычном | |
| `deepvk/ru-HNP`. Использовано 20000 исходных строк, | |
| 20000 валидных триплетов, `query` как anchor, `pos[0]` как positive | |
| и `neg[0]` как hard negative. | |
| ## Обучение | |
| - TripletLoss, cosine distance, margin = 0.2 | |
| - batch size = 16 | |
| - epochs = 3 | |
| - steps per epoch = 1250 | |
| - total steps = 3750 | |
| - warmup steps = 375 (10.00%) | |
| - seed = 42 | |
| ## Оценка на ai-forever/rubq-retrieval | |
| Обе модели оценены одной функцией на полном корпусе и всех | |
| 1692 запросах с положительными qrels. | |
| Использованы L2-нормированные эмбеддинги и `faiss.IndexFlatIP`. | |
| | Метрика | Базовая модель | Дообученная модель | Абсолютное изменение | Относительное изменение | | |
| |---|---:|---:|---:|---:| | |
| | Recall@5 | 0.027194 | 0.021298 | -0.005896 | -21.68% | | |
| | Recall@10 | 0.035025 | 0.029375 | -0.005650 | -16.13% | | |
| ## UMAP | |
| Silhouette рассчитан в отдельной двумерной UMAP-проекции | |
| `ai-forever/headline-classification` (`test[:1000]`, `text`/`label_text`): | |
| - базовая модель: -0.082124 | |
| - дообученная модель: -0.086733 | |
| - изменение: -0.004609 | |
| UMAP — диагностическая 2D-проекция, а не retrieval-метрика. Изменение Silhouette | |
| в UMAP не доказывает улучшение поиска в исходном 384-мерном пространстве. | |
| ## Ограничения | |
| `ru-HNP` преимущественно содержит симметричные парафразы и сложные непарафразы, | |
| тогда как RubQ — несимметричная задача «короткий вопрос → документ». Совпадение | |
| языка не гарантирует совпадение предметной области, типа задачи, длины или стиля. | |
| Результат относится к одному seed, одному набору гиперпараметров и первым 20 000 | |
| строкам обучающего датасета. | |