SentenceTransformer based on deepvk/USER-bge-m3

This is a sentence-transformers model finetuned from deepvk/USER-bge-m3. It maps sentences & paragraphs to a 1024-dimensional dense vector space and can be used for retrieval.

Model Details

Model Description

  • Model Type: Sentence Transformer
  • Base model: deepvk/USER-bge-m3
  • Maximum Sequence Length: 8192 tokens
  • Output Dimensionality: 1024 dimensions
  • Similarity Function: Cosine Similarity
  • Supported Modality: Text

Model Sources

Full Model Architecture

SentenceTransformer(
  (0): Transformer({'transformer_task': 'feature-extraction', 'modality_config': {'text': {'method': 'forward', 'method_output_name': 'last_hidden_state'}}, 'module_output_name': 'token_embeddings', 'architecture': 'XLMRobertaModel'})
  (1): Pooling({'embedding_dimension': 1024, 'pooling_mode': 'cls', 'include_prompt': True})
  (2): Normalize({})
)

Usage

Direct Usage (Sentence Transformers)

First install the Sentence Transformers library:

pip install -U sentence-transformers

Then you can load this model and run inference.

from sentence_transformers import SentenceTransformer

# Download from the 🤗 Hub
model = SentenceTransformer("shezoff/voproshalyach-bge-m3")
# Run inference
sentences = [
    'Как долго рассматривают апелляцию?',
    'Апелляция рассматривается в срок не позднее двух рабочих дней со дня\nподачи апелляции на заседании апелляционной комиссии.',
    'До даты проведения заседания наблюдательного совета\nУниверситета, а также непосредственно на заседании могут быть\nпредставлены дополнительные материалы для рассмотрения по вопросам\nповестки дня.\n\n4.35. В заседании наблюдательного совета Университета вправе\nучаствовать ректор Университета. Иные приглашенные председателем\nнаблюдательного совета Университета лица могут участвовать в заседании\nнаблюдательного совета Университета, если против их присутствия\nне возражает более чем одна треть от общего числа членов\nнаблюдательного совета Университета.\n\n4.36. Заседание наблюдательного совета Университета является\nправомочным, если все члены наблюдательного совета Университета\nизвещены о времени и месте его проведения, и на заседании присутствует\nболее половины членов наблюдательного совета Университета. Передача\nчленом наблюдательного совета Университета своего голоса другому лицу\nне допускается.',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 1024]

# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities)
# tensor([[1.0000, 0.7062, 0.1257],
#         [0.7062, 1.0000, 0.1362],
#         [0.1257, 0.1362, 1.0000]])

Training Details

Training Dataset

Unnamed Dataset

  • Size: 667 training samples
  • Columns: sentence_0 and sentence_1
  • Approximate statistics based on the first 667 samples:
    sentence_0 sentence_1
    type string string
    details
    • min: 6 tokens
    • mean: 14.43 tokens
    • max: 27 tokens
    • min: 27 tokens
    • mean: 172.1 tokens
    • max: 255 tokens
  • Samples:
    sentence_0 sentence_1
    Какие варианты решений можно выбрать на голосовании? уведомление, в котором указывается на принятие решения в форме
    заочного голосования и указывается период получения заполненных
    бюллетеней;

    информационные материалы, необходимые для принятия решений
    по вопросам повестки заседания наблюдательного совета Университета;
    | именные бюллетени для голосования, предлагающие выбрать членам
    наблюдательного совета Универбитета 1 (один) из 3 (трех) вариантов
    решения по вопросу повестки дня: «за», «воздержался» или «против».

    Решения наблюдательного совета Университета принимаются
    на основании полученных заполненных и подписанных членами
    наблюдательного совета Университета бюллетеней, которые могут
    направляться в Университет посредством почтовой, телеграфной,
    электронной или иной — связи, обеспечивающей — аутентичность
    передаваемых и принимаемых сообщений.
    Как составляется расписание занятий? Окончание учебного года устанавливается календарными учебными
    графиками по соответствующей образовательной программе.

    3.1.3. Организация образовательного процесса в Университете
    по образовательным программам высшего образования регламентируется
    учебным планом, календарным учебным графиком.

    3.1.4. Формирование учебных групп для проведения занятий различного
    типа регламентируется соответствующим локальным нормативным актом
    Университета.

    3.1.5. Занятия проводятся в соответствии с расписанием, составленным
    в соответствии с локальным нормативным актом Университета.
    При составлении расписаний занятий, проводимых в форме контактной работы,
    Университет исключает нерациональные затраты времени обучающихся.

    3.1.6. Для всех видов аудиторных занятий академический час
    устанавливается продолжительностью 45 минут. Одно занятие включает два
    академических часа. Перерывы между учебными занятиями должны быть
    продолжительностью от 10 до 30 минут.
    Как объединялся Тюменский государственный университет с Ишимским педагогическим институтом? Федеральное государственное бюджетное образовательное
    учреждение высшего образования «Тюменский государственный
    университет» образован 1 января 1973 года постановлением Совета
    Министров СССР от 23 марта 1972 г. № 199, постановлением Совета
    Министров РСФСР от 10 апреля 1972 г. № 222 и приказом Министра
    высшего и среднего специального образования РОФСР от 10 мая 1972 г.
    №237 на базе Тюменского педагогического института Министерства
    просвещения РСФСР как Тюменский государственный университет.

    Приказом Министерства образования и науки Российской Федерации
    от 30 августа 2013 г. № 1013 федеральное государственное бюджетное
    образовательное учреждение высшего профессионального образования
    «Тюменский государственный университет» реорганизован в форме
    присоединения к нему федерального государственного бюджетного
    образовательного учреждения высшего профессионального образования
    «Ишимский государственный педагогический институт ПЛТ. Ершова»
    2
  • Loss: MultipleNegativesRankingLoss with these parameters:
    {
        "scale": 20.0,
        "similarity_fct": "cos_sim",
        "gather_across_devices": false,
        "directions": [
            "query_to_doc"
        ],
        "partition_mode": "joint",
        "hardness_mode": null,
        "hardness_strength": 0.0
    }
    

Training Hyperparameters

Non-Default Hyperparameters

  • multi_dataset_batch_sampler: round_robin

All Hyperparameters

Click to expand
  • per_device_train_batch_size: 8
  • num_train_epochs: 3
  • max_steps: -1
  • learning_rate: 5e-05
  • lr_scheduler_type: linear
  • lr_scheduler_kwargs: None
  • warmup_steps: 0
  • optim: adamw_torch_fused
  • optim_args: None
  • weight_decay: 0.0
  • adam_beta1: 0.9
  • adam_beta2: 0.999
  • adam_epsilon: 1e-08
  • optim_target_modules: None
  • gradient_accumulation_steps: 1
  • average_tokens_across_devices: True
  • max_grad_norm: 1
  • label_smoothing_factor: 0.0
  • bf16: False
  • fp16: False
  • bf16_full_eval: False
  • fp16_full_eval: False
  • tf32: None
  • gradient_checkpointing: False
  • gradient_checkpointing_kwargs: None
  • torch_compile: False
  • torch_compile_backend: None
  • torch_compile_mode: None
  • use_liger_kernel: False
  • liger_kernel_config: None
  • use_cache: False
  • neftune_noise_alpha: None
  • torch_empty_cache_steps: None
  • auto_find_batch_size: False
  • log_on_each_node: True
  • logging_nan_inf_filter: True
  • include_num_input_tokens_seen: no
  • log_level: passive
  • log_level_replica: warning
  • disable_tqdm: False
  • project: huggingface
  • trackio_space_id: None
  • trackio_bucket_id: None
  • trackio_static_space_id: None
  • per_device_eval_batch_size: 8
  • prediction_loss_only: True
  • eval_on_start: False
  • eval_do_concat_batches: True
  • eval_use_gather_object: False
  • eval_accumulation_steps: None
  • include_for_metrics: []
  • batch_eval_metrics: False
  • save_only_model: False
  • save_on_each_node: False
  • enable_jit_checkpoint: False
  • push_to_hub: False
  • hub_private_repo: None
  • hub_model_id: None
  • hub_strategy: every_save
  • hub_always_push: False
  • hub_revision: None
  • load_best_model_at_end: False
  • ignore_data_skip: False
  • restore_callback_states_from_checkpoint: False
  • full_determinism: False
  • seed: 42
  • data_seed: None
  • use_cpu: False
  • accelerator_config: {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}
  • parallelism_config: None
  • dataloader_drop_last: False
  • dataloader_num_workers: 0
  • dataloader_pin_memory: True
  • dataloader_persistent_workers: False
  • dataloader_prefetch_factor: None
  • remove_unused_columns: True
  • label_names: None
  • train_sampling_strategy: random
  • length_column_name: length
  • ddp_find_unused_parameters: None
  • ddp_bucket_cap_mb: None
  • ddp_broadcast_buffers: False
  • ddp_static_graph: None
  • ddp_backend: None
  • ddp_timeout: 1800
  • fsdp: []
  • fsdp_config: {'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}
  • deepspeed: None
  • debug: []
  • skip_memory_metrics: True
  • do_predict: False
  • resume_from_checkpoint: None
  • warmup_ratio: None
  • local_rank: -1
  • prompts: None
  • batch_sampler: batch_sampler
  • multi_dataset_batch_sampler: round_robin
  • router_mapping: {}
  • learning_rate_mapping: {}

Training Time

  • Training: 13.3 minutes

Framework Versions

  • Python: 3.14.2
  • Sentence Transformers: 5.4.1
  • Transformers: 5.8.0
  • PyTorch: 2.11.0+cu130
  • Accelerate: 1.13.0
  • Datasets: 4.8.5
  • Tokenizers: 0.22.2

Citation

BibTeX

Sentence Transformers

@inproceedings{reimers-2019-sentence-bert,
    title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
    author = "Reimers, Nils and Gurevych, Iryna",
    booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
    month = "11",
    year = "2019",
    publisher = "Association for Computational Linguistics",
    url = "https://arxiv.org/abs/1908.10084",
}

MultipleNegativesRankingLoss

@misc{oord2019representationlearningcontrastivepredictive,
      title={Representation Learning with Contrastive Predictive Coding},
      author={Aaron van den Oord and Yazhe Li and Oriol Vinyals},
      year={2019},
      eprint={1807.03748},
      archivePrefix={arXiv},
      primaryClass={cs.LG},
      url={https://arxiv.org/abs/1807.03748},
}
Downloads last month
85
Safetensors
Model size
0.4B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for shezoff/voproshalych-bge-m3

Finetuned
(15)
this model

Papers for shezoff/voproshalych-bge-m3