SentenceTransformer based on sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2
This is a sentence-transformers model finetuned from sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 on the experiment_data_knowledge_distillation_vs_fine_tuning dataset. It maps inputs to a 384-dimensional dense vector space and can be used for semantic textual similarity, semantic search, paraphrase mining, classification, clustering, and more.
Model Details
Model Description
- Model Type: Sentence Transformer
- Base model: sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2
- Maximum Sequence Length: 128 tokens
- Output Dimensionality: 384 dimensions
- Similarity Function: Cosine Similarity
- Supported Modality: Text
- Training Dataset:
- experiment_data_knowledge_distillation_vs_fine_tuning
Model Sources
Full Model Architecture
SentenceTransformer(
(0): Transformer({'transformer_task': 'feature-extraction', 'modality_config': {'text': {'method': 'forward', 'method_output_name': 'last_hidden_state'}}, 'module_output_name': 'token_embeddings', 'architecture': 'BertModel'})
(1): Pooling({'embedding_dimension': 384, 'pooling_mode': 'mean', 'include_prompt': True})
)
Usage
Direct Usage (Sentence Transformers)
First install the Sentence Transformers library:
pip install -U sentence-transformers
Then you can load this model and run inference.
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("hatemestinbejaia/R3mmarco-Arabic-mMiniLML-bi-encoder-KD-v1")
queries = [
'ماذا يعني اسم ديونيسوس',
]
documents = [
'ديونيسوس . إله الكرمة ، وحصاد العنب ، وصناعة النبيذ ، والنبيذ ، وطقوس الجنون ، والنشوة الدينية ، والمسرح',
'اسم دينيس هو اسم طفل إنجليزي . في اللغة الإنجليزية ، معنى الاسم Denise هو : من اللاتينية Dionysos أو Dionysus ، في إشارة إلى إله النبيذ اليوناني . المعنى الأمريكي : اسم دينيس هو اسم طفل أمريكي .',
'رقم هاتف مطبعة جامعة كامبريدج في نيويورك هو 3900 - 924 - 924 . مطبعة جامعة كامبريدج هي دار نشر مشهورة في الأسواق المحلية والدولية وتنشر مجموعة متنوعة من الكتب المتعلقة بالأكاديمية والطب وتعليم اللغة والعلوم الإنسانية وغير ذلك الكثير .',
]
query_embeddings = model.encode_query(queries)
document_embeddings = model.encode_document(documents)
print(query_embeddings.shape, document_embeddings.shape)
similarities = model.similarity(query_embeddings, document_embeddings)
print(similarities)
Evaluation
Metrics
Reranking
| Metric |
Value |
| map |
0.5751 |
| mrr@10 |
0.578 |
| ndcg@10 |
0.6429 |
Training Details
Training Dataset
experiment_data_knowledge_distillation_vs_fine_tuning
- Dataset: experiment_data_knowledge_distillation_vs_fine_tuning
- Size: 5,000,000 training samples
- Columns:
query, pos, neg, and label
- Approximate statistics based on the first 100 samples:
|
query |
pos |
neg |
label |
| type |
string |
string |
string |
float |
| modality |
text |
text |
text |
|
| details |
- min: 5 tokens
- mean: 11.31 tokens
- max: 20 tokens
|
- min: 13 tokens
- mean: 91.55 tokens
- max: 128 tokens
|
- min: 41 tokens
- mean: 89.69 tokens
- max: 128 tokens
|
- min: -1.83
- mean: 12.59
- max: 20.47
|
- Samples:
| query |
pos |
neg |
label |
القليل من الكافيين جيد أثناء الحمل |
نحن لا نعرف الكثير عن تأثيرات الكافيين أثناء الحمل عليك وعلى طفلك . لذلك فمن الأفضل أن تحد من المبلغ الذي تحصل عليه كل يوم . إذا كنت حاملا ، قللي من تناول الكافيين إلى 200 ملليجرام يوميا . هذا هو الكمية الموجودة في فنجان واحد سعة 8 أونصات من القهوة أو فنجان قهوة سعة 12 أونصة . |
من الآمن عموما أن تتناول النساء الحوامل الشوكولاتة لأن الدراسات أثبتت وجود فوائد معينة لتناول الشوكولاتة أثناء الحمل . ومع ذلك ، يجب على النساء الحوامل التأكد من أن تناول الكافيين أقل من 200 مجم في اليوم . |
4.0280589908361435 |
ما هي الفاكهة الأصلية في أستراليا |
Passiflora herbertiana . فاكهة العاطفة النادرة موطنها أستراليا . الثمار ذات قشرة خضراء ، بيضاء اللون ، مع تصنيف غير معروف للأكل . تسرد بعض المصادر الفاكهة على أنها صالحة للأكل وحلوة ولذيذة ، بينما يسرد البعض الآخر الفاكهة على أنها مرة وغير صالحة للأكل . فاكهة العاطفة النادرة موطنها أستراليا . الثمار ذات قشرة خضراء ، بيضاء اللون ، مع تصنيف غير معروف للأكل . تسرد بعض المصادر الفاكهة على أنها صالحة للأكل وحلوة ولذيذة ، بينما يسرد البعض الآخر الفواكه على أنها مرة وغير صالحة للأكل . |
جوز الكولا هو ثمرة شجرة الكولا ، وهي جنس ( كولا ) من الأشجار التي تنتمي إلى الغابات الاستوائية المطيرة في إفريقيا . |
10.18145449956258 |
ما هو حجم الجيش الكندي |
القوات المسلحة الكندية . 1 بدأت أول مهمة حفظ سلام كندية واسعة النطاق في مصر في 24 نوفمبر 1956 . 2 هناك ما يقرب من 65000 من القوات النظامية و 25000 من أفراد الاحتياط في الجيش الكندي . 3 في كندا ، تم تحديد يوم 9 أغسطس كيوم حفظة السلام الوطنيين . |
المعهد الكندي لصحة الأطباء ( CPHI ) هو برنامج وطني تم إنشاؤه في عام 2012 كتعاون بين الجمعية الطبية الكندية ( CMA ) والمؤسسة الطبية الكندية ( CMF ) والجمعيات الطبية الإقليمية والإقليمية ( PTMAs ) . |
16.420575777689614 |
- Loss:
main.combine_dstilationLoss_studentLoss
Evaluation Dataset
experiment_data_knowledge_distillation_vs_fine_tuning
- Dataset: experiment_data_knowledge_distillation_vs_fine_tuning
- Size: 10,000 evaluation samples
- Columns:
query, pos, neg, and label
- Approximate statistics based on the first 100 samples:
|
query |
pos |
neg |
label |
| type |
string |
string |
string |
float |
| modality |
text |
text |
text |
|
| details |
- min: 5 tokens
- mean: 10.56 tokens
- max: 23 tokens
|
- min: 47 tokens
- mean: 91.06 tokens
- max: 128 tokens
|
- min: 48 tokens
- mean: 79.22 tokens
- max: 128 tokens
|
- min: 2.19
- mean: 13.84
- max: 21.47
|
- Samples:
| query |
pos |
neg |
label |
ما هو اسم د . كوين |
اعرض الشخصيات المختلفة التي لعبها نفس الممثل . الدكتورة ميكايلا كوين . ولدت ميكايلا في 15 فبراير 1833 في بوسطن ، ماساتشوستس ، لأبوين جوزيف وإليزابيث كوين . هناك نشأت مع شقيقاتها الأربع : ماري ( التي تم تغيير اسمها إلى ريبيكا ) ، ومارجوري ، وكلوديت ، ومورين . كان والدها يريد ابنا ، لذلك عندما ولدت أطلق عليها اسم ميكايلا ( الملقب مايك ) . |
ليس لدى د . ماكفارلاند أي تأمينات مدرجة . إذا كنت دكتور ماكفارلاند وترغب في إضافة تأمينات تقبلها ، يرجى تحديث ملفك التعريفي المجاني . الانتساب إلى المستشفى ينتمي د . ماكفارلاند إلى المستشفيات التالية . |
15.524045944213867 |
من يلعب دور بيرني مادوف |
ساحر الأكاذيب هو واحد من اثنين من مشاريع Madoff التلفزيونية قيد الإعداد . ABC لديها مسلسل قصير قادم يسمى مادوف ، من بطولة ريتشارد دريفوس وبليث دانر . قصص ذات الصلة . روبرت دي نيرو يسجل الدخول للعب بيرني مادوف في فيلم HBO المحتمل . |
اتهمت السلطات الأمريكية مسؤول تنفيذي للمحاسبة يزعم أنه ساعد برنارد مادوف في مخطط بونزي الذي تبلغ تكلفته عدة مليارات من الدولارات ، والذي يوسع نطاق تحقيقه في الاحتيال بعد خمس سنوات من اكتشافه . |
13.17703644434611 |
كم قدم مكعب في طن من حصى البازلاء |
لذلك 1 طن لديه 2000 - 100 أو 20 قدم مكعب من الحصى . الفناء المكعب هو 3x3x3 = 27 قدما مكعبا من الفناء المكعب ، الإجابة 20 - 27 أو 0 . 74 ياردة مكعبة . العوامل الأخرى التي تؤثر على حجم الحصى هي محتوى الرطوبة ودرجات المواد . يحتوي حصى البازلاء على سبيل المثال على جميع الجزيئات ذات الحجم المحدد ، على سبيل المثال ، 1 - 4 بوصة ، حوالي 120 رطلا للإشارة فقط : 1 قدم مكعب = 6 . 25 جالون ( إمبراطوري ) ، جالون من الماء يزن 10 أرطال ، لذا فإن القدم المكعبة من الماء تزن 62 . 5 رطلا . هذا يعني أن الجاذبية النوعية للحصى هي 120 - 62 . 5 ، أو أقل قليلا من 2 . |
1 كيس قدم مكعب واحد ( التربة والمهاد ) يغطي ما يقرب من 8 أقدام مربعة إلى عمق 3 . 2 كيس واحد 75 رطلا ( الحصى والرمل ) يغطي حوالي 4 أقدام مربعة إلى عمق 3 . 3 بوصات سميكة ستغطي حوالي 300 قدم مربع . سيغطي سمك 1 حوالي 150 قدما مربعا . |
10.34702980518341 |
- Loss:
main.combine_dstilationLoss_studentLoss
Training Hyperparameters
Non-Default Hyperparameters
per_device_train_batch_size: 16
learning_rate: 7e-06
warmup_steps: 0.07
gradient_accumulation_steps: 8
fp16: True
load_best_model_at_end: True
All Hyperparameters
Click to expand
per_device_train_batch_size: 16
num_train_epochs: 3
max_steps: -1
learning_rate: 7e-06
lr_scheduler_type: linear
lr_scheduler_kwargs: None
warmup_steps: 0.07
optim: adamw_torch_fused
optim_args: None
weight_decay: 0.0
adam_beta1: 0.9
adam_beta2: 0.999
adam_epsilon: 1e-08
optim_target_modules: None
gradient_accumulation_steps: 8
average_tokens_across_devices: True
max_grad_norm: 1.0
label_smoothing_factor: 0.0
bf16: False
fp16: True
bf16_full_eval: False
fp16_full_eval: False
tf32: None
gradient_checkpointing: False
gradient_checkpointing_kwargs: None
torch_compile: False
torch_compile_backend: None
torch_compile_mode: None
use_liger_kernel: False
liger_kernel_config: None
use_cache: False
neftune_noise_alpha: None
torch_empty_cache_steps: None
auto_find_batch_size: False
log_on_each_node: True
logging_nan_inf_filter: True
include_num_input_tokens_seen: no
log_level: passive
log_level_replica: warning
disable_tqdm: False
project: huggingface
trackio_space_id: None
trackio_bucket_id: None
trackio_static_space_id: None
per_device_eval_batch_size: 8
prediction_loss_only: True
eval_on_start: False
eval_do_concat_batches: True
eval_use_gather_object: False
eval_accumulation_steps: None
include_for_metrics: []
batch_eval_metrics: False
save_only_model: False
save_on_each_node: False
enable_jit_checkpoint: False
push_to_hub: False
hub_private_repo: None
hub_model_id: None
hub_strategy: every_save
hub_always_push: False
hub_revision: None
load_best_model_at_end: True
ignore_data_skip: False
restore_callback_states_from_checkpoint: False
full_determinism: False
seed: 42
data_seed: None
use_cpu: False
accelerator_config: {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}
parallelism_config: None
dataloader_drop_last: False
dataloader_num_workers: 0
dataloader_pin_memory: True
dataloader_persistent_workers: False
dataloader_prefetch_factor: None
dataloader_multiprocessing_context: None
dataloader_in_order: True
remove_unused_columns: True
label_names: None
train_sampling_strategy: random
length_column_name: length
ddp_find_unused_parameters: None
ddp_bucket_cap_mb: None
ddp_broadcast_buffers: False
ddp_static_graph: None
ddp_backend: None
ddp_timeout: 1800
fsdp: None
fsdp_config: None
deepspeed: None
debug: []
skip_memory_metrics: True
do_predict: False
resume_from_checkpoint: None
local_rank: -1
prompts: None
batch_sampler: batch_sampler
multi_dataset_batch_sampler: proportional
router_mapping: {}
learning_rate_mapping: {}
warmup_ratio: None
Training Logs
| Epoch |
Step |
Training Loss |
Validation Loss |
ndcg@10 |
| 1.5360 |
60000 |
0.0006 |
0.0021 |
0.6367 |
| 1.5872 |
62000 |
0.0006 |
0.0021 |
0.6356 |
| 1.6384 |
64000 |
0.0006 |
0.0021 |
0.6275 |
| 1.6896 |
66000 |
0.0006 |
0.0021 |
0.6363 |
| 1.7408 |
68000 |
0.0006 |
0.0021 |
0.6377 |
| 1.7920 |
70000 |
0.0006 |
0.0020 |
0.6356 |
| 1.8432 |
72000 |
0.0005 |
0.0020 |
0.6342 |
| 1.8944 |
74000 |
0.0005 |
0.0020 |
0.6317 |
| 1.9456 |
76000 |
0.0005 |
0.0020 |
0.6356 |
| 1.9968 |
78000 |
0.0005 |
0.0020 |
0.6337 |
| 2.0 |
78126 |
- |
0.0020 |
0.6342 |
| 2.0480 |
80000 |
0.0005 |
0.0020 |
0.6345 |
| 2.0992 |
82000 |
0.0005 |
0.0020 |
0.6424 |
| 2.1504 |
84000 |
0.0005 |
0.0020 |
0.6417 |
| 2.2016 |
86000 |
0.0005 |
0.0020 |
0.6379 |
| 2.2528 |
88000 |
0.0005 |
0.0020 |
0.6368 |
| 2.3040 |
90000 |
0.0005 |
0.0019 |
0.6378 |
| 2.3552 |
92000 |
0.0005 |
0.0019 |
0.6413 |
| 2.4064 |
94000 |
0.0005 |
0.0019 |
0.6434 |
| 2.4576 |
96000 |
0.0005 |
0.0019 |
0.6428 |
| 2.5088 |
98000 |
0.0005 |
0.0019 |
0.6424 |
| 2.56 |
100000 |
0.0005 |
0.0019 |
0.6478 |
| 2.6112 |
102000 |
0.0005 |
0.0019 |
0.6478 |
| 2.6624 |
104000 |
0.0005 |
0.0019 |
0.6451 |
| 2.7136 |
106000 |
0.0005 |
0.0019 |
0.6448 |
| 2.7648 |
108000 |
0.0005 |
0.0019 |
0.6433 |
| 2.8160 |
110000 |
0.0005 |
0.0019 |
0.6472 |
| 2.8672 |
112000 |
0.0005 |
0.0019 |
0.6471 |
| 2.9184 |
114000 |
0.0005 |
0.0019 |
0.6459 |
| 2.9696 |
116000 |
0.0005 |
0.0019 |
0.6433 |
| 3.0 |
117189 |
- |
0.0019 |
0.6429 |
- The bold row denotes the saved checkpoint.
Training Time
Framework Versions
- Python: 3.11.9
- Sentence Transformers: 6.1.0
- Transformers: 5.18.0
- PyTorch: 2.14.1+cu130
- Accelerate: 1.15.0
- Datasets: 5.0.1
- Tokenizers: 0.23.2
Additional Resources
Citation
BibTeX
Sentence Transformers
@inproceedings{reimers-2019-sentence-bert,
title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
author = "Reimers, Nils and Gurevych, Iryna",
booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
month = "11",
year = "2019",
publisher = "Association for Computational Linguistics",
url = "https://arxiv.org/abs/1908.10084",
}
combine_dstilationLoss_studentLoss
@misc{hofstätter2021improving,
title={Improving Efficient Neural Ranking Models with Cross-Architecture Knowledge Distillation},
author={Sebastian Hofstätter and Sophia Althammer and Michael Schröder and Mete Sertkan and Allan Hanbury},
year={2021},
eprint={2010.02666},
archivePrefix={arXiv},
primaryClass={cs.IR}
}
@misc{henderson2017efficient,
title={Efficient Natural Language Response Suggestion for Smart Reply},
author={Matthew Henderson and Rami Al-Rfou and Brian Strope and Yun-hsuan Sung and Laszlo Lukacs and Ruiqi Guo and Sanjiv Kumar and Balint Miklos and Ray Kurzweil},
year={2017},
eprint={1705.00652},
archivePrefix={arXiv},
primaryClass={cs.CL}
}