Sentence Similarity
sentence-transformers
Safetensors
bert
feature-extraction
dense
Generated from Trainer
dataset_size:5000000
loss:combine_dstilationLoss_studentLoss
Eval Results (legacy)
text-embeddings-inference
Instructions to use hatemestinbejaia/R3mmarco-Arabic-mMiniLML-bi-encoder-KD-v1 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use hatemestinbejaia/R3mmarco-Arabic-mMiniLML-bi-encoder-KD-v1 with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("hatemestinbejaia/R3mmarco-Arabic-mMiniLML-bi-encoder-KD-v1") sentences = [ "ما هو كور يعني", "تعريف cor . : وحدة قياس سعة عبرية وفينيقية قديمة .", "رفعت منظمة صندوق ادخار الموظفين ( EPFO ) الحد الأدنى للراتب إلى 15000 روبية من 6500 روبية في وقت سابق .", "شكل الجمع بين الجلطة - o يعني _ _ . صيغة الجمع embol - o تعني _ _ . اللاحقة التي تعني أداة قياس الضغط هي _ _ . لاحقة غير كلها تعني صغيرة هي _ _ . اللاحقة التي تعني التصلب هي _ _ ." ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [4, 4] - Notebooks
- Google Colab
- Kaggle
|
Download README.md from hatemestinbejaia/R3mmarco-Arabic-mMiniLML-bi-encoder-KD-v1: direct link, hf CLI and curl.
- Browser
- Download file 33.7 kB
-
https://huggingface.co/hatemestinbejaia/R3mmarco-Arabic-mMiniLML-bi-encoder-KD-v1/resolve/22f8c3bed37be148b359a18e5ba34f4aba074857/README.md
- Command line
-
hf download hf://hatemestinbejaia/R3mmarco-Arabic-mMiniLML-bi-encoder-KD-v1@22f8c3bed37be148b359a18e5ba34f4aba074857/README.md
-
curl -L -o README.md https://huggingface.co/hatemestinbejaia/R3mmarco-Arabic-mMiniLML-bi-encoder-KD-v1/resolve/22f8c3bed37be148b359a18e5ba34f4aba074857/README.md
33.7 kB
metadata
tags:
- sentence-transformers
- sentence-similarity
- feature-extraction
- dense
- generated_from_trainer
- dataset_size:5000000
- loss:combine_dstilationLoss_studentLoss
base_model: sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2
widget:
- source_sentence: ما هو كور يعني
sentences:
- 'تعريف cor . : وحدة قياس سعة عبرية وفينيقية قديمة .'
- >-
رفعت منظمة صندوق ادخار الموظفين ( EPFO ) الحد الأدنى للراتب إلى 15000
روبية من 6500 روبية في وقت سابق .
- >-
شكل الجمع بين الجلطة - o يعني _ _ . صيغة الجمع embol - o تعني _ _ .
اللاحقة التي تعني أداة قياس الضغط هي _ _ . لاحقة غير كلها تعني صغيرة هي
_ _ . اللاحقة التي تعني التصلب هي _ _ .
- source_sentence: ما هو يوم التصرف في المحكمة
sentences:
- >-
في سياق قضية جنائية ، تاريخ التصرف هو التاريخ الذي حدثت فيه نتيجة قضية
معينة . عادة ، لا يتم تضمين الحكم كتصرف .
- >-
1 . مائل أو مائل أو مائل . 2 . امتلاك الأفضلية أو التصرف أو الميل : ضغط
أعضاء مجلس الشيوخ الذين يميلون بشكل إيجابي للضغط من أجل تمرير مشروع
القانون .
- عادة ما تضع البطة بيضة واحدة إما كل يوم أو كل يوم .
- source_sentence: فعال
sentences:
- >-
مصنف تحت اللغة | الفرق بين الفعال وغير الفعال غير الفعال ' هي أن كلمة
واحدة هي عكس الأخرى .
- >-
فالكون هايتس ، مينيسوتا . فالكون هايتس هي إحدى ضواحي سانت بول ومدينة في
مقاطعة رامزي ، مينيسوتا ، الولايات المتحدة . كان عدد السكان 5321 في
تعداد 2010 . أصبحت قرية في عام 1949 ومدينة في عام 1973 .
- >-
الاستنتاجات : تسمح الطبيعة الواسعة لنهج CPTED بتكييفه مع أي وضع ، وتشير
النتائج إلى أنه نهج فعال للحد من السرقة . ومع ذلك ، لم يتم تقييم معظم
التدخلات بشكل مستقل عن العوامل الأخرى المساهمة في مخاطر السرقة .
- source_sentence: ما هي الزيارة
sentences:
- >-
الزيارة هي مسألة تتعلق بقانون الولاية ، ولكن بشكل عام ، تسمح كل ولاية
للآباء بممارسة قدر معقول من الزيارة مع أطفالهم ، وهو ما يعني عموما وقتا
كافيا لإقامة علاقة مفيدة والحفاظ عليها .
- >-
2455 Visitation Drive ، Mendota Heights ، MN 55120651 - 683 - 1700 |
[رابط] 1 تويتر . 2 فيسبوك . 3 يوتيوب . انستغرام .
- >-
تيد كافر هو أسطورة الإنترنت . وثق رحلته إلى الجحيم كاملة بالصور ، ليختفي
قبل 14 عاما . لا تزال قصته حية .
- source_sentence: ماذا يعني اسم ديونيسوس
sentences:
- >-
ديونيسوس . إله الكرمة ، وحصاد العنب ، وصناعة النبيذ ، والنبيذ ، وطقوس
الجنون ، والنشوة الدينية ، والمسرح
- >-
رقم هاتف مطبعة جامعة كامبريدج في نيويورك هو 3900 - 924 - 924 . مطبعة
جامعة كامبريدج هي دار نشر مشهورة في الأسواق المحلية والدولية وتنشر
مجموعة متنوعة من الكتب المتعلقة بالأكاديمية والطب وتعليم اللغة والعلوم
الإنسانية وغير ذلك الكثير .
- >-
اسم دينيس هو اسم طفل إنجليزي . في اللغة الإنجليزية ، معنى الاسم Denise
هو : من اللاتينية Dionysos أو Dionysus ، في إشارة إلى إله النبيذ
اليوناني . المعنى الأمريكي : اسم دينيس هو اسم طفل أمريكي .
pipeline_tag: sentence-similarity
library_name: sentence-transformers
metrics:
- map
- mrr@10
- ndcg@10
model-index:
- name: >-
SentenceTransformer based on
sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2
results:
- task:
type: reranking
name: Reranking
dataset:
name: Unknown
type: unknown
metrics:
- type: map
value: 0.5750672778977942
name: Map
- type: mrr@10
value: 0.5780277777777778
name: Mrr@10
- type: ndcg@10
value: 0.6428641544098906
name: Ndcg@10
SentenceTransformer based on sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2
This is a sentence-transformers model finetuned from sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 on the experiment_data_knowledge_distillation_vs_fine_tuning dataset. It maps inputs to a 384-dimensional dense vector space and can be used for semantic textual similarity, semantic search, paraphrase mining, classification, clustering, and more.
Model Details
Model Description
- Model Type: Sentence Transformer
- Base model: sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2
- Maximum Sequence Length: 128 tokens
- Output Dimensionality: 384 dimensions
- Similarity Function: Cosine Similarity
- Supported Modality: Text
- Training Dataset:
- experiment_data_knowledge_distillation_vs_fine_tuning
Model Sources
- Documentation: Sentence Transformers Documentation
- Repository: Sentence Transformers on GitHub
- Hugging Face: Sentence Transformers on Hugging Face
Full Model Architecture
SentenceTransformer(
(0): Transformer({'transformer_task': 'feature-extraction', 'modality_config': {'text': {'method': 'forward', 'method_output_name': 'last_hidden_state'}}, 'module_output_name': 'token_embeddings', 'architecture': 'BertModel'})
(1): Pooling({'embedding_dimension': 384, 'pooling_mode': 'mean', 'include_prompt': True})
)
Usage
Direct Usage (Sentence Transformers)
First install the Sentence Transformers library:
pip install -U sentence-transformers
Then you can load this model and run inference.
from sentence_transformers import SentenceTransformer
# Download from the 🤗 Hub
model = SentenceTransformer("hatemestinbejaia/R3mmarco-Arabic-mMiniLML-bi-encoder-KD-v1")
# Run inference
queries = [
'ماذا يعني اسم ديونيسوس',
]
documents = [
'ديونيسوس . إله الكرمة ، وحصاد العنب ، وصناعة النبيذ ، والنبيذ ، وطقوس الجنون ، والنشوة الدينية ، والمسرح',
'اسم دينيس هو اسم طفل إنجليزي . في اللغة الإنجليزية ، معنى الاسم Denise هو : من اللاتينية Dionysos أو Dionysus ، في إشارة إلى إله النبيذ اليوناني . المعنى الأمريكي : اسم دينيس هو اسم طفل أمريكي .',
'رقم هاتف مطبعة جامعة كامبريدج في نيويورك هو 3900 - 924 - 924 . مطبعة جامعة كامبريدج هي دار نشر مشهورة في الأسواق المحلية والدولية وتنشر مجموعة متنوعة من الكتب المتعلقة بالأكاديمية والطب وتعليم اللغة والعلوم الإنسانية وغير ذلك الكثير .',
]
query_embeddings = model.encode_query(queries)
document_embeddings = model.encode_document(documents)
print(query_embeddings.shape, document_embeddings.shape)
# [1, 384] [3, 384]
# Get the similarity scores for the embeddings
similarities = model.similarity(query_embeddings, document_embeddings)
print(similarities)
# tensor([[0.7265, 0.6916, 0.2127]])
Evaluation
Metrics
Reranking
- Evaluated with
RerankingEvaluatorwith these parameters:{ "at_k": 10 }
| Metric | Value |
|---|---|
| map | 0.5751 |
| mrr@10 | 0.578 |
| ndcg@10 | 0.6429 |
Training Details
Training Dataset
experiment_data_knowledge_distillation_vs_fine_tuning
- Dataset: experiment_data_knowledge_distillation_vs_fine_tuning
- Size: 5,000,000 training samples
- Columns:
query,pos,neg, andlabel - Approximate statistics based on the first 100 samples:
query pos neg label type string string string float modality text text text details - min: 5 tokens
- mean: 11.31 tokens
- max: 20 tokens
- min: 13 tokens
- mean: 91.55 tokens
- max: 128 tokens
- min: 41 tokens
- mean: 89.69 tokens
- max: 128 tokens
- min: -1.83
- mean: 12.59
- max: 20.47
- Samples:
query pos neg label القليل من الكافيين جيد أثناء الحملنحن لا نعرف الكثير عن تأثيرات الكافيين أثناء الحمل عليك وعلى طفلك . لذلك فمن الأفضل أن تحد من المبلغ الذي تحصل عليه كل يوم . إذا كنت حاملا ، قللي من تناول الكافيين إلى 200 ملليجرام يوميا . هذا هو الكمية الموجودة في فنجان واحد سعة 8 أونصات من القهوة أو فنجان قهوة سعة 12 أونصة .من الآمن عموما أن تتناول النساء الحوامل الشوكولاتة لأن الدراسات أثبتت وجود فوائد معينة لتناول الشوكولاتة أثناء الحمل . ومع ذلك ، يجب على النساء الحوامل التأكد من أن تناول الكافيين أقل من 200 مجم في اليوم .4.0280589908361435ما هي الفاكهة الأصلية في أسترالياPassiflora herbertiana . فاكهة العاطفة النادرة موطنها أستراليا . الثمار ذات قشرة خضراء ، بيضاء اللون ، مع تصنيف غير معروف للأكل . تسرد بعض المصادر الفاكهة على أنها صالحة للأكل وحلوة ولذيذة ، بينما يسرد البعض الآخر الفاكهة على أنها مرة وغير صالحة للأكل . فاكهة العاطفة النادرة موطنها أستراليا . الثمار ذات قشرة خضراء ، بيضاء اللون ، مع تصنيف غير معروف للأكل . تسرد بعض المصادر الفاكهة على أنها صالحة للأكل وحلوة ولذيذة ، بينما يسرد البعض الآخر الفواكه على أنها مرة وغير صالحة للأكل .جوز الكولا هو ثمرة شجرة الكولا ، وهي جنس ( كولا ) من الأشجار التي تنتمي إلى الغابات الاستوائية المطيرة في إفريقيا .10.18145449956258ما هو حجم الجيش الكنديالقوات المسلحة الكندية . 1 بدأت أول مهمة حفظ سلام كندية واسعة النطاق في مصر في 24 نوفمبر 1956 . 2 هناك ما يقرب من 65000 من القوات النظامية و 25000 من أفراد الاحتياط في الجيش الكندي . 3 في كندا ، تم تحديد يوم 9 أغسطس كيوم حفظة السلام الوطنيين .المعهد الكندي لصحة الأطباء ( CPHI ) هو برنامج وطني تم إنشاؤه في عام 2012 كتعاون بين الجمعية الطبية الكندية ( CMA ) والمؤسسة الطبية الكندية ( CMF ) والجمعيات الطبية الإقليمية والإقليمية ( PTMAs ) .16.420575777689614 - Loss:
main.combine_dstilationLoss_studentLoss
Evaluation Dataset
experiment_data_knowledge_distillation_vs_fine_tuning
- Dataset: experiment_data_knowledge_distillation_vs_fine_tuning
- Size: 10,000 evaluation samples
- Columns:
query,pos,neg, andlabel - Approximate statistics based on the first 100 samples:
query pos neg label type string string string float modality text text text details - min: 5 tokens
- mean: 10.56 tokens
- max: 23 tokens
- min: 47 tokens
- mean: 91.06 tokens
- max: 128 tokens
- min: 48 tokens
- mean: 79.22 tokens
- max: 128 tokens
- min: 2.19
- mean: 13.84
- max: 21.47
- Samples:
query pos neg label ما هو اسم د . كويناعرض الشخصيات المختلفة التي لعبها نفس الممثل . الدكتورة ميكايلا كوين . ولدت ميكايلا في 15 فبراير 1833 في بوسطن ، ماساتشوستس ، لأبوين جوزيف وإليزابيث كوين . هناك نشأت مع شقيقاتها الأربع : ماري ( التي تم تغيير اسمها إلى ريبيكا ) ، ومارجوري ، وكلوديت ، ومورين . كان والدها يريد ابنا ، لذلك عندما ولدت أطلق عليها اسم ميكايلا ( الملقب مايك ) .ليس لدى د . ماكفارلاند أي تأمينات مدرجة . إذا كنت دكتور ماكفارلاند وترغب في إضافة تأمينات تقبلها ، يرجى تحديث ملفك التعريفي المجاني . الانتساب إلى المستشفى ينتمي د . ماكفارلاند إلى المستشفيات التالية .15.524045944213867من يلعب دور بيرني مادوفساحر الأكاذيب هو واحد من اثنين من مشاريع Madoff التلفزيونية قيد الإعداد . ABC لديها مسلسل قصير قادم يسمى مادوف ، من بطولة ريتشارد دريفوس وبليث دانر . قصص ذات الصلة . روبرت دي نيرو يسجل الدخول للعب بيرني مادوف في فيلم HBO المحتمل .اتهمت السلطات الأمريكية مسؤول تنفيذي للمحاسبة يزعم أنه ساعد برنارد مادوف في مخطط بونزي الذي تبلغ تكلفته عدة مليارات من الدولارات ، والذي يوسع نطاق تحقيقه في الاحتيال بعد خمس سنوات من اكتشافه .13.17703644434611كم قدم مكعب في طن من حصى البازلاءلذلك 1 طن لديه 2000 - 100 أو 20 قدم مكعب من الحصى . الفناء المكعب هو 3x3x3 = 27 قدما مكعبا من الفناء المكعب ، الإجابة 20 - 27 أو 0 . 74 ياردة مكعبة . العوامل الأخرى التي تؤثر على حجم الحصى هي محتوى الرطوبة ودرجات المواد . يحتوي حصى البازلاء على سبيل المثال على جميع الجزيئات ذات الحجم المحدد ، على سبيل المثال ، 1 - 4 بوصة ، حوالي 120 رطلا للإشارة فقط : 1 قدم مكعب = 6 . 25 جالون ( إمبراطوري ) ، جالون من الماء يزن 10 أرطال ، لذا فإن القدم المكعبة من الماء تزن 62 . 5 رطلا . هذا يعني أن الجاذبية النوعية للحصى هي 120 - 62 . 5 ، أو أقل قليلا من 2 .1 كيس قدم مكعب واحد ( التربة والمهاد ) يغطي ما يقرب من 8 أقدام مربعة إلى عمق 3 . 2 كيس واحد 75 رطلا ( الحصى والرمل ) يغطي حوالي 4 أقدام مربعة إلى عمق 3 . 3 بوصات سميكة ستغطي حوالي 300 قدم مربع . سيغطي سمك 1 حوالي 150 قدما مربعا .10.34702980518341 - Loss:
main.combine_dstilationLoss_studentLoss
Training Hyperparameters
Non-Default Hyperparameters
per_device_train_batch_size: 16learning_rate: 7e-06warmup_steps: 0.07gradient_accumulation_steps: 8fp16: Trueload_best_model_at_end: True
All Hyperparameters
Click to expand
per_device_train_batch_size: 16num_train_epochs: 3max_steps: -1learning_rate: 7e-06lr_scheduler_type: linearlr_scheduler_kwargs: Nonewarmup_steps: 0.07optim: adamw_torch_fusedoptim_args: Noneweight_decay: 0.0adam_beta1: 0.9adam_beta2: 0.999adam_epsilon: 1e-08optim_target_modules: Nonegradient_accumulation_steps: 8average_tokens_across_devices: Truemax_grad_norm: 1.0label_smoothing_factor: 0.0bf16: Falsefp16: Truebf16_full_eval: Falsefp16_full_eval: Falsetf32: Nonegradient_checkpointing: Falsegradient_checkpointing_kwargs: Nonetorch_compile: Falsetorch_compile_backend: Nonetorch_compile_mode: Noneuse_liger_kernel: Falseliger_kernel_config: Noneuse_cache: Falseneftune_noise_alpha: Nonetorch_empty_cache_steps: Noneauto_find_batch_size: Falselog_on_each_node: Truelogging_nan_inf_filter: Trueinclude_num_input_tokens_seen: nolog_level: passivelog_level_replica: warningdisable_tqdm: Falseproject: huggingfacetrackio_space_id: Nonetrackio_bucket_id: Nonetrackio_static_space_id: Noneper_device_eval_batch_size: 8prediction_loss_only: Trueeval_on_start: Falseeval_do_concat_batches: Trueeval_use_gather_object: Falseeval_accumulation_steps: Noneinclude_for_metrics: []batch_eval_metrics: Falsesave_only_model: Falsesave_on_each_node: Falseenable_jit_checkpoint: Falsepush_to_hub: Falsehub_private_repo: Nonehub_model_id: Nonehub_strategy: every_savehub_always_push: Falsehub_revision: Noneload_best_model_at_end: Trueignore_data_skip: Falserestore_callback_states_from_checkpoint: Falsefull_determinism: Falseseed: 42data_seed: Noneuse_cpu: Falseaccelerator_config: {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}parallelism_config: Nonedataloader_drop_last: Falsedataloader_num_workers: 0dataloader_pin_memory: Truedataloader_persistent_workers: Falsedataloader_prefetch_factor: Nonedataloader_multiprocessing_context: Nonedataloader_in_order: Trueremove_unused_columns: Truelabel_names: Nonetrain_sampling_strategy: randomlength_column_name: lengthddp_find_unused_parameters: Noneddp_bucket_cap_mb: Noneddp_broadcast_buffers: Falseddp_static_graph: Noneddp_backend: Noneddp_timeout: 1800fsdp: Nonefsdp_config: Nonedeepspeed: Nonedebug: []skip_memory_metrics: Truedo_predict: Falseresume_from_checkpoint: Nonelocal_rank: -1prompts: Nonebatch_sampler: batch_samplermulti_dataset_batch_sampler: proportionalrouter_mapping: {}learning_rate_mapping: {}warmup_ratio: None
Training Logs
| Epoch | Step | Training Loss | Validation Loss | ndcg@10 |
|---|---|---|---|---|
| 1.5360 | 60000 | 0.0006 | 0.0021 | 0.6367 |
| 1.5872 | 62000 | 0.0006 | 0.0021 | 0.6356 |
| 1.6384 | 64000 | 0.0006 | 0.0021 | 0.6275 |
| 1.6896 | 66000 | 0.0006 | 0.0021 | 0.6363 |
| 1.7408 | 68000 | 0.0006 | 0.0021 | 0.6377 |
| 1.7920 | 70000 | 0.0006 | 0.0020 | 0.6356 |
| 1.8432 | 72000 | 0.0005 | 0.0020 | 0.6342 |
| 1.8944 | 74000 | 0.0005 | 0.0020 | 0.6317 |
| 1.9456 | 76000 | 0.0005 | 0.0020 | 0.6356 |
| 1.9968 | 78000 | 0.0005 | 0.0020 | 0.6337 |
| 2.0 | 78126 | - | 0.0020 | 0.6342 |
| 2.0480 | 80000 | 0.0005 | 0.0020 | 0.6345 |
| 2.0992 | 82000 | 0.0005 | 0.0020 | 0.6424 |
| 2.1504 | 84000 | 0.0005 | 0.0020 | 0.6417 |
| 2.2016 | 86000 | 0.0005 | 0.0020 | 0.6379 |
| 2.2528 | 88000 | 0.0005 | 0.0020 | 0.6368 |
| 2.3040 | 90000 | 0.0005 | 0.0019 | 0.6378 |
| 2.3552 | 92000 | 0.0005 | 0.0019 | 0.6413 |
| 2.4064 | 94000 | 0.0005 | 0.0019 | 0.6434 |
| 2.4576 | 96000 | 0.0005 | 0.0019 | 0.6428 |
| 2.5088 | 98000 | 0.0005 | 0.0019 | 0.6424 |
| 2.56 | 100000 | 0.0005 | 0.0019 | 0.6478 |
| 2.6112 | 102000 | 0.0005 | 0.0019 | 0.6478 |
| 2.6624 | 104000 | 0.0005 | 0.0019 | 0.6451 |
| 2.7136 | 106000 | 0.0005 | 0.0019 | 0.6448 |
| 2.7648 | 108000 | 0.0005 | 0.0019 | 0.6433 |
| 2.8160 | 110000 | 0.0005 | 0.0019 | 0.6472 |
| 2.8672 | 112000 | 0.0005 | 0.0019 | 0.6471 |
| 2.9184 | 114000 | 0.0005 | 0.0019 | 0.6459 |
| 2.9696 | 116000 | 0.0005 | 0.0019 | 0.6433 |
| 3.0 | 117189 | - | 0.0019 | 0.6429 |
- The bold row denotes the saved checkpoint.
Training Time
- Training: 12.7 hours
Framework Versions
- Python: 3.11.9
- Sentence Transformers: 6.1.0
- Transformers: 5.18.0
- PyTorch: 2.14.1+cu130
- Accelerate: 1.15.0
- Datasets: 5.0.1
- Tokenizers: 0.23.2
Additional Resources
- Training and Finetuning Embedding Models with Sentence Transformers: the end-to-end guide for training or finetuning Sentence Transformer models.
- Introduction to Matryoshka Embedding Models: variable-size embeddings that can be truncated with minimal quality loss.
- Binary and Scalar Embedding Quantization for Significantly Faster & Cheaper Retrieval: post-training compression of embedding vectors.
- Multimodal Embedding & Reranker Models with Sentence Transformers: use text, image, audio, and video models through the same API.
- Training and Finetuning Multimodal Embedding & Reranker Models with Sentence Transformers: train multimodal embedding models, with a Visual Document Retrieval walkthrough.
Citation
BibTeX
Sentence Transformers
@inproceedings{reimers-2019-sentence-bert,
title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
author = "Reimers, Nils and Gurevych, Iryna",
booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
month = "11",
year = "2019",
publisher = "Association for Computational Linguistics",
url = "https://arxiv.org/abs/1908.10084",
}
combine_dstilationLoss_studentLoss
@misc{hofstätter2021improving,
title={Improving Efficient Neural Ranking Models with Cross-Architecture Knowledge Distillation},
author={Sebastian Hofstätter and Sophia Althammer and Michael Schröder and Mete Sertkan and Allan Hanbury},
year={2021},
eprint={2010.02666},
archivePrefix={arXiv},
primaryClass={cs.IR}
}
@misc{henderson2017efficient,
title={Efficient Natural Language Response Suggestion for Smart Reply},
author={Matthew Henderson and Rami Al-Rfou and Brian Strope and Yun-hsuan Sung and Laszlo Lukacs and Ruiqi Guo and Sanjiv Kumar and Balint Miklos and Ray Kurzweil},
year={2017},
eprint={1705.00652},
archivePrefix={arXiv},
primaryClass={cs.CL}
}