nickprock commited on
Commit
379258c
·
verified ·
1 Parent(s): e27bb46

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +396 -392
README.md CHANGED
@@ -121,96 +121,100 @@ datasets:
121
  language:
122
  - it
123
  ---
124
-
125
- # SentenceTransformer based on ibm-granite/granite-embedding-311m-multilingual-r2
126
-
127
- This is a [sentence-transformers](https://www.SBERT.net) model finetuned from [ibm-granite/granite-embedding-311m-multilingual-r2](https://huggingface.co/ibm-granite/granite-embedding-311m-multilingual-r2) on the it-wiki-retrieval-synthetic-hn dataset. It maps inputs to a 768-dimensional dense vector space and can be used for semantic textual similarity, semantic search, paraphrase mining, classification, clustering, and more.
128
-
129
- ## Model Details
130
-
131
- ### Model Description
132
- - **Model Type:** Sentence Transformer
133
- - **Base model:** [ibm-granite/granite-embedding-311m-multilingual-r2](https://huggingface.co/ibm-granite/granite-embedding-311m-multilingual-r2) <!-- at revision 44399559930365213510b1ee2eb15ded83374f0e -->
134
- - **Maximum Sequence Length:** 32768 tokens
135
- - **Output Dimensionality:** 768 dimensions
136
- - **Similarity Function:** Cosine Similarity
137
- - **Supported Modality:** Text
138
- - **Training Dataset:**
139
- - it-wiki-retrieval-synthetic-hn
140
- <!-- - **Language:** Unknown -->
141
- <!-- - **License:** Unknown -->
142
-
143
- ### Model Sources
144
-
145
- - **Documentation:** [Sentence Transformers Documentation](https://sbert.net)
146
- - **Repository:** [Sentence Transformers on GitHub](https://github.com/huggingface/sentence-transformers)
147
- - **Hugging Face:** [Sentence Transformers on Hugging Face](https://huggingface.co/models?library=sentence-transformers)
148
-
149
- ### Full Model Architecture
150
-
151
- ```
152
- SentenceTransformer(
153
- (0): Transformer({'transformer_task': 'feature-extraction', 'modality_config': {'text': {'method': 'forward', 'method_output_name': 'last_hidden_state'}}, 'module_output_name': 'token_embeddings', 'architecture': 'ModernBertModel'})
154
- (1): Pooling({'embedding_dimension': 768, 'pooling_mode': 'cls', 'include_prompt': False})
155
- (2): Normalize({'module_input_name': 'sentence_embedding', 'module_output_name': 'sentence_embedding'})
156
- )
157
- ```
158
-
159
- ## Usage
160
-
161
- ### Direct Usage (Sentence Transformers)
162
-
163
- First install the Sentence Transformers library:
164
-
165
- ```bash
166
- pip install -U sentence-transformers
167
- ```
168
- Then you can load this model and run inference.
169
- ```python
170
- from sentence_transformers import SentenceTransformer
171
-
172
- # Download from the 🤗 Hub
173
- model = SentenceTransformer("sentence_transformers_model_id")
174
- # Run inference
175
- sentences = [
176
- "In quali gare fu eliminato l'atleta nelle Olimpiadi di Parigi?",
177
- 'Partecipò ai Giochi della II Olimpiade di Parigi nella gara di spada individuale e sciabola individuale. In entrambe le gare fu eliminato alle semifinali.',
178
- "['Partecipò ai Giochi della II Olimpiade di Parigi alla gara di fioretto individuale, in cui fu eliminato ai quarti, e alla gara di spada individuale, in cui fu eliminato al primo turno.', 'Partecipò ai Giochi della II Olimpiade di Parigi nelle gare di fioretto per maestri, in cui fu eliminato ai ripescaggi, e di spada per maestri, in cui fu eliminato al primo turno.']",
179
- ]
180
- embeddings = model.encode(sentences)
181
- print(embeddings.shape)
182
- # [3, 768]
183
-
184
- # Get the similarity scores for the embeddings
185
- similarities = model.similarity(embeddings, embeddings)
186
- print(similarities)
187
- # tensor([[1.0000, 0.8895, 0.6944],
188
- # [0.8895, 1.0000, 0.7186],
189
- # [0.6944, 0.7186, 1.0000]])
190
- ```
191
- <!--
192
- ### Direct Usage (Transformers)
193
-
194
- <details><summary>Click to see the direct usage in Transformers</summary>
195
-
196
- </details>
197
- -->
198
-
199
- <!--
200
- ### Downstream Usage (Sentence Transformers)
201
-
202
- You can finetune this model on your own dataset.
203
-
204
- <details><summary>Click to expand</summary>
205
-
206
- </details>
207
- -->
208
-
209
- <!--
210
- ### Out-of-Scope Use
211
-
212
- *List how the model may foreseeably be misused and address what users ought not to do with the model.*
213
- -->
 
 
 
 
214
  ## Evaluation & Benchmarks
215
 
216
  To ensure full transparency, the model was evaluated across two distinct benchmarks: **Information Retrieval / RAG** (SQuAD-it) and **Semantic Textual Similarity** (STSb-it), compared against widely used Italian embedding models.
@@ -243,312 +247,312 @@ To ensure full transparency, the model was evaluated across two distinct benchma
243
  | **`granite-311m-italiano-matryoshka (Full)`** | **768** | **0.7612** | **0.7574** | **588.2** |
244
  | **`granite-311m-italiano-matryoshka (Truncated)`** | **256** | **0.7627** | **0.7599** | **572.0** |
245
 
246
- ---
247
-
248
-
249
- ## Training Details
250
-
251
  ### Training Setup
252
  - **Dataset:** `nickprock/it-wiki-retrieval-synthetic-hn` (45,181 samples)
253
  - **Epochs:** 1
254
  - **Batch Size:** 16 (per device) x 16 (Gradient Accumulation) = 256 effective batch size
255
  - **Optimizer:** `adamw_8bit`
256
  - **Learning Rate:** 2e-5 with linear warmup (0.1)
257
- - **Precision:** `bf16`
258
-
259
- ### Training Dataset
260
-
261
- #### it-wiki-retrieval-synthetic-hn
262
-
263
- * Dataset: it-wiki-retrieval-synthetic-hn
264
- * Size: 45,181 training samples
265
- * Columns: <code>anchor</code>, <code>positive</code>, and <code>negative</code>
266
- * Approximate statistics based on the first 100 samples:
267
- | | anchor | positive | negative |
268
- |:---------|:-----------------------------------------------------------------------------------|:-------------------------------------------------------------------------------------|:-------------------------------------------------------------------------------------|
269
- | type | string | string | string |
270
- | modality | text | text | text |
271
- | details | <ul><li>min: 12 tokens</li><li>mean: 20.64 tokens</li><li>max: 44 tokens</li></ul> | <ul><li>min: 36 tokens</li><li>mean: 119.38 tokens</li><li>max: 233 tokens</li></ul> | <ul><li>min: 80 tokens</li><li>mean: 257.07 tokens</li><li>max: 441 tokens</li></ul> |
272
- * Samples:
273
- | anchor | positive | negative |
274
- |:--------------------------------------------------------------------------------------------------------|:-----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|:---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
275
- | <code>Quali formati ha avuto l'album Dejavu della cantante giapponese Koda Kumi?</code> | <code>Dejavu è il nono album studio della cantante giapponese Koda Kumi, pubblicato il 2 marzo 2011. Descrizione L'album è stato pubblicato in due formati: CD e CD+2DVD (First Press Limited Edition); quando di quest'ultima si sono esaurite le copie, è stata venduta la sola edizione CD+DVD. La traccia Hey Baby! è stata utilizzata come canzone di apertura per la sigla della dodicesima stagione del famoso anime Crayon Shin-chan.</code> | <code>["è una serie di light novel scritta da Aoi Sekina e illustrata Kira Inugami. La serie è iniziata con la prubblicazione del primo volume il 19 gennaio 2008, edito dalla Fujimi Shobō per l'etichetta Fujimi Fantasia Bunko. Originariamente la serie era intitolata , ma fu successivamente intitolata con il sottotitolo del primo volume . Alla serie si fa anche riferimento con il titolo . Da essa sono stati tratti un manga nel 2009 e due serie anime nel 2009 e nel 2012.\n\nTrama \nI membri del consiglio studentesco dell'Accademia Hekiyou di Hokkaidō vengono selezionati attraverso un concorso di popolarità.", "è un manga di genere yaoi scritto ed illustrato da Hinako Takanaga. L'opera è stata serializzata tra il 2001 e il 2003 da Ōtō Shobō sulla rivista Gust e in seguito raccolta in tre volumi tankōbon.\n\nTrama \nQuando Kojima, allegro studente di scuola media, decide di fare amicizia col solitario Nakahara, viene a sapere che questi si trova praticamente senza famiglia: infatti il padre è lo...</code> |
276
- | <code>Come sono state suddivise le aree dei Territori del Nord-Ovest nel censimento più recente?</code> | <code>La Regione 1 è una delle sei regioni censuarie dei Territori del Nord-Ovest in Canada, con capoluogo Inuvik. Al 2011 aveva 6.712 abitanti su una superficie di (1 chilometro quadro ogni 54 abitanti). È stata istituita con il censimento del 2011, quando l'area dei Territori è stata suddivisa in 6 nuove regioni censuarie.</code> | <code>['La municipalità di Northern Areas è una Local Government Area che si trova in Australia Meridionale. Essa si estende su una superficie di 3.070 chilometri quadrati e ha una popolazione di 4.866 abitanti. La sede del consiglio si trova a Jamestown.', 'Il sistema bibliotecario Sud ovest bresciano è una rete di biblioteche situate nei comuni della Bassa Bresciana occidentale.\nÈ parte della Rete Bibliotecaria Bresciana e Cremonese (RBBC). La convenzione che regola i rapporti tra i comuni aderenti è stata stipulata il 18 agosto del 2000.']</code> |
277
- | <code>In quale anno Colosi ha donato i suoi estratti e opuscoli all'Istituto di Zoologia?</code> | <code>Docente all'università di Firenze dal 1926 al 1962, dal 1950 fu Socio dei Lincei. Fu autore di varie opere scientifiche come Fauna italiana (1933), Gli organismi ed il mondo esterno (1945) e Zoologia e biologia generale (1956). Biblioteca personale Nel 1975 Colosi donò all'Istituto di Zoologia dell'Università di Firenze circa 9.400 estratti ed opuscoli del sec.</code> | <code>["Fu autore delle editio princeps e della raccolta L'oceano delle fiumane delle novelle (1866).\n\nNel 1870 gli fu dedicata una medaglia (unitamente a Heinrich Leberecht Fleischer, August Friedrich Pott ed Emil Rödiger) in occasione del 25º anniversario della fondazione della Deutsche Morgenländische Gesellschaft.", 'Diresse il laboratorio istologico francese e fu docente al Collège de France dal 1875. Nel 1888 fu nominato Socio Straniero dei Lincei. Da lui prendono nome gli anelli di Ranvier e le croci latine di Ranvier.\n\nEbbe tra i suoi allievi Ferdinand-Jean Darier, Justin Marie Jolly, Joaquín Albarrán, Luis Simarro Lacabra e Fredrik Georg Gade.']</code> |
278
- * Loss: [<code>MatryoshkaLoss</code>](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#matryoshkaloss) with these parameters:
279
- ```json
280
- {
281
- "loss": "CachedMultipleNegativesRankingLoss",
282
- "matryoshka_dims": [
283
- 768,
284
- 512,
285
- 256,
286
- 128
287
- ],
288
- "matryoshka_weights": [
289
- 1,
290
- 1,
291
- 1,
292
- 1
293
- ],
294
- "n_dims_per_step": -1
295
- }
296
- ```
297
-
298
- ### Evaluation Dataset
299
-
300
- #### it-wiki-retrieval-synthetic-hn
301
-
302
- * Dataset: it-wiki-retrieval-synthetic-hn
303
- * Size: 2,378 evaluation samples
304
- * Columns: <code>anchor</code>, <code>positive</code>, and <code>negative</code>
305
- * Approximate statistics based on the first 100 samples:
306
- | | anchor | positive | negative |
307
- |:---------|:-----------------------------------------------------------------------------------|:-------------------------------------------------------------------------------------|:--------------------------------------------------------------------------------------|
308
- | type | string | string | string |
309
- | modality | text | text | text |
310
- | details | <ul><li>min: 11 tokens</li><li>mean: 20.12 tokens</li><li>max: 49 tokens</li></ul> | <ul><li>min: 35 tokens</li><li>mean: 119.73 tokens</li><li>max: 198 tokens</li></ul> | <ul><li>min: 104 tokens</li><li>mean: 266.03 tokens</li><li>max: 413 tokens</li></ul> |
311
- * Samples:
312
- | anchor | positive | negative |
313
- |:-----------------------------------------------------------------------------------------------------------|:---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|:---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
314
- | <code>Cosa significava essere un marchese nel periodo feudale in Italia?</code> | <code>Berengario – nome proprio di persona italiano maschile Berengario del Friuli – marchese del Friuli (874-924), re d'Italia (888-924) e imperatore del Sacro Romano Impero (915-924) Berengario II d'Ivrea – marchese d'Ivrea (928-950) e re d'Italia (950-961) Berengario I di Tolosa detto il Saggio (? – 835) – conte di Tolosa e conte di Barcellona Berengario di Tours (1010-1088) – filosofo, dialettico ed eretico francese medievale</code> | <code>['Il titolo di conte di Richmond è un titolo nobiliare, ora estinto, dei pari del Regno Unito. Venne creato molte volte è ed è stato tenuto da famiglie bretoni, normanne, di stirpe plantageneta, capetingia, sabauda, Tudor e Stuart.', "Duca d'Orléans (in francese: Duc d'Orléans) è un titolo riservato alla famiglia reale francese, creato nel corso del XIV secolo. Legato al trattamento di Principe del sangue (princes du sang), il titolo di duca d'Orléans era dato, se possibile, al fratello minore del sovrano. In questo modo il titolare spesso formava una linea collaterale della famiglia reale francese, con un eventuale diritto di succedere al trono tra i principi più prossimi al trono.\n\nDurante il periodo dell'Ancien Régime il detentore del titolo spesso assumeva un ruolo politico."]</code> |
315
- | <code>Quali sono le caratteristiche musicali dell'album Listen to Your Heart - Unplugged di D.H.T.?</code> | <code>Listen to Your Heart - Unplugged è il terzo album duo belga D.H.T.. È stato pubblicato solo digitalmente il 30 giugno 2006. Il disco L'album è costituito dalle stesse tracce del loro album Listen to Your Heart, arrangiate in chiave acustica. La versione di Listen to Your Heart presente in questo album è la stessa che chiudeva l'album di debutto, solo qui è la traccia d'apertura dell'album; le successive nove tracce sono arrangiamenti degli altri brani del primo album. L'undicesima ed ultima traccia è What if?, l'unico inedito, che sostituisce Depressed.</code> | <code>["Listen to Your Heart è l'album di debutto del duo dance-trance belga D.H.T., pubblicato il 18 luglio 2005.\n\nIl disco\nL'album prende il titolo dall'omonima Listen to Your Heart, canzone del gruppo pop svedese Roxette, della quale sono presenti due cover nella tracklist (la prima già precedentemente pubblicata come singolo). Oltre a Listen to Your Heart, l'album si compone di altre quattro cover e di sei brani originali.\n\nDa quest'album sono stati estratti quattro singoli, due dei quali prima della pubblicazione dell'album.", 'Listen to Your Heart è il secondo album del duo belga D.H.T., pubblicato solo digitalmente il 30 giugno 2006.\n\nIl disco\nL\'album riprende la tracklist del precedente Listen to Your Heart, riproponeno tutti gli undici brani in versione remixata.\n\nDa questo album è stato tratto un singolo, Sun "teuduh-duh-te-te", pubblicato l\'8 giugno 2005.\n\nTracce\n\nTesti e musiche di Edmée Daenen e Flor Theeuwes, tranne dove indicato.\n\n Listen to Your Heart (Hardb...</code> |
316
- | <code>Conseguenze psicologiche del lavoro marittimo nel romanzo The Shadow Line</code> | <code>La linea d'ombra (The Shadow Line) – romanzo di Joseph Conrad del 1917 The Shadow Line – album dei Godhead del 2006 The Shadow Line – serie televisiva britannica del 2011</code> | <code>["Il mare (The Sea) è un romanzo di John Banville del 2005 vincitore del Booker Prize.\n\nLa vicenda è narrata da Max Morden, uno storico dell'arte in pensione che cerca di accettare le morti di coloro che ha amato da bambino e da adulto.\nLa narrazione è caratterizzata dai frequenti salti temporali tra presente e passato.\n\nTrama \nIl romanzo è ambientato nella città immaginaria di Ballymore, dove i ricordi della noiosa cittadina sono manipolati dall'immaginazione.", "Endless Ocean, detto anche Forever Blue, è un gioco di simulazione di immersione subacquea prodotto dalla Nintendo e compatibile con console Nintendo Wii. È il primo capitolo della omonima saga.\n\nModalità di gioco\nEsplorazione. L'esplorazione è libera e la si può praticare in qualsiasi momento del giorno.\nLezioni. Sono delle esplorazioni di durata breve in cui insieme a qualcun altro bisognerà trovare un pesce in particolare."]</code> |
317
- * Loss: [<code>MatryoshkaLoss</code>](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#matryoshkaloss) with these parameters:
318
- ```json
319
- {
320
- "loss": "CachedMultipleNegativesRankingLoss",
321
- "matryoshka_dims": [
322
- 768,
323
- 512,
324
- 256,
325
- 128
326
- ],
327
- "matryoshka_weights": [
328
- 1,
329
- 1,
330
- 1,
331
- 1
332
- ],
333
- "n_dims_per_step": -1
334
- }
335
- ```
336
-
337
- ### Training Hyperparameters
338
- #### Non-Default Hyperparameters
339
-
340
- - `per_device_train_batch_size`: 16
341
- - `num_train_epochs`: 1
342
- - `learning_rate`: 2e-05
343
- - `warmup_steps`: 0.1
344
- - `optim`: adamw_8bit
345
- - `gradient_accumulation_steps`: 16
346
- - `bf16`: True
347
-
348
- #### All Hyperparameters
349
- <details><summary>Click to expand</summary>
350
-
351
- - `per_device_train_batch_size`: 16
352
- - `num_train_epochs`: 1
353
- - `max_steps`: -1
354
- - `learning_rate`: 2e-05
355
- - `lr_scheduler_type`: linear
356
- - `lr_scheduler_kwargs`: None
357
- - `warmup_steps`: 0.1
358
- - `optim`: adamw_8bit
359
- - `optim_args`: None
360
- - `weight_decay`: 0.0
361
- - `adam_beta1`: 0.9
362
- - `adam_beta2`: 0.999
363
- - `adam_epsilon`: 1e-08
364
- - `optim_target_modules`: None
365
- - `gradient_accumulation_steps`: 16
366
- - `average_tokens_across_devices`: True
367
- - `max_grad_norm`: 1.0
368
- - `label_smoothing_factor`: 0.0
369
- - `bf16`: True
370
- - `fp16`: False
371
- - `bf16_full_eval`: False
372
- - `fp16_full_eval`: False
373
- - `tf32`: None
374
- - `gradient_checkpointing`: False
375
- - `gradient_checkpointing_kwargs`: None
376
- - `torch_compile`: False
377
- - `torch_compile_backend`: None
378
- - `torch_compile_mode`: None
379
- - `use_liger_kernel`: False
380
- - `liger_kernel_config`: None
381
- - `use_cache`: False
382
- - `neftune_noise_alpha`: None
383
- - `torch_empty_cache_steps`: None
384
- - `auto_find_batch_size`: False
385
- - `log_on_each_node`: True
386
- - `logging_nan_inf_filter`: True
387
- - `include_num_input_tokens_seen`: no
388
- - `log_level`: passive
389
- - `log_level_replica`: warning
390
- - `disable_tqdm`: False
391
- - `project`: huggingface
392
- - `trackio_space_id`: None
393
- - `trackio_bucket_id`: None
394
- - `trackio_static_space_id`: None
395
- - `per_device_eval_batch_size`: 8
396
- - `prediction_loss_only`: True
397
- - `eval_on_start`: False
398
- - `eval_do_concat_batches`: True
399
- - `eval_use_gather_object`: False
400
- - `eval_accumulation_steps`: None
401
- - `include_for_metrics`: []
402
- - `batch_eval_metrics`: False
403
- - `save_only_model`: False
404
- - `save_on_each_node`: False
405
- - `enable_jit_checkpoint`: False
406
- - `push_to_hub`: False
407
- - `hub_private_repo`: None
408
- - `hub_model_id`: None
409
- - `hub_strategy`: every_save
410
- - `hub_always_push`: False
411
- - `hub_revision`: None
412
- - `load_best_model_at_end`: False
413
- - `ignore_data_skip`: False
414
- - `restore_callback_states_from_checkpoint`: False
415
- - `full_determinism`: False
416
- - `seed`: 42
417
- - `data_seed`: None
418
- - `use_cpu`: False
419
- - `accelerator_config`: {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}
420
- - `parallelism_config`: None
421
- - `dataloader_drop_last`: False
422
- - `dataloader_num_workers`: 0
423
- - `dataloader_pin_memory`: True
424
- - `dataloader_persistent_workers`: False
425
- - `dataloader_prefetch_factor`: None
426
- - `dataloader_multiprocessing_context`: None
427
- - `dataloader_in_order`: True
428
- - `remove_unused_columns`: True
429
- - `label_names`: None
430
- - `train_sampling_strategy`: random
431
- - `length_column_name`: length
432
- - `ddp_find_unused_parameters`: None
433
- - `ddp_bucket_cap_mb`: None
434
- - `ddp_broadcast_buffers`: False
435
- - `ddp_static_graph`: None
436
- - `ddp_backend`: None
437
- - `ddp_timeout`: 1800
438
- - `fsdp`: None
439
- - `fsdp_config`: None
440
- - `deepspeed`: None
441
- - `debug`: []
442
- - `skip_memory_metrics`: True
443
- - `do_predict`: False
444
- - `resume_from_checkpoint`: None
445
- - `local_rank`: -1
446
- - `prompts`: None
447
- - `batch_sampler`: batch_sampler
448
- - `multi_dataset_batch_sampler`: proportional
449
- - `router_mapping`: {}
450
- - `learning_rate_mapping`: {}
451
- - `warmup_ratio`: None
452
-
453
- </details>
454
-
455
- ### Training Logs
456
- | Epoch | Step | Validation Loss | triplet-eval-it_cosine_accuracy |
457
- |:------:|:----:|:---------------:|:-------------------------------:|
458
- | 0.5666 | 100 | 0.4228 | 0.9975 |
459
- | 1.0 | 177 | 0.2577 | 0.9996 |
460
-
461
-
462
- ### Training Time
463
- - **Training**: 51.7 minutes
464
- - **Evaluation**: 1.6 minutes
465
- - **Total**: 53.4 minutes
466
-
467
- ### Framework Versions
468
- - Python: 3.13.11
469
- - Sentence Transformers: 6.1.0.dev0
470
- - Transformers: 5.17.0
471
- - PyTorch: 2.11.0+cu128
472
- - Accelerate: 1.15.0
473
- - Datasets: 5.0.1
474
- - Tokenizers: 0.23.2
475
-
476
- ## Additional Resources
477
-
478
- - [Training and Finetuning Embedding Models with Sentence Transformers](https://huggingface.co/blog/train-sentence-transformers): the end-to-end guide for training or finetuning Sentence Transformer models.
479
- - [Introduction to Matryoshka Embedding Models](https://huggingface.co/blog/matryoshka): variable-size embeddings that can be truncated with minimal quality loss.
480
- - [Binary and Scalar Embedding Quantization for Significantly Faster & Cheaper Retrieval](https://huggingface.co/blog/embedding-quantization): post-training compression of embedding vectors.
481
- - [Multimodal Embedding & Reranker Models with Sentence Transformers](https://huggingface.co/blog/multimodal-sentence-transformers): use text, image, audio, and video models through the same API.
482
- - [Training and Finetuning Multimodal Embedding & Reranker Models with Sentence Transformers](https://huggingface.co/blog/train-multimodal-sentence-transformers): train multimodal embedding models, with a Visual Document Retrieval walkthrough.
483
-
484
- ## Citation
485
-
486
- ### BibTeX
487
-
488
- #### Sentence Transformers
489
- ```bibtex
490
- @inproceedings{reimers-2019-sentence-bert,
491
- title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
492
- author = "Reimers, Nils and Gurevych, Iryna",
493
- booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
494
- month = "11",
495
- year = "2019",
496
- publisher = "Association for Computational Linguistics",
497
- url = "https://arxiv.org/abs/1908.10084",
498
- }
499
- ```
500
-
501
- #### MatryoshkaLoss
502
- ```bibtex
503
- @misc{kusupati2024matryoshka,
504
- title={Matryoshka Representation Learning},
505
- author={Aditya Kusupati and Gantavya Bhatt and Aniket Rege and Matthew Wallingford and Aditya Sinha and Vivek Ramanujan and William Howard-Snyder and Kaifeng Chen and Sham Kakade and Prateek Jain and Ali Farhadi},
506
- year={2024},
507
- eprint={2205.13147},
508
- archivePrefix={arXiv},
509
- primaryClass={cs.LG}
510
- }
511
- ```
512
-
513
- #### CachedMultipleNegativesRankingLoss
514
- ```bibtex
515
- @misc{gao2021scaling,
516
- title={Scaling Deep Contrastive Learning Batch Size under Memory Limited Setup},
517
- author={Luyu Gao and Yunyi Zhang and Jiawei Han and Jamie Callan},
518
- year={2021},
519
- eprint={2101.06983},
520
- archivePrefix={arXiv},
521
- primaryClass={cs.LG}
522
- }
523
- ```
524
-
525
- #### MultipleNegativesRankingLoss
526
- ```bibtex
527
- @misc{oord2019representationlearningcontrastivepredictive,
528
- title={Representation Learning with Contrastive Predictive Coding},
529
- author={Aaron van den Oord and Yazhe Li and Oriol Vinyals},
530
- year={2019},
531
- eprint={1807.03748},
532
- archivePrefix={arXiv},
533
- primaryClass={cs.LG},
534
- url={https://arxiv.org/abs/1807.03748},
535
- }
536
- ```
537
-
538
- <!--
539
- ## Glossary
540
-
541
- *Clearly define terms in order to be accessible across audiences.*
542
- -->
543
-
544
- <!--
545
- ## Model Card Authors
546
-
547
- *Lists the people who create the model card, providing recognition and accountability for the detailed work that goes into its construction.*
548
- -->
549
-
550
- <!--
551
- ## Model Card Contact
552
-
553
- *Provides a way for people who have updates to the Model Card, suggestions, or questions, to contact the Model Card authors.*
554
  -->
 
121
  language:
122
  - it
123
  ---
124
+
125
+ # SentenceTransformer based on ibm-granite/granite-embedding-311m-multilingual-r2
126
+
127
+ This is a [sentence-transformers](https://www.SBERT.net) model finetuned from [ibm-granite/granite-embedding-311m-multilingual-r2](https://huggingface.co/ibm-granite/granite-embedding-311m-multilingual-r2) on the it-wiki-retrieval-synthetic-hn dataset. It maps inputs to a 768-dimensional dense vector space and can be used for semantic textual similarity, semantic search, paraphrase mining, classification, clustering, and more.
128
+
129
+ <p align="center">
130
+ <img src="https://huggingface.co/nickprock/granite-311m-italiano-matryoshka/raw/main/logo.svg" width="500" alt="Granite Matryoshka Logo">
131
+ </p>
132
+
133
+ ## Model Details
134
+
135
+ ### Model Description
136
+ - **Model Type:** Sentence Transformer
137
+ - **Base model:** [ibm-granite/granite-embedding-311m-multilingual-r2](https://huggingface.co/ibm-granite/granite-embedding-311m-multilingual-r2) <!-- at revision 44399559930365213510b1ee2eb15ded83374f0e -->
138
+ - **Maximum Sequence Length:** 32768 tokens
139
+ - **Output Dimensionality:** 768 dimensions
140
+ - **Similarity Function:** Cosine Similarity
141
+ - **Supported Modality:** Text
142
+ - **Training Dataset:**
143
+ - it-wiki-retrieval-synthetic-hn
144
+ <!-- - **Language:** Unknown -->
145
+ <!-- - **License:** Unknown -->
146
+
147
+ ### Model Sources
148
+
149
+ - **Documentation:** [Sentence Transformers Documentation](https://sbert.net)
150
+ - **Repository:** [Sentence Transformers on GitHub](https://github.com/huggingface/sentence-transformers)
151
+ - **Hugging Face:** [Sentence Transformers on Hugging Face](https://huggingface.co/models?library=sentence-transformers)
152
+
153
+ ### Full Model Architecture
154
+
155
+ ```
156
+ SentenceTransformer(
157
+ (0): Transformer({'transformer_task': 'feature-extraction', 'modality_config': {'text': {'method': 'forward', 'method_output_name': 'last_hidden_state'}}, 'module_output_name': 'token_embeddings', 'architecture': 'ModernBertModel'})
158
+ (1): Pooling({'embedding_dimension': 768, 'pooling_mode': 'cls', 'include_prompt': False})
159
+ (2): Normalize({'module_input_name': 'sentence_embedding', 'module_output_name': 'sentence_embedding'})
160
+ )
161
+ ```
162
+
163
+ ## Usage
164
+
165
+ ### Direct Usage (Sentence Transformers)
166
+
167
+ First install the Sentence Transformers library:
168
+
169
+ ```bash
170
+ pip install -U sentence-transformers
171
+ ```
172
+ Then you can load this model and run inference.
173
+ ```python
174
+ from sentence_transformers import SentenceTransformer
175
+
176
+ # Download from the 🤗 Hub
177
+ model = SentenceTransformer("sentence_transformers_model_id")
178
+ # Run inference
179
+ sentences = [
180
+ "In quali gare fu eliminato l'atleta nelle Olimpiadi di Parigi?",
181
+ 'Partecipò ai Giochi della II Olimpiade di Parigi nella gara di spada individuale e sciabola individuale. In entrambe le gare fu eliminato alle semifinali.',
182
+ "['Partecipò ai Giochi della II Olimpiade di Parigi alla gara di fioretto individuale, in cui fu eliminato ai quarti, e alla gara di spada individuale, in cui fu eliminato al primo turno.', 'Partecipò ai Giochi della II Olimpiade di Parigi nelle gare di fioretto per maestri, in cui fu eliminato ai ripescaggi, e di spada per maestri, in cui fu eliminato al primo turno.']",
183
+ ]
184
+ embeddings = model.encode(sentences)
185
+ print(embeddings.shape)
186
+ # [3, 768]
187
+
188
+ # Get the similarity scores for the embeddings
189
+ similarities = model.similarity(embeddings, embeddings)
190
+ print(similarities)
191
+ # tensor([[1.0000, 0.8895, 0.6944],
192
+ # [0.8895, 1.0000, 0.7186],
193
+ # [0.6944, 0.7186, 1.0000]])
194
+ ```
195
+ <!--
196
+ ### Direct Usage (Transformers)
197
+
198
+ <details><summary>Click to see the direct usage in Transformers</summary>
199
+
200
+ </details>
201
+ -->
202
+
203
+ <!--
204
+ ### Downstream Usage (Sentence Transformers)
205
+
206
+ You can finetune this model on your own dataset.
207
+
208
+ <details><summary>Click to expand</summary>
209
+
210
+ </details>
211
+ -->
212
+
213
+ <!--
214
+ ### Out-of-Scope Use
215
+
216
+ *List how the model may foreseeably be misused and address what users ought not to do with the model.*
217
+ -->
218
  ## Evaluation & Benchmarks
219
 
220
  To ensure full transparency, the model was evaluated across two distinct benchmarks: **Information Retrieval / RAG** (SQuAD-it) and **Semantic Textual Similarity** (STSb-it), compared against widely used Italian embedding models.
 
247
  | **`granite-311m-italiano-matryoshka (Full)`** | **768** | **0.7612** | **0.7574** | **588.2** |
248
  | **`granite-311m-italiano-matryoshka (Truncated)`** | **256** | **0.7627** | **0.7599** | **572.0** |
249
 
250
+ ---
251
+
252
+
253
+ ## Training Details
254
+
255
  ### Training Setup
256
  - **Dataset:** `nickprock/it-wiki-retrieval-synthetic-hn` (45,181 samples)
257
  - **Epochs:** 1
258
  - **Batch Size:** 16 (per device) x 16 (Gradient Accumulation) = 256 effective batch size
259
  - **Optimizer:** `adamw_8bit`
260
  - **Learning Rate:** 2e-5 with linear warmup (0.1)
261
+ - **Precision:** `bf16`
262
+
263
+ ### Training Dataset
264
+
265
+ #### it-wiki-retrieval-synthetic-hn
266
+
267
+ * Dataset: it-wiki-retrieval-synthetic-hn
268
+ * Size: 45,181 training samples
269
+ * Columns: <code>anchor</code>, <code>positive</code>, and <code>negative</code>
270
+ * Approximate statistics based on the first 100 samples:
271
+ | | anchor | positive | negative |
272
+ |:---------|:-----------------------------------------------------------------------------------|:-------------------------------------------------------------------------------------|:-------------------------------------------------------------------------------------|
273
+ | type | string | string | string |
274
+ | modality | text | text | text |
275
+ | details | <ul><li>min: 12 tokens</li><li>mean: 20.64 tokens</li><li>max: 44 tokens</li></ul> | <ul><li>min: 36 tokens</li><li>mean: 119.38 tokens</li><li>max: 233 tokens</li></ul> | <ul><li>min: 80 tokens</li><li>mean: 257.07 tokens</li><li>max: 441 tokens</li></ul> |
276
+ * Samples:
277
+ | anchor | positive | negative |
278
+ |:--------------------------------------------------------------------------------------------------------|:-----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|:---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
279
+ | <code>Quali formati ha avuto l'album Dejavu della cantante giapponese Koda Kumi?</code> | <code>Dejavu è il nono album studio della cantante giapponese Koda Kumi, pubblicato il 2 marzo 2011. Descrizione L'album è stato pubblicato in due formati: CD e CD+2DVD (First Press Limited Edition); quando di quest'ultima si sono esaurite le copie, è stata venduta la sola edizione CD+DVD. La traccia Hey Baby! è stata utilizzata come canzone di apertura per la sigla della dodicesima stagione del famoso anime Crayon Shin-chan.</code> | <code>["è una serie di light novel scritta da Aoi Sekina e illustrata Kira Inugami. La serie è iniziata con la prubblicazione del primo volume il 19 gennaio 2008, edito dalla Fujimi Shobō per l'etichetta Fujimi Fantasia Bunko. Originariamente la serie era intitolata , ma fu successivamente intitolata con il sottotitolo del primo volume . Alla serie si fa anche riferimento con il titolo . Da essa sono stati tratti un manga nel 2009 e due serie anime nel 2009 e nel 2012.\n\nTrama \nI membri del consiglio studentesco dell'Accademia Hekiyou di Hokkaidō vengono selezionati attraverso un concorso di popolarità.", "è un manga di genere yaoi scritto ed illustrato da Hinako Takanaga. L'opera è stata serializzata tra il 2001 e il 2003 da Ōtō Shobō sulla rivista Gust e in seguito raccolta in tre volumi tankōbon.\n\nTrama \nQuando Kojima, allegro studente di scuola media, decide di fare amicizia col solitario Nakahara, viene a sapere che questi si trova praticamente senza famiglia: infatti il padre è lo...</code> |
280
+ | <code>Come sono state suddivise le aree dei Territori del Nord-Ovest nel censimento più recente?</code> | <code>La Regione 1 è una delle sei regioni censuarie dei Territori del Nord-Ovest in Canada, con capoluogo Inuvik. Al 2011 aveva 6.712 abitanti su una superficie di (1 chilometro quadro ogni 54 abitanti). È stata istituita con il censimento del 2011, quando l'area dei Territori è stata suddivisa in 6 nuove regioni censuarie.</code> | <code>['La municipalità di Northern Areas è una Local Government Area che si trova in Australia Meridionale. Essa si estende su una superficie di 3.070 chilometri quadrati e ha una popolazione di 4.866 abitanti. La sede del consiglio si trova a Jamestown.', 'Il sistema bibliotecario Sud ovest bresciano è una rete di biblioteche situate nei comuni della Bassa Bresciana occidentale.\nÈ parte della Rete Bibliotecaria Bresciana e Cremonese (RBBC). La convenzione che regola i rapporti tra i comuni aderenti è stata stipulata il 18 agosto del 2000.']</code> |
281
+ | <code>In quale anno Colosi ha donato i suoi estratti e opuscoli all'Istituto di Zoologia?</code> | <code>Docente all'università di Firenze dal 1926 al 1962, dal 1950 fu Socio dei Lincei. Fu autore di varie opere scientifiche come Fauna italiana (1933), Gli organismi ed il mondo esterno (1945) e Zoologia e biologia generale (1956). Biblioteca personale Nel 1975 Colosi donò all'Istituto di Zoologia dell'Università di Firenze circa 9.400 estratti ed opuscoli del sec.</code> | <code>["Fu autore delle editio princeps e della raccolta L'oceano delle fiumane delle novelle (1866).\n\nNel 1870 gli fu dedicata una medaglia (unitamente a Heinrich Leberecht Fleischer, August Friedrich Pott ed Emil Rödiger) in occasione del 25º anniversario della fondazione della Deutsche Morgenländische Gesellschaft.", 'Diresse il laboratorio istologico francese e fu docente al Collège de France dal 1875. Nel 1888 fu nominato Socio Straniero dei Lincei. Da lui prendono nome gli anelli di Ranvier e le croci latine di Ranvier.\n\nEbbe tra i suoi allievi Ferdinand-Jean Darier, Justin Marie Jolly, Joaquín Albarrán, Luis Simarro Lacabra e Fredrik Georg Gade.']</code> |
282
+ * Loss: [<code>MatryoshkaLoss</code>](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#matryoshkaloss) with these parameters:
283
+ ```json
284
+ {
285
+ "loss": "CachedMultipleNegativesRankingLoss",
286
+ "matryoshka_dims": [
287
+ 768,
288
+ 512,
289
+ 256,
290
+ 128
291
+ ],
292
+ "matryoshka_weights": [
293
+ 1,
294
+ 1,
295
+ 1,
296
+ 1
297
+ ],
298
+ "n_dims_per_step": -1
299
+ }
300
+ ```
301
+
302
+ ### Evaluation Dataset
303
+
304
+ #### it-wiki-retrieval-synthetic-hn
305
+
306
+ * Dataset: it-wiki-retrieval-synthetic-hn
307
+ * Size: 2,378 evaluation samples
308
+ * Columns: <code>anchor</code>, <code>positive</code>, and <code>negative</code>
309
+ * Approximate statistics based on the first 100 samples:
310
+ | | anchor | positive | negative |
311
+ |:---------|:-----------------------------------------------------------------------------------|:-------------------------------------------------------------------------------------|:--------------------------------------------------------------------------------------|
312
+ | type | string | string | string |
313
+ | modality | text | text | text |
314
+ | details | <ul><li>min: 11 tokens</li><li>mean: 20.12 tokens</li><li>max: 49 tokens</li></ul> | <ul><li>min: 35 tokens</li><li>mean: 119.73 tokens</li><li>max: 198 tokens</li></ul> | <ul><li>min: 104 tokens</li><li>mean: 266.03 tokens</li><li>max: 413 tokens</li></ul> |
315
+ * Samples:
316
+ | anchor | positive | negative |
317
+ |:-----------------------------------------------------------------------------------------------------------|:---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|:---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
318
+ | <code>Cosa significava essere un marchese nel periodo feudale in Italia?</code> | <code>Berengario – nome proprio di persona italiano maschile Berengario del Friuli – marchese del Friuli (874-924), re d'Italia (888-924) e imperatore del Sacro Romano Impero (915-924) Berengario II d'Ivrea – marchese d'Ivrea (928-950) e re d'Italia (950-961) Berengario I di Tolosa detto il Saggio (? – 835) – conte di Tolosa e conte di Barcellona Berengario di Tours (1010-1088) – filosofo, dialettico ed eretico francese medievale</code> | <code>['Il titolo di conte di Richmond è un titolo nobiliare, ora estinto, dei pari del Regno Unito. Venne creato molte volte è ed è stato tenuto da famiglie bretoni, normanne, di stirpe plantageneta, capetingia, sabauda, Tudor e Stuart.', "Duca d'Orléans (in francese: Duc d'Orléans) è un titolo riservato alla famiglia reale francese, creato nel corso del XIV secolo. Legato al trattamento di Principe del sangue (princes du sang), il titolo di duca d'Orléans era dato, se possibile, al fratello minore del sovrano. In questo modo il titolare spesso formava una linea collaterale della famiglia reale francese, con un eventuale diritto di succedere al trono tra i principi più prossimi al trono.\n\nDurante il periodo dell'Ancien Régime il detentore del titolo spesso assumeva un ruolo politico."]</code> |
319
+ | <code>Quali sono le caratteristiche musicali dell'album Listen to Your Heart - Unplugged di D.H.T.?</code> | <code>Listen to Your Heart - Unplugged è il terzo album duo belga D.H.T.. È stato pubblicato solo digitalmente il 30 giugno 2006. Il disco L'album è costituito dalle stesse tracce del loro album Listen to Your Heart, arrangiate in chiave acustica. La versione di Listen to Your Heart presente in questo album è la stessa che chiudeva l'album di debutto, solo qui è la traccia d'apertura dell'album; le successive nove tracce sono arrangiamenti degli altri brani del primo album. L'undicesima ed ultima traccia è What if?, l'unico inedito, che sostituisce Depressed.</code> | <code>["Listen to Your Heart è l'album di debutto del duo dance-trance belga D.H.T., pubblicato il 18 luglio 2005.\n\nIl disco\nL'album prende il titolo dall'omonima Listen to Your Heart, canzone del gruppo pop svedese Roxette, della quale sono presenti due cover nella tracklist (la prima già precedentemente pubblicata come singolo). Oltre a Listen to Your Heart, l'album si compone di altre quattro cover e di sei brani originali.\n\nDa quest'album sono stati estratti quattro singoli, due dei quali prima della pubblicazione dell'album.", 'Listen to Your Heart è il secondo album del duo belga D.H.T., pubblicato solo digitalmente il 30 giugno 2006.\n\nIl disco\nL\'album riprende la tracklist del precedente Listen to Your Heart, riproponeno tutti gli undici brani in versione remixata.\n\nDa questo album è stato tratto un singolo, Sun "teuduh-duh-te-te", pubblicato l\'8 giugno 2005.\n\nTracce\n\nTesti e musiche di Edmée Daenen e Flor Theeuwes, tranne dove indicato.\n\n Listen to Your Heart (Hardb...</code> |
320
+ | <code>Conseguenze psicologiche del lavoro marittimo nel romanzo The Shadow Line</code> | <code>La linea d'ombra (The Shadow Line) – romanzo di Joseph Conrad del 1917 The Shadow Line – album dei Godhead del 2006 The Shadow Line – serie televisiva britannica del 2011</code> | <code>["Il mare (The Sea) è un romanzo di John Banville del 2005 vincitore del Booker Prize.\n\nLa vicenda è narrata da Max Morden, uno storico dell'arte in pensione che cerca di accettare le morti di coloro che ha amato da bambino e da adulto.\nLa narrazione è caratterizzata dai frequenti salti temporali tra presente e passato.\n\nTrama \nIl romanzo è ambientato nella città immaginaria di Ballymore, dove i ricordi della noiosa cittadina sono manipolati dall'immaginazione.", "Endless Ocean, detto anche Forever Blue, è un gioco di simulazione di immersione subacquea prodotto dalla Nintendo e compatibile con console Nintendo Wii. È il primo capitolo della omonima saga.\n\nModalità di gioco\nEsplorazione. L'esplorazione è libera e la si può praticare in qualsiasi momento del giorno.\nLezioni. Sono delle esplorazioni di durata breve in cui insieme a qualcun altro bisognerà trovare un pesce in particolare."]</code> |
321
+ * Loss: [<code>MatryoshkaLoss</code>](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#matryoshkaloss) with these parameters:
322
+ ```json
323
+ {
324
+ "loss": "CachedMultipleNegativesRankingLoss",
325
+ "matryoshka_dims": [
326
+ 768,
327
+ 512,
328
+ 256,
329
+ 128
330
+ ],
331
+ "matryoshka_weights": [
332
+ 1,
333
+ 1,
334
+ 1,
335
+ 1
336
+ ],
337
+ "n_dims_per_step": -1
338
+ }
339
+ ```
340
+
341
+ ### Training Hyperparameters
342
+ #### Non-Default Hyperparameters
343
+
344
+ - `per_device_train_batch_size`: 16
345
+ - `num_train_epochs`: 1
346
+ - `learning_rate`: 2e-05
347
+ - `warmup_steps`: 0.1
348
+ - `optim`: adamw_8bit
349
+ - `gradient_accumulation_steps`: 16
350
+ - `bf16`: True
351
+
352
+ #### All Hyperparameters
353
+ <details><summary>Click to expand</summary>
354
+
355
+ - `per_device_train_batch_size`: 16
356
+ - `num_train_epochs`: 1
357
+ - `max_steps`: -1
358
+ - `learning_rate`: 2e-05
359
+ - `lr_scheduler_type`: linear
360
+ - `lr_scheduler_kwargs`: None
361
+ - `warmup_steps`: 0.1
362
+ - `optim`: adamw_8bit
363
+ - `optim_args`: None
364
+ - `weight_decay`: 0.0
365
+ - `adam_beta1`: 0.9
366
+ - `adam_beta2`: 0.999
367
+ - `adam_epsilon`: 1e-08
368
+ - `optim_target_modules`: None
369
+ - `gradient_accumulation_steps`: 16
370
+ - `average_tokens_across_devices`: True
371
+ - `max_grad_norm`: 1.0
372
+ - `label_smoothing_factor`: 0.0
373
+ - `bf16`: True
374
+ - `fp16`: False
375
+ - `bf16_full_eval`: False
376
+ - `fp16_full_eval`: False
377
+ - `tf32`: None
378
+ - `gradient_checkpointing`: False
379
+ - `gradient_checkpointing_kwargs`: None
380
+ - `torch_compile`: False
381
+ - `torch_compile_backend`: None
382
+ - `torch_compile_mode`: None
383
+ - `use_liger_kernel`: False
384
+ - `liger_kernel_config`: None
385
+ - `use_cache`: False
386
+ - `neftune_noise_alpha`: None
387
+ - `torch_empty_cache_steps`: None
388
+ - `auto_find_batch_size`: False
389
+ - `log_on_each_node`: True
390
+ - `logging_nan_inf_filter`: True
391
+ - `include_num_input_tokens_seen`: no
392
+ - `log_level`: passive
393
+ - `log_level_replica`: warning
394
+ - `disable_tqdm`: False
395
+ - `project`: huggingface
396
+ - `trackio_space_id`: None
397
+ - `trackio_bucket_id`: None
398
+ - `trackio_static_space_id`: None
399
+ - `per_device_eval_batch_size`: 8
400
+ - `prediction_loss_only`: True
401
+ - `eval_on_start`: False
402
+ - `eval_do_concat_batches`: True
403
+ - `eval_use_gather_object`: False
404
+ - `eval_accumulation_steps`: None
405
+ - `include_for_metrics`: []
406
+ - `batch_eval_metrics`: False
407
+ - `save_only_model`: False
408
+ - `save_on_each_node`: False
409
+ - `enable_jit_checkpoint`: False
410
+ - `push_to_hub`: False
411
+ - `hub_private_repo`: None
412
+ - `hub_model_id`: None
413
+ - `hub_strategy`: every_save
414
+ - `hub_always_push`: False
415
+ - `hub_revision`: None
416
+ - `load_best_model_at_end`: False
417
+ - `ignore_data_skip`: False
418
+ - `restore_callback_states_from_checkpoint`: False
419
+ - `full_determinism`: False
420
+ - `seed`: 42
421
+ - `data_seed`: None
422
+ - `use_cpu`: False
423
+ - `accelerator_config`: {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}
424
+ - `parallelism_config`: None
425
+ - `dataloader_drop_last`: False
426
+ - `dataloader_num_workers`: 0
427
+ - `dataloader_pin_memory`: True
428
+ - `dataloader_persistent_workers`: False
429
+ - `dataloader_prefetch_factor`: None
430
+ - `dataloader_multiprocessing_context`: None
431
+ - `dataloader_in_order`: True
432
+ - `remove_unused_columns`: True
433
+ - `label_names`: None
434
+ - `train_sampling_strategy`: random
435
+ - `length_column_name`: length
436
+ - `ddp_find_unused_parameters`: None
437
+ - `ddp_bucket_cap_mb`: None
438
+ - `ddp_broadcast_buffers`: False
439
+ - `ddp_static_graph`: None
440
+ - `ddp_backend`: None
441
+ - `ddp_timeout`: 1800
442
+ - `fsdp`: None
443
+ - `fsdp_config`: None
444
+ - `deepspeed`: None
445
+ - `debug`: []
446
+ - `skip_memory_metrics`: True
447
+ - `do_predict`: False
448
+ - `resume_from_checkpoint`: None
449
+ - `local_rank`: -1
450
+ - `prompts`: None
451
+ - `batch_sampler`: batch_sampler
452
+ - `multi_dataset_batch_sampler`: proportional
453
+ - `router_mapping`: {}
454
+ - `learning_rate_mapping`: {}
455
+ - `warmup_ratio`: None
456
+
457
+ </details>
458
+
459
+ ### Training Logs
460
+ | Epoch | Step | Validation Loss | triplet-eval-it_cosine_accuracy |
461
+ |:------:|:----:|:---------------:|:-------------------------------:|
462
+ | 0.5666 | 100 | 0.4228 | 0.9975 |
463
+ | 1.0 | 177 | 0.2577 | 0.9996 |
464
+
465
+
466
+ ### Training Time
467
+ - **Training**: 51.7 minutes
468
+ - **Evaluation**: 1.6 minutes
469
+ - **Total**: 53.4 minutes
470
+
471
+ ### Framework Versions
472
+ - Python: 3.13.11
473
+ - Sentence Transformers: 6.1.0.dev0
474
+ - Transformers: 5.17.0
475
+ - PyTorch: 2.11.0+cu128
476
+ - Accelerate: 1.15.0
477
+ - Datasets: 5.0.1
478
+ - Tokenizers: 0.23.2
479
+
480
+ ## Additional Resources
481
+
482
+ - [Training and Finetuning Embedding Models with Sentence Transformers](https://huggingface.co/blog/train-sentence-transformers): the end-to-end guide for training or finetuning Sentence Transformer models.
483
+ - [Introduction to Matryoshka Embedding Models](https://huggingface.co/blog/matryoshka): variable-size embeddings that can be truncated with minimal quality loss.
484
+ - [Binary and Scalar Embedding Quantization for Significantly Faster & Cheaper Retrieval](https://huggingface.co/blog/embedding-quantization): post-training compression of embedding vectors.
485
+ - [Multimodal Embedding & Reranker Models with Sentence Transformers](https://huggingface.co/blog/multimodal-sentence-transformers): use text, image, audio, and video models through the same API.
486
+ - [Training and Finetuning Multimodal Embedding & Reranker Models with Sentence Transformers](https://huggingface.co/blog/train-multimodal-sentence-transformers): train multimodal embedding models, with a Visual Document Retrieval walkthrough.
487
+
488
+ ## Citation
489
+
490
+ ### BibTeX
491
+
492
+ #### Sentence Transformers
493
+ ```bibtex
494
+ @inproceedings{reimers-2019-sentence-bert,
495
+ title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
496
+ author = "Reimers, Nils and Gurevych, Iryna",
497
+ booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
498
+ month = "11",
499
+ year = "2019",
500
+ publisher = "Association for Computational Linguistics",
501
+ url = "https://arxiv.org/abs/1908.10084",
502
+ }
503
+ ```
504
+
505
+ #### MatryoshkaLoss
506
+ ```bibtex
507
+ @misc{kusupati2024matryoshka,
508
+ title={Matryoshka Representation Learning},
509
+ author={Aditya Kusupati and Gantavya Bhatt and Aniket Rege and Matthew Wallingford and Aditya Sinha and Vivek Ramanujan and William Howard-Snyder and Kaifeng Chen and Sham Kakade and Prateek Jain and Ali Farhadi},
510
+ year={2024},
511
+ eprint={2205.13147},
512
+ archivePrefix={arXiv},
513
+ primaryClass={cs.LG}
514
+ }
515
+ ```
516
+
517
+ #### CachedMultipleNegativesRankingLoss
518
+ ```bibtex
519
+ @misc{gao2021scaling,
520
+ title={Scaling Deep Contrastive Learning Batch Size under Memory Limited Setup},
521
+ author={Luyu Gao and Yunyi Zhang and Jiawei Han and Jamie Callan},
522
+ year={2021},
523
+ eprint={2101.06983},
524
+ archivePrefix={arXiv},
525
+ primaryClass={cs.LG}
526
+ }
527
+ ```
528
+
529
+ #### MultipleNegativesRankingLoss
530
+ ```bibtex
531
+ @misc{oord2019representationlearningcontrastivepredictive,
532
+ title={Representation Learning with Contrastive Predictive Coding},
533
+ author={Aaron van den Oord and Yazhe Li and Oriol Vinyals},
534
+ year={2019},
535
+ eprint={1807.03748},
536
+ archivePrefix={arXiv},
537
+ primaryClass={cs.LG},
538
+ url={https://arxiv.org/abs/1807.03748},
539
+ }
540
+ ```
541
+
542
+ <!--
543
+ ## Glossary
544
+
545
+ *Clearly define terms in order to be accessible across audiences.*
546
+ -->
547
+
548
+ <!--
549
+ ## Model Card Authors
550
+
551
+ *Lists the people who create the model card, providing recognition and accountability for the detailed work that goes into its construction.*
552
+ -->
553
+
554
+ <!--
555
+ ## Model Card Contact
556
+
557
+ *Provides a way for people who have updates to the Model Card, suggestions, or questions, to contact the Model Card authors.*
558
  -->