--- library_name: sentence-transformers pipeline_tag: sentence-similarity tags: - sentence-transformers - feature-extraction - sentence-similarity - matryoshka - multilingual - embeddings language: - multilingual - en - ar - de - es - fr - zh - ru - tr - ko - ja license: cc-by-nc-4.0 base_model: xlm-roberta-base --- # Matryoshka Text Embedding v1 **Matryoshka Embedding Model with Flexible Dimensions** This is a [sentence-transformers](https://www.SBERT.net) model with Matryoshka Representation Learning, allowing flexible dimension truncation from 64D to 1024D. ## Model Details - **Model Type**: Sentence Transformer with Matryoshka Representation Learning - **Base Architecture**: XLM-RoBERTa - **Dimensions**: 64, 128, 256, 384, 512, 768, 1024 - **Max Sequence Length**: 8192 tokens - **Languages**: 100+ languages - **Output Dimensionality**: 1024 (with 7 truncation options) ## Usage ```python from sentence_transformers import SentenceTransformer model = SentenceTransformer('matryoshka-text-embedding-v1') # Full precision embeddings = model.encode(["Hello World"]) # Optimized for production (recommended) embeddings = model.encode(["Hello World"], truncate_dim=512) ``` See [README.md](README.md) for detailed documentation. ## Performance (Self-Reported) | Task | Metric | Score | |------|--------|-------| | SciFact | NDCG@10 | 0.6308 | | STS17 | Spearman | 0.8096 | | STSBenchmark | Spearman | 0.8506 | ## License CC-BY-NC-4.0 - See LICENSE file for details and acknowledgments. ## Acknowledgments This model builds upon: - **XLM-RoBERTa**: Base architecture - **BAAI**: RetroMAE and BGE-M3 research contributions - **Matryoshka Representation Learning**: Training methodology ## Citation ```bibtex @misc{matryoshka-text-embedding-v1, title={Matryoshka Text Embedding v1}, author={Hasan Kurşun and Kerem Berkay Yanık}, year={2025}, url={https://huggingface.co/matryoshka-text-embedding-v1}, organization={Lumees}, contact={hello@lumees.io}, website={https://lumees.io} } ```