Instructions to use LeCastre/DistilBert-pMHC with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use LeCastre/DistilBert-pMHC with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="LeCastre/DistilBert-pMHC")# Load model directly from transformers import AutoTokenizer, BertRnnDist tokenizer = AutoTokenizer.from_pretrained("LeCastre/DistilBert-pMHC") model = BertRnnDist.from_pretrained("LeCastre/DistilBert-pMHC", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Update README.md
Browse files
README.md
CHANGED
|
@@ -24,7 +24,7 @@ Se usó de referencia la Destilación de un modelo RoBERTa. Lo que se hizo fue d
|
|
| 24 |
|
| 25 |

|
| 26 |
|
| 27 |
-
|
| 28 |
Citas:
|
| 29 |
[1] Victor SANH, Lysandre DEBUT, Julien CHAUMOND, Thomas WOLF, DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter (2019), Hugging Face
|
| 30 |
[3] Yinhan Liu, Myle Ott, Naman Goyal, Jingfei Du, Mandar Joshi, Danqi Chen, Omer Levy, Mike Lewis, Luke Zettlemoyer, Veselin Stoyanov, RoBERTa: un enfoque de preentrenamiento BERT optimizado de manera sólida (2019), arXiv
|
|
|
|
| 24 |
|
| 25 |

|
| 26 |
|
| 27 |
+
Este proceso implica reducir el tamaño del modelo maestro dividiendo sus capas, por ejemplo, a la mitad en el modelo estudiante, manteniendo su estructura esencial. Según [1], se entrena al modelo pequeño para imitar las salidas del maestro, utilizando técnicas como la pérdida de entropía cruzada y la temperatura de softmax para suavizar las predicciones. Como se menciona en [2], además de reducir capas, se ajustan los pesos y se optimizan las salidas intermedias para que el modelo destilado conserve el rendimiento. En [1] usaron la teoría de DistilBERT pero aplicado a un modelo RoBERTa de [2] y usando esta implementación, obviamente modificándolo para nuestro modelo ProteinBERT, se logró hacerle una destilación y obtener resultados muy similares al modelo original y con mucho menos peso que su modelo maestro.
|
| 28 |
Citas:
|
| 29 |
[1] Victor SANH, Lysandre DEBUT, Julien CHAUMOND, Thomas WOLF, DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter (2019), Hugging Face
|
| 30 |
[3] Yinhan Liu, Myle Ott, Naman Goyal, Jingfei Du, Mandar Joshi, Danqi Chen, Omer Levy, Mike Lewis, Luke Zettlemoyer, Veselin Stoyanov, RoBERTa: un enfoque de preentrenamiento BERT optimizado de manera sólida (2019), arXiv
|