metadata
language: es
license: cc-by-nc-sa-4.0
tags:
- text-classification
- sentiment-analysis
- sarcasm-detection
- xlm-roberta
base_model: xlm-roberta-large
pipeline_tag: text-classification
datasets:
- Ernesto-1997/Sarcastic_spanish_dataset
metrics:
- f1
- precision
- recall
- accuracy
Sarcasmo XLM-ROBERTA
Fine-tuning de xlm-roberta-large sobre el dataset Sarcastic_spanish_dataset (Ernesto-1997).
Tarea: clasificación binaria (sarcasmo / no_sarcasmo).
Taller PLN - Maestría Ingeniería de Sistemas, Univalle.
Métricas en test
| Batch | F1 | Precision | Recall | Accuracy |
|---|---|---|---|---|
| bs8 ⭐ | 0.9170 | 0.9201 | 0.9139 | 0.9351 |
| bs16 | 0.9104 | 0.9232 | 0.8979 | 0.9306 |
| bs32 | 0.9081 | 0.9199 | 0.8966 | 0.9288 |
Uso
from transformers import AutoModelForSequenceClassification, AutoTokenizer, pipeline
m = AutoModelForSequenceClassification.from_pretrained("cvalenciaunivalle/sarcasmo-xlm-roberta-large", subfolder="bs8")
t = AutoTokenizer.from_pretrained("cvalenciaunivalle/sarcasmo-xlm-roberta-large", subfolder="bs8")
pipe = pipeline("text-classification", model=m, tokenizer=t)
pipe("¡Qué divertido, otro lunes de trabajo!")
Detalles
- Modelo base:
xlm-roberta-large - Dataset: Ernesto-1997/Sarcastic_spanish_dataset
- Trainer + EarlyStopping
- Hardware: Kaggle GPU
- Compañeros: Laura Valero, Cristian Valencia