--- language: es license: cc-by-nc-sa-4.0 tags: - text-classification - sentiment-analysis - sarcasm-detection - xlm-roberta base_model: xlm-roberta-large pipeline_tag: text-classification datasets: - Ernesto-1997/Sarcastic_spanish_dataset metrics: - f1 - precision - recall - accuracy --- # Sarcasmo XLM-ROBERTA Fine-tuning de **`xlm-roberta-large`** sobre el dataset **Sarcastic_spanish_dataset** (Ernesto-1997). Tarea: clasificación binaria (sarcasmo / no_sarcasmo). Taller PLN - Maestría Ingeniería de Sistemas, Univalle. ## Métricas en test | Batch | F1 | Precision | Recall | Accuracy | |------:|---:|---:|---:|---:| | bs8 ⭐ | 0.9170 | 0.9201 | 0.9139 | 0.9351 | | bs16 | 0.9104 | 0.9232 | 0.8979 | 0.9306 | | bs32 | 0.9081 | 0.9199 | 0.8966 | 0.9288 | ## Uso ```python from transformers import AutoModelForSequenceClassification, AutoTokenizer, pipeline m = AutoModelForSequenceClassification.from_pretrained("cvalenciaunivalle/sarcasmo-xlm-roberta-large", subfolder="bs8") t = AutoTokenizer.from_pretrained("cvalenciaunivalle/sarcasmo-xlm-roberta-large", subfolder="bs8") pipe = pipeline("text-classification", model=m, tokenizer=t) pipe("¡Qué divertido, otro lunes de trabajo!") ``` ## Detalles - Modelo base: `xlm-roberta-large` - Dataset: [Ernesto-1997/Sarcastic_spanish_dataset](https://huggingface.co/datasets/Ernesto-1997/Sarcastic_spanish_dataset) - Trainer + EarlyStopping - Hardware: Kaggle GPU - Compañeros: Laura Valero, Cristian Valencia