BETO Fine-tuned para Detección de Fake News en Español
Modelo BERT en español (BETO) afinado para clasificar noticias en español como real (0) o fake (1).
Detalles
- Modelo base:
dccuchile/bert-base-spanish-wwm-cased - Corpus: Spanish Fake News Corpus (Posadas-Durán et al.)
- Tarea: clasificación binaria (
real/fake) - Idioma: español (multi-país: México, España, Latinoamérica)
- max_length: 512 tokens (WordPiece)
Resultados
| Métrica | Valor |
|---|---|
| F1 (best seed=123) | 0.7585 |
| F1 (multi-seed avg, 5 seeds) | 0.7452 ± 0.0116 |
| Accuracy | 0.7762 |
| Precision (fake) | 0.7544 |
| Recall (fake) | 0.7625 |
Multi-seed: 13, 42, 87, 123, 2024. El F1 reportado es la media. El sweep de hiperparámetros usó learning_rate, batch_size, warmup_ratio y weight_decay sobre validation set, evaluando solo en test (sin leakage).
Uso
from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch
tokenizer = AutoTokenizer.from_pretrained("Anderson230101/beto-fakenews-tuned")
model = AutoModelForSequenceClassification.from_pretrained("Anderson230101/beto-fakenews-tuned")
text = "El presidente anuncia un nuevo programa social para zonas rurales."
inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=512)
with torch.no_grad():
logits = model(**inputs).logits
probs = torch.softmax(logits, dim=-1)[0]
labels = ["real", "fake"]
print({labels[i]: float(probs[i]) for i in range(2)})
Limitaciones
- Entrenado solo en corpus Posadas-Durán; no se valida out-of-domain.
- Sesgado hacia el estilo del corpus (sátira política, bulos virales pre-2020). Textos modernos o de otros temas pueden bajar la performance.
- F1=0.7585 < 0.80 (objetivo académico) — probablemente techo del corpus por errores de etiquetado y ambigüedad real/sátira.
Cita
Proyecto académico para el curso de IA — UTP (Universidad Tecnológica del Perú), 2026.
Corpus: Posadas-Durán, J. P., Gómez-Adorno, H., Sidorov, G., & Escobar, J. J. M. (2019). Detection of fake news in a new corpus for the Spanish language. Journal of Intelligent & Fuzzy Systems.
- Downloads last month
- 11
Model tree for Anderson230101/beto-fakenews-tuned
Base model
dccuchile/bert-base-spanish-wwm-casedSpace using Anderson230101/beto-fakenews-tuned 1
Evaluation results
- F1 (best seed=123) on Posadas-Durán Spanish Fake News Corpusself-reported0.758
- F1 (multi-seed mean, std=0.0116) on Posadas-Durán Spanish Fake News Corpusself-reported0.745
- Accuracy on Posadas-Durán Spanish Fake News Corpusself-reported0.776