BETO Fine-tuned para Detección de Fake News en Español

Modelo BERT en español (BETO) afinado para clasificar noticias en español como real (0) o fake (1).

Detalles

  • Modelo base: dccuchile/bert-base-spanish-wwm-cased
  • Corpus: Spanish Fake News Corpus (Posadas-Durán et al.)
  • Tarea: clasificación binaria (real / fake)
  • Idioma: español (multi-país: México, España, Latinoamérica)
  • max_length: 512 tokens (WordPiece)

Resultados

Métrica Valor
F1 (best seed=123) 0.7585
F1 (multi-seed avg, 5 seeds) 0.7452 ± 0.0116
Accuracy 0.7762
Precision (fake) 0.7544
Recall (fake) 0.7625

Multi-seed: 13, 42, 87, 123, 2024. El F1 reportado es la media. El sweep de hiperparámetros usó learning_rate, batch_size, warmup_ratio y weight_decay sobre validation set, evaluando solo en test (sin leakage).

Uso

from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch

tokenizer = AutoTokenizer.from_pretrained("Anderson230101/beto-fakenews-tuned")
model = AutoModelForSequenceClassification.from_pretrained("Anderson230101/beto-fakenews-tuned")

text = "El presidente anuncia un nuevo programa social para zonas rurales."
inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=512)
with torch.no_grad():
    logits = model(**inputs).logits
probs = torch.softmax(logits, dim=-1)[0]
labels = ["real", "fake"]
print({labels[i]: float(probs[i]) for i in range(2)})

Limitaciones

  • Entrenado solo en corpus Posadas-Durán; no se valida out-of-domain.
  • Sesgado hacia el estilo del corpus (sátira política, bulos virales pre-2020). Textos modernos o de otros temas pueden bajar la performance.
  • F1=0.7585 < 0.80 (objetivo académico) — probablemente techo del corpus por errores de etiquetado y ambigüedad real/sátira.

Cita

Proyecto académico para el curso de IA — UTP (Universidad Tecnológica del Perú), 2026.

Corpus: Posadas-Durán, J. P., Gómez-Adorno, H., Sidorov, G., & Escobar, J. J. M. (2019). Detection of fake news in a new corpus for the Spanish language. Journal of Intelligent & Fuzzy Systems.

Downloads last month
11
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Anderson230101/beto-fakenews-tuned

Finetuned
(198)
this model

Space using Anderson230101/beto-fakenews-tuned 1

Evaluation results

  • F1 (best seed=123) on Posadas-Durán Spanish Fake News Corpus
    self-reported
    0.758
  • F1 (multi-seed mean, std=0.0116) on Posadas-Durán Spanish Fake News Corpus
    self-reported
    0.745
  • Accuracy on Posadas-Durán Spanish Fake News Corpus
    self-reported
    0.776