Token Classification
Transformers
ONNX
Safetensors
Portuguese
bert
speech-acts
atos-de-fala
dialogue-acts
portuguese
pt-br
bertimbau
bioes
Instructions to use lucianfialho/atos-de-fala-ptbr with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use lucianfialho/atos-de-fala-ptbr with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("token-classification", model="lucianfialho/atos-de-fala-ptbr")# Load model directly from transformers import AutoTokenizer, AutoModelForTokenClassification tokenizer = AutoTokenizer.from_pretrained("lucianfialho/atos-de-fala-ptbr") model = AutoModelForTokenClassification.from_pretrained("lucianfialho/atos-de-fala-ptbr", device_map="auto") - Notebooks
- Google Colab
- Kaggle
model card: v3 (+real text) eval 0.269
Browse files
README.md
CHANGED
|
@@ -54,26 +54,29 @@ Agrupe as tags BIOES (B/I/E/S por ato) em spans `(start, end, ato)`.
|
|
| 54 |
DeepSeek, com balanceamento por ato.
|
| 55 |
- LoRA nos módulos de atenção (`query`/`value`) + cabeça `classifier`. O adapter foi
|
| 56 |
**mesclado** (`merge_and_unload`) e exportado pra **ONNX int8** (roda no navegador).
|
| 57 |
-
- **
|
| 58 |
-
|
|
|
|
|
|
|
|
|
|
| 59 |
|
| 60 |
## Avaliação (honesta)
|
| 61 |
Eval **sentence-level** no Porttinari (notícias; da Silva et al., PROPOR 2024), **zero-shot**
|
| 62 |
-
(o modelo
|
| 63 |
|
| 64 |
-
| Métrica | v1
|
| 65 |
-
|---|---|---|
|
| 66 |
-
| macro-F1 (13 atos) | 0,201 | **0,
|
| 67 |
-
|
|
| 68 |
-
| accuracy | 0,827 | 0,834 |
|
| 69 |
|
| 70 |
-
|
| 71 |
-
|
| 72 |
-
|
| 73 |
|
| 74 |
-
|
| 75 |
-
|
| 76 |
-
|
|
|
|
| 77 |
|
| 78 |
## Limitações
|
| 79 |
- Texto de treino **sintético** (sabor "LLM"), carrega o **viés do teacher**.
|
|
|
|
| 54 |
DeepSeek, com balanceamento por ato.
|
| 55 |
- LoRA nos módulos de atenção (`query`/`value`) + cabeça `classifier`. O adapter foi
|
| 56 |
**mesclado** (`merge_and_unload`) e exportado pra **ONNX int8** (roda no navegador).
|
| 57 |
+
- **class-weights** (inverse-frequency loss): desbalanço — não domínio — era o gargalo; a loss
|
| 58 |
+
ponderada tira os atos raros do zero sem precisar de mais dado.
|
| 59 |
+
- **v3 (atual): + texto real.** Além do sintético, treina com **~500 anotações de texto dialógico
|
| 60 |
+
real** (entrevistas Roda Viva/FAPESP, anotadas por um teacher e revisadas) — texto real fecha o
|
| 61 |
+
gap de transferência que o sintético sozinho não fecha.
|
| 62 |
|
| 63 |
## Avaliação (honesta)
|
| 64 |
Eval **sentence-level** no Porttinari (notícias; da Silva et al., PROPOR 2024), **zero-shot**
|
| 65 |
+
(o modelo não treinou no Porttinari):
|
| 66 |
|
| 67 |
+
| Métrica | v1 | v2 (class-weights) | **v3 (+ texto real)** |
|
| 68 |
+
|---|---|---|---|
|
| 69 |
+
| macro-F1 (13 atos) | 0,201 | 0,233 | **0,269** |
|
| 70 |
+
| accuracy | 0,827 | 0,834 | **0,862** |
|
|
|
|
| 71 |
|
| 72 |
+
Cada passo é melhora Pareto. `perguntar` 0,62 → **0,80** (o texto real de entrevista ajudou),
|
| 73 |
+
`informar` ~0,93. Referência: o BERTimbau do paper, treinado **in-domain** no Porttinari, faz
|
| 74 |
+
**0,295** macro-F1 — a v3 chega a ~91% disso **sendo zero-shot**.
|
| 75 |
|
| 76 |
+
**Caveat de avaliação:** Porttinari é notícia → mede bem `informar`/`perguntar`, é cego aos atos
|
| 77 |
+
sociais/comissivos (poucos/zero exemplos). Adicionar texto muito fora-de-domínio (ex: reviews) pode
|
| 78 |
+
até **piorar** esse número sem ser pior no geral — falta um eval multi-domínio (em construção via
|
| 79 |
+
coleta humana).
|
| 80 |
|
| 81 |
## Limitações
|
| 82 |
- Texto de treino **sintético** (sabor "LLM"), carrega o **viés do teacher**.
|