lucianfialho commited on
Commit
94f5335
·
verified ·
1 Parent(s): 589243c

model card: v3 (+real text) eval 0.269

Browse files
Files changed (1) hide show
  1. README.md +17 -14
README.md CHANGED
@@ -54,26 +54,29 @@ Agrupe as tags BIOES (B/I/E/S por ato) em spans `(start, end, ato)`.
54
  DeepSeek, com balanceamento por ato.
55
  - LoRA nos módulos de atenção (`query`/`value`) + cabeça `classifier`. O adapter foi
56
  **mesclado** (`merge_and_unload`) e exportado pra **ONNX int8** (roda no navegador).
57
- - **v2 (atual): loss com class-weights** (inverse-frequency). Desbalanço — não domínio — era o
58
- gargalo: a loss ponderada tira os atos raros do zero sem precisar de mais dado.
 
 
 
59
 
60
  ## Avaliação (honesta)
61
  Eval **sentence-level** no Porttinari (notícias; da Silva et al., PROPOR 2024), **zero-shot**
62
- (o modelo treinou em sintético, não no Porttinari):
63
 
64
- | Métrica | v1 (sem pesos) | **v2 (class-weights)** |
65
- |---|---|---|
66
- | macro-F1 (13 atos) | 0,201 | **0,233** |
67
- | macro-F1 (coarse, Searle) | 0,407 | **0,428** |
68
- | accuracy | 0,827 | 0,834 |
69
 
70
- A v2 é melhora Pareto: `perguntar` 0,62→0,71, `informar` ~0,91 estável, e atos raros saem do
71
- zero (desculpar 0,25 · concordar 0,20 · discordar/expressar 0,15 · agradecer/sugerir 0,13 …).
72
- Referência: o BERTimbau do paper, treinado **in-domain** no Porttinari, faz 0,295 macro-F1.
73
 
74
- - **Caveat:** Porttinari é notícia → mede bem `informar`/`perguntar`, mas tem pouquíssimos
75
- exemplos dos atos sociais (`oferecer`/`despedir` seguem ~0 por falta de positivos no teste).
76
- Span-F1 exato 0 por granularidade (gold de frase vs spans).
 
77
 
78
  ## Limitações
79
  - Texto de treino **sintético** (sabor "LLM"), carrega o **viés do teacher**.
 
54
  DeepSeek, com balanceamento por ato.
55
  - LoRA nos módulos de atenção (`query`/`value`) + cabeça `classifier`. O adapter foi
56
  **mesclado** (`merge_and_unload`) e exportado pra **ONNX int8** (roda no navegador).
57
+ - **class-weights** (inverse-frequency loss): desbalanço — não domínio — era o gargalo; a loss
58
+ ponderada tira os atos raros do zero sem precisar de mais dado.
59
+ - **v3 (atual): + texto real.** Além do sintético, treina com **~500 anotações de texto dialógico
60
+ real** (entrevistas Roda Viva/FAPESP, anotadas por um teacher e revisadas) — texto real fecha o
61
+ gap de transferência que o sintético sozinho não fecha.
62
 
63
  ## Avaliação (honesta)
64
  Eval **sentence-level** no Porttinari (notícias; da Silva et al., PROPOR 2024), **zero-shot**
65
+ (o modelo não treinou no Porttinari):
66
 
67
+ | Métrica | v1 | v2 (class-weights) | **v3 (+ texto real)** |
68
+ |---|---|---|---|
69
+ | macro-F1 (13 atos) | 0,201 | 0,233 | **0,269** |
70
+ | accuracy | 0,827 | 0,834 | **0,862** |
 
71
 
72
+ Cada passo é melhora Pareto. `perguntar` 0,62 **0,80** (o texto real de entrevista ajudou),
73
+ `informar` ~0,93. Referência: o BERTimbau do paper, treinado **in-domain** no Porttinari, faz
74
+ **0,295** macro-F1 a v3 chega a ~91% disso **sendo zero-shot**.
75
 
76
+ **Caveat de avaliação:** Porttinari é notícia → mede bem `informar`/`perguntar`, é cego aos atos
77
+ sociais/comissivos (poucos/zero exemplos). Adicionar texto muito fora-de-domínio (ex: reviews) pode
78
+ até **piorar** esse número sem ser pior no geral falta um eval multi-domínio (em construção via
79
+ coleta humana).
80
 
81
  ## Limitações
82
  - Texto de treino **sintético** (sabor "LLM"), carrega o **viés do teacher**.