hayriyigit commited on
Commit
e7a42ae
·
verified ·
1 Parent(s): e74f17a

Model card, license notes, training records

Browse files
LICENSE.md ADDED
@@ -0,0 +1,14 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # Lisans notları
2
+
3
+ Bu model `hayriyigit/decider-4b-tr` üzerine (o da `Mapika/decider-4b`, Apache-2.0 üzerine) aşağıdaki verilerle LoRA ile eğitildi.
4
+ Model ağırlıklarının kullanım koşulları bu kaynakların koşullarından etkilenebilir.
5
+
6
+ | Kaynak | Kullanım | Lisans |
7
+ |---|---|---|
8
+ | hayriyigit/decider-4b-tr | başlangıç modeli | other (karışık eğitim verisi; o modelin LICENSE.md'si) |
9
+ | 2WikiMultihopQA (Türkçesi hayriyigit/2wikimultihopqa-tr-answerability) | eğitim + test | Apache-2.0 |
10
+ | HotpotQA (Türkçesi hayriyigit/hotpotqa-tr-answerability) | eğitim + test | CC BY-SA 4.0 |
11
+ | MuSiQue (Türkçesi hayriyigit/musique-tr-answerability) | eğitim + test | CC BY 4.0 |
12
+ | hayriyigit/answerability-synth-tr | eğitim + test | LLM üretimi; üreten modellerin ve servis sağlayıcının şartları geçerli olabilir |
13
+ | SQuAD 2.0 (Türkçesi hayriyigit/squad_v2-tr) | eğitim + test | CC BY-SA 4.0 |
14
+ | avbiswas/bev-decision-150K (ve Türkçesi) | replay | belirtilmemiş ("unknown") |
README.md ADDED
@@ -0,0 +1,159 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ language:
3
+ - tr
4
+ - en
5
+ license: other
6
+ license_name: mixed-training-data
7
+ license_link: LICENSE.md
8
+ base_model: hayriyigit/decider-4b-tr
9
+ pipeline_tag: text-classification
10
+ tags:
11
+ - decision-model
12
+ - calibrated
13
+ - answerability
14
+ - rag
15
+ - turkish
16
+ - lora
17
+ datasets:
18
+ - hayriyigit/2wikimultihopqa-tr-answerability
19
+ - hayriyigit/hotpotqa-tr-answerability
20
+ - hayriyigit/musique-tr-answerability
21
+ - hayriyigit/answerability-synth-tr
22
+ - hayriyigit/squad_v2-tr
23
+ ---
24
+
25
+ # decider-4b-tr-rag: Türkçe RAG için cevaplanabilirlik
26
+
27
+ **English summary.** A second LoRA round (rank 64, merged into the bf16 weights) on
28
+ [`hayriyigit/decider-4b-tr`](https://huggingface.co/hayriyigit/decider-4b-tr) for one decision: can this retrieved document answer
29
+ this question? Trained for one epoch on 87.318 Turkish rows built so that the negative documents are on topic and hold the
30
+ same kind of information, for another entity, institution, place or period (translated 2WikiMultihopQA, HotpotQA and MuSiQue, an
31
+ LLM judge filtering their answerable rows, LLM-written Turkish minimal pairs, SQuAD 2.0-tr) plus replay rows. On held-out rows
32
+ built the same way it is close to perfect (2WikiMultihopQA-tr 1.000, synthetic 0.992);
33
+ on the independent SQuAD 2.0-tr dev set it is unchanged (0.862 → 0.861). Treat the in-distribution
34
+ numbers as an upper bound, and check it on your own documents.
35
+
36
+ [`hayriyigit/decider-4b-tr`](https://huggingface.co/hayriyigit/decider-4b-tr) üzerine, tek bir karar için yapılmış ikinci bir LoRA
37
+ turu: **RAG'de getirilen belge, kullanıcının sorusunu cevaplıyor mu?** Hedef hata türü, belgenin konuyla ilgili olup aynı
38
+ türden bilgiyi başka bir varlık, kurum, yer ya da dönem için içermesi: model "belgede bu türden bir bilgi var mı?" sorusuna
39
+ bakıp "bu bilgi sorulan varlığa ve döneme mi ait?" sorusuna bakmadığında "evet" diyordu.
40
+
41
+ ## Kullanım
42
+
43
+ ```python
44
+ import sys
45
+ from huggingface_hub import snapshot_download
46
+
47
+ path = snapshot_download("hayriyigit/decider-4b-tr-rag", token="hf_...") # private repo: okuma yetkili bir token
48
+ sys.path.insert(0, path)
49
+ from decider.infer import Decider
50
+
51
+ d = Decider(path)
52
+ QUESTION = {"answerable": {"type": "noul", "instructions": "Verilen `document`, `question` sorusunun TÜM kısımlarını doğru ve eksiksiz şekilde cevaplamak için yeterli bilgiyi açıkç…"}} # tam metin aşağıda
53
+ p_yes = d.system_one({"question": "Türksat 6A hangi tarihte uzaya fırlatıldı?", "document": belge}, QUESTION)["answers"]["answerable"]["noul"]
54
+ ```
55
+
56
+ Eğitimde kullanılan soru metni (eğitim satırlarının yarısında bu metin, yarısında üç farklı ifade vardı):
57
+
58
+ > Verilen `document`, `question` sorusunun TÜM kısımlarını doğru ve eksiksiz şekilde cevaplamak için yeterli bilgiyi açıkça içeriyor mu? Yalnızca belgede açıkça belirtilen veya belgeden doğrudan ve tartışmasız biçimde çıkarılabilen bilgileri kullan. Konusal olarak ilgili olmak yeterli değildir. Soruda belirli bir tarih, sayı, isim, konum, neden, yöntem veya başka bir bilgi isteniyorsa, istenen bilgi belgede doğru olay, varlık ve ilişkiyle bağlantılı olmalıdır. İstenen cevaba benzeyen bir bilginin belgede başka bir olay veya varlık için geçmesi cevap sayılmaz. Sorunun birden fazla kısmı varsa TÜM kısımlar cevaplanabiliyorsa EVET, herhangi bir gerekli kısım eksikse HAYIR döndür. Dış bilgi kullanma.
59
+
60
+ State `{"question": …, "document": …}`: `document` düz metindir (başlık, tarih ve kaynak satırları metnin içinde olabilir).
61
+ noul temperature değeri 1,097 (`decider_config.json`), ayrılmış 1.500 Türkçe kararda fit edildi.
62
+
63
+ Bu modelin bazı örneklerde verdiği P(evet):
64
+
65
+ | Soru | Belge (son kısmı) | P(evet) |
66
+ |---|---|---:|
67
+ | Türksat 6A hangi tarihte uzaya fırlatıldı? | …yöneticilerin katıldığı bir değerlendirme toplantısı gerçekleştirildi. | 0,032 |
68
+ | Türksat 6A hangi tarihte uzaya fırlatıldı? | …Uydu SpaceX'in Falcon 9 roketiyle Cape Canaveral'dan uzaya gönderildi. | 0,003 |
69
+ | Türksat 6A hangi tarihte uzaya fırlatıldı? | …roketiyle Cape Canaveral'dan 9 Temmuz 2024 tarihinde uzaya gönderildi. | 1,000 |
70
+ | Siparişim ne zaman teslim edilecek? | …verilir ve kargoya verildikten sonra 1-3 iş günü içinde teslim edilir. | 0,932 |
71
+ | Siparişimin kargo takip numarası nedir? | …verilir ve kargoya verildikten sonra 1-3 iş günü içinde teslim edilir. | 0,000 |
72
+
73
+ İlk iki satırda belgede aynı türden bilgi (bir tarih) başka bir olay için geçiyor ya da hiç geçmiyor: model "hayır" diyor;
74
+ tarih fırlatmanın kendisine ait olduğunda (üçüncü satır) "evet". Dördüncü satır tartışmalıdır: belge kişinin kendi siparişinin tarihini değil, genel bir süreyi verir; katı kurala göre
75
+ cevap hayır olmalıdır, model ise genel kuralı cevap sayıyor. Genel bir politikanın belirli bir vakayı cevaplayıp
76
+ cevaplamadığına kendi verinizle bakın.
77
+
78
+ ## Değerlendirme
79
+
80
+ Test satırları eğitimde görülmedi. "Önce" başlangıç modelidir (`decider-4b-tr`). Toplam: 16.243 karar, doğruluk
81
+ 0,860 → 0,893, ECE 0,023 → 0,043.
82
+
83
+ | Test seti | Karar | Doğruluk (önce) | Doğruluk (sonra) | Cevaplanabilirde doğru | Cevaplanamazda doğru | AUROC | ECE |
84
+ |---|---:|---:|---:|---:|---:|---:|---:|
85
+ | 2WikiMultihopQA-tr: aynı alan, başka varlık | 1.200 | 0,962 | **1,000** | 0,987 → 1,000 | 0,935 → 1,000 | 0,997 → 1,000 | 0,022 → 0,001 |
86
+ | Sentetik Türkçe minimal pair'ler | 1.170 | 0,906 | **0,992** | 0,997 → 0,983 | 0,862 → 0,996 | 0,996 → 1,000 | 0,028 → 0,004 |
87
+ | HotpotQA-tr: tüm hop'lar / eksik hop / distractor | 1.500 | 0,806 | **0,980** | 0,618 → 0,970 | 0,899 → 0,984 | 0,871 → 0,997 | 0,065 → 0,006 |
88
+ | MuSiQue-tr: tüm hop'lar / eksik hop | 500 | 0,634 | **0,898** | 0,376 → 0,832 | 0,908 → 0,972 | 0,751 → 0,978 | 0,186 → 0,030 |
89
+ | SQuAD 2.0-tr dev (bağımsız, insan yazımı) | 11.873 | 0,862 | 0,861 | 0,937 → 0,924 | 0,783 → 0,798 | 0,940 → 0,935 | 0,016 → 0,057 |
90
+
91
+ Sentetik setin tuzak türlerinde "hayır"ı bilme oranı:
92
+
93
+ | Tuzak | Karar | Önce | Sonra |
94
+ |---|---:|---:|---:|
95
+ | `kurum` (başka bir kurumun aynı bilgisi) | 113 | 0,779 | 1,000 |
96
+ | `varlik` (aynı türden başka bir varlık) | 115 | 0,913 | 0,991 |
97
+ | `zaman` (yayın tarihinden sonraki ya da kapsanmayan dönem) | 113 | 0,894 | 1,000 |
98
+ | `yer_facet` (başka şehir/bölge ya da başka yön) | 113 | 0,929 | 1,000 |
99
+ | `eksik_oznitelik` (belgede olmayan öznitelik) | 127 | 0,913 | 0,992 |
100
+ | `kismi` (iki parçalı soru, bir parçası cevapsız) | 232 | 0,797 | 0,996 |
101
+
102
+ ### Nasıl okunmalı
103
+
104
+ - **Büyük kazançlar eğitim verisiyle aynı yöntemle kurulmuş test setlerinde.** 2WikiMultihopQA, HotpotQA, MuSiQue ve sentetik
105
+ test satırları, eğitim satırlarıyla aynı şablon, aynı writer model ve aynı paragraf düzeniyle kuruldu; model bu kalıpları
106
+ öğrendi. Bu sayılar gerçek belgelerdeki başarının üst sınırı olarak okunmalı.
107
+ - **Bağımsız SQuAD 2.0-tr'de değişiklik yok:** doğruluk 0,862 → 0,861,
108
+ cevaplanamazları bilme 0,783 → 0,798, cevaplanabilirleri bilme
109
+ 0,937 → 0,924; kalibrasyon biraz kötüleşti (ECE 0,016 → 0,057).
110
+ - **HotpotQA ve MuSiQue testlerinin evet satırları judge ile filtrelenmedi.** Train'de bu satırların sırasıyla ~%19 ve ~%46'sı
111
+ katı kurala göre cevaplanamaz bulunup çıkarılmıştı; testte de benzer bir pay vardır. Modelin MuSiQue evet satırlarında "evet"
112
+ oranının 0,376 → 0,832 çıkması, bu tür belgelere sorunun gerçekten cevaplanıp cevaplanmadığına bakmadan evet
113
+ demeyi öğrenmiş olabileceğine işaret ediyor.
114
+ - Genel karar becerisinin (bev, jev-bench vb.) korunup korunmadığı ölçülmedi; eğitimde 7.000 replay satırı vardı.
115
+
116
+ ### Validation
117
+
118
+ Eğitim karışımından belgeye göre gruplanarak ayrılmış 1.500 Türkçe satır: doğruluk 0,981,
119
+ cross-entropy 0,056. Bu satırlar eğitim verisiyle aynı kaynaklardan geldiği için yukarıdaki ilk uyarı onlar için de geçerli.
120
+
121
+ ## Eğitim verisi
122
+
123
+ | Kaynak | Evet | Hayır |
124
+ |---|---:|---:|
125
+ | [2WikiMultihopQA-tr](https://huggingface.co/datasets/hayriyigit/2wikimultihopqa-tr-answerability): doğru varlık / aynı alan, başka varlık | 12.000 | 12.000 |
126
+ | [HotpotQA-tr](https://huggingface.co/datasets/hayriyigit/hotpotqa-tr-answerability): judge onaylı tüm hop'lar / eksik hop + distractor | 8.090 | 10.112 |
127
+ | [MuSiQue-tr](https://huggingface.co/datasets/hayriyigit/musique-tr-answerability): judge onaylı tüm hop'lar / eksik hop | 2.697 | 3.371 |
128
+ | [Sentetik Türkçe](https://huggingface.co/datasets/hayriyigit/answerability-synth-tr) (iki kez, iki farklı soru ifadesiyle) | 6.490 | 15.058 |
129
+ | [SQuAD 2.0-tr](https://huggingface.co/datasets/hayriyigit/squad_v2-tr) | 8.027 | 3.973 |
130
+ | Replay: bev-decision-150K-tr ve İngilizce bev satırları, başlangıç modelinin kendi cevaplarına (KL) | 7.000 satır | |
131
+
132
+ - HotpotQA ve MuSiQue'nin evet satırları `deepseek-v4.1-flash` judge'ı ile filtrelendi (sırasıyla 1.910 ve 2.303 satır çıkarıldı);
133
+ bu iki kaynakta judge yalnızca evet satırlarını elediği için hayır satırları, evetlerin 1,25 katına indirildi (türler arasında eşit).
134
+ - Soru metni satırların yarısında yukarıdaki metin, yarısında üç farklı ifade; model tek bir cümleye bağlanmasın diye.
135
+ - Belirli bir değerlendirme setiyle (judge set) örtüşmemesi için bazı adlar ve kombinasyonlar sentetik üretimden çıkarıldı.
136
+
137
+ ## Eğitim
138
+
139
+ | | |
140
+ |---|---|
141
+ | Başlangıç | `hayriyigit/decider-4b-tr` (`df9aacb`), o da `Mapika/decider-4b` v2.1 üzerine bir LoRA turu |
142
+ | Yöntem | LoRA rank 64, alpha 128; attention ve MLP projeksiyonları; 121,9M trainable parametre; bf16 ağırlıklara merge edildi |
143
+ | Loss | Türkçe satırlarda label'a cross-entropy; replay satırlarında frozen başlangıç modelinin cevap dağılımına (KL) |
144
+ | Program | 1 epoch, 660 adım × 65.536 token (106.021 prompt satırı, 49.019.781 token); learning rate 1e-4, %5 warmup, cosine |
145
+ | Donanım ve süre | 1 × RTX 5090 (32 GB), bf16, gradient checkpointing, `causal-conv1d`; eğitim 3 sa 24 dk (~4.290 token/s) |
146
+
147
+ Eğitim ve değerlendirme kayıtları [`training/`](training/) klasöründe.
148
+
149
+ ## Sınırlamalar
150
+
151
+ - Gerçek RAG belgelerinde (ürün sayfaları, haberler, kurum duyuruları) ayrıca doğrulanmadı; yukarıdaki test setlerinin çoğu
152
+ eğitim verisiyle aynı yöntemle kuruldu.
153
+ - Hayır örnekleri eğitimde evetlerden fazlaydı; model belirsiz durumlarda "hayır"a kayabilir. Threshold'u kendi verinizle seçin.
154
+ - Eğitim verisinin çoğu makine çevirisi ve LLM üretimidir.
155
+ - Genel karar becerisi ve FP8 bu model için ölçülmedi.
156
+
157
+ ## Lisans
158
+
159
+ Taban modelin ve eğitim verilerinin lisansları farklıdır; ayrıntılar [`LICENSE.md`](LICENSE.md)'de.
training/answerability_eval_start.json ADDED
@@ -0,0 +1,330 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model": "decider-4b-v2.1-tr-lora",
3
+ "path": "hayriyigit/decider-4b-tr",
4
+ "revision": "df9aacb9f4c9e4e64178176502f51ae4db271f26",
5
+ "fp8_layers": 0,
6
+ "limit": 0,
7
+ "skipped": {},
8
+ "seconds": 579,
9
+ "report": {
10
+ "all": {
11
+ "n": 16243,
12
+ "accuracy": 0.8601,
13
+ "brier": 0.2038,
14
+ "nll": 0.3316,
15
+ "ece": 0.0234
16
+ },
17
+ "source/hotpot_tr": {
18
+ "n": 1500,
19
+ "accuracy": 0.806,
20
+ "brier": 0.2812,
21
+ "nll": 0.4504,
22
+ "ece": 0.0652
23
+ },
24
+ "source/hotpot_tr/noul": {
25
+ "n": 1500,
26
+ "accuracy": 0.806,
27
+ "brier": 0.2812,
28
+ "nll": 0.4504,
29
+ "ece": 0.0652
30
+ },
31
+ "source/musique_tr": {
32
+ "n": 500,
33
+ "accuracy": 0.634,
34
+ "brier": 0.523,
35
+ "nll": 0.8011,
36
+ "ece": 0.1863
37
+ },
38
+ "source/musique_tr/noul": {
39
+ "n": 500,
40
+ "accuracy": 0.634,
41
+ "brier": 0.523,
42
+ "nll": 0.8011,
43
+ "ece": 0.1863
44
+ },
45
+ "source/squad_tr": {
46
+ "n": 11873,
47
+ "accuracy": 0.8617,
48
+ "brier": 0.2028,
49
+ "nll": 0.3322,
50
+ "ece": 0.0159
51
+ },
52
+ "source/squad_tr/noul": {
53
+ "n": 11873,
54
+ "accuracy": 0.8617,
55
+ "brier": 0.2028,
56
+ "nll": 0.3322,
57
+ "ece": 0.0159
58
+ },
59
+ "source/synth_tr": {
60
+ "n": 1170,
61
+ "accuracy": 0.906,
62
+ "brier": 0.1319,
63
+ "nll": 0.2137,
64
+ "ece": 0.0275
65
+ },
66
+ "source/synth_tr/noul": {
67
+ "n": 1170,
68
+ "accuracy": 0.906,
69
+ "brier": 0.1319,
70
+ "nll": 0.2137,
71
+ "ece": 0.0275
72
+ },
73
+ "source/wiki2_tr": {
74
+ "n": 1200,
75
+ "accuracy": 0.9617,
76
+ "brier": 0.0538,
77
+ "nll": 0.0966,
78
+ "ece": 0.0221
79
+ },
80
+ "source/wiki2_tr/noul": {
81
+ "n": 1200,
82
+ "accuracy": 0.9617,
83
+ "brier": 0.0538,
84
+ "nll": 0.0966,
85
+ "ece": 0.0221
86
+ },
87
+ "type/noul": {
88
+ "n": 16243,
89
+ "accuracy": 0.8601,
90
+ "brier": 0.2038,
91
+ "nll": 0.3316,
92
+ "ece": 0.0234
93
+ },
94
+ "workflow/hotpot_tr/all_hops": {
95
+ "n": 500,
96
+ "accuracy": 0.616,
97
+ "brier": 0.5436,
98
+ "nll": 0.8223,
99
+ "ece": 0.2049
100
+ },
101
+ "workflow/hotpot_tr/distractors_only": {
102
+ "n": 500,
103
+ "accuracy": 0.952,
104
+ "brier": 0.0703,
105
+ "nll": 0.1353,
106
+ "ece": 0.0447
107
+ },
108
+ "workflow/hotpot_tr/missing_hop": {
109
+ "n": 500,
110
+ "accuracy": 0.85,
111
+ "brier": 0.2297,
112
+ "nll": 0.3936,
113
+ "ece": 0.0512
114
+ },
115
+ "workflow/musique_tr/all_hops": {
116
+ "n": 250,
117
+ "accuracy": 0.36,
118
+ "brier": 0.9114,
119
+ "nll": 1.371,
120
+ "ece": 0.4278
121
+ },
122
+ "workflow/musique_tr/missing_hop": {
123
+ "n": 250,
124
+ "accuracy": 0.908,
125
+ "brier": 0.1345,
126
+ "nll": 0.2311,
127
+ "ece": 0.0685
128
+ },
129
+ "workflow/squad_tr/answerability": {
130
+ "n": 11873,
131
+ "accuracy": 0.8617,
132
+ "brier": 0.2028,
133
+ "nll": 0.3322,
134
+ "ece": 0.0159
135
+ },
136
+ "workflow/synth_tr/synth_answerable": {
137
+ "n": 352,
138
+ "accuracy": 0.9972,
139
+ "brier": 0.0062,
140
+ "nll": 0.0253,
141
+ "ece": 0.0232
142
+ },
143
+ "workflow/synth_tr/synth_eksik_oznitelik": {
144
+ "n": 127,
145
+ "accuracy": 0.9134,
146
+ "brier": 0.1201,
147
+ "nll": 0.193,
148
+ "ece": 0.0363
149
+ },
150
+ "workflow/synth_tr/synth_kismi": {
151
+ "n": 232,
152
+ "accuracy": 0.8103,
153
+ "brier": 0.2776,
154
+ "nll": 0.4405,
155
+ "ece": 0.0786
156
+ },
157
+ "workflow/synth_tr/synth_kurum": {
158
+ "n": 113,
159
+ "accuracy": 0.7788,
160
+ "brier": 0.2835,
161
+ "nll": 0.4126,
162
+ "ece": 0.1197
163
+ },
164
+ "workflow/synth_tr/synth_k\u0131smi": {
165
+ "n": 2,
166
+ "accuracy": 1.0,
167
+ "brier": 0.0007,
168
+ "nll": 0.0162,
169
+ "ece": 0.0161
170
+ },
171
+ "workflow/synth_tr/synth_varlik": {
172
+ "n": 115,
173
+ "accuracy": 0.913,
174
+ "brier": 0.1032,
175
+ "nll": 0.168,
176
+ "ece": 0.0349
177
+ },
178
+ "workflow/synth_tr/synth_varl\u0131k": {
179
+ "n": 3,
180
+ "accuracy": 1.0,
181
+ "brier": 0.0195,
182
+ "nll": 0.0668,
183
+ "ece": 0.0613
184
+ },
185
+ "workflow/synth_tr/synth_yer_facet": {
186
+ "n": 113,
187
+ "accuracy": 0.9292,
188
+ "brier": 0.1065,
189
+ "nll": 0.1809,
190
+ "ece": 0.0365
191
+ },
192
+ "workflow/synth_tr/synth_zaman": {
193
+ "n": 113,
194
+ "accuracy": 0.9027,
195
+ "brier": 0.1455,
196
+ "nll": 0.2456,
197
+ "ece": 0.0386
198
+ },
199
+ "workflow/wiki2_tr/other_entity_same_attribute": {
200
+ "n": 600,
201
+ "accuracy": 0.9367,
202
+ "brier": 0.089,
203
+ "nll": 0.1505,
204
+ "ece": 0.0317
205
+ },
206
+ "workflow/wiki2_tr/same_entity": {
207
+ "n": 600,
208
+ "accuracy": 0.9867,
209
+ "brier": 0.0186,
210
+ "nll": 0.0426,
211
+ "ece": 0.0192
212
+ },
213
+ "hotpot_tr/answerability": {
214
+ "n": 1500,
215
+ "acc_answerable": 0.618,
216
+ "acc_unanswerable": 0.899,
217
+ "auroc": 0.8713
218
+ },
219
+ "hotpot_tr/all_hops/answerability": {
220
+ "n": 500,
221
+ "acc_answerable": 0.618,
222
+ "acc_unanswerable": null
223
+ },
224
+ "hotpot_tr/distractors_only/answerability": {
225
+ "n": 500,
226
+ "acc_answerable": null,
227
+ "acc_unanswerable": 0.952
228
+ },
229
+ "hotpot_tr/missing_hop/answerability": {
230
+ "n": 500,
231
+ "acc_answerable": null,
232
+ "acc_unanswerable": 0.846
233
+ },
234
+ "musique_tr/answerability": {
235
+ "n": 500,
236
+ "acc_answerable": 0.376,
237
+ "acc_unanswerable": 0.908,
238
+ "auroc": 0.7513
239
+ },
240
+ "musique_tr/all_hops/answerability": {
241
+ "n": 250,
242
+ "acc_answerable": 0.376,
243
+ "acc_unanswerable": null
244
+ },
245
+ "musique_tr/missing_hop/answerability": {
246
+ "n": 250,
247
+ "acc_answerable": null,
248
+ "acc_unanswerable": 0.908
249
+ },
250
+ "squad_tr/answerability": {
251
+ "n": 11873,
252
+ "acc_answerable": 0.9374,
253
+ "acc_unanswerable": 0.7827,
254
+ "auroc": 0.9398
255
+ },
256
+ "squad_tr/answerability/answerability": {
257
+ "n": 11873,
258
+ "acc_answerable": 0.9374,
259
+ "acc_unanswerable": 0.7827,
260
+ "auroc": 0.9398
261
+ },
262
+ "synth_tr/answerability": {
263
+ "n": 1170,
264
+ "acc_answerable": 0.9972,
265
+ "acc_unanswerable": 0.8619,
266
+ "auroc": 0.996
267
+ },
268
+ "synth_tr/synth_answerable/answerability": {
269
+ "n": 352,
270
+ "acc_answerable": 0.9972,
271
+ "acc_unanswerable": null
272
+ },
273
+ "synth_tr/synth_eksik_oznitelik/answerability": {
274
+ "n": 127,
275
+ "acc_answerable": null,
276
+ "acc_unanswerable": 0.9134
277
+ },
278
+ "synth_tr/synth_kismi/answerability": {
279
+ "n": 232,
280
+ "acc_answerable": null,
281
+ "acc_unanswerable": 0.7974
282
+ },
283
+ "synth_tr/synth_kurum/answerability": {
284
+ "n": 113,
285
+ "acc_answerable": null,
286
+ "acc_unanswerable": 0.7788
287
+ },
288
+ "synth_tr/synth_k\u0131smi/answerability": {
289
+ "n": 2,
290
+ "acc_answerable": null,
291
+ "acc_unanswerable": 1.0
292
+ },
293
+ "synth_tr/synth_varlik/answerability": {
294
+ "n": 115,
295
+ "acc_answerable": null,
296
+ "acc_unanswerable": 0.913
297
+ },
298
+ "synth_tr/synth_varl\u0131k/answerability": {
299
+ "n": 3,
300
+ "acc_answerable": null,
301
+ "acc_unanswerable": 1.0
302
+ },
303
+ "synth_tr/synth_yer_facet/answerability": {
304
+ "n": 113,
305
+ "acc_answerable": null,
306
+ "acc_unanswerable": 0.9292
307
+ },
308
+ "synth_tr/synth_zaman/answerability": {
309
+ "n": 113,
310
+ "acc_answerable": null,
311
+ "acc_unanswerable": 0.8938
312
+ },
313
+ "wiki2_tr/answerability": {
314
+ "n": 1200,
315
+ "acc_answerable": 0.9867,
316
+ "acc_unanswerable": 0.935,
317
+ "auroc": 0.997
318
+ },
319
+ "wiki2_tr/other_entity_same_attribute/answerability": {
320
+ "n": 600,
321
+ "acc_answerable": null,
322
+ "acc_unanswerable": 0.935
323
+ },
324
+ "wiki2_tr/same_entity/answerability": {
325
+ "n": 600,
326
+ "acc_answerable": 0.9867,
327
+ "acc_unanswerable": null
328
+ }
329
+ }
330
+ }
training/answerability_lora.log ADDED
@@ -0,0 +1,136 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ 05:11:09 hotpot_tr: 18,202 of 18,202 rows
2
+ 05:11:09 musique_tr: 6,068 of 6,068 rows
3
+ 05:11:09 replay_bev_tr: 4,000 of 4,000 rows
4
+ 05:11:09 replay_bev_tr_en: 3,000 of 3,000 rows
5
+ 05:11:09 squad_tr: 12,000 of 12,000 rows
6
+ 05:11:09 synth_tr: 21,548 of 21,548 rows
7
+ 05:11:09 wiki2_tr: 24,000 of 24,000 rows
8
+ 05:11:54 items train: 87,318 rows -> 106,021 prompt rows, 49,019,781 tokens
9
+ 05:11:55 items holdout: 1,500 rows -> 1,500 prompt rows, 772,790 tokens
10
+ 05:12:03 LoRA r=64: 121.9M trainable parameters
11
+ [transformers] `use_cache=True` is incompatible with gradient checkpointing. Setting `use_cache=False`.
12
+ 05:19:07 train epoch=1 step=20 of=660 ce=0.1464 kl=0.0000 acc=0.956 lr=6.06e-05 tok_per_s=3774 eta_h=3.77
13
+ 05:25:25 train epoch=1 step=40 of=660 ce=0.2318 kl=0.0000 acc=0.906 lr=1.00e-04 tok_per_s=4000 eta_h=3.45
14
+ 05:31:38 train epoch=1 step=60 of=660 ce=0.0799 kl=0.0000 acc=0.984 lr=9.95e-05 tok_per_s=4065 eta_h=3.26
15
+ 05:37:58 train epoch=1 step=80 of=660 ce=0.1024 kl=0.2941 acc=0.960 lr=9.86e-05 tok_per_s=4094 eta_h=3.13
16
+ 05:42:16 checkpoint: step 94 / 660
17
+ 05:44:06 train epoch=1 step=100 of=660 ce=0.1029 kl=0.0000 acc=0.960 lr=9.72e-05 tok_per_s=4135 eta_h=2.99
18
+ 05:50:20 train epoch=1 step=120 of=660 ce=0.1264 kl=0.3063 acc=0.973 lr=9.53e-05 tok_per_s=4145 eta_h=2.87
19
+ 05:56:29 train epoch=1 step=140 of=660 ce=0.0482 kl=0.3015 acc=0.975 lr=9.30e-05 tok_per_s=4173 eta_h=2.75
20
+ 06:02:38 train epoch=1 step=160 of=660 ce=0.0612 kl=0.3076 acc=0.962 lr=9.02e-05 tok_per_s=4192 eta_h=2.63
21
+ 06:08:49 train epoch=1 step=180 of=660 ce=0.0780 kl=0.3077 acc=0.969 lr=8.70e-05 tok_per_s=4206 eta_h=2.52
22
+ 06:12:28 checkpoint: step 192 / 660
23
+ 06:14:55 train epoch=1 step=200 of=660 ce=0.0092 kl=0.2882 acc=1.000 lr=8.35e-05 tok_per_s=4219 eta_h=2.41
24
+ 06:21:05 train epoch=1 step=220 of=660 ce=0.0616 kl=0.0000 acc=0.971 lr=7.96e-05 tok_per_s=4229 eta_h=2.30
25
+ 06:27:14 train epoch=1 step=240 of=660 ce=0.0167 kl=0.2768 acc=1.000 lr=7.54e-05 tok_per_s=4235 eta_h=2.19
26
+ 06:33:19 train epoch=1 step=260 of=660 ce=0.0510 kl=0.2752 acc=0.987 lr=7.10e-05 tok_per_s=4241 eta_h=2.08
27
+ 06:39:26 train epoch=1 step=280 of=660 ce=0.0538 kl=0.0000 acc=0.976 lr=6.64e-05 tok_per_s=4250 eta_h=1.98
28
+ 06:42:30 checkpoint: step 290 / 660
29
+ 06:45:29 train epoch=1 step=300 of=660 ce=0.0165 kl=0.0000 acc=0.994 lr=6.15e-05 tok_per_s=4257 eta_h=1.87
30
+ 06:51:38 train epoch=1 step=320 of=660 ce=0.0986 kl=0.0000 acc=0.951 lr=5.66e-05 tok_per_s=4261 eta_h=1.76
31
+ 06:57:33 train epoch=1 step=340 of=660 ce=0.0847 kl=0.0000 acc=0.975 lr=5.16e-05 tok_per_s=4263 eta_h=1.65
32
+ 07:03:42 train epoch=1 step=360 of=660 ce=0.0057 kl=0.2554 acc=0.981 lr=4.66e-05 tok_per_s=4264 eta_h=1.55
33
+ 07:09:45 train epoch=1 step=380 of=660 ce=0.0736 kl=1.0762 acc=0.957 lr=4.16e-05 tok_per_s=4269 eta_h=1.45
34
+ 07:12:47 checkpoint: step 390 / 660
35
+ 07:15:44 train epoch=1 step=400 of=660 ce=0.0026 kl=0.2418 acc=1.000 lr=3.68e-05 tok_per_s=4272 eta_h=1.34
36
+ 07:21:55 train epoch=1 step=420 of=660 ce=0.0876 kl=0.2455 acc=0.985 lr=3.20e-05 tok_per_s=4273 eta_h=1.24
37
+ 07:28:02 train epoch=1 step=440 of=660 ce=0.0553 kl=0.4678 acc=0.990 lr=2.74e-05 tok_per_s=4274 eta_h=1.13
38
+ 07:34:11 train epoch=1 step=460 of=660 ce=0.0090 kl=0.3076 acc=0.963 lr=2.31e-05 tok_per_s=4276 eta_h=1.03
39
+ 07:40:18 train epoch=1 step=480 of=660 ce=0.0804 kl=0.0000 acc=0.981 lr=1.90e-05 tok_per_s=4278 eta_h=0.93
40
+ 07:42:49 checkpoint: step 488 / 660
41
+ 07:46:26 train epoch=1 step=500 of=660 ce=0.0376 kl=0.0000 acc=0.987 lr=1.52e-05 tok_per_s=4280 eta_h=0.82
42
+ 07:52:30 train epoch=1 step=520 of=660 ce=0.0204 kl=0.0000 acc=1.000 lr=1.18e-05 tok_per_s=4284 eta_h=0.72
43
+ 07:58:29 train epoch=1 step=540 of=660 ce=0.0495 kl=0.0000 acc=0.990 lr=8.77e-06 tok_per_s=4287 eta_h=0.62
44
+ 08:04:35 train epoch=1 step=560 of=660 ce=0.0728 kl=0.2521 acc=0.989 lr=6.15e-06 tok_per_s=4291 eta_h=0.51
45
+ 08:10:43 train epoch=1 step=580 of=660 ce=0.0332 kl=0.0000 acc=0.988 lr=3.96e-06 tok_per_s=4293 eta_h=0.41
46
+ 08:12:57 checkpoint: step 587 / 660
47
+ 08:16:58 train epoch=1 step=600 of=660 ce=0.0545 kl=0.2792 acc=0.978 lr=2.24e-06 tok_per_s=4293 eta_h=0.31
48
+ 08:23:00 train epoch=1 step=620 of=660 ce=0.0631 kl=0.6144 acc=0.965 lr=1.00e-06 tok_per_s=4292 eta_h=0.21
49
+ 08:29:10 train epoch=1 step=640 of=660 ce=0.0139 kl=0.4028 acc=0.994 lr=2.51e-07 tok_per_s=4292 eta_h=0.10
50
+ 08:35:16 train epoch=1 step=660 of=660 ce=0.0369 kl=0.0000 acc=0.987 lr=0.00e+00 tok_per_s=4294 eta_h=0.00
51
+ 08:36:11 validation epoch_end=1 val_rows=1500 val_slot_accuracy=0.9813 val_ce=0.0555
52
+ 08:36:11 checkpoint: step 660 / 660, training complete
53
+ 08:37:11 temperatures on 1,500 held-out answers: {'noul': 1.097} (pooled 1.097)
54
+ 08:37:11 exported: answerability_run/model (load with Decider('answerability_run/model'))
55
+ decider-4b-v2.1-tr-lora-tr-lora on 16,243 rows (16,243 decisions)
56
+ 256 / 16,243 rows 8s accuracy so far 0.871
57
+ 512 / 16,243 rows 16s accuracy so far 0.879
58
+ 768 / 16,243 rows 24s accuracy so far 0.872
59
+ 1,024 / 16,243 rows 32s accuracy so far 0.883
60
+ 1,280 / 16,243 rows 40s accuracy so far 0.885
61
+ 1,536 / 16,243 rows 48s accuracy so far 0.889
62
+ 1,792 / 16,243 rows 56s accuracy so far 0.884
63
+ 2,048 / 16,243 rows 64s accuracy so far 0.882
64
+ 2,304 / 16,243 rows 72s accuracy so far 0.884
65
+ 2,560 / 16,243 rows 80s accuracy so far 0.881
66
+ 2,816 / 16,243 rows 88s accuracy so far 0.881
67
+ 3,072 / 16,243 rows 95s accuracy so far 0.882
68
+ 3,328 / 16,243 rows 103s accuracy so far 0.884
69
+ 3,584 / 16,243 rows 111s accuracy so far 0.884
70
+ 3,840 / 16,243 rows 119s accuracy so far 0.885
71
+ 4,096 / 16,243 rows 127s accuracy so far 0.885
72
+ 4,352 / 16,243 rows 135s accuracy so far 0.887
73
+ 4,608 / 16,243 rows 143s accuracy so far 0.888
74
+ 4,864 / 16,243 rows 151s accuracy so far 0.889
75
+ 5,120 / 16,243 rows 159s accuracy so far 0.890
76
+ 5,376 / 16,243 rows 167s accuracy so far 0.889
77
+ 5,632 / 16,243 rows 174s accuracy so far 0.889
78
+ 5,888 / 16,243 rows 182s accuracy so far 0.891
79
+ 6,144 / 16,243 rows 190s accuracy so far 0.891
80
+ 6,400 / 16,243 rows 197s accuracy so far 0.891
81
+ 6,656 / 16,243 rows 205s accuracy so far 0.890
82
+ 6,912 / 16,243 rows 213s accuracy so far 0.891
83
+ 7,168 / 16,243 rows 221s accuracy so far 0.892
84
+ 7,424 / 16,243 rows 229s accuracy so far 0.891
85
+ 7,680 / 16,243 rows 237s accuracy so far 0.891
86
+ 7,936 / 16,243 rows 244s accuracy so far 0.890
87
+ 8,192 / 16,243 rows 253s accuracy so far 0.890
88
+ 8,448 / 16,243 rows 260s accuracy so far 0.889
89
+ 8,704 / 16,243 rows 268s accuracy so far 0.889
90
+ 8,960 / 16,243 rows 276s accuracy so far 0.890
91
+ 9,216 / 16,243 rows 284s accuracy so far 0.891
92
+ 9,472 / 16,243 rows 292s accuracy so far 0.891
93
+ 9,728 / 16,243 rows 300s accuracy so far 0.892
94
+ 9,984 / 16,243 rows 307s accuracy so far 0.892
95
+ 10,240 / 16,243 rows 316s accuracy so far 0.892
96
+ 10,496 / 16,243 rows 324s accuracy so far 0.892
97
+ 10,752 / 16,243 rows 332s accuracy so far 0.892
98
+ 11,008 / 16,243 rows 339s accuracy so far 0.891
99
+ 11,264 / 16,243 rows 347s accuracy so far 0.892
100
+ 11,520 / 16,243 rows 355s accuracy so far 0.892
101
+ 11,776 / 16,243 rows 363s accuracy so far 0.892
102
+ 12,032 / 16,243 rows 371s accuracy so far 0.892
103
+ 12,288 / 16,243 rows 379s accuracy so far 0.892
104
+ 12,544 / 16,243 rows 386s accuracy so far 0.892
105
+ 12,800 / 16,243 rows 394s accuracy so far 0.892
106
+ 13,056 / 16,243 rows 403s accuracy so far 0.892
107
+ 13,312 / 16,243 rows 411s accuracy so far 0.893
108
+ 13,568 / 16,243 rows 418s accuracy so far 0.893
109
+ 13,824 / 16,243 rows 426s accuracy so far 0.893
110
+ 14,080 / 16,243 rows 434s accuracy so far 0.893
111
+ 14,336 / 16,243 rows 441s accuracy so far 0.893
112
+ 14,592 / 16,243 rows 449s accuracy so far 0.894
113
+ 14,848 / 16,243 rows 458s accuracy so far 0.894
114
+ 15,104 / 16,243 rows 466s accuracy so far 0.893
115
+ 15,360 / 16,243 rows 474s accuracy so far 0.893
116
+ 15,616 / 16,243 rows 482s accuracy so far 0.893
117
+ 15,872 / 16,243 rows 490s accuracy so far 0.893
118
+ 16,128 / 16,243 rows 498s accuracy so far 0.893
119
+ 16,243 / 16,243 rows 502s accuracy so far 0.893
120
+ all {'n': 16243, 'accuracy': 0.8931, 'brier': 0.1653, 'nll': 0.2898, 'ece': 0.0426}
121
+ source/hotpot_tr {'n': 1500, 'accuracy': 0.98, 'brier': 0.032, 'nll': 0.0605, 'ece': 0.0063}
122
+ source/musique_tr {'n': 500, 'accuracy': 0.898, 'brier': 0.1518, 'nll': 0.2529, 'ece': 0.0296}
123
+ source/squad_tr {'n': 11873, 'accuracy': 0.8614, 'brier': 0.2146, 'nll': 0.3759, 'ece': 0.0572}
124
+ source/synth_tr {'n': 1170, 'accuracy': 0.9923, 'brier': 0.0113, 'nll': 0.023, 'ece': 0.0038}
125
+ source/wiki2_tr {'n': 1200, 'accuracy': 1.0, 'brier': 0.0001, 'nll': 0.0006, 'ece': 0.0006}
126
+ type/noul {'n': 16243, 'accuracy': 0.8931, 'brier': 0.1653, 'nll': 0.2898, 'ece': 0.0426}
127
+ hotpot_tr/answerability {'n': 1500, 'acc_answerable': 0.97, 'acc_unanswerable': 0.984, 'auroc': 0.997}
128
+ musique_tr/answerability {'n': 500, 'acc_answerable': 0.832, 'acc_unanswerable': 0.972, 'auroc': 0.9783}
129
+ squad_tr/answerability {'n': 11873, 'acc_answerable': 0.9239, 'acc_unanswerable': 0.7978, 'auroc': 0.9346}
130
+ synth_tr/answerability {'n': 1170, 'acc_answerable': 0.983, 'acc_unanswerable': 0.9963, 'auroc': 0.9996}
131
+ wiki2_tr/answerability {'n': 1200, 'acc_answerable': 1.0, 'acc_unanswerable': 1.0, 'auroc': 1.0}
132
+ skipped decisions: {}
133
+ 08:45:39 eval: accuracy 0.8931, ECE 0.0426 (answerability_run/eval_report.json)
134
+ 08:46:52 pushed: https://huggingface.co/hayriyigit/decider-4b-tr-rag (8fe5d78d3bb3)
135
+ 08:46:52 done
136
+ EXIT 0
training/answerability_mix.log ADDED
@@ -0,0 +1,25 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ train: 88,818 rows
2
+ hotpot_tr false 10,112
3
+ hotpot_tr true 8,090
4
+ musique_tr false 3,371
5
+ musique_tr true 2,697
6
+ replay_bev_tr replay 4,000
7
+ replay_bev_tr_en replay 3,000
8
+ squad_tr false 3,973
9
+ squad_tr true 8,027
10
+ synth_tr false 15,058
11
+ synth_tr true 6,490
12
+ wiki2_tr false 12,000
13
+ wiki2_tr true 12,000
14
+ test: 16,243 rows
15
+ hotpot_tr false 1,000
16
+ hotpot_tr true 500
17
+ musique_tr false 250
18
+ musique_tr true 250
19
+ squad_tr false 5,945
20
+ squad_tr true 5,928
21
+ synth_tr false 818
22
+ synth_tr true 352
23
+ wiki2_tr false 600
24
+ wiki2_tr true 600
25
+ dropped: {'hotpot answerable dropped by judge': 1910, 'musique answerable dropped by judge': 2303, 'hotpot_tr negatives capped': 9888, 'musique_tr negatives capped': 1629}
training/decider_answerability.yaml ADDED
@@ -0,0 +1,43 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # Second LoRA round: answerability for RAG (can this document answer this question?), on top of hayriyigit/decider-4b-tr.
2
+ # scripts/answerability_run.sh (builds data/answerability_mix, scores the starting model, then this)
3
+ workdir: ./answerability_run
4
+
5
+ model:
6
+ repo: hayriyigit/decider-4b-tr # private: HF_TOKEN in .env
7
+ revision: df9aacb9f4c9e4e64178176502f51ae4db271f26
8
+
9
+ data:
10
+ train: data/answerability_mix/train-00000-of-00001.parquet # scripts/build_answerability_mix.py
11
+ test: data/answerability_mix/test-00000-of-00001.parquet
12
+ rows: # everything the mix holds; replay rows train toward the starting model
13
+ wiki2_tr: 24000 # same attribute, other entity (the judge set's entity errors)
14
+ hotpot_tr: 30000 # all hops / a missing hop / on-topic distractors only
15
+ musique_tr: 10000 # all hops (judge-checked) / a missing hop
16
+ synth_tr: 30000 # Turkish pairs: institution, entity, time, place/facet, attribute, partial
17
+ squad_tr: 12000
18
+ replay_bev_tr: 4000
19
+ replay_bev_tr_en: 3000
20
+ holdout_rows: 1500
21
+ max_state_tokens: 4096
22
+ seed: 0
23
+
24
+ lora:
25
+ r: 64
26
+ alpha: 128
27
+
28
+ train:
29
+ epochs: 1
30
+ lr: 1.0e-4
31
+ warmup: 0.05
32
+ tokens_per_step: 65536
33
+ micro_tokens: 16384
34
+
35
+ checkpoint:
36
+ every_minutes: 30
37
+
38
+ limits:
39
+ max_hours: 6
40
+ reserve_minutes: 20
41
+
42
+ export:
43
+ push_to_hub: {repo: hayriyigit/decider-4b-tr-rag, private: true}
training/eval_report.json ADDED
@@ -0,0 +1,331 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model": "decider-4b-v2.1-tr-lora-tr-lora",
3
+ "path": "/workspace/laya/answerability_run/model",
4
+ "revision": "eb5fbdfc9448473ec25e399882912863afbdb70e",
5
+ "fp8_layers": 0,
6
+ "limit": 0,
7
+ "skipped": {},
8
+ "seconds": 502,
9
+ "report": {
10
+ "all": {
11
+ "n": 16243,
12
+ "accuracy": 0.8931,
13
+ "brier": 0.1653,
14
+ "nll": 0.2898,
15
+ "ece": 0.0426
16
+ },
17
+ "source/hotpot_tr": {
18
+ "n": 1500,
19
+ "accuracy": 0.98,
20
+ "brier": 0.032,
21
+ "nll": 0.0605,
22
+ "ece": 0.0063
23
+ },
24
+ "source/hotpot_tr/noul": {
25
+ "n": 1500,
26
+ "accuracy": 0.98,
27
+ "brier": 0.032,
28
+ "nll": 0.0605,
29
+ "ece": 0.0063
30
+ },
31
+ "source/musique_tr": {
32
+ "n": 500,
33
+ "accuracy": 0.898,
34
+ "brier": 0.1518,
35
+ "nll": 0.2529,
36
+ "ece": 0.0296
37
+ },
38
+ "source/musique_tr/noul": {
39
+ "n": 500,
40
+ "accuracy": 0.898,
41
+ "brier": 0.1518,
42
+ "nll": 0.2529,
43
+ "ece": 0.0296
44
+ },
45
+ "source/squad_tr": {
46
+ "n": 11873,
47
+ "accuracy": 0.8614,
48
+ "brier": 0.2146,
49
+ "nll": 0.3759,
50
+ "ece": 0.0572
51
+ },
52
+ "source/squad_tr/noul": {
53
+ "n": 11873,
54
+ "accuracy": 0.8614,
55
+ "brier": 0.2146,
56
+ "nll": 0.3759,
57
+ "ece": 0.0572
58
+ },
59
+ "source/synth_tr": {
60
+ "n": 1170,
61
+ "accuracy": 0.9923,
62
+ "brier": 0.0113,
63
+ "nll": 0.023,
64
+ "ece": 0.0038
65
+ },
66
+ "source/synth_tr/noul": {
67
+ "n": 1170,
68
+ "accuracy": 0.9923,
69
+ "brier": 0.0113,
70
+ "nll": 0.023,
71
+ "ece": 0.0038
72
+ },
73
+ "source/wiki2_tr": {
74
+ "n": 1200,
75
+ "accuracy": 1.0,
76
+ "brier": 0.0001,
77
+ "nll": 0.0006,
78
+ "ece": 0.0006
79
+ },
80
+ "source/wiki2_tr/noul": {
81
+ "n": 1200,
82
+ "accuracy": 1.0,
83
+ "brier": 0.0001,
84
+ "nll": 0.0006,
85
+ "ece": 0.0006
86
+ },
87
+ "type/noul": {
88
+ "n": 16243,
89
+ "accuracy": 0.8931,
90
+ "brier": 0.1653,
91
+ "nll": 0.2898,
92
+ "ece": 0.0426
93
+ },
94
+ "workflow/hotpot_tr/all_hops": {
95
+ "n": 500,
96
+ "accuracy": 0.97,
97
+ "brier": 0.0527,
98
+ "nll": 0.1011,
99
+ "ece": 0.0126
100
+ },
101
+ "workflow/hotpot_tr/distractors_only": {
102
+ "n": 500,
103
+ "accuracy": 0.996,
104
+ "brier": 0.0059,
105
+ "nll": 0.01,
106
+ "ece": 0.0065
107
+ },
108
+ "workflow/hotpot_tr/missing_hop": {
109
+ "n": 500,
110
+ "accuracy": 0.974,
111
+ "brier": 0.0374,
112
+ "nll": 0.0704,
113
+ "ece": 0.0127
114
+ },
115
+ "workflow/musique_tr/all_hops": {
116
+ "n": 250,
117
+ "accuracy": 0.824,
118
+ "brier": 0.2596,
119
+ "nll": 0.4257,
120
+ "ece": 0.0587
121
+ },
122
+ "workflow/musique_tr/missing_hop": {
123
+ "n": 250,
124
+ "accuracy": 0.972,
125
+ "brier": 0.044,
126
+ "nll": 0.0801,
127
+ "ece": 0.0199
128
+ },
129
+ "workflow/squad_tr/answerability": {
130
+ "n": 11873,
131
+ "accuracy": 0.8614,
132
+ "brier": 0.2146,
133
+ "nll": 0.3759,
134
+ "ece": 0.0572
135
+ },
136
+ "workflow/synth_tr/synth_answerable": {
137
+ "n": 352,
138
+ "accuracy": 0.983,
139
+ "brier": 0.0226,
140
+ "nll": 0.0439,
141
+ "ece": 0.0118
142
+ },
143
+ "workflow/synth_tr/synth_eksik_oznitelik": {
144
+ "n": 127,
145
+ "accuracy": 0.9921,
146
+ "brier": 0.0208,
147
+ "nll": 0.0531,
148
+ "ece": 0.014
149
+ },
150
+ "workflow/synth_tr/synth_kismi": {
151
+ "n": 232,
152
+ "accuracy": 0.9957,
153
+ "brier": 0.0055,
154
+ "nll": 0.0096,
155
+ "ece": 0.0073
156
+ },
157
+ "workflow/synth_tr/synth_kurum": {
158
+ "n": 113,
159
+ "accuracy": 1.0,
160
+ "brier": 0.0,
161
+ "nll": 0.0005,
162
+ "ece": 0.0005
163
+ },
164
+ "workflow/synth_tr/synth_kısmi": {
165
+ "n": 2,
166
+ "accuracy": 1.0,
167
+ "brier": 0.0,
168
+ "nll": 0.0001,
169
+ "ece": 0.0001
170
+ },
171
+ "workflow/synth_tr/synth_varlik": {
172
+ "n": 115,
173
+ "accuracy": 0.9913,
174
+ "brier": 0.0115,
175
+ "nll": 0.016,
176
+ "ece": 0.0056
177
+ },
178
+ "workflow/synth_tr/synth_varlık": {
179
+ "n": 3,
180
+ "accuracy": 1.0,
181
+ "brier": 0.0,
182
+ "nll": 0.0002,
183
+ "ece": 0.0002
184
+ },
185
+ "workflow/synth_tr/synth_yer_facet": {
186
+ "n": 113,
187
+ "accuracy": 1.0,
188
+ "brier": 0.0002,
189
+ "nll": 0.0025,
190
+ "ece": 0.0025
191
+ },
192
+ "workflow/synth_tr/synth_zaman": {
193
+ "n": 113,
194
+ "accuracy": 1.0,
195
+ "brier": 0.0001,
196
+ "nll": 0.0023,
197
+ "ece": 0.0023
198
+ },
199
+ "workflow/wiki2_tr/other_entity_same_attribute": {
200
+ "n": 600,
201
+ "accuracy": 1.0,
202
+ "brier": 0.0,
203
+ "nll": 0.0002,
204
+ "ece": 0.0002
205
+ },
206
+ "workflow/wiki2_tr/same_entity": {
207
+ "n": 600,
208
+ "accuracy": 1.0,
209
+ "brier": 0.0003,
210
+ "nll": 0.001,
211
+ "ece": 0.0009
212
+ },
213
+ "hotpot_tr/answerability": {
214
+ "n": 1500,
215
+ "acc_answerable": 0.97,
216
+ "acc_unanswerable": 0.984,
217
+ "auroc": 0.997
218
+ },
219
+ "hotpot_tr/all_hops/answerability": {
220
+ "n": 500,
221
+ "acc_answerable": 0.97,
222
+ "acc_unanswerable": null
223
+ },
224
+ "hotpot_tr/distractors_only/answerability": {
225
+ "n": 500,
226
+ "acc_answerable": null,
227
+ "acc_unanswerable": 0.996
228
+ },
229
+ "hotpot_tr/missing_hop/answerability": {
230
+ "n": 500,
231
+ "acc_answerable": null,
232
+ "acc_unanswerable": 0.972
233
+ },
234
+ "musique_tr/answerability": {
235
+ "n": 500,
236
+ "acc_answerable": 0.832,
237
+ "acc_unanswerable": 0.972,
238
+ "auroc": 0.9783
239
+ },
240
+ "musique_tr/all_hops/answerability": {
241
+ "n": 250,
242
+ "acc_answerable": 0.832,
243
+ "acc_unanswerable": null
244
+ },
245
+ "musique_tr/missing_hop/answerability": {
246
+ "n": 250,
247
+ "acc_answerable": null,
248
+ "acc_unanswerable": 0.972
249
+ },
250
+ "squad_tr/answerability": {
251
+ "n": 11873,
252
+ "acc_answerable": 0.9239,
253
+ "acc_unanswerable": 0.7978,
254
+ "auroc": 0.9346
255
+ },
256
+ "squad_tr/answerability/answerability": {
257
+ "n": 11873,
258
+ "acc_answerable": 0.9239,
259
+ "acc_unanswerable": 0.7978,
260
+ "auroc": 0.9346
261
+ },
262
+ "synth_tr/answerability": {
263
+ "n": 1170,
264
+ "acc_answerable": 0.983,
265
+ "acc_unanswerable": 0.9963,
266
+ "auroc": 0.9996
267
+ },
268
+ "synth_tr/synth_answerable/answerability": {
269
+ "n": 352,
270
+ "acc_answerable": 0.983,
271
+ "acc_unanswerable": null
272
+ },
273
+ "synth_tr/synth_eksik_oznitelik/answerability": {
274
+ "n": 127,
275
+ "acc_answerable": null,
276
+ "acc_unanswerable": 0.9921
277
+ },
278
+ "synth_tr/synth_kismi/answerability": {
279
+ "n": 232,
280
+ "acc_answerable": null,
281
+ "acc_unanswerable": 0.9957
282
+ },
283
+ "synth_tr/synth_kurum/answerability": {
284
+ "n": 113,
285
+ "acc_answerable": null,
286
+ "acc_unanswerable": 1.0
287
+ },
288
+ "synth_tr/synth_kısmi/answerability": {
289
+ "n": 2,
290
+ "acc_answerable": null,
291
+ "acc_unanswerable": 1.0
292
+ },
293
+ "synth_tr/synth_varlik/answerability": {
294
+ "n": 115,
295
+ "acc_answerable": null,
296
+ "acc_unanswerable": 0.9913
297
+ },
298
+ "synth_tr/synth_varlık/answerability": {
299
+ "n": 3,
300
+ "acc_answerable": null,
301
+ "acc_unanswerable": 1.0
302
+ },
303
+ "synth_tr/synth_yer_facet/answerability": {
304
+ "n": 113,
305
+ "acc_answerable": null,
306
+ "acc_unanswerable": 1.0
307
+ },
308
+ "synth_tr/synth_zaman/answerability": {
309
+ "n": 113,
310
+ "acc_answerable": null,
311
+ "acc_unanswerable": 1.0
312
+ },
313
+ "wiki2_tr/answerability": {
314
+ "n": 1200,
315
+ "acc_answerable": 1.0,
316
+ "acc_unanswerable": 1.0,
317
+ "auroc": 1.0
318
+ },
319
+ "wiki2_tr/other_entity_same_attribute/answerability": {
320
+ "n": 600,
321
+ "acc_answerable": null,
322
+ "acc_unanswerable": 1.0
323
+ },
324
+ "wiki2_tr/same_entity/answerability": {
325
+ "n": 600,
326
+ "acc_answerable": 1.0,
327
+ "acc_unanswerable": null
328
+ }
329
+ },
330
+ "train_key": "dc5d693207f19271"
331
+ }
training/meta.json ADDED
@@ -0,0 +1,21 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "key": "8202ca60057ee74c",
3
+ "train": {
4
+ "rows": 87318,
5
+ "items": 106021,
6
+ "replay_items": 25703,
7
+ "tokens": 49019781,
8
+ "tokens_p50": 437,
9
+ "tokens_max": 4303,
10
+ "skipped": {}
11
+ },
12
+ "holdout": {
13
+ "rows": 1500,
14
+ "items": 1500,
15
+ "replay_items": 0,
16
+ "tokens": 772790,
17
+ "tokens_p50": 487,
18
+ "tokens_max": 2512,
19
+ "skipped": {}
20
+ }
21
+ }
training/train_log.jsonl ADDED
@@ -0,0 +1 @@
 
 
1
+ {"epoch_end": 1, "val_rows": 1500, "val_slot_accuracy": 0.9813, "val_ce": 0.0555}