hayriyigit commited on
Commit
e497032
·
verified ·
1 Parent(s): 241be87

Training and evaluation records

Browse files
training/bench_bf16.json ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "fp8": false,
3
+ "fp8_layers": 0,
4
+ "requests": 300,
5
+ "decisions": 432,
6
+ "latency_ms_p50": 23.5,
7
+ "latency_ms_p90": 83.2,
8
+ "decisions_per_s": 4.0,
9
+ "gpu": "NVIDIA GeForce RTX 5090"
10
+ }
training/bench_fp8.json ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "fp8": true,
3
+ "fp8_layers": 200,
4
+ "requests": 300,
5
+ "decisions": 432,
6
+ "latency_ms_p50": 14.7,
7
+ "latency_ms_p90": 90.2,
8
+ "decisions_per_s": 5.3,
9
+ "gpu": "NVIDIA GeForce RTX 5090"
10
+ }
training/decider_eval_base.log ADDED
@@ -0,0 +1,55 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ decider-4b-v2.1 on 77,016 rows (101,716 decisions)
2
+ [transformers] `causal_conv1d_fn` is falling back to its reference PyTorch implementation because `causal_conv1d` is not installed. This is correct but much slower; install `causal_conv1d` for the optimized kernel.
3
+ 2,000 / 77,016 rows 228s accuracy so far 0.543
4
+ 4,000 / 77,016 rows 384s accuracy so far 0.546
5
+ 6,000 / 77,016 rows 597s accuracy so far 0.537
6
+ 8,000 / 77,016 rows 832s accuracy so far 0.543
7
+ 10,000 / 77,016 rows 884s accuracy so far 0.575
8
+ 12,000 / 77,016 rows 942s accuracy so far 0.592
9
+ 14,000 / 77,016 rows 1072s accuracy so far 0.632
10
+ 16,000 / 77,016 rows 1194s accuracy so far 0.654
11
+ 18,000 / 77,016 rows 1254s accuracy so far 0.662
12
+ 20,000 / 77,016 rows 1418s accuracy so far 0.666
13
+ 22,000 / 77,016 rows 1634s accuracy so far 0.667
14
+ 24,000 / 77,016 rows 1847s accuracy so far 0.668
15
+ 26,000 / 77,016 rows 2001s accuracy so far 0.671
16
+ 28,000 / 77,016 rows 2085s accuracy so far 0.676
17
+ 30,000 / 77,016 rows 2170s accuracy so far 0.682
18
+ 32,000 / 77,016 rows 2194s accuracy so far 0.680
19
+ 34,000 / 77,016 rows 2216s accuracy so far 0.689
20
+ 36,000 / 77,016 rows 2334s accuracy so far 0.696
21
+ 38,000 / 77,016 rows 2576s accuracy so far 0.688
22
+ 40,000 / 77,016 rows 2852s accuracy so far 0.688
23
+ 42,000 / 77,016 rows 2926s accuracy so far 0.687
24
+ 44,000 / 77,016 rows 2950s accuracy so far 0.688
25
+ 46,000 / 77,016 rows 2970s accuracy so far 0.690
26
+ 48,000 / 77,016 rows 3007s accuracy so far 0.688
27
+ 50,000 / 77,016 rows 3132s accuracy so far 0.685
28
+ 52,000 / 77,016 rows 3218s accuracy so far 0.687
29
+ 54,000 / 77,016 rows 3311s accuracy so far 0.691
30
+ 56,000 / 77,016 rows 3375s accuracy so far 0.694
31
+ 58,000 / 77,016 rows 3396s accuracy so far 0.697
32
+ 60,000 / 77,016 rows 3418s accuracy so far 0.700
33
+ 62,000 / 77,016 rows 3535s accuracy so far 0.696
34
+ 64,000 / 77,016 rows 3657s accuracy so far 0.692
35
+ 66,000 / 77,016 rows 3754s accuracy so far 0.689
36
+ 68,000 / 77,016 rows 3810s accuracy so far 0.689
37
+ 70,000 / 77,016 rows 3876s accuracy so far 0.689
38
+ 72,000 / 77,016 rows 3935s accuracy so far 0.689
39
+ 74,000 / 77,016 rows 3995s accuracy so far 0.689
40
+ 76,000 / 77,016 rows 4053s accuracy so far 0.689
41
+ 77,016 / 77,016 rows 4082s accuracy so far 0.689
42
+ all {'n': 101716, 'accuracy': 0.689, 'brier': 0.3876, 'nll': 0.7511, 'ece': 0.0282}
43
+ source/bev_tr {'n': 46320, 'accuracy': 0.6687, 'brier': 0.416, 'nll': 0.7659, 'ece': 0.0272}
44
+ source/bev_tr_en {'n': 5766, 'accuracy': 0.7197, 'brier': 0.352, 'nll': 0.653, 'ece': 0.0206}
45
+ source/beyazperde_tr {'n': 5000, 'accuracy': 0.5204, 'brier': 0.5888, 'nll': 1.0806, 'ece': 0.0503}
46
+ source/jev_bench_tr {'n': 22773, 'accuracy': 0.71, 'brier': 0.3406, 'nll': 0.8272, 'ece': 0.0308}
47
+ source/jev_bench_tr_en {'n': 2000, 'accuracy': 0.768, 'brier': 0.2677, 'nll': 0.6802, 'ece': 0.0338}
48
+ source/massive_tr {'n': 2974, 'accuracy': 0.8285, 'brier': 0.2533, 'nll': 0.7069, 'ece': 0.0362}
49
+ source/squad_tr {'n': 11873, 'accuracy': 0.6832, 'brier': 0.4016, 'nll': 0.585, 'ece': 0.0488}
50
+ source/xnli_tr {'n': 5010, 'accuracy': 0.8128, 'brier': 0.2741, 'nll': 0.4991, 'ece': 0.0356}
51
+ type/choice {'n': 39616, 'accuracy': 0.717, 'brier': 0.3579, 'nll': 0.8249, 'ece': 0.0563}
52
+ type/noul {'n': 39371, 'accuracy': 0.7828, 'brier': 0.2902, 'nll': 0.4514, 'ece': 0.0073}
53
+ type/score {'n': 22729, 'accuracy': 0.4776, 'brier': 0.6083, 'nll': 1.1413, 'ece': 0.0321}
54
+ squad_tr/answerability {'auroc': 0.8093, 'acc_answerable': 0.9178, 'acc_unanswerable': 0.439}
55
+ skipped decisions: {}
training/decider_lora.log ADDED
@@ -0,0 +1,380 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ 19:57:17 bev_tr: 27,000 of 102,782 rows
2
+ 19:57:17 bev_tr_en: 6,000 of 34,261 rows
3
+ 19:57:17 beyazperde_tr: 5,000 of 5,000 rows
4
+ 19:57:17 massive_tr: 5,000 of 5,000 rows
5
+ 19:57:17 squad_tr: 20,000 of 20,000 rows
6
+ 19:57:17 xnli_tr: 2,490 of 2,490 rows
7
+ 19:58:20 items train: 63,990 rows -> 169,657 prompt rows, 56,858,516 tokens
8
+ 19:58:21 items holdout: 1,500 rows -> 3,826 prompt rows, 1,277,818 tokens
9
+ 19:58:29 LoRA r=64: 121.9M trainable parameters
10
+ [transformers] `use_cache=True` is incompatible with gradient checkpointing. Setting `use_cache=False`.
11
+ 20:05:10 train epoch=1 step=20 of=786 ce=0.4711 kl=0.0000 acc=0.802 lr=5.13e-05 tok_per_s=3963 eta_h=4.26
12
+ 20:11:12 train epoch=1 step=40 of=786 ce=0.3948 kl=0.0000 acc=0.815 lr=1.00e-04 tok_per_s=4132 eta_h=3.95
13
+ 20:17:17 train epoch=1 step=60 of=786 ce=0.4701 kl=0.0000 acc=0.765 lr=9.98e-05 tok_per_s=4186 eta_h=3.79
14
+ 20:23:11 train epoch=1 step=80 of=786 ce=0.4196 kl=0.4652 acc=0.841 lr=9.93e-05 tok_per_s=4252 eta_h=3.63
15
+ 20:28:30 checkpoint: step 98 / 786
16
+ 20:29:06 train epoch=1 step=100 of=786 ce=0.3161 kl=0.4193 acc=0.860 lr=9.84e-05 tok_per_s=4298 eta_h=3.50
17
+ 20:35:04 train epoch=1 step=120 of=786 ce=0.3690 kl=0.0000 acc=0.832 lr=9.71e-05 tok_per_s=4325 eta_h=3.38
18
+ 20:41:01 train epoch=1 step=140 of=786 ce=0.3986 kl=0.0000 acc=0.822 lr=9.56e-05 tok_per_s=4339 eta_h=3.27
19
+ 20:47:04 train epoch=1 step=160 of=786 ce=0.4116 kl=0.0000 acc=0.825 lr=9.37e-05 tok_per_s=4347 eta_h=3.17
20
+ 20:53:03 train epoch=1 step=180 of=786 ce=0.3470 kl=0.0000 acc=0.876 lr=9.15e-05 tok_per_s=4354 eta_h=3.06
21
+ 20:58:40 checkpoint: step 199 / 786
22
+ 20:58:57 train epoch=1 step=200 of=786 ce=0.3483 kl=0.0000 acc=0.883 lr=8.90e-05 tok_per_s=4365 eta_h=2.95
23
+ 21:04:53 train epoch=1 step=220 of=786 ce=0.2993 kl=0.0000 acc=0.867 lr=8.62e-05 tok_per_s=4376 eta_h=2.85
24
+ 21:10:45 train epoch=1 step=240 of=786 ce=0.3812 kl=0.4214 acc=0.862 lr=8.32e-05 tok_per_s=4386 eta_h=2.74
25
+ 21:16:41 train epoch=1 step=260 of=786 ce=0.3078 kl=0.4537 acc=0.873 lr=7.99e-05 tok_per_s=4392 eta_h=2.64
26
+ 21:22:42 train epoch=1 step=280 of=786 ce=0.2801 kl=0.4366 acc=0.916 lr=7.64e-05 tok_per_s=4396 eta_h=2.54
27
+ 21:28:38 train epoch=1 step=300 of=786 ce=0.3187 kl=0.0000 acc=0.853 lr=7.28e-05 tok_per_s=4399 eta_h=2.43
28
+ 21:28:56 checkpoint: step 301 / 786
29
+ 21:34:27 train epoch=1 step=320 of=786 ce=0.2944 kl=0.0000 acc=0.862 lr=6.90e-05 tok_per_s=4401 eta_h=2.33
30
+ 21:40:18 train epoch=1 step=340 of=786 ce=0.2463 kl=0.0000 acc=0.893 lr=6.50e-05 tok_per_s=4402 eta_h=2.23
31
+ 21:46:17 train epoch=1 step=360 of=786 ce=0.2853 kl=0.3493 acc=0.894 lr=6.10e-05 tok_per_s=4403 eta_h=2.13
32
+ 21:52:15 train epoch=1 step=380 of=786 ce=0.2339 kl=0.0000 acc=0.931 lr=5.68e-05 tok_per_s=4402 eta_h=2.03
33
+ 21:58:08 train epoch=1 step=400 of=786 ce=0.2437 kl=0.0000 acc=0.896 lr=5.26e-05 tok_per_s=4403 eta_h=1.92
34
+ 21:59:04 checkpoint: step 403 / 786
35
+ 22:04:11 train epoch=1 step=420 of=786 ce=0.2569 kl=0.0000 acc=0.891 lr=4.84e-05 tok_per_s=4404 eta_h=1.83
36
+ 22:10:03 train epoch=1 step=440 of=786 ce=0.2504 kl=0.5673 acc=0.905 lr=4.42e-05 tok_per_s=4406 eta_h=1.72
37
+ 22:15:59 train epoch=1 step=460 of=786 ce=0.3125 kl=0.3594 acc=0.908 lr=4.01e-05 tok_per_s=4407 eta_h=1.62
38
+ 22:21:57 train epoch=1 step=480 of=786 ce=0.2940 kl=0.4133 acc=0.874 lr=3.60e-05 tok_per_s=4409 eta_h=1.52
39
+ 22:27:57 train epoch=1 step=500 of=786 ce=0.2922 kl=0.0000 acc=0.866 lr=3.20e-05 tok_per_s=4409 eta_h=1.42
40
+ 22:29:13 checkpoint: step 504 / 786
41
+ 22:33:59 train epoch=1 step=520 of=786 ce=0.2071 kl=0.0000 acc=0.912 lr=2.82e-05 tok_per_s=4409 eta_h=1.33
42
+ 22:39:51 train epoch=1 step=540 of=786 ce=0.2321 kl=0.0000 acc=0.892 lr=2.45e-05 tok_per_s=4413 eta_h=1.23
43
+ 22:45:46 train epoch=1 step=560 of=786 ce=0.3239 kl=0.0000 acc=0.862 lr=2.09e-05 tok_per_s=4415 eta_h=1.13
44
+ 22:51:46 train epoch=1 step=580 of=786 ce=0.2457 kl=0.4150 acc=0.906 lr=1.76e-05 tok_per_s=4414 eta_h=1.03
45
+ 22:57:44 train epoch=1 step=600 of=786 ce=0.2926 kl=0.0000 acc=0.872 lr=1.45e-05 tok_per_s=4416 eta_h=0.93
46
+ 22:59:14 checkpoint: step 605 / 786
47
+ 23:03:43 train epoch=1 step=620 of=786 ce=0.5139 kl=0.3765 acc=0.883 lr=1.17e-05 tok_per_s=4416 eta_h=0.83
48
+ 23:09:47 train epoch=1 step=640 of=786 ce=0.2457 kl=0.3053 acc=0.908 lr=9.13e-06 tok_per_s=4416 eta_h=0.73
49
+ 23:15:53 train epoch=1 step=660 of=786 ce=0.2090 kl=0.3768 acc=0.905 lr=6.86e-06 tok_per_s=4416 eta_h=0.63
50
+ 23:21:58 train epoch=1 step=680 of=786 ce=0.2614 kl=0.4038 acc=0.910 lr=4.89e-06 tok_per_s=4414 eta_h=0.53
51
+ 23:28:00 train epoch=1 step=700 of=786 ce=0.1429 kl=0.0000 acc=0.962 lr=3.23e-06 tok_per_s=4415 eta_h=0.43
52
+ 23:29:30 checkpoint: step 705 / 786
53
+ 23:33:53 train epoch=1 step=720 of=786 ce=0.2879 kl=0.0000 acc=0.862 lr=1.91e-06 tok_per_s=4416 eta_h=0.33
54
+ 23:39:50 train epoch=1 step=740 of=786 ce=0.2532 kl=0.3678 acc=0.896 lr=9.33e-07 tok_per_s=4418 eta_h=0.23
55
+ 23:45:45 train epoch=1 step=760 of=786 ce=0.3217 kl=0.0000 acc=0.850 lr=2.99e-07 tok_per_s=4419 eta_h=0.13
56
+ 23:51:39 train epoch=1 step=780 of=786 ce=0.3324 kl=0.0928 acc=0.844 lr=1.59e-08 tok_per_s=4421 eta_h=0.03
57
+ 23:54:46 validation epoch_end=1 val_rows=3826 val_slot_accuracy=0.8907 val_ce=0.2603
58
+ 23:54:46 checkpoint: step 786 / 786, training complete
59
+ 23:56:39 temperatures on 2,118 held-out answers: {'choice': 0.936, 'noul': 1.146, 'score': 1.093} (pooled 1.051)
60
+ 23:56:39 exported: decider_run/model (load with Decider('decider_run/model'))
61
+ decider-4b-v2.1-tr-lora on 77,016 rows (101,716 decisions)
62
+ 256 / 77,016 rows 19s accuracy so far 0.750
63
+ 512 / 77,016 rows 40s accuracy so far 0.746
64
+ 768 / 77,016 rows 73s accuracy so far 0.744
65
+ 1,024 / 77,016 rows 96s accuracy so far 0.732
66
+ 1,280 / 77,016 rows 111s accuracy so far 0.732
67
+ 1,536 / 77,016 rows 138s accuracy so far 0.730
68
+ 1,792 / 77,016 rows 164s accuracy so far 0.730
69
+ 2,048 / 77,016 rows 185s accuracy so far 0.731
70
+ 2,304 / 77,016 rows 200s accuracy so far 0.729
71
+ 2,560 / 77,016 rows 224s accuracy so far 0.732
72
+ 2,816 / 77,016 rows 243s accuracy so far 0.730
73
+ 3,072 / 77,016 rows 261s accuracy so far 0.731
74
+ 3,328 / 77,016 rows 276s accuracy so far 0.733
75
+ 3,584 / 77,016 rows 290s accuracy so far 0.737
76
+ 3,840 / 77,016 rows 309s accuracy so far 0.737
77
+ 4,096 / 77,016 rows 334s accuracy so far 0.738
78
+ 4,352 / 77,016 rows 359s accuracy so far 0.737
79
+ 4,608 / 77,016 rows 385s accuracy so far 0.739
80
+ 4,864 / 77,016 rows 409s accuracy so far 0.738
81
+ 5,120 / 77,016 rows 438s accuracy so far 0.738
82
+ 5,376 / 77,016 rows 455s accuracy so far 0.738
83
+ 5,632 / 77,016 rows 478s accuracy so far 0.740
84
+ 5,888 / 77,016 rows 507s accuracy so far 0.739
85
+ 6,144 / 77,016 rows 525s accuracy so far 0.739
86
+ 6,400 / 77,016 rows 545s accuracy so far 0.739
87
+ 6,656 / 77,016 rows 565s accuracy so far 0.739
88
+ 6,912 / 77,016 rows 581s accuracy so far 0.738
89
+ 7,168 / 77,016 rows 601s accuracy so far 0.739
90
+ 7,424 / 77,016 rows 621s accuracy so far 0.740
91
+ 7,680 / 77,016 rows 643s accuracy so far 0.739
92
+ 7,936 / 77,016 rows 656s accuracy so far 0.741
93
+ 8,192 / 77,016 rows 660s accuracy so far 0.745
94
+ 8,448 / 77,016 rows 665s accuracy so far 0.750
95
+ 8,704 / 77,016 rows 669s accuracy so far 0.754
96
+ 8,960 / 77,016 rows 673s accuracy so far 0.756
97
+ 9,216 / 77,016 rows 678s accuracy so far 0.758
98
+ 9,472 / 77,016 rows 691s accuracy so far 0.755
99
+ 9,728 / 77,016 rows 703s accuracy so far 0.755
100
+ 9,984 / 77,016 rows 706s accuracy so far 0.757
101
+ 10,240 / 77,016 rows 712s accuracy so far 0.757
102
+ 10,496 / 77,016 rows 714s accuracy so far 0.758
103
+ 10,752 / 77,016 rows 717s accuracy so far 0.761
104
+ 11,008 / 77,016 rows 726s accuracy so far 0.759
105
+ 11,264 / 77,016 rows 733s accuracy so far 0.759
106
+ 11,520 / 77,016 rows 735s accuracy so far 0.760
107
+ 11,776 / 77,016 rows 747s accuracy so far 0.765
108
+ 12,032 / 77,016 rows 762s accuracy so far 0.772
109
+ 12,288 / 77,016 rows 778s accuracy so far 0.778
110
+ 12,544 / 77,016 rows 793s accuracy so far 0.784
111
+ 12,800 / 77,016 rows 810s accuracy so far 0.790
112
+ 13,056 / 77,016 rows 825s accuracy so far 0.795
113
+ 13,312 / 77,016 rows 840s accuracy so far 0.800
114
+ 13,568 / 77,016 rows 857s accuracy so far 0.804
115
+ 13,824 / 77,016 rows 872s accuracy so far 0.809
116
+ 14,080 / 77,016 rows 887s accuracy so far 0.813
117
+ 14,336 / 77,016 rows 902s accuracy so far 0.816
118
+ 14,592 / 77,016 rows 917s accuracy so far 0.819
119
+ 14,848 / 77,016 rows 932s accuracy so far 0.822
120
+ 15,104 / 77,016 rows 948s accuracy so far 0.825
121
+ 15,360 / 77,016 rows 963s accuracy so far 0.828
122
+ 15,616 / 77,016 rows 980s accuracy so far 0.830
123
+ 15,872 / 77,016 rows 989s accuracy so far 0.832
124
+ 16,128 / 77,016 rows 1000s accuracy so far 0.833
125
+ 16,384 / 77,016 rows 1011s accuracy so far 0.835
126
+ 16,640 / 77,016 rows 1020s accuracy so far 0.837
127
+ 16,896 / 77,016 rows 1026s accuracy so far 0.838
128
+ 17,152 / 77,016 rows 1031s accuracy so far 0.839
129
+ 17,408 / 77,016 rows 1038s accuracy so far 0.840
130
+ 17,664 / 77,016 rows 1044s accuracy so far 0.840
131
+ 17,920 / 77,016 rows 1050s accuracy so far 0.841
132
+ 18,176 / 77,016 rows 1057s accuracy so far 0.842
133
+ 18,432 / 77,016 rows 1064s accuracy so far 0.842
134
+ 18,688 / 77,016 rows 1071s accuracy so far 0.842
135
+ 18,944 / 77,016 rows 1078s accuracy so far 0.843
136
+ 19,200 / 77,016 rows 1087s accuracy so far 0.843
137
+ 19,456 / 77,016 rows 1098s accuracy so far 0.844
138
+ 19,712 / 77,016 rows 1117s accuracy so far 0.844
139
+ 19,968 / 77,016 rows 1140s accuracy so far 0.844
140
+ 20,224 / 77,016 rows 1162s accuracy so far 0.843
141
+ 20,480 / 77,016 rows 1191s accuracy so far 0.843
142
+ 20,736 / 77,016 rows 1218s accuracy so far 0.842
143
+ 20,992 / 77,016 rows 1243s accuracy so far 0.842
144
+ 21,248 / 77,016 rows 1268s accuracy so far 0.841
145
+ 21,504 / 77,016 rows 1295s accuracy so far 0.841
146
+ 21,760 / 77,016 rows 1318s accuracy so far 0.841
147
+ 22,016 / 77,016 rows 1343s accuracy so far 0.840
148
+ 22,272 / 77,016 rows 1368s accuracy so far 0.840
149
+ 22,528 / 77,016 rows 1394s accuracy so far 0.840
150
+ 22,784 / 77,016 rows 1419s accuracy so far 0.839
151
+ 23,040 / 77,016 rows 1444s accuracy so far 0.839
152
+ 23,296 / 77,016 rows 1466s accuracy so far 0.839
153
+ 23,552 / 77,016 rows 1491s accuracy so far 0.839
154
+ 23,808 / 77,016 rows 1516s accuracy so far 0.839
155
+ 24,064 / 77,016 rows 1542s accuracy so far 0.838
156
+ 24,320 / 77,016 rows 1568s accuracy so far 0.838
157
+ 24,576 / 77,016 rows 1582s accuracy so far 0.837
158
+ 24,832 / 77,016 rows 1602s accuracy so far 0.837
159
+ 25,088 / 77,016 rows 1614s accuracy so far 0.836
160
+ 25,344 / 77,016 rows 1625s accuracy so far 0.835
161
+ 25,600 / 77,016 rows 1643s accuracy so far 0.834
162
+ 25,856 / 77,016 rows 1659s accuracy so far 0.833
163
+ 26,112 / 77,016 rows 1675s accuracy so far 0.833
164
+ 26,368 / 77,016 rows 1689s accuracy so far 0.832
165
+ 26,624 / 77,016 rows 1701s accuracy so far 0.831
166
+ 26,880 / 77,016 rows 1713s accuracy so far 0.830
167
+ 27,136 / 77,016 rows 1726s accuracy so far 0.830
168
+ 27,392 / 77,016 rows 1741s accuracy so far 0.829
169
+ 27,648 / 77,016 rows 1743s accuracy so far 0.829
170
+ 27,904 / 77,016 rows 1745s accuracy so far 0.829
171
+ 28,160 / 77,016 rows 1748s accuracy so far 0.829
172
+ 28,416 / 77,016 rows 1752s accuracy so far 0.829
173
+ 28,672 / 77,016 rows 1768s accuracy so far 0.829
174
+ 28,928 / 77,016 rows 1784s accuracy so far 0.829
175
+ 29,184 / 77,016 rows 1801s accuracy so far 0.829
176
+ 29,440 / 77,016 rows 1815s accuracy so far 0.829
177
+ 29,696 / 77,016 rows 1819s accuracy so far 0.829
178
+ 29,952 / 77,016 rows 1823s accuracy so far 0.829
179
+ 30,208 / 77,016 rows 1828s accuracy so far 0.829
180
+ 30,464 / 77,016 rows 1832s accuracy so far 0.829
181
+ 30,720 / 77,016 rows 1834s accuracy so far 0.829
182
+ 30,976 / 77,016 rows 1837s accuracy so far 0.827
183
+ 31,232 / 77,016 rows 1840s accuracy so far 0.827
184
+ 31,488 / 77,016 rows 1843s accuracy so far 0.826
185
+ 31,744 / 77,016 rows 1845s accuracy so far 0.825
186
+ 32,000 / 77,016 rows 1848s accuracy so far 0.824
187
+ 32,256 / 77,016 rows 1851s accuracy so far 0.824
188
+ 32,512 / 77,016 rows 1853s accuracy so far 0.824
189
+ 32,768 / 77,016 rows 1856s accuracy so far 0.825
190
+ 33,024 / 77,016 rows 1859s accuracy so far 0.825
191
+ 33,280 / 77,016 rows 1861s accuracy so far 0.825
192
+ 33,536 / 77,016 rows 1864s accuracy so far 0.825
193
+ 33,792 / 77,016 rows 1867s accuracy so far 0.825
194
+ 34,048 / 77,016 rows 1875s accuracy so far 0.825
195
+ 34,304 / 77,016 rows 1900s accuracy so far 0.826
196
+ 34,560 / 77,016 rows 1926s accuracy so far 0.826
197
+ 34,816 / 77,016 rows 1951s accuracy so far 0.826
198
+ 35,072 / 77,016 rows 1968s accuracy so far 0.826
199
+ 35,328 / 77,016 rows 1971s accuracy so far 0.827
200
+ 35,584 / 77,016 rows 1973s accuracy so far 0.827
201
+ 35,840 / 77,016 rows 1976s accuracy so far 0.828
202
+ 36,096 / 77,016 rows 1979s accuracy so far 0.827
203
+ 36,352 / 77,016 rows 1982s accuracy so far 0.826
204
+ 36,608 / 77,016 rows 1985s accuracy so far 0.824
205
+ 36,864 / 77,016 rows 1988s accuracy so far 0.823
206
+ 37,120 / 77,016 rows 2016s accuracy so far 0.821
207
+ 37,376 / 77,016 rows 2074s accuracy so far 0.820
208
+ 37,632 / 77,016 rows 2127s accuracy so far 0.818
209
+ 37,888 / 77,016 rows 2177s accuracy so far 0.816
210
+ 38,144 / 77,016 rows 2229s accuracy so far 0.815
211
+ 38,400 / 77,016 rows 2286s accuracy so far 0.815
212
+ 38,656 / 77,016 rows 2340s accuracy so far 0.814
213
+ 38,912 / 77,016 rows 2391s accuracy so far 0.814
214
+ 39,168 / 77,016 rows 2414s accuracy so far 0.813
215
+ 39,424 / 77,016 rows 2426s accuracy so far 0.812
216
+ 39,680 / 77,016 rows 2438s accuracy so far 0.812
217
+ 39,936 / 77,016 rows 2449s accuracy so far 0.811
218
+ 40,192 / 77,016 rows 2461s accuracy so far 0.812
219
+ 40,448 / 77,016 rows 2472s accuracy so far 0.812
220
+ 40,704 / 77,016 rows 2483s accuracy so far 0.812
221
+ 40,960 / 77,016 rows 2494s accuracy so far 0.812
222
+ 41,216 / 77,016 rows 2500s accuracy so far 0.811
223
+ 41,472 / 77,016 rows 2506s accuracy so far 0.810
224
+ 41,728 / 77,016 rows 2512s accuracy so far 0.809
225
+ 41,984 / 77,016 rows 2518s accuracy so far 0.808
226
+ 42,240 / 77,016 rows 2522s accuracy so far 0.807
227
+ 42,496 / 77,016 rows 2525s accuracy so far 0.807
228
+ 42,752 / 77,016 rows 2529s accuracy so far 0.806
229
+ 43,008 / 77,016 rows 2532s accuracy so far 0.805
230
+ 43,264 / 77,016 rows 2535s accuracy so far 0.805
231
+ 43,520 / 77,016 rows 2538s accuracy so far 0.805
232
+ 43,776 / 77,016 rows 2541s accuracy so far 0.805
233
+ 44,032 / 77,016 rows 2543s accuracy so far 0.805
234
+ 44,288 / 77,016 rows 2545s accuracy so far 0.805
235
+ 44,544 / 77,016 rows 2547s accuracy so far 0.804
236
+ 44,800 / 77,016 rows 2550s accuracy so far 0.804
237
+ 45,056 / 77,016 rows 2552s accuracy so far 0.804
238
+ 45,312 / 77,016 rows 2553s accuracy so far 0.805
239
+ 45,568 / 77,016 rows 2555s accuracy so far 0.805
240
+ 45,824 / 77,016 rows 2557s accuracy so far 0.805
241
+ 46,080 / 77,016 rows 2566s accuracy so far 0.804
242
+ 46,336 / 77,016 rows 2574s accuracy so far 0.803
243
+ 46,592 / 77,016 rows 2583s accuracy so far 0.801
244
+ 46,848 / 77,016 rows 2590s accuracy so far 0.800
245
+ 47,104 / 77,016 rows 2591s accuracy so far 0.799
246
+ 47,360 / 77,016 rows 2592s accuracy so far 0.798
247
+ 47,616 / 77,016 rows 2594s accuracy so far 0.798
248
+ 47,872 / 77,016 rows 2596s accuracy so far 0.798
249
+ 48,128 / 77,016 rows 2598s accuracy so far 0.798
250
+ 48,384 / 77,016 rows 2609s accuracy so far 0.797
251
+ 48,640 / 77,016 rows 2620s accuracy so far 0.796
252
+ 48,896 / 77,016 rows 2631s accuracy so far 0.795
253
+ 49,152 / 77,016 rows 2642s accuracy so far 0.794
254
+ 49,408 / 77,016 rows 2663s accuracy so far 0.793
255
+ 49,664 / 77,016 rows 2685s accuracy so far 0.793
256
+ 49,920 / 77,016 rows 2707s accuracy so far 0.793
257
+ 50,176 / 77,016 rows 2728s accuracy so far 0.792
258
+ 50,432 / 77,016 rows 2737s accuracy so far 0.792
259
+ 50,688 / 77,016 rows 2747s accuracy so far 0.792
260
+ 50,944 / 77,016 rows 2757s accuracy so far 0.792
261
+ 51,200 / 77,016 rows 2765s accuracy so far 0.792
262
+ 51,456 / 77,016 rows 2775s accuracy so far 0.792
263
+ 51,712 / 77,016 rows 2785s accuracy so far 0.792
264
+ 51,968 / 77,016 rows 2795s accuracy so far 0.792
265
+ 52,224 / 77,016 rows 2804s accuracy so far 0.791
266
+ 52,480 / 77,016 rows 2815s accuracy so far 0.792
267
+ 52,736 / 77,016 rows 2826s accuracy so far 0.792
268
+ 52,992 / 77,016 rows 2837s accuracy so far 0.792
269
+ 53,248 / 77,016 rows 2848s accuracy so far 0.793
270
+ 53,504 / 77,016 rows 2859s accuracy so far 0.793
271
+ 53,760 / 77,016 rows 2870s accuracy so far 0.793
272
+ 54,016 / 77,016 rows 2881s accuracy so far 0.793
273
+ 54,272 / 77,016 rows 2892s accuracy so far 0.793
274
+ 54,528 / 77,016 rows 2903s accuracy so far 0.794
275
+ 54,784 / 77,016 rows 2914s accuracy so far 0.794
276
+ 55,040 / 77,016 rows 2925s accuracy so far 0.794
277
+ 55,296 / 77,016 rows 2931s accuracy so far 0.795
278
+ 55,552 / 77,016 rows 2934s accuracy so far 0.795
279
+ 55,808 / 77,016 rows 2936s accuracy so far 0.795
280
+ 56,064 / 77,016 rows 2939s accuracy so far 0.795
281
+ 56,320 / 77,016 rows 2941s accuracy so far 0.795
282
+ 56,576 / 77,016 rows 2944s accuracy so far 0.795
283
+ 56,832 / 77,016 rows 2946s accuracy so far 0.795
284
+ 57,088 / 77,016 rows 2949s accuracy so far 0.795
285
+ 57,344 / 77,016 rows 2951s accuracy so far 0.796
286
+ 57,600 / 77,016 rows 2954s accuracy so far 0.796
287
+ 57,856 / 77,016 rows 2957s accuracy so far 0.796
288
+ 58,112 / 77,016 rows 2959s accuracy so far 0.796
289
+ 58,368 / 77,016 rows 2962s accuracy so far 0.796
290
+ 58,624 / 77,016 rows 2965s accuracy so far 0.796
291
+ 58,880 / 77,016 rows 2967s accuracy so far 0.797
292
+ 59,136 / 77,016 rows 2970s accuracy so far 0.797
293
+ 59,392 / 77,016 rows 2973s accuracy so far 0.797
294
+ 59,648 / 77,016 rows 2975s accuracy so far 0.797
295
+ 59,904 / 77,016 rows 2978s accuracy so far 0.797
296
+ 60,160 / 77,016 rows 2981s accuracy so far 0.797
297
+ 60,416 / 77,016 rows 2996s accuracy so far 0.796
298
+ 60,672 / 77,016 rows 3013s accuracy so far 0.796
299
+ 60,928 / 77,016 rows 3028s accuracy so far 0.795
300
+ 61,184 / 77,016 rows 3042s accuracy so far 0.795
301
+ 61,440 / 77,016 rows 3055s accuracy so far 0.794
302
+ 61,696 / 77,016 rows 3071s accuracy so far 0.794
303
+ 61,952 / 77,016 rows 3086s accuracy so far 0.793
304
+ 62,208 / 77,016 rows 3100s accuracy so far 0.792
305
+ 62,464 / 77,016 rows 3114s accuracy so far 0.792
306
+ 62,720 / 77,016 rows 3130s accuracy so far 0.791
307
+ 62,976 / 77,016 rows 3144s accuracy so far 0.791
308
+ 63,232 / 77,016 rows 3159s accuracy so far 0.790
309
+ 63,488 / 77,016 rows 3173s accuracy so far 0.790
310
+ 63,744 / 77,016 rows 3188s accuracy so far 0.790
311
+ 64,000 / 77,016 rows 3202s accuracy so far 0.789
312
+ 64,256 / 77,016 rows 3218s accuracy so far 0.789
313
+ 64,512 / 77,016 rows 3235s accuracy so far 0.789
314
+ 64,768 / 77,016 rows 3250s accuracy so far 0.788
315
+ 65,024 / 77,016 rows 3265s accuracy so far 0.788
316
+ 65,280 / 77,016 rows 3275s accuracy so far 0.787
317
+ 65,536 / 77,016 rows 3281s accuracy so far 0.788
318
+ 65,792 / 77,016 rows 3287s accuracy so far 0.788
319
+ 66,048 / 77,016 rows 3293s accuracy so far 0.788
320
+ 66,304 / 77,016 rows 3299s accuracy so far 0.788
321
+ 66,560 / 77,016 rows 3306s accuracy so far 0.788
322
+ 66,816 / 77,016 rows 3312s accuracy so far 0.789
323
+ 67,072 / 77,016 rows 3319s accuracy so far 0.789
324
+ 67,328 / 77,016 rows 3326s accuracy so far 0.789
325
+ 67,584 / 77,016 rows 3333s accuracy so far 0.789
326
+ 67,840 / 77,016 rows 3339s accuracy so far 0.789
327
+ 68,096 / 77,016 rows 3346s accuracy so far 0.789
328
+ 68,352 / 77,016 rows 3355s accuracy so far 0.789
329
+ 68,608 / 77,016 rows 3365s accuracy so far 0.789
330
+ 68,864 / 77,016 rows 3373s accuracy so far 0.790
331
+ 69,120 / 77,016 rows 3380s accuracy so far 0.790
332
+ 69,376 / 77,016 rows 3387s accuracy so far 0.790
333
+ 69,632 / 77,016 rows 3394s accuracy so far 0.790
334
+ 69,888 / 77,016 rows 3401s accuracy so far 0.790
335
+ 70,144 / 77,016 rows 3408s accuracy so far 0.790
336
+ 70,400 / 77,016 rows 3415s accuracy so far 0.791
337
+ 70,656 / 77,016 rows 3422s accuracy so far 0.791
338
+ 70,912 / 77,016 rows 3429s accuracy so far 0.791
339
+ 71,168 / 77,016 rows 3436s accuracy so far 0.791
340
+ 71,424 / 77,016 rows 3443s accuracy so far 0.792
341
+ 71,680 / 77,016 rows 3450s accuracy so far 0.792
342
+ 71,936 / 77,016 rows 3457s accuracy so far 0.792
343
+ 72,192 / 77,016 rows 3464s accuracy so far 0.792
344
+ 72,448 / 77,016 rows 3471s accuracy so far 0.793
345
+ 72,704 / 77,016 rows 3478s accuracy so far 0.793
346
+ 72,960 / 77,016 rows 3486s accuracy so far 0.793
347
+ 73,216 / 77,016 rows 3493s accuracy so far 0.793
348
+ 73,472 / 77,016 rows 3500s accuracy so far 0.794
349
+ 73,728 / 77,016 rows 3507s accuracy so far 0.794
350
+ 73,984 / 77,016 rows 3514s accuracy so far 0.794
351
+ 74,240 / 77,016 rows 3520s accuracy so far 0.794
352
+ 74,496 / 77,016 rows 3527s accuracy so far 0.795
353
+ 74,752 / 77,016 rows 3534s accuracy so far 0.795
354
+ 75,008 / 77,016 rows 3540s accuracy so far 0.795
355
+ 75,264 / 77,016 rows 3547s accuracy so far 0.795
356
+ 75,520 / 77,016 rows 3554s accuracy so far 0.795
357
+ 75,776 / 77,016 rows 3561s accuracy so far 0.796
358
+ 76,032 / 77,016 rows 3569s accuracy so far 0.796
359
+ 76,288 / 77,016 rows 3575s accuracy so far 0.796
360
+ 76,544 / 77,016 rows 3582s accuracy so far 0.796
361
+ 76,800 / 77,016 rows 3589s accuracy so far 0.796
362
+ 77,016 / 77,016 rows 3595s accuracy so far 0.796
363
+ all {'n': 101716, 'accuracy': 0.7962, 'brier': 0.2653, 'nll': 0.53, 'ece': 0.0203}
364
+ source/bev_tr {'n': 46320, 'accuracy': 0.8382, 'brier': 0.2215, 'nll': 0.3964, 'ece': 0.0092}
365
+ source/bev_tr_en {'n': 5766, 'accuracy': 0.7542, 'brier': 0.3138, 'nll': 0.5674, 'ece': 0.0126}
366
+ source/beyazperde_tr {'n': 5000, 'accuracy': 0.6336, 'brier': 0.4769, 'nll': 0.8667, 'ece': 0.0402}
367
+ source/jev_bench_tr {'n': 22773, 'accuracy': 0.7078, 'brier': 0.3407, 'nll': 0.821, 'ece': 0.051}
368
+ source/jev_bench_tr_en {'n': 2000, 'accuracy': 0.7705, 'brier': 0.2689, 'nll': 0.6936, 'ece': 0.0351}
369
+ source/massive_tr {'n': 2974, 'accuracy': 0.8705, 'brier': 0.1941, 'nll': 0.5568, 'ece': 0.0362}
370
+ source/squad_tr {'n': 11873, 'accuracy': 0.8619, 'brier': 0.2028, 'nll': 0.3322, 'ece': 0.0168}
371
+ source/xnli_tr {'n': 5010, 'accuracy': 0.8315, 'brier': 0.2488, 'nll': 0.4509, 'ece': 0.0151}
372
+ type/choice {'n': 39616, 'accuracy': 0.8135, 'brier': 0.2401, 'nll': 0.5701, 'ece': 0.0214}
373
+ type/noul {'n': 39371, 'accuracy': 0.8746, 'brier': 0.1753, 'nll': 0.2943, 'ece': 0.0177}
374
+ type/score {'n': 22729, 'accuracy': 0.6304, 'brier': 0.465, 'nll': 0.8684, 'ece': 0.0235}
375
+ squad_tr/answerability {'auroc': 0.9397, 'acc_answerable': 0.9379, 'acc_unanswerable': 0.783}
376
+ skipped decisions: {}
377
+ 00:56:41 eval: accuracy 0.7962, ECE 0.0203 (decider_run/eval_report.json)
378
+ 00:58:36 pushed: https://huggingface.co/hayriyigit/decider-4b-tr (241be87048b2)
379
+ 00:58:36 done
380
+ EXIT 0
training/decider_lora.yaml ADDED
@@ -0,0 +1,45 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # LoRA fine-tune of Mapika/decider-4b on the Turkish decision data that laya_pipeline built (configs/laya.yaml):
2
+ # uv run --script scripts/decider_lora.py --config configs/decider_lora.yaml
3
+ # Everything goes to `workdir`; after a time limit, a crash or a STOP file run the same command again to resume.
4
+ workdir: ./decider_run
5
+
6
+ model:
7
+ repo: Mapika/decider-4b # v2.1: Qwen3.5-4B-Base, one forward pass reads every option's probability
8
+ revision: eb5fbdfc9448473ec25e399882912863afbdb70e
9
+
10
+ data:
11
+ train: laya_run/data/all/train-00000-of-00001.parquet # laya_pipeline prepare output (state / questions / gold)
12
+ test: laya_run/data/all/test-00000-of-00001.parquet # the same test split as Laya: the reports compare row for row
13
+ rows: # training rows sampled per source (laya_pipeline's source names)
14
+ bev_tr: 27000 # bev-decision-150K-tr (domain-weighted, decontaminated); ~1,290 tokens/row
15
+ squad_tr: 20000 # SQuAD 2.0-tr answerability; ~460 tokens/row
16
+ massive_tr: 5000 # ~800 tokens/row: all 60 intents are options
17
+ xnli_tr: 2490 # ~150 tokens/row
18
+ beyazperde_tr: 5000 # ~915 tokens/row: one yes/no row per Score level
19
+ bev_tr_en: 6000 # English rows: trained toward the base model's own answers (replay)
20
+ # ~62M tokens: ~4.6 h on one RTX 5090 (with causal-conv1d)
21
+ holdout_rows: 1500 # Turkish rows, whole states: validation + temperature fit
22
+ max_state_tokens: 4096
23
+ seed: 0
24
+
25
+ lora: # decider-4b v2.1's own stage 2: rank 64, alpha 128, attention + MLP
26
+ r: 64
27
+ alpha: 128
28
+
29
+ train:
30
+ epochs: 1 # ~65K different rows once rather than half of them twice
31
+ lr: 1.0e-4
32
+ warmup: 0.05
33
+ tokens_per_step: 65536 # padded tokens per optimizer step (v2.1: 65,536)
34
+ micro_tokens: 16384 # per forward pass: lower it on an out-of-memory error
35
+ label_smoothing: 0.0
36
+
37
+ checkpoint:
38
+ every_minutes: 30
39
+
40
+ limits:
41
+ max_hours: 6 # wall-clock budget of one invocation; 0 = none
42
+ reserve_minutes: 20
43
+
44
+ export:
45
+ push_to_hub: {repo: hayriyigit/decider-4b-tr, private: true}
training/eval_10k_bf16.json ADDED
@@ -0,0 +1,800 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model": "decider-4b-v2.1-tr-lora",
3
+ "path": "/workspace/laya/decider_run/model",
4
+ "revision": "eb5fbdfc9448473ec25e399882912863afbdb70e",
5
+ "fp8_layers": 0,
6
+ "limit": 10000,
7
+ "skipped": {},
8
+ "seconds": 462,
9
+ "report": {
10
+ "all": {
11
+ "n": 13371,
12
+ "accuracy": 0.7968,
13
+ "brier": 0.2639,
14
+ "nll": 0.5223,
15
+ "ece": 0.0213
16
+ },
17
+ "source/bev_tr": {
18
+ "n": 6122,
19
+ "accuracy": 0.8383,
20
+ "brier": 0.2217,
21
+ "nll": 0.3967,
22
+ "ece": 0.0104
23
+ },
24
+ "source/bev_tr/choice": {
25
+ "n": 2464,
26
+ "accuracy": 0.8381,
27
+ "brier": 0.2187,
28
+ "nll": 0.4023,
29
+ "ece": 0.0167
30
+ },
31
+ "source/bev_tr/noul": {
32
+ "n": 2357,
33
+ "accuracy": 0.905,
34
+ "brier": 0.1368,
35
+ "nll": 0.2225,
36
+ "ece": 0.0084
37
+ },
38
+ "source/bev_tr/score": {
39
+ "n": 1301,
40
+ "accuracy": 0.7179,
41
+ "brier": 0.3814,
42
+ "nll": 0.7019,
43
+ "ece": 0.0301
44
+ },
45
+ "source/bev_tr_en": {
46
+ "n": 852,
47
+ "accuracy": 0.777,
48
+ "brier": 0.2821,
49
+ "nll": 0.5,
50
+ "ece": 0.0313
51
+ },
52
+ "source/bev_tr_en/choice": {
53
+ "n": 314,
54
+ "accuracy": 0.7548,
55
+ "brier": 0.3185,
56
+ "nll": 0.5896,
57
+ "ece": 0.038
58
+ },
59
+ "source/bev_tr_en/noul": {
60
+ "n": 364,
61
+ "accuracy": 0.8956,
62
+ "brier": 0.1319,
63
+ "nll": 0.2167,
64
+ "ece": 0.0393
65
+ },
66
+ "source/bev_tr_en/score": {
67
+ "n": 174,
68
+ "accuracy": 0.569,
69
+ "brier": 0.5307,
70
+ "nll": 0.9313,
71
+ "ece": 0.0733
72
+ },
73
+ "source/beyazperde_tr": {
74
+ "n": 631,
75
+ "accuracy": 0.6466,
76
+ "brier": 0.4678,
77
+ "nll": 0.8605,
78
+ "ece": 0.0735
79
+ },
80
+ "source/beyazperde_tr/score": {
81
+ "n": 631,
82
+ "accuracy": 0.6466,
83
+ "brier": 0.4678,
84
+ "nll": 0.8605,
85
+ "ece": 0.0735
86
+ },
87
+ "source/jev_bench_tr": {
88
+ "n": 2986,
89
+ "accuracy": 0.7029,
90
+ "brier": 0.3414,
91
+ "nll": 0.8115,
92
+ "ece": 0.0586
93
+ },
94
+ "source/jev_bench_tr/choice": {
95
+ "n": 1256,
96
+ "accuracy": 0.7301,
97
+ "brier": 0.2809,
98
+ "nll": 0.912,
99
+ "ece": 0.0693
100
+ },
101
+ "source/jev_bench_tr/noul": {
102
+ "n": 959,
103
+ "accuracy": 0.8092,
104
+ "brier": 0.2436,
105
+ "nll": 0.4284,
106
+ "ece": 0.0637
107
+ },
108
+ "source/jev_bench_tr/score": {
109
+ "n": 771,
110
+ "accuracy": 0.5266,
111
+ "brier": 0.5617,
112
+ "nll": 1.124,
113
+ "ece": 0.0547
114
+ },
115
+ "source/jev_bench_tr_en": {
116
+ "n": 278,
117
+ "accuracy": 0.7662,
118
+ "brier": 0.2858,
119
+ "nll": 0.7261,
120
+ "ece": 0.0676
121
+ },
122
+ "source/jev_bench_tr_en/choice": {
123
+ "n": 115,
124
+ "accuracy": 0.7565,
125
+ "brier": 0.2891,
126
+ "nll": 0.9776,
127
+ "ece": 0.093
128
+ },
129
+ "source/jev_bench_tr_en/noul": {
130
+ "n": 82,
131
+ "accuracy": 0.8902,
132
+ "brier": 0.1192,
133
+ "nll": 0.2343,
134
+ "ece": 0.1167
135
+ },
136
+ "source/jev_bench_tr_en/score": {
137
+ "n": 81,
138
+ "accuracy": 0.6543,
139
+ "brier": 0.45,
140
+ "nll": 0.8671,
141
+ "ece": 0.1334
142
+ },
143
+ "source/massive_tr": {
144
+ "n": 416,
145
+ "accuracy": 0.8894,
146
+ "brier": 0.158,
147
+ "nll": 0.3759,
148
+ "ece": 0.0261
149
+ },
150
+ "source/massive_tr/choice": {
151
+ "n": 416,
152
+ "accuracy": 0.8894,
153
+ "brier": 0.158,
154
+ "nll": 0.3759,
155
+ "ece": 0.0261
156
+ },
157
+ "source/squad_tr": {
158
+ "n": 1454,
159
+ "accuracy": 0.8583,
160
+ "brier": 0.2133,
161
+ "nll": 0.3509,
162
+ "ece": 0.0283
163
+ },
164
+ "source/squad_tr/noul": {
165
+ "n": 1454,
166
+ "accuracy": 0.8583,
167
+ "brier": 0.2133,
168
+ "nll": 0.3509,
169
+ "ece": 0.0283
170
+ },
171
+ "source/xnli_tr": {
172
+ "n": 632,
173
+ "accuracy": 0.8259,
174
+ "brier": 0.2537,
175
+ "nll": 0.4652,
176
+ "ece": 0.0423
177
+ },
178
+ "source/xnli_tr/choice": {
179
+ "n": 632,
180
+ "accuracy": 0.8259,
181
+ "brier": 0.2537,
182
+ "nll": 0.4652,
183
+ "ece": 0.0423
184
+ },
185
+ "type/choice": {
186
+ "n": 5197,
187
+ "accuracy": 0.8078,
188
+ "brier": 0.2407,
189
+ "nll": 0.5551,
190
+ "ece": 0.0268
191
+ },
192
+ "type/noul": {
193
+ "n": 5216,
194
+ "accuracy": 0.8735,
195
+ "brier": 0.1772,
196
+ "nll": 0.2959,
197
+ "ece": 0.0192
198
+ },
199
+ "type/score": {
200
+ "n": 2958,
201
+ "accuracy": 0.6423,
202
+ "brier": 0.4575,
203
+ "nll": 0.8638,
204
+ "ece": 0.0284
205
+ },
206
+ "workflow/bev_tr/Browser interaction": {
207
+ "n": 34,
208
+ "accuracy": 0.9412,
209
+ "brier": 0.0907,
210
+ "nll": 0.1661,
211
+ "ece": 0.1111
212
+ },
213
+ "workflow/bev_tr/Civic and safety operations": {
214
+ "n": 27,
215
+ "accuracy": 0.7037,
216
+ "brier": 0.3862,
217
+ "nll": 0.7932,
218
+ "ece": 0.1457
219
+ },
220
+ "workflow/bev_tr/Contract evidence": {
221
+ "n": 29,
222
+ "accuracy": 0.8621,
223
+ "brier": 0.222,
224
+ "nll": 0.4294,
225
+ "ece": 0.107
226
+ },
227
+ "workflow/bev_tr/Engagement and ranking": {
228
+ "n": 12,
229
+ "accuracy": 0.5833,
230
+ "brier": 0.5043,
231
+ "nll": 0.7431,
232
+ "ece": 0.2083
233
+ },
234
+ "workflow/bev_tr/Financial reporting and banking": {
235
+ "n": 210,
236
+ "accuracy": 0.8381,
237
+ "brier": 0.2199,
238
+ "nll": 0.3958,
239
+ "ece": 0.0434
240
+ },
241
+ "workflow/bev_tr/Game-state decisions": {
242
+ "n": 282,
243
+ "accuracy": 0.8723,
244
+ "brier": 0.146,
245
+ "nll": 0.2215,
246
+ "ece": 0.0367
247
+ },
248
+ "workflow/bev_tr/Reading comprehension": {
249
+ "n": 200,
250
+ "accuracy": 0.92,
251
+ "brier": 0.1237,
252
+ "nll": 0.2081,
253
+ "ece": 0.0396
254
+ },
255
+ "workflow/bev_tr/Response preference and quality": {
256
+ "n": 387,
257
+ "accuracy": 0.6822,
258
+ "brier": 0.4485,
259
+ "nll": 0.8363,
260
+ "ece": 0.0701
261
+ },
262
+ "workflow/bev_tr/Retail, product, and shopping": {
263
+ "n": 855,
264
+ "accuracy": 0.9275,
265
+ "brier": 0.1039,
266
+ "nll": 0.1844,
267
+ "ece": 0.018
268
+ },
269
+ "workflow/bev_tr/Scientific and paper understanding": {
270
+ "n": 71,
271
+ "accuracy": 0.7887,
272
+ "brier": 0.2864,
273
+ "nll": 0.4506,
274
+ "ece": 0.1094
275
+ },
276
+ "workflow/bev_tr/Sensory quality rating": {
277
+ "n": 41,
278
+ "accuracy": 0.3415,
279
+ "brier": 0.7407,
280
+ "nll": 1.4077,
281
+ "ece": 0.0664
282
+ },
283
+ "workflow/bev_tr/Sentiment, emotion, and moderation": {
284
+ "n": 1534,
285
+ "accuracy": 0.8696,
286
+ "brier": 0.1881,
287
+ "nll": 0.3356,
288
+ "ece": 0.0234
289
+ },
290
+ "workflow/bev_tr/Software engineering and code": {
291
+ "n": 252,
292
+ "accuracy": 0.7222,
293
+ "brier": 0.3646,
294
+ "nll": 0.6731,
295
+ "ece": 0.0413
296
+ },
297
+ "workflow/bev_tr/Software security": {
298
+ "n": 330,
299
+ "accuracy": 0.6848,
300
+ "brier": 0.4157,
301
+ "nll": 0.7087,
302
+ "ece": 0.0569
303
+ },
304
+ "workflow/bev_tr/Spam detection": {
305
+ "n": 37,
306
+ "accuracy": 1.0,
307
+ "brier": 0.0091,
308
+ "nll": 0.023,
309
+ "ece": 0.02
310
+ },
311
+ "workflow/bev_tr/Spatial and logical reasoning": {
312
+ "n": 1122,
313
+ "accuracy": 0.7576,
314
+ "brier": 0.326,
315
+ "nll": 0.5801,
316
+ "ece": 0.0301
317
+ },
318
+ "workflow/bev_tr/Support and intent routing": {
319
+ "n": 422,
320
+ "accuracy": 0.9787,
321
+ "brier": 0.0412,
322
+ "nll": 0.0858,
323
+ "ece": 0.0176
324
+ },
325
+ "workflow/bev_tr/Tool and workflow decisions": {
326
+ "n": 277,
327
+ "accuracy": 0.9892,
328
+ "brier": 0.0186,
329
+ "nll": 0.0572,
330
+ "ece": 0.0127
331
+ },
332
+ "workflow/bev_tr_en/Browser interaction": {
333
+ "n": 7,
334
+ "accuracy": 0.7143,
335
+ "brier": 0.3125,
336
+ "nll": 0.4928,
337
+ "ece": 0.3385
338
+ },
339
+ "workflow/bev_tr_en/Civic and safety operations": {
340
+ "n": 3,
341
+ "accuracy": 0.3333,
342
+ "brier": 0.829,
343
+ "nll": 1.1192,
344
+ "ece": 0.5844
345
+ },
346
+ "workflow/bev_tr_en/Contract evidence": {
347
+ "n": 5,
348
+ "accuracy": 1.0,
349
+ "brier": 0.1274,
350
+ "nll": 0.3017,
351
+ "ece": 0.2545
352
+ },
353
+ "workflow/bev_tr_en/Engagement and ranking": {
354
+ "n": 1,
355
+ "accuracy": 0.0,
356
+ "brier": 0.6791,
357
+ "nll": 0.8739,
358
+ "ece": 0.5827
359
+ },
360
+ "workflow/bev_tr_en/Financial reporting and banking": {
361
+ "n": 24,
362
+ "accuracy": 0.75,
363
+ "brier": 0.3628,
364
+ "nll": 0.6762,
365
+ "ece": 0.1383
366
+ },
367
+ "workflow/bev_tr_en/Game-state decisions": {
368
+ "n": 45,
369
+ "accuracy": 0.9556,
370
+ "brier": 0.1414,
371
+ "nll": 0.2709,
372
+ "ece": 0.17
373
+ },
374
+ "workflow/bev_tr_en/Reading comprehension": {
375
+ "n": 27,
376
+ "accuracy": 0.8889,
377
+ "brier": 0.2271,
378
+ "nll": 0.3849,
379
+ "ece": 0.1321
380
+ },
381
+ "workflow/bev_tr_en/Response preference and quality": {
382
+ "n": 34,
383
+ "accuracy": 0.5882,
384
+ "brier": 0.5002,
385
+ "nll": 0.8492,
386
+ "ece": 0.1697
387
+ },
388
+ "workflow/bev_tr_en/Retail, product, and shopping": {
389
+ "n": 129,
390
+ "accuracy": 0.6977,
391
+ "brier": 0.3353,
392
+ "nll": 0.561,
393
+ "ece": 0.1092
394
+ },
395
+ "workflow/bev_tr_en/Scientific and paper understanding": {
396
+ "n": 7,
397
+ "accuracy": 0.4286,
398
+ "brier": 0.5093,
399
+ "nll": 0.9023,
400
+ "ece": 0.3847
401
+ },
402
+ "workflow/bev_tr_en/Sensory quality rating": {
403
+ "n": 7,
404
+ "accuracy": 0.0,
405
+ "brier": 0.8219,
406
+ "nll": 1.6507,
407
+ "ece": 0.3153
408
+ },
409
+ "workflow/bev_tr_en/Sentiment, emotion, and moderation": {
410
+ "n": 262,
411
+ "accuracy": 0.8855,
412
+ "brier": 0.1727,
413
+ "nll": 0.3088,
414
+ "ece": 0.0688
415
+ },
416
+ "workflow/bev_tr_en/Software engineering and code": {
417
+ "n": 34,
418
+ "accuracy": 0.6471,
419
+ "brier": 0.4953,
420
+ "nll": 0.9538,
421
+ "ece": 0.1696
422
+ },
423
+ "workflow/bev_tr_en/Software security": {
424
+ "n": 34,
425
+ "accuracy": 0.5294,
426
+ "brier": 0.5426,
427
+ "nll": 0.8608,
428
+ "ece": 0.1167
429
+ },
430
+ "workflow/bev_tr_en/Spam detection": {
431
+ "n": 4,
432
+ "accuracy": 1.0,
433
+ "brier": 0.0002,
434
+ "nll": 0.0082,
435
+ "ece": 0.0081
436
+ },
437
+ "workflow/bev_tr_en/Spatial and logical reasoning": {
438
+ "n": 148,
439
+ "accuracy": 0.6486,
440
+ "brier": 0.4133,
441
+ "nll": 0.7589,
442
+ "ece": 0.062
443
+ },
444
+ "workflow/bev_tr_en/Support and intent routing": {
445
+ "n": 34,
446
+ "accuracy": 1.0,
447
+ "brier": 0.0532,
448
+ "nll": 0.1073,
449
+ "ece": 0.0803
450
+ },
451
+ "workflow/bev_tr_en/Tool and workflow decisions": {
452
+ "n": 47,
453
+ "accuracy": 1.0,
454
+ "brier": 0.0014,
455
+ "nll": 0.0067,
456
+ "ece": 0.0062
457
+ },
458
+ "workflow/beyazperde_tr": {
459
+ "n": 631,
460
+ "accuracy": 0.6466,
461
+ "brier": 0.4678,
462
+ "nll": 0.8605,
463
+ "ece": 0.0735
464
+ },
465
+ "workflow/jev_bench_tr/arc_challenge": {
466
+ "n": 120,
467
+ "accuracy": 0.8333,
468
+ "brier": 0.23,
469
+ "nll": 0.4115,
470
+ "ece": 0.056
471
+ },
472
+ "workflow/jev_bench_tr/banking77": {
473
+ "n": 141,
474
+ "accuracy": 0.8014,
475
+ "brier": 0.2653,
476
+ "nll": 0.5743,
477
+ "ece": 0.0687
478
+ },
479
+ "workflow/jev_bench_tr/boolq": {
480
+ "n": 133,
481
+ "accuracy": 0.8647,
482
+ "brier": 0.2,
483
+ "nll": 0.3307,
484
+ "ece": 0.0374
485
+ },
486
+ "workflow/jev_bench_tr/chaosnli": {
487
+ "n": 204,
488
+ "accuracy": 0.5882,
489
+ "brier": 0.2156,
490
+ "nll": 1.1708,
491
+ "ece": 0.1832
492
+ },
493
+ "workflow/jev_bench_tr/civil_comments": {
494
+ "n": 267,
495
+ "accuracy": 0.8577,
496
+ "brier": 0.1454,
497
+ "nll": 0.4001,
498
+ "ece": 0.0423
499
+ },
500
+ "workflow/jev_bench_tr/clinc150": {
501
+ "n": 129,
502
+ "accuracy": 0.845,
503
+ "brier": 0.2216,
504
+ "nll": 0.8302,
505
+ "ece": 0.0558
506
+ },
507
+ "workflow/jev_bench_tr/fever_evidence": {
508
+ "n": 139,
509
+ "accuracy": 0.8489,
510
+ "brier": 0.2078,
511
+ "nll": 0.3258,
512
+ "ece": 0.0788
513
+ },
514
+ "workflow/jev_bench_tr/go_emotions": {
515
+ "n": 119,
516
+ "accuracy": 0.4958,
517
+ "brier": 0.3178,
518
+ "nll": 2.3626,
519
+ "ece": 0.1529
520
+ },
521
+ "workflow/jev_bench_tr/helpsteer2_helpfulness": {
522
+ "n": 120,
523
+ "accuracy": 0.3417,
524
+ "brier": 0.7534,
525
+ "nll": 1.4327,
526
+ "ece": 0.1728
527
+ },
528
+ "workflow/jev_bench_tr/helpsteer2_verbosity": {
529
+ "n": 136,
530
+ "accuracy": 0.6324,
531
+ "brier": 0.541,
532
+ "nll": 0.9622,
533
+ "ece": 0.1695
534
+ },
535
+ "workflow/jev_bench_tr/ledgar": {
536
+ "n": 130,
537
+ "accuracy": 0.7,
538
+ "brier": 0.4419,
539
+ "nll": 1.1838,
540
+ "ece": 0.1384
541
+ },
542
+ "workflow/jev_bench_tr/massive": {
543
+ "n": 144,
544
+ "accuracy": 0.8958,
545
+ "brier": 0.1432,
546
+ "nll": 0.3663,
547
+ "ece": 0.043
548
+ },
549
+ "workflow/jev_bench_tr/measuring_hate_speech": {
550
+ "n": 142,
551
+ "accuracy": 0.5563,
552
+ "brier": 0.3266,
553
+ "nll": 1.062,
554
+ "ece": 0.1568
555
+ },
556
+ "workflow/jev_bench_tr/mmlu": {
557
+ "n": 124,
558
+ "accuracy": 0.6048,
559
+ "brier": 0.5092,
560
+ "nll": 0.9451,
561
+ "ece": 0.1036
562
+ },
563
+ "workflow/jev_bench_tr/mnli": {
564
+ "n": 145,
565
+ "accuracy": 0.8345,
566
+ "brier": 0.25,
567
+ "nll": 0.443,
568
+ "ece": 0.0808
569
+ },
570
+ "workflow/jev_bench_tr/paws": {
571
+ "n": 138,
572
+ "accuracy": 0.6957,
573
+ "brier": 0.4653,
574
+ "nll": 0.7604,
575
+ "ece": 0.1842
576
+ },
577
+ "workflow/jev_bench_tr/sms_spam": {
578
+ "n": 109,
579
+ "accuracy": 0.9908,
580
+ "brier": 0.0118,
581
+ "nll": 0.0272,
582
+ "ece": 0.0228
583
+ },
584
+ "workflow/jev_bench_tr/sst5": {
585
+ "n": 129,
586
+ "accuracy": 0.4264,
587
+ "brier": 0.6658,
588
+ "nll": 1.2069,
589
+ "ece": 0.1382
590
+ },
591
+ "workflow/jev_bench_tr/strategyqa_closed": {
592
+ "n": 96,
593
+ "accuracy": 0.5625,
594
+ "brier": 0.5143,
595
+ "nll": 0.7265,
596
+ "ece": 0.1302
597
+ },
598
+ "workflow/jev_bench_tr/strategyqa_grounded": {
599
+ "n": 77,
600
+ "accuracy": 0.7273,
601
+ "brier": 0.3174,
602
+ "nll": 0.482,
603
+ "ece": 0.1241
604
+ },
605
+ "workflow/jev_bench_tr/stsb": {
606
+ "n": 120,
607
+ "accuracy": 0.5,
608
+ "brier": 0.6592,
609
+ "nll": 1.298,
610
+ "ece": 0.1734
611
+ },
612
+ "workflow/jev_bench_tr/yelp5": {
613
+ "n": 124,
614
+ "accuracy": 0.6855,
615
+ "brier": 0.4654,
616
+ "nll": 0.8193,
617
+ "ece": 0.1218
618
+ },
619
+ "workflow/jev_bench_tr_en/arc_challenge": {
620
+ "n": 7,
621
+ "accuracy": 0.8571,
622
+ "brier": 0.1881,
623
+ "nll": 0.2846,
624
+ "ece": 0.115
625
+ },
626
+ "workflow/jev_bench_tr_en/banking77": {
627
+ "n": 16,
628
+ "accuracy": 0.75,
629
+ "brier": 0.384,
630
+ "nll": 1.0887,
631
+ "ece": 0.2165
632
+ },
633
+ "workflow/jev_bench_tr_en/boolq": {
634
+ "n": 9,
635
+ "accuracy": 1.0,
636
+ "brier": 0.0051,
637
+ "nll": 0.0379,
638
+ "ece": 0.0365
639
+ },
640
+ "workflow/jev_bench_tr_en/chaosnli": {
641
+ "n": 19,
642
+ "accuracy": 0.7895,
643
+ "brier": 0.1991,
644
+ "nll": 1.0873,
645
+ "ece": 0.1646
646
+ },
647
+ "workflow/jev_bench_tr_en/civil_comments": {
648
+ "n": 21,
649
+ "accuracy": 0.8095,
650
+ "brier": 0.1381,
651
+ "nll": 0.4076,
652
+ "ece": 0.1633
653
+ },
654
+ "workflow/jev_bench_tr_en/clinc150": {
655
+ "n": 8,
656
+ "accuracy": 1.0,
657
+ "brier": 0.0013,
658
+ "nll": 0.0225,
659
+ "ece": 0.0219
660
+ },
661
+ "workflow/jev_bench_tr_en/fever_evidence": {
662
+ "n": 13,
663
+ "accuracy": 1.0,
664
+ "brier": 0.0135,
665
+ "nll": 0.047,
666
+ "ece": 0.043
667
+ },
668
+ "workflow/jev_bench_tr_en/go_emotions": {
669
+ "n": 16,
670
+ "accuracy": 0.5,
671
+ "brier": 0.3503,
672
+ "nll": 2.451,
673
+ "ece": 0.2825
674
+ },
675
+ "workflow/jev_bench_tr_en/helpsteer2_helpfulness": {
676
+ "n": 12,
677
+ "accuracy": 0.5,
678
+ "brier": 0.5452,
679
+ "nll": 1.0448,
680
+ "ece": 0.217
681
+ },
682
+ "workflow/jev_bench_tr_en/helpsteer2_verbosity": {
683
+ "n": 12,
684
+ "accuracy": 0.9167,
685
+ "brier": 0.2796,
686
+ "nll": 0.5754,
687
+ "ece": 0.3113
688
+ },
689
+ "workflow/jev_bench_tr_en/ledgar": {
690
+ "n": 12,
691
+ "accuracy": 0.75,
692
+ "brier": 0.5091,
693
+ "nll": 1.0791,
694
+ "ece": 0.3892
695
+ },
696
+ "workflow/jev_bench_tr_en/massive": {
697
+ "n": 12,
698
+ "accuracy": 0.8333,
699
+ "brier": 0.2544,
700
+ "nll": 0.6022,
701
+ "ece": 0.1641
702
+ },
703
+ "workflow/jev_bench_tr_en/measuring_hate_speech": {
704
+ "n": 12,
705
+ "accuracy": 0.6667,
706
+ "brier": 0.3492,
707
+ "nll": 0.774,
708
+ "ece": 0.2877
709
+ },
710
+ "workflow/jev_bench_tr_en/mmlu": {
711
+ "n": 13,
712
+ "accuracy": 0.6923,
713
+ "brier": 0.3751,
714
+ "nll": 0.6949,
715
+ "ece": 0.2002
716
+ },
717
+ "workflow/jev_bench_tr_en/mnli": {
718
+ "n": 12,
719
+ "accuracy": 0.8333,
720
+ "brier": 0.1955,
721
+ "nll": 0.3119,
722
+ "ece": 0.2192
723
+ },
724
+ "workflow/jev_bench_tr_en/paws": {
725
+ "n": 5,
726
+ "accuracy": 1.0,
727
+ "brier": 0.0029,
728
+ "nll": 0.0349,
729
+ "ece": 0.0342
730
+ },
731
+ "workflow/jev_bench_tr_en/sms_spam": {
732
+ "n": 16,
733
+ "accuracy": 1.0,
734
+ "brier": 0.0062,
735
+ "nll": 0.0192,
736
+ "ece": 0.0173
737
+ },
738
+ "workflow/jev_bench_tr_en/sst5": {
739
+ "n": 10,
740
+ "accuracy": 0.7,
741
+ "brier": 0.5048,
742
+ "nll": 0.8854,
743
+ "ece": 0.1895
744
+ },
745
+ "workflow/jev_bench_tr_en/strategyqa_closed": {
746
+ "n": 11,
747
+ "accuracy": 0.7273,
748
+ "brier": 0.3491,
749
+ "nll": 0.503,
750
+ "ece": 0.291
751
+ },
752
+ "workflow/jev_bench_tr_en/strategyqa_grounded": {
753
+ "n": 7,
754
+ "accuracy": 0.7143,
755
+ "brier": 0.3853,
756
+ "nll": 0.5264,
757
+ "ece": 0.2675
758
+ },
759
+ "workflow/jev_bench_tr_en/stsb": {
760
+ "n": 15,
761
+ "accuracy": 0.4667,
762
+ "brier": 0.5584,
763
+ "nll": 1.0288,
764
+ "ece": 0.2153
765
+ },
766
+ "workflow/jev_bench_tr_en/yelp5": {
767
+ "n": 20,
768
+ "accuracy": 0.7,
769
+ "brier": 0.4468,
770
+ "nll": 0.8608,
771
+ "ece": 0.2496
772
+ },
773
+ "workflow/massive_tr": {
774
+ "n": 416,
775
+ "accuracy": 0.8894,
776
+ "brier": 0.158,
777
+ "nll": 0.3759,
778
+ "ece": 0.0261
779
+ },
780
+ "workflow/squad_tr": {
781
+ "n": 1454,
782
+ "accuracy": 0.8583,
783
+ "brier": 0.2133,
784
+ "nll": 0.3509,
785
+ "ece": 0.0283
786
+ },
787
+ "workflow/xnli_tr": {
788
+ "n": 632,
789
+ "accuracy": 0.8259,
790
+ "brier": 0.2537,
791
+ "nll": 0.4652,
792
+ "ece": 0.0423
793
+ },
794
+ "squad_tr/answerability": {
795
+ "auroc": 0.9316,
796
+ "acc_answerable": 0.9371,
797
+ "acc_unanswerable": 0.7759
798
+ }
799
+ }
800
+ }
training/eval_10k_fp8.json ADDED
@@ -0,0 +1,800 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model": "decider-4b-v2.1-tr-lora",
3
+ "path": "/workspace/laya/decider_run/model",
4
+ "revision": "eb5fbdfc9448473ec25e399882912863afbdb70e",
5
+ "fp8_layers": 200,
6
+ "limit": 10000,
7
+ "skipped": {},
8
+ "seconds": 447,
9
+ "report": {
10
+ "all": {
11
+ "n": 13371,
12
+ "accuracy": 0.7965,
13
+ "brier": 0.2645,
14
+ "nll": 0.5237,
15
+ "ece": 0.0209
16
+ },
17
+ "source/bev_tr": {
18
+ "n": 6122,
19
+ "accuracy": 0.8381,
20
+ "brier": 0.2217,
21
+ "nll": 0.3972,
22
+ "ece": 0.0112
23
+ },
24
+ "source/bev_tr/choice": {
25
+ "n": 2464,
26
+ "accuracy": 0.8377,
27
+ "brier": 0.2183,
28
+ "nll": 0.4011,
29
+ "ece": 0.0154
30
+ },
31
+ "source/bev_tr/noul": {
32
+ "n": 2357,
33
+ "accuracy": 0.9079,
34
+ "brier": 0.137,
35
+ "nll": 0.224,
36
+ "ece": 0.0138
37
+ },
38
+ "source/bev_tr/score": {
39
+ "n": 1301,
40
+ "accuracy": 0.7125,
41
+ "brier": 0.3817,
42
+ "nll": 0.7037,
43
+ "ece": 0.0274
44
+ },
45
+ "source/bev_tr_en": {
46
+ "n": 852,
47
+ "accuracy": 0.7782,
48
+ "brier": 0.2807,
49
+ "nll": 0.497,
50
+ "ece": 0.0288
51
+ },
52
+ "source/bev_tr_en/choice": {
53
+ "n": 314,
54
+ "accuracy": 0.7516,
55
+ "brier": 0.3163,
56
+ "nll": 0.5854,
57
+ "ece": 0.0477
58
+ },
59
+ "source/bev_tr_en/noul": {
60
+ "n": 364,
61
+ "accuracy": 0.9011,
62
+ "brier": 0.1307,
63
+ "nll": 0.2156,
64
+ "ece": 0.0277
65
+ },
66
+ "source/bev_tr_en/score": {
67
+ "n": 174,
68
+ "accuracy": 0.569,
69
+ "brier": 0.5301,
70
+ "nll": 0.926,
71
+ "ece": 0.0572
72
+ },
73
+ "source/beyazperde_tr": {
74
+ "n": 631,
75
+ "accuracy": 0.6403,
76
+ "brier": 0.4695,
77
+ "nll": 0.8628,
78
+ "ece": 0.0631
79
+ },
80
+ "source/beyazperde_tr/score": {
81
+ "n": 631,
82
+ "accuracy": 0.6403,
83
+ "brier": 0.4695,
84
+ "nll": 0.8628,
85
+ "ece": 0.0631
86
+ },
87
+ "source/jev_bench_tr": {
88
+ "n": 2986,
89
+ "accuracy": 0.7036,
90
+ "brier": 0.3436,
91
+ "nll": 0.8157,
92
+ "ece": 0.0604
93
+ },
94
+ "source/jev_bench_tr/choice": {
95
+ "n": 1256,
96
+ "accuracy": 0.7253,
97
+ "brier": 0.2852,
98
+ "nll": 0.92,
99
+ "ece": 0.0718
100
+ },
101
+ "source/jev_bench_tr/noul": {
102
+ "n": 959,
103
+ "accuracy": 0.8123,
104
+ "brier": 0.2444,
105
+ "nll": 0.4304,
106
+ "ece": 0.0594
107
+ },
108
+ "source/jev_bench_tr/score": {
109
+ "n": 771,
110
+ "accuracy": 0.5331,
111
+ "brier": 0.5622,
112
+ "nll": 1.1249,
113
+ "ece": 0.07
114
+ },
115
+ "source/jev_bench_tr_en": {
116
+ "n": 278,
117
+ "accuracy": 0.7662,
118
+ "brier": 0.2867,
119
+ "nll": 0.7303,
120
+ "ece": 0.0868
121
+ },
122
+ "source/jev_bench_tr_en/choice": {
123
+ "n": 115,
124
+ "accuracy": 0.7652,
125
+ "brier": 0.2899,
126
+ "nll": 0.9846,
127
+ "ece": 0.0964
128
+ },
129
+ "source/jev_bench_tr_en/noul": {
130
+ "n": 82,
131
+ "accuracy": 0.878,
132
+ "brier": 0.1229,
133
+ "nll": 0.2394,
134
+ "ece": 0.1037
135
+ },
136
+ "source/jev_bench_tr_en/score": {
137
+ "n": 81,
138
+ "accuracy": 0.6543,
139
+ "brier": 0.4479,
140
+ "nll": 0.8662,
141
+ "ece": 0.2199
142
+ },
143
+ "source/massive_tr": {
144
+ "n": 416,
145
+ "accuracy": 0.8918,
146
+ "brier": 0.1612,
147
+ "nll": 0.3838,
148
+ "ece": 0.0236
149
+ },
150
+ "source/massive_tr/choice": {
151
+ "n": 416,
152
+ "accuracy": 0.8918,
153
+ "brier": 0.1612,
154
+ "nll": 0.3838,
155
+ "ece": 0.0236
156
+ },
157
+ "source/squad_tr": {
158
+ "n": 1454,
159
+ "accuracy": 0.8569,
160
+ "brier": 0.2134,
161
+ "nll": 0.351,
162
+ "ece": 0.0252
163
+ },
164
+ "source/squad_tr/noul": {
165
+ "n": 1454,
166
+ "accuracy": 0.8569,
167
+ "brier": 0.2134,
168
+ "nll": 0.351,
169
+ "ece": 0.0252
170
+ },
171
+ "source/xnli_tr": {
172
+ "n": 632,
173
+ "accuracy": 0.8244,
174
+ "brier": 0.2548,
175
+ "nll": 0.4658,
176
+ "ece": 0.0368
177
+ },
178
+ "source/xnli_tr/choice": {
179
+ "n": 632,
180
+ "accuracy": 0.8244,
181
+ "brier": 0.2548,
182
+ "nll": 0.4658,
183
+ "ece": 0.0368
184
+ },
185
+ "type/choice": {
186
+ "n": 5197,
187
+ "accuracy": 0.8064,
188
+ "brier": 0.2418,
189
+ "nll": 0.5571,
190
+ "ece": 0.0287
191
+ },
192
+ "type/noul": {
193
+ "n": 5216,
194
+ "accuracy": 0.8752,
195
+ "brier": 0.1774,
196
+ "nll": 0.297,
197
+ "ece": 0.0203
198
+ },
199
+ "type/score": {
200
+ "n": 2958,
201
+ "accuracy": 0.6403,
202
+ "brier": 0.458,
203
+ "nll": 0.865,
204
+ "ece": 0.0274
205
+ },
206
+ "workflow/bev_tr/Browser interaction": {
207
+ "n": 34,
208
+ "accuracy": 0.9412,
209
+ "brier": 0.1026,
210
+ "nll": 0.1858,
211
+ "ece": 0.0924
212
+ },
213
+ "workflow/bev_tr/Civic and safety operations": {
214
+ "n": 27,
215
+ "accuracy": 0.7037,
216
+ "brier": 0.3878,
217
+ "nll": 0.8065,
218
+ "ece": 0.172
219
+ },
220
+ "workflow/bev_tr/Contract evidence": {
221
+ "n": 29,
222
+ "accuracy": 0.8621,
223
+ "brier": 0.2234,
224
+ "nll": 0.4335,
225
+ "ece": 0.124
226
+ },
227
+ "workflow/bev_tr/Engagement and ranking": {
228
+ "n": 12,
229
+ "accuracy": 0.6667,
230
+ "brier": 0.518,
231
+ "nll": 0.7589,
232
+ "ece": 0.2632
233
+ },
234
+ "workflow/bev_tr/Financial reporting and banking": {
235
+ "n": 210,
236
+ "accuracy": 0.8333,
237
+ "brier": 0.2259,
238
+ "nll": 0.4079,
239
+ "ece": 0.0469
240
+ },
241
+ "workflow/bev_tr/Game-state decisions": {
242
+ "n": 282,
243
+ "accuracy": 0.8723,
244
+ "brier": 0.1467,
245
+ "nll": 0.223,
246
+ "ece": 0.0224
247
+ },
248
+ "workflow/bev_tr/Reading comprehension": {
249
+ "n": 200,
250
+ "accuracy": 0.925,
251
+ "brier": 0.1247,
252
+ "nll": 0.2108,
253
+ "ece": 0.0447
254
+ },
255
+ "workflow/bev_tr/Response preference and quality": {
256
+ "n": 387,
257
+ "accuracy": 0.6796,
258
+ "brier": 0.4472,
259
+ "nll": 0.8357,
260
+ "ece": 0.0669
261
+ },
262
+ "workflow/bev_tr/Retail, product, and shopping": {
263
+ "n": 855,
264
+ "accuracy": 0.931,
265
+ "brier": 0.1026,
266
+ "nll": 0.1808,
267
+ "ece": 0.0226
268
+ },
269
+ "workflow/bev_tr/Scientific and paper understanding": {
270
+ "n": 71,
271
+ "accuracy": 0.7887,
272
+ "brier": 0.2876,
273
+ "nll": 0.455,
274
+ "ece": 0.0831
275
+ },
276
+ "workflow/bev_tr/Sensory quality rating": {
277
+ "n": 41,
278
+ "accuracy": 0.2683,
279
+ "brier": 0.7343,
280
+ "nll": 1.3888,
281
+ "ece": 0.1425
282
+ },
283
+ "workflow/bev_tr/Sentiment, emotion, and moderation": {
284
+ "n": 1534,
285
+ "accuracy": 0.8703,
286
+ "brier": 0.1896,
287
+ "nll": 0.3393,
288
+ "ece": 0.0255
289
+ },
290
+ "workflow/bev_tr/Software engineering and code": {
291
+ "n": 252,
292
+ "accuracy": 0.7183,
293
+ "brier": 0.3628,
294
+ "nll": 0.67,
295
+ "ece": 0.0516
296
+ },
297
+ "workflow/bev_tr/Software security": {
298
+ "n": 330,
299
+ "accuracy": 0.6788,
300
+ "brier": 0.4166,
301
+ "nll": 0.7101,
302
+ "ece": 0.07
303
+ },
304
+ "workflow/bev_tr/Spam detection": {
305
+ "n": 37,
306
+ "accuracy": 1.0,
307
+ "brier": 0.0072,
308
+ "nll": 0.0209,
309
+ "ece": 0.0186
310
+ },
311
+ "workflow/bev_tr/Spatial and logical reasoning": {
312
+ "n": 1122,
313
+ "accuracy": 0.7585,
314
+ "brier": 0.324,
315
+ "nll": 0.5778,
316
+ "ece": 0.0316
317
+ },
318
+ "workflow/bev_tr/Support and intent routing": {
319
+ "n": 422,
320
+ "accuracy": 0.9787,
321
+ "brier": 0.0402,
322
+ "nll": 0.0863,
323
+ "ece": 0.0143
324
+ },
325
+ "workflow/bev_tr/Tool and workflow decisions": {
326
+ "n": 277,
327
+ "accuracy": 0.9892,
328
+ "brier": 0.0185,
329
+ "nll": 0.0543,
330
+ "ece": 0.0093
331
+ },
332
+ "workflow/bev_tr_en/Browser interaction": {
333
+ "n": 7,
334
+ "accuracy": 0.5714,
335
+ "brier": 0.3066,
336
+ "nll": 0.488,
337
+ "ece": 0.3347
338
+ },
339
+ "workflow/bev_tr_en/Civic and safety operations": {
340
+ "n": 3,
341
+ "accuracy": 0.3333,
342
+ "brier": 0.8266,
343
+ "nll": 1.109,
344
+ "ece": 0.4267
345
+ },
346
+ "workflow/bev_tr_en/Contract evidence": {
347
+ "n": 5,
348
+ "accuracy": 1.0,
349
+ "brier": 0.1152,
350
+ "nll": 0.2835,
351
+ "ece": 0.2417
352
+ },
353
+ "workflow/bev_tr_en/Engagement and ranking": {
354
+ "n": 1,
355
+ "accuracy": 0.0,
356
+ "brier": 0.6791,
357
+ "nll": 0.8739,
358
+ "ece": 0.5827
359
+ },
360
+ "workflow/bev_tr_en/Financial reporting and banking": {
361
+ "n": 24,
362
+ "accuracy": 0.75,
363
+ "brier": 0.369,
364
+ "nll": 0.683,
365
+ "ece": 0.1622
366
+ },
367
+ "workflow/bev_tr_en/Game-state decisions": {
368
+ "n": 45,
369
+ "accuracy": 0.9778,
370
+ "brier": 0.1366,
371
+ "nll": 0.2622,
372
+ "ece": 0.1834
373
+ },
374
+ "workflow/bev_tr_en/Reading comprehension": {
375
+ "n": 27,
376
+ "accuracy": 0.8889,
377
+ "brier": 0.2251,
378
+ "nll": 0.3871,
379
+ "ece": 0.1329
380
+ },
381
+ "workflow/bev_tr_en/Response preference and quality": {
382
+ "n": 34,
383
+ "accuracy": 0.5882,
384
+ "brier": 0.5046,
385
+ "nll": 0.8538,
386
+ "ece": 0.157
387
+ },
388
+ "workflow/bev_tr_en/Retail, product, and shopping": {
389
+ "n": 129,
390
+ "accuracy": 0.6977,
391
+ "brier": 0.3318,
392
+ "nll": 0.5527,
393
+ "ece": 0.102
394
+ },
395
+ "workflow/bev_tr_en/Scientific and paper understanding": {
396
+ "n": 7,
397
+ "accuracy": 0.4286,
398
+ "brier": 0.5201,
399
+ "nll": 0.9032,
400
+ "ece": 0.397
401
+ },
402
+ "workflow/bev_tr_en/Sensory quality rating": {
403
+ "n": 7,
404
+ "accuracy": 0.0,
405
+ "brier": 0.8088,
406
+ "nll": 1.6132,
407
+ "ece": 0.315
408
+ },
409
+ "workflow/bev_tr_en/Sentiment, emotion, and moderation": {
410
+ "n": 262,
411
+ "accuracy": 0.8893,
412
+ "brier": 0.1699,
413
+ "nll": 0.3039,
414
+ "ece": 0.0548
415
+ },
416
+ "workflow/bev_tr_en/Software engineering and code": {
417
+ "n": 34,
418
+ "accuracy": 0.6471,
419
+ "brier": 0.4888,
420
+ "nll": 0.947,
421
+ "ece": 0.1651
422
+ },
423
+ "workflow/bev_tr_en/Software security": {
424
+ "n": 34,
425
+ "accuracy": 0.5294,
426
+ "brier": 0.5471,
427
+ "nll": 0.8623,
428
+ "ece": 0.145
429
+ },
430
+ "workflow/bev_tr_en/Spam detection": {
431
+ "n": 4,
432
+ "accuracy": 1.0,
433
+ "brier": 0.0003,
434
+ "nll": 0.0097,
435
+ "ece": 0.0096
436
+ },
437
+ "workflow/bev_tr_en/Spatial and logical reasoning": {
438
+ "n": 148,
439
+ "accuracy": 0.6486,
440
+ "brier": 0.4134,
441
+ "nll": 0.7604,
442
+ "ece": 0.0696
443
+ },
444
+ "workflow/bev_tr_en/Support and intent routing": {
445
+ "n": 34,
446
+ "accuracy": 1.0,
447
+ "brier": 0.0574,
448
+ "nll": 0.1111,
449
+ "ece": 0.0812
450
+ },
451
+ "workflow/bev_tr_en/Tool and workflow decisions": {
452
+ "n": 47,
453
+ "accuracy": 1.0,
454
+ "brier": 0.0013,
455
+ "nll": 0.0064,
456
+ "ece": 0.006
457
+ },
458
+ "workflow/beyazperde_tr": {
459
+ "n": 631,
460
+ "accuracy": 0.6403,
461
+ "brier": 0.4695,
462
+ "nll": 0.8628,
463
+ "ece": 0.0631
464
+ },
465
+ "workflow/jev_bench_tr/arc_challenge": {
466
+ "n": 120,
467
+ "accuracy": 0.8167,
468
+ "brier": 0.2349,
469
+ "nll": 0.4166,
470
+ "ece": 0.0771
471
+ },
472
+ "workflow/jev_bench_tr/banking77": {
473
+ "n": 141,
474
+ "accuracy": 0.7801,
475
+ "brier": 0.2819,
476
+ "nll": 0.6119,
477
+ "ece": 0.107
478
+ },
479
+ "workflow/jev_bench_tr/boolq": {
480
+ "n": 133,
481
+ "accuracy": 0.8421,
482
+ "brier": 0.2069,
483
+ "nll": 0.3392,
484
+ "ece": 0.0428
485
+ },
486
+ "workflow/jev_bench_tr/chaosnli": {
487
+ "n": 204,
488
+ "accuracy": 0.5784,
489
+ "brier": 0.211,
490
+ "nll": 1.1579,
491
+ "ece": 0.1836
492
+ },
493
+ "workflow/jev_bench_tr/civil_comments": {
494
+ "n": 267,
495
+ "accuracy": 0.8539,
496
+ "brier": 0.1416,
497
+ "nll": 0.3936,
498
+ "ece": 0.0561
499
+ },
500
+ "workflow/jev_bench_tr/clinc150": {
501
+ "n": 129,
502
+ "accuracy": 0.8527,
503
+ "brier": 0.2251,
504
+ "nll": 0.8504,
505
+ "ece": 0.0754
506
+ },
507
+ "workflow/jev_bench_tr/fever_evidence": {
508
+ "n": 139,
509
+ "accuracy": 0.8633,
510
+ "brier": 0.2089,
511
+ "nll": 0.327,
512
+ "ece": 0.0611
513
+ },
514
+ "workflow/jev_bench_tr/go_emotions": {
515
+ "n": 119,
516
+ "accuracy": 0.5042,
517
+ "brier": 0.3195,
518
+ "nll": 2.3638,
519
+ "ece": 0.1197
520
+ },
521
+ "workflow/jev_bench_tr/helpsteer2_helpfulness": {
522
+ "n": 120,
523
+ "accuracy": 0.35,
524
+ "brier": 0.7576,
525
+ "nll": 1.4431,
526
+ "ece": 0.1645
527
+ },
528
+ "workflow/jev_bench_tr/helpsteer2_verbosity": {
529
+ "n": 136,
530
+ "accuracy": 0.6471,
531
+ "brier": 0.5413,
532
+ "nll": 0.9607,
533
+ "ece": 0.1735
534
+ },
535
+ "workflow/jev_bench_tr/ledgar": {
536
+ "n": 130,
537
+ "accuracy": 0.7,
538
+ "brier": 0.4511,
539
+ "nll": 1.2061,
540
+ "ece": 0.1448
541
+ },
542
+ "workflow/jev_bench_tr/massive": {
543
+ "n": 144,
544
+ "accuracy": 0.8889,
545
+ "brier": 0.1447,
546
+ "nll": 0.3666,
547
+ "ece": 0.0648
548
+ },
549
+ "workflow/jev_bench_tr/measuring_hate_speech": {
550
+ "n": 142,
551
+ "accuracy": 0.5634,
552
+ "brier": 0.3286,
553
+ "nll": 1.0651,
554
+ "ece": 0.1415
555
+ },
556
+ "workflow/jev_bench_tr/mmlu": {
557
+ "n": 124,
558
+ "accuracy": 0.6129,
559
+ "brier": 0.5136,
560
+ "nll": 0.9445,
561
+ "ece": 0.0948
562
+ },
563
+ "workflow/jev_bench_tr/mnli": {
564
+ "n": 145,
565
+ "accuracy": 0.8276,
566
+ "brier": 0.2553,
567
+ "nll": 0.4509,
568
+ "ece": 0.072
569
+ },
570
+ "workflow/jev_bench_tr/paws": {
571
+ "n": 138,
572
+ "accuracy": 0.6957,
573
+ "brier": 0.4684,
574
+ "nll": 0.7684,
575
+ "ece": 0.1833
576
+ },
577
+ "workflow/jev_bench_tr/sms_spam": {
578
+ "n": 109,
579
+ "accuracy": 0.9908,
580
+ "brier": 0.0135,
581
+ "nll": 0.0296,
582
+ "ece": 0.0243
583
+ },
584
+ "workflow/jev_bench_tr/sst5": {
585
+ "n": 129,
586
+ "accuracy": 0.4341,
587
+ "brier": 0.663,
588
+ "nll": 1.2004,
589
+ "ece": 0.1378
590
+ },
591
+ "workflow/jev_bench_tr/strategyqa_closed": {
592
+ "n": 96,
593
+ "accuracy": 0.5938,
594
+ "brier": 0.521,
595
+ "nll": 0.74,
596
+ "ece": 0.1296
597
+ },
598
+ "workflow/jev_bench_tr/strategyqa_grounded": {
599
+ "n": 77,
600
+ "accuracy": 0.7532,
601
+ "brier": 0.3097,
602
+ "nll": 0.4777,
603
+ "ece": 0.087
604
+ },
605
+ "workflow/jev_bench_tr/stsb": {
606
+ "n": 120,
607
+ "accuracy": 0.4917,
608
+ "brier": 0.6578,
609
+ "nll": 1.2984,
610
+ "ece": 0.1597
611
+ },
612
+ "workflow/jev_bench_tr/yelp5": {
613
+ "n": 124,
614
+ "accuracy": 0.6935,
615
+ "brier": 0.4662,
616
+ "nll": 0.8194,
617
+ "ece": 0.1309
618
+ },
619
+ "workflow/jev_bench_tr_en/arc_challenge": {
620
+ "n": 7,
621
+ "accuracy": 0.8571,
622
+ "brier": 0.1993,
623
+ "nll": 0.31,
624
+ "ece": 0.1203
625
+ },
626
+ "workflow/jev_bench_tr_en/banking77": {
627
+ "n": 16,
628
+ "accuracy": 0.75,
629
+ "brier": 0.3822,
630
+ "nll": 1.1184,
631
+ "ece": 0.2174
632
+ },
633
+ "workflow/jev_bench_tr_en/boolq": {
634
+ "n": 9,
635
+ "accuracy": 1.0,
636
+ "brier": 0.0049,
637
+ "nll": 0.0392,
638
+ "ece": 0.0379
639
+ },
640
+ "workflow/jev_bench_tr_en/chaosnli": {
641
+ "n": 19,
642
+ "accuracy": 0.7895,
643
+ "brier": 0.2056,
644
+ "nll": 1.0926,
645
+ "ece": 0.2334
646
+ },
647
+ "workflow/jev_bench_tr_en/civil_comments": {
648
+ "n": 21,
649
+ "accuracy": 0.8095,
650
+ "brier": 0.1395,
651
+ "nll": 0.412,
652
+ "ece": 0.1507
653
+ },
654
+ "workflow/jev_bench_tr_en/clinc150": {
655
+ "n": 8,
656
+ "accuracy": 1.0,
657
+ "brier": 0.0016,
658
+ "nll": 0.0232,
659
+ "ece": 0.0226
660
+ },
661
+ "workflow/jev_bench_tr_en/fever_evidence": {
662
+ "n": 13,
663
+ "accuracy": 1.0,
664
+ "brier": 0.0117,
665
+ "nll": 0.0447,
666
+ "ece": 0.0413
667
+ },
668
+ "workflow/jev_bench_tr_en/go_emotions": {
669
+ "n": 16,
670
+ "accuracy": 0.5,
671
+ "brier": 0.3472,
672
+ "nll": 2.4423,
673
+ "ece": 0.2566
674
+ },
675
+ "workflow/jev_bench_tr_en/helpsteer2_helpfulness": {
676
+ "n": 12,
677
+ "accuracy": 0.5833,
678
+ "brier": 0.5415,
679
+ "nll": 1.0402,
680
+ "ece": 0.3284
681
+ },
682
+ "workflow/jev_bench_tr_en/helpsteer2_verbosity": {
683
+ "n": 12,
684
+ "accuracy": 0.9167,
685
+ "brier": 0.2716,
686
+ "nll": 0.561,
687
+ "ece": 0.367
688
+ },
689
+ "workflow/jev_bench_tr_en/ledgar": {
690
+ "n": 12,
691
+ "accuracy": 0.75,
692
+ "brier": 0.5033,
693
+ "nll": 1.0739,
694
+ "ece": 0.3251
695
+ },
696
+ "workflow/jev_bench_tr_en/massive": {
697
+ "n": 12,
698
+ "accuracy": 0.9167,
699
+ "brier": 0.2471,
700
+ "nll": 0.5981,
701
+ "ece": 0.1823
702
+ },
703
+ "workflow/jev_bench_tr_en/measuring_hate_speech": {
704
+ "n": 12,
705
+ "accuracy": 0.6667,
706
+ "brier": 0.3689,
707
+ "nll": 0.8192,
708
+ "ece": 0.2886
709
+ },
710
+ "workflow/jev_bench_tr_en/mmlu": {
711
+ "n": 13,
712
+ "accuracy": 0.6923,
713
+ "brier": 0.39,
714
+ "nll": 0.7223,
715
+ "ece": 0.236
716
+ },
717
+ "workflow/jev_bench_tr_en/mnli": {
718
+ "n": 12,
719
+ "accuracy": 0.8333,
720
+ "brier": 0.1896,
721
+ "nll": 0.3074,
722
+ "ece": 0.1535
723
+ },
724
+ "workflow/jev_bench_tr_en/paws": {
725
+ "n": 5,
726
+ "accuracy": 1.0,
727
+ "brier": 0.0029,
728
+ "nll": 0.0341,
729
+ "ece": 0.0334
730
+ },
731
+ "workflow/jev_bench_tr_en/sms_spam": {
732
+ "n": 16,
733
+ "accuracy": 1.0,
734
+ "brier": 0.0109,
735
+ "nll": 0.0256,
736
+ "ece": 0.0222
737
+ },
738
+ "workflow/jev_bench_tr_en/sst5": {
739
+ "n": 10,
740
+ "accuracy": 0.7,
741
+ "brier": 0.5016,
742
+ "nll": 0.8804,
743
+ "ece": 0.2318
744
+ },
745
+ "workflow/jev_bench_tr_en/strategyqa_closed": {
746
+ "n": 11,
747
+ "accuracy": 0.6364,
748
+ "brier": 0.3726,
749
+ "nll": 0.5286,
750
+ "ece": 0.3522
751
+ },
752
+ "workflow/jev_bench_tr_en/strategyqa_grounded": {
753
+ "n": 7,
754
+ "accuracy": 0.7143,
755
+ "brier": 0.3812,
756
+ "nll": 0.522,
757
+ "ece": 0.2653
758
+ },
759
+ "workflow/jev_bench_tr_en/stsb": {
760
+ "n": 15,
761
+ "accuracy": 0.4,
762
+ "brier": 0.5529,
763
+ "nll": 1.0189,
764
+ "ece": 0.2745
765
+ },
766
+ "workflow/jev_bench_tr_en/yelp5": {
767
+ "n": 20,
768
+ "accuracy": 0.7,
769
+ "brier": 0.4393,
770
+ "nll": 0.8514,
771
+ "ece": 0.2851
772
+ },
773
+ "workflow/massive_tr": {
774
+ "n": 416,
775
+ "accuracy": 0.8918,
776
+ "brier": 0.1612,
777
+ "nll": 0.3838,
778
+ "ece": 0.0236
779
+ },
780
+ "workflow/squad_tr": {
781
+ "n": 1454,
782
+ "accuracy": 0.8569,
783
+ "brier": 0.2134,
784
+ "nll": 0.351,
785
+ "ece": 0.0252
786
+ },
787
+ "workflow/xnli_tr": {
788
+ "n": 632,
789
+ "accuracy": 0.8244,
790
+ "brier": 0.2548,
791
+ "nll": 0.4658,
792
+ "ece": 0.0368
793
+ },
794
+ "squad_tr/answerability": {
795
+ "auroc": 0.9318,
796
+ "acc_answerable": 0.9357,
797
+ "acc_unanswerable": 0.7732
798
+ }
799
+ }
800
+ }
training/eval_report.json ADDED
@@ -0,0 +1,801 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model": "decider-4b-v2.1-tr-lora",
3
+ "path": "/workspace/laya/decider_run/model",
4
+ "revision": "eb5fbdfc9448473ec25e399882912863afbdb70e",
5
+ "fp8_layers": 0,
6
+ "limit": 0,
7
+ "skipped": {},
8
+ "seconds": 3595,
9
+ "report": {
10
+ "all": {
11
+ "n": 101716,
12
+ "accuracy": 0.7962,
13
+ "brier": 0.2653,
14
+ "nll": 0.53,
15
+ "ece": 0.0203
16
+ },
17
+ "source/bev_tr": {
18
+ "n": 46320,
19
+ "accuracy": 0.8382,
20
+ "brier": 0.2215,
21
+ "nll": 0.3964,
22
+ "ece": 0.0092
23
+ },
24
+ "source/bev_tr/choice": {
25
+ "n": 18808,
26
+ "accuracy": 0.8465,
27
+ "brier": 0.214,
28
+ "nll": 0.3982,
29
+ "ece": 0.009
30
+ },
31
+ "source/bev_tr/noul": {
32
+ "n": 17572,
33
+ "accuracy": 0.9029,
34
+ "brier": 0.1396,
35
+ "nll": 0.2281,
36
+ "ece": 0.0099
37
+ },
38
+ "source/bev_tr/score": {
39
+ "n": 9940,
40
+ "accuracy": 0.708,
41
+ "brier": 0.3805,
42
+ "nll": 0.6904,
43
+ "ece": 0.018
44
+ },
45
+ "source/bev_tr_en": {
46
+ "n": 5766,
47
+ "accuracy": 0.7542,
48
+ "brier": 0.3138,
49
+ "nll": 0.5674,
50
+ "ece": 0.0126
51
+ },
52
+ "source/bev_tr_en/choice": {
53
+ "n": 2386,
54
+ "accuracy": 0.7812,
55
+ "brier": 0.3036,
56
+ "nll": 0.5762,
57
+ "ece": 0.0289
58
+ },
59
+ "source/bev_tr_en/noul": {
60
+ "n": 2117,
61
+ "accuracy": 0.8734,
62
+ "brier": 0.1665,
63
+ "nll": 0.2696,
64
+ "ece": 0.0262
65
+ },
66
+ "source/bev_tr_en/score": {
67
+ "n": 1263,
68
+ "accuracy": 0.5036,
69
+ "brier": 0.5799,
70
+ "nll": 1.0501,
71
+ "ece": 0.0373
72
+ },
73
+ "source/beyazperde_tr": {
74
+ "n": 5000,
75
+ "accuracy": 0.6336,
76
+ "brier": 0.4769,
77
+ "nll": 0.8667,
78
+ "ece": 0.0402
79
+ },
80
+ "source/beyazperde_tr/score": {
81
+ "n": 5000,
82
+ "accuracy": 0.6336,
83
+ "brier": 0.4769,
84
+ "nll": 0.8667,
85
+ "ece": 0.0402
86
+ },
87
+ "source/jev_bench_tr": {
88
+ "n": 22773,
89
+ "accuracy": 0.7078,
90
+ "brier": 0.3407,
91
+ "nll": 0.821,
92
+ "ece": 0.051
93
+ },
94
+ "source/jev_bench_tr/choice": {
95
+ "n": 9599,
96
+ "accuracy": 0.7316,
97
+ "brier": 0.2873,
98
+ "nll": 0.9497,
99
+ "ece": 0.0593
100
+ },
101
+ "source/jev_bench_tr/noul": {
102
+ "n": 7174,
103
+ "accuracy": 0.8246,
104
+ "brier": 0.2226,
105
+ "nll": 0.4021,
106
+ "ece": 0.0458
107
+ },
108
+ "source/jev_bench_tr/score": {
109
+ "n": 6000,
110
+ "accuracy": 0.5298,
111
+ "brier": 0.5675,
112
+ "nll": 1.1159,
113
+ "ece": 0.0453
114
+ },
115
+ "source/jev_bench_tr_en": {
116
+ "n": 2000,
117
+ "accuracy": 0.7705,
118
+ "brier": 0.2689,
119
+ "nll": 0.6936,
120
+ "ece": 0.0351
121
+ },
122
+ "source/jev_bench_tr_en/choice": {
123
+ "n": 839,
124
+ "accuracy": 0.7926,
125
+ "brier": 0.2156,
126
+ "nll": 0.8206,
127
+ "ece": 0.0399
128
+ },
129
+ "source/jev_bench_tr_en/noul": {
130
+ "n": 635,
131
+ "accuracy": 0.8945,
132
+ "brier": 0.1434,
133
+ "nll": 0.2821,
134
+ "ece": 0.0208
135
+ },
136
+ "source/jev_bench_tr_en/score": {
137
+ "n": 526,
138
+ "accuracy": 0.5856,
139
+ "brier": 0.5053,
140
+ "nll": 0.988,
141
+ "ece": 0.0867
142
+ },
143
+ "source/massive_tr": {
144
+ "n": 2974,
145
+ "accuracy": 0.8705,
146
+ "brier": 0.1941,
147
+ "nll": 0.5568,
148
+ "ece": 0.0362
149
+ },
150
+ "source/massive_tr/choice": {
151
+ "n": 2974,
152
+ "accuracy": 0.8705,
153
+ "brier": 0.1941,
154
+ "nll": 0.5568,
155
+ "ece": 0.0362
156
+ },
157
+ "source/squad_tr": {
158
+ "n": 11873,
159
+ "accuracy": 0.8619,
160
+ "brier": 0.2028,
161
+ "nll": 0.3322,
162
+ "ece": 0.0168
163
+ },
164
+ "source/squad_tr/noul": {
165
+ "n": 11873,
166
+ "accuracy": 0.8619,
167
+ "brier": 0.2028,
168
+ "nll": 0.3322,
169
+ "ece": 0.0168
170
+ },
171
+ "source/xnli_tr": {
172
+ "n": 5010,
173
+ "accuracy": 0.8315,
174
+ "brier": 0.2488,
175
+ "nll": 0.4509,
176
+ "ece": 0.0151
177
+ },
178
+ "source/xnli_tr/choice": {
179
+ "n": 5010,
180
+ "accuracy": 0.8315,
181
+ "brier": 0.2488,
182
+ "nll": 0.4509,
183
+ "ece": 0.0151
184
+ },
185
+ "type/choice": {
186
+ "n": 39616,
187
+ "accuracy": 0.8135,
188
+ "brier": 0.2401,
189
+ "nll": 0.5701,
190
+ "ece": 0.0214
191
+ },
192
+ "type/noul": {
193
+ "n": 39371,
194
+ "accuracy": 0.8746,
195
+ "brier": 0.1753,
196
+ "nll": 0.2943,
197
+ "ece": 0.0177
198
+ },
199
+ "type/score": {
200
+ "n": 22729,
201
+ "accuracy": 0.6304,
202
+ "brier": 0.465,
203
+ "nll": 0.8684,
204
+ "ece": 0.0235
205
+ },
206
+ "workflow/bev_tr/Browser interaction": {
207
+ "n": 286,
208
+ "accuracy": 0.8497,
209
+ "brier": 0.1897,
210
+ "nll": 0.3352,
211
+ "ece": 0.0394
212
+ },
213
+ "workflow/bev_tr/Civic and safety operations": {
214
+ "n": 261,
215
+ "accuracy": 0.7701,
216
+ "brier": 0.3154,
217
+ "nll": 0.6527,
218
+ "ece": 0.0616
219
+ },
220
+ "workflow/bev_tr/Contract evidence": {
221
+ "n": 320,
222
+ "accuracy": 0.8375,
223
+ "brier": 0.2302,
224
+ "nll": 0.4253,
225
+ "ece": 0.0491
226
+ },
227
+ "workflow/bev_tr/Engagement and ranking": {
228
+ "n": 82,
229
+ "accuracy": 0.6463,
230
+ "brier": 0.4851,
231
+ "nll": 0.6918,
232
+ "ece": 0.1104
233
+ },
234
+ "workflow/bev_tr/Financial reporting and banking": {
235
+ "n": 1740,
236
+ "accuracy": 0.8264,
237
+ "brier": 0.2371,
238
+ "nll": 0.4219,
239
+ "ece": 0.0215
240
+ },
241
+ "workflow/bev_tr/Game-state decisions": {
242
+ "n": 2039,
243
+ "accuracy": 0.8794,
244
+ "brier": 0.1475,
245
+ "nll": 0.2267,
246
+ "ece": 0.0145
247
+ },
248
+ "workflow/bev_tr/Reading comprehension": {
249
+ "n": 1422,
250
+ "accuracy": 0.8643,
251
+ "brier": 0.1945,
252
+ "nll": 0.3188,
253
+ "ece": 0.0163
254
+ },
255
+ "workflow/bev_tr/Response preference and quality": {
256
+ "n": 3176,
257
+ "accuracy": 0.6382,
258
+ "brier": 0.4731,
259
+ "nll": 0.8563,
260
+ "ece": 0.0269
261
+ },
262
+ "workflow/bev_tr/Retail, product, and shopping": {
263
+ "n": 6601,
264
+ "accuracy": 0.9365,
265
+ "brier": 0.0922,
266
+ "nll": 0.1653,
267
+ "ece": 0.0122
268
+ },
269
+ "workflow/bev_tr/Scientific and paper understanding": {
270
+ "n": 508,
271
+ "accuracy": 0.8346,
272
+ "brier": 0.248,
273
+ "nll": 0.4421,
274
+ "ece": 0.0278
275
+ },
276
+ "workflow/bev_tr/Sensory quality rating": {
277
+ "n": 260,
278
+ "accuracy": 0.4,
279
+ "brier": 0.6968,
280
+ "nll": 1.3241,
281
+ "ece": 0.0533
282
+ },
283
+ "workflow/bev_tr/Sentiment, emotion, and moderation": {
284
+ "n": 11526,
285
+ "accuracy": 0.8647,
286
+ "brier": 0.1892,
287
+ "nll": 0.3338,
288
+ "ece": 0.0152
289
+ },
290
+ "workflow/bev_tr/Software engineering and code": {
291
+ "n": 2039,
292
+ "accuracy": 0.7229,
293
+ "brier": 0.3732,
294
+ "nll": 0.7028,
295
+ "ece": 0.0368
296
+ },
297
+ "workflow/bev_tr/Software security": {
298
+ "n": 2240,
299
+ "accuracy": 0.6879,
300
+ "brier": 0.4086,
301
+ "nll": 0.7059,
302
+ "ece": 0.0458
303
+ },
304
+ "workflow/bev_tr/Spam detection": {
305
+ "n": 271,
306
+ "accuracy": 0.9779,
307
+ "brier": 0.0284,
308
+ "nll": 0.0569,
309
+ "ece": 0.0159
310
+ },
311
+ "workflow/bev_tr/Spatial and logical reasoning": {
312
+ "n": 8384,
313
+ "accuracy": 0.7832,
314
+ "brier": 0.3054,
315
+ "nll": 0.5545,
316
+ "ece": 0.0198
317
+ },
318
+ "workflow/bev_tr/Support and intent routing": {
319
+ "n": 2858,
320
+ "accuracy": 0.971,
321
+ "brier": 0.0462,
322
+ "nll": 0.087,
323
+ "ece": 0.011
324
+ },
325
+ "workflow/bev_tr/Tool and workflow decisions": {
326
+ "n": 2307,
327
+ "accuracy": 0.9866,
328
+ "brier": 0.0197,
329
+ "nll": 0.0423,
330
+ "ece": 0.0068
331
+ },
332
+ "workflow/bev_tr_en/Browser interaction": {
333
+ "n": 39,
334
+ "accuracy": 0.7692,
335
+ "brier": 0.2566,
336
+ "nll": 0.4157,
337
+ "ece": 0.1178
338
+ },
339
+ "workflow/bev_tr_en/Civic and safety operations": {
340
+ "n": 31,
341
+ "accuracy": 0.5484,
342
+ "brier": 0.5519,
343
+ "nll": 0.9665,
344
+ "ece": 0.2049
345
+ },
346
+ "workflow/bev_tr_en/Contract evidence": {
347
+ "n": 49,
348
+ "accuracy": 0.7959,
349
+ "brier": 0.3148,
350
+ "nll": 0.5499,
351
+ "ece": 0.1107
352
+ },
353
+ "workflow/bev_tr_en/Engagement and ranking": {
354
+ "n": 6,
355
+ "accuracy": 0.6667,
356
+ "brier": 0.4327,
357
+ "nll": 0.6113,
358
+ "ece": 0.278
359
+ },
360
+ "workflow/bev_tr_en/Financial reporting and banking": {
361
+ "n": 196,
362
+ "accuracy": 0.6531,
363
+ "brier": 0.4856,
364
+ "nll": 0.975,
365
+ "ece": 0.1033
366
+ },
367
+ "workflow/bev_tr_en/Game-state decisions": {
368
+ "n": 303,
369
+ "accuracy": 0.835,
370
+ "brier": 0.2434,
371
+ "nll": 0.4021,
372
+ "ece": 0.0929
373
+ },
374
+ "workflow/bev_tr_en/Reading comprehension": {
375
+ "n": 168,
376
+ "accuracy": 0.9048,
377
+ "brier": 0.1584,
378
+ "nll": 0.2737,
379
+ "ece": 0.0486
380
+ },
381
+ "workflow/bev_tr_en/Response preference and quality": {
382
+ "n": 389,
383
+ "accuracy": 0.5604,
384
+ "brier": 0.5324,
385
+ "nll": 0.9589,
386
+ "ece": 0.0574
387
+ },
388
+ "workflow/bev_tr_en/Retail, product, and shopping": {
389
+ "n": 902,
390
+ "accuracy": 0.6896,
391
+ "brier": 0.3378,
392
+ "nll": 0.5532,
393
+ "ece": 0.1003
394
+ },
395
+ "workflow/bev_tr_en/Scientific and paper understanding": {
396
+ "n": 66,
397
+ "accuracy": 0.7424,
398
+ "brier": 0.3035,
399
+ "nll": 0.5148,
400
+ "ece": 0.1262
401
+ },
402
+ "workflow/bev_tr_en/Sensory quality rating": {
403
+ "n": 37,
404
+ "accuracy": 0.2432,
405
+ "brier": 0.7863,
406
+ "nll": 1.5804,
407
+ "ece": 0.1299
408
+ },
409
+ "workflow/bev_tr_en/Sentiment, emotion, and moderation": {
410
+ "n": 1439,
411
+ "accuracy": 0.8457,
412
+ "brier": 0.202,
413
+ "nll": 0.3659,
414
+ "ece": 0.0443
415
+ },
416
+ "workflow/bev_tr_en/Software engineering and code": {
417
+ "n": 260,
418
+ "accuracy": 0.7077,
419
+ "brier": 0.3893,
420
+ "nll": 0.7283,
421
+ "ece": 0.076
422
+ },
423
+ "workflow/bev_tr_en/Software security": {
424
+ "n": 234,
425
+ "accuracy": 0.5556,
426
+ "brier": 0.5142,
427
+ "nll": 0.8403,
428
+ "ece": 0.0889
429
+ },
430
+ "workflow/bev_tr_en/Spam detection": {
431
+ "n": 23,
432
+ "accuracy": 1.0,
433
+ "brier": 0.0001,
434
+ "nll": 0.006,
435
+ "ece": 0.006
436
+ },
437
+ "workflow/bev_tr_en/Spatial and logical reasoning": {
438
+ "n": 1042,
439
+ "accuracy": 0.6823,
440
+ "brier": 0.4407,
441
+ "nll": 0.8513,
442
+ "ece": 0.0635
443
+ },
444
+ "workflow/bev_tr_en/Support and intent routing": {
445
+ "n": 310,
446
+ "accuracy": 0.9581,
447
+ "brier": 0.0834,
448
+ "nll": 0.1668,
449
+ "ece": 0.0519
450
+ },
451
+ "workflow/bev_tr_en/Tool and workflow decisions": {
452
+ "n": 272,
453
+ "accuracy": 0.9779,
454
+ "brier": 0.0379,
455
+ "nll": 0.074,
456
+ "ece": 0.0203
457
+ },
458
+ "workflow/beyazperde_tr": {
459
+ "n": 5000,
460
+ "accuracy": 0.6336,
461
+ "brier": 0.4769,
462
+ "nll": 0.8667,
463
+ "ece": 0.0402
464
+ },
465
+ "workflow/jev_bench_tr/arc_challenge": {
466
+ "n": 1000,
467
+ "accuracy": 0.833,
468
+ "brier": 0.2373,
469
+ "nll": 0.452,
470
+ "ece": 0.0305
471
+ },
472
+ "workflow/jev_bench_tr/banking77": {
473
+ "n": 1000,
474
+ "accuracy": 0.81,
475
+ "brier": 0.2667,
476
+ "nll": 0.6704,
477
+ "ece": 0.0496
478
+ },
479
+ "workflow/jev_bench_tr/boolq": {
480
+ "n": 1000,
481
+ "accuracy": 0.877,
482
+ "brier": 0.1889,
483
+ "nll": 0.3099,
484
+ "ece": 0.0233
485
+ },
486
+ "workflow/jev_bench_tr/chaosnli": {
487
+ "n": 1599,
488
+ "accuracy": 0.6373,
489
+ "brier": 0.2039,
490
+ "nll": 1.1669,
491
+ "ece": 0.1133
492
+ },
493
+ "workflow/jev_bench_tr/civil_comments": {
494
+ "n": 2000,
495
+ "accuracy": 0.863,
496
+ "brier": 0.1263,
497
+ "nll": 0.3793,
498
+ "ece": 0.0208
499
+ },
500
+ "workflow/jev_bench_tr/clinc150": {
501
+ "n": 1000,
502
+ "accuracy": 0.873,
503
+ "brier": 0.1986,
504
+ "nll": 0.6114,
505
+ "ece": 0.0333
506
+ },
507
+ "workflow/jev_bench_tr/fever_evidence": {
508
+ "n": 1000,
509
+ "accuracy": 0.926,
510
+ "brier": 0.1063,
511
+ "nll": 0.1935,
512
+ "ece": 0.0218
513
+ },
514
+ "workflow/jev_bench_tr/go_emotions": {
515
+ "n": 1000,
516
+ "accuracy": 0.496,
517
+ "brier": 0.3399,
518
+ "nll": 2.3234,
519
+ "ece": 0.1412
520
+ },
521
+ "workflow/jev_bench_tr/helpsteer2_helpfulness": {
522
+ "n": 1000,
523
+ "accuracy": 0.403,
524
+ "brier": 0.7142,
525
+ "nll": 1.3625,
526
+ "ece": 0.1558
527
+ },
528
+ "workflow/jev_bench_tr/helpsteer2_verbosity": {
529
+ "n": 1000,
530
+ "accuracy": 0.661,
531
+ "brier": 0.5088,
532
+ "nll": 0.9137,
533
+ "ece": 0.1524
534
+ },
535
+ "workflow/jev_bench_tr/ledgar": {
536
+ "n": 1000,
537
+ "accuracy": 0.678,
538
+ "brier": 0.4474,
539
+ "nll": 1.2384,
540
+ "ece": 0.0563
541
+ },
542
+ "workflow/jev_bench_tr/massive": {
543
+ "n": 1000,
544
+ "accuracy": 0.867,
545
+ "brier": 0.1986,
546
+ "nll": 0.5556,
547
+ "ece": 0.0434
548
+ },
549
+ "workflow/jev_bench_tr/measuring_hate_speech": {
550
+ "n": 1000,
551
+ "accuracy": 0.534,
552
+ "brier": 0.3917,
553
+ "nll": 1.1279,
554
+ "ece": 0.1391
555
+ },
556
+ "workflow/jev_bench_tr/mmlu": {
557
+ "n": 1000,
558
+ "accuracy": 0.615,
559
+ "brier": 0.5026,
560
+ "nll": 0.9645,
561
+ "ece": 0.0798
562
+ },
563
+ "workflow/jev_bench_tr/mnli": {
564
+ "n": 1000,
565
+ "accuracy": 0.832,
566
+ "brier": 0.2406,
567
+ "nll": 0.4346,
568
+ "ece": 0.0289
569
+ },
570
+ "workflow/jev_bench_tr/paws": {
571
+ "n": 1000,
572
+ "accuracy": 0.694,
573
+ "brier": 0.4599,
574
+ "nll": 0.7411,
575
+ "ece": 0.1698
576
+ },
577
+ "workflow/jev_bench_tr/sms_spam": {
578
+ "n": 800,
579
+ "accuracy": 0.9587,
580
+ "brier": 0.0616,
581
+ "nll": 0.1232,
582
+ "ece": 0.0165
583
+ },
584
+ "workflow/jev_bench_tr/sst5": {
585
+ "n": 1000,
586
+ "accuracy": 0.428,
587
+ "brier": 0.6809,
588
+ "nll": 1.2517,
589
+ "ece": 0.0952
590
+ },
591
+ "workflow/jev_bench_tr/strategyqa_closed": {
592
+ "n": 687,
593
+ "accuracy": 0.5429,
594
+ "brier": 0.5218,
595
+ "nll": 0.7334,
596
+ "ece": 0.1441
597
+ },
598
+ "workflow/jev_bench_tr/strategyqa_grounded": {
599
+ "n": 687,
600
+ "accuracy": 0.8049,
601
+ "brier": 0.2641,
602
+ "nll": 0.4067,
603
+ "ece": 0.0331
604
+ },
605
+ "workflow/jev_bench_tr/stsb": {
606
+ "n": 1000,
607
+ "accuracy": 0.51,
608
+ "brier": 0.634,
609
+ "nll": 1.2248,
610
+ "ece": 0.0975
611
+ },
612
+ "workflow/jev_bench_tr/yelp5": {
613
+ "n": 1000,
614
+ "accuracy": 0.643,
615
+ "brier": 0.4752,
616
+ "nll": 0.8146,
617
+ "ece": 0.0633
618
+ },
619
+ "workflow/jev_bench_tr_en/arc_challenge": {
620
+ "n": 91,
621
+ "accuracy": 0.9121,
622
+ "brier": 0.1091,
623
+ "nll": 0.1997,
624
+ "ece": 0.0625
625
+ },
626
+ "workflow/jev_bench_tr_en/banking77": {
627
+ "n": 71,
628
+ "accuracy": 0.8592,
629
+ "brier": 0.2199,
630
+ "nll": 0.5531,
631
+ "ece": 0.0805
632
+ },
633
+ "workflow/jev_bench_tr_en/boolq": {
634
+ "n": 80,
635
+ "accuracy": 0.9,
636
+ "brier": 0.1214,
637
+ "nll": 0.2017,
638
+ "ece": 0.0737
639
+ },
640
+ "workflow/jev_bench_tr_en/chaosnli": {
641
+ "n": 151,
642
+ "accuracy": 0.7086,
643
+ "brier": 0.1814,
644
+ "nll": 1.1407,
645
+ "ece": 0.1201
646
+ },
647
+ "workflow/jev_bench_tr_en/civil_comments": {
648
+ "n": 171,
649
+ "accuracy": 0.8655,
650
+ "brier": 0.14,
651
+ "nll": 0.3978,
652
+ "ece": 0.0587
653
+ },
654
+ "workflow/jev_bench_tr_en/clinc150": {
655
+ "n": 96,
656
+ "accuracy": 0.8854,
657
+ "brier": 0.1594,
658
+ "nll": 0.3886,
659
+ "ece": 0.0521
660
+ },
661
+ "workflow/jev_bench_tr_en/fever_evidence": {
662
+ "n": 91,
663
+ "accuracy": 0.967,
664
+ "brier": 0.0561,
665
+ "nll": 0.1315,
666
+ "ece": 0.0348
667
+ },
668
+ "workflow/jev_bench_tr_en/go_emotions": {
669
+ "n": 93,
670
+ "accuracy": 0.5269,
671
+ "brier": 0.323,
672
+ "nll": 2.3535,
673
+ "ece": 0.1604
674
+ },
675
+ "workflow/jev_bench_tr_en/helpsteer2_helpfulness": {
676
+ "n": 89,
677
+ "accuracy": 0.4831,
678
+ "brier": 0.6573,
679
+ "nll": 1.1603,
680
+ "ece": 0.1857
681
+ },
682
+ "workflow/jev_bench_tr_en/helpsteer2_verbosity": {
683
+ "n": 79,
684
+ "accuracy": 0.7089,
685
+ "brier": 0.4661,
686
+ "nll": 0.8944,
687
+ "ece": 0.1493
688
+ },
689
+ "workflow/jev_bench_tr_en/ledgar": {
690
+ "n": 70,
691
+ "accuracy": 0.7857,
692
+ "brier": 0.3543,
693
+ "nll": 0.8834,
694
+ "ece": 0.1722
695
+ },
696
+ "workflow/jev_bench_tr_en/massive": {
697
+ "n": 95,
698
+ "accuracy": 0.8526,
699
+ "brier": 0.207,
700
+ "nll": 0.73,
701
+ "ece": 0.0683
702
+ },
703
+ "workflow/jev_bench_tr_en/measuring_hate_speech": {
704
+ "n": 96,
705
+ "accuracy": 0.5729,
706
+ "brier": 0.3906,
707
+ "nll": 1.1441,
708
+ "ece": 0.187
709
+ },
710
+ "workflow/jev_bench_tr_en/mmlu": {
711
+ "n": 80,
712
+ "accuracy": 0.725,
713
+ "brier": 0.3559,
714
+ "nll": 0.6658,
715
+ "ece": 0.071
716
+ },
717
+ "workflow/jev_bench_tr_en/mnli": {
718
+ "n": 92,
719
+ "accuracy": 0.9348,
720
+ "brier": 0.1053,
721
+ "nll": 0.1974,
722
+ "ece": 0.0927
723
+ },
724
+ "workflow/jev_bench_tr_en/paws": {
725
+ "n": 80,
726
+ "accuracy": 0.8375,
727
+ "brier": 0.2238,
728
+ "nll": 0.3598,
729
+ "ece": 0.0984
730
+ },
731
+ "workflow/jev_bench_tr_en/sms_spam": {
732
+ "n": 82,
733
+ "accuracy": 1.0,
734
+ "brier": 0.0055,
735
+ "nll": 0.0164,
736
+ "ece": 0.0147
737
+ },
738
+ "workflow/jev_bench_tr_en/sst5": {
739
+ "n": 73,
740
+ "accuracy": 0.5205,
741
+ "brier": 0.5669,
742
+ "nll": 0.9347,
743
+ "ece": 0.0965
744
+ },
745
+ "workflow/jev_bench_tr_en/strategyqa_closed": {
746
+ "n": 60,
747
+ "accuracy": 0.8333,
748
+ "brier": 0.3338,
749
+ "nll": 0.5123,
750
+ "ece": 0.1264
751
+ },
752
+ "workflow/jev_bench_tr_en/strategyqa_grounded": {
753
+ "n": 71,
754
+ "accuracy": 0.8592,
755
+ "brier": 0.1958,
756
+ "nll": 0.3115,
757
+ "ece": 0.0442
758
+ },
759
+ "workflow/jev_bench_tr_en/stsb": {
760
+ "n": 90,
761
+ "accuracy": 0.5111,
762
+ "brier": 0.577,
763
+ "nll": 1.098,
764
+ "ece": 0.1376
765
+ },
766
+ "workflow/jev_bench_tr_en/yelp5": {
767
+ "n": 99,
768
+ "accuracy": 0.7071,
769
+ "brier": 0.4005,
770
+ "nll": 0.6957,
771
+ "ece": 0.1338
772
+ },
773
+ "workflow/massive_tr": {
774
+ "n": 2974,
775
+ "accuracy": 0.8705,
776
+ "brier": 0.1941,
777
+ "nll": 0.5568,
778
+ "ece": 0.0362
779
+ },
780
+ "workflow/squad_tr": {
781
+ "n": 11873,
782
+ "accuracy": 0.8619,
783
+ "brier": 0.2028,
784
+ "nll": 0.3322,
785
+ "ece": 0.0168
786
+ },
787
+ "workflow/xnli_tr": {
788
+ "n": 5010,
789
+ "accuracy": 0.8315,
790
+ "brier": 0.2488,
791
+ "nll": 0.4509,
792
+ "ece": 0.0151
793
+ },
794
+ "squad_tr/answerability": {
795
+ "auroc": 0.9397,
796
+ "acc_answerable": 0.9379,
797
+ "acc_unanswerable": 0.783
798
+ }
799
+ },
800
+ "train_key": "411bcda4c97e6b5b"
801
+ }
training/eval_report_base_decider-4b.json ADDED
@@ -0,0 +1,798 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model": "decider-4b-v2.1",
3
+ "path": "Mapika/decider-4b",
4
+ "revision": "eb5fbdfc9448473ec25e399882912863afbdb70e",
5
+ "skipped": {},
6
+ "seconds": 4083,
7
+ "report": {
8
+ "all": {
9
+ "n": 101716,
10
+ "accuracy": 0.689,
11
+ "brier": 0.3876,
12
+ "nll": 0.7511,
13
+ "ece": 0.0282
14
+ },
15
+ "source/bev_tr": {
16
+ "n": 46320,
17
+ "accuracy": 0.6687,
18
+ "brier": 0.416,
19
+ "nll": 0.7659,
20
+ "ece": 0.0272
21
+ },
22
+ "source/bev_tr/choice": {
23
+ "n": 18808,
24
+ "accuracy": 0.6687,
25
+ "brier": 0.4305,
26
+ "nll": 0.853,
27
+ "ece": 0.069
28
+ },
29
+ "source/bev_tr/noul": {
30
+ "n": 17572,
31
+ "accuracy": 0.8119,
32
+ "brier": 0.2643,
33
+ "nll": 0.4119,
34
+ "ece": 0.0192
35
+ },
36
+ "source/bev_tr/score": {
37
+ "n": 9940,
38
+ "accuracy": 0.4157,
39
+ "brier": 0.6566,
40
+ "nll": 1.227,
41
+ "ece": 0.0427
42
+ },
43
+ "source/bev_tr_en": {
44
+ "n": 5766,
45
+ "accuracy": 0.7197,
46
+ "brier": 0.352,
47
+ "nll": 0.653,
48
+ "ece": 0.0206
49
+ },
50
+ "source/bev_tr_en/choice": {
51
+ "n": 2386,
52
+ "accuracy": 0.715,
53
+ "brier": 0.3711,
54
+ "nll": 0.7288,
55
+ "ece": 0.0509
56
+ },
57
+ "source/bev_tr_en/noul": {
58
+ "n": 2117,
59
+ "accuracy": 0.8635,
60
+ "brier": 0.1836,
61
+ "nll": 0.3012,
62
+ "ece": 0.0466
63
+ },
64
+ "source/bev_tr_en/score": {
65
+ "n": 1263,
66
+ "accuracy": 0.4877,
67
+ "brier": 0.5983,
68
+ "nll": 1.0994,
69
+ "ece": 0.036
70
+ },
71
+ "source/beyazperde_tr": {
72
+ "n": 5000,
73
+ "accuracy": 0.5204,
74
+ "brier": 0.5888,
75
+ "nll": 1.0806,
76
+ "ece": 0.0503
77
+ },
78
+ "source/beyazperde_tr/score": {
79
+ "n": 5000,
80
+ "accuracy": 0.5204,
81
+ "brier": 0.5888,
82
+ "nll": 1.0806,
83
+ "ece": 0.0503
84
+ },
85
+ "source/jev_bench_tr": {
86
+ "n": 22773,
87
+ "accuracy": 0.71,
88
+ "brier": 0.3406,
89
+ "nll": 0.8272,
90
+ "ece": 0.0308
91
+ },
92
+ "source/jev_bench_tr/choice": {
93
+ "n": 9599,
94
+ "accuracy": 0.7209,
95
+ "brier": 0.3008,
96
+ "nll": 1.002,
97
+ "ece": 0.059
98
+ },
99
+ "source/jev_bench_tr/noul": {
100
+ "n": 7174,
101
+ "accuracy": 0.8433,
102
+ "brier": 0.2132,
103
+ "nll": 0.386,
104
+ "ece": 0.0263
105
+ },
106
+ "source/jev_bench_tr/score": {
107
+ "n": 6000,
108
+ "accuracy": 0.533,
109
+ "brier": 0.5565,
110
+ "nll": 1.0753,
111
+ "ece": 0.0604
112
+ },
113
+ "source/jev_bench_tr_en": {
114
+ "n": 2000,
115
+ "accuracy": 0.768,
116
+ "brier": 0.2677,
117
+ "nll": 0.6802,
118
+ "ece": 0.0338
119
+ },
120
+ "source/jev_bench_tr_en/choice": {
121
+ "n": 839,
122
+ "accuracy": 0.7926,
123
+ "brier": 0.2158,
124
+ "nll": 0.8053,
125
+ "ece": 0.0562
126
+ },
127
+ "source/jev_bench_tr_en/noul": {
128
+ "n": 635,
129
+ "accuracy": 0.8866,
130
+ "brier": 0.147,
131
+ "nll": 0.2887,
132
+ "ece": 0.0317
133
+ },
134
+ "source/jev_bench_tr_en/score": {
135
+ "n": 526,
136
+ "accuracy": 0.5856,
137
+ "brier": 0.4964,
138
+ "nll": 0.9534,
139
+ "ece": 0.0678
140
+ },
141
+ "source/massive_tr": {
142
+ "n": 2974,
143
+ "accuracy": 0.8285,
144
+ "brier": 0.2533,
145
+ "nll": 0.7069,
146
+ "ece": 0.0362
147
+ },
148
+ "source/massive_tr/choice": {
149
+ "n": 2974,
150
+ "accuracy": 0.8285,
151
+ "brier": 0.2533,
152
+ "nll": 0.7069,
153
+ "ece": 0.0362
154
+ },
155
+ "source/squad_tr": {
156
+ "n": 11873,
157
+ "accuracy": 0.6832,
158
+ "brier": 0.4016,
159
+ "nll": 0.585,
160
+ "ece": 0.0488
161
+ },
162
+ "source/squad_tr/noul": {
163
+ "n": 11873,
164
+ "accuracy": 0.6832,
165
+ "brier": 0.4016,
166
+ "nll": 0.585,
167
+ "ece": 0.0488
168
+ },
169
+ "source/xnli_tr": {
170
+ "n": 5010,
171
+ "accuracy": 0.8128,
172
+ "brier": 0.2741,
173
+ "nll": 0.4991,
174
+ "ece": 0.0356
175
+ },
176
+ "source/xnli_tr/choice": {
177
+ "n": 5010,
178
+ "accuracy": 0.8128,
179
+ "brier": 0.2741,
180
+ "nll": 0.4991,
181
+ "ece": 0.0356
182
+ },
183
+ "type/choice": {
184
+ "n": 39616,
185
+ "accuracy": 0.717,
186
+ "brier": 0.3579,
187
+ "nll": 0.8249,
188
+ "ece": 0.0563
189
+ },
190
+ "type/noul": {
191
+ "n": 39371,
192
+ "accuracy": 0.7828,
193
+ "brier": 0.2902,
194
+ "nll": 0.4514,
195
+ "ece": 0.0073
196
+ },
197
+ "type/score": {
198
+ "n": 22729,
199
+ "accuracy": 0.4776,
200
+ "brier": 0.6083,
201
+ "nll": 1.1413,
202
+ "ece": 0.0321
203
+ },
204
+ "workflow/bev_tr/Browser interaction": {
205
+ "n": 286,
206
+ "accuracy": 0.7622,
207
+ "brier": 0.3497,
208
+ "nll": 0.6694,
209
+ "ece": 0.0703
210
+ },
211
+ "workflow/bev_tr/Civic and safety operations": {
212
+ "n": 261,
213
+ "accuracy": 0.4598,
214
+ "brier": 0.7236,
215
+ "nll": 1.6077,
216
+ "ece": 0.0844
217
+ },
218
+ "workflow/bev_tr/Contract evidence": {
219
+ "n": 320,
220
+ "accuracy": 0.7,
221
+ "brier": 0.4117,
222
+ "nll": 0.7334,
223
+ "ece": 0.0947
224
+ },
225
+ "workflow/bev_tr/Engagement and ranking": {
226
+ "n": 82,
227
+ "accuracy": 0.5732,
228
+ "brier": 0.4994,
229
+ "nll": 0.6958,
230
+ "ece": 0.1553
231
+ },
232
+ "workflow/bev_tr/Financial reporting and banking": {
233
+ "n": 1740,
234
+ "accuracy": 0.573,
235
+ "brier": 0.5624,
236
+ "nll": 1.0865,
237
+ "ece": 0.0942
238
+ },
239
+ "workflow/bev_tr/Game-state decisions": {
240
+ "n": 2039,
241
+ "accuracy": 0.7013,
242
+ "brier": 0.4137,
243
+ "nll": 0.6803,
244
+ "ece": 0.0833
245
+ },
246
+ "workflow/bev_tr/Reading comprehension": {
247
+ "n": 1422,
248
+ "accuracy": 0.8601,
249
+ "brier": 0.2171,
250
+ "nll": 0.3537,
251
+ "ece": 0.0343
252
+ },
253
+ "workflow/bev_tr/Response preference and quality": {
254
+ "n": 3176,
255
+ "accuracy": 0.5107,
256
+ "brier": 0.5648,
257
+ "nll": 1.0151,
258
+ "ece": 0.0319
259
+ },
260
+ "workflow/bev_tr/Retail, product, and shopping": {
261
+ "n": 6601,
262
+ "accuracy": 0.6946,
263
+ "brier": 0.3684,
264
+ "nll": 0.6556,
265
+ "ece": 0.0808
266
+ },
267
+ "workflow/bev_tr/Scientific and paper understanding": {
268
+ "n": 508,
269
+ "accuracy": 0.6713,
270
+ "brier": 0.4589,
271
+ "nll": 0.7734,
272
+ "ece": 0.0884
273
+ },
274
+ "workflow/bev_tr/Sensory quality rating": {
275
+ "n": 260,
276
+ "accuracy": 0.2692,
277
+ "brier": 0.8003,
278
+ "nll": 1.6129,
279
+ "ece": 0.1629
280
+ },
281
+ "workflow/bev_tr/Sentiment, emotion, and moderation": {
282
+ "n": 11526,
283
+ "accuracy": 0.727,
284
+ "brier": 0.3386,
285
+ "nll": 0.594,
286
+ "ece": 0.0549
287
+ },
288
+ "workflow/bev_tr/Software engineering and code": {
289
+ "n": 2039,
290
+ "accuracy": 0.6709,
291
+ "brier": 0.428,
292
+ "nll": 0.8088,
293
+ "ece": 0.0432
294
+ },
295
+ "workflow/bev_tr/Software security": {
296
+ "n": 2240,
297
+ "accuracy": 0.5161,
298
+ "brier": 0.573,
299
+ "nll": 0.9591,
300
+ "ece": 0.034
301
+ },
302
+ "workflow/bev_tr/Spam detection": {
303
+ "n": 271,
304
+ "accuracy": 0.9852,
305
+ "brier": 0.0443,
306
+ "nll": 0.1076,
307
+ "ece": 0.0481
308
+ },
309
+ "workflow/bev_tr/Spatial and logical reasoning": {
310
+ "n": 8384,
311
+ "accuracy": 0.5081,
312
+ "brier": 0.621,
313
+ "nll": 1.2295,
314
+ "ece": 0.1028
315
+ },
316
+ "workflow/bev_tr/Support and intent routing": {
317
+ "n": 2858,
318
+ "accuracy": 0.8656,
319
+ "brier": 0.1927,
320
+ "nll": 0.3617,
321
+ "ece": 0.023
322
+ },
323
+ "workflow/bev_tr/Tool and workflow decisions": {
324
+ "n": 2307,
325
+ "accuracy": 0.9515,
326
+ "brier": 0.0784,
327
+ "nll": 0.1804,
328
+ "ece": 0.0202
329
+ },
330
+ "workflow/bev_tr_en/Browser interaction": {
331
+ "n": 39,
332
+ "accuracy": 0.7436,
333
+ "brier": 0.332,
334
+ "nll": 0.5797,
335
+ "ece": 0.2032
336
+ },
337
+ "workflow/bev_tr_en/Civic and safety operations": {
338
+ "n": 31,
339
+ "accuracy": 0.2903,
340
+ "brier": 0.7323,
341
+ "nll": 1.3491,
342
+ "ece": 0.2817
343
+ },
344
+ "workflow/bev_tr_en/Contract evidence": {
345
+ "n": 49,
346
+ "accuracy": 0.7959,
347
+ "brier": 0.3294,
348
+ "nll": 0.592,
349
+ "ece": 0.1754
350
+ },
351
+ "workflow/bev_tr_en/Engagement and ranking": {
352
+ "n": 6,
353
+ "accuracy": 0.5,
354
+ "brier": 0.5541,
355
+ "nll": 0.7408,
356
+ "ece": 0.2987
357
+ },
358
+ "workflow/bev_tr_en/Financial reporting and banking": {
359
+ "n": 196,
360
+ "accuracy": 0.6173,
361
+ "brier": 0.5212,
362
+ "nll": 1.0502,
363
+ "ece": 0.1278
364
+ },
365
+ "workflow/bev_tr_en/Game-state decisions": {
366
+ "n": 303,
367
+ "accuracy": 0.7987,
368
+ "brier": 0.2917,
369
+ "nll": 0.477,
370
+ "ece": 0.1155
371
+ },
372
+ "workflow/bev_tr_en/Reading comprehension": {
373
+ "n": 168,
374
+ "accuracy": 0.8988,
375
+ "brier": 0.1561,
376
+ "nll": 0.2729,
377
+ "ece": 0.0442
378
+ },
379
+ "workflow/bev_tr_en/Response preference and quality": {
380
+ "n": 389,
381
+ "accuracy": 0.5733,
382
+ "brier": 0.5404,
383
+ "nll": 0.9819,
384
+ "ece": 0.0858
385
+ },
386
+ "workflow/bev_tr_en/Retail, product, and shopping": {
387
+ "n": 902,
388
+ "accuracy": 0.6641,
389
+ "brier": 0.3671,
390
+ "nll": 0.6347,
391
+ "ece": 0.0989
392
+ },
393
+ "workflow/bev_tr_en/Scientific and paper understanding": {
394
+ "n": 66,
395
+ "accuracy": 0.6818,
396
+ "brier": 0.4373,
397
+ "nll": 0.6896,
398
+ "ece": 0.1184
399
+ },
400
+ "workflow/bev_tr_en/Sensory quality rating": {
401
+ "n": 37,
402
+ "accuracy": 0.2973,
403
+ "brier": 0.8005,
404
+ "nll": 1.645,
405
+ "ece": 0.026
406
+ },
407
+ "workflow/bev_tr_en/Sentiment, emotion, and moderation": {
408
+ "n": 1439,
409
+ "accuracy": 0.8367,
410
+ "brier": 0.2179,
411
+ "nll": 0.4039,
412
+ "ece": 0.0738
413
+ },
414
+ "workflow/bev_tr_en/Software engineering and code": {
415
+ "n": 260,
416
+ "accuracy": 0.6615,
417
+ "brier": 0.4328,
418
+ "nll": 0.7957,
419
+ "ece": 0.0837
420
+ },
421
+ "workflow/bev_tr_en/Software security": {
422
+ "n": 234,
423
+ "accuracy": 0.4829,
424
+ "brier": 0.5552,
425
+ "nll": 0.9091,
426
+ "ece": 0.0714
427
+ },
428
+ "workflow/bev_tr_en/Spam detection": {
429
+ "n": 23,
430
+ "accuracy": 1.0,
431
+ "brier": 0.014,
432
+ "nll": 0.0504,
433
+ "ece": 0.0463
434
+ },
435
+ "workflow/bev_tr_en/Spatial and logical reasoning": {
436
+ "n": 1042,
437
+ "accuracy": 0.5979,
438
+ "brier": 0.5265,
439
+ "nll": 1.0567,
440
+ "ece": 0.0797
441
+ },
442
+ "workflow/bev_tr_en/Support and intent routing": {
443
+ "n": 310,
444
+ "accuracy": 0.9032,
445
+ "brier": 0.1216,
446
+ "nll": 0.2252,
447
+ "ece": 0.0401
448
+ },
449
+ "workflow/bev_tr_en/Tool and workflow decisions": {
450
+ "n": 272,
451
+ "accuracy": 0.9669,
452
+ "brier": 0.0568,
453
+ "nll": 0.1371,
454
+ "ece": 0.0194
455
+ },
456
+ "workflow/beyazperde_tr": {
457
+ "n": 5000,
458
+ "accuracy": 0.5204,
459
+ "brier": 0.5888,
460
+ "nll": 1.0806,
461
+ "ece": 0.0503
462
+ },
463
+ "workflow/jev_bench_tr/arc_challenge": {
464
+ "n": 1000,
465
+ "accuracy": 0.844,
466
+ "brier": 0.2238,
467
+ "nll": 0.4245,
468
+ "ece": 0.0291
469
+ },
470
+ "workflow/jev_bench_tr/banking77": {
471
+ "n": 1000,
472
+ "accuracy": 0.786,
473
+ "brier": 0.3131,
474
+ "nll": 0.8613,
475
+ "ece": 0.0587
476
+ },
477
+ "workflow/jev_bench_tr/boolq": {
478
+ "n": 1000,
479
+ "accuracy": 0.862,
480
+ "brier": 0.2002,
481
+ "nll": 0.3298,
482
+ "ece": 0.0267
483
+ },
484
+ "workflow/jev_bench_tr/chaosnli": {
485
+ "n": 1599,
486
+ "accuracy": 0.5935,
487
+ "brier": 0.2505,
488
+ "nll": 1.2798,
489
+ "ece": 0.1838
490
+ },
491
+ "workflow/jev_bench_tr/civil_comments": {
492
+ "n": 2000,
493
+ "accuracy": 0.9375,
494
+ "brier": 0.0852,
495
+ "nll": 0.326,
496
+ "ece": 0.1395
497
+ },
498
+ "workflow/jev_bench_tr/clinc150": {
499
+ "n": 1000,
500
+ "accuracy": 0.877,
501
+ "brier": 0.2026,
502
+ "nll": 0.6939,
503
+ "ece": 0.0488
504
+ },
505
+ "workflow/jev_bench_tr/fever_evidence": {
506
+ "n": 1000,
507
+ "accuracy": 0.909,
508
+ "brier": 0.1436,
509
+ "nll": 0.2527,
510
+ "ece": 0.0384
511
+ },
512
+ "workflow/jev_bench_tr/go_emotions": {
513
+ "n": 1000,
514
+ "accuracy": 0.486,
515
+ "brier": 0.3056,
516
+ "nll": 2.2315,
517
+ "ece": 0.077
518
+ },
519
+ "workflow/jev_bench_tr/helpsteer2_helpfulness": {
520
+ "n": 1000,
521
+ "accuracy": 0.432,
522
+ "brier": 0.7229,
523
+ "nll": 1.3629,
524
+ "ece": 0.191
525
+ },
526
+ "workflow/jev_bench_tr/helpsteer2_verbosity": {
527
+ "n": 1000,
528
+ "accuracy": 0.668,
529
+ "brier": 0.4887,
530
+ "nll": 0.8986,
531
+ "ece": 0.1154
532
+ },
533
+ "workflow/jev_bench_tr/ledgar": {
534
+ "n": 1000,
535
+ "accuracy": 0.694,
536
+ "brier": 0.4402,
537
+ "nll": 1.2495,
538
+ "ece": 0.0355
539
+ },
540
+ "workflow/jev_bench_tr/massive": {
541
+ "n": 1000,
542
+ "accuracy": 0.832,
543
+ "brier": 0.2553,
544
+ "nll": 0.7084,
545
+ "ece": 0.0477
546
+ },
547
+ "workflow/jev_bench_tr/measuring_hate_speech": {
548
+ "n": 1000,
549
+ "accuracy": 0.46,
550
+ "brier": 0.3972,
551
+ "nll": 1.0576,
552
+ "ece": 0.1811
553
+ },
554
+ "workflow/jev_bench_tr/mmlu": {
555
+ "n": 1000,
556
+ "accuracy": 0.631,
557
+ "brier": 0.4863,
558
+ "nll": 0.9305,
559
+ "ece": 0.0703
560
+ },
561
+ "workflow/jev_bench_tr/mnli": {
562
+ "n": 1000,
563
+ "accuracy": 0.821,
564
+ "brier": 0.2604,
565
+ "nll": 0.472,
566
+ "ece": 0.0469
567
+ },
568
+ "workflow/jev_bench_tr/paws": {
569
+ "n": 1000,
570
+ "accuracy": 0.665,
571
+ "brier": 0.4888,
572
+ "nll": 0.7479,
573
+ "ece": 0.1876
574
+ },
575
+ "workflow/jev_bench_tr/sms_spam": {
576
+ "n": 800,
577
+ "accuracy": 0.9762,
578
+ "brier": 0.0415,
579
+ "nll": 0.088,
580
+ "ece": 0.0262
581
+ },
582
+ "workflow/jev_bench_tr/sst5": {
583
+ "n": 1000,
584
+ "accuracy": 0.477,
585
+ "brier": 0.624,
586
+ "nll": 1.1233,
587
+ "ece": 0.034
588
+ },
589
+ "workflow/jev_bench_tr/strategyqa_closed": {
590
+ "n": 687,
591
+ "accuracy": 0.5531,
592
+ "brier": 0.4841,
593
+ "nll": 0.6782,
594
+ "ece": 0.0609
595
+ },
596
+ "workflow/jev_bench_tr/strategyqa_grounded": {
597
+ "n": 687,
598
+ "accuracy": 0.8413,
599
+ "brier": 0.2337,
600
+ "nll": 0.3645,
601
+ "ece": 0.0358
602
+ },
603
+ "workflow/jev_bench_tr/stsb": {
604
+ "n": 1000,
605
+ "accuracy": 0.509,
606
+ "brier": 0.6394,
607
+ "nll": 1.2233,
608
+ "ece": 0.0989
609
+ },
610
+ "workflow/jev_bench_tr/yelp5": {
611
+ "n": 1000,
612
+ "accuracy": 0.652,
613
+ "brier": 0.467,
614
+ "nll": 0.7862,
615
+ "ece": 0.0543
616
+ },
617
+ "workflow/jev_bench_tr_en/arc_challenge": {
618
+ "n": 91,
619
+ "accuracy": 0.9451,
620
+ "brier": 0.0923,
621
+ "nll": 0.1834,
622
+ "ece": 0.0425
623
+ },
624
+ "workflow/jev_bench_tr_en/banking77": {
625
+ "n": 71,
626
+ "accuracy": 0.8592,
627
+ "brier": 0.2192,
628
+ "nll": 0.5844,
629
+ "ece": 0.104
630
+ },
631
+ "workflow/jev_bench_tr_en/boolq": {
632
+ "n": 80,
633
+ "accuracy": 0.9125,
634
+ "brier": 0.1191,
635
+ "nll": 0.202,
636
+ "ece": 0.0567
637
+ },
638
+ "workflow/jev_bench_tr_en/chaosnli": {
639
+ "n": 151,
640
+ "accuracy": 0.6755,
641
+ "brier": 0.2455,
642
+ "nll": 1.3287,
643
+ "ece": 0.1913
644
+ },
645
+ "workflow/jev_bench_tr_en/civil_comments": {
646
+ "n": 171,
647
+ "accuracy": 0.8538,
648
+ "brier": 0.1343,
649
+ "nll": 0.3876,
650
+ "ece": 0.0761
651
+ },
652
+ "workflow/jev_bench_tr_en/clinc150": {
653
+ "n": 96,
654
+ "accuracy": 0.9062,
655
+ "brier": 0.1405,
656
+ "nll": 0.3832,
657
+ "ece": 0.0887
658
+ },
659
+ "workflow/jev_bench_tr_en/fever_evidence": {
660
+ "n": 91,
661
+ "accuracy": 0.956,
662
+ "brier": 0.0721,
663
+ "nll": 0.1511,
664
+ "ece": 0.0373
665
+ },
666
+ "workflow/jev_bench_tr_en/go_emotions": {
667
+ "n": 93,
668
+ "accuracy": 0.5161,
669
+ "brier": 0.283,
670
+ "nll": 2.1674,
671
+ "ece": 0.1568
672
+ },
673
+ "workflow/jev_bench_tr_en/helpsteer2_helpfulness": {
674
+ "n": 89,
675
+ "accuracy": 0.427,
676
+ "brier": 0.6556,
677
+ "nll": 1.1478,
678
+ "ece": 0.1033
679
+ },
680
+ "workflow/jev_bench_tr_en/helpsteer2_verbosity": {
681
+ "n": 79,
682
+ "accuracy": 0.7089,
683
+ "brier": 0.4528,
684
+ "nll": 0.8678,
685
+ "ece": 0.1142
686
+ },
687
+ "workflow/jev_bench_tr_en/ledgar": {
688
+ "n": 70,
689
+ "accuracy": 0.8,
690
+ "brier": 0.3384,
691
+ "nll": 0.8433,
692
+ "ece": 0.1181
693
+ },
694
+ "workflow/jev_bench_tr_en/massive": {
695
+ "n": 95,
696
+ "accuracy": 0.8105,
697
+ "brier": 0.2327,
698
+ "nll": 0.5822,
699
+ "ece": 0.0781
700
+ },
701
+ "workflow/jev_bench_tr_en/measuring_hate_speech": {
702
+ "n": 96,
703
+ "accuracy": 0.5312,
704
+ "brier": 0.3995,
705
+ "nll": 1.0836,
706
+ "ece": 0.1889
707
+ },
708
+ "workflow/jev_bench_tr_en/mmlu": {
709
+ "n": 80,
710
+ "accuracy": 0.7625,
711
+ "brier": 0.3231,
712
+ "nll": 0.603,
713
+ "ece": 0.1016
714
+ },
715
+ "workflow/jev_bench_tr_en/mnli": {
716
+ "n": 92,
717
+ "accuracy": 0.9457,
718
+ "brier": 0.0929,
719
+ "nll": 0.1728,
720
+ "ece": 0.0731
721
+ },
722
+ "workflow/jev_bench_tr_en/paws": {
723
+ "n": 80,
724
+ "accuracy": 0.825,
725
+ "brier": 0.2561,
726
+ "nll": 0.413,
727
+ "ece": 0.0911
728
+ },
729
+ "workflow/jev_bench_tr_en/sms_spam": {
730
+ "n": 82,
731
+ "accuracy": 0.9634,
732
+ "brier": 0.0418,
733
+ "nll": 0.0741,
734
+ "ece": 0.0379
735
+ },
736
+ "workflow/jev_bench_tr_en/sst5": {
737
+ "n": 73,
738
+ "accuracy": 0.589,
739
+ "brier": 0.5294,
740
+ "nll": 0.8771,
741
+ "ece": 0.1161
742
+ },
743
+ "workflow/jev_bench_tr_en/strategyqa_closed": {
744
+ "n": 60,
745
+ "accuracy": 0.8,
746
+ "brier": 0.3278,
747
+ "nll": 0.5048,
748
+ "ece": 0.0974
749
+ },
750
+ "workflow/jev_bench_tr_en/strategyqa_grounded": {
751
+ "n": 71,
752
+ "accuracy": 0.9014,
753
+ "brier": 0.1506,
754
+ "nll": 0.2501,
755
+ "ece": 0.0844
756
+ },
757
+ "workflow/jev_bench_tr_en/stsb": {
758
+ "n": 90,
759
+ "accuracy": 0.5556,
760
+ "brier": 0.5762,
761
+ "nll": 1.0837,
762
+ "ece": 0.167
763
+ },
764
+ "workflow/jev_bench_tr_en/yelp5": {
765
+ "n": 99,
766
+ "accuracy": 0.7071,
767
+ "brier": 0.3851,
768
+ "nll": 0.6587,
769
+ "ece": 0.1091
770
+ },
771
+ "workflow/massive_tr": {
772
+ "n": 2974,
773
+ "accuracy": 0.8285,
774
+ "brier": 0.2533,
775
+ "nll": 0.7069,
776
+ "ece": 0.0362
777
+ },
778
+ "workflow/squad_tr": {
779
+ "n": 11873,
780
+ "accuracy": 0.6832,
781
+ "brier": 0.4016,
782
+ "nll": 0.585,
783
+ "ece": 0.0488
784
+ },
785
+ "workflow/xnli_tr": {
786
+ "n": 5010,
787
+ "accuracy": 0.8128,
788
+ "brier": 0.2741,
789
+ "nll": 0.4991,
790
+ "ece": 0.0356
791
+ },
792
+ "squad_tr/answerability": {
793
+ "auroc": 0.8093,
794
+ "acc_answerable": 0.9178,
795
+ "acc_unanswerable": 0.439
796
+ }
797
+ }
798
+ }
training/export.json ADDED
@@ -0,0 +1,30 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "train_key": "411bcda4c97e6b5b",
3
+ "calibration": {
4
+ "temperature_by_type": {
5
+ "choice": 0.936,
6
+ "noul": 1.146,
7
+ "score": 1.093
8
+ },
9
+ "temperature": 1.051,
10
+ "rows": {
11
+ "choice": 638,
12
+ "noul": 1024,
13
+ "score": 456
14
+ },
15
+ "nll": {
16
+ "choice": {
17
+ "T=1": 0.3116,
18
+ "fitted": 0.3107
19
+ },
20
+ "noul": {
21
+ "T=1": 0.2288,
22
+ "fitted": 0.2265
23
+ },
24
+ "score": {
25
+ "T=1": 0.6997,
26
+ "fitted": 0.6972
27
+ }
28
+ }
29
+ }
30
+ }
training/fp8.log ADDED
@@ -0,0 +1,115 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ decider-4b-v2.1-tr-lora on 10,000 rows (13,371 decisions)
2
+ 256 / 10,000 rows 14s accuracy so far 0.778
3
+ 512 / 10,000 rows 28s accuracy so far 0.774
4
+ 768 / 10,000 rows 38s accuracy so far 0.788
5
+ 1,024 / 10,000 rows 52s accuracy so far 0.787
6
+ 1,280 / 10,000 rows 62s accuracy so far 0.787
7
+ 1,536 / 10,000 rows 75s accuracy so far 0.787
8
+ 1,792 / 10,000 rows 89s accuracy so far 0.792
9
+ 2,048 / 10,000 rows 101s accuracy so far 0.793
10
+ 2,304 / 10,000 rows 111s accuracy so far 0.790
11
+ 2,560 / 10,000 rows 122s accuracy so far 0.789
12
+ 2,816 / 10,000 rows 133s accuracy so far 0.790
13
+ 3,072 / 10,000 rows 143s accuracy so far 0.790
14
+ 3,328 / 10,000 rows 155s accuracy so far 0.790
15
+ 3,584 / 10,000 rows 167s accuracy so far 0.794
16
+ 3,840 / 10,000 rows 178s accuracy so far 0.798
17
+ 4,096 / 10,000 rows 189s accuracy so far 0.798
18
+ 4,352 / 10,000 rows 202s accuracy so far 0.797
19
+ 4,608 / 10,000 rows 216s accuracy so far 0.795
20
+ 4,864 / 10,000 rows 226s accuracy so far 0.795
21
+ 5,120 / 10,000 rows 237s accuracy so far 0.796
22
+ 5,376 / 10,000 rows 252s accuracy so far 0.797
23
+ 5,632 / 10,000 rows 265s accuracy so far 0.797
24
+ 5,888 / 10,000 rows 277s accuracy so far 0.797
25
+ 6,144 / 10,000 rows 290s accuracy so far 0.797
26
+ 6,400 / 10,000 rows 300s accuracy so far 0.797
27
+ 6,656 / 10,000 rows 313s accuracy so far 0.797
28
+ 6,912 / 10,000 rows 326s accuracy so far 0.799
29
+ 7,168 / 10,000 rows 337s accuracy so far 0.798
30
+ 7,424 / 10,000 rows 348s accuracy so far 0.797
31
+ 7,680 / 10,000 rows 361s accuracy so far 0.795
32
+ 7,936 / 10,000 rows 373s accuracy so far 0.795
33
+ 8,192 / 10,000 rows 382s accuracy so far 0.796
34
+ 8,448 / 10,000 rows 393s accuracy so far 0.796
35
+ 8,704 / 10,000 rows 404s accuracy so far 0.796
36
+ 8,960 / 10,000 rows 414s accuracy so far 0.796
37
+ 9,216 / 10,000 rows 427s accuracy so far 0.796
38
+ 9,472 / 10,000 rows 437s accuracy so far 0.797
39
+ 9,728 / 10,000 rows 449s accuracy so far 0.797
40
+ 9,984 / 10,000 rows 461s accuracy so far 0.797
41
+ 10,000 / 10,000 rows 462s accuracy so far 0.797
42
+ all {'n': 13371, 'accuracy': 0.7968, 'brier': 0.2639, 'nll': 0.5223, 'ece': 0.0213}
43
+ source/bev_tr {'n': 6122, 'accuracy': 0.8383, 'brier': 0.2217, 'nll': 0.3967, 'ece': 0.0104}
44
+ source/bev_tr_en {'n': 852, 'accuracy': 0.777, 'brier': 0.2821, 'nll': 0.5, 'ece': 0.0313}
45
+ source/beyazperde_tr {'n': 631, 'accuracy': 0.6466, 'brier': 0.4678, 'nll': 0.8605, 'ece': 0.0735}
46
+ source/jev_bench_tr {'n': 2986, 'accuracy': 0.7029, 'brier': 0.3414, 'nll': 0.8115, 'ece': 0.0586}
47
+ source/jev_bench_tr_en {'n': 278, 'accuracy': 0.7662, 'brier': 0.2858, 'nll': 0.7261, 'ece': 0.0676}
48
+ source/massive_tr {'n': 416, 'accuracy': 0.8894, 'brier': 0.158, 'nll': 0.3759, 'ece': 0.0261}
49
+ source/squad_tr {'n': 1454, 'accuracy': 0.8583, 'brier': 0.2133, 'nll': 0.3509, 'ece': 0.0283}
50
+ source/xnli_tr {'n': 632, 'accuracy': 0.8259, 'brier': 0.2537, 'nll': 0.4652, 'ece': 0.0423}
51
+ type/choice {'n': 5197, 'accuracy': 0.8078, 'brier': 0.2407, 'nll': 0.5551, 'ece': 0.0268}
52
+ type/noul {'n': 5216, 'accuracy': 0.8735, 'brier': 0.1772, 'nll': 0.2959, 'ece': 0.0192}
53
+ type/score {'n': 2958, 'accuracy': 0.6423, 'brier': 0.4575, 'nll': 0.8638, 'ece': 0.0284}
54
+ squad_tr/answerability {'auroc': 0.9316, 'acc_answerable': 0.9371, 'acc_unanswerable': 0.7759}
55
+ skipped decisions: {}
56
+ FP8: 200 linear layers
57
+ decider-4b-v2.1-tr-lora on 10,000 rows (13,371 decisions)
58
+ 256 / 10,000 rows 14s accuracy so far 0.783
59
+ 512 / 10,000 rows 27s accuracy so far 0.779
60
+ 768 / 10,000 rows 37s accuracy so far 0.790
61
+ 1,024 / 10,000 rows 51s accuracy so far 0.789
62
+ 1,280 / 10,000 rows 61s accuracy so far 0.786
63
+ 1,536 / 10,000 rows 74s accuracy so far 0.786
64
+ 1,792 / 10,000 rows 87s accuracy so far 0.794
65
+ 2,048 / 10,000 rows 99s accuracy so far 0.792
66
+ 2,304 / 10,000 rows 109s accuracy so far 0.789
67
+ 2,560 / 10,000 rows 119s accuracy so far 0.787
68
+ 2,816 / 10,000 rows 130s accuracy so far 0.789
69
+ 3,072 / 10,000 rows 140s accuracy so far 0.788
70
+ 3,328 / 10,000 rows 151s accuracy so far 0.788
71
+ 3,584 / 10,000 rows 162s accuracy so far 0.793
72
+ 3,840 / 10,000 rows 173s accuracy so far 0.796
73
+ 4,096 / 10,000 rows 184s accuracy so far 0.798
74
+ 4,352 / 10,000 rows 196s accuracy so far 0.796
75
+ 4,608 / 10,000 rows 209s accuracy so far 0.796
76
+ 4,864 / 10,000 rows 219s accuracy so far 0.796
77
+ 5,120 / 10,000 rows 230s accuracy so far 0.796
78
+ 5,376 / 10,000 rows 244s accuracy so far 0.797
79
+ 5,632 / 10,000 rows 257s accuracy so far 0.798
80
+ 5,888 / 10,000 rows 268s accuracy so far 0.797
81
+ 6,144 / 10,000 rows 281s accuracy so far 0.797
82
+ 6,400 / 10,000 rows 291s accuracy so far 0.797
83
+ 6,656 / 10,000 rows 303s accuracy so far 0.797
84
+ 6,912 / 10,000 rows 316s accuracy so far 0.798
85
+ 7,168 / 10,000 rows 326s accuracy so far 0.797
86
+ 7,424 / 10,000 rows 337s accuracy so far 0.796
87
+ 7,680 / 10,000 rows 349s accuracy so far 0.795
88
+ 7,936 / 10,000 rows 360s accuracy so far 0.794
89
+ 8,192 / 10,000 rows 368s accuracy so far 0.796
90
+ 8,448 / 10,000 rows 379s accuracy so far 0.795
91
+ 8,704 / 10,000 rows 390s accuracy so far 0.796
92
+ 8,960 / 10,000 rows 400s accuracy so far 0.796
93
+ 9,216 / 10,000 rows 412s accuracy so far 0.795
94
+ 9,472 / 10,000 rows 422s accuracy so far 0.796
95
+ 9,728 / 10,000 rows 434s accuracy so far 0.797
96
+ 9,984 / 10,000 rows 446s accuracy so far 0.796
97
+ 10,000 / 10,000 rows 447s accuracy so far 0.796
98
+ all {'n': 13371, 'accuracy': 0.7965, 'brier': 0.2645, 'nll': 0.5237, 'ece': 0.0209}
99
+ source/bev_tr {'n': 6122, 'accuracy': 0.8381, 'brier': 0.2217, 'nll': 0.3972, 'ece': 0.0112}
100
+ source/bev_tr_en {'n': 852, 'accuracy': 0.7782, 'brier': 0.2807, 'nll': 0.497, 'ece': 0.0288}
101
+ source/beyazperde_tr {'n': 631, 'accuracy': 0.6403, 'brier': 0.4695, 'nll': 0.8628, 'ece': 0.0631}
102
+ source/jev_bench_tr {'n': 2986, 'accuracy': 0.7036, 'brier': 0.3436, 'nll': 0.8157, 'ece': 0.0604}
103
+ source/jev_bench_tr_en {'n': 278, 'accuracy': 0.7662, 'brier': 0.2867, 'nll': 0.7303, 'ece': 0.0868}
104
+ source/massive_tr {'n': 416, 'accuracy': 0.8918, 'brier': 0.1612, 'nll': 0.3838, 'ece': 0.0236}
105
+ source/squad_tr {'n': 1454, 'accuracy': 0.8569, 'brier': 0.2134, 'nll': 0.351, 'ece': 0.0252}
106
+ source/xnli_tr {'n': 632, 'accuracy': 0.8244, 'brier': 0.2548, 'nll': 0.4658, 'ece': 0.0368}
107
+ type/choice {'n': 5197, 'accuracy': 0.8064, 'brier': 0.2418, 'nll': 0.5571, 'ece': 0.0287}
108
+ type/noul {'n': 5216, 'accuracy': 0.8752, 'brier': 0.1774, 'nll': 0.297, 'ece': 0.0203}
109
+ type/score {'n': 2958, 'accuracy': 0.6403, 'brier': 0.458, 'nll': 0.865, 'ece': 0.0274}
110
+ squad_tr/answerability {'auroc': 0.9318, 'acc_answerable': 0.9357, 'acc_unanswerable': 0.7732}
111
+ skipped decisions: {}
112
+ Installed 57 packages in 342ms
113
+ {"fp8": false, "fp8_layers": 0, "requests": 300, "decisions": 432, "latency_ms_p50": 23.5, "latency_ms_p90": 83.2, "decisions_per_s": 4.0, "gpu": "NVIDIA GeForce RTX 5090"}
114
+ {"fp8": true, "fp8_layers": 200, "requests": 300, "decisions": 432, "latency_ms_p50": 14.7, "latency_ms_p90": 90.2, "decisions_per_s": 5.3, "gpu": "NVIDIA GeForce RTX 5090"}
115
+ FP8 DONE
training/meta.json ADDED
@@ -0,0 +1,21 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "key": "435f5337f79d0547",
3
+ "train": {
4
+ "rows": 63990,
5
+ "items": 169657,
6
+ "replay_items": 22217,
7
+ "tokens": 56858516,
8
+ "tokens_p50": 218,
9
+ "tokens_max": 4163,
10
+ "skipped": {}
11
+ },
12
+ "holdout": {
13
+ "rows": 1500,
14
+ "items": 3826,
15
+ "replay_items": 0,
16
+ "tokens": 1277818,
17
+ "tokens_p50": 226,
18
+ "tokens_max": 4163,
19
+ "skipped": {}
20
+ }
21
+ }
training/train_log.jsonl ADDED
@@ -0,0 +1 @@
 
 
1
+ {"epoch_end": 1, "val_rows": 3826, "val_slot_accuracy": 0.8907, "val_ce": 0.2603}