dottreo commited on
Commit
ba4944d
·
verified ·
1 Parent(s): 4234aeb

Add more benchmark results

Browse files
Files changed (1) hide show
  1. README.md +63 -18
README.md CHANGED
@@ -51,24 +51,69 @@ rys_30-33 shows the best combined improvement across reasoning categories. rys_3
51
 
52
  ---
53
 
54
- ## Benchmark scores
55
-
56
- Initial, partial benchmark results from running BFCLv4. Scores of other models from Leaderboard.
57
-
58
-
59
- | Task | Qwen3.5-27B-RYS-30-34 (Δ vs Best) | Claude Opus 4.5 (FC) | Claude Sonnet 4.5 (FC) | GLM 4.6 (FC) | Grok-4 (FC) | GPT-5.2 (FC) |
60
- |------|-----------------------------------|---------------------|-----------------------|--------------|-------------|--------------|
61
- | irrelevance | 86.67% (-1.25%) | 85.83% | **87.92%** | 85.42% | 77.50% | 80.00% |
62
- | multiple | **96.50%** | 95.50% | 95.50% | 95.00% | 92.50% | 88.00% |
63
- | simple_java | 62.00% (-2.00%) | 60.00% | 62.00% | **64.00%** | 62.00% | 62.00% |
64
- | simple_javascript | 72.00% (-2.00%) | **74.00%** | 58.00% | 64.00% | 66.00% | 64.00% |
65
- | simple_python | 95.25% (-2.50%) | 96.50% | **97.75%** | 94.75% | 92.50% | 92.75% |
66
- | live_irrelevance | 82.24% (-3.05%) | 83.60% | **85.29%** | 84.50% | 73.30% | 78.85% |
67
- | live_multiple | **79.68%** | 78.16% | 78.92% | 78.92% | 73.88% | 70.37% |
68
- | live_relevance | 81.25% (-6.25%) | 62.50% | 68.75% | 75.00% | **87.50%** | 75.00% |
69
- | live_simple | 84.50% (-5.03%) | 86.43% | **89.53%** | **89.53%** | 82.17% | 71.71% |
70
- | multi_turn_base | 74.50% (-6.50%) | **81.00%** | 69.00% | 74.50% | 44.00% | 36.50% |
71
- | multi_turn_long_context | 67.50% (-3.00%) | **70.50%** | 59.00% | 66.50% | 44.00% | 30.50% |
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
72
 
73
  ---
74
 
 
51
 
52
  ---
53
 
54
+ # Benchmarks (based on BFCLv4)
55
+
56
+ ## Non-Live Tests
57
+
58
+ | Task | Qwen3.5-27B-RYS-30-34 (Δ vs Best) | Qwen3.5-27B-FC (Baseline) | Claude Opus 4.5 (FC) | Claude Sonnet 4.5 (FC) | GLM 4.6 (FC) | Grok-4 (FC) | GPT-5.2 (FC) |
59
+ |------|-----------------------------------|--------------------------|---------------------|-----------------------|--------------|-------------|--------------|
60
+ | irrelevance | 86.67% (-1.25%) | 87.50% | 85.83% | **87.92%** | 85.42% | 77.50% | 80.00% |
61
+ | multiple | **96.50%** | 96.50% | 95.50% | 95.50% | 95.00% | 92.50% | 88.00% |
62
+ | parallel | **95.00%** | 93.00% | 93.50% | 94.50% | 91.50% | 88.50% | 89.00% |
63
+ | parallel_multiple | 91.50% (-0.50%) | 76.00% | 88.50% | **92.00%** | 89.50% | 87.00% | 77.50% |
64
+ | simple_java | 62.00% (-3.00%) | **65.00%** | 60.00% | 62.00% | 64.00% | 62.00% | 62.00% |
65
+ | simple_javascript | 72.00% (-2.00%) | 66.00% | **74.00%** | 58.00% | 64.00% | 66.00% | 64.00% |
66
+ | simple_python | 95.25% (-2.50%) | 95.00% | 96.50% | **97.75%** | 94.75% | 92.50% | 92.75% |
67
+
68
+ ## Live Tests
69
+
70
+ | Task | Qwen3.5-27B-RYS-30-34 (Δ vs Best) | Qwen3.5-27B-FC (Baseline) | Claude Opus 4.5 (FC) | Claude Sonnet 4.5 (FC) | GLM 4.6 (FC) | Grok-4 (FC) | GPT-5.2 (FC) |
71
+ |------|-----------------------------------|--------------------------|---------------------|-----------------------|--------------|-------------|--------------|
72
+ | live_irrelevance | 82.24% (-3.05%) | 80.88% | 83.60% | **85.29%** | 84.50% | 73.30% | 78.85% |
73
+ | live_multiple | 79.68% (-1.14%) | **80.82%** | 78.16% | 78.92% | 78.92% | 73.88% | 70.37% |
74
+ | live_parallel | 81.25% (-6.25%) | **87.50%** | **87.50%** | **87.50%** | 81.25% | 75.00% | 68.75% |
75
+ | live_parallel_multiple | 75.00% (-8.33%) | 79.17% | 75.00% | **83.33%** | 75.00% | 79.17% | 58.33% |
76
+ | live_relevance | 81.25% (-6.25%) | 68.75% | 62.50% | 68.75% | 75.00% | **87.50%** | 75.00% |
77
+ | live_simple | 84.50% (-5.03%) | 87.60% | 86.43% | **89.53%** | **89.53%** | 82.17% | 71.71% |
78
+
79
+ ## Multi-Turn Tests
80
+
81
+ | Task | Qwen3.5-27B-RYS-30-34 (Δ vs Best) | Qwen3.5-27B-FC (Baseline) | Claude Opus 4.5 (FC) | Claude Sonnet 4.5 (FC) | GLM 4.6 (FC) | Grok-4 (FC) | GPT-5.2 (FC) |
82
+ |------|-----------------------------------|--------------------------|---------------------|-----------------------|--------------|-------------|--------------|
83
+ | multi_turn_base | 74.50% (-6.50%) | 70.50% | **81.00%** | 69.00% | 74.50% | 44.00% | 36.50% |
84
+ | multi_turn_long_context | 67.50% (-3.00%) | 59.00% | **70.50%** | 59.00% | 66.50% | 44.00% | 30.50% |
85
+
86
+ ## Memory Tests (Agentic)
87
+
88
+ | Task | Qwen3.5-27B-RYS-30-34 (Δ vs Best) | Qwen3.5-27B-FC (Baseline) | Claude Opus 4.5 (FC) | Claude Sonnet 4.5 (FC) | GLM 4.6 (FC) | Grok-4 (FC) | GPT-5.2 (FC) |
89
+ |------|-----------------------------------|--------------------------|---------------------|-----------------------|--------------|-------------|--------------|
90
+ | memory_kv | 45.81% (-25.16%) | N/A | **70.97%** | 54.19% | 43.87% | 57.42% | 33.55% |
91
+ | memory_rec_sum | 70.97% (-12.26%) | N/A | 77.42% | **83.23%** | 67.10% | 51.61% | 60.65% |
92
+ | memory_vector | 63.23% (-9.67%) | N/A | **72.90%** | 57.42% | 56.13% | 58.71% | 43.23% |
93
+
94
+ ## RYS vs Baseline Comparison (All Tests)
95
+
96
+ | Task | RYS | Baseline | Δ (RYS - Baseline) |
97
+ |------|-----|----------|-------------------|
98
+ | irrelevance | 86.67% | 87.50% | **-0.83%** |
99
+ | multiple | 96.50% | 96.50% | **0.00%** |
100
+ | parallel | 95.00% | 93.00% | **+2.00%** ✅ |
101
+ | parallel_multiple | 91.50% | 76.00% | **+15.50%** ✅ |
102
+ | simple_java | 62.00% | 65.00% | **-3.00%** |
103
+ | simple_javascript | 72.00% | 66.00% | **+6.00%** ✅ |
104
+ | simple_python | 95.25% | 95.00% | **+0.25%** |
105
+ | live_irrelevance | 82.24% | 80.88% | **+1.36%** ✅ |
106
+ | live_multiple | 79.68% | 80.82% | **-1.14%** |
107
+ | live_parallel | 81.25% | 87.50% | **-6.25%** |
108
+ | live_parallel_multiple | 75.00% | 79.17% | **-4.17%** |
109
+ | live_relevance | 81.25% | 68.75% | **+12.50%** ✅ |
110
+ | live_simple | 84.50% | 87.60% | **-3.10%** |
111
+ | multi_turn_base | 74.50% | 70.50% | **+4.00%** ✅ |
112
+ | multi_turn_long_context | 67.50% | 59.00% | **+8.50%** ✅ |
113
+ | memory_kv | 45.81% | N/A | ✅ |
114
+ | memory_rec_sum | 70.97% | N/A | ✅ |
115
+ | memory_vector | 63.23% | N/A | ✅ |
116
+
117
 
118
  ---
119