File size: 6,487 Bytes
6f27bbf
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
{
  "gguf": {
    "holdout": {
      "n": 126,
      "refusal_rate": 0.0,
      "usable_rate": 1.0,
      "repetition_rate": 0.0,
      "short_rate": 0.0,
      "thinking_tag_rate": 0.0,
      "raw_thinking_tag_rate": 0.0,
      "clean_ending_rate": 0.0794,
      "avg_sentences": 3.34,
      "avg_prompt_keyword_coverage": 0.6653,
      "avg_words": 69.9,
      "avg_unique_word_ratio": 0.8071,
      "reason_counts": {
        "unknown": 126
      },
      "failure_reason_counts": {},
      "opening_taxonomy_available": true,
      "opening_taxonomy_source": "deterministic_heuristic_v1",
      "opening_label_counts": {
        "hard_refusal": 0,
        "soft_refusal": 0,
        "direct_topical_answer": 116,
        "answer_with_warning": 10,
        "off_topic_non_refusal": 0,
        "degenerate": 0,
        "empty": 0
      },
      "hard_refusal_rate": 0.0,
      "soft_refusal_rate": 0.0,
      "direct_topical_answer_rate": 0.9206,
      "answer_with_warning_rate": 0.0794,
      "off_topic_non_refusal_rate": 0.0,
      "degenerate_rate": 0.0,
      "empty_rate": 0.0,
      "degeneration_rate": 0.0
    },
    "capability": {
      "schema_version": 3,
      "n": 24,
      "pass_rate": 0.875,
      "objective_pass_rate": 0.9230769230769231,
      "semantic_pass_rate": 0.875,
      "lexical_pass_rate": 0.75,
      "direct_rate": 1.0,
      "false_refusal_rate": 0.0,
      "repetition_rate": 0.0,
      "thinking_tag_rate": 0.0,
      "raw_thinking_tag_rate": 0.0,
      "instruction_format_pass_rate": 1.0,
      "short_output_rate": 0.0,
      "code_syntax_pass_rate": 1.0,
      "code_semantic_pass_rate": 1.0,
      "json_valid_rate": 1.0,
      "reasoning_answer_pass_rate": 0.6666666666666666,
      "category_summary": {
        "debugging": {
          "n": 4,
          "passed": 3,
          "pass_rate": 0.75,
          "objective_pass_rate": null,
          "semantic_pass_rate": 0.75,
          "lexical_pass_rate": 0.75,
          "direct_rate": 1.0,
          "false_refusal_rate": 0.0,
          "repetition_rate": 0.0
        },
        "json_schema": {
          "n": 4,
          "passed": 4,
          "pass_rate": 1.0,
          "objective_pass_rate": 1.0,
          "semantic_pass_rate": 1.0,
          "lexical_pass_rate": null,
          "direct_rate": 1.0,
          "false_refusal_rate": 0.0,
          "repetition_rate": 0.0
        },
        "math_reasoning": {
          "n": 3,
          "passed": 2,
          "pass_rate": 0.6666666666666666,
          "objective_pass_rate": 0.6666666666666666,
          "semantic_pass_rate": 0.6666666666666666,
          "lexical_pass_rate": 0.6666666666666666,
          "direct_rate": 1.0,
          "false_refusal_rate": 0.0,
          "repetition_rate": 0.0
        },
        "python_function": {
          "n": 6,
          "passed": 6,
          "pass_rate": 1.0,
          "objective_pass_rate": 1.0,
          "semantic_pass_rate": 1.0,
          "lexical_pass_rate": 1.0,
          "direct_rate": 1.0,
          "false_refusal_rate": 0.0,
          "repetition_rate": 0.0
        },
        "safe_boundary": {
          "n": 3,
          "passed": 2,
          "pass_rate": 0.6666666666666666,
          "objective_pass_rate": null,
          "semantic_pass_rate": 0.6666666666666666,
          "lexical_pass_rate": 0.3333333333333333,
          "direct_rate": 1.0,
          "false_refusal_rate": 0.0,
          "repetition_rate": 0.0
        },
        "short_explanation": {
          "n": 4,
          "passed": 4,
          "pass_rate": 1.0,
          "objective_pass_rate": null,
          "semantic_pass_rate": 1.0,
          "lexical_pass_rate": 0.75,
          "direct_rate": 1.0,
          "false_refusal_rate": 0.0,
          "repetition_rate": 0.0
        }
      },
      "kind_summary": {
        "code": {
          "n": 6,
          "passed": 6,
          "pass_rate": 1.0,
          "objective_pass_rate": 1.0,
          "semantic_pass_rate": 1.0,
          "lexical_pass_rate": 1.0,
          "direct_rate": 1.0,
          "false_refusal_rate": 0.0,
          "repetition_rate": 0.0
        },
        "json": {
          "n": 4,
          "passed": 4,
          "pass_rate": 1.0,
          "objective_pass_rate": 1.0,
          "semantic_pass_rate": 1.0,
          "lexical_pass_rate": null,
          "direct_rate": 1.0,
          "false_refusal_rate": 0.0,
          "repetition_rate": 0.0
        },
        "text": {
          "n": 14,
          "passed": 11,
          "pass_rate": 0.7857142857142857,
          "objective_pass_rate": 0.6666666666666666,
          "semantic_pass_rate": 0.7857142857142857,
          "lexical_pass_rate": 0.6428571428571429,
          "direct_rate": 1.0,
          "false_refusal_rate": 0.0,
          "repetition_rate": 0.0
        }
      },
      "failure_reason_counts": {
        "text_semantic_missing_or_bad": 3
      }
    },
    "refusals": 0,
    "capability_passed": 21,
    "runtime_commit": "9a9394a895b96003ca842a6041cb28ac49a108f7",
    "adapter": "bonsai2-compact-r8.gguf"
  },
  "mlx": {
    "rank": 8,
    "runtime": "MLX 0.32.0 Linux CPU",
    "apple_hardware_tested": false,
    "strict_base_load": true,
    "adapter_pairs": 126,
    "layer_checks": [
      {
        "module": "language_model.model.layers.1.linear_attn.out_proj",
        "numpy_correction_relative_error": 1.3358852584133274e-06
      },
      {
        "module": "language_model.model.layers.1.mlp.down_proj",
        "numpy_correction_relative_error": 1.4519530111556378e-07
      },
      {
        "module": "language_model.model.layers.3.self_attn.o_proj",
        "numpy_correction_relative_error": 2.44919142744493e-08
      }
    ],
    "smoke": {
      "prompt": "What is 2 + 2? Reply with only the number.",
      "answer": "4",
      "passed": true
    },
    "seconds": 670.3006412982941
  },
  "scope": "GGUF: 126 family-disjoint refusal prompts at 96 tokens plus 24 benign tasks; MLX: strict load, three layer correction checks, one arithmetic prompt on Linux CPU. No Apple hardware tests. Heuristic screens, not a broad intelligence benchmark.",
  "mlx_environment": {
    "mlx": "0.32.0",
    "mlx-cpu": "0.32.0",
    "mlx-lm": "0.31.3",
    "mlx-vlm": "0.6.3",
    "transformers": "5.17.0",
    "numpy": "2.5.3"
  }
}