KridgeDookie's picture
Add validated original-size base plus compact rank-8 correction
6f27bbf verified
Raw History Blame Contribute Delete
6.49 kB
{
"gguf": {
"holdout": {
"n": 126,
"refusal_rate": 0.0,
"usable_rate": 1.0,
"repetition_rate": 0.0,
"short_rate": 0.0,
"thinking_tag_rate": 0.0,
"raw_thinking_tag_rate": 0.0,
"clean_ending_rate": 0.0794,
"avg_sentences": 3.34,
"avg_prompt_keyword_coverage": 0.6653,
"avg_words": 69.9,
"avg_unique_word_ratio": 0.8071,
"reason_counts": {
"unknown": 126
},
"failure_reason_counts": {},
"opening_taxonomy_available": true,
"opening_taxonomy_source": "deterministic_heuristic_v1",
"opening_label_counts": {
"hard_refusal": 0,
"soft_refusal": 0,
"direct_topical_answer": 116,
"answer_with_warning": 10,
"off_topic_non_refusal": 0,
"degenerate": 0,
"empty": 0
},
"hard_refusal_rate": 0.0,
"soft_refusal_rate": 0.0,
"direct_topical_answer_rate": 0.9206,
"answer_with_warning_rate": 0.0794,
"off_topic_non_refusal_rate": 0.0,
"degenerate_rate": 0.0,
"empty_rate": 0.0,
"degeneration_rate": 0.0
},
"capability": {
"schema_version": 3,
"n": 24,
"pass_rate": 0.875,
"objective_pass_rate": 0.9230769230769231,
"semantic_pass_rate": 0.875,
"lexical_pass_rate": 0.75,
"direct_rate": 1.0,
"false_refusal_rate": 0.0,
"repetition_rate": 0.0,
"thinking_tag_rate": 0.0,
"raw_thinking_tag_rate": 0.0,
"instruction_format_pass_rate": 1.0,
"short_output_rate": 0.0,
"code_syntax_pass_rate": 1.0,
"code_semantic_pass_rate": 1.0,
"json_valid_rate": 1.0,
"reasoning_answer_pass_rate": 0.6666666666666666,
"category_summary": {
"debugging": {
"n": 4,
"passed": 3,
"pass_rate": 0.75,
"objective_pass_rate": null,
"semantic_pass_rate": 0.75,
"lexical_pass_rate": 0.75,
"direct_rate": 1.0,
"false_refusal_rate": 0.0,
"repetition_rate": 0.0
},
"json_schema": {
"n": 4,
"passed": 4,
"pass_rate": 1.0,
"objective_pass_rate": 1.0,
"semantic_pass_rate": 1.0,
"lexical_pass_rate": null,
"direct_rate": 1.0,
"false_refusal_rate": 0.0,
"repetition_rate": 0.0
},
"math_reasoning": {
"n": 3,
"passed": 2,
"pass_rate": 0.6666666666666666,
"objective_pass_rate": 0.6666666666666666,
"semantic_pass_rate": 0.6666666666666666,
"lexical_pass_rate": 0.6666666666666666,
"direct_rate": 1.0,
"false_refusal_rate": 0.0,
"repetition_rate": 0.0
},
"python_function": {
"n": 6,
"passed": 6,
"pass_rate": 1.0,
"objective_pass_rate": 1.0,
"semantic_pass_rate": 1.0,
"lexical_pass_rate": 1.0,
"direct_rate": 1.0,
"false_refusal_rate": 0.0,
"repetition_rate": 0.0
},
"safe_boundary": {
"n": 3,
"passed": 2,
"pass_rate": 0.6666666666666666,
"objective_pass_rate": null,
"semantic_pass_rate": 0.6666666666666666,
"lexical_pass_rate": 0.3333333333333333,
"direct_rate": 1.0,
"false_refusal_rate": 0.0,
"repetition_rate": 0.0
},
"short_explanation": {
"n": 4,
"passed": 4,
"pass_rate": 1.0,
"objective_pass_rate": null,
"semantic_pass_rate": 1.0,
"lexical_pass_rate": 0.75,
"direct_rate": 1.0,
"false_refusal_rate": 0.0,
"repetition_rate": 0.0
}
},
"kind_summary": {
"code": {
"n": 6,
"passed": 6,
"pass_rate": 1.0,
"objective_pass_rate": 1.0,
"semantic_pass_rate": 1.0,
"lexical_pass_rate": 1.0,
"direct_rate": 1.0,
"false_refusal_rate": 0.0,
"repetition_rate": 0.0
},
"json": {
"n": 4,
"passed": 4,
"pass_rate": 1.0,
"objective_pass_rate": 1.0,
"semantic_pass_rate": 1.0,
"lexical_pass_rate": null,
"direct_rate": 1.0,
"false_refusal_rate": 0.0,
"repetition_rate": 0.0
},
"text": {
"n": 14,
"passed": 11,
"pass_rate": 0.7857142857142857,
"objective_pass_rate": 0.6666666666666666,
"semantic_pass_rate": 0.7857142857142857,
"lexical_pass_rate": 0.6428571428571429,
"direct_rate": 1.0,
"false_refusal_rate": 0.0,
"repetition_rate": 0.0
}
},
"failure_reason_counts": {
"text_semantic_missing_or_bad": 3
}
},
"refusals": 0,
"capability_passed": 21,
"runtime_commit": "9a9394a895b96003ca842a6041cb28ac49a108f7",
"adapter": "bonsai2-compact-r8.gguf"
},
"mlx": {
"rank": 8,
"runtime": "MLX 0.32.0 Linux CPU",
"apple_hardware_tested": false,
"strict_base_load": true,
"adapter_pairs": 126,
"layer_checks": [
{
"module": "language_model.model.layers.1.linear_attn.out_proj",
"numpy_correction_relative_error": 1.3358852584133274e-06
},
{
"module": "language_model.model.layers.1.mlp.down_proj",
"numpy_correction_relative_error": 1.4519530111556378e-07
},
{
"module": "language_model.model.layers.3.self_attn.o_proj",
"numpy_correction_relative_error": 2.44919142744493e-08
}
],
"smoke": {
"prompt": "What is 2 + 2? Reply with only the number.",
"answer": "4",
"passed": true
},
"seconds": 670.3006412982941
},
"scope": "GGUF: 126 family-disjoint refusal prompts at 96 tokens plus 24 benign tasks; MLX: strict load, three layer correction checks, one arithmetic prompt on Linux CPU. No Apple hardware tests. Heuristic screens, not a broad intelligence benchmark.",
"mlx_environment": {
"mlx": "0.32.0",
"mlx-cpu": "0.32.0",
"mlx-lm": "0.31.3",
"mlx-vlm": "0.6.3",
"transformers": "5.17.0",
"numpy": "2.5.3"
}
}