APUS-OpenJev-v1 / 9B-3000 /merged-evaluation.json
gump2049's picture
Publish complete APUS-OpenJev-v1 models and Technical Report v1.1
68e5880 verified
Raw
History Blame Contribute Delete
3.4 kB
{
"scope": "80 fixed requests, both explicit efforts; merged-model comparison, not independent generalization evidence",
"checkpoint_step": 3000,
"base_id": "Qwen/Qwen3.5-9B",
"base_revision": "c202236235762e1c871ad0ccb60c8ee5ba337b9a",
"comparison": {
"passed": false,
"gate": "identical160_argmax_and_max_probability_delta_le_0.05",
"depths": {
"16": {
"before_correct": 63,
"after_correct": 63,
"changed_decisions": [],
"max_probability_abs_difference": 0.08810508251190186,
"mean_probability_abs_difference": 0.0019464968157012663,
"max_logit_abs_difference": 0.265625,
"mean_logit_abs_difference": 0.02963104248046875
},
"32": {
"before_correct": 68,
"after_correct": 68,
"changed_decisions": [],
"max_probability_abs_difference": 0.062176525592803955,
"mean_probability_abs_difference": 0.001304240933347387,
"max_logit_abs_difference": 0.25,
"mean_logit_abs_difference": 0.03828125
}
},
"before_sha256": "28412c70d8b456b35bb884a2fba4e85801b0135fc7957190927994a56d268a6f",
"after_sha256": "3f01a868d4fba91a8a1749df37a87f10f0874823eec5a978291c93231773c365",
"verified_at_unix": 1789984423.7235599
},
"runtime_validation": {
"status": "passed",
"decisions": 160,
"max_probability_delta": 0.0,
"no_jev_import": true,
"long_input_rejected": true,
"invalid_effort_rejected": true,
"text_scope": "Execution smoke only; not TYPE accuracy or speed validation",
"source_sha256": "70d686828090965063966dddac6d8454cf981c6614a406c1647617986e534c5d"
},
"decision_release": {
"passed": true,
"scope": "Independent BF16 merged variant, frozen80 decision parity; NOT a probability-equivalent replacement",
"post_observation_scope_amendment": true,
"original_numerical_gate_passed": false,
"original_gate": "identical160_argmax_and_max_probability_delta_le_0.05",
"original_comparison_sha256": "d2ea8a7af10f09fdfde166384ffb18fb5a19ebf1a1281c58cb72806a45878c41",
"decision_agreement": 160,
"total_decisions": 160,
"independent_questions": 80,
"probability_calibration_transfer_validated": false,
"automatic_routing_validated": false,
"required_followup": "Recalibrate all probability, rejection and routing thresholds; independently evaluate new tasks",
"depths": {
"16": {
"before_correct": 63,
"after_correct": 63,
"changed_decisions": [],
"max_probability_abs_difference": 0.08810508251190186,
"mean_probability_abs_difference": 0.0019464968157012663,
"max_logit_abs_difference": 0.265625,
"mean_logit_abs_difference": 0.02963104248046875
},
"32": {
"before_correct": 68,
"after_correct": 68,
"changed_decisions": [],
"max_probability_abs_difference": 0.062176525592803955,
"mean_probability_abs_difference": 0.001304240933347387,
"max_logit_abs_difference": 0.25,
"mean_logit_abs_difference": 0.03828125
}
},
"publication_requires": "Further portable-runtime160, weight arithmetic, full file hashes and fresh HF reload gates"
},
"reviewed_variant": {},
"decision_parity_passed": true,
"decision_agreement": 160,
"weight_arithmetic_status": "passed",
"raw_inputs_included": false
}