{ "scope": "80 fixed requests, both explicit efforts; merged-model comparison, not independent generalization evidence", "checkpoint_step": 3000, "base_id": "Qwen/Qwen3.5-9B", "base_revision": "c202236235762e1c871ad0ccb60c8ee5ba337b9a", "comparison": { "passed": false, "gate": "identical160_argmax_and_max_probability_delta_le_0.05", "depths": { "16": { "before_correct": 63, "after_correct": 63, "changed_decisions": [], "max_probability_abs_difference": 0.08810508251190186, "mean_probability_abs_difference": 0.0019464968157012663, "max_logit_abs_difference": 0.265625, "mean_logit_abs_difference": 0.02963104248046875 }, "32": { "before_correct": 68, "after_correct": 68, "changed_decisions": [], "max_probability_abs_difference": 0.062176525592803955, "mean_probability_abs_difference": 0.001304240933347387, "max_logit_abs_difference": 0.25, "mean_logit_abs_difference": 0.03828125 } }, "before_sha256": "28412c70d8b456b35bb884a2fba4e85801b0135fc7957190927994a56d268a6f", "after_sha256": "3f01a868d4fba91a8a1749df37a87f10f0874823eec5a978291c93231773c365", "verified_at_unix": 1789984423.7235599 }, "runtime_validation": { "status": "passed", "decisions": 160, "max_probability_delta": 0.0, "no_jev_import": true, "long_input_rejected": true, "invalid_effort_rejected": true, "text_scope": "Execution smoke only; not TYPE accuracy or speed validation", "source_sha256": "70d686828090965063966dddac6d8454cf981c6614a406c1647617986e534c5d" }, "decision_release": { "passed": true, "scope": "Independent BF16 merged variant, frozen80 decision parity; NOT a probability-equivalent replacement", "post_observation_scope_amendment": true, "original_numerical_gate_passed": false, "original_gate": "identical160_argmax_and_max_probability_delta_le_0.05", "original_comparison_sha256": "d2ea8a7af10f09fdfde166384ffb18fb5a19ebf1a1281c58cb72806a45878c41", "decision_agreement": 160, "total_decisions": 160, "independent_questions": 80, "probability_calibration_transfer_validated": false, "automatic_routing_validated": false, "required_followup": "Recalibrate all probability, rejection and routing thresholds; independently evaluate new tasks", "depths": { "16": { "before_correct": 63, "after_correct": 63, "changed_decisions": [], "max_probability_abs_difference": 0.08810508251190186, "mean_probability_abs_difference": 0.0019464968157012663, "max_logit_abs_difference": 0.265625, "mean_logit_abs_difference": 0.02963104248046875 }, "32": { "before_correct": 68, "after_correct": 68, "changed_decisions": [], "max_probability_abs_difference": 0.062176525592803955, "mean_probability_abs_difference": 0.001304240933347387, "max_logit_abs_difference": 0.25, "mean_logit_abs_difference": 0.03828125 } }, "publication_requires": "Further portable-runtime160, weight arithmetic, full file hashes and fresh HF reload gates" }, "reviewed_variant": {}, "decision_parity_passed": true, "decision_agreement": 160, "weight_arithmetic_status": "passed", "raw_inputs_included": false }