{ "scope": "80 fixed requests, both explicit efforts; merged-model comparison, not independent generalization evidence", "checkpoint_step": 5949, "base_id": "Qwen/Qwen3.5-4B", "base_revision": "851bf6e806efd8d0a36b00ddf55e13ccb7b8cd0a", "comparison": { "passed": false, "gate": "identical160_argmax_and_max_probability_delta_le_0.05", "depths": { "16": { "before_correct": 61, "after_correct": 61, "changed_decisions": [], "max_probability_abs_difference": 0.09226870536804199, "mean_probability_abs_difference": 0.001908167676742778, "max_logit_abs_difference": 0.5078125, "mean_logit_abs_difference": 0.026137218475341797 }, "32": { "before_correct": 66, "after_correct": 66, "changed_decisions": [], "max_probability_abs_difference": 0.06145721673965454, "mean_probability_abs_difference": 0.0017077110185891797, "max_logit_abs_difference": 0.875, "mean_logit_abs_difference": 0.03171875 } }, "before_sha256": "7be98e54b67be84ae97a4152adeddd47a351e224cbe9345bae8ca8f44c265964", "after_sha256": "ac22ede19c6ade99388038292644df50e9891dff162acdb10029bb3bd343537e", "verified_at_unix": 1789983995.6865954 }, "runtime_validation": { "status": "passed", "decisions": 160, "max_probability_delta": 0.0, "no_jev_import": true, "long_input_rejected": true, "invalid_effort_rejected": true, "text_scope": "Execution smoke only; not TYPE accuracy or speed validation", "source_sha256": "60a80902675971ff6a054377852b936eec90f49f466eb7b8b077eee7b979f230" }, "decision_release": { "passed": true, "scope": "Independent BF16 merged variant, frozen80 decision parity; NOT a probability-equivalent replacement", "post_observation_scope_amendment": true, "original_numerical_gate_passed": false, "original_gate": "identical160_argmax_and_max_probability_delta_le_0.05", "original_comparison_sha256": "97cc94ddebb4f321d3d4ed29c89a0d8b1b3d6570e48bff427c635ba82f67862e", "decision_agreement": 160, "total_decisions": 160, "independent_questions": 80, "probability_calibration_transfer_validated": false, "automatic_routing_validated": false, "required_followup": "Recalibrate all probability, rejection and routing thresholds; independently evaluate new tasks", "depths": { "16": { "before_correct": 61, "after_correct": 61, "changed_decisions": [], "max_probability_abs_difference": 0.09226870536804199, "mean_probability_abs_difference": 0.001908167676742778, "max_logit_abs_difference": 0.5078125, "mean_logit_abs_difference": 0.026137218475341797 }, "32": { "before_correct": 66, "after_correct": 66, "changed_decisions": [], "max_probability_abs_difference": 0.06145721673965454, "mean_probability_abs_difference": 0.0017077110185891797, "max_logit_abs_difference": 0.875, "mean_logit_abs_difference": 0.03171875 } }, "publication_requires": "Further portable-runtime160, weight arithmetic, full file hashes and fresh HF reload gates" }, "reviewed_variant": {}, "decision_parity_passed": true, "decision_agreement": 160, "weight_arithmetic_status": "passed", "raw_inputs_included": false }