Scaling Properties of Same-Family On-Policy Distillation Paper • 2609.32722 • Published 6 days ago • 254
Fractional State Space Transition for Long Sequence Modeling Paper • 2609.36314 • Published 4 days ago • 10
Where the Model Changes Its Mind: Hindsight-Divergence Localization for Efficient Reinforcement Learning with Verifiable Rewards Paper • 2609.36864 • Published 3 days ago • 9