Scaling Properties of Same-Family On-Policy Distillation Paper • 2609.32722 • Published 7 days ago • 300
Fractional State Space Transition for Long Sequence Modeling Paper • 2609.36314 • Published 5 days ago • 10
Where the Model Changes Its Mind: Hindsight-Divergence Localization for Efficient Reinforcement Learning with Verifiable Rewards Paper • 2609.36864 • Published 4 days ago • 9