Diffusion-based Cumulative Adversarial Purification for Vision Language Models Paper • 2506.03933 • Published Jun 10
Multi-Step Alignment as Markov Games: An Optimistic Online Gradient Descent Approach with Convergence Guarantees Paper • 2502.12678 • Published May 24, 2025
Membership Inference Attacks against Large Vision-Language Models Paper • 2411.02902 • Published Nov 5, 2024
Sanity-Checking Pruning Methods: Random Tickets can Win the Jackpot Paper • 2009.11094 • Published Oct 22, 2020
High-Dimensional Kernel Methods under Covariate Shift: Data-Dependent Implicit Regularization Paper • 2406.03171 • Published Jun 5, 2024
ReCAST: Reward Credit Assignment across Timesteps for Online Diffusion Reinforcement Paper • 2609.13425 • Published 22 days ago • 9
A Unifying Lens on Supervised Fine-Tuning Through Target Distribution Design Paper • 2606.11189 • Published Jun 9 • 2
Generalization of Scaled Deep ResNets in the Mean-Field Regime Paper • 2403.09889 • Published Mar 14, 2024
Defending LLMs against Jailbreaking Attacks via Backtranslation Paper • 2402.16459 • Published Feb 26, 2024 • 4
An Efficient Rehearsal Scheme for Catastrophic Forgetting Mitigation during Multi-stage Fine-tuning Paper • 2402.08096 • Published Feb 12, 2024
On the Loss of Context-awareness in General Instruction Fine-tuning Paper • 2411.02688 • Published Nov 5, 2024