WavLink: Compact Audio-Text Embeddings with a Global Whisper Token Paper • 2601.15118 • Published Jan 21
Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data Paper • 2509.07526 • Published Sep 9, 2025
VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models Paper • 2502.10250 • Published Feb 14, 2025
Towards Building Text-To-Speech Systems for the Next Billion Users Paper • 2211.09536 • Published Nov 17, 2022
DataKernelBench: Can LLMs Optimize Database Queries on GPUs? Paper • 2608.25061 • Published 8 days ago • 1
DataKernelBench: Can LLMs Optimize Database Queries on GPUs? Paper • 2608.25061 • Published 8 days ago • 1