-
Continuous Latent Diffusion Language Model
Paper • 2605.06548 • Published • 86 -
Scaling Latent Reasoning via Looped Language Models
Paper • 2510.25741 • Published • 236 -
Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
Paper • 2502.05171 • Published • 162 -
Pretraining Language Models to Ponder in Continuous Space
Paper • 2505.20674 • Published • 3
Collections
Discover the best community collections!
Collections including paper arxiv:2609.29845
-
Why Fine-Tuning Encourages Hallucinations and How to Fix It
Paper • 2604.15574 • Published • 25 -
Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation
Paper • 2604.24763 • Published • 70 -
Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora
Paper • 2604.24819 • Published • 90 -
GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
Paper • 2604.26752 • Published • 114
-
FinTral: A Family of GPT-4 Level Multimodal Financial Large Language Models
Paper • 2402.10986 • Published • 83 -
Aria Everyday Activities Dataset
Paper • 2402.13349 • Published • 31 -
Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
Paper • 2403.04132 • Published • 41 -
SaulLM-7B: A pioneering Large Language Model for Law
Paper • 2403.03883 • Published • 93
-
NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction
Paper • 2609.10715 • Published • 328 -
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
Paper • 2609.24972 • Published • 210 -
From Pattern Recognizers to Personalized Companions: A Survey of Large Language Models in Mental Health
Paper • 2609.25186 • Published • 32 -
Rufus-Air: An Open LLM Post-Training Recipe
Paper • 2609.29421 • Published • 19
-
Searching for Best Practices in Retrieval-Augmented Generation
Paper • 2407.01219 • Published • 11 -
AI for Auto-Research: Roadmap & User Guide
Paper • 2605.18661 • Published • 70 -
Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs
Paper • 2609.29845 • Published • 78 -
Agent-Editing World Model: Rethinking World Modeling for LLM Agents
Paper • 2609.28416 • Published • 20
-
Chain-of-Verification Reduces Hallucination in Large Language Models
Paper • 2309.11495 • Published • 39 -
Adapting Large Language Models via Reading Comprehension
Paper • 2309.09530 • Published • 82 -
CulturaX: A Cleaned, Enormous, and Multilingual Dataset for Large Language Models in 167 Languages
Paper • 2309.09400 • Published • 87 -
Language Modeling Is Compression
Paper • 2309.10668 • Published • 85
-
Continuous Latent Diffusion Language Model
Paper • 2605.06548 • Published • 86 -
Scaling Latent Reasoning via Looped Language Models
Paper • 2510.25741 • Published • 236 -
Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
Paper • 2502.05171 • Published • 162 -
Pretraining Language Models to Ponder in Continuous Space
Paper • 2505.20674 • Published • 3
-
NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction
Paper • 2609.10715 • Published • 328 -
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
Paper • 2609.24972 • Published • 210 -
From Pattern Recognizers to Personalized Companions: A Survey of Large Language Models in Mental Health
Paper • 2609.25186 • Published • 32 -
Rufus-Air: An Open LLM Post-Training Recipe
Paper • 2609.29421 • Published • 19
-
Why Fine-Tuning Encourages Hallucinations and How to Fix It
Paper • 2604.15574 • Published • 25 -
Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation
Paper • 2604.24763 • Published • 70 -
Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora
Paper • 2604.24819 • Published • 90 -
GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
Paper • 2604.26752 • Published • 114
-
Searching for Best Practices in Retrieval-Augmented Generation
Paper • 2407.01219 • Published • 11 -
AI for Auto-Research: Roadmap & User Guide
Paper • 2605.18661 • Published • 70 -
Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs
Paper • 2609.29845 • Published • 78 -
Agent-Editing World Model: Rethinking World Modeling for LLM Agents
Paper • 2609.28416 • Published • 20
-
FinTral: A Family of GPT-4 Level Multimodal Financial Large Language Models
Paper • 2402.10986 • Published • 83 -
Aria Everyday Activities Dataset
Paper • 2402.13349 • Published • 31 -
Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
Paper • 2403.04132 • Published • 41 -
SaulLM-7B: A pioneering Large Language Model for Law
Paper • 2403.03883 • Published • 93
-
Chain-of-Verification Reduces Hallucination in Large Language Models
Paper • 2309.11495 • Published • 39 -
Adapting Large Language Models via Reading Comprehension
Paper • 2309.09530 • Published • 82 -
CulturaX: A Cleaned, Enormous, and Multilingual Dataset for Large Language Models in 167 Languages
Paper • 2309.09400 • Published • 87 -
Language Modeling Is Compression
Paper • 2309.10668 • Published • 85