Edit Models filters
Model Tree
Apps
Inference Providers
One-click Deployment
Models
882
Active filters: rlvr
nvidia/Nemotron-Research-GooseReason-4B-Instruct
Text Generation • 4B • Updated • 581 • 10
NotoriousH2/Qwen3-4B-Calendar-Agent-RLVR
Text Generation • 4B • Updated • 1.88k • 3
INSAIT-Institute/RAFT-7B
Text Generation • 8B • Updated • 85 • 1
mradermacher/Qwen3-4B-Calendar-Agent-RLVR-GGUF
Reinforcement Learning • 4B • Updated • 638 • 1
mradermacher/RAFT-7B-GGUF
8B • Updated • 401 • 1
mradermacher/RAFT-7B-i1-GGUF
8B • Updated • 1.66k • 1
SultanR/SmolTulu-1.7b-Reinforced-GGUF
Text Generation • 2B • Updated • 7 • 1
thuml/rt1-world-model-multi-step-rlvr
0.1B • Updated • 17
thuml/rt1-world-model-single-step-rlvr
0.1B • Updated • 14
thuml/webarena-world-model-rlvr
2B • Updated • 28 • 1
thuml/bytesized32-world-model-rlvr-binary-reward
2B • Updated • 12
thuml/bytesized32-world-model-rlvr-task-specific-reward
2B • Updated • 10
DebateLabKIT/Llama-3.1-Argunaut-1-8B-HIRPO
Text Generation • 8B • Updated • 16 • 1
thinkwee/NOVER1-Qwen3-4B
thinkwee/NOVER1-Qwen2.5-7B
mradermacher/NOVER1-Qwen3-4B-GGUF
4B • Updated • 131 • 1
mradermacher/NOVER1-Qwen2.5-7B-GGUF
8B • Updated • 199 • 1
mradermacher/NOVER1-Qwen3-4B-i1-GGUF
4B • Updated • 329 • 1
mradermacher/NOVER1-Qwen2.5-7B-i1-GGUF
8B • Updated • 604 • 1
DebateLabKIT/Phi-4-Argunaut-1-HIRPO
Text Generation • 415k • Updated • 15
mradermacher/Llama-3.1-Argunaut-1-8B-HIRPO-GGUF
8B • Updated • 217 • 1
mradermacher/Llama-3.1-Argunaut-1-8B-HIRPO-i1-GGUF
8B • Updated • 189 • 1
fangwu97/DeepSearch-1.5B
Text Generation • 2B • Updated • 69 • 10
ziadrone/airesupdated-v2
Text Generation • 4B • Updated • 12 • 1
mradermacher/airesupdated-v2-GGUF
Reinforcement Learning • 4B • Updated • 123
ABaroian/Apertus-8B-RLVR-GSM
Text Generation • Updated • 2
Anonymouslolol/qwen3-8B-hanabi-step110
Reinforcement Learning • Updated • 6
Aletheia-Bench/GRPO-Think-7B-16k
Text Generation • 8B • Updated • 309
Aletheia-Bench/GRPO-Think-1.5B-16k
Text Generation • 2B • Updated • 286