Inference Providers
Active filters: RLHF
mradermacher/GRAM-LLaMA3.2-3B-RewardModel-i1-GGUF
3B • Updated • 369
wangclnlp/GRAM-RR-LLaMA-3.1-8B-RewardModel
Text Generation
• 8B • Updated • 10
• 2
wangclnlp/GRAM-RR-LLaMA-3.2-3B-RewardModel
Text Generation
• 3B • Updated • 12
mradermacher/GRAM-RR-LLaMA-3.2-3B-RewardModel-GGUF
3B • Updated • 70
mradermacher/GRAM-RR-LLaMA-3.2-3B-RewardModel-i1-GGUF
3B • Updated • 312
mradermacher/GRAM-RR-LLaMA-3.1-8B-RewardModel-GGUF
8B • Updated • 166
• 1
mradermacher/GRAM-RR-LLaMA-3.1-8B-RewardModel-i1-GGUF
8B • Updated • 291
• 1
mradermacher/OpenBioLLm-70B-GGUF
71B • Updated • 115
mradermacher/OpenBioLLm-70B-i1-GGUF
71B • Updated • 187
HYDARIM7/SmolLM2_RLHF_PPO_HY
Reinforcement Learning
• 0.1B • Updated • 3
SandLogicTechnologies/Hermes-2-Pro-Llama-3-8B-GGUF
Text Generation
• 8B • Updated • 13
mradermacher/Binary-Think-RM-8B-GGUF
8B • Updated • 111
mradermacher/Multiclass-Think-RM-8B-GGUF
8B • Updated • 78
ArtusDev/ilgee_Binary-Think-RM-8B-EXL3
mradermacher/Binary-Think-RM-8B-i1-GGUF
8B • Updated • 324
mradermacher/Multiclass-Think-RM-8B-i1-GGUF
8B • Updated • 91
ArtusDev/ilgee_Multiclass-Think-RM-8B-EXL3
kp-forks/reward-model-deberta-v3-large-v2
mradermacher/Binary-Think-RM-3B-GGUF
3B • Updated • 45
• 1
mradermacher/Binary-Think-RM-3B-i1-GGUF
3B • Updated • 180
• 1
invi-bhagyesh/TinyLlama-1.1B-Chat-v1.0-hh-rlhf
1B • Updated • 12
11B • Updated • 82
• 8
ChiKoi7/Starling-LM-7B-alpha-Heretic
Text Generation
• 7B • Updated • 10
ChiKoi7/Starling-LM-7B-alpha-Heretic-GGUF
7B • Updated • 123
mradermacher/Starling-LM-7B-alpha-Heretic-GGUF
7B • Updated • 193
mradermacher/Starling-LM-7B-alpha-Heretic-i1-GGUF
7B • Updated • 709
• 1
cherifkhalifah/Llama3-OpenBioLLM-8B
kunjcr2/stablelm-1.6b-finetuned-aligned
Text Generation
• Updated • 1
Supreeth/searchlm-qwen2.5-3b-rlhf
Text Generation
• 3B • Updated • 11