Tanaybh commited on
Commit
5a4f023
·
verified ·
1 Parent(s): 4ea01c2

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +1 -1
README.md CHANGED
@@ -25,7 +25,7 @@ This model was trained using the **complete 3-stage RLHF pipeline** - the same m
25
 
26
  ## 🎯 Model Description
27
 
28
- This is a GPT-2 model that has been fine-tuned using **Reinforcement Learning from Human Feedback (RLHF)** with real preference data from Anthropic's HH-RLHF dataset - the same data used to train Claude.
29
 
30
  ### 🔥 Training Pipeline
31
 
 
25
 
26
  ## 🎯 Model Description
27
 
28
+ This is a GPT-2 model that has been fine-tuned using **Reinforcement Learning from Human Feedback (RLHF)** with real preference data from Anthropic's HH-RLHF dataset
29
 
30
  ### 🔥 Training Pipeline
31