GSM8k-GRPO
Collection
26 items • Updated
How to use rghosh8/gsm8k-nemotron-mini-4b-instruct-rajat-seed-42-G-16 with PEFT:
from peft import PeftModel
from transformers import AutoModelForCausalLM
base_model = AutoModelForCausalLM.from_pretrained("nvidia/Nemotron-Mini-4B-Instruct")
model = PeftModel.from_pretrained(base_model, "rghosh8/gsm8k-nemotron-mini-4b-instruct-rajat-seed-42-G-16")LoRA adapter fine-tuned from nvidia/Nemotron-Mini-4B-Instruct on GSM8K using GRPO.
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("rghosh8/gsm8k-nemotron-mini-4b-instruct-rajat-seed-42-G-16", torch_dtype="auto", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("rghosh8/gsm8k-nemotron-mini-4b-instruct-rajat-seed-42-G-16")
Base model
nvidia/Nemotron-Mini-4B-Instruct