gsm8k-Nemotron-Mini-4B-Instruct-rajat-seed-42_merged

Merged model fine-tuned from nvidia/Nemotron-Mini-4B-Instruct on GSM8K using GRPO.

Usage

from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained("rghosh8/gsm8k-Nemotron-Mini-4B-Instruct-rajat-seed-42_merged", torch_dtype="auto", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("rghosh8/gsm8k-Nemotron-Mini-4B-Instruct-rajat-seed-42_merged")
Downloads last month
13
Safetensors
Model size
4B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for rghosh8/gsm8k-Nemotron-Mini-4B-Instruct-rajat-seed-42_merged

Adapter
(34)
this model

Collection including rghosh8/gsm8k-Nemotron-Mini-4B-Instruct-rajat-seed-42_merged