GSM8k-GRPO
Collection
26 items • Updated
How to use rghosh8/gsm8k-deepseek-llm-7b-chat-rajat-seed-42-G-16 with PEFT:
from peft import PeftModel
from transformers import AutoModelForCausalLM
base_model = AutoModelForCausalLM.from_pretrained("deepseek-ai/deepseek-llm-7b-chat")
model = PeftModel.from_pretrained(base_model, "rghosh8/gsm8k-deepseek-llm-7b-chat-rajat-seed-42-G-16")LoRA adapter fine-tuned from deepseek-ai/deepseek-llm-7b-chat on GSM8K using GRPO.
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("rghosh8/gsm8k-deepseek-llm-7b-chat-rajat-seed-42-G-16", torch_dtype="auto", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("rghosh8/gsm8k-deepseek-llm-7b-chat-rajat-seed-42-G-16")
Base model
deepseek-ai/deepseek-llm-7b-chat