Model Card for tiny_llama_768

This model is a fine-tuned version of . It has been trained using TRL.

Quick start

from transformers import AutoTokenizer, AutoModelForCausalLM, BitsAndBytesConfig


model_id = "kurogane/tinystorys_llama_vocab768"
cache_dir = r"/media/kurogane/backup/cache"

model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto", cache_dir=cache_dir)
tokenizer = AutoTokenizer.from_pretrained(model_id, padding_side="left", cache_dir=cache_dir)

model_inputs = tokenizer(["A list of colors: red, blue"], return_tensors="pt").to(model.device)
generated_ids = model.generate(**model_inputs)

s_output = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
print(s_output)

result example

A list of colors: red, blue, yellow, green, orange. All the people

Training procedure

This model was trained with SFT.

Framework versions

  • TRL: 0.24.0
  • Transformers: 5.8.0
  • Pytorch: 2.11.0+cu129
  • Datasets: 4.3.0
  • Tokenizers: 0.22.2

Used dataset

roneneldan/TinyStories at 5,000 steps

Downloads last month
5
Safetensors
Model size
5.31M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Dataset used to train kurogane/tinystorys_llama_vocab768

Collection including kurogane/tinystorys_llama_vocab768