Qwen3-thirukkural-tamil

This model is a fine-tuned version of Qwen/Qwen3-0.6B on an Thirukkural dataset

It achieves the following results on the evaluation set:

  • Loss: 0.2378

Training hyperparameters

The following hyperparameters were used during training:

  • learning_rate: 2e-05
  • train_batch_size: 1
  • eval_batch_size: 8
  • seed: 42
  • gradient_accumulation_steps: 16
  • total_train_batch_size: 16
  • optimizer: Use OptimizerNames.ADAMW_TORCH_FUSED with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
  • lr_scheduler_type: linear
  • num_epochs: 6

Training results

Training Loss Epoch Step Validation Loss
0.2613 1.0 200 0.2644
0.2322 2.0 400 0.2482
0.2235 3.0 600 0.2403
0.2022 4.0 800 0.2380
0.1972 5.0 1000 0.2374
0.2086 6.0 1200 0.2378

Usage

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "tidelganesh/Qwen3-thirukkural-tamil"  # update to your actual repo name

tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name, dtype="auto")

messages = [
    {"role": "user", "content": "பொறையுடைமை அதிகாரத்தில் வரும் 158ஆம் குறளைத் தருக."}
]

prompt = tokenizer.apply_chat_template(
    messages, tokenize=False, add_generation_prompt=True
)

inputs = tokenizer(prompt, return_tensors="pt").to(model.device)

output = model.generate(
    **inputs,
    max_new_tokens=150,
    eos_token_id=tokenizer.eos_token_id,
    pad_token_id=tokenizer.eos_token_id,
)

response = tokenizer.decode(
    output[0][inputs["input_ids"].shape[1]:],
    skip_special_tokens=True,
)
print(response)

Framework versions

  • Transformers 5.14.1
  • Pytorch 2.8.0+cu128
  • Datasets 5.0.0
  • Tokenizers 0.22.2
Downloads last month
15
Safetensors
Model size
0.6B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for tidelganesh/Qwen3-thirukkural-tamil

Finetuned
Qwen/Qwen3-0.6B
Finetuned
(1348)
this model