--- base_model: - unsloth/Qwen3-8B tags: - text-generation-inference - transformers - unsloth - qwen3 - urdu - urdu-reasoning license: apache-2.0 language: - ur widget: - messages: - role: user content: 2 + 3 کتنا ہوتا ہے؟ - messages: - role: user content: اگر آپ کے پاس 10 سیب ہیں اور 3 کھا لیتے ہیں، تو کتنے بچیں گے؟ - messages: - role: user content: >- ایک باپ کی عمر اپنے بیٹے کی عمر سے تین گنا ہے۔ 10 سال بعد باپ کی عمر 50 سال ہوگی۔ بیٹے کی موجودہ عمر کیا ہے؟ - messages: - role: user content: >- اگر ایک گاڑی 60 کلومیٹر فی گھنٹہ کی رفتار سے 2 گھنٹے چلے، تو کتنی دوری طے کرے گی؟ --- ## Quick start ```python from unsloth import FastLanguageModel import torch max_seq_length = 2048 # Choose any! We auto support RoPE Scaling internally! dtype = ( None # None for auto detection. Float16 for Tesla T4, V100, Bfloat16 for Ampere+ ) load_in_4bit = False # Use 4bit quantization to reduce memory usage. Can be False. load_in_8bit = False # Use 8bit quantization to reduce memory usage. Can be False. model, tokenizer = FastLanguageModel.from_pretrained( model_name="azherali/Riazi-8B-Instruct", # Choose ANY max_seq_length=max_seq_length, dtype=dtype, load_in_4bit=load_in_4bit, load_in_8bit=load_in_8bit, # token = "YOUR_HF_TOKEN", # HF Token for gated models ) FastLanguageModel.for_inference(model) # Enable native 2x faster inference reasoning_start = "" reasoning_end = "" solution_start = "" solution_end = "" system_prompt = f""" You are given a problem. Think about the problem and provide your working out. Place your reasoning between {reasoning_start} and {reasoning_end}. Then, provide your final solution between {solution_start} and {solution_end}. Always answer in Urdu. """ message = [ {"role": "system", "content": system_prompt}, { "role": "user", "content": "پانچ بچوں نے 20 چاکلیٹس برابر بانٹیں۔ ہر بچے کو کتنی چاکلیٹس ملیں گی؟" } ] text = tokenizer.apply_chat_template( message, tokenize=False, add_generation_prompt=True, enable_thinking=False, # Must add for generation ) # Inference Using Tranformer Library from transformers import TextStreamer _ = model.generate( **tokenizer(text, return_tensors="pt").to("cuda"), temperature=0.6, top_p=0.95, top_k=20, # For non thinking streamer=TextStreamer(tokenizer, skip_prompt=True), ) # Inference Using VLLM(fast) from vllm import SamplingParams def generate_answer(problem): message = [ {"role": "system", "content": system_prompt}, {"role": "user", "content": problem}, ] text = tokenizer.apply_chat_template( message, add_generation_prompt = True, # Must add for generation tokenize = False, enable_thinking=False, ) sampling_params = SamplingParams( max_tokens=2048, temperature=0.6, top_p=0.95, top_k=20, ) output = model.fast_generate( text, sampling_params = sampling_params, lora_request =None, )[0].outputs[0].text return output generate_answer("پانچ بچوں نے 20 چاکلیٹس برابر بانٹیں۔ ہر بچے کو کتنی چاکلیٹس ملیں گی؟") ``` ## Training procedure This model was trained with SFT. ### Framework versions - TRL: 0.22.2 - Transformers: 4.56.2 - Pytorch: 2.12.0+rocm7.2 - Datasets: 4.3.0 - Tokenizers: 0.22.2