from pathlib import Path import torch from qwen35_standalone import load_standalone HERE = Path(__file__).resolve().parent if __name__ == "__main__": model, tokenizer = load_standalone(HERE) prompt = tokenizer.apply_chat_template( [{"role": "user", "content": "Explain sparse neural networks in one paragraph."}], tokenize=False, add_generation_prompt=True, ) inputs = tokenizer(prompt, return_tensors="pt").to(next(model.parameters()).device) with torch.inference_mode(): out = model.generate(**inputs, max_new_tokens=128, do_sample=False) print(tokenizer.decode(out[0, inputs.input_ids.shape[1]:], skip_special_tokens=True))