Text Generation
Transformers
Safetensors
qwen2
Generated from Trainer
trl
sft
conversational
text-generation-inference
Instructions to use arch-stanton-1/NeuTTS-air_ur with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use arch-stanton-1/NeuTTS-air_ur with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="arch-stanton-1/NeuTTS-air_ur") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# pip install -U transformers accelerate # Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("arch-stanton-1/NeuTTS-air_ur") model = AutoModelForCausalLM.from_pretrained("arch-stanton-1/NeuTTS-air_ur", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=256) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use arch-stanton-1/NeuTTS-air_ur with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "arch-stanton-1/NeuTTS-air_ur" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "arch-stanton-1/NeuTTS-air_ur", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/arch-stanton-1/NeuTTS-air_ur
- SGLang
How to use arch-stanton-1/NeuTTS-air_ur with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "arch-stanton-1/NeuTTS-air_ur" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "arch-stanton-1/NeuTTS-air_ur", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "arch-stanton-1/NeuTTS-air_ur" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "arch-stanton-1/NeuTTS-air_ur", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use arch-stanton-1/NeuTTS-air_ur with Docker Model Runner:
docker model run hf.co/arch-stanton-1/NeuTTS-air_ur
Download checkpoint-996/trainer_state.json from arch-stanton-1/NeuTTS-air_ur: direct link, hf CLI and curl.
- Browser
- Download file 15.3 kB
-
https://huggingface.co/arch-stanton-1/NeuTTS-air_ur/resolve/main/checkpoint-996/trainer_state.json
- Command line
-
hf download hf://arch-stanton-1/NeuTTS-air_ur/checkpoint-996/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/arch-stanton-1/NeuTTS-air_ur/resolve/main/checkpoint-996/trainer_state.json
15.3 kB
| { | |
| "best_global_step": 992, | |
| "best_metric": 7.356758117675781, | |
| "best_model_checkpoint": "/workspace/neutts_air_urdu_finetune/checkpoint-992", | |
| "epoch": 4.220338983050848, | |
| "eval_steps": 124, | |
| "global_step": 996, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 7.697032804489136, | |
| "epoch": 0.1059322033898305, | |
| "grad_norm": 4.78125, | |
| "learning_rate": 1.6000000000000003e-05, | |
| "loss": 7.989871215820313, | |
| "mean_token_accuracy": 0.016311284080147745, | |
| "num_tokens": 218322.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 7.771375341415405, | |
| "epoch": 0.211864406779661, | |
| "grad_norm": 2.671875, | |
| "learning_rate": 1.9980915336317713e-05, | |
| "loss": 7.803304443359375, | |
| "mean_token_accuracy": 0.018622982166707516, | |
| "num_tokens": 437349.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 7.646108131408692, | |
| "epoch": 0.3177966101694915, | |
| "grad_norm": 2.421875, | |
| "learning_rate": 1.989779323028575e-05, | |
| "loss": 7.629185180664063, | |
| "mean_token_accuracy": 0.021061680242419244, | |
| "num_tokens": 658790.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 7.555726566314697, | |
| "epoch": 0.423728813559322, | |
| "grad_norm": 2.359375, | |
| "learning_rate": 1.9749279121818235e-05, | |
| "loss": 7.55064208984375, | |
| "mean_token_accuracy": 0.022715183552354575, | |
| "num_tokens": 872825.0, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.5254237288135594, | |
| "eval_entropy": 7.486619492371877, | |
| "eval_loss": 7.498717784881592, | |
| "eval_mean_token_accuracy": 0.02434113745888074, | |
| "eval_num_tokens": 1084707.0, | |
| "eval_runtime": 7.3619, | |
| "eval_samples_per_second": 54.062, | |
| "eval_steps_per_second": 3.396, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 7.509912757873535, | |
| "epoch": 0.5296610169491526, | |
| "grad_norm": 2.21875, | |
| "learning_rate": 1.9536354202855306e-05, | |
| "loss": 7.5065460205078125, | |
| "mean_token_accuracy": 0.022764644995331765, | |
| "num_tokens": 1093864.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 7.504309902191162, | |
| "epoch": 0.635593220338983, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 1.9260425209878052e-05, | |
| "loss": 7.493028564453125, | |
| "mean_token_accuracy": 0.022260171882808207, | |
| "num_tokens": 1315198.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 7.464480457305908, | |
| "epoch": 0.7415254237288136, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 1.8923315129986838e-05, | |
| "loss": 7.463182373046875, | |
| "mean_token_accuracy": 0.023391987532377242, | |
| "num_tokens": 1533213.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 7.452612771987915, | |
| "epoch": 0.847457627118644, | |
| "grad_norm": 2.34375, | |
| "learning_rate": 1.8527251156925997e-05, | |
| "loss": 7.447894897460937, | |
| "mean_token_accuracy": 0.02403868570923805, | |
| "num_tokens": 1752307.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 7.409109563827514, | |
| "epoch": 0.9533898305084746, | |
| "grad_norm": 1.96875, | |
| "learning_rate": 1.8074849976626273e-05, | |
| "loss": 7.407470703125, | |
| "mean_token_accuracy": 0.023314249143004416, | |
| "num_tokens": 1973350.0, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 1.0508474576271187, | |
| "eval_entropy": 7.401865323384603, | |
| "eval_loss": 7.414607524871826, | |
| "eval_mean_token_accuracy": 0.025272298449029524, | |
| "eval_num_tokens": 2178943.0, | |
| "eval_runtime": 7.4146, | |
| "eval_samples_per_second": 53.678, | |
| "eval_steps_per_second": 3.372, | |
| "step": 248 | |
| }, | |
| { | |
| "entropy": 7.410350885391235, | |
| "epoch": 1.0593220338983051, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 1.756910047947926e-05, | |
| "loss": 7.405702514648437, | |
| "mean_token_accuracy": 0.024052796624600886, | |
| "num_tokens": 2195473.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 7.378520240783692, | |
| "epoch": 1.1652542372881356, | |
| "grad_norm": 2.0625, | |
| "learning_rate": 1.7013344013559197e-05, | |
| "loss": 7.368658447265625, | |
| "mean_token_accuracy": 0.024010552018880846, | |
| "num_tokens": 2410539.0, | |
| "step": 275 | |
| }, | |
| { | |
| "entropy": 7.370533514022827, | |
| "epoch": 1.271186440677966, | |
| "grad_norm": 2.015625, | |
| "learning_rate": 1.64112523092536e-05, | |
| "loss": 7.370477905273438, | |
| "mean_token_accuracy": 0.02511810462921858, | |
| "num_tokens": 2630347.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 7.372100067138672, | |
| "epoch": 1.3771186440677967, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 1.5766803221148676e-05, | |
| "loss": 7.374469604492187, | |
| "mean_token_accuracy": 0.02450455617159605, | |
| "num_tokens": 2848534.0, | |
| "step": 325 | |
| }, | |
| { | |
| "entropy": 7.342970514297486, | |
| "epoch": 1.4830508474576272, | |
| "grad_norm": 1.9609375, | |
| "learning_rate": 1.5084254447436169e-05, | |
| "loss": 7.339466552734375, | |
| "mean_token_accuracy": 0.025138991102576256, | |
| "num_tokens": 3070123.0, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 1.576271186440678, | |
| "eval_entropy": 7.361576656500499, | |
| "eval_loss": 7.381193161010742, | |
| "eval_mean_token_accuracy": 0.025545974417279165, | |
| "eval_num_tokens": 3263577.0, | |
| "eval_runtime": 7.4123, | |
| "eval_samples_per_second": 53.695, | |
| "eval_steps_per_second": 3.373, | |
| "step": 372 | |
| }, | |
| { | |
| "entropy": 7.361075611114502, | |
| "epoch": 1.5889830508474576, | |
| "grad_norm": 1.9140625, | |
| "learning_rate": 1.4368115400470393e-05, | |
| "loss": 7.3520880126953125, | |
| "mean_token_accuracy": 0.024180141538381578, | |
| "num_tokens": 3288806.0, | |
| "step": 375 | |
| }, | |
| { | |
| "entropy": 7.3546325302124025, | |
| "epoch": 1.694915254237288, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 1.3623117414318827e-05, | |
| "loss": 7.346293334960937, | |
| "mean_token_accuracy": 0.024999124109745027, | |
| "num_tokens": 3510776.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 7.363360710144043, | |
| "epoch": 1.8008474576271185, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 1.2854182486136944e-05, | |
| "loss": 7.364286499023438, | |
| "mean_token_accuracy": 0.02418241061270237, | |
| "num_tokens": 3731405.0, | |
| "step": 425 | |
| }, | |
| { | |
| "entropy": 7.334566602706909, | |
| "epoch": 1.9067796610169492, | |
| "grad_norm": 1.9609375, | |
| "learning_rate": 1.2066390757884328e-05, | |
| "loss": 7.33093505859375, | |
| "mean_token_accuracy": 0.02495731335133314, | |
| "num_tokens": 3953207.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 7.353079776763916, | |
| "epoch": 2.01271186440678, | |
| "grad_norm": 1.8671875, | |
| "learning_rate": 1.1264946953221496e-05, | |
| "loss": 7.351827392578125, | |
| "mean_token_accuracy": 0.02447190221399069, | |
| "num_tokens": 4169521.0, | |
| "step": 475 | |
| }, | |
| { | |
| "epoch": 2.1016949152542375, | |
| "eval_entropy": 7.34862866004308, | |
| "eval_loss": 7.365415096282959, | |
| "eval_mean_token_accuracy": 0.025626841001212597, | |
| "eval_num_tokens": 4351452.0, | |
| "eval_runtime": 7.4142, | |
| "eval_samples_per_second": 53.681, | |
| "eval_steps_per_second": 3.372, | |
| "step": 496 | |
| }, | |
| { | |
| "entropy": 7.339797382354736, | |
| "epoch": 2.1186440677966103, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 1.0455145991329639e-05, | |
| "loss": 7.3259820556640625, | |
| "mean_token_accuracy": 0.025096801929175853, | |
| "num_tokens": 4386912.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 7.330105533599854, | |
| "epoch": 2.2245762711864407, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 9.642338004833295e-06, | |
| "loss": 7.330958251953125, | |
| "mean_token_accuracy": 0.024473249688744547, | |
| "num_tokens": 4607819.0, | |
| "step": 525 | |
| }, | |
| { | |
| "entropy": 7.331509189605713, | |
| "epoch": 2.330508474576271, | |
| "grad_norm": 1.96875, | |
| "learning_rate": 8.831892992943e-06, | |
| "loss": 7.329585571289062, | |
| "mean_token_accuracy": 0.024803164564073086, | |
| "num_tokens": 4829926.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 7.332346143722535, | |
| "epoch": 2.4364406779661016, | |
| "grad_norm": 1.953125, | |
| "learning_rate": 8.029165343344805e-06, | |
| "loss": 7.3258428955078125, | |
| "mean_token_accuracy": 0.02469826426357031, | |
| "num_tokens": 5045115.0, | |
| "step": 575 | |
| }, | |
| { | |
| "entropy": 7.318505411148071, | |
| "epoch": 2.542372881355932, | |
| "grad_norm": 1.9140625, | |
| "learning_rate": 7.2394584572309125e-06, | |
| "loss": 7.3118963623046875, | |
| "mean_token_accuracy": 0.02518722042441368, | |
| "num_tokens": 5265448.0, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 2.6271186440677967, | |
| "eval_entropy": 7.333844860394795, | |
| "eval_loss": 7.359093189239502, | |
| "eval_mean_token_accuracy": 0.025550531456246972, | |
| "eval_num_tokens": 5439386.0, | |
| "eval_runtime": 7.4052, | |
| "eval_samples_per_second": 53.746, | |
| "eval_steps_per_second": 3.376, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 7.321087207794189, | |
| "epoch": 2.648305084745763, | |
| "grad_norm": 2.0625, | |
| "learning_rate": 6.467989711184021e-06, | |
| "loss": 7.31301513671875, | |
| "mean_token_accuracy": 0.025983325839042663, | |
| "num_tokens": 5482207.0, | |
| "step": 625 | |
| }, | |
| { | |
| "entropy": 7.322469959259033, | |
| "epoch": 2.7542372881355934, | |
| "grad_norm": 2.125, | |
| "learning_rate": 5.7198559874026945e-06, | |
| "loss": 7.318033447265625, | |
| "mean_token_accuracy": 0.02565582599490881, | |
| "num_tokens": 5703727.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 7.31039176940918, | |
| "epoch": 2.860169491525424, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 5.000000000000003e-06, | |
| "loss": 7.305034790039063, | |
| "mean_token_accuracy": 0.02535436548292637, | |
| "num_tokens": 5923157.0, | |
| "step": 675 | |
| }, | |
| { | |
| "entropy": 7.3113681411743165, | |
| "epoch": 2.9661016949152543, | |
| "grad_norm": 1.9765625, | |
| "learning_rate": 4.313177639848408e-06, | |
| "loss": 7.3114166259765625, | |
| "mean_token_accuracy": 0.025559407025575638, | |
| "num_tokens": 6143779.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 7.3387535953521725, | |
| "epoch": 3.0720338983050848, | |
| "grad_norm": 1.921875, | |
| "learning_rate": 3.6639265537145187e-06, | |
| "loss": 7.343036499023437, | |
| "mean_token_accuracy": 0.024094666354358196, | |
| "num_tokens": 6365371.0, | |
| "step": 725 | |
| }, | |
| { | |
| "epoch": 3.152542372881356, | |
| "eval_entropy": 7.332533776760101, | |
| "eval_loss": 7.357120990753174, | |
| "eval_mean_token_accuracy": 0.025878646954273183, | |
| "eval_num_tokens": 6532337.0, | |
| "eval_runtime": 7.4033, | |
| "eval_samples_per_second": 53.76, | |
| "eval_steps_per_second": 3.377, | |
| "step": 744 | |
| }, | |
| { | |
| "entropy": 7.320968351364136, | |
| "epoch": 3.1779661016949152, | |
| "grad_norm": 2.109375, | |
| "learning_rate": 3.056536165272662e-06, | |
| "loss": 7.313834228515625, | |
| "mean_token_accuracy": 0.025647504702210427, | |
| "num_tokens": 6584143.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 7.319151067733765, | |
| "epoch": 3.2838983050847457, | |
| "grad_norm": 1.9140625, | |
| "learning_rate": 2.4950193360603868e-06, | |
| "loss": 7.315574951171875, | |
| "mean_token_accuracy": 0.02516275253146887, | |
| "num_tokens": 6806162.0, | |
| "step": 775 | |
| }, | |
| { | |
| "entropy": 7.312239484786987, | |
| "epoch": 3.389830508474576, | |
| "grad_norm": 1.8359375, | |
| "learning_rate": 1.9830858536039742e-06, | |
| "loss": 7.299415893554688, | |
| "mean_token_accuracy": 0.025689680464565753, | |
| "num_tokens": 7025188.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 7.3349973487854, | |
| "epoch": 3.4957627118644066, | |
| "grad_norm": 1.90625, | |
| "learning_rate": 1.524117921870789e-06, | |
| "loss": 7.336126098632812, | |
| "mean_token_accuracy": 0.02420500263571739, | |
| "num_tokens": 7242603.0, | |
| "step": 825 | |
| }, | |
| { | |
| "entropy": 7.306003942489624, | |
| "epoch": 3.601694915254237, | |
| "grad_norm": 1.765625, | |
| "learning_rate": 1.121147815976248e-06, | |
| "loss": 7.2987548828125, | |
| "mean_token_accuracy": 0.02604618974030018, | |
| "num_tokens": 7462100.0, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 3.6779661016949152, | |
| "eval_entropy": 7.331447899341583, | |
| "eval_loss": 7.3567795753479, | |
| "eval_mean_token_accuracy": 0.02568032095829646, | |
| "eval_num_tokens": 7621408.0, | |
| "eval_runtime": 7.4184, | |
| "eval_samples_per_second": 53.65, | |
| "eval_steps_per_second": 3.37, | |
| "step": 868 | |
| }, | |
| { | |
| "entropy": 7.314174528121948, | |
| "epoch": 3.707627118644068, | |
| "grad_norm": 2.0, | |
| "learning_rate": 7.76837848774642e-07, | |
| "loss": 7.314702758789062, | |
| "mean_token_accuracy": 0.02541963815689087, | |
| "num_tokens": 7681092.0, | |
| "step": 875 | |
| }, | |
| { | |
| "entropy": 7.335706939697266, | |
| "epoch": 3.8135593220338984, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 4.934627816890469e-07, | |
| "loss": 7.334556884765625, | |
| "mean_token_accuracy": 0.02444286733865738, | |
| "num_tokens": 7902109.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 7.30207275390625, | |
| "epoch": 3.919491525423729, | |
| "grad_norm": 1.96875, | |
| "learning_rate": 2.728947959871353e-07, | |
| "loss": 7.29387451171875, | |
| "mean_token_accuracy": 0.02536882445216179, | |
| "num_tokens": 8122890.0, | |
| "step": 925 | |
| }, | |
| { | |
| "entropy": 7.312922801971435, | |
| "epoch": 4.02542372881356, | |
| "grad_norm": 1.984375, | |
| "learning_rate": 1.1659112379354575e-07, | |
| "loss": 7.30086181640625, | |
| "mean_token_accuracy": 0.025601605214178563, | |
| "num_tokens": 8341879.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 7.326199951171875, | |
| "epoch": 4.13135593220339, | |
| "grad_norm": 1.953125, | |
| "learning_rate": 2.558442055732524e-08, | |
| "loss": 7.32387939453125, | |
| "mean_token_accuracy": 0.024802666790783405, | |
| "num_tokens": 8564759.0, | |
| "step": 975 | |
| }, | |
| { | |
| "epoch": 4.203389830508475, | |
| "eval_entropy": 7.331596851348877, | |
| "eval_loss": 7.356758117675781, | |
| "eval_mean_token_accuracy": 0.02577025055264433, | |
| "eval_num_tokens": 8715260.0, | |
| "eval_runtime": 7.397, | |
| "eval_samples_per_second": 53.806, | |
| "eval_steps_per_second": 3.38, | |
| "step": 992 | |
| }, | |
| { | |
| "epoch": 4.220338983050848, | |
| "eval_entropy": 7.331597983837128, | |
| "eval_loss": 7.3567633628845215, | |
| "eval_mean_token_accuracy": 0.02577025055264433, | |
| "eval_num_tokens": 8750612.0, | |
| "eval_runtime": 7.4178, | |
| "eval_samples_per_second": 53.655, | |
| "eval_steps_per_second": 3.37, | |
| "step": 996 | |
| } | |
| ], | |
| "logging_steps": 25, | |
| "max_steps": 996, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 124, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.380260592254976e+16, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |