sarvam-optimized-atos / vllm_config.yaml
pavanperi's picture
Better max tokens
3b3fb44 verified
Raw
History Blame Contribute Delete
198 Bytes
model: pavanperi/sarvam-first-optimization
trust-remote-code: true
dtype: bfloat16
tensor-parallel-size: 2
max-model-len: 32768
max-num-seqs: 16
gpu-memory-utilization: 0.9
host: 0.0.0.0
port: 8000