model: pavanperi/sarvam-first-optimization trust-remote-code: true dtype: bfloat16 tensor-parallel-size: 2 max-model-len: 32768 max-num-seqs: 16 gpu-memory-utilization: 0.9 host: 0.0.0.0 port: 8000