services: vllm: build: context: . dockerfile: Dockerfile image: lfm25-8b-a1b-nvfp4 container_name: vllm-lfm25 runtime: nvidia restart: unless-stopped ports: - "8000:8000" environment: - MODEL_DIR=/model - PORT=8000 - MAX_MODEL_LEN=${MAX_MODEL_LEN:-32768} - MAX_NUM_SEQS=${MAX_NUM_SEQS:-16} - GPU_MEM_UTIL=${GPU_MEM_UTIL:-0.90} - KV_CACHE_DTYPE=${KV_CACHE_DTYPE:-auto} - TP_SIZE=${TP_SIZE:-1} - REASONING_PARSER=${REASONING_PARSER:-deepseek_r1} - SERVED_MODEL_NAME=lfm25-8b-a1b - NVIDIA_VISIBLE_DEVICES=${CUDA_VISIBLE_DEVICES:-0} - TORCH_MATMUL_PRECISION=high - VLLM_USE_FLASHINFER_SAMPLER=1 volumes: # point this at the model folder (defaults to this directory) - .:/model:ro deploy: resources: reservations: devices: - driver: nvidia count: 1 # one Blackwell card is enough capabilities: [gpu] shm_size: 8g