export FMHA_VERSION=V2 # 如使用旧版本Attn,设置 FMHA_VERSION=OFF export KV_CACHE_DTYPE=DEFAULT # 如使用KVCache Int8,设置 KV_CACHE_DTYPE=INT8 model_path=ModelPath # 转换后模型所处文件夹路径 (1-gpu-fp16.bin等文件所在目录) data_type=fp16 # 权重保存精度 memopt_mode=0 # MEMOPT模式: 0/1 quant_type="int8" # 量化精度: int4/int8 max_output_length=256 warmups=1 avgnums=1 python batch_demo.py --model-path $model_path\ --tokenizer-path $model_path\ --data-type $data_type\ --memopt_mode $memopt_mode\ --quant-type ${quant_type}\ --max-output-length $max_output_length\ --warmups $warmups\ --avgnums $avgnums