{ "external_data": "model.onnx.data", "geometry": { "dynamic_batch": true, "dynamic_sequence": true, "local_attention_window": 257, "max_batch": 32, "max_sequence": 1024, "passage_max_sequence": 1024, "query_max_sequence": 128 }, "graph": "model.onnx", "inputs": [ "input_ids", "attention_mask" ], "output": "embeddings", "precision": "float32", "provider_chain": [ "CUDAExecutionProvider", "CPUExecutionProvider" ], "role": "dense-retriever", "schema": "daecore.retrieval-onnx-serving.v1", "sha256": "8c088b1635875d5406e148782b303cfc5a961138600783fb4842b413b98a98c3", "source_model_tree_sha256": "30a7b9f1c42b1fcee29a6729742685d5b744e8fa87d13cefab2fd2d49ea9150e", "torch_required_at_runtime": false }