auerchristoph commited on
Commit
6e7faae
·
verified ·
1 Parent(s): 40d7a97

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +6 -5
README.md CHANGED
@@ -101,24 +101,25 @@ You can use **transformers**, **vllm**, or **onnx** to perform inference, and [D
101
  # pip install torch
102
  # pip install docling_core
103
  # pip install transformers
 
104
 
105
  import torch
106
  from docling_core.types.doc import DoclingDocument
107
  from docling_core.types.doc.document import DocTagsDocument
108
- from transformers import AutoProcessor, AutoModelForVision2Seq
109
  from transformers.image_utils import load_image
110
  from pathlib import Path
111
 
112
  DEVICE = "cuda" if torch.cuda.is_available() else "cpu"
113
 
114
  # Load images
115
- image = load_image("https://upload.wikimedia.org/wikipedia/commons/7/76/GazettedeFrance.jpg")
116
 
117
  # Initialize processor and model
118
  processor = AutoProcessor.from_pretrained("ibm-granite/granite-docling-258M")
119
- model = AutoModelForVision2Seq.from_pretrained(
120
  "ibm-granite/granite-docling-258M",
121
- torch_dtype=torch.bfloat16,
122
  _attn_implementation="flash_attention_2" if DEVICE == "cuda" else "sdpa",
123
  ).to(DEVICE)
124
 
@@ -128,7 +129,7 @@ messages = [
128
  "role": "user",
129
  "content": [
130
  {"type": "image"},
131
- {"type": "text", "text": "Convert this page to docling."}
132
  ]
133
  },
134
  ]
 
101
  # pip install torch
102
  # pip install docling_core
103
  # pip install transformers
104
+ # pip install flash_attn --no-build-isolation # on supported Nvidia GPUs
105
 
106
  import torch
107
  from docling_core.types.doc import DoclingDocument
108
  from docling_core.types.doc.document import DocTagsDocument
109
+ from transformers import AutoProcessor, AutoModelForImageTextToText
110
  from transformers.image_utils import load_image
111
  from pathlib import Path
112
 
113
  DEVICE = "cuda" if torch.cuda.is_available() else "cpu"
114
 
115
  # Load images
116
+ image = load_image("https://huggingface.co/ibm-granite/granite-docling-258M/resolve/main/assets/new_arxiv.png")
117
 
118
  # Initialize processor and model
119
  processor = AutoProcessor.from_pretrained("ibm-granite/granite-docling-258M")
120
+ model = AutoModelForImageTextToText.from_pretrained(
121
  "ibm-granite/granite-docling-258M",
122
+ dtype=torch.bfloat16,
123
  _attn_implementation="flash_attention_2" if DEVICE == "cuda" else "sdpa",
124
  ).to(DEVICE)
125
 
 
129
  "role": "user",
130
  "content": [
131
  {"type": "image"},
132
+ {"type": "text", "text": "Convert page to docling."}
133
  ]
134
  },
135
  ]