Skip to main content

Processors and multimodal inputs

A Processor bundles the text tokenizer with image/audio/video preprocessors so multimodal models receive a single aligned batch.

Adapted for this playbook from the 🤗 Transformers documentation by Hugging Face. Official page: https://huggingface.co/docs/transformers/processors. Images © Hugging Face (documentation-images) unless noted. This is not a substitute for the upstream docs — verify against the current version.

Covers Hugging Face pages: processors, multimodal_processing, feature_extractors

from transformers import AutoProcessor, AutoModelForVision2Seq
from PIL import Image

processor = AutoProcessor.from_pretrained("Salesforce/blip-image-captioning-base")
model = AutoModelForVision2Seq.from_pretrained("Salesforce/blip-image-captioning-base")

image = Image.open("cat.jpg")
inputs = processor(images=image, text="a photo of", return_tensors="pt")
outputs = model.generate(**inputs)
print(processor.decode(outputs[0], skip_special_tokens=True))

When to use what​

ClassModality
AutoTokenizerText
AutoImageProcessorImages
AutoFeatureExtractorAudio (and some vision legacy APIs)
AutoProcessorMultimodal combinations
AutoVideoProcessorVideo

Multimodal chat​

Many VLMs use chat templates that embed image/audio placeholders. See Chat and tools and Hugging Face’s multimodal chat templates.

Discussion

Comments​

Share feedback or questions about this page. No account required.

Loading comments…