Skip to main content

Vision Transformer (ViT)

ViT adapts Transformers to vision by splitting an image into fixed-size patches treated as tokens.

Adapted for this playbook from the 🤗 Transformers documentation by Hugging Face. Official page: https://huggingface.co/docs/transformers/model_doc/vit. Images © Hugging Face (documentation-images) unless noted. This is not a substitute for the upstream docs — verify against the current version.

Covers Hugging Face pages: model_doc/vit

ViT / vision documentation imagery — Source: Hugging Face

Source: Hugging Face documentation images.

Quick usage​

from transformers import pipeline

clf = pipeline(task="image-classification", model="google/vit-base-patch16-224")
print(clf("https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/pipeline-cat-chonk.jpeg"))
from transformers import AutoImageProcessor, AutoModelForImageClassification
from PIL import Image
import requests

processor = AutoImageProcessor.from_pretrained("google/vit-base-patch16-224", use_fast=True)
model = AutoModelForImageClassification.from_pretrained("google/vit-base-patch16-224")
image = Image.open(requests.get(
"https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/pipeline-cat-chonk.jpeg",
stream=True,
).raw)
inputs = processor(images=image, return_tensors="pt")
logits = model(**inputs).logits

Official API​

ViT model doc.

Discussion

Comments​

Share feedback or questions about this page. No account required.

Loading comments…