Skip to main content

Quickstart

Get from zero to a working inference call in minutes using Pipeline or Auto classes.

Adapted for this playbook from the πŸ€— Transformers documentation by Hugging Face. Official page: https://huggingface.co/docs/transformers/quicktour. Images Β© Hugging Face (documentation-images) unless noted. This is not a substitute for the upstream docs β€” verify against the current version.

Covers Hugging Face pages: quickstart

Path 1 β€” Pipeline (fastest)​

from transformers import pipeline

classifier = pipeline("sentiment-analysis")
print(classifier("I love Hugging Face Transformers"))

Task identifiers cover NLP, vision, audio and multimodal. Override the default checkpoint with model=....

generator = pipeline("text-generation", model="openai-community/gpt2")
print(generator("Once upon a time", max_new_tokens=40))

Path 2 β€” Auto classes (more control)​

from transformers import AutoTokenizer, AutoModelForCausalLM
import torch

model_id = "openai-community/gpt2"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id)

inputs = tokenizer("Transformers are", return_tensors="pt")
with torch.no_grad():
outputs = model.generate(**inputs, max_new_tokens=30)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

Device placement​

from accelerate import Accelerator
device = Accelerator().device
pipe = pipeline("text-generation", model="openai-community/gpt2", device=device)

Or pass device_map="auto" on compatible models to shard across GPUs with Accelerate.

What to learn next​

GoalPage
Understand library designPhilosophy
Load / save / share weightsLoading models
Task recipesPipeline
LLM decodingText generation

Discussion

Comments​

Share feedback or questions about this page. No account required.

Loading comments…