Skip to content

Model comparison

Overview

Description
The Llama 3.2-Vision instruction-tuned models are optimized for visual recognition, image reasoning, captioning, and answering general questions about an image.
Category
Text Generation
Context length
0
Providers
1

Pricing (per 1M tokens)

Input
$0.05
Output
$0.68

Capabilities

Reasoning
–
Tool calling
Vision
Streaming

Token activity (30 days)

Usage