Skip to content

Model comparison

Overview

Description
Qwen2.5-VL-7B-Instruct is Qwen's 7B vision-language chat model: it takes images and text as input and answers in text.
Category
Text Generation
Context length
33K
Providers
1

Pricing (per 1M tokens)

Input
$0.77
Output
$0.77

Capabilities

Reasoning
–
Tool calling
–
Vision
Streaming

Token activity (30 days)

Usage