Qwen3 VL Plus
Alibaba Cloud
🧠 Language Model
Advanced vision-language model with 262K context. Excels at visual coding, spatial perception, and multimodal reasoning.
Specifications
Input modalitiestext, image
Output modalitiestext
Capabilitiestools, reasoning
Relative speed●●●○○ Average
Context window262,144 tokens
Max output8,192 tokens
Vision inputYes
Tool callingYes
Input price$0.2502 / 1M
Output price$2.51 / 1M
Pricing
$0.2502 / 1M input tokens · $2.51 / 1M output tokens
Platform credit pricing — live rates on the Models page.