Sarvam Vision

Sarvam AI ๐Ÿง  Language Model

Sarvam's 3B multimodal vision model, parses documents, extracts text, and understands visual content in 23 languages. Designed for India's diverse document formats.

Specifications

ModalitiesInput: text, image  ยท  Output: text
Speedโ—โ—โ—โ—โ—‹ Fast
FeaturesTools: No Streaming: No Vision: No
Capabilitiesvision

Pricing

$0.0297 / generation

Platform credit pricing โ€” live rates on the Models page.

Use Sarvam Vision on Zubnet →