S
Sarvam Vision
Sarvam AI
๐ง Language Model
Sarvam's 3B multimodal vision model, parses documents, extracts text, and understands visual content in 23 languages. Designed for India's diverse document formats.
Specifications
ModalitiesInput: text, image ยท Output: text
Speedโโโโโ Fast
FeaturesTools: No Streaming: No Vision: No
Capabilitiesvision
Pricing
$0.0297 / generation
Platform credit pricing โ live rates on the Models page.