Jina CLIP v2

Jina AI ๐Ÿ“ Embedding

Jina AI's CLIP model, cross-modal text-image embeddings supporting 89 languages with Matryoshka representations. 865M params.

Specifications

ModalitiesInput: text, image  ยท  Output: embedding
Context window8K tokens
Speedโ—โ—โ—โ—โ—‹ Fast
FeaturesTools: No Streaming: No

Pricing

$0.0875 / 1M input tokens

Platform credit pricing โ€” live rates on the Models page.

Use Jina CLIP v2 on Zubnet →