---
name: Paligemma
slug: paligemma
type: Multimodal
providers:
  - nvidia
description: 'Gemini multimodal model for text, image, audio, video, and document tasks'
tags:
  - open-source
  - multimodal
is_open_source: true
context_window: 128000
max_output: 8192
pricing:
  - image: 0
    input: 0
    output: 0
    provider: nvidia
release_date: '2024-05-14'
capabilities:
  audio: false
  vision: true
  tool_use: false
  citations: false
  reasoning: false
---
Paligemma is a Multimodal model.
Gemini multimodal model for text, image, audio, video, and document tasks
