---
title: Googleのオープンな視覚言語モデル「PaliGemma」が登場　Google I/O 2024で発表
url: https://roboin.io/article/2024/05/15/google-releases-pali-gemma-open-vision-language-model/
description: Googleが新たに、オープンなビジョン言語モデル（VLM）の「PaliGemma」を発表しました。このモデルは、視覚情報と言語情報を理解し、画像や短い動画のキャプションの生成、視覚的質問への応答、画像内のテキストの認識、物体検出、セグメンテーションといった多様なタスクに対応可能です。
publishedDate: 2024-05-15T07:17:08.000Z
modifiedDate: 2024-05-15T08:11:09.000Z
thumbnail: https://roboin.io/api/media/file/thumbnail-127.png
thumbnailAlt: PaliGemmaを実行しているHuggingFace Spaceのスクリーンショット
thumbnailCaption: N/A
---

# Googleのオープンな視覚言語モデル「PaliGemma」が登場　Google I\/O 2024で発表

**Google**が新たに、オープンなビジョン言語モデル（VLM）の「**PaliGemma**」を発表しました。このモデルは、視覚情報と言語情報を理解し、画像や短い動画のキャプションの生成、視覚的質問への応答、画像内のテキストの認識、物体検出、セグメンテーションといった多様なタスクに対応可能です。

PaliGemmaは、Googleの開発者向けイベント「Google I/O 2024」で発表されました。Google I/O 2024で発表された他の新機能やアップデートについては、こちらの記事を参照してください。

[Google I\/O 2024の発表内容まとめ](https://roboin.io/article/2024/05/15/google-io-2024-summary/)

## PaliGemmaとは？

![PaliGemmaを実行しているHuggingFace Spaceのスクリーンショット](https://roboin.io/api/media/file/thumbnail-127.png)
*画像：「[Introducing PaliGemma, Gemma 2, and an Upgraded Responsible AI Toolkit - Google Developers Blog](https://developers.googleblog.com/en/gemma-family-and-toolkit-expansion-io-2024/)」より*

PaliGemmaは、[PaLI-3](https://arxiv.org/abs/2310.09199)にインスパイアされ、[SigLIP](https://arxiv.org/abs/2303.15343)ビジョンモデルと**Gemma**言語モデルを統合した、オープンなビジョン言語モデル（VLM：Visual Language Model）です。多岐にわたる視覚・言語タスクで優れたパフォーマンスを発揮するよう設計されています。

PaLI-3は、画像とテキストの統合理解を提供するモデルで、SigLIPは視覚的特徴の抽出を専門とするモデルです。一方、Gemmaは高度な言語理解を担当するモデルです。この3つのモデルが統合されることで、PaliGemmaは従来のVLMに比べてより深い分析と洞察を提供することが可能となっています。

Googleのオープンな大規模言語モデル（LLM：Large Language Model）の「Gemma」については、こちらの記事で紹介しています。

[GoogleのオープンなLLM「Gemma」を使ってみた　概要から使い方まで解説](https://roboin.io/article/2024/02/22/google-releases-gemma-and-how-to-use/)

PaliGemmaの最大のメリットは、**マルチモーダル**に対応している点です。これにより、画像と言語の両方を同時に理解し、幅広いタスクに利用できます。

また、PaliGemmaが発表されたGoogle I/O 2024の前日には、OpenAIが新しいマルチモーダルAI「GPT-4o」を発表しています。

[GPT-4o発表！OpenAI Spring Updateの発表内容まとめ](https://roboin.io/article/2024/05/14/openai-spring-update-2024/)

[GPT-4oの概要から使い方まで徹底解説！OpenAIの次世代フラッグシップモデル](https://roboin.io/article/2024/05/14/openai-releases-gpt-4o-multimodal-ai/)

## PaliGemmaを使う方法

PaliGemmaは、[Hugging Face](https://huggingface.co/google)や[Kaggle](https://www.kaggle.com/models/google/paligemma)からダウンロードでき、Google Colabノートブックやローカルで利用可能です。複数の解像度で事前学習されたチェックポイントとファインチューニング済みのチェックポイントが提供されています。

- **PaliGemma**：さまざまなタスクでファインチューニングできる汎用できな事前学習済みモデル
- **PaliGemma-FT**：研究データセットに微調整された研究目的モデル

また、Googleは学術研究者を支援しており、Google Cloudのクレジットを利用することで、PaliGemmaを活用した高度な研究が可能です。学術研究をしている場合は、Google Cloudクレジットを[こちら](https://docs.google.com/forms/d/1Hc6kzDvLtPflHnSql8_tPid7KxEgs39k-5pZsmOvKVE/viewform?edit_requested=true)から申請できます。

Googleによると、`paligemma-3b-mix`を除くPaliGemmaモデルは、有用な結果を生成するためにファインチューニングを必要とするとのことです。エンドユーザーにデプロイする前に、ファインチューニングして出力を確認することが推奨されています。

## まとめ

Googleのオープンなビジョン言語モデル「PaliGemma」は、視覚情報と言語情報を統合し、さまざまなタスクに対応可能なモデルです。PaLI-3、SigLIP、Gemmaの3つのモデルを統合することで、より深い分析と洞察を提供します。PaliGemmaは、Hugging FaceやKaggleからダウンロードでき、Google Cloudのクレジットを利用することで高度な研究が可能です。

## 参考

- [Introducing PaliGemma, Gemma 2, and an Upgraded Responsible AI Toolkit - Google Developers Blog](https://developers.googleblog.com/en/gemma-family-and-toolkit-expansion-io-2024/)
- [PaliGemma  |  Google for Developers](https://ai.google.dev/gemma/docs/paligemma?hl=ja)