マルチモーダル・サービス
マルチモーダルAIとは?
読み: まるちもーだるえーあい英語: Multimodal AI更新日: 2026-06-23
マルチモーダルAIとは、テキスト、画像、音声、動画など複数種類のデータを統合的に扱えるAIです。
生成AIパスポートG検定
関連表記: マルチモーダルAI / Multimodal AI / マルチモーダル / ネイティブマルチモーダル
試験で問われるポイント
- 画像を見て質問に答える、動画を生成するなどの用途があります。
- GeminiやGPT-4Vなどの例と結びつけて出題されます。
- ディープフェイクや著作権などのリスクも関係します。
具体例
商品の写真と説明文を同時に理解して検索するサービスに使われます。
混同しやすい点
- テキストだけを扱うAIと同じ意味で使う。
- 複数モダリティなら常に人間と同じ理解ができると考える。
関連問題で復習
Cloud Digital LeaderGoogle CloudのAI活用
Geminiに代表されるマルチモーダルAIの特徴を表す説明はどれですか。
AWS AI Practitioner生成AIの基礎
現場の状況写真と担当者が入力した文章を、同じリクエストの文脈として理解させたいと考えています。この入力要件を満たすモデルの特徴はどれですか。
DS検定データサイエンス
診療支援で、問診テキスト、患部画像、心音の音声を組み合わせて一つの判定を出したい。このデータとモデルの説明として最も適切なものはどれか。
G検定人工知能をめぐる動向
第1次AIブームで中心となった探索・推論の具体例として、最も適切なものはどれか。
G検定ディープラーニングの応用例
マルチモーダルタスクの説明として、最も適切なものはどれか。
G検定ディープラーニングの応用例
画像と文章を対応付けて事前学習したマルチモーダルモデルを、新しい商品画像の検索や分類へ応用したい。学習時になかったカテゴリも含まれ、追加のラベル付きデータは少ない。この事前学習が応用を支え得る理由として、最も適切なものはどれか。
G検定ディープラーニングの応用例
マルチモーダルタスクと入出力の対応として、最も適切なものはどれか。
生成AIパスポート生成AI(ジェネレーティブAI)
生成AIが事実と異なる内容をもっともらしく生成する現象はどれか。