マルチモーダル

まるちもーだる/Multimodal

文章・画像・音声・動画など、複数の種類の情報を組み合わせて扱えるAIの性質です。

最終更新: 2026-07-06

01

詳しい解説

マルチモーダルとは、AIがテキストだけでなく、画像・音声・動画など複数の種類(モダリティ)の情報を同時に理解したり生成したりできる性質を指します。従来のAIは「テキストならテキストのみ」「画像なら画像のみ」を扱うものが中心でしたが、近年のAIモデルは複数の形式を横断的に扱えるようになっています。

具体的には、画像を見せて「この写真に写っているものを説明して」と尋ねたり、手書きのメモを撮影した画像から文字情報を読み取ったり、逆に文章の指示から画像を生成したりする使い方が挙げられます。1つのAIが複数の入力・出力形式を扱えることで、これまで別々のツールが必要だった作業を1つの窓口でこなせるようになってきています。

個人開発の現場でも、UIデザインのスクリーンショットをAIコーディングエージェントに見せて「このデザインに近い画面を実装して」と依頼するなど、マルチモーダルな入力を活かした使い方が広がっています。

02

具体例・使いどころ

手書きの図をAIに見せて要件を伝える、エラー画面のスクリーンショットを見せて原因を尋ねる、といった使い方が代表的です。

03

関連用語

04

関連記事