← 解説の一覧へ更新:2026.10.05 MON
マルチモーダルAIとは?写真や声も分かるAI
写真を見せて質問したり、声で話したり。文字以外の情報もあつかえるAIの使い道と、写りこみなどの注意点をやさしく解説します。
かんたんまとめ
- マルチモーダルAIは、文字だけでなく、写真・声・動画などいくつもの種類の情報をまとめてあつかえるAI
- 写真を見せて質問したり、声で会話したり、録音から議事録を作ったりできる
- 写真や録音には、思わぬ情報が写りこむ・入りこむことがあるので注意する
マウ
AIに冷蔵庫の中の写真を見せたら、作れる料理を教えてくれたよ! どうして写真が分かるの?
ビット
それがマルチモーダルAIだね。「モーダル」は情報の種類のこと。文字・写真・声などをまとめて学習しているから、写真の中身をことばで説明できるんだ。
入れる
文字
写真・画像
声・音
動画
まとめて理解する写真の中の文字や、声の調子も手がかりにする
出す
文章
画像
声
マウ
仕事では、どんなふうに使えるの?
ビット
「見せる」「聞かせる」だけで頼めるから、文字に起こす手間がいらないのが強みだよ。
手書きのメモや紙の書類を写真で撮って、文字にしてもらう
グラフや表の画像を見せて、読み取りや説明をしてもらう
会議の録音から、要点や決まったことをまとめてもらう
画面のスクリーンショットを見せて、操作のしかたやエラーの意味を聞く
声で会話しながら、外国語の練習や考えの整理をする
マウ
写真を見せるだけなら、気をつけることはなさそうだね。
ビット
そうでもないんだ。写真のすみのホワイトボードや書類、人の顔まで、AIはしっかり読み取るよ。それに、細かい数字の読みまちがいも起きるんだ。
今回のポイント
- 写真を送る前に、写りこんだ書類・画面・人の顔がないか確かめる。必要ならその部分を切り取る
- 会議の録音を使うときは、参加者に伝えてから、会社が認めたサービスで扱う
- 写真や表から読み取った数字は、元と見くらべて確かめる
マウ
見せる・聞かせるだけで頼めるって、すごく便利だね。
ビット
そのとおり!ひとことでいうと「見せる前に、写りこみチェック」だよ。写真を使った服の試着の話はこちらの記事も見てね。
- マルチモーダルAI
- 文字・画像・音声・動画など、いくつもの種類の情報をまとめてあつかえるAI
- モーダル
- 情報の種類のこと。文字、画像、音声などがそれぞれ1つのモーダル
- 文字起こし
- 録音や動画の中の話し声を、文字にすること
参考:Google(画像の理解) ↗OpenAI(画像の入力) ↗OpenAI(音声) ↗