AIひとくちニュース

← 解説の一覧へ更新:2026.10.05 MON

写真も声も分かるAI

マルチモーダルAIとは?写真や声も分かるAI

写真を見せて質問したり、声で話したり。文字以外の情報もあつかえるAIの使い道と、写りこみなどの注意点をやさしく解説します。

かんたんまとめ
マウ

AIに冷蔵庫の中の写真を見せたら、作れる料理を教えてくれたよ! どうして写真が分かるの?

ビット

それがマルチモーダルAIだね。「モーダル」は情報の種類のこと。文字・写真・声などをまとめて学習しているから、写真の中身をことばで説明できるんだ。

入れられるもの・出せるもの
入れる
文字 写真・画像 声・音 動画
まとめて理解する写真の中の文字や、声の調子も手がかりにする
出す
文章 画像 声
マウ

仕事では、どんなふうに使えるの?

ビット

「見せる」「聞かせる」だけで頼めるから、文字に起こす手間がいらないのが強みだよ。

マルチモーダルAIの使い道
手書きのメモや紙の書類を写真で撮って、文字にしてもらう
グラフや表の画像を見せて、読み取りや説明をしてもらう
会議の録音から、要点や決まったことをまとめてもらう
画面のスクリーンショットを見せて、操作のしかたやエラーの意味を聞く
声で会話しながら、外国語の練習や考えの整理をする
マウ

写真を見せるだけなら、気をつけることはなさそうだね。

ビット

そうでもないんだ。写真のすみのホワイトボードや書類、人の顔まで、AIはしっかり読み取るよ。それに、細かい数字の読みまちがいも起きるんだ。

今回のポイント
マウ

見せる・聞かせるだけで頼めるって、すごく便利だね。

ビット

そのとおり!ひとことでいうと「見せる前に、写りこみチェック」だよ。写真を使った服の試着の話はこちらの記事も見てね。

用語ミニ解説
マルチモーダルAI
文字・画像・音声・動画など、いくつもの種類の情報をまとめてあつかえるAI
モーダル
情報の種類のこと。文字、画像、音声などがそれぞれ1つのモーダル
文字起こし
録音や動画の中の話し声を、文字にすること

参考:Google(画像の理解) ↗OpenAI(画像の入力) ↗OpenAI(音声) ↗

この解説に関係する記事

解説の一覧へ