Multimodal
Multimodal AI
Multimodal(マルチモーダル)とは
ひとことで
テキスト・画像・音声・動画など、種類の異なる複数のデータ(モダリティ)をまとめて扱えるAIの性質。画像を見て質問に答える、音声で会話するといったことが可能になる。
たとえると
文字の手紙しか読めなかった相談相手が、写真を見たり、声を聞いたりできるようになるイメージです。「この写真の故障箇所はどこ?」と見せながら相談できるので、説明の手間が大きく減ります。
現場ではこう使う
設備保守の担当者が、現場で撮影した機械の写真と、異音を録音した音声をAIにまとめて渡し、考えられる原因を尋ねました。AIは写真に写った部品の摩耗と音の特徴を合わせて原因の候補を挙げ、確認すべき点を示しました。最終的な判断は、担当者が実機を点検して行いました。
試験のポイント
EXAM POINT「テキスト・画像・音声など複数の種類のデータを扱う」と出てきたらマルチモーダルです。1種類のデータだけを扱う「シングルモーダル」との対比や、データの種類を指す「モダリティ」という言葉が問われます。「複数のモデルを組み合わせる」「複数の言語を扱う(多言語)」とは意味が違うので、選択肢の言い換えに注意しましょう。
混同しやすい用語との違い
- LLM主にテキストを扱う大規模言語モデル。画像や音声も扱えるよう拡張したものはマルチモーダルモデルと呼ばれる
- Foundation Model大量のデータで事前学習し、多くの用途に転用できるモデル。マルチモーダルかどうかとは別の観点