多模态(Multimodal)(2026.08.24)

概念编号:062

一句话理解

多模态模型不只处理文字,还能理解或生成图像、声音、视频等不同形式的信息。

苏苏的入门解释

多模态(Multimodal):不仅会看字,还会看图、听声音、认视频的模型。

作用:解决“你描述一只猫,模型只知道猫这个字,却没见过猫长什么样”的缺陷。

具体解释

“模态”可以理解为信息的表现形式或感知通道。文字、图片、音频和视频是不同模态。多模态模型能够把这些不同形式的信息放在同一个任务中理解、比较、转换或生成。

例如,你上传一张猫的照片并问“它在做什么”,模型需要同时处理图像和文字;你给模型一段会议录音,让它输出摘要,则涉及音频理解和文字生成;让模型根据文字和参考图生成视频,则涉及跨模态创作。

常见组合

  • 文本+图像:看图问答、图片分析、图像编辑;
  • 文本+音频:语音对话、语音转写、声音理解;
  • 文本+视频:视频问答、内容分析、镜头理解;
  • 图像/音频/视频生成:根据文字或参考素材生成媒体内容。

边界与易混淆概念

  • 多模态不等于只会生成图片:理解图片、听懂音频和处理视频同样属于多模态能力。
  • 支持输入不等于支持输出:模型可能会看图,但不能生成图;也可能能听音频,但不能生成声音。
  • 支持多模态不等于每种模态都同样强:具体能力要看模型版本和任务。
  • 模型与应用要区分:应用的图片上传、语音播放和视频处理功能,不一定全部由同一个模型完成。

相关概念

来源

概念卡更新日志

  • 2026.08.24|创建概念卡:依据已有 LLM 科普文章、当前模型导航和用户提供的猫的比喻,登记为 062