多模态(Multimodal)(2026.08.24)
概念编号:062
一句话理解
多模态模型不只处理文字,还能理解或生成图像、声音、视频等不同形式的信息。
苏苏的入门解释
多模态(Multimodal):不仅会看字,还会看图、听声音、认视频的模型。
作用:解决“你描述一只猫,模型只知道猫这个字,却没见过猫长什么样”的缺陷。
具体解释
“模态”可以理解为信息的表现形式或感知通道。文字、图片、音频和视频是不同模态。多模态模型能够把这些不同形式的信息放在同一个任务中理解、比较、转换或生成。
例如,你上传一张猫的照片并问“它在做什么”,模型需要同时处理图像和文字;你给模型一段会议录音,让它输出摘要,则涉及音频理解和文字生成;让模型根据文字和参考图生成视频,则涉及跨模态创作。
常见组合
- 文本+图像:看图问答、图片分析、图像编辑;
- 文本+音频:语音对话、语音转写、声音理解;
- 文本+视频:视频问答、内容分析、镜头理解;
- 图像/音频/视频生成:根据文字或参考素材生成媒体内容。
边界与易混淆概念
- 多模态不等于只会生成图片:理解图片、听懂音频和处理视频同样属于多模态能力。
- 支持输入不等于支持输出:模型可能会看图,但不能生成图;也可能能听音频,但不能生成声音。
- 支持多模态不等于每种模态都同样强:具体能力要看模型版本和任务。
- 模型与应用要区分:应用的图片上传、语音播放和视频处理功能,不一定全部由同一个模型完成。
相关概念
- 大模型(LLM)(2026.08.24)
- 推理(Reasoning)(2026.08.24):不同模态之间的理解和比较也可能需要推理。
- 上下文窗口(Context Window)(2026.08.24):图像、音频和视频也会消耗模型的工作空间。
- 幻觉(Hallucination)(2026.08.24)
来源
- 什么是 LLM 大语言模型?:已有文章中的多模态模型基础材料。
- AI学习导航:多模态模型与媒体生成模型入口。
- 本轮 AI 概念清单原始笔记:提供“看字、看图、听声音、认视频”和猫的入门解释。
概念卡更新日志
- 2026.08.24|创建概念卡:依据已有 LLM 科普文章、当前模型导航和用户提供的猫的比喻,登记为 062。
🔐 GitHub 评论(Giscus)
正在连接 GitHub 评论…