首页 / 多模态(Multimodal)

📖 多模态(Multimodal) 是什么?

多模态是 AI 的“五感俱全”,不光看字,还能看图、听声音。

核心概念

⚡ 一句话秒懂

多模态是 AI 的“五感俱全”,不光看字,还能看图、听声音。

📖 举个故事

刘姐在仓库用手机拍了一张货架照片发给 AI 助手:“帮我数数第三层有几箱货。”AI 回:“第三层有 7 箱,其中 2 箱标签破损。”刘姐惊了:“它居然‘看’得见?”同事解释:“以前的 AI 是‘瞎子’,只能读文字;现在的 AI 长了‘眼睛’,图片、声音、文字都能一起理解。”刘姐觉得,这比打字描述省事多了。

💡 类比理解

暂未补充。

🧩 真实例子

暂未补充。

🛠️ 怎么实际使用

开发 Agent 时,若输入含图片,直接传 image_url(base64 或 URL)给支持视觉的模型,提示词里说明“请描述图片中的表格内容”。注意图片占用大量 token(1024px 图约 1000+ token),批量场景先压缩或裁剪。语音场景可先接 STT 转文字再进 LLM,兼顾成本。

📚 进阶原理

多模态模型用统一编码器把文本、图像、音频映射到同一向量空间,如 CLIP 对齐图文,LLaVA 等 VLM 用视觉编码器加语言模型融合。推理时视觉 token 数远多于文本,成本与延迟更高。工程上先用轻量模型预处理(OCR、分类),只把关键信息送进大模型,兼顾效果与成本。

继续学习相关术语