首页 / 多模态(Multimodal)
📖 多模态(Multimodal) 是什么?
多模态是 AI 的“五感俱全”,不光看字,还能看图、听声音。
⚡ 一句话秒懂
多模态是 AI 的“五感俱全”,不光看字,还能看图、听声音。
📖 举个故事
刘姐在仓库用手机拍了一张货架照片发给 AI 助手:“帮我数数第三层有几箱货。”AI 回:“第三层有 7 箱,其中 2 箱标签破损。”刘姐惊了:“它居然‘看’得见?”同事解释:“以前的 AI 是‘瞎子’,只能读文字;现在的 AI 长了‘眼睛’,图片、声音、文字都能一起理解。”刘姐觉得,这比打字描述省事多了。
💡 类比理解
暂未补充。
🧩 真实例子
暂未补充。
🛠️ 怎么实际使用
开发 Agent 时,若输入含图片,直接传 image_url(base64 或 URL)给支持视觉的模型,提示词里说明“请描述图片中的表格内容”。注意图片占用大量 token(1024px 图约 1000+ token),批量场景先压缩或裁剪。语音场景可先接 STT 转文字再进 LLM,兼顾成本。
📚 进阶原理
多模态模型用统一编码器把文本、图像、音频映射到同一向量空间,如 CLIP 对齐图文,LLaVA 等 VLM 用视觉编码器加语言模型融合。推理时视觉 token 数远多于文本,成本与延迟更高。工程上先用轻量模型预处理(OCR、分类),只把关键信息送进大模型,兼顾效果与成本。