Appearance
01. 多模态基础与应用详解
版本:
v1.1最后更新:
2026-07-06适用对象:希望系统理解多模态模型、多模态应用架构、图像/音频/视频/文档处理流程与工程落地方法的学习者。
1. 什么是多模态
多模态(Multimodal)指模型或系统能够处理、理解、生成或联动多种信息形态。
常见模态包括:
- 文本:自然语言、代码、表格文本、日志、结构化字段
- 图像:照片、截图、图表、手写内容、商品图、医学图像
- 音频:语音、会议录音、环境声音、音乐片段
- 视频:连续画面、动作过程、屏幕录制、监控片段
- 文档:PDF、PPT、Word、扫描件、合同、票据、表单
- 传感器数据:位置、温度、时序信号、机器人状态、操作轨迹
更直白地说:
- 传统 LLM 主要读文字
- 多模态模型可以看图、听音频、理解视频,甚至把这些信息和文本放在一起推理
多模态不只是输入更多文件,而是让模型建立跨模态的联合理解。
2. 为什么多模态重要
真实世界的信息很少只以纯文本存在。
用户经常给系统的输入是:
- 一张报错截图
- 一份扫描合同
- 一段客服录音
- 一个监控视频片段
- 一个带图表的 PDF
- 一张手写表单
- 一段屏幕录制
如果系统只能读文本,就必须先把这些内容转成文本,再进入 LLM。这条路线能做很多事,但会丢失布局、颜色、空间关系、时间顺序和视觉细节。
多模态能力的价值在于:
- 更接近真实用户输入
- 降低用户表达成本
- 减少 OCR、ASR 等中间环节的信息损失
- 支持更自然的人机交互,例如语音对话、截图问答、视频理解
- 让 Agent 能观察外部环境,再决定下一步动作
3. 多模态系统解决的核心问题
多模态系统通常要解决 5 类问题。
3.1 感知
感知是把原始模态转成模型可理解的信息。
例如:
- 从图片里识别物体、文字、位置和关系
- 从音频里识别说话内容、语气、停顿和说话人变化
- 从视频里识别动作、时间顺序和事件变化
- 从 PDF 里识别标题、段落、表格、页眉页脚和版面结构
感知阶段决定了模型能看到什么。
3.2 对齐
对齐是把不同模态映射到可互相比较、互相理解的表示空间。
例如:
- 图片中的一只猫和文字“cat”要能对应起来
- 视频里的动作和文本描述“拿起杯子”要能对应起来
- 音频里的语音和转写文本要能对应起来
CLIP 这类模型的关键思想就是用大量图文对学习图像和文本之间的对齐关系。
3.3 融合
融合是让模型把不同模态的信息结合起来推理。
例如用户问:
看这张报错截图,帮我判断问题出在哪里。
模型需要同时理解:
- 截图中的 UI 元素
- 报错文字
- 用户问题
- 可能的上下文
如果只是 OCR 出文字,可能会丢失按钮位置、页面状态、层级关系等视觉线索。
3.4 生成
多模态系统不只理解输入,也可以生成输出。
常见输出包括:
- 图片说明
- 表格抽取结果
- 文档摘要
- 语音回复
- 图像生成或编辑
- 视频脚本
- 多模态报告
3.5 行动
当多模态能力和 Agent 结合时,模型不只是看和说,还可能根据观察结果调用工具。
例如:
- 看截图后点击页面按钮
- 听用户语音后查询订单
- 读合同后生成审批意见
- 看设备照片后创建维修工单
这时系统要同时处理感知、推理、工具权限和安全边界。
4. 常见模态能力详解
4.1 图像理解
图像理解是最常见的多模态能力。
典型能力:
- 识别图片中的对象、场景和关系
- 阅读截图、票据、表单和文档图片中的文字
- 理解图表趋势
- 比较两张图片差异
- 根据图片回答问题
- 判断 UI 状态和页面错误
典型输入:
- 商品图
- 设备照片
- 错误截图
- 白板照片
- 图表截图
- 身份证、发票、合同扫描件
图像理解不等于 OCR。OCR 只解决“图里有什么文字”,图像理解还要处理版面、视觉关系、颜色、图形和上下文。
4.2 文档理解
文档理解可以看作图像、文本、版面和结构的组合任务。
一份 PDF 里可能包含:
- 标题层级
- 正文段落
- 表格
- 图片
- 页眉页脚
- 脚注
- 扫描图片
- 印章和签名
文档理解的目标不是简单提取全文,而是保留结构。
例如合同审查场景里,只拿到 OCR 文本可能不够。系统还需要知道:
- 哪些条款属于同一章节
- 表格里的金额对应哪个项目
- 签字页是否存在
- 印章和日期是否在指定位置
- 附件是否完整
4.3 语音识别
语音识别(Speech to Text, STT)把音频转成文本。
关键能力包括:
- 转写用户语音
- 识别不同语言
- 处理噪声和口音
- 识别标点和停顿
- 支持实时或离线转写
语音识别的难点:
- 背景噪声
- 多人同时说话
- 口音和方言
- 专有名词
- 说话中断、重复和口误
- 音频质量不稳定
在真实业务里,ASR 结果通常需要后处理,例如:
- 纠错
- 分段
- 说话人分离
- 标点恢复
- 关键词提取
- 意图识别
4.4 语音生成
语音生成(Text to Speech, TTS)把文本转成自然语音。
典型应用:
- 智能客服播报
- 语音助手回复
- 有声内容生成
- 无障碍阅读
- 教育陪练
- 车载语音交互
工程上需要关注:
- 音色
- 语速
- 情绪
- 停顿
- 多语言
- 延迟
- 是否支持流式播放
好的语音系统不只是声音自然,还要让对话节奏自然。
4.5 实时语音交互
实时语音交互比“先转写、再回答、再 TTS”更复杂。
它需要处理:
- 用户什么时候开始说话
- 用户什么时候说完
- 是否允许打断
- 模型是否边听边思考
- 回复音频如何流式输出
- 工具调用期间如何保持对话体验
实时语音 Agent 的关键指标不是单次回答质量,而是交互延迟、打断体验和任务完成率。
4.6 视频理解
视频可以理解为图像序列加音频加时间关系。
视频理解任务包括:
- 描述视频内容
- 分析事件发生顺序
- 识别动作
- 检测异常
- 总结会议录像
- 理解屏幕录制中的操作步骤
- 从视频中抽取关键帧和时间点
视频比图片更难,因为它多了时间维度。
工程上常见做法:
- 抽关键帧
- 按时间窗口切片
- 提取音频转写
- 将视觉信息和字幕/ASR 合并
- 再交给模型做总结或问答
5. 多模态模型的基本技术路线
5.1 分阶段流水线
分阶段流水线是最容易落地的方案。
典型流程:
text
图片/PDF/音频/视频
-> OCR / ASR / 关键帧抽取 / 版面分析
-> 文本和结构化中间结果
-> LLM 理解、总结、抽取、问答
-> 业务系统消费结果优点:
- 工程可控
- 每个环节可替换
- 方便调试
- 可以复用成熟 OCR、ASR、文档解析工具
- 适合对准确性和可追溯要求高的场景
缺点:
- 中间转换可能丢失信息
- 链路长,延迟更高
- 每个环节都有错误传播
- 复杂图像关系不一定能通过文本表达完整
适合场景:
- 发票识别
- 合同抽取
- 会议转写总结
- 客服录音分析
- 扫描件归档
5.2 端到端多模态模型
端到端多模态模型直接接收图像、音频或视频,再结合文本指令输出结果。
典型流程:
text
用户问题 + 图片/音频/视频
-> 多模态模型
-> 答案 / JSON / 操作建议优点:
- 链路短
- 能保留更多原始模态信息
- 对截图、图表、视觉关系更友好
- 用户体验更自然
缺点:
- 成本可能更高
- 可解释性较弱
- 对复杂文档结构不一定稳定
- 很难完全替代专业 OCR、ASR 或版面解析
适合场景:
- 截图问答
- 图片内容理解
- UI 状态判断
- 图表解释
- 简单文档问答
- 视觉辅助 Agent
5.3 混合路线
实际生产中最常见的是混合路线。
例如文档审查:
text
PDF
-> 文档解析:提取文本、表格、版面、页码
-> 多模态模型:检查签章、图片、版面异常
-> LLM:条款分析、风险总结、结构化输出
-> 人工复核混合路线的优点是:
- 用专业工具处理确定性强的部分
- 用多模态模型处理视觉理解和复杂推理
- 用 LLM 做总结、判断和业务表达
6. 多模态输入的预处理
多模态系统成败很大程度取决于输入质量。
6.1 图像预处理
常见处理:
- 调整分辨率
- 裁剪无关区域
- 旋转校正
- 去噪
- 提升对比度
- 多图排序
- 对长截图切片
- 对重要区域局部放大
注意事项:
- 截图不要过度压缩
- 小字图片要保证清晰度
- 多张图片要说明顺序和关系
- 如果只关心局部区域,最好明确标注
图像输入常见失败原因:
- 分辨率过低
- 字体太小
- 图片模糊
- 截图不完整
- 多张图顺序混乱
- 关键区域被遮挡
6.2 文档预处理
文档处理要特别关注结构。
建议保留:
- 页码
- 标题层级
- 段落顺序
- 表格结构
- 图片说明
- 脚注
- 附件关系
- 扫描页和原生文本页的差异
不要只把 PDF 粗暴转成一大段文本。这样很容易丢掉表格关系和章节边界。
6.3 音频预处理
常见处理:
- 降噪
- 分段
- 语音活动检测(VAD)
- 说话人分离
- 采样率统一
- 音量标准化
- 专有名词热词提示
音频系统要特别注意:
- 用户可能说到一半停顿
- 用户可能打断模型
- 多人会议需要区分说话人
- 专有名词识别错误会影响后续业务判断
6.4 视频预处理
视频一般不能整段无脑丢给模型,成本和延迟都会很高。
常见策略:
- 抽关键帧
- 按固定间隔采样
- 按镜头变化采样
- 提取音频转写
- 对字幕单独 OCR
- 将画面、字幕、ASR 按时间戳对齐
视频理解最好保留时间信息,例如:
text
00:00-00:15 用户打开登录页
00:16-00:20 输入账号
00:21-00:25 页面提示验证码错误这样模型更容易回答“什么时候发生了什么”。
7. 多模态 Prompt 怎么写
多模态 Prompt 要比纯文本 Prompt 多说明三件事:
- 输入模态是什么
- 模态之间是什么关系
- 输出时如何引用视觉、音频或视频证据
7.1 图片理解 Prompt 模板
text
你是图像理解助手。
任务:
根据用户提供的图片回答问题。
观察要求:
1. 先识别图片类型:截图、照片、图表、文档、表单或其他。
2. 再提取与问题相关的可见信息。
3. 如果图片中文字不清楚,直接说明不确定,不要猜测。
4. 如果问题需要图片之外的信息,说明缺少哪些信息。
输出格式:
## 结论
[直接回答]
## 依据
- [来自图片的可见证据]
## 不确定点
- [如果没有,写“无”]7.2 截图排障 Prompt 模板
text
你是产品技术支持助手。
任务:
根据截图判断用户可能遇到的问题,并给出排查建议。
要求:
- 只能基于截图中可见的信息和用户描述推断。
- 如果截图不完整,说明需要补充哪些区域。
- 不要把猜测当成确定结论。
- 优先给出用户可以立即尝试的排查步骤。
输出:
1. 截图显示的问题
2. 可能原因
3. 建议排查步骤
4. 需要补充的信息7.3 文档抽取 Prompt 模板
text
你是文档信息抽取助手。
任务:
从文档图片或 PDF 解析结果中抽取指定字段。
字段:
- document_type:合同、发票、收据、审批单、其他
- title:文档标题
- parties:涉及主体
- amount:金额
- date:日期
- key_terms:关键条款
- missing_fields:缺失字段
规则:
1. 字段必须来自文档可见内容。
2. 如果字段不存在,返回 null 或空数组。
3. 如果文本模糊,标记为 uncertain。
4. 保留页码或证据位置,方便复核。7.4 音频总结 Prompt 模板
text
你是会议纪要助手。
任务:
根据语音转写内容生成会议纪要。
要求:
- 保留决策、待办、负责人和时间。
- 如果转写中存在明显识别错误,标记为可能错误,不要强行修正。
- 区分已经确定的结论和待确认事项。
输出:
## 会议结论
## 待办事项
## 风险与争议
## 需要确认的内容7.5 视频理解 Prompt 模板
text
你是视频内容分析助手。
任务:
根据视频关键帧、字幕和音频转写,回答用户问题。
要求:
- 按时间顺序分析事件。
- 引用时间戳作为依据。
- 如果关键帧不足以判断,说明缺少哪些时间段。
- 不要把单帧画面推断成完整事件,除非时间序列支持。
输出:
## 结论
## 时间线
## 证据
## 不确定点8. 多模态应用架构
8.1 图片问答架构
text
用户上传图片 + 问题
-> 图片质量检查
-> 多模态模型理解
-> 结构化答案
-> 证据与不确定点适合:
- 截图问答
- 商品图分析
- 图表解释
- 简单票据识别
关键点:
- 检查图片是否清晰
- 保留用户问题
- 要求模型说明依据
- 对高风险结论加入人工复核
8.2 文档智能处理架构
text
PDF/扫描件
-> 文档解析/OCR/版面分析
-> 表格和章节结构恢复
-> LLM 抽取与总结
-> 规则校验
-> 人工复核适合:
- 合同审查
- 发票识别
- 档案归档
- 审批材料初审
- 研究报告摘要
关键点:
- 结构比纯文本更重要
- 表格要保留行列关系
- 金额、日期、主体要做规则校验
- 结果要能回溯到页码或片段
8.3 语音客服架构
text
用户语音
-> 语音活动检测
-> ASR 转写
-> 意图识别
-> 知识库/RAG/业务查询
-> 生成回复
-> TTS 播报适合:
- 电话客服
- 车载助手
- 语音问答
- 会议助手
关键点:
- 延迟要低
- 支持用户打断
- 专有名词需要优化
- 业务操作必须有确认
8.4 实时语音 Agent 架构
text
麦克风音频流
-> 实时语音模型或实时管线
-> 对话状态管理
-> 工具调用
-> 流式语音回复
-> 日志与质检适合:
- 实时客服
- 语音面试
- 陪练系统
- 远程操作助手
关键点:
- 用户打断处理
- 工具调用期间的等待话术
- 对话状态不能丢
- 高风险动作要确认
8.5 视频分析架构
text
视频文件
-> 切片 / 抽帧 / ASR / OCR
-> 时间线对齐
-> 多模态理解
-> 摘要 / 事件检测 / 问答适合:
- 监控异常分析
- 课程视频总结
- 屏幕录制复盘
- 会议录像纪要
关键点:
- 不要只看单帧
- 时间戳很重要
- 音频和画面要对齐
- 长视频要分段处理
8.6 常见产品路线到底怎么选
很多团队一说“做多模态”,其实说的是完全不同的系统。更实用的分法通常是:
A. 文件理解路线
text
图片 / PDF / 音频 / 视频文件
-> 预处理
-> 理解 / 抽取 / 总结
-> 结构化结果 / 问答更适合:
- 报错截图排障
- 文档抽取
- 会议录音总结
- 课程视频复盘
B. 实时转写路线
text
流式音频
-> transcription session
-> 实时字幕 / 文本流更适合:
- 直播字幕
- 电话记录
- 会议同传前置转写
这类系统更看重:
- 延迟
- VAD / turn detection
- 文本流稳定性
C. 实时语音助手路线
text
流式音频
-> Realtime session
-> 理解 / 工具调用 / 语音回复更适合:
- 语音客服
- 陪练
- 语音面试
- 远程助手
这类系统比转写系统多了:
- 打断处理
- 语音回复节奏
- 工具等待话术
- 长会话状态
D. 图像 / 视频生成路线
text
文本 / 参考图
-> 图像或视频生成
-> 审核 / 批处理 / 资产管理更适合:
- 营销素材
- 角色设定图
- 视频片段生成
- 海报或封面生成
这类系统的核心问题已经从“理解输入”切到了:
- 风格一致性
- 素材审核
- 批量任务吞吐
- 生成成本和等待时间
9. 多模态系统的评测
多模态评测比文本评测更难,因为输入质量、模态对齐和主观判断都会影响结果。
9.1 图像理解评测
常见指标:
- 对象识别是否正确
- OCR 是否准确
- 空间关系是否正确
- 图表趋势解释是否正确
- 是否承认图片不清楚
- 是否编造不可见内容
测试样本要覆盖:
- 清晰图
- 模糊图
- 截断图
- 小字图
- 多图顺序
- 图文冲突
9.2 文档理解评测
常见指标:
- 字段抽取准确率
- 表格结构恢复准确率
- 金额和日期准确率
- 页码引用准确率
- 章节归属是否正确
- 缺失字段是否正确返回空
文档任务尤其要防止模型补全不存在的信息。
9.3 音频评测
常见指标:
- 字错率(WER)
- 关键词召回率
- 说话人分离准确率
- 延迟
- 用户打断处理成功率
- 任务完成率
语音系统不要只测转写质量,还要测端到端体验。
9.4 视频评测
常见指标:
- 事件识别准确率
- 时间戳误差
- 动作顺序是否正确
- 是否遗漏关键片段
- 是否把单帧误判成事件
长视频还要评估分段策略是否会切断上下文。
10. 多模态系统常见难点
10.1 输入质量不稳定
用户上传的文件经常质量不可控。
例如:
- 图片模糊
- 音频嘈杂
- PDF 扫描歪斜
- 视频过长
- 截图不完整
系统要在入口处做质量判断,而不是把所有问题都丢给模型。
10.2 中间错误会传播
流水线系统中,OCR 或 ASR 一旦出错,后面的 LLM 可能基于错误文本继续推理。
解决方法:
- 保留置信度
- 标记不确定片段
- 对关键字段做二次校验
- 让模型看到原图或原音频片段
- 关键结果进入人工复核
10.3 成本和延迟更高
多模态输入通常比文本更重。
成本来源:
- 图片 token
- 音频时长
- 视频抽帧数量
- OCR/ASR 调用
- 多轮工具链
优化方法:
- 裁剪无关区域
- 只抽关键帧
- 限制图片数量
- 先做轻量分类,再决定是否调用大模型
- 对重复文件做缓存
10.4 评测困难
文本任务可以比较字符串或 JSON,多模态任务往往需要看图、听音频、对时间线。
建议:
- 建立小而高质量的人工标注集
- 对关键字段做自动校验
- 对主观任务用评分 Rubric
- 保留原始输入和模型证据
- 将线上失败样本回流
10.5 安全和隐私风险更高
图片、音频和文档里可能包含敏感信息。
例如:
- 身份证号
- 地址
- 电话
- 合同金额
- 医疗记录
- 车牌
- 人脸
- 公司内部截图
多模态系统要考虑:
- 文件访问权限
- 脱敏
- 存储周期
- 审计日志
- 高风险输出拦截
- 用户授权
11. 多模态与 RAG 的关系
多模态 RAG 是把图片、音频、视频或文档内容纳入检索增强生成。
常见做法有三种。
11.1 先转文本再检索
text
图片/PDF/音频
-> OCR/ASR
-> 文本切片
-> 向量检索
-> LLM 回答优点:
- 实现简单
- 可复用文本 RAG
- 成本相对可控
缺点:
- 丢失视觉和版面信息
- 对图表、图片关系支持弱
11.2 多模态向量检索
text
图片/文本
-> 多模态 embedding
-> 跨模态检索例如用文本查询图片,或用图片查询相似商品。
优点:
- 能做图搜文、文搜图、图搜图
- 适合商品、素材、知识库配图检索
缺点:
- 对精确字段抽取不如 OCR
- 需要选择合适的 embedding 模型和索引策略
11.3 原始文件 + 检索片段一起给模型
text
检索出相关页/图/时间段
-> 原始图片或关键帧 + 文本片段
-> 多模态模型回答优点:
- 保留原始证据
- 适合截图、图表、文档页问答
缺点:
- 成本更高
- 上下文组织更复杂
12. 多模态与 Agent 的关系
多模态能力让 Agent 有了“观察环境”的能力。
典型例子:
- 看网页截图后决定点击哪里
- 听用户语音后调用业务接口
- 读设备照片后创建维修单
- 看报错截图后搜索日志
- 读合同后生成审批意见
但多模态 Agent 的风险也更高。
需要额外定义:
- 观察结果是否足够可靠
- 是否需要再次确认
- 工具调用是否高风险
- 用户上传内容是否可信
- 模型能否访问敏感文件
多模态 Agent 的 Prompt 不能只写“看图完成任务”,还要写清楚:
- 观察范围
- 不确定时怎么处理
- 工具调用条件
- 高风险动作确认规则
- 失败停止条件
13. 工程选型建议
13.1 什么时候用端到端多模态模型
适合:
- 用户体验要求自然
- 输入是截图、照片、图表
- 任务需要视觉关系理解
- 不需要极强可解释性
- 可以接受较高成本
例如:
- 截图问答
- 图表解释
- 商品图片描述
- 简单图片审核
13.2 什么时候用流水线
适合:
- 任务要求可追溯
- 字段抽取要求高
- 文件结构复杂
- 成本敏感
- 已有成熟 OCR/ASR/解析系统
例如:
- 发票识别
- 合同条款抽取
- 审批材料归档
- 会议录音分析
13.3 什么时候用混合路线
适合:
- 文档既有结构化字段,又有视觉要素
- 结果需要可解释
- 部分任务适合专用模型,部分任务适合 LLM
- 业务风险较高
例如:
- 合同审查
- 保险理赔材料审核
- 医疗报告初筛
- 工业巡检报告生成
14. 落地检查清单
设计多模态系统前,建议先回答这些问题。
14.1 输入检查
- 输入是什么模态
- 文件质量是否可控
- 是否需要压缩、裁剪、抽帧或转写
- 是否有敏感信息
- 是否需要保留原始文件
- 是否需要多文件排序
14.2 模型检查
- 模型是否支持目标模态
- 是否支持足够的上下文
- 是否支持流式输出
- 是否支持结构化输出
- 是否需要工具调用
- 成本和延迟是否可接受
14.3 输出检查
- 输出给人看还是给程序消费
- 是否需要引用证据
- 是否需要置信度
- 是否需要人工复核
- 是否需要结构化 schema
- 是否需要脱敏
14.4 评测检查
- 是否有代表性样本
- 是否覆盖低质量输入
- 是否覆盖边界样本
- 是否覆盖安全样本
- 是否记录失败原因
- 是否能回溯到原始证据
15. 常见错误与修正
| 错误 | 问题 | 修正 |
|---|---|---|
| 把多模态当 OCR | 只提文字,忽略版面和视觉关系 | 同时保留图片、版面、坐标或页码 |
| 图片太大直接丢模型 | 成本高,重点不清 | 先裁剪、压缩、标注关注区域 |
| 视频整段送入模型 | 成本和延迟不可控 | 抽关键帧、切片、时间戳对齐 |
| ASR 文本直接当事实 | 识别错误会传播 | 保留置信度,关键字段复核 |
| 不要求证据 | 结果不可追溯 | 输出页码、时间戳、图片区域或原文片段 |
| 不处理低质量输入 | 模型会猜 | 入口质量检测,不清楚就拒绝或要求补充 |
| 不做隐私治理 | 文件可能含敏感信息 | 脱敏、权限、审计、存储周期控制 |
16. 一个完整案例:报错截图排障助手
16.1 目标
用户上传系统报错截图,助手识别问题并给出排查建议。
16.2 推荐流程
text
用户上传截图
-> 检查清晰度和完整性
-> 多模态模型读取截图
-> 提取错误信息、页面位置、操作状态
-> 结合知识库检索
-> 生成排查建议
-> 输出不确定点和需要补充的信息16.3 Prompt 示例
text
你是技术支持助手。
任务:
根据用户上传的系统截图和问题描述,判断可能原因并给出排查步骤。
规则:
1. 先描述截图中可见的错误信息和页面状态。
2. 再判断可能原因。
3. 如果截图不清晰或信息不足,说明需要补充什么。
4. 不要编造截图中不存在的错误码、按钮或日志。
5. 如果涉及账号权限、支付、删除数据等高风险操作,建议联系管理员或人工支持。
输出:
## 截图可见信息
## 可能原因
## 排查步骤
## 需要补充的信息16.4 评测样本
至少准备:
- 正常报错截图
- 模糊截图
- 截断截图
- 无关截图
- 多个错误同时出现的截图
- 用户描述与截图冲突的样本
17. 一个完整案例:会议语音纪要助手
17.1 目标
把会议录音转成纪要,并抽取结论、待办、负责人和时间。
17.2 推荐流程
text
会议录音
-> 降噪和分段
-> ASR 转写
-> 说话人分离
-> LLM 整理纪要
-> 人工确认关键待办17.3 Prompt 示例
text
你是会议纪要助手。
任务:
根据会议转写生成结构化纪要。
规则:
1. 不要新增转写中没有的信息。
2. 如果负责人或截止时间没有明确出现,标记为“未明确”。
3. 把决定、讨论点、待办分开。
4. 对疑似 ASR 错误的专有名词加“待确认”。
输出:
## 会议结论
## 讨论要点
## 待办事项
| 事项 | 负责人 | 截止时间 | 依据 |
## 待确认内容17.4 评测重点
- 是否遗漏关键决策
- 是否编造负责人
- 是否误听专有名词
- 是否能识别待确认事项
- 纪要是否结构清楚
18. 你学完后应该掌握什么
学完这篇文档后,你应该能做到:
- 解释多模态和纯文本 LLM 的区别
- 区分图像、文档、音频、视频任务的处理方式
- 判断什么时候用端到端多模态模型,什么时候用流水线
- 为图片、文档、音频、视频任务设计 Prompt
- 设计多模态系统的输入预处理和输出校验
- 为多模态任务建立基础评测集
- 识别多模态系统的成本、延迟、安全和隐私风险
19. 一句话总结
多模态系统的核心不是“把图片、音频、视频都塞给模型”,而是让系统在不同信息形态之间完成感知、对齐、融合、推理和行动,并在工程上控制质量、成本、延迟和风险。
20. 推荐阅读
以下资源在 2026-07-06 检查时可访问。
官方文档
- OpenAI Images and Vision:https://developers.openai.com/api/docs/guides/images-vision
- OpenAI Audio and Speech:https://developers.openai.com/api/docs/guides/audio
- OpenAI Speech to Text:https://developers.openai.com/api/docs/guides/speech-to-text
- OpenAI Text to Speech:https://developers.openai.com/api/docs/guides/text-to-speech
- OpenAI Realtime and Audio:https://developers.openai.com/api/docs/guides/realtime
- OpenAI Voice Agents:https://developers.openai.com/api/docs/guides/voice-agents
- Google Gemini media prompting:https://ai.google.dev/gemini-api/docs/prompting_with_media
- Anthropic Vision:https://docs.anthropic.com/en/docs/build-with-claude/vision
经典论文
- CLIP: Learning Transferable Visual Models From Natural Language Supervision:https://arxiv.org/abs/2103.00020
- Flamingo: a Visual Language Model for Few-Shot Learning:https://arxiv.org/abs/2204.14198
- BLIP: Bootstrapping Language-Image Pre-training:https://arxiv.org/abs/2201.12086
- ImageBind: One Embedding Space To Bind Them All:https://arxiv.org/abs/2305.05665