Appearance
多模态与语音
版本:
v1.1最后更新:
2026-07-08
这一组内容围绕图像、视频、语音和实时交互展开,适合从文本 LLM 扩展到更复杂的输入输出链路。
它关心的不只是“模型能看图、能听音、能说话”,更关心多模态系统在真实应用里会遇到的链路问题:输入预处理、实时延迟、工具协同、评测、成本、安全和会话控制。
1. 这组内容主要解决什么问题
从纯文本系统走向多模态之后,很多问题会明显变复杂:
- 输入不再只是文本,而是图片、视频帧、音频流和实时事件。
- 输出不再只是文字,而是语音、结构化结果、视觉生成和多轮实时控制。
- 成本、时延、缓存、会话状态和用户体验都会变得更敏感。
- 错误也不再只是“答错了”,还可能是识别错、转写断、说话打断不自然、画面理解偏差或视频帧抽样错误。
按 OpenAI 当前的 Images and vision、Speech to text、Text to speech、Realtime and audio、Voice agents 官方资料来看,多模态系统至少要同时回答五个问题:
- 不同模态的数据如何进入统一上下文。
- 实时语音和离线批处理的链路应该如何拆开。
- 图像、语音和视频结果该怎么评测和治理。
- 什么场景适合单次调用,什么场景适合 Agent 或工作流。
- 延迟、带宽和成本该如何进入方案设计,而不是部署后再补。
2. 推荐阅读顺序
2.1 想先理解多模态基础能力
2.2 想补实时语音和交互工作流
2.3 想补视频与复杂输入链路
3. 这组专题之间是什么关系
3.1 能力层
这一层更偏“模型会不会处理这种模态、典型场景是什么、输入输出大致怎么设计”。
3.2 运行层
OpenAI 目前把 Realtime and audio、Voice agents、连接方式与实时会话能力分成一整组资料,本身就说明实时语音系统不是简单的“给文本聊天套一个 TTS”。它涉及打断、状态、流式输出、工具调用、延迟控制和持续会话。
3.3 评测层
多模态评测通常比纯文本更复杂,因为要同时看识别正确率、结构一致性、时延、交互自然度、任务成功率和成本。
4. 多模态系统里最值得先建立的几个共识
4.1 多模态不是“所有模态都一起上”
很多场景并不需要一开始就做图像、语音、视频全打通。更稳的路径通常是:
- 先明确核心任务
- 再判断是否真的需要视觉理解、实时语音或视频输入
如果业务目标只是“从图片里抽字段”,那通常是视觉理解问题,不一定要扩成全链路多模态 Agent。
4.2 Realtime 和离线批处理不是同一种系统
OpenAI Realtime and audio 与 Speech to text 官方资料都说明:实时系统更关心打断、低延迟、持续交互和会话控制;离线音视频处理更关心吞吐、稳定性、重试和成本。
更实用的划分通常是:
- 实时模式:电话、语音助手、会议陪练、在线陪伴。
- 异步模式:录音转写、音视频摘要、质检、批量抽取。
不要把这两类任务都塞进同一条同步链路。
4.3 语音体验很多时候不是模型问题
语音应用的很多差体验,来自:
- VAD 不稳定
- 网络抖动
- 流式切分不合理
- 打断和恢复逻辑不自然
- TTS 音色、停顿和回声处理差
所以“用户觉得不像在对话”不一定是模型不够聪明,常常是链路工程问题。
4.4 视频理解要先解决抽样和上下文预算
很多视频问题不是“模型看不懂”,而是:
- 抽帧策略不对
- 关键帧没进上下文
- 时间顺序被破坏
- 片段太长导致预算不够
因此视频系统往往比图像系统更依赖前处理和上下文装配。
4.5 多模态越强,评测和安全越不能后置
图像、音频和视频输入会带来新的:
- 误识别风险
- 隐私风险
- 版权和合规风险
- 实时控制风险
5. 不同场景更适合怎么进入
5.1 想做图像理解、表单识别或视觉问答
优先看:
重点先弄清楚输入规范、裁切、分辨率、结构化输出和字段校验。
5.2 想做语音助手、电话机器人或实时陪练
优先看:
重点先区分实时交互链路和后台任务链路。
5.3 想做视频理解或长链路多模态任务
优先看:
重点不是只看“能不能识别”,还要看抽帧、排序、预算和回放。
6. 多模态系统上线前最小检查清单
- 是否明确了这是视觉理解、语音交互、视频理解还是多步工作流问题。
- 是否明确区分实时模式与离线模式。
- 是否定义了输入规格,例如分辨率、采样率、时长、格式和大小限制。
- 是否定义了结构化输出和失败回退方式。
- 是否有多模态任务专用评测样例,而不是只靠主观体验。
- 是否评估了隐私、录音留存、图像权限和内容安全边界。
7. 多模态系统最容易被低估的地方
- 实时体验问题很多时候来自语音链路和网络抖动,而不是模型本身。
- 视觉输入质量、裁切、抽帧和文件大小会直接影响最终效果。
- 多模态系统更容易牵涉隐私、权限、内容安全和数据留存边界。
- 一旦接入实时语音和工具调用,多模态系统会越来越像持续运行的工作流系统。
8. 当前官方资料最值得先建立的四个链路判断
按 2026-07-08 复核可访问的 OpenAI、Google Gemini 与 Anthropic 官方资料,比较值得先建立的链路判断有这些:
8.1 file inputs、request-based audio、realtime transcription、realtime conversation 不是同一条链路
OpenAI 当前官方资料实际上已经把多模态链路拆得很清楚:
File inputs:更适合文件上传后做理解、抽取、问答和结构化处理Speech to text:更适合有边界的音频文件或单次音频请求Realtime transcription:更适合实时字幕、会议旁录、电话流转写这类“只要转写,不要语音回复”的场景Realtime and audio / Voice agents:更适合真正的持续语音交互、工具调用和 spoken response
这几个入口如果混成一句“都能处理语音和文件”,工程上最容易出的问题就是:
- 明明是离线任务,却硬塞进实时链路
- 明明只是实时字幕,却做成完整语音 agent
- 明明是文档理解,却误以为要上整套多模态对话系统
8.2 视觉理解、文档解析和图像生成要拆成三条产品路径
很多团队会把“视觉”笼统理解成一件事,但从 OpenAI Images and vision、File inputs、Image generation,以及 Anthropic Vision / PDF support 的资料放在一起看,更实用的拆法通常是:
- 视觉理解:看图、截图问答、界面理解、表单识别
- 文档解析:PDF、表格、扫描件、图文混排抽取
- 图像生成 / 编辑:生成、修改、风格控制、一致性输出
这三条线的评测和工程重点都不一样:
- 视觉理解更看识别、定位、结构化输出
- 文档解析更看页面组织、表格、图文对齐和字段可靠性
- 图像生成更看风格、一致性、审核和交付率
8.3 实时语音体验首先是状态机和 VAD 问题,其次才是模型问题
OpenAI 当前 Realtime and audio、Realtime conversations、Voice activity detection (VAD)、Voice agents 的资料共同指向一个很重要的现实:
- 很多语音体验问题,本质上不是“模型不够聪明”,而是 turn-taking 没处理好
更常见的真实问题其实是:
- 何时判定用户说完
- 被打断后如何恢复
- 工具调用期间怎么维持对话体验
- 什么时候该静音、等待、继续说或切文本 fallback
如果这一层没设计好,用户体感通常会先表现为:
- 抢话
- 断句奇怪
- 延迟大
- 工具调用时像“卡住了”
8.4 视频系统最重要的前置决策是抽样与时间轴,而不是先换更强模型
Google Gemini Video understanding 和 OpenAI Video generation with Sora 的资料都提醒了同一个现实:
- 视频不是“更长的图片”
工程上更先要解决的通常是:
- 抽帧频率
- 时间片切分
- 关键片段筛选
- 时间顺序与上下文压缩
- 理解链路和生成链路是否拆开
如果这层没做好,再强的模型也可能因为关键时刻没进上下文而判断失真。
9. 多模态系统里最容易漏掉的四个控制对象
9.1 输入规格对象
很多系统会写“支持图片 / 音频 / 视频”,但没有冻结这些真正会影响效果的输入对象:
- 分辨率
- 采样率
- 帧率
- 文件大小
- 时长上限
- 编码格式
没有这层规格,线上效果波动通常很难复盘。
9.2 交互状态对象
实时系统里真正要管的不只是“当前文本”,还包括:
- 当前 turn 状态
- 是否正在说话
- 是否进入工具调用
- 是否允许打断
- 当前音频输出是否应暂停或重播
这类状态如果没显式设计,语音体验会非常不稳定。
9.3 介质留存对象
多模态系统比纯文本更容易产生敏感留存:
- 原图
- 原始录音
- 视频片段
- 转写文本
- 关键帧
- 审批和人工 review 快照
更稳的做法通常不是“全存下来以后再说”,而是先定义:
- 哪些必须存
- 哪些只存摘要
- 哪些必须脱敏
- 哪些必须设置到期删除
9.4 失败回退对象
多模态失败很多时候不是完全失败,而是局部失败:
- OCR 某页失败
- 某段音频质量太差
- 某次实时 turn 丢失
- 某个视频片段超预算
如果系统没有定义每类失败该怎么 fallback,用户端就只会看到“系统忽然不对了”。
10. 建议搭配阅读
11. 重点官方资料
以下入口在 2026-07-08 检查时可访问:
- OpenAI Images and vision
- OpenAI File inputs
- OpenAI Audio and speech
- OpenAI Speech to text
- OpenAI Text to speech
- OpenAI Realtime and audio
- OpenAI Realtime conversations
- OpenAI Realtime transcription
- OpenAI Realtime translation
- OpenAI Voice activity detection (VAD)
- OpenAI Voice agents
- OpenAI Data controls in the OpenAI platform
- Google Gemini Video understanding
- Anthropic Vision
- Anthropic PDF support
12. 什么时候该跳到其他目录
- 当你开始治理上下文、成本、缓存和异步模式时,跳到 平台工程。
- 当你开始做语音工具调用、多步控制和会话编排时,跳到 AI Agents专题。
- 当你开始处理隐私、录音留存、内容风控和权限问题时,跳到 安全治理。
- 当你开始建设多模态指标、回归样例和失败复盘时,跳到 评测运营与案例。