Skip to content

多模态与语音

版本:v1.1

最后更新:2026-07-08

这一组内容围绕图像、视频、语音和实时交互展开,适合从文本 LLM 扩展到更复杂的输入输出链路。

它关心的不只是“模型能看图、能听音、能说话”,更关心多模态系统在真实应用里会遇到的链路问题:输入预处理、实时延迟、工具协同、评测、成本、安全和会话控制。

1. 这组内容主要解决什么问题

从纯文本系统走向多模态之后,很多问题会明显变复杂:

  • 输入不再只是文本,而是图片、视频帧、音频流和实时事件。
  • 输出不再只是文字,而是语音、结构化结果、视觉生成和多轮实时控制。
  • 成本、时延、缓存、会话状态和用户体验都会变得更敏感。
  • 错误也不再只是“答错了”,还可能是识别错、转写断、说话打断不自然、画面理解偏差或视频帧抽样错误。

按 OpenAI 当前的 Images and visionSpeech to textText to speechRealtime and audioVoice agents 官方资料来看,多模态系统至少要同时回答五个问题:

  1. 不同模态的数据如何进入统一上下文。
  2. 实时语音和离线批处理的链路应该如何拆开。
  3. 图像、语音和视频结果该怎么评测和治理。
  4. 什么场景适合单次调用,什么场景适合 Agent 或工作流。
  5. 延迟、带宽和成本该如何进入方案设计,而不是部署后再补。

2. 推荐阅读顺序

2.1 想先理解多模态基础能力

  1. 多模态专题
  2. 视觉模型专题
  3. 语音模型专题

2.2 想补实时语音和交互工作流

  1. Realtime与语音工作流专题
  2. 语音模型专题
  3. 多模态评测案例专题

2.3 想补视频与复杂输入链路

  1. 视频模型专题
  2. 多模态专题
  3. 平台工程

3. 这组专题之间是什么关系

3.1 能力层

这一层更偏“模型会不会处理这种模态、典型场景是什么、输入输出大致怎么设计”。

3.2 运行层

OpenAI 目前把 Realtime and audioVoice agents、连接方式与实时会话能力分成一整组资料,本身就说明实时语音系统不是简单的“给文本聊天套一个 TTS”。它涉及打断、状态、流式输出、工具调用、延迟控制和持续会话。

3.3 评测层

多模态评测通常比纯文本更复杂,因为要同时看识别正确率、结构一致性、时延、交互自然度、任务成功率和成本。

4. 多模态系统里最值得先建立的几个共识

4.1 多模态不是“所有模态都一起上”

很多场景并不需要一开始就做图像、语音、视频全打通。更稳的路径通常是:

  • 先明确核心任务
  • 再判断是否真的需要视觉理解、实时语音或视频输入

如果业务目标只是“从图片里抽字段”,那通常是视觉理解问题,不一定要扩成全链路多模态 Agent。

4.2 Realtime 和离线批处理不是同一种系统

OpenAI Realtime and audioSpeech to text 官方资料都说明:实时系统更关心打断、低延迟、持续交互和会话控制;离线音视频处理更关心吞吐、稳定性、重试和成本。

更实用的划分通常是:

  • 实时模式:电话、语音助手、会议陪练、在线陪伴。
  • 异步模式:录音转写、音视频摘要、质检、批量抽取。

不要把这两类任务都塞进同一条同步链路。

4.3 语音体验很多时候不是模型问题

语音应用的很多差体验,来自:

  • VAD 不稳定
  • 网络抖动
  • 流式切分不合理
  • 打断和恢复逻辑不自然
  • TTS 音色、停顿和回声处理差

所以“用户觉得不像在对话”不一定是模型不够聪明,常常是链路工程问题。

4.4 视频理解要先解决抽样和上下文预算

很多视频问题不是“模型看不懂”,而是:

  • 抽帧策略不对
  • 关键帧没进上下文
  • 时间顺序被破坏
  • 片段太长导致预算不够

因此视频系统往往比图像系统更依赖前处理和上下文装配。

4.5 多模态越强,评测和安全越不能后置

图像、音频和视频输入会带来新的:

  • 误识别风险
  • 隐私风险
  • 版权和合规风险
  • 实时控制风险

所以更需要和 安全治理 以及 评测运营与案例 一起看。

5. 不同场景更适合怎么进入

5.1 想做图像理解、表单识别或视觉问答

优先看:

  1. 视觉模型专题
  2. 多模态专题
  3. 平台工程

重点先弄清楚输入规范、裁切、分辨率、结构化输出和字段校验。

5.2 想做语音助手、电话机器人或实时陪练

优先看:

  1. 语音模型专题
  2. Realtime与语音工作流专题
  3. AI Agents 与工作流总目录

重点先区分实时交互链路和后台任务链路。

5.3 想做视频理解或长链路多模态任务

优先看:

  1. 视频模型专题
  2. 多模态评测案例专题
  3. 评测运营与案例

重点不是只看“能不能识别”,还要看抽帧、排序、预算和回放。

6. 多模态系统上线前最小检查清单

  • 是否明确了这是视觉理解、语音交互、视频理解还是多步工作流问题。
  • 是否明确区分实时模式与离线模式。
  • 是否定义了输入规格,例如分辨率、采样率、时长、格式和大小限制。
  • 是否定义了结构化输出和失败回退方式。
  • 是否有多模态任务专用评测样例,而不是只靠主观体验。
  • 是否评估了隐私、录音留存、图像权限和内容安全边界。

7. 多模态系统最容易被低估的地方

  • 实时体验问题很多时候来自语音链路和网络抖动,而不是模型本身。
  • 视觉输入质量、裁切、抽帧和文件大小会直接影响最终效果。
  • 多模态系统更容易牵涉隐私、权限、内容安全和数据留存边界。
  • 一旦接入实时语音和工具调用,多模态系统会越来越像持续运行的工作流系统。

8. 当前官方资料最值得先建立的四个链路判断

2026-07-08 复核可访问的 OpenAI、Google Gemini 与 Anthropic 官方资料,比较值得先建立的链路判断有这些:

8.1 file inputs、request-based audio、realtime transcription、realtime conversation 不是同一条链路

OpenAI 当前官方资料实际上已经把多模态链路拆得很清楚:

  • File inputs:更适合文件上传后做理解、抽取、问答和结构化处理
  • Speech to text:更适合有边界的音频文件或单次音频请求
  • Realtime transcription:更适合实时字幕、会议旁录、电话流转写这类“只要转写,不要语音回复”的场景
  • Realtime and audio / Voice agents:更适合真正的持续语音交互、工具调用和 spoken response

这几个入口如果混成一句“都能处理语音和文件”,工程上最容易出的问题就是:

  • 明明是离线任务,却硬塞进实时链路
  • 明明只是实时字幕,却做成完整语音 agent
  • 明明是文档理解,却误以为要上整套多模态对话系统

8.2 视觉理解、文档解析和图像生成要拆成三条产品路径

很多团队会把“视觉”笼统理解成一件事,但从 OpenAI Images and visionFile inputsImage generation,以及 Anthropic Vision / PDF support 的资料放在一起看,更实用的拆法通常是:

  • 视觉理解:看图、截图问答、界面理解、表单识别
  • 文档解析:PDF、表格、扫描件、图文混排抽取
  • 图像生成 / 编辑:生成、修改、风格控制、一致性输出

这三条线的评测和工程重点都不一样:

  • 视觉理解更看识别、定位、结构化输出
  • 文档解析更看页面组织、表格、图文对齐和字段可靠性
  • 图像生成更看风格、一致性、审核和交付率

8.3 实时语音体验首先是状态机和 VAD 问题,其次才是模型问题

OpenAI 当前 Realtime and audioRealtime conversationsVoice activity detection (VAD)Voice agents 的资料共同指向一个很重要的现实:

  • 很多语音体验问题,本质上不是“模型不够聪明”,而是 turn-taking 没处理好

更常见的真实问题其实是:

  • 何时判定用户说完
  • 被打断后如何恢复
  • 工具调用期间怎么维持对话体验
  • 什么时候该静音、等待、继续说或切文本 fallback

如果这一层没设计好,用户体感通常会先表现为:

  • 抢话
  • 断句奇怪
  • 延迟大
  • 工具调用时像“卡住了”

8.4 视频系统最重要的前置决策是抽样与时间轴,而不是先换更强模型

Google Gemini Video understanding 和 OpenAI Video generation with Sora 的资料都提醒了同一个现实:

  • 视频不是“更长的图片”

工程上更先要解决的通常是:

  • 抽帧频率
  • 时间片切分
  • 关键片段筛选
  • 时间顺序与上下文压缩
  • 理解链路和生成链路是否拆开

如果这层没做好,再强的模型也可能因为关键时刻没进上下文而判断失真。

9. 多模态系统里最容易漏掉的四个控制对象

9.1 输入规格对象

很多系统会写“支持图片 / 音频 / 视频”,但没有冻结这些真正会影响效果的输入对象:

  • 分辨率
  • 采样率
  • 帧率
  • 文件大小
  • 时长上限
  • 编码格式

没有这层规格,线上效果波动通常很难复盘。

9.2 交互状态对象

实时系统里真正要管的不只是“当前文本”,还包括:

  • 当前 turn 状态
  • 是否正在说话
  • 是否进入工具调用
  • 是否允许打断
  • 当前音频输出是否应暂停或重播

这类状态如果没显式设计,语音体验会非常不稳定。

9.3 介质留存对象

多模态系统比纯文本更容易产生敏感留存:

  • 原图
  • 原始录音
  • 视频片段
  • 转写文本
  • 关键帧
  • 审批和人工 review 快照

更稳的做法通常不是“全存下来以后再说”,而是先定义:

  • 哪些必须存
  • 哪些只存摘要
  • 哪些必须脱敏
  • 哪些必须设置到期删除

9.4 失败回退对象

多模态失败很多时候不是完全失败,而是局部失败:

  • OCR 某页失败
  • 某段音频质量太差
  • 某次实时 turn 丢失
  • 某个视频片段超预算

如果系统没有定义每类失败该怎么 fallback,用户端就只会看到“系统忽然不对了”。

10. 建议搭配阅读

11. 重点官方资料

以下入口在 2026-07-08 检查时可访问:

12. 什么时候该跳到其他目录

  • 当你开始治理上下文、成本、缓存和异步模式时,跳到 平台工程
  • 当你开始做语音工具调用、多步控制和会话编排时,跳到 AI Agents专题
  • 当你开始处理隐私、录音留存、内容风控和权限问题时,跳到 安全治理
  • 当你开始建设多模态指标、回归样例和失败复盘时,跳到 评测运营与案例