静态看图、读 PDF,今天多半是多模态模型上的一次前向,当作感知工具挂进 ReAct 即可。真正把架构逼变形的是实时性:输入持续流动,输出必须卡在时间预算里。三条主战场——语音对话、Computer Use(屏幕 GUI 操作)、机器人控制——表面领域不同,卡点同构:多模态融合 + 延迟敏感。语音停顿两秒就显尴尬;控制环抖动到毫秒级可能碰撞。

边界说清:生图/生视频在本书框架里是普通工具调用,不进本章主线;连续视频流的实时理解对 Agent 仍是开放问题。下面先用语音三级范式搭坐标系,再谈快慢思考,最后把同一套延迟账映射到屏幕与物理世界。

语音:高带宽接口

正常语速大约是打字数倍,且不占双手视线。产品分两路:语音输入法(口述转写进任意应用)与语音 Agent(对话本身就是协作)。同一套实时技术还支撑「Agent 替用户打电话协商」。

三种架构范式

OpenAI 对 ChatGPT 语音演进的概括,可当作工业坐标系(名称因厂商略异,结构稳定):

范式结构轮次假设延迟与信息
级联 CascadingVAD → ASR → LLM → TTS 串成流水线轮流说,靠静音猜说完模块可独立优化;信息在交接处损失;串行延迟累加
Omni 端到端单模型听—想—说仍常依赖 VAD/轮次韵律情感等副语言可保留;首包可更低
全双工 Full-Duplex边听边说,持续决策说/听/停/打断/调工具取消硬轮次接近人类对话节奏;训练与工程更重

主线只有一条:如何摆脱「轮流说话」与 VAD 对轮次的猜测。三种范式不是简单新旧替代,而是延迟、成本与能力的长期并存。

范式一:级联与流式化

经典四段:

  1. VAD(Voice Activity Detection,语音活动检测)——连续静音 500–800ms 常当作「说完」。短了截断思考停顿,长了干等。
  2. ASR(Automatic Speech Recognition)——波形 → 文本;中小模型 GPU 上数秒音频常 50–200ms 量级。
  3. LLM——TTFT(Time To First Token,首 token 时间)再加生成;开 reasoning 可到数秒。
  4. TTS(Text-to-Speech)——文本 → 波形,再数百毫秒。

完全串行空载合计大约 0.9–2s 量级;生产排队下延迟可按利用率非线性放大(利用率高时等待急剧上升)。

2025 年后的生产级联很少真「整段接力」,而是全链路流式:ASR 边听边出字,LLM 按句切片往下送,TTS 句级开合成——工位重叠,端到端常可压到约 600–800ms。流式化压不掉的是 VAD 静默等待本身——流水线开工的前提。

流式语音感知试图替换「VAD + ASR」前端:因果/分块编码 + 增量解码,在语义层判断是否说完,并尽量保留情绪、犹豫、环境声等副语言,而不是只吐纯文本。级联与端到端的差距,很大程度取决于中间表示是否丢掉任务相关信息——中间层若带结构副语言标记,纯文本瓶颈会收窄。

级联仍是电话客服、可替换组件、强合规拆分场景的务实默认。

范式二与三:Omni 与全双工

Omni 把听想说收进统一模型(或 Thinker–Talker 分工:理解模块 + 语音生成模块)。优势:端到端韵律、更低首包(公开数字里可见约二百毫秒量级宣称,以实测为准)。局限:多数部署仍在「轮次」框架内——用户出声就停、静音就开,数字串中途停顿仍可能被抢话。Realtime API 一类「模型吃音频 + 服务端 VAD」属于过渡态;异步函数调用可把工具等待藏进继续说话里。

全双工走到逻辑终点:并行建模用户声与自身声(Moshi 另加内心独白文本流提升语言质量),重叠与打断是默认行为,无需单独 barge-in 状态机。交互模型以约 200ms 微轮次持续「读入—生成」,把静音、重叠留在连续上下文里。GPT-Live 类系统每秒多次决策:该说、该听、该停、该附和、该调工具;用户思考时安静,而不是抢话。

全双工常与快慢解耦绑定:前台交互模型保活对话,复杂推理/搜索委派后台前沿模型,结果流式回传后择机织入——用非思考延迟兑现思考能力,且后台可随 SOTA 换代而不重训整个实时栈。

思考架构:实时与深度

用户要毫秒级回应,难题要秒级思考。三种并存取舍(由弱协调到强内化):

方案一:快慢并行直接对用户说话
快路径 ~500ms 先答,慢路径数秒后给「正确答案」。问题:简单题浪费算力;快慢结论冲突时信任崩塌(先劝买套餐,八秒后说没有漫游不合适)。

方案二:快交互 + 慢军师
慢思考只写状态栏/精简通道,由快模型决定是否、何时说给用户。GPT-Live 委派、Pine 类语音 Agent 属此类。局限:纸条式沟通,快模型可能误解军师意图;看不到慢思考中间草稿;难以真正「边想边说」。

方案三:思考内化进音频模型
单一端到端路径上做 CoT 式音频思考(如部分 Step-Audio 路线),延迟与深度在同一模型内权衡,训练目标更重。

2026 年生产语音产品大量选解耦而非「一个模型通吃」:交互数据与训练目标专、推理模型迭代快,硬焊在一起等于追移动靶还可能稀释推理。Computer Use 与机器人同样会遇到「何时请慢军师」——原则可迁移。

Computer Use:动作空间、定位与壁垒

Computer Use(GUI 自动化 Agent):看屏幕(截图 / 可访问性树),用鼠标键盘完成任务。循环仍是感知—思考—行动,但观察是像素与 UI 结构,动作是点击坐标、输入、滚动等。

动作空间设计取舍:

  • 低层:绝对/相对坐标点击、键入、滚轮——通用,难,定位误差大
  • 中层:点击「带某文本的按钮」、按角色与名称——依赖可访问性树
  • 高层:业务宏(「提交表单」)——稳但不可组合、覆盖窄

工程上常混合:能拿到 DOM/A11y 树就优先结构化定位,否则回退坐标;危险动作(付款、删除)进 Harness 审批。

Grounding(视觉定位:把语言指称落到屏幕坐标或元素):模型既要懂「设置里的 Wi-Fi」,又要在当前分辨率与主题下点对。失败模式包括:点到相邻图标、弹层未出现就点击、动画中途截到半帧。移动端动作空间变为触摸手势(滑动、长按、双指缩放),桌面「鼠标+键盘」假设失效;AndroidWorld 一类基准按此评测。

生态壁垒:部分消费级站点主动识别并限制自动化流量——不只是 CAPTCHA 技术题,也是商业模式冲突,短期内单靠模型精度解不开。

延迟:截图—推理—点击一轮常以秒计;长流程步数一多,墙钟时间不可接受。与语音不同,Computer Use 把「循环本身变快」的生产级全双工方案仍不成熟;更现实的是:关键路径用 API/专用工具短路 GUI、重复流程走第 8 章录制回放、复杂规划后台慢想、前台只执行。感知若永远单帧静图,闪现对话框、进度动画、提示音一类动态事件接近禁区——需要额外时间维感知中间件或事件流,而不是只加分辨率。

机器人:双层规划与 VLA

机器人把实时性再收紧一档:控制环与碰撞约束。常见双层

  1. 慢层(任务规划)——语言目标 → 子任务序列(「打开抽屉 → 抓杯 → 放到桌上」),可用 LLM/VLM,Hz 低
  2. 快层(运动控制)——关节/力矩/阻抗控制,高频,保证稳定与安全

中间接口是技能原语(grasp、place)或轨迹,而不是每 10ms 问一次大模型「下一步关节角」。

VLA(Vision-Language-Action:视觉—语言—动作一体策略)把图像与指令映射到动作 token 或连续控制。OpenVLA 一类工作大量靠大规模演示上的行为克隆(SFT 性质);其上再叠 RL(可验证进度/成功奖励)可探索超演示策略(如文献中的「推切」等)。Sim2Real(仿真到真机):在仿真里便宜试错,再处理域随机化、系统辨识与真机微调;仿真保真不足时,策略会过拟合仿真纹理与摩擦——与第 7 章「环境失真,策略必废」同一句话。

安全:力限制、急停、人类在环、动作沙箱;自我进化式「网上拉依赖」在物理执行器上更不可直接套用。

三条场景对照

语音Computer Use机器人
关键模态音频流屏幕像素 / UI 树相机 + 本体感觉
延迟痛点轮次与抢话逐步截图像素环控制频率与稳定
演进方向流式 → Omni → 全双工结构化定位 + 工具短路规划/控制分层 + VLA
快慢分工交互 / 推理模型执行 / 规划 Agent伺服 / 任务规划

可迁移原则:能进专用接口的别走最通用感知;验证看世界真实状态(通话是否办成、DB/UI 是否变更、物体是否到位),不看模型是否宣称成功;实时栈与深度推理解耦,便于各自迭代。

本篇收束

  1. 实时多模态难在连续输入 + 硬延迟,不在「会不会看图」。
  2. 语音三级范式沿「摆脱 VAD 轮次」推进;生产里级联流式、Omni、全双工并存。
  3. 快慢冲突要用协调机制;解耦委派是当前可扩展默认之一。
  4. Computer Use 的核心是动作空间与 grounding,外加生态与逐步延迟;移动手势与动态 UI 仍难。
  5. 机器人双层计划/控制 + VLA + 谨慎 Sim2Real;安全约束优先于自主度。

下一篇压轴第 10 章:多 Agent 协作——何时真比单 Agent 强,以及共享上下文与隔离拓扑怎么选。

版权声明: 如无特别声明,本文版权归 sshipanoo 所有,转载请注明本文链接。

(采用 CC BY-NC-SA 4.0 许可协议进行授权)

本文标题:09. 多模态与实时交互:语音、屏幕与机器人

本文链接:https://www.sshipanoo.com/blog/ai/ai-agent-indepth/09-多模态与实时交互/

本文最后一次更新为 天前,文章中的某些内容可能已过时!