AI Agents

什么是 Voice Agent — 语音 Agent 的定义、架构与任务形态全解析

Voice Agent 是语音进、语音出的实时对话 AI 系统:你说话,它监听、推理并以合成语音实时回复,还能调用工具、支持打断与轮次管理。本文给出完整定义、五项核心特征、从麦克风到语音回复的技术栈架构、2026 年中 GPT-Live、Claude Voice Mode、Gemini Live、Grok Voice 的产品格局,并厘清它与语音听写、电话语音机器人的边界。

Tan Shaoqing4 分钟阅读
什么是 Voice Agent — 语音 Agent 的定义、架构与任务形态全解析

1. 为什么「Voice Agent」成了一个品类,而不只是一个功能

1.1 语音离开了键盘——也离开了电话树

十年来,「语音 AI」在实践中不外乎两件事。听写软件把语音变成光标处的文本——有用、快,且刻意在转写之外不管语义。电话系统用语音识别把你路由到对的部门——对企业有用,且刻意限定你可以说什么。这两种模式都回答不了人们在 2024–2026 年开始问的问题:我能不能像跟同事说话一样跟一个 AI 说话,让它思考、用工具、开口回答?

正是这个问题让 voice agents 成为独立品类。2026 年年中,各大实验室在数周之内相继推出消费级语音模式:OpenAI 的 GPT-Live 于 7 月 8 日、Anthropic 扩展版 Claude Voice Mode 于 7 月 23 日、xAI 的 Grok Voice Think Fast 2.0 于 7 月 29 日,而 Google 的 Gemini Live 仍在持续为 Android 与 iOS 增加摄像头与屏幕上下文。开发者也拿到了平行的界面——OpenAI 带 gpt-realtime 模型家族的 Realtime API、xAI 的 WebSocket 语音端点——目标是把语音原生的 agent 嵌进客服热线、教练应用与车载助手。产品各异,任务形态相通:音频进、推理、音频出,延迟低到对话感觉是连续的。

独立创业者对此感受真切。你可以在散步时演练提案、在车里出声 debug 一个决策、不停步地问追问——但前提是系统把语音当作主界面,而不是粘进聊天里的转写捷径。这正是 voice agent 跨得过、听写层跨不过的那道线。

1.2 命名难题:Mode、Agent、Bot、API

营销标签很快就搅浑了。OpenAI 管它的消费级界面叫 GPT-Live;Anthropic 说 voice mode;Google 说 Gemini Live;xAI 品牌 Grok Voice。工程师说 speech-to-speechrealtime API全双工语音模型。搜索者输入什么是 voice agent时,想要的是品类定义,不是产品手册。

本文用 voice agent 作为「口语对话即运行时」系统的统称——不管这个 agent 住在 ChatGPT、Claude、一台 Pixel 手机里,还是你自己的、接着厂商 API 的应用里。我们把「面向 AI Agent 的语音听写」保留给相邻模式——语音变成文档或桌面 agent 工作区里的文本——把「电话语音机器人」保留给围绕呼叫路由、合规脚本与 CRM 交接构建的电话优先流程。选工具时这些边界很重要:手机上一个出色的 voice agent 不会自动让你的长文草稿获得听写能力;一个打磨精致的电话机器人也不是一个开放式推理伙伴。


2. Voice Agent:定义

2.1 核心定义

Voice agent 是为实时口语对话设计的 AI 系统:它接受连续或逐轮的音频输入,用语言模型(常带工具或搜索访问)解读意图,并以足够快的合成语音回复以维持对话。与批量转写不同,语音通道不是通往文本界面的中间步骤——语音就是界面。与传统 IVR 不同,对话是开放的:用户可以换话题、打断、追问,并期待模型推理而不是匹配固定脚本。

OpenAI 的 GPT-Live 公告,其消费级参考实现在全双工架构下并发处理输入与生成输出,每秒多次做出交互决策——该说话、该聆听、该停顿,还是该调用工具。Anthropic 的 2026 年 7 月 voice mode 更新强调另一个角度:把语音会话路由到 Opus、Sonnet 或 Haiku,让用户在对话中途用速度换深度。Google 把 Gemini Live 描述为只用语音与 AI 交谈,在支持的设备上带多模态输入。实现各异,契约相通——语音进,智能语音出

2.2 五项定义性特征

语音原生 I/O。 输入输出是音频流(或其 API 等价物),不是带可选朗读的打字消息。延迟预算以数百毫秒计,而不是粘贴操作之间的秒数。

对话状态。 agent 跨轮次维持对话上下文——代词能指代、先前的约束持续生效、追问无须重述背景就有意义。会话长度可以拉长到数分钟的工作对话,而不是单条命令式的短发言。

推理与工具。 voice agent 不是包着搜索框的语音合成器。它会规划、调用函数、搜索,或在问题超出快语音层的处理范围时委托给更强的模型——OpenAI 的 GPT-Live 明确在后台把深活儿交给 GPT-5.5,同时保持语音线程不断。

轮替与打断。 生产级 voice agent 支持抢话(barge-in):你可以掐断一个糟糕的回答、纠正一个误解、在句子中途改方向。全双工系统把它扩展到语音重叠;逐轮系统用停止/开始边界模拟。无论哪种,控制感是双向的。

可部署的任务形态。 消费级应用(ChatGPT 语音按钮)、移动 OS 集成(Android 上的 Gemini)与开发者 API(Realtime API、Grok Voice WebSocket)是同一抽象任务的不同包装:跟一个 AI 说话,并得到能替你行动的语音回答

2.3 Voice Agent 不是什么

边界清晰能避免昂贵的错配——尤其是与这个语音系列单独成篇的两个邻居。

Voice agent 不是面向 AI Agent 的语音听写。听写把语音变成文档、表单或 agent 工作区里的可编辑文本;持久的产物是文字,不是一段语音线程。你可以口述一段话、选中一句、让桌面 agent 重写——但重心是文件。我们关于面向 AI Agent 的语音听写的枢纽文章端到端地覆盖了那个模式。Voice agent 以对话本身为中心;听写以为下游工作捕获文本为中心。

Voice agent 不是经典意义上的电话语音机器人。为联络中心优化的电话机器人优先确定性流程——账户查询、付款确认、排队位置——配合规脚本与明确的人工升级。现代语音到语音 API 可以驱动这些机器人,但「voice bot」的品类默认仍意味着电话约束:DTMF 回退、运营商延迟、录音免责声明与狭窄的意图目录。你手机上的一场 GPT-Live 会话是相反的设计点——宽意图、个人上下文、除非你特意加否则没有 PSTN 链路。

Voice agent 不是事后钉上文字转语音的文本聊天。朗读打字回复,错过了让语音交互成立的重音、时机与打断语义。2026 年年中最好的产品是为对话训练或调优音频通路,而不是把语音当作导出格式。

最后,voice agent 不等同于「任何接受麦克风输入的产品」。Otter 或 Fireflies 这类会议转写器产出所说内容的记录;它们一般不在通话中与用户维持交互式的语音推理循环。转写是归档;语音能动性是交互。


3. Voice Agent 架构:从麦克风到语音回复

理解架构,才能解释为什么两个营销话术相似的语音产品用起来天差地别——以及为什么构建者选 API 而不是消费级应用。

3.1 语音到语音技术栈

高层次上,每个 voice agent 由四层组成:采集(麦克风或流式音频帧)、理解(语音识别或端到端音频编码进模型状态)、策略(语言模型推理、工具调用、安全过滤)与渲染(文字转语音或原生音频生成)。在较老的管线里,ASR 与 TTS 分属不同供应商、中间夹着文本——命令够用,重叠与情绪就脆。较新的语音到语音模型把理解与渲染折叠进一个用音频 token 训练的模型——OpenAI 为 Realtime API 的 gpt-realtime 家族强调的正是这一点,也是 GPT-Live 向消费者宣传的卖点。

逐轮架构仍出现在生产中——听完整句、思考、再开口——Anthropic 为 Claude Voice Mode(截至 2026 年 7 月)披露的管线保持逐轮加外部 TTS,用重叠能力换模型灵活性。这并不天然更差,而是一种不同的延迟-质量取舍。逐轮栈对企业电话场景更容易审计;全双工栈在教练与头脑风暴的自然度上占优。

3.2 全双工 vs 逐轮交互

全双工意味着模型可以在生成输出音频的同时处理输入音频——实现附和语(「嗯」)、从容的停顿与快速纠正,而无须僵硬的「该你/该我」闸门。GPT-Live 是 OpenAI 面向消费者的这一模式的表达。逐轮对话强制更清晰的分段:用户说完,模型回应。开发者用端点检测与取消 token 模拟打断,但认知模型不同。

评估产品时,问一句:打断是一等特性还是补丁。2026 年 8 月对 Gemini Live、GPT-Live 与 Grok Voice 的消费级评测,一致把首次出声时间抢话可靠性排在原始基准分之上——因为语音 UX 对时机的敏感,是文本聊天没有的。

3.3 委托推理与工具使用

语音层往往太小或太快,无法独自承载前沿推理。委托推理把难题发给更强的文本模型或工具执行器,同时语音表面继续说话——总结进展、提出澄清问题,或得体地填补空档。GPT-Live 对 GPT-5.5 的委托是最清晰的公开例子;Claude Voice Mode 的模型选择器(Haiku vs Sonnet vs Opus)达成类似目标——让用户在会话中途升级智能,而不是在技术栈中途。

工具访问补全了名字里「agent」的那一半。Anthropic 的 2026 年 7 月更新在付费套餐上把语音路由到 Gmail、Slack 等已连接应用——触发真实动作的语音请求,而不是独白。OpenAI 的 Realtime API 为构建客服 agent 的开发者暴露 function calling 与远程 MCP 服务器,可在通话中查询订单或预约。没有工具,你只有语音助手;有了跨会话的持久动作,你就接近语音能动性——尽管产品营销把两个词都用得很随意。


4. 品类层面的主流语音产品(2026 年中)

以下条目不是购买指南;它们梳理的是各家实验室如何包装同一个抽象任务形态,帮你在搜索结果与工程文档里定位。

4.1 OpenAI:GPT-Live 与 Realtime API

GPT-Live 是 ChatGPT 内 OpenAI 的消费级语音产品——全双工对话,付费档为 GPT-Live-1,免费档为更轻的 GPT-Live-1 mini,见该公司 2026 年 7 月的发布帖。它在幕后把重推理委托给 GPT-5.5。视频与屏幕共享在 GPT-Live 上线时不支持;旧版 Advanced Voice Mode 保留了一些多模态功能。

对构建者,可编程界面是 Realtime APIgpt-realtime 模型家族——WebSocket 或 WebRTC 音频、工具调用、GA 公告中的 SIP 电话呼叫——而不是 GPT-Live 本身;截至 2026 年 8 月,GPT-Live 仍是 ChatGPT 应用功能,没有公开的 API 模型 ID。如果你在架构一个自定义 voice agent,你瞄准的多半是 Realtime;如果你是散步时演练演讲的独立创业者,你用的多半是 GPT-Live。

4.2 Anthropic:Claude Voice Mode

Claude Voice Mode 瞄准更长的口语工作会话——练习提案、比较报价、出声想流程。到 2025 年年中它跑在 Haiku 上求速度;2026 年 7 月 23 日的更新通过会话内模型选择器加入 Opus 与 Sonnet,让用户不重启就升级智能。付费档解锁更广的模型访问与更多已连接工具;免费档用户留在 Haiku 且连接器有限。

第三方报道指出,Anthropic 没有为这次发布推出新的语音原生基础模型——升级是为现有 Claude 模型做的路由与工具访问,经由带外部 TTS 的语音管线。这让 Claude Voice Mode 的感觉更接近「会说话的聪明聊天」,而不是单一端到端音频转换器——一个偏爱推理深度、不追求双工噱头的正当设计选择。

4.3 Google:Gemini Live

Gemini Live 是 Google 长期运营的消费级语音界面,内置于 Android 与 iOS 的 Gemini 应用,定位为以语音为主输入的 Gemini 对话入口。与 2026 年年中的 GPT-Live 和 Grok Voice 相比,Gemini Live 的差异化强项是设备集成多模态——支持的手机上可共享摄像头与屏幕——用户可以展示一个物体或界面并继续谈论它。语言广度与 Google 搜索接地是 Google 定位中反复出现的主题;确切的语言数量因版本而异,写进正式文案前请对照当前帮助文档核实。

对 Android 为主的独立创业者,Gemini Live 往往是设备上已就位、摩擦最低的 voice agent;对跨平台、桌面优先的工作流,它是多个标签页中的一个选项。

4.4 xAI:Grok Voice

Grok Voice——包括 xAI 于 2026 年 7 月底发布的 Think Fast 2.0 模型——强调低延迟与开发者可用的语音到语音,在公开材料中按分钟计费,而非只按 token 定价。xAI 通过面向构建者的 API 端点暴露语音能力,瞄准想要在自定义应用里获得电话级响应速度的团队,与 Grok 的文本聊天品牌区分开。

在品类坐标里,Grok Voice 与 OpenAI 的 Realtime API 竞争可嵌入 voice agent,而 GPT-Live 与 Gemini Live 竞争默认消费级语音按钮。Grok 的消费级应用集成存在,但对要发布自有语音产品的团队,API 故事才是架构层面的头条。


5. Voice Agents vs 语音听写 vs 电话机器人

语音栈分成三种任务形态——共用一个麦克风图标,却为不同结果优化。混淆它们会导向常见失败:期待文档听写工具带你演练谈判,或期待电话机器人自由头脑风暴。

Voice agents 优化交互式口语推理。成功的样子:与 AI 的一场连贯多轮通话,你出声思考、打断、得到有实质的回答——可选带工具。延迟与轮替主导 UX 评估。产品:GPT-Live、Claude Voice Mode、Gemini Live、Grok Voice(消费级);Realtime API 与 Grok Voice API(开发者)。OpenAI 在同一应用里区分双向 Voice Mode 与 composer 听写的细节,见 ChatGPT 语音模式 vs 听写

面向 AI Agent 的语音听写优化工作区内的文本生产。成功的样子:准确转写进你正在编辑的产物,agent 对选中片段施以辅助——润色这段、批量批注这些高亮——全程不离开文档。延迟仍然重要,但持久产出是文字,不是 AI 语音的转写。关于语音模式何时胜过听写的结构化对比,见 面向 AI Agent 的语音模式与语音听写对比

电话语音机器人优化电话网络上的呼叫完成指标——问题解决率、平均处理时长、合规话术、CRM 记录。成功常常是一笔完成的付款、一个订好的预约、或一次合格的转人工。开放式推理可能被明确排除以降低责任风险。现代语音到语音模型可以升级这些机器人,但运营外壳(运营商、录音、PCI 流程)与模型共同定义了这个品类。

对选择日常工具的独立运营者,工作语境的框架很重要。我们的姊妹篇 工作中的 Voice Agent 与语音听写之别逐场景展开——散步 vs 桌面草稿、会议 vs 备忘录——而不把品类混为一谈。

维度Voice agent面向 agent 的语音听写电话语音机器人
主要输出口语对话(+ 可选动作)工作区内可编辑文本呼叫结果(工单、付款、路由)
交互模型开放式对话语音 → 文本 → 编辑/agent 处理结构化意图 + 人工升级
典型延迟关注点首次出声时间、抢话转写精度、编辑循环ASR 槽位填充、脚本遵循
最贴切的例子散步时演练战略边口述提案边润色章节非工作时间的账单支持热线
代表产品GPT-Live、Claude Voice、Gemini LiveFlow 式文档听写层联络中心平台 + Realtime API

表格做了简化——混合产品存在——但如果你的任务放不进任何一列,你多半需要两个工具,而不是一个被贴错标签的「语音 AI」。


6. 任务形态:Voice Agent 在你的技术栈里赢得哪个位置

思考速度胜过键盘精度、且任务容忍对话式探索而非像素级编辑时,voice agents 大放异彩。2026 年年中,独立创业者与独立创始人反复出现三种任务形态。

移动中的思考伙伴。 战略、演练与决策框架受益于语音,因为走路与开车本就占用了你的双手。Claude Voice Mode 的营销明确瞄准练习提案与比较报价;GPT-Live 瞄准连续来回。交付物往往是清晰度,而不是格式化文档——你之后可能仍会记笔记,但认知工作是语音会话完成的。

带追问的即时调研。 带搜索或工具访问的 voice agents 支持链式提问——「政策三月以来改了什么?」接着「那对一家两人的 LLC 有什么影响?」——比在手机键盘上打字快。Gemini Live 的搜索接地与 GPT-Live 的委托模式都瞄准这个形态,只是生态锁定不同。

嵌入的面向客户 agent(构建者形态)。 开发者用 Realtime API 或 Grok Voice 把 voice agents 放进自己的产品——辅导、内部服务台、预约分诊——品牌与数据边界要求自定义托管。除非你本身发布软件,这不是独立创业者的默认项;列出它是为了完成品类地图。

Voice agents 不能替代其他工具的地方:带引用的长文写作、法律级精度、协同编辑仍偏向键盘优先的工作流或向文档听写。那是语音听写产品——而非 voice agents——领跑的边界。Floatboat 的 Flow Mode(见我们的 Flow Mode 公告)稳稳站在听写一侧:语音喂给一份活文档,桌面 agent 协作编辑选中文本。Floatboat 不是 voice agent 产品——它不把语音进/语音出的对话定位为主运行时。如果你的任务是在客户电话前交付一份书面简报,听写加 agent 编辑,可能胜过一场还需要收拾转写烂摊子的口头头脑风暴。


7. 结语

Voice agent 最好的理解方式是:为实时对话而建的语音进、语音出 AI——和你一起出声推理,而不只是记下你说了什么、或路由你的电话。2026 年年中的消费级版图——GPT-Live、Claude Voice Mode、Gemini Live、Grok Voice——与平行的开发者 API 在这个任务形态上汇流,又在双工架构、模型路由、多模态输入与可嵌入性上各不相同。

实用要点先在分类学,再在厂商。需要带工具的交互式口语思考?找 voice agent。需要语音变成 agent 可编辑的工作区持久文本?那是面向 AI Agent 的语音听写,见我们的系列枢纽文章。需要大规模完成电话呼叫并合规?电话语音机器人——越来越多由语音到语音模型驱动——仍是对框。混用标签浪费钱也浪费势头;任务形态对准品类则不会。


https://floatboat.ai/zh/blog/what-is-a-voice-agent

常见问题

ChatGPT Voice 就是 voice agent 吗?
按品类说,是的。由 GPT-Live 驱动的 ChatGPT Voice 是消费级 voice agent:你说话,模型以语音回应、维持上下文,并能委托复杂工作给更强的模型。旧的「Advanced Voice Mode」品牌指更早的实时技术栈;截至 2026 年 7 月,GPT-Live 是全双工一代。构建自定义产品的开发者通常用 Realtime API,而不是 GPT-Live 本身。
Voice agent 与语音听写有什么不同?
语音听写把语音转成文本作为主要产物——通常在文档或输入框里——供编辑与下游 agent 动作。语音 agent口语对话当作主界面;文本可能从不出现。你可能一天两者都用:在桌前口述客户备忘录,然后出去散步、和 voice agent 把定价策略聊透。两个品类之别在重心,不在麦克风硬件。
电话机器人可以是 voice agent 吗?
它们可以用 voice agent 的模型,但产品品类不同。电话机器人优化电话网络约束——脚本、话术、排队、CRM 写入——而消费级 voice agents 优化开放式对话。架在 SIP 中继上的 Realtime API 部署在架构上模糊了界线,但运营团队评估电话机器人仍看问题解决率与合规,不看头脑风暴质量。
对独立创业者,哪个 voice agent 最好?
没有万能赢家——任务形态说了算。GPT-Live 强调 ChatGPT 里自然的双工对话;需要在 Android 上带摄像头或屏幕上下文时,Gemini Live 领先;Claude Voice Mode 让付费用户在通话中途切到 Opus 或 Sonnet 处理更难的推理;如果你自己开发软件,Grok Voice 瞄准低延迟 API 场景。桌面写作为主、要与 agent 协作的场景,考虑听写优先的工具,而不是把 voice agent 会话硬伸进文档生产。
Floatboat 包含 voice agent 吗?
不包含。Floatboat Flow Mode 提供进文档的 AI 语音听写,带原位 agent 编辑——是「给 agent 的听写」模式,不是语音进/语音出的对话 agent。想了解那个相邻品类的定义,从我们的面向 AI Agent 的语音听写枢纽文章读起;本文覆盖的是对话式 voice agent 那一侧。