SeedRealtime 全双工手机 Agent:从 Seeduplex 语音交互到 Android 执行层
SeedRealtime 和 Seeduplex 让实时语音 Agent 更接近自然对话,但真正的安卓手机 Agent 还需要权限、审批、工具契约、结果验证和恢复。本文从 FoneClaw 构建经验解释对话层与执行层如何配合。
- SeedRealtime 和 Seeduplex 的关键变化,是让语音模型在说话时继续聆听用户输入,从轮流说话走向更自然的全双工交互。
- 全双工语音 AI 改善停顿、打断、噪声和插话体验,但手机上的真实动作仍需要 Android 权限、工具契约、审批、结果验证和恢复。
- FoneClaw 当前把语音和当前屏幕上下文设计成用户主动触发,并通过受治理工具执行支持范围内的 Android 手机任务。
- 实用手机 Agent 架构需要把对话层和执行层分开:模型负责理解与协商,执行层负责权限、状态、动作、验证和可见接管。
SeedRealtime 和 Seeduplex 给手机 Agent 带来什么变化
SeedRealtime 全双工手机 Agent 这个话题,真正值得关注的不是“语音更像真人”这一句表面结论,而是对手机 Agent 交互栈的影响。ByteDance Seed 在 Seed Full-Duplex Speech LLM 官方介绍中发布了 Seeduplex,并说明其采用原生“边说边听”的全双工语音框架;Seed 还表示这类能力已经在 Doubao 中落地。SeedRealtime 官方模型页则提供了当前模型家族的实体背景。
半双工语音交互像对讲机:用户说完,模型再说;模型说话时,用户插话常常会被忽略或打断得很生硬。全双工语音 AI 的目标是让模型在输出时继续监听用户,理解用户的停顿、插话、纠正、噪声和旁人说话。对手机 Agent 来说,这意味着用户可以更自然地说“等等,不是这个联系人”“把最后一句改短一点”“先别发,给我看看路线”。
我们在 FoneClaw 里构建 Android 手机 Agent 时,很早就看到这个方向的重要性。语音优先手机的核心,不只是把按钮换成口令,而是让用户在真实任务中随时纠正、暂停和接管。想进一步理解语音优先交互如何和屏幕控制配合,可以阅读 语音优先 AI 手机:第三代手机交互为什么不是取消屏幕。
全双工语音 AI 如何处理停顿、噪声和打断
全双工的难点在于模型需要同时处理两条流:自己正在说的话,以及用户此刻新进入的声音。用户的“嗯”“等一下”“不是这个”“继续”可能是确认、纠正、取消,也可能只是环境声。系统要判断说话是否结束、是否需要被打断、插话是否与当前任务相关、旁人声音是否应该被忽略。Seed 在官方介绍中报告了对干扰抑制、端点判断和打断处理的改进,这些指标需要按 Seed 的发布语境理解。
研究层面也在拆解这个问题。论文 How Should LLMs Listen While Speaking?讨论了大模型在生成过程中如何路由用户新输入的音频,并指出通道融合、交叉注意力等方案会带来不同的语义 grounding 和上下文鲁棒性取舍。简单说,全双工不是把麦克风一直开着这么简单,而是要决定“用户此刻说的话是否应改变当前回答或任务计划”。
手机环境比安静办公室更复杂。厨房有抽油烟机,车里有路噪,地铁里有人说话,用户可能一边走路一边修正指令。语音模型需要过滤干扰,也需要保留真正的打断。低延迟模型会让对话更自然,但推理速度只是其中一环;如果你关心高速推理对手机 Agent 的影响,可以继续看 1000 TPS 大模型与手机智能体:高速推理真正改变了什么。
为什么对话层和 Android 执行层要分开
全双工语音 AI 解决的是交互层问题:模型怎样听、怎样说、怎样被打断、怎样理解用户的临时修正。Android 执行层解决的是另一组问题:能否访问当前屏幕,是否具备权限,哪个应用负责动作,结果在哪里验证,发送、删除、改设置这类外部影响动作怎样审批。把这两层分开,手机 Agent 才能既自然又可靠。
举个例子,用户说“给小王发短信说我十分钟到”,又在模型朗读草稿时插话“改成二十分钟”。全双工模型可以更快理解这个纠正;Android 执行层还要确认收件人、默认短信应用、完整正文和稳定发送控件。对话更顺,并不自动生成发送授权。真正影响手机状态的动作,要经过工具契约、权限和结果验证。
这也是我们在 FoneClaw 里坚持执行层治理的原因。模型可以帮助理解意图,FoneClaw 负责把意图放进受支持 Android 动作流程:读取可见状态、请求必要权限、展示审批、执行工具、核对结果、失败时恢复。想看更完整的手机执行模型,可以阅读 AI Agent 手机控制指南:Android 手机 Agent 真正应该怎么工作。
从语音意图到可验证结果的七阶段契约
我们把实用手机 Agent 的路径拆成七个阶段。第一是捕获:用户通过语音、悬浮入口或当前屏幕上下文发起任务。第二是澄清:模型确认对象、范围和影响,比如短信发给谁、路线用哪个地图、勿扰持续多久。第三是计划:Agent 把目标拆成支持范围内的工具步骤,并标出需要权限或审批的节点。
第四是审批:有外部影响的动作要让用户看到目标、理由和后果。发送消息、改系统设置、删除文件、共享位置、拨打电话,都属于需要清楚确认的动作。第五是执行:Android 执行层调用受治理工具或交给指定应用完成动作。第六是验证:执行后检查屏幕、系统状态或应用结果,告诉用户任务是否完成。第七是恢复:权限缺失、界面变化、网络中断、目标歧义或用户打断时,任务回到可理解的状态。
全双工模型可以让前两步更自然,也能让用户在审批前快速修正。执行层则保证后五步可控。这个契约的关键在于状态和审批要贯穿全程:用户中途插话、切换应用、打开悬浮助手或选择稍后处理时,任务仍然知道自己处在哪一步。关于审批界面和理由呈现,可以继续读 AI Agent 操作确认界面设计:建议、置信度、理由与手机恢复流程。
我们如何构建当前 FoneClaw 执行层
FoneClaw 当前采用用户主动触发的语音输入和当前屏幕上下文路径。截至目前的最新信息,当前发布基线已经提供悬浮助手、同机任务连续性、权限恢复和快速动作;用户可以在 FoneClaw 下载页面查看当前版本入口。我们把这些能力放在执行层里,是为了让用户从任意手机场景回到同一条任务线。
FoneClaw 的当前屏幕上下文也由用户主动附加。用户在某个 App 中遇到需要理解或操作的页面,可以通过悬浮助手把当前可见状态交给 FoneClaw,而不是让系统长期监听或持续观察。这个设计让上下文最小化,也让用户知道 Agent 正在处理哪一块屏幕内容。更完整的当前屏幕路径可以看 Android 悬浮 AI 助手与当前屏幕:从提问到可控操作的完整指南。
在工具层,FoneClaw 通过 Android 权限和受治理工具执行支持范围内的任务,包括勿扰、可见消息草稿、拨号准备、导航交给选定地图应用,以及部分设置流程。读者可以通过 FoneClaw 功能介绍了解当前用户可见能力。本文讨论 SeedRealtime 和 Seeduplex 的架构意义;当前 FoneClaw 产品事实,以 FoneClaw 自身 Android 执行层为准。
需要执行保护的全双工手机 Agent 场景
第一个场景是会议勿扰。用户说“接下来一小时开会,帮我开勿扰”,模型可以自然回应并允许用户补充“重要联系人仍然提醒”。执行层要检查系统设置路径,展示影响范围,完成后确认状态。这里的关键不是语音是否顺滑,而是设备状态变化是否可见。
第二个场景是短信口述。全双工模型能在朗读草稿时接受用户插话:“把二十分钟改成十分钟”“别发给客户,发给同事”。执行层要重新核对收件人、正文、默认短信应用和发送控件。FoneClaw 当前会准备可见 SMS/MMS 草稿,并在纯文本 SMS 的条件满足时推进发送;双卡、附件或界面歧义会进入可见接管。
第三个场景是通话和导航。用户可能一边走路一边说“给门店打电话,不通就导航过去”。全双工对话层能理解用户中途改主意,执行层要把拨号和地图应用交接清楚。第四个场景是被打断的多步骤任务:用户正在整理设置,来电后回来继续。FoneClaw 的同机任务连续性让任务保持可恢复。更完整的 Android 执行基础仍可参考 AI Agent 手机控制指南:Android 手机 Agent 真正应该怎么工作。
隐私、电量、音视频限制和下一步建设
全双工语音 AI 会增加对麦克风、延迟、电量和噪声处理的要求。手机 Agent 需要明确何时开始听、为何需要听、用户怎样暂停、怎样删除上下文、怎样恢复任务。FoneClaw 当前采用用户主动触发的语音和当前屏幕上下文,就是为了让用户知道任务从哪里开始、上下文来自哪里、执行影响到哪里。
视觉理解也是单独挑战。Seed 在官方发布展望中把视觉输入和主动交互列为后续方向;音频全双工能力本身还不等于完成“边看边听边说”。论文 VideoFDB 全双工音视频基准也说明,流式音视频 grounding 仍然是独立评估问题,许多系统在显式视觉问题之外对视觉流利用不足。
我们给手机 Agent 构建者的检查清单很简单:语音交互要支持打断和澄清;Android 执行要有权限契约;高影响动作要有审批;结果要能验证;失败要能恢复;当前屏幕上下文要由用户主动提供;电量、延迟和隐私要进入默认设计。FoneClaw 会继续把这些要求落实到 Android 执行层,让未来更强的实时语音模型可以接入一套可靠的手机行动框架。