解析手机 Agent 如何从干净录屏和语音讲解中提取规则、生成可复用技能,并通过状态测试、权限映射、确认和回退适配 Android。
如果一个手机流程每周都要重复,用户能否做一遍并讲清楚原因,让 Agent 下次自己完成?这就是演示学习的核心:系统不只接收一句任务描述,还同时观察操作顺序、界面状态和用户解释,从中提取可以复用的目标与规则。
2026 年 7 月 22 日,ITmedia 对 Claude Cowork Record a Skill 的报道介绍了一种具体交互:用户执行任务并进行口头说明,系统把过程转换为可重复使用的技能。Android Authority 的实测报道也指出,该功能会录制屏幕,同时听取用户对工作流的解释,目标是减少重复任务中反复编写提示词的需要。
这项信号来自 Claude Cowork 的技能记录方式,它让“做给 Agent 看”成为清楚的产品交互。对手机 Agent 设计而言,更重要的问题是如何把这种方法移植到动态 Android 环境:录屏提供可观察过程,语音提供决策理由,技能生成环节再把两者整理为目标、参数、条件和动作。
演示学习与普通提示词不同。提示词通常告诉模型“要做什么”,但可能没有展示实际入口、页面状态和异常分支。演示则提供一个完整实例,让系统看到用户如何识别目标、选择控件、检查结果,并知道哪些步骤需要停下来确认。
它也不同于确定性宏。传统宏更接近按顺序重放坐标、按键或固定选择器,只要界面位置、窗口尺寸或页面结构变化,流程就可能偏离。演示学习追求的是提取语义规则,例如“选择标记为本月的账单”或“在发送前核对联系人和正文”,而不是记住第三次点击发生在屏幕右下角。
演示学习同样不是重新训练基础模型。一次录屏通常用于创建特定工作流的技能描述、参数和执行规则,不会因此改变模型的通用能力。模型训练关注跨任务能力;演示生成技能关注如何在明确范围内重复一项工作。关于训练环境与手机任务泛化的相邻研究,可阅读PhoneBuddy-4B 与手机 Agent 训练:为什么 Mock-App RL 对 Android Agent 很重要。
可靠的演示转换不是把视频文件直接交给执行器,而是经过捕获、解释、规则提取、参数化、技能封装和调用六个阶段。每一阶段都会减少偶然点击,让最终技能更接近用户真正想复用的工作方法。
| 阶段 | 需要捕获的内容 | 生成的结果 | 关键检查 |
|---|---|---|---|
| 屏幕捕获 | 应用、页面、控件、状态变化和最终结果 | 带时间顺序的操作轨迹 | 画面是否干净,是否出现敏感资料 |
| 语音讲解 | 目标、选择理由、跳过条件和异常处理 | 操作背后的决策语义 | 是否解释“为什么”,而不只是念出点击动作 |
| 规则提取 | 必须步骤、可选步骤、前置条件和成功标准 | 可执行的工作流结构 | 是否把偶然界面状态误当成固定规则 |
| 参数化 | 联系人、日期、金额、文件、应用或关键词 | 调用时可替换的输入变量 | 变量类型、默认值和允许范围是否清楚 |
| 技能封装 | 动作、权限、确认点、失败分支和输出 | 有版本的可复用技能 | 每项动作是否属于支持范围 |
| 重复调用 | 新输入和当前 Android 状态 | 一次实际任务运行 | 是否重新检查状态并显示结果 |
捕获阶段记录“发生了什么”。例如,用户打开日历、选择一个日期、填写标题并保存。单看录屏,系统可能只知道点击顺序;加入语音讲解后,才知道日期来自哪条消息、标题如何命名,以及保存前为什么要检查参与人。
规则提取阶段需要区分必需动作和现场巧合。演示中恰好只有一个日历账户,不代表技能永远可以跳过账户选择;当前页面没有权限弹窗,也不代表其他设备已经授权。技能应把账户、登录状态、权限和目标应用识别为前置条件。
参数化让技能摆脱单次示例。联系人姓名、会议日期、文件名称或目标文件夹不能固化在技能里,而应在每次调用时读取或询问。涉及同名联系人、多个账户或多个可用应用时,流程需要显示候选项并让用户确定。
封装后的技能还应包含明确输出,例如“草稿已创建”“事件已保存”或“流程停在确认页面”。只有动作结果可以验证,用户才能知道任务是否完成。需要了解一句话如何连接多个 Android 步骤,可以参考Android 任务自动化指南:用一个语音命令完成多步手机任务。
同一套操作昨天成功,今天为什么会点错?Android 工作流并不是静态幻灯片。应用更新、屏幕尺寸、字体缩放、横竖屏切换、系统导航方式、地区和语言都会改变控件的位置与文字。仅记住坐标或截图相似度,无法稳定覆盖这些变化。
应用状态是第一类变量。首次启动可能出现引导页,登录过期会回到认证页面,购物车或草稿可能保留上次内容,网络较慢时还会出现加载状态。技能执行前应识别当前页面和已有数据,再决定从哪一步继续,而不是默认每次都从演示中的初始画面开始。
响应式布局会改变控件结构。在大屏手机、折叠屏或平板布局中,底部导航可能变成侧栏;字体放大后,按钮可能换行或移到滚动区域。语义化技能应寻找具备特定名称、角色和上下文的控件,并在候选不唯一时暂停选择。
语言和地区也会改变界面。按钮文字、日期格式、货币、姓名顺序和地址字段都可能不同。可靠技能可以把“保存按钮”理解为动作角色,而不是只匹配某个固定字符串;处理日期和金额时,还要根据当前区域设置重新解析。
Android 无障碍节点可以提供控件名称、角色、状态和可执行动作。Android 无障碍服务指南展示了服务如何读取相关界面信息并与用户界面交互。对演示生成技能而言,无障碍树可以帮助把画面中的点击映射为语义目标,但实际访问和动作仍由平台能力、用户授权和当前应用界面决定。
权限弹窗是另一种动态状态。相机、联系人、通知、文件或位置权限可能在首次执行时出现,也可能已被拒绝或只获得部分授权。技能需要把权限申请视为独立步骤,说明为什么需要,并根据同意、拒绝或稍后处理进入不同分支。逐坐标回放若把权限弹窗当成普通页面,很容易点击错误选项。
一段好的演示首先要保护数据,其次才是展示完整流程。录制前应准备测试账户、示例联系人、虚拟文件和无真实交易的测试环境。密码、银行卡与支付资料、私人聊天、健康信息、身份证件、密钥和短信验证码都不应进入画面或语音讲解。
Android 的MediaProjection 文档要求每次媒体投影会话获得用户同意,并说明了捕获显示内容时的处理要求。这种逐次同意很重要,因为录屏权限对应的是当前会话,不是对设备屏幕的永久访问。录制结束后,捕获应立即停止,临时文件也应按照既定保留策略处理。
开始录制前,可以先按以下顺序清理环境:
录制时,语音讲解应解释决策,而不是机械复述手势。与其说“现在点右上角”,不如说“这里选择新建,因为当前列表没有匹配项目”;与其说“选第二个联系人”,不如说“根据公司名称选择工作联系人,若有两个结果就要求确认”。这种讲解更容易转化为可泛化规则。
还应主动演示例外。目标不存在怎么办?应用要求重新登录时在哪里停止?保存按钮不可用意味着缺少哪个字段?如果权限被拒绝,流程是改用手动步骤还是结束任务?只有把例外说出来,生成的技能才不会把一次顺利录制误认为所有未来状态。
Android 隐私与安全指南把权限和敏感数据访问视为按用途授予的平台能力。技能设计也应遵循同样思路:只捕获完成任务需要的画面,只绑定必要权限,并让录制者清楚知道哪些数据会进入技能生成过程。
从录屏生成技能后,第一次成功运行只证明它能重现一个样本。真正可复用的技能需要面对不同设备状态、输入值和异常分支。测试目标不是追求每次都自动完成,而是确保系统在无法确定时停在正确位置,并把下一步交给用户。
变体测试可以从五个方向展开:更换联系人或文件名,调整屏幕尺寸与字体,切换应用语言,清除登录状态,以及拒绝一项权限。对于消息、订单或账户变更,还应测试同名对象、重复提交和网络中断。每次测试都要记录技能如何识别状态、选择动作并判断成功。
试运行模式适合在真正执行前展示计划。系统可以列出准备打开的应用、所需输入、权限和最终动作,但不提交会产生后果的操作。用户确认计划合理后,再进入实际运行。发送消息、删除文件、提交表单、创建订阅或付款等步骤,应单独设置确认点。
权限映射要落实到每个动作。读取联系人需要什么权限,打开文件依赖哪个选择器,操作当前界面是否涉及无障碍能力,屏幕捕获是否仍在进行,都应在技能定义中明确。权限被撤销后,技能应提示缺少的能力并提供替代步骤,而不是反复尝试同一个失败动作。
日志需要回答四个问题:谁调用了技能、使用了哪个版本、输入了哪些非敏感参数,以及每一步得到什么结果。涉及私人数据时,日志应保留任务证据而控制内容范围。更完整的身份、权限和记录设计,可阅读AI Agent 身份、权限与审计轨迹:手机智能体真正需要的安全栈。
技能还需要版本号、变更说明和回滚路径。应用更新导致控件或流程变化时,可以先在测试环境升级技能;新版本失败,则恢复到上一个已验证版本或切换到人工步骤。安装前检查只能解决来源与声明问题,运行时还要持续核对当前输入、权限和动作,相关方法见AI Agent 技能安全:为什么手机 Agent 不能只靠安装前扫描。
从 FoneClaw 产品团队的视角看,可复用手机工作流需要把模型规划和 Android 执行清楚连接起来。用户配置的模型负责理解请求、推理条件并规划步骤;FoneClaw 负责执行受支持的 Android 手机动作,显示当前状态和结果,按需处理权限,在关键步骤请求用户确认,并在条件不匹配时提供实际回退。
目前,FoneClaw 提供的是配置模型驱动的受支持 Android 手机动作流程;从屏幕录制直接生成手机技能不在当前功能范围内。演示学习为未来工作流设计提供了有价值的交互方向,而现阶段用户可以通过自然语言描述目标,让配置模型完成理解与规划,再由 FoneClaw 在支持范围内执行。
一项理想的可复用手机技能,应包含目标、参数、前置状态、动作、权限、确认点、成功标准和失败分支。例如“为联系人准备会议信息”不应固化某个人名和某个日期,而应在调用时接收联系人、时间与正文;FoneClaw 执行支持的步骤时,会把对象和结果呈现给用户,并在发送前完成确认。
手机工作流的价值并不来自隐藏步骤,而来自减少重复操作的同时保留可见控制。模型可以处理自然语言中模糊但可推理的部分,FoneClaw 则将计划落到当前 Android 状态。应用页面变化、权限不足或目标不唯一时,流程可以停下说明原因,由用户选择、补充权限或接手完成。
Claude Cowork 的 Record a Skill 展示了“边做边讲”的技能创建入口,而移动端控制还涉及屏幕空间、通知、账户、权限和触摸替代等更多条件。关于 Cowork 与移动端 Agent 入口的相邻讨论,可阅读Claude Cowork 上手机:为什么移动端控制会成为 AI Agent 新入口。
对 Android 手机 Agent 而言,演示学习最终要通过一个简单标准:技能能否在状态发生变化时仍找到正确目标,在产生后果前让用户确认,并在失败后留下清楚的恢复位置。具备这些条件,录屏才会从一次性操作记录,真正转化为可维护、可授权、可复用的手机工作流。