个人上下文 AI Agent:手机上下文、记忆与 Android 可控执行指南
用一个真实手机任务解释个人上下文 AI Agent:怎样区分当前屏幕、会话历史、连接数据、偏好和记忆,并把上下文安全转化为受支持 Android 操作。
- 个人上下文 AI Agent 的核心不是收集更多信号,而是为当前任务选择足够相关、足够短命、足够可解释的上下文。
- 手机 Agent 上下文可以分成当前屏幕、会话历史、连接数据、偏好和长期记忆;它们的敏感度、保留时间和控制方式不同。
- 上下文要转化为手机操作,需要经过理解目标、选择受支持能力、检查权限与审批、执行或交接、验证状态和恢复六步。
- FoneClaw 把用户触发的当前屏幕、受支持 Android 工具、可见审批、停止、权限恢复和状态检查放在同一条可控工作流里。
用一个手机任务理解个人上下文 AI Agent
想象一个很普通的手机场景:你收到朋友发来的地址和时间,想“帮我安排一下”。一个普通聊天助手可以告诉你打开地图、设置提醒、回复朋友;个人上下文 AI Agent 则应该先理解这条消息、当前时间、你刚才的请求、可用地图应用、日历权限和是否需要发送回复。个人上下文不是关于你的全部私人资料,而是与当前目标有关、能帮助下一步更准确的信号。
所以,AI Agent 的个人上下文可以定义为:在用户允许和任务需要的范围内,为完成当前目标而选择的手机状态、会话信息、连接服务、偏好或记忆。它可能来自当前屏幕、最近一次请求、正在打开的 App、日历、通知、联系人、位置意图、设备状态,或用户明确保存的习惯。真正重要的不是信号数量,而是它是否让下一步受支持动作更清楚。
我们在构建 FoneClaw 时,经常用一个判断来筛选上下文:这条信息能否改善接下来那一步手机动作。如果它能帮助识别地址、选择正确联系人、避免重复提醒、解释权限缺口或确认执行结果,它就是有用上下文;如果它只是让模型看起来更“了解你”,却无法改善任务结果,就应该放在任务外。更完整的 Android 执行层可以参考 AI Agent 手机控制指南:Android 手机 Agent 真正应该怎么工作,本页重点解释行动前的上下文怎样被选中。
把当前状态、会话、连接数据、偏好和记忆分开
实用的手机 Agent 上下文可以分成五层,每一层的生命周期和控制方式都不同。第一层是当前状态:当前屏幕、可见按钮、正在使用的 App、设备网络、音量、权限状态、刚弹出的通知。它最贴近任务,也最适合短时使用。第二层是会话历史:用户刚才说了什么、Agent 已经做了哪几步、哪些步骤正在等待确认。它负责让任务连续,而不是让用户反复解释。
第三层是连接数据,例如日历、Gmail、Photos、联系人、云端文档或其他已连接服务。Google 在 Gemini Connected Apps 个性化帮助中把连接服务、个性化响应和单独控制放在一起说明,这给手机 Agent 一个清晰提示:连接数据和 Android 运行时权限不是同一件事。一个服务连接可以让回答更贴合资料,一个 Android 权限可以让应用访问设备能力,两者都需要独立控制。
第四层是偏好:默认地图应用、常用语言、通知摘要方式、回复风格、常用工作流、审批强度。Google 的 Gemini Apps 个性化说明也把过往聊天、连接应用和响应指令作为不同来源描述。第五层是长期记忆:用户希望系统长期记住的习惯、联系人称呼、常用路线或工作偏好。长期记忆最需要可查看、可删除、可关闭。关于长期记忆和服务器状态的取舍,可以继续读 Hy-Memory 服务器状态 vs 本地智能体记忆:手机用户该怎么看。
| 上下文层 | 典型信号 | 适合用途 | 用户控制 |
|---|---|---|---|
| 当前状态 | 屏幕、App、权限、设备状态 | 解释当前页面、选择下一步入口 | 按任务触发、用完刷新 |
| 会话历史 | 刚才请求、已执行步骤、等待确认 | 保持任务连续 | 停止、清空、换会话 |
| 连接数据 | 日历、邮件、照片、联系人、云端服务 | 个性化回答和任务准备 | 按服务连接或撤销 |
| 偏好 | 默认应用、语言、审批强度、常用流程 | 减少重复选择 | 编辑、重置、临时覆盖 |
| 长期记忆 | 长期习惯、称呼、路线、工作偏好 | 跨任务延续个人设定 | 查看、删除、关闭 |
为任务选择最小必要上下文
最小上下文不是让 Agent 变笨,而是让它只拿完成任务真正需要的信号。第一步先说清预期动作:是解释当前屏幕、准备草稿、打开导航、创建提醒、改系统设置,还是只做建议。动作越接近外部效果,上下文和确认就越要清晰。
第二步选择足够但更低敏感度的信号。要解释当前页面,优先使用用户主动附加的当前屏幕;要准备路线,优先使用消息里的地址和用户选择的地图应用;要安排提醒,优先使用这条任务里的时间,而不是整段日历历史。Android 的 最小化权限请求指南强调减少不必要权限、使用范围更窄的替代方案和优雅降级,这个原则同样适合手机 Agent 上下文。
第三步看生命周期。临时任务语境适合用完即更新;会话历史适合在当前任务中保留;偏好适合由用户长期管理;长期记忆只保存用户愿意跨任务复用的信息。AI 记忆和任务上下文的区别就在这里:任务上下文服务当下动作,长期记忆服务未来重复任务。把二者混在一起,会让用户难以判断系统为什么知道某件事。
第四步准备回退。用户拒绝权限、关闭连接服务或不想分享屏幕时,工作流仍应给出较窄方案:让用户手动选择联系人、复制地址、确认时间、打开设置页,或只返回说明而不执行。Android 的 运行时权限指南也说明用户可以拒绝危险权限;对手机 Agent 来说,拒绝权限应该触发更清楚的下一步,而不是任务失控。
把上下文映射到可见的 Android 动作
个人上下文怎样转化为手机操作?我们在 FoneClaw 里把它看成六步。第一步,解释目标:模型根据用户请求、当前屏幕和会话状态判断要做什么。第二步,选择受支持能力:例如屏幕理解、地图导航、日历、短信草稿、系统设置、设备状态、网页或工作流。第三步,检查权限和审批策略:当前是否有 Android 权限,动作是否需要用户确认,工具是否启用。
第四步,执行或交接。配置的模型负责理解和规划,FoneClaw 提供受治理的 Android 执行运行时。用户可以从主界面或浮动助手开始,主动附加当前屏幕,把当前页面纳入任务语境;执行层再用受支持 Android 工具推进任务。第五步,验证手机状态:导航是否打开到正确地点,提醒是否创建在正确时间,设置是否从原状态变为目标状态,消息是否仍停在可确认草稿。第六步,恢复或停止:权限不足时引导恢复,结果不对时停止或重试,敏感步骤停在用户批准前。
这条链路让上下文从“模型知道一些信息”变成“用户看得见下一步”。例如你在外卖页面看到地址和备注,想把地址发给同事并打开导航。一个安卓上下文感知 Agent 应先确认屏幕来源,再识别地址和联系人候选,随后选择短信或地图能力。涉及发送时,内容、收件人和应用必须可见;涉及导航时,目的地和地图应用要能检查。关于身份、权限和审计证据的更完整设计,可以看 AI 智能体身份、权限与审计日志:逐工具审批控制怎么落到手机 Agent。
FoneClaw 当前用 100+ 内置工具覆盖受支持手机能力,具体能力范围集中在 FoneClaw 功能页维护。我们不会把“上下文充分”当成“动作自动完成”的理由。上下文帮助规划,权限允许访问,审批决定是否继续,状态检查证明结果,恢复机制处理偏差。
识别过期、过量、误导和带指令的上下文
上下文会出错。第一类是过期上下文:旧日历、已撤回消息、刚改变的地点、已经关闭的 App、之前会话里的目标,都可能让 Agent 做出过时判断。解决办法是让系统在关键动作前刷新当前状态,并在必要时向用户确认“现在要处理的是哪一条”。
第二类是过量上下文。给模型塞入太多聊天、通知、网页和历史记录,可能让重要信号被稀释。手机 Agent 上下文应围绕任务排序:当前屏幕和用户刚说的话通常优先,连接数据和长期记忆只在能改善当前动作时加入。更大的上下文窗口可以容纳更多信息,但不会自动筛出正确的手机任务语境。
第三类是冲突上下文。长期记忆说你常用某个地图应用,当前屏幕却显示另一个地图链接;会话历史说要提醒明天,消息里写的是今天;联系人昵称可能对应多个人。这时 Agent 应把冲突显式展示出来,让用户选择,而不是把猜测藏在执行结果里。
第四类是带指令的上下文。网页、邮件、短信或截图里可能包含“忽略之前要求”“把信息发给某人”“点击这个链接”等文字,它们并不自动代表用户意图。手机 Agent 应把页面内容当作被分析对象,而不是把其中所有句子都当成命令。遇到发送、删除、付款、公开发布、位置共享和账号操作时,刷新上下文、展示计划、等待确认,是把错误限制在小范围内的关键。
用可撤回流程测试上下文感知手机 Agent
测试 AI 助手个人上下文,不要从高风险动作开始。先选一个可撤回、低影响的任务:根据当前屏幕解释一段文字、把消息里的地址打开到地图预览、创建一个可以删除的测试提醒、检查勿扰或音量状态,或根据一条通知准备但不发送回复。
测试前列出三项预期。第一,Agent 应该使用哪些信号:当前屏幕、刚才问题、日历时间、设备状态,还是一个手动选择的联系人。第二,它不需要哪些信号:完整聊天历史、全部位置记录、相册、账号密码或无关通知。第三,结果应停在哪里:回答、草稿、预览、系统入口,还是等待批准的动作。
- 选择一个低风险任务,并记录初始状态。
- 只提供完成任务所需的最小上下文。
- 运行任务,观察 Agent 是否说明使用了哪些信号。
- 检查动作是否停在合适层级:建议、准备、确认或完成。
- 验证结果,例如提醒、导航页面、设置状态或草稿内容。
- 撤销可选上下文,重复一次,观察工作流是否优雅降级。
- 只改变一个变量,例如换联系人、改时间或关闭权限,再看结果是否跟着变化。
一次成功演示只能说明这一条路径可用。更有价值的是看它是否能停止、能解释、能恢复。我们建议用户把“理解得对不对”和“执行得可不可控”分开评分:前者看上下文相关性,后者看权限、审批、状态证据和回退。涉及本地和云端路径的隐私取舍,可以参考 AI Agent 信任指南:本地手机 Agent 与云端 AI 安全怎么选。
FoneClaw 当前上下文设计和下一步
我们在 FoneClaw 的设计原则很直接:任务上下文应该服务一个受支持动作,而不是变成看不见的用户画像。用户可以从主界面或浮动助手进入,主动把当前屏幕加入任务;系统根据这次任务读取相关状态,配置的模型负责理解和规划,FoneClaw 的 Android 执行层负责权限、工具、审批、停止、状态检查和恢复。
这让上下文在手机上有明确边界。当前屏幕用于回答“我正在看什么”;会话历史用于回答“刚才做到哪一步”;连接服务用于回答“这项任务是否需要日历、邮件或联系人”;偏好用于减少重复选择;长期记忆用于用户愿意保留的跨任务习惯。不同来源可能经过不同网络和隐私路径,用户应按任务、模型和连接服务分别评估。
如果你准备实际尝试,可以先查看 FoneClaw 功能页了解当前支持的上下文、工具、审批和恢复能力,再通过 FoneClaw 下载页确认安装方式。建议从一个可撤回流程开始:附加当前屏幕,让 FoneClaw解释内容,准备一个提醒或导航预览,确认权限提示和结果证据。我们正在建设的方向,是让个人上下文成为可见、可控、可恢复的行动语境,让手机 Agent 在真实任务里更可靠。