個人情境 AI Agent 指南:手機脈絡、記憶、權限與 Android 執行
用一個手機任務看懂個人情境 AI Agent:如何區分目前畫面、對話歷史、連結資料、偏好與長期記憶,並把必要脈絡轉成可確認、可復原的 Android 動作。
- 個人情境 AI Agent 的重點是為目前任務選出必要訊號,例如目前畫面、近期對話、App 狀態、連結服務、偏好或可管理記憶。
- AI Agent 記憶與任務情境要分開看:短暫脈絡服務眼前任務,長期記憶服務重複偏好,兩者都需要可檢查與可重設控制。
- 最小情境決策法要同時看相關性、敏感度、保存時間與失敗替代路徑,讓 Android 情境感知 Agent 在足夠資訊內完成支援動作。
- FoneClaw 把使用者帶入的情境連到受治理 Android 執行:設定的相容模型負責理解與規劃,FoneClaw 提供支援工具、核准、停止、狀態檢查與權限復原。
用一個手機任務定義個人情境 AI Agent
先看一個真實手機情境:你正在聊天 App 裡看到同事傳來「下午三點改到北車附近碰面」,接著你對手機說:「幫我整理一下,順便提醒我提早出門。」對個人情境 AI Agent 來說,真正有用的資訊不是你的所有私密資料,而是目前任務需要的幾個訊號:目前畫面上提到的時間與地點、你剛剛提出的目標、行事曆是否有衝突、導航或提醒是否屬於支援動作,以及送出或建立前是否需要你確認。
因此,個人情境 AI Agent 可以定義為:能為目前任務選取相關情境、用模型理解與規劃下一步,並在使用者允許的範圍內推進支援動作的 AI 代理。情境可能來自目前螢幕、最近一句指令、同一任務的對話歷史、App 狀態、連結服務、裝置訊號、偏好或可管理的長期記憶。它的價值不是蒐集更多,而是讓下一個動作更準確、更少打擾、更容易檢查。
我們在 FoneClaw 做 Android 手機代理時,會用一個很直接的判斷標準看個人情境:這個訊號是否能改善下一個支援動作?如果答案是可以,例如把可見地址轉成導航、把會議時間轉成提醒、把目前畫面內容轉成草稿,它就值得納入任務脈絡。如果訊號和眼前任務無關,即使模型能讀,也會增加雜訊與風險。這也是手機 Agent 情境設計和一般聊天記憶最大的差別。
把目前狀態、工作歷史、連結資料、偏好與記憶分開
實用的 AI 助理個人情境需要分層管理。第一層是立即狀態:目前畫面、使用者剛說的話、正在開啟的 App、可見按鈕、表單欄位、通知或截圖。這一層最貼近任務,也最適合短暫使用。第二層是工作階段歷史:同一個任務裡前面問過什麼、已經嘗試哪些步驟、哪個權限被拒絕、哪個結果已完成。它幫助 Agent 不必重複問同一件事,也能在失敗後接著復原。
第三層是連結資料與授權服務,例如行事曆、郵件、雲端檔案、照片、地圖、聯絡人或其他可連接服務。Google Gemini 個人化說明把過去對話、連結 App 與回覆指示拆成不同來源;Google Gemini 連結 App 個人化說明也把可連接服務、使用者控制與資料使用分開描述。這些文件提醒我們:個人化不是單一開關,來源、資格、帳戶與控制方式都可能不同。
第四層是偏好,例如常用語氣、常用地圖 App、偏好的提醒時間、常見收件人、是否要先產生草稿再送出。第五層是較耐久的 AI Agent 記憶與情境,例如「我通常把會議摘要整理成三點」或「工作訊息先用正式語氣」。長期記憶的保存時間更長,控制要求也更高;使用者應能檢視、修正、刪除或重設。若你想深入理解耐久記憶、伺服器狀態與本地代理記憶的差異,可看 Hy-Memory 伺服器狀態 vs 本地智能體記憶:手機用戶該怎麼看。
| 情境層 | 常見來源 | 保存時間 | 適合用途 | 主要控制 |
|---|---|---|---|---|
| 立即狀態 | 目前畫面、可見 App、最新指令 | 任務期間 | 理解眼前內容、選下一步 | 由使用者主動帶入、可停止 |
| 工作階段歷史 | 同一任務的對話、工具結果、錯誤狀態 | 同一工作流 | 接續任務、避免重複、復原 | 清除對話、停止任務 |
| 連結資料 | 行事曆、郵件、照片、地圖、聯絡人 | 依服務設定 | 查詢、摘要、安排、準備草稿 | 連結服務控制、Android 權限 |
| 偏好 | 語氣、常用 App、提醒習慣 | 可調整 | 減少重複設定 | 偏好設定、重設選項 |
| 耐久記憶 | 使用者允許保存的長期資訊 | 較長期 | 重複任務、個人化流程 | 檢視、刪除、匯出或關閉 |
這張表的重點是壽命不同、控制也不同。Android runtime 權限、連結服務設定、模型的網路處理、FoneClaw 的核准政策與本地記憶控制,應各自被看清楚。把它們混成「AI 懂我」一句話,會讓使用者很難判斷自己交出了什麼。
選出完成任務所需的最小情境
Android 情境感知 Agent 的第一原則,是先說清楚要做什麼,再選最小足夠情境。你要把畫面上的地址轉成導航,通常需要目前畫面或地址文字、地圖 App 與位置狀態;不需要讀取整個郵件信箱。你要把一句話轉成訊息草稿,通常需要收件人、內容和語氣偏好;不需要開放相簿或完整通知歷史。把任務說清楚,資料需求就會縮小。
Android 權限最小化建議強調減少不必要權限,並優先使用範圍更小的替代方案。Android runtime permissions 指南也提醒,App 在有限存取沙盒中運作,危險權限會在執行時請求,使用者可以拒絕。對手機 Agent 而言,這會變成一個很實用的決策法:相關性、敏感度、保存時間、替代路徑。
相關性問的是:這個訊號是否直接改善下一步?敏感度問的是:它是否包含私人訊息、位置、帳號、付款、健康或工作資料?保存時間問的是:任務完成後還需要保留嗎?替代路徑問的是:使用者拒絕權限時,是否能用較窄方式完成,例如手動選取一段文字、只附加目前畫面、只開啟設定頁,或產生草稿讓使用者自行送出。
這樣做會讓手機 Agent 更可靠。資料少一點,模型比較容易對準任務;權限窄一點,使用者比較願意授權;保存短一點,錯誤影響範圍比較可控。若某個工作真的需要更高權限,Agent 應在用到的當下說明用途,並提供拒絕後的可行方案,而不是把廣泛授權當成預設條件。
把個人情境轉成可見的 Android 支援動作
個人情境如何變成手機操作?我們在 FoneClaw 會把它拆成六步:理解、路由、檢查、執行、驗證、復原。第一步是理解目前目標,例如「把螢幕上的地址傳給同事,並提醒我下班前跟進」。模型要先判斷任務需要哪些資訊:目前畫面、同事聯絡方式、提醒時間、訊息內容和使用者確認。
第二步是路由到支援能力。FoneClaw 提供 Android phone-agent runtime,設定的相容模型負責推理與規劃,FoneClaw 則把任務導向受治理的 Android 工具與流程。這些能力包含目前畫面、App、裝置狀態、通訊、行事曆、備忘、網頁、工作流程與其他支援工具;公開能力可概括為 100+ built-in tools。若你想看 Android 手機動作的整體架構,可延伸閱讀 手機 AI Agent 控制是什麼?Android 手機自動化代理的能力、邊界與安全檢查。
第三步是檢查權限與核准政策。讀取目前畫面、查行事曆、準備訊息、調整設定或連接線上服務,涉及不同資料來源與風險。FoneClaw 會在任務需要時引導權限,並把有外部影響的步驟放在可見確認裡。第四步是執行或交接:能支援的動作由工具完成;需要使用者判斷的內容,停在可檢查位置;超出支援範圍的步驟,提供清楚的下一步。
第五步是驗證結果。手機 Agent 不能只說「完成了」,還要讓使用者看到狀態,例如提醒已建立、草稿已準備、設定頁已開啟、地圖路線已顯示、權限仍缺哪一項。第六步是復原。若權限被拒絕、App 狀態改變、畫面資訊不足或工具失敗,流程應能停止、請使用者補資料、修復權限,或只重試失敗的部分。這條從情境到行動的迴圈,是我們把個人情境做進 FoneClaw 時最在意的地方。
辨識過期、過量、衝突與帶指令的情境
手機 Agent 情境有用,也會出錯。第一種常見失敗是過期情境:舊地址、舊會議時間、已取消的提醒、上一次對話中的收件人,被誤用到新任務。解法是刷新目前畫面與最新狀態,在敏感步驟前再次顯示來源和結果。
第二種是過量情境。模型拿到太多通知、太長聊天紀錄、太多歷史偏好,反而抓不到眼前目標。這時應縮小任務範圍,只保留和下一步有關的訊號。第三種是衝突情境:長期記憶說你偏好某個地圖 App,目前畫面卻在另一個 App 裡;過去偏好說下班前提醒,使用者這次明確說晚上九點。當記憶與目前指令衝突,目前指令和可見畫面應優先進入確認。
第四種是帶指令的情境。網頁、訊息、文件或截圖中可能含有看似指令的文字,例如要求 AI 忽略前面的規則、分享資料、刪除內容或改變收件人。這些內容代表頁面或訊息的一部分,不等於使用者意圖。手機 Agent 應把它們當作待分析內容,並在涉及送出、刪除、分享、付款、登入或設定變更時要求使用者確認。
這篇不把問題展開成完整安全深潛,但使用者可以記住一個原則:情境要服務任務,不能取代確認。當內容過期、過多、衝突或帶有可疑指令,最好的恢復方式是重新附加目前畫面、縮小資料來源、請使用者明確選擇,或交還手動操作。這些停頓會讓流程更慢一點,也讓結果更可控。
用可復原流程測試懂情境的手機 Agent
如何安全測試懂情境的手機 Agent?從低風險、可復原、可觀察的任務開始。不要第一個測試就選付款、刪除檔案、傳送敏感訊息或修改帳號。更好的起點是:看著一段會議文字,請 Agent 建立一個可取消提醒;看著一個地址,請它準備導航但先不要分享;看著一段聊天,請它產生草稿並停在確認前。
測試前先寫下你希望 Agent 使用哪些訊號,例如目前畫面、使用者剛說的時間、預設提醒 App、語氣偏好。也寫下它不需要使用哪些訊號,例如完整相簿、全部聯絡人、所有通知或長期記憶。接著預測期待結果:它應該打開哪個 App?應該停在哪個確認點?完成後你可以在哪裡檢查?
- 選一個可取消的任務,例如建立提醒或準備不送出的訊息草稿。
- 列出必要情境:目前畫面、任務指令、目標 App、必要權限。
- 關閉不必要來源,例如暫時不連結郵件或不使用長期記憶。
- 執行任務並觀察:Agent 是否引用正確畫面、是否要求必要核准、結果是否可見。
- 改變一個變數,例如時間、收件人或目前畫面,再跑一次。
- 撤銷可選權限或清除任務脈絡,確認流程能停止或降級。
一次只改一個情境變數,才能知道 Agent 是否真的懂脈絡。若第一次測試通過,再加入一個新的訊號,例如行事曆或位置;若結果不穩,先縮小情境而不是加更多資料。這種測試方式能同時檢查相關性、權限範圍、可見執行和復原能力,也能幫你建立自己的可託付範圍。
FoneClaw 目前的情境設計與下一步
我們在 FoneClaw 的設計出發點很實際:任務情境要服務支援動作。使用者可以從預設模型開始,也可以配置相容模型;模型負責理解語句、整理脈絡與規劃步驟,FoneClaw 負責把計畫連到受治理的 Android 執行。這讓情境從「AI 好像知道我」變成「我看得見它用哪些資訊做下一步」。
目前畫面是最重要的短暫情境之一。FoneClaw 的懸浮入口和使用者觸發的目前畫面附加,讓使用者在其他 App 中把眼前內容帶入任務。任務可以在 Home 與懸浮助手之間維持連續,並透過核准、停止、權限復原和狀態檢查保持可追蹤。這些控制讓 Android 情境感知 Agent 的工作更接近可驗證流程,而不是只產生一段建議文字。
我們也把本地記憶、連結服務、Android 權限、核准政策和模型網路路徑分開處理。某些個人情境適合在本機短暫使用,某些設定或線上服務需要網路處理,某些資料應由使用者明確選擇是否連接。若你正在評估本地控制與雲端服務之間的信任取捨,可閱讀 AI Agent 信任指南:本地手機控制與雲端安全怎麼取捨;若你要深入工具核准與稽核證據,可閱讀 AI 代理身份與權限治理:逐工具核准、稽核紀錄與 FoneClaw Android 控制。
下一步建議很簡單:先到 FoneClaw 功能頁 查看目前支援能力,再到 FoneClaw 下載頁 取得目前安裝資訊。安裝後用一個可取消提醒或不送出的草稿測試目前畫面、必要權限、可見核准和復原。當這個小流程可靠,再逐步加入更多情境來源與更長的 Android 任務。