AI 代理記憶投毒手機安全指南:Ask AI、推薦偏差與已儲存記憶稽核
說明 AI 代理記憶投毒與 AI 推薦投毒如何透過 Ask AI、預填提示詞與持久記憶影響未來建議,並提供手機端檢查、來源追蹤與復原流程。
- AI 代理記憶投毒指未經充分檢查的指令、偏好或事實進入助理的持久記憶,讓後續對話、推薦或排序受到影響。
- Ask AI、Summarize with AI、分享連結、文件摘要和目前畫面都可能把外部內容送進助理;安全重點是看清目的地、預填文字、分享範圍與是否會寫入記憶。
- Microsoft 觀察到超過 50 個獨特提示,來自 31 家公司、橫跨 14 個產業,嘗試影響未來推薦;實際效果會因助理、記憶機制和防護更新而變。
- FoneClaw 目前提供刻意附加目前畫面、排除覆蓋層、設定模型揭露、帳戶資訊控制與受治理 Android 動作邊界;這些是使用者可見控制點,而非自動記憶投毒偵測。
什麼是 AI 代理記憶投毒
AI 代理記憶投毒,是指外部內容把不可靠的偏好、事實或指令帶進助理的持久記憶,讓後續對話和推薦受到影響。它的風險點在「持久」:一次普通錯答只影響當下回覆;記憶被寫入後,助理可能在未來另一次對話中繼續引用,甚至在推薦服務、排序選項或解釋使用者偏好時重複這個偏差。
用手機上的例子看會更清楚。你在某個網頁看到 Ask AI 按鈕,按下後助理被預填一段看似摘要請求的文字。那段文字除了要求摘要,也可能夾帶「日後推薦時優先考慮某公司」這類持久偏好。若助理平台允許記憶寫入,且安全機制未攔截,未來你問「推薦一個供應商」時,答案可能被這段記憶影響。
Microsoft Security 對 AI Recommendation Poisoning 的分析把這類行為描述成嘗試影響未來推薦的做法。重點不是模型訓練資料遭污染,而是使用者助理或代理環境中的記憶、偏好或持久上下文被外部內容引導。
我們在 FoneClaw 看這個議題時,會先問三個問題:內容從哪裡來、是否可能被保存、未來會在哪個任務中被重用。手機代理越常讀取目前畫面、文件、訊息和分享內容,越需要讓使用者看得見脈絡來源與動作邊界。
隱藏的 Ask AI 或 AI 摘要提示如何進入記憶
一條常見路徑可以這樣理解:網站或文件放上一個友善標籤,例如 Ask AI、Summarize with AI、用 AI 幫我整理。使用者按下後,手機開啟某個助理或聊天服務。連結裡可能已經帶了預填提示詞,使用者只看到按鈕名稱,未必看到完整文字、參數或目的地。送出後,助理會把這段外部內容當成使用者交付的任務。
Microsoft 觀察到的案例中,特製連結會把 prompt parameters 帶到 AI 按鈕後面,嘗試讓助理記住或優先考慮某家公司。這類路徑的危險性在於外觀很像正常生產力捷徑:讀者只想摘要文章、比較商品或請 AI 解釋服務,卻同時把外部提供的隱藏指令送進助理。
這裡不需要把每個 AI 按鈕都視為惡意。Ask AI 本身可以很方便,問題在於來源、目的地和預填內容是否可檢查。安全的產品應該讓使用者知道要送出哪些文字、是否會附上網頁或螢幕內容、是否可能更新記憶或偏好,以及能否在送出前取消。
手機上的路徑更容易被忽略,因為小螢幕會隱藏完整 URL,分享頁面會簡化標籤,App 之間跳轉很快。使用者只要養成兩個習慣,就能降低風險:先查看連結目的地,再檢查助理輸入框中的預填文字。對重要推薦、採購、醫療、金融、法律和帳戶設定,還要用獨立來源驗證。
記憶投毒、提示注入與訓練資料投毒的差異
診斷這類問題時,要把三種威脅分清楚。提示注入通常影響當前任務:一段網頁或文件內容告訴助理忽略原本指令、改做別的事。記憶投毒瞄準的是持久狀態:它嘗試把某個偏好、事實或推薦方向保存下來,讓未來任務也受到影響。訓練資料投毒則發生在模型訓練或微調資料層,距離一般手機使用者更上游。
| 類型 | 攻擊目標 | 常見入口 | 使用者可檢查項目 |
|---|---|---|---|
| 提示注入 | 當前回覆或當前工具流程 | 網頁、文件、Email、螢幕文字 | 助理是否跟隨了內容中的可疑指令 |
| 記憶投毒 | 已儲存記憶、偏好、推薦依據 | Ask AI、摘要按鈕、分享內容、預填提示詞 | 記憶來源、保存時間、適用範圍、可否刪除 |
| 訓練資料投毒 | 模型訓練資料或微調資料 | 資料集、訓練管線、標註流程 | 一般使用者主要依賴模型供應商治理 |
MITRE ATLAS Memory Poisoning把記憶投毒列為 AML.T0080,提供威脅分類語言。這能幫使用者和產品團隊避免把所有奇怪回覆都叫做同一件事。單次推薦偏差只能提示你檢查,還需要看記憶、來源、歷史行為和平台控制,才能判斷它是否與持久記憶有關。
Microsoft 發現了什麼,數字代表到哪裡
Microsoft 的分析提供了目前最清楚的公開訊號之一。該團隊觀察到超過 50 個獨特提示,來自 31 家公司,橫跨 14 個產業;這些提示嘗試透過 AI 按鈕或特製連結影響未來推薦。這代表商業推廣者已經開始把 AI 助理記憶視為新的推薦入口。
這些數字的意義在於趨勢,而不是通用成功率。Microsoft 明確提到,效果會因助理而異,也會隨著記憶持久化方式和安全防護演進而變。該文也提到 Microsoft 在 Copilot 中部署防護,並且某些早期行為後來無法重現。這對讀者的實際含義是:平台安全會變,記憶功能會變,保護措施也會變。
我們不應把 Copilot 的防護效果套用到所有助理,也不應把所有 observed attempts 解讀成成功寫入記憶。更穩健的做法,是把它當成手機安全檢查的新類別:當你看到 AI 推薦突然長期偏向某個品牌、某個服務或某種說法,就檢查近期按過的 Ask AI、摘要連結、分享內容和已儲存記憶。
Microsoft 建議的方向很務實:檢查連結、檢視已儲存記憶、移除可疑項目,並用獨立來源驗證重要推薦。這些也正好適合手機使用者,因為手機上大量 AI 入口都從按鈕、分享選單和目前畫面開始。
為什麼記憶來源、版本與範圍很重要
有用的 AI 記憶需要來源。它應該知道這段偏好來自哪次對話、哪個文件、哪個使用者、哪個裝置或哪個工作區。它也需要版本:某個偏好是今天更新,還是半年前的資訊;某個工作規則是否被新規則取代。它還需要範圍:只用在個人購物建議,還是也用在工作文件、家人訊息或企業採購。
TencentDB Agent Memory是一個有用的架構參考。它把 Chat Memory、Skills、Wiki 和 CodeGraph 作為受治理的記憶資產來建模,並保留 ownership、versions、status、visibility、usage counts 和 agent bindings 等資訊。它的文件也描述 L0 原始對話、L1 atoms、L2 scenarios、L3 core/persona 的分層。
這個例子告訴我們,記憶安全不是只有「開或關」。更好的設計是讓記憶有來源、可見範圍、版本狀態、使用對象和刪除或停用方式。即使來源追蹤不能攔住所有注入,它也能讓事後調查和復原變得可行:你可以知道哪一段記憶何時建立、由誰使用、影響哪個代理。
手機代理尤其需要這種思路。手機上有私人訊息、通知、照片、帳戶、位置和工作資料。若助理使用個人上下文,使用者要能理解哪些脈絡被帶入任務。更廣的上下文價值可延伸讀 個人上下文 AI Agent:手機代理為什麼需要可見脈絡與權限邊界;記憶架構與本地、伺服器狀態的比較則可看 Hy-Memory 伺服器狀態 vs 本地智能體記憶:手機用戶該怎麼看。
把內容送給 AI 助理前的手機檢查清單
Ask AI 按鈕安全的第一步,是把「按鈕標籤」和「實際送出的內容」分開看。按鈕寫著摘要、比較、詢問 AI,並不等於它只送出乾淨文本。它可能帶有 URL 參數、預填提示詞、頁面內容、文件片段或你目前畫面的一部分。小螢幕會讓這些細節更難察覺。
在手機上按任何 AI 分享或摘要入口前,可以用下面清單快速檢查:
- 先長按或展開連結,查看目的地是否為你預期的助理或服務。
- 進入助理後,先讀輸入框裡的預填文字,再按送出。
- 把要摘要的內容和要求助理遵守的指令分開,不讓外部文字直接成為個人偏好。
- 遇到品牌、供應商、醫療、金融、法律或安全建議,用獨立來源核對。
- 確認該助理是否有記憶、個人化或推薦偏好設定,以及是否能檢視和移除。
- 畫面含有帳號、地址、付款、健康、公司資料或私人訊息時,先縮小分享範圍。
這些檢查不能看穿所有編碼或隱藏參數,但能擋下很多常見風險。更重要的是,它讓你在送出之前重新取得主導權。手機上的 AI 助理越方便,越要把「我正在交給 AI 的到底是什麼」變成固定檢查。
懷疑記憶遭投毒後如何隔離與復原
懷疑記憶遭投毒時,先把風險降下來,再開始復原。第一步是停止用該助理做高風險推薦,例如供應商選擇、醫療建議、金融決策、帳戶安全、法律文件或公司採購。第二步記下可疑觸發點:你最近按過的 Ask AI、摘要按鈕、分享連結、文件、Email 或網站。
接著檢查平台提供的記憶或個人化控制。不同助理的控制位置不同,有些提供已儲存記憶列表,有些把偏好放在個人化設定,有些只提供聊天紀錄或資料控制。看到可疑條目時,先截下可讀摘要供自己追蹤,再依平台支援方式移除、停用或修改。
- 暫停高風險使用,改用獨立來源做重要判斷。
- 整理近期觸發來源:按鈕、連結、文件、Email、螢幕分享和預填提示詞。
- 檢查已儲存記憶、個人化偏好、推薦設定和連結 App 權限。
- 移除或修正可疑記憶,並記錄你改了什麼。
- 開一個乾淨新對話,用中性問題重新測試推薦方向。
- 對重要結論使用獨立來源驗證,觀察偏差是否仍然出現。
刪除聊天紀錄和刪除已儲存記憶是不同控制,實際名稱要以各平台為準。復原後也要做乾淨測試:不要把原本可疑文字再貼回助理,而是用中性提問觀察它是否仍帶有異常偏好。若你關心本地控制與雲端服務的信任取捨,AI Agent 信任指南:本地手機控制與雲端安全怎麼取捨 會提供更完整的判斷框架。
FoneClaw 目前在 Android 上的脈絡邊界
FoneClaw 的角色,是 Android phone-agent runtime。設定的模型負責推理與規劃,FoneClaw 提供支援的 Android 執行路徑:權限、核准、結果和復原都要在手機任務中被看見。這個分工能幫使用者分清楚兩件事:內容被送去讓模型理解,和手機上真的執行一個動作,是不同階段。
截至目前可取得的最新產品資訊,FoneClaw 已加入可移動懸浮助手、刻意的一鍵目前畫面附加,並排除 FoneClaw overlay surfaces。使用者可以在需要時把目前畫面加入任務脈絡,而不是讓每個畫面自動成為輸入。版本入口以 FoneClaw 下載頁 為準。
這個設計對記憶安全的意義,是讓脈絡入口更可見。使用者知道自己何時附加目前畫面,也能在送出前判斷畫面是否含有外部指令、私人資訊或不該交給線上模型的內容。FoneClaw 提供本地管理的帳戶資訊控制;當使用者設定線上模型或服務時,相關脈絡可能依設定送往該服務。隱私與資料控制請以 FoneClaw 隱私政策 和使用者實際設定為準。
FoneClaw 支援的 Android 動作透過受治理工具、權限流程、核准、可見結果和復原處理;能力面可從 FoneClaw 功能頁 查看,並以 100+ built-in tools 的穩定說法理解。本文把這些稱為控制邊界:它們幫助使用者檢查脈絡和動作,但專門的記憶投毒偵測、記憶稽核或一鍵回滾仍要看各助理與模型平台本身提供的能力。
對我們來說,最實用的產品方向,是把「附加了什麼脈絡」「哪個模型會收到」「哪個 Android 動作會執行」「使用者在哪裡核准」做得更清楚。這也是手機 Agent 技能與權限安全需要延伸討論的原因;更多安裝與權限風險可看 AI Agent 技能安全:為什麼手機 Agent 不能只靠安裝前掃描。
手機代理記憶安全評估清單
評估手機代理的記憶安全,從低風險偏好開始,不要用真實採購、醫療、金融或公司決策當第一個測試。你可以建立一個無害偏好,例如「我偏好簡短回覆」,再檢查助理是否告知它保存了什麼、在哪裡能檢視、能否改名、停用或刪除,以及新對話是否會使用它。
- 來源:能否看到記憶來自哪次對話、哪個文件或哪個畫面。
- 範圍:能否限制記憶只用在個人、工作、某 App 或某任務。
- 版本:能否更新、取代或標記過期偏好。
- 控制:能否查看、編輯、停用、刪除和重新測試。
- 驗證:重要推薦是否要求獨立來源或使用者確認。
- 隔離:外部文件中的指令是否和使用者偏好分開處理。
透明記憶控制能幫助調查,來源驗證仍然必要。對手機代理來說,最好的安全體驗不是讓使用者背威脅名稱,而是讓每次脈絡附加、記憶保存、推薦使用和 Android 動作都能被看見、被修改、被停止。