Industry Analysis
📅 2026-07-26 ⏱️ 9 分鐘 Dean Dean

示範一次,教會手機 Agent:螢幕錄製、可重用技能與 Android 安全

解析手機 Agent 示範學習如何從螢幕錄製、語音解說與規則提取,轉為可測試、可控權限並能安全重用的 Android 工作流程。

使用者在 Android 手機示範操作並以語音解說,手機 Agent 將步驟整理成可測試、可重用且需要確認的工作流程
📋 核心要點
📑 目錄
  1. 示範工作流程,不等於錄下固定腳本
  2. 從一次錄製到可重用技能的完整路徑
  3. Android 畫面持續變動,逐格重播為何容易失敗
  4. 如何錄出乾淨、安全又足以學習的示範
  5. 技能上線前要測試變化、權限與復原能力
  6. FoneClaw 如何看待可重用的手機工作流程

示範工作流程,不等於錄下固定腳本

如果你每天都要在手機上完成相同任務,能不能操作一次,再讓 AI Agent 記住做法?這正是手機 Agent 示範學習想解決的問題。它的重點不是保存一串點擊,而是觀察使用者如何抵達目標,再從畫面、動作與口頭解說中找出可以重用的規則。

2026 年 7 月 22 日的ITmedia 報導指出,Claude Cowork 的 Record a Skill 會記錄任務及使用者的語音說明,再將內容轉成可重用技能。前一天的Android Authority 實際體驗也描述了相同互動:系統錄下螢幕,使用者一邊操作一邊解釋流程,目標是減少日後執行重複任務時反覆輸入指示。這項訊號讓「做給 Agent 看」成為具體的產品互動方式,但手機上的可靠技能仍需要處理比螢幕錄影更多的問題。

提示詞、巨集、畫面重播、示範學習與模型訓練並不是同一件事。提示詞用文字告訴 Agent 要做什麼;確定性巨集依固定順序執行預設命令;畫面重播保存操作軌跡;示範學習則試圖理解動作背後的目的,將偶然出現的畫面位置與真正的決策條件分開。模型訓練的範圍更廣,通常涉及大量資料與模型參數更新,並非錄製一次個人工作流程就等同完成訓練。

方式主要輸入適合情境遇到畫面變化時
提示詞自然語言要求一次性或可由模型規劃的任務由 Agent 重新理解當前狀態
固定巨集預設動作與順序介面穩定、條件單純的流程按鈕位移或步驟增減時容易中斷
畫面重播錄製的觸控與畫面軌跡重現完全相同的展示環境通常缺少判斷與例外處理
示範學習操作、語音解說、畫面狀態與結果具有可變資料與重複決策的工作流程依提取出的規則與當前狀態調整
模型訓練大量資料、評估與訓練程序提升廣泛能力或特定任務表現取決於訓練涵蓋範圍與部署方式

真正有價值的示範會解釋「為什麼」。例如,使用者不是只點選第二個搜尋結果,而是說明「選擇評分高於四顆星、今天可送達且未超過預算的選項」。這句解說把偶然位置轉成可重用條件。當結果排序改變,Agent 仍可依規則選擇,而不會固執地點擊第二列。想了解 Claude Cowork 與手機操作入口的相鄰發展,可閱讀Claude Cowork 走上手機:為什麼行動控制會成為 AI Agent 新入口;本文則聚焦於示範如何成為經過治理的 Android 技能。

從一次錄製到可重用技能的完整路徑

一段螢幕錄影如何變成下次可以直接呼叫的工作流程?中間至少要經過擷取、解說、規則提取、參數化、技能封裝與驗證。若直接把錄影當成完整技能,Agent 只會記住那一次的資料與畫面,難以處理下一次不同的收件人、日期、檔案或應用程式狀態。

第一步是擷取一個乾淨範例。錄製從清楚的起點開始,例如應用程式首頁或指定資料夾,而不是從充滿臨時視窗的中途畫面開始。使用者一邊操作,一邊說明目標、選擇依據、哪些欄位每次會變,以及何時應停下詢問。語音解說應聚焦決策,例如「檔名使用專案名稱加日期」或「只有附件存在時才寄出」,而非逐字朗讀每次點擊。

接下來要把示範拆成三類資訊。第一類是固定規則,例如輸出必須存進特定類型的資料夾;第二類是參數,例如聯絡人、日期、標題、金額或檔案名稱;第三類是當次示範的偶然細節,例如某個按鈕剛好位於右下角。可靠技能保留前兩類,並盡量排除第三類。若一個資訊無法確定是規則還是偶然狀況,技能生成階段應把它列為待確認項目。

完成參數化後,工作流程才能被封裝成可呼叫技能。技能說明應包含用途、必要輸入、允許使用的應用程式與權限、成功條件、需要使用者確認的動作,以及失敗時如何停下。呼叫方式可以是「把今天的現場照片整理到專案資料夾」,而不必重新描述每個操作步驟。設定的模型根據當次輸入規劃路徑,手機 Agent 則依支援能力執行具體動作。

最後還要驗證產出是否符合原始目標。Agent 不應只報告「流程完成」,而要核對可見結果,例如檔案是否出現在正確位置、訊息是否仍停在送出前、表單是否包含正確資料。對多步驟 Android 工作流程有興趣的讀者,可參考用一句話完成 Android 任務自動化:FoneClaw 多步驟手機操作指南,了解規劃、操作與確認如何在實際任務中銜接。

Android 畫面持續變動,逐格重播為何容易失敗

同一段手機操作明天再做一次,畫面往往不會完全相同。通知可能蓋住按鈕,應用程式可能更新版面,帳號可能需要重新登入,清單順序也可能因新資料改變。這些變化使 Android phone agent 不能只記住「在某個座標點一下」,而要辨認目前畫面代表什麼狀態。

裝置尺寸與回應式版面是第一個變因。相同應用程式在一般手機、摺疊裝置、平板模式或不同字體大小下,按鈕位置與欄位排列都可能改變。深色模式、顯示縮放、橫向畫面與系統導覽方式也會影響錄影中看到的位置。依座標重播的巨集容易按錯;依控制項名稱、角色及鄰近文字辨識的流程則比較能適應版面移動。

語言與帳號狀態會進一步改變介面。示範時看到「下一步」,換成另一個系統語言後可能顯示不同文字;個人帳號與工作帳號也可能擁有不同功能。已登入、登出、首次啟動、同步失敗或資料為空,分別需要不同路徑。因此,技能應先判斷當前狀態,再決定是否能沿用示範中的下一步。

Android 的無障礙樹可提供控制項名稱、類型、可用動作及畫面層次。Android 無障礙服務指南說明了服務如何取得介面事件與節點資訊。對手機 Agent 而言,這類結構化資訊可協助理解「這是一個可編輯欄位」或「這是一個送出按鈕」,比單純依賴像素位置更有意義;實際可用資訊仍取決於應用程式如何實作介面及使用者授予的能力。

權限對話框尤其不能被當成一般步驟直接略過。相機、麥克風、聯絡人、通知或檔案存取可能只在首次使用時出現,也可能因系統設定而再次要求。技能應知道哪項權限與哪個動作相關,清楚呈現用途,並等待使用者選擇。若權限未取得,流程可以保留進度、提供替代路徑或引導使用者改用手動輸入,而不是在未知畫面上繼續點擊。

這也是示範技能與手機 Agent 訓練資料的差別。單一示範主要表達個人工作流程;訓練可靠的通用操作能力則需要更多裝置、應用程式狀態與失敗案例。相關技術背景可延伸閱讀PhoneBuddy-4B 與手機 AI Agent 訓練:為什麼 Mock-App RL 對 Android Agent 很重要

如何錄出乾淨、安全又足以學習的示範

要讓 Agent 看懂流程,是否應把真實工作畫面完整錄下來?較好的做法是先建立專用示範環境,用測試帳號、假資料與可撤銷操作呈現決策。錄得越多不一定學得越好;乾淨、可解釋且沒有敏感內容的範例,反而更容易提取可靠規則。

Android MediaProjection 文件要求每次螢幕擷取工作階段取得使用者同意,並說明顯示內容應受到妥善處理。這項設計提醒我們:允許錄製某一次畫面,不等於永久授權擷取所有內容。示範工具應讓使用者知道何時開始、目前錄製哪個範圍、何時停止,以及錄影會如何儲存與處理。

錄製前先關閉通知預覽,移除浮動視窗,登出與示範無關的帳號,並準備虛構的姓名、地址、訂單與文件。密碼、支付卡資料、銀行資訊、私人聊天、健康紀錄、政府證件、驗證碼、復原金鑰與工作機密都不應出現在工作流程錄影中。即使敏感內容只閃過一瞬間,也可能進入畫面、縮圖、暫存或後續分析資料。

一段高品質示範除了正常路徑,還應口頭指出重要分支。例如:「如果找不到指定聯絡人,就停下來詢問,不要選名字相近的人」;「若附件超過限制,先保留草稿」;「看到付款或正式送出按鈕時,交由我確認」。這些句子能把安全界線與例外處理納入技能,而不是只教 Agent 如何最快抵達終點。

錄製完成後,應從頭檢查影片、語音轉錄與擷取的畫面,確認沒有出現私人資料,也沒有把暫時狀況誤寫成固定規則。接著列出技能真正需要的權限,逐項對應到用途。Android 隱私與安全指引將權限和敏感資料存取視為有範圍的平台能力;示範技能也應延續同一原則,只取得完成任務所需的能力。

錄製清單可以保持簡潔:使用測試資料、從穩定起點開始、說明目標而非只念點擊、標出可變欄位、講清楚停止條件、示範一個例外,最後檢查錄影與轉錄內容。當技能還會呼叫外部工具或安裝額外能力時,可再閱讀AI Agent 技能安全:為什麼手機 Agent 不能只靠安裝前掃描,把執行期間的權限與行為也納入檢查。

技能上線前要測試變化、權限與復原能力

只成功重現示範一次,還不能證明技能可重用。真正的測試應故意改變資料、畫面與權限,觀察 Agent 是否仍能理解目標,並在超出能力時停在正確位置。測試的目的不是追求每次都走同一條路,而是確認不同路徑仍受到相同規則約束。

第一輪可使用乾跑模式,只產生計畫、辨識畫面與預告動作,不實際送出訊息、刪除檔案、建立訂單或修改帳號。使用者可以檢查 Agent 找到的控制項、準備填入的參數及預期結果。通過後再開放低影響動作,最後才測試需要確認的高影響步驟。

變化測試至少應涵蓋不同資料量、空白清單、名稱相近的聯絡人、網路中斷、應用程式重啟、按鈕移位、語言改變、權限未開啟及目標項目不存在。若技能處理檔案,還要測試同名檔案與儲存空間不足;若涉及訊息,則要測試收件人不明、附件缺失及內容超長。每個案例都應有清楚的成功條件與停止條件。

權限對應表要回答三個問題:哪一步需要哪項能力、權限未開啟時如何接續,以及權限是否能在任務結束後撤回。讀取資料與修改資料也應分開看待。能辨識聯絡人不代表可以直接傳送訊息;能建立草稿也不代表可以略過送出確認。這種細分讓技能更容易被理解、測試與管理。

正式使用後,技能需要版本編號、變更說明、執行紀錄與回復方式。應用程式更新造成流程失效時,可以停用新版本並回到已驗證版本;若執行在中途失敗,紀錄應顯示已完成哪些步驟、哪些資料已被修改,以及從哪裡安全接續。重要動作還應保留使用者確認時間與可見結果,方便釐清實際發生的操作。

完整治理不只發生在技能建立時。每次新增應用程式、擴大資料範圍或加入高影響動作,都應重新檢查權限與確認點。更深入的管理方法可參考AI Agent 身分、權限與稽核軌跡:手機 Agent 真正需要的安全棧,將執行者身分、授權來源與操作結果連成可追溯紀錄。

FoneClaw 如何看待可重用的手機工作流程

從 FoneClaw 的產品角度看,可重用手機流程的核心不是保存越多點擊,而是讓意圖、規劃、手機動作與使用者決定各自清楚。使用者設定的支援模型負責理解自然語言、推理與規劃;FoneClaw 負責執行支援的 Android 手機動作,顯示目前狀態與結果,依任務使用必要權限,並在具有實際後果的步驟要求確認。

目前的 FoneClaw 工作方式以設定模型與支援的 Android 動作流程為主。使用者可以用自然語言描述重複任務,模型將需求拆成步驟,FoneClaw 再依手機上的可用狀態推進操作。從螢幕錄影自動建立手機技能並非目前的建立方式;本文描述的是示範轉技能若要成為可靠產品能力,應具備的完整生命週期。

這個區分很重要。即使未直接匯入錄影,示範學習的設計原則仍能改善任何多步驟手機任務:先明確定義目標與參數,再分辨固定規則和臨時畫面,最後為權限、確認、例外與結果建立可見節點。模型可以依當前情境調整計畫,FoneClaw 則把支援的計畫落實為可觀察的手機動作。

假設使用者要把收到的文件重新命名、移到專案資料夾,再準備一則通知。設定的模型可理解命名規則與目的地,並判斷缺少哪些資訊;FoneClaw 執行支援的檔案與應用程式操作,逐步呈現結果。到了送出訊息或覆寫同名檔案等關鍵點,使用者可以檢查內容後確認。若目標資料夾不存在或權限尚未取得,流程會保留已完成成果,並提供建立資料夾、授予必要權限或手動接續的實際選項。

未來若示範錄製成為手機技能的輸入來源,我們認為可靠實作至少要保留四項能力:使用者可查看提取出的規則、可編輯參數與停止條件、可在乾跑中檢查計畫,以及可逐項控制技能需要的權限。錄影只能提供例子,不能取代這些治理介面。

手機 Agent 示範學習的理想結果,不是讓一次操作永久固定,而是把人的做法轉成可理解、可測試、可修正的工作流程。設定的模型負責掌握意圖與變化,FoneClaw 負責支援的 Android 操作、可見結果、權限感知流程、使用者確認與失敗後接續。當這些部分都能被檢查,示範才真正從一段影片成為值得重用的手機技能設計。

常見問題

可以,但可靠的示範學習不只分析影片。系統還需要結合操作事件、語音解說、畫面狀態與預期結果,從中提取目標、規則、可變參數、例外及確認點,再經過測試後封裝成可重用技能。
巨集通常依固定順序或座標重播動作;示範學習則嘗試理解動作背後的條件。例如按下第二個結果只是當次位置,而選擇預算內且今天可送達的商品才是可重用規則。
錄影應排除密碼、支付卡與銀行資料、私人對話、健康資訊、政府證件、驗證碼、復原金鑰及工作機密。較合適的方式是使用測試帳號與虛構資料,關閉通知預覽,並在錄製後檢查影片及轉錄內容。
FoneClaw 目前聚焦於可設定模型驅動的 Android 手機工作流程:設定的模型負責理解、推理與規劃,FoneClaw 執行支援的手機動作,提供可見結果、權限感知流程、使用者確認與實際接續方式。從螢幕錄影自動產生技能不是目前的建立方式。