Android AI 圖片連續脈絡:同一張圖片重新分析與動作驗證指南
Android AI 要連續分析同一張照片或截圖,必須保留正確圖片參照、來源、尺寸與存取期限,並在問題改變時重新檢視原始像素。本文說明擷取、續問、驗證、失效復原與 FoneClaw 圖片任務流程。
- Android AI 圖片連續脈絡不是只記住先前答案,而是讓同一張原始圖片在後續問題中保持可辨識、可存取,並與目前任務正確綁定。
- 可靠的圖片參照應保存來源、擷取時間、尺寸、格式、存取期限與分析紀錄;參照失效時應重新取得授權或重選圖片。
- 問題改變時,AI 應判斷舊有文字結論是否足夠,必要時重新開啟原始像素、使用適合的裁切與解析度,再比較新舊證據。
- FoneClaw 可將圖片或截圖的已確認資訊帶入支援的 Android 動作,透過可見進度、權限、確認點、結果驗證與復原完成低風險圖片任務。
Android AI 圖片連續脈絡是什麼
Android AI 圖片連續脈絡,指的是使用者在多輪任務中持續針對同一張照片或截圖提問,而助理始終知道目前作用中的圖片是哪一張、先前分析過哪些內容,以及新問題是否需要重新檢視原始像素。它處理的不是單次看圖回答,而是一段可能延伸到整理、確認與手機操作的完整工作。
以一張購物收據為例。第一個問題可能是「這是哪一家店?」第二個問題變成「含稅總額是多少?」接著又問「幫我把保固到期日前一週設成提醒」。三個問題都指向同一張收據,但需要的視覺證據不同:店名通常在頁首,總額在底部,保固資訊可能出現在商品列、日期或附註中。第一輪產生的文字摘要未必保存了後兩輪所需的細節。
- 第一輪:使用者選擇收據照片,AI 辨識商店名稱與購買日期。
- 第二輪:使用者追問含稅總額,助理重新查看金額區域,而不是只從舊摘要推測。
- 第三輪:使用者要求建立提醒,助理先確認日期、商品與提醒時間,再執行支援的行事曆或提醒動作。
- 完成後:助理檢查新建立的紀錄,確認內容與圖片中的已核對資訊一致。
這段流程包含三種不同資料。第一種是原始像素,也就是照片或截圖本身;第二種是圖片參照,用來辨識並重新開啟正確檔案;第三種是先前分析結果,例如「購買日期為 8 月 20 日」。對話記憶可以保存第三種資料,但只有原始圖片與有效參照,才能支援新的視覺問題。
同一張圖片可以回答許多問題,並不代表助理在第一輪就已完整理解每個像素。模型可能為了速度、輸入長度或目前問題,只關注特定區域並產生簡化摘要。當新問題要求小字、邊角、數字、物件狀況或不同區域時,可靠流程會回到圖片本身取得新證據。
連續脈絡還需要明確的作用中圖片。如果使用者在對話中加入第二張收據、另一張錯誤畫面或重新截圖,助理應顯示目前分析的是哪個附件,並在需要比較時分別標記。這能避免把第一張圖片的日期套到第二張,也能讓後續動作追溯到正確來源。
選擇、拍攝或截取正確圖片
連續圖片任務的第一個決定,是從哪裡取得圖片。Android 常見路徑包括相片選擇器、相機拍攝與螢幕截圖。三者都能提供視覺資料,但來源、解析度、授權方式和適合的任務不同。
| 取得方式 | 適合情境 | 開始分析前要檢查 |
|---|---|---|
| 相片選擇器 | 既有收據、商品照片、文件、維修照片或活動海報 | 是否選對檔案、方向是否正確、裁切是否保留關鍵區域、存取期限是否足夠 |
| 相機拍攝 | 現場文件、設備狀況、包裝標籤或實體物件 | 取得的是縮圖或完整儲存圖片、文字是否清晰、反光與模糊是否影響細節 |
| 螢幕截圖 | 錯誤訊息、訂單畫面、設定頁、聊天內容或 App 狀態 | 使用者是否已同意擷取、截圖包含哪個 App、狀態列與敏感資訊是否需要遮蔽 |
Android 相片選擇器官方指南說明,使用者可以只授權所選照片或影片,而不是開放整個媒體庫。選擇完成後,App 會取得對應媒體的 URI;若任務需要跨越較長時間或稍後重新開啟圖片,還要確認該存取權是否需要延續。
相片選擇器特別適合明確的單檔任務。使用者可以看到自己選了哪張照片,助理也能把該項目記錄為目前圖片。若一次選取多張,應先為每張圖片顯示縮圖、順序或簡短標記,再開始比較,避免後續提到「第二張」時產生歧義。
Android 相機拍攝 Intent 指南指出,App 可以委派相機應用程式完成基本拍攝,再取得圖片資料或已儲存結果。這裡要特別分辨縮圖和完整圖片:縮圖適合快速預覽,但收據小字、序號、遠處標誌或物件裂痕通常需要完整解析度。
拍攝時也應保存基本來源資訊,例如由相機取得、拍攝時間、圖片方向與原始尺寸。若使用者稍後旋轉、裁切或標註圖片,助理應把修改後的檔案視為新的版本,同時保留它與原始照片的關係。這樣後續發現裁切遺漏時,才能返回原圖重新分析。
螢幕擷取適合處理當前 App 狀態。依Android MediaProjection 螢幕擷取說明,每次擷取工作階段都需要使用者同意,使用的授權權杖具有單次工作階段範圍;依流程也可能選擇完整顯示畫面或特定 App 視窗。這種明確選擇有助於確認圖片來源及擷取範圍。
若你的任務是從目前畫面開始,再交給浮動助理續問,可以參考Android 懸浮 AI 助手與目前畫面:提問、核准、執行與復原指南。開始分析前,先檢查截圖是否包含完整錯誤訊息、必要按鈕、App 名稱與相關狀態;同時裁掉通知、聯絡人或帳號等與任務無關的內容。
讓同一張圖片在多輪對話中保持穩定
同一張圖片連續提問能否可靠,關鍵在於圖片參照是否穩定。穩定不等於永久保存,而是任務進行期間,助理可以確認圖片身分、重新取得像素,並知道參照何時需要更新。即使對話還保留先前答案,失效的圖片參照也無法支援新的細節分析。
一個實用的圖片參照至少應保存以下資訊:
- 圖片身分:讓系統區分本次附件、先前附件與後續新增圖片。
- 來源:記錄圖片來自相片選擇器、相機、螢幕擷取或任務中的其他支援入口。
- 取得時間:協助判斷畫面是否仍反映目前 App 或服務狀態。
- 尺寸與方向:保留寬度、高度、旋轉方向及必要的裁切資訊。
- 圖片格式:記錄 MIME type,讓後續流程用合適方式解碼。
- 可用參照:保存任務所需的本機或受控遠端參照,供後續重新分析。
- 存取期限:知道 URI、工作階段或附件授權能使用多久,以及何時需要續期。
- 任務綁定:把圖片與目前對話、子任務和已核准動作連在一起。
- 分析紀錄:保存已確認結論、使用的圖片版本,以及仍待核對的欄位。
尺寸不是單純的檔案屬性。若使用者在圖片上指出「右下角的錯誤碼」,助理需要以正確寬高解讀位置;圖片經過縮放、旋轉或裁切後,舊座標可能已不再適用。保存原始尺寸與轉換關係,才能讓重新裁切和局部分析指向正確區域。
圖片來源也會影響有效時間。相片選擇器回傳的 URI 可能只提供暫時存取;長時間工作若需要持續使用,App 應依 Android 支援方式管理相應授權。螢幕擷取的同意則屬於特定工作階段,新的擷取需求要重新取得使用者選擇。參照到期時,清楚請使用者重新選擇或擷取,比自動換成名稱相近的另一張圖片可靠。
我們在打造 FoneClaw 圖片任務時,會同時保留圖片尺寸、附件身分與可用參照,讓目前任務能重新開啟正確圖片。若存取期限改變,流程會更新附件或請使用者重新提供來源,並保持先前已確認的文字結果。這讓新參照能延續同一任務,又不會把另一張圖片誤接進來。
多張圖片的任務需要額外標記。例如比較產品損壞前後照片,可以將圖片分成「送修前」與「送修後」,並讓每項結論指出來源。若使用者替換其中一張,助理應更新對應分析,而不是重新解讀整組圖片後默默改變所有結論。
使用者也應能看見目前圖片。縮圖、來源名稱、尺寸或拍攝時間可以提供足夠辨識資訊;涉及敏感內容時,介面可顯示經遮蔽的預覽。重點是讓人確認「現在問的是這一張」,而不是要求理解儲存位置或內部識別碼。
問題改變時重新分析原始圖片
Android AI 圖片重新分析的起點,是先判斷新問題需要什麼證據。若上一輪已明確辨識並讓使用者確認某個欄位,新問題只是引用該欄位,既有結果可能足夠;若新問題要求不同區域、更小文字、精確數字或物件狀況,就應重新查看原始圖片。
可靠的重新分析可以依以下循環進行:
- 把新問題改寫成明確的視覺目標,例如「找出含稅總額」或「讀取紅色錯誤框中的完整文字」。
- 檢查既有分析紀錄是否包含可驗證答案,以及該答案來自哪個圖片版本。
- 確認原始圖片參照仍可使用,尺寸與方向資訊一致。
- 用適合的解析度或裁切重新準備圖片,聚焦與問題相關的區域。
- 產生新的可見結論,並指出讀取的欄位或區域。
- 把新結果與先前結論比較;出現衝突時,先請使用者核對,再進入後續動作。
收據總額是數字精度問題。第一輪可能只回答商店名稱,圖片準備時也可能優先保留頁首。當使用者追問總額,助理應重新打開底部區域,分辨小計、稅額、折扣、總額與刷卡金額。若兩個欄位都像最終金額,先顯示候選值與標籤,再讓使用者選定。
錯誤截圖則是文字完整性問題。第一輪可能概括成「網路連線失敗」,但後續排錯需要精確錯誤碼、伺服器名稱或按鈕狀態。重新分析時應聚焦訊息框,同時保留 App 名稱與周邊畫面,避免把系統通知誤認成目標 App 的錯誤。
物件照片屬於視覺狀況問題。使用者先問「這是什麼零件」,接著問「邊緣有沒有裂痕」。辨識種類和檢查損傷需要不同解析度與觀察區域。第二個問題可能需要原始高解析度圖片,甚至請使用者補拍更近、光線更均勻的照片。
圖片輸入也受模型能力、圖片 token 預算與壓縮方式影響。較強壓縮可以降低傳輸與處理負擔,但小字、細線、紋理和微小瑕疵可能因此模糊。重新分析時應依問題調整圖片準備方式;重要細節可使用局部高解析度裁切,而不是反覆把整張圖片壓成相同大小。
當畫面同時包含可讀文字與可操作介面,像素未必是唯一證據。結構化 UI 資訊可以幫助確認按鈕文字、欄位和可點擊節點,截圖則保留圖示、圖片與實際視覺狀態。需要選擇兩種方式時,可閱讀Android AI Agent 螢幕理解:UI 樹、截圖與混合視覺定位怎麼選。
新結果若與舊結果衝突,後續動作應先暫停。例如第一輪讀到日期為 8 月 12 日,重新分析後變成 8 月 17 日,建立行事曆前應顯示兩個值及對應圖片區域,請使用者確認。讓人看到證據與差異,比提供模型內部推理過程更能支持決定。
驗證後續動作並復原失效脈絡
圖片分析只有在結果被正確帶入後續工作時才真正有用。從收據建立記帳備忘、從活動海報建立行事曆、從錯誤截圖整理維修紀錄,都會把視覺資訊轉成具體欄位。進入動作前,應先顯示即將使用的值,讓使用者檢查日期、金額、聯絡人、地址與文字。
確認後,Agent 可以呼叫支援的 Android 工具完成動作。完成畫面仍不是唯一判斷依據;流程應重新查詢或開啟結果,例如查看行事曆事件、備忘錄內容、提醒時間或訊息草稿,確認資料已寫入正確位置。這項完成後檢查能發現權限中斷、App 狀態改變與部分欄位遺失。
| 失敗訊號 | 可能原因 | 復原方式 |
|---|---|---|
| 後續問題突然找不到圖片 | URI 或附件參照已到期 | 請使用者重新選擇原圖或更新授權,核對縮圖後延續原任務 |
| 回答內容像是另一張圖片 | 新增附件取代了作用中圖片,或任務綁定錯誤 | 顯示所有候選圖片,重新指定目前圖片並撤回未確認結論 |
| 小字或數字前後不一致 | 壓縮、裁切、解析度或辨識條件不足 | 使用原始尺寸或局部高解析度重新分析,將候選值交由使用者核對 |
| 畫面內容已經變動 | 舊截圖反映的是先前 App 狀態 | 保留舊圖作為歷史證據,經使用者同意後擷取目前畫面 |
| 動作顯示完成但找不到結果 | App 未登入、權限不足、寫入失敗或停在中間頁面 | 查詢實際紀錄,恢復權限或返回正確入口後重新執行 |
| 重要欄位可信度不足 | 圖片模糊、反光、遮擋或文字太小 | 請使用者補拍、選取原檔或手動確認欄位,再決定是否提交 |
圖片附件失效時,應更新同一項任務的參照,而不是從媒體庫自動挑選看似相同的檔案。重新選擇後,可以比對縮圖、尺寸、取得時間與使用者描述,再把先前已核對的分析紀錄連回新參照。這能兼顧任務延續與圖片身分。
畫面過期也很常見。使用者可能先截下訂單頁,幾分鐘後庫存、價格或付款狀態已改變。舊截圖仍適合說明當時資訊,但正式下單前需要回到目前 App 狀態重新核對。時間敏感欄位應以最新服務畫面或紀錄為準。
辨識可信度可以幫助安排流程,卻不應取代使用者確認。涉及付款、對外傳送、刪除、醫療資訊或重要日期時,即使模型給出很高的可信程度,也應顯示原始欄位和即將提交的內容。使用者修正後,動作與驗證都應採用修正值。
用最小存取範圍管理圖片隱私
圖片連續脈絡需要在任務期間保留存取能力,但保留範圍應與任務相符。對一張收據進行數分鐘分析,和建立長期維修紀錄需要的保存時間不同。使用者應知道圖片來自哪裡、會使用多久、是否送交所選模型,以及何時可以移除。
Android 最小化權限要求指南建議優先採用範圍較窄的存取方式。相片選擇器讓使用者只選擇任務所需媒體,App 取得的是所選項目的讀取能力。這比為單張圖片任務要求整個媒體庫權限更符合使用者期待。
開始前可以完成以下檢查:
- 只選擇與目前問題直接相關的照片或截圖。
- 確認圖片方向、裁切與解析度足以回答問題。
- 查看是否包含身分證號、地址、帳號、通知或其他無關敏感資訊。
- 需要時先遮蔽或裁掉不會參與分析的區域。
- 確認目前設定的模型與圖片任務相符。
任務進行期間,介面應顯示作用中的圖片與分析用途。若新問題需要更大範圍、更高解析度或新的目前畫面,先說明原因,再讓使用者選擇補充圖片或授權擷取。MediaProjection 的同意對應特定擷取工作階段,新的擷取需求應建立新的使用者選擇。
任務完成後,使用者可以依用途決定保留分析結果、保留圖片或一併移除。備忘錄可能只需要商店、日期和金額,不必長期保留完整收據;維修案件則可能需要保存原圖作為證據。把圖片生命週期與文字結果分開管理,可以在保留有用資料的同時縮小圖片存取範圍。
暫時 URI 存取與延續存取也應分開理解。短任務可使用暫時授權;需要稍後繼續的工作,則依 Android 提供的方式延續必要存取,或在恢復任務時請使用者重選圖片。採用哪種方式,取決於任務長度與使用者選擇,而不是預設永久保存。
更廣泛的主動情境功能還需要額外規則,例如什麼事件可以觸發分析、是否顯示通知、何時需要重新確認,以及如何停止。若你正規劃這類使用方式,可以閱讀手機主動式 AI 助理指南:情境、觸發、隱私控制與 FoneClaw 路線。
一個實用原則是「開始前選得少、進行中看得見、完成後留得剛好」。這比要求一次性廣泛授權更容易理解,也能讓使用者在任務改變時重新決定圖片範圍。
用 FoneClaw 完成可靠的圖片到手機動作流程
我們在 FoneClaw 中把圖片視為可持續參照的任務輸入,而不是只能看一次的視覺提示。使用者可以選擇照片、拍攝圖片、加入截圖,或在支援情境下附上目前畫面;FoneClaw 會保存附件身分、尺寸與可用參照,讓後續問題仍能指向同一項內容。
模型設定在 FoneClaw Agent 內,負責理解問題與分析圖片;FoneClaw 則管理圖片準備、支援工具、Android 權限、可見進度、確認點與結果驗證。圖片需要重新分析時,流程會依新問題重新準備多模態輸入,調整必要的裁切、壓縮與圖片 token 使用,並在附件存取需要更新時完成續期或引導使用者重新提供來源。
可以用一張收據完成以下低風險測試:
- 附加圖片:從相片選擇器選擇一張不含敏感付款資料的收據,確認預覽、方向與尺寸。
- 第一次提問:詢問商店名稱、購買日期與主要品項,檢查回答是否來自正確圖片。
- 改變問題:再問「含稅總額是多少」,讓 FoneClaw 重新分析金額區域,而不是只沿用第一輪摘要。
- 核對差異:若圖片同時出現小計、稅額與刷卡金額,先顯示各欄位並由使用者選定最終值。
- 預覽動作:請 FoneClaw 準備一則備忘錄,內容包含商店、日期、品項與已確認總額。
- 確認執行:查看標題與正文,確認後再建立備忘錄。
- 驗證結果:開啟或查詢新備忘錄,核對文字、金額與日期是否正確。
錯誤截圖也可以使用同一流程。先請 FoneClaw 概括目前問題,再追問完整錯誤碼、App 名稱與發生時間。若舊摘要缺少代碼,FoneClaw 會重新查看原始截圖;圖片太模糊時,流程可以請使用者補充新截圖,並清楚區分舊畫面與新畫面。
圖片參照若在長任務中失效,FoneClaw 會更新附件或要求重新選擇,並讓使用者確認新取得的仍是原圖。先前已驗證的文字結果可以保留,但任何需要像素證據的新問題都會以恢復後的圖片為準。這避免了附件失效後沿用過期視覺假設。
支援的下游動作可依圖片內容延伸到備忘錄、行事曆、提醒、通訊、畫面與 App、裝置狀態或工作流程。具體可用範圍會受到 Android 版本、權限、App 狀態、地區服務、所選模型能力及任務本身影響。FoneClaw 會透過明確工具承接動作,並在重要步驟提供預覽和確認。
我們會持續把圖片身分、重新分析、權限復原與完成後驗證整理成同一條可見流程。目標是讓使用者知道現在看的圖片、引用的證據、即將執行的動作及最後結果,而不是在多輪對話中猜測 Agent 是否仍記得原始內容。
你可以先到FoneClaw 功能頁查看圖片、目前畫面與 Android 任務能力,再從FoneClaw 下載頁選擇適合的安裝入口。第一次使用建議從收據備忘錄、活動海報提醒或錯誤截圖整理開始,完成一次附加、續問、確認與驗證的完整循環。