AI 代理指南
📅 2026-09-24 ⏱️ 12 分鐘 Dean Dean

開源手機 Agent 框架推薦:Open-AutoGLM、Mobilerun 與 Minitap mobile-use 怎麼選

比較三個開源手機 Agent 框架:Open-AutoGLM、Mobilerun 與 Minitap mobile-use。依裝置前提、執行方式、模型配置、授權、追蹤檢查與維護成本選擇。

三個開源手機 Agent 框架在 Android 裝置、模型服務、執行器與測試紀錄之間的比較示意
📋 核心要點
  • 想研究視覺手機代理與 Android ADB 執行流程,可先看 Open-AutoGLM;它把模型服務、裝置連線與敏感操作確認分開處理。
  • 想要 Python 或 CLI 控制、可檢查軌跡與雲端裝置選項,Mobilerun Framework 比較合適;但 Framework 與 Mobilerun Cloud 是不同路線。
  • 想用自然語言描述結構化行動任務,並接受專案列出的裝置限制,可評估 Minitap mobile-use;iOS 支援要按 README 的模擬器與實機條件確認。
  • 開源框架不等於零成本或免維護;模型 API、自架推論、ADB/Portal/WebDriverAgent、雲端手機、追蹤工具與失敗復原都要一起算。

先按任務選開源手機 Agent 框架

三個開源手機 Agent 框架適合不同任務。Open-AutoGLM 適合想研究視覺手機代理、Android ADB 執行與模型服務分離的人;Mobilerun 適合需要 CLI 或 Python 控制、執行軌跡與雲端裝置選項的團隊;Minitap mobile-use 適合想用自然語言描述結構化手機任務,並按專案支援條件配置 Android 或指定 iOS 模擬器環境的人。

選項最適合先確認
Open-AutoGLM研究視覺手機代理、ADB/HDC 執行與敏感操作確認Android 開發者設定、ADB Keyboard、模型端點或自架推論
Mobilerun Framework用本機框架控制手機,保留軌跡、截圖與結構化結果Portal accessibility service、模型供應商、追蹤工具與裝置連線
Minitap mobile-use用自然語言處理結構化手機 UI 任務ADB、Docker/本機環境、LLM provider、Android 或 iOS 模擬器條件

這份清單不是實測成功率,也不是模型排名。選擇時要把四層分開:框架 runtime、模型推論、手機執行器,以及你願意維護的裝置與觀測成本。

比較設定、執行、模型與授權

三個專案都可以放進「手機智能體開發框架」的討論,但開源倉庫授權不等於整個工作流免費。模型 API 可能收費,自架推論要算硬體和維運,雲端裝置也可能有服務條件。框架能開放你檢查或修改控制流程,並不代表每個 App、每台手機或每個模型都能穩定完成任務。

比較項目Open-AutoGLMMobilerunMinitap mobile-use
主要執行路線Android 透過 ADB;也文件化 HDC/HarmonyOSFramework 在你的機器上跑 agent;Cloud 另有託管裝置路線Android 透過 ADB;Docker 快速開始偏 Android
模型配置第三方託管模型 API 或自架推論可選模型供應商;本機 runtime 不等於本機推論可配置 LLM providers,支援結構化抽取
檢查與追蹤看框架流程與裝置回饋README 記載 Arize Phoenix、Langfuse 與保存軌跡依任務輸出與框架回傳檢查,需注意 accessibility-tree 限制
授權Apache-2.0MITApache-2.0
iOS 條件另有 WebDriverAgent 設定另有 Portal setup flowREADME 明列 macOS 上 iOS 模擬器;實體 iOS 尚未支援

如果你還在選模型,可先讀AI 代理模型推薦:六款通用與 GUI 模型,手機 Agent 怎麼選,把模型能力和框架執行條件分開評估。

什麼情況適合 Open-AutoGLM

Open-AutoGLM 官方倉庫適合想研究手機 GUI agent 如何把螢幕理解、模型決策和裝置執行串起來的讀者。它的 Android 路線依賴 ADB,設定中包含開發者選項、USB debugging 和 ADB Keyboard;專案也文件化 HDC/HarmonyOS,表示它不是單純的消費者 App 包裝。

它的模型推論可以走第三方託管 API,也可以自架模型服務;因此「開源框架」不代表所有推論都免費或離線。Open-AutoGLM 還描述敏感操作確認,以及登入、驗證碼等場景的人類接手。這對研究安全邊界很有價值:你可以觀察 agent 在不確定或高影響步驟前如何停下,而不是只看它是否能一路點完。

若你的目標是理解 Android GUI 任務的工程拆分,Open-AutoGLM 很值得看;若你只是想馬上在日常手機上完成任務,它的裝置、模型與調試成本就要先算清楚。

什麼情況選 Mobilerun Framework 或 Cloud

Mobilerun 官方倉庫是原 DroidRun 路線的現行名稱。Mobilerun Framework 提供 CLI 與 Python 控制、accessibility trees、截圖、模型供應商選擇和結構化結果;Android 需要 ADB、開發者/USB debugging,以及 Portal accessibility service。它適合需要把手機任務放進程式化流程,並保留可檢查輸出的團隊。

Mobilerun Framework 和 Mobilerun Cloud 要分開看。Framework 在你的機器上跑 agent,不等於模型推論一定在本機,也不等於裝置維護消失;Cloud 則提供連接本地手機,以及託管虛擬或實體手機的 API 工作流。選 Cloud 的好處是降低裝置管理負擔,代價是要接受雲端裝置、帳號、資料流與服務條件。

Mobilerun README 也提到 Arize Phoenix、Langfuse 和保存軌跡,這對失敗分析很實用。你可以把每次錯誤拆成模型選錯、畫面解析錯、權限不足、App 狀態不同或執行器受限。

什麼情況適合 Minitap mobile-use

Minitap mobile-use 官方倉庫主打自然語言行動 UI automation,並提供可配置 LLM providers 與結構化抽取。它適合把任務描述成清楚的 UI 步驟,然後檢查輸出是否符合預期的工程場景,例如表單、設定頁或重複性 App 流程。

它的 Android 物理裝置與模擬器走 ADB;README 的 Docker 快速開始是 Android-only。iOS 要按專案說明逐項看:手動裝置章節列出 macOS 上的 iOS simulators,並明確表示 physical iOS devices 尚未支援。這一點要優先於較寬泛的行銷字句,避免把 iOS 模擬器支援誤讀成實體 iPhone 對等支援。

mobile-use 也提醒,缺少 accessibility-tree 資訊的遊戲類場景會受限制。換句話說,它較適合結構化 UI 任務;如果目標是大量視覺不透明、即時變化或遊戲畫面,就要另外設計觀測和回退策略。

先用一個可復原任務檢查失敗原因

不要用真實帳號付款、外發訊息或刪除資料作為第一輪評估。建議每個框架都跑同一個可復原任務,例如:開啟一個測試 App、讀取目前畫面、建立一則可刪除的測試備忘、回到列表確認它存在,最後刪除。這不是聲稱我們已跑出成績,而是給你一個可比較的評估方法。

  1. 固定裝置、系統版本、App 版本、登入狀態與網路。
  2. 記錄模型設定、是否用 hosted API、自架推論或雲端裝置。
  3. 保存螢幕截圖、accessibility tree、工具呼叫、模型輸出與最終 App 狀態。
  4. 遇到失敗時標記原因:看不懂畫面、選錯工具、權限不足、按到錯誤控制、模型幻覺或執行器限制。
  5. 只改一個變數重跑,例如換模型、換裝置、調提示或改 execution backend。

若要把這套方法擴展成完整基準,可以參考Android 手機 Agent 基準測試指南:2026 AI Agent 評估、GUI 測試與可靠性指標。重點不是做漂亮分數,而是讓失敗可定位、可重現、可修正。

不想部署框架時,選現成 Android 路線

如果你的目標不是研究框架,而是直接在 Android 手機上完成受支援的日常任務,FoneClaw 是另一條路。FoneClaw 是可直接使用的 Android App,不是本文三個開源開發框架之一;我們提供的是可使用的 Android 產品路線:可配置模型、受治理的支援工具、權限與核准流程,以及更清楚的錯誤提示和模型選擇。

這條路適合不想維護 ADB、Portal、WebDriverAgent、模型服務和雲端裝置的人。FoneClaw 可處理支援範圍內的手機任務,例如開啟 App、讀取目前畫面脈絡、查詢 SMS、建立待辦,並把高影響動作放在可見核准流程中;但這不代表所有 Android App 都能被任意控制,也不代表所有推論都在裝置本機完成。若想了解產品能力,可從FoneClaw 功能頁開始;若你需要理解意圖、確認、執行和復原的完整邏輯,可延伸閱讀AI 代理控制 Android 手機指南:從意圖到確認、執行、驗證與復原