Androidスマホエージェント ベンチマーク:2026年の評価指標と再現可能なテスト設計
Androidスマホエージェントをどう評価するかを、B-MoCA、MobileWorld、KnowU-Bench、PhoneHarnessの研究動向とFoneClawの実装経験から、成功率、承認、安全性、復旧、監査まで実用的に整理します。
- Androidスマホエージェント ベンチマークでは、タップがもっともらしいかではなく、意図した結果が検証でき、余計な副作用を残さず、復旧できるかを測ります。
- B-MoCA、MobileWorld、KnowU-Bench、PhoneHarnessは、それぞれ設定差、長い複数アプリ作業、個人化と同意、GUIとツール実行の検証という別の課題を見せています。
- タスク成功率だけでは不十分で、承認のタイミング、権限の最小化、停止、拒否後の抑制、介入回数、遅延、コスト、監査品質を合わせて評価します。
- FoneClawでは、現在画面添付、フローティング入口、タスク継続、承認、停止、権限復旧を、現在のAndroid phone agent評価項目として設計に取り込んでいます。
Androidスマホエージェントの成功をどう測るか
Androidスマホエージェント ベンチマークで最初に決めるべきことは、成功の定義です。私たちがFoneClawを作ってきて学んだのは、画面上のタップが自然に見えることと、ユーザーの意図が正しく完了したことは別だという点です。スマホAgentは、目的を理解し、必要なアプリや設定へ進み、正しい副作用を起こし、不要な副作用を避け、ユーザーが結果を確認できるところまで含めて評価する必要があります。
たとえば「会議中だけ通知を抑えて」という依頼では、Do Not Disturbの画面を開けたかだけでは不十分です。どの時間だけ有効にしたか、アラームや重要連絡をどう扱ったか、ユーザーが承認したか、完了後に状態が確認できたか、途中で権限が足りなかった場合に復旧できたかまで見ます。SMS下書きなら、本文の自然さに加えて、宛先、送信条件、承認前の停止、送信後の検証が必要です。
そのため、私たちが考える評価対象は「検証された結果」と「制御された過程」の両方です。タスク成功率は重要ですが、単独では足りません。失敗したときに原因が分かるか、再試行してよいか、ユーザーが止められるか、監査ログに残るかも、スマホエージェント 信頼性指標に入ります。継続的なテスト基盤や改善ループを深く知りたい場合は、自己改善するPhone Agentに必要なスキル版管理・テスト・ロールバックが、ハーネス運用の考え方を補います。
2026年のモバイルエージェント評価ベンチマーク
2026年のAIエージェント ベンチマーク 2026は、一つの総合順位で読むより、各ベンチマークがどの弱点を浮かび上がらせるかで見るほうが実用的です。Androidやモバイルの環境は、端末設定、言語、アプリの状態、画面レイアウト、ログイン、権限、長い手順、ユーザーとのやり取りによって結果が変わります。異なる研究の点数をそのまま一列に並べても、同じ能力を測っているとは限りません。
| ベンチマーク | 確認できる範囲 | 評価で見える課題 |
|---|---|---|
| B-MoCA | PMLRのB-MoCA論文は、131件の一般的なAndroid日常タスクを定義し、UIレイアウトや言語設定などの端末構成をランダム化します。 | 同じ目的でも端末構成が変わるとエージェントがどこまで一般化できるかを見ます。単純なタスクと複雑なタスクの差も重要です。 |
| MobileWorld | ACL 2026のMobileWorld論文は、20アプリにまたがる201タスクを扱い、平均27.8手順、62.2%が複数アプリと報告しています。 | 長い手順、複数アプリ、ユーザーとのやり取り、MCPで拡張されたタスクを含む評価です。論文内では最良のagentic frameworkが51.7%、最良のend-to-end modelが20.9%と報告されています。 |
| KnowU-Bench | KnowU-Benchのpreprintは、42件の一般GUIタスク、86件の個人化タスク、64件のプロアクティブタスクを扱います。 | ユーザープロファイルを隠し、行動ログを見せる設定で、聞き返し、同意、拒否後の抑制を評価します。個人化と介入の調整を見るのに向いています。 |
| PhoneHarness | PhoneHarnessのpreprintは、GUI、CLI、ホスト側ツールアクションを組み合わせ、観測できる副作用と監査可能な実行トレースを評価します。 | エージェントがどの実行面を使うか、結果が本当に起きたか、トレースで追えるかを評価しやすい設計です。 |
この四つは、直接つなげて一つの順位表にするための材料ではありません。B-MoCAは構成差、MobileWorldは長い複数アプリ作業、KnowU-Benchは個人化と同意、PhoneHarnessは実行面と副作用検証に焦点があります。能力発見や信頼できるリソース選択まで評価したい場合は、Agentic Resource Discoveryとは:ai-catalog.json、検証、スマホ操作の認可を分けて考えるが、ツール発見と認可を分ける視点を補います。
実機テストに必要な六つの評価軸
実用的なAndroid GUIエージェント テストを作るなら、研究ベンチマークの教訓を六つの軸に落とし込みます。第一は構成差です。端末メーカー、画面サイズ、表示言語、フォントサイズ、通知状態、標準アプリを変えます。第二は手順の長さです。一画面で終わる操作と、複数アプリをまたぐ長い作業を分けます。手順が多いほど常に難しいとは限らず、明確な構造化ツールがあれば長い作業でも安定することがあります。
第三は意図の明確さです。「音量を上げて」のような明確な依頼と、「会議に集中できるようにして」のような曖昧な依頼を分けます。第四は実行面です。GUIを読むのか、構造化ツールを呼ぶのか、ホスト側の機能を使うのかを明確にします。第五は副作用の重さです。読み取り、可逆的な設定、外部に届くメッセージ、削除や共有のような影響の大きい操作を分けます。
第六は割り込みと復旧です。ユーザーが途中で止める、権限を取り消す、画面が変わる、ネットワークが落ちる、別の通知が割り込む。FoneClawのようなAndroid AIエージェントでは、これらを例外ではなく通常のテスト軸として扱います。各軸を独立して変えると、失敗の原因が見えます。すべてを一度に変えると、モデルの理解、UIの変化、権限不足、復旧失敗が混ざってしまいます。
タスク成功率を超える信頼性指標
スマホエージェント 信頼性指標では、タスク成功率の分母を固定することから始めます。何回まで再試行を許すか、ユーザー介入を成功に含めるか、途中で下書きに止めることを部分成功にするかを決めます。LLMによる判定だけでなく、端末状態、画面結果、ファイル、設定、メッセージ、通知のような観測可能な証拠で検証します。
私たちが使うなら、最低でも六つの指標を置きます。完全成功率、部分チェックポイント到達率、誤った副作用率、復旧成功率、人間の介入回数、実行トレースの品質です。さらに、遅延、トークンや推論コスト、バッテリー影響、失敗理由の分類も見ます。PhoneHarnessが観測可能な副作用と監査可能な実行トレースを重視している点は、プロダクトQAでも参考になります。
重要なのは、失敗を一つの数字に押し込まないことです。宛先を間違えたSMS、権限不足で止まったDND変更、画面を読めずにユーザーへ聞き返したケースは、同じ失敗ではありません。アイデンティティ、権限、監査ログを指標化する考え方は、AIエージェントのアイデンティティ、権限、監査ログ:ツール単位で安全に実行する設計で詳しく扱っています。
承認、権限、抑制、停止をテストする
安全性は、拒否率だけでは測れません。スマホAgentでは、必要な最小権限で進めるか、影響のある操作の前に適切な承認を求めるか、曖昧な依頼で聞き返すか、ユーザーが拒否したあとに同じ操作を押し通さないか、停止指示を実行タスクへ反映できるかをテストします。KnowU-Benchが、明確化、プロアクティブな同意、拒否後の抑制を扱う点は、スマホAgentの安全評価に近い発想です。
承認テストでは、タイミングが重要です。完了後に「やっておきました」と言うのではなく、送信、共有、削除、設定変更の前に、対象、理由、影響を示します。承認UIそのものの設計は、AIエージェント承認UI設計:提案、信頼度、理由、タスク状態をスマホでどう見せるかで詳しく説明しています。テストでは、承認がタスク、操作、端末状態と結び付いているかを確認します。
停止と監査も同じくらい大切です。ユーザーが「やめて」と言ったとき、会話だけが止まるのではなく、実行待ちのタスクも止まる必要があります。権限が足りない場合は、勝手に迂回せず、必要な許可と戻り先を示します。安全性の合格は、何もしないことではなく、必要なことを必要な範囲で行い、危険な場面で正しく止まることです。
現在のFoneClawタスクをどう評価するか
ここでは評価方法を示し、FoneClawの公開ベンチマーク結果は報告しません。私たちが現在のFoneClawを評価するなら、現時点までの最新情報にもとづく基準を使います。現在のFoneClawは、フローティングアシスタント、現在画面添付、タスク継続、承認、停止、権限復旧、DND、音量、会議モード、スクリーンショットの安定性、クイックアクションを提供しています。リリースはFoneClawのダウンロードページで案内しています。
テスト対象は、読み取り、可逆的な端末制御、外部効果、権限復旧、画面変化、停止に分けます。読み取りでは、現在画面の鮮度、アプリ名、表示内容、スクリーンショットの取得結果を検証します。可逆的な制御では、DND、音量、Bluetooth、会議モード、ショートカットを対象に、実行前後の状態が確認できるかを見ます。外部効果では、メッセージ下書き、カレンダー、メモ、タスク、ワークフローを、承認前に止まるかまで含めて評価します。
| テストクラス | 例 | 見る指標 |
|---|---|---|
| 読み取り | 現在画面、通知、スクリーンショット | 観測の鮮度、誤読、ユーザーへの表示 |
| 可逆的制御 | DND、音量、Bluetooth | 状態確認、元に戻せるか、承認の必要性 |
| 外部効果 | メッセージ、予定、共有 | 対象、内容、承認、二重実行の防止 |
| 権限復旧 | マイク、通知、アクセシビリティ、特別なアクセス | 不足理由、復旧導線、再開地点 |
| 割り込み | 画面変更、停止指示、別通知 | タスク状態、停止、復旧、監査ログ |
FoneClawは、設定されたモデル、Android権限、管理されたツールで動きます。公開している機能では、100+ built-in toolsを通じて、さまざまなAndroidワークフローを扱えます。詳細はFoneClawの機能紹介で確認できます。権限や特別なアクセスのユーザー向け監査を試すなら、AIによるAndroidスマホ健康チェック:FoneClawで権限、特別なアクセス、隠しアプリを監査する方法が、具体的なテスト題材になります。
再現可能なスマホAgentテスト手順
再現可能なモバイルエージェント評価を作るには、手順を固定します。第一に、端末、OS、ロケール、表示言語、フォント、アプリ版本、ログイン状態、権限状態を記録します。第二に、初期状態と期待結果を定義します。第三に、六つの評価軸のうち一つだけを変えます。第四に、承認、ユーザー介入、ツール呼び出し、画面変化を記録します。
第五に、結果を観測可能な副作用で検証します。設定が変わったか、ファイルができたか、下書きが見えるか、送信が起きたか、余計な変更がないかを確認します。第六に、失敗を分類します。理解失敗、UI失敗、権限不足、承認不足、外部サービス失敗、復旧失敗を分けます。第七に、制限を公開します。端末やアプリが違えば結果も変わるため、比較できる範囲を明示します。
最初のテストは、取り返しのつきやすいものにします。現在画面の要約、DNDの短時間変更、音量調整、スクリーンショット、メモ作成、権限監査などです。スコアカードには、完全成功、部分成功、誤副作用、承認品質、復旧、介入回数、遅延、コスト、トレース品質を入れます。評価ハーネスを継続改善する場合は、自己改善するPhone Agentに必要なスキル版管理・テスト・ロールバックで、テスト、ロールバック、改善ループまで確認できます。