AIエージェントガイド
📅 2026-08-09 ⏱️ 12分 Dean Dean

Androidスマホエージェント ベンチマーク:2026年の評価指標と再現可能なテスト設計

Androidスマホエージェントをどう評価するかを、B-MoCA、MobileWorld、KnowU-Bench、PhoneHarnessの研究動向とFoneClawの実装経験から、成功率、承認、安全性、復旧、監査まで実用的に整理します。

Androidスマホエージェントのベンチマークでタスク成功、承認、権限、復旧、監査ログを評価するテスト画面
📋 要点
  • Androidスマホエージェント ベンチマークでは、タップがもっともらしいかではなく、意図した結果が検証でき、余計な副作用を残さず、復旧できるかを測ります。
  • B-MoCA、MobileWorld、KnowU-Bench、PhoneHarnessは、それぞれ設定差、長い複数アプリ作業、個人化と同意、GUIとツール実行の検証という別の課題を見せています。
  • タスク成功率だけでは不十分で、承認のタイミング、権限の最小化、停止、拒否後の抑制、介入回数、遅延、コスト、監査品質を合わせて評価します。
  • FoneClawでは、現在画面添付、フローティング入口、タスク継続、承認、停止、権限復旧を、現在のAndroid phone agent評価項目として設計に取り込んでいます。

Androidスマホエージェントの成功をどう測るか

Androidスマホエージェント ベンチマークで最初に決めるべきことは、成功の定義です。私たちがFoneClawを作ってきて学んだのは、画面上のタップが自然に見えることと、ユーザーの意図が正しく完了したことは別だという点です。スマホAgentは、目的を理解し、必要なアプリや設定へ進み、正しい副作用を起こし、不要な副作用を避け、ユーザーが結果を確認できるところまで含めて評価する必要があります。

たとえば「会議中だけ通知を抑えて」という依頼では、Do Not Disturbの画面を開けたかだけでは不十分です。どの時間だけ有効にしたか、アラームや重要連絡をどう扱ったか、ユーザーが承認したか、完了後に状態が確認できたか、途中で権限が足りなかった場合に復旧できたかまで見ます。SMS下書きなら、本文の自然さに加えて、宛先、送信条件、承認前の停止、送信後の検証が必要です。

そのため、私たちが考える評価対象は「検証された結果」と「制御された過程」の両方です。タスク成功率は重要ですが、単独では足りません。失敗したときに原因が分かるか、再試行してよいか、ユーザーが止められるか、監査ログに残るかも、スマホエージェント 信頼性指標に入ります。継続的なテスト基盤や改善ループを深く知りたい場合は、自己改善するPhone Agentに必要なスキル版管理・テスト・ロールバックが、ハーネス運用の考え方を補います。

2026年のモバイルエージェント評価ベンチマーク

2026年のAIエージェント ベンチマーク 2026は、一つの総合順位で読むより、各ベンチマークがどの弱点を浮かび上がらせるかで見るほうが実用的です。Androidやモバイルの環境は、端末設定、言語、アプリの状態、画面レイアウト、ログイン、権限、長い手順、ユーザーとのやり取りによって結果が変わります。異なる研究の点数をそのまま一列に並べても、同じ能力を測っているとは限りません。

ベンチマーク確認できる範囲評価で見える課題
B-MoCAPMLRのB-MoCA論文は、131件の一般的なAndroid日常タスクを定義し、UIレイアウトや言語設定などの端末構成をランダム化します。同じ目的でも端末構成が変わるとエージェントがどこまで一般化できるかを見ます。単純なタスクと複雑なタスクの差も重要です。
MobileWorldACL 2026のMobileWorld論文は、20アプリにまたがる201タスクを扱い、平均27.8手順、62.2%が複数アプリと報告しています。長い手順、複数アプリ、ユーザーとのやり取り、MCPで拡張されたタスクを含む評価です。論文内では最良のagentic frameworkが51.7%、最良のend-to-end modelが20.9%と報告されています。
KnowU-BenchKnowU-Benchのpreprintは、42件の一般GUIタスク、86件の個人化タスク、64件のプロアクティブタスクを扱います。ユーザープロファイルを隠し、行動ログを見せる設定で、聞き返し、同意、拒否後の抑制を評価します。個人化と介入の調整を見るのに向いています。
PhoneHarnessPhoneHarnessのpreprintは、GUI、CLI、ホスト側ツールアクションを組み合わせ、観測できる副作用と監査可能な実行トレースを評価します。エージェントがどの実行面を使うか、結果が本当に起きたか、トレースで追えるかを評価しやすい設計です。

この四つは、直接つなげて一つの順位表にするための材料ではありません。B-MoCAは構成差、MobileWorldは長い複数アプリ作業、KnowU-Benchは個人化と同意、PhoneHarnessは実行面と副作用検証に焦点があります。能力発見や信頼できるリソース選択まで評価したい場合は、Agentic Resource Discoveryとは:ai-catalog.json、検証、スマホ操作の認可を分けて考えるが、ツール発見と認可を分ける視点を補います。

実機テストに必要な六つの評価軸

実用的なAndroid GUIエージェント テストを作るなら、研究ベンチマークの教訓を六つの軸に落とし込みます。第一は構成差です。端末メーカー、画面サイズ、表示言語、フォントサイズ、通知状態、標準アプリを変えます。第二は手順の長さです。一画面で終わる操作と、複数アプリをまたぐ長い作業を分けます。手順が多いほど常に難しいとは限らず、明確な構造化ツールがあれば長い作業でも安定することがあります。

第三は意図の明確さです。「音量を上げて」のような明確な依頼と、「会議に集中できるようにして」のような曖昧な依頼を分けます。第四は実行面です。GUIを読むのか、構造化ツールを呼ぶのか、ホスト側の機能を使うのかを明確にします。第五は副作用の重さです。読み取り、可逆的な設定、外部に届くメッセージ、削除や共有のような影響の大きい操作を分けます。

第六は割り込みと復旧です。ユーザーが途中で止める、権限を取り消す、画面が変わる、ネットワークが落ちる、別の通知が割り込む。FoneClawのようなAndroid AIエージェントでは、これらを例外ではなく通常のテスト軸として扱います。各軸を独立して変えると、失敗の原因が見えます。すべてを一度に変えると、モデルの理解、UIの変化、権限不足、復旧失敗が混ざってしまいます。

タスク成功率を超える信頼性指標

スマホエージェント 信頼性指標では、タスク成功率の分母を固定することから始めます。何回まで再試行を許すか、ユーザー介入を成功に含めるか、途中で下書きに止めることを部分成功にするかを決めます。LLMによる判定だけでなく、端末状態、画面結果、ファイル、設定、メッセージ、通知のような観測可能な証拠で検証します。

私たちが使うなら、最低でも六つの指標を置きます。完全成功率、部分チェックポイント到達率、誤った副作用率、復旧成功率、人間の介入回数、実行トレースの品質です。さらに、遅延、トークンや推論コスト、バッテリー影響、失敗理由の分類も見ます。PhoneHarnessが観測可能な副作用と監査可能な実行トレースを重視している点は、プロダクトQAでも参考になります。

重要なのは、失敗を一つの数字に押し込まないことです。宛先を間違えたSMS、権限不足で止まったDND変更、画面を読めずにユーザーへ聞き返したケースは、同じ失敗ではありません。アイデンティティ、権限、監査ログを指標化する考え方は、AIエージェントのアイデンティティ、権限、監査ログ:ツール単位で安全に実行する設計で詳しく扱っています。

承認、権限、抑制、停止をテストする

安全性は、拒否率だけでは測れません。スマホAgentでは、必要な最小権限で進めるか、影響のある操作の前に適切な承認を求めるか、曖昧な依頼で聞き返すか、ユーザーが拒否したあとに同じ操作を押し通さないか、停止指示を実行タスクへ反映できるかをテストします。KnowU-Benchが、明確化、プロアクティブな同意、拒否後の抑制を扱う点は、スマホAgentの安全評価に近い発想です。

承認テストでは、タイミングが重要です。完了後に「やっておきました」と言うのではなく、送信、共有、削除、設定変更の前に、対象、理由、影響を示します。承認UIそのものの設計は、AIエージェント承認UI設計:提案、信頼度、理由、タスク状態をスマホでどう見せるかで詳しく説明しています。テストでは、承認がタスク、操作、端末状態と結び付いているかを確認します。

停止と監査も同じくらい大切です。ユーザーが「やめて」と言ったとき、会話だけが止まるのではなく、実行待ちのタスクも止まる必要があります。権限が足りない場合は、勝手に迂回せず、必要な許可と戻り先を示します。安全性の合格は、何もしないことではなく、必要なことを必要な範囲で行い、危険な場面で正しく止まることです。

現在のFoneClawタスクをどう評価するか

ここでは評価方法を示し、FoneClawの公開ベンチマーク結果は報告しません。私たちが現在のFoneClawを評価するなら、現時点までの最新情報にもとづく基準を使います。現在のFoneClawは、フローティングアシスタント、現在画面添付、タスク継続、承認、停止、権限復旧、DND、音量、会議モード、スクリーンショットの安定性、クイックアクションを提供しています。リリースはFoneClawのダウンロードページで案内しています。

テスト対象は、読み取り、可逆的な端末制御、外部効果、権限復旧、画面変化、停止に分けます。読み取りでは、現在画面の鮮度、アプリ名、表示内容、スクリーンショットの取得結果を検証します。可逆的な制御では、DND、音量、Bluetooth、会議モード、ショートカットを対象に、実行前後の状態が確認できるかを見ます。外部効果では、メッセージ下書き、カレンダー、メモ、タスク、ワークフローを、承認前に止まるかまで含めて評価します。

テストクラス見る指標
読み取り現在画面、通知、スクリーンショット観測の鮮度、誤読、ユーザーへの表示
可逆的制御DND、音量、Bluetooth状態確認、元に戻せるか、承認の必要性
外部効果メッセージ、予定、共有対象、内容、承認、二重実行の防止
権限復旧マイク、通知、アクセシビリティ、特別なアクセス不足理由、復旧導線、再開地点
割り込み画面変更、停止指示、別通知タスク状態、停止、復旧、監査ログ

FoneClawは、設定されたモデル、Android権限、管理されたツールで動きます。公開している機能では、100+ built-in toolsを通じて、さまざまなAndroidワークフローを扱えます。詳細はFoneClawの機能紹介で確認できます。権限や特別なアクセスのユーザー向け監査を試すなら、AIによるAndroidスマホ健康チェック:FoneClawで権限、特別なアクセス、隠しアプリを監査する方法が、具体的なテスト題材になります。

再現可能なスマホAgentテスト手順

再現可能なモバイルエージェント評価を作るには、手順を固定します。第一に、端末、OS、ロケール、表示言語、フォント、アプリ版本、ログイン状態、権限状態を記録します。第二に、初期状態と期待結果を定義します。第三に、六つの評価軸のうち一つだけを変えます。第四に、承認、ユーザー介入、ツール呼び出し、画面変化を記録します。

第五に、結果を観測可能な副作用で検証します。設定が変わったか、ファイルができたか、下書きが見えるか、送信が起きたか、余計な変更がないかを確認します。第六に、失敗を分類します。理解失敗、UI失敗、権限不足、承認不足、外部サービス失敗、復旧失敗を分けます。第七に、制限を公開します。端末やアプリが違えば結果も変わるため、比較できる範囲を明示します。

最初のテストは、取り返しのつきやすいものにします。現在画面の要約、DNDの短時間変更、音量調整、スクリーンショット、メモ作成、権限監査などです。スコアカードには、完全成功、部分成功、誤副作用、承認品質、復旧、介入回数、遅延、コスト、トレース品質を入れます。評価ハーネスを継続改善する場合は、自己改善するPhone Agentに必要なスキル版管理・テスト・ロールバックで、テスト、ロールバック、改善ループまで確認できます。

よくある質問

目的理解、検証済みの結果、正しい副作用、不要な副作用の回避、承認、権限、停止、復旧、監査ログを合わせて評価します。画面上の操作が自然に見えるだけでは足りず、端末状態や結果を実際に確認する必要があります。
B-MoCA、MobileWorld、KnowU-Bench、PhoneHarnessが重要な参考になります。B-MoCAは構成差、MobileWorldは長い複数アプリ作業、KnowU-Benchは個人化と同意、PhoneHarnessはGUIやツール実行の副作用検証とトレースを見せています。
できません。成功率に加えて、部分到達、誤った副作用、承認の質、権限の最小化、拒否後の抑制、停止、復旧、人間の介入回数、遅延、コスト、監査品質を見ます。分母と再試行ポリシーも固定する必要があります。
送信、共有、削除、設定変更の前に、対象、理由、影響が表示されるかを見ます。権限不足時に迂回せず復旧へ進むか、ユーザーが拒否したあとに同じ操作を押し通さないか、停止指示が実行タスクへ反映されるかも評価します。
端末、OS、ロケール、アプリ状態、権限、初期状態、期待結果、再試行回数、ユーザー介入ルールを記録します。評価軸を一つずつ変え、実行ログ、承認、画面変化、観測可能な副作用を残し、失敗理由を分類します。