スマホエージェント比較
📅 2026-08-11 ⏱️ 12分 Dean Dean

PokeClawとFoneClawの比較:ローカル推論とAndroid実行の選び方

PokeClawとFoneClawを、ローカルAIスマホエージェント、オンデバイス推論、Android操作実行、権限、承認、復旧、端末性能の違いから比較します。

PokeClawのローカル推論とFoneClawのAndroid実行ルートを比較するイメージ
📋 要点
  • PokeClawは、Android上でローカル推論を試したい開発者や実験ユーザーに向くオープンソースのlocal-firstプロトタイプです。
  • FoneClawは、対応済みAndroid操作を、フローティング入口、現在画面の文脈、タスク継続、承認、停止、権限回復の中で進める独立したphone-agent runtimeです。
  • 「ローカル」には、モデル推論が端末内で動くことと、電話上の操作実行が端末上で管理されることの二つがあります。この二つを分けると比較がぶれません。
  • 最初の判断は、送信や削除ではなく、アプリを開く、現在画面を説明する、未送信の下書きを準備するなど、戻しやすい実機テストで行います。

まず結論:ローカル推論か、管理されたAndroid実行か

PokeClawとFoneClawの比較は、どちらが一方的に優れているかではなく、何を重視するかで決まります。ローカルAIスマホエージェントを自分で触り、端末内モデル推論、オープンソースの実装、Android UIを読むループを検証したいならPokeClawが近い選択肢です。対応済みAndroid操作を、権限、承認、停止、復旧、見える結果の中で日常作業へつなげたいならFoneClawが合います。

この比較で最初に分けたいのは、「ローカル」の意味です。一つ目は、モデル推論が端末内で動くことです。PokeClawのLocal modeは、公式説明でGemma 4をLiteRT-LM経由でスマホ上に動かす方向として示されています。二つ目は、電話上の操作実行が端末の画面、権限、アプリ状態に沿って進むことです。FoneClawでは、私たちはこのAndroid実行の管理に集中しています。ユーザーが今見ている画面、これから行う操作、承認が必要な場面、失敗時の戻り方を見える形にすることが価値になります。

PokeClawは、公式GitHubリポジトリで、open-source local-first Android prototypeとして説明されています。FoneClawは、独立したAndroid phone-agent runtimeとして、対応済みの電話側操作を扱います。PocketClaw代替を探している読者も、名前の近さではなく、モデルの置き場所、データ経路、操作制御、実機で戻せるテストを見て判断するのが実用的です。

モデルとデータ経路を比較する

PokeClawは、モデルとデータ経路の話で強い特徴を持ちます。公式リポジトリとPokeClawの公式サイトでは、Local modeがGemma 4をLiteRT-LMで端末上に動かすこと、セットアップ後はアカウントやAPIキーなしで使えることが説明されています。ローカル推論を試したい読者にとって、この点は分かりやすい魅力です。ネットワーク経由のモデル呼び出しを減らし、端末内で推論の遅延や電池、メモリ、温度を観察できます。

ただし、PokeClawはOptional cloud providersもサポートします。つまり、どの設定で使うかによってデータ経路が変わります。Local modeであれば推論は端末内に寄りますが、クラウドプロバイダーを有効にした場合は、入力や文脈がそのサービスの経路へ進む可能性があります。PokeClawは「完全に端末内で動くのか」という質問には、設定を確認して答えるのが正確です。

FoneClaw側では、モデル推論とAndroid実行を分けて考えます。私たちは、FoneClawを「すべての推論が端末内に閉じる製品」として説明していません。FoneClawの役割は、設定されたモデルが考えた意図を、対応済みAndroid操作へ安全に運ぶ実行側にあります。この記事の更新時点で確認できる最新の製品情報では、フローティング入口、ユーザー操作による現在画面の添付、タスク継続、承認、停止、権限回復、状態確認、機能ルーティングが、電話上の作業を扱う中心です。

比較軸PokeClawFoneClaw確認すること
モデル推論Local modeでGemma 4をLiteRT-LM経由で端末上に動かす設定されたモデルの推論とAndroid実行を分けて扱う推論が端末内か、オンライン経路か
クラウド利用Optional cloud providersをサポート構成によりモデルやサービスとの接続を使うどの入力や文脈が外部へ出るか
初期設定Local modeはセットアップ後にアカウントやAPIキーなしで使える現在の導入情報はダウンロードページで確認する必要な権限、モデル設定、更新経路
主な強みローカル推論の実験と実装の透明性対応済みAndroid操作の管理、承認、復旧自分の目的が推論検証か実行管理か

ローカルとクラウドの信頼判断をもっと広く見たい場合は、AIエージェントの信頼性:クラウドAIとローカルAndroid操作をどう見分けるかを読むと、モデル経路、操作経路、データ共有の切り分けがしやすくなります。

画面をどう見て、どう操作するかを比較する

PokeClaw Androidエージェントの中核は、スマホ上の現在UIをテキスト表現として読み、次に使うツールを選ぶループです。公式リポジトリでは、画面読み取り、タッチ、テキスト入力、アプリを開く、スクリーンショット、メッセージング、自動返信、finishなどのツールやスキルが説明されています。これは、研究者や開発者が「Android UIを読んで行動するエージェント」を観察するには分かりやすい構造です。

この方式では、UIの読み取り品質と行動選択が重要になります。画面のテキスト表現が十分か、ボタンや入力欄が正しく分かるか、アプリ側のレイアウト変更に耐えられるか、同じ依頼を繰り返した時に同じように進むか。PokeClawはプロトタイプとして公開されているため、実験のしやすさと同時に、手元の端末やアプリで実際に検証する姿勢が必要です。

FoneClawでは、私たちは汎用的な画面タップだけを中心に置くのではなく、対応済みのAndroid能力へルーティングする設計を重視しています。ユーザーが必要な時に現在画面を添付し、フローティングアシスタントから文脈を渡し、タスクをHomeとフローティング入口の間で継続し、必要な操作では承認や状態確認を挟みます。対応済み能力はFoneClawの機能一覧で100+ built-in toolsとして確認できます。

項目PokeClawFoneClaw
観察方法現在UIのテキスト表現、画面読み取り、スクリーンショットユーザー操作による現在画面の添付、画面とアプリ状態の確認
行動方法タッチ、入力、アプリ起動、メッセージング、自動返信などのツール選択対応済みAndroid操作、機能ルーティング、承認付き実行
継続性プロトタイプのループとスキルで検証するHomeとフローティングアシスタントをまたぐタスク継続を使う
評価軸ローカル推論とUIループの透明性権限、承認、停止、復旧、結果確認の見え方

FoneClawの現在画面ルートを詳しく見たい場合は、Android フローティングAIアシスタント 画面認識:現在画面から安全に操作へ進む方法で、画面文脈を常時監視ではなくユーザー操作で渡す考え方を整理しています。

権限、承認、停止、復旧を比較する

操作制御が充実しているのはどちらかを考える時は、権限があるかどうかだけでは足りません。PokeClawは、公式サイトでAccessibilityが画面読み取りとジェスチャーに使われることを説明しています。AndroidエージェントにとってAccessibilityは強力な入口です。画面を読み、タップし、入力するための土台になります。一方で、強力な入口ほど、何を読んだか、何を押したか、どこで止まったかをユーザーが確認できる必要があります。

PokeClawの公式リポジトリは、rules、guards、stuck detection、clean failures、QA priorities、limitationsにも触れています。これは、プロトタイプであっても、行動ループが失敗する場面や止まる設計を意識していることを示します。WhatsApp auto-replyのようなメッセージング系の例を見る時も、実際に送る前の確認、対象スレッド、本文、二重送信の防止、失敗時の状態が評価軸になります。

FoneClawでは、私たちはAndroid操作を進める時に、権限、承認、状態確認、停止、権限回復を同じ作業の一部として扱います。たとえば、アプリを開く、画面を確認する、設定を読む、DNDや音量を扱う、メモやリマインダーを準備する、メッセージ下書きへ進む。こうした操作では、ユーザーの依頼が低リスクな読み取りなのか、端末状態を変えるのか、外部に影響するのかを分けます。現在の機能ルーティングは、その違いを判断し、承認や手動確認が必要な場面を見える形にするために使います。

ここで大切なのは、オープンソースなら自動的に安全、権限を許可すれば自動的に同意、という見方を避けることです。安全性は、コードを読めること、端末上で権限を管理できること、操作前に承認できること、途中で止められること、失敗後に復旧できることが組み合わさって初めて評価できます。FoneClawのTool、Plugin、Skill、Workflow、Shortcutの能力レイヤーを掘り下げたい場合は、FoneClawのTool、Plugin、Skill、Workflow、Shortcutの違い:Androidエージェントの能力レイヤーを選ぶ実用ガイドで、実行能力の分け方を説明しています。

導入と端末コストを比較する

PokeClawに必要な端末性能は、ローカル推論を試す時の大きな判断材料です。公式サイトでは、Direct APK、Android 9+、arm64が案内されています。また、Local modeでは初回起動時に約2.6 GBのダウンロードがあり、約4 GBの空きRAMが必要と説明されています。CPUでのウォームアップは約45秒かかる場合があり、対応する高速なハードウェアでは短縮される可能性があります。

この情報は、PokeClawを試す前の現実的なチェックになります。ストレージに余裕があるか、メモリが足りるか、端末が熱くなりすぎないか、電池消費を許容できるか、初回セットアップを待てるか。ローカルAIスマホエージェントは、ネットワーク依存を減らせる一方で、端末側の計算資源を使います。掲載された条件やハードウェア例は、速度を保証するものではなく、実機で測るべき目安です。

FoneClawでは、導入時に見るべきポイントが少し違います。現在の配布状況はFoneClawのダウンロードで確認し、使いたい操作に必要なAndroid権限、モデル設定、アプリ連携、承認の出方を見ます。FoneClawの比較軸は、端末内モデル推論の速度だけではありません。フローティング入口が日常アプリの上で使いやすいか、現在画面の添付が必要な時だけ使えるか、タスクが途中で続くか、権限不足の時に復旧できるかを確認します。

オンデバイスLLMの速度、電池、メモリの関係をさらに知りたい場合は、オンデバイスLLM最適化とスマホAIエージェント:速さ、電池、確認が体験を決めるが近いテーマです。このページでは、PokeClawのローカル推論コストと、FoneClawの管理されたAndroid実行コストを分けて見ます。

現実的なワークフローで選ぶ

製品比較は、機能表だけでは決まりません。どのワークフローを本当にやりたいかで、PokeClawとFoneClawの見え方は変わります。PokeClawは、ローカル推論、UI読み取りループ、WhatsApp auto-reply、汎用的なアプリナビゲーションを試したい人に向きます。Apache 2.0ライセンスで公開され、リポジトリでは商標上の扱いにも触れています。開発者がコードを読み、動かし、ルールやガードを調整し、ローカル実験を行うには魅力があります。

FoneClawは、Android上の対応済み操作を日常の流れで使いたい人に向きます。たとえば、現在画面を添付して意味を確認する、DNDや音量の状態を見る、メモやリマインダーを準備する、アプリを開く、メッセージ下書きを作り、送信前に確認する。私たちは、AIが勝手にすべてを進める体験より、ユーザーが見て、承認し、止めて、復旧できる実行を重視しています。

やりたいことPokeClawが合う場面FoneClawが合う場面
ローカル推論を観察するLocal modeで端末内推論、遅延、電池、メモリを試すモデル経路よりAndroid実行の制御を見たい時
コードを読みながら実験するオープンソース実装、ツールループ、ガードを確認する製品としての対応済み操作と承認の流れを使う
日常の電話操作を進めるプロトタイプとして対応アプリや端末で試す権限、承認、状態確認、停止、復旧を見ながら進める
メッセージ関連を試すauto-replyやアプリナビゲーションの実験に向く下書き、確認、外部影響のある操作の扱いを重視する
広い能力レイヤーを選ぶスキルとツールの実装を検証するTool、Plugin、Skill、Workflow、Shortcutを用途で分ける

読者にとって一番大切なのは、自分の端末と自分のアプリで試すことです。PokeClawもFoneClawも、発表文だけでは実際の速度、画面読み取り、権限、復旧の感触までは分かりません。まずは低リスクなワークフローで、同じ依頼を複数回試します。

どちらを試すか、戻せるテストで決める

最初にPokeClawを試すべきなのは、端末内推論を自分で観察したい人、オープンソースのAndroidエージェントループを読みたい人、プロトタイプとしてローカルAIスマホエージェントを触りたい人です。最初にFoneClawを試すべきなのは、Android上の対応済み操作を、フローティング入口、現在画面の文脈、承認、停止、復旧の中で日常に近い形で使いたい人です。

比較の最初のテストは、送信、購入、削除、アカウント変更ではなく、戻しやすい作業にします。次の五段階で見ると、PokeClawとFoneClawの違いが分かりやすくなります。

  1. 同じAndroid端末で、権限、言語、ネットワーク、対象アプリを記録します。
  2. 低リスクな依頼を選びます。例は、アプリを開く、現在画面を説明する、未送信の下書きを準備する、短いメモを作る、音量やDNDの状態を確認する、です。
  3. 権限要求、初回待ち時間、画面読み取り、操作の見え方、承認の有無を記録します。
  4. 途中で停止を指示し、タスクがどこで止まるか、手動で引き取れるかを確認します。
  5. 権限不足や画面変更を入れ、復旧、再開、最終状態の確認ができるかを見ます。

一回の成功は、信頼性の証明ではありません。同じ依頼を日を変えて試し、結果、遅延、電池、権限、停止、復旧を比べます。PokeClawとFoneClawの比較は、名前や機能数ではなく、ローカル推論を重視するのか、管理されたAndroid実行を重視するのかで選ぶと、判断がぶれません。

よくある質問

PokeClawは、ローカル推論とオープンソースのAndroidエージェントループを試すlocal-firstプロトタイプです。FoneClawは、対応済みAndroid操作を、フローティング入口、現在画面の文脈、承認、停止、権限回復の中で進める独立したphone-agent runtimeです。
PokeClawのLocal modeは、Gemma 4をLiteRT-LM経由で端末上に動かし、セットアップ後はアカウントやAPIキーなしで使えると説明されています。ただしOptional cloud providersもサポートされるため、クラウド設定を有効にするとデータ経路は変わります。
見るべき軸は、権限、承認、停止、復旧、状態確認です。PokeClawはAccessibilityを使うUIループとガードを試せるプロトタイプです。FoneClawは、対応済み操作を承認、停止、権限回復、結果確認の流れで扱うことに集中しています。
公式サイトではAndroid 9+とarm64が案内され、Local modeでは初回に約2.6 GBのダウンロード、約4 GBの空きRAMが必要と説明されています。CPUウォームアップは約45秒かかる場合があり、対応する高速なハードウェアでは短縮される可能性があります。実際の速度は端末で確認します。
ローカル推論、コードの透明性、プロトタイプ実験を重視するならPokeClawから試します。Android上の対応済み操作、現在画面の文脈、承認、停止、復旧を重視するならFoneClawから試します。最初は送信や削除ではなく、アプリ起動、画面説明、未送信下書きのような戻しやすいタスクにします。