Industry Analysis
📅 2026-07-26 ⏱️ 9分 Dean Dean

見せて教えるPhone Agent:画面録画、再利用スキル、Androidの安全性

Phone Agent デモ学習で、画面録画と音声説明から再利用可能なAndroid手順を設計し、変化への対応、権限、確認、履歴、復旧まで管理する方法を解説します。

Androidの操作を画面録画と音声説明で示し、ルール抽出、再利用スキル、権限確認、テストへつなげるPhone Agent デモ学習
📋 要点
📑 目次
  1. 操作を見せることはマクロ記録と何が違うのか
  2. 画面録画から再利用できるスキルを組み立てる
  3. Androidでは同じ画面が毎回現れるとは限らない
  4. 安全で学びやすい実演データを録る方法
  5. 変化を試し、権限・履歴・復旧を管理する
  6. FoneClawから見る再利用可能なAndroidワークフロー

操作を見せることはマクロ記録と何が違うのか

AIエージェントにスマホ操作を一度見せれば、次から同じ仕事を任せられるのでしょうか。Phone Agent デモ学習が目指すのは、タップした座標の記憶ではありません。利用者が何を達成しようとし、画面のどの情報を見て選び、どの状態になれば完了なのかを、再利用できる手順へ変換することです。

2026年7月22日のITmediaによるClaude CoworkのRecord a Skill報道では、利用者の作業と音声説明を記録し、繰り返し使えるスキルへ変換する機能が紹介されました。前日のAndroid Authorityによる操作報告でも、画面を記録しながら利用者が手順を説明し、定型作業のたびに同じ指示を書く負担を減らす仕組みとして扱われています。

この新しい操作方法は、通常のプロンプト、マクロ、画面再生、モデル訓練のいずれとも異なります。違いを整理すると、録画から何を抽出すべきかが見えてきます。

方法記録するもの変化への対応主な用途
プロンプト目的や条件を文章で伝える説明に含まれる範囲でモデルが判断する一回の依頼や柔軟な相談
決め打ちのマクロ入力や操作の順序を固定する想定外の画面には弱い表示が一定の反復作業
画面の単純再生タップ位置や待ち時間を再現する配置や速度が変わるとずれやすい同一環境での短い操作
デモ学習によるスキル操作、説明、判断条件、結果をまとめる画面の意味とルールを使って分岐する状態が変わる反復ワークフロー
モデル訓練多数のデータからモデル自体を更新する学習データと訓練方法に依存する基盤能力の改善

例えば、利用者が配送アプリで「発送待ちだけを表示し、期限が近いものから確認する」操作を見せたとします。マクロは三番目のタブを押す手順として記録するかもしれません。再利用スキルでは「発送待ちという状態を選ぶ」「期限を基準に並べ替える」「該当件数を確認する」という意味に分けます。タブの位置が変わっても、同じ目的を達成できる可能性が高まります。

Claude Coworkの動きをスマホへそのまま置き換えるのではなく、実演からルールを取り出す発想として見ることが重要です。Claude Coworkとスマホ側の操作接点については、Claude Coworkがスマホへ:AIエージェントの新しい操作の入口になる理由で隣接する論点を整理しています。

画面録画から再利用できるスキルを組み立てる

一回の実演は、どのようにすれば別の日や別のデータでも使えるスキルになるのでしょうか。必要なのは、録画を保存するだけではなく、操作の目的、判断、入力値、終了条件を段階ごとに分離することです。

最初に、利用者が達成したい仕事を一文で決めます。「アプリを開く」ではなく、「新しく届いた申請を確認し、条件を満たすものを担当者へ割り当てる」のように、結果まで含めて表現します。開始状態も重要です。ログイン済みのホーム画面から始めるのか、通知から開くのか、対象データがすでに表示されているのかを記録します。

次に、画面操作と同時に判断理由を説明します。「このボタンを押す」だけではなく、「未処理の項目だけを見るために状態を絞り込む」「期限が今日までなので優先する」「金額が上限を超えるので確定しない」と話します。音声説明は、画面から読み取れない業務ルールを補う役割を持ちます。

録画後は、手順を次の要素へ分解します。

  1. 開始条件:必要なアプリ、アカウント状態、接続、対象データを定義する。

  2. 画面上の対象:名称、役割、状態、周辺の見出しなどから操作対象を識別する。

  3. 判断規則:どの条件なら進み、どの条件なら確認や中止へ戻るかを記述する。

  4. 変更可能な値:宛先、日付、金額、検索語、数量などを毎回の入力として切り出す。

  5. 重要操作:送信、削除、公開、購入、権限変更など、利用者確認が必要な地点を指定する。

  6. 完了条件:成功表示、保存済み状態、送信履歴など、結果の確認方法を決める。

変更可能な値を固定値から切り離す工程を、パラメータ化と考えると分かりやすくなります。実演で「田中さん」「金曜日」「3件」と入力していても、それらはスキルそのものではありません。再利用時に与える宛先、期限、件数へ置き換えます。一方、「期限を過ぎた項目は送信しない」という判断規則は、スキルに残します。

最後に、スキル名、目的、必要な入力、利用アプリ、権限、確認地点、完了条件、失敗時の戻り先を一つの定義へまとめます。呼び出すときは「前回と同じ操作をして」ではなく、「未処理の申請を確認し、担当者候補まで準備して」のように、目的と今回の値を渡します。

これは一度の実演だけで基盤モデルを再訓練する作業ではありません。実演から明示的な手順と判断規則を作り、実行時には現在の画面へ適用する設計です。スマホAgentの訓練そのものを扱う話題は、PhoneBuddy-4BとスマホAgent訓練:Mock-App RLがAndroid Agentに重要な理由で詳しく説明しています。

Androidでは同じ画面が毎回現れるとは限らない

同じAndroidアプリで同じ作業を繰り返すなら、録画をそのまま再生しても動くのでしょうか。実際の画面は、端末、アカウント、言語、通知、読み込み状態によって変わります。再利用スキルには、変化を前提に現在の状態を読み直す仕組みが必要です。

まず、画面サイズとレイアウトが一定ではありません。スマホとタブレットではボタンの位置が変わり、画面回転、表示倍率、文字サイズ、分割画面によっても配置が動きます。小さな端末ではメニュー内に入る操作が、大きな画面では最初から表示されることもあります。座標だけを保存すると、別の項目を押す危険が生じます。

アカウント状態も画面を変えます。初回利用では案内画面が入り、未ログインなら認証が必要です。複数アカウントを使っていれば、実演時とは別のプロフィールが選ばれている可能性があります。未読件数、保有データ、契約プランによって、表示されるタブや機能も変化します。

言語と地域の違いでは、ラベルの文字だけでなく、日付、時刻、通貨、住所、姓名の順序が変わります。「保存」という日本語ラベルだけに依存したスキルは、別言語の画面で対象を見つけられません。ボタンの役割、所属する画面、近くにある入力欄など、複数の手掛かりで識別する必要があります。

読み込み中、通信エラー、空の一覧、更新通知、同意画面も通常の状態として扱います。対象が見つからないときに画面を無制限にタップするのではなく、読み込み完了を待つ、再読込する、前の画面へ戻る、利用者へ現在の状態を示すといった分岐を用意します。

Androidのアクセシビリティ情報を利用できる場合は、見た目の座標に加え、要素の説明、役割、操作可能状態などを手掛かりにできます。Androidのアクセシビリティサービスに関するガイドは、サービスが画面上の要素やイベントを扱う仕組みを説明しています。ただし、アプリごとに提供される情報の質は異なるため、表示内容と操作結果の確認も組み合わせます。

権限ダイアログも文字どおりに再生できない代表例です。すでに許可済みなら表示されず、拒否後には別の案内が出ることがあります。Androidのバージョンによって選択肢が変わる場合もあります。再利用スキルは「この位置の許可ボタンを押す」のではなく、「必要な権限が未設定なら用途を示し、利用者が選択できる状態にする」と定義します。

したがって、Android向けのデモ学習では、録画した正解経路だけでなく、途中に現れ得る状態を列挙することが重要です。通常状態、データなし、権限未設定、通信失敗、対象が複数ある状態を試すことで、画面再生から実用的なワークフローへ近づきます。

安全で学びやすい実演データを録る方法

Phone Agentへ見せる画面録画には、何を含め、何を除けばよいのでしょうか。安全な実演は、実際の作業に近い一方で、本人確認情報や機密データを使わず、判断理由を読み取れる状態になっています。

Androidで画面を取得する仕組みについて、MediaProjectionの公式ドキュメントは、投影セッションごとに利用者の同意を求めることや、取得した表示内容を適切に扱う必要性を示しています。録画開始時の許可は、以後のすべての画面取得を恒久的に認めるものではありません。録画対象と時間を作業に必要な範囲へ絞ります。

実演前には、専用のテストアカウントと架空データを用意します。通知を止め、個人用アプリを閉じ、最近使ったアプリの一覧にも私的な内容が出ない状態にします。検索履歴、連絡先候補、写真の縮小表示、クリップボード候補は、意図せず録画へ入ることがあるため事前に確認します。

録画へ含めない情報は明確です。パスワード、暗証番号、決済カード情報、銀行口座情報、本人確認書類、認証コード、秘密鍵、回復コード、個人チャット、健康情報、実在する顧客や従業員のデータは使用しません。入力方法を教える必要がある場合は、架空の値を使い、「ここには実行時に承認済みの値を入力する」と説明します。

Androidのプライバシーとセキュリティに関するガイダンスが示すように、権限や機密データへのアクセスは、用途に応じた範囲で扱うプラットフォーム機能です。録画を作る段階でも、連絡先、位置情報、写真、マイクなどを一括して公開するのではなく、実演に必要な情報だけを使います。

録画中は、操作の説明に加えて、選ばなかった理由も短く話します。「この項目は期限切れなので開かない」「金額が上限を超えるため送信前に止める」「同名の相手が二人いるので識別情報を確認する」と説明すれば、正しいタップ列だけでは見えない例外規則を抽出できます。

完了時には、期待する結果を画面で示します。保存済み表示、送信履歴、更新後の一覧、作成されたファイルなどを確認し、「この状態なら成功」と説明します。単に最後のボタンを押して録画を終えると、操作が本当に完了したかを判定できないスキルになります。

安全な録画手順は次のようにまとめられます。

変化を試し、権限・履歴・復旧を管理する

完成したスキルは、一度成功すれば実用化できるのでしょうか。実演と同じデータで動くだけでは、固定されたマクロと大きく変わりません。再利用前には、入力、画面状態、権限、失敗条件を変えて試します。

最初は、送信や削除を行わない試行モードで手順を確認します。スキルが選んだ対象、入力しようとする値、次の操作を表示し、利用者が正しいか判断します。重要操作の直前で止めれば、実データを変更せずに分岐と画面認識を検証できます。

次に、正常系だけでなく変化を加えます。対象が一件、複数、ゼロの場合を試し、長い名称、同名の項目、期限切れ、読み込み遅延、別言語、文字サイズ変更、権限未設定でも安全に止まるかを確認します。画面内の対象が見つからないときは、推測で別の項目を選ばず、再探索や利用者確認へ移る設計が必要です。

権限は、スキル全体に一括で割り当てるのではなく、操作単位へ対応付けます。画面を読む、入力する、連絡先を参照する、通知を扱う、ファイルを保存するといった能力には、それぞれ異なるAndroid権限やアプリ内許可が関係します。詳しい考え方は、AIエージェントのスキル安全性:スマホ権限は実行時に確認すべき理由で解説しています。

利用者確認を置く場所も、操作の結果に合わせます。検索、並べ替え、下書き作成は途中経過を表示しながら進められます。メッセージ送信、外部共有、データ削除、設定変更、購入などは、対象と結果を確定前に示します。確認画面には、何を、どこへ、どの値で実行するかを含めます。

実行履歴には、スキル名と版、開始時刻、受け取った入力、利用したアプリ、分岐結果、確認した操作、完了状態、失敗地点を残します。個人情報そのものを過剰に記録するのではなく、後から動作を説明し、同じ問題を再現するために必要な情報へ絞ります。ID、権限、履歴の設計は、AIエージェントのID・権限・監査ログ:スマホエージェントに必要な安全基盤にもつながります。

アプリの更新で画面が変わったときに備え、スキルには版を付けます。新しい版は試行モードで検証し、問題があれば前の版へ戻せる状態を保ちます。入力形式や必要権限を変更する場合は、既存の呼び出し方法との違いを明示します。

失敗からの回復では、最初からやり直す前に、どこまで処理されたかを確認します。保存や送信が完了している可能性がある場合は、履歴や結果画面を調べ、重複操作を避けます。復旧できない状態では、現在の画面、完了済みの手順、残っている作業を利用者へ示し、手動操作へ切り替えます。

FoneClawから見る再利用可能なAndroidワークフロー

FoneClawでは、見せて教える考え方をどのようにAndroid操作へ生かせるでしょうか。私たちが重視するのは、利用者の目的をモデルが理解し、現在の画面に合わせて計画し、FoneClawが対応するAndroid操作を見える状態で進めることです。

FoneClawは、利用者が対応モデルを設定できるAndroid phone agentです。設定したモデルが言語理解、推論、手順の計画を担当し、FoneClawが対応するアプリや画面で操作を進めます。結果は端末上で確認でき、必要な権限はAndroidとアプリの仕組みに沿って扱い、送信や削除などの重要な段階では利用者の確認へつなげます。

現在のFoneClawで利用するワークフローは、録画ファイルを渡すだけで新しいPhone Skillへ自動変換する方式ではありません。FoneClawの現在の製品範囲は、設定したモデルによる理解と計画、対応するAndroid操作、見える結果、権限に沿った進行、重要操作の確認、必要時の手動切り替えです。

ただし、デモ学習の設計原則は、FoneClawで繰り返し行う操作を整理するうえでも有効です。「どこをタップするか」ではなく、「どの状態を探すか」「どの値を毎回変えるか」「何が起きたら利用者へ戻すか」を明確にすれば、モデルが現在の画面を踏まえて計画しやすくなります。

例えば、毎朝の業務で複数アプリを開き、未処理項目を確認し、結果を下書きへまとめる場合、アプリ名とタップ順だけを並べるのでは不十分です。対象となる未処理状態、日付の範囲、重複の扱い、データがない場合の結果、下書きの保存先を定義します。FoneClawは対応するAndroid操作を進め、画面が想定と異なる場合は現在の状態を示し、再計画や手動操作へつなげます。

複数手順の依頼をどのように組み立てるかは、Android タスク自動化を声で始める:FoneClawで複数手順を任せる考え方でも紹介しています。実演から得た判断規則を、目的、入力、確認地点、完了条件として言語化すると、繰り返し使いやすい依頼になります。

再利用ワークフローをFoneClawで運用するときは、まず読み取りや下書き作成など、結果を戻しやすい操作から試します。次に、異なる入力や画面状態で結果を確認し、最後に送信や変更を伴う工程へ利用者確認を配置します。権限が不足している場合や対応外の画面に到達した場合は、その状態を見える形で返し、必要な設定や手動操作を選べるようにします。

Phone Agent デモ学習の本質は、人の操作を丸ごとコピーすることではありません。人が画面を見て行っている判断を、目的、条件、変更可能な値、例外、確認、完了判定へ分けることです。この構造が整えば、録画は一回限りの再生データではなく、Androidの変化に対応できるワークフローを設計するための具体的な教材になります。

よくある質問

画面録画に操作中の説明を加えることで、目的、判断条件、入力値、完了状態を再利用可能な手順へ整理できます。実用的なデモ学習では、タップ位置をそのまま覚えるのではなく、画面上の対象が持つ意味と、例外時の判断を抽出します。
同じではありません。マクロは決められた入力や操作順を再生する方法です。デモ学習によるスキルは、実演から目的、分岐条件、変更可能な値、確認地点を取り出し、現在の画面状態に合わせて手順を選びます。
パスワード、暗証番号、決済情報、銀行口座情報、本人確認書類、認証コード、秘密鍵、回復コード、個人チャット、健康情報、実在する顧客や従業員のデータは含めません。テスト用アカウントと架空データを使い、録画後にも全体を確認します。
現在のFoneClawは、録画ファイルを直接Phone Skillへ変換する方式ではありません。利用者が設定した対応モデルが依頼を理解して計画し、FoneClawが対応するAndroid操作を見える状態で進めます。権限に沿った実行、重要操作の確認、結果表示、必要時の手動切り替えが現在の製品範囲です。