AI Agentガイド
📅 2026-08-25 ⏱️ 9分 Dean Dean

Android AIの画像コンテキスト維持:同じ画像を再解析して操作へつなぐ方法

Android AIで同じ写真やスクリーンショットに追加質問する方法を解説。画像の識別、参照期限、再解析、権限、結果確認、期限切れからの復旧まで整理します。

Android AIが同じ画像の参照を維持し、追加質問ごとに再解析して確認済みのスマホ操作へつなぐ流れ
📋 要点
  • 画像コンテキストを維持するには、過去の説明文だけでなく、元画像の識別情報、寸法、入手元、参照先、利用期限を現在のタスクに結び付けます。
  • 写真選択、カメラ撮影、スクリーンショットでは権限と取得結果が異なるため、用途に合う方法を選び、切り抜き、向き、解像度を確認します。
  • 追加質問が以前と異なる細部を求める場合は、元のピクセルを必要な範囲と解像度で再解析し、過去の結果との矛盾を解消してから次の操作へ進みます。
  • FoneClawでは、画像の参照と寸法を保ち、必要に応じてアクセスを更新しながら、確認済みの情報を対応するAndroid操作へつなげます。

Android AIで画像コンテキストを維持する意味

Android AIの画像コンテキストとは、一度送った写真やスクリーンショットを、同じタスクの中で追加質問にも使える状態です。たとえばレシートを添付して「合計金額を教えて」と尋ねた後、「購入日はいつ?」「食品だけを抜き出して」「この内容で経費メモを作って」と続ける場面を考えると分かりやすいでしょう。

最初の回答に合計金額しか含まれていなければ、購入日や品目の情報は会話履歴に残っていない可能性があります。そのとき必要なのは、以前の文章を言い換えることではなく、同じレシート画像を再び開き、日付欄や明細部分を確認することです。同じ画像でも、質問が変われば必要な証拠と注目範囲が変わります。

画像を継続して使う仕組みは、三つの要素を分けると理解しやすくなります。第一は元のピクセルを持つ画像ファイル、第二はその画像を再び取得するためのURIや管理された参照先、第三は以前の解析で得た文字や説明です。過去の解析結果は回答を速くする手掛かりになりますが、新しい質問に必要な細部まで含んでいるとは限りません。

  1. レシート画像を一枚選び、現在のタスクへ添付する。
  2. 最初の質問に必要な範囲を解析し、合計金額を提示する。
  3. 画像の識別情報と参照先をタスクに保持する。
  4. 購入日について質問されたら、元画像の日付欄を再解析する。
  5. 経費メモを作る前に、店名、日付、金額、用途を利用者が確認する。
  6. 作成後のメモを開き、転記結果を元画像と照合する。

この流れで大切なのは、どの画像が現在の対象かを常に特定できることです。会話中に別のスクリーンショットを添付した場合も、最初のレシートと新しい画像を別々に識別します。「さっきの画像」「今の画面」「二枚目」の対応関係が曖昧になると、正しい解析でも別の画像に対する答えになってしまいます。

画像コンテキストの維持は、カメラを継続的に監視する仕組みとは用途が異なります。利用者が選択または撮影した画像を一つのタスク入力として保持し、追加質問が来たときに同じ素材へ戻る方法です。画像の識別、アクセス期限、解析履歴を管理することで、必要なときだけ元画像を見直せます。

用途に合う写真やスクリーンショットを用意する

解析の精度は、最初にどの画像を用意したかで大きく変わります。Androidでは、既存の写真を選ぶ、カメラで新しく撮影する、現在の画面をスクリーンショットとして取得する、という三つの経路が一般的です。それぞれ入手元、権限、解像度、利用期限が異なります。

取得方法向いている用途確認する点
フォトピッカー保存済みの写真、レシート、書類、製品画像選んだ項目、URIの利用期限、向き、編集後のファイル
カメラ撮影その場にある書類、故障箇所、商品の状態サムネイルか保存済み画像か、焦点、影、反射、解像度
スクリーンショットエラー表示、設定画面、アプリ内の情報利用者の同意、対象画面、通知などの写り込み、取得範囲

Androidのフォトピッカーに関する開発者ガイドでは、利用者が選んだ写真や動画だけへのアクセスをアプリへ渡せます。ライブラリ全体を対象にするより範囲が明確で、単一選択と複数選択の両方に対応します。返されたURIを後の作業でも使う場合は、必要な期間に応じてアクセス方法を確認します。

カメラで撮影する場合は、撮影できたことと、解析に適した画像を取得できたことを分けて見ます。AndroidのカメラIntentに関する開発者ガイドが示すように、基本的な撮影をカメラアプリへ任せ、画像データや保存結果を後続処理へ渡せます。返される小さなプレビュー画像と、保存された高解像度画像では、細かい文字や傷を読み取れる範囲が異なります。

撮影後は、対象全体が収まっているか、上下が正しいか、文字にピントが合っているかを確認します。レシートなら四隅と合計欄、機器の故障なら全体像と問題箇所、商品ラベルなら型番と注意書きが読めることが目安です。必要に応じて全体写真と接写を別画像として保持し、役割を明確にします。

画面情報を使う場合、MediaProjectionによる取得は利用者の同意を伴うセッション単位の仕組みです。Androidの画面キャプチャに関する開発者ガイドでは、一回限りのトークンを使い、フルディスプレイまたは選択したアプリ画面を取得する流れが案内されています。取得前に対象画面を整え、個人情報や通知が写る範囲も確認します。

現在画面を添付して質問する準備や、フローティングアシスタントから操作へ進む流れは、Android フローティングAIアシスタント 画面認識:現在画面から安全に操作へ進む方法で詳しく解説しています。まずはエラー画面や設定状態など、目的が一つに絞られた画面から試すと、取得と解析の対応関係を確認しやすくなります。

同じ画像を参照し続けるための条件

同じ画像で追加質問を続けるには、会話に「画像があった」という記録を残すだけでは足りません。再解析に使える安定した識別情報と参照先を、現在のタスクへ結び付けます。画像が端末内にある場合も、管理されたリモート参照を使う場合も、どの素材を指しているかが変わらないことが基本です。

最低限保持したい情報は、画像ごとの識別子、取得方法、取得時刻、MIME type、幅と高さ、向き、端末内または管理された参照先、アクセス期限、現在のタスクとの関連です。複数画像を使うなら、「レシート全体」「合計欄の接写」「エラー発生前の画面」のように役割も記録します。

  • 画像の識別:ほかの添付画像と区別できる一意の識別子。
  • 入手元:フォトピッカー、カメラ、スクリーンショット、共有などの取得経路。
  • 寸法と向き:元画像の幅、高さ、回転情報。
  • 形式:JPEG、PNG、WebPなどのMIME type。
  • 参照先:端末内URIまたは認証付きで管理された参照。
  • 利用期限:現在の参照を再利用できる期間。
  • タスクとの関連:どの会話、画像番号、質問、操作に使っているか。
  • 解析履歴:過去に確認した範囲と得られた結果。

画像の寸法は、単なるファイル情報ではありません。画面上の位置を示したり、特定範囲を切り抜いたりするときの基準になります。圧縮後や回転後の画像に対して古い座標を使うと、日付欄を読むつもりで別の明細を切り抜くことがあります。再解析時には、参照している画像の寸法と座標系が一致しているかを確認します。

URIへのアクセスには一時的なものがあり、タスクが長時間続いた場合やアプリを再起動した場合に更新が必要になることがあります。アクセスできなくなったときは、同じ画像を再選択するか、許可された経路で参照を更新します。その際、ファイル名だけで判断せず、寸法、取得時刻、サムネイル、画像の指紋などを照合して元の素材へ戻ります。

FoneClawでは、選択または撮影した画像の参照と寸法を後続タスクへ引き継ぎ、追加の解析に使える状態を整えています。端末内の参照と管理された参照を画像の識別情報へ結び付け、期限が切れた場合はアクセス更新や再選択へ案内します。これにより、別の添付画像へ意図せず切り替わることを防ぎながら、同じ視覚情報を複数の質問へ使えます。

質問が変わったら元画像を再解析する

AI画像の再解析が必要になるのは、新しい質問が以前の解析結果に含まれていない証拠を求めるときです。最初の質問が「合計金額はいくら?」で、次が「税額と支払方法は?」なら、以前の回答だけでは判断できません。元画像へ戻り、税欄や支払情報がある範囲を読み直します。

再解析の判断は、まず新しい質問を具体的な確認項目へ分けるところから始まります。過去の結果に必要な情報があり、元画像との対応も確認済みなら、その結果を利用できます。情報が欠けている、細部が省略されている、画像が更新された可能性がある場合は、元のピクセルを再び解析します。

  1. 新しい質問で必要な情報を特定する。
  2. 過去の解析結果に、その情報と根拠範囲が含まれるか確認する。
  3. 現在も同じ画像参照へアクセスできるか確かめる。
  4. 必要な範囲を適切な解像度で切り出し、元のピクセルを解析する。
  5. 新しい結果を過去の結果と比較し、一致点と相違点を整理する。
  6. 矛盾が残る場合は、画像を拡大するか利用者へ確認を求める。

レシートでは、合計、日付、店名、税額、品目がそれぞれ別の再解析理由になります。合計欄は下部にあり、日付は上部、品目は中央に並ぶことが多いためです。画像全体を毎回同じ縮小率で送るより、質問に必要な範囲を元の寸法に基づいて選ぶほうが細部を確認しやすくなります。

エラー画面では、最初にエラーの概要を説明し、追加質問でエラーコードやボタン状態を読むことがあります。小さな文字が圧縮で読みにくい場合は、該当部分を高い解像度で再解析します。UI要素の構造や操作可能な項目が必要なら、画像だけでなくUIツリーも利用すると状態を確認しやすくなります。両者の使い分けは、Android AIエージェントの画面理解:UIツリー、スクリーンショット、ハイブリッドの選び方で整理しています。

物の状態を調べる写真では、質問の変化が見る場所を大きく変えます。「これは何の部品?」では全体形状が重要ですが、「ひび割れはある?」では表面の接写と光の当たり方が必要です。「型番は?」ならラベル部分の文字が根拠になります。必要な証拠が元画像に写っていない場合は、別角度や接写の追加撮影へ進みます。

マルチモーダル解析では、画像の大きさ、圧縮、送信できる情報量が細部の再現に影響します。画像全体の概要には縮小版が適していても、細かい文字や損傷の確認では元画像または対象範囲の高解像度データが必要です。圧縮前後で細部が変わる可能性を踏まえ、質問に合う準備方法を選びます。

新旧の解析結果が食い違った場合は、次のAndroid操作へ進む前に原因を確認します。別画像を参照していないか、回転や切り抜き位置が正しいか、文字が反射で隠れていないかを見ます。利用者にとって確認できる根拠は、対象画像、読み取った値、結果が得られた範囲です。内部の推論過程ではなく、元画像と照合できる情報を提示します。

操作結果を確認し、画像の取り違えから復旧する

画像から読み取った情報をメモ、予定、連絡、検索などのAndroid操作へ使うときは、解析結果をそのまま確定値にせず、影響が残る項目を先に確認します。レシートから経費メモを作るなら、店名、日付、合計、通貨、用途をプレビューします。エラー画面から問い合わせ文を作るなら、エラーコード、アプリ名、発生時刻、端末状態を確認します。

確認後は、対応するAndroidツールで操作を進めます。操作が完了したら、作成済みのメモ、登録された予定、入力後の画面などを開き、画像から得た値が正しく反映されたかを検証します。ボタン操作が成功したことと、目的の記録が作られたことは別の確認点です。

失敗の兆候確認する内容復旧方法
画像を開けないURIの利用期限、ファイルの移動、認証状態参照を更新するか、同じ画像を再選択する
別の内容が解析された画像識別子、サムネイル、寸法、取得時刻現在の対象を明示し、正しい画像へタスクを結び直す
文字が欠ける切り抜き、解像度、向き、反射、圧縮元画像の該当範囲を高い解像度で再解析する
過去の結果と食い違う参照画像、解析範囲、表示更新、読み取り単位両方の根拠範囲を比較し、利用者の確認を挟む
操作後の記録が見つからない保存先、送信先、処理状態、アプリの応答履歴や対象画面を確認し、状態を確定してから再試行する
画像が古い取得時刻と現在の画面または物の状態最新画像を取得し、新しい参照として明示的に切り替える

期限切れの参照から復旧するときは、別の画像を自動的に代用するのではなく、元画像へのアクセスを更新します。再選択が必要なら、利用者に候補を示し、対象を確認してからタスクへ結び直します。これにより、同じファイル名の別画像や編集後のコピーを誤って解析する可能性を減らせます。

読み取りに確信を持てない箇所では、候補を示して利用者に選んでもらう方法が有効です。たとえば「8,900円」と「3,900円」の判別が難しい場合は、該当箇所を拡大し、元画像と候補値を並べます。確信度の数字だけで確定するより、利用者が目で照合できる根拠を出すほうが、その後のメモや予定へ正しい値を渡せます。

画面操作を伴う場合は、解析したスクリーンショットの状態と現在のアプリ状態が一致しているかも確認します。画面が切り替わった後に古い座標を使うと、別のボタンを選ぶ可能性があります。現在画面を再取得するかUI状態を確認し、最新の対象へ操作を合わせます。

画像アクセスと保存範囲を自分で管理する

画像コンテキストを維持するときは、必要な素材だけを選び、必要な期間だけ利用できる状態にするのが分かりやすい管理方法です。写真ライブラリ全体への広いアクセスより、フォトピッカーで一枚または必要な複数枚を選ぶ方法なら、今回のタスクに使う範囲を利用者自身が指定できます。

Androidで権限要求を最小限にするためのガイドでも、フォトピッカーのような限定的なアクセス方法が案内されています。選択したメディアへの一時的な読み取りアクセスと、長期間の作業に必要なアクセスでは寿命が異なります。タスクが終わった後も参照を保つ必要があるかを、用途ごとに決めます。

画像を渡す前

  • 必要な画像だけを選び、同じような写真が複数ある場合は対象を確認する。
  • 通知、氏名、住所、口座情報、顔、位置情報などの写り込みを見る。
  • 解析に不要な敏感な範囲は、内容を確認したうえで切り抜く。
  • 元画像を使うか、編集済みのコピーを使うかを明確にする。

解析中

  • 現在のタスクに結び付いている画像名、サムネイル、取得時刻を確認する。
  • 追加質問で元画像を再利用するか、新しい画像へ切り替えるかを明示する。
  • 細部を再解析する場合は、必要な範囲と解像度だけを使う。
  • 別サービスへ情報を渡す操作では、送信項目と宛先を確認する。

作業後

  • 作成したメモや予定など、必要な結果だけを残す。
  • 一時的な参照や添付を今後も使うか判断する。
  • 画面キャプチャのセッションを終了し、次回は新しい同意から始める。
  • タスクの目的が変わったら、対象画像とアクセス範囲を選び直す。

MediaProjectionの同意はキャプチャセッションごとに扱われます。現在画面を一度添付したことが、継続的な画面取得の許可として引き継がれるわけではありません。次の画面が必要になった場合は、新しい取得操作と対象範囲を確認します。

画像コンテキストの保存期間と、解析から作成したメモや予定の保存期間も分けます。元画像への参照はタスク終了時に不要になる一方、利用者が確認した経費メモは継続して残す場合があります。何を入力として保持し、何を成果物として保存するかを選べると、後から整理しやすくなります。

文脈を先回りして使うアシスタント全体の権限や提案設定は、スマホのプロアクティブAIアシスタントとは?文脈、提案、実行、プライバシー設定の実用ガイドで詳しく扱っています。画像についても、選択、解析、提案、実行を分けて管理することで、必要な便利さと利用者の判断を両立できます。

FoneClawで画像からAndroid操作へ進む手順

私たちはFoneClawで、写真やスクリーンショットを一回限りの質問材料ではなく、確認可能なタスク入力として扱っています。選択または撮影した画像の識別情報、寸法、参照先を保ち、質問が変わったときは元のピクセルを再解析します。アクセス期限が切れた場合は参照を更新し、同じ画像へ戻れる流れを用意しています。

具体例として、レシートから経費メモと支払確認用のリマインダーを作る手順を見てみましょう。

  1. 画像を用意する。 フォトピッカーからレシートを一枚選ぶか、カメラで全体が読めるように撮影します。FoneClawは画像の寸法と参照を現在のタスクへ結び付けます。
  2. 最初の質問をする。 「店名、日付、合計金額を読み取って」と依頼します。設定したモデルはFoneClaw内で画像と質問を処理し、必要な範囲を解析します。
  3. 別の観点で追加質問する。 「食品以外の品目と税額も確認して」と続けます。以前の回答に情報が足りなければ、FoneClawは同じ画像の明細欄と税欄を再解析します。
  4. 結果を照合する。 店名、日付、通貨、合計、対象品目、税額を元画像と並べて確認します。読み取りが競合する部分は拡大または再撮影へ進みます。
  5. 操作内容をプレビューする。 経費メモの題名と本文、リマインダーの日時を表示します。画像から抽出した値を利用者が修正できます。
  6. 確認後に実行する。 FoneClawの対応するメモや予定のツールを使い、許可されたAndroid操作として作成します。
  7. 結果を検証する。 作成済みのメモまたは予定を開き、内容と日時が確認した値に一致するか確かめます。

この処理では、画像全体を毎回同じ形で送るのではなく、質問、利用可能な情報量、必要な細部に合わせてマルチモーダル入力を準備します。全体把握には適切に圧縮した画像を使い、小さな文字には元の寸法を基準にした範囲を使います。参照が古くなった場合は更新し、処理中は画像準備、解析、確認、Android操作の進行を利用者が追えるようにします。

FoneClawの画像・画面文脈、カメラ、スクリーンショット、メモ、予定、ワークフローなどの対応範囲は、FoneClawの機能一覧で確認できます。実際の動作は、Androidのバージョン、端末権限、対象アプリの状態、地域サービス、設定したモデルの画像理解能力、選んだタスクによって変わります。

最初のテストには、送信や購入を伴わない作業が適しています。エラー画面から問い合わせ用メモを作る、レシートから確認用メモを作る、製品ラベルから型番を抽出して下書きへ入れる、といった流れなら、画像の維持、再解析、確認、結果検証を一通り試せます。現在の入手方法はFoneClawのダウンロードページで案内しています。

画像を覚えているように見えることより、同じ素材へ確実に戻り、新しい質問に必要な証拠を取り直し、確認した値だけを次の操作へ渡せることが重要です。私たちはこの一連の流れを、写真やスクリーンショットからAndroid上の実用的な作業へ進むための基盤として磨き続けています。

よくある質問

会話履歴には以前の解析結果が残る場合がありますが、追加質問へ正確に答えるには元画像へ再びアクセスできる参照が必要です。画像の識別子、寸法、参照先、利用期限を現在のタスクに結び付けておくと、同じ画像のピクセルを再解析できます。
新しい質問が、以前の回答に含まれていない細部を求めるときです。合計金額の後に税額を尋ねる、エラー概要の後にコードを読む、製品全体の後に傷を確認するといった場合は、元画像の必要な範囲を適切な解像度で再解析します。
MediaProjectionによる画面取得は、利用者の同意を伴うキャプチャセッション単位で扱われます。一回限りのトークンを使うため、新しいセッションでは対象画面と取得範囲を改めて確認します。
許可された経路で参照を更新するか、元画像を再選択します。再選択時は、サムネイル、寸法、取得時刻、画像の内容を照合し、同じ素材であることを確認してから現在のタスクへ結び直します。