AI Agent 가이드
📅 2026-08-25 ⏱️ 12분 Dean Dean

Android AI 이미지 컨텍스트: 같은 이미지 후속 질문과 재분석을 이어 가는 방법

Android AI가 사진과 스크린샷의 출처, 크기, 접근 상태를 유지하고 질문이 달라질 때 원본 이미지를 다시 분석하며 후속 작업까지 검증하는 방법을 설명합니다.

Android AI가 같은 스크린샷의 참조와 크기를 유지하고 후속 질문에 맞춰 원본 이미지를 재분석하는 작업 흐름
📋 핵심 요약
  • 연속적인 Android AI 이미지 컨텍스트에는 이전 답변뿐 아니라 어떤 원본 이미지를 사용했는지 식별할 수 있는 참조, 출처, 크기와 접근 상태가 함께 필요합니다.
  • 사진 선택기, 카메라와 화면 캡처는 접근 범위와 결과물이 다르므로 분석 전에 원본 크기, 방향, 잘림, 촬영 시점과 민감한 영역을 확인해야 합니다.
  • 후속 질문이 영수증 합계, 오류 문구, 물체 상태처럼 새로운 시각적 근거를 요구하면 이전 요약에 의존하지 않고 필요한 해상도와 영역으로 원본 픽셀을 재분석해야 합니다.
  • 이미지에서 읽은 값으로 메모, 일정이나 다른 지원 작업을 만들 때는 추출값 미리보기, 사용자 확인, 실행 후 결과 검증과 만료된 첨부의 명시적 갱신이 필요합니다.

Android에서 이미지 맥락을 계속 이어 간다는 것

Android AI 이미지 컨텍스트는 이미지를 한 번 설명하고 끝내는 기능보다 넓습니다. 사용자가 사진이나 스크린샷을 첨부한 뒤 서로 다른 후속 질문을 이어 가더라도, AI가 같은 원본을 정확히 찾아 필요한 부분을 다시 살펴보고 그 결과를 다음 작업에 활용할 수 있어야 합니다. 여기에는 대화 내용과 함께 이미지 자체의 식별 정보, 접근 가능 상태와 이전 분석 기록이 필요합니다.

영수증 사진을 예로 들어 보겠습니다. 첫 질문은 “무엇을 산 영수증이야?”일 수 있습니다. AI는 상호와 주요 품목을 읽어 간단히 요약합니다. 다음에는 “세금과 최종 결제액은 얼마야?”라고 물을 수 있고, 이어서 “반품 기한을 메모로 만들어 줘”라고 요청할 수 있습니다. 세 질문은 같은 사진을 사용하지만 각각 상호·품목, 금액 영역, 날짜와 정책 문구라는 다른 시각적 근거를 요구합니다.

  1. 사용자가 영수증 사진을 선택하고 첫 번째 질문을 보냅니다.
  2. AI는 상호와 품목을 확인해 요약하고 사용한 이미지를 현재 작업에 연결합니다.
  3. 두 번째 질문이 들어오면 금액 영역의 원본 픽셀을 다시 살펴봅니다.
  4. 세 번째 요청에서는 날짜와 반품 문구를 확인한 뒤 메모 후보를 만듭니다.
  5. 사용자가 추출된 날짜와 내용을 검토하고 저장을 승인합니다.
  6. 저장 후 실제 메모가 생성됐는지 결과를 확인합니다.

이 흐름에서 이미지와 이전 답변은 서로 다른 자료입니다. 원본 픽셀에는 글자, 색상, 배치와 물체 상태가 들어 있습니다. 이미지 참조는 AI가 어느 원본을 다시 열어야 하는지 알려줍니다. 이전 분석 결과는 당시 질문에 필요한 내용만 압축한 텍스트입니다. 첫 답변에서 세금이나 반품 문구를 언급하지 않았다면, 그 답변만으로 후속 질문에 정확하게 답하기 어렵습니다.

대화가 이미지를 기억하는 것처럼 보여도 활성 이미지가 어느 파일인지 분명해야 합니다. 사용자가 영수증 다음에 제품 사진을 추가했다면 “여기서 날짜를 찾아 줘”라는 말이 어느 이미지를 가리키는지 확인해야 합니다. 첨부 순서, 사용자 선택과 현재 작업의 연결 상태를 바탕으로 대상을 정하고, 여러 후보가 남아 있으면 미리보기를 보여 사용자가 선택하도록 하는 방식이 안정적입니다.

새로운 질문이 기존 분석 범위를 벗어날 때는 원본 재분석이 필요합니다. 문서의 다른 모서리를 읽거나 작은 오류 코드를 확인하고, 제품 표면의 흠집을 비교하는 일은 이전 요약에 포함되지 않았을 가능성이 큽니다. 반대로 “방금 말한 합계를 원화 형식으로 써 줘”처럼 이미 확인된 값의 표현만 바꾸는 질문은 원본을 다시 열지 않고 처리할 수 있습니다. 좋은 이미지 컨텍스트는 이 두 경우를 구분합니다.

분석할 사진과 스크린샷을 올바르게 가져오기

연속적인 이미지 작업은 올바른 원본을 선택하는 데서 시작합니다. Android에서는 사진 선택기, 카메라 촬영과 화면 캡처가 대표적인 입력 경로입니다. 각 방식은 출처, 접근 범위와 해상도가 다르므로 사용 목적에 맞춰 골라야 합니다.

가져오는 방법적합한 상황확인할 점
사진 선택기갤러리에 저장된 영수증, 문서, 제품 사진이나 기존 스크린샷선택한 항목의 접근 기간, 편집본과 원본 구분, 클라우드 미디어의 현재 이용 상태
카메라 촬영종이 문서, 기기 오류 화면, 제품 상태나 현장 정보전체 해상도 저장 여부, 흔들림, 반사광, 초점과 촬영 방향
현재 화면 캡처앱 오류, 주문 정보, 설정 화면과 웹페이지 상태캡처 동의, 전체 화면과 선택 앱 범위, 알림이나 개인정보 노출

Android 사진 선택기 안내에 따르면 사용자는 전체 미디어 보관함을 열어 주는 대신 자신이 선택한 이미지나 동영상에 접근 권한을 부여할 수 있습니다. 한 장 또는 여러 항목을 선택할 수 있으며, 앱은 선택 결과로 받은 URI를 통해 해당 미디어를 읽습니다. 긴 작업에서 다시 접근해야 한다면 허용된 접근 기간과 유지 방식도 확인해야 합니다.

사진 선택기를 사용할 때는 비슷한 이미지가 여러 장인지 살펴보세요. 같은 영수증을 원본 카메라 사진, 자동 보정본과 메신저 압축본으로 보관하고 있을 수 있습니다. 작은 글자나 제품 손상을 확인해야 한다면 해상도가 높은 원본이 유리합니다. 반대로 민감한 주변 정보가 많이 포함된 사진이라면 필요한 영역만 검토 가능한 형태로 준비하는 편이 좋습니다.

Android 카메라 촬영 기능 안내는 앱이 기본적인 촬영을 카메라 앱에 맡기고 그 결과를 후속 작업에 사용할 수 있는 흐름을 설명합니다. 카메라에서 돌아오는 작은 미리보기와 저장된 전체 크기 사진은 세부 정보가 다를 수 있습니다. 영수증의 작은 숫자나 기기 라벨을 읽으려면 전체 해상도 결과가 현재 분석에 연결됐는지 확인해야 합니다.

촬영 직후에는 이미지 방향과 선명도를 확인합니다. 자동 회전 정보가 적용되지 않으면 문서가 옆으로 눕거나 좌표가 어긋날 수 있습니다. 반사광으로 금액이 지워졌거나 영수증 아래쪽이 잘린 경우에는 AI 분석을 반복하기보다 다시 촬영하는 편이 빠릅니다. 출처와 촬영 시간을 함께 남겨 두면 비슷한 문서 가운데 최신 이미지를 선택하기도 쉬워집니다.

현재 화면은 Android 화면 캡처 동의 절차를 통해 가져올 수 있습니다. MediaProjection 기반 화면 캡처는 각 캡처 세션에서 사용자의 동의를 받고 일회성 토큰을 사용합니다. 흐름에 따라 전체 디스플레이 또는 선택한 앱 창을 캡처할 수 있으므로, 필요한 화면만 선택하면 다른 앱의 알림과 개인정보 노출을 줄일 수 있습니다.

플로팅 도우미에서 지금 보고 있는 화면을 첨부하는 방법이 필요하다면 Android 플로팅 AI 어시스턴트 현재 화면: 묻고 확인하고 실행하는 방법에서 권한 설정과 화면 맥락 확인 순서를 이어서 볼 수 있습니다. 캡처 후에는 상단 알림, 계정 이름, 주소와 결제 정보처럼 질문에 필요하지 않은 영역이 포함됐는지 먼저 살펴보세요.

대화가 이어져도 같은 이미지를 유지하는 기준

같은 이미지 후속 질문이 안정적으로 작동하려면 원본에 지속적으로 연결되는 참조가 필요합니다. 파일 이름만으로는 충분하지 않습니다. Android에서 서로 다른 폴더에 같은 이름의 이미지가 있을 수 있고, 카메라와 스크린샷 앱이 반복해서 비슷한 이름을 만들기도 합니다. 현재 작업 안에서 이미지 하나를 확실하게 식별할 수 있는 값과 출처를 함께 유지해야 합니다.

최소한의 이미지 기록에는 원본을 가리키는 참조, 사진 선택·촬영·화면 캡처 중 어느 경로에서 왔는지, 이미지 형식, 가로와 세로 크기, 방향, 첨부 시점과 현재 작업의 연결 정보가 포함됩니다. 여러 장을 함께 분석한다면 표시 순서와 사용자가 붙인 설명도 도움이 됩니다. “첫 번째 영수증”, “배송받은 뒤 찍은 제품 사진”처럼 사람이 이해할 수 있는 이름을 더하면 이미지 교체 실수를 줄일 수 있습니다.

  • 이미지 식별: 현재 작업 안에서 다른 첨부와 겹치지 않는 참조를 유지합니다.
  • 출처: 사진 선택기, 카메라, 화면 캡처 또는 사용자가 공유한 파일인지 기록합니다.
  • 형식: JPEG, PNG, WebP 등 실제 미디어 형식을 확인합니다.
  • 크기: 원본의 가로와 세로 픽셀을 보존합니다.
  • 방향: 회전 정보가 표시와 분석 좌표에 반영됐는지 확인합니다.
  • 작업 연결: 어느 대화와 요청에서 선택된 이미지인지 묶어 둡니다.
  • 접근 상태: 현재 참조로 원본을 다시 읽을 수 있는지 확인합니다.
  • 분석 기록: 어떤 질문으로 어느 영역을 살펴봤는지 결과와 함께 남깁니다.

이미지 크기는 단순한 부가 정보가 아닙니다. “오른쪽 아래의 오류 코드를 읽어 줘”라는 요청을 처리할 때 자르기 영역과 좌표는 원본 크기를 기준으로 해석됩니다. 이미지가 분석 과정에서 축소됐거나 회전됐다면 원본과 처리본의 크기 관계를 알아야 올바른 영역을 다시 열 수 있습니다. 크기 정보가 사라지면 엉뚱한 모서리를 확대하거나 다른 항목을 선택할 수 있습니다.

참조의 접근 기간도 확인해야 합니다. 사진 선택기에서 받은 URI는 상황에 따라 임시 접근으로 제공됩니다. 대화가 오래 이어지거나 앱이 다시 시작된 뒤에도 같은 미디어가 필요하다면 Android가 허용하는 범위 안에서 접근을 유지하거나 사용자가 이미지를 다시 선택하도록 안내해야 합니다. 접근이 끝난 참조를 다른 이미지로 자동 대체하면 이전 질문과 후속 작업의 근거가 달라집니다.

원격 처리가 필요한 경우에도 사용자는 같은 원본을 가리키는 안정적인 작업 참조를 경험해야 합니다. 실제 접근 주소에는 유효 기간이 있을 수 있으므로 필요할 때 안전하게 갱신하고, 갱신된 참조가 이전 이미지와 같은 자산인지 확인해야 합니다. 주소 자체를 대화에 노출하기보다 이미지 미리보기, 출처와 크기를 보여주는 방식이 이해하기 쉽습니다.

FoneClaw에서 우리는 이미지 첨부와 캡처 결과가 후속 Agent 작업에서도 다시 사용될 수 있도록 이미지 참조와 크기를 유지하는 흐름을 다듬어 왔습니다. 접근 갱신이 필요한 경우에는 현재 작업에 연결된 이미지를 기준으로 첨부를 준비하며, 갱신 과정에서 마지막으로 확인된 이미지와 사용자의 선택이 바뀌지 않도록 처리합니다.

질문이 달라지면 원본 이미지를 다시 분석하기

AI 이미지 재분석은 이전 답변을 다시 읽는 작업이 아니라, 새로운 질문에 필요한 시각적 근거를 원본 이미지에서 다시 찾는 과정입니다. 같은 이미지라도 질문이 바뀌면 살펴봐야 할 영역과 해상도가 달라집니다. 먼저 새 질문이 요구하는 증거를 정하고, 이전 분석 결과에 그 증거가 충분히 포함됐는지 판단해야 합니다.

첫 번째 예는 영수증 금액입니다. 처음에는 구매 품목만 요약했지만 다음 질문이 “할인 후 최종 합계와 세금을 나눠 줘”라면 금액 영역을 다시 읽어야 합니다. 품목 요약에는 소계, 할인, 세금과 결제액의 정확한 숫자가 빠져 있을 수 있습니다. 숫자가 작거나 인쇄가 흐리면 원본에서 해당 부분을 확대하고, 각 값의 라벨과 위치를 함께 확인하는 편이 좋습니다.

두 번째는 오류 스크린샷입니다. 첫 질문에서 “로그인 오류 화면이야”라고 분류했더라도 후속 질문이 “오류 코드와 다시 시도할 수 있는 시간을 알려 줘”라면 작은 안내 문구를 재분석해야 합니다. 화면에 구조화된 버튼과 텍스트 정보가 제공된다면 픽셀 분석과 UI 정보를 함께 활용할 수 있습니다. Android AI 에이전트 화면 이해: UI 트리와 스크린샷을 언제 써야 하나에서 두 방식의 선택 기준을 확인할 수 있습니다.

세 번째는 물체 상태입니다. 제품 사진을 보고 처음에는 모델과 색상을 식별했지만, 다음에 “왼쪽 모서리에 균열이 있는지 봐 줘”라고 물을 수 있습니다. 이 질문은 제품 종류보다 표면의 작은 형태와 빛 반사를 살펴야 합니다. 원본 해상도가 부족하거나 초점이 맞지 않으면 추가 촬영을 요청하는 것이 가장 정확한 다음 단계입니다.

재분석에 사용하는 이미지 준비 방식도 결과에 영향을 줍니다. 고해상도 이미지를 그대로 처리하면 세부 정보가 늘지만 요청 크기와 처리 시간이 커질 수 있습니다. 반대로 과도하게 축소하거나 압축하면 작은 글자와 미세한 손상이 사라집니다. 질문에 필요한 전체 구도와 세부 영역을 구분하고, 적절한 해상도와 이미지 처리 예산을 선택해야 합니다.

문맥이 긴 대화에서는 텍스트와 이미지 입력을 함께 정리해야 합니다. 이전 대화를 압축하더라도 현재 질문, 활성 이미지, 원본 크기와 필요한 분석 영역은 유지해야 합니다. 과거의 모든 설명을 반복해서 보내는 대신, 이번 질문에 필요한 이전 결과와 원본 이미지 참조를 선별하면 분석 초점을 명확하게 잡을 수 있습니다.

새 분석이 이전 결과와 충돌하면 다음 작업을 잠시 멈추고 차이를 보여주는 편이 좋습니다. 앞에서는 합계가 58,900원이라고 읽었는데 확대 분석에서 56,900원으로 보인다면 두 값을 비교하고 원본의 해당 영역을 사용자에게 제시해야 합니다. 일정 생성, 비용 기록이나 메시지 전송은 값이 확정된 뒤 이어 가야 합니다.

FoneClaw에서는 후속 질문이 새로운 시각적 근거를 요구할 때 현재 작업에 연결된 이미지를 다시 준비하고 분석할 수 있습니다. 이미지 크기와 참조를 유지하고, 접근이 만료된 첨부는 갱신한 뒤 멀티모달 요청을 구성합니다. 처리 과정에서는 이미지 크기, 모델이 다룰 수 있는 입력량과 필요한 압축을 함께 고려하며 진행 상태와 복구 경로를 사용자에게 보여주는 방향으로 설계했습니다.

이미지 기반 작업을 검증하고 오류에서 복구하기

이미지 분석 결과가 메모, 일정, 연락이나 다른 Android 작업으로 이어질 때는 추출과 실행 사이에 검토 단계가 필요합니다. 인식한 값이 자연스러운 문장처럼 보여도 날짜, 금액, 전화번호와 수신자는 작은 오류 하나로 결과가 크게 달라질 수 있습니다. 실행 전에 원본 이미지와 함께 핵심 필드를 미리 보여주면 사용자가 빠르게 수정할 수 있습니다.

영수증에서 반품 기한을 찾아 알림을 만드는 경우라면 상호, 구매일, 반품 가능 기간, 계산된 마감일과 알림 시간을 보여줍니다. 오류 스크린샷에서 지원 요청 메모를 만든다면 앱 이름, 오류 코드, 발생 시각과 사용자가 이미 시도한 조치를 확인합니다. 제품 라벨에서 연락처를 읽어 전화를 준비할 때는 번호와 대상 업체를 함께 표시해야 합니다.

실패 신호가능한 원인복구 방법
이전과 다른 이미지가 표시됨여러 첨부의 순서 변경 또는 작업 연결 누락이미지 미리보기와 출처를 다시 보여주고 사용자가 활성 이미지를 선택
첨부를 열 수 없음임시 URI 또는 접근 참조 만료같은 자산의 접근을 갱신하거나 사용자가 원본을 다시 선택
작은 글자가 흐리게 읽힘썸네일 사용, 과도한 압축, 초점이나 해상도 부족전체 크기 원본을 사용하고 필요한 영역을 확대하거나 다시 촬영
이전 답변과 새 결과가 충돌질문별 분석 영역 또는 해상도 차이충돌한 영역을 원본에서 다시 확인하고 사용자 검토 후 값을 확정
추출값은 맞지만 작업 결과가 없음권한 부족, 앱 상태 변경 또는 실행 단계 실패필요한 권한과 대상 앱 상태를 확인하고 지원되는 단계부터 재시도
작업이 완료된 것처럼 보이나 기록이 없음화면 입력 후 제출 실패 또는 네트워크 문제결과 화면, 생성된 일정·메모나 전송 상태를 직접 조회해 확인

실행 성공은 버튼을 눌렀다는 기록만으로 판단하기 어렵습니다. 일정 생성 뒤에는 해당 날짜의 캘린더에서 이벤트를 확인하고, 메모 저장 뒤에는 목록이나 검색 결과에서 새 항목을 찾아야 합니다. 앱을 열거나 설정을 바꿨다면 최종 화면과 상태가 요청에 맞는지 살펴야 합니다. 이렇게 실행 후 증거를 남기면 사용자는 다음 행동을 결정할 수 있습니다.

참조가 만료됐을 때는 조용히 다른 이미지로 넘어가지 않고 갱신 절차를 보여줘야 합니다. 같은 로컬 자산에 다시 접근할 수 있다면 참조를 갱신하고, 접근 권한이 끝났다면 사진 선택기나 캡처 흐름을 다시 엽니다. 사용자가 새 이미지를 선택하면 이전 분석 기록과 분리하고, 새 자산의 출처와 크기를 기준으로 작업을 다시 시작합니다.

인식 결과가 불분명한 경우에는 숫자 하나로 표현된 신뢰도보다 실제 근거가 유용합니다. 읽기 어려운 영역을 잘라 보여주고, 가능한 해석을 제시하거나 더 선명한 사진을 요청하세요. 사용자는 원본과 후보 값을 비교해 확정할 수 있습니다. 이 방식은 금액, 날짜와 주소처럼 후속 작업에 직접 들어가는 값에서 특히 중요합니다.

지원되는 작업을 실행하는 동안 앱 상태가 바뀔 수도 있습니다. 사용자가 다른 화면으로 이동했거나 로그인이 풀리고, 대상 항목이 삭제됐을 수 있습니다. 이때는 이미지에서 추출한 값이 맞더라도 현재 실행 조건을 다시 확인해야 합니다. 이미지 근거와 휴대폰의 현재 상태를 함께 검증하는 것이 이미지에서 행동으로 이어지는 작업의 핵심입니다.

이미지 접근 범위와 보관 기간을 직접 관리하기

이미지는 화면 텍스트보다 더 많은 주변 정보를 담을 수 있습니다. 영수증에는 카드 정보와 주소가, 스크린샷에는 알림과 계정 이름이, 실내 사진에는 사람과 생활 공간이 포함될 수 있습니다. 따라서 필요한 이미지 한 장과 필요한 영역을 의도적으로 선택하는 것이 이미지 컨텍스트 관리의 첫 단계입니다.

Android의 권한 요청 최소화 안내는 전체 미디어 보관함 권한 대신 사진 선택기처럼 범위가 좁은 접근 방법을 활용하도록 권장합니다. 사진 선택기는 사용자가 고른 미디어에 임시 읽기 권한을 제공하므로 이번 작업과 관련된 항목만 선택할 수 있습니다. 여러 장이 필요할 때도 목적에 맞는 사진만 지정하는 편이 관리하기 쉽습니다.

작업 전에는 원본과 질문을 함께 검토합니다. 필요한 정보가 이미지의 일부에만 있다면 계정 번호, 얼굴, 주소나 다른 대화 내용이 포함됐는지 살펴보세요. 캡처 범위를 선택할 수 있는 경우에는 해당 앱 창이나 필요한 화면을 사용합니다. 이미지가 흐리거나 너무 넓다면 민감한 영역을 가리는 것만큼 다시 촬영하거나 더 정확한 화면을 선택하는 방법도 효과적입니다.

작업 중에는 어떤 이미지가 활성 상태인지 확인할 수 있어야 합니다. 여러 장을 비교할 때는 각 이미지에 짧은 이름을 붙이고, AI가 어느 이미지를 근거로 답했는지 표시하는 편이 좋습니다. 새로운 이미지가 추가되더라도 기존 원본과 분석 기록을 덮어쓰지 않고 별개의 자산으로 관리하면 후속 질문에서 혼동을 줄일 수 있습니다.

화면 캡처 동의는 세션 단위로 다뤄집니다. MediaProjection의 일회성 토큰과 사용자 동의는 현재 캡처 흐름을 위한 것이므로, 다음 세션에서 화면이 다시 필요하면 새로운 동의 절차를 거칩니다. 현재 작업에 화면 정보가 더 이상 필요하지 않다면 캡처 세션을 종료하고 이후 요청에서는 사진 선택이나 수동 첨부처럼 목적에 맞는 입력 방식을 선택합니다.

작업이 끝난 뒤에는 대화 기록과 원본 이미지의 보관 기간을 구분해 생각해야 합니다. 추출된 메모나 일정은 사용자가 계속 보관하고 싶을 수 있지만, 그 근거가 된 영수증이나 스크린샷은 작업 완료 후 정리할 수 있습니다. 반대로 보증이나 비용 증빙처럼 이후 재분석이 필요한 이미지는 사용자가 관리하는 위치에 보관하고, 다시 사용할 때 명시적으로 선택하는 흐름이 적합합니다.

  • 작업 전: 필요한 이미지와 영역을 고르고 민감한 정보와 촬영 품질을 확인합니다.
  • 작업 중: 활성 이미지, 사용 목적, 접근 상태와 생성될 후속 작업을 확인합니다.
  • 실행 전: 추출된 날짜, 금액, 주소, 수신자와 제출 내용을 검토합니다.
  • 작업 후: 결과를 확인하고 원본 이미지와 분석 기록의 보관 필요성을 각각 결정합니다.
  • 범위 변경 시: 새 사진을 선택하거나 새로운 화면 캡처 동의를 거쳐 작업 근거를 갱신합니다.

휴대폰 AI가 사용자의 상황을 먼저 감지해 제안하는 더 넓은 맥락 관리가 궁금하다면 스마트폰 선제형 AI 어시스턴트란 무엇인가: 맥락, 트리거, 개인정보 제어에서 접근 시점과 승인 기준을 이어서 확인할 수 있습니다. 이미지 컨텍스트에서도 핵심은 필요한 순간에 필요한 범위를 사용자가 이해하고 선택할 수 있게 하는 것입니다.

FoneClaw에서 이미지부터 Android 작업까지 이어 가기

FoneClaw에서 우리가 구현하는 이미지 작업의 목표는 한 번의 멀티모달 답변보다 지속 가능한 이미지에서 행동으로의 흐름입니다. 사용자가 선택하거나 촬영한 이미지를 현재 작업에 연결하고, 첫 질문에 답한 뒤에도 같은 자산의 참조와 크기를 유지합니다. 새로운 질문이 들어오면 이전 텍스트만 반복하지 않고 필요한 경우 원본 이미지를 다시 준비해 분석합니다.

낮은 위험의 시험으로 영수증 사진을 메모와 알림으로 바꾸는 과정을 사용할 수 있습니다. 먼저 사진 선택기나 카메라로 영수증 한 장을 첨부합니다. 이때 상호, 날짜와 금액 영역이 잘 보이는지 확인하고, FoneClaw 대화에서 표시되는 이미지 미리보기가 선택한 원본과 같은지 살펴봅니다.

첫 질문은 “이 영수증에서 상호, 구매일과 주요 품목을 정리해 줘”처럼 근거가 분명한 내용으로 시작합니다. FoneClaw 안에 구성된 모델은 이미지와 요청을 함께 이해하고 결과를 작성합니다. 사용자는 품목과 날짜가 원본에 맞는지 확인할 수 있습니다. 작은 글자가 흐리다면 더 선명한 사진이나 원본 크기 이미지를 선택해 분석을 다시 시작합니다.

다음에는 질문의 초점을 바꿉니다. “하단에서 최종 결제액과 반품 가능 기간을 다시 찾아 줘”라고 요청하면 이전 품목 요약에 빠졌던 영역이 필요합니다. FoneClaw는 현재 작업에 연결된 이미지 참조를 사용해 원본을 다시 준비합니다. 첨부 접근을 갱신해야 하는 상황에서는 같은 자산을 기준으로 복구하고, 이미지 크기와 질문에 필요한 세부 수준을 고려해 멀티모달 분석을 구성합니다.

결과가 나오면 바로 저장하기보다 추출값을 검토합니다. 상호, 구매일, 결제액, 반품 기한과 원본에서 읽은 문구를 한 번 확인하세요. 날짜 계산이 필요한 경우에는 구매일과 정책 문구를 분리해서 보여주는 편이 좋습니다. 두 분석 결과가 충돌하면 해당 영역을 다시 살펴보고 확정된 값만 후속 작업에 사용합니다.

이제 “반품 기한 이틀 전에 알림을 만들고, 구매 정보는 메모로 저장해 줘”처럼 지원되는 Android 작업을 요청할 수 있습니다. FoneClaw는 필요한 도구와 권한을 확인하고 메모 및 알림 후보를 준비합니다. 사용자는 날짜, 시간, 제목과 메모 내용을 미리 보고 승인할 수 있습니다. 작업 중에는 진행 상태를 확인하고 필요하면 중단하거나 수정할 수 있습니다.

실행 뒤에는 결과를 다시 조회합니다. 생성된 메모에서 상호와 금액이 맞는지, 일정이나 알림이 올바른 날짜에 들어갔는지 확인합니다. 권한 부족이나 앱 상태로 작업이 멈추면 FoneClaw는 필요한 권한과 실패 지점을 보여주고 복구 후 재시도할 수 있게 합니다. 이미지 분석 성공과 Android 작업 성공을 각각 검증하는 이유가 여기에 있습니다.

오류 스크린샷에서도 같은 흐름을 적용할 수 있습니다. 현재 화면을 첨부해 오류의 종류를 묻고, 후속 질문으로 작은 오류 코드와 재시도 조건을 다시 분석합니다. 이어서 지원 문의용 메모를 만들거나 설정 상태를 확인하는 작업을 준비합니다. 화면 캡처, 이미지 분석, 추출값 확인과 실제 휴대폰 작업이 분리되어 있어 사용자는 어느 단계에서 문제가 생겼는지 알 수 있습니다.

FoneClaw의 이미지와 화면 맥락 기능 및 지원 작업은 FoneClaw 기능 안내에서 확인할 수 있습니다. 현재 Android 기기에서 시험하려면 FoneClaw 다운로드에서 배포 방식을 확인한 뒤, 민감하지 않은 사진이나 스크린샷으로 시작하는 것이 좋습니다. 실제 동작은 Android 버전, 권한, 앱 상태, 지역 서비스, 구성한 모델의 이미지 이해 능력과 요청한 작업 범위에 따라 달라집니다.

우리가 FoneClaw를 만들며 계속 다듬고 있는 기준은 단순합니다. 사용자가 선택한 이미지가 대화 도중 바뀌지 않아야 하고, 질문이 달라지면 필요한 픽셀을 다시 살펴봐야 하며, 이미지에서 읽은 값은 실행 전에 확인할 수 있어야 합니다. 마지막으로 Android 작업이 끝났다는 말은 실제 화면이나 생성된 기록으로 검증돼야 합니다. 이 순서가 갖춰질 때 Android AI 이미지 컨텍스트는 일회성 이미지 설명을 넘어 신뢰할 수 있는 작업 입력이 됩니다.

자주 묻는 질문

연속적인 이미지 작업에는 대화 속 설명뿐 아니라 원본 이미지를 다시 찾을 수 있는 참조, 출처, 크기와 접근 상태가 필요합니다. 이미지 접근이 유지되고 현재 작업에 올바르게 연결돼 있으면 후속 질문에서 같은 원본을 다시 분석할 수 있습니다. 여러 이미지를 추가했을 때는 활성 이미지 미리보기를 확인하는 편이 좋습니다.
새 질문이 이전 분석에 포함되지 않은 시각적 근거를 요구할 때 재분석해야 합니다. 영수증의 합계와 세금, 오류 화면의 작은 코드, 제품 표면의 손상처럼 다른 영역이나 더 높은 해상도가 필요한 경우가 대표적입니다. 이전 결과와 새 분석이 충돌하면 값을 확정하기 전에 원본 영역을 다시 확인해야 합니다.
MediaProjection을 사용하는 화면 캡처는 각 캡처 세션에서 사용자의 동의를 받고 일회성 토큰을 사용합니다. 흐름에 따라 전체 화면이나 선택한 앱 창을 캡처할 수 있습니다. 새로운 세션에서 화면 정보가 다시 필요하면 해당 캡처 범위에 맞는 동의 절차를 거칩니다.
같은 자산에 다시 접근할 수 있으면 참조를 안전하게 갱신하고 이미지 식별 정보와 크기를 현재 작업에 유지합니다. 접근 권한이 끝났다면 사용자가 사진 선택기나 캡처 흐름에서 원본을 다시 선택합니다. 새 이미지를 선택한 경우에는 이전 분석과 분리하고 새 미리보기와 출처를 확인한 뒤 작업을 이어 가야 합니다.