화면 녹화와 음성 설명을 재사용 가능한 폰 에이전트 스킬로 바꾸는 과정, Android 상태 변화, 권한 설계, 테스트와 복구 기준을 설명합니다.
매번 긴 명령을 작성하지 않고 직접 한 번 보여 주면 AI 에이전트가 그 작업을 배울 수 있을까? 학습 시범 방식의 핵심은 사용자가 화면에서 수행한 행동과 그 이유를 함께 관찰한 뒤, 우연히 발생한 클릭은 버리고 반복 가능한 규칙을 찾아내는 데 있다. 녹화 영상 자체가 완성된 스킬이 되는 것이 아니라, 재사용할 수 있는 작업 정의를 만들기 위한 입력 자료가 되는 셈이다.
2026년 7월 22일 ITmedia가 보도한 Claude Cowork의 Record a Skill은 이 방식을 구체적인 제품 상호작용으로 보여 줬다. 보도에 따르면 사용자가 작업을 수행하면서 말로 설명하면 해당 과정을 기록하고 재사용 가능한 스킬로 변환한다. 하루 앞서 공개된 Android Authority의 사용 보고서도 화면을 녹화하는 동안 사용자가 업무 흐름을 설명하며, 반복 작업을 위해 매번 같은 지시를 작성하는 부담을 줄이는 기능이라고 전했다.
이 신호를 Android phone agent에 적용할 때는 네 가지 개념을 구분해야 한다. 프롬프트는 원하는 결과를 말로 설명한다. 매크로는 정해진 입력과 클릭 순서를 같은 방식으로 반복한다. 화면 재생은 녹화된 행동을 시간 순서대로 재현한다. 시범 학습은 행동과 설명에서 목표, 선택 조건, 바뀔 수 있는 값, 실패 조건을 추출한다. 모델 훈련은 더 넓은 데이터로 모델 자체의 능력이나 가중치를 바꾸는 과정이므로 한 사용자의 작업을 스킬로 저장하는 것과도 다르다.
| 방식 | 저장하는 것 | 변화 대응 | 알맞은 작업 |
|---|---|---|---|
| 프롬프트 | 자연어 요청 | 모델 해석에 따라 달라짐 | 일회성 또는 유연한 요청 |
| 매크로 | 고정된 키·클릭 순서 | 화면이 같을 때 강함 | 결정 없이 반복되는 안정된 화면 |
| 화면 재생 | 녹화 당시의 행동과 위치 | 앱 상태가 바뀌면 취약함 | 시연과 검토 |
| 시범 기반 스킬 | 목표, 규칙, 변수, 예외와 결과 | 현재 상태를 읽고 계획을 조정 | 조건이 달라지는 반복 업무 |
| 모델 훈련 | 모델의 일반화된 능력 | 훈련 범위에 따라 달라짐 | 여러 작업에 쓰이는 기반 능력 개선 |
따라서 좋은 시범은 손가락의 이동 경로보다 판단 이유를 잘 전달해야 한다. “이 버튼을 누른다”보다 “이 상태가 승인 대기일 때만 처리한다”가 더 재사용 가능한 정보다. Claude Cowork가 모바일 에이전트 인터페이스에 주는 인접한 의미는 Claude Cowork가 휴대폰으로 온다는 것: AI 에이전트 인터페이스의 변화에서 이어서 살펴볼 수 있다.
화면 녹화 한 편을 실제 스킬로 만들려면 무엇을 더 해야 할까? 단순한 동영상에는 사용자가 무엇을 보았는지, 왜 특정 선택을 했는지, 다음 실행 때 어떤 값이 바뀌어야 하는지가 충분히 담기지 않는다. 신뢰할 수 있는 스킬은 녹화, 음성 설명, 규칙 추출, 변수화, 포장과 호출이라는 여러 단계를 거쳐야 한다.
이 과정에서 가장 어려운 부분은 어떤 클릭이 업무 규칙이고 어떤 클릭이 당시 화면 때문에 생긴 우연인지 가려내는 일이다. 예를 들어 사용자가 목록을 한 번 아래로 스크롤한 것은 특정 항목이 화면 밖에 있었기 때문일 수 있다. 재사용 스킬은 ‘한 번 스크롤’이 아니라 ‘조건에 맞는 항목을 찾을 때까지 목록을 탐색’하는 행동으로 일반화해야 한다.
모델은 사용자의 설명에서 목표와 규칙을 추론하고 다음 실행을 계획하는 데 강점을 제공할 수 있다. 그러나 실제 Android 행동은 지원 앱, 현재 화면, 권한과 기기 상태에 맞는 수행 계층이 필요하다. 여러 단계의 자연어 작업을 Android 흐름으로 연결하는 방법은 한 번의 음성 명령으로 Android 작업 자동화하기: FoneClaw 고급 가이드에서 더 자세히 확인할 수 있다.
어제 녹화한 터치 순서가 오늘 같은 앱에서 실패하는 이유는 무엇일까? Android 화면은 고정된 무대가 아니다. 기기 크기와 글자 배율, 앱 버전, 로그인 상태, 서버에서 내려온 데이터, 언어, 접근성 설정과 권한 상태에 따라 같은 목표로 가는 화면이 달라질 수 있다.
가장 단순한 변화는 위치 차이다. 작은 화면에서는 버튼이 아래로 밀리고, 큰 글자를 사용하면 한 줄 메뉴가 두 줄로 바뀔 수 있다. 반응형 레이아웃은 세로와 가로 모드에서 구성 자체를 바꾼다. 좌표를 저장한 매크로는 이러한 변화에서 잘못된 항목을 누를 수 있지만, 의미 기반 스킬은 버튼의 역할과 현재 화면 구조를 다시 읽어 대상을 찾아야 한다.
계정 상태도 경로를 바꾼다. 처음 실행한 계정에는 이용약관이나 권한 요청이 나타나고, 기존 사용자는 곧바로 홈 화면에 들어갈 수 있다. 읽지 않은 알림, 장바구니 항목, 저장된 주소나 이전 검색 결과도 다음 화면을 달라지게 한다. 스킬은 특정 화면이 반드시 나타난다고 가정하기보다 현재 상태를 확인하고 이미 완료된 단계를 건너뛸 수 있어야 한다.
언어와 지역 설정은 화면 텍스트, 날짜, 숫자와 메뉴 순서에 영향을 준다. 버튼 이름을 한 언어로만 기억하면 동일한 의미의 현지화된 화면을 놓칠 수 있다. 접근성 트리도 앱 구현에 따라 달라진다. Android 접근성 서비스 안내는 접근성 서비스가 화면의 사용자 인터페이스 요소와 이벤트를 다루는 플랫폼 구조를 설명한다. 다만 모든 앱 요소가 항상 동일한 의미와 품질로 노출되는 것은 아니므로 보이는 화면, 구조 정보와 작업 결과를 함께 판단해야 한다.
권한 창은 특히 중요한 분기다. 카메라, 마이크, 연락처, 알림이나 파일 접근이 처음 필요한 순간 Android가 시스템 대화상자를 표시할 수 있다. 이 화면은 일반 앱 콘텐츠가 아니며 사용자의 선택을 요구한다. 재사용 스킬은 허용 버튼을 무조건 누르는 순서를 저장하는 대신, 요청된 권한과 작업 목적을 연결해 사용자에게 보이고 필요한 결정을 맡겨야 한다.
폰 에이전트 시범 학습의 목표는 모든 변화에 임의로 대응하는 자율성을 주는 것이 아니다. 정상적으로 처리할 수 있는 변형과 사용자 확인이 필요한 예외, 실행을 멈춰야 하는 상태를 구분하는 데 있다. 휴대폰 에이전트를 별도 환경에서 훈련하고 일반화하는 연구 방향은 PhoneBuddy-4B와 휴대폰 Agent 학습: Mock-App RL이 Android Agent에 중요한 이유에서 인접한 관점으로 확인할 수 있다.
시범 녹화에는 무엇을 보여 주고 무엇을 제외해야 할까? 화면 기록은 작업 방법뿐 아니라 알림, 계정명, 메시지, 주소와 입력 중인 값까지 담을 수 있다. 재사용 스킬을 만들기 위한 자료라면 실제 개인정보를 수집하는 대신 의사결정 구조와 기대 결과를 전달하는 데 집중해야 한다.
Android MediaProjection 문서는 디스플레이 콘텐츠를 캡처하는 각 세션마다 사용자 동의를 요구하며, 캡처된 화면을 안전하게 취급해야 한다는 기대를 설명한다. 녹화 권한은 계속 유지되는 포괄 권한이 아니라 사용자가 해당 세션을 시작하도록 승인하는 플랫폼 기능이다. 화면 녹화 기반 학습을 설계할 때도 캡처 시작과 종료가 분명하게 보이고 사용자가 언제든 중단할 수 있어야 한다.
녹화 전에 테스트 계정과 가상 데이터를 준비하는 것이 가장 효과적이다. 실제 고객명 대신 예시 이름을 쓰고, 테스트 문서와 임시 연락처를 사용하며, 결제나 인증 단계는 모의 화면 또는 결제 직전의 안전한 지점까지만 시범 보인다. 비밀번호, 카드 및 계좌 정보, 개인 대화, 건강 정보, 인증 코드와 복구 키는 녹화 화면이나 음성 설명에 포함하지 않는다.
| 녹화에 담을 내용 | 담지 않을 내용 | 대체 방법 |
|---|---|---|
| 작업의 시작 상태와 목표 | 실제 계정 비밀번호 | 이미 로그인된 테스트 계정과 로그인 이후 흐름 사용 |
| 항목을 선택하는 업무 규칙 | 실제 고객·환자·직원의 개인 데이터 | 형식만 같은 가상 데이터 사용 |
| 정상 결과와 오류 표시 | 카드 번호, 계좌 정보, 결제 인증값 | 모의 주문 또는 결제 확인 직전까지 시범 |
| 사용자 확인이 필요한 지점 | 문자나 인증 앱의 일회용 코드 | ‘여기서 사용자가 직접 인증’이라는 규칙으로 표시 |
| 품절·중복·권한 부족 때의 처리 | 비공개 대화와 민감한 알림 | 알림을 정리하고 방해 금지 상태에서 녹화 |
좋은 음성 설명은 화면에 보이는 내용을 그대로 읽지 않는다. “파란 버튼을 누릅니다”보다 “검토 상태가 완료이고 오류가 없을 때만 제출합니다”가 더 가치 있다. 반대로 녹화 중 예외가 발생하면 숨기지 말고 중단 이유와 올바른 다음 행동을 설명한다. 스킬이 학습해야 하는 것은 성공 경로뿐 아니라 잘못된 상태에서 실행하지 않는 기준이기 때문이다.
Android 개인정보 보호 및 보안 안내는 권한과 민감한 데이터 접근을 작업 목적에 맞게 제한된 플랫폼 기능으로 다룬다. 시범에서 특정 데이터에 접근했다고 해서 재사용 스킬에 같은 접근을 항상 부여할 이유는 없다. 실제 실행 때 필요한 권한을 다시 연결하고, 새로운 데이터 범위가 요구되면 사용자에게 확인받는 구조가 적합하다.
한 번 성공한 시범을 바로 반복 업무에 써도 될까? 안정적인 스킬은 녹화와 다른 조건에서도 같은 목적을 달성하는지 확인해야 한다. 테스트는 클릭을 정확히 재현하는지보다 입력값과 화면 상태가 바뀌었을 때 올바른 판단을 내리고 위험한 상황에서 멈추는지를 검증해야 한다.
첫 단계는 시험 실행이다. 실제 전송, 삭제, 게시, 구매를 수행하지 않고 에이전트가 선택할 항목과 준비한 입력, 필요한 권한, 최종 행동을 미리 보여 준다. 사용자는 스킬이 어떤 규칙을 추출했는지 확인하고 잘못 일반화된 부분을 수정할 수 있다. 정상 흐름이 확인된 뒤에도 처음 몇 차례는 결과가 큰 마지막 단계에서 명시적으로 승인하는 편이 좋다.
변형 테스트에는 최소한 빈 목록, 항목 하나, 이름이 비슷한 여러 항목, 느린 네트워크, 권한 거부, 로그인 만료, 언어 변경과 앱 업데이트 상태가 포함되어야 한다. 수신자가 없을 때 임의의 사람을 선택하거나, 버튼을 찾지 못했을 때 가까운 위치를 누르는 행동은 실패로 처리한다. 올바른 대응은 현재 상태를 알리고 입력을 다시 요청하거나 사용자가 이어서 처리할 수 있는 지점을 보여 주는 것이다.
스킬 자체가 정상이어도 실행 중 상황은 달라질 수 있다. 사용자가 시범에서 허용한 파일 접근이 새로운 폴더까지 자동으로 확대되어서는 안 되며, 메시지 초안을 만드는 권한이 전송 승인까지 포함한다고 간주해서도 안 된다. 스킬의 검사 결과와 실제 실행 권한을 분리하는 이유는 AI 에이전트 스킬 보안: 검사 통과보다 실행 중 권한 확인이 중요한 이유에서 더 자세히 다룬다.
운영 기록은 문제를 재현하는 데도 필요하다. 어떤 스킬 버전이 어떤 입력과 앱 상태에서 실패했는지 알 수 있어야 수정이 가능하다. 신원, 권한, 작업 기록과 복구를 하나의 통제 구조로 보는 방법은 AI 에이전트 신원, 권한, 감사 추적: 폰 에이전트에 필요한 안전 스택에서 이어진다.
FoneClaw 관점에서 좋은 재사용 작업은 무엇일까? 한 번의 화면 녹화를 그대로 따라 하는 기능보다 목표와 입력, 지원되는 Android 행동, 권한, 확인 지점과 성공 결과가 명확한 작업이 중요하다. 설정된 모델은 사용자의 언어를 이해하고 현재 상황을 추론하며 다음 단계를 계획한다. FoneClaw는 그 계획을 지원되는 Android 휴대폰 행동으로 옮기고 진행 과정과 결과를 화면에 보여 준다.
현재 FoneClaw의 제품 범위는 녹화 파일을 넣어 자동으로 새 폰 스킬을 생성하는 기능이 아니다. 대신 구성 가능한 모델의 계획 능력과 FoneClaw가 지원하는 Android 작업을 결합해 반복 흐름을 수행한다. 이 구분은 시범 기반 학습의 원칙을 제품에 적용할 때 중요하다. 녹화에서 추출한 아이디어가 있더라도 실제 작업은 지원 행동, Android 권한, 앱 상태와 사용자 확인에 맞춰 구성되어야 한다.
재사용 흐름을 설계할 때는 먼저 결과를 정의한다. 예를 들어 “앱을 열고 세 번 누른다”보다 “미처리 항목을 찾아 필요한 내용을 준비하고 전송 직전에 검토를 요청한다”가 좋은 작업 정의다. 모델은 대상과 조건을 해석할 수 있고, FoneClaw는 지원되는 검색, 이동, 선택과 입력 행동을 수행한다. 대상이 여러 개거나 현재 화면이 예상과 다르면 결과가 큰 행동을 서두르지 않고 사용자에게 선택지를 보여 줄 수 있다.
권한도 작업별로 연결한다. 연락처를 찾는 흐름, 파일을 첨부하는 흐름, 알림을 확인하는 흐름은 서로 다른 Android 권한과 앱 상태를 요구할 수 있다. FoneClaw는 필요한 권한을 고려해 진행하며 사용자가 현재 단계를 확인할 수 있게 한다. 전송, 삭제, 구매 또는 계정 변경처럼 결과가 큰 행동은 명시적인 확인을 중심에 둔다.
예상한 앱 요소를 찾지 못하거나 지원되지 않는 화면에 도달했을 때는 실용적인 다음 방법을 제공한다. 사용자가 직접 필요한 단계를 마친 뒤 이어서 진행하거나, 입력을 수정하거나, 현재까지 준비된 결과를 검토할 수 있다. 실패를 숨긴 채 임의의 클릭을 계속하는 것보다 어디까지 완료됐는지 보여 주는 편이 반복 업무의 신뢰성을 높인다.
장기적으로 시범 기반 스킬이 Android phone agent에 자연스럽게 연결되려면 세 가지 요소가 필요하다. 모델이 시범에서 규칙과 변수를 추출해야 하고, Android 수행 계층이 변화한 화면에서 지원 행동을 안전하게 실행해야 하며, 사용자가 권한과 중요한 결과를 통제할 수 있어야 한다. FoneClaw는 이 가운데 구성된 모델의 이해·추론·계획과 지원되는 Android 행동, 화면에 보이는 결과, 권한을 고려한 흐름, 사용자 확인 및 실용적인 다음 경로를 하나의 작업 경험으로 연결한다.