AI 에이전트 작업당 토큰 비용: 완료된 Android 작업 기준으로 계산하는 법
AI 에이전트 작업당 토큰 비용을 입력·캐시·출력·재시도·도구 비용으로 계산하고, FoneClaw의 지원 Android 실행이 비용 측정에 어떤 변수를 만드는지 정리합니다.
- AI 에이전트 비용은 시도 횟수가 아니라 검증된 완료 작업당 비용으로 봐야 합니다. 총 측정 비용을 성공적으로 끝난 작업 수로 나누는 방식이 가장 실용적입니다.
- 비용 장부는 서로 겹치지 않는 비캐시 입력, 캐시 읽기, 청구 대상 출력으로 모델 토큰 소계를 만들고, 적용 가능한 캐시 생성·저장·도구·구독 비용은 별도로 기록해야 합니다.
- 예시 장부에서 비캐시 입력 100만 토큰, 캐시 읽기 20만 토큰, 출력 15만 토큰, 외부 도구 비용 0.10달러를 합치면 100회 시도와 90회 완료 기준 작업당 약 0.0371달러입니다.
- FoneClaw의 휴대폰 실행은 지원 Android 작업을 처리하는 예시이며, 그 자체가 무료 추론이나 고정 절감률을 뜻하지 않습니다. 실제 모델 사용량과 완료 결과를 따로 측정해야 합니다.
완료된 작업당 비용으로 보기
AI 에이전트 작업당 토큰 비용은 “한 번 호출이 얼마인가”보다 “검증된 결과 하나를 얻는 데 얼마가 들었는가”로 봐야 합니다. 사용자가 원하는 것은 긴 답변이 아니라 휴대폰에서 끝난 작업입니다. 따라서 기본 공식은 단순합니다. 전체 측정 비용을 검증된 완료 작업 수로 나눕니다. 실패한 시도와 재시도는 이미 전체 비용에 포함되어야 합니다.
완료의 정의도 먼저 정해야 합니다. 예를 들어 Android 메시지 초안 작업이라면 “올바른 대화방이 열렸고, 사용자가 확인할 수 있는 초안이 현재 입력칸에 들어갔다”가 완료일 수 있습니다. FoneClaw의 텍스트 입력은 확인된 편집 필드에 내용을 넣는 동작이며, 전송이나 제출은 별도입니다. Android 작업의 완료 기준을 더 넓게 정리하려면 AI 에이전트 Android 휴대폰 제어: 의도에서 확인, 실행, 검증까지가 기준을 잡는 데 도움이 됩니다.
비용 항목은 모델 API 사용량, 이미 포함된 구독·크레딧 범위, 외부 도구나 서비스 비용, 사람이 검토하는 시간, 별도로 재는 배터리·전력 비용으로 나누어야 합니다. 구독이나 크레딧에 이미 포함된 비용을 다시 API 사용량으로 더하면 이중 계산이 됩니다.
제공자 사용량으로 비용 장부 만들기
Gemini 토큰 문서는 텍스트뿐 아니라 이미지 같은 다른 입력도 토큰화될 수 있고, 실제 응답 사용량에는 입력, 출력, 사고 과정, 캐시된 맥락 같은 사용량 항목이 포함될 수 있음을 설명합니다. Gemini API 가격 문서도 모델, 모달리티, 서비스 계층에 따라 요금 항목이 달라지고, 일부 출력 가격은 사고 토큰을 포함할 수 있으며, 컨텍스트 캐싱·저장·그라운딩이 별도 과금될 수 있음을 보여 줍니다. 실제 비용은 현재 제공자 청구 항목으로 계산해야 합니다.
장부를 만들 때는 서로 겹치지 않는 항목으로 나눕니다. 비캐시 입력 토큰, 캐시 읽기 토큰, 청구 대상 출력 토큰을 각각 기록하고, 제공자가 캐시 생성이나 캐시 저장을 별도로 청구한다면 그 항목을 추가합니다. Claude 프롬프트 캐싱 문서처럼 캐시 쓰기, 캐시 읽기, 일반 입력을 구분하는 제공자도 있으므로, 캐시가 실제로 적용되었는지는 사용량 필드로 확인해야 합니다.
단가가 100만 토큰당 금액으로 주어졌다면 공식은 다음처럼 쓸 수 있습니다.
모델 토큰 소계 = 비캐시 입력 토큰 / 1,000,000 × 입력 단가 + 캐시 읽기 토큰 / 1,000,000 × 캐시 읽기 단가 + 청구 대상 출력 토큰 / 1,000,000 × 출력 단가
총 측정 비용 = 모델 토큰 소계 + 별도 청구되는 캐시 생성·저장 비용 + 적용 가능한 서비스·도구 비용 + 적용 가능한 구독 배분 비용
이미 입력 토큰에 포함된 이미지 토큰을 별도 이미지 비용으로 다시 더하면 안 됩니다. 출력 가격이 사고 토큰을 포함하는 제공자라면 사고 토큰도 다시 더하지 않습니다. 실패한 호출과 재시도는 전체 토큰 합계에 이미 들어 있어야 하며, 나중에 “재시도 비용”이라는 항목으로 한 번 더 더하지 않습니다.
가상의 한 배치 다시 계산하기
아래 숫자는 계산 방법을 보여 주기 위한 가상의 교육용 단가입니다. 특정 제공자나 FoneClaw 가격이 아닙니다. 한 배치에서 100개의 Android 초안 작업을 시도했고, 모든 호출과 재시도를 포함한 사용량이 다음과 같다고 가정합니다.
| 항목 | 가정 사용량 | 가정 단가 | 계산 | 비용 |
|---|---|---|---|---|
| 비캐시 입력 | 1,000,000 토큰 | 100만 토큰당 2.00달러 | 1 × 2.00 | 2.00달러 |
| 캐시 읽기 | 200,000 토큰 | 100만 토큰당 0.20달러 | 0.2 × 0.20 | 0.04달러 |
| 청구 대상 출력 | 150,000 토큰 | 100만 토큰당 8.00달러 | 0.15 × 8.00 | 1.20달러 |
| 모델 토큰 소계 | 전체 재시도 포함 | - | 2.00 + 0.04 + 1.20 | 3.24달러 |
| 외부 도구 비용 | 가정 도구 비용 | - | 0.10 | 0.10달러 |
| 총비용 | 100회 시도 | - | 3.24 + 0.10 | 3.34달러 |
100회 시도 중 90개가 검증된 완료 작업이었다면, 완료 작업당 비용은 3.34달러 / 90 = 약 0.0371달러입니다. 이 배치에서는 캐시 생성 비용, 캐시 저장 비용, 구독 배분 비용, 별도 그라운딩 비용을 넣지 않았습니다. 실제 제공자가 그런 항목을 청구한다면 장부에 추가해야 합니다.
완료가 0개라면 작업당 비용은 0이 아니라 계산 불능입니다. 이 경우에는 비용 절감보다 실패 원인부터 봐야 합니다. 같은 작업을 반복 청구하기 전에 권한, 화면 상태, 입력칸, 모델 응답, 사용자 확인 단계가 어디서 막혔는지 분리하세요. 실패 복구 순서는 휴대폰 AI 에이전트 실패 디버깅과 복구: 권한, 도구 단계, 재시도 실전 런북에서 더 자세히 볼 수 있습니다.
휴대폰 쪽 실행이 바꿀 수 있는 것
FoneClaw의 휴대폰 쪽 실행은 모델 추론이 전혀 없다는 뜻이 아닙니다. FoneClaw는 구성된 모델이 요청을 이해하고 계획하는 데 도움을 주고, 지원되는 Android 작업은 현재 화면 정보와 지원 도구를 통해 진행합니다. 온라인 모델을 구성하면 제공한 맥락이 해당 모델 제공자에게 전달될 수 있습니다. 휴대폰에서 작업이 실행된다는 사실만으로 모든 처리가 기기 안에서 끝나거나 모델 비용이 사라진다고 볼 수 없습니다.
달라질 수 있는 것은 작업을 구성하는 방식입니다. 예를 들어 메시지 앱에서 현재 보이는 입력칸에 초안을 넣는 작업은 지원되는 화면 상태를 확인하고 텍스트를 입력하는 흐름으로 다룰 수 있습니다. 입력은 전송이 아니며, 사용자는 수신자와 전문을 확인해야 합니다. 이런 지원 작업이나 저장된 워크플로는 반복되는 지원 단계를 더 일관되게 정리할 수 있지만, 필요한 실행 단계와 확인이 사라지는 것은 아니며 실제 모델 호출 수와 청구 금액도 측정해야 합니다.
화면 정보도 비용 관점에서 단순하지 않습니다. 접근성 기반 화면 정보와 스크린샷은 서로 다른 도구이며, 어느 쪽이 항상 더 싸다고 일반화할 수 없습니다. 제공자와 작업에 따라 텍스트 맥락, 이미지 토큰, 재시도 횟수가 달라집니다. Android 다단계 작업을 정의하는 법은 Android 다단계 작업 자동화: 확인, 실행, 검증, 복구까지 안전하게 설계하기에서 함께 볼 수 있습니다.
작은 반복 작업으로 측정하기
실제 비교는 작은 반복 작업으로 시작하는 편이 좋습니다. 예를 들어 같은 휴대폰, 같은 앱, 같은 입력 문장으로 “개인 메모 앱의 새 메모 입력칸에 ‘내일 오전 10시에 영수증 정리’ 초안을 넣고, 저장이나 공유 없이 화면에서 확인하기” 같은 낮은 위험 작업을 10회 반복합니다. 비교하려는 설정이 있다면 입력, 기기, 앱 상태, 성공 기준을 모두 같게 맞춥니다. 이 절차는 측정 방법 제안이지 완료된 테스트 결과가 아닙니다.
- 성공 기준을 정합니다. 예: 올바른 앱 화면이 열리고, 초안이 입력칸에 있으며, 저장·공유·전송되지 않았다.
- 제공자 사용량이 보이면 비캐시 입력, 캐시 읽기, 출력, 도구 비용을 기록합니다.
- 스크린샷, 이미지 입력, 사고 토큰, 캐시 생성·저장 비용을 제공자 청구 방식대로만 넣습니다.
- 실패한 호출과 재시도도 같은 배치에 포함합니다.
- 사용자 검토 시간, 승인 단계, 경과 시간을 따로 적습니다.
- 배터리나 전력 비용은 증분 Wh를 측정해 별도 항목으로 둡니다.
에너지 비용을 돈으로 바꾸려면 증분 Wh / 1000 × 현지 전기요금 단가(1kWh당 요금)로 계산합니다. 다만 시간 비용과 에너지 비용을 모두 금액화할지, 별도 지표로 둘지는 일관되게 정해야 합니다. 어떤 방식이든 필수 권한 확인이나 전송 전 검토를 줄여 비용을 낮추는 것은 좋은 절감이 아닙니다.
로컬 실행과 클라우드 처리의 신뢰 경계까지 함께 비교하려면 AI Agent Trust: 클라우드 AI 보안과 로컬 휴대폰 제어를 어떻게 판단할까가 도움이 됩니다.
확인을 줄이지 않고 낭비 줄이기
비용을 줄이는 가장 안전한 방법은 필요한 정보를 명확히 주고, 기록할 맥락을 제한하고, 실패 지점을 먼저 진단하는 것입니다. 긴 대화 전체를 매번 보내기보다 이번 작업에 필요한 수신자, 목적, 초안 조건만 제공합니다. 캐시를 쓴다면 제공자 사용량에서 실제 캐시 읽기가 발생했는지 확인합니다. 반복되는 지원 단계는 저장된 워크플로로 정리할 수 있지만, 필요한 실행과 검토 단계를 건너뛰거나 향후 모델 호출이 0이 된다고 가정하지 말고 계속 측정해야 합니다.
반대로 줄이면 안 되는 항목도 있습니다. 권한 확인, 수신자 확인, 전송 전 검토, 결제나 계정 변경 같은 민감 작업의 승인 단계는 비용 절감 대상이 아닙니다. FoneClaw의 지원 Android 작업 범위는 FoneClaw 기능 페이지에서 확인할 수 있습니다. 좋은 비용 설계는 더 적게 확인하는 것이 아니라, 성공 가능성이 높은 작은 작업을 명확히 정의하고 실패를 반복 청구하지 않는 것입니다.