AIエージェントのタスク別トークン費用:完了1件あたりで測る計算ガイド
AIエージェントのタスク別トークン費用を、入力、キャッシュ、出力、再試行、外部ツール費、完了件数で計算。FoneClawのAndroid実行例と測定手順を整理します。
- AIエージェントの費用は、会話1回ではなく、検証済み完了タスク1件あたりで見ると判断しやすくなります。
- 計算では、未キャッシュ入力、キャッシュ読み取り、課金対象出力、必要に応じたキャッシュ作成・保存・外部ツール費を分けます。
- 例の100件バッチでは、仮定単価でモデル費用3.24ドル、外部ツール費0.10ドル、90件完了なら1件あたり約0.0371ドルです。
- FoneClawの端末側実行や保存済みワークフローは、呼び出し回数や文脈量を変える可能性がありますが、モデル呼び出しゼロ、無料推論、全データ端末内処理を意味しません。
完了タスク1件あたりで測る
AIエージェントのタスク別トークン費用は、モデル単価だけでは判断できません。見るべき単位は「回答1回」ではなく、「検証済みで完了したタスク1件」です。下書きを作っただけなのか、正しい相手の編集欄に入ったのか、送信前に止まったのか、予定が実際に保存されたのかで、同じトークン量でも価値は変わります。
基本式は、測定した総費用を、検証済み完了件数で割ります。総費用には、モデルの入力・出力、キャッシュ、外部ツール、必要ならサブスクリプションやクレジット枠の扱いを入れます。ただし、既に定額やクレジットで含まれている費用を二重に足さないようにします。人間の確認時間や端末の消費電力は、別の列に分けるか、同じ基準で金額換算します。
Androidの複数ステップ作業を測る場合は、完了条件を先に決めます。たとえば「指定アプリで下書きが見える」「送信はしていない」「ユーザーが宛先と本文を確認できる」までを完了にする、という形です。完了条件の作り方は、Android 複数ステップ自動化:意図、確認、実行、検証、復旧まで安全に進める方法と合わせて見ると整理しやすくなります。
プロバイダーの使用量から台帳を作る
実務の台帳では、少なくとも3つを分けます。未キャッシュ入力、キャッシュ読み取り、課金対象出力です。これらは重ならないように集計します。式にすると、モデル費用は「未キャッシュ入力トークン ÷ 100万 × 入力単価」+「キャッシュ読み取りトークン ÷ 100万 × キャッシュ読み取り単価」+「課金対象出力トークン ÷ 100万 × 出力単価」です。
プロバイダーによっては、キャッシュ作成、キャッシュ保存、検索・グラウンディング、コード実行、画像や音声などのモダリティが別料金になる場合があります。GoogleのGemini APIのトークン説明では、テキスト以外に画像などもトークン化され、実際の使用量には入力、出力、思考、キャッシュされた文脈などの項目が出ることが説明されています。料金区分はGemini APIの料金説明でモデルや機能ごとに変わるため、実測時は現在の表示を使います。
キャッシュも注意が必要です。Claudeのプロンプトキャッシュ説明では、キャッシュ書き込み、キャッシュ読み取り、通常の未キャッシュ入力が区別されます。キャッシュに入ったトークンを通常入力として再度足すと二重計上になります。画像トークンが入力使用量に含まれているなら、同じ画像を別の「画像料金」として重ねて足さないようにします。思考トークンや内部推論が出力料金に含まれるか、別項目かもプロバイダーの台帳に合わせます。
仮の100件バッチを再計算する
次の例は、計算方法を示すための仮定です。現在の特定ベンダー価格やFoneClawの価格ではありません。100件の低リスクな下書きタスクを試し、失敗や再試行を含む全呼び出しの合計が、未キャッシュ入力100万トークン、キャッシュ読み取り20万トークン、課金対象出力15万トークンだったとします。仮の単価は、未キャッシュ入力が100万トークンあたり2ドル、キャッシュ読み取りが100万トークンあたり0.20ドル、出力が100万トークンあたり8ドルです。
| 項目 | 数量 | 仮の単価 | 小計 |
|---|---|---|---|
| 未キャッシュ入力 | 1,000,000 | 2ドル/100万 | 2.00ドル |
| キャッシュ読み取り | 200,000 | 0.20ドル/100万 | 0.04ドル |
| 課金対象出力 | 150,000 | 8ドル/100万 | 1.20ドル |
| モデル費用合計 | - | - | 3.24ドル |
| 外部ツール費 | 仮定 | - | 0.10ドル |
| 総費用 | - | - | 3.34ドル |
この100件のうち、完了条件を満たしたものが90件なら、完了1件あたりの費用は3.34ドル ÷ 90で、約0.0371ドルです。ここでは、すべての再試行、失敗、やり直しの呼び出しがすでに入力・出力合計に含まれている前提です。さらに「再試行分」を別に足すと二重計上になります。この例では、キャッシュ書き込み、キャッシュ保存、サブスクリプション、クレジット枠、為替換算は入れていません。実際の台帳では、自分が使うプロバイダーの課金項目だけを足します。
スマホ側実行で変わる可能性があるもの
FoneClawのようなPhone Agentでスマホ側の対応済み操作を使うと、モデル呼び出しの回数、毎回送る文脈、画面確認のやり直し、失敗時の説明量が変わる可能性があります。ただし、スマホ側で実行することは、推論がすべて端末内で行われることや、モデル費用がゼロになることを意味しません。設定したオンラインモデルを使う場合、依頼文や画面文脈がモデル側で処理されることがあります。
FoneClawでは、現在画面から見える情報を確認し、対応するAndroid操作を進めます。表示中の編集欄にテキストを入れることはできますが、それだけで送信、投稿、Enter確定はしません。保存済みワークフローは、対応済みの手順を再利用しやすくするためのものです。将来の実行でモデル呼び出しが不要になる、または必ず安くなる、という意味ではありません。
画面確認も、いつでも同じ費用とは限りません。アクセシビリティで読める画面情報と、スクリーンショットや画像入力は別の扱いです。テキストツリーが常に安い、画像が常に高い、と決めつけず、プロバイダーの使用量に出る入力、画像、キャッシュ、出力を見ます。ローカル実行とクラウド推論の違いは、AIエージェントの信頼性:クラウドAIとローカルAndroid操作をどう見分けるかでも整理しています。
小さな反復タスクで測る
比較するなら、10件程度の同じ低リスク作業から始めます。たとえば、同じメモアプリまたはメッセージアプリで「短い下書きを作り、表示中の編集欄に入れ、送信せずに止まる」というタスクを選びます。端末、アプリ、入力文、完了条件をそろえ、プロバイダーの使用量が見られる場合は記録します。FoneClaw側で対応済みAndroid操作を使う時も、現在画面の確認、入力、承認、結果確認を同じ基準で見ます。
記録する列は、試行番号、完了可否、未キャッシュ入力、キャッシュ読み取り、出力、キャッシュ作成や保存の有無、外部ツール費、再試行回数、確認にかかった時間、承認の有無です。端末の電力まで含めたいなら、増分のWhを測り、Wh ÷ 1000 × 1kWhあたりの自分の電気料金で別列にします。時間と電力を金額換算する場合は、同じ基準で1回だけ足します。
完了件数が0なら、完了1件あたりの費用は0ではなく、未定義です。失敗した理由を見て、必要な権限、画面状態、対象アプリ、入力内容を直します。やみくもに再試行を増やすと、費用だけが増えます。Android上の対応操作と検証の流れは、AIエージェントでAndroidを操作する仕組み:意図、確認、実行、検証までの完全ガイドが参考になります。
確認を削らずに無駄を減らす
費用を下げる時に削ってはいけないのは、宛先、権限、送信前確認です。減らすべきなのは、曖昧な依頼、長すぎる履歴、不要な画像入力、原因を見ない再試行、使われていないキャッシュ前提です。プロバイダーの使用量でキャッシュヒットを確認し、失敗したステップだけを直します。
画面が変わった後は、古い画面情報で進めず、現在の状態を確認します。結果が不明な時は、実際のアプリ状態を見てから次へ進みます。原因切り分けを詳しく行う場合は、スマホAIエージェントの失敗診断と復旧:原因切り分け、権限回復、失敗したツールだけ再実行する手順が役立ちます。FoneClawの現在の対応範囲はFoneClawの機能一覧で確認できます。