AI Agent 每項任務 Token 成本怎麼算:公式、範例帳本與 Android 任務量測
用可重算公式估 AI Agent 每項任務 Token 成本,包含未快取輸入、快取讀取、輸出、重試、圖片與工具費,並說明 FoneClaw 支援的 Android 手機執行如何納入量測。
- AI Agent 每項任務 Token 成本應用「總量測成本 ÷ 已驗證完成任務數」計算,而不是只看單次模型輸入與輸出。
- 成本帳本要把未快取輸入、快取讀取、可計費輸出、快取寫入或儲存、外部工具費與訂閱額度分開,避免重複計算。
- 教學範例中,100 次嘗試、90 次驗證完成、總成本 3.34 美元,換算約每個完成任務 0.0371 美元;這不是任何供應商報價。
- FoneClaw 的手機端支援動作可能改變上下文、重試和人工操作量,但實際模型呼叫、快取命中與費用仍要用供應商用量紀錄量測。
先量每個已完成任務的成本
AI Agent 每項任務 Token 成本,應該從「完成結果」開始算,而不是從單次聊天字數開始算。最實用的公式是:每個已完成任務成本 = 總量測成本 ÷ 已驗證完成任務數。若 100 次任務嘗試中只有 90 次達到你定義的完成標準,分母就是 90,不是 100。
完成標準要先寫清楚。以 Android 任務來說,可能是「草稿已放進正確對話的可編輯欄位,且使用者確認收件人和文字」;也可能是「行事曆事件已建立並打開核對」。如果只是模型回答了步驟,但手機任務沒有完成,就不該算成功。
總量測成本則要分層:模型 API 用量、可能存在的訂閱或額度、外部工具或服務費、使用者檢查時間,以及你是否要另外計入裝置電力。已包含在訂閱或額度裡的部分不要重複計費;需要額外付費的工具、快取儲存或連接外部資料來源的服務,則只在實際適用時加入。
用供應商用量建立成本帳本
成本帳本的核心是把不同類型的用量分開。Gemini 的 Token 計算說明提到,文字與圖片等不同模態都會被計入 Token;實際回應也可能提供輸入、輸出、內部推理用量與已使用的快取內容等欄位。Gemini 的 API 計價說明也提醒,費率會依模型、模態和服務層級不同,某些輸出價格可能已包含內部推理用量,快取儲存或連接外部資料來源的服務也可能另計。
可重用的公式是:模型成本 =(未快取輸入 Token ÷ 1,000,000 × 每百萬未快取輸入單價)+(快取讀取 Token ÷ 1,000,000 × 每百萬快取讀取單價)+(可計費輸出 Token ÷ 1,000,000 × 每百萬輸出單價)。這些費用類別要互斥:若某段內容已被列為快取讀取,就不要同時把它算進未快取輸入;若圖片 Token 已經包含在輸入量裡,也不要再把同一張圖片算第二次。
Claude 的 Prompt caching 說明把快取寫入、快取讀取和一般未快取輸入分開,並要求符合特定條件才會重用快取。這對所有供應商都給出同一個提醒:不要假設快取一定命中,要用實際用量欄位確認。所有失敗嘗試和重試都要包含在總用量中;若你的總用量已包含重試,就不要在最後再乘一次重試係數。
重算一批假設任務帳本
下面是一個完全假設的教學帳本,單價不是任何供應商或 FoneClaw 的現行價格。假設一批 Android 草稿任務包含所有呼叫、重試和失敗嘗試後,總用量如下:未快取輸入 1,000,000 tokens,單價假設為每百萬 2 美元;快取讀取 200,000 tokens,單價假設為每百萬 0.20 美元;可計費輸出 150,000 tokens,單價假設為每百萬 8 美元。
| 項目 | 用量 | 假設單價 | 成本 |
|---|---|---|---|
| 未快取輸入 | 1.00M tokens | 2.00 美元/M | 2.00 美元 |
| 快取讀取 | 0.20M tokens | 0.20 美元/M | 0.04 美元 |
| 可計費輸出 | 0.15M tokens | 8.00 美元/M | 1.20 美元 |
| 模型小計 | 已含全部嘗試與重試 | — | 3.24 美元 |
| 外部工具費 | 假設批次總額 | — | 0.10 美元 |
| 總成本 | 100 次嘗試 | — | 3.34 美元 |
如果這 100 次嘗試中有 90 次達到你定義的「已驗證完成」,每個完成任務成本就是 3.34 ÷ 90,約 0.0371 美元。這個範例沒有加入快取寫入、快取儲存、訂閱費、匯率或人工時間;若你的供應商或內部帳本有這些項目,請加在獨立欄位。若某批任務完成數是 0,成本/完成任務這個指標就是未定義,不應寫成 0。
手機端執行可能改變哪些成本
手機端執行可能改變的是模型需要理解的上下文、重試次數和人工補救量,而不是自動保證省錢。FoneClaw 會讓設定的模型協助理解和規劃,再由支援的 Android 動作處理目前手機上的可見流程;這不代表沒有模型呼叫,也不代表所有推理都在裝置上完成。
舉例來說,FoneClaw 可以讀取支援 App 的目前可見狀態,並把使用者確認過的文字填入已識別的可編輯欄位。這個動作只會填入文字,不會送出、提交或按 Enter。若任務是「把草稿放到正確對話,先不要送出」,成功檢查點就應該是草稿、收件人和欄位狀態,而不是訊息已送出。
保存可重用的支援工具步驟,也可能減少每次從零規劃的負擔;但保存流程不保證未來沒有模型呼叫,也不保證費用一定下降。螢幕可見資訊和截圖也不能簡單比較誰一定便宜,因為實際成本取決於供應商如何計算模態、上下文和快取。若你要先定義什麼叫完整 Android 任務,可參考 Android 多步驟任務自動化指南:意圖、確認、執行、驗證與復原;若要看手機端動作邊界,可讀 AI 代理控制 Android 手機指南:從意圖到確認、執行、驗證與復原。
跑一組可重複的小任務檢查
要比較不同做法,建議先跑 10 次相同、低風險的草稿任務。保持同一支手機、同一個 App、同一段輸入、同一個完成定義。例如:「把這段已確認文字放進指定對話的輸入欄,先不要送出。」每次都記錄是否達成、是否需要人工修正、是否發生重試,以及最後是否能在 App 裡看到預期結果。
若供應商提供用量資料,請記錄未快取輸入、快取讀取、快取寫入或儲存、可計費輸出、內部推理用量、圖片或其他模態、外部工具費和失敗嘗試。若沒有逐任務輸出,至少用批次總用量除以已驗證完成數。不要把同一張截圖同時算成圖片費和已含在輸入中的 tokens;也不要把已包含在供應商輸出價格中的內部推理用量再收一次。
時間和電力可以另列。使用者檢查時間可記錄秒數或分鐘,但不要同時把它算成金錢又再加一次人工費。裝置電力可用「增量 Wh ÷ 1000 × 當地每 kWh 電價」估算,但要承認手機背景耗電和網路狀態會讓數字有波動。要比較本地手機控制與雲端處理取捨,可延伸看 AI Agent 信任指南:本地手機控制與雲端安全怎麼取捨。
減少浪費,但不要省掉必要檢查
降低成本的第一步,是把輸入變清楚:給模型必要欄位、避免整段歷史無限制帶入、用供應商用量確認快取是否真的命中。第二步,是先診斷失敗點再重試:若畫面變了,要重新讀目前畫面;若欄位不可編輯,要讓使用者接手;若結果不明,要先查實際 App 狀態,而不是直接再跑一次。更完整的處理方式可看 手機 AI 代理失敗除錯與復原指南:根因分析、權限修復與安全重跑。
不要為了省 token 而取消必要檢查。收件人、金額、權限、送出、付款、刪除和外部動作都應保留清楚確認;FoneClaw 的全域和個別工具核准政策也應配合任務風險設定。使用 FoneClaw 時,你可以讓支援的 Android 動作讀取目前可見狀態、填入已確認文字、保存可重用步驟,並在外部動作前保留檢查點;目前支援能力可在 FoneClaw 功能頁查看。