エージェント運用の予算設計

AIエージェントのAPI費用を計算する方法

AIエージェントでは、ユーザーに見える1回の実行でも、計画、ツール呼び出し、結果の読み込み、検証、修正のために複数回モデルを呼び出します。単発リクエストではなく、ワークフロー全体と成功タスクあたりの費用を見積もります。

まず実行をモデル呼び出し単位に分ける

実際の処理順に、最初の指示、ツール選択、ツール結果を含む次の判断、最終回答、検証や修正を並べます。各呼び出しについて、システム指示、ユーザー入力、過去のメッセージ、ツール定義、ツール結果、出力トークンを記録してください。前の結果を後の呼び出しへ再送する構成では、入力文脈が段階ごとに増えます。

エージェント費用の基本式

1回のモデル費用 = (通常入力 × 入力単価 + キャッシュ済み入力 × キャッシュ単価 + 課金対象出力 × 出力単価) ÷ 1,000,000

1回のタスク試行費用 = 全モデル呼び出しの合計 + ツール実行費用

月間費用 = 初回試行の合計 + 再試行の合計 + 共通インフラ費用

成功タスクあたりの費用 = 全試行の総費用 ÷ 完了したタスク数

入力単価と出力単価は利用するモデルの100万トークンあたりの料金を使います。通常入力とキャッシュ済み入力を重複して数えず、モデルを使い分ける場合は呼び出しごとに別の単価で計算します。ツール呼び出しを要求するモデル応答と、外部APIや検索を実行する費用も区別します。

例:4回のモデル呼び出しを行うサポート処理

固定指示が8,000トークン、依頼が600トークン、3つのツール結果が各1,500トークンとします。最初の3回はツール引数を200トークンずつ出力し、4回目は600トークンの回答を出します。過去のメッセージとツール結果をすべて保持すると、入力は8,600、10,300、12,000、13,700トークンです。

合計は入力44,600トークン、出力1,200トークンです。新しく得たツール結果は合計4,500トークンですが、後の呼び出しで再び処理されるため、総入力とは一致しません。最初の入力に4を掛ける方法では、増えていく文脈を正しく表せません。

仮に入力単価が100万トークンあたり2ドル、出力単価が8ドルなら、モデル費用は0.0988ドルです。さらに3つのツールが各0.005ドルなら、初回試行は0.1138ドルになります。これは計算方法を示す例であり、特定モデルの料金ではありません。必ず提供元の最新料金に置き換えてください。

再試行は失敗率だけで計算しない

最後の回答だけを作り直す再試行と、ツール実行を含めて最初からやり直す再実行では追加費用が違います。タイムアウト、検証エラー、ツール障害ごとに、追加されるモデル呼び出しとツール回数を分けてください。失敗したタスクにも費用は発生するため、総支出を成功件数で割った「成功タスクあたりの費用」を運用指標にします。

費用を抑える確認項目

公開後はタスク単位で実測する

タスクIDと試行IDを付け、モデル、入力・出力・キャッシュ済みトークン、ツール結果の大きさ、呼び出し回数、再試行理由、成功可否を記録します。平均値だけでなく、通常タスクと長時間タスクを分けて比較し、月間件数は月間AI API費用ガイドで予算へ展開してください。

エージェントのトークン費用を計算