RPM・TPM容量計算ガイド
AI APIレート制限計算:RPM・TPMと安全な処理容量
月額費用が予算内でも、ピーク時の呼び出しがRPMやTPMを超えると処理は失敗します。実際のモデル・プロジェクトに適用される上限と1回あたりのトークン数から、安全に処理できるリクエスト数を計算します。
現在の上限を管理画面から集める
同じ提供会社でも、モデル、プロジェクト、利用ティアによって上限は異なります。管理画面やAPIレスポンスから、1分あたりのリクエスト数(RPM)、入力トークン数(入力TPM)、出力トークン数(出力TPM)、日次上限、同時実行数を確認してください。公開表の値を自分のアカウントにそのまま当てはめないことが重要です。
最も小さい処理上限を求める
入力と出力に別のTPM上限がある場合は分けて計算し、最も小さい値を採用します。
RPM上限による容量 = RPM上限
入力TPMによる容量 = 入力TPM上限 ÷ 1回あたりの入力トークン
出力TPMによる容量 = 出力TPM上限 ÷ 1回あたりの出力トークン
安全な処理数 = 3つのうち最小の容量 × 目標使用率
統合TPMだけが示される場合は、どのトークンが計上されるかを公式資料で確認してから割り算します。80%などの目標使用率は突発的な増加への余裕であり、429エラーがゼロになる保証ではありません。
1分あたりの処理容量の例
上限が60 RPM、入力300,000 TPM、出力30,000 TPMで、1回に入力12,000トークン、出力800トークンを使うとします。
- RPMによる容量:60件/分
- 入力TPMによる容量:300,000 ÷ 12,000 = 25件/分
- 出力TPMによる容量:30,000 ÷ 800 = 37.5件/分
入力TPMがボトルネックです。目標使用率を80%にすると、安全な計画値は約20件/分です。1回のユーザー操作でモデルを2回呼ぶなら、ユーザー操作は約10件/分までと考えます。
ピーク負荷から必要なTPMを逆算する
必要な上限は、ピーク時のモデル呼び出し数に1回あたりのトークン数を掛け、目標使用率で割って求めます。毎分8回、入力12,000、出力800トークン、目標80%なら、少なくとも入力120,000 TPM、出力8,000 TPM、10 RPMが必要です。平均値だけでなくp90またはp95の大きなリクエストでも計算してください。
ユーザー操作ではなくモデル呼び出しを数える
AIエージェントは計画、ツール実行、結果確認、回答で複数回モデルを呼びます。PDF要約も分割したページごとの呼び出しと統合要約を含みます。モデルごとのピーク量を分け、負荷テストで確認した再試行分だけ余裕を追加します。
バースト、429、再試行を設計に含める
1時間に600件でも、最初の1分に100件が集中すれば上限を超えることがあります。ワーカーの同時実行数を制限し、超過分をキューへ送り、利用できる場合はRetry-Afterに従います。上限なしの即時再試行は失敗を長引かせるため、上限付きの指数バックオフとジッターを使います。
本番データで見積もりを更新する
代表的な負荷テストと本番運用で、時刻、モデル、入力・出力トークン、429の種類、再試行、キュー深度、p95レイテンシを記録します。会話履歴やRAG文脈が長くなるサービスでは、平均だけでなくトークン数の分布を監視してください。月間費用とピーク容量を一緒に確認する場合は月間AI API費用ガイドも参照できます。
最新の上限は公式資料で確認する
上限と計上方法は変更されます。導入前にOpenAIのレート制限ガイド、Claudeの日本語レート制限資料、Geminiの日本語レート制限資料と自分の管理画面を確認してください。