ビジョンAI費用ガイド
画像トークンの費用と計算方法
スクリーンショット、領収書、商品写真、スキャン文書をビジョンAIで処理するとき、ファイル容量だけでは費用を計算できません。画像入力、テキスト入力、出力トークンを分け、解像度、detail設定、画像数、再試行まで含めて見積もります。
画像入力とテキストの費用を分ける
ビジョンリクエストには通常、画像入力トークン、指示文などのテキスト入力トークン、生成された出力トークンが含まれます。画像の数え方はプロバイダーやモデルごとに異なるため、JPEGのMB数や文字数をそのまま画像トークンに換算しないでください。
まず実際にAPIへ送る代表画像とプロンプトで入力トークンを測定します。次に予想出力トークンを加え、1件あたりの画像数、ワークフローの呼び出し回数、1日の処理件数、稼働日数、再試行率を掛けると、月間予算の範囲を作れます。
費用を左右する4つの要素
- ピクセル寸法とdetail設定:モデルによっては画像を縮小またはタイル分割し、低detailの設定を別に用意しています。
- 画像枚数:表裏、複数ページ、複数の商品写真を送ると、それぞれの画像入力が加算されます。
- 指示文と出力長:プロンプト、JSONスキーマ、会話履歴、生成された回答も別のトークン費用になります。
- 処理の繰り返し:分類、抽出、検証の各段階で同じ画像を再送すると、呼び出しごとに費用が発生する場合があります。
月間の領収書処理例
1日に500枚の領収書を処理し、1枚ごとに抽出とエラー検証を1回ずつ行うとします。代表サンプルで測定した画像・プロンプト入力が1,200トークン、構造化出力が300トークン、再試行率が5%なら、入力と出力を別々に計算してから、2回の呼び出し、500枚、稼働日数、1.05を掛けます。単価には選択したモデルの最新料金を使います。
品質を保ちながら費用を抑える
必要な文字や欠陥が読める範囲まで画像を切り抜き、不要な余白を除きます。細かな文字や表の構造が不要なら低detailを試し、同じ画像を複数段階で送り直す代わりに、最初の結果を構造化して次の処理へ渡せるか確認してください。
スキャン文書は、ページ画像を直接送る方法とOCRで抽出したテキストを送る方法を同じサンプルで比較します。費用だけでなく、読み取り漏れや表・レイアウトの精度も記録すると、過度な縮小による品質低下を防げます。
公式のトークン数とusageで検証する
画像の計算規則はモデルごとに異なり、変更される可能性があります。公開前に代表画像のセットで、プロバイダーのトークン計数機能と実際のレスポンスのusageを確認してください。最新仕様はOpenAIの画像・ビジョンガイド、Claudeのビジョンガイド、Geminiのトークン計数ガイドで再確認できます。
計算機へ反映する手順
計算機でテキストプロンプトと予想回答の費用を先に計算し、代表リクエストで測定した画像トークンを入力トークンへ加えます。文書ページを画像として処理する場合は、PDF要約費用ガイドでOCR、分割処理、再試行も合わせて確認できます。