APIレートリミットとは
APIレートリミット(API Rate Limit)とは、AIのAPIサービスが一定時間内に受け付けるリクエスト数やトークン数に設定する上限のことです。サーバーの過負荷を防ぎ、全てのユーザーに公平なサービスを提供するために設けられています。OpenAI、Anthropic、Google Cloud AI Platformなど、ほぼ全てのAI APIプロバイダーがレートリミットを設定しています。
| ひとことで言うと | 決まった時間内にAPIを呼び出せる回数の上限。 |
|---|---|
| どこで使う | 生成AI APIを組み込むときの設計、社内ツールの同時アクセス制御。 |
| 注意点 | 超えると429エラーになる。少し待って再送する仕組み(リトライ)が必須。 |
レートリミットの種類
レートリミットには複数の種類があります。RPM(Requests Per Minute:1分あたりのリクエスト数)、TPM(Tokens Per Minute:1分あたりのトークン数)、RPD(Requests Per Day:1日あたりのリクエスト数)などが一般的です。利用プランやTier(利用量に応じたレベル)によって上限値が異なり、高額プランや利用実績の多いユーザーにはより高い上限が設定されます。
1リクエスト送信アプリがAPIを呼ぶ
▶
2回数をカウントサーバー側で集計
▶
3上限内か判定分・時間あたりで比較
▶
4OKなら結果通常どおり応答
▶
5超過なら429待ってから再送する
※ 再送するときは待ち時間を少しずつ延ばす「指数バックオフ」が定番です。
レートリミット対策
レートリミットに達した場合、HTTP 429(Too Many Requests)エラーが返されます。対策としては、指数バックオフ(Exponential Backoff)によるリトライ、リクエストのバッチ処理、キューイングシステムの導入、複数のAPIキーの使い分け、キャッシュの活用によるリクエスト削減などが有効です。プロダクション環境では、レートリミットを考慮したアーキテクチャ設計が重要であり、リクエストの優先度管理やフォールバック戦略を事前に計画しておくことが推奨されます。