2026年版OpenRouter代替サービス:実践的な比較

OpenRouterの代替サービスは、すべてを同種のゲートウェイとして扱わなければ比較しやすくなります。OpenRouterとTokenhotは複数企業のモデルへのアクセスを集約します。Together AI、Groq、Fireworks AIは、特にオープンウェイトモデル向けのホスト型推論に重点を置いています。専用デプロイは、自社管理インフラで推論を実行することとは異なります。
この比較は2026年9月14日に各ベンダーのドキュメントと照合しました。カタログ、料金、制限、ポリシーは変わるため、本番移行前にリンク先ページと契約を確認してください。本記事ではプロバイダー横断ベンチマークを実行していません。
OpenRouter代替サービスの概要
| サービス | 最も適した用途 | 配置とルーティングの制御 | テストすべき重要な制限 |
|---|---|---|---|
| OpenRouter | 多数のモデル開発元と推論プロバイダーを1つのAPIで利用 | プロバイダーの順序、フォールバック、プライバシーフィルター、性能設定 | モデルとエンドポイントによって互換性、ポリシー、性能が変わる |
| Tokenhot | ディレクトリ掲載モデルに対する1つの文書化済みAPIキーとOpenAI互換エンドポイント | 1つのベースURLからモデルを切り替え | 公開ドキュメントでは包括的ZDR、SLA、自社ワークロードの実測レイテンシは確認できない |
| Together AI | オープンウェイトモデルとカスタムモデルのホスティング | サーバーレス、予約ハードウェア、オートスケーリング、ファインチューニング | 互換性マトリクスにResponsesは掲載されず、他の複数のOpenAI形式ワークフローも明示的に非対応 |
| Groq | 現在のカタログをGroqインフラで実行するホスト型推論 | サービスティアとアカウント固有のレート制限 | 複数プロバイダーのアグリゲーターよりカタログと対応パラメーターが狭く、一部のOpenAIフィールドはエラーになる |
| Fireworks AI | オープンモデル推論、構造化出力、ファインチューニング | サーバーレスと専用GPU、カスタムモデル、JSON Schema、grammar | 専用環境の課金とモデル固有の動作はテストが必要 |
1. OpenRouterは引き続きルーティングの基準
OpenRouterは自動的に置き換えるべきサービスではなく、比較の基準です。プロバイダーのルーティング制御では、プロバイダーの順序指定や除外、フォールバックの許可、パラメーター対応の必須化、価格上限の設定、最近のレイテンシまたはスループットのパーセンタイル優先が可能です。
現在のプライバシードキュメントは、よくある誤解も訂正しています。OpenRouterによると、OpenRouter内でのプロンプト保持はオプトインですが、リクエストメタデータは保存されます。プロバイダー層では、エンドポイントごとにポリシーが異なる場合があります。リクエストにprovider.zdr: trueを設定すると、ゼロデータ保持と表示されたエンドポイントだけへ送信できます。要件を満たす対象エンドポイントがなければ、可用性が低下したり、リクエストが失敗したりする場合があります。すべてのルートで同じポリシーが適用されると仮定せず、OpenRouter ZDRガイドを確認してください。
プロバイダー単位のルーティング、幅広いカタログ、一括請求が重要ならOpenRouterを選びます。離れる前に、プロバイダー固定、require_parameters、ZDRの強制で元の問題を解決できないか確認してください。
2. 1つのエンドポイントで統合モデルアクセスを提供するTokenhot
TokenhotのQuick Startには、1つのAPIキー、ベースURLhttps://api.tokenhot.ai/v1、OpenAI互換のチャットレスポンスが記載されています。現在のIDと公開料金はモデルディレクトリで確認します。複数ベンダーのモデルファミリーを使うアプリケーションに適する場合があります。推論モデルを評価するチームは、DeepSeek APIアクセスガイドとLLM API料金計算方法も利用できます。
互換性はエンドポイントごとに確認してください。Quick Startでは、OpenAI SDKからの移行は通常APIキーとベースURLを変更すると説明されていますが、すべてのエンドポイントやパラメーターが全モデルで動作する証拠ではありません。ストリーミング、ツール、構造化出力、usageフィールド、エラー、キャンセルをテストしてください。
プライバシー規約では、リクエストメタデータを記録し、プロンプトと生成コンテンツを一時的にキャッシュする可能性があり、リクエスト内容を上流のモデルプロバイダーへ送信するとされています。同ページでは、上流での処理が各ベンダーのポリシーに従うことも説明されています。保持要件があるチームは、適用されるキャッシュ、削除、上流、データ所在地、契約条件を書面で取得してください。
3. オープンウェイトモデルと予約ハードウェア向けのTogether AI
Together AIは、オープンウェイト推論に適した候補です。推論の概要では、同じAPIを通じてサーバーレスと専用エンドポイントを提供しています。専用エンドポイントはGPUを予約し、対応するカスタムモデルやファインチューニング済みモデルをホストでき、ハードウェアの稼働中は課金されます。
Togetherは、OpenAI互換のchat、ストリーミング、ビジョン、ツール、構造化出力、embeddings、画像、音声を文書化しています。互換性マトリクスにはResponses APIが掲載されていません。モデルIDには名前空間があり、OpenAI形式のassistants、threads、runs、batchesは、差し替えるだけで使える機能ではないと明記されています。掲載されていないエンドポイントは、依存する前に確認してください。
Togetherのプライバシードキュメントによると、プロンプトとレスポンスはデフォルトで保存され、製品改善に使われる場合があります。組織管理者は保存を無効にしてZDRを有効化できますが、その場合はpassthroughモデルも無効になります。学習データ共有は別のオプトイン設定で、デフォルトでは無効です。TogetherがホストするサードパーティモデルはTogetherのインフラで動作しますが、passthroughルートでは上流プロバイダーのポリシーに従ってコンテンツが転送されます。組織のキーに適用される設定を確認してください。
4. ホスト型カタログに適合するワークロード向けのGroq
対応モデルと生成レイテンシがカタログの広さより重要な場合、Groqはテストする価値があります。現在のモデルカタログでは、速度、コンテキスト、料金、制限を公開しています。これらはベンダーが示す数値であるため、自社のプロンプト長、地域、同時実行数、出力サイズでテストしてください。
Groqのエンドポイントは、おおむねOpenAI互換です。互換性ガイドには400レスポンスの原因になる非対応フィールドが掲載されているため、ベースURLの変更だけで移行が完了すると仮定してはいけません。制限はモデルとプランによって異なります。レート制限ガイドでは、429の処理とレスポンスヘッダーを説明しています。
Groqデータガイドによると、推論コンテンツはデフォルトで保持されませんが、信頼性と不正利用監視の例外があります。顧客はZDR制御を有効化できます。Batchとファインチューニングはアプリケーションの状態を保持します。ZDRを有効にすると、その保持を必要とする機能も無効になります。
5. 構造化出力とカスタムデプロイ向けのFireworks AI
Fireworks AIは、サーバーレスのオープンモデル推論と専用GPUを組み合わせています。デプロイドキュメントでは、カスタムモデル、オートスケーリング、GPU選択、地域配置を扱っています。ファインチューニング済みLoRAモデルは現在、専用デプロイが必要なため、アイドル時のコストとスケールアップ動作をテストしてください。
FireworksはOpenAI互換エンドポイントを公開し、Anthropic互換アクセスも文書化しています。抽出とツールパイプラインでの特徴は、JSON Schemaとカスタムgrammar制約を含む構造化出力対応です。対応状況はモデルとリクエストパスによって異なるため、不正な入力や境界値入力でもスキーマを検証してください。
Fireworksの保持に関するドキュメントでは、オープンモデル推論がデフォルトでZDRであり、メタデータのログと一時的なインメモリプロンプトキャッシュがあると説明しています。また、Responses API固有の例外も記載されています。store=Trueがデフォルトで、会話データを30日間保持します。この会話保存を無効にするにはstore=Falseを設定してください。一般的なZDRの説明をすべての操作に適用せず、エンドポイント固有の設定を確認します。
専用ホスティングはセルフホスティングではない
専用エンドポイントは、プロバイダーが管理するハードウェアを予約します。セルフホスティングでは、チームがランタイム、ネットワーク境界、アップグレード、オブザーバビリティ、モデルウェイトを管理します。
データを自社環境の外へ出してはならない場合、公開共有APIはその境界を満たしません。非公開の法人向け配置が条件を満たすか確認するか、自社でオープンウェイトのスタックを運用してください。セルフホスティングでは、キャパシティ、パッチ適用、フェイルオーバー、不正利用対策、GPU使用率をチームが担当します。
誤解を招かずにレイテンシを測定する方法
1つのレイテンシ値でLLM APIを説明してはいけません。
- **Time to first token(TTFT)**は、リクエスト送信から最初の生成トークンが届くまでの時間です。プロンプト長、キュー、prefill、ネットワーク距離、認証、ルーティングのすべてが影響します。
- ゲートウェイのオーバーヘッドは、エッジ処理、ポリシーチェック、ルーティングなど中間層で増える処理です。無関係なモデルや地域同士では分離して測定できません。
- スループットは、処理開始後の出力生成速度で、一般に1秒あたりのトークン数で表します。スループットが高くてもTTFTが低いとは限りません。
- エンドツーエンドのレイテンシには、TTFTに加えて生成時間とクライアント側ネットワークの影響が含まれます。出力長がこの指標を大きく左右する場合があります。
同じプロンプト、モデルバージョン、パラメーター、地域、ストリーミングモード、同時実行数でテストしてください。TTFTとエンドツーエンドレイテンシのp50、p95、p99に加え、エラーと再試行も報告します。OpenRouterのレイテンシガイドでは、コールド状態のエッジキャッシュ、残高確認、失敗したフォールバックがレイテンシを変える可能性を説明しています。
テスト可能な移行パターン
次のPython例では、プロバイダー固有の値を環境変数に保持します。実際のアカウントに対しては実行していません。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["LLM_API_KEY"],
base_url=os.environ["LLM_BASE_URL"],
)
response = client.chat.completions.create(
model=os.environ["LLM_MODEL"],
messages=[{"role": "user", "content": "Return three migration risks."}],
)
print(response.choices[0].message.content)
ベースURLはhttps://openrouter.ai/api/v1、https://api.tokenhot.ai/v1、https://api.together.ai/v1、https://api.groq.com/openai/v1、https://api.fireworks.ai/inference/v1です。推測せず、現在のモデルIDをコピーしてください。
本番トラフィックを移す前に、次を行います。
- アプリケーションが依存するすべてのエンドポイント、パラメーター、モデルID、ツールスキーマ、レスポンスフィールド、エラーコードを一覧化する。
- プロンプト、レスポンス、メタデータ、キャッシュ、Batch、ファインチューニングの保持を個別に確認する。
- 現在の入力、出力、キャッシュ、画像、音声、専用容量の料金を使って、代表的なワークロードを見積もる。DeepSeek料金とウェイトのガイドでは、ホスト型APIとダウンロード可能なウェイトが異なる問いへの答えである理由を説明しています。
- 機密情報を除いたテストセットを再生し、出力品質、ツール呼び出しの有効性、TTFT、スループット、テールレイテンシ、429、再試行を比較する。
- 最初は本番トラフィックの一部だけを送る。請求の照合と障害処理が実証されるまで旧ルートを利用可能にしておく。
マルチモーダルパイプラインでは、画像エンドポイントと動画エンドポイントを別々の移行として扱います。Sora API移行ガイドでは、動画ワークフローに必要なモデル固有の確認例を示しています。
よくある質問
最適なOpenRouter代替サービスはどれですか?
Tokenhotは、ディレクトリ掲載モデルへの統合アクセスに適しています。Together AIとFireworks AIは、オープンウェイトモデルやカスタムモデルに適しています。Groqはホスト型カタログに重点を置いています。アクセス、互換性、プライバシー、実測レイテンシ、配置環境の所有権を基準に選んでください。
OpenAI互換APIはそのまま差し替えられますか?
通常、そのまま使えるのは基本的なchatだけです。モデルID、エンドポイント、ツール、構造化出力、ストリーミング、usageフィールド、エラーが異なる場合があります。互換性テストを実行してください。
OpenRouterはプロンプトを保持しますか?
OpenRouterによると、自社でのプロンプト保持はオプトインですが、上流エンドポイントのポリシーは異なります。必要に応じてZDRとプロバイダー制御を使用し、選択したモデルに対象ルートが存在することを確認してください。
Tokenhotはゼロデータ保持を提供しますか?
現在の公開プライバシー規約は、包括的なZDRの約束を裏付けていません。メタデータのログ、一時的なコンテンツキャッシュの可能性、上流ベンダーへのコンテンツ転送が記載されています。機密データを送る前に、自分のアカウントとワークフローに適用される条件を取得してください。
完全なセルフホスティング制御を得られる選択肢はどれですか?
プロバイダーがホストするサーバーレスや専用エンドポイントだけでは、完全なセルフホスティングになりません。インフラの所有が必須なら、自社環境のオープンウェイトランタイム、または契約で定義された非公開配置を評価し、それに伴う運用作業の予算を組んでください。
最適なOpenRouter代替サービスは用途によって異なります。独自モデルとオープンモデルへの統合アクセス、最適化されたオープンウェイト推論、専用容量、自社管理インフラなどです。本ガイドでは、文書化された製品動作を比較し、チーム向けの移行テスト計画を示します。


