Caffeine Inference早期アクセス

コスト効率の高い AI とスマートルーティング。

私たちが作っているもの: Caffeine Inference は、コスト効率に優れたスマートルーティングの提供を目指しています。モデルを選ぶ必要はありません。ルーティングが代わりに選びます。 現時点であるもの: コスト効率の高い推論。

Caffeine Inference を開く

Caffeine のサブスクリプションで動きます。

メニューではなく、ルーティング。

スマートルーティングが提供されると、Caffeine はリクエストを読み、各モデルのコストとその時点での応答速度を比較して、そのうちの 1 つに送るようになります。モデルが混雑していたり遅かったりする場合は、失敗させずに別のモデルへ回します。

リクエストルーターコスト · 負荷 · 難易度モデルモデルモデル回答

使い慣れたツールをCaffeineに向ける。

Claude Code、そしてベースURLを指定できるあらゆるツール。設定をコピーして貼り付ければ、作業はそのまま続きます。

Goose

GOOSE_PROVIDER=openai
OPENAI_HOST=...
OPENAI_API_KEY=...

Claude Code

ANTHROPIC_BASE_URL=...
ANTHROPIC_AUTH_TOKEN=...

その他すべて

base URL + key
same request shape

最初の呼び出しまで4ステップ。

ツールを選び、設定をコピーして、呼び出しを一度送るだけです。Caffeine がそのツールに合った形式で設定を渡します。

1.概要

ここでお答えしたい質問。

入力は 100 万トークンあたり $0.2、キャッシュ済み入力は $0.05、出力は $0.5 です。ルーティングの改善に伴い料金は変わる場合があります。

Caffeine Inference

アカウントにすでにある Caffeine 予算で動きます。今の設定は、3 行変えるだけで動きはじめます。

はじめる

早期アクセス。請求もアカウントも分ける必要はありません。