Caffeine InferenceAkses awal

AI hemat biaya & perutean cerdas.

Yang sedang kami bangun: Caffeine Inference bertujuan menghadirkan perutean cerdas yang hemat biaya. Anda tidak perlu memilih model, perutean kami melakukannya untuk Anda. Yang sudah ada saat ini: inference hemat biaya.

Buka Caffeine Inference

Berjalan dengan langganan Caffeine.

Perutean, bukan menu.

Begitu perutean cerdas hadir, Caffeine akan membaca permintaan, menimbang berapa biaya tiap model dan seberapa cepat mereka merespons saat itu, lalu mengirimkannya ke salah satu model. Saat sebuah model sibuk atau lambat, permintaan akan dialihkan ke tempat lain alih-alih gagal.

permintaan Andaperutebiaya · beban · kesulitanmodelmodelmodeljawaban

Arahkan alat yang sudahAnda pakai ke Caffeine.

Claude Code dan apa pun yang menerima URL dasar khusus. Salin konfigurasinya, tempel, lanjutkan bekerja.

Goose

GOOSE_PROVIDER=openai
OPENAI_HOST=...
OPENAI_API_KEY=...

Claude Code

ANTHROPIC_BASE_URL=...
ANTHROPIC_AUTH_TOKEN=...

Apa pun yang lain

base URL + key
same request shape

Empat langkah menuju panggilan pertama.

Pilih alat, salin konfigurasinya, lalu kirim satu panggilan. Caffeine memberi Anda pengaturan dalam format yang diharapkan alat itu.

1.Ikhtisar

Pertanyaan yang lebih baik kami jawab di sini.

Input $0,2 per juta token, input dari cache $0,05, dan output $0,5. Harga dapat berubah seiring perutean makin baik.

Caffeine Inference

Berjalan dengan anggaran Caffeine yang sudah ada di akun Anda, dan konfigurasi Anda saat ini tinggal tiga baris lagi untuk berfungsi.

Mulai

Akses awal. Tanpa tagihan terpisah, tanpa akun terpisah.