Caffeine InferenceAccès anticipé

IA économique et routage intelligent.

Ce que nous construisons : Caffeine Inference vise un routage intelligent et économique. Pas besoin de choisir un modèle, notre routage le fait pour vous. Ce qui existe aujourd’hui : une inference économique.

Ouvrir Caffeine Inference

Fonctionne avec l’abonnement Caffeine.

Un routage, pas un menu.

Quand le routage intelligent arrivera, Caffeine lira la requête, évaluera ce que coûterait chaque modèle et la vitesse à laquelle ils répondent à ce moment-là, puis l’enverra à l’un d’eux. Quand un modèle sera occupé ou lent, la requête partira ailleurs au lieu d’échouer.

votre requêterouteurcoût · charge · difficultémodèlemodèlemodèleréponse

Pointez vers Caffeine les outilsque vous utilisez déjà.

Claude Code et tout ce qui accepte une URL de base personnalisée. Copiez la configuration, collez-la, continuez à travailler.

Goose

GOOSE_PROVIDER=openai
OPENAI_HOST=...
OPENAI_API_KEY=...

Claude Code

ANTHROPIC_BASE_URL=...
ANTHROPIC_AUTH_TOKEN=...

Tout le reste

base URL + key
same request shape

Quatre étapes jusqu'à votre premier appel.

Choisissez un outil, copiez la configuration et envoyez un appel. Caffeine vous donne les réglages au format attendu par cet outil.

1.Vue d'ensemble

Des questions auxquelles nous préférons répondre ici.

L’entrée coûte 0,2 $ par million de tokens, l’entrée en cache 0,05 $ et la sortie 0,5 $. Les prix peuvent évoluer à mesure que le routage s’améliore.

Caffeine Inference

Il fonctionne avec le budget Caffeine déjà présent sur votre compte, et votre configuration actuelle est à trois lignes de fonctionner.

Commencer

Accès anticipé. Pas de facturation séparée, pas de compte séparé.