Caffeine Inferenceابتدائی رسائی

کم لاگت AI اور Smart Routing۔

ہم کیا بنا رہے ہیں: Caffeine Inference لاگت میں مؤثر smart routing فراہم کرنے کا ہدف رکھتا ہے۔ آپ کو ماڈلز منتخب کرنے کی ضرورت نہیں، ہماری routing آپ کے لیے یہ کرتی ہے۔ فی الحال موجود: لاگت میں مؤثر inference۔

Caffeine Inference کھولیں

یہ Caffeine subscription پر چلتا ہے۔

Routing، مینو نہیں۔

جب smart routing دستیاب ہو جائے گی، Caffeine درخواست پڑھے گا، ہر ماڈل کی لاگت اور موجودہ جواب دینے کی رفتار کا موازنہ کرے گا، اور اسے ان میں سے کسی ایک پر بھیج دے گا۔ جب کوئی ماڈل مصروف یا سست ہو، درخواست ناکام ہونے کی بجائے کہیں اور جائے گی۔

آپ کی درخواستrouterلاگت · load · difficultyماڈلماڈلماڈلجواب

وہ ٹولز Caffeineکی طرف رخ کریں جو آپ پہلے سے استعمال کرتے ہیں۔

Claude Code اور کوئی بھی چیز جو custom base URL قبول کرے۔ configuration کاپی کریں، پیسٹ کریں، کام جاری رکھیں۔

Goose

GOOSE_PROVIDER=openai
OPENAI_HOST=...
OPENAI_API_KEY=...

Claude Code

ANTHROPIC_BASE_URL=...
ANTHROPIC_AUTH_TOKEN=...

کچھ اور

base URL + key
same request shape

پہلی کال تک چار مراحل۔

ایک ٹول منتخب کریں، configuration کاپی کریں، اور ایک کال بھیجیں۔ Caffeine آپ کو اس ٹول کی توقع کے format میں settings دیتا ہے۔

1.جائزہ

وہ سوالات جن کا ہم یہاں جواب دینا پسند کرتے ہیں۔

Input $0.2 فی ملین tokens، cached input $0.05، اور output $0.5 ہے۔ routing بہتر ہونے کے ساتھ قیمتیں بدل سکتی ہیں۔

Caffeine Inference

یہ آپ کے اکاؤنٹ میں موجود Caffeine budget پر چلتا ہے، اور آپ کی موجودہ configuration کام کرنے سے صرف تین سطریں دور ہے۔

شروع کریں

ابتدائی رسائی۔ الگ billing نہیں، الگ اکاؤنٹ نہیں۔