AI API Maliyetlerini Düşürme: Pratik Model Seçim Rehberi

calendar_month 8 Temmuz 2026 schedule 6 dk okuma

Yapay zekâ destekli bir ürün büyüdükçe LLM API faturası da büyür — ve çoğu ekipte bu faturanın asıl kaynağı kullanım hacmi değil, yanlış model seçimidir. E-posta sınıflandırma gibi dar bir görevi amiral gemisi bir modele yaptırmak, aynı işi nano sınıfı bir modele yaptırmaktan token başına 100 kata kadar pahalı olabilir. Başka bir deyişle AI API maliyet optimizasyonunun en güçlü kaldıracı kod değil, karardır: hangi iş hangi modele gidecek?

Bu rehber, maliyetin anatomisinden başlayıp iş–model eşleştirme matrisi, kademeli (cascade) mimari, prompt ve max_tokens optimizasyonu ile ölçüm pratiklerine uzanan somut bir yol haritası sunuyor. Örnekler Onysoft AI Gateway üzerinde çalışıyor: 708+ model tek OpenAI uyumlu API arkasında durduğu için model değiştirmek tek satırlık bir iş — buradaki her stratejiyi denemek de o kadar ucuz.

Maliyetin Anatomisi: Token'lar ve 100 Kat Fiyat Farkı

Bir LLM API çağrısının maliyeti iki kalemden oluşur: modele gönderdiğiniz input token'lar ve modelin ürettiği output token'lar. İkisi ayrı fiyatlandırılır ve output token çoğu modelde belirgin biçimde daha pahalıdır. Aylık faturanız kabaca şu çarpımdır: istek sayısı × istek başına ortalama token × token birim fiyatı.

Denklemin en oynak değişkeni birim fiyattır, çünkü model sınıfları arasındaki makas çok geniştir: amiral gemisi bir modelle nano sınıfı bir model arasında token başına 100 kata varan fiyat farkı olabilir. "Her isteği en iyi modele gönderelim" politikası, küçük bir modelin rahatça yaptığı işlere gereksiz yere onlarca kat prim ödemek demektir.

İlk adım envanter çıkarmak: hangi özellik hangi modeli çağırıyor, ayda kaç istek atıyor, ortalama input/output token değeri ne? Bu tablo bir kez oluştuğunda tasarrufun nereden geleceği genellikle kendiliğinden görünür. Güncel TL fiyatlarını model kataloğunda karşılaştırabilirsiniz; rehberin geri kalanı bu envanteri satır satır ucuzlatmayı anlatıyor.

İş–Model Eşleştirme Matrisi

Optimizasyonun özü tek cümle: görevin zorluğunu modelin sınıfıyla eşleştirin. Pratikte dört katman çoğu ürünü kapsar:

  • Sınıflandırma, etiketleme, yönlendirme, basit çıkarım: kısa girdi, kısa çıktı, dar kapsam. openai/gpt-5.4-nano ve google/gemini-3.1-flash-lite bu sınıfın tipik tercihleri; iyi yazılmış bir prompt'la bu görevler için fazlasıyla yeterlidir.
  • Sohbet, özetleme, orta zorlukta içerik: openai/gpt-5.4-mini, google/gemini-3.5-flash ve anthropic/claude-haiku-4.5 hız–maliyet dengesinin tatlı noktasıdır.
  • Analiz, kod üretimi, uzun doküman işleme: anthropic/claude-sonnet-5, 1M bağlam penceresiyle google/gemini-3.1-pro-preview veya deepseek/deepseek-v4-pro.
  • Çok adımlı akıl yürütme, ajan iş akışları, kritik kararlar: anthropic/claude-fable-5, anthropic/claude-opus-4.8 ve openai/gpt-5.5 — yalnızca gerçekten gerektiğinde.

Aile içi seçenekleri ve güncel kadroları Claude ve Gemini sayfalarında karşılaştırabilirsiniz. Kural basit: bir üst katmana çıkmadan önce, alttaki modelin sizin görevinizde gerçekten yetersiz kaldığını kanıtlayın.

Kademeli Mimari: Önce Ucuz Model, Gerekirse Yükselt

Eşleştirme matrisi statik bir karardır; kademeli (cascade) mimari aynı kararı istek bazında, dinamik olarak verir. Prensip: her istek önce ucuz modele gider, model kendinden emin değilse istek güçlü modele eskale edilir. Üretim trafiğinin büyük bölümü kolay isteklerden oluştuğu için pahalı model yalnızca bunu hak eden azınlık için çalışır.

Onysoft tüm modelleri tek OpenAI uyumlu API arkasında sunduğundan eskalasyon, kelimenin tam anlamıyla model adı değişikliğidir:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.onysoft.com/v1",
    api_key="sk-ony-...",
)

def yanitla(soru):
    hizli = client.chat.completions.create(
        model="google/gemini-3.1-flash-lite",
        max_tokens=200,
        messages=[
            {"role": "system",
             "content": "Cevaptan emin degilsen sadece ESKALE yaz."},
            {"role": "user", "content": soru},
        ],
    )
    cevap = hizli.choices[0].message.content
    if "ESKALE" not in cevap:
        return cevap  # trafigin buyuk kismi burada biter
    return client.chat.completions.create(
        model="anthropic/claude-sonnet-5",
        max_tokens=800,
        messages=[{"role": "user", "content": soru}],
    ).choices[0].message.content

Eskalasyon oranını mutlaka loglayın. Oran beklediğinizden yüksekse çözüm çoğu zaman üst modele daha fazla trafik göndermek değil, ucuz modelin prompt'unu netleştirmektir.

Prompt Kısaltma ve max_tokens Disiplini

Model seçimi doğru olsa bile token israfı faturayı şişirir. En hızlı kazanımlar şunlar:

  1. max_tokens tavanı koyun. Output token en pahalı kalemdir; iki cümlelik özet döndüren bir uca binlerce token'lık üretim alanı bırakmayın. Uç başına gerçekçi bir sınır belirleyin.
  2. Sistem prompt'unu kısaltın. Sistem mesajı her istekte yeniden gönderilir ve her seferinde input token olarak faturalanır. Gereksiz few-shot örneklerini ve tekrar eden açıklamaları budayın.
  3. Sohbet geçmişini pencereleyin. Tüm geçmişi her seferinde göndermek yerine son birkaç mesajı iletin, eskisini kısa bir özetle temsil edin.
  4. Yapılandırılmış çıktı isteyin. "Kısa JSON döndür" talimatı serbest metne göre hem daha az output token üretir hem ayrıştırmayı kolaylaştırır.
  5. RAG'de cimri olun. Dokümanın tamamını değil, yalnızca sorguyla ilgili parçaları bağlama koyun.

İstek parametrelerinin tamamı API dokümantasyonunda; farklı max_tokens değerlerinin çıktıya etkisini kod yazmadan Playground'da deneyebilirsiniz.

Ölç, Hesapla, İzle: Kalıcı Tasarrufun Formülü

Tasarruf tek seferlik bir proje değil, sürekli bir döngüdür: tahmin et, ölç, yeniden değerlendir.

  • Yayından önce tahmin: maliyet hesaplayıcıya modeli, aylık istek sayısını ve ortalama input/output token değerlerini girip öngörülen aylık maliyeti görün. İki modeli aynı senaryoda kıyaslamak, saatlik tartışmayı beş dakikalık kontrole çevirir.
  • Yayında ölçüm: her API yanıtındaki usage alanı (prompt_tokens, completion_tokens) gerçek tüketimi raporlar. Bunu özellik bazında loglayın ki hangi ucun ne yaktığını tam olarak bilin.
  • Düzenli yeniden değerlendirme: model pazarı hızlı hareket ediyor; yeni nesil bir orta sınıf model, geçen çeyreğin üst sınıf işini daha ucuza yapmaya başlayabiliyor. Fiyat/performans sıralamalarını periyodik kontrol edip matrisinizi güncelleyin.

Onysoft'ta faturalama tek bir ön ödemeli TL bakiyeden, TCMB kuru üzerinden ve kullandıkça öde modeliyle çalışır: abonelik yok, taahhüt yok, kurumsal e-fatura var. Böylece "ölçtüm, modeli değiştirdim" adımı bütçe tarafında anında ve birebir karşılık bulur.

Sık Sorulan Sorular

En ucuz LLM API'si hangisidir?

Tek bir cevap yok: "en ucuz" model, sizin kalite çıtanızı geçen en düşük fiyatlı modeldir ve göreve göre değişir. Sınıflandırma ve yönlendirme gibi dar görevlerde gpt-5.4-nano veya gemini-3.1-flash-lite gibi nano/flash-lite sınıfı modeller genellikle en düşük maliyeti verir. Güncel TL fiyatlarını /models sayfasında karşılaştırabilirsiniz.

Kademeli mimari yanıt kalitesini düşürür mü?

Doğru kurgulanırsa hayır. Ucuz modele net bir "emin değilsen eskale et" talimatı verildiğinde kolay istekler ucuz modelde biter, zor istekler güçlü modele çıkar. Kritik nokta eskalasyon oranını loglamak: oran çok yüksekse ucuz modelin prompt'unu iyileştirin; şüpheli derecede düşükse yanıtlardan örneklem alıp kaliteyi denetleyin.

Model değiştirmek için kodumu yeniden mi yazmam gerekir?

Hayır. Onysoft AI Gateway OpenAI uyumlu olduğu için mevcut OpenAI SDK'nızda base_url değerini https://api.onysoft.com/v1 yapıp sk-ony- anahtarınızı girmeniz yeterli. Sonrasında 708+ model arasında geçiş yapmak, istekteki model parametresini değiştirmekten ibarettir.

Aylık maliyetimi yayına almadan önce nasıl tahmin ederim?

/calculator sayfasındaki maliyet hesaplayıcıya modeli, aylık istek sayısını ve ortalama input/output token değerlerini girerek aylık tahmin alabilirsiniz. Yayına aldıktan sonra da her API yanıtındaki usage alanını loglayıp tahmini gerçek tüketimle karşılaştırın; sapma varsa max_tokens ve prompt uzunluğuna bakın.

Onysoft'ta ödeme ve faturalama nasıl çalışır?

Kullandıkça öde: hesabınıza TL bakiye yüklersiniz, her çağrı TCMB kuru üzerinden bakiyeden düşer. Abonelik ve taahhüt yoktur; kurumsal e-fatura kesilir, yabancı kart veya VPN gerekmez. Böylece maliyet optimizasyonu çalışmanızın sonucu faturanıza birebir yansır.

İlgili sayfalar

AI Maliyet Hesaplayıcı → Model Fiyat/Performans Sıralamaları → 708+ Model Kataloğu ve Güncel Fiyatlar → API Dokümantasyonu →

Denemeye hazır mısınız?

708+ AI modeline tek API ile erişin. TL bakiye yükleyin, kullandıkça ödeyin — abonelik yok.

Ücretsiz Hesap Aç Modelleri İncele

← Tüm yazılar

Size uygun modeli bulmanıza yardımcı olayım mı?