Yapay Zeka API Maliyet Kontrolü: Sürpriz Faturayı Teknik Olarak İmkânsız Kılan 6 Mekanizma
Yapay zeka API maliyet kontrolü, harcamayı ay sonunda raporlamak değil, bütçe aşımını istek daha sağlayıcıya ulaşmadan engellemektir. Onysoft AI Gateway bunu altı mekanizmayla çözer: istek öncesi bakiye ön-kontrolü (tahmini maliyet × 1,2 tampon, yetmezse 402), anahtar bazlı token limitleri, her yanıtta dönen gerçek maliyet, filtrelenebilir PDF kullanım raporları, bakiye bitince otomatik durma ve OnyRouter yönlendirmesi.
Türkçe kaynaklarda bu sorgunun karşılığı çoğunlukla maliyeti düşürme teknikleridir: önbellekleme, istek kısma, token budama. Bunlar değerli — biz de ayrı bir rehberde anlattık — ama farklı bir sorunun cevaplarıdır. Bütçeden sorumlu kişinin asıl sorusu şudur: hatalı bir retry döngüsü, unutulmuş bir test cron'u veya beklenmedik bir trafik patlaması yaşandığında faturamın tavanını ne garanti ediyor?
Bu yazı o soruya mimari düzeyde cevap veriyor: sürpriz faturayı imkânsız kılan ön-kontrol mekanizmasını, anahtar bazlı limitleri, istek düzeyinde maliyet görünürlüğünü ve — canlı katalog fiyatıyla hesaplanmış — 100.000 isteklik gerçek bir bütçe senaryosunu adım adım inceliyoruz.
Maliyet Kontrolü ile Maliyet Optimizasyonu Arasındaki Fark Nedir?
Optimizasyon birim maliyeti düşürür; kontrol ise toplam harcamanın tavanını garanti eder — biri fatura kalemini küçültür, diğeri faturanın sürpriz olmasını engeller. İkisi aynı şey değildir ve biri diğerinin yerine geçmez.
Doğru model seçimi, kademeli mimari ve prompt disiplini gibi teknikler istek başına ödediğiniz tutarı azaltır; bu tekniklerin tamamını AI API maliyet optimizasyonu rehberinde topladık. Ama en optimize edilmiş sistem bile tavan garantisi vermez: istek başına maliyeti 10 kat düşürdüğünüz bir uç, hatalı bir döngüye girip istek sayısını 1.000 kat artırırsa fatura yine patlar. Sahada bütçeyi aşındıran vakalar genellikle "pahalı model seçilmiş" değil, "kimsenin görmediği bir yerde kontrolsüz harcama birikmiş" vakalarıdır.
Maliyet kontrolü bu yüzden bir teknik listesi değil, mimari bir katmandır ve üç bacağı vardır: tavan (harcama hiçbir koşulda X'i aşamaz), sınır (bu anahtar/proje en fazla şu kadar tüketebilir) ve görünürlük (hangi istek ne yaktı, anlık olarak). Bu yazının geri kalanı bu üç bacağın Onysoft AI Gateway üzerinde nasıl mekanizmaya döküldüğünü anlatıyor.
Sürpriz Fatura Teknik Olarak Nasıl İmkânsız Hale Gelir?
İki mekanizmanın birleşimiyle: ön ödemeli bakiye ve her istekten önce çalışan maliyet ön-kontrolü. Kredi kartına bağlı "kullan, ay sonunda öde" modelinde limit bir uyarıdır; ön ödemeli modelde ise matematiksel bir tavandır — sistemin harcayabileceği en yüksek tutar, yüklediğiniz bakiyedir.
Onysoft'ta bu tavan istek düzeyinde uygulanır: gateway, her istek geldiğinde girdi uzunluğu ve izin verilen çıktı tavanı (max_tokens) üzerinden tahmini maliyeti hesaplar, üzerine 1,2 katsayılı bir güvenlik tamponu koyar ve bakiyeyle karşılaştırır. Bakiye tahmini karşılamıyorsa istek sağlayıcıya hiç iletilmeden HTTP 402 ile geri döner: harcama oluşmaz, borç oluşmaz, "isteğin yarısı işlendi" belirsizliği oluşmaz.
Zincirin son halkası otomatik durmadır: bakiye sıfıra inince sistem durur; negatife düşme, gecikmiş tahsilat veya ay sonu sürpriz ekstresi bu modelde yapısal olarak yoktur. Retry fırtınası senaryosunu bu gözle yeniden düşünün: hatalı döngü ne kadar agresif olursa olsun, yaktığı toplam tutar bakiyenizle sınırlıdır ve bakiye bittiği anda döngü 402'ye çarpıp durur. "Sürpriz fatura imkânsız" ifadesi bir pazarlama cümlesi değil, bu akışın doğrudan sonucudur.
Anahtar Bazlı Limitler Ekip ve Proje Yönetiminde Ne Sağlar?
Her API anahtarına model bazında token limitleri tanımlayarak tek bakiyeyi birden çok ekip, ortam veya proje arasında kontrollü biçimde bölüştürmenizi sağlar. Toplam tavanı bakiye çizer; anahtar bazlı limitler ise o tavanın içindeki dağılımı yönetir.
Pratik kurgu şöyle görünür: üretim anahtarına geniş bir limit, staging anahtarına dar bir limit, deneysel projeye ayrı ve küçük bir anahtar. Bu yapı iki riski aynı anda keser. Birincisi operasyonel risk: hatalı bir deploy'un retry fırtınası ya da testte unutulmuş bir zamanlanmış görev, kendi anahtarının limitinde durur — üretim bütçesini süpüremez. İkincisi güvenlik riski: bir anahtar sızarsa saldırganın yakabileceği tutar o anahtarın limitiyle sınırlıdır, bakiyenizin tamamıyla değil.
Aynı deseni bir üst ölçekte işletmek isteyenler için ayrıca partner katmanı var: müşterilerine AI çözümü işleten ajans ve yazılım evleri, partner portalında her müşteri için ayrı API anahtarı ve proje açar, kendi kâr marjını belirler ve müşteri bazlı kullanım raporlarını tek panelden izler. Yani "müşteri X bu ay ne kadar yaktı?" sorusu, tablo birleştirme egzersizi değil hazır bir rapor ekranıdır.
Harcamayı İstek Düzeyinde Nasıl Görürsünüz?
Her API yanıtı, o isteğin gerçek maliyetini USD cinsinden cost alanında döndürür; panel aynı tutarın TL karşılığını gösterir. Yani maliyet görünürlüğü için ayrı bir ölçüm aracı kurmanız gerekmez — veri, zaten işlediğiniz yanıtın içindedir:
{
"model": "openai/gpt-5.6-luna",
"usage": {
"prompt_tokens": 812,
"completion_tokens": 246,
"total_tokens": 1058
},
"cost": 0.000343
}cost alanını özellik bazında loglayıp topladığınızda "hangi uç ne yakıyor?" sorusu tahmin olmaktan çıkar: destek chatbot'u mu, doküman özetleyici mi, gece çalışan toplu iş mi — kalem kalem görürsünüz. Limitleri de ancak bu görünürlükle akıllıca koyabilirsiniz; körlemesine konan limit ya çok gevşektir ya üretimi keser.
Dönemsel takip için panelin kullanım raporları ekranı devrededir: dökümü tarih, model ve durum filtreleriyle alır, PDF olarak indirir veya logolu e-posta raporu şeklinde doğrudan finans ekibinize ya da müşterinize gönderirsiniz. Aylık bütçe toplantısına "API harcaması" satırını manuel derlemek yerine, filtreyi kurup raporu ekleyerek girersiniz.
Örnek Bütçe Senaryosu: 100.000 İsteklik Chatbot Ayda Kaça Çalışır?
Ekonomi sınıfı openai/gpt-5.6-luna ile ayda 100.000 istek işleyen bir destek chatbot'unun hesaplanabilir maliyeti 34,50 USD — 5 Ağustos 2026 TCMB kuruyla yaklaşık 1.640,65 TL'dir. Senaryomuz gerçekçi bir profil kullanıyor: istek başına ortalama 800 girdi tokenı (sistem talimatı + konuşma penceresi + soru) ve 250 çıktı tokenı (yanıt):
| Kalem | Hesap | Aylık maliyet |
|---|---|---|
| Girdi tokenları | 100.000 istek × 800 token = 80M × $0.15/1M | $12.00 |
| Çıktı tokenları | 100.000 istek × 250 token = 25M × $0.90/1M | $22.50 |
| Toplam (USD) | — | $34.50 |
| Toplam (TL) | $34.50 × 47,555 | ≈ 1.640,65 TL |
| İstek başına | $34.50 ÷ 100.000 | ≈ 0,0164 TL |
Ölçüm: 5 Ağustos 2026 — api.onysoft.com canlı katalog (openai/gpt-5.6-luna: girdi $0.15, çıktı $0.90 / 1M token). TL karşılığı 5 Ağustos 2026 TCMB kuru (1 USD = 47,555 TL) ile hesaplanmıştır.
Bu hesabın kontrol açısından anlamı şudur: istek başına ~0,0164 TL'lik öngörülebilir bir birim maliyetiniz var. Aya 2.000 TL bakiyeyle girerseniz sistemin harcayabileceği mutlak tavan 2.000 TL'dir — trafik beklenmedik biçimde ikiye katlansa bile aşım değil, bakiye bitiminde kontrollü bir durma yaşarsınız; panel uyarısıyla bakiye yükleyip devam edersiniz. Kendi trafik profilinizle aynı hesabı maliyet hesaplayıcıda kurabilir, farklı modellerin aylık karşılığını yan yana görebilirsiniz.
Onysoft'ta Nasıl Çalışıyor: İsteğin Geçtiği Kontrol Zinciri
Bir isteğin gateway'e girişinden raporlanmasına kadar altı kontrol katmanı sırayla devreye girer:
| # | Katman | Ne yapar | Ne zaman devrede |
|---|---|---|---|
| 1 | Bakiye ön-kontrolü | Tahmini maliyet × 1,2 tampon; bakiye yetmezse sağlayıcıya gitmeden 402 | Her istekte, işlem öncesi |
| 2 | Anahtar bazlı limitler | Anahtar × model düzeyinde token tavanı | Anahtar yapılandırmasına göre |
| 3 | cost alanı | Yanıtta gerçek maliyet (USD), panelde TL karşılığı | Her yanıtta |
| 4 | Kullanım raporları | Tarih/model/durum filtresi, PDF indirme, logolu e-posta raporu | Panelde, istendiğinde |
| 5 | Otomatik durma | Bakiye sıfırda istekler durur; negatif bakiye oluşmaz | Bakiye tükenince |
| 6 | OnyRouter | onysoft/auto ucuz işleri ucuz modele yönlendirir; yönlendirme ücretsiz | Model seçimi devredildiğinde |
Kod tarafında tek yapmanız gereken 402'yi bir hata değil, bir bütçe sinyali olarak ele almaktır:
from openai import OpenAI, APIStatusError
client = OpenAI(
base_url="https://api.onysoft.com/v1",
api_key="sk-ony-ANAHTARINIZ",
)
try:
r = client.chat.completions.create(
model="openai/gpt-5.6-luna",
max_tokens=300, # cikti tavani ayni zamanda tahmini maliyetin ust siniridir
messages=[{"role": "user", "content": "Bu destek talebini kategorize et."}],
)
print(r.choices[0].message.content)
except APIStatusError as e:
if e.status_code == 402:
# Bakiye, tahmini maliyeti (x1,2 tampon dahil) karsilamiyor:
# istek saglayiciya hic gitmedi, harcama olusmadi.
print("Bakiye yetersiz — bakiye yukleyin veya max_tokens degerini gozden gecirin.")Zincirin altıncı katmanı kontrolün proaktif ayağıdır: model alanına onysoft/auto yazdığınızda OnyRouter, basit istekleri ekonomi sınıfına, ağır istekleri amiral sınıfına yönlendirir — yönlendirmenin kendisi ücretsizdir, yalnızca seçilen modelin kullanımı faturalanır. Ayrıntılar OnyRouter rehberinde. Başlamak için ücretsiz hesap açıp küçük bir bakiyeyle bu zinciri uçtan uca kendiniz test edebilirsiniz; katalogdaki 708+ modelin tamamı aynı kontrol katmanlarının arkasında çalışır.
Son güncelleme: 5 Ağustos 2026 · Veriler: api.onysoft.com canlı katalog
Sık Sorulan Sorular
Yapay zeka API maliyetini nasıl kontrol altında tutarım?
Üç katmanla: tavan (ön ödemeli bakiye + her istekten önce çalışan maliyet ön-kontrolü), sınır (anahtar bazlı model token limitleri) ve görünürlük (her yanıttaki cost alanı + filtrelenebilir kullanım raporları). Onysoft AI Gateway'de bu mekanizmaların tümü panelde hazır gelir; ayrı bir bütçe aracı kurmanız gerekmez.
API bütçem aşılırsa eksiye düşer miyim?
Hayır. Sistem ön ödemeli çalışır: her istekten önce tahmini maliyet, 1,2 katsayılı tamponla birlikte bakiyeyle karşılaştırılır; yetmiyorsa istek işlenmez. Bakiye sıfıra inince sistem otomatik durur. Negatif bakiye, gecikmiş tahsilat veya ay sonu sürpriz ekstresi bu modelde yapısal olarak oluşmaz.
HTTP 402 hatası aldım; ne anlama geliyor?
Bakiyeniz, isteğin tahmini maliyetini (güvenlik tamponu dahil) karşılamıyor demektir. İstek sağlayıcıya hiç iletilmediği için herhangi bir harcama oluşmamıştır. Bakiye yükledikten sonra aynı isteği tekrarlayabilirsiniz; tahmin girdi uzunluğu ve max_tokens tavanından hesaplandığı için gereksiz yüksek max_tokens değerlerini düşürmek de 402 sıklığını azaltır.
Her isteğin maliyetini tek tek görebilir miyim?
Evet. Her API yanıtındaki cost alanı, o isteğin gerçek maliyetini USD cinsinden döndürür; panel TL karşılığını gösterir. Kullanım raporları ekranında dökümü tarih, model ve durum filtreleriyle alabilir, PDF indirebilir veya logolu e-posta raporu olarak finans ekibinize gönderebilirsiniz.
Ekipteki her proje veya ortama ayrı bütçe tanımlayabilir miyim?
Evet. Her projeye veya ortama (üretim, staging, deneysel) ayrı API anahtarı verir, anahtar bazında model token limitleri tanımlarsınız; böylece bir ortamdaki hata diğerinin bütçesini süpüremez. Müşterileri adına AI çözümü işleten ajanslar, partner portalında müşteri başına ayrı anahtar/proje ve müşteri bazlı kullanım raporlarıyla aynı yapıyı bir üst ölçekte kurar.
Maliyet kontrolü ile maliyet optimizasyonunun farkı nedir?
Optimizasyon birim maliyeti düşürür: doğru model seçimi, kademeli mimari, prompt kısaltma gibi teknikler. Kontrol ise toplam harcamanın tavanını garanti eder: ön-kontrol, limitler ve görünürlük. İkisi birbirini tamamlar — birim maliyeti düşürme teknikleri için AI API maliyet optimizasyonu rehberimize bakın.
İlgili sayfalar
Denemeye hazır mısınız?
708+ AI modeline tek API ile erişin. TL bakiye yükleyin, kullandıkça ödeyin — abonelik yok.