Telefonu Yapay Zeka Karşılasın: 7/24 Sesli Asistan Mimarisi ve Gerçek Gecikme Verisi
Şirket telefonunu bir yapay zekanın karşılaması artık deneysel bir fikir değil: gelen çağrıyı karşılayan, soruyu anlayan ve doğal Türkçeyle cevap veren bir asistan üç katmanla kurulur — telefon katmanı, konuşmayı yazıya çeviren katman ve yanıtı üreten dil modeli. Bu yazı üçünü de ayrı ayrı, hangi parçanın nereden geldiği açık olacak şekilde anlatıyor.
Kendi kurumsal numaramızda böyle bir asistan çalışıyor: mesai dışında ve hatlar meşgulken gelen çağrıları karşılıyor, sık sorulan konularda bilgi veriyor, gerektiğinde konuyu bize aktarıyor. Bu yazıdaki mimari ve maliyet çerçevesi o kurulumun mantığını yansıtıyor.
En kritik soru şu: bir telefon görüşmesinde yapay zeka yeterince hızlı mı? Çünkü yazışmada tolere edilen üç saniyelik sessizlik, telefonda karşı tarafa "hat düştü" hissi verir. Aşağıda bu soruyu tahminle değil, kendi üretim trafiğimizden ölçülmüş gecikme verisiyle yanıtlıyoruz.
Sesli Asistan Aslında Üç Ayrı Katmandır
"Telefona yapay zeka koymak" tek bir ürün almak gibi görünür ama teknik olarak üç bağımsız parçanın zincirlenmesidir. Parçaları ayırmak hem maliyeti hem de sorun çıktığında nereye bakacağınızı netleştirir.
1. Telefon katmanı (ses taşıma). Çağrının size ulaşmasını sağlayan altyapı: kurumsal santraliniz, sanal santral hizmetiniz veya operatörünüzün çağrı yönlendirmesi. Sesin dijitale dönüşmesi, çağrının tutulması, aktarılması ve kapanması bu katmanın işidir. Yapay zeka burada devrede değildir.
2. Konuşma–yazı dönüşümü. Arayanın söylediği cümlenin metne çevrilmesi (ses tanıma) ve asistanın cevabının sese dönüştürülmesi (konuşma sentezi). Gerçek zamanlı telefon görüşmelerinde ses tanıma genellikle telefon/santral platformunun kendi akışında çözülür, çünkü ses paketlerinin canlı akışına orada erişilir.
3. Beyin katmanı: dil modeli. Metne dönüşmüş soruyu anlayan, şirketinizin bilgisiyle harmanlayıp cevabı yazan kısım. Asistanın "akıllı" hissettiren tarafı burasıdır ve Onysoft API tam olarak bu katmanı sağlar: OpenAI uyumlu tek bir uç, 739+ model arasından seçim, Türk Lirası faturalama.
Bu ayrımın pratik sonucu şudur: sesli asistan kurmak için telefon altyapınızı değiştirmeniz gerekmez. Mevcut santralinizin akışına bir API çağrısı eklersiniz; beyin katmanı dışarıdan gelir.
Telefonda Gecikme: Gerçek Ölçüm
Telefonda kabul edilebilir sessizlik penceresi dardır. İnsan karşılıklı konuşmada yaklaşık bir saniyelik duraklamayı doğal bulur; iki saniyeyi aşan sessizlikte "bağlantı koptu mu" tereddüdü başlar. Dolayısıyla beyin katmanının bütçesi genelde 1,5 saniye civarıdır.
Kendi üretim trafiğimizden son 60 günün ölçümü (yalnızca başarılı istekler):
| Model sınıfı | İstek | Ortalama yanıt | Ortalama çıktı |
|---|---|---|---|
| Hızlı sınıf (flash-lite) | 4.553 | 1.561 ms | 53 token |
| Kısa yanıtlar (≤120 token), hızlı sınıf | — | 1.471 ms | ≤120 token |
| Orta sınıf (mini) | 873 | 2.056 ms | 189 token |
| Üst sınıf (pro/reasoning) | 2.954 | 8.851 ms | 183 token |
Tablodan çıkan üç sonuç var. Birincisi: hızlı sınıf modeller telefon için uygun, ortalama 1,5 saniye beyin gecikmesi ses tanıma ve sentez süreleriyle toplandığında konuşulabilir bir akış bırakır. İkincisi: üst sınıf akıl yürütme modelleri telefonda kullanılamaz — 8,8 saniyelik ortalama, canlı görüşmede duvara toslar; onları çağrı sonrası özet gibi işlere saklayın. Üçüncüsü: çıktı uzunluğu doğrudan gecikmedir. Model 400 token yazarsa arayan onu bekler. Sistem talimatına "en fazla iki cümle kur" yazmak, model değiştirmekten daha çok kazandırır.
Ölçüm: 7 Ağustos 2026, son 60 gün, api.onysoft.com üretim trafiği. Yanıt süresi uçtan uca API süresidir; telefon katmanının ve ses dönüşümünün gecikmesi buna dahil değildir.
Konuşma Sentezi: Cevabı Sese Dönüştürmek
Dil modeli metin üretir; arayanın duyacağı ses o metnin seslendirilmesidir. Onysoft kataloğunda konuşma sentezi modelleri mevcuttur ve /v1/audio/generate ucundan çağrılır.
curl https://api.onysoft.com/v1/audio/generate \
-H "Authorization: Bearer sk-ony-ANAHTARINIZ" \
-H "Content-Type: application/json" \
-d '{"model":"elevenlabs/text-to-speech-turbo-2-5","prompt":"Merhaba, size nasıl yardımcı olabilirim?"}'
Önemli bir teknik sınırı baştan söyleyelim: bu uç asenkron çalışır. İstek bir task_id döner, sonucu /v1/audio/status/{task_id} ile sorgularsınız. Bu model, sesli yanıtın önceden üretilip saklandığı senaryolar için doğrudur — karşılama anonsları, sık sorulan sorulara hazır cevaplar, kampanya duyuruları, sesli bildirimler.
Canlı görüşmenin ortasında, cümle cümle akan bir seslendirme için ise telefon platformunuzun kendi gerçek zamanlı ses motorunu kullanmanız gerekir. Bu ayrım pratikte şu şekilde çözülür: sık tekrarlanan cevaplar önceden seslendirilip önbelleğe alınır, yalnızca kişiye özel cümleler canlı sentezlenir. Bir asistanın söylediklerinin büyük kısmı zaten tekrar eden cümlelerdir; bu yaklaşım hem gecikmeyi hem maliyeti düşürür.
Ne Kadara Mal Olur? Açık Hesap
Somut bir senaryo kuralım: günde 100 çağrı, çağrı başına ortalama 6 tur konuşma (arayan sorar, asistan yanıtlar). Her turda modele giden bağlam yaklaşık 800 token, dönen yanıt yaklaşık 60 token olsun.
Günlük token hacmi: 100 × 6 × 800 = 480.000 giriş, 100 × 6 × 60 = 36.000 çıkış token.
| Kalem | Hesap | Günlük | Aylık (30 gün) |
|---|---|---|---|
| Giriş (hızlı sınıf, $0,45/1M) | 0,48M × 0,45 | $0,216 | $6,48 |
| Çıkış (hızlı sınıf, $3,75/1M) | 0,036M × 3,75 | $0,135 | $4,05 |
| Beyin katmanı toplam | $0,35 | $10,53 |
Yani ayda yaklaşık 10 dolarlık dil modeli maliyetiyle günde 100 çağrı karşılanır. Buna telefon altyapınızın kendi ücreti ve kullanıyorsanız konuşma sentezi maliyeti eklenir — hazır cevapları önbelleğe alırsanız sentez kalemi çağrı sayısıyla değil, farklı cümle sayısıyla ölçeklenir.
Maliyeti belirleyen asıl değişken çağrı sayısı değil, her tura taşıdığınız bağlamın uzunluğudur. Sistem talimatına eklediğiniz her 500 token, günde 600 turda 300.000 token demektir. Kurumsal bilgiyi promptun tamamına gömmek yerine soruya göre ilgili parçayı çekmek, bu kalemi kolayca yarıya indirir.
Fiyatlar satış fiyatıdır ve yazım tarihindeki katalog değerlerini yansıtır; güncel rakamlar için model listesi ve maliyet hesaplayıcı.
Asistanı Kullanışlı Yapan Şey Model Değil, Sınırlarıdır
Sesli asistan projelerinin çoğu model seçiminde değil, davranış tasarımında başarısız olur. Telefonda yapay zekayı işe yarar kılan dört kural:
Kısa konuşsun. Sistem talimatına yanıt uzunluğu sınırı koyun. Yazıda beş maddelik liste okunur; telefonda aynı liste karşı tarafı kaybettirir. "En fazla iki cümle, gerekirse tek soru sor" talimatı hem doğal hem hızlıdır.
Bilmediğini söylesin. Bir dil modeli boşluğu doldurmaya eğilimlidir; telefonda uydurulmuş bir fiyat ya da yanlış çalışma saati doğrudan güven kaybıdır. "Emin değilsen tahmin etme, konuyu ekibe aktar" kuralı, asistanın en değerli özelliğidir.
Devretme yolu açık olsun. Asistanın amacı her çağrıyı bitirmek değil, bitirebileceklerini bitirip kalanını temiz bir özetle insana aktarmaktır. Devretme eşiği net tanımlanmalı: iki turda çözülemeyen konu, şikâyet tonu, ödeme/iptal gibi işlemler.
Yapay zeka olduğunu gizlemesin. Karşılamada bunu belirtmek hem dürüstlük hem beklenti yönetimidir; arayan karşısındakinin bir asistan olduğunu bilirse net konuşur ve deneyim iyileşir.
KVKK Tarafında Neye Dikkat Etmeli?
Telefon görüşmesi, içeriğinde kişisel veri geçmese bile ses kaydı niteliğiyle kişisel veri işleme sayılır. Sesli asistan kurarken üç başlık öne çıkar.
Aydınlatma ve bilgilendirme. Çağrının başında kaydın ve otomatik sistemin varlığı belirtilmelidir. Mevcut çağrı kaydı anonsunuz varsa asistan bilgisini oraya eklemek en pratik yoldur.
Veri minimizasyonu. Modele giden metinde işin görülmesi için gerekmeyen kimlik bilgisi bulunmamalıdır. Arayan numarası, TCKN veya kart bilgisi gibi alanların prompt'a girmemesi; gerekiyorsa maskelenmesi gerekir. Bu hem uyum hem güvenlik açısından doğrudur.
Saklama süresi. Ses kayıtları, dökümler ve model yanıtları için saklama süresi tanımlanmalı ve süre dolduğunda gerçekten silinmelidir. Sesli asistan kurulumlarında en sık atlanan madde budur: döküm metinleri "log" sayılıp süresiz saklanır.
Onysoft tarafında istekler Türkiye'den faturalanır ve kurumsal e-fatura kesilir; veri işleme yaklaşımımızın ayrıntısı için KVKK uyumlu yapay zeka kullanımı yazısına bakabilirsiniz.
Bu bölüm genel bilgilendirme amaçlıdır, hukuki danışmanlık değildir.
Nereden Başlamalı?
Sesli asistanı tek seferde kurmaya çalışmak yerine, riski düşük bir yerden başlatmak işe yarıyor.
Mesai dışıyla başlayın. Şu anda kimsenin açmadığı saatlerdeki çağrılar en düşük riskli sahadır: asistanın alternatifi kusursuz bir insan değil, çalan ve açılmayan bir telefondur. Buradaki her karşılanan çağrı net kazançtır.
Beyin katmanını önce yazıyla test edin. Sesli kuruluma girmeden, asistanın sistem talimatını Playground üzerinde metin olarak deneyin. Sık gelen 20 soruyu yazıp cevapları okuyun; telefonda duyulacak cümleler önce ekranda doğru olmalı.
Model seçimini ölçüme bırakın. Hızlı sınıf bir modelle başlayın; yanıt kalitesi yetersizse bir üst sınıfa çıkın ve gecikmeyi tekrar ölçün. Hangi modelin işinize uyduğundan emin değilseniz OnyRouter soruyu sınıflandırıp uygun modele yönlendirir.
Devretme oranını izleyin. Asistanın kaç çağrıyı kendi bitirdiği, kaçını aktardığı tek anlamlı başarı ölçüsüdür. Bu oran zamanla iyileşmiyorsa sorun modelde değil, asistana verdiğiniz bilgidedir.
Beyin katmanı için hesap açmak birkaç dakika sürer: ücretsiz kayıt olun, API anahtarınızı alın ve ilk çağrınızı dokümantasyondaki örnekle atın.
Sık Sorulan Sorular
Telefonu yapay zekanın karşılaması için santralimi değiştirmem gerekir mi?
Hayır. Sesli asistan üç katmandan oluşur ve yapay zeka bunlardan yalnızca birini (yanıt üreten beyin katmanını) oluşturur. Mevcut santralinizin veya sanal santral hizmetinizin akışına bir API çağrısı eklenerek çalışır; ses taşıma katmanı olduğu gibi kalır.
Yapay zeka telefonda konuşulacak kadar hızlı mı?
Hızlı sınıf modellerde evet. Kendi üretim trafiğimizde son 60 günde 4.553 istekte ortalama yanıt süresi 1.561 ms, kısa yanıtlarda 1.471 ms ölçüldü — telefon görüşmesinin tolere ettiği pencerenin içinde. Üst sınıf akıl yürütme modelleri ise ortalama 8,8 saniyeyle canlı görüşme için uygun değildir; onlar çağrı sonrası özet gibi işlerde kullanılır.
Günde 100 çağrı karşılamak ne kadara mal olur?
Çağrı başına 6 tur ve tur başına yaklaşık 800 giriş / 60 çıkış token varsayımıyla hızlı sınıf bir modelde günlük yaklaşık 0,35 dolar, aylık yaklaşık 10,5 dolar. Buna telefon altyapınızın ücreti ve varsa konuşma sentezi maliyeti eklenir. Maliyeti asıl belirleyen çağrı sayısı değil, her tura taşınan bağlamın uzunluğudur.
Asistan cevabını sese çevirebiliyor musunuz?
Evet, konuşma sentezi modelleri katalogda mevcuttur ve /v1/audio/generate ucundan çağrılır. Bu uç asenkron çalışır (task_id döner, durum sorgulanır), yani önceden üretilip saklanan sesler için uygundur: karşılama anonsları, sık sorulan sorulara hazır cevaplar, sesli bildirimler. Canlı görüşme ortasındaki cümle cümle seslendirme için telefon platformunuzun gerçek zamanlı ses motoru kullanılır.
Asistan yanlış bilgi verirse ne olur?
Bu riski azaltmanın yolu model değiştirmek değil, sınır koymaktır. Sistem talimatına "emin değilsen tahmin etme, konuyu ekibe aktar" kuralını yazmak ve devretme eşiğini net tanımlamak (iki turda çözülmeyen konu, şikâyet tonu, ödeme/iptal işlemleri) telefonda en kritik tasarım kararıdır.
Sesli asistan KVKK açısından sorun yaratır mı?
Doğru kurulduğunda hayır. Üç başlığa dikkat edilir: çağrı başında otomatik sistem ve kayıt hakkında bilgilendirme, modele giden metinde gereksiz kimlik bilgisi bulunmaması (veri minimizasyonu) ve ses kayıtları ile döküm metinleri için tanımlı bir saklama süresi. En sık atlanan madde sonuncusudur; döküm metinleri log sayılıp süresiz saklanmamalıdır.
İlgili sayfalar
Denemeye hazır mısınız?
739+ AI modeline tek API ile erişin. TL bakiye yükleyin, kullandıkça ödeyin — abonelik yok.