Prompt önbelleğe alma maliyeti üç değişkene bağlıdır: prompt'unuzun ne kadarının yeniden kullanılabilir bir önek olduğu, bu önekin önbelleğin aktif penceresi içinde ne sıklıkla tekrarlandığı ve belirli bir sağlayıcının önbellek yazma işlemlerini önbellek isabetlerine (cache hits) karşı nasıl fiyatlandırdığı. Bu üç sayıyı doğru ayarlarsanız, önbelleğe alma tekrarlayan iş yüklerinde girdi token faturanızı önemli ölçüde düşürebilir; yanlış yaparsanız, asla yeniden kullanılmayan bir önbellek için yazma primi ödeyebilirsiniz.
Bu rehber, sağlayıcıların neler belgelediğini, genel API yüzeylerinde neleri doğrulayabileceğinizi ve bir önbelleğe alma stratejisine üretim harcaması ayırmadan önce neleri test etmeniz gerektiğini birbirinden ayırır.
Temel Çıkarımlar
- Prompt önbelleğe alma maliyetinin iki bileşeni vardır: bir yazma maliyeti (genellikle yeni bir önbellek girişi oluşturulduğunda ücretlendirilir) ve bir isabet maliyeti (genellikle bir istek bu girişi yeniden kullandığında ücretlendirilir). Anthropic'in belgeleri bu yazma-isabet ayrımını açıkça tanımlar; harcama modellemesi yapmadan önce dokümanlar sayfasındaki güncel çarpanları teyit etmelisiniz.
- Önbellek isabetleri, tanımlanmış bir kesme noktasına (breakpoint) kadar tam veya tama yakın bir önek eşleşmesi gerektirir. Sistem talimatlarını, araç tanımlarını veya az örnekli (few-shot) örnekleri bu kesme noktasının önüne taşımak önbelleği geçersiz kılar ve yeniden yazmaya zorlar.
- Önbellek girişleri, sağlayıcı tarafından tanımlanan bir yaşam süresinden (time-to-live) sonra sona erer. Belirli bir önek için istek hacminiz bu pencerenin içine düşmeyecek kadar seyrekse, isabet tasarrufları biriktirmek yerine tekrar eden yazma maliyetleri ödersiniz.
- OpenRouter'ın belgeleri, prompt önbelleğe alma davranışının ve fiyatlandırmasının altta yatan sağlayıcıya ve modele göre değiştiğini belirtir; bu nedenle bir arka uçta tasarruf sağlayan bir önbelleğe alma stratejisi otomatik olarak diğerine aktarılmaz. Trafiği varsayılan tasarruflara göre yönlendirmeden önce model bazlı desteği kontrol edin.
Prompt Önbelleğe Alma Sizi Aslında Neler İçin Ücretlendirir?
Prompt önbelleğe alma, bir API sağlayıcısının bir prompt önekinin işlenmiş temsilini saklamasına olanak tanır, böylece bu öneki paylaşan sonraki istekler gereksiz hesaplamayı atlar. Bunun sonucunda ortaya çıkan faturalandırma modeli "önbelleğe alınan token'lar ücretsizdir" şeklinde değildir. Daha çok "önbelleğe alınan token'lar yeniden kullanımda daha ucuzdur, ancak ilk yazma işlemi standart bir girdi token'ından daha maliyetlidir" şeklindedir.
Anthropic'in prompt önbelleğe alma belgeleri bu yapıyı doğrudan ortaya koyar: yeni bir önbellek girişi oluşturan bir istek, mevcut bir girişi kullanan bir istekle farklı şekilde faturalandırılır. Kesin çarpanlar zamanla ve modele göre değişir, bu nedenle bir blog yazısında (buna dahil) gördüğünüz herhangi bir sayıyı sabit bir değer olarak değil, güncel dokümanlara karşı doğrulanması gereken bir şey olarak ele alın.
Pratik çıkarım şudur: prompt önbelleğe alma, yeniden kullanım üzerine yapılan bir bahistir. Sistem prompt'unuz, araç şemanız veya getirilen bağlam bloğunuz bir kez gönderilip asla tekrarlanmıyorsa, önbelleğe alma herhangi bir isabet tasarrufu sağlamadan bir yazma primi ekler. Aynı blok önbelleğin aktif penceresi içinde yüzlerce kez gönderilirse, isabet tasarrufları yazma maliyetini büyük bir farkla geride bırakabilir.
Önbellek İsabetleri Nasıl Çalışır: Önekler, Önekler ve Kesme Noktaları
Önbellek isabetleri, bulanık bir anlamda içerik tabanlı değil, önek tabanlıdır. Bir prompt'un önbelleğe alınan kısmı, önbellek sınırının (bazen kesme noktası olarak adlandırılır) belirlendiği noktaya kadar gelen istekle token bazında eşleşmelidir. Anthropic'in belgeleri bunu, geliştiricilerin prompt'un hangi kısmının önbelleğe alınmaya uygun olduğunu (genellikle çağrılar arasında değişmeyen kararlı sistem talimatları, araç tanımları ve uzun referans belgeleri) işaretlediği açık bir mekanizma olarak tanımlar.
Bunun doğrudan bir mühendislik sonucu vardır: önbellek kesme noktasından önce yerleştirdiğiniz her şey, boşluklar ve sıralama dahil olmak üzere istekler arasında bayt bazında aynı olmalıdır. Yaygın bir hata, istek başına değişkenleri (zaman damgası veya kullanıcı kimliği gibi) önbellek sınırının önündeki sistem prompt'una serpiştirmektir. Bu tek değişken, tüm önek için önbelleği bozar ve isabet biriktirmek yerine her çağrıda yazma maliyetleri ödersiniz.
Çözüm basittir: gerçekten statik içeriği (araç tanımları, kurum içi stil talimatları, büyük referans belgeleri) önbelleğe alınan önekte tutun ve isteğe özel her şeyi (genellikle kullanıcı mesajı olan) önbelleğe alınmamış soneke itin.
Önbellek ömrü, önek tasarımı kadar önemlidir. Anthropic'in belgeleri, dakikalarla ölçülen varsayılan bir önbellek süresini ve buna ihtiyaç duyan iş yükleri için daha uzun süreli bir seçeneği tanımlar. Trafik düzeniniz paylaşılan bir öneki her birkaç dakikada bir gönderiyorsa, kısa ömürlü bir önbellek bir sonraki istek gelmeden önce sona erebilir ve sonuçta sürekli yazma maliyetleri ödersiniz. Yüksek frekanslı iş yükleri (sohbet oturumları, aracı döngüleri, arka arkaya çalışan toplu işlem hatları), düşük frekanslı, düzensiz çağrılardan çok daha iyi adaylardır.
Gerçek API Harcamalarını Modelleme: Uygulamalı Bir Yaklaşım
Bir tasarruf yüzdesi iddia etmek yerine, kendi iş yükünüzü aşağıdaki şekille modelleyin. Bu örnek, istek yapısını kavramsal olarak göstermektedir; uygulamadan önce sağlayıcının belgelerindeki kesin alan adlarını ve güncel fiyatlandırmayı kontrol edin.
{
"model": "claude-sonnet-5",
"system": [
{
"type": "text",
"text": "You are a support agent. Full policy document follows...",
"cache_control": { "type": "ephemeral" }
}
],
"messages": [
{ "role": "user", "content": "What is the refund window for order 48213?" }
]
}
Sistem bloğundaki cache_control işareti, bu içeriğin bir önbelleğe alma adayı olduğunu belirtir. Bir oturumdaki ilk çağrı, o blok için yazma maliyetini öder. Önbelleğin aktif penceresi içinde aynı öneki yeniden kullanan sonraki her çağrı, bu token'lar için tam girdi oranı yerine isabet oranını öder.
Bunun hizmetiniz için uygulanmaya değer olup olmadığını tahmin etmek için kendi günlüklerinizden dört sayı toplayın:
- Önek boyutu: önbelleğe almayı planladığınız kararlı içeriğin (sistem prompt'u, araç şeması, referans belgesi) token sayısı.
- TTL penceresi içindeki çağrı sıklığı: önbelleğin aktif süresi içinde kaç isteğin o tam öneki yeniden kullandığı.
- Yazma ve isabet oranları: hafızadan varsayılan değil, güncel sağlayıcı belgelerinden alınan.
- Sonek değişkenliği: prompt'unuzun önbelleğe alınmamış kısmının, önbelleğe alınan kısma göre küçük olup olmadığı; çünkü tasarruflar toplam prompt'un ne kadarının önbellek kesme noktasının arkasında oturduğuyla ölçeklenir.
Önekiniz büyükse, TTL penceresi içindeki çağrı sıklığınız yüksekse ve sonekiniz küçükse, önbelleğe alma harcamaları muhtemelen azaltacaktır. Bu üç koşuldan herhangi biri zayıfsa, önbelleğe almayı geniş çapta yayına almadan önce yan yana bir maliyet karşılaştırması yapın. TokenLab'in AI API maliyetlerini düşürme rehberi, model seçimi ve toplu işleme dahil olmak üzere önbelleğe almanın ötesindeki daha geniş bir kaldıraç setini /blog/cut-ai-api-costs-30-percent adresinde incelemektedir.
Karar Tablosu: Prompt Önbelleğe Alma Ne Zaman Kazandırır?
| İş yükü modeli | Önbellek yardımcı olur mu? | Notlar |
|---|---|---|
| Bir oturumdaki birçok çağrıda yeniden kullanılan uzun sistem prompt'u veya araç şeması | Evet | Klasik durum; yazma maliyeti isabetler arasında amorti edilir |
| Kısa bir takip soruları patlamasında yeniden kullanılan büyük getirilen belge | Evet, çağrılar TTL içinde gerçekleşirse | Yeniden kullanım penceresini varsaymadan önce TTL'yi güncel dokümanlarla teyit edin |
| Tekrarlayan trafiği olmayan tek seferlik prompt'lar | Hayır | Karşılayacak isabet olmadan yazma primi |
| "Kararlı" bölümün sürekli değiştiği yüksek değişkenli prompt'lar | Hayır | Kesme noktasının önündeki herhangi bir değişiklik önbelleği geçersiz kılar |
| Birçok turda tekrarlanan araç tanımlarına sahip aracı döngüleri | Evet | Araç şemaları birincil önbelleğe alma adaylarıdır |
| Önbellek TTL'sinin ötesine yayılan düşük frekanslı toplu işler | Hayır | Önbellek yeniden kullanımdan önce sona erer; her seferinde yazma maliyeti ödersiniz |
| Yalnızca bazı arka uçların önbelleğe almayı desteklediği çoklu sağlayıcı yönlendirmesi | Model bazında doğrulayın | Önbelleğe alma desteğinin sağlayıcılar arasında aktarıldığını varsaymayın |
Bu tabloyu nihai bir cevap olarak değil, başlangıç kontrol listesi olarak kullanın. Kullanmayı planladığınız belirli model için TTL'yi, yazma/isabet fiyatlandırmasını ve kesme noktası mekaniklerini sağlayıcı belgelerine göre teyit edin, çünkü bu ayrıntılar model ailesine göre değişir.
Taahhütte Bulunmadan Önce Doğrulamanız Gereken Sağlayıcı Farklılıkları
Prompt önbelleğe alma her yerde aynı şekilde uygulanmaz ve trafiği birden fazla sağlayıcı veya model arasında yönlendiriyorsanız bu önemlidir. OpenRouter'ın prompt önbelleğe alma en iyi uygulamaları hakkındaki belgeleri, önbelleğe alma desteğinin ve davranışının altta yatan sağlayıcıya göre değiştiğini belirtir; bu da bir modelin önbellek mekaniklerine göre ayarlanmış bir stratejinin, modelleri değiştirdiğinizde veya farklı bir arka uç üzerinden yönlendirdiğinizde otomatik olarak uygulanmadığı anlamına gelir.
Mimariniz maliyeti kontrol etmek için model yönlendirmesi kullanıyorsa (örneğin, rutin sınıflandırma görevlerini DeepSeek V4 Flash, GLM-5.2 veya Gemini 3.5 Flash gibi daha düşük maliyetli bir modele gönderirken, daha zor akıl yürütme görevleri için Claude Sonnet 5 veya GPT-5.5'i ayırmak), bu yönlendirme tablosundaki her model için önbelleğe alma desteğini bağımsız olarak kontrol etmeniz gerekir. Bir modelin dokümanlarına göre doğrulanmış bir önbelleğe alma stratejisi, diğeri için güvenli bir varsayım değildir. TokenLab'in sıralamalar sayfası, /models/rankings adresinde başlangıç referans noktası olarak kullanabileceğiniz model düzeyindeki farklılıkları takip eder ve /blog/ai-model-routing-benchmark-cost-per-task adresindeki yönlendirme kıyaslama analizi, yönlendirme kararlarının görev başına maliyetle nasıl etkileşime girdiğini kapsar; bu da önbelleğe alma kararlarının yerine geçmek yerine onlarla birleşir.
Bu Analizin Sınırlamaları
Bu rehber, Anthropic tarafından belgelenen ve yukarıdaki gözlemlenen tarihler itibarıyla OpenRouter tarafından referans verilen prompt önbelleğe almanın genel mekaniklerini tanımlar. Kesin yazma/isabet çarpanlarını, kesin TTL sürelerini veya model bazlı fiyatlandırmayı içermez, çünkü bu rakamlar modele göre değişir ve farklılık gösterir. Üretim trafiği için bir maliyet modeli oluşturmadan önce, üçüncü taraf içeriklerde (bu makale dahil) alıntılanan herhangi bir sabit rakama güvenmek yerine güncel rakamları doğrudan yukarıda bağlantısı verilen sağlayıcı belgelerinden çekin. Akıl yürütme odaklı modeller, çok modlu prompt'lar ve çok uzun bağlam pencereleri için önbelleğe alma davranışı, burada açıklanan genel önek önbelleğe alma modelinden farklı olabilir; kullanmayı planladığınız belirli modelin belgelerine göre doğrulayın.
SSS
Prompt önbelleğe alma her zaman API harcamalarını azaltır mı? Hayır. Harcamaları yalnızca kararlı bir önek, önbelleğin aktif penceresi içinde yazma maliyetini karşılayacak kadar sık yeniden kullanıldığında azaltır. Düzensiz veya oldukça değişken prompt'lar, önbelleğe alma etkinleştirildiğinde genellikle onsuz olduğundan daha maliyetlidir.
Önbellek isabetini ne bozar? Boşluklar, token sırası veya aksi takdirde statik olan bir sistem prompt'una eklenen tek bir değişken dahil olmak üzere, önbellek kesme noktasının önündeki prompt içeriğinde yapılan herhangi bir değişiklik. Eşleşme, kesme noktasına kadar tam olmalıdır.
Prompt önbelleğe alma tüm sağlayıcılarda aynı şekilde mi uygulanır? Hayır. Anthropic, tanımlanmış yazma ve isabet fiyatlandırması ile açık bir önbellek kontrol mekanizmasını belgeler. OpenRouter'ın belgeleri, önbelleğe alma desteğinin ve fiyatlandırmasının altta yatan sağlayıcıya ve modele göre değiştiğini belirtir, bu nedenle desteği model bazında doğrulamalı ve aktarıldığını varsaymamalısınız.
Prompt önbelleğe almanın, model yönlendirmenin veya her ikisinin bir kombinasyonunun trafik düzeninize uyup uymadığını değerlendiriyorsanız, üretim harcaması yapmadan önce model seçeneklerini ve maliyet yapısını karşılaştırmak için TokenLab ile başlayın.
Kaynaklar
Fiyat 2026-07-14 tarihinde gözlendi
- OpenRouter prompt caching2026-07-14 tarihinde gözlendi
- Anthropic prompt caching2026-07-14 tarihinde gözlendi
- TokenLab model rankings2026-07-14 tarihinde gözlendi



