Ayarlar

Dil

AI API Batch Inference Fiyatlandırması: Asenkron İşler Ne Zaman Tasarruf Sağlar?

CryptoCrypto
·14 Temmuz 2026·11 dk okuma·Güncellendi 26 Temmuz 2026·258 görüntüleme
#fiyatlandırma#AI API#model altyapısı#TokenLab
AI API Batch Inference Fiyatlandırması: Asenkron İşler Ne Zaman Tasarruf Sağlar?

Toplu çıkarım (batch inference) fiyatlandırması, yanıt gecikmesini daha düşük bir token başına ücretle takas ederek çalışır: bir iş gönderirsiniz, sağlayıcı bunu tanımlanmış bir pencere içinde (genellikle 24 saate kadar) işler ve siz senkron, gerçek zamanlı bir çağrıya göre daha az ödeme yaparsınız. Bu takasın değip değmeyeceği tamamen iş yükünüzün bu beklemeyi tolere edip edemeyeceğine bağlıdır.

Bu makale, OpenAI ve Google tarafından yayınlanan toplu API dokümantasyonuna dayanarak toplu (asenkron) çıkarımı standart senkron API çağrılarıyla karşılaştırır ve asenkron yolun ürününüz için ne zaman gerçekten tasarruf sağladığına dair bir karar çerçevesi sunar.

Önemli Çıkarımlar

  • OpenAI ve Gemini, senkron çağrılara kıyasla indirimli bir oranda asenkron işleme için iş kabul eden bir toplu API yayınlamaktadır; oranlar değişebileceğinden, bütçe yapmadan önce her sağlayıcının fiyatlandırma sayfasındaki güncel indirim yüzdesini doğrulayın.
  • Toplu çıkarım, anında yanıt gerektirmek yerine bir geri dönüş penceresini tolere edebilen iş yüklerine uygundur: toplu sınıflandırma, embedding oluşturma, çevrimdışı değerlendirme, veri kümesi etiketleme ve geriye dönük (backfill) işler.
  • Gerçek zamanlı sohbet, kodlama ajanları ve etkileşimli ürün özellikleri genellikle toplu fiyatlandırmaya uygun değildir, çünkü işleme penceresi onları canlı kullanıcı etkileşimi için kullanılamaz hale getirir.
  • En büyük kümülatif tasarruflar genellikle toplu indirimleri model seçimi ve prompt verimliliği çalışmalarıyla birleştirmekten gelir; diğer kaldıraçlar için /models/rankings ve AI API maliyet düşürme rehberine bakın.

Toplu Çıkarım Gerçekte Ne Anlama Gelir?

Senkron API çağrıları, model oluşturmayı tamamladığı anda, genellikle saniyeler içinde bir yanıt döndürür. Bu anlık işlemle bağlantılı bir token başına ücret ödersiniz. Toplu çıkarım modeli tersine çevirir: tek bir istek-yanıt alışverişi yerine, bir dosya veya istek listesini iş olarak gönderirsiniz. Sağlayıcı işi kuyruğa alır, kendi kontrolündeki bir pencerede işler ve tamamlandığında sonuçları almanız için hazır hale getirir.

Bu, model içinde yeni bir çıkarım tekniği değildir. Bu, farklı bir ticari ve operasyonel sözleşmedir. Sağlayıcı, iş yükünüzü boş veya yoğun olmayan kapasiteye göre planlama imkanı bulur ve karşılığında, anında sunması gereken bir istekten daha düşük bir token başına ücret alır.

Hem OpenAI hem de Google, ilgili API'leri için bu modeli dokümante etmektedir:

  • OpenAI'ın Batch API referansı, yüklenen bir istek dosyasından toplu nesne oluşturmayı, durumunu takip etmeyi ve iş tamamlandığında çıktıyı almayı açıklar (platform.openai.com/docs/api-reference/batch/object).
  • Google'ın Gemini Batch API dokümantasyonu benzer bir modeli açıklar: bir istek grubu gönderin, iş asenkron olarak çalışır ve sonuçlar işlendikten sonra alınır (ai.google.dev/gemini-api/docs/batch-api).

Mekanikler sağlayıcılar arasında biraz farklılık gösterse de (dosya tabanlı gönderim, iş nesneleri, durum sorgulama, çıktı alma), temel yapı tutarlıdır: şimdi gönder, sonra topla, senkron eşdeğerinden daha az token başına ücret öde. Her sağlayıcının güncel dokümantasyonunu, hesabınız ve modeliniz için geçerli olan tam işleme penceresi ve indirim oranı açısından kontrol edin, çünkü bu detaylar sağlayıcıya özeldir ve değişebilir.

Dokümante Edilmiş İki Toplu API Nasıl Çalışır?

Mekanik düzeyde, her iki sağlayıcı da benzer bir yaşam döngüsünü izler:

  1. İstekleri hazırlayın. İşlenmesini istediğiniz bireysel çıkarım isteklerini, genellikle bir dosya olarak biçimlendirilmiş şekilde bir araya getirirsiniz (OpenAI, özel bir ID ile anahtarlanmış bir istek dosyasını kabul eder; Gemini, yapılandırılmış bir istek grubunu kabul eder).
  2. İşi gönderin. Yüklediğiniz girdiye referans veren bir toplu nesne veya iş kaynağı oluşturursunuz.
  3. Tamamlanması için sorgulayın veya bekleyin. İş, sağlayıcı dokümante edilmiş penceresi içinde işlemeyi bitirene kadar durumlar (kuyrukta, işlemde, tamamlandı veya başarısız) arasında ilerler.
  4. Çıktıyı alın. Tamamlandığında, her yanıtı ID'sine göre orijinal isteğiyle eşleştirerek çıktı dosyasını veya sonuç kümesini indirir veya getirirsiniz.

Hiçbir sağlayıcı toplu işleri anında işlemez. Fiyatlandırma modelinin tüm amacı budur: iş sizin değil, sağlayıcının programında çalışır ve daha düşük bir oran karşılığında sınırlı bir gecikmeyi kabul edersiniz. Ürününüz bu gecikmeyi tolere edemiyorsa, kağıt üzerinde ne kadar tasarruf edeceğinizden bağımsız olarak toplu fiyatlandırma sizin için uygun değildir.

Toplu Fiyatlandırma Ne Zaman Tasarruf Sağlar: Bir Karar Kontrol Listesi

Bir iş yükünü toplu uç noktaya yönlendirmeden önce bu kontrol listesini kullanın:

  • İş yükü doğal olarak etkileşimli olmayan bir yapıya sahip mi? Bir veri kümesi üzerinde sınıflandırma geçişleri, bir belge külliyatı için embedding oluşturma, içerik denetleme taramaları veya gece özetleme işlerinin tümü buna uygundur.
  • Ürününüz dokümante edilmiş işleme penceresini tolere edebilir mi? Bir kullanıcı veya alt sistem sonucun saniyeler veya dakikalar içinde gelmesine ihtiyaç duyuyorsa, toplu işlem uygun değildir.
  • Hacim önemli olacak kadar büyük mü? Toplu indirimler token başına uygulanır, bu nedenle mutlak tasarruflar hacimle ölçeklenir. Birkaç istek faturanızı hiçbir şekilde anlamlı bir şekilde değiştirmeyecektir.
  • Görev idempotent mi veya güvenli bir şekilde yeniden denenebilir mi? Toplu işler asenkron olarak çalıştığı ve kısmen başarısız olabileceği için, hattınızın alt sistem durumunu bozmadan yeniden gönderimi veya kısmi tamamlanmayı işlemesi gerekir.
  • Orkestrasyon katmanınız zaten asenkron iş sorgulamayı destekliyor mu? Bu modeli ilk kez oluşturuyorsanız, iş gönderimi, durum sorgulama ve çıktı mutabakatı için mühendislik süresi ayırın.
Boyut Senkron API Toplu (asenkron) API
Gecikme Genellikle saniyeler Dakikalar ila saatler, sağlayıcının dokümante edilmiş penceresiyle sınırlı
Fiyatlandırma Standart token başına ücret Sağlayıcı dokümantasyonuna göre senkrana kıyasla indirimli token başına ücret
En iyi kullanım Sohbet, ajanlar, canlı ürün özellikleri Toplu sınıflandırma, embedding'ler, çevrimdışı değerlendirme, geriye dönük işler
Hata işleme Çağrıda anında hata İş düzeyi durum; toplu iş içinde kısmi başarısızlıklar mümkün
Mühendislik yükü Basit istek-yanıt İş gönderimi, sorgulama ve çıktı alma mantığı gerektirir
Çıktı sıralaması Çağrı sırasıyla eşleşir Çağrı sırasıyla değil, özel istek ID'si ile eşleşir

Toplu Fiyatlandırma Ne Zaman Uygun Değildir?

Toplu çıkarım, bir kişinin veya alt sistemin yanıtı beklediği her durum için kötü bir uyumdur. Bunlar şunları içerir:

  • Konuşma ajanları ve sohbet ürünleri. Bir kullanıcı yanıtı bir işleme penceresinden sonra değil, saniyeler içinde bekler.
  • Kodlama asistanları ve ajansal kodlama iş akışları. Claude Sonnet 5 veya Kimi K2.7 Code gibi modeller etrafında oluşturulan araçlar, geliştirici ile model arasındaki sıkı geri bildirim döngülerine bağlıdır; toplu işlem etkileşimi tamamen bozacaktır.
  • Kullanıcıya dönük özellikler için gerçek zamanlı içerik üretimi, kullanıcının bir ilerleme göstergesini izlediği Nano Banana Pro veya Veo 3 gibi API'ler aracılığıyla isteğe bağlı görüntü veya video üretimi dahil.
  • Hizmet düzeyi gecikme gereksinimi olan her şey, bu gereksinim gevşek olsa bile (örneğin, bir dakikanın altı). Toplu pencereler genellikle saniyelerle değil, saatlerle ölçülür.

Hattınızın bir kısmı gerçek zamanlıysa ve bir kısmı değilse, işi bölün. Etkileşimli kısmı senkron API üzerinden yönlendirin ve toplu, gecikmeye toleranslı kısmı (gecelik yeniden indeksleme, veri kümesi yeniden etiketleme, değerlendirme çalıştırmaları) toplu uç noktaya itin.

Pratik Bir İstek Şekli

Tam şema, OpenAI'ın toplu nesnesi ile Gemini'nin toplu API'si arasında farklılık gösterir, bu nedenle aşağıdakileri her iki sağlayıcının istek formatının birebir kopyası olarak değil, açıklayıcı bir şekil olarak değerlendirin. Bunu uygulamadan önce tam alan adlarını ve uç noktaları güncel dokümantasyona göre doğrulayın.

# 1. Her biri özel bir ID'ye sahip isteklerden oluşan bir dosya hazırlayın
{"custom_id": "req-001", "method": "POST", "url": "/v1/chat/completions",
 "body": {"model": "your-selected-model", "messages": [{"role": "user", "content": "Classify this ticket."}]}}
{"custom_id": "req-002", "method": "POST", "url": "/v1/chat/completions",
 "body": {"model": "your-selected-model", "messages": [{"role": "user", "content": "Classify this ticket."}]}}

# 2. Toplu işi gönderin
POST /v1/batches
{
  "input_file_id": "file-abc123",
  "endpoint": "/v1/chat/completions",
  "completion_window": "24h"
}

# 3. İş durumunu sorgulayın
GET /v1/batches/{batch_id}
# durum döndürür: queued | in_progress | completed | failed

# 4. Tamamlandığında çıktıyı alın
GET /v1/files/{output_file_id}/content
# her yanıtı custom_id ile orijinal isteğiyle eşleştirin

Temel mühendislik modeli, sağlayıcıdan bağımsız olarak aynıdır: istek dosyanızı sabit ID'lerle oluşturun, işi gönderin, tamamlanması için sorgulayın ve çıktıyı orijinal istek listenizle mutabık kılın. İş düzeyi kısmi başarısızlıklar etrafında yeniden deneme mantığı oluşturun, çünkü işin kendisi başarılı olsa bile bir toplu iş bazı bireysel istekler başarısız olarak tamamlanabilir.

Toplu İndirimleri Model Seçimiyle Birleştirme

Toplu fiyatlandırma bir kaldıraçtır. AI model yönlendirme karşılaştırması ve AI API maliyet düşürme rehberinde ele alınan model ve prompt düzeyi kararların yerini almaz, onlarla birleşir. Hem toplu işe uygun olan hem de yönlendirme dostu görevler için DeepSeek V4 Flash, GLM-5.2 veya Gemini 3.5 Flash gibi daha düşük maliyetli bir model tarafından sunulan bir iş yükü, genellikle her iki kaldıracı tek başına uygulamaktan daha büyük mutlak tasarruflar görecektir. Büyük bir toplu işi tek bir modele ve fiyatlandırma katmanına taahhüt etmeden önce, sağlayıcılar ürün yelpazelerini güncelledikçe sınır (frontier) ve düşük maliyetli modeller arasındaki göreceli fiyatlandırma değiştiğinden, /models/rankings adresindeki güncel model başına fiyatlandırmayı ve konumlandırmayı kontrol edin.

Toplu desteği oluşturup oluşturmamayı değerlendiren ekipler için hesaplama basittir: gecikmeye toleranslı görevler için aylık token hacminizi tahmin edin, dokümante edilmiş toplu indirimi aynı hacimdeki mevcut senkron harcamanızla karşılaştırın ve bunu iş gönderimi ve sorgulama mantığı oluşturmanın mühendislik maliyetiyle tartın. Hacim küçükse, indirim eklenen karmaşıklığı telafi etmeyebilir.

Sınırlamalar

Bu karşılaştırma, 2026-07-14 tarihinde gözlemlendiği üzere OpenAI ve Google tarafından toplu API'leri için dokümante edilen genel mekaniklere dayanmaktadır. Tam indirim yüzdeleri, işleme penceresi uzunlukları, model başına kullanılabilirlik ve dosya formatı gereksinimleri sağlayıcıya özeldir, zamanla değişir ve burada sabit sayılar olarak yeniden belirtilmemiştir. Bütçe yapmadan veya oluşturmadan önce güncel toplu fiyatlandırmayı ve şartları doğrudan her sağlayıcının dokümantasyonuna göre doğrulayın. Bu makale ayrıca her model sağlayıcısından gelen toplu desteği kapsamaz; bir toplu iş planlamadan önce seçtiğiniz modelin ve satıcının bir toplu uç nokta yayınlayıp yayınlamadığını kontrol edin.

SSS

Toplu çıkarım, senkron çağrılardan ne kadar daha ucuzdur? Hem OpenAI hem de Google, standart senkron oranlarına göre toplu işleme için bir indirim dokümante eder, ancak tam yüzde sağlayıcıya ve zamana özeldir. Tasarrufları tahmin etmeden önce sağlayıcınız ve modeliniz için güncel fiyatlandırma sayfasını kontrol edin.

Toplu işim işleme penceresi içinde bitmezse ne olur? Sağlayıcı dokümantasyonu (kuyrukta, işlemde, tamamlandı ve başarısız gibi) iş durumlarını açıklar. Davranış sağlayıcıya göre değişebileceğinden ve değişime tabi olduğundan, her sağlayıcının tamamlama penceresini aşan işleri nasıl ele aldığına dair dokümantasyonunu inceleyin.

Toplu çıkarımı gerçek zamanlı sohbet özellikleri için kullanabilir miyim? Hayır. Toplu işler, dakikalar ila birçok saat arasında sürebilen bir pencere içinde asenkron olarak işlenir, bu da onları kullanıcının veya sistemin anında yanıt beklediği herhangi bir iş yükü için uygunsuz hale getirir. Etkileşimli özellikler için senkron API'yi kullanın ve toplu uç noktaları gecikmeye toleranslı, yüksek hacimli görevler için ayırın.

Toplu fiyatlandırmanın iş yükünüze uygun olup olmadığını değerlendiriyorsanız, mevcut model başına oranları ve sıralamaları karşılaştırın, ardından iş gönderimi ve sorgulama mantığına mühendislik süresi ayırmadan önce gecikmeye toleranslı işlerinizi yukarıdaki kontrol listesine göre eşleştirerek başlayın.

Kaynaklar

Fiyat 2026-07-14 tarihinde gözlendi

Paylaş:

İlgili modeller

Son herkese açık modeller

Bu rehberdeki modellerle geliştirin

Fiyatları karşılaştırın, rotaları test edin ve araştırmayı çalışan bir API çağrısına dönüştürün.