Türkçe yazmak yapay zekâya ne kadar pahalı? Kendi sitemin metniyle ölçtüm
mcalab.com.tr'nin TR ve EN metinleri aynı uzunlukta. Tokenizer'dan geçirince Türkçe %39 daha fazla token çıktı. Ölçümün tamamı ve faturaya etkisi.
Bu yazının İngilizcesi: English version.
Bir süredir kafamı kurcalayan bir şüphe vardı: Türkçe prompt yazmak İngilizceden pahalı mı? Herkes "eklemeli dil, token'ı çok yer" diyor ama kimse sayı vermiyor. Ben de kendi sitemi kobay yaptım.
Şansım şu: mcalab.com.tr bugüne kadar iki dilli tek sayfa mantığıyla yazıldı. Aynı HTML'de data-lang="tr" ve data-lang="en" etiketli iki metin yan yana duruyor. Yani elimde kendi yazdığım, telifi bana ait, gerçek bir paralel derlem var. Çeviri motoru değil, insan eliyle iki dilde kurulmuş cümleler.
Yöntem
Siteden data-lang çiftlerini çekip HTML'i temizleyen küçük bir betik yazdım. Tekrar edenleri (menü başlıkları her sayfada var) attım, geriye 24 benzersiz TR/EN çifti kaldı. Sonra bunları iki tokenizer'dan geçirdim:
cl100k_base— GPT-3.5 ve GPT-4 döneminin tokenizer'ıo200k_base— GPT-4o'dan itibaren kullanılan, GPT-5 ailesinin de tokenizer'ı
Araç gpt-tokenizer npm paketi, sürüm 4.0.0. Ölçüm 19 Ağustos 2026'da yapıldı.
Sonuç
Önce şu tesadüfe bakın: derlemin iki dili neredeyse birebir aynı karakter uzunluğunda. Bunu ben ayarlamadım, öylece çıktı.
| Ölçü | Türkçe | İngilizce | Oran |
|---|---|---|---|
| Karakter | 2.508 | 2.518 | 1,00 |
| Kelime | 356 | 441 | 0,81 |
| Token (o200k) | 770 | 554 | 1,39 |
| Token (cl100k) | 1.014 | 563 | 1,80 |
| Karakter / token (o200k) | 3,26 | 4,55 |
Aynı bilgiyi, aynı karakter sayısında anlatıyorum. Modern tokenizer'da Türkçe %39 daha fazla token ediyor. Eski tokenizer'da fark %80'di.
Kelime sayısına dikkat: Türkçe aynı şeyi %19 daha az kelimeyle söylüyor. "Kaydedebilirsiniz" bir kelime, "you can save it" dört kelime. Ama token cinsinden Türkçe kelime başına 2,16, İngilizce 1,26 token tutuyor. Yani Türkçenin kısalık avantajı tokenizer'da yeniyor, üstüne para veriyorsunuz.
Neden böyle
Tokenizer'lar İngilizce metin ağırlıklı derlemlerde eğitiliyor. Sık geçen İngilizce kelimeler tek bir token'a oturuyor; Türkçenin ekleri ise parçalanıyor. Birkaç kelimeyi tek tek geçirdim:
| Kelime | o200k token |
|---|---|
| computer | 1 |
| bilgisayar | 3 |
| update | 1 |
| güncelleme | 4 |
| application | 1 |
| uygulamalarımızın | 5 |
| çalıştıramadıklarımızdan | 8 |
| Zıpla | 3 |
Son satır beni güldürdü: kendi oyunumun adı üç token. Z, ı, pla. Türkçeye özgü ı harfi tek başına bir token yiyor. Latin alfabesi dışına çıkmadan bile pahalıya geliyoruz.
Bir istisna da var: Türkiye tek token. Demek ki derlemde yeterince sık geçen özel adlar sözlüğe girmiş. Yani mesele "Türkçe karakter" değil, sıklık. Tokenizer, gördüğü şeyi ucuzlatıyor.
Eski tokenizer'dan yeniye geçiş Türkçeye ne kazandırdı
Bu ölçümün en sevindirici tarafı: aynı 24 çiftte Türkçe token sayısı cl100k'da 1.014 iken o200k'da 770'e düşmüş. %24 ucuzlama. İngilizce tarafta ise 563'ten 554'e, yani neredeyse hiç değişmemiş.
Yeni tokenizer'ın kazancının büyük kısmını İngilizce dışındaki diller aldı. Kimse bunu duyuru metnine "Türkçe %24 ucuzladı" diye yazmadı ama sayı bu.
Faturaya çevirelim
19 Ağustos 2026 fiyatlarıyla, Anthropic'in fiyat sayfasına göre Claude Opus 5 girdisi 1 milyon token başına 5 dolar. Ölçtüğüm karakter/token oranlarıyla:
| Senaryo | TR token | EN token | Opus 5 girdi maliyeti farkı |
|---|---|---|---|
| 100 bin karakterlik doküman | ~30.700 | ~22.000 | 0,04 $ |
| Günde 500 böyle çağrı | 15,3 M | 11,0 M | ~21 $/gün |
| Aynısı ay boyunca | 460 M | 330 M | ~650 $/ay |
Tek seferlik bir sohbette fark yuvarlama hatası. Ama üretimde çalışan bir ürününüz varsa, Türkçe olmak size ayda üç haneli dolar yazıyor. Bunu bilerek fiyatlamak lazım.
Bir de ters tarafı var: bağlam penceresi de token cinsinden. 1 milyon token'lık pencereye İngilizce ~4,55 milyon karakter sığarken Türkçe ~3,26 milyon karakter sığıyor. Yani "1M bağlam" reklamı Türkçe kullanıcıya sessizce %28 daha küçük geliyor.
Ne yapıyorum
Ölçümden sonra kendi kullanımımda üç şeyi değiştirdim:
- Sistem promptunu İngilizce yazıyorum. Modelden Türkçe cevap istemek ayrı şey, ona verdiğim talimatı Türkçe yazmak ayrı şey. Talimat her çağrıda tekrar gidiyor; en pahalı kısmı o. İngilizceye çevirince aynı talimat gözle görülür şekilde küçüldü. Cevap kalitesinde bir fark hissetmedim — ama bu benim izlenimim, ölçüm değil.
- Uzun sabit metinleri önbelleğe alıyorum. Anthropic'te önbellek okuması temel girdi fiyatının onda biri. Türkçe metnin token şişkinliğini en ucuza kapatan yol bu; şişkinliği yok etmiyor, üstündeki çarpanı düşürüyor.
- JSON anahtarlarını ve alan adlarını Türkçe yazmıyorum. Ölçümden sonra fark ettiğim en aptalca kayıp buydu. Yapılandırılmış çıktı isterken şemadaki her anahtar her çağrıda gidiyor;
kullanici_adiyerineusernameyazmak tek başına birkaç token, ama şema yirmi alanlıysa ve günde binlerce çağrı yapıyorsanız toplamı görünür oluyor. Kullanıcıya gösterilen metin Türkçe kalsın, makineye giden anahtarlar İngilizce olsun. - Türkçe kullanıcı metnini olduğu gibi bırakıyorum. Kullanıcının yazdığını çevirip modele vermek hem anlam kaybettiriyor hem de çeviri çağrısının kendisi para. Şişkinliğe orada razıyım.
Bu ölçümün sınırları
Dürüst olmak lazım, bu bir akademik çalışma değil:
- 24 çift az. Üstelik hepsi benim üslubum: ürün tanıtım metni, kısa cümleler. Hukuk metni ya da sohbet kaydı ölçseydim oran değişirdi.
- Ölçtüğüm tokenizer OpenAI'ınki. Claude'un tokenizer'ı açık kaynak değil, elimde yok. Anthropic kendi dokümanında Claude 4.7 ve sonrasının yeni bir tokenizer kullandığını ve aynı metin için yaklaşık %30 daha fazla token ürettiğini yazıyor — ama bu farklı bir konu, dil farkı değil sürüm farkı. İkisini karıştırmayın.
- Gemini'nin tokenizer'ını da ölçmedim.
Yani "Türkçe %39 pahalı" cümlesi, tam olarak şu demek: benim yazdığım tarzda metinlerde, o200k_base tokenizer'ında, %39. Başka bir derlemde 1,3 de çıkar 1,5 de.
Yine de eminim olduğum şey şu: fark var, küçük değil, ve kimse size bunu söylemiyor. Fiyat sayfalarındaki "1 milyon token başına 5 dolar" ifadesi dil-nötr görünüyor ama değil. Türkçe konuşan bir geliştirici olarak, aynı dolarla daha az iş yapıyorsunuz.
Ölçümü kendi metninizle tekrarlamak isterseniz yöntem basit: iki dilde aynı içeriği alın, gpt-tokenizer paketinden o200k_base kodlayıcısını çağırın, uzunlukları bölün. On dakikalık iş. Kendi rakamınızı görmek, benimkine güvenmekten iyidir.
Bu blogda reklam vermek ya da birlikte iş yapmak
MCALAB bağımsız bir stüdyo. Sponsorluk, çapraz tanıtım ya da bir iş birliği için:
ads@mcalab.com.trAyrıntılar: Reklam & iş birliği. Kullanıcı desteği için destek sayfası.