core-ai
Sözlük ↗Token
Token, bir LLM'in tokenizer'ının girdi ve çıktıyı işleme için böldüğü en küçük metin birimidir — tam bir karakter değildir, tam bir kelime de değildir, istatistiksel olarak seçilmiş bir parçadır ve yaygın bir kelimenin tamamı ("the"), daha uzun bir kelimenin bir parçası ("token" → "tok" + "en") veya tek bir noktalama işareti olabilir. İngilizcede kullanışlı bir kural: 100 token ≈ 75 kelime, ancak bu dile göre değişir (İngilizce olmayan diller, özellikle Latin olmayan alfabeler kullananlar, genellikle çok daha az verimli tokenize edilir; yani aynı cümle daha fazla token'a mal olur). Token'lar, SaaS geliştiricileri için son derece önemlidir çünkü LLM uygulamalarında paraya ve zamana mal olan her şeyin gerçek birimidirler: API fiyatlandırması milyon girdi/çıktı token'ı başına belirtilir (örneğin Claude Sonnet 4.5, milyon girdi/çıktı token'ı başına yaklaşık 3$/15$), bağlam penceresi (kelime veya karakter değil) token cinsinden ölçülür ve üretim gecikmesi, modeller bir seferde tek bir token ürettiği için çıktı token sayısıyla ölçeklenir. Somut bir örnek: "Lütfen bu dokümanı üç madde halinde özetle." cümlesi yaklaşık 11 token'a tokenize edilir. Bir geliştirici 10.000 kelimelik bir doküman (~13.000 token) artı 50 tokenlık bir talimat gönderip 100 tokenlık bir özet alırsa, API çağrısı yaklaşık 13.050 girdi token'ına ve 100 çıktı token'ına mal olur — ve çıktı token'ları genellikle girdi token'larından 4-5 kat daha yüksek fiyatlandırıldığı için, ayrıntılı yanıtlar orantısız derecede pahalıdır. Maliyet konusunda dikkatli geliştiricilerin modellere özlü olmalarını talimatlandırmasının, tekrarlanan bağlamı önbelleğe almasının (prompt caching) ve yüksek hacimli, düşük karmaşıklıktaki görevler için daha küçük/ucuz modeller seçmesinin nedeni budur. Tokenizasyonu anlamak, modellerin bir kelimedeki harfleri sayarken tarihsel olarak zorlanması ("strawberry'de kaç tane r var") gibi tuhaf LLM davranışlarını da açıklar — çünkü model tek tek karakterleri değil, token'ları görür. Geliştiricilerin ayrıca token'ların bir isteğin her iki tarafında da tüketildiğini bilmesi gerekir — prompt'unuzdaki her token (sistem talimatları, konuşma geçmişi, geri getirilen RAG bağlamı) girdi token'ı olarak sayılır, modelin ürettiği her token ise çıktı token'ı olarak sayılır; çoğu sağlayıcı, üretimin token başına okumaktan hesaplama açısından daha pahalı olması nedeniyle çıktı token'larını girdi token'larından birkaç kat daha yüksek fiyatlandırır. Bu asimetri, bir modele "özlü ol" demenin veya API çağrısında `max_tokens`'ı sınırlamanın yalnızca bir kullanıcı deneyimi tercihi değil, gerçek bir maliyet kontrolü aracı olmasının nedenidir; ve konuşma geçmişinin sınırsız büyümesine izin veren bir sohbet özelliğinin (her turda tüm geçmişi girdi token'ı olarak yeniden göndermek) konuşmalar uzadıkça sessizce bir SaaS ürününün yapay zeka maliyet yapısının en pahalı parçalarından biri haline gelebilmesinin nedenidir.
İlgili terimler