Retrieval (Bilgi Erişimi)

Retrieval (bilgi erişimi/alma), belirli bir sorguyla en alakalı parçaları bulmak için bir belge, veri veya bilgi külliyatını aramak sürecidir — klasik arama motorlarının arkasındaki aynı temel fikir olan onlarca yıllık bir bilgi erişimi kavramıdır ve modern AI ürün mimarisinde bir RAG hattının ilk adımı olarak merkezi hale gelmiştir. Retrieval birkaç farklı mekanizma yoluyla gerçekleşebilir ve seçim kalite için önemlidir: leksik/anahtar kelime erişimi (klasik BM25 veya Elasticsearch tam metin araması gibi) sorgu ile belgeler arasındaki tam veya yaklaşık tam kelime örtüşmesine dayanarak eşleştirir; belirli terminolojiye sahip sorgular için hızlı ve kesindir ama anlama karşı kördür ("aboneliği iptal et" araması, yalnızca "planınızı sonlandırın" diyen bir belgeyle eşleşmez); semantik/vektör erişimi hem sorguyu hem de belgeleri vektör uzayına gömer ve anlama göre en yakın komşuları bulur; anahtar kelime aramasının kaçırdığı eş anlamlıları ve yeniden ifadeleri yakalar ama bazen literal eşleşmeden fayda sağlayan kesin terimlere (ürün kodları, hata mesajları) sahip sorgularda daha az kesin olabilir; ve hibrit erişim her iki yaklaşımı birleştirir (genellikle reciprocal rank fusion yoluyla), tipik olarak hem tam eşleşme hem de semantik eşleşme alakalılığını yakalayarak en iyi gerçek dünya sonuçlarını üretir. Bu, SaaS geliştiricileri için önemlidir çünkü retrieval kalitesi, RAG kalitesinin tavanıdır — üretim tarafındaki hiçbir prompt mühendisliği miktarı, baştan yanlış belgeleri alan bir sistemi düzeltmez; bu da retrieval ayarını (parçalama stratejisi, embedding modeli seçimi, metadata filtreleme, hibrit arama ağırlıklandırması, reranking) genellikle bir RAG sisteminde mühendislik zamanı yatırımı için en yüksek etkiye sahip yer haline getirir. Somut bir örnek: bir geliştirici belgelendirme arama asistanı "neden webhook'um tetiklenmiyor" sorgusunu alır. Saf anahtar kelime erişimi, sorguyla hiçbir tam kelime paylaşmadığı için "Sessiz olay teslimatı hatalarında hata ayıklama" başlıklı ilgili bir sorun giderme belgesini kaçırabilir; semantik erişim bunu yakalar çünkü embedding'ler kavramsal örtüşmeyi tanır; hibrit bir sistem, belge gerçekten en iyi eşleşme olduğunda, başlığında gerçekten "webhook" içeren bir belgeyi de doğru şekilde önceliklendirir. Üretim retrieval sistemleri genellikle ilk erişimden sonra bir reranking adımı ekler — en iyi birkaç aday LLM'e gönderilmeden önce başlangıç aday setini yeniden puanlayan, hesaplama açısından daha pahalı ama daha doğru bir alakalılık modeli. Retrieval kalitesi ayrıca herhangi bir sorgu verilmeden çok önce gerçekleşen belge hazırlama seçimlerinden de etkilenir: belgelerin nasıl parçalandığı (paragraf sınırlarında bölme, bir cümleyi veya tabloyu ortadan kesebilen sabit bir karakter sayısında bölmeye göre genellikle daha tutarlı anlam korur), hangi metadatanın eklendiği (kaynak, tarih, erişim izinleri, bölüm başlıkları) ve indekslemeden önce yinelenen veya neredeyse yinelenen içeriğin tekilleştirilip tekilleştirilmediği, bir retrieval sisteminin ne bulabileceğini ve ne kadar alakalı olduğunu doğrudan etkiler — yani RAG kalitesi çalışmasının anlamlı bir kısmı retrieval algoritmasının kendisinde değil, veri hazırlamada gerçekleşir.

İlgili terimler

Daha fazla Temel Yapay Zeka terimi