data-infra

Veri Ambarı (Data Warehouse)

Veri ambarı, bir uygulamanın gerçek zamanlı okuma ve yazma işlemlerini yürüten operasyonel (OLTP) veritabanının aksine, büyük hacimli geçmiş veri üzerinde toplama, filtreleme ve birleştirme gibi analitik sorgular için özel olarak optimize edilmiş bir veritabanı sistemidir. Bu ayrım mimari olarak önemlidir: bir uygulamanın production Postgres veritabanı hızlı, küçük, işlemsel operasyonlar için ayarlanmıştır (bir sipariş ekle, bir kullanıcıya bak); Snowflake, BigQuery veya Redshift gibi bir ambar ise tam tersi için ayarlanmıştır - "son 24 ay için plan katmanına göre aylık yinelenen gelirimiz neydi?" sorusunu yanıtlamak için milyonlarca hatta milyarlarca satırı taramak. Bu tür bir sorguyu doğrudan production OLTP veritabanına karşı çalıştırmak tabloları kilitleyebilir ve gerçek kullanıcılar için uygulamanın canlı performansını düşürebilir - ambarların ETL/ELT boru hattı ile beslenen ayrı bir sistem olarak var olmasının tam nedeni budur. AI/SaaS kurucuları için neden önemli: geçmiş eğilimler, müşteriler arası kıyaslama, kohort analizi veya toplanmış veriyi içgörü üretimi için bir AI modeline besleme ("bu hesabın son çeyrekteki kullanım eğilimini özetle") içeren herhangi bir ürün özelliği, bir production veritabanı iş yükü değil, bir ambar iş yüküdür. Bu sorguları doğrudan uygulamanın canlı veritabanından sunmaya çalışmak, bir şirket büyüdükçe production yavaşlamalarına neden olan yaygın bir erken aşama hatasıdır. Nasıl çalışır: ambarlar sütunsal depolama kullanır (veri satır yerine sütuna göre organize edilir); bu, milyonlarca satırın birkaç sütunu üzerinde toplama sorgularını satır odaklı bir veritabanına göre çarpıcı şekilde hızlandırır, ancak tekil satır aramalarında zayıf kalır. Modern bulut ambarları depolamayı ve hesaplamayı ayırır - depolanan veri için ve sorgu hesaplaması için ayrı ayrı ödeme yaparsınız (genellikle saniye başına veya taranan byte başına); bu, bir şirketin yıllarca geçmişi ucuza depolamasına izin verirken, yalnızca sorgular gerçekten çalıştığında anlamlı bir ödeme yapmasını sağlar. Ambarlar genellikle ham ve dönüştürülmüş tabloları dolduran ELT boru hatlarıyla beslenir, ardından BI araçları (Looker, Metabase, Tableau) tarafından ya da müşteriye yönelik analitik özellikler için doğrudan uygulama kodu tarafından sorgulanır. Somut örnek: bir AI SaaS, ürün içinde "ekibinizin bu çeyrekte en çok kullandığı AI özellikleri" raporu sunmak istiyor. Bu toplamayı canlı uygulama veritabanına karşı çalıştırmak yerine (bu, gerçek kullanıcı trafiğiyle kaynak için rekabet ederdi), özellik kullanım olayları gece boyu bir boru hattı aracılığıyla bir BigQuery ambarındaki `usage_events` tablosuna akar; rapor uç noktası, production veritabanına dokunmadan BigQuery'ye karşı önceden toplanmış bir `SELECT feature_name, COUNT(*) FROM usage_events WHERE customer_id = @id AND event_date >= @quarter_start GROUP BY feature_name ORDER BY COUNT(*) DESC` sorgusu çalıştırır.

İlgili terimler

Daha fazla Veri ve Altyapı terimi