data-infra
Словарь ↗Data Lakehouse (озеро-хранилище)
Lakehouse — это архитектура, которая размещает возможности хранилища данных (ACID-транзакции, контроль схемы, быстрый SQL) прямо поверх дешёвого объектного хранилища вроде S3, а не в проприетарном хранилище. Цель — совместить низкую стоимость и гибкость озера данных с надёжностью и производительностью хранилища, чтобы не поддерживать две отдельные системы. Технология-основа — открытые табличные форматы Apache Iceberg, Delta Lake и Apache Hudi, которые добавляют журнал транзакций и слой метаданных поверх колоночных файлов Parquet. Этот слой приносит атомарные записи, «путешествие во времени» и эволюцию схемы файлам, которые иначе превратились бы в мутное «болото данных». Для SaaS-разработчиков посыл lakehouse — избежать привязки к вендору и дублирования хранения: сырые данные и готовые к аналитике таблицы лежат в одних открытых файлах, доступных многим движкам (Spark, Trino, DuckDB, Snowflake, Databricks). На практике: обещание реально, но инструментарий моложе классических хранилищ. Если данных немного, управляемое хранилище часто проще; к lakehouse стоит идти, когда масштаб, стоимость или доступ из нескольких движков оправдывают лишнюю сложность.
Похожие термины