Происхождение данных (lineage)

Происхождение данных — это карта того, откуда данные приходят и куда уходят: какой источник породил значение, какие преобразования его затронули и какие нижестоящие таблицы, дашборды или модели от него зависят. Оно отвечает на два ключевых вопроса — «откуда взялась эта цифра?» (вверх по потоку) и «что сломается, если я изменю этот столбец?» (вниз по потоку). Для SaaS-разработчиков lineage превращает разбор неверного дашборда из дня раскопок в Slack в пятиминутную трассировку. Когда KPI выглядит странно, вы идёте по происхождению назад через каждый шаг пайплайна и находите, где всё разошлось. Перед миграцией схемы вы смотрите нисходящее происхождение, чтобы понять, кого сломаете. Современные инструменты фиксируют lineage автоматически. dbt строит граф зависимостей из ваших SQL-моделей; инструменты происхождения на уровне столбцов (в DataHub, OpenMetadata или встроенные в хранилище) разбирают запросы и отслеживают отдельные поля. На практике: для анализа влияния уровень столбцов куда полезнее уровня таблиц, но и сложнее в поддержке — вложитесь сначала в самые важные метрики и доверьте тяжёлую работу автоматическому разбору, а не ручным схемам.

Похожие термины

Ещё термины: Данные и инфраструктура