Что сделал HeadHunter

HeadHunter завершил проект внедрения Arenadata Catalog (ADC) — отечественной системы управления корпоративными данными. Компания несколько лет разрабатывала собственный каталог метаданных, но к 2024 году пересмотрела стратегию и перешла на готовое рыночное решение. Активная фаза внедрения заняла около трёх месяцев: команда HeadHunter реализовывала проект самостоятельно, привлекая техподдержку Arenadata по мере необходимости.

Что такое Data Governance и зачем нужен каталог данных

Data Governance — это управление корпоративными данными как активом: кто ими владеет, где они хранятся, что означают, кому можно их использовать и как отследить, из какого источника получена та или иная цифра в отчёте. Каталог данных в этой системе выполняет роль справочника и навигатора: вместо того чтобы искать нужную таблицу или показатель в переписке и документации, сотрудник обращается к единому пространству, где описаны все объекты данных компании, их связи и ответственные за них люди.

Потребность в таком инструменте команда HeadHunter зафиксировала ещё в 2022 году: с ростом объёма данных и штата компании усложнялись и аналитические задачи, требовалось единое пространство для коллективной работы с данными.

Масштаб внедрения в цифрах

  • Объём аналитического хранилища — 5,8 петабайта данных
  • Метаданные систем-источников — около 40 терабайт
  • Отсканировано 487 баз данных, описано 99 590 таблиц
  • Каталогизировано 1203 kafka-топика
  • Отслеживается 405 Airflow DAG и 40 783 задачи Airflow
  • Учтено 1768 дашбордов, более 200 KPI и бизнес-терминов, свыше 100 кастомизируемых классификаторов

Системой пользуются порядка 800 бизнес-пользователей из 45 команд, из них около 100 — активные пользователи каталога, а стабильное число уникальных активных пользователей в день превышает 30 человек.

Как каталог используется на практике

Аналитики чаще всего ищут описания таблиц, схем и колонок — с этим сценарием сталкиваются 72% пользователей, ещё 40% просматривают термины и метрики, 28% анализируют лайнэйдж (историю происхождения и преобразования данных). Технические специалисты используют каталог для поиска владельцев и стюардов таблиц (48%) и навигации по связям между объектами. Дата-инженеры обязаны указывать ссылку на объект каталога при постановке задач на переливку таблиц или kafka-топиков — это встроено в рабочий процесс, а не остаётся опциональной практикой.

Каталог данных и искусственный интеллект

Отдельное направление — использование каталога ИИ-агентами. HeadHunter разработала MCP-сервер (Model Context Protocol), который даёт ИИ-агентам доступ к метаданным, техническим описаниям и скриптам. Документация при этом хранится в Git-репозитории и синхронизируется с ADC. По сути, каталог данных превращается из справочника метаданных для людей в операционную систему, на которой строятся и внутренние ИИ-сервисы компании.

Контекст: зачем это компаниям с большими объёмами данных

Задача каталогизации данных становится особенно острой у компаний, накопивших данные быстрее, чем успели выстроить процессы управления ими, — что типично для быстрорастущих технологических компаний. Без единого каталога сотрудники тратят время на поиск нужной таблицы или показателя, дублируют аналитические расчёты, а качество данных, лежащих в основе бизнес-решений, невозможно проконтролировать. Рынок российских инструментов Data Governance формировался во многом как ответ на уход зарубежных решений этого класса, и переход крупных компаний на отечественные каталоги данных — показатель зрелости этого сегмента.

Итог: Опыт HeadHunter показывает, что каталогизация данных из вспомогательной ИТ-задачи превращается в инфраструктурный слой, на котором строятся и аналитика, и работа ИИ-агентов. Для других крупных компаний с петабайтными хранилищами это ориентир масштаба задачи и подтверждение того, что отечественные решения класса Data Governance готовы к промышленной эксплуатации.

Читайте также: