дата инженеретта
Статистикамелкое — крупно, в глубоком разговоре мудрость приходит по вопросам сюда: @aigul_sea
- Последний пост
- 15 авг.
- Последнее чтение
- 12:21
- Постов за неделю
- 3
- Всего постов
- 25
- Тип
- открытый
- Язык
- русский
- Категория
- Цитаты
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 922
- 1/48двое суток
- 1 056
- 1/72трое суток
- 1 139
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Как разогнать Lakehouse-ный S3 в 3 раза? 18 августа VK Tech проводит митап про платформы данных. И там будет интересный кейс Авито про ситуацию, когда производительность дата-платформы упирается не в движок, а в S3 🙂 Их аналитическая платформа работает на Trino и Vertica поверх Hive-каталогов, а данные лежат в S3 на HDD. Доступная конфигурация S3 уперлась в предел масштабирования и 20 ГБайт/с на чтение. Что придумали: 🤩взяли три S3 кластера 🤩распределили объекты каждой таблицы между ними по хешу пути 🤩превратили существующие HAProxy-сайдкары на compute-нодах в stateless-шардирующий прокси 🤩каждая нода стала сразу ходить в нужный S3 без отдельного proxy layer В итоге пиковую скорость чтения увеличили с 20 до 60 ГБайт/с🚀 На митапе Дмитрий Листвин из Авито расскажет, как они писали расширение HAProxy на Lua, реализовали ListObjects и DeleteObjects, какие проблемы собрали и как теперь решардируют и эксплуатируют эту конструкцию. Еще будет доклад Павла Кутакова из VK Tech про архитектуру VK Data Platform гиперконвергентной дата-платформы на k8s: управление СУБД и сервисами, отказоустойчивость, сеть, безопасность и наблюдаемость. А после инженеры RWB и VK Tech разберут подготовку сегментов для таргетинга на Trino и DataFusion и обсудят, как AI-агенты и новые типы нагрузок изменят платформы данных. И куда же без нетворкинга, пиццы🍕 и приятных напитков 🍺 📅 18 августа, сбор в 17:30 📍 Москва, БЦ «Скайлайт» 💻 Можно подключиться онлайн 🚀 Регистрация тут: https://vk.cc/d0fvkw?erid=2VtzqvrCo3H
Анти чек-лист работы в DE По ходу жизни собрала список того, что мне не очень нравится в работе. И вот что в него вошло: 1️⃣Канбан У вас нет пула задач на ближайшее время. К вам могут приходить аналитики и менеджеры с адхоками, которым нужны отчеты еще вчера. Вы не можете спокойно распределить время на свои задачи. В канбане будут всегда прилетать новые задачи, которые нужно взять, как только закончите предыдущую. И вместе с этим постоянное ощущение напряга 2️⃣ Проектная работа Проекты заканчиваются. Допустим, он длится год, потом вам обещают найти другой. А если проект свернут раньше года? А если другой проект не найдется? 3️⃣ Срочный трудовой договор Он может быть короче даже самого проекта. А если договор не продлят? Не проще ли сразу найти нормальное место и не жить в страхе от приближения того самого дня? 4️⃣ Ты - единственный DE Я в такое лезть не пробовала, но внутренне становится некомфортно. Представь, у тебя больше нет DEшной экспертизы в команде. Если не получается - надеешься только на себя (ну и на иишку) 5️⃣ В стеке только 3 инструмента На рынке де столько всего требуется, как потом красиво преподать свой опыт, когда ты все последнее время писал только SQL и YAML? 6️⃣ Очень сложные задачи А это я бы назвала другой крайностью 5го пункта) Делать настолько уникальное, что в других местах абсолютно не нужно. Или просто лично для меня непонятное, например, писать заливку данных на Rust 7️⃣ Уникальный стек Молодец, ты освоишь инструмент, который нигде больше не используется 8️⃣ Нет созвонов Вот вообще. Хотя бы раз в несколько дней. Просто заканчиваешь одну задачку и берешь следующую. В такие моменты складывается ощущение, что члены команды между собой не общаются. У кого-то такой подход может вызывать лишь восторг) Но для меня общение с коллегами - реально важная часть и чего не хватает на удаленке 9️⃣ Нет чатика с мемами Это тоже в тему общения с командой и создания более прочных коммуникативных связей 💫💫💫💫💫💫💫💫💫💫💫 Здесь я привела свое субъективное мнение, вы можете поспорить или дополнить своими пунктами🥺 @data_engineerette
Lakehouse для аналитиков и инженеров данных Приглашаем изучить популярный подход построения хранилищ данных Data Lakehouse c разделенным Compute и Storage на основе Iceberg и Trino. В программе курса: • Современная архитектура аналитических систем от DWH и Data Lake до Lakehouse с разделением Compute и Storage на базе Apache Iceberg и Trino. • Iceberg: управление файлами, снимками, каталогами, схемами изменений и очисткой. • Практическое использование Iceberg Catalog, работа с кластером Trino (на Kubernetes), подключение данных на S3 и выполнение SQL/ Python-запросов. • Работа с Iceberg+Trinо на больших масштабах: сложные запросы к датасету TPC-DS (2.8 млрд строк), интеграция с DBT, Apache Airflow, оценка производительность систем. • Построение пайплайнов, инструменты для корректной поддержки, обновления и масштабирования Lakehouse-инфраструктуры на уровне предприятия. Кто мы: R&D-центр Devhands, наш канал. Автор курса — Алексей Белозерский, CDO в inSales (Сбер 2B), ex: VK Tech, М.Видео, Эльдорадо 🗓 Старт курса: 27 августа Изучить программу и записаться можно здесь. Ждём вас! Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzquZf5с8
Ребят, а тут есть такие, кто идет на дата конфу в Лондоне? https://www.bigdataldn.com Она бесплатная, нужно просто прилететь🙂 По темам очень похоже: лейкхаус, AI агенты, data fabric, data governance. И сессии от топовых компаний: Databricks, Microsoft, Google, JetBrains, dbt Labs, Snowflake… Я вот зарегалась и даже на некоторое время задумалась над подачей визы🤭 Но потом как вспомнила, что ИМЕННО В ЭТИ ДАТЫ у меня конфа в Москве Так что ищу шпиониро😎 Полную программу конференции можно хотя бы полистать тут @data_engineerette
пупупу у меня всего 9 с половиной😚
Отгадайте с первой попытки, за какой это было период и что случилось😁😁 @data_engineerette
Сеньорские вопросы 🤵 Чем круче вы становитесь, чем в более highload сторону вы идете, чем быстрее развиваются ллмки, тем вопросики к вам становятся все серьезнее Собрала для вас подборку таких вопросов по технологиям: ✨ Spark Из чего состоит executor memory? Что такое spark.memory.storageFraction? В чем разница между Sort-Merge Join и Broadcast на маленькой таблице? Каким образом уменьшить количество шафла? Зачем нужен data spill? Как работает AQE? Какие проблемы спарка в кубере? 🧊Iceberg Как айсберг работает с параллельным изменением одного файла и нескольких? Почему при записи из старой таблицы в новую в айсберге джоба бежит очень долго? Почему при перекладке в айсберг забивается кэш? Какие проблемы с айсбергом, кроме maintenance? 🌺 Airflow, Python Что такое TYPE_CHECKING? Как добавить шаблонизированное поле, если оператор не поддерживает jinja? Что такое dynamic task mapping? 🖥 ClickHouse Если данные писались в одну ноду клика, то при ее падении какие данные будут лежать на остальных? Какие проблемы с Replacing Merge Tree при вставке 5тб данных? 300 колонок, 8 ключей - в чем проблема такого подхода и как лучше поменять? 🧘Kafka Как интеграция Spark-Kafka умеет обеспечивать exactly once? Как будет читать спарк из кафки, если 10 коров, 5 партиций? Сколько будет простаивать экзекьюторов? Как будет читаться таблица в спарке, если 1ТБ один файл, 20 коров? Сколько будет простаивать экзекьюторов? Как будут читать 10 инстансов приложения из 5 партиций? @data_engineerette
Всем привет! Возвращаюсь на связь, на прошлой неделе была в отпуске😌 А пока на нашем рынке я такого не видела, но на зарубежном после HR-интервью присылается очень подробное и информативное саммари: о чем говорили, что нужно спросить в следующий раз, ваши плюсы/минусы, соответствие вакансии @data_engineerette
видео или голосовое, без подписи
Кажется, я уработалась😕 Это моя первая мысль, как только я села в такси
Раскрываю тайну Наверняка у многих был такой момент, что вы заходите в YARN, находите Hive-запрос, хотите в него провалиться, но Tez UI недоступен? Теперь вы знаете, как он выглядит @data_engineerette
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
Data + AI 🍿 Вчера-сегодня проходит Data + AI Summit от Databricks. Основная суть — как работать с данными в эру AI, реклама собственных разработок, интервью с партнерами и крупными пользователями, кейсы применения сервисов Меня больше всего поразило — как они красиво говорят, у них такая чистая четкая речь и акцент, как на аудировании😍 И больше 30к людей в офлайне!! Есть очень много интересных моментов, которые я пометила себе: 🤩Аннонсировали Lakehouse//RT на собственном движке Reyden, который возвращает результат на огромном объеме данных за мс и не требует перекладки данных в отдельную бд под дэши (красивые графички тут) ✨✨ 🤩Обсуждали Lakebase — это постгря как движок над s3. Чтобы опять-таки хранить данные в одном месте, а не перекладывать из OLTP в OLAP-системы🤪 🤩LTAP (Lake Transactional/Analytical Processing) = Lakebase + Lakehouse. Данные пишутся строками => строки конвертятся в столбцы => чтение по столбцам. Правда, нам не сказали, насколько эта конвертация затратна❓ 🤩На сцене побывал Ryan Blue, один из главных создателей Iceberg. Он сказал, что в Databricks уже поддерживается iceberg v3, где одна из фич — это кросс-поддержка iceberg+delta lake, которые на диске лежат одинаково, и не надо ничего переписывать при смене формата. А к концу q4 или чуть позже уже выйдет iceberg v4 🤩Genie One + Genie Ontology — чат-бот, дополненный глоссарием/знаниями предметной области компании на основе графов + коннектов к гугл драйв/почте/и т.д. А еще он умеет чекать пермишены к данным перед тем, как вернуть ответ. А агентов можно шерить с коллегами✨ 🤩Добавляется отдельный агент Genie ZeroOps, который постоянно следит за кластером. Если в 2 часа ночи упал пайплайн, он пойдет искать причины по линейджу всех зависимостей, внесет изменения в код, потестит в песочнице, подготовит фикс и отправит алерт о готовности. Вам остается только аппрувнуть✨✨ 🤩Omnigent — платформа, где можно миксовать несколько моделек, чтобы они делали разные операции. Это называется "meta-harness" 🤩В Uber за 1 квартал потратили годовой бюджет на AI 🤩Pepsico — один из пользаков, у которых раньше было 600 дата лейков😳 🤩Databricks заколлабились с OpenAI (приходил кофаундер Greg Brockman), чтобы их модельки забустили дата-сервисы @data_engineerette
Hive vs HMS HMS - Hive Metastore Я долгое время вообще не знала про существование HMS. Для меня HMS и Hive шли неразрывно, и я не отличала одно от другого. Я же такая не одна, да?🌸 Но в один момент до меня дошло, что: 🤩Hive - это движок, который через синтаксис SQL (HiveQL) умеет ходить к данным. Мы пишем запросы как будто в обычной бд, но они становятся MapReduce/Tez/Spark задачами и ходят в файлики 🤩HMS - это каталог метаданных: схема таблиц, пути к файлам, типы данных, партиции и т.д. Ему для работы нужна бд. Чаще всего это PostgreSQL, MySQL Для работы Hive обязательно нужен HMS А вот сам HMS может использоваться и отдельно - с тем же Spark, Trino, Impala 🧊В контексте Iceberg мы используем HMS как технический каталог. Например, чтобы понимать, что таблице db.orders соответствует файл 000-asdkd27sn.metadata.json Подробнее про внутрянку hms я рассказывала здесь Про каталоги — тут @data_engineerette
AI-эра тех собесов 💻 Теперь вместе с sql/python-задачками на тех собесе могут дать создание мини-проекта за 20 минут Разрешается использовать все, что угодно, любые ллм. (Только подумайте над тем, что будет работать, когда вы на созвоне на внутренней платформе.) Есть только одно условие — шерить экран Примеры заданий ➡️Для де: написать ddl таблиц, sql-запросы по сборке витрин, несколько дагов ➡️Для разраба: придумать архитектуру микросервиса и реализовать его ➡️Разобраться в коде и найти баги Сгенерили, а дальше? 🙂 Интервьюеры могут сами пока не до конца понимать, что делать после генерации кода) Они просто сидят и смотрят, как ты будешь разбираться, что происходит, просят внести правки или объяснить кусок кода Пока такое замечено в WB в последние 2 месяца, но могут подтянуться и остальные. Особенно после этого поста😁 @data_engineerette
ClickOps Мне тут пришло в голову покопаться в сервисах AWS и поделать какие-нибудь лабы. На ютубе довольно много видосов от индусов (и не только) на эту тему, я в итоге решила посмотреть вот этот 4х-часовой туториал с пет-проектом 🎙 Там парень очень понятно рассказывает про теорию и сервисы, показывает, как что делать. К акценту надо привыкнуть, но вроде норм) Говорит он супер быстро, как будто на x1.5 смотришь. Одна из фраз, которая красной линией проходит по видосу: Сейчас никто не пишет код сам. Если вы хотите что-то реализовать или столкнулись с проблемой — идите к ChatGPT Еще сайтец у него есть полезный, там очень много инфы собрано 💻 В чем суть проекта? Взять данные из файлов и API, залить в S3, переложить по слоям, добавить dq, настроить алерты, собрать витрину и поставить на расписание. Используя тех стек AWS: S3, Glue, Lambda, Athena, Step Functions, CloudWatch, SNS Вся эта история поместилась в 5 питонячих файлов и 4 джейсонины. Поэтому проект натолкнул меня на несколько логичных мыслей, но над которыми я не задумывалась: 1️⃣Девопсы вообще не нужны — все и так настроено и работает 2️⃣Платформенные решения, фреймворки для витрин тоже не нужны — достаточно написать одну Glue-джобку и запускать ее с разными конфигами 3️⃣Основная работа DE — нажимать на кнопочки и заполнять формочки Создать таблицу? 4 клика Загрузить csv в таблицу? 6 кликов Добавить поле? Перетащить прямоугольничек Партицировать таблицу? Выбрать колонку из списка Выделить инкремент для загрузки? Включить опцию Оно примерно так и есть, или я пока что-то упускаю? @data_engineerette