дата инженеретта
описание
мелкое — крупно, в глубоком разговоре мудрость приходит по вопросам сюда: @aigul_sea
3 423
подписчиков
Охват к подписчикам
71,5%
ERR
Реакции к просмотрам
0,94%
543 на 25 постов
Пересылки к просмотрам
1,05%
603
Постов в день
0,3
всего 25
Где отзываются чаще
доля реакций к просмотрам- 12 авг.Анти чек-лист работы в DE По ходу жизни собрала список того, что мне не очень нравится в работе. И вот что в него вошло: 1️⃣Канбан У вас нет пула задач на ближайшее время. К вам могут приходить аналитики и менеджеры с адхоками, которым нужны отчеты еще вчера. Вы не можете спокойно распределить время на свои задачи. В канбане будут всегда прилетать новые задачи, которые нужно взять, как только закончите предыдущую. И вместе с этим постоянное ощущение напряга 2️⃣ Проектная работа Проекты заканчиваются. Допустим, он длится год, потом вам обещают найти другой. А если проект свернут раньше года? А если другой проект не найдется? 3️⃣ Срочный трудовой договор Он может быть короче даже самого проекта. А если договор не продлят? Не проще ли сразу найти нормальное место и не жить в страхе от приближения того самого дня? 4️⃣ Ты - единственный DE Я в такое лезть не пробовала, но внутренне становится некомфортно. Представь, у тебя больше нет DEшной экспертизы в команде. Если не получается - надеешься только на себя (ну и на иишку) 5️⃣ В стеке только 3 инструмента На рынке де столько всего требуется, как потом красиво преподать свой опыт, когда ты все последнее время писал только SQL и YAML? 6️⃣ Очень сложные задачи А это я бы назвала другой крайностью 5го пункта) Делать настолько уникальное, что в других местах абсолютно не нужно. Или просто лично для меня непонятное, например, писать заливку данных на Rust 7️⃣ Уникальный стек Молодец, ты освоишь инструмент, который нигде больше не используется 8️⃣ Нет созвонов Вот вообще. Хотя бы раз в несколько дней. Просто заканчиваешь одну задачку и берешь следующую. В такие моменты складывается ощущение, что члены команды между собой не общаются. У кого-то такой подход может вызывать лишь восторг) Но для меня общение с коллегами - реально важная часть и чего не хватает на удаленке 9️⃣ Нет чатика с мемами Это тоже в тему общения с командой и создания более прочных коммуникативных связей 💫💫💫💫💫💫💫💫💫💫💫 Здесь я привела свое субъективное мнение, вы можете поспорить или дополнить своими пунктами🥺 @data_engineerette4,61%
- 15 авг.Как разогнать Lakehouse-ный S3 в 3 раза? 18 августа VK Tech проводит митап про платформы данных. И там будет интересный кейс Авито про ситуацию, когда производительность дата-платформы упирается не в движок, а в S3 🙂 Их аналитическая платформа работает на Trino и Vertica поверх Hive-каталогов, а данные лежат в S3 на HDD. Доступная конфигурация S3 уперлась в предел масштабирования и 20 ГБайт/с на чтение. Что придумали: 🤩взяли три S3 кластера 🤩распределили объекты каждой таблицы между ними по хешу пути 🤩превратили существующие HAProxy-сайдкары на compute-нодах в stateless-шардирующий прокси 🤩каждая нода стала сразу ходить в нужный S3 без отдельного proxy layer В итоге пиковую скорость чтения увеличили с 20 до 60 ГБайт/с🚀 На митапе Дмитрий Листвин из Авито расскажет, как они писали расширение HAProxy на Lua, реализовали ListObjects и DeleteObjects, какие проблемы собрали и как теперь решардируют и эксплуатируют эту конструкцию. Еще будет доклад Павла Кутакова из VK Tech про архитектуру VK Data Platform гиперконвергентной дата-платформы на k8s: управление СУБД и сервисами, отказоустойчивость, сеть, безопасность и наблюдаемость. А после инженеры RWB и VK Tech разберут подготовку сегментов для таргетинга на Trino и DataFusion и обсудят, как AI-агенты и новые типы нагрузок изменят платформы данных. И куда же без нетворкинга, пиццы🍕 и приятных напитков 🍺 📅 18 августа, сбор в 17:30 📍 Москва, БЦ «Скайлайт» 💻 Можно подключиться онлайн 🚀 Регистрация тут: https://vk.cc/d0fvkw?erid=2VtzqvrCo3H2,45%
- 24 июн.Кажется, я уработалась😕 Это моя первая мысль, как только я села в такси2,43%
- 30 июл.пупупу у меня всего 9 с половиной😚2,42%
- 26 янв. 2024 г.Так почему запрос стал медленнее? Это вопрос с собесов, и тут главное - не перечислить все варианты, а показать, что вы умняши и соображаете🤓 📝Я бы выделила вот эти группы: - появилось в разы больше данных - параллельно с таблицей что-то происходит, и она залочена - меньше ресурсов - поменялись индексы - поменялся план запроса (например, нужно помочь и добавить хинты) - сетевые проблемы - конфигурационные изменения (админы взяли и уменьшили параметры) 💬Очень полезные варианты - в комментариях к предыдущему посту. 🧐И, прежде чем столько ждать, лучше провести свой анализ, посмотреть на каунты, план запроса, спросить у коллег. Иначе 2 часа могут растянуться и на подольше🥺 #собес2,13%
- 14 июл.Сеньорские вопросы 🤵 Чем круче вы становитесь, чем в более highload сторону вы идете, чем быстрее развиваются ллмки, тем вопросики к вам становятся все серьезнее Собрала для вас подборку таких вопросов по технологиям: ✨ Spark Из чего состоит executor memory? Что такое spark.memory.storageFraction? В чем разница между Sort-Merge Join и Broadcast на маленькой таблице? Каким образом уменьшить количество шафла? Зачем нужен data spill? Как работает AQE? Какие проблемы спарка в кубере? 🧊Iceberg Как айсберг работает с параллельным изменением одного файла и нескольких? Почему при записи из старой таблицы в новую в айсберге джоба бежит очень долго? Почему при перекладке в айсберг забивается кэш? Какие проблемы с айсбергом, кроме maintenance? 🌺 Airflow, Python Что такое TYPE_CHECKING? Как добавить шаблонизированное поле, если оператор не поддерживает jinja? Что такое dynamic task mapping? 🖥 ClickHouse Если данные писались в одну ноду клика, то при ее падении какие данные будут лежать на остальных? Какие проблемы с Replacing Merge Tree при вставке 5тб данных? 300 колонок, 8 ключей - в чем проблема такого подхода и как лучше поменять? 🧘Kafka Как интеграция Spark-Kafka умеет обеспечивать exactly once? Как будет читать спарк из кафки, если 10 коров, 5 партиций? Сколько будет простаивать экзекьюторов? Как будет читаться таблица в спарке, если 1ТБ один файл, 20 коров? Сколько будет простаивать экзекьюторов? Как будут читать 10 инстансов приложения из 5 партиций? @data_engineerette1,49%
- 4 июн.Когда никто не понимает, как делать задачу😂1,40%
- 17 июн.Data + AI 🍿 Вчера-сегодня проходит Data + AI Summit от Databricks. Основная суть — как работать с данными в эру AI, реклама собственных разработок, интервью с партнерами и крупными пользователями, кейсы применения сервисов Меня больше всего поразило — как они красиво говорят, у них такая чистая четкая речь и акцент, как на аудировании😍 И больше 30к людей в офлайне!! Есть очень много интересных моментов, которые я пометила себе: 🤩Аннонсировали Lakehouse//RT на собственном движке Reyden, который возвращает результат на огромном объеме данных за мс и не требует перекладки данных в отдельную бд под дэши (красивые графички тут) ✨✨ 🤩Обсуждали Lakebase — это постгря как движок над s3. Чтобы опять-таки хранить данные в одном месте, а не перекладывать из OLTP в OLAP-системы🤪 🤩LTAP (Lake Transactional/Analytical Processing) = Lakebase + Lakehouse. Данные пишутся строками => строки конвертятся в столбцы => чтение по столбцам. Правда, нам не сказали, насколько эта конвертация затратна❓ 🤩На сцене побывал Ryan Blue, один из главных создателей Iceberg. Он сказал, что в Databricks уже поддерживается iceberg v3, где одна из фич — это кросс-поддержка iceberg+delta lake, которые на диске лежат одинаково, и не надо ничего переписывать при смене формата. А к концу q4 или чуть позже уже выйдет iceberg v4 🤩Genie One + Genie Ontology — чат-бот, дополненный глоссарием/знаниями предметной области компании на основе графов + коннектов к гугл драйв/почте/и т.д. А еще он умеет чекать пермишены к данным перед тем, как вернуть ответ. А агентов можно шерить с коллегами✨ 🤩Добавляется отдельный агент Genie ZeroOps, который постоянно следит за кластером. Если в 2 часа ночи упал пайплайн, он пойдет искать причины по линейджу всех зависимостей, внесет изменения в код, потестит в песочнице, подготовит фикс и отправит алерт о готовности. Вам остается только аппрувнуть✨✨ 🤩Omnigent — платформа, где можно миксовать несколько моделек, чтобы они делали разные операции. Это называется "meta-harness" 🤩В Uber за 1 квартал потратили годовой бюджет на AI 🤩Pepsico — один из пользаков, у которых раньше было 600 дата лейков😳 🤩Databricks заколлабились с OpenAI (приходил кофаундер Greg Brockman), чтобы их модельки забустили дата-сервисы @data_engineerette1,31%
- 20 июн. 2024 г.Вопросы на middle+ 😵 Недавно позвали на собес, решила сходить для контента🤩 Для меня он был прям сильно нестандартным, т.к. больше гоняли по кейсам "что будешь делать, если" и задавали нетривиальные вопросы по технике. 🚩 Ниже краткий списочек тем и вопросов: DataOps Синхронная/асинхронная репликация Селективный запрос Покрывающий индекс Всегда ли план запроса отражает правду? Zookeeper MapReduce Spark Что делать, если надо показать отчет за месяц, а данных за один день нет? Что делать, если после загрузки в dwh данных в 3 раза больше? Золотая запись PL/SQL процедуры Движки в КХ MDM (master data management) Data Lineage Data Vault/Anchor/Звезда В каких случаях что выбирать? ACID WAL (Write-Ahead Logging) Что сложнее - update vs insert? Физические джойны Какую бд выберешь, если ...? Что делать, чтобы сравнить данные с источником, api? Как будешь решать нестандартную задачу? 👍 Можете порассуждать в комментах) #собес1,20%
- 6 авг.Ребят, а тут есть такие, кто идет на дата конфу в Лондоне? https://www.bigdataldn.com Она бесплатная, нужно просто прилететь🙂 По темам очень похоже: лейкхаус, AI агенты, data fabric, data governance. И сессии от топовых компаний: Databricks, Microsoft, Google, JetBrains, dbt Labs, Snowflake… Я вот зарегалась и даже на некоторое время задумалась над подачей визы🤭 Но потом как вспомнила, что ИМЕННО В ЭТИ ДАТЫ у меня конфа в Москве Так что ищу шпиониро😎 Полную программу конференции можно хотя бы полистать тут @data_engineerette1,20%
- 16 июн.Hive vs HMS HMS - Hive Metastore Я долгое время вообще не знала про существование HMS. Для меня HMS и Hive шли неразрывно, и я не отличала одно от другого. Я же такая не одна, да?🌸 Но в один момент до меня дошло, что: 🤩Hive - это движок, который через синтаксис SQL (HiveQL) умеет ходить к данным. Мы пишем запросы как будто в обычной бд, но они становятся MapReduce/Tez/Spark задачами и ходят в файлики 🤩HMS - это каталог метаданных: схема таблиц, пути к файлам, типы данных, партиции и т.д. Ему для работы нужна бд. Чаще всего это PostgreSQL, MySQL Для работы Hive обязательно нужен HMS А вот сам HMS может использоваться и отдельно - с тем же Spark, Trino, Impala 🧊В контексте Iceberg мы используем HMS как технический каталог. Например, чтобы понимать, что таблице db.orders соответствует файл 000-asdkd27sn.metadata.json Подробнее про внутрянку hms я рассказывала здесь Про каталоги — тут @data_engineerette1,17%
- 9 июл.Всем привет! Возвращаюсь на связь, на прошлой неделе была в отпуске😌 А пока на нашем рынке я такого не видела, но на зарубежном после HR-интервью присылается очень подробное и информативное саммари: о чем говорили, что нужно спросить в следующий раз, ваши плюсы/минусы, соответствие вакансии @data_engineerette1,10%