Инжиниринг Данных
описание
Делюсь новостями из мира аналитики и карьерными советами. 15 лет в Аналитике и Инжиниринге Данных, 10 лет в MAANG 🛠️ dataengineer.ru | 🏄♂️ Surfalytics.com №5017813306 Реклама: https://almond-rule-130.notion.site/1199f595f76a8030ba1be1e607c9a8ce
23 807
подписчиков
Охват к подписчикам
23,6%
ERR
Реакции к просмотрам
0,32%
482 на 28 постов
Пересылки к просмотрам
0,70%
1 053
Постов в день
0,7
всего 30
Где отзываются чаще
доля реакций к просмотрам- 13 авг.Говорят навык кодить руками уже умирает. Писать код самому это уже недостаток. Понимать код, архитектуру и знать фундаментальные вещи это другое, которое необходимо. И теперь как-то надо это понимать и знать без hands-on опыта. Молодежь, держись ☕️1,64%
- 7 авг.Я получил новый MacBook и зарядил Claude Code скачать локальные модели на попробовать.0,63%
- 7 авг.Сегодня заценил новый skill от Claude. Как обычно Airflow Dag упал с ошибкой. Обычно я копирую ошибку в Claude Code и прошу его починить. Но сегодня товарищ попробовал попросить Claude bot, и он сразу нашел проблему, владельца dag, source code изменения и тп. И сразу сделал PR. Раньше мы такое делали как мини проект - запускали lambda, чтобы она все это делала и писала ответ и создавала PR. А теперь все из коробки.0,62%
- 13 июл. 2025 г.Краткий обзор платформы данных Т-Банка (Рубрика #Data) Прочитал интересную статью от коллег про про нашу data platform. Если обобщать достаточно длинную статью, то можно отметить, что платформа данных Т-Банка эволюционировала более 18 лет, следуя общеотраслевым трендам. Компания постепенно отходила от классических концепций хранилищ данных по Инмону и Кимбеллу в сторону Data Lake, а затем — к современным Lakehouse-архитектурам. Платформа сейчас обслуживает более 17 тысяч пользователей и обрабатывает свыше 144 млн запросов в месяц, что требует постоянного развития масштабируемости и производительности. Текущая архитектура включает 19 ключевых систем, которые обеспечивают полный жизненный цикл работы с данными — от сбора до визуализации и обеспечения безопасности. Вот как они сгруппированны 1. Сбор и транспортировка данных - Data Replication: BODS (legacy) и Chrono для пакетной и потоковой репликации - Event Sourcing: SDP (Streaming Data Transfer Platform) на основе принципов Data Mesh - Reverse ETL: Spheradian для возврата данных в операционные системы с латентностью до 100 мс 2. Хранение данных - Data Warehouse: GreenPlum как основная СУБД (15 кластеров, 1,7 ПБ данных) - LakeHouse: Spark/Trino + S3 с несколькими вычислительными движками - Real-Time Analytics: ClickHouse для быстрой аналитики на больших таблицах 3. Обработка и трансформация - Streaming Processing: Unicorn (на Apache Flink) и NiFi - Workflow Management: TEDI (на Apache Airflow) и Moebius для оркестрации - Analytics Tools: Proteus (на Apache Superset) для дашбордов и Helicopter для совместной работы 4. Управление данными - Data Discovery: Data Detective для поиска и каталогизации - Data Governance: Data Contracts для управления поставками данных - Data Observability: DQ Tools для контроля качества и Data Incident Management - Data Security: SLH для управления доступом к чувствительным данным Если хочется узнать больше, то можно почитать статью и позадавать вопросы в комментариях. #Data #Database #Architecture #Software #Engineering #PlatformEngineering0,60%
- 11 авг.Рост зарплат DE в Канаде, да и в мире. Раньше в Канаде средняя вилка была 140-160к, а теперь уже почти все вакансии до 200к (в год gross). И это за старшего инженера. В США будет конечно выше и уже в usd. Как дела с зарплатами в РФ и Европе?0,58%
- 13 янв.📅 #Топ мировых конференций по Data Engineering на 2026 🧰 01/24 — Data Day Texas +AI — Austin, USA — ламповая комьюнити-конфа про инженерку данных: пайплайны, DWH/lakehouse, облака, практики прод-эксплуатации. Online только материалы/записи (если выложат). 🧭 03/09-11 — Gartner Data & Analytics Summit — Orlando, USA — data governance, architecture, operating model, “как продать и масштабировать платформу данных” в компании (полезно архитекторам/лидам). Online только материалы после (если доступны). ☁️ 04/22-24 — Google Cloud Next — Las Vegas, USA — паттерны построения data platforms в GCP: ingestion, lakehouse/warehouse, streaming, security & governance. Online только записи/хайлайты (если будут). ⚡ 05/19-20 — Current (Confluent) — London, UK — Kafka/streaming в проде: real-time ETL, schema evolution, governance, observability, event-driven архитектуры. Online только материалы/записи (если выложат). 🏛️ 05/06-08 — Data Innovation Summit — Stockholm, Sweden — современная дата-платформа: data products, governance, quality, architecture, enterprise-кейсы. ❄️ 06/01-04 — Snowflake Summit — San Francisco, USA — облачный DWH/платформа: performance, governance, sharing, ingestion/ELT, экосистема. Online только livestream ключевых + записи. 🧊 06/15-18 — Data + AI Summit (Databricks) — San Francisco, USA — lakehouse/lakehouse-ops: ingestion, streaming, governance, cost/perf, infra для MLOps/GenAI на платформе. Online только Watch On Demand. 🌀 08/31-09/02 — Airflow Summit — Austin, USA — оркестрация и ops: multi-tenant Airflow, reliability, backfills, sensors, best practices для data platform teams. Online только записи (если выложат). 🛠️ 09/15-18 — Coalesce (dbt Labs) — Las Vegas, USA — analytics engineering для прод-DWH: dbt, тесты/контракты, семантика, lineage, CI/CD. IRL + online. 🎡 09/23-24 — Big Data LDN — London, UK — большой зоопарк modern data stack: платформы, интеграции, governance/quality, архитектурные кейсы и вендоры. Online только материалы (если появятся). 🏗️ 11/30-12/04 — AWS re:Invent — Las Vegas, USA — инфраструктура под data platforms: storage/lakehouse, streaming, managed data services, security, FinOps. Online только on-demand + Best of re:Invent (virtual). #y2026 #DE #data #conferences #dataengineering #modernDataStack #dataplatform #airflow #dbt #iceberg #kafka #streaming #dataquality #datagovernance #tobecontinued.. Сохраняй — и пусть 2026 будет годом крепких дата-платформ и бодрых релизов 🚀 * при подготовке использовались #LLM, тч делайте #фактчекинг 😁 (и присылайте под пост или в директ;))0,46%
- 1 авг.Товарищ скинул видео про Clickhouse и его основателя. Очень интересно и познавательно. Как-то я его всего недооценивал на западном рыке. Очень интересный кейс для data observability - миграция c DataDog/Splunk, миграция хранилища данных Databricks/Snowflake на ClickHouse Cloud. Вот пришел бы ко мне Clickhouse, я бы им помог завоевать рынок Северной Америки через сообщества и обучение. Я так много лет назад предлагал Teradata, когда им на пятки наступал Snowflake (они без меня классно разобрались, но сделали playbook для всех), но никто мне не ответил. Поэтому мой 14 летный сын знает, что такое Snowflake, но не знает, что такое Teradata🎮 Меня попросили развернуть проект хранилища данных, я предложил Snowflake + dbt core и все внутри Snowflake - dbt, alerts, orchestration. Для BI Metabase. Задача сделать максимально дешево. Но может быть стоит попробовать Clickhouse Cloud. Как он с dbt core? Какие самые дешевые решения для оркестрации и BI?0,43%
- 03:58Оказывается GitHub переживает тяжелые времена. Я сам замечаю как мои простые jobs на расписание работают через раз. Получается для critical pipelines GitHub все хуже. А как у вас?0,42%
- 17 авг.🚀🚀🚀 📅 Сегодня в 19:00 по МСК будет вебинар про то, как агентный AI начинает менять привычный подход к BI и меняет бизнес-аналитику. 🎙 Спикеры: ребята из AI4BI. Вебинар будет здесь (в канале) в онлайне 🔍 Описание: Поговорим о том, как меняется сама работа с аналитикой: от ручных SQL-запросов и привычных дашбордов - к агентам, которые могут самостоятельно работать с данными, находить аномалии и помогать получать ответы быстрее. Что разберем: 🔸 почему self-service BI не решил многие проблемы аналитики и куда сейчас движется Agentic BI 🔸 Open Source vs Enterprise: Vanna, DB-GPT, Superset - в сравнении с DataLens и Power BI 🔸 как может выглядеть агентный слой поверх Apache Superset + Trino + ClickHouse в закрытом контуре 🔸 реальный кейс внедрения в ритейле на 1500+ пользователей - логистика, склады, транспорт 🔸 экономика внедрения и окупаемость такого подхода на реальном кейсе Думаю, особенно интересно будет тем, кто работает с BI, аналитическими платформами и AI-агентами или просто хочет понять, куда сейчас движется аналитика. ◼︎ Сегодня, 19:00 по Москве Ссылки на ресурсы ребят: 🔗 Сайт → https://ai4bi.raftds.ru/ 🔗 Канал → https://t.me/ai_archnadzor 🚀🚀🚀 #datalearn #Вебинар0,42%
- 31 июл.Snowflake показал отчлиные результаты и стоки у них подросли. Без AI конечно не обошлось. Для меня Snowflake все еще является лучшей платформой для хранилища данных. Не самой дешевой, но самой простой и понятной. Про Databricks такого сказать не могу.0,40%
- 11 авг.В Lakehouse можно сколько угодно ускорять compute, но если S3 не успевает отдавать данные, вся платформа упрётся в storage. 18 августа на Data Meetup VK Tech будет хороший практический кейс Авито именно про это. Их аналитическая платформа работает на Trino и Vertica поверх Hive-каталогов, данные хранятся в S3 на HDD. Один S3 кластер упёрся в предел масштабирования и 20 ГБайт/с на чтение. Тогда команда взяла три кластера S3, стала распределять объекты каждой таблицы по хешу пути и использовала уже существующие HAProxy-сайдкары на compute-нодах как stateless-шардирующий прокси. В результате пиковую скорость чтения увеличили с 20 до 60 ГБайт/с без отдельного proxy layer. Дмитрий Листвин из Авито расскажет, как они писали расширение HAProxy на Lua, реализовали ListObjects и DeleteObjects, какие проблемы получили при решардинге и как теперь эксплуатируют это решение. Ещё будет доклад Павла Кутакова из VK Tech про архитектуру VK Data Platform гиперконвергентной дата-платформы на Kubernetes: управление СУБД и сервисами, отказоустойчивость, сеть, безопасность и наблюдаемость. После докладов инженеры RWB и VK Tech разберут кейс подготовки сегментов для таргетинга на Trino и DataFusion. Затем обсудят Kubernetes, self-service-аналитику, подготовку платформ под AI-агентов и то, как AI меняет разработку дата-платформ. После технической части — приятные напитки, пицца и можно будет обсудить всё это уже без слайдов. 18 августа, сбор в 17:30 Москва, БЦ «Скайлайт» Онлайн тоже будет. Регистрация 👉 https://vk.cc/d0fvdV?erid=2VtzqxS4LDR0,37%
- 4 авг.Вход в аналитику сейчас требует большего, чем несколько лет назад. AI закрывает часть рутины, но не снимает с аналитика ответственность за корректность выводов. Писать код недостаточно, если нет понимания устройства данных и умения проверять результат: бизнесу нужен не скрипт, а обоснованный вывод. Своим видением обстановки поделился Саша Исаков, в своем посте он начал делиться базой, которая нужна прямо сейчас, чтобы вкатиться в аналитику: 🔹 SQL: проверить, корректен ли код, может только тот, кто знает, как он устроен внутри. 🔹 Статистика: аргумент в спорах с заказчиками, особенно когда те приходят с готовыми выводами от Claude и ждут немедленного «катим тест». 🔹 Реальный проект: от сбора данных, борьбы с дубликатами и тестов гипотез до финальных метрик и защиты выводов. Эти темы всё чаще мелькают у опытных практиков, чтобы помочь новичкам в период, когда инструменты обновляются быстрее, чем накапливается реальный опыт. В конечном счёте именно фундамент определяет, как далеко получится пройти в профессии.0,34%