tgindex
Инжиниринг Данных

Инжиниринг Данных

Статистика

Делюсь новостями из мира аналитики и карьерными советами. 15 лет в Аналитике и Инжиниринге Данных, 10 лет в MAANG 🛠️ dataengineer.ru | 🏄‍♂️ Surfalytics.com №5017813306 Реклама: https://almond-rule-130.notion.site/1199f595f76a8030ba1be1e607c9a8ce

Последний пост
14 авг.
Последнее чтение
18:46
Постов за неделю
6
Всего постов
28
Тип
открытый
Язык
русский
Категория
Карьера
В каталоге с
12 авг.
Подписчики
23 792
+5 за 4 дн.
Сутки
+1
+0,00%
Неделя
 
Месяц
 
Просмотров на пост
5 122
26 постов
Вовлечённость
21,5%
к подписчикам
Постов в день
0,9
всего 28
Упоминаний
7
каналов
Охват размещения
оценка
1/24сутки в ленте
3 534
1/48двое суток
4 049
1/72трое суток
4 368

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 14 авг.2 993146

    Наверно посмотрели на SpaceX, OpenAI, Anthropic и решили, что надо побольше капитализацию. А еще databricks купил Electric - агенты рулят!

  • 13 авг.3 8309347

    Говорят навык кодить руками уже умирает. Писать код самому это уже недостаток. Понимать код, архитектуру и знать фундаментальные вещи это другое, которое необходимо. И теперь как-то надо это понимать и знать без hands-on опыта. Молодежь, держись ☕️

  • 12 авг.3 872425

    Lakehouse для аналитиков и инженеров данных Приглашаем изучить популярный подход построения хранилищ данных Data Lakehouse c разделенным Compute и Storage на основе Iceberg и Trino.  В программе курса: • Современная архитектура аналитических систем от DWH и Data Lake до Lakehouse с разделением Compute и Storage на базе Apache Iceberg и Trino.  • Iceberg: управление файлами, снимками, каталогами, схемами изменений и очисткой.  • Практическое использование Iceberg Catalog, работа с кластером Trino (на Kubernetes), подключение данных на S3 и выполнение SQL/ Python-запросов. • Работа с Iceberg+Trinо на больших масштабах: сложные запросы к датасету TPC-DS (2.8 млрд строк), интеграция с DBT, Apache Airflow, оценка производительность систем.  • Построение пайплайнов, инструменты  для корректной поддержки, обновления и масштабирования Lakehouse-инфраструктуры на уровне предприятия.  Кто мы: R&D-центр Devhands, наш канал. Автор курса — Алексей Белозерский, CDO в inSales (Сбер 2B), ex: VK Tech, М.Видео, Эльдорадо 🗓 Старт курса: 27 августа Изучить программу и записаться можно здесь. Ждём вас! Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzquZf5с8

  • 11 авг.4 0981852

    В Lakehouse можно сколько угодно ускорять compute, но если S3 не успевает отдавать данные, вся платформа упрётся в storage. 18 августа на Data Meetup VK Tech будет хороший практический кейс Авито именно про это. Их аналитическая платформа работает на Trino и Vertica поверх Hive-каталогов, данные хранятся в S3 на HDD. Один S3 кластер упёрся в предел масштабирования и 20 ГБайт/с на чтение. Тогда команда взяла три кластера S3, стала распределять объекты каждой таблицы по хешу пути и использовала уже существующие HAProxy-сайдкары на compute-нодах как stateless-шардирующий прокси. В результате пиковую скорость чтения увеличили с 20 до 60 ГБайт/с без отдельного proxy layer. Дмитрий Листвин из Авито расскажет, как они писали расширение HAProxy на Lua, реализовали ListObjects и DeleteObjects, какие проблемы получили при решардинге и как теперь эксплуатируют это решение. Ещё будет доклад Павла Кутакова из VK Tech про архитектуру VK Data Platform гиперконвергентной дата-платформы на Kubernetes: управление СУБД и сервисами, отказоустойчивость, сеть, безопасность и наблюдаемость. После докладов инженеры RWB и VK Tech разберут кейс подготовки сегментов для таргетинга на Trino и DataFusion. Затем обсудят Kubernetes, self-service-аналитику, подготовку платформ под AI-агентов и то, как AI меняет разработку дата-платформ. После технической части — приятные напитки, пицца и можно будет обсудить всё это уже без слайдов. 18 августа, сбор в 17:30 Москва, БЦ «Скайлайт» Онлайн тоже будет. Регистрация 👉 https://vk.cc/d0fvdV?erid=2VtzqxS4LDR

  • 11 авг.4 6042745

    Рост зарплат DE в Канаде, да и в мире. Раньше в Канаде средняя вилка была 140-160к, а теперь уже почти все вакансии до 200к (в год gross). И это за старшего инженера. В США будет конечно выше и уже в usd. Как дела с зарплатами в РФ и Европе?

  • 10 авг.4 589621

    Давно не слышал про хороший open source BI Metabase. https://www.metabase.com/blog/security-update

  • 7 авг.6 1254168

    Сегодня заценил новый skill от Claude. Как обычно Airflow Dag упал с ошибкой. Обычно я копирую ошибку в Claude Code и прошу его починить. Но сегодня товарищ попробовал попросить Claude bot, и он сразу нашел проблему, владельца dag, source code изменения и тп. И сразу сделал PR. Раньше мы такое делали как мини проект - запускали lambda, чтобы она все это делала и писала ответ и создавала PR. А теперь все из коробки.

  • 7 авг.5 40717

    видео или голосовое, без подписи

  • 7 авг.5 42017

    видео или голосовое, без подписи

  • 7 авг.4 98217

    видео или голосовое, без подписи

  • 7 авг.4 6293017

    Я получил новый MacBook и зарядил Claude Code скачать локальные модели на попробовать.

  • 7 авг.4 6221613

    👀Кто такой по-настоящему крутой дата-инженер сегодня? Профессия дата-инженера сильно изменилась. Еще недавно основной фокус был на надежных пайплайнах, ETL-процессах и стабильной доставке данных. Но сейчас везде обсуждают LLM: инструменты меняются на лету, бизнес требует внедрения больших языковых моделей, и команды пока ищут устойчивые подходы к тому, как использовать их в реальных системах. Сегодня рынок ждет от нас гораздо большего. — Как встроить LLM в пайплайны без лишней сложности? — Как устроены базы данных под капотом? — Почему ломается Data Quality, когда объемы вырастают в сто раз? — Как выстроить MLOps, чтобы модели жили долго и не деградировали? Над этими вопросами сейчас ломают голову и мидлы, и сеньоры. И чтобы находить изящные решения, нужна хорошая архитектурная насмотренность. Быстрее всего она появляется там, где можно вживую разобрать чужие подходы и обсудить их с коллегами из других компаний. Именно такие люди соберутся на SmartData уже этой осенью. Среди тем программы — практический опыт команд, которые внедряют LLM в свои решения. 📆 23–24 сентября, Москва (офлайн) + онлайн. Подробности и билеты — на сайте конференции. ⚡️С промокодом ROCKYOURDATA персональные билеты дешевле.

  • 6 авг.4 9201365

    Интересная локальная модель Gemma4-12B-Coder для Python, работает без интернета. Нужно 4.5 Gb VRAM. Если вдруг вопрос про RAM vs VRAM: RAM — рабочий стол обычного офисного работника (CPU) VRAM — рабочий стол дизайнера с огромным монитором (GPU) Пишите много на Python или изучаете его? Отличный вариант использовать бесплатного помощника, если компьютер позволяет

  • 6 авг.4 989210

    Как работать с данными так, чтобы не терять клиентов Данных о клиентах у крупных компаний не просто много, а очень много. Следующий уровень: связать все эти данные между собой и использовать в бизнес-процессах. Ситуация: клиент решил расстаться с банком. Банк думает, что тот недоволен обслуживанием как физическое лицо, а на самом деле — у клиента есть своя компания, и он расстроен тем, как финансовая организация решала вопрос с неработающим эквайрингом. Парадокс: банк знает о клиенте практически все, но ни один сотрудник не видит ситуацию целиком и не понимает, в чем истинная причина ухода. Сегодня в 18.00 компания HFLabs проведет вебинар и расскажет, как бизнесу не попадать в такие ситуации. На вебинаре обсудят: — как собрать в одном профиле данные, события и связи между людьми и компаниями; — зачем хранить граф связей и какие задачи он помогает решать; — как повысить LTV за счет лучшего понимания клиента и своевременных действий;   — как перейти от накопления данных к их использованию в бизнес-процессах;  — как сделать данные о клиентах понятными для LLM.  Кому будет полезно Всем, кто хочет лучше понимать своих клиентов: руководителям CX-департаментов, розничных и корпоративных блоков в крупных компаниях, директорам по маркетингу. 🕕 Вебинар пройдет сегодня (6 августа) в 18:00. Зарегистрируйтесь, чтобы получить ссылку на подключение.

  • 5 авг.4 8331135

    Если смотреть на актуальный стек в Data-инженерии и ML, требования к специалистам уже давно вышли за рамки одной только работы с данными или алгоритмами. Сейчас наравне с PyTorch и SQL в продуктовой разработке требуют знать Airflow, Kafka, Docker, FastAPI и разбираться в MLOps-инфраструктуре. Для тех, кто планирует системно закрыть хард-скиллы или сменить направление, есть новость. Сейчас у НИЯУ МИФИ идет прием документов на онлайн-магистратуру «Специалист по работе с данными и применению ИИ», созданную в партнерстве с Яндекс Практикумом. Программу разделили на 4 профильных трека: -CV-инженер — компьютерное зрение от базовой обработки до трансформеров: PyTorch, OpenCV, Hugging Face, Transformers, FastAPI. -NLP-инженер — обработка текста и работа с LLM: NLTK, TF-IDF, RNN, PyTorch. -Data-инженер — пайплайны и хранилища: SQL, PostgreSQL, MongoDB, Vertica, Hadoop, Kafka, Python. - ML-инженер — разработка и внедрение моделей машинного обучения: MLflow, DVC, Airflow, Optuna, Docker, FastAPI, Yandex Cloud. Там же разбирают продуктовые кейсы компаний, в том числе юнитов Яндекса (Лавка, Еда, Go, Реклама, Облако). В общем, все подвязано на практике, поэтому без портфолио проектов точно не останетесь. Формат программы полностью дистанционный, при этом ее статус очный — с отсрочкой и студенческими льготами. Выдается два диплома: магистерский от НИЯУ МИФИ и о профпереподготовке от Яндекс Практикума. Поступление тоже проходит онлайн. Кампания в самом разгаре, так что смело залетайте. Ознакомиться с подробностями можете по ссылке.

  • 4 авг.5 3951950

    Вход в аналитику сейчас требует большего, чем несколько лет назад. AI закрывает часть рутины, но не снимает с аналитика ответственность за корректность выводов. Писать код недостаточно, если нет понимания устройства данных и умения проверять результат: бизнесу нужен не скрипт, а обоснованный вывод. Своим видением обстановки поделился Саша Исаков, в своем посте он начал делиться базой, которая нужна прямо сейчас, чтобы вкатиться в аналитику: 🔹 SQL: проверить, корректен ли код, может только тот, кто знает, как он устроен внутри. 🔹 Статистика: аргумент в спорах с заказчиками, особенно когда те приходят с готовыми выводами от Claude и ждут немедленного «катим тест». 🔹 Реальный проект: от сбора данных, борьбы с дубликатами и тестов гипотез до финальных метрик и защиты выводов. Эти темы всё чаще мелькают у опытных практиков, чтобы помочь новичкам в период, когда инструменты обновляются быстрее, чем накапливается реальный опыт. В конечном счёте именно фундамент определяет, как далеко получится пройти в профессии.

  • 1 авг.7 0233180

    Товарищ скинул видео про Clickhouse и его основателя. Очень интересно и познавательно. Как-то я его всего недооценивал на западном рыке. Очень интересный кейс для data observability - миграция c DataDog/Splunk, миграция хранилища данных Databricks/Snowflake на ClickHouse Cloud. Вот пришел бы ко мне Clickhouse, я бы им помог завоевать рынок Северной Америки через сообщества и обучение. Я так много лет назад предлагал Teradata, когда им на пятки наступал Snowflake (они без меня классно разобрались, но сделали playbook для всех), но никто мне не ответил. Поэтому мой 14 летный сын знает, что такое Snowflake, но не знает, что такое Teradata🎮 Меня попросили развернуть проект хранилища данных, я предложил Snowflake + dbt core и все внутри Snowflake - dbt, alerts, orchestration. Для BI Metabase. Задача сделать максимально дешево. Но может быть стоит попробовать Clickhouse Cloud. Как он с dbt core? Какие самые дешевые решения для оркестрации и BI?

  • 31 июл.7 12326

    видео или голосовое, без подписи

  • 31 июл.7 12526

    видео или голосовое, без подписи

  • 31 июл.5 852527

    MotherDuck сделали классный сервис для своего демо, который анализирует данные с LLM