tgindex
Data Engineer
@dataengineernewsрусский

Дата-инженерия в схемах и мемах По всем вопросам — @mobiledeveloper_bot

Последний пост
12 авг.
Последнее чтение
09:36
Постов за неделю
1
Всего постов
89
Тип
открытый
Язык
русский
В каталоге с
13 авг.
Подписчики
477
0 за 3 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
320
40 постов
Вовлечённость
67,1%
к подписчикам
Постов в день
0,1
всего 89
Упоминаний
0
каналов
Охват размещения
оценка
1/24сутки в ленте
121
1/48двое суток
138
1/72трое суток
149

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • Я тоже буду https://t.me/analyticsfromzero/728

  • С недавних пор я официально являюсь сертифицированным руководителем отдела, закончив соответствующий курс в «Стратоплане». Оказывается, руководить людьми довольно просто - «развивай свои сильные стороны, а слабые закрывай шаблонами». Все по бразильской системе, короче… Пришел я сюда с целью «легитимизировать свой опыт», придать ему системный характер. В каком-то хаотичном виде он у меня и так присутствовал… Колес и велосипедов за свою управленческую карьеру я изобрел предостаточное количество. «Обломал немало веток, наломал немало дров», не один штрафной круг по граблям прошел. Мне бы вот все эти мои новые знания четыре года назад, глядишь, бы и не было затянувшегося творческого кризиса с обязательной сменой работы каждый год. А иногда и не один раз… Четыре месяца пролетели незаметно. Менялись темы, менялись преподаватели, неизменными были высокий уровень каждого занятия и заряд энергии, приобретаемый от общения с умными людьми на групповых занятиях. Что мне дал этот курс? 1️⃣ Помог лучше узнать себя, ближе к концу я разобрался, зачем я здесь, для чего это все мне нужно и что делать дальше. 2️⃣ Мой образ жизни стал несколько здоровее, я стал следить за сном, перестал терзать себя чрезмерными беговыми объемами, даже сбросил пару накопленных за период зимней спячки килограммов. «Вы где-нибудь видели топ-менеджера, который пихает в себя всякую гадость?» - в общем. 3️⃣ По DISC-классификации я желто-зеленый. Про желтый цвет и до этого понятно было, а вот зеленый удивил. Правда, после того, как я начал высыпаться, вместо зеленого стал проявляться красный. 4️⃣ GOSPA - очень простой и вместе с тем эффективный метод стратегического планирования. Настолько он меня поразил, что я прямо на занятии полез переписывать свою стратегию, а остаток лекции теперь придется пересматривать в записи. 5️⃣ Куча полезной литературы для дальнейшего самостоятельного развития. На пару лет точно хватит даже с моей скоростью чтения. 6️⃣ Я познакомился с большим количеством умных людей, советы и рекомендации коих очень помогли мне при разборе различных рабочих ситуаций. Всем им за это я премного благодарен. Как и моему бадди, конечно же. Не считая решенных рабочих вопросов, без него не появился бы канал про бег. Также я благодарен всем преподавателям и сотрудникам «Стратоплана» за то, что эти четыре месяца получились такими насыщенными и интересными. Всего-то чуть больше недели прошло, а я уже скучаю. Обязательно вернусь через год.

  • Раз уж вписался в ИИ-трансформацию, надо хотя бы делать вид, что понимаешь, что происходит. Обложился, в общем, специальной литературой, благо ее сейчас предостаточно, да и на русском выходит со скоростью Себастьяна Саве, устаревая примерно так же. Так что «не хайпа ради, а служебной пользы для». Да и стратегию защищать нужно... Чип Хьюен - персонаж в сфере сей довольно авторитетный: работала в NVIDIA, преподавала в Стэнфорде и даже написала книгу о машинном обучении. Которую я, конечно же, «ни при какой погоде не читал». Ну, не интересовала меня эта тема... Люблю, когда автор начинает с определения: «ИИ-инженерия - процесс создания приложений на основе доступных моделей» Сразу настраивает на рабочий лад. Далее Хьюен по шагам проводит читателя от знакомства с базовыми моделями до архитектуры ИИ-инженерии. Ровно посередине находится глава, посвященная промт-инжинирингу, который автор определяет как «процесс разработки инструкции, которая позволяет добиться от модели желаемого результата». Отмечая, что: «Проблема не в промт-инжиниринге. Это реальный и полезный навык. Проблема возникает, когда люди не знают ничего, кроме промт-инжиниринга. Вам будут нужны знания из области статистики, инженерии и классического ML для отслеживания экспериментов, оценки и редактирования наборов данных» Такой вот нас ждет «новый дивный мир»... Книга мне понравилась, подойдет тем, кто уже имеет некий инженерный опыт, но в ИИ еще не вляпался.

  • #напочитать Даниэль Пинк - «Драйв» Типичная книга из серии «Литература для бизнеса», построенная по формуле «Проблема-Следствие-Аргументы-Выгода». Много воды, различного рода кейсов из жизни деревень Вилларибо и Виллабаджо. В Вилларибо все еще используют обычное моющее средство и вследствие этого кипятятся, а в Виллабаджо уже рубят. И да, мы идем к вам. Суть первых двух частей можно свести к простой мысли: для творческих задач внутренняя мотивация важнее внешней. Для рутинных задач внешний стимул в короткой перспективе может стать отличным импульсом. Мотивируют людей, согласно Пинку, всего три вещи: 🔹 Автономность - наше стремление к самоуправлению 🔹 Мастерство - побуждение становиться все лучше и лучше в своем деле 🔹 Целеустремленность - явная отсылка к Фейербаху - желание быть частью чего-то большего, чем мы сами Самая полезная - третья часть - полный комплект подсказок, упражнений и ресурсов, призванных помочь создавать условия для поведения, определяемого внутренними желаниями. Ради нее и стоит читать книгу. Цитаты: «Одна из главных причин фрустрации на рабочем месте - несоответствие между тем, что люди должны делать, и тем, что они могут. Слишком простые задачи заставляют их скучать, слишком сложные - тревожиться» «Когда вы будете размышлять о своей цели в жизни, начните с важного вопроса: как звучит ваша главная фраза?» Когда я заступал на пост Head of DE в зеленом (тогда) DIY-ритейлере, у меня была похожая идея с отсылкой на японских императоров, которые в начале своего правления тоже должны были представить некий девиз. Я тогда что-то придумал, следовал выбранному курсу, но нигде это не афишировал, а коль скоро так, то и у меня из головы это вылетело. Но наверняка там что-то было про непрерывное развитие…

  • Оформил предзаказ на второе издание «Книги с кабанчиком» и по этому поводу явился в офис в соответствующей футболке. Такая книга точно должна быть в моей бумажной коллекции! https://habr.com/ru/companies/piter/articles/1059118/

  • https://github.com/AlexGladkov/quickai Напоминаю, что если вы хотите замерять эффективность своей работы с агентами и Клодом (а сейчас уже и не только), то можете воспользоваться тулзой выше

  • Человек, который в конце прошлого года клялся и божился, что станет меньше читать, уже к началу июля залил в «болото данных» своего головного мозга еще 60 книг. И ни конца ни края сему беспределу не видно. Основными катализаторами стали: 1️⃣ Выход в офис - 2 часа в дороге. 2️⃣ Аудиокниги - еще час во время тренировок. Итого с обеденным перерывом около 4 часов в день выходит, все книги мира прочитать можно. 3️⃣ Учеба в Стратоплане серьезно так пополнила буклог, все такое интересное и само на экран просится. 4️⃣ Смена деятельности - раз уж взялся ИИ-трансформацию внедрять, то надо хотя бы понять, что это такое. Не удивлюсь, если к концу года я еще и геологию активно изучать начну. 5️⃣ В угоду скорости почти перестал читать на английском. Тот же Серра, например, читался в переводе, слезы кровавые ручьем лились, но так все равно быстрее. Мир опять ускорился, пришлось в этот раз под него прогнуться. Лучшее из прочитанного: 📖 Карл Саган - «Наука в поисках Бога». Саган однозначно попадает в мой личный топ в компанию к Дэвиду Греберу, Ричарду Фейнману и Стивену Хокингу. Даже странно, что я до этого не обращал на него внимания. Прочитаю всё, что смогу, что-то обязательно будет добавлено в бумажную коллекцию. 📖 Элияху Голдрат - «Цель» и «Цель-2». Формат бизнес-романа - новый для меня - читается легко и хорошо запоминается. Не скажу, что стал знатоком теории ограничений, но при решении кейсов на групповых занятиях в Стратоплане регулярно с умным видом врываюсь в дискуссию со словами: «Коллеги, посмотрите, ну, это же чистый Голдрат». 📖 Антон Савочка - «Путь тимлида». Еще один бизнес-роман, вместе с тем представляющий собой набор рецептов по обнаружению и обходу разного рода грабель, хаотично расставленных на пути начинающего тимлида. Пять лет назад эта книга стала бы для меня настоящим спасением, да и сейчас, в общем-то, актуальности не утратила. 📖 Должно же быть в этом списке что-то про данные. Пусть будет Серра из поста выше - проглочен влет, невзирая на кровавые слезы от перевода. А зарок читать поменьше переносится на следующий год, видимо.

  • 14 июл.2611016

    Дочитал «Архитектуры данных» Джеймса Серры. Товарищ сей мне весьма симпатичен, было время, когда я наблюдал за его каналом на YouTube. Мне импонировало то, что, рассказывая про Data Mesh, он не пытался эксплуатировать тему «самого лучшего кунг-фу», а просто рассказывал свое видение ситуации и предлагал свой критерий соответствия функции данных в компании методологии имени Жамак Дегани. Серра почти 40 лет в IT, 15 из них в хранилищах, «я здесь давно, мне можно верить», короче. Книгу он решил написать, поскольку обратил внимание, что архитектуры данных сложны и «большинство людей не понимают их концепций, если вообще что-то знают о них». Он попытался объективно рассказать о достоинствах и недостатках каждой из представленных архитектур. На мой взгляд, у него получилось. Особенно порадовала глава о проведении дизайн-сессий по разработке архитектуры - хорошее практическое пособие для начинающих архитекторов. Ну, или чек-лист вопросов, которые имеет смысл задать на собеседовании по System Design. По части Data Mesh Серра не стал отделываться общими словами, а прикинул, как оно будет выглядеть на практике. Его вердикт сродни: «Чистого спирта не бывает. Максимум - 96 градусов!». По его мнению, из тех, кто назовет свое решение Data Mesh: ▪️ ~90% внедрят доменное владение ▪️ ~70% данные как продукт ▪️ ~треть осилит самообслуживаемую инфраструктуру ▪️ ~половина федеративное управление В суть Data Mesh вообще мало проник, кроме Трента Кримма, разве что. Сам Серра, по собственному признанию, десятки раз перечитывал блоги Дегани и до сих пор иногда обнаруживает, что понял что-то неправильно. В завершение, как обычно, парочка любимых цитат: «Слухи о смерти реляционных хранилищ данных сильно преувеличены» «Стандартных определений концепций и архитектур данных не существует. Иначе эта книга была бы не нужна.» «Хотя технологии и шагнули далеко вперед, дело не в них - а в людях и процессах, и мы не так хорошо продвинулись в работе с ними. Вы можете придумывать новые крутые словечки и методы, которые вам нравятся, но очень трудно заставить людей измениться.» Поскольку я не являюсь любителем модных словечек и хайпа вокруг них, то книга Джеймса Серры мне понравилась, рекомендуется всем, кто хочет понять суть, а не заниматься жонглированием малопонятными терминами.

  • Prefect приобретает Dagster Labs Очень неожиданная новость. Если бы еще вчера меня спросили, кто кого купит — Prefect или Dagster, я бы точно не поставил на такой исход. Prefect объявил о приобретении Dagster Labs. За последние восемь лет Prefect и Dagster подталкивали друг друга к развитию, двигая вперед всю категорию инструментов оркестрации. То, что начиналось как два разных подхода, со временем стало всё более взаимодополняющим, особенно сейчас, когда ИИ меняет подход к выполнению задач и управлению рабочими процессами. Для пользователей ничего не меняется: Dagster и Dagster+ продолжат развиваться, а команда обещает сохранить долгосрочные инвестиции в продукт и сообщество. Интересно будет посмотреть, как объединение двух главных игроков на рынке оркестрации повлияет на развитие экосистемы. Особенно сейчас, когда границы между data orchestration, workflow orchestration и AI-агентами становятся всё менее заметными. @tldr_data

  • Если уж решил заняться вайбкодингом, то нужно идти в своем увлечении до конца… https://t.me/vibecoding_tg/3420

  • Так вот, какова она, цена «сделай пайплайн красиво». https://habr.com/ru/news/1050202/

  • 1 июл.337510

    DEMate - тот, кто тебя заменит Meta пошарила статью про DEmate - внутреннего AI-ассистента для data engineering, который не просто SQL / питон генератор кода, а готовый AI-слой для полноценного цикла разработки (ака накидаем md в контекст в первых версиях😂), учитывающим специфику внутренних систем Meta (а там без пол-литра иногда и не разобраться 🍺). Главный поинт в том, что LLM становятся полезными в enterprise-инженерии не тогда, когда им дают полный yolo, а когда их ограничивают контекстом, проверками, рецептами и автоматической валидацией (вот это поворот 🤯) https://medium.com/@AnalyticsAtMeta/how-we-built-demate-taming-llms-for-data-engineering-at-meta-d134e69637c5 Один из уровней это Recipe Architecture - архитектура “рецептов”, которая направляет LLM через структурированный процесс. Когда ленивый дата инженер (то есть я 🧐) просит модель “сделай pipeline” и надеется на хороший результат, DEmate выбирает подходящий рецепт, подставляет нужный контекст, генерирует изменения и затем прогоняет проверки. На выходе не просто сгенерированный код, а уже проверенный результат, адаптированный под внутренние стандарты. Еще сделан Recipe Chaining, или цепочка рецептов. Реальная engineering-задача состоит из набора шагов: сначала нужно построить pipeline, затем добавить data quality checks, потом оптимизировать SQL или подготовить тесты 😺. DEmate не загружает модель огромным md сразу, а постепенно раскрывает инструкции по мере необходимости (ого, неужто workflow 😃). Это снижает шум в контексте и уменьшает вероятность ошибок (якобы 👍) Meta также использовала AI для ревью самих AI-рецептов (ну а фигли, бесплатные токены же 🔼). По мере роста DEmate разные команды начали добавлять собственные рецепты, и ручная проверка стала узким местом. Для этого ввели автоматизированные проверки: инструкции должны быть не размытыми, без лишнего текста, содержать явные шаги валидации, не конфликтовать друг с другом, не дублировать существующие рецепты и иметь тестовые positive/negative prompts для правильного анализа (😑это ж сколько слопа можно нагенерить). Еще одна из фич асинхронная валидация. В data engineering тесты выполняются долго, а инженерам приходится возвращаться к задаче через часы, проверять результаты, читать CI-ошибки и вручную исправлять код (👨‍⚕️ у кого-то еще 2024 видимо на дворе). DEmate интегрировали с Analytics Agent (вообще топовая вещь на самом деле 🍷): агент мониторит долгие тестовые job’ы, проверяет гипотезы на тестовых таблицах, обновляет diff (aka pull request) результатами и при необходимости запускает цикл исправления заново. Это превращает тестирование из ручного процесса в почти полностью автоматический loop. Также многие фичи demate работают как cli, то есть можно встраивать в ваш собственный harnessing 🤨 (это в основном, как я использую) P.S. В общем переходим на новый стиль дата инженерных задача - наговариваем в микрофон "сделай пайплайн красиво" и ждем пару часов ☕️

  • AI-эра тех собесов 💻 Теперь вместе с sql/python-задачками на тех собесе могут дать создание мини-проекта за 20 минут Разрешается использовать все, что угодно, любые ллм. (Только подумайте над тем, что будет работать, когда вы на созвоне на внутренней платформе.) Есть только одно условие — шерить экран Примеры заданий ➡️Для де: написать ddl таблиц, sql-запросы по сборке витрин, несколько дагов ➡️Для разраба: придумать архитектуру микросервиса и реализовать его ➡️Разобраться в коде и найти баги Сгенерили, а дальше? 🙂 Интервьюеры могут сами пока не до конца понимать, что делать после генерации кода) Они просто сидят и смотрят, как ты будешь разбираться, что происходит, просят внести правки или объяснить кусок кода Пока такое замечено в WB в последние 2 месяца, но могут подтянуться и остальные. Особенно после этого поста😁 @data_engineerette

  • Databricks объявил конец эпохи пайплайнов. На Data + AI Summit 2026 компания представила новую архитектуру LTAP (Lake Transactional/Analytical Processing), которая должна объединить транзакционные системы, аналитику, стриминг и AI на одной копии данных. Идея радикальная: приложения, BI-системы и AI-агенты работают с одним источником данных напрямую, без CDC, ETL и бесконечных репликаций между OLTP и аналитическими хранилищами. Последние двадцать лет типичная архитектура выглядела примерно так: PostgreSQL → CDC → Kafka → ETL → Data Warehouse → BI → AI Каждый новый слой добавлял задержки, повышал стоимость владения и создавал новые точки отказа. Особенно болезненно это стало с появлением AI-агентов, которым нужны актуальные данные в реальном времени, а не копия пятиминутной давности. Ответ Databricks — хранить операционные и аналитические данные в одном месте. В основе подхода лежит Lakebase, PostgreSQL-совместимая система, работающая поверх объектного хранилища и интегрированная с Lakehouse. Компания называет это первым LTAP-подходом, который должен заменить как традиционные ETL-процессы, так и многочисленные реплики баз данных. Конечно, заявления о «смерти пайплайнов» стоит воспринимать осторожно. Интеграции между компаниями, обмен данными с внешними системами, специализированные стриминговые сценарии и гибридные архитектуры никуда не денутся. Но сам тренд выглядит очень интересным. Если раньше индустрия спорила, что лучше — Data Lake или Data Warehouse, то теперь главный вопрос звучит иначе: Нужно ли вообще перемещать данные между системами, если все сервисы, аналитика и AI могут работать поверх одной копии данных? Похоже, именно вокруг этого вопроса и будет строиться следующая большая битва в мире Data Engineering. @tldr_data

  • Amazon S3 annotations: attach rich, queryable context directly to your objects Amazon S3 представил Annotations — новую функцию метаданных, которая позволяет пользователям прикреплять к каждому объекту до 1 ГБ бизнес-контекста, распределённого по 1 000 именованным аннотациям. Эти аннотации можно изменять без перезаписи самого объекта, а также они автоматически индексируются в таблицы Apache Iceberg, доступные для запросов. Функция уже доступна во всех регионах AWS и предназначена для поддержки AI-агентов и автономных рабочих процессов. Она позволяет хранить расширенные метаданные — например, транскрипты, возрастные рейтинги контента, технические характеристики и другую контекстную информацию — непосредственно рядом с объектами в S3. Все аннотации можно искать и анализировать через Amazon Athena, что избавляет от необходимости поддерживать отдельные базы данных для хранения метаданных. @tldr_data

  • 5 июн.383149

    Anthropic наконец-то опубликовали свой секретный рецепт для агентной аналитики, и это… Моделирование данных по Кимбаллу (Kimball Data Modeling) Шутка здесь в том, что многие ожидают увидеть какой-то революционный AI-фреймворк, сложную агентную архитектуру или новый research paper, а оказывается, что в основе агентной аналитики лежат старые добрые принципы построения аналитических хранилищ данных по Кимбаллу: факты, измерения, схема звезда, понятные бизнес-сущности и качественно подготовленные данные. Для дата-инженеров и аналитиков это примерно звучит как: Секрет успешных AI-агентов? Сделайте нормальный DWH @tldr_data

  • Launching Polars Distributed on Kubernetes С сегодняшнего дня, Polars также доступен как распределённый движок (Distributed Engine) для Kubernetes. Цель Polars всегда заключалась в том, чтобы сделать обработку данных на одном узле максимально производительной и удобной. Теперь Polars хочет распространить этот подход и на распределённые вычисления. https://pola.rs/posts/polars-distributed-available-on-kubernetes/ @tldr_data

  • Нашел, наконец-то, применение ИИ в своей жизнедеятельности - назначил его смотрящим за моей беговой активностью. Прогнозы выглядят пока очень оптимистичными, за год Клодик обещает меня сделать чемпионом России по легкой атлетике в моей возрастной категории. Проверим-проверим… Подписывайтесь, в общем, кому интересно следить за экспериментом😁 https://t.me/runningwithai/3

  • Еще один экземпляр из бумажной коллекции. Начал читать.

  • Фабрика архитекторов зеленого поля Хорошее название - половина статьи. Идея написать о сходстве мира данных и футбола появилась у меня давно, отдельные куски я здесь выкладывал. Существовало даже рабочее название - «Все о данных для настоящих мужиков» - однако моего внутреннего перфекциониста оно не удовлетворяло, хотя, без сомнения, является сутевым. Хотелось чего-то более четкого и, вместе с тем, емкого… Поиски идеального названия отвлекали от самого процесса написания статьи. И вот она, «эврика автора»: «Greenfield Architects». Возможность начать проект с нуля, без «тяжкого легаси предыдущих режимов» - мечта любого настоящего архитектора, к сожалению, для многих остающаяся несбыточной на протяжении всей карьеры. Занимательный факт: «донором» послужило название фильма, снятого по сценарию автора книги, которая послужила «донором» названию рабочему. Сама статья, как обычно, будет написана в «несвойственной мне манере c использованием хеви-метла, кантри и чуть-чуть джаза», квеста, в общем, для «посвященных» с множеством цитат и отсылок, а также непременными авторскими импровизациями. Все ради того, чтобы никто не подумал, что дедушка яблочки гадостью поливал тексты свои при помощи ИИ генерит. «Это присказка, не сказка. Сказка будет впереди…»

Data Engineer — tgindex