tgindex

Nik в мире данных

описание

Автор канала - @nikbeesti

1 310
подписчиков

Лучшие посты

за три месяца
  • 18 июн.7 476 просмотров30 реакций97 пересылок

    Запись - https://www.youtube.com/watch?v=CE0K9ErBqsI Презентация в приложении. Вроде получилось довольно неплохо, хоть и с небольшими проседаниями, так как давно не делал презентаций на английском. Из интересного, удалось сделать полноценный pet project по генерации презентации чисто на промптах с добавлением валидаций на уровне text и image LLM-as-a-judge + multi-LLM asssessment. Любой новый промт включал полный цикл от обновления svg до пересборки всего pdf. Доработаю его на на новых созвонах книжного клуба и сделаю более детальный пост об архитектуре.

  • 9 июн.3 345 просмотров33 реакций13 пересылок

    Возвращаюсь в онлайн вебинары 🙂 Залечу на вебинар на следующей неделе во вторник в легендарный DataTalksClub к поговорить (угадайте про что 😘) про Agentic для дата инженеров. 📚Описание The Agentic Shift in Data Engineering: From Pipeline Builders to Architects of Controlled Chaos ​AI agents are changing data engineering on two fronts at once. ​In development, they compress the engineering loop: helping write SQL, generate transformations, debug pipelines, create tests, document systems, and reason about legacy codebases. ​In production, they become active participants in the data ecosystem: consuming context, calling tools, triggering workflows, creating side effects, and introducing new forms of operational chaos. ​This changes the role of the data engineer. It is no longer enough to build pipelines that move data from A to B. Data engineers now need to design the control layer for agentic systems: trusted context, data contracts, permissions, observability, audit trails, and closed feedback loops. ​🔮The future data engineer is not just a pipeline builder. They are the architect of controlled autonomy. 🔗 Если интересно, инвайт в Luma - https://luma.com/hpuirqjd

  • 30 июн.3 309 просмотров24 реакций106 пересылок

    DEMate - тот, кто тебя заменит Meta пошарила статью про DEmate - внутреннего AI-ассистента для data engineering, который не просто SQL / питон генератор кода, а готовый AI-слой для полноценного цикла разработки (ака накидаем md в контекст в первых версиях😂), учитывающим специфику внутренних систем Meta (а там без пол-литра иногда и не разобраться 🍺). Главный поинт в том, что LLM становятся полезными в enterprise-инженерии не тогда, когда им дают полный yolo, а когда их ограничивают контекстом, проверками, рецептами и автоматической валидацией (вот это поворот 🤯) https://medium.com/@AnalyticsAtMeta/how-we-built-demate-taming-llms-for-data-engineering-at-meta-d134e69637c5 Один из уровней это Recipe Architecture - архитектура “рецептов”, которая направляет LLM через структурированный процесс. Когда ленивый дата инженер (то есть я 🧐) просит модель “сделай pipeline” и надеется на хороший результат, DEmate выбирает подходящий рецепт, подставляет нужный контекст, генерирует изменения и затем прогоняет проверки. На выходе не просто сгенерированный код, а уже проверенный результат, адаптированный под внутренние стандарты. Еще сделан Recipe Chaining, или цепочка рецептов. Реальная engineering-задача состоит из набора шагов: сначала нужно построить pipeline, затем добавить data quality checks, потом оптимизировать SQL или подготовить тесты 😺. DEmate не загружает модель огромным md сразу, а постепенно раскрывает инструкции по мере необходимости (ого, неужто workflow 😃). Это снижает шум в контексте и уменьшает вероятность ошибок (якобы 👍) Meta также использовала AI для ревью самих AI-рецептов (ну а фигли, бесплатные токены же 🔼). По мере роста DEmate разные команды начали добавлять собственные рецепты, и ручная проверка стала узким местом. Для этого ввели автоматизированные проверки: инструкции должны быть не размытыми, без лишнего текста, содержать явные шаги валидации, не конфликтовать друг с другом, не дублировать существующие рецепты и иметь тестовые positive/negative prompts для правильного анализа (😑это ж сколько слопа можно нагенерить). Еще одна из фич асинхронная валидация. В data engineering тесты выполняются долго, а инженерам приходится возвращаться к задаче через часы, проверять результаты, читать CI-ошибки и вручную исправлять код (👨‍⚕️ у кого-то еще 2024 видимо на дворе). DEmate интегрировали с Analytics Agent (вообще топовая вещь на самом деле 🍷): агент мониторит долгие тестовые job’ы, проверяет гипотезы на тестовых таблицах, обновляет diff (aka pull request) результатами и при необходимости запускает цикл исправления заново. Это превращает тестирование из ручного процесса в почти полностью автоматический loop. Также многие фичи demate работают как cli, то есть можно встраивать в ваш собственный harnessing 🤨 (это в основном, как я использую) P.S. В общем переходим на новый стиль дата инженерных задача - наговариваем в микрофон "сделай пайплайн красиво" и ждем пару часов ☕️

  • 6 июл.2 373 просмотров35 реакций29 пересылок

    в бигтехе после сокращений, флатерингов, лейфоф промзошла тихая девальвация уровней. она и раньше была, но сейчас прям пик если вы мидлл, то ожидания от вас как от сеньор разработчика, отношение как к джуну. для роста нужно вести проект уровня стаффа если джуниор, то должны работать минимум на уровне миддла, для повышения нужно работать на уровне сеньора если сеньор, то пашите как стафф, тяните проект который пару лет назад вели две команды если вы стафф, менеджер - сил и держите коробку для вещей всегда рядом, и холодчик с напитками, чтобы оставаться кул, сейчас жарко. для повышения нужно просто сделать чудо, небольшое обыкновенное уровни это все относительно, ведь есть же еще вечный мидлл++, джуниор+, миддл +- , и прочий стыд. кароче прыгнуть нужно на плюс один уровень, а работать на +2. а когда все работают так, то кажется что нужно сделать что-то невозможное, а нужно все лишь

  • 18 июн.1 922 просмотров14 реакций25 пересылок

    без подписи

  • 20 июл.1 685 просмотров14 реакций33 пересылок

    Ищу к себе двух инженеров, удаленка (100-150$k) Вакансия ближе к разработке и ML https://job-boards.eu.greenhouse.io/dwelly/jobs/4929545101 Вакансия ближе к разработке https://job-boards.eu.greenhouse.io/dwelly/jobs/4928198101 PS: чуть позже еще будет пара вакансий попроще. Можете писать мне, зареферю :) PS2: если хотите в Лондон - можем сделать визу

  • 28 июл.1 571 просмотров22 реакций44 пересылок

    Решил сделать площадку для обсуждений / созвонов по Agentic / AI Engineering in Data на основе топика в @de_zoomcamp. Если кому-то интересно, залетайте туда. Первой темой возьмем Data / Analytics Agents - как они работают, зачем нужны и как их строить. Тема обширная, поэтому пойдем top-down, обсудим все компоненты хай левел, а потом будем разбирать каждый из них в следующих созвонах. Базовые статьи (часть из них, думаю, многие уже видели): Open AI - https://openai.com/index/inside-our-in-house-data-agent/ Anthropic - https://claude.com/blog/how-anthropic-enables-self-service-data-analytics-with-claude Meta - https://medium.com/%40AnalyticsAtMeta/inside-metas-home-grown-ai-analytics-agent-4ea6779acfb3 Salesforce - https://www.salesforce.com/blog/text-to-sql-agent/

  • 10 авг.691 просмотров17 реакций

    В целом, заметил, что в моем bubble нетворке обсуждают подписки и конкретные модели сильно чаще, чем porsche vs lamba 😂 Позитивный тренд, хотя подписки ныне дороже лизинга 🥹 Лично у меня уже свой собственный диджитал парк подписок (5+). 😑 Осталось выставочный зал организовать. (И конечно прикупить парочку Nvidia Spark DGX)