Data Engineering / Инженерия данных / Data Engineer / DWH
описание
Data Engineering: ETL / DWH / Data Pipelines based on Open-Source software. Инженерия данных. ✔ DWH / SQL ✔ Airflow / Python / ETL / dbt / Spark ✔ AI Agents Рекламу не размещаю Вопросы: @iv_shamaev | datatalks.ru
2 676
подписчиков
Охват к подписчикам
100,0%
ERR
Реакции к просмотрам
0,63%
688 на 41 постов
Пересылки к просмотрам
2,31%
2 511
Постов в день
0,0
всего 41
Где отзываются чаще
доля реакций к просмотрам- 26 июл.🚀 Перевод книги «Architecting an Apache Iceberg Lakehouse» на русский язык. Если вы хотите разобраться, что такое Lakehouse, эта книга — отличная отправная точка. В ней последовательно разбираются: • чем Lakehouse отличается от Data Lake и Data Warehouse; • почему появились открытые табличные форматы (Iceberg, Delta Lake, Hudi); • ACID-транзакции, schema evolution, time travel и другие ключевые возможности современных платформ данных; • архитектурные принципы и практические сценарии применения Lakehouse. 📖 Читать перевод: https://aitech720.github.io/lakehouse/ #DataEngineering #Lakehouse #ApacheIceberg #DeltaLake #DataArchitecture #BigData2,40%
- 7 авг.🆕 PySpark нейролекции Возможно кому-то поможет в освоении PySpark. С одной стороны нейрослоп и повторы между лекциями, с другой стороны некоторые концепции хорошо прописаны. Раздел с подготовкой к интервью собирался с разных сайтов и материалов. https://datatalks.ru/pyspark/1,92%
- 10 авг.🤖 Что такое SDD и зачем он нужен? Spec-Driven Development (SDD) — подход к разработке, при котором сначала формируется подробная спецификация, а уже потом AI-агент реализует задачу. Вместо: «Напиши мне эту фичу» → код получаем: Требования → Specification → Plan → Tasks → Code → Tests Зачем это нужно? AI-агент умеет быстро писать код, но может неправильно понять задачу. Спецификация фиксирует что именно нужно сделать, ограничения, архитектуру и критерии готовности. SDD превращает AI-кодинг из хаотичного *vibe coding* в управляемый инженерный процесс. 📚 Подробный разбор SDD и инструментов для работы с AI-агентами: 👉 https://datatalks.ru/spec-driven-development/index.html #AI #AIAgents #SDD #SpecDrivenDevelopment #ClaudeCode #Codex #SoftwareEngineering1,71%
- 9 апр.Trino Перевод DeepWiki https://datatalks.ru/trino-deepwiki/1,55%
- 27 апр.По Trino 479 документации https://datatalks.ru/trino-docs/ переведены все разделы + добавлена информация по dbt1,47%
- 9 апр.Какая же жиза)1,33%
- 28 февр.Запряг cursor перевести доку с сайта astronomer. Детально не читал, но вроде получилось хорошо. https://github.com/ivanshamaev/airflow-docs репозиторий недоступен Update: прикрутил страничку https://datatalks.ru/airflow-docs/ (страничка переехала)1,14%
- 19 мар.Привет 👋🏻 Документация airflow с github pages переехала на новый адрес https://datatalks.ru/airflow-docs/. А по Trino тоже появилась заготовка https://datatalks.ru/trino-docs/ (пока висит английская версия, чтобы без vpn смотреть)0,91%
- 15 окт. 2024 г.Trino - The Definitive Guide 2023 Second Edition.pdf SQL at Any Scale, on Any Storage, in Any Environment Trino — это распределённый SQL-движок для выполнения аналитических запросов на больших объёмах данных. Он позволяет выполнять запросы к данным, хранящимся в различных источниках, таких как базы данных, хранилища данных и файловые системы, без необходимости перемещать данные. Trino поддерживает стандарты ANSI SQL и широко используется для высокопроизводительной аналитики, позволяя объединять данные из различных систем в одном запросе. #trino0,90%
- 26 мар.AI Agent Engineer Roadmap Некоторое время назад начал накидывать через claude импровизационный roadmap по разработке ai agents. Исходная цель: быстро вникнуть в особенности и архитектуру решений для применения в работе. В целом уже что-то можно почитать и изучить. По проектам пока не уверен, что именно будет (и будет ли). https://datatalks.ru/ai-agents/0,86%
- 4 апр.🤖 opencode: Учимся создавать виртуальные команды из агентов для Data-проектов 🚀 Делюсь небольшой инструкцией по OpenCode — инструменту, который можно использовать не просто как CLI, а как полноценный слой настройки проекта для работы с агентами, ролями, правилами и workflow 👇 За основу я взял демо-пример, где OpenCode + ChatGPT использовались для создания проекта с аналитическим стеком. Сразу оговорюсь: в самом проекте не было четкой постановки задачи 🎯 Делал быстрые наброски, чтобы понять как настраивать opencode и какая у него структура. Что попало в инструкцию: ✨ как правильно оформить проект ✨ где и что писать ✨ как задавать правила для агента ✨ как подключать роли, skills и спецификации ✨ как сделать так, чтобы агент работал не “с нуля”, а в контексте вашей команды Что оказалось особенно ценным 💡 OpenCode становится по-настоящему полезным, когда воспринимаешь его не как “чатик в терминале”, а как часть инженерной инфраструктуры проекта. То есть важно не только запустить tool, но и продумать: 📌 AGENTS.md — как проектный контракт 📌 opencode.json — как control plane для правил, инструментов и разрешений 📌 .opencode/agents/ — для role-based subagents 📌 .opencode/skills/ — для повторяемых playbooks 📌 docs/specs/ — для устойчивых спецификаций, на которые может опираться агент В итоге получается интересный подход: можно собирать “виртуальную команду” из агентов под data-проект — например, выделять роли аналитика, архитектора, infra-инженера, а также задавать им понятные зоны ответственности 🧩 Мне кажется, это особенно полезно тем, кто хочет: — структурировать AI-работу в репозитории — выстроить понятные правила для агентов — сделать процесс воспроизводимым для команды — использовать AI не только для генерации кода, но и для организации инженерного процесса ⚙️📊0,86%
- 13 янв. 2025 г.без подписи0,85%