Data Engineering / Инженерия данных / Data Engineer / DWH
СтатистикаData Engineering: ETL / DWH / Data Pipelines based on Open-Source software. Инженерия данных. ✔ DWH / SQL ✔ Airflow / Python / ETL / dbt / Spark ✔ AI Agents Рекламу не размещаю Вопросы: @iv_shamaev | datatalks.ru
- Последний пост
- 10 авг.
- Последнее чтение
- 20:09
- Постов за неделю
- 1
- Всего постов
- 41
- Тип
- открытый
- Язык
- русский
- Категория
- Технологии
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 1 018
- 1/48двое суток
- 1 166
- 1/72трое суток
- 1 258
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
🤖 Что такое SDD и зачем он нужен? Spec-Driven Development (SDD) — подход к разработке, при котором сначала формируется подробная спецификация, а уже потом AI-агент реализует задачу. Вместо: «Напиши мне эту фичу» → код получаем: Требования → Specification → Plan → Tasks → Code → Tests Зачем это нужно? AI-агент умеет быстро писать код, но может неправильно понять задачу. Спецификация фиксирует что именно нужно сделать, ограничения, архитектуру и критерии готовности. SDD превращает AI-кодинг из хаотичного *vibe coding* в управляемый инженерный процесс. 📚 Подробный разбор SDD и инструментов для работы с AI-агентами: 👉 https://datatalks.ru/spec-driven-development/index.html #AI #AIAgents #SDD #SpecDrivenDevelopment #ClaudeCode #Codex #SoftwareEngineering
🆕 PySpark нейролекции Возможно кому-то поможет в освоении PySpark. С одной стороны нейрослоп и повторы между лекциями, с другой стороны некоторые концепции хорошо прописаны. Раздел с подготовкой к интервью собирался с разных сайтов и материалов. https://datatalks.ru/pyspark/
🚀 Перевод книги «Architecting an Apache Iceberg Lakehouse» на русский язык. Если вы хотите разобраться, что такое Lakehouse, эта книга — отличная отправная точка. В ней последовательно разбираются: • чем Lakehouse отличается от Data Lake и Data Warehouse; • почему появились открытые табличные форматы (Iceberg, Delta Lake, Hudi); • ACID-транзакции, schema evolution, time travel и другие ключевые возможности современных платформ данных; • архитектурные принципы и практические сценарии применения Lakehouse. 📖 Читать перевод: https://aitech720.github.io/lakehouse/ #DataEngineering #Lakehouse #ApacheIceberg #DeltaLake #DataArchitecture #BigData
Тестовый пример реализации MCP Server на Go для OpenCode ▫️Есть набор specs для написания через агентов с нуля MCP Server (теоретически можно реализовать mcp для взаимодействия с любым ПО) ▫️Сгенерирована документация по разработке MCP Server (GitHub Pages) Сам бинарник возвращает из Яндекс метрики список счётчиков (был под рукой api). Основная цель - понять как реализовать свой mcp для взаимодействия с opencode, как собрать бинарник. 🔗 Исходный код, документация и готовые бинарники доступны в репозитории: https://github.com/ivanshamaev/mcp-server 🔗 Краткая документация по разработке MCP: https://ivanshamaev.github.io/mcp-server/
Data Engineering AI Agent Skills - экспериментальный набор скиллов для агентной разработки и построения Agentic Data Platform. https://datatalks.ru/de-ai-agent-skills/ Скиллы все в открытом доступе https://github.com/ivanshamaev/de-agent-skills
По Trino 479 документации https://datatalks.ru/trino-docs/ переведены все разделы + добавлена информация по dbt
Volga: движок обработки real-time данных для AI/ML — аналог Spark и Flink на Rust (Arrow + DataFusion) / Хабр В статье описаны базовые сценарии работы, архитектурные особенности и переход движка на rust. https://habr.com/ru/articles/1021290/
Готов проект по 2 модулю AI Agents — research-agent Репозиторий: https://github.com/ivanshamaev/research-agent Изначальная цель заключалась в том, чтобы на простом примере пройти весь цикл взаимодействия: как оркестратор общается с LLM, как агент выбирает инструменты, как возвращаются результаты вызовов, где хранится состояние и в какой момент всё это собирается в итоговый отчёт. В процессе реализации исходный описанный концепт во 2 модуле изменился. Плюс вместо 1-2 двух llm моделей добавились open-source варианты. И самое важное - добавил gatellm.ru, на котором и протестировался (не реклама, первое что попалось со стартовым балансом на тест). В итоге получился CLI-агент, который: - ищет материалы по теме, - загружает и обрабатывает страницы, - суммаризирует найденное, - собирает результат в структурированный markdown-отчёт с источниками (здесь пока что бага, на днях доработаю). В проекте есть подробная документация со схемами. Для тех, кто хочет разобраться в том, как создать свой агент - welcome: - как выглядит ReAct-цикл на практике, - зачем нужен tool registry, - где проходит граница между orchestration и tools, - и т.д. Агент написан и отлажен за 1 час с помощью claude code (с учетом переделки части модулей и поиска api llm для тестов). 👉🏻 В репозитории есть docs, в которых разложена реализация.
Какая же жиза)
Trino Перевод DeepWiki https://datatalks.ru/trino-deepwiki/
🤖 opencode: Учимся создавать виртуальные команды из агентов для Data-проектов 🚀 Делюсь небольшой инструкцией по OpenCode — инструменту, который можно использовать не просто как CLI, а как полноценный слой настройки проекта для работы с агентами, ролями, правилами и workflow 👇 За основу я взял демо-пример, где OpenCode + ChatGPT использовались для создания проекта с аналитическим стеком. Сразу оговорюсь: в самом проекте не было четкой постановки задачи 🎯 Делал быстрые наброски, чтобы понять как настраивать opencode и какая у него структура. Что попало в инструкцию: ✨ как правильно оформить проект ✨ где и что писать ✨ как задавать правила для агента ✨ как подключать роли, skills и спецификации ✨ как сделать так, чтобы агент работал не “с нуля”, а в контексте вашей команды Что оказалось особенно ценным 💡 OpenCode становится по-настоящему полезным, когда воспринимаешь его не как “чатик в терминале”, а как часть инженерной инфраструктуры проекта. То есть важно не только запустить tool, но и продумать: 📌 AGENTS.md — как проектный контракт 📌 opencode.json — как control plane для правил, инструментов и разрешений 📌 .opencode/agents/ — для role-based subagents 📌 .opencode/skills/ — для повторяемых playbooks 📌 docs/specs/ — для устойчивых спецификаций, на которые может опираться агент В итоге получается интересный подход: можно собирать “виртуальную команду” из агентов под data-проект — например, выделять роли аналитика, архитектора, infra-инженера, а также задавать им понятные зоны ответственности 🧩 Мне кажется, это особенно полезно тем, кто хочет: — структурировать AI-работу в репозитории — выстроить понятные правила для агентов — сделать процесс воспроизводимым для команды — использовать AI не только для генерации кода, но и для организации инженерного процесса ⚙️📊
AI Agent Engineer Roadmap Некоторое время назад начал накидывать через claude импровизационный roadmap по разработке ai agents. Исходная цель: быстро вникнуть в особенности и архитектуру решений для применения в работе. В целом уже что-то можно почитать и изучить. По проектам пока не уверен, что именно будет (и будет ли). https://datatalks.ru/ai-agents/
Привет 👋🏻 Документация airflow с github pages переехала на новый адрес https://datatalks.ru/airflow-docs/. А по Trino тоже появилась заготовка https://datatalks.ru/trino-docs/ (пока висит английская версия, чтобы без vpn смотреть)
Полное руководство по созданию Skills для Claude Перевод guide от Anthropic https://fkonovalov.github.io/claude-skills-guide-ru/
Запряг cursor перевести доку с сайта astronomer. Детально не читал, но вроде получилось хорошо. https://github.com/ivanshamaev/airflow-docs репозиторий недоступен Update: прикрутил страничку https://datatalks.ru/airflow-docs/ (страничка переехала)
GitHub Agentic Workflows are now in technical preview - GitHub Changelog GitHub выпустил прикольную фичу, которая по сути даёт вам суперсилу "DevOps" для работы с CI/CD. Теперь достаточно написать то, что вы хотите получить в формате Markdown, а агент сам сделает всю работу. https://github.blog/changelog/2026-02-13-github-agentic-workflows-are-now-in-technical-preview/
Подборка сайтов со скиллами для ИИ-агентов — можно научить своего бота абсолютно всему без исключения: • skills.sh • skillhub.club • skillsmp.com Сохраняем.
🚀 Airflow: пример Mapped Tasks + Trigger DAG В Apache Airflow есть две фичи: 👉 Mapped Tasks - динамическое создание набора тасок с разными параметрами 👉 Trigger DAG - запуск одного DAG из другого с передачей параметров Я собрал небольшой demo-пример, который показывает, как эти механики можно использовать вместе. 1️⃣ Первый DAG — Orchestrator Реализованы Mapped Tasks. Каждая mapped-таска: ▫️ получает свой параметр ▫️ триггерит второй DAG Выполнение идёт последовательно (одна mapped-таска за другой). По сути — это контроллер, который запускает отдельный pipeline для каждого входного значения. 2️⃣ Второй DAG — Worker ▫️ Принимает параметр из первого DAG ▫️ Подставляет его в SQL-запрос ▫️ Выполняет запрос в PostgreSQL Также сгенерирована документация по этим двум дагам и есть минимум теории по этим двум темам (с оглядкой на эти два дага): 🔸 Airflow Mapped Tasks Tutorial 🔸 Airflow Trigger Dag Tutorial 🔗 Ссылка на даги и доку: trigger_example ⏬⏬⏬ В репозитории также можно найти docker-compose.yml, для запуска этих примеров.
Data-команды должны стать командами контекста Context engineering = управление данными + инженерия данных + наука о данных. Понравилась статья, закинул перевод на сайт. На мой взгляд, content engineering может стать как отдельным ответвлением профессии (здесь и аналитика, и бизнес-процессы, более быстрое получение ответов на вопросы). С другой стороны дата команды могут трансформироваться в нечто большее. Всё зависит от ваших экспериментов и открытости к технологиям. Главное держать баланс хайпа и реальной пользой для бизнеса. https://datatalks.ru/context-engineering-data-teams/
ClickHouse выпустил agent-skills Agent Skills — это открытый стандарт для расширения возможностей ИИ-агентов с помощью модулей, которые дают им доменные знания, инструкции и повторяемые процедуры без необходимости дообучения модели. По сути это набор лучших практик работы с ClickHouse: как правильно проектировать схемы, оптимизировать запросы и настраивать загрузку данных. Далее эти skills подключаются в AI редактор, например, Copilot, Claude Code, Cursor. GitHub - ClickHouse/agent-skills: The official Agent Skills for ClickHouse and ClickHouse Cloud https://github.com/ClickHouse/agent-skills