tgindex
Agentic Engineer

Agentic Engineer

Статистика

Data Engineering Technologies. SQL, Python, Kafka, Spark, Pandas, Airflow, Clickhouse, Greenplum, Postgres, dbt, LLM agentic systems, AI, robots, drones etc. Boost channel - https://t.me/boost/data_engi

Последний пост
23:47
Последнее чтение
14:39
Постов за неделю
31
Всего постов
239
Тип
открытый
Язык
русский
Категория
Технологии
В каталоге с
12 авг.
Подписчики
622
+2 за 4 дн.
Сутки
+1
+0,16%
Неделя
 
Месяц
 
Просмотров на пост
107
40 постов
Вовлечённость
17,2%
к подписчикам
Постов в день
4,4
всего 239
Упоминаний
5
каналов
Охват размещения
оценка
1/24сутки в ленте
100
1/48двое суток
114
1/72трое суток
123

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 👻AI-агенты перепроверили треть работ ICML 2026 Более 1200 участников с помощью Codex, Claude Code, Cursor и других агентов попытались воспроизвести 2226 научных работ — около 34% всей конференции. Код, результаты и трассы запусков публиковались открыто. Только 266 работ удалось воспроизвести полностью. У 23% проверенных публикаций хотя бы один вывод был опровергнут или оспорен. Но и агенты ошибались: одна громкая «находка» оказалась обычным сравнением времени одной операции со временем пакета из 50. Для тебя вывод практический: агент хорошо масштабирует проверку кода и экспериментов, но его вердикт тоже нужно перепроверять. Лучшие результаты получились там, где человек управлял направлением исследования и проверял спорные выводы. Пруф: отчёт Hugging Face от 13 августа 2026 года #aiagents #machinelearning #research #reproducibility #icml #aievals @data_engi

  • 20:389142

    ⭐️ В Spark меньше executors иногда означает быстрее и дешевле AWS сравнила два кластера EMR Serverless с одинаковыми 192 vCPU: 6 крупных executors по 32 vCPU против 48 небольших по 4 vCPU. На 126 запросах TPC-DS и TPC-H крупные workers с оптимизированными под shuffle дисками оказались в среднем на 29% быстрее и дешевле. Один executor получал данные только от 5 удалённых источников вместо 47 — меньше сетевой координации, удалённых чтений и spill на диск. Для инженеров вывод неочевидный: при тяжёлых join, groupBy и repartition увеличение числа executors может мешать. Но для обычного I/O без большого shuffle множество небольших workers всё ещё способно дать больше параллелизма. Источник: AWS Big Data Blog — 29 июля 2026 года #apachespark #amazonemr #shuffle #dataengineering #distributedcomputing #performance @data_engi

  • 😍 Iceberg-каталог теперь сам решает, какие файлы читать Раньше каждый клиент Iceberg загружал списки манифестов и сами манифесты, а затем локально вычислял набор файлов для запроса. На больших таблицах это нагружало сеть и память драйвера Spark. В Iceberg 1.11 REST-каталог может выполнить планирование на сервере и потоково вернуть только готовые задачи чтения. Механизм также охватывает инкрементальные запросы Structured Streaming и служебные таблицы history и snapshots. Для инженеров это меньше метаданных на клиентах и возможность централизованно улучшать планирование без изменений в движках. Но REST-каталог и клиент должны поддерживать новый протокол. #apacheiceberg #lakehouse #restcatalog #apachespark #structuredstreaming #dataengineering @data_engi

  • 👩‍💻 ClickHouse перестал превращать колонки в строки по дороге к приложению ClickHouse выпустил официальный драйвер ADBC — колоночную альтернативу JDBC и ODBC. Результаты запросов передаются сразу пакетами Apache Arrow: без промежуточного преобразования колонок в строки и обратной сборки для pandas, Polars или dbt Fusion. Один драйвер на Rust работает через общую ADBC-прослойку в разных языках, включая Python, R, Ruby и C. Он также поддерживает потоковую загрузку Arrow-пакетов с постоянным потреблением памяти. Для инженеров это меньше преобразований, копирования данных и отдельных драйверов. Но версия пока ранняя — 0.1.0; автоматическое создание таблиц, просмотр каталогов и полноценная передача JSON ещё не готовы. #clickhouse #apachearrow #adbc #dataengineering #columnar #dbtfusion @data_engi

  • ⭐️ OpenAI вынесла обвязку AI-агентов из контекста модели 13 августа OpenAI представила Programmatic Tool Calling. Теперь GPT‑5.6 может написать JavaScript, который параллельно вызывает инструменты, фильтрует и объединяет их ответы в изолированном V8-рантайме. Промежуточные данные при этом не забивают контекст модели. Тебе это пригодится в агентах, которые обрабатывают много документов, API-ответов или результатов поиска. Детерминированную работу выполняет код, а LLM получает уже компактные данные и занимается только тем, где действительно нужно рассуждение. В одном из производственных тестов такой подход сохранил качество и сократил расход входных токенов на 21%. Пруфы: 🔘документация 🔘гайд OpenAI #aiagents #llm #toolcalling #javascript #openai #agenticai @data_engi

  • 😵‍💫 Одна и та же модель стала почти втрое умнее благодаря обвязке В тесте OpenAI GPT‑5.6 Sol набрала на ARC‑AGI‑3 всего 13,3% со стандартной архитектурой агента. После сохранения рассуждений между шагами и сжатия длинного контекста результат вырос до 38,3% — при этом выходных токенов потребовалось примерно в шесть раз меньше. Для тебя вывод простой: качество агента определяется не только моделью. Грамотное управление памятью и контекстом может дать больший эффект, чем очередная замена LLM. Пруф: технический разбор OpenAI от 13 августа 2026 года #ai #aiagents #llm #contextmanagement #agentarchitecture #evaluation @data_engi

  • 🥺 Claude начнёт ставить водяные знаки на тексты Anthropic объявила 14 августа, что будущие модели Claude будут незаметно маркировать ответы по всему миру. Никаких скрытых символов: модель оставляет статистический узор, выбирая слова с помощью секретного ключа. Дополнительные токены не расходуются. Anthropic готовит API для проверки таких текстов. Но тебе нельзя считать его детектором истины: короткие фрагменты, код и слегка отредактированный человеком текст определяются плохо. Знак показывает лишь вероятность участия Claude, а не авторство конкретного человека. Изменение вводят для выполнения требований закона ЕС об ИИ, но распространят сразу на весь мир. Пруф: официальный разбор Anthropic от 14 августа 2026 года #ai #claude #llm #watermarking #aigovernance #anthropic @data_engi

  • 🦜 GPT‑5.6 Sol разогнали до 750 токенов в секунду OpenAI показала режим Ultrafast: GPT‑5.6 Sol работает до 14 раз быстрее стандартного режима без замены на упрощённую модель. Ускорение обеспечивает инфраструктура Cerebras. 7 Для тебя это открывает новый класс приложений: голосовые агенты без долгих пауз, анализ логов во время инцидента и сложные цепочки инструментов в реальном времени. Пока Ultrafast доступен только ограниченному числу клиентов — цены и сроки общего запуска не объявлены. Пруф: официальный анонс OpenAI от 13 августа 2026 года #ai #llm #openai #inference #cerebras #infrastructure @data_engi

  • 🍴 Milvus индексирует озеро без копирования данных 29 июля вышел Milvus 3.0 с внешними коллекциями. Векторная база оставляет исходные данные в Parquet, Lance, Iceberg или Vortex на объектном хранилище, но строит поверх них собственные векторные, полнотекстовые, JSON- и скалярные индексы. Для инженеров это убирает вторую копию терабайтов эмбеддингов и ETL-конвейер для её синхронизации. При добавлении колонок Milvus может обновить только затронутые сегменты, не перестраивая всю коллекцию. Ограничения: внешние коллекции доступны только для чтения, требуют Storage V3 и обновляются через отдельную операцию refresh. #milvus #vectorsearch #lakehouse #apacheiceberg #parquet #dataengineering #zerocopy @data_engi

  • 👀 Storm применил TCP-логику к пакетам событий В Apache Storm 3.0 размер пакетов между производителями и очередями может меняться по алгоритму AIMD — тому же принципу, который используется для управления перегрузкой в TCP. При свободной очереди пакет постепенно растёт, повышая пропускную способность. При обратном давлении размер резко уменьшается, чтобы не усугублять перегрузку. Это снижает потребность вручную подбирать фиксированный размер пакета под каждый поток. Функция включается параметром topology.producer.batch.dynamic. Для перехода на Storm 3.0 потребуется Java 25; ветка 2.x больше поддерживаться не будет. #apachestorm #streamprocessing #backpressure #dataengineering #distributedcomputing #realtime @data_engi

  • ⛔️ ByteDance готовит ИИ-модель на 10 триллионов параметров Китайская ByteDance обучает модель, которая по масштабу может превзойти даже Anthropic Mythos с примерно 8 трлн параметров. Модель пока находится на этапе предварительного обучения. Запуск не подтверждён, а размер сам по себе не гарантирует качества. Но гонка явно смещается от «умнее» к «огромнее». #ai #llm #bytedance #china @data_engi

  • ⭐️ StarRocks сам дробит «горячих» арендаторов В StarRocks 4.1 появилась диапазонная раскладка данных. Каждый планшет хранит свой диапазон ключей, а система автоматически делит слишком крупные или перегруженные планшеты и объединяет остывшие. Для многопользовательских платформ ключ можно начинать с tenant_id: активный клиент получит больше планшетов и вычислительных ресурсов, не создавая перекос для остальных. Переразметка схемы, изменение SQL и повторная загрузка данных не нужны. Пока механизм работает только в архитектуре shared-data и отключён по умолчанию — его нужно включать параметром enable_range_distribution. #starrocks #olap #multitenancy #datadistribution #scalability #dataengineering @data_engi

  • Учёные смоделировали рой из 100 000 ИИ-агентов Исследователи представили IO Factory — симулятор информационных кампаний, где тысячи ИИ-агентов могут планировать действия, публиковать сообщения, отслеживать реакцию аудитории и менять тактику. Это не реальная атака, а контролируемая модель для изучения угроз. Но сам масштаб впечатляет: информационные операции теперь можно анализировать как инженерную систему — с ролями, логами и измеримым эффектом. Следующий вызов для AI-безопасности — не один чат-бот, а целые координированные рои. arXiv, 11 августа 2026 #ai #agents #cybersecurity #informationwarfare @data_engi

  • 💡 Как премия за синий светодиод выросла в суде в миллион раз — а затем снова уменьшилась Красные и зелёные светодиоды существовали десятилетиями. Но без синего нельзя было получить полноценный белый свет — основу современных ламп, экранов и многих оптических устройств. Проблема казалась почти нерешаемой: кристаллы нитрида галлия получались слишком плохого качества. В 1988 году инженер Сюдзи Накамура начал заниматься этой задачей в небольшой японской компании Nichia. Работодатель оплатил ему обучение в США и закупил оборудование, однако Накамуре пришлось самостоятельно переделывать установку для выращивания кристаллов. В 1990 году он создал двухпоточную систему подачи газов, позволявшую получать более качественные слои нитрида галлия. Nichia оформила патент № 2628404 на себя, указав Накамуру изобретателем. Согласно внутренним правилам, ему заплатили 10 000 иен за подачу заявки и ещё 10 000 после выдачи патента. Итого — 20 000 иен. В 1993 году Nichia объявила о промышленном выпуске яркого синего светодиода. Это был результат не одного патента и не работы только Накамуры: параллельный прорыв совершили Исаму Акасаки и Хироси Амано из Нагойского университета. Но именно решения Накамуры помогли превратить сложную лабораторную технологию в массовый товар. В 1999 году инженер ушёл из Nichia, а в августе 2001-го подал иск. Японский закон признавал патент компании, но требовал выплатить работнику «соразмерное вознаграждение» за служебное изобретение. 30 января 2004 года Токийский окружной суд постановил: вклад Накамуры стоил не меньше 60,4 миллиарда иен. Он требовал только 20 миллиардов, поэтому суд присудил именно эту сумму — ровно в миллион раз больше первоначальной премии. Nichia обжаловала решение. Компания напоминала, что финансировала исследования, несла коммерческие риски, а успех обеспечивали почти две сотни патентов и работа целой организации. До окончательного приговора дело не дошло. 11 января 2005 года стороны приняли мировое соглашение: 608,57 миллиона иен за все изобретения Накамуры плюс 235,34 миллиона процентов — около 843,9 миллиона иен. Накамура счёл сумму заниженной, Nichia — завышенной. В 2014 году Накамура, Акасаки и Амано разделили Нобелевскую премию по физике. Так синий светодиод осветил весь мир — и заодно показал, насколько по-разному свет падает на изобретение, изобретателя и бухгалтерию. Пруфы: 🔘решение Токийского окружного суда 🔘официальные условия мирового соглашения 🔘исследование служебных изобретений Гарвард-Еньчинского института 🔘Нобелевский комитет о синем светодиоде #историятехники #япония #светодиоды #патентноеправо #историябизнеса @data_engi

  • 👀 Pinot научился исправлять пакетные данные без Kafka В Apache Pinot 1.5 механизм upsert появился у пакетных OFFLINE-таблиц. При повторении первичного ключа база сохраняет запись с наибольшим значением указанной колонки — например, временем обновления. Теперь корректировки, поздние данные и повторную загрузку снимков можно выполнять через обычные файлы, не создавая потоковый контур только ради обновлений. Ограничение: поддерживается лишь полная замена строки. Изменение первичного ключа или колонки сравнения требует полной пересборки таблицы. #apachepinot #upsert #olap #batchprocessing #dataengineering #datapipelines @data_engi

  • 🖼️ Apache Airflow 3.3.1 выкатили Опубликован очередной патч-релиз Airflow 3.3. В нём нет большой революции — это набор исправлений и небольших улучшений стабильности после выхода 3.3.0. Если ты уже работаешь на ветке 3.3, обновление стоит проверить в тестовом окружении. Для воспроизводимой установки используй constraints именно от версии 3.3.1, а не обычный "pip install" без фиксации зависимостей. #airflow #apacheairflow #dataengineering #orchestration #python @data_engi

  • vLLM утроила пропускную способность длинноконтекстных агентов Команда vLLM показала Decode Context Parallelism: KV-кеш делится между GPU не по головам внимания, а по отрезкам контекста. Поэтому видеокартам не приходится хранить одинаковые копии длинной истории агента. На одном сервере с 8×B200 и Kimi K2.6 производительность выросла с 1 863 до 6 091 токена/с на GPU. Тест использовал реальные агентные трассы с медианой около 67 тысяч токенов и хвостом до миллиона. Если ты обслуживаешь много долгоживущих агентов, узким местом может быть не сама модель, а дублирование KV-кеша. В vLLM DCP включается одним параметром. #ai #llm #vllm #inference #kvcache #gpu #agenticai @data_engi

  • Гуманоидные роботы устроили ажиотаж на бирже IPO Unitree в Шанхае оказался переподписан розничными инвесторами более чем в 8000 раз. Компания привлекла около $900 млн, а её оценка превысила $9 млрд. Unitree может стать первым китайским производителем гуманоидов на бирже. Похоже, роботы уже продают не только себя — они продают инвесторам надежду на следующую большую индустрию. #robotics #humanoidrobots #physicalai #china @data_engi

  • 👉 Учёные предложили способ обучать роботов без разметки предпочтений В свежем препринте RynnValue исследователи обучили модель оценки действий робота на временной дистанции до цели — без ручной разметки «хорошо/плохо». Модель использовала около 7 000 часов данных и 3 млн видеофрагментов; в их экспериментах успешность выполнения задач выросла с 52,5% до 72,5%. Если результат подтвердится, обучение роботов станет дешевле: вместо ручной оценки каждой попытки можно использовать обычные временные метки видеозаписей. Пока это исследовательская работа, а не готовая промышленная технология. #robotics #embodiedai #machinelearning #opensource @data_engi

  • 😳 Microsoft собрала локального агента из моделей на 14B и 9B MagenticLite использует MagenticBrain на 14 млрд параметров для планирования, кода и вызова инструментов, а браузерные задачи передаёт специализированной Fara1.5-9B. Система работает с браузером и локальными файлами, сама сжимает старый контекст и запускает действия в QEMU-песочнице. Перед входом в аккаунт, оплатой или необратимой операцией агент запрашивает подтверждение. Для инженеров вывод простой: сильный агент — не обязательно одна огромная LLM. Узкие модели, правильное разделение задач и управление контекстом могут дать более дешёвую и контролируемую систему. #ai #aiagents #smallmodels #computeruse #localai #architecture @data_engi