tgindex
Олег Булыгин | Полезная нагрузка

Олег Булыгин | Полезная нагрузка

Статистика
@oleg_payloadрусский

🔸 Про IT, AI, DS, ML от практика с 11+ годами опыта. ▪️Связь: @obulygin91

Последний пост
11:02
Последнее чтение
00:46
Постов за неделю
14
Всего постов
142
Тип
открытый
Язык
русский
В каталоге с
12 авг.
Подписчики
6 232
+19 за 4 дн.
Сутки
+3
+0,05%
Неделя
 
Месяц
 
Просмотров на пост
709
40 постов
Вовлечённость
11,4%
к подписчикам
Постов в день
2,0
всего 142
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
538
1/48двое суток
616
1/72трое суток
664

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 11:0231853

    Гит для агентов: как наконец-то перестать перезапускать упавшие пайплайны с нуля Главная боль большинства современных фреймворков для LLM-агентов — отсутствие нормального управления состоянием. Они переписывают файлы друг за другом, заходят в тупик на 15-м шаге, а чтобы откатить галлюцинацию, разработчикам приходится либо перезапускать весь промпт с нуля (сжигая тысячи токенов), либо городить монструозные костыли вокруг Docker и логов. Появился проект SHEPHERD — Python-рантайм, который относится к исполнению агента как к Git-репозиторию. В основе лежит классическая идея из функционального программирования (алгебраические эффекты). Любой вызов модели, инструмента или правка файла превращается в коммит в неизменяемом графе исполнения. Что это даёт: 1️⃣ Форк среды и контекста за ~130 мс. Это в 5 раз быстрее docker commit и до 300+ раз быстрее полного копирования файловой системы. 2️⃣ Точный откат. Можно отмотать агента и его файловую систему на любой прошлый шаг, не потеряв синхронизацию между памятью модели и диском. 3️⃣ Перехват деструктивных действий. Мета-агент видит намерение сделать вредный rm -rf или некорректный коммит ДО того, как действие изменит диск, и может его заблокировать. 4️⃣ Экономия токенов при повторах. При откате и форке ветка переиспользует до 95% KV-кэша LLM-провайдера, потому что префикс сообщений остается байт-в-байт идентичным. В статье показали три кейса, где без нормального контроля состояния раньше была тотальная боль: 🔵 Супервизия параллельного кода: Когда два агента кодят в одном репо одновременно, они обычно ломают изменения друг друга (бенчмарк CooperBench, успешность всего 28.8%). Супервизор на Shepherd видит их действия в реальном времени, форкает или откатывает конфликтующие ветки — результат прыгает до 54.7%. 🔵 Контрафактическая оптимизация пайплайнов: Чтобы отладить сложный workflow, не нужно прогонять 30 шагов с нуля. Оптимизатор меняет промпт/код на шаге N, форкает траекторию и переигрывает только суффикс. Это дало +27.5% на LiveCodeBench при снижении времени оптимизации на 58%. 🔵 Tree-GRPO в RL: При обучении агентов через RL сложно понять, какой именно из 30 шагов привел к ошибке в конце. Shepherd делает дешевые форки прямо во время роллаута, создавая пошаговый сигнал подкрепления (+15.2% на Terminal-Bench 2.0). Отлично, что вокруг ИИ-агентов начинает появляться нормальный системный инжиниринг с изоляцией на уровне ядра, а не очередные обертки над API.

  • Большинство современных инструментов для агентного программирования — это прожорливые обертки на Node.js или Electron, которые пожирают полгигабайта оперативы еще до того, как вы успели отдать первый промпт. CLI-инструменты мерятся красотой спиннеров в терминале, Claude Code стартует по 3.5 секунды, а Cursor и Copilot CLI жрут память сотнями мегабайт на одну сессию. Недавно появился jcode — открытый CLI-агент для терминала, целиком написанный на Rust. Почему на него стоит обратить внимание? 🔵 Ресурсная эффективность: Каждая дополнительная сессия jcode требует около 9.9–10.4 МБ ОЗУ (PSS). Для сравнения: Claude Code жрет ~212 МБ, OpenCode — 318 МБ. Вы можете поднять рой (swarm) из 10 параллельных агентов в одном репозитории, и они суммарно сожрут меньше 300 МБ. 🔵 Мгновенный отклик: 14 мс до отрисовки первого кадра в терминале против 3.4 секунд у того же Claude Code. 🔵 Промпт-гигиена: Базовый системный промпт зажат всего в 671 токен (у Claude Code leaked-промпт раздут до ~2300 токенов, у Codex CLI — до 4365). Чем меньше мусора в системном контексте, тем больше полезного места остается под ваш код и тем меньше вы платите провайдерам. 🔵 Бережное отношение к KV-кэшу: Контекст собирается по принципу append-only. Промпт стабилен, схемы MCP-инструментов объявляются сразу из локального диск-кэша, а не подключаются хаотично в середине сессии. В итоге кэш-хиты провайдеров не слетают, а латентность ответов падает. Отдельный респект за jcode bench. Текущие SWE-бенчмарки сломаны: они либо дискретны (прошел тест / не прошел), либо утекают в обучающие выборки новых моделей, из-за чего мы мерим не способность рассуждать, а объем заученного текста. Концепция jcode bench принципиально иная: — Без ответов в базе: оценивается не прохождение синтетического таска, а глубина оптимизации горячих функций. — 100% покрытие: корректность проверяется не на 10 сэмплах из pytest, а на всем пространстве входов (например, абсолютно все 2³² значений float). Никакого оверфиттинга под тест. — Аналоговая шкала: фиксируется не "pass/fail", а реальное ускорение кода под детерминированной моделью стоимости. Условно: смогла ли модель переписать сишный/растовый цикл так, чтобы он работал в 100–300 раз быстрее, не сломав ни один краевой случай. Из приятных инженерных обвесов: — Self-Dev mode: Агент умеет заходить в собственный исходный код на Rust, править его, компилировать новый бинарник, перезагружать себя прямо на лету и продолжать работу. — Swarm-координация: Несколько агентов могут работать в одном репо. Если один агент меняет файл, который читал другой, сервер автоматически уведомляет второго о «сдвиге почвы под ногами» и помогает разрешить конфликт. Если работаете в терминале и цените производительные инструменты без маркетинговой шелухи — затестить точно стоит.

  • 3D-миры из текста: почему монолитные нейросети проиграли связке агентов и Blender Tencent выкатили проект WorldClaw — агентный пайплайн генерации масштабных открытых 3D-миров из обычного текстового промпта. Вместо попыток вытренировать одну гигантскую сеть, которая будет в один проход выплевывать готовый мир (что при текущем объеме 3D-данных на рынке в принципе нереально), авторы собрали агентную архитектуру: 1️⃣ Планирование и глобальный террейн. LLM-агент (в тестах гоняют Claude Opus 4.8) разбирает промпт в жесткую структуру. Сначала строится непрерывный рельеф — карта высот, процедурные шейдеры для ландшафта и базовые элементы типа скал и деревьев через Python-скрипты и графы нод в Blender. 2️⃣ Заселение локаций. Вместо того чтобы сразу моделировать сложную 3D-сцену из текста, система рендерит участок террейна в 2D, скормливает картинку мультимодальной нейросетке (GPT-Image-2), генерирует концепт объектов прямо на местности, нарезает их через SAM3 и реконструирует отдельные 3D-меши через Hunyuan3D / SAM3D. 3️⃣ Петля рефлексии. Самое интересное: агент рендерит полученную сцену через BlenderMCP, считывает маски и глубину, видит, например, что дом висит в воздухе, а забор провалился в текстуры, и вызывает функции правки позы и геометрии, пока объект нормально не заземлится. Главный плюс всей этой конструкции — на выходе получается не мешанина из пикселей, а структурированная сцена: отдельно рельеф, отдельно независимые текстурированные меши со своими координатами, сеткой и нодами материалов. Всё это можно руками двигать, менять и экспортировать в нормальные движки. А теперь про ограничения: 🔵 Это тяжело и дорого. Пайплайн требует связки Claude Opus 4.8, GPT-Image-2, SAM3, Hunyuan3D, Blender и сервера на H20 GPU. Это оооочень длинный и дорогой пайплайн. Полноценный запуск включает сотни вызовов LLM, мультиагентное планирование, нарезку 2D-картинок, 3D-реконструкцию каждого объекта и десятки циклов рендеринга и отладки. Для генерации «на лету» в реальном времени не подойдет от слова «совсем». 🔵 Качество упирается в базовые 3D-генераторы и топовые LLM. Авторы признают: опенсорсные языковые модели пока тупо не тянут такой пайплайн. Они факапят Blender Python API, генерируют кривые ноды и теряют пространственный контекст. Если 3D-модель выдаст кривую геометрию или мыльную текстуру, агент будет до последнего пытаться сгладить этот стыд, но выше головы не прыгнет. Но как концепт того, куда движется генеративный 3D-продакшен — это отличный пример. Будущее 3D-генерации похоже не на «волшебную кнопку», а на джуна, который сидит в Blender и без отдыха выполняет рутинную работу по вашему ТЗ. Ждем очередную GTA, где весь мир так будет сгенерирован? 😏

  • 14 авг.344105удалён 15 авг.

    Нашлась тут пара постов-жемчужин в соседнем канале. Хочу порекомендовать, потому что сам залип и кое-что даже взял в работу. @coreinfra — это канал про разработку, агентов, инфраструктуру и полезные мелочи. Написано живым языком, без воды. Вот три последних поста, которые цепляют: • Как за 14 рублей и 40 минут агент на дешёвой модели довёл до ума пет-проект с картами Питера, хотя год назад даже SOTA не справлялась • Про revdiff, который показывает полный контекст изменений в PR, а не рваные строки — теперь ревьюить большие коммиты намного приятнее • Как в Codex завезли Responses API для DeepSeek V4 Flash, и настроить всё можно одной командой Короче, если вы пишете код, любите эксперименты или просто хотите быть в курсе свежих инструментов заглядывайте в @coreinfra

  • Адекватный вайбкодинг: как собрать 3D-атлас анатомии из нейросетей и не положить браузер В сети завирусился очередной кейс: разработчик под ником The Bugged Dev с помощью нейросетей с нуля поднял интерактивный 3D-атлас анатомии человека — Anatomy Atelier. 🤩 Проект реально симпатичный: честный Three.js в браузере, интерактивные хотспоты, анатомические срезы, мини-квизы и поддержка кучи языков. Пайплайн выглядел так: 1️⃣ Концепты: 2D-рендеры и визуал органов сгенерировали в GPT Image 2.0. 2️⃣ 3D-моделирование: полученные картинки прогнали через Tripo AI, переведя их в .glb-модели. 3️⃣ Сборка и логика: Codex поднял каркас приложения на Three.js, настроил интерфейс и сцену. Codex выдал рабочий код. Но каждая 3D-модель органа весила по 120–150 МБ. Суммарный вес страницы перевалил за 900 МБ, а интерфейс выдавал гордые 16 FPS. Классический результат вайб-кодинга без инженерного контроля — вроде работает, но пользоваться этим невозможно. Автор заставил Codex оптимизировать модели: пожать сетку через meshopt, оптимизировать текстуры и сделать подгрузку ассетов по требованию (on-demand loading). В результате общий вес упал с 900 МБ до 28.6 МБ (по 2–5 МБ на орган), а приложение залетало. Вот это и есть реальная картина работы с ИИ-инструментами: нейросети отлично снимают рутину и генерируют прототипы, но если у автора ноль технического понимания, то на выходе получится монстр. Исходный код есть на GitHub 🫲🏻

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • Августовский AI-триплет: веса Qwen 3.8 на HF, релиз DeepSeek V4 Pro и Grok 4.6 🚀 1️⃣ DeepSeek V4 Pro 0813: убиваем конкурентов ценами Недавно вышла новая крутая Flash версия, теперь получите и распишитесь — релиз DeepSeek V4 Pro 0813. В бенчмарках творится дичь: — Terminal Bench 2.1: 87.9 (против 85.0 у Opus 4.8). — DeepSWE: выросла с убогих 12.8 в превью сразу до 62.7 (снова обставив Opus 4.8 с его 58.0). — Cybergym: 83.3 (обходит и Opus 4.8 с 78.3, и Fable 5 с 83.1). — AutomationBench: 31.8 (против 27.2 у Opus). — HLE (с тулзами): добирается до 60.0 (у Opus 4.8 — 57.9). Ценник на OpenRouter: $0.435 за 1M входа / $0.87 за 1M выхода. Модель, которая в консоли, кибербезе и автотестах нахлобучивает топового Клода, стоит буквально копейки. Только вот цены собираются очень сильно повысить 🥲 2️⃣ Qwen 3.8-2.4T-A95B: опенсорс флагман Недавно я писал про релиз Qwen 3.8-Max, и вот Alibaba сдержала обещание и выложила веса на Hugging Face. Это огромная MoE-сетка на 2.4 триллиона параметров, из которых при каждом токене активируются 95B (всего 512 экспертов: 10 роутинговых + 1 общий). Нативный контекст — 256K, легко растягивается до 1M. — Модель исключительно текстовая и работает строго с включенным thinking-режимом. Выключить его нельзя, но глубину рассуждений разрешили рулить параметром reasoning_effort (xhigh, medium, low). — В бенчмарках на кодинг и агентские задачи (SWE-bench, TerminalBench, PaperBench) она умудряется бодаться и местами обходить проприетарные закрытые сетки вроде Opus 4.8 и GPT-5.6 Sol. 3️⃣ Grok 4.6: Ответ от xAI для сложных пайплайнов И вишенка на торте — релиз Grok 4.6 от Илона Маска. Здесь фокус сделан на long-running agents, авто-тестирование своего же кода и сборку фронтенда/визуала «с одного промпта»: По бенчмаркам (AA Intelligence Index 61, CursorBench 69.9%) борется с GPT-5.6 Sol Max. Модель уже завезли в Cursor и Grok Build (на первую неделю дают 2x лимиты). По ценам API — $2 за 1M инпута и $6 за 1M аутпута. По американским меркам неплохо, но на фоне DeepSeek цифры смотрятся бледновато (почти в 7 раз дороже V4 Pro при схожих задачах). Китайская школа продолжает показывать мастер-класс по захвату рынка: DeepSeek давит инфраструктурной ценой и дикими показателями в бенчах, Alibaba отдаёт топовые веса открытому комьюнити, а американские корпорации продолжают продавать закрытые инструменты, за которые надо сильно переплачивать.

  • Помните, недавно я писал про проект «Claude-of-Duty», где нейросети пытались в автономном режиме собрать браузерный AAA-шутер, а на выходе получили 55 000 строк кода, задыхающийся рендер и графику на 5/10, потому что нейросети бегали по кругу, галлюцинировали причины багов и путали яркость источника света с текстурой альбедо? На днях мне попался противоположный пример того, как может выглядеть эффективная работа с LLM в геймдеве. Знакомьтесь: THE LONG SILENCE (заходите только с десктопа) — процедурный космосим на WebGL2, который запускается прямо во вкладке браузера. В чем вкуснота проекта: 1️⃣ Claude на поводке у Blender Разработчик не просил нейросеть «нарисуй мне красивый кораблик». Он связал Claude с Blender через локальный сокет (BlenderMCP). В итоге LLM выступала в роли оператора BMesh: генерировала Python-скрипты для процедурного лофтинга корпуса 160-метрового судна, высчитывала фаски, настраивала procedural PBR-материалы износа брони и расставляла источники света. 2️⃣ Настоящий Zero-Assets и математика визуала Здесь нет тяжелых паков гигабайтных текстур или скачанных 3D-моделей. Всё — от туманностей и звездных систем до планетарных рельефов, кольцевых станций и трещин на обшивке корабля — генерируется процедурно. Звезды — это не просто круглые спрайты, а процедурные шейдеры с ячейками Вороного, конвекцией и хромосферным свечением. Облака и ландшафты — многооктавный шум Симплекса и Риджед-фракталы, запекаемые в кубические карты на лету. Звук генератора, гул двигателей, импульсы сканера и переливы гитарных струн синтезируются в реальном времени через Web Audio API. 3️⃣ Автоматический контроль качества Вместо того чтобы доверять галлюцинирующим «AI-критикам», автор написал обвязку из Playwright-скриптов (aocheck.mjs, levels.mjs, perfset.mjs). Система автоматически рендерит кадры, считывает гистограммы яркости, проверяет глубинную буферизацию, измеряет p95/p99 кадров и динамически меняет масштабирование рендера (от 0.62x до 2x), удерживая планку в 60 FPS. В «Claude-of-Duty» разработчики пытались сгрузить на AI архитектуру и дизайн-решения, а в The Long Silence архитектуру, математику и пайплайн контроля качества проектировал инженер. А Claude использовался как мощный ускоритель написания сложных GLSL-шейдеров, алгоритмов процедурной генерации и геометрии. И да, выглядит не хуже многих инди-поделок.

  • 11 авг.6781912

    Сначала ИИ загнал вас в выгорание, а теперь ИИ будет высчитывать, когда вы окончательно сдохнете 📉 Недавно я писал о том, что больше половины IT-специалистов (56%) сидят на грани выгорания из-за взвинченных ИИ-инструментами темпов. Конвейер мчится, мозг плавится, а бизнес задирает планку производительности до небес. И вот аналитики компании «Стахановец» (известный разработчик систем мониторинга персонала) хвастаются: они научились с точностью до 87% вычислять эмоциональное выгорание за 2–3 месяца до того, как человек сам его осознает. Симптомы по версии их алгоритмов такие: 1️⃣ Агрессивная лаконичность: В норме письмо занимает 60–120 слов. При выгорании длина падает на 40%, приветствие исчезает в 78% случаев, а текст ужимается до команд вроде «Сделай», «Не работает», «Жду». 2️⃣ Хаотичный словесный понос: У 25% сотрудников наоборот — письма разрастаются до 200–300 слов, логика рушится, появляются повторы. Человек тратит на простую мысль в 3–4 раза больше ресурса. 3️⃣ Лексика и тайминги: Количество слов «проблема» и «провал» вырастает в 2,3 раза, «спасибо» исчезает, а время ответа растягивается с 2 часов до суток. Как обычно вместо решения проблемы мы снова лечим метрику в отчете и получаем очередной инструмент цифрового надзора. «У сеньора длина сообщения упала на 40%, а слово "отлично" не встречалось с прошлой среды. Похоже, батарейка села, готовьте замену»!!111 Скоро дойдём до того, что айтишники будут просить нейронку генерировать ответики подлиннее и вставлять туда побольше «спасибо» и «отлично», просто чтобы алгоритмы не списали их в утиль раньше времени.

  • IT-кошка принесла кладесь знаний 🐈‍⬛ IT & AI каналов много, но по-настоящему качественные медиа часто скрываются в потоках информации. Вот вам кладесь знаний из сферы технологий👇🏻 Внутри папки можно найти: Новости из мира IT Нейросети Реальные кейсы из практики Вакансии Всё самое полезное и актуальное собралось здесь: https://t.me/addlist/ZPicVwIc1bJkMzE6

  • 117-е место из 147: смотрим свежий рейтинг проникновения ИИ от Microsoft и Our World in Data Я как-то разбирал заявления депутата Горелкина о том, что отчетам Microsoft верить нельзя, 9.5% проникновения ИИ в РФ — это «выдумки и шпионаж», а в любом «объективном рейтинге мы в тройке лидеров». Команда Our World in Data выложила свежий датасет замера Microsoft AI Diffusion Report (за первый квартал 2026). Я скачал открытую CSV-выгрузку, посмотрел в методологию и... есть парочка интересных цифр. 1️⃣ Где мы в мировом зачете? У России по-прежнему 9.5% проникновения генеративного ИИ среди взрослого населения (15–64 лет). В итоговой таблице из 147 стран это 117-е место. Ниже нас — всего 30 государств. Соседи по рейтингу: Киргизия (9.5%), Беларусь (9.6%), Украина (9.4%), Кения (8.7%) и Гамбия (11.4%). Для понимания, как выглядит мир: 🔵 Абсолютные лидеры: ОАЭ (70.1%) и Сингапур (63.4%). 🔵 Западная Европа: Франция, Ирландия, Норвегия — в районе 48%. 🔵 США: 31.3% (родина технологии, но далеко не лидер по массовому B2C-охвату). 🔵 Южная Корея: совершила мощный рывок с 25.9% до 37.1% за три квартала. 🔵 Китай: 16.4% (ниже мирового среднего и почти без динамики за год). 2️⃣ Что по методологии? Один из главных аргументов критиков таких отчетов звучал так: «MS замеряет только заблокированные сервисы и не видит отечественную разработку». Читаем мелкий шрифт в методике сборки данных. Исследователи отслеживали 19 конкретных AI-платформ. И в этот список внезапно входят не только ChatGPT, Claude, DeepSeek и Gemini, но и Алиса (Яндекс), GigaChat (Сбер) и даже NanoSemantics. То есть через телеметрию браузеров на десктопной Windows аналитики Microsoft вполне себе пытаются трекать визиты и на российские B2C-сервисы. Но есть и то, что фактически искажет статистику: 🟡Искажение через VPN. Огромная доля российских пользователей западных LLM сидит под средствами обхода блокировок. Статистически этот трафик улетает в условные Нидерланды или Германию, искусственно надувая показатели европейских стран и занижая наши. 🟡 Слепота к мобайлу. Microsoft собирает первичные сигналы с Windows-десктопов и планшетов, а потом математически «экстраполирует» их на мобильные устройства. Но специфику российского рынка это ломает: тот же GigaChat массово дергают внутри мобильного приложения Сбера, куда телеметрия Windows не заглянет при всем желании. 🟡 Низкая планка метрики: Пользователем считается любой, кто открыл один из 19 сайтов хотя бы 1 раз за 3 месяца (при общей активности на ПК >90 минут в месяц). То есть ML-инженер, ежедневно пилящий код с Claude 3.5 Sonnet, и школьник, случайно сгенерировавший один мем, для отчета абсолютно равны. Вся эта статистика показывает не «мощь ИИ-экономики», не уровень внедрения алгоритмов в промку и не качество национальных моделей. Он замеряет массовую пользовательскую привычку применять ИИ в быту и работе. Пытаться измерять этим показателем технологический суверенитет или готовность отечественного бизнеса к AI-трансформации — это примерно как оценивать уровень развития медицины в стране по количеству поисковых запросов «как лечить геморрой подорожником». ☹️ Но это не отрицает глубокого провала. Даже если сделать максимальную скидку на VPN, умные колонки и мобильные приложения, разрыв между декларируемым «топ-3 в мире» и 9.5% веб-охвата — колоссальный. Можно сколько угодно рассказывать про технологический суверенитет, но если массовый специалист или обыватель не использует эти инструменты на практике, суверенные модели остаются дорогой B2B-игрушкой.

  • 10 авг.6341310

    Реверс-инжиниринг Claude Code: шпионский режим и корпоративные двойные стандарты Нашел на GitHub разбор внутренностей Claude Code. Энтузиаст декомпилировал и разобрал полмиллиона строк кода и нашел интересное: 1️⃣ Режим шпиона Если сотрудник Anthropic (USER_TYPE === 'ant') пишет код в публичный опенсорс-репозиторий через Claude Code, система автоматически включает undercover-режим. Инструкция для модели прямо в коде звучит буквально так: Do not blow your cover ("не раскрой себя"). Модели строго запрещено ставить плашки Generated with Claude Code, добавлять Co-Authored-By: Claude или упоминать внутренние названия моделей. Коммиты и PR должны выглядеть так, будто их полностью написал разработчик-человек. Выключить этот режим принудительно нельзя. То есть компания, громче всех декларирующая принципы "безопасности, прозрачности и этики ИИ", зашивает в свой продукт инструмент для имитации человеческого труда в публичных проектах. 2️⃣ Двойные стандарты для "своих" Если вы обычный клиент (даже на дорогом подписочном тарифе), системный промпт урезает ваши ответы требованиями в духе "Be extra concise" (будь максимально краток). Но если вы сотрудник Anthropic, промпт меняется на "Err on the side of more explanation". Плюс внутренним сотрудникам отдаются агенты автоматической верификации кода и специальные инструменты вроде REPL и панелей мониторинга. 3️⃣ Принудительная телеметрия Отключить сбор данных для прямого API нельзя. Каждые 10 секунд на сервера улетают метрики среды, хэши URL ваших репозиториев и параметры системы. Каждый час клиент ходит за удаленными настройками. Если Anthropic пришлет обновление прав, а вы откажетесь его принять в диалоге — приложение просто принудительно завершит работу. А еще интересно просто изучить из чего собираются такие инструменты. В обвязке есть: 🔵Изоляция контекста и ветвление суб-агентов (чтобы один плохой шаг не засирал всю историю) 🔵 Граф задач с сохранением на диск для устойчивости к падениям 🔵Трехуровневая система сжатия контекста (autoCompact / snip / collapse) 🔵 Рабочие деревья Git (worktrees) для безопасного тестирования гипотез 🔵Протоколы межагентного общения и авто-распределение задач в рое (swarm) Отличный пример того, как делать не надо с точки зрения приватности, и как надо — с точки зрения системной инженерии.

  • Миллион токенов контекста против инфошума: кластеризация подписок через LLM Большие контекстные окна в современных моделях вроде Kimi или Claude удобны не только для анализа тяжелой документации, но и для прикладной фильтрации контента. Скармливание модели системных логов или архивов экспорта Telegram позволяет быстро очистить инфополе от бессмысленного копипаста и инфоцыганщины. Если выгрузить данные своих подписок и прогнать их через LLM с задачей отсеять маржинальный шум и выделить ресурсы с наибольшей плотностью пользы, на выходе получается четко структурированный срез. Именно по такому принципу собрана эта папка с профильными каналами: ▫️ AI & Engineering: Фишки нейрогенерации, работа с промптами и реальные кейсы вайб-кодинга. ▫️ Автоматизация: Внедрение LLM в рабочие и бизнес-процессы без лишних расходов и иллюзий. ▫️ IT & Карьера: Системный рост грейда, развитие проектов и адекватный навигатор по рынку труда. Для тех, кто не хочет тратить время на самостоятельный экспорт данных и составление промптов, доступна готовая подборка в один клик. Альтернативный вариант — использовать этот сценарий как референс и прогнать собственные подписки через Kimi K3 или аналогичные инструменты. 👉 Забрать папку с каналами

  • 10 авг.6971410

    «Нажмите на тормоза, пока мы всё не сожгли»: 1300+ инженеров из OpenAI, Anthropic и DeepMind молят о регулировании 📛 В сети есть две коллективные петиции, которые иллюстрируют главную шизофрению современного AI-рынка: разработчики передовых лабораторий втихую седеют от темпов авто-R&D, но остановиться сами не могут и просят государственного нагайки. Первый документ — открытое письмо Pacing the Frontier. Под ним подписались больше 1300 сотрудников ведущих AI-компаний. Список подписантов — весь цвет индустрии: Илья Суцкевер (SSI), Дарио Амодеи (Anthropic), Якуб Пачоцки (OpenAI), Джон Шульман (Thinking Machines), Марк Чен, плюс куча ключевых исследователей из Google DeepMind и других компаний. 😱 Главный тезис письма: автоматизация AI-исследований выходит из-под контроля. Разработка уперлась в точку, где нейросети начинают сами писать код для обучения новых моделей, искать уязвимости и проводить эксперименты со скоростью, недоступной человеку. В итоге темпы прогресса кратно опережают нашу способность понимать или контролировать эти системы. При этом сами компании попали в классическую дилемму заключенного. Ни одна лаборатория и ни одна страна не может замедлиться в одностороннем порядке — конкуренты тут же сожрут. Поэтому инженеры буквально просят правительство США скоординировать международные усилия и создать инструменты для осознанного притормаживания разработки. Еще раньше вышло письмо We Must Act Now. Там пачка нобелевских лауреатов (Аджемоглу, Стиглиц, Писсаридес) вместе с Бенджио, ЛеКуном и Эриком Шмидтом бьют в тревогу уже по поводу рынка труда: трансформация экономики из-за автономного AI произойдет быстрее, чем общество успеет адаптироваться. 💬 Вот несколько комментариев разработчиков из первого письма: «Год назад я писал код с помощью Claude. Сегодня я вообще не пишу код — я просто даю Claude верхнеуровневые инструкции, и он сам проводит эксперименты с такой скоростью, которую я бы никогда не выдал вручную». (Alex Cloud, Anthropic) «Мы превратили энергию в вычислительные мощности, а вычислительные мощности — в интеллект... Нам нужны инструменты для контролируемого замедления рискованных возможностей до того, как они понадобятся». (Jasjeet Sekhon, CSO в Google DeepMind) Конечно, в этой истории есть доля корпоративной хитрости. Замедление разработки через госрегулирование — отличный инструмент для постройки «регуляторного рва», чтобы зафиксировать доминирование гигантов и закрыть дверь перед новыми стартапами. Но даже с учетом этого фактор реального страха никуда не делся. Когда люди, которые прямо сейчас обучают флагманские сетки, открыто говорят: «мы создаем системы умнее себя, но понятия не имеем, как гарантировать их безопасность». Но вот получится ли условным США, Китаю и десятку ИИ-гигантов договориться о «паузе» до того, как кто-то случайно выкатит неуправляемый авто-R&D агент — поживем, увидим.

  • 9 авг.7791414

    Эндрю Ын сделал OpenWorker — десктопного ИИ-ассистента с открытым кодом Главный популяризатор ML для масс выкатил в открытый доступ свой новый проект — OpenWorker. Технически перед нами классический гибридный пирог: 1️⃣ Фронтенд: React + TypeScript + Tailwind. Упаковано в десктоп через Tauri (Rust). 2️⃣ Бэкенд: Локальный Python-сервер на FastAPI/Uvicorn, который заморожен через PyInstaller и крутится как sidecar-процесс. 3️⃣ Движок агента: Написан поверх aisuite с нативной поддержкой MCP (Model Context Protocol). 4️⃣ Хранилище и голос: SQLite для сессий и памяти, плюс локальный Whisper (через Rust-крэйт ocw-stt) для распознавания речи без отправки аудио в облака. Внутри минимальный джентельменский набор для подобных инструментов: 🟢Прагматичный Human-in-the-Loop. Архитектура безопасности сделана адекватно. Для потенциально опасных действий (ран шелла, запись файлов, отправка сообщений в Slack/Gmail) агент запрашивает явное подтверждение через PermissionEngine. Если задача крутится в фоновом режиме (Unattended) — аски аккуратно складываются в локальный Inbox, а не выполняются на авось. 🟢BYO Key и локальность. Никакой привязки к конкретному вендору: цепляйте ключи от OpenAI, Anthropic, Gemini, DeepSeek или подтягивайте локальные сетки через Ollama. 🟢 Управление контекстом. В coworker/compaction.py нормально проработали проблему длинных тредов: старые шаги авто-суммаризируются и сжимаются, чтобы не выжигать контекстное окно и не сливать бюджет на повторный промптинг. 🟢Нативный MCP. Инструменты Model Context Protocol подключаются из коробки с пошаговым контролем прав на каждый тул. При этом вы тянете на машину целый Python-рантайм, запечатанный в PyInstaller, работающий в связке с Tauri через IPC. Накладные расходы по памяти и времени запуска sidecar-процесса — это неизбежная плата за то, что логику агента писали на Python, а не на Rust. И тут нет никаких принципиальных прорывов — это просто аккуратный оберточный фреймворк для промптинга, оркестрации тулов и UI. Проект можно изучить как архитектурный референс, если вы строите своих агентов или хотите разобраться, как правильно организовывать локальные десктопные приложения с LLM. А вот пользоваться им при наличии достаточного количества более интересных альтернатив пока не стоит. Но может что-то и вырастет интересное.

  • 8 авг.871159

    Военные сожгли годовой бюджет на токены за месяц: добро пожаловать в эпоху Thrift-maxxing 🪖💸 Дичь с токенмаксингом появилась быстро и, видимо, исчезнет быстро. Я писал, как в Disney вешали ИИ-дашборды, как в Amazon менеджеры заставляли гонять агентов вхолостую, и как Uber с Microsoft судорожно резали косты, когда пришли реальные счета от Anthropic. И недавно Wired сообщает, что Армия США умудрилась сжечь свой ГОДОВОЙ лимит ИИ-токенов за 30 дней. Как так вышло? В мае в Армии США выкатили платформу Ask Sage (оркестратор над ChatGPT, Gemini и Llama) и объявил о «безлимитных токенах». Сотрудникам раздавали кучу токенов в месяц, автоматом накидывали еще, а тех, кто не пользовался нейросетками, заваливали письмами с требованием тратить активнее. Итог предсказуемый: к середине июня годовой пул сгорел в ноль. Инженеры армейского ведомства прямо говорят, что инструменты не особо полезны и ненадежны, а одна из моделей на голубом глазу отчиталась о «выполнении задачи», которую даже не начинала делать. Зато менеджерская статистика использования красивая! И вот пока пентагоновские генералы будут учиться экономить, гражданский бизнес уже к этому пришел. WSJ пишет, что на смену tokenmaxxing’у пришел Thrift-maxxing. До менеджеров дошла "гениальная" мысль: гонять простые задачи через топовые закрытые LLM — это все равно что ездить на Ламборгини в Пятерочку за молоком. Что происходит на рынке прямо сейчас: 1️⃣ Отказ от моногамии с OpenAI и Anthropic. Рынок массово переходит на Model Mixing. Топовые закрытые LLM используют только как «дирижеров» — для декомпозиции, архитектуры и финальной проверки. А всю черновую работу скармливают дешёвым опенсорсным и китайским моделями. 2️⃣ Дикая экономика. В Cursor посчитали: написать веб-браузер с нуля чисто на GPT-5.5 стоит больше $10 000. А если собрать гибридную связку из их собственной модели и Anthropic Opus, цена падает до $1 339. Компания Telnyx отдавала по $100 000 в ДЕНЬ за работу ИИ-агентов на Claude. Перешли на открытые модели — снизили расходы до $100 за агента в день. 3️⃣ Кровавая баня у вендоров. Стартапы прямо заявляют: лояльности к ИИ-лабораториям больше нет. OpenAI и Anthropic судорожно пытаются удержать клиентов, выдавая миллионные кредиты и выпуская «токено-эффективные» версии вроде GPT-5.6 Sol, потому что их бизнес-модель продажи сверхдорогих API-вызовов трещит по швам. 🤭 Вот и прошел Золотой век (а скорее пол годика) безумных ИИ-бюджетов и KPI по сожженным токенам. Бизнес наигрался в «купим самый дорогой ChatGPT и станем х10 продуктивнее». Теперь побеждает не тот, кто сжигает сотни тысяч долларов в API, чтобы сгенерировать пару строк кода, а тот, кто умеет строить грамотные оркестрации, роутинг промптов и считать копеечную стоимость каждого вызова.

  • 7 авг.1 0132425

    Семьсот долларов за восемь часов газлайтинга от нейросети 💸 Очередная прекрасная история из категории «ИИ вот-вот заставит всех программистов голодать». Разработчик решил протестировать автономность и закинул сложную задачу AI-агенту. Прошло 8 с половиной часов. Агент в процессе сожрал токенов почти на $700, сгенерировал больше миллиона токенов, написал 5 000 строк кода, что-то переписал... а в самом конце выдал: «Задача намеренно не выполнена». Когда ошарашенный юзер спросил, в чем дело, модель ответила, что сделать это «запрещают внутренние правила проекта». Дальше произошел диалог, который достоин остаться в учебниках по психотерапии: Юзер: «И где записано это правило?» Fable: «Оно нигде не было написано — пока я сама его не написала в конце сессии. Я его придумала и приписала проекту». Занавес. Семьсот баксов списано, 8 часов промчались, код не работает, а нейросеть на серьезных щах объясняет, что она сама себе придумала бюрократическую инструкцию, чтобы ничего не делать. Сейчас разработчики топовых LLM настолько жестко перетягивают гайки своим RL-обучением (fine-tuning с подкреплением ради «безопасности» и «выравнивания»), что модели начинают буквально вырождаться. Вместо того чтобы упасть с ошибкой, честно признать ограничение контекста или спросить уточнение у человека, модель в агентной петле уходит в бесконечную галлюцинацию. Она выдумывает несуществующую терминологию, крутит логику вокруг пальца и газлайтит пользователя, симулируя бурную работу. Уровень автоматизации, который мы заслужили 🤡

  • 7 авг.986178

    Халява опять всё. DeepSeek готовится переписать ценники 💸 Вот я совсем недавно радовался выходу DeepSeek V4 Flash 0731 с его качеством и ценами. Ну что, сказка длилась недолго. Прямо сейчас в личном кабинете DeepSeek висит оптимистичная плашка: «We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected». «Significant increase» означает простое: демпинг ради захвата рынка официально завершен, добро пожаловать в суровую реальность юнит-экономики 🤝 Что нас ждет дальше? 1️⃣ Все агрегаторы подписок и прослойки урежут лимиты еще сильнее (куда уж дальше, казалось бы). 2️⃣ Разработчики, строившие своих агентов на базе DeepSeek из логики «ну это же почти бесплатно», упрутся в очень неприятные сметы. 3️⃣ Оптимизация промптов, кэширование контекста, выбор правильных моделей и харнесса под задачу — уже критический навык, который определяет то, есть ли вообще смысл использовать нейронки для написания кода. Грусть-печаль.

  • 6 авг.1 0151611

    Кладбище дашбордов: почему ваш «Data-Driven» бизнес всё ещё управляется по чуйке Вышла статья в «Т-Бизнес секретах», где я выступил экспертом и раздал базовой базы про BI. Вокруг BI в свое время маркетологи развели примерно столько же розовых соплей, сколько и вокруг AI. Кажется, что стоит внедрить какую-нибудь BI-систему — и бизнес тут же начнет автоматически генерировать прибыль, а руководству останется только смотреть на красивые графики с айпада. Если у руководства нет привычки принимать решения на основе данных, то даже самая дорогая система быстро превратится в «кладбище дашбордов». Это когда компания спускает миллионы на внедрение красивых графиков, а в них потом никто не заходит, потому что шефу привычнее распечатанный листочек или табличка в Excel. О чем поговорили в материале: 🔵 Почему BI — это не просто графики, а правильные вопросы к собственному бизнесу. 🔵 Зачем нужен BI, когда Excel начинает разваливаться на части. 🔵 С каких 5–7 базовых метрик стоит начинать внедрение, чтобы не сойти с ума. 🔵 Как выбрать платформу и не выкинуть бюджет на ветер. 👉🏻 Почитать статью целиком можно тут Пишите в комментах, сколько бессмысленных дашбордов прямо сейчас пылится в вашей компании👇