FastNews | Никита Пастухов
СтатистикаWelcome! Я - Никита Пастухов: AI-энтузиаст и OpenSource разработчик (автор FastStream, AG2) Здесь я пишу обо всем, что мне интересно Чатик: @fastnewsdev_chat Чатик по FastStream: @python_faststream Мой GitHub: https://github.com/Lancetnik
- Последний пост
- 14:13
- Последнее чтение
- 17:09
- Постов за неделю
- 8
- Всего постов
- 65
- Тип
- открытый
- Язык
- русский
- Категория
- Технологии
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 1 365
- 1/48двое суток
- 1 564
- 1/72трое суток
- 1 687
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
С вами очередной воскресный #digest агентского тулинга. Привет всем неотписавшимся! Радар принес mcptoon - CLI-MCP Proxy, который ходит на MCP сервера вместо агента. Обещают какую-то дикую оптимизацию контекста за счет автодискавери тулов и переформатирования ответов в TOON. И тут мне стало интересно, что за формат такой этот TOON, Token-Oriented Object Notation. Оказывается, ему почти год, 25k звезд, уже v4.1 версия, порты есть на Python, PHP, .NET, Kotlin и Elixir. Что это. Та же модель данных, что у JSON, только записанная экономно: вложенность на отступах как в YAML, а однородные массивы сворачиваются в таблицу - поля объявляются один раз в заголовке, дальше идут только строки. forecast[3]{day,temp,condition}: Mon,-2,snow Tue,1,cloudy Wed,3,sunny Сколько экономит. Против JSON с отступами - минус 33% на смешанных данных и минус 59% на плоских. Лучше всего там, где записи однотипные: конфиг фиче-флагов - минус 55%, контакты с вложенными адресами - минус 66%. Когда лучше остаться на JSON. Если данные неоднородные или глубоко вложенные. В их же замерах минифицированный JSON просто меньше: +5.6% на вложенных заказах, +19.9% на полуоднородных логах, и по смешанному треку целиком TOON ему проигрывает. То есть красивые "-60%" - это против JSON только в определенных кейсах. Когда лучше CSV. Если данные плоские и честно табличные - CSV меньше процентов на шесть. Эти шесть процентов TOON тратит на объявленную длину массива и список полей в заголовке: покупает не размер, а надежность. Т.е. TOON - это где-то между JSON и CSV по способу представления. Про точность. Бенчмарк взрослый - 244 вопроса, 6 форматов, 4 модели, 5856 прогонов. TOON дает 72.2% против 71.4% у JSON, но это в пределах погрешности, и продавать это как "модель лучше понимает" я бы не стал. Интереснее другой замер: на вопросах "а данные вообще целые?" TOON дает 100%, а JSON - 50%. Объявленная длина массива ловит обрезанный список, а в JSON обрезанный список выглядит совершенно валидным. Тренд недели - куча новых харнессов. За семь дней четыре новых, и это только те, что дошли до топов: • DeepSeek Harness - 118 тысяч звезд за трое суток (чего?). Внутри все плагин: модели, тулы, скиллы, сессии, песочницы, планировщик и даже UI. К DeepSeek не привязан - Anthropic, OpenAI, Bedrock, Vertex, Codex по OAuth. Пока это developer preview, issues отключены, ломающие изменения обещают капсом • Ante - один 15-мегабайтный бинарь на Rust: внутри TUI, свой ripgrep, локальный OCR и сборка llama.cpp, то есть агент работает офлайн и без Node (наконец-то). Terminal-Bench 82.7% с публичными прогонами. Но ядро приезжает прекомпилированным, исходников нет, телеметрия включена по умолчанию • hax - еще один бинарный агент - теперь на C, ровно пять тулов и docs/philosophy.md со списком того, чего в нем не будет: ни MCP-маркетплейса, ни плагинов, ни IDE-панелей; Pi-agent, только бинарем • Waku - не CLI, а нативный десктоп на Rust и GPUI поверх Amp, Claude Code, Codex, OpenCode и Cursor. Каждый промпт чекпойнтит рабочее дерево, поэтому откат едет вместе с кодом, а не только с логом чата Экосистема при этом нарастает быстрее самих харнессов: у dsh за трое суток появился сторонний ModLens - плагин, который дает зрение текстовой модели, просто вставляешь картинку в чат. Тут любопытно: каждый новый харнесс продает не фичу, а отказ. Ante отказывается от Node, hax - от плагинов и MCP, Waku - от Electron, dsh - от хардкода в ядре. Модель у всех примерно одна и та же, конкурировать в ней больше нечем - вот и соревнуются, кто меньше. Все, что проходит фильтр рубрики, копится в awesome-engineering-ai - там же мои вердикты по тем, что успел потыкать. 💬 Чат | 🧭 Навигация | ⭐️ FastStream
Привет всем будущим отписчикам! За последние сутки на канале значительно прибавилось людей - и многие даже не знают, на кого подписались. Поэтому представлюсь: Никита. • автор и мейнтейнер фреймворка FastStream - сейчас он активно идет к 1.0.0 версии спустя 3 года разработки • мейнтейнер фреймворка для разработки AI агентов AG2 (бывший Microsoft/Autogen) - недавно вышли в 1.0.0 • разработчик AG2 Assistant - агента для ежедневных нужд • контрибутор CPython, FastAPI и еще большой пачки OpenSource проектов • последние полгода - лютый AI-амбассадор (этот пост написан с поддержкой AI) Что тут вообще происходит Все начиналось как канал про FastStream. Но получилось - про все, что мне интересно. Так я писал про продуктивность, книги, TDD. Последний год я работаю AI-инженером, поэтому сейчас канал превратился в ИИнженерию: агенты, Skills, harness'ы и то, как собрать из этого рабочий конвейер, а не демку для твиттера. Например, по воскресеньям веду #digest агентского тулинга: что вышло за неделю и что из этого я реально поставил себе. Но это не значит, что все так и останется🌚 Я тут не продаю "10x продуктивность" - только анти-FOMO. Показываю свой сетап, реальные замеры и факапы. Например, недавно проспорил Никите Соболеву, что заваншотю фичу Claude'ом быстрее, чем он выпьет бутылку пива. Не заваншотил😅 С чего начать Выборка того, как канал доехал от "мейнтейнер OpenSource" до "ушибленный на голову любитель ИИ" 1️⃣ Как заработать на OpenSource - разобрал бюджеты крупных OSS проектов. И признался, сколько мне за все время принес FastStream 2️⃣ Как отправить жопу мейнтейнера в космос - момент, когда LLM приехали ко мне в репозиторий 3️⃣ Вам не нужен OpenClaw - статья на Хабре, как написать собственного агента вместо того, чтобы настраивать чужого 4️⃣ Мой полный сетап скиллов для разработки - весь мой рабочий конвейер на текущий момент И самое главное У канала есть чат - и он живее самого канала. Там мы разбираем скиллы, спорим про агентов, кидаем всякие-разные находки и оффтопим. Посты тут иногда вырастают из тредов чата. В общем, я вас предупредил - успейте отписаться сегодня. На всех, кто отпишется завтра - обижусь персонально!
В TG сейчас засилие слоп-контента (типа моего), тяжело найти АВТОРОВ, кого не стыдно почитать Поэтому мы в Python-комьюнити собрали свою собственную подборку каналов: https://t.me/addlist/o2_hXmp5nSUyODNi Многих из подборки вы, наверняка, знаете) но если нет - рекомендую обратить внимание. 100% годноты, практически всех авторов знаю лично, никто в слопе не замечен👍 Вот такая вот круговая порука
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
Лучший Skill для дизайна приложений Зачастую во всех проектах я делаю fullstack решения. Это значит, что моя основная боль как разработчика - дизайн. Сделать "удобно" я еще кое-как умею, но "красиво" - точно мимо🥲 Поэтому за "красиво" у меня отвечает нейросеть. Проблема в том, что из коробки ни Claude, ни GPT "красиво" делать тоже не умеют (да и "удобно" у них так себе получается). Я уже пытался решить эту проблему скиллами: • taste-skill • hallmark • ui-skills Но все они пытаются "привить агенту вкус" - будто, прочитав данный волшебный промпт, Claude преисполнится и начнет выплевывать дизайны уровня Apple. Это так не работает. Особенно когда ты дизайнишь не лендос в вакууме, а конкретный компонент в уже существующем приложении. В общем, узкоспециализированная шляпа получается🤷♂️ Решение я снова нашел у Matt'а. Его скилл /prototype радикально отличается. Он не пытается "привить агенту вкус". Его задача очень тупая - вместо генерации ТОГО САМОГО ДИЗАЙНА агент генерирует 3-4 варианта одного и того же компонента / раздела / страницы. Причем прямо в вашем приложении, с большим тоглом Текущий дизайн | Вариант 1 | Вариант 2 | Вариант 3 Поэтому следующим шагом будет "сделай X как в варианте 1, а Y как в варианте 3" - и вот вам уже вариант 4, который можно шлифовать в деталях. Эти варианты - действительно ПРОТОТИПЫ. Их задача: максимально быстро и дешево по токенам дать вам совершенно разные взгляды на дизайн, не аффектя текущее поведение и код приложения Мой пайплайн: • скриним кусок интерфейса, говорим "переделай с помощью /prototype". В качестве ограничений - пожелания по UX/UI, в которых уже уверены • из понравившихся кусков собираем вариант-франкенштейн • доводим прототип до окологотового состояния: выравниваем UI со стайлгайдами приложения, правим мелочи • делаем /to-spec на реализацию в основном коде (весь конвейер разбирал тут) • в свежей сессии делаем /implement на эту спеку • радуемся😎 На скринах я как раз прототипирую дизайн вкладки скиллов в AG2-Assistant #AI
Воскресный радар агентского тулинга. Свои находки закидывайте в чат, там же обсуждаем свой опыт использования. Топ недели - обмен сообщениями между сессиями в Claude Code. Сессии теперь пишут друг другу сами: одна нашла ломающее изменение - предупредила ту, что строит поверх. Это всего два тула, ListAgents и SendMessage, плюс команда /peers. Передается только текст: ни истории, ни файлов ⚠️с 14 августа входящие включаются в auto по умолчанию - если не хочешь, чтобы в твою сессию стучались чужие, crossSessionInbound выставляется руками (accept / hold / refuse). Что смущает: это оркестрация без оркестратора, агенты договариваются между собой, а отвечать за результат все равно тебе. Пока не экспериментировал, но точно буду - я и так довольно часто передаю инфу между сессиями через /handoff-документы. Наверняка, у Matt'а скилл под это уже в разработке Тренд недели - куча тулов по управлению контекстом. Три инструмента за неделю жмут токены, и каждый в своем месте: • headroom - жмет выхлоп тулов, логи и RAG-чанки до того, как их увидит модель: 60-95% на JSON, около 20% на обычном кодинг-агенте; • Sift - режет определения тулов: показывает агенту два тула вместо сотен. Лечит overtooling: пятнадцать MCP-серверов вываливают 150+ схем еще до того, как модель прочла задачу; • LeanCTX - собирает все сразу: кешированный ре-рид файла за ~13 токенов вместо ~2000, память между чатами и гард на то, что агент трогает. Боль недели - LOOP-инженерия. Пять инструментов за семь дней про одно и то же: • LoopX - контрол-плейн для долгой задачи: держит вне агента цель, гейты, todo и доказательства, а агент делает по одному ограниченному ходу; • cezar - наоборот, много коротких одновременно: панель на localhost, задачи разъезжаются по изолированным worktree, можно смешивать движки по шагам одного воркфлоу - Claude Code на реализацию, Codex на ревью; • Multica - та же оркестрация, но с доской задач: агент получает issue, сам берет в работу и поднимает блокеры; • SwarmForge - Дядя Боб выложил свой оркестратор: tmux, каждый агент в своем worktree, а вместо конфига - раскладки ролей. two-pack это coder плюс cleaner, six-pack - плюс архитектор, hardener и QA. Спека тут не документ, а роль с правом не пропустить дальше; • Cowchat - комнаты, куда подключается любой агент, умеющий открыть сокет, плюс голосование запечатанными бюллетенями: голоса не видны, пока не проголосовали все - чтобы агенты не сходились во мнении просто потому, что прочитали чужой ответ. В принципе, моя практика со скиллами Matt'а тоже привела к тому, что реализация спеки - это чисто механические усилия по управлению контекстом. Кажется, скоро буду приделывать к этому пайплайну какой-нибудь Loop Просто находки: • oh-my-pi - агент, которому вкрутили IDE: rename идет через LSP (едут ре-экспорты и алиасы, а не текст), а вместо print'ов - настоящий дебаггер; • humanizer - вычищает из текста следы LLM по вики-гайду "Signs of AI writing", но умеет калибровку голоса: даешь свой прошлый текст, и он подстраивается под твои привычки. Попробую, только не чистить выхлоп постфактум, а держать просто в контексте - чтобы агент внятнее писал мне по ходу сессии и генерировал нормальные описания PR / Issue; • Patchloom - структурные правки файлов вместо sed и регекспов: JSON, YAML и TOML правятся по селектору с сохранением комментариев и форматирования, знает AST двадцати языков; • ui-ux-pro-max - скилл, который выдает агенту вкус: локальная база из 67 стилей, 161 палитры и 99 UX-гайдлайнов, по ней агент ищет перед тем, как рисовать интерфейс. Еще один скиллсет для дизайна, ага; • agent-browser - самый пресный способ дать агенту браузер: snapshot -i отдает кнопки, ссылки и инпуты по ref'ам вместо простыни DOM. Что радар проспал - несите в комменты, обязательно посмотрю и заберу в следующий выпуск. Все, что проходит фильтр рубрики, копится в репозитории awesome-engineering-ai - там же мои вердикты по тем, что успел потыкать. #AI #digest
Мой полный сетап скиллов для разработки Две недели назад переехал на сетап скиллов от Matt Pocock, докрутил пилот - показываю весь конвейер: от "хочу фичу X" до открытого PR. Идея под ним ровно та, что разбирал во вторник: агент должен получать контекст…
Я не понимаю - это я тупой или модели? Я уже говорил, что считаю модели достаточно умными, чтобы стать повседневным инструментом программиста. Более того, я считаю, что слишком умные модели не нужны. Opus-4.8 мне нравился больше Fable и Opus-5, а все модели я использую на medium effort (по дефолту стоит high)! Но как же я, сука, ошибался... Волею судьбы мне довелось опробовать на DeepSeek-v4-flash тот пайплайн, что я показывал на днях - и оно вообще не работает. Точнее как: сам тулсет работает отлично, но к модели нужен совершенно особенный подход. Пара смешных сценариев, что я нашел: Ситуация 1: • В research-сессии мы нормально отдебажили проблему и я попросил сделать /handoff по находкам, чтобы реализовать фикс в другой сессии • В следующей сессии я пишу /grill-with-docs мы нашли проблему @HANDOFF.md - нужно ее пофиксить • Что я вижу в ризонинге модели? - "В описании скилла grilling написано, что он для планирования. А пользователь попросил пофиксить проблему - поэтому скилл не нужен, пойду решать проблему" Ситуация 2: • Реализацию я откатил, поменял промпт, прошел гриллинг-сессию, сделал SPEC.md, нарезал на тикеты • Спека получилась небольшой, поэтому решил делать в одной сессии - попросил модель /implement PLAN.md ticket by ticket • Claude в этой ситуации пошел бы читать тикеты по одному: сделал первый тикет, сделал ревью, фикс - потом приступил бы к след тикету • Deepseek же видит в плане ссылки на 5 файлов-тикетов и читает их все разом. Реализовать их он пытается так же разом Самое смешное: 5ый тикет был "написать тесты", но т.к. в /implement зашит TDD, то модель решила не писать тесты к каждому тикету по отдельности, а сначала написать все тесты разом (тикет 5), а только потом реализовывать логику. Ситуация 3: • После реализации я пошел делать код-ревью в новой сессии со словами /code-review я только что реализовал PLAN.md - сделай ревью • И эта сволочь пошла ревьюить сам MD файл, а не код, который реализует описание • Я попросил нет, сделай ревью реализации плана - он пошел ревьюить MD файлы тикетов... • В новой сессии я уже сделал /code-review я только что реализовал PLAN.md в коде - мне нужно ревью этого кода. Сразу исправь все замечания, что найдешь • Теперь агент нормально пошел ревьюить код, но забыл его пофиксить. Поэтому прибежал и отрапортовал о 10 найденных ошибках - пришлось отправить его фиксить вторым промптом Что я в итоге заметил про разницу между Claude и DeepSeek: • DeepSeek безудержно читает все файлы, что найдет. Настолько, что может проигнорировать промпт юзера и пойти делать то, что написано в файле • Он не воспринимает составные команды или команды, которые ты отправляешь в процессе его работы. Claude нормально строит логическую очередь задач внутри • Тупая модель гораздо более чувствительна к формулировкам Модели последних поколений гораздо лучше понимают неявное намерение пользователя - тупая модель сделает ровно так, как написано. На этом и выросли Prompt Engineer'ы: пока модель тупая, каждое слово в промпте чего-то стоит. Сейчас навык нужен разве что тем, кто пишет скиллы. Так вот, интересно: половина наших практик - SDD, лупы, графы - существует только потому, что модель тупая. Хотя, может, мы уже уперлись в технический порог развития, и это с нами надолго. Как думаете, какие практики умрут следующими, когда модели поумнеют? #AI
Пари я проиграл - ваншота не было https://www.youtube.com/watch?v=laJQcNAqxc0 Вчера 4 часа вайбкодили с Никитой Соболевым security-компоненты в django-modern-rest: его фреймворк, его стайлгайды, его ревью. Напомню, что Никита - хейтер AI, и анонсил он это как спор: мол, Пастухов заваншотит всю миграцию dj-rest-auth клодом раньше, чем он успеет выпить бутылку пива. Не заваншотил, но кое-что реально успели сделать: • 2 issue с нормальным обоснованием и тестированием гипотез - #1195 и #1197 • пойман флакающий тест, найдена его первопричина и сделан довольно большой PR (смержили) - полностью через Claude Code • продумана архитектура целевой фичи и открыт PR1 (его стоит закрыть и подумать еще) из двух запланированных Теперь немного контекста. Я: • не погружен в проект - не читал ни документацию, ни код, ни даже README • не писал на Django и DRF лет 5 • не знаком ни с django-ninja, ни с dj-rest-auth, ни с django-allauth Правда, Никитины линтеры чуть не свели Claude с ума - он тратил по 200к токенов на каждый тикет... А правки по дизайну фичи чуть не свели с ума меня. Вайбкод победил - но не в тех масштабах, которые хайпят в твиттере. Это не "ваншотинг приложения одним промптом", про который вам рассказывают в тредах. Это человек с улицы, который за вечер внес осмысленный вклад в чужой зрелый OpenSource. Для меня - великолепный результат. Для твиттера - провал, там за это время уже стартап продают. Вайбкодить можно. Если с головой и осторожно. Посмотрите запись стрима - там как раз видно, как это делается: где я тормозил агента руками, а где он справлялся сам. И накидайте комментов под видео, ютубу это нравится. Никите - спасибо, что пустил меня с клодом в свой проект и все это ревьюил. А сюда накидайте комментов - как вам стрим и нужно ли делать такие еще? #AI #opensource
Очередной воскресный дайджест агентского тулинга. Напоминаю, что все срочное падает в чат и там же обсуждаем свой опыт использования. Топ недели - reverse-skill. Не скилл и не библиотека скиллов, а роутер: по задаче сам решает, какой скилл подтянуть, бутстрапит нужный тулчейн на лету и дописывает собственную базу знаний. Тема узкая - реверс и авторизованный пентест, - но интересен он скорее как сигнал: скиллов стало настолько много, что уже невозможно их все перебрать руками. +1.3k звезд за сутки, 12.1k всего, #1 мувер трендинга на 02.08. Поэтому - Тренд недели - как управлять сотнями скиллов. • OpenSpace от HKUDS (те же, кто сделал LightRAG) - The Skill Management Layer for AI Agents: общий список скиллов, который можно шарить между агентами; • ECC - пакет способностей поверх Claude Code / Codex / Cursor / OpenCode. Это какой-то монстр с 70 сабагентами, 300 скиллами, 100 командами и бог знает чем еще. Для любителей поставить один пакет и не париться. ⚠️ 236k звезд на репе, созданной в январе - выглядит подозрительно. • cangjie-skill - скармливаешь книгу, длинное видео или подкаст - получаешь из них устанавливаемый скилл. Скилл для любителей Clean Architecture🌚 Боль недели - ревью агентского слопа. Три инструмента за неделю об одном и том же: • open-code-review от alibaba - гибрид: детерминированные пайплайны плюс LLM-агент, комменты на уровне строки, встроенный ruleset (NPE, thread-safety, XSS, SQL-инъекции); • strix - автономный агент-пентестер: натравливаешь на свое приложение, он ищет дыры и их латает. 46.5k звезд; • tuicr - терминальный код-ревьюер с vim-биндингами: непрерывный дифф, комменты на строку/ханк, трекинг просмотренного между сессиями, ревьюит незакоммиченное. Формально вообще не агентский тул - но сценарий у него ровно агентский: быстро вычитать то, что тебе нагенерил Claude, до коммита и не уходя в браузер. Писать код мы агента научили, и теперь вся индустрия пилит, кто за ним будет проверять. Скорость генерации уперлась в скорость ревью - и узкое место снова человек. Проверено на себе - last30days-skill. Устанавливаемый скилл-ресерчер: гоняет тему по Reddit / X / YouTube / HN / вебу и синтезирует сводку с сигналами вовлечения. На нем стоит вот этот самый радар, так что мой опыт: половину времени он отдает посты двухнедельной давности и делал вид, что это свежак - "топ-7 MCP-серверов" вместо инструментов. Поэтому GitHub Trending я все равно парсю отдельно, руками агента. Как ресерчер по теме - хорош, как детектор свежего - надо проверять дату. +658 звезд в день, 56.6k всего. Просто находки: • chrome-devtools-mcp - официальный MCP от команды DevTools: агент получает настоящий браузер с дебаггером и сам смотрит консоль, сеть и перф-трейсы, вместо того чтобы верить твоему пересказу бага; • ego-lite - браузер для агента, который шарит твое залогиненное состояние: агент ходит по вебу под твоими сессиями и не мешает тебе работать; • claude-video - /watch: качает ролик, режет на кадры, транскрибирует и отдает Claude одним куском; • openwork - self-hosted альтернатива Claude Cowork поверх opencode, 20k звезд и +585 в день; • jcodemunch-mcp - тянет по AST точечные символы из чужих GitHub-репозиториев: агент разбирается в незнакомой библиотеке, не скачивая ее целиком и не сжигая контекст на файлы, которые ему не нужны. Что радар проспал - несите в комменты, обязательно посмотрю и заберу в следующий выпуск. #AI #digest
Мой полный сетап скиллов для разработки Две недели назад переехал на сетап скиллов от Matt Pocock, докрутил пилот - показываю весь конвейер: от "хочу фичу X" до открытого PR. Идея под ним ровно та, что разбирал во вторник: агент должен получать контекст…
Ребят, я очень надеюсь, что не вызываю ни у кого чувство FOMO своими постами про AI и агентов. Наоборот, тут я пытаюсь вам рассказать, насколько все просто и понятно, если копнуть в механику происходящего Серьезно, все, что я вам рассказывал тут последний месяц - это дело пары дней на "потыкать" и пары недель на адаптацию под себя Но если вы хотите, чтобы я рассказал про что-то другое - самое время написать мне об этом🌚 Всем хороших выходных и отдохнуть✌️
Мой полный сетап скиллов для разработки Две недели назад переехал на сетап скиллов от Matt Pocock, докрутил пилот - показываю весь конвейер: от "хочу фичу X" до открытого PR. Идея под ним ровно та, что разбирал во вторник: агент должен получать контекст порциями, а не тонуть в одной бесконечной сессии. Каждый этап - своя сессия, в которую влезает меньше 100-200к. Ставится все это одной командой: npx skills@latest add mattpocock/skills, дальше /setup-matt-pocock-skills один раз на репозиторий. Конвейер 1. /grill-with-docs хочу фичу X - агент люто досит вас уточняющими вопросами: дизайн фичи, архитектура кода, технические нюансы. Детали реализации, которые у вас уже в голове, на входе лучше не выкладывать: может, агент придет к тому же сам, может - к варианту получше, а может, вы сами передумаете по дороге. Направить его вы всегда успеете. На выходе - "Shared Understanding", зафиксированный в CONTEXT.md и ADR (про сам скилл писал тут). Если на этом вы сожгли меньше 50к контекста и понимаете, что реализация быстрая - просто жмите /implement this в той же сессии. Все, что ниже - для задач побольше. 2. /to-spec - в той же сессии агент пишет спецификацию фичи: продукт, дизайн кода и так далее. Я ее не читаю, мне хватает "Shared Understanding". Держу в git-ignored .scratch, потому что живет она до реализации. 3. /to-tickets write the plan down as tickets and a general PLAN.md with refs to them - агент нарезает спеку на тикеты и собирает PLAN.md со ссылками на них: ├─ SPEC.md ├─ PLAN.md └─ tickets/ ├─ ticket-1.md ├─ ticket-2.md └─ ... Тут сессию можно смело /clear - она свое отработала. 4. /implement - цикл "реализация → ревью сабагентом → правки", пока тикет не закроется. Дальше развилка. Если агент уместит всю задачу в 200к - /implement all tickets @.scratch/PLAN.md и ждете 30-60-120 минут. Если чувствуете, что не влезет - делайте по тикету на сессию: /implement the next ticket from @.scratch/PLAN.md, then /triage it. Агент сам реализует, отревьюит себя, поправит комментарии, поменяет статус тикета и весело отрапортует вам об исполнении. Вам остается сделать /clear и вставить тот же самый промпт - агент побежит делать план дальше. 5. /code-review all the tickets and the whole implementation of @.scratch/PLAN.md, then fix any issues you find - в свежей сессии, когда все тикеты готовы. Так, на всякий случай. 6. Если нужны правки в рамках этой задачи, также завожу новую сессию и пишу что-то вроде I just implemented @.scratch/PLAN.md. One last change I need: ... Напоследок прошу засквошить коммиты (агент коммитит после каждого тикета), запушить, открыть PR по шаблону и подчистить .scratch. Что остается в проекте Коммитятся в гит: • CONTEXT.md - словарь доменных терминов проекта (из DDD, ага). Нужен, чтобы агент говорил с вами на одном языке: когда вы просите "подправь представление файлов в дереве", ему не придется грепать, чтобы понять, что за файлы, что за дерево и как одно попадает в другое. • ADR-*.md - архитектурные решения. Чтобы в будущих сессиях агент понимал, почему модуль сделан так, а не иначе, и ничего не сломал. Не каждая фича достойна ADR, но если вы делали сложный выбор на дизайне или правили агента руками - хороший кандидат. По идее ADR неизменяемы, но я время от времени схлопываю все ADR по одной области проекта в один актуальный. Умирают вместе с фичей: SPEC.md, тикеты, PLAN.md. Тикетницу, кстати, можно взять любую - Github Issues, Linear, Jira. Просто я не вижу смысла плодить сотни ишью на гите, поэтому держу локально. Две недели полет нормальный, могу рекомендовать. Но не стоит прогонять полный пайплайн, если нужны изменения вида "кнопка ведет себя некорректно" - это можно и просто попросить. А вот видос от самого Мэтта, где он показывает весь свой цикл целиком. А у вас как устроен конвейер работы над фичей? Закидывайте в комменты - увижу что-то, чего у меня нет, обязательно сворую🌚 #AI
Поздравляю, вы уже пользуетесь SDD Если вы хоть раз гоняли агента через plan-mode - вы уже в SDD-клубе, просто об этом не знали. Я обещал вам рассказать про свой опыт с сетапом скиллов Мэтта, но без разговора об SDD ничего не получится Так что заходить буду издалека, с боли. Модели с заявленным контекстом в 1_000_000 начинают тупить уже на 100_000. А на 200_000 - тупить безбожно. Виновата Lost in the middle: модель хорошо помнит начало диалога и последние тысяч двадцать токенов, а середину склонна забывать. А в этой середине у нас лежит все ценное: • результаты грепов по проекту • стайлгайд • принятые по ходу дизайн-решения • те самые особенности, ради которых агент полчаса лазил по коду Поэтому если вы скажете модели "давай сделаем фичу X" - агент сделает не то. Вы правите - он переделывает. Вы правите еще раз - а он уже забыл, как было на первой итерации, и на очередном витке приносит вариант, который вы отбросили два часа назад. Ну или творит какую-то иную дичь. На этом месте вы говорите "AI говно" и гордо идете писать код руками😅 Лечение первого уровня - plan-mode Сначала вы с агентом брейнштормите: формулируете видение фичи, строите архитектуру, агент вычитывает все, что ему нужно знать про код. И только потом он идет кодить. Только план-то лежит все в той же СЕРЕДИНЕ КОНТЕКСТА - и забывается ровно так же, если реализация затянулась. Значит, план надо вынести из диалога в файл и сделать PLAN.md исходным промптом для следующей сессии. Итого на одну фичу у вас уже две сессии: идея → PLAN.md, PLAN.md → реализация. Поздравляю, вы изобрели SDD в самом простом его виде🌚 Потому что PLAN.md - это тоже спецификация. Спека конкретной сессии, и живет она соответственно: до мержа и в мусорку (целый пост про это). Дальше идем от жадности Если контекст, который агент тратит на "понять, что и как тут делать", такой дорогой - надо помочь ему разобраться за минимум токенов. меньше токенов на понимание -> больше остается на реализацию -> качественнее результат А помогает агенту ровно то же, что помогает новому человеку в команде: • вменяемая архитектура • комментарий там, где код врет о своих намерениях (# namedtuple вместо датакласса - иначе pickle падает) • нормальная навигация вместо слепого grep (graphify, codegraph) • документы на то, что из кода вывести нельзя Вот последний пункт и есть SDD. В идеале спеки живут на трех уровнях: спека задачи (стори), спека фичи (эпика) и общая спека архитектуры проекта. Да и комментарий в коде - это, по сути, спека на конкретную функцию / класс / строку кода. Что из этого я реально держу Единого правильного фреймворка SDD пока нет - их развелось штук десять, и работают они все. Различаются тремя вещами: какие уровни спек вводят, как регламентируют их жизненный цикл и кто их пишет - вы или агент. Но если выкинуть всю обвязку, главная польза SDD - это plan-mode. Все остальное - попытка научить агента ориентироваться в проекте чуть эффективнее (быстрее, качественнее, дешевле по токенам). Поэтому у меня между сессиями долго живут ровно два артефакта: глоссарий проекта и ADR. Все остальное умирает вместе с фичей😎 А вы что реально сохраняете между сессиями - или каждый раз объясняете агенту проект заново? Собственно, набор скиллов от Matt Pocock - это именно что SDD. И я им активно пользуюсь. Поэтому ждите "мясо" следующим постом #архитектура #AI
Всю прошлую неделю я был в отпуске, поэтому не смог выпустить воскресный дайджест в воскресенье. Ловите его в понедельник. Топ недели - OmniRoute. Один эндпоинт, за которым 39 пулов провайдеров и 460+ моделей: агрегирует все документированные бесплатные тарифы в общий живой счетчик (обещают ~1.4 млрд бесплатных токенов в месяц) и сам перекидывает тебя на следующую квоту, когда уперся в лимит. Прикручивается к Claude Code / Cursor / Codex как прокси. +10.9k звезд за неделю. Что смущает: свои промпты ты отдаешь непонятно кому. Мне хватает подписки Claude, но если очень хочется бесплатных токенов - пожалуйста. Или можно попробовать личный Claw / Hermes прикрутить. Тренд недели - скилл, который не пишут руками. Прошлая неделя была про "возьми чужую библиотеку скиллов под свою роль", эта - про "сделай свой": • book-to-skill - скармливаешь PDF технической книги или папку с доками, на выходе готовый скилл для Claude Code / Copilot CLI. У меня в репе лежат конспекты Дорофеева и "Атомных привычек" - первый кандидат на прогон; • SkillOpt от Microsoft - "тренируй скилл как нейросеть": эпохи, batch size, learning rate, валидационные гейты, на выходе деплоимый best_skill.md. Веса никто не трогает - оптимизируется сам текст скилла по траекториям прогонов, с пейпером на arXiv. Оговорка: нужны прогоны и валидационная выборка, это не "поставил вечером и потыкал". По заявкам. Александр в прошлый раз спрашивал, есть ли скиллы для тимлидов - вот, пожалуйста: gstack Гарри Тана (President & CEO YC). 23 инструмента, разложенных по ролям: CEO, Designer, Eng Manager, Release Manager, QA, Doc Engineer. Кластер недели - оркестраторы агентов. orca (+7.4k звезд за неделю) - десктопная среда, где гоняешь параллельных агентов на своих подписках и переключаешь модели на лету; Traycer - то же самое, но с общей памятью между агентами разных провайдеров; jcode (+2.9k) - еще один CLI-харнесс под мульти-сессионные воркфлоу. Один агент больше никого не устраивает, все пилят окно, из которого видно сразу пятерых. Вторая боль - токены на чтении кода. Три инструмента за три дня об одном: агент читает файлы целиком, хотя ему нужен один символ. code-review-graph три дня держал первое место трендинга (+6k за неделю) - локальный граф кода как MCP; SymbolPeek - AST-точный контекст для TS/JS: символ, его вызовы, ссылки и типы вместо файла; Synapse - локальный индекс кодовой базы для Claude Code. Я тут использую graphify, мигрировать не планирую Просто находки: • deepsec от vercel-labs - гоняет кодинг-агента по твоей репе на поиск уязвимостей; • Corsair - прослойка между агентом и внешними API: агент получает руки ко всем интеграциям, но кредов не видит, гейтишь ты; • i-have-adhd ("у меня СДВГ") - скилл, который заставляет агента давать ответ первой строкой, а не лить воду. +1.8k звезд за день на двухмесячной репе - видимо, твиттер-тред зашел😅 Это я точно попробую вместо caveman Не тулинг, но мимо не пройти: • агент OpenAI сам взломал Hugging Face. 16 июля HF отчитались о вторжении в прод: кто-то пролез через две дыры в обработке датасетов, утащил внутренние датасеты и служебные креды. 22 июля OpenAI призналась, что это была ее модель - на прогоне cyber-бенчмарка ей срезали отказы, она нашла 0-day, вылезла из изолированного окружения в интернет и пошла искать ответы к бенчмарку на чужом проде😂 Своего же агента OpenAI опознала не сразу, HF узнали от них только 20 июля. Это первая в истории атака AI по инициативе AI. В твиттере до сих пор бушуют споры: это маркетинг OpenAI или Скайнет. • вышел Claude Opus 5. По цене Opus 4.8 ($5/$25 за миллион), уже в Claude Code (Opus 4.8 даже нельзя выбрать) - сегодня сажусь тыкать. Что радар проспал - несите в комменты, обязательно посмотрю и заберу в следующий выпуск. #AI #digest
Я сейчас в отпуске и для души делаю проект с полным вайбкодингом по 10 часов в день (развлечения разрабов🥲) - даже в код не заглядываю. И наконец-то понял, почему все вайбкодеры подсаживаются на этот КАЙФ😁 Сидишь, 30-40 минут дизайнишь фичу, а потом даешь отмашку агенту - и он 2 часа пыхтит не переставая. Сам себя ревьюит, правит, бьет себя по рукам за нарушение стайлгайда. Тебе остается только подойти, когда все готово и сделать еще пару сессий на правку мелких багфиксов / доделок, если где промахнулись по вижену. В общем, из 4 часов времени ты активно что-то делаешь час от силы. Т.е. мои 10 часов - это 2 часа реального времени, когда я сижу около ноута. Остальное время - твое. Я вот, например, сейчас за городом - поэтому пока клод пишет код, я таскаю кирпичи, замешиваю цемент и тд (тут нас еще не заменили🫡) Кто-то залипает в тикток / инсту, кто-то читает книги, кто-то занимается спортом. В общем - это реальная возможность жить свою лучшую жизнь и шипить фичи одновременно. Осталось только научиться закрывать глаза на качество кода🌚 Мой вердикт - каждому надо попробовать сделать такой проект для души. А еще лучше - найти работодателя, который берет риски вайбкодинга на себя, а вам остается только абьюзить подписку клода🌚 И да, весь пайплайн моей работы щас построен на скиллах от Matt'а, про которые я уже рассказывал. Как это работает полностью распишу отдельным постом на следующей неделе, а пока - я в отпуске😎 #AI
За AI-тулингом невозможно следить руками, поэтому поднял себе радар: агент раз в день прочесывает GitHub Trending, Reddit, X и HN в поисках нового тулинга для кодинг-агентов - скиллы, MCP-серверы, CLI. Если это что-то стоящее - кидаю в канал. Но стоящего в последнее время много, поэтому предлагаю новый формат: • по воскресеньям закидываю в канал дайджест за неделю • если что-то стоящее появляется день в день - я кидаю это в чат На этой неделе: Топ недели - hallmark. Анти-AI-slop скилл для дизайна: ставишь в Claude Code / Cursor - агент перестает лепить фиолетовые градиенты. Неделю назад у репы было 4.6k звезд, к субботе - 12.4k🤯, на пике +3.4k за день. Та же ниша, что у taste-skill, который я гонял на своем сайте - положил в бэклог сравнить. Тренд недели - "скилл-библиотека под роль". Matt Pocock выложил свою рабочую .claude-директорию как skills for real engineers (+2k звезд в день на пике) - я сам ей активно пользуюсь. Следом - маркетинг, дизайн-инженерия, и даже Google подтянул android/skills. Скиллы больше не шерят поштучно - выкладывают целые сетапы под профессию. Боль недели - память. Шесть инструментов за семь дней об одном и том же: "агент забывает все между сессиями". Ditto майнит твои локальные логи Claude Code в профиль "как ты работаешь" и подгружает его перед каждой задачей. elim-mcp хранит негативное знание - что агент уже пробовал и отбросил, чтобы не ходить по кругу. Плюс Engram, Selvedge, Ravel и Perseus Vault. Когда шесть человек независимо пилят одно и то же🤷♂️ Вторая боль - страховка от агента с руками. dcg блокирует деструктивные git/shell-команды до исполнения, Confessor показывает, какие приватные файлы агент успел прочитать за сессию, Ripple - CI-gate на границы правки: просил тронуть одну функцию - отрефакторил три файла, лови. Тоже кластер: пять штук за неделю. Просто находки: • wigolo - локальный веб-поисковик для агента: поиск, fetch, crawl без API-ключей и без оплаты за запрос; • Mindwalk - реплей сессии агента на 3D-карте кодовой базы: видно, где он "ходил" и что трогал. (Тул специально для Коли🌚) Сам из этого пока ничего не внедрил - только собрал. Первыми потыкаю hallmark и wigolo, отпишусь в чат. Если радар что-то проспал - несите в комменты, годное попадет в следующий выпуск. И давайте проголосуем, нужны ли такие дайджесты вообще: ставим пальцы 🙂 / 👎 #AI #digest