ivan zakutni
описание
Авторский канал про инженерию умных систем. SDD, AI/Human collaboration, инженерное мышление. Связь: @m0n0x41d
Лучшие посты
за три месяцадистилляция промптов? Нет, дистилляция скиллов! Это что то новенькое... Мелкийсофт выкатили пейпер SkillOpt – штуковину, где обучают не модель, а skill-файл агента. Ну конечно это не дистилляция, а optimization loop вокруг markdown-инструкций. Но направление интересное, я даже глаза не закатывал)))) Элементарное просто – берем замороженного агента, даем ему skill, гоняем на задачах и сохраняем весь роллаут: какие тулзы дергал, где поехал, какой ответ выдал, и тд. Потом внешняя сильная модель-оптимизатор читает эти следы и предлагает патч (выборочный, весь скилл в кашу переписывать нельзя) к skill-файлу: добавить правило, выкинуть вредную инструкцию, заменить кривой кусок. такие предложения принимаются и сразу проверяются – если справилось лучше то… применяем изменение в описание скилла. Цифры бодрые, обещают десятки и десятки процентов улучшения… работы на бенчмарках Это все дикая молотилка токенов, но кажется что в вертикальных кейсах должно работать норм. сложные системы скиллов (вроде haft) тренировать такой машинкой врядли получится. Все таки сложные сценарии, измерить результат еще сложнее. Но если у вас есть понятный AI процесс, который держится на файлике с инструкциями, и результат можно измерить и оценить в табличке – поздравляю, у вас уже есть тренируемая поверхность))) Если у вас скиллы в проде… я не знаю что сказать Скорее это про улучшение всякой harness прикладной истории.
Я первый раз попробовал v0.dev и лучше бы не пробовал. Название, вообще, очень точное – на выходе у меня получился именно v0 фронтенд, настолько кривой, что отвратительный! с ним ничего нельзя сделать кроме как выкинуть к чертовой слопобабушке! Возможно... v0 работает хорошо/лучше с react. Ну мб, но зачем мне реакт? Мне надо vue. Возможно, подумаете вы, я скормил ему плохой промпт? Но нет, я скормил ему specs из haft которые, на минуточку, формировались почти полторы недели, плюс DESIGN.md и PRODUCT.md выведенные из этих самых specs с помощью impeccable Да, я редко пишу про прикладные штуки. Но сейчас я все таки пишу, потому что impaccable это мощь! Сила! Класс! Срочно пробуйте! В сетапе где у вас есть уже отличные спеки, объясняющие что вы строите (ждите, 8.2.0 haft скоро будет, и я все расскажу, что оно и как и какие спеки вам помогает писать. Да, это байт на лайки), и хороший агент который умеет генерировать изображения и ходить в браузер, смотреть и мучать что он там наделал... получится хорошо. В моем случае "хороший агент", это codex, в частности – codex app. Я не знаю насколько хороша интеграция с браузером в codex cli, но апп прямо из коробки хорошо молотит с playwright. Вообще какое-то время я уже почти не пользуюсь cli агентами как основной средой, все headless и one-shot комманды. Но об этом тоже в другой раз))) Итак, ваша формула успеха в agentic фронтенде: 0) крутой агент и крутое окружение (читай Codex App, вам там и терминал, и worktrees, и браузер, и ничего не тормозит давно), impeccable, и shadcn (для vue или реакта, если любите пожирнее). Ставити все это в своей проект и сражаетесь. 1) Думаю что можно начать с голого поля, и собирать design и product "спеки" прямо с impeccable, но я рекомендую подойти серьезнее)) 2) Все! Сверху можно добавить для ускорения и мега красоты сниппеты с каких нубудь сайтов вроде vue-bits (для реакта такого добра еще больше), ибо с shadcn не всегда вывозит с первого раза. Impeccable умеет полировать, оптимизировать и ускорять, там вообще отличный пласт фронтенд мудрости упакован, так что с последних сайтов всякие тяжелые анимации оно успешно переписывает чтобы работало на утюгах. Ставь: огонек – если не понял почему я топлю за Codex App и хочешь пояснений хотдог – если имеешь претензии по поводу отсутствия haft 8.2.0 в релизах желтый морда с вопросом – если я пишу в блог слишком редко, а надо чаще.
Привет! В ответ на реакции к посту выше поясняю свою позицию за Codex App 😈 TL;DR: я сфокусировал работу в Codex App, потому что для меня он оказался лучшей – да и вообще наиболее цельной – средой агентской разработки. Я меньше отвлекаюсь/переключаю контекст, лучше контролирую параллельную работу и, что особенно важно, я снова стал гораздо чаще читать (и писать) код, тесты и диффы. А GPT-модели начиная с 5.5 оказались для меня намного более лучшими инженерными друзьями, чем опус и сказочка. С месяц назад я выбирал на чем остаться Claude vs ChatGPT (200$). Выбор был сделан в пользу второго. В том числе потому, что FPF последних версий уже не влезает в Claude Desktop. Кстати, история с Fable случилась буквально в последние дни моей активной подписки на Claude, бгг. Скажу так – я по CC я не скучаю вообще, вот ни чуточки) Codex App стал сейчас прям хорош. Работает шустро, GPT-модели не так прожорливы на токены, а компакт контекста просто великолепный! В нём удобно читать код, комментировать диффы и открывать файлы во внешнем редакторе (у меня это Zed.) это особенно актуально, потому что сложность моих последних проектов такая, что вообще не читать код, тесты и диффы абсолютно непозволительно. ремоут сессии были последней фичей что держала меня в CC – я прям много работаю с телефона. я не знаю что тут еще добавиь, разве этого мало? Worktrees в один клик? сommit-and-push и address comments в гитхабе в пару кликов? Пет, который не навязчиво привлекает внимание, когда оно требуется? (open peon в CC меня задрочил до нервного тика) Терминал под рукой? Пока писал этот пост, увидел, что ещё и просмотр PR'ов привезли в сайдбар) По отдельности всё это кажется набором мелких фич, но в том то и прикол, что вместе они убирают огромный слой ручной и полуручной диспетчерезации, как бы не было удобненько в tmux вкладках, но в единой среде с хорошим интерфейсом работать приятнее и проще. Я долго был под чарами Антропик, но теперь они похоже совсем развеялись. Антропиковские модели хороши. Особенно хороши они в прозе) Мне не нужна проза! с прозой мне нравится разбираться самому!!! Мне нужен peer engineer и удобная среда, в которой я могу думать, пока плюю в потолок, и в которой мне не приходится переключаться по вкладкам как амфетаминовая белка, и тратить столь много человеческой оперативки (которой так мало) на удержание в голове всего этого безобразия Мне нужна среда в которой можно не терять активные треды и быстро понимать статус каждой активной работы. Мне нужна среда, в которой релизы не ломают базовый функционал (че там как дела с глитчами сс?), а приносят новые полезные фичи! вот Codex App всё это даёт. И ещё кучу приятных вещей: быстрые скриншоты экрана, которые сразу влетают в активный тред, интеграцию с playwright из коробки и браузер с аннотациями, чтобы при разработке фронтендов лучше тягать агента за уши))) Claude Code многое из этого нормально не даёт, а чего-то из этого в нём вообще не будет в виду ограничений среды. Конечно, это совсем разные продукты. Я не утверждаю, что GUI в принципе лучше терминала. Но для управления несколькими долгоживущими агентскими задачами CLI лично для меня перестал быть самым удобным и эффективным интерфейсом. Еще мне нравится OpenAI не стремится запирать пользователей внутри одного интерфейса. Лимиты кодекса всё ещё можно использовать через разные другие инструменты – OpenCode, Zed, name your thing – да хоть в собственных не коммерческих ИИ-приложухах, смотришь как авторизация в codex cli работает и делаешь так же))) Сколько такая политика проживёт – посмотрим, но прямо сейчас это топ. В конце концов, все сейчас говорят про harness, и вот harness это не про то насколько эффектно агент генерирует код, и не только про автономную молотилку goal десятки часов, но еще и про то, насколько хорошо _человек_ может управлять несколькими потоками работы и при этом сам оставаться внутри инженерного процесса. И вот это, имхо, Codex App сейчас делает лучше всех остальных тулов. Ставь огонь если Codex App топ, и желтый морда с вопросом, если не понимаешь зачем читать код.
5 вещей, которые я хотел бы осознать раньше на пути из эникейщика в инженера Читайте весь текст => тут <= 1. Проблема, которая кажется технической, часто находится в договорённостях между людьми 2. Архитектуру нельзя выбирать лишь потому, что она стильная-модная или интеллектуально привлекательная 3. Коллекция фреймворков не заменяет развитого мышления 4. Сильные специалисты не компенсируют плохо спроектированную коллективную работу 5. Я слишком поздно научился проверять, существует ли вообще задача, которую собрались решать *** Перешли коллеге или другу, которому это будет полезно 🙂
без подписи
без подписи
да, кстати, там наконец-то вышел Haft v9. точнее он уже v9.0.2)) Дока тут. В течении какого то времени в доке еще добавится что то вроде work/cool-books для самых маленьких. Но вы можете это не ждать, ставь да пользуйся блин) История с v9 была примерно такая: Прямо перед моим закрытым стримом в AI подлодке несколько недель назад в FPF произошла куча изменений. А до этих изменений я параллельно городил в Haft костыли для pattern retrieval, и вот раз и Анатолий Игоревич Левенчук взял и сделал этот условный базовый retrieval уже внутри самого FPF. Одновременно оказалось, что извлечение карточек можно имплементировать проще, без псевдо-умных роутеров, которые якобы знают FPF лучше самого FPF)))) Туда же добавляется тот факто, что за последние полтора месяца прошло пять семинаров по FPF. Из них стало понятно много новых ходов, как улучшить Haft – в частности с самых первых семинаров пришел сильный ход на улучшение именно как проектнрй памяти Теперь Haft стремится помнить не только отдельные решения и заметки, но держит связанный граф проекта: сущности, проблемы, варианты, наши решения, spec sections, evidence, код и отношения между ними. Это нужно чтобы агент мог зайти через вопрос, файл или символ из кода и поднять нужный кусок этого графа)))) Помогает понять, какие решения рядом, чем они были обоснованы, какие спеки относятся к коду и даже может отловаить если оно подпротухло! В итоге в v9.0.0 появились: – source-native FPF Query: concern retrieval, exact lookup и inspect прямо по запеченному в релиз FPF-Spec.md (с этого дня оставание от FPF будет меньше и релизить будем чаще!) – typed project memory с entities, aliases, relations, provenance и bounded neighborhood вокруг предмета работы (та самая проектная память, но ее надо тестить, welcome!) – fused graph памяти о проекте, коде и reasoning-артефактах; – улучшил онбординг и spec sections. Target System и Software System спеки это на самом деле тоже новая фича, в 8 версии они были жутко недоделанные, но сейчас кажется можно пользоваться! В старый или новый проект заходите через скиллы h-onboard / h-spec и haft сам должен проести вас по системному моделированию) – Haft толстоват в плане интерфейса – в нем 12 независимых скиллов и 12 MCP тулов, но совсем нет никаких обязательных, детерминированных последовательностей как это было когда то дваным давно. На самом деле почти для любого вопроса можно использовать просто зонтичный скилл – h-reason. Если проблема ещё не сформулирована – h-frame. Если есть конкретный сбой и непонятна причина – h-diagnose. Но все скиллы теперь ваш агент может вызывать сам, он разберется)))) короче говоря, я думаю что порог вхождения в haft стал все таки много меньше! При этом Haft стал потоньше на лишние штуки, полностью выпилены экспериментальные haft run, haft harness (Open-Sleigh и весь Elixir/OTP/BEAM runtime – ничего из этого не надо, полное комодити. Хост агенты прекрасно вызывают суб-агентов и они так же хорошо сами используют haft скилы и тулы). Haft больше не пытается (и не будет пытаться) быть ещё одним агентом рядом с вашим основным. Пусть Codex, Claude Code или еще кто нибудь выполняет работу! Задача Haft – помнить, почему эта работа вообще делается, что было решено раньше, где это живёт в коде и на каких уликах оно держится. *** Я не удивлюсь если там есть баги, ибо я с haft имею ноль шекелей, делалось там дофига, тестить там тоже дофига, Тем не менее догфуддинг и еще N больших и средних проектов новая версия пережила, в том числе greenfield, поэтому релиз больше откладывать смысла нет. В случае нахождения любых ошибок, пожеланий и предложений, вы знаете куда они идти – принимаются в порядке записи по талонам в github issue. Всем добра ☺️
Лучший harness — это вы и ваши AI-агенты harness – еще одно новояз словечко которое полностью вошло в ментальность и звучит из каждого утюга. Первоклассный зонтичный термин с эталонным фан аутом – вот говорит кто-то harness, и черт его знает что там – набор скиллов? Мега AGENTS.md? RFC? Кастомный Pi? Или другой OpenCode на стероидах? MCP сервер? Все вместе? Каждый раз как в первый раз в первый класс)) Приглашаю вас со мной сделать zoom-out за чашкой кофе и вспомнить арку про Augmented Intelligence в свежем письме. Прошло уже больше года с той заметки, и imho – в этом мета-моменте не поменялось вообще ничего, хотя AI и стал намного умнее. Почитал сам – дай почитать другому :)