tgindex
Остриков пилит агентов

Остриков пилит агентов

Статистика
@aostrikov_ai_agentsрусский

Занимаюсь разработкой AI-агентов и рассказываю про это вам. Чатик: https://t.me/aostrikov_agents_chat С рекламой сразу в /dev/null Личка: @aostrikov

Последний пост
15:45
Последнее чтение
11:47
Постов за неделю
4
Всего постов
23
Тип
открытый
Язык
русский
В каталоге с
12 авг.
Подписчики
4 924
+19 за 3 дн.
Сутки
+3
+0,06%
Неделя
 
Месяц
 
Просмотров на пост
3 709
21 постов
Вовлечённость
75,3%
к подписчикам
Постов в день
0,6
всего 23
Упоминаний
16
каналов
Охват размещения
оценка
1/24сутки в ленте
3 269
1/48двое суток
3 746
1/72трое суток
4 040

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 15:451 5704187

    Новости, ребят, вышел новый протокол. Ну как протокол - новый формат файликов в папке: https://agent-plugins.org/ В октябре прошлого года вышли скиллы и люди их в итоге выкупили. Теперь везде полно разных Skill Store: - наш отечественный: https://skill-store.ru/ - от Vercel: https://www.skills.sh/ - от Валеры: https://neuraldeep.ru/skills Даже внутри Яндекса теперь есть свой Skill Store и народ им постоянно пользуется. Но что делать с MCP? Обычно descriptions и схемы всех подключённых MCP-тулов харнесс сразу кладёт в контекст. Скиллы устроены хитрее: сначала модель видит только короткие name и description, а полная инструкция подгружается, когда скилл понадобился. Поэтому ушлые ребята научились вообще не подключать часть MCP постоянно. Вместо этого кладут CLI или API-клиент в scripts скилла, пишут в description, когда этим пользоваться, и получают лучшее от обоих миров: тулы есть, а контекст заранее не съеден. Плохо что ли? Хорошо! Так вот, умные дяди из OpenAI, Vercel и прочих компаний решили объединить два лагеря и сделали единый формат упаковки обеих сущностей. Behold! Agent Plugins! 🙏🏻 Теперь в один пакет можно положить: - пачку скиллов; - mcp.json с конфигами MCP-серверов; - client extensions - любые дополнительные файлы для конкретного харнесса. Плохо что ли? А зачем?... В чём смысл такого «пакета умений», если это просто коробка рассыпанных шестерёнок без инструкции по сборке? Допустим, идея была в том, что ты подключаешь плагин - и модель сразу превращается в волка с Уолл-стрит: проводит интервью через skill1, отрабатывает возражения через skill2, оформляет покупку через MCP1 и пишет в поддержку через MCP2. Но нет. В plugin.json есть короткий description, у каждого скилла есть свой description, у MCP-тулов тоже будут свои descriptions. А центрального переносимого PLUGIN.md, который объясняет модели весь продукт целиком - какие задачи он решает, как выбирать сценарий и как собирать skills и MCP в один workflow - в стандарте нет. Это всё равно придётся прописывать уровнем выше: в инструкциях вашего харнесса, отдельном meta-skill или client extension, который другие клиенты уже не обязаны понимать. Подгрузятся ли после подключения плагина descriptions и схемы всех MCP-тулов в контекст? Стандарт этого не определяет. Один харнесс загрузит всё сразу, другой спрячет тулы за tool search, третий подключит MCP только по необходимости. Как настроите - так и будет. То есть пока это просто удобная коробка для доставки skills и MCP. Коробка хорошая, но инструкцию по сборке забыли - так бы сказал наш миньон-ревьювер, Захар привет! Не отдавайте главного архитектора в IKEA. <пингвин_в_наклоне.jpg>

  • 10 авг.3 65261324

    Более спокойная версия, без матюков. Можно скинуть и маме, и тому, кто только начинает разбираться в агентах. Только потом не удивляйтесь, если мама напишет харнесс лучше вашего.

  • 9 авг.4 64072470

    @aostrikov для ценителей на всякий случай.

  • 9 авг.3 6866049

    Однажды у пачки AI-инфлюенсеров резко закончились подписки, Tibo не порадовал ребят ресетом и они пошли трогать траву. Трогали на лужайках, трогали в парках, трогали в контактных зоопарках и постепенно судьба привела их в лес. В лесу они разожгли костер, набили свои трубки и долго и упорно спорили по разным аспектам AI. - что такое модель и что такое контекст? - а что такое агенты и что такое тулзы, скиллы и мсп? - сколько субагентов смогут написать луп из семи харнессов? Казалось бы, простые вопросы, но эти ребята курили трубки до самого раннего утра и спорили, спорили, спорили. Но они не знали, что всё это время в кустах сидел Пух со включенным микрофоном и записывал все их разговоры. А потом он пошел домой, включил клода, скормил ему записи и все тайные, секретные, но родные для ребят истории улетели в контекст модели. Случилась глобальная протечка базы. И родилась книга. ——— Ну а если по-простому, перед вами квинтэссенция полугода переписок в нашем чатике, скормленная Пухом в клод и дистиллированная в книгу. Книгу, за которой уже начинает охотиться O’Reilly, Манн Иванов и Фербер и все лучшие издательские дома нового света, не зная что она была написана под воздействием самого душевного скилла. Но для вас эта книга бесплатна. Пока. На след неделе будет 15к 👇🏻👇🏼👇🏽

  • 8 авг.3 077266

    ☝🏻☝🏻☝🏻 Считаю Колю одним из самых сильных AI-спецов в РФ комьюнити, а тут еще и дорогобогатый подкаст в уютной студии вышел Упираемся в 5-часовой лимит и смотрим 🍿

  • 8 авг.2 55635104

    Вышел первый серьезный подкаст со мной Получилось очень живо и плотно по темам. Обсуждали скиллы, безопасность и сложности внедрения в компании Классно, что получилось обсудить много микро-деталей, которые обычно не влезают в тг посты. На чилловый просмотр под пиво/чай/прогулку – самое оно 00:01:47 - Бизнесу часто не нужен отдельный кастомный AI-продукт 00:16:56 - Люди не могут рассказать, как именно делают свою работу, а агенту, как и сотруднику, нужен онбординг 00:24:39 - Полностью автоматические системы регулярно проваливаются 00:36:43 - Доступ в терминал делает агента гибким, но усложняет контроль. Ценность смещается от производства результата к ответственности за него 00:47:08 - Корпоративная инерция и Shadow AI 01:01:40 - Слабые места моделей; Как быстрее всего учиться строить ИИ продукты 01:17:10 - Разрыв между лидерами и остальными. Внедрять ИИ важно не только из-за роста производительности в моменте 📱 Смотреть полную версию Бтв, нарезку выше сделал агент с нуля, но с одним небольшим хаком, угадаете каким?

  • 7 авг.2 832233

    Всем от души кто залетел 🤌🏻

  • 7 авг.2 6123225из streambyyandex

    👨‍💻 Прямо сейчас встречаемся на балконе на крыше офиса, чтобы поразгонять про ИИ — если он теперь пишет код, то что делает разработчик? Узнаем на стриме — вместе с Лешей Остриковым, руководителем разработки в одной из команд Яндекса, а еще мастером по AI агентам. https://www.twitch.tv/yandex https://www.twitch.tv/yandex https://www.twitch.tv/yandex

  • 2 авг.4 5785878

    Главная новость прошедшей недели: Дарио сказал ФАК Ю ... и забанил меня в четверг. Fable, вечная память. Пришлось в спешке пересаживаться на кодекс, благо там есть волшебная кнопка - перенести все из клода. Главная проблема была в скиллах. За последние несколько месяцев очень глубоко оброс скиллами для внутренних систем, некоторые дублировали друг друга. Часть знаний, компенсирующих разные ошибки, осели в заметках памяти, часть расползлась по CLAUDE.md, часть скиллов не подходили под кодекс. Переделка скиллов заняла два с половиной дня. Сложность была в том, что для некоторых внутренних систем идеальных скиллов пока не существует. Например, для нашей системы контроля версий есть три скилла с разными сильными и слабыми сторонами. И с тремя разными авторами. Помогли в итоге три вещи: - полный анализ кодексом всех скиллов, находящихся в контексте, с безжалостной вычисткой устаревших и не актуальных. Для аудита этого добра использовал прекрасный скилл-кондуктор от @shimaoz - сравнение всех оставшихся похожих скиллов и вынесение правил про то, какие их части должны использоваться для разных сценариев в новый скилл роутинга (ахаха 😄) - скан всего контекста на предмет разных подсказок про скиллы (из обрывков памяти и AGENTS.md) и в итоге дистилляция годных знаний в тот же новый скилл роутинга. AGENTS.md оставляем максимально чистым, спасибо Борису за советы В целом ничего грандиозного, просто получилась хорошая тактическая карта - для каких кейсов использовать какие части скиллов. Неплохой вариант, когда альтернатива - идти в лички к авторам скиллов и договариваться с ними на фиксы. Короче со временем весь зоопарк скиллов превращается в помойку и нужно убираться. Если вдруг вы знаете, как правильно работать со skill hell, и, возможно, для этого существуют более продвинутые механизмы, пишите. Что ж, это была славная охота, еще повезло, что Сlaude так долго проработал. По интеллекту 5.6 Sol похож на Opus 5, они хорошо делают задачи, когда им конкретно сказать, что делать. Но творческого полета фантазии, как у Fable, у них всё-таки нет. ——— Думал ещё в этот же пост написать новости и новые сложности по Swarm OS, но он и так раздулся, сделаем отдельный. За картинку спасибо богу пикчеров @attafitamim

  • 31 июл.3 4882212

    Туту проводит хакатон: хороший способ познакомиться с командой Помните я рассказывал, что запустили MCP для сервиса путешествий Туту. Самый популярный запрос в личку по итогам анонса был про то, как я нашел проект и договорился с командой.

  • 29 июл.3 848848

    ☝🏼☝🏼☝🏼 годнота, крутейший совет, спасибо ребят но в CLI небось также удобно, мы не знаем просто... ——— из комментов: - В cli все гораздо проще, большой текст сложно читать поэтому и не надо, сразу апрув

  • 29 июл.3 1945449из the_ai_architect

    Способ ответа на вопросы в Codex App Рекомендую :) кстати, можно ещё и голосом надиктовывать заметки подсмотрел у @etechlead Лайк, репост, ✔️ Тимур Хахалев про AI Coding, подписывайтесь!

  • 28 июл.4 53551186

    Помимо выбора совиньон блана, написал на выходных скилл по поиску небанальных статей про агентов из техноблогов больших компаний: https://github.com/maddness/agent-research-radar Пока дебажил, наткнулся на одну неплохую: https://huggingface.co/blog/allenai/shippy-tech-blog Ребята написали агента, который отвечает на вопросы по судам в морском пространстве Ганы: сколько в водах кораблей, кто где плавает, какие морские события сейчас идут и прочее. Хорошая статья, которая в целом показывает на обзорном уровне все современные внутренности ai-агента. - модель они взяли Opus 4.6, отлично - харнесс взяли OpenClaw, тут уже можно начать душнить, но если так проще для первой версии - почему нет. В OpenClaw много лишнего, и если вам нужен легкий лаконичный агент, есть варианты лучше (zero, nano, pi) - у агента более пяти внешних API для получения риалтайм данных, они написали скиллы внутри которых лежат cli. Самый верный способ - до этого пытались собирать запросы в api на лету, но был фон галлюцинаций. В итоге cli закрыли проблемы и упростили тестирование - изоляцию они сделали на k8s, под каждого пользователя разворачиваются поды с агентом, получаем полную изоляцию. Это самая странная часть, особенно учитывая немаленький образ и ресурсы OpenClaw, тут кажется при большом количестве клиентов будет оверхед. Да и решения типа microVM слышал более легковесные (но в комментах Илья и Пух говорят что нет). Плюс со стороны кажется такая изоляция им не нужна, если все покрыто cli-шками и модель не должна писать код, отключили бы нужные тулы у OpenClaw и всё - по эвалам хорошо, расписали базовые кейсы, гоняют их в сендбоксе на реальных данных, проверяют использует ли модель тулы, оценивают через судью разные критерии от 0 до 1 с разными весами, получают итоговый скор. Дешево и сердито) Годное легкое чтиво, минут за 20, уровень начальный-средний. ——— Если кто попробует и будет фидбэк по скилу, кидайте, поправлю

  • 26 июл.4 316159120

    Ладно ребят, раз уж тут все свои, вот она РЕАЛЬНАЯ ПОЛЬЗА от применения ИИ

  • 26 июл.3 2815187

    Заметки чиркаши на полях, часть вторая, продолжаем рубрику Семь бед - одна новая сессия Завёл привычку: в любой непонятной ситуации просто задать вопрос клоду. Собрал внутренние тулы и скиллы, чтобы он сам лазил по сервисам, докам, коду и возвращался с ответом, и по заветам Карпатого сложился флоу. Есть сложный вопрос - открываешь голосовуху, надиктовываешь 2-3 минуты мыслей, с чего начать и куда посмотреть - оно уходит копать. Через полчаса-час возвращается и раскладывает всё по полочкам, и вот тут главный челлендж - найти те самые 10-15 минут, чтобы прочитать, осознать и дать следующий шаг. В параллель получается держать 3-4 контекста, но часов с 12 начинаются встречи, и вернуться к клоду выходит ближе к вечеру - нет времени наподумать. Похоже придётся ставить в календарь пару встреч «Разговоры о важном», иначе агенты простаивают и разгребать начинаешь их ночью... Но чувство всё равно прекрасное, как будто живёшь на скорости x3-x5 и клонировал себя)) Главное - не делегируйте агентам принятие решений, говорите им «копай и возвращайся, подумаем вместе», так шикарно решаются и кодинговые задачи, и не кодинговые. Иначе они такого нарешают, потом пару недель придется разгребать. Процентов 10 запросов летит в fable, все остальные решает 4.8, а теперь пятерка на medium. Fable 4 Life Безумно нравится, как Fable работает с задачами, где я сам не знаю, с чего начать: поисследовать несколько систем, понять, как они устроены, придумать, как сделать лучше, прикинуть рефакторинг. Он долго думает, затем раскладывает работу в workflow из нескольких уровней субагентов, и там, где нет очевидного решения, работает лучше всего. Три примера из последнего месяца: Первый - «прочитай все диалоги агентов по одной из стран за неделю, разложи на удачные и провальные и спроектируй по ним улучшенные критерии для LLM-as-judge». Правильного ответ тут нет, чистый ресёрч. Fable развернул это в 47 субагентов, которые читали диалоги пачками параллельно и сводили выводы, всё вместе - полчаса. Второй - «разбери архитектуру одного из наших сервисов, найди весь бойлерплейт и предложи декларативный фреймворк вместо копипасты». Сначала 9 агентов на карту кода, потом прогон из 12 агентов и 8 фаз, который написал по ней детальный RFC. Третий - архитектурная развилка «переносить ли логику наших воркфлоу из внешнего оркестратора в код сервиса». Восемь агентов, два часа, на выходе разбор с плюсами, минусами и ценой каждого варианта. И результаты, с которыми он возвращается прям радуют, остается лишь минимальное кол-во итераций для дошлифовки. Swarm OS Решил попробовать написать центральный агентский мозг нашего контура. Мы пилим агентов, которые общаются с исполнителями разных профессий и помогают им по жизни, ставим A/B-эксперименты смотрим, какие прокрашиваются. Решил собрать агента, у которого на руках все ниточки: очередь с пул-реквестами, весь наш код, read-only базу с данными, конфиги экспериментов, дашборды и ещё пять-шесть источников, вплоть до транскрибаций стендапов и архитектурных сессий (да да да, все шутки про мам с дейликов - собственность агента). В итоге у агента почти все аспекты жизни контура, спросить можно что угодно: кто больше пул-реквестов залил на прошлой неделе, что нужно успеть дожать до конца августа, в каких странах и на каких сегментах стоит запускаться следующими. Отсюда две вещи: Первая простая - с вероятностью 99% получится (уже получается) виртуальный ассистент контура, отвечающий на любые вопросы мгновенно. А вот вторая - челлендж. Мыслящий мозг, который сам анализирует происходящее и подсказывает следующие шаги: поменять эксперимент, разобрать результаты, сказать что мы забыли, или изменить продуктовые фокусы сентября, потому что у него есть предложение лучше. То есть отдать агенту часть процессов, которые сейчас держатся на плечах кожаных, ну а через какое-то время он, конечно, станет главным в контуре, а мы - прислугой. Если кто-то делал похожее, напишите в комменты, а ещё лучше расскажите, где будет фиаско - за максимально точное предсказание будущего что-нибудь подарю (и даже не ссылку на лучший в мире скилл)

  • 19 июл.4 3356545

    ☝🏻☝🏻☝🏻 Давайте поддержим Сергея Исконно русский caveman с национальной душой и характером родился всего лишь пару дней назад, но уже успел завоевать любовь нашего чата Ставим звезды, не жалеем: https://github.com/smixs/pohuy По пользе скилл может посоревноваться с T-Stonks от Пуха (вилла пока в жестком минусе, но мы её все равно купим, ждем отскока) Зачем нужны звезды вы спросите? Понятно зачем - они позволят новому бриллианту податься на конкурс лучших решений от Антропика, и повторить успех скилла для оптимизации префикс кеша от Сережи Нотевского, который получил полгода x20 🔥 А не дадут подписку, ну и POHUY

  • 19 июл.3 34658117из aimastersme

    Материтесь ли вы на работе? Умный дядька Нассим Талеб в книге «Рискуя собственной шкурой» (та, что вышла после «Чёрных лебедей») формулирует: если человек говорит формальностями, весь такой вежливый, извиняется на каждом шагу - ему плевать на проект. Шкура не горит. А где ставки настоящие, там матерятся. Зайдите в кабину пилота: «уважаемый Вадим Сергеевич, мы падаем, поднимите, пожалуйста, руль» - ага, ну, конечно! Загляните в операционную, или к строителям, которым платят, чтобы кран ни на кого не упал. Именно поэтому я запилил скилл POHUY, а не ради шуточек - режим идиоматического русского мата для агентов. Агент перестаёт мямлить «the deployment failed because the environment variable...» а прямо докладывает: «деплой наебнулся...». Сегодня доделал v2: шкала состояний, словарь со сценами применения, evals. Работает как часы - экономит вам нервы, а не токены ==== Дальше по апдейтам IVA теперь обновляется плавненько. Пишете ей /update - она накатывает улучшения и сохраняет все ваши правки. Кастомизируйте её сколько хотите, обновления ничего не затирают. Заодно навёл красоту UX ==== И превью, про которое скоро будет отдельный пост: скилл MENTOR . Он читает историю ваших сессий в Claude Code и Codex и показывает, что не так в вашей работе с агентами: что строите, где теряете время, что чинить. Зачем я делаю MENTOR - в компаниях сейчас решают, кого увольнять из-за AI. Уволишь джунов - сеньоры разленятся. Уволишь сеньоров - некому учить джунов. Мне милее второй вариант: пусть сеньоры идут отдыхать, а учит нейронка с моим скиллом POHUY - один в один как сеньор. Сейчас готово процентов двадцать от задуманного Ментора, работаю дальше. ==== Теперь просьба У меня здесь 6000 подписчиков. Зайдите на GitHub. пожалуйста, - пройди те по ссылкам и поставьте звёзды. Если нет аккаунта - регистрация занимает два шага. Огоньки в телеграме греют, но другие люди находят мои проекты по звёздам на гитхабе. Мне нужна ваша поддержка. Поставьте звезду, я вас очень прошу. Это важно. Спасибо @aimastersme

  • 18 июл.3 84235

    видео или голосовое, без подписи

  • 18 июл.4 18336

    видео или голосовое, без подписи

  • 18 июл.4 72936

    видео или голосовое, без подписи

Остриков пилит агентов — tgindex