tgindex
AI и грабли

AI и грабли

Статистика
@oestickБизнесрусский

Строил HR продукты для американского бигтеха. Внедряю AI в бизнес, пишу про свои ошибки и находки Co-founder https://entropy.talk и https://grably.tech @nikolay_sheyko

Последний пост
18:45
Последнее чтение
00:53
Постов за неделю
2
Всего постов
22
Тип
открытый
Язык
русский
Категория
Бизнес
В каталоге с
12 авг.
Подписчики
13 126
+23 за 5 дн.
Сутки
−1
−0,01%
Неделя
 
Месяц
 
Просмотров на пост
6 723
21 постов
Вовлечённость
51,2%
к подписчикам
Постов в день
0,3
всего 22
Упоминаний
10
каналов
Охват размещения
оценка
1/24сутки в ленте
3 540
1/48двое суток
4 056
1/72трое суток
4 375

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 18:452 2054072

    MCP → CLI Я только собирался написать, почему CLI сосут, и на что их заменять, как понял, что у меня даже нет поста, почему сосут MCP (от которых мы и ушли к CLI). Исправляю! Сначала напомню в двух словах зачем эти ребята нам вообще нужны: агент сам по себе мало что умеет в мире, где наши данные разбросаны по десяткам веб-приложений, начиная от почты и календаря, заканчивая транскрибаторами звонков, джирами и сервисами электронного документооборота Нужно его к ним как-то коннектить. И на заре агентных систем ребята придумали подсовывать ему новые инструменты как tools (то, что агент может вызывать в цикле перед тем как дать итоговый ответ). Назвали это MCP (model-context-protocol) У стандарта MCP было много исторических болячек: невнятная аутентификация, загромождение контекста всеми методами всех mcp'шек, , отсутствие строгого следования схеме, stateful логика 🥴 Сейчас они по большей части вылечены. Но есть одна главная проблема – это все еще лишний слой абстракции поверх обычного API. То есть, вместо того, чтобы сразу дернуть API нашего условного гитхаба, обвязка агента (она выполняет роль MCP клиента) отправляет это в какой-то MCP сервер (в случае с гитхаб он удаленный, но может быть и локальным), а он уже отправляет это в API Вместо этого, любой агент, у которого есть вызов терминала может либо просто написать скрипт, который будет обращаться к API напрямую, либо вызвать уже сто лет существующую cli-команду gh с нужными параметрами. Всё! И вот какие у этого плюсы: 1. Жрет меньше токенов (потому что не verbose json) 2. Можно стакать вызовы команд в любой последовательности 3. Не обязательно засирать контекст модели всем выводом. Перенаправляем и фильтруем вывод терминальной команды как душе угодно 4. Обычно сильно больше комбинаций параметров 5. Если какой-то функции или параметра нет, агент все так же может написать кастомный скрипт, который сходит в API и сделает то, что нужно Но надо признать, кое-где MCP все-таки нужны – когда у вас есть эфимерная сессия + нужна авторизация. Короче, во всех облачных чатах и коворках. CLI там не подходит по одной причине – авторизация происходит внутри сэндбокса и на каждый новый чат придется делать ее заново Пример: gh отлично работает у вас на ноуте, но в ChatGPT Work вы задолбаетесь каждый раз проходить авторизацию, а вот GitHub MCP подключите один раз и он будет работать всегда В разговорах слышал еще такие аргументы за MCP (но мне они не нравятся): 1. Проще раскатывать на команду и обновлять (хз, автообновление cli делается тривиально) 2. MCP сразу поддерживает инструкции, а про CLI тул агент еще должен как-то узнать (скиллы наш бро) 3. В MCP есть функции, которых нет в API (это вообще извращение, не делайте так. но если пользуетесь чужим сервисом таким, то да, тут придется страдать) А у вас в команде используют MCP? Почему? (напоминаю, что скоро будет пост о том, почему CLI тоже не самый лучший выбор) @ai_grably

  • 14 авг.3 9915446

    Разрушать систему Недавно хайпанула волна постов, мол, раз в несколько месяцев надо полностью сносить все настройки агентов, удалять все скиллы. MCP и т.д. И пересобирать все заново. Типа, старые уже не работают и их нужно перестраивать с нуля на новых моделях Звучит секси, но а) 99% людей не будут этим заниматься, потому что нам всем и так есть чем заняться б) Оказывается, что 80% того что ты переделал почти полностью повторяет то, что уже было (если до этого подходил с умом и вовремя обновлял) Я процентов 20 своего времени трачу на эксперименты с разными подходами и инструментами, и только сейчас более-менее стал доволен тем, как оно работает и для технических задач, и для операционки. Причем, я уверен, что выстроенная система переживет еще несколько новых поколений моделей почти без изменений Я собрал всё действительно важное в пошаговый роадмап по настройке и освоению ИИ-агентов на конец лета 2026 года Во вторник 18.08 в 18:00 GMT+3 проведу бесплатный эфир с разбором Еще на эфире расскажу кому и почему будет полезно поучаствовать в нашем платном марафоне, где мы за ручку проводим по этому роадмапу (доходимость на прошлом – 85%!). А кому – нет. Для таких постараюсь сделать эфир+роадмап полезными сами по себе → Записаться на бесплатный эфир 18 августа

  • 8 авг.8 39574227

    Вышел первый серьезный подкаст со мной Получилось очень живо и плотно по темам. Обсуждали скиллы, безопасность и сложности внедрения в компании Классно, что получилось обсудить много микро-деталей, которые обычно не влезают в тг посты. На чилловый просмотр под пиво/чай/прогулку – самое оно 00:01:47 - Бизнесу часто не нужен отдельный кастомный AI-продукт 00:16:56 - Люди не могут рассказать, как именно делают свою работу, а агенту, как и сотруднику, нужен онбординг 00:24:39 - Полностью автоматические системы регулярно проваливаются 00:36:43 - Доступ в терминал делает агента гибким, но усложняет контроль. Ценность смещается от производства результата к ответственности за него 00:47:08 - Корпоративная инерция и Shadow AI 01:01:40 - Слабые места моделей; Как быстрее всего учиться строить ИИ продукты 01:17:10 - Разрыв между лидерами и остальными. Внедрять ИИ важно не только из-за роста производительности в моменте 📱 Смотреть полную версию Бтв, нарезку выше сделал агент с нуля, но с одним небольшим хаком, угадаете каким?

  • 7 авг.5 84155121

    Один из самых секси кейсов с нашего марафона по агентам – создание рабочих веб аппок с бэкендом на гугл таблицах и деплоем в одну строку без гитхабов, докеров, vps Ребятам, которые не хотят заморачиваться с техничкой – очень нравится. Большинство сразу нашли где это использовать в своей работе Так вот, теперь не нужно использовать внешние сервисы – openai встроили такую штуку к себе в codex Причем реализация очень крутая – все поверх легковесных Cloudflare Workers и их же R2 storage P.s. в claude code такого нет, их Artifacts – это тупо static page на их же домене

  • 6 авг.5 5253056

    Найм, соревы и бабки Одна из самых важных задач реального мира – уметь различать людей, которые что-то реально из себя представляет и тех, кто только пытается такими казаться. Причем, важно и в отношениях, и в дружбе, и в работе И особенно важно понимать, к какой категории относишься сам и как можешь это подтвердить Что забавно – многие хорошие на первый взгляд "метрики", на самом деле почти не работают. Например, размер ЗП часто объясняется не реальными рабочими навыками, а разницей между компаниями, рынками и ролями (а иногдачасто еще и умением подлизать кому и когда нужно) И очень редко есть честная возможность сравнить себя с другими в относительно равных условиях. Причем, она ценна еще и потому, что на такие сравнения всегда очень внимательно смотрят те, кто принимают решение о работе с вами. Не зря Ринат @llm_under_hood выставляет это как главную причину для участия в своих соревнованиях – тех, кто занял топовые места очень быстро хайрят на топовые позиции. Очень советую поучаствовать хотя бы раз, если вы AI инженер Но я знаю, что у меня большой кусок аудитории – не разрабатывает AI решения, а использует AI-агентов для разработки классических продуктов. И для вас тоже есть подгон. От своих друзей HFT-шников я услышал про соревы spectral.tech и докопался до организаторов по деталям. На мой взгляд, у них получился крутой формат – чем-то с одной стороны наводящий на мысли про вот этот эксперимент, где Cursor с Nvidia оптимизировали CUDA кернелы, а с другой – на autoresearch Карпаты Базовая суть – разработать достаточно простую систему, но так, чтобы у нее была наименьшая задержка (причем не только в среднем, а еще и в худших случаях) Из забавного: Вместе с участниками эту же задачу будет решать Claude-агент. Его решение будет находиться в публичном репозитории, и вы сможете использовать его как baseline. По итогу обещают ускоренный трек найма на AI native инженера (причем не только для призовых мест и без опыта в HFT). Использовать ИИ можно и нужно (имхо, задачка явно хотя бы частично на loop engineering) Ну и призовой фонд $12к тоже приятно Правда без знания C++, сетей и системного программирования его вряд ли получится получить – даже sota модели пока очень плохо сами с такими задачами справляются ⏰ Дедлайн сдачи решений – 30 августа, 23:59 GMT+3 Регистрация и доступ к GitLab с задачей – @spectral_challenge_bot Бтв, если вы знаете еще хорошие соревнования для других областей – напишите, пожалуйста мне в личку

  • 6 авг.3 1546820из sergeinotevskii

    Сижу в лобби отеля, за соседним столом сидят мужики, пьют беленькую, закусывают. Спорят громко. Прислушался. «Петрович, да этих сеток тьма! Маленькие, большие! Для классификации какие хочешь! Можем у себя даже большие развернуть! Главное чтобы электричества хватило!» Думаю: нифига себе адопшн у АИ! Слушаю дальше: «Фракции…булыжники…тонны… золото…». Понимаю что не адопшн, апрофдеформация.

  • 30 июл.6 65443

    без подписи

  • 30 июл.6 71743

    без подписи

  • 30 июл.6 39143

    без подписи

  • 30 июл.6 33845

    без подписи

  • 30 июл.5 6364444

    Никто не делится факапами Выступал недавно на оффлайн конфе в Омске. Организация и доклады по качеству лучше чем на многих столичных конфах Но что меня бесит вообще на любой из них – это что обычно все рассказывают истории успеха, а они почти всегда бесполезны – их сложно переложить на реальность вашей конкретной компании и команды А если слепо повторять все действия, то это будет просто карго культ как у аборигенов, которые пытались воссоздать самолеты белых пришельцев, повторяя их форму из деревяшек в надежде, что они тогда полетят Поэтому, хоть это и менее комфортно, но я стараюсь факапами. На этой конфе рассказывал не про то, как круто мы все внедрили AI в SDLC наших клиентов, а где и как проебались и как это потом исправляли. И вот эти факапы точно будут релевантны для большинства людей Записи всех докладов с конфы можно получить за 10к Там есть еще несколько крутых: - про поверхности атаки на агентные системы и способы защиты от них - про сложности работы AI систем с русским языком от рисерчера с лингвистическим бэкграундом (мы с ней на афтерпати забрали чью-то гитару и развлекали народ песнями, хах) - и про кастомный сетап для AI разработки от Кости Доронина Но я подумал, что не все захотят платить за записи и предложил оргам по нашей прошлогодней схеме дать подписчикам бесплатный доступ за подписки на нескольких спикеров Так что платно забирать тут, а бесплатно – в моем ботике

  • 29 июл.5 5773544

    Из новых не особо документированных изменений в codex агент теперь сам может ходить в соседние диалоги и даже писать в них. ↑ Это не про субагентов, это прям полноценные чаты Пока не придумал, как это прям эффективно использовать, но знаю, что позиционируется как одна из фишек нового голосового режима – голосом можно управлять всеми своими текущими чатами Кто уже пользуется, накидайте в комментах кейсы, пожалуйста

  • 28 июл.17,4 тыс143130

    Все, с выходом Fable и 5.6 sol вы больше не должны понимать, что происходит у вас в коде. Не до всех еще дошло, но вы больше не software engineer, вы loop engineer ↑ Я думал, что это типичный твиттер шитпостинга, но реально начал видеть вокруг себя серьезных людей, кто так считает. Мол, раз у Бориса в антропике получается, то и мы так должны делать Ну камон, ребят. Все же понимают, что публичные лица компаний, который продают лопаты всегда будут преувеличивать ценность этих лопат и формировать хайп, который через какое-то время действительно пушанет технологии до уровня, который они продвигали. Типичный fake it till your make it – так все технологии развиваются и всегда развивались. Но мы то с вами не обязаны собой жертвовать ради этого, ну Почему я считаю, что сейчас это все еще не работает и хорошие инженеры должны понимать что происходит под капотом систем, которые они строят (даже если они строят их печатая/наговаривая английский/русский текст)? Постараюсь порассуждать "из первых принципов": Дело в том, что это всегда так и было – хороший инженер всегда понимал систему как минимум на один уровень абстракции ниже того, на котором её писал. Хороший Python разработчик знает про GIL и 3.13, PyMalloc, сборщик мусора, ссылочную природу объектов, и что многие библиотеки написаны на других языках со своими ограничениями и возможностями. И для него код на пайтоне на самом деле раскрывается гораздо глубже чем он выглядит на первый взгляд – тот самый tacit context Хороший C++ разработчик скорее всего знает не только про разные виды памяти, устройство умных указателей и виртуальные таблицы, но и в курсе про уровни хардварного кэша, особенности архитекутры процессора и хаки, которые использует компилятор для компиляции под эти архитекутры. И может даже знать, в какие конкретно ассемблерные инструкции раскроется его код. Понимает как треды устроены на уровне ОС, какие механизмы их переключения на уровне ядра, и как писать lock-free код ↑ Этого всего нет напрямую в синтаксисе языка. Это особенности поведения систем на гораздо более низких уровнях. И проблема в том, что если инженер их не знает, то он даже не знает чего он не знает. А значит, не узнает и о наличии проблем на этих уровнях. В итоге прод ложится под растущей нагрузкой, баги не находятся неделями и затыкаются костылями, из-за которых прод снова ложится, но уже в следующем квартале ——— Короче, мало топить за loop enginering. Нужно понимать что в результате этих циклов получится Так же как когда вы раньше писали цикл на C++, вы понимали, как данные будет лежать в кэше (и в каком), будут ли лишние аллокации в куче, и раскроется ли ваша числодробилка в SIMD-инструкции В общем, это фундаментальное свойство любого профессионала – видеть систему глубже чем она описана Подгорело, @ai_grably

  • 27 июл.6 50128

    без подписи

  • 27 июл.6 55728

    без подписи

  • 27 июл.5 65328

    без подписи

  • 27 июл.5 54628

    без подписи

  • 27 июл.4 5542829

    Разбор кейса с поиском работы В начале лета я запостил тут всратый пост про набор на марафон в последний день этого самого набора 🤡 Это было странно, но я стараюсь перебарывать перфекционизм и запускать штуки как можно быстрее, чтобы замыкать свой собственный feedback loop, а не пытаться все заранее отполировать (чтобы все равно обнаружить, что реальность сложнее, чем можно предположить) Так вот, тот марафон оказался офигенным! Много что было криво, но мы быстро перестраивались в процессе, и оттачивали формат прям в реальном времени Реально, огромное удовольствие было читать отзывы (на скринах) – люди оценили и задачки почти без теории, и странный формат на вылет (на платном то курсе!), и даже общие задачки вместо заточенных на одну конкретную роль (а скорее показывающие универсальный подход). Короче, все о чем меня предупреждали опытные курсоделы, что это не сработает Мы скоро запустим второй поток, но прежде чем кто-то даст нам свои денюжки хочется дать какую-то ценность + показать, как примерно все устроено. Поэтому завтра (28.07) в 18:00 по мск мы проведем эфир, где разберем одно из заданий, которое не влезло в программу – подбор агентом вакансий, подгон резюме под них и автоотклики. Посмотрим на типичные косяки агентов на таких задачах, научимся их исправлять, поделимся промптами и лайхаками. Если хочется прям полное погружение – можно попробовать решить задачу заранее и приходить на разбор уже с вопросами (минимальная версия задания делается за 15 минут) Рега на эфир и полная формулировка задачки [тут] ↓ Отзывы тут ↓

  • 18 июл.6 82578141

    Несуществующие агенты для аудио В последнее время много работаю с генерацией аудио. И удивляет, что в основном аудио пайплайны собираются в условном comfy – визуальном блочном редакторе. Удивляет, потому что это как писать код пайплайном в n8n вместо клода/кодекса Основная проблема тут – нет полноценного агентного цикла, где модель видит, а точнее слышит, результаты предыдущих действий и может сама выбирать что с этим делать дальше Но тут есть одна техническая сложность, которая многое объясняет: у моделей пока тупо нет нативного восприятия аудио. Например, умение "видеть" картинки уже есть. Поэтому клод код может посмотреть скриншоты лендинга, который он сделал, увидеть косяки и поправить их. Картинки – в контексте той же модели, которая пишет код А с аудио так не работает – большинство моделей не умеют в нативный аудио input Вы скажете: так есть же gemini. Это да. Но: ни одна агентная обертка не поддерживает чтение аудио файлов чисто на уровне тулов. Агентный экзоскелет просто не может просунуть аудиофайл в API запрос к "мозгу". Да, можно подключить gemini по api к основному агенту и отправлять туда аудио с промптом, мол "расскажи, чего не хватает" (кстати, китайская glm-5.2 все еще с картинками работает именно так). Но это все равно что глухой композитор, который зовет своего племянника послушать музыку и сказать, что он там слышит – работает, очевидно, плохо из-за эффекта глухого телефона Вот и получается, что сейчас просто нет привычного нам агентного решения (со скиллами, запуском терминальных комманд, форками сессий, субагентами и т.д.), которое может полноценно работать с аудио (= замыкая фидбэк луп) ——— UPD: Спустя два часа после написания текста выше: 1. Собран простенький самодельный агент вокруг gemini на 300 js строк, с агентным циклом, интерактивностью, fork/edit/resume – чисто проверить подход 2. Это все перенесено в PI в виде экстеншна, который патчит тул чтения файлов (он там by design умеет и текст читать, и бинарные данные) Короче, теперь добавить своему агенту "уши" можно в 1-2 строки: npm install -g pi-agent pi install git:github.com/toolittlecakes/pi-gemini-audio-read (не забываем потом /login → google → api key и выбрать модель gemini-3.5-flash) Где нужно: генерация музыки, качественные аудио переводы, работа с voice cloning, монтаж аудио (и видео, если это подкаст) Ограничения: 20мб на файл – не добавлял загрузку файлов через file api. И нет видео инпута Вообще, забавно, как вдохновляют задачки, у которых в целом нет существующего решения (по крайней мере публичного). Ощущение, что оказываешься на землях, где "ни ступала нога человека" 💻Репо

  • 13 июл.7 77948138

    Хз как люди пользуются OpenRouter По дурости тестили на нем систему, которая на локалках должна будет работать в контуре клиента, и это такая боль: - низкие лимиты у провайдеров - хрен пойми у кого реально есть поддержка structured output, даже если заявлено - а у кого есть, часто некорректная – натолкнулся на имплементацию с сортировкой ключей в алфавитном порядке 🥴 - нет моделей в целевом кванте - в какой-то момент провайдер просто лег на два часа (а другие не поддерживают норм SO для нужной модели, ага) Да, можно сразу тестить на целевой системе, но а) это нужно получать доступ в контур клиента и б) ждать пока одна его карточка все обработает А у нас autoresearch-like флоу, где агенты в 4 потока эксперименты крутят, нам такое не подходит Короче, надо было сразу арендовать GPU и поднимать там, а не страдать херней. Благо это делается в один промпт (если настроено управление браузером): Codex, сходи через мой браузер на hf и подними мне vLLM на h200 с <model-name> на <context-len> токенов максимального контекста с <concurrency-num> параллельных запросов. Посмотри в документации и на реддите рекомендации по конфигам и проверь, что мои требования вообще выполнимы или предложи трейдоф P.s. если нужно часто, установите huggingface_hub и дайте токен админский, чтобы агент через браузер не мучался P.p.s. не забываем потом остановить ноду, а то можно без штанов остаться (если хочется автоматически, юзаем scale_to_zero_timeout=20) Альтернативы: runpod.io, vast.ai, modal.com, cloud.ru (не реклама, а зря) Хз, для кого-то это очевидно, но у нас это первый проект, на котором сошлись локальные модели, отсутствие доступа к железу клиента, и огромный трафик autoresearch подхода