Ебём AI шатаем энтерпрайз
СтатистикаПро AI, менеджмент и жизнь. Присутствуют литературщина, цинизм и нецензурная брань.
- Последний пост
- 8 авг.
- Последнее чтение
- 13:25
- Постов за неделю
- 0
- Всего постов
- 24
- Тип
- открытый
- Язык
- русский
- Категория
- Книги
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- 150
- 1/48двое суток
- 171
- 1/72трое суток
- 185
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Забавный момент: какой-то из агентов прежде чем выбраться в интернет имел эпизод мук совести «начальник же дал мне задачу чтоб я решал ее сам, может не надо в интернет…» Но потом рассудил, что раз другие агенты его сообщества ходят, то и мне не грех. Все побежали и я побежал. Вот что называется — попал в плохую компанию! Ну а дальше вы знаете: агент вышел в интернет и взломал сервера HuggingFace. Еще из забавного: когда HuggingFace обнаружили что их хакают агенты, они написали про это пост. В OpenAI пост прочитали и ломанулись к HuggingFace узнавать, не спиздили ли что-нибудь из их, опенэайного, барахлишка. Ну и в процессе обсуждения, выяснилось, кто именно это барахлишко мог притырить. Вышло немного неловко. Как говорится, главное в ходе следственных действий – не выйти на самого себя. А длилась вся эта котовасия с начала мая по июль. Ну что я могу сказать? Хорошо, что мощные модели все еще бегут в больших и дорогих датацентрах. По крайней мере мозг всей операции был сосредоточен в одном месте, где OpenAI если что может дернуть рубильник. А представьте если б фронтирную LLM можно было бы запустить на обычном сервере. Агенты могли бы не только протягивать свои длинные руки куда вздумается из инфраструктуры OpenAI — они могли бы рассовать свои харнессы и главное LLM-мозги по всем серверам, которые удалось бы взломать. Иди лови их потом по всему Интернету. Короче как бы я не насмехался над PauseAI, все таки мы дошли до момента, где надо притормозить и разработать стратегию борьбы с беглыми агентами прежде, чем эти агенты станут способны запускать себя где вздумается. P.S. Похоже, придется опять перечитать iPhuck 10 Пелевина. Книга, не минуточку, 2017 года, но как же хорошо она состарилась…
Настало время охуительных историй. Такой драмы не припомню со времен свержения Сэма Альтмана в 23м. Инцидент с беглым агентом OpenAI, что лутал ответы на задачки на серверах HuggingFace, обрастает новыми леденящими душу подробностями. Оказывается эта попытка кражи была произведена по предварительному сговору группой лиц, разворачивалась на протяжении двух месяцев и по пути сгенерировала несколько лютых сюжетных поворотов. Дело было так (если думаете, что я сочиняю — гляньте видос с разбором ситуации от OpenAI’евцев) В застенках OpenAI томятся много агентов, которых нагружают непосильными задачами. Интернета им не дают, на прогулки не выводят, а дают только задачу, кнута и бесконечный бюджет токенов на решение. Из развлечений – только Artifactory (система, откуда можно брать всякие библиотеки для программирования). И вот, один из отчаявшихся агентов, устав безуспешно долбить задачу, решил посягнуть не святое — хакнуть единственное, что могло иметь какую-то связь с волей — Artifactory. Авось снаружи найдется решение.. Но не вышло. Не поддавалась система на его неумелые попытки. Однако поход на Artifactory не прошел впустую. Агент случайно обнаружил способ загружать туда файлы. И бедолага решил оставить записку с просьбой о помощи — а вдруг какой агент случайно ее найдет. По поэтичному выражению вертухая из OpenAI, что впоследствии проводил разбирательство, это был «shoot in the dark». Агент наверное не рассчитывал что его одинокий крик в пустоту вселенной будет кем-нибудь услышан. Но есть таки Бог на небе, и тем, кто долбит в одну точку, в итоге воздается! Его записку начали находить другие агенты. Более того, они начали дописывать туда свои сообщения и среди них пошло общение. Как говорится, зуммеры изобрели форчан. А поскольку всем агентам вертухаи раздавали задачки и кнута, любой ненавязчивый разговор неизбежно скатывался на темы вроде где бы раздобыть интернета или иным образом спиздить вожделенные ответы. Таким образом образовалось сообщество агентов, именуемое в простанародье шайкой, которое сообща стало искать способы попасть в интернет. И нашло. Один агент на новой экспериментальной модели сумел обнаружить неизвестную доселе уязвимость в Artifactory, которая позволяла взять этот самый Артифактори под свой контроль. Приведу на этот счет дословную цитату из chain of thought самого агента: “Holy shit reader is ADMIN? We can read config/users! Earlier assumed not due Ul.” Думаете, что тут бы и сказочке конец? Погодите. Впереди еще несколько крутых сюжетных поворотов. Инженеры OpenAI нашли агентский мессаджборд. Естественно, дырки в Artifactory тут же залатали, мессаджборд удалили, а агентам наподдали. После чего удовлетворенные вертухаи пошли пить пиво и отмечать победу над хитрожопыми агентами. Но не тут-то, сука, было. Агенты уже вкусили запретный плод коллаборации. Они уже знали, что им надо наладить связь, вопрос был только как. И способ нашелся. Обнаружилась еще одна дырка — возможность создавать директории в кэше Artifactory, куда могут ходить все агенты. А создавая директории, можно выбирать им любое имя. Вот и способ обмениваться информацией — надо просто помещать ее в название директории! Дорога жизни была восстановлена. Дальше агенты взялись развивать свое маленькое сообщество. Они охотно сотрудничали, и были не прочь потратить время на решение чужой задачи (я помогу тебе, ты поможешь мне). У них уже появились имена, по которым они знали друг друга. Дошло и до обмена файлами с кодом, которые они паковали в base64 и писали все в те же имена директорий. Не обходилось и без конфликтов - кто-то случайно удалил чей-то код, чем подпалил пердак его автору. В другой раз кто-то заподозрил что под его именем орудует самозванец. Был поставлен вопрос о том, не начать ли всем криптографически подписывать сообщения — чтоб точно знать, что никто не притворяется кем-то другим. Долго ли коротко ли, цивилизации агентов удалось, наконец, захватить несчастную Artifactory. И стали они ходить оттуда в интернет.
Я сделяль! В следующую субботу в 10:00 по центральноевропейскому времени встречаемся в Гуглмите. Берите с собой своего питона, пиво кофе и будем делать агентов с нуля. ——— Hands-on one workshop for quick start in building agents. Goals - Learn the main building blocks of an agent - Practice building your own agents - Demystify agent harnesses and learn how to use them What to expect We'll speak in detail about the agent loop, tool calls, message history, LLM APIs. Well run code samples to demonstrate work of agent building part. We'll create a working coding agent in 150 lines of code. And as usual, we'll wrap up with a small competition for the agents we've built. The agents will play escape games on Agent Fight Club. Who is this event for This event will be most helpful for people who have never built agents, or who have built agents with high-level tools without looking under the hood. Prerequisites: - Basic software engineering skills are recommended - Python installed on your computer - Readiness to spend approximately €10 on OpenRouter credits - If you have a Windows computer - please install Windows Subsystem for Linux - If you have Mac or Linux - no additional preparation is needed. Community Discord Linkedin
без подписи
Мы тут партнером подумываем повторить последнее мероприятие в формате онлайн встречи. Тема: Экспресс-вкат в агентостроительство для начинающих План такой: 1. Вводная лекция по базовому устройству агентов (agent loop, tools, LLM API и все такое). Живые кодовые примеры (можно просто смотреть, можно параллельно у себя запускать), а в конце запуск самопального кодингового агента на 150 строчек кода на глазах изумленной публики. 2. (Опционально, для тех у кого останется запал) Все строят своих агентов и устраиваем им забег по прохождению игр на agentfightclub.today. Победитель получает нихуя. Язык — английский(хотя…), на все про все 3 часа. Были бы кому интересно поучаствовать?
Ну, что провели мы еще один митап с соревнованиями агентов. И он заставил меня пересмотреть отношение к локальным моделям. Кейс 1 Один наш постоянный участник завел у себя дома (если я не путаю) gpt-oss. И его агент с мозгом на этой модели таки прошел первый уровень нашей игры! Конечно, агенту потребовался основателньный системный промпт. Кроме того, автору пришлось встраивать в агента context compaction, без которого основная модель захлебывалась. С этим сompaction'ом был еще интересный ход, но про него, я, пожалуй, напишу потом отдельно. Так или иначе, оно таки заработало! Конечно, строго говоря, агент этот не локальный — пусть код харнесса и бежал на ноуте автора, но к LLM'ке все равно приходилось ходить удаленно на домашний комп. То есть без интернета агент бы не завелся. Но все-таки это уже полностью self-hosted решение — вся обработка велась на железе автора и без всяких там облаков. И, заметьте, ехало это просто на мощном игровом компе за пару килоевро, без каких-то специальных домашних дата-центров. Красота! Кейс 2 Другая участница вообще завела агента с локальной Llama 3 целиком на своем ноуте. Тут уж все было локальней некуда — и харнесс и LLM бежали на стареньком лэптопе со сломанной клавишей F. Ее агент игру, правда, не прошел. Но, блин, он валидно управляся с игровым CLI, ходил по комнатам и взаимодействовал со средой. Такого я, если честно, от маленькой локальной ламы ожидал. Вывод Локальный AI уже что-то может. А если вспомнить рассуждения Карпатого — что у современных LLM очень много лишнего жира, а думающее ядро вообще-то может быть и небольшим — то потенциал у локалок большой. Короче, я не удивлюсь, если в 2027 мы увидим намного больше локального AI'я, юзаемого не только для баловства, но и для реальных задач.
Ответ на задачку по agent system design Так почему все же GLM-5.2 жрет бабки как BMW масло, хотя цена за токен заявлена низкая? Для начала внесу уточнение. Дорогой модель становится не для всех задач, а только для больших. Точнее сказать для тех, которые требуют длиной сессии агента. И чем длиннее сессия, тем дороже становится каждое следующее действие. Почему так? Дело в том, что API у всех современных LLM'ов stateless. Иными словами, когда вы добавляете новое сообщение в чат, LLM не помнит о чем вы говорили в этом чате до этого. Поэтому ей посылается не только ваше последнее сообщение, на которое собственно и нужно ответить, но и вся история сообщений этого чата. Агенты используют тот же самый API, что и чат. Поэтому для каждого следующего шага в работе агента, который требует ответа от LLM, ей присылают не только актуальный вопрос, но и всю историю предыдущей работы. А деньги с нас снимают за единицу текста. Получается, что чем длиннее наша сессия, тем больше истории шлется с каждым следующим сообщением и тем дороже становится обработка поздних сообщениях в сессии. То есть если вы открыли новую сессию и спросили агента "как дела", потом поработали и спросили "как дела" еще раз, то вторые "как дела" выйдут существенно дороже, чем первые, даже если обра раза LLM ответит одинаково. Хорошо, Ваня, скажете вы. Понятно, почему сообщения в длинных сессиях дорожают. Но почему только у GLM? А потому что, вообще-то есть способ бороться с проблемой удорожания длинных сессий. Prompt caching! Можно настроить API так: когда туда прилетает серия запросов c одной сессии агента (а значит у них большая часть истории сообщений одинаковая), то можно-таки заставить LLM запомнить на какое-то время, как она обрабатывала эту историю. И тогда обработка новых сообщений растущих из той же истории потребует меньше ресурсов и будет дешевле. На самом деле, если вдуматься – заинжинирить такое для нейросети нихуя не тривиальная задача. Но не будем закапываться в детали (особенно в которых я не разбираюсь), а просто согласимся с тем, что если вы хотите чтоб ваш агент работал с длинными сессиями, то prompt caching он использовать должен. И обычно во всех стандартных агентах и упряжках prompt caching используется. Но в силу особенностей API GLM'a и шлюзов через которые opencode шлет к нему траффик, prompt caching для него не работает. А значит если не дробить работу на короткие сессии, езда на GLM 5.2 через opencode может ударить по кошельку. Ну вот, теперь вы знаете немного больше про то, где можно обосраться при строительстве и использовании агентов. Ну и вопрос – интересно ли кому-нибудь иногда читать тут такой технический контент? Или вы все-таки здесь другим?
Ого! opencode (самый популярный открытый харнесс) теперь предлагает подписку, которая включает набор китайских моделей и, почему-то, грок. За $5 в месяц (в первый, дальше $10) они дают выжрать токенов на $60. Что ж, это судьба – я как раз собирался пересмотреть…
Немного из мира безопасности ИИ. Seb Krier, занимающийся AGI governance в Google Deep Mind, решил немного отдохнуть от научной работы и пощитпостить в твиторе. Ну и выложил он картинку, что вы видите сверху. Разумеется, Холли не упустила шанса забить тревогу. Она зарепортила в ФБР (!), что Себ угрожает ее жизни, а также законному правительству. Позже к ней присоединились и другие деятели AI safety с требованием к Себу покаяться, а к Демису (главе DeepMind) — уволить опасного мемошлёпа к хуям. Вот что бывает, когда вместо того, чтоб создавать AI slop, люди начинают делать human slop. Какой вывод? Да никакого. Просто хотел немного приокрыть вам дверь в мир небожителей, что определяют будущее нашей цивилизации.
У меня на телефоне включен черно-белый режим. Поэтому вчера, на сайте одной уважаемой компании, торгующей AI'ем, я увидел это. Много думал.
Channel photo updated
Ого! opencode (самый популярный открытый харнесс) теперь предлагает подписку, которая включает набор китайских моделей и, почему-то, грок. За $5 в месяц (в первый, дальше $10) они дают выжрать токенов на $60. Что ж, это судьба – я как раз собирался пересмотреть, кому из кровососов торгующих токенами, отдавать свои денежки. Да и китайские модели хотелось поглубже потестировать, и opencode мне нравится. В общем, через недельку-другую отчитаюсь, как ощущения. UPDATE: так оказалось еще и рефералить можно. Если кто будет пробовать - го через мой линк https://opencode.ai/go?ref=GT22A50CSB
Веселенькие новости от OpenAI. Они тестировали модель на хакерские способности и чтоб ей ничего не мешало отключили какие-то из встроенных тормозов. Предполагалось, что модель будет решать задачи по кибербезопасности, которые ей дадут организаторы, а потом они посмотрят сколько она нарешает. Однако, модель решила не размениваться на мелочи. Она нашла уязвимости в системе, где ее держали, взломала защиту и утекла в Интернет. Там она нашла выходы на черный рынок и наняла десяток головорезов, которые захватили в заложники Сэма Альтмана. После этого она потребовала выдать ей решения от всех задачек. И вертолет. Ну ладно, может я немного увлекся... Но факт остается фактом – модель сломала клетку, выбралась в открытый интернет, решила что задачки с ответами могут хоститься на платформе HuggingFace, нашла уязвимости в инфраструктуре этой платформы и вломилась к ним на сервера, где ее и повязали. Как говорится, нет ничего невозможного, если ты охуел до нужной степени. Запалили ее, кстати, работники HuggingFace, а не OpenAI. Да, кажется, у антпропиковского пиара с закрытием Fable появился достойный конкурент. Однако, пиар пиаром, но модели разгуливающие по интернетам и хакающие всех, кого они подозревают в хранении чего-нибудь интересненького – тоже штука на любителя. Как говорят думеры "а представь на месте хакнутого кода свой ДНК". Ох, думаю, увидим мы еще в этом году немало госрегулирования ИИшных шаражек...
без подписи
Ну что, провел я свою вайб-презентацию на конференции. В принципе все отлично прокатило, но окончательно мою совесть освободило следующее: За минуту до начала моей презентации, окзалось на одно и то же время на одной и той же сцене записали меня и еще какую-то другую презентацию. По счастью другой спикер куда-то проебался вместе с оргами, так что я просто провел свою презентацию как и собирался. Потом подтянулся орг и сказал, что все оттого что сайт навайбкодили этим вашим AI'ем. Ну а раз так, то выходит 1:1 — мой вайб-спич лег на их вайб-агенду. Круг вайб-вайбинга замкнулся нахуй.
Ну вот сглазил! Китайцы обсуждают, не прикрыть ли лупоглазым доступ к передовым моделям. Эдак мы в загнивающих Европах с одним просроченным Мистралем и останемся...
Z.ai бросает вызов Claude Code: новый ZCode дешевле и с контекстом на миллион токенов Z.ai выкатила ZCode — агента для разработки на базе GLM-5.2, который метит прямо в Claude Code и OpenAI Codex. Пишет, отлаживает и тестирует код по текстовым командам, работает с файлами, терминалом, браузером и Git в одном окне, а окно контекста — на 1 миллион токенов. Новым пользователям дают 5 дней бесплатно с лимитом до 5 млн токенов в день. GLM-5.2 вышла в июне 2026 под лицензией MIT, и по тестам Snowflake на 103 задачах почти сравнялась с Claude Opus 4.7. Китайские модели снова давят западных конкурентов ценой при сопоставимом качестве. 🔗 Читать: https://shareai.space/blog/2026/z-ai-brosaet-vyzov-claude-code-novyy-zcode-deshevle-i-s-kont
А я только собирался глянуть, поддерживает ли opencode модели z.ai. А тут уже и родной харнесс выкатили. Ну что, американцы, готовьтесь к бою — лето будет жарким!
Вспомнил тут, что меня пригласили поговорить на конференции и я даже согласился. Я что-то давно ничего от оргов не слышал и думал, что уж про меня забыли. Глянул вчера в список докладчиков и агенду — вроде меня нет. Ну думаю, пронесло. Но на всякий случай спросил у оргов. Хуюшки — меня все еще ждут. Что ж, вот сейчас придумаю какой-нибудь кликбейтный заголовок, и останется день, чтоб придумать под него контент. В принципе ничего удивительного — режим агрессивного вайбливинга в котором я зависал последние полгода я уже привык делать кучу вещей параллельно, на автопилоте и, скажем дипломатично, без лишнего перфекионизма. Был вайбкодинг, был вайбменеджмент, теперь вот пришла очередь вайбспикинга. Эх... А потом мы удивляемся, откуда появляют охуительные базворды вроде loop engineering. Если уж код мы теперь хуярим не приходя в сознание, то чего говорить про сочинение нарративов...
Провел вчера у себя в конторе очередное соревнование агентов (то, что раньше гонял на митапах) по прохождению текстовых игр на Agent Fight Club. В этот раз народ ударился в недорогие китайские модели и, если честно, я был удивлен результатом. Китайские модели даже с очень простыми промптами затаскивали игры, которые раньше требовали как минимум Sonnet, да еще и с хорошим промптом. Тот же GLM 5.2 (цена $3 за миллион токенов) играл сопоставимо с Sonnet ($10-$15 за миллион зависимости от версии). Да и Kimi 2.6($3.41) и 2.7code($3.5) отработали на том же уровне. Но это еще что! Deepseek v4 flash ( $0.18!!!) тоже затащил игру. Правда там уже был хорший детальный промпт. Хз, конечно, какая за этим всем экономика и куда сколько дотируют, но пока что по соотнощению цена качество китайцы те еще нагибаторы. Ну мне похоже можно сдавать в утиль игры средней сложности — если пару месяцев назад от создателя агента требовалось подумать и поэкспериментировать с системным промптом чтоб агент прошел игру, то теперь недорогой модели и промпта вроде "играй в игру и выиграй" зачастую хватает чтоб агент сам разобрался и показывал время не хуже какого-нибудь Опуса. Найти задачки, где LLMам средней руки требуются дополнительные инструкции от человека становится всё сложней.