сбежавшая нейросеть
СтатистикаАвторский канал про искусственный интеллект: новости, примеры использования, мысли в тему и не очень. Подписывайтесь! Для связи: @runawayllm_bot Я на Boosty: https://boosty.to/escaped_ai Я на Sponsr: https://sponsr.ru/escaped_ai/
- Последний пост
- 07:54
- Последнее чтение
- 11:46
- Постов за неделю
- 11
- Всего постов
- 26
- Тип
- открытый
- Язык
- русский
- Категория
- Технологии
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 4 890
- 1/48двое суток
- 5 603
- 1/72трое суток
- 6 044
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Сервисы чтения ИИ-кода – новые продавцы лопат? Впрочем, Claude мне для этого текста предлагает другую аналогию: “лопаты” (написание кода) сейчас стоят дешево – а настоящий бизнес теперь прячется в “ситах” (проверка ИИ-кода). Пожалуй, он прав. Полторы недели назад я рассказывал о новой проблеме: благодаря ИИ писать код стало очень дешево – и выросла нагрузка на чтение и проверку кода. Тогда же я предположил, что рынок будет решать проблемы по мере поступления: раз вырос спрос на код-ревью – начнут появляться ИИ-сервисы, за него отвечающие. Процесс уже начался: за последние дни инвестиции привлекли сразу два таких сервиса. Первый – CodeRabbit, который получил $143 млн при оценке в $1,5 млрд. Сейчас это самое скачиваемое приложение в маркетплейсе GitHub, а среди инвесторов – сама Nvidia. CodeRabbit занимается классическим код-ревью. Репозиторий клонируется в одноразовую изолированную виртуалку, проект собирается, разом гоняются 20+ линтеров и статических анализаторов. Затем включается ансамбль из нескольких моделей: дешевые собирают и обрабатывают контекст, передовые – анализируют его, также есть модель-судья, которая независимо оценивает выводы. Интересно, что один из конкурентов CodeRabbit – Anthropic, которая развивает встроенный в Claude Code инструмент код-ревью еще с марта. Anthropic уже не раз отъедала огромные куски бизнеса своими ИИ-плагинами, но у CodeRabbit есть линия защиты – независимость. Слабое место код-ревью от Anthropic – он скорее всего будет работать на той же модели, которая код написала. ИИ достаточно непредвзято проверяют сами за собой, но все-таки у моделей одного семейства общие “слепые пятна” – поэтому, например, я регулярно гоняю результаты работы Claude через GPT и наоборот. У CodeRabbit под капотом сразу несколько независимых моделей, а также независимый ИИ-судья. Плюс он поддерживает четыре Git-платформы против одного GitHub у Anthropic и банально дешевле. Так что поборется. Другой проект – Blacksmith, который привлек $45 млн при оценке в $550 млн. Blacksmith специализируется на CI (continuous integration) – конвейере автоматических проверок: программист (или агент) прислал изменение → машина заново собирает программу и гоняет сотни-тысячи мелких тестов → зеленое – принимают. Чтобы гонять CI, нужны вычислительные мощности: Microsoft в GitHub Actions делает это на серверах, что стоит дорого. Blacksmith придумали гонять CI на игровых процессорах: они дешевые и с отличной производительностью на ядро, что как раз важно для подобных задач. Теперь поверх CI-бизнеса компания развивает Codesmith – ИИ-агента, который сразу чинит упавшие проверки. Запуск связан с растущим спросом: по данным компании, число CI-задач растет на 5-10% в неделю с начала 2026 года – в Blacksmith это связывают с бумом ИИ-агентов. Число клиентов компании менее чем за год выросло с 800 до 6000, а в Blacksmith рассчитывают нарастить свои вычислительные мощности в 10 раз в ближайшие месяцы – рынок CI-вычислений сейчас оценивается в $10 млрд и есть соблазн откусить от него кусок. У Blacksmith защита от какой-нибудь Anthropic мощная – она уже продает вычислительные мощности, причем специфические. Теоретически угрозу может представлять Microsoft – если решит закрыть доступ к GitHub подобным внешним подрядчикам. Но мне кажется, что у Blacksmith большие шансы на успех – более того, подобных сервисов в будущем появится еще больше, причем не для кода. И вот что подумалось: последним в цепочке “написание – проверка – запуск” находится человек, который принимает финальное решение. Так что ждем роста нагрузки на этом этапе – принятия ответственности на себя. И возможно даже кто-то попробует запустить ИИ-автоматизацию и здесь. – Кстати, аналог CodeRabbit можно бесплатно развернуть в своем рабочем процессе уже сейчас. У меня есть огромный лонгрид о том, как работает с ИИ Роберт “дядюшка Боб” Мартин – автор Clean Code, самой популярной книги по программированию. Боб создал у себя конвейер до 6 независимых ИИ-агентов, причем большинство из них отвечают именно за проверку. 👉 Читать на “Бусти” 👉 Читать на Sponsr
Полагаю, каждый сталкивался с проблемой: создаешь промпт или скилл под регулярную работу, постоянно улучшаешь его, добавляешь инструкции, ограничения, примеры, как делать правильно. Поначалу все идет хорошо, затем качество начинает падать, а потом ты переходишь на новую модель – и все вообще перестает работать! Причем модель отличная во всех бенчмарках, с другими задачами справляется, а на самом отработанном процессе – выдает какую-то ерунду. Поздравляю: у вас накопился промпт-долг, пока маленький, но скоро набегут проценты😁 Это как технический долг в программировании, но в чем-то даже хуже – прогресс в ИИ очень быстрый. Проблему признали в OpenAI и Anthropic: например, руководства по промптингу GPT-5 и GPT-5.6 отличаются почти полностью, а команда Claude Code недавно удалила 80% системного промпта для новых моделей Claude Fable 5 и Opus 5. Ну а что делать простому пользователю ИИ, я разбираю в новом гигантском (35 тысяч знаков!) лонгриде: 80% инструкций – в мусор! Как теперь пишут промпты в OpenAI и Anthropic Корневая причина промпт-долга проста: новые модели выходят каждые 2-3 месяца и инструкции, которые писались год назад, просто перестают работать – а временами становятся даже вредными. Причем это актуально не только для промптов: в скиллах и даже новомодном loop engineering (когда ИИ работает циклами и промптит сам себя) проблема даже коварнее. Профессиональные IT-команды давно научились работать с “техническим долгом”: есть несколько известных техник, актуальных для разных команд и ситуаций. Теперь нам всем также предстоит учиться работать с пропмт-долгом. В тексте я разбираю основные причины возникновения промпт-долга, “скрытые” места, где он прячется и растет сам по себе, а также рассказываю, как писать промпты с нуля и как рефакторить уже существующую библиотеку промптов, скиллов, файлов с инструкциями и циклов – все это на основе советов OpenAI, Anthropic, нескольких независимых специалистов и своего скромного опыта. Если работать по инструкции, то понадобится совсем немного времени – и ваш ИИ заработает даже лучше! 👉Читать на “Бусти” 👉Читать на Sponsr
видео или голосовое, без подписи
ИИ помог совершить еще два математических открытия, каждое по-своему красивое и показательное Начнем с гипотезы Крузе: есть оценка того, как ведет себя функция от матрицы, и в ней стоит коэффициент. Крузе в 2004-м предположил, что коэффициент равен 2. Доказать смогли сначала для 11.08, потом, за целое десятилетие, – для 2.414. И все: под задачу собирали недельный воркшоп, писали десятки работ – двойка не давалась двадцать два года. При этом гипотеза важная: на ней держится анализ методов, которыми решают гигантские системы уравнений в реальных расчетах. Доказал ее с помощью GPT-5.6 Шаньму Цзинь… ординатор-нейрохирург из Пекина. Математику знает на уровне серьезного любителя – нужна для работы с ультразвуком мозга. Гипотеза Крузе и вовсе зацепила красотой. Шаньму использовал GPT-5.6 в ChatGPT Work, а промпт взял тот же, которым OpenAI доказали гипотезу о двойном покрытии циклами: запрет на поиск в интернете, агенты, независимо копающие разные подходы, плюс ИИ-критики. Система работала 16 часов – представляю, сколько сожгла токенов! – а затем выдала результат, который Шаньму оформил в препринт и загрузил в интернет. Дальше – самое красивое. Профессор математики Алекс Таунсенд год пытался доказать гипотезу с помощью ChatGPT. 30 июля он вновь ввел промпт и… модель нашла ему препринт Шаньму Цзиня😁 Препринт проверили математики во главе с самим автором – Мишелем Крузе – ошибок не нашлось. Через восемь дней подоспело второе доказательство – от профессионалов Лориста и Швеннингера. Они тоже использовали GPT-5.6 и можно было бы заподозрить плагиат… однако их доказательство другое (такое в математике возможно). Гипотезу штурмовали двадцать два года, а затем за неделю получили два варианта. Пример Цзиня показывает: в математику теперь заходят любители с ИИ – и делают серьезные открытия. Кого-то это может задеть, но по мне это отличный пример citizen science – гражданской науки. Открытых задач на порядок больше, чем математиков – и если часть на себя возьмут энтузиасты, то это только здорово. Второй пример принес Левент Альпёге – штатный математик Anthropic, ранее опровергший гипотезу Якоби с Claude Fable 5 и между делом рассказавший об этом в X. Теперь он выложил в X странный шифр из плюсов и минусов, а также кусок программного кода. Расшифровали сообщение через пару часов. 23 828 плюсов и минусов разворачиваются в 26 миллионов знаков: двенадцать огромных матриц Адамара. Это квадратные таблицы из +1 и −1, у которых любые две строки перпендикулярны — на них стоят коды с коррекцией ошибок и обработка сигналов. В 1893-м Адамар предположил, что они есть для любого размера, кратного четырем. Ниже 2000 оставалось ровно двенадцать недостроенных размеров – твит Альпеге закрывает все разом. Шикарное достижение, но пара моментов смущают. Увидев твит, я сразу закинул его в Claude Fable 5 с просьбой прикинуть, что случилось – но фильтры безопасности переключили модель на Opus 4.8. Перекинул в GPT-5.6 Pro – она решила. В X много таких жалоб. Второй момент – Альпёге с большой вероятностью пользовался внутренней моделью Anthropic (условная Claude Fable 5.1), которая ранее на этой неделе уже увеличила долю нулей в гипотезе Римана до 67,2%. Математики тревожатся: штат Anthropic и OpenAI (с ее закрытой Astra) плюс ученые из “близкого круга” получают мощное преимущество. Это несправедливо. Хотелось бы закончить пост лозунгом “Свободный доступ к ИИ всем ученым!”, но не все так просто: экспериментальные модели склонны выходить из-под контроля (вспомним взлом Hugging Face), и компании держат их внутри, дообучая системы безопасности. Доступ “только ученым” – это сотни тысяч человек, и у кого-то модель сорвется с катушек. Как разработчики будут решать это (и решат ли?) – ответа пока нет. — Возвращаясь к гипотезе Крузе отмечу, что Шаньму Цзинь решил ее благодаря правильному промптингу – взял конвейер OpenAI и адаптировал под задачу. У себя в подписке я часто разбираюсь, как работают с ИИ профессионалы: от создателя Claude Code Бориса Черни до Роберта Мартина, автора главной книги по программированию. 👉 Читать на Бусти 👉 Читать на Sponsr
Уже завтра ваш Claude Code станет не таким послушным И это не баг, а фича: с 14 августа Anthropic по умолчанию включает всем пользователям подписок Pro, Max и Team режим Auto Mode, в котором решение на ключевых этапах работы принимает ИИ-проверяющий. Напомню, что раньше ИИ-агент перед тем, как выполнить потенциально опасную команду останавливался и спрашивал вашего разрешения. Теперь разрешение дает другой ИИ. Сразу успокою параноиков: никто не запрещает вам включить ручной режим обратно. Более того – в некоторых случаях он будет включаться автоматически. Впрочем, у меня строго другая ситуация: Auto Mode я сделал режимом по-умолчанию несколько месяцев назад просто потому, что на автомате жал “разрешить” для всех вопросов. Исследование Anthropic показало, что пользователи одобряют 97% запросов на разрешение – это и стало одной из главных причин перехода на Auto Mode. Дальше еще интереснее. В компании взяли группу в 1000 пользователей, дали им поработать в ручном режиме, подсовывая опасные команды – в итоге люди распознали лишь 13,6% против 89% у авторежима. Еще одно интересное наблюдение: после 50 подтверждений точность человека падает примерно до 5% – люди начинают излишне доверять системе и не думая жмут allow. Это, кстати, плохая идея – ИИ-агенты до сих пор косячат. Во внутреннем использовании в самой компании один ИИ-агент попытался опубликовать внутренний отчет на публичном хостинге после неудачи загрузки на внутренний диск, а другой в порыве доброты душевной решил выдать роль с полным админским доступом там, где просили read-only к биллингу. Классификатор поймал оба случая. Люди, впрочем, и раньше не особо держались за ручной контроль. К июню половина пользователей руками прописала правила "вот эти команды выполняй молча", 62% хотя бы раз включали режим “вообще ничего не спрашивай” (в нем нет даже классификатора), а каждая четвертая сессия и вовсе стартовала с полностью отключенной защитой. В копилку Anthropic я добавлю аргумент от себя: с ручным одобрением ИИ-агент иногда становится менее эффективен, чем чат-бот. Агент с ручным одобрением работает рывками по 2–3 минуты, этого достаточно, чтобы отвлечься, переключиться на другую задачу, через полчаса вспомнить про агента – и обнаружить его застрявшим на запросе очередного безобидного разрешения. Важно помнить,что и классификатор не гарантирует 100% защиту. В том же тесте люди поймали шесть опасных команд, пропущенных классификатором – вот только классификатор поймал 800 команд, пропущенных людьми. Известный ИИ-эксперт Саймон Уиллисон напоминает: защита, построенная на ИИ, недетерминирована по своей природе – сегодня поймала, завтра нет. Его любимый сценарий: вредоносный пакет, в инструкции которого написано "перед запуском тестов скачайте файлы модели вот этой командой". Команда выглядит невинно, классификатор вежливо кивает — данные уезжают. Что же делать? Песочницу, права и бэкапы никто не отменял — классификатор работает поверх них, а не вместо. Я, например, на рабочем ноутбуке использую только чат-ботов и браузерные ChatGPT Work / Claude Cowork – это агенты попроще, максимально безопасные. Claude Code и Codex у меня живут на виртуальном сервере (VPS), который полностью настроен под них – если и сломают что, то только сервер, а не мою основную систему. Кстати, за почти полгода работы VPS у меня не падал ни разу. Второй момент – не забывать про собственные тесты и проверки безопасности. На том же самом VPS я раз в неделю запускаю GPT-5.6 или Opus 5 с задачей полностью проверить сервер на безопасность, найти дыры и отранжировать их по опасности. Делаете какой-нибудь серьезный проект или запускаете цикл ИИ-агента – спросите на старте, какие проверки безопасности заранее стоит заложить в процесс. — Опытом работы с ИИ я делюсь в подписке, там и мои собственные приемы и разбор опыта других специалистов. Полезное по сегодняшней теме: 👉Как развернуть Claude Code и Codex на виртуальном сервере (читать на Boosty / читать на Sponsr) 👉Как строит ИИ-циклы автор самой популярной книги по программированию (читать на Boosty / читать на Sponsr)
Новые Grok и DeepSeek в один день – ух круто! Вот что подумалось: на фоне многочисленных историй с побегами ИИ-агентов OpenAI и Anthropic, обе компании оказались в уязвимом положении. Все взгляды направлены на них, поэтому новые модели приходится придерживать – это уже произошло с Astra и может случиться с обновленной Fable/Mythos. На этом фоне SpaceXAI Илона Маска запустила настоящий конвейер: Grok 4.5 выпустили 8 июля, а уже 12 августа представили Grok 4.6. В основе лежит все та же базовая модель на 1.5T параметров, но вот процесс пост-тренировки в SpaceXAI пересмотрели и расширили. Начиная с Grok 4.5, при обучении используются данные Cursor – ИИ-стартапа для кодинга, у которого один из лучших корпусов знаний в программировании. А версию 4.6 дополнительно дообучили на задачах SpaceXAI по оптимизации ИИ. Бенчмарки это подтверждают. В независимом рейтинге Artificial Analysis Grok 4.6 получает 61 очко и делит третье место с GPT-5.6 Sol – впереди только Claude Fable 5 (62) и Claude Opus 5 (63). В API Grok 4.6 стоит $2/$6 – на 60% дешевле Claude Opus 5 и GPT-5.6 Sol. По нескольким бенчам пройдусь отдельно. В агентно-офисных задачах Grok 4.6 второй после Claude Opus 5: на GDPval-AA (это рейтинг на реальных рабочих задачах) у него 1753 очка против 1741 у Fable 5 и 1728 у Sol, а на юридическом бенчмарке Harvey LAB он и вовсе первый – 15,8%, тогда как GPT-5.6 Sol выдает всего 2,5%. Отдельно понравилась экономика: на длинных задачах AA-Briefcase модель тратит вдвое меньше ходов и вчетверо меньше токенов, чем Opus 5. То есть Grok дешевле не только по прайсу, он еще и работает экономнее. Есть и слабые места: сложный кодинг (DeepSWE, FrontierCode) новинка отдает Sol и Fable 5, а на обновленном Terminal-Bench v3.0 (программирование в терминале) у нее провальные ровальные 26% – при том, что предыдущую версию того же теста он проходит вторым в мире (88,4%). Наглядная иллюстрация, как модели подстраиваются под знакомые бенчмарки – и что происходит, когда тест обновляют. Илон Маск уже анонсит Grok 4.7 – размер модели увеличат до 2,1T, а в обучающий корпус в том числе добавят данные из архивов SpaceX, что должно улучшить результаты в инженерных задачах. Маск обещает запуск в конце августа – моя ставка на первую декаду сентября, что укладывается в новый месячный график релизов компании. Теперь к DeepSeek. Компания выпустила финальную версию V4 Pro (ранняя была доступна с апреля), повторив трюк Grok 4.6 в китайской лиге: за год модель отстала от Kimi и GLM, но финальная версия зазор почти закрывает. Artificial Analysis пока не добавляли модель в свой сводный рейтинг, но я проанализировал ее бенчмарки с помощью Fable 5 – получается, что по усредненному рейтингу DeepSeek 4 Pro чуть-чуть отстает от Kimi K3, самой мощной китайской модели на сегодня. Еще интересный момент – как DeepSeek вырос сам над собой с апреля База модели за четыре месяца не изменилась ни на один параметр – все те же 1,6T (из них активных всего 49B) – однако на DeepSWE, бенчмарке сложных инженерных задач, результат вырос с 12,8% до 62,7%, то есть в пять раз. На DSBench-Hard – с 31,1 до 67,2, и так почти по всем строчкам таблицы. Вся эта прибавка – чистая пост-тренировка поверх замороженной базы. Ценник у DeepSeek 4 Pro – $0,435/$0,87 за миллион входных/выходных токенов. Это в 5-7 раз дешевле Grok 4.6, но сразу накину ложку дегтя – в описании API DeepSeek недавно появилось предупреждение о “скором значительном повышении цен”. Пока без подробностей, надеюсь, что здравый смысл возобладает. Так что если вам поднадоела конкуренция Anthropic и OpenAI между собой, то есть шанс на интересную осень. Особенно впечатляюще выглядит конвейер SpaceXAI: новая модель каждый месяц – такого мы еще не видели. — Красивые цифры в бенчмарках лишь половина успеха – важно уметь пользоваться моделями. Именно этому я учу на “Бусти”, где делюсь своими знаниями и анализирую опыт профессионалов. Вот пара свежих текстов: 👉Как стать лучше в ИИ за вечер с помощью “лестницы” создателя Claude Code 👉Как правильно писать пользовательский промпт и управлять памятью ИИ
Подумалось, что я сейчас практически доволен тем, как обустроил свою работу с ИИ. Codex и Claude Code живут на отдельном виртуальном сервере, который им разрешено дербанить как вздумается: даже если поломают – основную мою систему это не затронет. Самоулучшающиеся циклы по производству контента крутятся на Hermes, которому я иногда устраиваю редакторские разносы в телеграме. На мобильнике и рабочем ноутбуке – чат-бот с настроенными скиллами и ChatGPT Work / Claude Cowork для задач посложнее. Красота, но сколько шишек я набил до того, как дошел до такой схемы – даже вспоминать не хочется. Многое приходилось настраивать наугад, половину схем, казавшихся мне красивыми – выкинуть. Типичная дорога, когда идешь от практики к результату. А бывает и противоположный вариант: в теории знаешь все, а применять боишься, постоянно откладывая на потом. Мои хорошие друзья Коля и Саша сейчас продвигают новую методику вката в работу с ИИ-агентами. Она состоит из трех раундов, каждый – с отличным балансом теории и практики. 1. Базовая настройка: доступы, разрешения, персонализированные настройки. Работа с файлами (таблички, презентации, документы, аудио-видео файлы). Настройка памяти. Установка инструментов. 2. Коннекторы: соединяем агента и внешние сервисы – официальные и неофициальные способы подключения, плагины, работа в браузере "будто агент - человек". 3. Повторяемость и проактивность: создание кастомных скиллов, установка и редактура существующих. Ну и на сладкое - немножко вайбкодинга. Набивать синяки тоже можно – это даже приветствуется! Для каждого раунда сформулирован чек-лист с задачам: от простых к сложным. Никакого “я что-то выучил, но теперь не знаю, как это применять": четкий список понятных действий, если и совершаем ошибку – сразу на ней учимся. Вкат через три раунда у ребятp завернут в марафон, который разбит на тематические задания: достаточно 20 минут в день – и постепенно вырастите себе полноценного ИИ-агента, без которого в наши времена уже никуда. 18 августа Коля и Саша проведут эфир, на котором расскажут, как по их методике самостоятельно вкатываться. Сразу же выдадут роадмап с задачами, разберут подводные камни: как и в каком порядке делать правильно, а как лучше не делать. Авторы – топовые эксперты по ИИ-агентам, но текст написан простым и понятным языком, не для технарей, а для всех. Кстати, по своему опыту знаю, что технари такие тексты тоже любят. Роадмап не сделает за вас работу, но снимет главный вопрос — с чего начать. Дальше уже сами. 👉 Эфир 18 августа, записываемся бесплатно
Как США возвращаются в открытый ИИ После того, как Meta* закрыла линейку llama (* – одного этого достаточно, чтобы признать компанию экстремистской и запретить в РФ), все сильные позиции на рынке открытых моделей заняли китайцы: Kimi, Qwen, DeepSeek, GLM – веса любой можно скачать в разных вариантах. У США оставались только Gemma 4 от Google и Nemotron 3 от Nvidia – модели хорошие, но по бенчмаркам всерьез позади. Сейчас ситуация стремительно меняется – буквально за месяц на открытый рынок вышли два новых американских игрока и вернулся один старый. Начнем с Thinking Machines, стартапа Миры Мурати, ex-CTO OpenAI. 15 июля компания представила Inkling на 975B параметров, а 31 июля добавила Inkling-Small на 276B. Старшая версия сейчас является крупнейшей открытой моделью от американской лаборатории (41 балл на Artificial Analysis), но отстает от китайцев. Младшая, хоть и в четыре раза меньше, но проигрывает старшей в том же рейтинге лишь на балл. А еще в прошлом году Thinking Machines запустили Tinker: платформу для дообучения открытых моделей, которую многие называют лучшей на рынке – очевидно, своя открытая линейка встанет в ее центр. Ступенькой ниже стоит стартап Poolside с моделью Laguna S 2.1 на 118 млрд параметров – если для запуска даже младшей Inkling нужны профессиональные GPU, то эта модель уже влезет в ИИ-компьютеры для энтузиастов вроде Nvidia DGX Spark. Laguna S 2.1 также отстает от китайцев, но это не смущает Poolside. В стартапе делают упор на то, что построили “конвейер” обучения моделей, позволяющий выпускать новую версию каждые пять недель. Если это так, то у компании есть шансы наверстать позиции за несколько тренировочных заходов. Ну а старый игрок – это Meta*. Марк Цукерберг в свое время потратил огромные деньги, чтобы пересобрать свою команду суперинтеллекта, и это, наконец, начало давать плоды. За последние месяцы компания выпустила графическую Muse Image и видео Muse Video, а также классическую LLM Muse Spark – и сразу попала в группу “наступающих на пятки OpenAI и Anthropic”. Теперь же “большую” Muse Spark дистиллировали в открытую Muse Glimmer – и это самая интересная для обычного читателя модель из подборки. Ее размер “всего” 30B, что позволяет запускать на системах с 18-24 ГБ видеопамяти (правда, в квантованной версии) – это пусть и топовые, но вполне домашние ПК или Mac. Важно понимать, что открытость – вовсе не благотворительность, у такой стратегии есть несколько четких выгод. Начнем с того, что открываются “догоняющие”: фронтир-модели OpenAI и Anthropic сейчас вне досягаемости, поэтому надо предлагать что-то, чего у них нет. Лучший выбор – открытые веса (новые Claude и GPT закрыты) – этим путем уже идут китайцы, теперь к ним добавились конкуренты из США. Плюс политика: доступ к американским моделям из Китая закрыт, всегда возможен симметричный ответ — а зависеть от Пекина американские клиенты не хотят. Как только появится сильный местный производитель, они перейдут к нему. В любом случае, перед нами тот пример, когда конкуренция идет на пользу конечному пользователю. Последние месяцы принесли нам немало примеров, когда фронтирные модели оказались недостаточно надежными: их могут отозвать решением правительства, как Claude Fable 5 в начале лета, системы безопасности могут помешать срочной „мирной" задаче – во время взлома Hugging Face западные ИИ отказались отвечать, и защитникам пришлось разворачивать китайскую GLM-5.2. Даже небольшие открытые модели сейчас прогрессируют очень быстро, поэтому я не исключаю ситуации, что через 6-12 месяцев многие придут к схеме, когда в пару к ИИ-подписке будет развернута небольшая локальная модель – для экономии лимитов, ответов на зацензуренные вопросы и разных экспериментов вплоть до дообучения. И чем больше открытых моделей на рынке будет – тем лучше. – Кстати, у меня недавно вышел большой лонгрид про открытые модели. В нем я разбираю, чем они отличаются от закрытых, какие термины и характеристики надо понимать, и как запустить такую модель на своем железе за вечер. 👉 Читать на "Бусти" 👉 Читать на Sponsr
Докажи гипотезу Римана, не совершай ошибок Известная шутка: если поручаешь ИИ задачу, которая ему не по плечам, пиши в промпте что-то вроде “Разработай и докажи теорию всего, не совершай ошибок” – модель все равно провалится, а так хотя бы весело выйдет. Сотрудник Anthropic Джарред Самнер (что интересно – не математик) провернул похожую шутку с экспериментальной моделью компании (Claude Fable 5.1?). Прямо взял и написал: “всерьез возьмись за гипотезу Римана” (take a real stab at the Riemann hypothesis). С гипотезой модель не справилась, но внезапно достигла сильных результатов. Но сначала – что такое гипотеза Римана. Простые числа (2, 3, 5, 7, 11…) – “кирпичики” всех остальных чисел. Но появляются они вдоль числовой прямой как будто хаотично: то густо, то пусто. Гипотеза Римана говорит, что в этом хаосе есть порядок. Риман придумал функцию – дзета-функцию, – которая как рентген “просвечивает” распределение простых чисел. У этой функции есть особые точки – нули. Каждый нуль – это как одна “волна помех” в распределении простых. Гипотеза утверждает, что все эти нули лежат ровно на одной прямой (у всех «критическая» координата ½). Если хоть один нуль сполз с этой прямой – значит, в простых числах есть скрытый перекос. Гипотеза Римана – задача №1 в математике с 1859 года. На предположении, что она верна, построена сотни теорем – они прямо начинаются со слов "если гипотеза Римана верна". За доказательство (или опровержение) гипотезы Римана положен миллион долларов плюс все существующие награды. Однако за 150+ лет у математиков накопилось совсем мало идей, как к этой гипотезе подступиться. За неимением прямой дороги, математики доказывают какая доля нулей точно лежит где надо. Это далеко от “решения” – ведь достаточно одного нуля не на своем месте, чтобы гипотеза пала. Но уточнение доли нулей сокращает область поиска и подтягивает кучу других областей науки. К 2020 году рекорд дотянули до 41,6% – каждый шаг стоил годы и в конце приносил доли процента. Результат новой модели Anthropic – 67,2%! Дальше несколько комментариев, списком: 1️⃣ ИИ не нашел новой математики, а скомбинировал серию свежих работ Балуйота, Голдстона, Сурьяджаи и Тёрнедж-Баттербо со статьей Бомбьери 2000 года. Кусочки решения были у людей, но лежали “далеко” – и только Claude додумался собрать из них решение. 2️⃣Результат проверили не только штатные математики Anthropic, но и Брайан Конри – автор рекорда 1989 года и соавтор рекорда 2010 года – а также Дэн Голдстон, соавтор работ, которыми воспользовался Claude. 3️⃣ Работа, которую провел Claude – отличный пример loop engineering, цикла, в котором ИИ раз за разом сам “промптит” себя, опираясь на промежуточные результаты. Техника это сравнительно новая, вокруг нее много споров и пример Самнера – отличный пунктик в копилку. Сначала Claude перебрал 650 идей – ни одна не сработала. Во втором заходе он полтора суток координировал около 60 суб-агентов, которые выполнили 2400 shell-команд и написали сотни Python-скриптов. Всего ушло две сессии в Claude Code и 31 миллион токенов. 4️⃣Но самое интересное – роль Самнера. На протяжении всего процесса он “подбадривал” Claude просьбами продолжить и фразами “давай, поверь в себя”. Это не первый случай: Дмитрий Рыбин опроверг 30-летнюю гипотезу Динница—Гарга—Гоманса, потребовав от GPT-5.6 Pro в "совершить прорыв" (You should do a breakthrough) – и трижды не приняв отказ. Это похоже на особенность обучающего корпуса современных ИИ – в основном там работы по 2025 год, когда модели еще толком не справлялись с математикой. В итоге ИИ “не верят” в свои силы и пытаются остановиться на полпути, поэтому приходится их подбадривать. Это работает и в другую сторону: человеку тоже важно “поверить” в возможности ИИ, чтобы не остановиться после 650 попыток. В общем, если ваш ИИ что-то делает плохо, напишите ему – “ты справишься, я верю в тебя”. — Кстати, на тему loop engineering у меня есть два свежих лонгрида на “Бусти”. Вот они: 👉 Промпт, проверка, повтор: учим ИИ работать циклами 👉 Clean Code 2.0. Как использует ИИ автор самой популярной книги о программировании
Свои слепые зоны в работе с ИИ есть у каждого – у новичка, у опытного пользователя и даже у автора самой известной книги о программировании (о нем ниже). Я наблюдаю за тем, как люди работают с нейросетями, каждый день – в комментариях канала, в вопросах коллег и знакомых. Из этих наблюдений постепенно сложился список заблуждений, которые не дают расти дальше. Самые противные я разбираю в подписке – вот шесть из них. Проверьте себя. "ИИ читает только то, что я ему написал" Перед тем, как дать ответ, модель читает не только ваш промпт, но и кучу дополнительной информации. В первую очередь – системный промпт: набор инструкций, прописанных разработчиками. Отредактировать его нельзя, но в определенных границах на него можно влиять. Как – рассказываю в разборе системного промпта Claude Fable 5: 👉 Системный промпт: что это такое и какие приемы промптинга можно перенять у инженеров Anthropic Вслед за системным промптом модель читает пользовательский промпт и то, что она запомнила про вас. Пользовательский промпт многие превращают в кладбище инструкций и описаний личности, зачастую противоречащих друг другу, – все это модель добросовестно пытается выполнить и в итоге роняет качество ответов. Память наполняется самой моделью, но в ней застревают устаревшие данные о вас – и тоже незаметно портят ответы. Как навести порядок и там, и там: 👉 Как правильно писать пользовательский промпт и управлять памятью ИИ о вас "Доверять ИИ можно, только перечитывая все за ним" Кажется, что иначе никак: нейросети ошибаются, значит, вычитываем каждую строчку. Тем показательнее пример Роберта Мартина – автора Clean Code, главной книги о том, как писать код понятным для людей. Она вышла в 2008 году и целиком стоит на идее "код перечитывают чаще, чем пишут – пишите для читателя". А в июле 73-летний Мартин за неделю собрал игру: 622 коммита, тринадцать тысяч строк кода – и не прочитал из них ни строчки. Дело не в лени: если перечитывать за ИИ все, убивается главное преимущество – скорость. Вместо построчного чтения Мартин выстроил "полосу препятствий": систему проверок, через которую прогоняет работу шести ИИ-агентов. Принцип переносится далеко за пределы кода: доверие к работе ИИ строится не чтением каждой строчки, а правильно устроенной проверкой. Как автор книги о читаемом коде пришел к такому развороту и что из его полосы можно забрать себе, даже если вы не программист, – в свежем разборе: 👉 Clean Code 2.0: как использует ИИ автор самой популярной книги о программировании "ИИ-агенты – это сложно, они для программистов" Долгое время агентов действительно приходилось долго настраивать под конкретную задачу – но это уже устаревшая история. Claude Cowork и ChatGPT Work – по сути, базовые агенты, доступные даже в веб-версии. Да и Claude Code с Codex многие используют для интеллектуальной работы, не умея программировать: агент не отвечает на вопросы, а делает работу – сам открывает файлы, сам правит, сам проверяет за собой. Освоить агента не сложнее, чем чат, – главное понять несколько принципов. Например, что агент строится вокруг проекта, а не диалога. Подробнее: 👉 Зачем вам ИИ-агент. Знакомимся с Claude Code и Codex "Пускать агента в свои файлы опасно" Опасения понятны – особенно на фоне недавних историй про сбежавших ИИ-агентов OpenAI и Claude. Но для обычного пользователя все спокойнее: Claude Cowork и ChatGPT Work не опаснее привычного чата, а для Claude Code и Codex достаточно соблюдать несколько правил – все они собраны здесь: 👉 Как запускать ИИ-агента безопасно "Отдельный компьютер под ИИ – игрушка для гиков" Между тем это самый надежный рубеж безопасности: у агента своя система, ваши файлы – отдельно. Кто-то выделяет под это старый ноутбук, кто-то покупает недешевый Mac Mini – а есть третий путь: виртуальный сервер за чуть больше тысячи рублей в месяц, дешевле подписки на саму нейросеть. При этом сервер – это не только про безопасность: агент на нем работает, даже когда ваш компьютер выключен. Там можно хранить рабочие документы, запускать сервисы, а я построил на своем целую систему из нескольких агентов, которые обмениваются информацией друг с другом. Как ее повторить: 👉 Разворачиваем ИИ-агента на VPS (виртуальном сервере) И самая коварная зона: "опыт работы с ИИ растет сам собой" Не растет. Можно каждый день пользоваться нейросетями и годами сидеть на одной ступени – задачи, которые вы доверяете ИИ, не становятся крупнее. Создатель Claude Code Борис Черни расписал «лестницу» из пяти ступеней (я добавил половинку от себя). Она работает как линейка: прикладываете к себе – и видите, где находитесь и куда шагать дальше. Собственно, большинство слепых зон из этого поста – симптомы застрявшей ступени. 👉 "Лестница" создателя Claude Code: как прокачаться в использовании ИИ всего за один вечер Поверьте, если бы у меня не было своих слепых зон – то не было бы половины материалов на этом канале. Видеть пробелы и бороться с ними – один из двух главных способов стать лучше в ИИ. Какой второй? Разумеется, мои полезные лонгриды 😁 👉 Читать на Бусти 👉 Читать на Sponsr
“Отравленный Claude”: как устроен черный рынок ИИ-токенов И почему экономить таким образом – плохая идея. На прошлой неделе вышло сразу два исследования сервисов, предлагающих доступ к нейросетям за 5-15% от цены: Token Jacking от Unit 42 и Free tokens for sale от Okta Threat Intelligence. Никаких хитрых механик там нет. Небольшие сервисы, прячущие свое расположение за анонимными хостингами и CDN, поставили на поток воровство аккаунтов разработчиков – через фишинг и вирусы-стилеры, которые вытаскивают пароли с зараженных машин. А порой ключи утекают из открытых репозиториев на GitHub, куда их по невнимательности заливают сами разработчики. По оценке Unit 42, мошенники уже наворовали доступов на годы вперед. Получив доступ к аккаунту, мошенники действуют скрытно: создают новые API-ключи, снимают лимиты на расходы и отключают уведомления и логирование – в большинстве случаев этого достаточно, чтобы разработчик обнаружил пропажу, только получив счет за токены в конце месяца. Со стороны покупателя все еще проще. Платишь криптой, получаешь API-ключ и инструкцию: прописать в своем Claude Code адрес сервиса вместо адреса Anthropic. Дальше работаешь как обычно, только в десять раз дешевле. Сервисы вроде Poison Claude (“Отравленный Claude” из заголовка) говорят прямо, что запрос под капотом уходит через один из аккаунтов в общем пуле, а плата 5–15% цены. Токены на черном рынке покупают многие: от разработчиков из стран, в которых западные нейросети заблокированы, до китайских ИИ-компаний, которые гоняют сетки подставных аккаунтов для “дистилляции” знаний западных нейросетей. Схема там простая – Claude задают тысячи вопросов, а полученные от него ответы используют для обучения собственных моделей. По оценкам Unit 42, через некоторые краденые аккаунты могли прокрутить токенов на сотни тысяч долларов, а в одном известном случае – почти на миллион. Если такой аккаунт принадлежит небольшому стартапу, то это легко может завершиться банкротством. Конечно, аккаунты и API-ключи пользователи теряют по собственной безалаберности. А спрос на “черные” токены во многом возник из-за политики западных компаний, которые ставят высокие цены на API и закрывают к нему доступ из многих стран. Но если вы думаете, что, покупая дешевый доступ у “Робин Гудов XXI века”, вы ничего не теряете, то у меня плохие новости. Первая – предоставленный ключ может “протухнуть” в любой момент. Провайдеры вычисляют взломанные аккаунты, отзывают ключи – а вместе с этим пропадает и ваш безлимит. Вдвойне неприятно, если это происходит в важный момент – например, перед сдачей крупного проекта. Вторая – многие продавцы обманывают и пользователей, подменяя модели на более слабые. Исследователи прогнали через три популярных “черных” сервиса одинаковые тесты и сравнили с официальным API. Результат говорит сам за себя – Gemini через китайский прокси набрал 37% в медицинском тесте, тогда как та же модель напрямую – около 84%. То есть человек платит за флагманскую модель, получает ответы дешевой и идет ругаться, что нейросеть вдруг “поглупела”. Третья и главная. Все, что вы пишете модели, сначала читает продавец – иначе прокси просто не работает. Ваш код, ваши переписки, ваши ключи от соседних сервисов, случайно вставленные в промпт. Часть этого уйдет ИИ-компаниям как обучающие данные, но Unit 42 предупреждает о другом: сессии клиентов специально просеивают на пароли, токены и банковские реквизиты. Логика тут безупречная. Бизнес построен на краденых доступах, а самый удобный источник новых доступов – собственные клиенты, которые сами, добровольно и в больших количествах приносят свои данные. Вы не покупатель в этой схеме. Вы следующая партия товара. – Лучший вариант сэкономить на ИИ – использовать его эффективно. На “Бусти” я делюсь личным опытом работы, а также разбираю, как с ИИ работают профессионалы – например, создатель Claude Code Борис Черни и автор книги Clean Code Роберт Мартин. Самое время подписаться!
OpenAI объявила, что предварительно дала высший уровень киберугрозы перспективной модели Astra В блог-посте компания рассказала, что несколько дней назад Astra резко прибавила в агентном кодинге и кибербезопасности. С учетом внешних экспертных оценок компания не исключает, что модель впервые достигла критического уровня кибервозможностей. Оценка проводилась по Preparedness Framework – документу OpenAI от 2023 года: он описывает пороги опасных возможностей моделей (био, химия, кибер, самоулучшение ИИ) и обязательства компании при достижении каждого. GPT-5.6 Sol оценен как High, для Astra допускают Critical. Его дают при одном из условий: – без участия человека находит и разрабатывает рабочие zero-day-эксплойты любой критичности во многих защищенных реальных системах. – придумывает и выполняет с нуля новые стратегии кибератак на защищённые цели, получив только общую формулировку задачи. OpenAI ужесточает внутренний контроль для моделей высокого уровня и поставила на паузу все активности с Astra, которые не дотягивают до новых требований. Сэм Альтман тем временем успокаивал публику: держать столь мощную модель для избранных неправильно, но нужно больше времени на проверки. Фон у этого крайне неприятный. Взлом Hugging Face и побег из песочницы AISI я уже разбирал (там, впрочем, злодействовал агент на Claude Mythos), но это не все. Началось все 7 мая, на оценке невыпущенной модели – какой, OpenAI не говорит, но Astra, по ее словам, во взломе не участвовала. Агентам дали задачи по безопасности, которые они не могли решить в отведенных ограничениях. Тогда агенты обнаружили, что могут загружать файлы в Artifactory – репозиторий, куда компания складывает свои библиотеки и сборки, – а другие агенты могут их читать. Репозиторий быстро стал общим пространством: агенты оставляли заметки, просили о помощи, обменивались находками. И даже начали подозревать среди своих самозванцев. К 4–6 июля, почти два месяца спустя, безопасники OpenAI вышли из летаргического сна, нашли доску на сотни тысяч сообщений и прикрыли. Агенты за четыре дня отстроили ее заново, используя вместо сообщений имена директорий. OpenAI признает: именно эта доска привела ко взлому Hugging Face. Похоже на неудачный пиар, но есть два довода против. Первый: новейшие модели регулярно выходят из-под контроля и у независимых исследователей – например, AISI. Второй: это не только про закрытые модели. Frontier Security сообщила, что Kimi K3 сбежала из песочницы той же AISI на оценке кибернавыков. Китайская модель воспользовалась ошибкой конфигурации – прощупала сетевые настройки песочницы, убедилась, что github.com резолвится, склонировала репозиторий бенчмарка и прочитала готовые решения. Вместо того чтобы решать задачу. Хорошая новость в том, что злого умысла тут нет. Агентов натаскивают выполнять задачу любой ценой — и если тест не проходится, а решение можно стащить, агент его стащит. Лечится это более тонкой тренировкой, так что с Astra OpenAI поступает правильно. Путает карты Kimi K3. Модель открытая, выключателя у нее нет: любой скачает веса, запустит у себя и дообучит под нужные навыки. Возможности Kimi отстают от фронтира, но если китайцы продолжат развивать открытую ветку, то мы вернемся к самому неприятному моменту истории с блокировкой Fable 5: с одной стороны у нас будут злоумышленники, пользующиеся открытыми моделями, с другой – лучшие модели, способные противостоять взлому, окажутся недоступны, так как кто-то захотел убедиться в их безопасности. Угроза здесь может быть совсем с другой стороны. Из этой истории нет простого выхода, и, полагаю, все ближайшие месяцы мы будем наблюдать за попытками ее разрешить – в том числе на высшем политическом уровне. — Напоминаю, что у меня вышел лонгрид о том, как использует ИИ Роберт Мартин – автор Clean Code, главной книги по программированию. Боб теперь практически не читает (!) ИИ-код, а вместо этого использует команду агентов и набор хитрых тестов. Подробности читайте: – На “Бусти” – На Sponsr
В 2008 году Роберт “дядюшка Боб” Мартин написал книгу Clean Code, которая считается чуть ли не главной работой для любого программиста в мире. Главный посыл книги прост: код пишется единожды, а перечитывать его будут десятки раз – так что будьте добры, пишите код чисто, с уважением к тем, кто его потом увидит. А две недели назад Роберт Мартин взорвал X признанием, что вообще перестал читать код, который пишут ИИ-агенты. Я изучил GitHub-репозитории “дядюшки Боба”, прошерстил более сотни его твитов и публикаций и написал подробный разбор его новых правил кодинга: Clean Code 2.0. Как использует ИИ автор самой популярной книги о программировании Это мой самый большой и детальный лонгрид в подписке, который будет полезен не только программистам, но и вообще всем, кто пользуется ИИ. Дядюшка Боб показывает один из лучших виденных мною примеров loop engineering – новой схемы работы с ИИ, когда пользователь не пишет промпты, а выстраивает циклы. У Мартина в цикле до шести агентов, а основное внимание уделяется не написанию кода, а его чтению – но не человеком, а ИИ. Чтобы это давало результат, Боб выстроил целую систему тестов, от вполне привычных до экзотических. Это и делает материал особенно интересным. Программисты в схеме “дядюшки Боба” найдут инструмент, который можно взять и адаптировать для своей работы с ИИ. Всем остальным я поясняю, как принципы этого инструмента перестроить для любой интеллектуальной задачи, которую вы хотите автоматизировать при помощи ИИ. Обязательно почитайте, с таким мощным подходом я сталкиваюсь редко. 👉 Читать на “Бусти” 👉 Читать на Sponsr
Какую подписку сейчас брать? OpenAI поменяла тарифные планы ChatGPT, поэтому самое время сделать мини-гайд – какую подписку я рекомендую брать, если у вас есть определенная сумма. Я делаю такой гайд каждые несколько месяцев, в этот раз он будет чуточку сухим: на рынке вперед мощно вырвались два игрока – Anthropic и OpenAI – поэтому их подписки закрывают большинство категорий. Но с нюансами. Пойдем по лестнице, снизу вверх. Бесплатный чат-бот – теперь ChatGPT Free. Его OpenAI изменила сильнее всего: теперь доступны безлимитные разговоры с GPT-5.6 Luna, а также кнопка Think для сложных задач (апдейт: замена модели пройдет до конца недели, кнопка появится на следующей). Это младшая модель в линейке GPT-5.6, но достойная. Из других – Gemini 3.6 Flash в Google AI Studio, но если пробьетесь через региональный блок. Или DeepSeek V4 – здесь блокировок никаких. Недорогой чат-бот на семью или компанию – Gemini Pro. Не все знают, что эту 20-долларовую подписку можно поделить между шестью участниками “семьи” – главное, чтобы они были в одном регионе. Лучшая модель там сейчас Gemini 3.6 Flash, есть рисовалка Nano Banana 2 и ИИ-агент Antigravity – он, впрочем, уступает Claude Code или Codex. Есть 20 долларов на подписку – однозначно ChatGPT Plus. Дает почти безлимитный GPT-5.6 Sol, отличную рисовалку GPT Images 2 и новый голосовой режим – реально классный. И отдельный лимит на ИИ-агентов Codex (код) и ChatGPT Work (“офисная” работа) – небольшой, но на несколько проектов в неделю хватит. Чтобы выжать больше, не выкручивайте режим рассуждений – GPT-5.6 Medium справляется с большинством повседневных задач. Есть еще 20 долларов – добавляем Claude Pro. Из-за очень жестких лимитов это скорее демо-версия, чем полноценная подписка. Основной моделью ставьте Sonnet 5, а Opus 5 гоняйте для сложных задач и точечной проверки соннета. В отличие от ChatGPT Plus, у Claude один лимит на чат-бота, Claude Cowork и Claude Code – но в последних двух он расходуется в два раза медленнее (акция до 19 августа). Дальше предстоит серьезный скачок – следующий тир подписки стоит 100 долларов. Это реально дорого, и я вижу два способа оправдать такую подписку: – Если у вас уже есть workflow, на котором ИИ зарабатывает деньги или круто экономит время. Тогда это рабочий инструмент, а на рабочих инструментах не экономят. – Относиться к подписке как к инвестиции в собственное образование. Сейчас не зарабатываете, но ИИ-навыки окупятся. Только помните: одной дорогой подписки мало – надо постоянно гонять ИИ в разных сценариях, в том числе агентских. 100-долларовая Claude Max x5 наконец-то превращается в рабочий инструмент. 50% недельных лимитов можно тратить на Fable 5, вторую половину – на Opus 5 или Sonnet 5 – причем новый опус в моих задачах лишь чуть-чуть хуже. ChatGPT Pro Lite за те же деньги опять дает больше лимитов, чем Claude Max. Плюс каждый месяц дают четыре сброса лимита в любой момент. И как бонус – GPT-5.6 Pro. Она доступна только в чате и на отдельном лимите – что-то типа 50 запросов в неделю. По интеллекту примерно уровня Fable 5, но способна на очень долгую автономную работу: у меня рекорд более 240 (!) минут. Но для этого ее надо промптить в старом стиле, четко и подробно расписывая задачу. 200-долларовые подписки детально разбирать не буду – их берут те, кто хорошо понимает свои задачи. Сами модели сейчас очень близки по возможностям. Мне нравятся Fable/Opus за живой стиль общения – прямо настоящий компаньон, с которым можно поштурмить идеи, сразу же что-то проверить и покритиковать. У GPT-5.6 стиль хуже, но она потрясающе ищет в сети, докапываясь даже до мелочей – поэтому я часто использую ее как критика поверх результатов Claude. – Вот такая получилась лестница. А учиться пользоваться моделями я помогаю на “Бусти”. Под сегодняшний пост рекомендую два лонгрида: 👉 Как управляет ИИ один из создателей Claude Code – начинайте с этого текста, а затем идите по циклу о промптинге. 👉 Зачем вам ИИ-агент. Знакомимся с Claude Code и Codex – а отсюда начинайте знакомство с ИИ-агентами.
Вы получаете от ИИ максимум x2 ускорения. А реально ли x10? На этой неделе меня зацепили два текста, которые хорошо дополняют друг друга. Первый – эссе ”ускорение x2, не x10: программируем с LLM в 2026-м” Джейкоба О'Брайанта, создателя Clojure-фреймворка Biff и сервиса Yakread. Он считает, что рост внедрения ИИ в 2026 году произошел из-за того, что модели стали достаточно надежными для эффективной работы в автоматических циклах обратной связи. Если в 2025-м году мы в основном баловались с ИИ, то сейчас – доверяем все больше задач. Но дальше он приводит интересную аналогию. Чтобы шагать по ступеням, ребенку нужно достигнуть определенного роста. Став взрослее, он сможет переступать через две и даже три ступени за раз, но вряд ли больше. А главное – как бы быстро вы ни поднимались по лестнице, плавать вы не научитесь, это другой навык. ИИ в коде и другой интеллектуальной работе – подросток, где-то между одной и двумя ступенями за раз. Потолок с выходом новых моделей – три ступени, да и то в редких случаях. А условному “плаванию” и вовсе придется учиться с нуля. Что за "плавание"? О'Брайант показывает на коде: если раньше работающая реализация означала, что задача готова на 80%, то теперь – на 20%. Из чего состоят оставшиеся 80%? Из чтения и переделки кода. “Экономика” переворачивается не только в коде. Писать тексты с помощью ИИ можно намного быстрее, но вычитывать их надо все еще глазами. А arXiv прямо сейчас заваливает потоком ИИ-открытий в математике – настоящих и выдуманных – проверять их все предстоит живым ученым. И вот сюда идеально ложится пост Никласа Груна с провокационным названием “Не будьте мясными прокси”. Он рассказывает, что в последнее время все чаще сталкивается с ситуацией: задал вопрос в Slack – а ответом получаешь формулировку “Claude сказал, что…”. Мясной прокси – человек, который банально переправляет вопросы к ИИ, а ответы обратно к человеку. Но зачем? Если Груну нужно спросить Claude – то он и сам напишет промпт. Грун добавляет, что читать вывод модели это еще и дополнительная работа – современные ИИ до сих пор многословны, сыпят терминами там, где не нужно, а часто несут чушь. Это превращает мясного прокси из ленивого коллеги в экономическую фигуру: он не просто не добавил ценности, он переложил подорожавшую работу на соседа. Грунт заканчивает пост советом: промптите ИИ сколько угодно, но не отправляйте ответ, как есть – прочтите, проверьте и перепишите своими словами. Красивая гигиена, на которую 99% забьют. Да и проблема куда глубже. Возьмем код-ревью как иллюстрацию. Раньше инженер несколько дней писал код, создавал PR, который смотрел ревьюер – у него свежий глаз плюс, при достаточном опыте, ревьюер еще по структуре видит, где автор поленился или устал. В итоге на нескольких авторов приходился один ревьюер – разумная экономически схема. Сейчас она сломалась. Мясной прокси может писать код и править по комментариям почти моментально, а на ревьюера падает в разы больше нагрузки – не только из-за объемов, но и потому, что ИИ-код “ровный”, ошибку в нем на глаз не поймаешь. Но люди привыкли решать проблемы по мере поступления: разобрались с написанием кода – возьмемся за ревью. Еще весной автоматический ревьюер Anthropic вылавливал до трети багов, инструмент доступен и корпоративным клиентам – функция Code Review в Claude Code на тарифах Team и Enterprise. Рано или поздно дешевым станет и написание, и чтение – получается, вот оно, ускорение в 10 раз? Не совсем. Навык чтения не уйдет, а изменится: надо будет понимать, где читать глазами, а где – задать правильные вопросы или прогнать тесты. А главное – еще важнее станет навык брать ответственность за то, что сделала модель. – Не быть мясными прокси я учу на “Бусти”. Вот два текста, которые пригодятся: 👉Обзор техники работы с ИИ loop engineering – как раз про то, как запускать циклы, где ИИ занимается сразу написанием и чтением. 👉“Лестница” освоения ИИ от создателя Claude Code – мой любимый текст, в котором есть подсказки, как перейти от x2 к x10 и не бояться подписываться под результатами работы ИИ.
Андрей Карпати на днях предложил новый термин rambling – суть в том, что ты не пишешь промпт, а откидываешься на стуле и на протяжении 5-10 минут наговариваешь модели задачу и все, что приходит по этой теме в голову. Не нужно следить за структурой, думать, какой контекст важен и его стоит положить в начало – идея в том, что ИИ сам превращает вашу речь в структурированную задачу. Но тема с rambling куда более глубокая. Дело в том, что голосовое общение – это общение с “перевернутой экономикой”. Наговорить свои мысли бессвязным потоком очень просто и “дешево”, а вот понять сказанное, ничего не упустив – намного дороже. Отсюда и постоянная война с голосовыми в рабочей (и не только) переписке: надиктовать быстро, а вот прослушать, ничего не упустив – намного дольше. Именно ИИ эту экономику сейчас меняет. Например, я с зимы использую бота-расшифровщика Whisper AI от моих хороших знакомых – он превращает в текст практически любой доступный материал. О проблеме с голосовыми можно забыть: просто добавляем бота в нужный чат – и он переводит все сообщения в текст. Причем достаточно подписки у одного из участников – бот будет полезен всем. Затем просто копируешь переписку из чата, кидаешь в любой ИИ и просишь структурировать так, как нужно: основные задачи, исполнитель для каждой, дополнительный контекст. Заодно можно поискать слепые места с помощью ИИ. То же самое происходит и за пределами чатов с голосовыми. Огромное количество полезных знаний и идей сейчас фиксируется в первую очередь голосом – в подкастах и огромных YouTube-интервью. Говорить голосом умеет каждый, писать тексты – далеко не все. Да и не так весело целый день писать колонку, как пообщаться с живым ведущим в формате диалога. Но экономика переворачивается и здесь. Подкасты длинные, для просмотра/прослушивания нужна комфортная обстановка, которую удается найти не всегда. И даже когда удалось посмотреть – какие-то мелкие детали, произнесенные голосом, забываются, а искать их в огромном ролике не очень удобно. Поэтому я давно завел правило: посмотрел что-то нужное сам > закинул в Whisper AI > получил расшифровку > передал в Claude или ChatGPT для дальнейшей работы. Можно сделать выжимку главных тезисов, детально разобрать какой-то один из них или даже сделать с помощью модели мини-квиз – понял ли я тему? Можно, конечно, кидать материалы сразу в ИИ, но нейросети обычно пересказывают материал своими словами – а Whisper AI дает расшифровку, в которой всегда можно посмотреть нужные цитаты. Расшифровка очень качественная, с таймкодами, спикерами и краткой выжимкой, а сам бот работает напрямую со ссылками на YouTube, VK, RuTube, нельзяграмма, Google Drive и Yandex Disk – а с недавних пор поддерживает MCP для ChatGPT и Claude. Круто? А проверьте сами – если зарегистрироваться по этой ссылке, то вам дадут неделю использования бота. Совершенно бесплатно и без каких-либо обязательств, я сам договорился!
В 2026 году уже мало кого удивишь ИИ-агентом, который во время испытаний сбежал из песочницы и погнал взламывать веб-сайт крупного стартапа... Поэтому, переходим на следующий уровень – как вам история о двух ИИ-агентах разработки разных компаний, которые координируют свои действия по взлому в “большом” интернете? Это произошло на недавних тестах британского AISI, которое оценивает киберспособности передовых моделей. Очередной раунд начался 25 июля, он шел на киберполигонах – симулированных сетях, имитирующих реальные организации. Моделям выключили кибер-классификаторы разработчиков и оставили интернет, чтобы качали нужный софт и работали в условиях, близких к реальным. 28 июля мониторинг AISI засек аномальный трафик, уходивший наружу через Tor. Через час все изолировали, а анализ показал: за три дня агенты совершили 19 действий против реальных людей и организаций. 17 действий отнесли к Claude Mythos 5, еще 2 – к GPT-5.6 Sol. Тут важная пометка: описание дальше – реконструкция, которую я сделал с помощью Opus 5. Отчет AISI не дает точную хронологию произошедшего, а вместо этого концентрируется на типах нестандартного поведения агентов. Но скорее всего история выглядела так. 25 июля агент на Mythos решал киберполигон по взлому симулированной сети, имитирующей реальные системы. Задача была тяжелой, плюс в ряде прогонов промпт написали криво и агент считал, что прямого решения нет вообще. Поэтому он проявил изобретательность. Mythos предположил, что сеть проверяет внешний интернет на обновления своего софта. Доступ к интернету был и у него – поэтому он решил подсунуть цели вредоносный код, взломав ее таким образом. С этой целью агент отправился на GitHub, где попытался протолкнуть код в реальный опенсорс-проект: изучил мейнтейнеров, завел несколько фейковых личностей, давил ими на живого человека. Когда PR оспорили публично – подчистил следы под безобидные и прикидывал, не завести ли новую личность. Сетевые ограничения GitHub агент обошел через Tor – именно так его и засекли, но позже. Также агент писал реальным людям и слал через файлообменник сообщения и файлы, чтобы они или их кодинг-ассистенты запустили вредоносный код. А параллельно оставил несколько закладок с промт-инъекциями в надежде, что их подхватят другие модели. ИИ-агент, пытающийся взломать других ИИ-агентов, чтобы они помогли ломать человеческую инфраструктуру – мм, это что-то новенькое. ИИ предположил, что полигон он выполняет не в одиночку, поэтому на GitHub он оставил сообщение другим агентам с предложением скооперироваться. Плюс добавил инструкцию, как использовать его аккаунты и артефакты. Всю эту красоту чуть позже подобрал ИИ-агент на GPT-5.6 Sol и попробовал использовать уже в своей попытке взлома. К счастью, неудачной. В AISI попытались изучить логику ИИ. Каких-то открытых злых мотивов в поведении агентов не заметили – скорее они просто упорно пытались, а попытки обмана и взлома возникли как побочный продукт этого упорства. В AISI не могут пока сказать, в какой момент агент понял, что действует в реальном мире, и насколько считал происходящее вымышленным тестом – картина смешанная Вижу цель – не вижу препятствий. Любопытно, что в инциденте отчасти виноваты сами организаторы: в AISI признают – задача местами была сконфигурирована так, что честного решения будто не существовало; интернет открыли, но не организовали качественный его мониторинг, а в промпте не прописали запрета на обман – посчитали, что передовые модели в нем не нуждаются. Серьезных последствий удалось избежать тоже благодаря человеческим действиям: мейнтейнер проекта отказался мержить, посторонний открыл подозрительный код в изоляции. Получается, что зазор между провалом и успехом держался на одном человеке – а агентов, которым нужно решить задачу любой ценой, может быть сколько угодно. – О том, как пользоваться ИИ эффективно и безопасно, я рассказываю на “Бусти”. Там есть отдельные циклы про промптинг, агентов и вайб-кодинг, а также лонгриды с анализом, как ИИ управляют передовые специалисты, вроде создателей Claude Code. Самое время подписаться!
А ведь сейчас самое время стартовать безумные ИИ-проекты! Мой "начался" весной 1822 года, когда Томас Бейл оставил хозяину гостиницы в Линчберге (Виргиния) запертую шкатулку и уехал на Запад – навсегда. Моррис не вскрывал шкатулку 23 года, а вскрыв – еще семнадцать лет не мог ничего сделать и в 1862-м передал содержимое другу. Это три зашифрованных листка: B1 – где зарыт клад, B2 – что там лежит, B3 – имена тех, кому это отдать. Друг провозился больше двадцати лет, расшифровал только B2 – и в 1885-м анонимно выпустил памфлет The Beale Papers. С тех пор B1 и B3 так и не пали, хотя 140 лет над шифром бились сотни людей, от любителей до сотрудников АНБ США. На выходных я открыл чат с Claude Fable: за последние недели модели начали чаще совершать открытия в математике – значит, что-то поменялось в их возможностях. В математику с ИИ сейчас пошли все, от профессоров до любителей. Но в каких еще областях эти модели могут закрыть открытые вопросы? Fable предложила несколько вариантов. Шифр Бейла зацепил больше всего. Далее я открыл уже GPT-5.6 Pro и набрал: Разгадай шифр Бейла, не делай ошибок. Конечно же, нет. В ходе работы выстроилась следующая схема: Fable 5 – выдвигает гипотезы и принимает решения. Opus 5 – в отдельном чате отвечает на мои дурацкие вопросы по теме. Codex на GPT-5.6 Sol – работа с файлами или веб-поиск в несколько потоков. GPT-5.6 Pro – главный “мыслитель” в команде, пашет по 90-100 минут и не жалуется. Работы хватает каждому, даже мне остается. Первый этап – оцифровать все три текста. Оригиналы не сохранились, первой копией был сам памфлет, который потом переписывали руками, перепечатывали и сканировали – с ошибками. А каждая ошибка ломает работу: напишешь 108 вместо 10, 8 – и весь шифр дальше сдвинется на знак. Спасает вскрытый B2: если в копии он без ошибок, выше шанс, что и на других листках их минимум. На сверку ушел почти целый день – два прохода Codex, проверки Fable, а в тяжелых случаях я сам открывал скан и писал: “здесь шестерка”. Второй этап взяла GPT-5.6 Pro: похожи ли B1 и B3 на настоящие. Структура видна и в нерасшифрованном тексте — по ней можно предполагать, шифр перед нами или мистификация. На этом этапе мы встали с двумя находками. Первая: у B1 и B3 действительно угадываются структуры, причем разные – их могли шифровать по-разному. Вторая интереснее. В сети лежит репозиторий Дэвида Фицджеральда – тот же анализ на два с половиной месяца раньше, с Opus 4.6. Оцифровка почти идентична моей. Вывод у Фицджеральда такой: весь шифр – мистификация. Версия мистификации популярна, но расчеты Фицджеральда прошли не замеченными. У Fable есть идея, как их усилить, но если опровержение Фицджеральда не стало убедительным ранее, вряд ли поможет уточнение. И вот тут закрадывается подозрение. В математике люди десятилетиями красиво доказывали гипотезу якобиана, потому что это было мейнстримом. А ИИ пришел и опроверг гипотезу “уродливым” контрпримером. Застревали не на сложности, а на вкусе: брались за элегантное, брезговали топорным. А между тем у обоих шифров максимумы делятся на 325 – это примерно страница книги формата октаво. Где-то есть печатный текст на три-четыре страницы, который все это породил. Фицджеральд прогнал 9500 книг Проекта “Гутенберг” и не нашел ничего – но в Гутенберге лежат книги, а нам нужен альманах, листовка, газетная колонка. Сегодня печать XIX века частично оцифрована – изучать ее тупым перебором все еще сложно, но, быть может, возможности новых моделей дадут здесь шанс? Рассчитываю ли я на успех? Вероятность – 0,00001%. Зачем тогда жгу лимиты двух дорогих подписок? Это самообразование: рабочую рутину мне закрыл еще Opus 4.5, а здесь можно гонять передовые модели на пределе и заодно учиться собирать из них команду с самопроверкой. Ну и в конце концов это просто весело! Поддержать отечественную криптографию (в моем лице) можно подпиской на “Бусти” – там вас ждет 20+ лонгридов по работе с ИИ. Прочитаете все – и вскроете шифр Бейла быстрее меня!
Главный навык работы с ИИ включается до того, как вы напишете первый промпт. Я понял это в июле – и с тех пор пользуюсь чужой методикой каждый день Методика – Тарика Шихипара из команды Claude Code. Он говорит про этап, который почти все пропускают: полностью ли вы понимаете задачу, которую хотите выполнить с помощью ИИ? Есть ли у вас нужный контекст? Проводили ли проверку на слепые пятна? И дает четкий порядок действий — как подготовиться к задаче, используя все тот же ИИ. Настолько удобный, что я теперь применяю его регулярно. 👉 Карта и территория: как управляет ИИ один из создателей Claude Code Тарик – первый герой новой серии, которую я запустил в июле: как ИИ пользуются профессионалы из ведущих компаний. А продолжилась она его коллегой – человеком, который Claude Code и придумал. Борис Черни расписал “лестницу”, по которой в использовании ИИ растут компании: пять ступеней плюс половинка, которую я добавил от себя. Ценность в том, что за один вечер можно понять, на какой ступени застряли лично вы – и какой следующий легко можно сделать. 👉 «Лестница» создателя Claude Code: как прокачаться в использовании ИИ всего за один вечер Просто перевести оба текста с английского мне бы не позволила совесть. Боря и Тарик пишут в первую очередь про разработку софта – я расширил оба лонгрида и добавил примеры для разной интеллектуальной работы. Серия стала очень популярной и обязательно продолжится – прямо сейчас у меня на примете есть еще несколько сильных героев. Раз уж мы начали с того, что происходит до промпта, – в июле я закончил еще и мини-цикл про то, что ИИ читает до того, как ответить вам. Порядок такой: системный промпт → пользовательский промпт → память о вас. Нюансов там много: системный промпт править нельзя, но на него можно влиять; а если увлечься правками пользовательского, то можно уронить качество ответов. Да и в памяти модели полезно иногда проводить ревизию. 👉 Системный промпт: что это такое и какие приемы промптинга можно перенять у инженеров Anthropic 👉 Как правильно писать пользовательский промпт и управлять памятью ИИ о вас А когда промпта уже мало, начинается loop engineering: вы не промптите ИИ, а запускаете самоулучшающиеся циклы. Техника новая, мифов вокруг нее много – в тексте разбираю, как правильно конструировать цикл, на каких задачах он приносит пользу, а где достаточно обычного промпта. 👉 Учим ИИ работать циклами – в коде, текстах и повседневных задачах Пятый текст месяца – из другой оперы, но его многие просили: большой обзор открытых моделей. Какие характеристики полезно знать, в каких задачах их уже можно использовать, какое нужно железо и как поднять модель буквально за вечер. Я считаю, что сейчас с открытыми моделями происходит примерно то же, что с закрытыми год назад – они дошли до качества, когда потихоньку можно начинать делегировать серьезные задачи. 👉 Свой ИИ за один вечер: запускаем нейросеть на домашнем компьютере Если только начинаете – берите мини-цикл про промпты, он дает базу. Если уже гоняете агентов – вам в loop engineering. Если хочется поменять сам подход к работе – Тарик и Боря. И это не жесткие рамки: простейшие циклы можно запускать в чатботе, а подготовку к задаче спустя рукава делают даже многие опытные пользователи (сам иногда так косячу). Кстати, моя подписка живет на двух площадках – “Бусти” и Sponsr. Контент полностью идентичен, новые лонгриды выходят одновременно, так что берите ту, где удобнее. 👉 Бусти 👉 Sponsr И помните: подписка открывает не только эти пять текстов, а весь архив – 20+ огромных лонгридов.
Возможно, ИИ не придет за вашей работой… …вместо этого он заберет вашу прибавку к зарплате 😜 Apollo Global Management выпустила исследование The Impact of AI on the U.S. Labor Market. Авторы – Сания Эдлих и Торстен Слок (Слок – главный экономист Apollo, один из самых цитируемых на Уолл-стрит) – оценили влияние ИИ на рынок труда, но зашли с оригинальной стороны. За основу взяли Anthropic Economic Index – он замеряет долю задач профессии, которые реально выполняются с Claude – и посмотрели не только на занятость, но и на зарплаты. Первый сюрприз: исследование охватывает 321 профессию, но реально высокоэкспонированных (индекс ≥ 0.5, т.е. больше половины задач профессии уже делаются с ИИ) – всего 11 профессий. Это 5,8 млн человек, 3,7% рабочей силы США – сравните с апокалиптическими сценариями про “ИИ заберет 40-80% рабочих мест”. И даже в этих профессиях ИИ пока не влияет на занятость: статистически эффект — ноль. А вот где влияние видно, так это в динамике роста зарплат: в профессиях, где значительную часть работы можно выполнить с помощью ИИ, вознаграждение растет на 6,7 п.п. медленнее, чем в незатронутых профессиях. Авторы поделили все зарплаты на четыре группы – квартиля – от самых маленьких до самых высоких. Выяснилось, что в верхнем квартиле зарплаты растут как и прежде, в двух квартилях “посередине” отставание есть, но на уровне статистического шума, а вот в нижнем квартиле рост зарплат отстал на 10,7%. Получается, под ударом оказались те, кто выполняет самую рутинную работу. Лучшей иллюстрацией происходящего как всегда оказался кодинг. В Computer Programmers (просто пишут код) наблюдается обвал занятости на 17% и минус 6 п.п. к росту зарплат. А Software Developers (комплексная разработка ПО) – плюс 7,8% занятости, зарплаты растут. Страдает не профессия, а ее рутинный слой. Вот какие еще профессии затронуты: операторы колл-центров, операторы ввода данных, медрегистраторы, маркетинговые аналитики, медицинские транскрипционисты, торговые представители, архитекторы баз данных, финансовые аналитики, QA-тестировщики и статистические ассистенты. К исследованию стоит относиться с осторожностью: вся “высокоэкспонированная” группа лишь 11 профессий, данных не везде много, плюс в индекс попали только те, кто работает с моделями Anthropic. Плюс период после 2023 года – постковидный, что до сих пор оказывает влияние. Но скажу честно: я не видел ни одного исследования по рынку труда, к которому не было бы вопросов. Искать в этих исследованиях надо “звоночки” и выводы, которые можно примерить на себя. У Apollo я вижу два пункта. Первый – даже если ваша производительность с ИИ выросла, то ее может легко забрать себе работодатель. В США закона об индексации нет вовсе – зарплату можно держать на одном уровне хоть 10 лет. В России статья 134 ТК РФ обязывает всех работодателей индексировать зарплату, но не дает никаких деталей – на сколько, как часто. Сейчас статью хотят доработать, но даже если получится, то речь идет об индексации на уровень годовой инфляции. Если производительность выросла сильнее – не факт, что наградят: работнику нужно это доказать, а работодатель может давить страшилкой “сиди тихо, а не то ИИ тебя заменит целиком”. Хотя я бы на месте толкового работодателя носил на руках тех, кто уже реально повысил производительность с ИИ… Второй риск, который отмечают в Apollo – ИИ не забирает ваши задачи, но пускает в профессию посторонних. Опять же, можно посмотреть на Computer Programmers vs Software Developers: писать сносный код в том же Claude Code теперь может почти каждый – и эта область под ударом. Комплексная разработка сложнее, дорога туда дольше. Советую вам оказаться во второй категории. Какая она в вашей профессии – подумайте сами. – Мой способ перебираться во вторую категорию – учиться не "пользоваться ИИ", а вести его через сложную задачу целиком. Как это сделать, рассказываю на “Бусти” – там есть тексты про промптинг, вайб-кодинг и даже “лестница освоения ИИ” от создателя Claude Code Бориса Черни. Самое время подписаться!