- Последний пост
- 15 авг.
- Последнее чтение
- 11:56
- Постов за неделю
- 2
- Всего постов
- 22
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 258
- 1/48двое суток
- 295
- 1/72трое суток
- 318
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
У китайской Z.ai вышла GLM-5.3. В программировании и агентных задачах она снова оказывается рядом с сильнейшими американскими моделями. При этом GLM-5.3 построена на той же базовой модели, что и GLM-5.2. Самый дорогой этап обучения заново не проводили: рост качества получили за счёт последующего обучения — большего числа задач и сред, длинных последовательностей действий и масштабирования обучения с подкреплением. На Terminal Bench 3.0 результат вырос примерно с 4,6 до 28,3, на DeepSWE — с 46,2 до 66,9. Этот пример хорошо показывает, как меняется гонка больших языковых моделей. Несколько лет назад преимущество почти напрямую связывали с масштабом предварительного обучения: больше данных и вычислений — сильнее модель. Сегодня всё больше результата создаётся после него: в учебных средах, системах проверки, обучении с подкреплением и скорости экспериментов. Это частично объясняет, почему китайские лаборатории продолжают держаться рядом с фронтиром, несмотря на ограничения в доступе к передовым ускорителям. Вычислительное преимущество США остаётся огромным, но оно уже не обязательно превращается в такое же преимущество в качестве доступных моделей. Есть и второй фактор — скорость. Китайские лаборатории зачастую выпускают модели почти сразу после завершения обучения, тогда как американские компании тратят больше времени на тестирование, безопасность и продуктовую интеграцию. Поэтому публичный фронтир и реальный исследовательский фронтир — не совсем одно и то же. Китайские лаборатории всё меньше выглядят как игроки, которые просто пытаются воспроизвести американские модели с задержкой в несколько месяцев. У них появляются собственные исследовательские школы, инфраструктура обучения с подкреплением, семейства моделей и высокая скорость экспериментов. А ограничения на вычисления, возможно, заставляют их особенно активно искать способы получать больше качества из уже обученной модели. В статье Interconnects Натан Ламберт разбирает GLM-5.3 именно как часть более широкого вопроса: как китайские лаборатории продолжают сокращать разрыв с американским фронтиром и почему объяснение «они просто дистиллируют западные модели» уже выглядит слишком простым.
Anthropic опубликовал подробный разбор внутренней системы self-service аналитики на базе Claude. По данным компании, через неё проходит около 95% внутренних аналитических запросов, а средняя точность на внутренних тестах составляет примерно 95%. Чтобы получить такой результат, Anthropic пришлось серьёзно переработать данные, документацию, семантический слой и сам процесс анализа. Одна из первых находок: качество аналитического агента чаще ломается не на SQL. Если Claude правильно понял вопрос и нашёл нужные данные, написать запрос обычно несложно. Основные ошибки возникают раньше. Anthropic выделяет три класса проблем: неоднозначность между бизнес-понятием и конкретной сущностью в данных, устаревшие определения и источники, а также ошибки при поиске нужной информации. Например, вопрос «сколько у нас активных пользователей?» требует не только COUNT DISTINCT. Нужно определить, что считается активностью, за какой период она измеряется, какие аккаунты исключаются, какой источник считается основным и не менялось ли определение метрики. В большой компании такие детали обычно распределены между документацией, кодом, старыми запросами и знаниями команды. Поэтому Anthropic начал с сокращения числа конкурирующих источников данных. Компания рекомендует выделять основные наборы данных и явно фиксировать для них уровень детализации, определения метрик, происхождение данных, владельцев и правила использования. Если для одной бизнес-сущности существует много почти одинаковых витрин, один только поиск по ним проблему не решает. Следующий слой — семантический. Если вопрос можно выразить через уже определённую метрику, агент должен использовать её в первую очередь и переходить к сырым таблицам только при необходимости. Anthropic попробовал автоматически построить такой слой с помощью LLM на основе таблиц и истории запросов. Результат оказался хуже ручной разметки: модель генерировала правдоподобные определения, но сохраняла существующие неоднозначности. Claude можно использовать для подготовки документации, но ответственность за определения ключевых бизнес-метрик Anthropic оставляет людям. Отдельный эксперимент был связан с историей SQL-запросов. Claude получил доступ к тысячам запросов из панелей, аналитических ноутбуков и конвейеров преобразования данных. Точность выросла меньше чем на один процентный пункт. При этом примерно в 80% ошибочных случаев необходимая информация действительно присутствовала в доступном корпусе. Проблемой оказался не недостаток контекста, а выбор правильного контекста. После этого Anthropic перешёл к более жёстко структурированной документации. Для отдельных предметных областей создаются справочные файлы с описанием того, какие таблицы использовать, что означает одна строка, какие связи между таблицами допустимы, какие фильтры обязательны и какие ошибки здесь уже встречались. Особое место занимают разделы с типичными ловушками — gotchas. В них фиксируются детали, которые редко видны из схемы данных, но напрямую влияют на результат анализа. Например, когда похожую таблицу использовать нельзя, какие идентификаторы дают разные результаты, какие данные обновляются с задержкой или какие домены нужно исключать из выборки. Для навигации по этой информации Anthropic использует skills. Один skill помогает Claude найти правильный источник: сначала проверить семантический слой, а затем, если нужного определения там нет, обратиться к ограниченному набору справочных файлов по нужной области. Другой задаёт порядок анализа: уточнить вопрос, выбрать источник, провести расчёт и проверить результат. В него же входят типовые аналитические процедуры, включая анализ удержания, воронок и разложение изменений показателей на составляющие. продолжение в комментариях...
Самой сильной кости здесь не существует На первый взгляд в задаче всё выглядит как вполне приличный рейтинг: кость A обыгрывает B, B обыгрывает C, а C — D. Причём каждая делает это с вероятностью 2/3. Остаётся только расставить кубики по местам, вручить A золотую медаль, отправить D в нижнюю часть турнирной таблицы и разойтись. Но у нас есть контрпример. Возьмём знаменитые кости Эфрона. Их придумал Брэдли Эфрон (на фото) — американский статистик, много лет работавший в Стэнфорде и вошедший в историю прежде всего как создатель бутстрэпа, одного из важнейших методов современной вычислительной статистики. За вклад в теоретическую и прикладную статистику Эфрон получил Национальную медаль науки США. На фоне таких достижений набор необычных кубиков выглядит почти математической шуткой. Но именно эта шутка удивительно наглядно показывает, почему попарные сравнения могут нас обманывать. Кубики устроены так: A: 0, 0, 4, 4, 4, 4 B: 3, 3, 3, 3, 3, 3 C: 2, 2, 2, 2, 6, 6 D: 1, 1, 1, 5, 5, 5 Начало полностью подтверждает нашу иерархию. На кости B всегда выпадает 3, а A показывает 4 в четырёх случаях из шести. Поэтому вероятность того, что A обыграет B, равна 2/3. Дальше B обыгрывает C: тройка сильнее двойки, а двоек на кости C тоже четыре из шести. Снова 2/3. С парой C и D расчёт немного интереснее. Если на C выпадает 6, она выигрывает при любом результате D. Если выпадает 2, она побеждает только единицу. Вероятность первого случая равна 2/6, второго — 4/6 × 3/6. В сумме снова получается 2/3. Пока всё выглядит так, будто A действительно должна быть сильнейшей. Но теперь сравним D и A. Половина граней D содержит пятёрку, которая побеждает любой результат A. На остальных гранях стоит единица: она проигрывает четвёрке, но выигрывает у нуля. Поэтому вероятность того, что D обыграет A, тоже равна 2/3. Вместо аккуратной лестницы возникает кольцо: A > B > C > D > A. Каждая кость обыгрывает следующую с вероятностью 2/3 и с той же вероятностью проигрывает предыдущей. Сильнейшего кубика в наборе нет — есть только удачные и неудачные соперники. Попробуйте самостоятельно сравнить A с C и B с D, там тоже результат неинтуитивен. Сама идея циклических сравнений старше костей Эфрона. Похожий эффект давно известен в теории голосования как парадокс Кондорсе: большинство может предпочитать A варианту B, B — варианту C, а C — варианту A. Набор Эфрона получил широкую известность после колонки Мартина Гарднера о нетранзитивных костях, опубликованной в Scientific American в 1970 году. У этой конструкции есть ещё одна любопытная игровая особенность. Представим простую игру для двух участников. Перед ними лежат четыре кости Эфрона. Первый игрок выбирает любую из них, после чего второй, уже видя его выбор, берёт одну из оставшихся. Затем оба одновременно бросают свои кости, и побеждает тот, у кого выпало большее число. Кажется, что преимущество должно быть у первого игрока: именно он может выбрать лучшую кость. На деле всё наоборот. Какую бы кость он ни взял, у второго всегда найдётся ответ, который выигрывает у неё с вероятностью 2/3. @pique_analyst
видео или голосовое, без подписи
У нас есть четыре необычные игральные кости — A, B, C и D. В отличие от обычного кубика, на их гранях могут стоять любые числа от 0 до 6, причём некоторые из них могут повторяться. Например, одна из костей может выглядеть так: 1, 1, 2, 2, 3, 3. Правила игры просты: два игрока выбирают по одной кости, бросают их, и побеждает тот, у кого выпало большее число. Известно, что: кость A обыгрывает B с вероятностью (2/3); кость B обыгрывает C с вероятностью (2/3); кость C обыгрывает D с вероятностью (2/3). Кажется, перед нами вполне понятная иерархия: A сильнее B, B сильнее C, а C сильнее D. Но следует ли отсюда, что A обязательно сильнее D?
Новая рубрика: парадоксы вероятности и статистики Теория вероятностей и статистика — науки во многом неинтуитивные. Иногда правильный ответ противоречит здравому смыслу, иногда вывод меняется после объединения данных, а иногда всё зависит от одной, на первый взгляд незначительной детали в условии. О парадоксе Монти Холла мы уже писали. Его знают почти все. Парадокс Симпсона — уже заметно меньше людей. Но за ними скрывается целый мир менее известных, хотя не менее интересных парадоксов: двух конвертов, дружбы, Берксона, Бертрана, Линдли, инспекции, спящей красавицы, мальчика и девочки, прокурора и многих других. Строго говоря, они не являются парадоксами в смысле настоящего логического противоречия. Чаще математика внутри задачи вполне последовательна, а «парадокс» возникает из-за столкновения результата с нашей интуицией. Иногда мы незаметно подменяем одну условную вероятность другой, забываем о способе отбора данных или считаем две похожие формулировки одной и той же задачей. Именно поэтому формулировки здесь особенно важны. Достаточно изменить способ получения информации, правило выбора или сам вопрос — и перед нами уже другая вероятностная модель с другим ответом. То, что выглядит противоречием, нередко оказывается следствием разных скрытых предположений. Разбираться в таких задачах полезно не только ради интеллектуального развлечения. Они учат замечать эти предположения, осторожнее работать с данными, не доверять первому очевидному объяснению и точнее формулировать вопросы. Поэтому мы планируем новую рубрику о парадоксах теории вероятностей и статистики. Будем разбирать, где ломается интуиция, почему ошибочный ответ кажется таким убедительным и как похожие ловушки возникают в исследованиях, экспериментах и анализе данных. Как вам такая идея? Было бы интересно читать такие разборы? И какие парадоксы теории вероятностей и статистики известны вам?
Написал для Yandex for Analytics про собеседования. А кто-то из моих подписчиков собеседовался в Яндекс, интересно, какие впечатления? https://t.me/yandexforanalytics/589
Кто будет владеть покупательским кошельком в эпоху AI-ассистентов В Turing Post вышел хороший обзор о том, как локальные AI-экосистемы меняют глобальную гонку ассистентов. Его главный тезис понятен: победит не обязательно тот, у кого лучшая модель, а тот, кто сможет не только ответить на вопрос, но и довести пользователя до реального действия — найти товар, забронировать столик, вызвать такси или провести оплату. Давайте посмотрим на этот вопрос немного шире. У OpenAI и Anthropic есть сильные модели, глобальная аудитория и доступ к пользователю ещё до того, как он открыл сайт магазина. Зато у них нет собственных складов, курьеров, ресторанов, гостиниц и пунктов выдачи. У Amazon, «Яндекса», Ozon, Wildberries, Mercado Libre и других платформ всё это уже есть, но они рискуют потерять начало покупательского пути: человек может сформулировать потребность, сравнить варианты и принять решение внутри ChatGPT или Claude, а в магазин прийти только для оформления заказа. Поэтому одна сторона вряд ли вытеснит другую. Скорее возникнет нервный симбиоз: ассистент будет помогать сформулировать намерение и выбирать исполнителя, маркетплейс — предоставлять ассортимент, оплату и логистику, а затем им нужно договариться о разделе дохода. Глобальному ассистенту придётся иметь дело не с одной универсальной торговой системой, а с целой картой региональных платформ И здесь вопрос разделения дохода превращается в задачу причинного анализа. Допустим, пользователи, пришедшие из ChatGPT, покупают в два раза чаще. Это ещё не означает, что именно ChatGPT создал дополнительные продажи: возможно, к нему просто чаще обращаются люди, которые и так уже почти решили купить товар. Но от ответа на этот вопрос зависит размер комиссии. Ассистент скажет, что привёл покупателя. Маркетплейс возразит, что тот и так собирался оформить заказ. Продавец припишет эффект скидке, внутренний рекомендатель — ранжированию, а платёжный сервис — рассрочке. Все будут наблюдать одну транзакцию и называть себя её причиной. Чтобы претендовать на кусок пирога, ассистенту придётся доказать не просто высокую конверсию своих пользователей, а инкрементальный эффект: покупки, которые без него не состоялись бы или принесли бы меньше денег. И вся новая AI-экономика рискует превратиться в огромную задачу multi-touch attribution, участники которой считают себя причинным эффектом. Кроме доказательства пользы возникает следующий конфликт. Как только ассистент начинает получать комиссию, у него появляется стимул направлять пользователя туда, где эта комиссия выше. Маркетплейс, в свою очередь, может предпочесть продавца с большей маржой или рекламной ставкой, продавец — более выгодный товар, а платёжная система — покупку в кредит. В итоге пользователь слышит одну фразу: «Я подобрал для вас лучший вариант», под которой может скрываться целая цепочка коммерческих оптимизаций, каждая из которых по отдельности выглядит разумно, а вместе формирует довольно своеобразное представление о слове «лучший». AI обещает избавить нас от рекламной выдачи из сотен товаров, но вместо неё может появиться рекламная выдача из двух. Просто коммерческий интерес теперь будет находиться не рядом с ответом, а внутри него и говорить тем же голосом, что и персональный совет. Так что история из обзора Turing Post не только о локальных экосистемах. Она о том, как новые AI-лидеры пытаются встроиться в уже существующий мир маркетплейсов, банков, логистики и платформ, а затем договориться, кто из них действительно создал покупку и кому полагается комиссия. OpenAI и Anthropic не вытеснят традиционные и региональные экосистемы. Они станут ещё одним слоем над ними — слоем, где формируется намерение, выбирается исполнитель и направляется внимание. Но тот, кто помогает выбрать, неизбежно получает возможность влиять на выбор. А когда советчик зарабатывает на результате собственного совета, его нейтральность становится частью бизнес-модели. Поэтому главный вопрос новой AI-торговли звучит так: кто будет владеть покупательским кошельком — и в чьих интересах будет действовать тот, кому мы разрешим его открыть?
В 2018 году Кай-Фу Ли в своей книге предсказывал, что новый мировой порядок искусственного интеллекта будут определять две сверхдержавы: США — за счёт исследований, Китай — за счёт данных и скорости внедрения. В целом он угадал игроков, но не угадал поле игры. После появления больших языковых моделей AI-гонка перестала быть соревнованием отдельных алгоритмов. Теперь конкуренция идёт сразу на четырёх слоях: за чипы и дата-центры, данные, сами модели и продукты, через которые они попадают в экономику. США пока контролируют значительную часть вычислений, облаков и передовых моделей. Китай почти закрыл разрыв по качеству, делает ставку на эффективность и открытые веса и постепенно превращает Qwen, DeepSeek и Kimi в альтернативную глобальную экосистему. При этом ни одна страна не контролирует всю цепочку. Американские модели зависят от тайваньских фабрик, нидерландской литографии, корейской памяти и всё большего количества электроэнергии. Китайские компании способны быстро сокращать модельное отставание, но по-прежнему ограничены в доступе к самым передовым ускорителям. Европа, Индия, Россия, Япония, Южная Корея и страны Залива контролируют отдельные важные части системы, но не весь стек целиком. Поэтому у этой гонки, скорее всего, не будет конца — и тем более одного победителя. Новый AI-порядок будет определяться теми, кто контролирует разные слои системы и какие зависимости готов считать приемлемыми. В большом разборе — о том, что Кай-Фу Ли предсказал правильно, как Китай сократил отставание, почему данные становятся дефицитнее моделей и зачем в разговор об искусственном интеллекте вернулись электростанции: https://datascience.xyz/analytics/novyj-mirovoj-poryadok-iskusstvennogo-intellekta.html Самая надёжная часть прогноза находится в конце статьи: через восемь лет этот текст почти наверняка будет выглядеть разумным описанием технологии, которая уже перестала быть главным центром происходящего.
Нейросеть вышла на работу В нашу жизнь ворвалось много AI-терминов: модели, агенты, скиллы, базы знаний, семантические слои, инструменты, воркфлоу, evals и т.д. Попробуем разобраться в них с помощью простой аналогии. Представим, что компания нанимает нового сотрудника — только не кожаного, а искусственного. Модель — это его базовые способности. Она умеет читать, писать, программировать и анализировать документы, но пока ничего не знает о вашей компании: как здесь считаются метрики, где лежат правильные данные и почему таблица final_revenue_v7_really_final всё равно не финальная. KB — база знаний — это корпоративная Wiki, документация и накопленная память компании. Она отвечает на вопрос: что сотрудник должен знать? Но внутри компании одни и те же слова часто означают разное. Для маркетинга клиент — тот, кто оставил контакты, для продукта — зарегистрированный пользователь, для финансов — тот, кто уже заплатил. Поэтому нужен семантический слой — корпоративный словарь и переводчик между человеческим языком и данными. Он фиксирует, что именно компания называет клиентом, заказом или выручкой, как это считается и где искать нужные данные. Но даже доступ к Wiki и общий словарь ещё не превращают сотрудника в профессионала. Информация у него появилась, профессия — пока нет. Для этого нужен скилл. На него удобно смотреть как на должностную инструкцию для искусственного сотрудника. Только это смесь должностной инструкции, рабочего регламента, руководства по инструментам, чек-листа качества и правил эскалации. Например, сотруднику можно поставить вполне человеческую задачу: Изучи результаты A/B-теста и дай рекомендацию. А скилл развернёт её в профессиональную процедуру: проверить дизайн эксперимента, единицу рандомизации, SRM и качество данных, оценить эффект и доверительный интервал, учесть множественные проверки и не маскировать сломанный дизайн красивыми расчётами. То есть KB говорит, что знать, семантический слой договаривается, что всё это означает, а скилл объясняет, что и как делать. Дальше тоже всё почти как в обычной компании: tools дают доступ к рабочим системам, workflow соединяет действия в процесс, агент получает право самостоятельно пройти несколько шагов до результата, а evals проверяют, не накосячил ли он по дороге. И тут интересно наблюдать за организациями, которые годами гордятся отсутствием подробных инструкций: плоские иерархии, самоорганизация, минимум бюрократии. С человеческими сотрудниками это иногда работает. Они считывают контекст, спрашивают коллег и постепенно осваивают корпоративный здравый смысл. Это называется культурой, автономией и зрелостью команды, хотя часто просто означает, что никто не хочет писать документацию. Но искусственный сотрудник корпоративный вайб считывает плохо. Быстро выясняется, что ценности нужно разложить на правила, здравый смысл — на проверяемые шаги, а автономию — на конкретные границы полномочий. Ирония в том, что AI может вернуть в бирюзовые организации процессы, регламенты и должностные инструкции, от которых те когда-то отказались. Только теперь это называется skill engineering и выглядит достаточно инновационно. AI заставляет компании формулировать работу и описывать сущности, которые раньше существовали только в головах людей.
На AI Engineer World’s Fair попытались сформулировать главные тренды AI engineering 2026 года. Но почти все они складываются в одну историю: самое интересное теперь происходит не внутри модели, а вокруг неё. Несколько лет назад основное внимание было приковано к устройству самого агента: модели добавляли память, планирование и инструменты. Теперь же модель становится заменяемой частью более крупной системы. При этом, разработка передовых моделей дорожает и концентрируется у нескольких компаний, а остальные строят продукты поверх их API или открытых весов. Само по себе это не новость. Но модели стали достаточно универсальными и доступными, чтобы конкуренция всё заметнее смещалась в данные, контекст, интеграции, проверки и организацию работы агента. Если примерно одинаковый интеллект могут подключить многие, отличия приходится создавать вокруг него. Есть и обратная сторона. Производители моделей поднимаются вверх по стеку: то, что сегодня составляет отдельный продукт — поиск, память, выполнение кода или оркестрация, — завтра может стать стандартной функцией платформы. Тогда поставщик не просто меняет цены, лимиты и поведение модели, а слой за слоем съедает надстройку. Получается, конкурировать иногда приходится не только с другими продуктами, но и с собственной платформой. Всю систему вокруг модели теперь называют agent harness. Она определяет, какой контекст получает агент, что помнит между запусками, какие действия ему разрешены и как проверяется результат. А заодно не даёт ему забыть задачу, потратить бесконечное количество токенов и отчитаться об успехе после неудачи. Отсюда растёт интерес и к loop engineering. Агент получает задачу, делает попытку, запускает проверки, исправляет ошибки и повторяет цикл. Человек уже не управляет каждым шагом, а проектирует контур работы. Похожий сдвиг происходит и в программировании. Единицей взаимодействия становится не строка кода, а задача целиком: изучить репозиторий, найти ошибку, внести изменения и прогнать тесты. Код всё чаще превращается в промежуточный артефакт между постановкой задачи и проверкой результата. Следующий слой — skills: инструкции, скрипты и шаблоны, которые агент подгружает под конкретную работу. Процедурные знания компании начинают отделяться и от сотрудников, и от самой модели. В итоге рынок понемногу делится на тех, кто производит интеллект, и тех, кто пытается заставить его надёжно работать. Вторая задача заметно дешевле первой. Но, как выясняется, не сильно проще.
Еще не посмотрел, но с идеей согласен, фактически я делаю похожие штуки, просто еще оформляю их в бесплатные курсы ))) ну и заодно сам разбираюсь. Да и разобрать какую-то сложную тему с ChatGPT или Claude - это отдельное развлечение. https://t.me/onlyanalystgroup/456
Я тут подумал: чем платить кому-то за очередной курс про ИИ, лучше собрать свой вместе с Claude. И сделать его бесплатным. Так появился AI Native — технический курс от устройства языковых моделей и промпт-инжиниринга до RAG, MCP, агентов, мультиагентных систем, оценки качества, экономики моделей и продакшена. На российском рынке обычно приходится выбирать: либо покупать отдельные курсы по RAG, агентам и очередному модному фреймворку, либо идти на большую программу, где вместе с полезными темами вам продадут внушительный объём базы, красивый сертификат и обещание новой жизни за восемь недель. Я попробовал собрать траекторию под себя: не коллекцию инструментов, а связное понимание того, как устроены современные системы на базе LLM и как довести их от идеи до работающего решения. Пока AI Native — не отполированный образовательный продукт с кураторами, дедлайнами и менеджером, который позвонит через тридцать секунд после заявки. Это скорее большая публичная бета. Я буду сам проходить курс, проверять код, вычитывать редактировать материалы и возможно, если не поленюсь, постепенно переносить всё в Stepik. Ошибки, спорные места и слой нейрослопа наверняка есть, но думаю пользоваться уже можно: https://datascience.xyz/courses/ainative/ Изучайте, запускайте код и присылайте фидбек. Особенно если что-то не работает или работает, но совершенно непонятно почему.
Anthropic научилась подменять «мысли» Claude Исследователи Anthropic разработали метод, который позволяет частично читать внутренние представления Claude — и заменять одно понятие другим до того, как модель выдаст ответ. Метод назвали Jacobian lens, сокращённо J-lens. Якобиан в математике показывает, как небольшое изменение в одной части системы влияет на другую. В данном случае исследователи смотрят, как изменение активаций на промежуточном слое повлияет на слова, которые модель может произнести позже. Грубо говоря, J-lens превращает часть внутренней активности Claude в список связанных с ней слов. Не обязательно тех, которые модель уже собирается написать, а тех, о которых она как будто бы «думает» в этот момент. Набор таких внутренних представлений авторы назвали J-space — пространством, которое обнаруживается с помощью J-lens. Это не отдельный участок искусственного мозга, а особый формат, в котором модель временно удерживает понятия, нужные для дальнейшего рассуждения. В одном из экспериментов Claude задавали вопрос: Количество ног у животного, которое плетёт паутину… Чтобы ответить, модель должна сначала получить промежуточное понятие «паук», а затем перейти к числу восемь. Самого слова «паук» нет ни в вопросе, ни в ответе, но J-lens показывает соответствующее представление во внутренних активациях. Исследователи заменили «паука» на «муравья» — и Claude ответил: шесть. В другом эксперименте модель просили молча выбрать вид спорта. J-lens показывал, что внутри возникло представление «футбол». Когда исследователи заменяли его на «регби», Claude сообщал, что выбрал регби. То есть исследователи наблюдали не просто след уже принятого решения. Изменение промежуточного представления меняло дальнейшее поведение модели. Причём одно и то же представление могло использоваться разными частями сети. Когда внутри Claude заменяли «Францию» на «Китай», модель вслед за этим называла Пекин, китайский язык, Азию или юань — в зависимости от заданного вопроса. Похоже, J-space работает как общая доска: одна часть модели записывает туда промежуточный результат, а разные последующие вычисления могут его прочитать и использовать. Именно поэтому Anthropic связывает найденный механизм с теорией глобального рабочего пространства. Согласно этой теории, большая часть работы мозга происходит автоматически, а некоторые результаты попадают в общий канал и становятся доступны сразу нескольким системам. Когда исследователи частично отключали J-space, Claude по-прежнему мог связно писать, распознавать тональность, извлекать информацию из текста и отвечать на простые вопросы. Зато многошаговые рассуждения, пересказы, переводы и сочинение рифмованных текстов заметно ухудшались. Получается довольно интересное разделение. Грамматика, беглость и многие привычные навыки выполняются автоматически. Но когда промежуточное понятие нужно удержать, передать другой операции или применить в новом контексте, оно, вероятно, появляется в J-space. Отсюда легко перейти к выводу, что Anthropic обнаружила у Claude сознание. Но исследование этого не показывает. Функциональный механизм, похожий на рабочую память и сознательный доступ, ещё ничего не говорит о том, испытывает ли модель субъективные переживания. Интересна сама постановка эксперимента. Нейросети стали настолько сложными, что их всё чаще изучают не как полностью понятные инженерные конструкции, а почти как человека: предъявляют стимулы, наблюдают реакцию, строят гипотезы о внутренних процессах, а затем пытаются проверить их точечным вмешательством. До сих пор исследователи в основном судили о модели по её ответам или искали внутренние признаки, связанные с отдельными понятиями. Теперь они смогли вмешаться в промежуточный этап рассуждения: заменить один внутренний объект другим и проследить, как вслед за этим перестраивается ответ. https://www.anthropic.com/research/global-workspace
Два агента — ещё не команда. Но уже не обязательно катастрофа Недавно Stanford HAI опубликовал заметку с довольно эффектным заголовком: AI Coding Agents Fail at Teamwork — «ИИ-агенты не справляются с командной работой». В её основе — январский препринт CooperBench. Двум ИИ-агентам давали разные части одной задачи по программированию, разрешали переписываться, а затем объединяли их код. Получилось не очень: при совместной работе успешность агентов была в среднем на 30% ниже, чем когда один агент получал обе задачи. Переписка почти не помогала: агенты обсуждали планы, но нарушали собственные договорённости, неверно представляли действия партнёра и иногда просто перезаписывали его работу. Удобный вывод напрашивается сам собой: агенты не умеют работать в команде. Но Стэнфорд поставил диагноз по январским анализам, а мы — я и ChatGPT — решили проверить, не успел ли пациент за полгода эволюционировать. Прямого повторения CooperBench на GPT-5.5 и Claude Opus 4.8 мы не нашли. Поэтому утверждать, что новые модели сами по себе решили проблему командной работы, пока нельзя. Зато свежие исследования показывают: результат заметно улучшается, когда агентам строят нормальную организацию. В системе Shepherd над двумя агентами-программистами поставили третьего — управляющего. Он наблюдал за их действиями, вмешивался перед конфликтами и мог откатывать неудачные решения. Успешность парной работы на CooperBench выросла с 28,8% до 54,7%. Это уже почти двукратный рост, но не победа самоорганизации. Агенты стали лучше работать вместе после того, как над ними появился тимлид. В другой работе — DeLM — агенты координировались через общую очередь задач и проверяемое состояние проекта. Каждый мог увидеть подтверждённый прогресс остальных и продолжить работу с этого места. На SWE-bench Verified такая архитектура дала до 10,5 процентного пункта прироста относительно сильнейшего базового подхода и примерно вдвое снизила стоимость. Это другой тест, поэтому напрямую сравнивать его цифры с CooperBench нельзя. Но общий вывод уже просматривается: проблема не только в способностях моделей, но и в устройстве самой команды. Свободная переписка равноправных агентов пока работает ненадёжно. Общее состояние, проверяемые результаты и управляющий контур — заметно лучше.
Нам обещали цифрового помощника, который возьмёт на себя часть работы. А выдали цифровой конвейер, который никогда не останавливается. Хорошая статья Evil Martians про выгорание разработчиков, работающих с ИИ. На неё я наткнулся в канале «Набор цветных костылей» — спасибо за наводку. Главная мысль статьи простая: ИИ сокращает не рабочий день, а промежутки между задачами. Раньше часть времени уходила на написание кода, поиск решения, ожидание сборки и другую механику. Теперь агент почти мгновенно приносит очередной результат, который нужно проверить, исправить, принять или отбросить. Работа становится похожа не на строительство, а на диспетчерскую: ты постоянно управляешь потоками, переключаешься и боишься пропустить ошибку. При этом освободившееся время редко превращается в свободное. Если задачу теперь можно сделать вдвое быстрее, это обычно означает не полдня отдыха, а ещё две задачи. Кратковременный рост производительности быстро становится новой нормой. Поэтому проблема, кажется, не столько в ИИ. Это обычная интенсификация труда: машина позволяет сделать больше → прежний максимум становится стандартом → выигрыш в производительности достаётся очереди задач. В статье есть важное наблюдение: профессия меняется без формальной смены должности. Человек нанимался писать код, а постепенно превращается в тимлида агентов и рецензента чужого, не до конца прозрачного рассуждения. Производительность может расти, а чувство авторства и удовлетворённость — падать. Авторы предлагают делать перерывы, вести журнал достижений и оставлять время «на ремесло». Всё это разумно, но немного похоже на совет рабочему у конвейера правильно дышать. Если компания после внедрения ИИ просто увеличила норму выработки, личная гигиена труда проблему не решит. ИИ действительно делает нас быстрее. Но сам по себе этот выигрыш ничего не гарантирует. Он может вернуться человеку в виде свободного времени и меньшей нагрузки — а может быть немедленно превращён организацией в ещё более плотный рабочий день. И пока второй сценарий выглядит куда вероятнее.
OpenAI представила GPT-5.6 и окончательно перешла с технических названий на астрономический отдел маркетинга: флагманский Sol, средняя Terra и дешёвая Luna. Видимо, когда цифры перестают передавать величие модели, приходится подключать Солнечную систему. Главный герой — GPT-5.6 Sol: новая флагманская модель для программирования, биологии и кибербезопасности. В особенно сложном режиме она может не только думать дольше, но и запускать целую команду субагентов. Один искусственный интеллект уже недостаточно масштабно ошибается — нужен целый отдел. Интересно и сравнение с Claude Mythos. На кибербенчмарке Sol показывает результаты, сопоставимые с Mythos Preview, расходуя примерно втрое меньше выходных токенов. Но именно с Preview, а не с более новым Mythos 5, который Anthropic называла сильнейшей кибермоделью в мире. Маркетинговая дуэль пока проходит по переписке: один участник сравнивает себя с прошлой версией соперника, а второго государство временно забрало с ринга. Различается и подход. Anthropic сделала Fable 5 для обычных пользователей и почти ту же модель под названием Mythos 5 — для доверенных организаций, но с ослабленными ограничениями. Потом правительство США потребовало вообще отключить обе модели из-за опасений по поводу обхода защиты. OpenAI решила не наступать на те же грабли без предварительного согласования с владельцем граблей. Sol сначала получат только избранные партнёры, список которых известен американскому правительству. При этом компания отдельно пишет, что такой порядок не должен стать нормой и что через несколько недель модель собираются открыть шире. То есть дверь пока закрыта, но OpenAI демонстративно держит руку на ручке. Есть и более прозаическая заявка: Sol стоит $5 за миллион входных и $30 за миллион выходных токенов, тогда как Mythos 5 оценивался в $10 и $50 соответственно. Если качество окажется сопоставимым, OpenAI предлагает не только нового конкурента Mythos, но и примерно ту же опасную магию заметно дешевле. Получается занятная новая реальность. Раньше лаборатории соревновались, у кого модель умнее. Теперь — у кого она умнее, дешевле, лучше защищена, допущена государством и при этом всё ещё доступна кому-нибудь, кроме государства. Модели становятся агентнее. А релизы — всё больше похожи на экспорт вооружений.
С завидной регулярностью сталкиваюсь в разных местах со следующим утверждением: t-тест можно применять только к данным с распределением, похожим на нормальное. Если метрика скошена, имеет длинный хвост или просто не напоминает колокол, тест будто бы сразу становится недействительным. Поэтому перед t-тестом аналитик строит гистограмму, запускает тест Шапиро — Уилка, обнаруживает что данные распределены не по Гауссу и запрещает себе сравнивать средние. Но t-тесту обычно не требуется, чтобы сама метрика выглядела как аккуратный колокол. Важно, насколько хорошо нормальным распределением приближается оценка разности средних. При достаточно больших выборках и выполнении условий ЦПТ это происходит даже с исходными данными, которые скошены, хвостаты и вообще ведут себя как средний чек. Нормальность исходных данных действительно важна на малых выборках. Если наблюдения независимы и нормально распределены, то t-статистика имеет распределение Стьюдента — известное распределение, по которому можно рассчитывать критические значения, p-value и доверительные интервалы даже когда данных очень мало. Если же исходные данные распределены произвольно, нам нужен другой, отдельно обоснованный механизм оценки p-value и интервалов... или больше данных. Это оговорено и в Википедии: требование нормальности исходных значений относится именно к случаю маленьких выборок. Но из этой оговорки почему-то часто запоминают только слово «нормальность». Остаётся понять, что такое маленькая выборка. Популярная граница в 30 наблюдений — не математический закон, а учебная традиция. Для почти симметричного распределения может хватить и меньшего числа наблюдений. Для сильно скошенной метрики с тяжёлым хвостом может не хватить и сотен. Выборка мала не тогда, когда (n<30), а тогда, когда нормальное приближение для интересующей нас статистики ещё недостаточно точно. Скорость этого приближения зависит не только от числа наблюдений, но и от свойств исходного распределения. Поэтому универсальной кнопки «ЦПТ включилась» не существует. Впрочем, в продуктовой аналитике, где эксперимент часто охватывает десятки тысяч или миллионы пользователей, именно недостаточный размер выборки обычно оказывается далеко не главной проблемой. Гораздо вероятнее ошибиться с независимостью наблюдений, единицей анализа или самой конструкцией метрики. https://t.me/ds_interview_lib/1480
Выложил на datascience.xyz open source курс «Разработка ИИ с нуля» Это русская версия курса AI Engineering from Scratch — большого открытого учебного плана про то, как устроены современные ИИ-системы: от линейной алгебры, обратного распространения и токенизаторов до внимания, агентных циклов и более сложных инженерных конструкций. Главная идея курса хорошая: не просто пользоваться фреймворками и копировать готовые пайплайны, а пройти путь «снизу вверх» — сначала понять математику и алгоритм, потом написать код, потом уже смотреть, как это упаковано в привычные инструменты. Я взял исходный open source курс, перевёл его и местами улучшил с помощью ChatGPT и Claude. Поэтому сразу предупреждение: я пока не вычитывал всё руками. Внутри может встречаться нейрослоп, кривые формулировки, странные переводы и места, которые требуют нормальной человеческой правки. Но в этом и план: буду сам постепенно учить и разбирать курс, а заодно вычитывать, исправлять и приводить в порядок. То есть это не «идеальный готовый учебник», а рабочая открытая версия, которую можно использовать, проверять, критиковать и улучшать. Пользоваться уже можно. О любых замечаниях пишите мне в @wishful_chat, буду благодарен. Курс здесь: https://datascience.xyz/courses/aicourse/ Исходный проект: https://aiengineeringfromscratch.com/
На алкоголе пишут drink responsibly, на сайтах азартных игр — play responsibly, на сайтах бирж — invest responsibly. Не пора ли начать писать на сайтах с ИИ — prompt responsibly? Ведь ИИ тоже умеет вызывать привыкание, снижать критичность и создавать иллюзию контроля — только делает это вежливо, грамотно, с длинным тире и маркированными списками.