Tuzov AI Lab
СтатистикаЗаметки инженера про AI / LLM: актуальные новости, эксперименты, кейсы, мысли. Автор: @ntuzov Общаемся в AI Dev Club: https://t.me/+NMh-DL73ibFkMWEy
- Последний пост
- 24 июл.
- Последнее чтение
- 08:49
- Постов за неделю
- 0
- Всего постов
- 40
- Тип
- открытый
- Язык
- русский
- Категория
- Новости и СМИ
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 2 742
- 1/48двое суток
- 3 142
- 1/72трое суток
- 3 389
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Релиз оказался мне очень кстати, т.к. я активно допиливаю финальные правки по своей платформе для гайдов*. Очень активно — в пяти сессиях параллельно разные аспекты дорабатываю — в основном по дизайну. Сейчас переключился везде на новый Опус, и вау-эффект действительно есть. За последние дни я уже привык, что сначала объсняю что поправить, а потом мы итеративно вымучиваем финальный вариант. С пятым же Опусом я сейчас закрыл несколько фиксов буквально за 1-2 итерации. При чем, вторая итерация — мелкие незначительные штрихи. Например, он помог мне доработать полоску с мета-инфой у постов (см. картинку), которая до этого была скомканная и неудобная. По привычке, я ожидал минимум 5-10 итераций правок. Надо ещё понимать, что Fable был хорош на сложных и длинных задачах, а мелкие таски он закрывал хуже Опуса (по моему опыту). Теперь же, когда Опус сопоставим по качеству с Фэйблом, но при этом не такой монстр, мелкие задачи ему даются сильно лучше. Но я сегодня уже очень устал, поэтому окончательные выводы буду делать уже завтра 😩 *Гайды там будут только по Go, но я уже готовлю аналогичный проект по LLM
🔸 Opus 5 — как Fable, но дешевле https://www.anthropic.com/news/claude-opus-5 Anthropic выкатили Opus 5. Доступен везде уже сегодня. Нам обещают, что он вплотную подошёл к Fable 5 — но за половину её цены. При этом сам стоит столько же, сколько Opus 4.8: те же $5/$25 за миллион токенов. Цена не выросла, а по словам «доверенных партнёров» — «это самый большой скачок в линейке Opus со времён 4.5». Из цифр: на Frontier-Bench обгоняет всех и больше чем вдвое перекрывает Opus 4.8, а на ARC-AGI 3 (это про решение новых, незнакомых задач) — втрое выше ближайшего конкурента. Но главный акцент релиза не на сырых бенчмарках, а на том, что модель стала заметно лучше соображать и проверять себя. Пара примеров из тестов: - Новому Опусу дали чертёж детали, нужно написать код, который соберёт по нему 3D-модель. Но это был жестокий пранк! Модели отключили зрение — открыть картинку и посмотреть на неё она не может. Тогда Опус написал программу, которая прочитала файл за него: нашла на чертеже линии и окружности, сняла размеры, и уже по ним собрала деталь. И так стабильно, раз за разом. Остальные модели в тех же условиях не справились ни за одну из пяти попыток. - Реальный баг в популярном пакетном менеджере (не говорят в каком): Opus 5 нашёл корневую причину и починил краевой случай, который сообщество в своём патче пропустило. Другая модель (не говорят какая) починила только симптом и отрапортовала о готовности. Ещё из интересного: - Anthropic называют его самой «выровненной» (aligned) моделью на сегодня — то есть лучше всех следует правилам, реже всех врёт и тяжелее всего ведётся на вредоносные промт-инжекшены. - По кибербезу снова осторожничают: находить уязвимости модель умеет хорошо, а вот писать к ним эксплойты — плохо (специально не учили). Зато фильтры теперь срабатывают примерно на 85% реже, чем на Fable 5, и вместо жёсткого отказа запрос по умолчанию просто откатывается на Opus 4.8 (ну спасибо..) ———— Вообще, я не удивлён близости к Fable 5, выглядит будто это и есть его дистилляция — дешёвая модель, которая тянется к качеству старшей. Google так делает с Gemini Flash и не скрывает. Anthropic про метод обучения молчат, так что это чисто мои догадки. Что ж, на бумаге звучит очень круто. Если оно и правда так круто, то я счастлив — можно будет отменять вторую max-подписку 😩 Буду пробовать уже сегодня. Если будут интересные выводы, напишу отдельный пост. #anthropic #claude #opus
Ну привет 👍 https://www.anthropic.com/news/claude-opus-5
без подписи
В последнее время вижу много восторженных отзывов про новый Kimi K3. Мол, он лучше Фэйбла и GPT Sol вместе взятых, да ещё и дешевле 👍 Кто-то уже пробовал? Поделитесь опытом, как вам. Особенно в сравнении с Клодом / Кодексом. Стоит брать ещё одну подписку за $100-200? 😐
Вот и ответ — Fable оставят в подписке навсегда. Новость, которая не новость 😃
Делайте ваши ставки 👍
🔸 ❤️🔵 Антропики и OpenAI конкурируют, мы получаем плюшки Codex: в очередной раз сбросили лимиты (они уже несколько раз так сделали после выхода GPT-5.6) и временно убрали 5-часовой лимит. Claude: продлили доступ к Fable до 19 июля и увеличили недельные лимиты Claude Code на 50% до этой даты. Идите и делайте дела (с)
Ещё одно удобное применение Клода — зачем скидывать скучные чеклисты в pdf, если можно сделать вот так? 👍 https://labs.tuzov.dev/trek-kit/ Готовлюсь к походу в горы, сделал такой вот чеклист-гайд. Моего времени на разработку потрачено примерно ноль (только написание стартового промта, плюс мелкие правки). Время я тратил только на составление списка и вычитку рекомендаций от Клода — он поресёрчил и дополнил меня и гида всяким полезным. К слову, как же удобно, когда можно на каждый чих запустить агента-ресёрчера в фоне, прямо из основной сессии: а точно ли вот эта штука нужна? Какая погода на маршруте в этом время? Рекомендацию по выбору вон той штуки и т.п. В какое удивительное время живём.. 🦄 И это ещё одна причина, почему мне сложно будет отказаться от Клода в пользу GPT — у него даже в 5.6 с дизайном заметно хуже.
А вот нормальную работу с субагентами в Кодекс так и не завезли, похоже.. У меня уже руки набиты на работу с Клод Кодом — делегирование подзадач агентам на правильных моделях (я знаю, что доверить Опусу, что Фэйблу, что Соннету, а иногда даже Хайку). Кроме того, недавно я выяснил, что в Кодексе есть даже ограничение на количество одновременно работающих субагентов, и их довольно мало. Ну и он очень неохотно их запускает, только по прямому запросу пользователя. Похоже, выход GPT-5.6, это прекрасный повод наконец-то освоить pi.dev
Можете ложиться спать, Fable с нами до 12 июля Обратите внимание: сколько дней до 12.07? Правильно, всего 5. А когда сбросятся лимиты, потраченные недавно? Примерно через неделю. У меня две подписки на Клода — у одной сброс будет 11-го, у другой 13-го. Так что, это продление мало что даёт, на самом деле. Дата выбрана не просто так 👍 ———— Гонка AI сейчас поинтересней, чем остросюжетные блокбастеры: 1. Антропики просят остановить развитие ИИ и просят зарегулировать нишу 2. Выпускают "ультрамощную" модель, подсаживая нас на эту иглу 3. Их "зарегулировали", как они и просили, модель забрали.. 4. ... Модель вернули! Но обещают снова забрать 7 июля (исключить из подписки). Однако, запрос на рынке уже есть, они сами его создали! 5. OpenAI собираются занять созданную и освободившуюся нишу, намекая, что GPT-5.6 Sol будет также хорош, как и Fable / Mythos (я даже слышал байки про многомиллионный контекст). Появляются слухи, что он выйдет как только заберут доступ к Fable, то есть в ближайшие часы. Идеальный тайминг! 6. Антропики продлевают нам Fable почти на неделю .... Мы здесь ??? 🍿 #fable #claude
Хорошая затея, можно взять на вооружение. Если не боитесь, что вас за это забанят.. Я, кстати, раньше думал, что оно изначально так и работает — что 5-часовое окно не зависит от моей работы, а привязано к каким-то глобальным чекпоинтам. И очень удивился, когда узнал обратное 🗿
Впрочем, ожидаемо. И печально.
Reuters: Пекин рассматривает возможность ограничения доступа зарубежных стран к лучшим китайским ИИ-моделям. По словам трех источников, знакомых с ходом обсуждений, китайские власти в течение последнего месяца проводили встречи с ведущими технологическими компаниями по вопросу возможного ограничения доступа из-за рубежа к передовым китайским моделям, включая те, которые еще не выпущены. Встречи проводились министерством коммерции Китая, в разговорах участвовали как минимум Alibaba, Bytedanc и авторы GLM-5.2 Z.ai. Масштабы потенциальных ограничений все еще обсуждаются, и они могут применяться только к будущим моделям. Пока неясно, когда и вступят ли они в силу вообще. Также, согласно двум источникам, китайские власти крайне обеспокоены потенциальной возможностью использования компанией Mythos уязвимостей программного обеспечения и тем, что Вашингтон может использовать эту модель против китайских интересов. Угроза воспринимается как реальная. === Я много раз тут и в других каналах выражал точку зрения, что считаю глупым топить за китайский опенсорс, и что не вижу большого будущего у открытых моделей. Почти все модели с большим экономическим потенциалом будут проприетарными, и никто не будет выкладывать модель, которая может принести, условно, 10-30 миллиардов долларов за счёт автоматизации экономически ценных задач. Даже если вдруг окажется что компании сами хотят их выпускать — им почти наверняка не дадут. Может быть это не произойдет в 2026. Может даже не в 2027, но чем дальше в гонке — тем больше ограничений. Выбор, по-сути, будет из двух: проприетарные модели США или проприетарные китайские модели — и это если выбор будет вообще, а то может быть не-гражданам или не членам коалиции и такого не дадут, что в целом вполне вероятно. Ещё останутся «слабые» локальные модели, но не факт, что они смогут шагнуть сильно дальше, чем те, что публично доступны на данный момент (условно Mythos-class).
Дайте-ка сюда свой GPT, мне уже не терпится, после всех этих прогревов. Особенно после того как я подсел на Fable... ☀️ Мои лимиты на Fable подошли к концу, но я ещё не наигрался. Надеюсь, смогу продолжить эти проекты на GPT-5.6 Sol Вообще, пока выглядит, будто Антропики сами себе яму выкопали — прогрели нас на "ультрамощную" модель, объяснили как она нам нужна.. Но в итоге отберут. И тут приходит Сэм Альтман и удовлетворяет спрос, который создал его конкурент! Шах и мат.
Раз уж нам выдали Fable поиграться, решил скормить ему тот же промт на дизайн сервиса. Результат очень приятно удивил Как я уже писал, промт довольно сложный, и множественные косяки в результатах работы модели вполне ожидаемы. Но вот чего я не ожидал, так это того, что Fable сделает всё идеально — строго по моим хотелкам и референсам, без багов. Ранее я уже писал отчёты по его тестам в дизайне и код-ревью, результат был плюс-минус такой же как у Опуса. Проблема в том, что тест был бессмысленный — я отправил его делать то, с чем и другие модели справляются неплохо. Надо было давать ему задачки, с которыми Опус справляется плохо — большие, комплексные, сложные, длинные. В моём случае, он оказался очень полезен, когда есть идея большого проекта, но пока ещё сам плохо понимаешь как оно должно выглядеть в конечном итоге — зато есть множество сумбурных идей. Вместо того, чтобы сидеть и пол дня продумывать детали самостоятельно, гораздо проще и быстрее попросить мощную модель набросать качественный прототип, чтобы потыкать его вживую, и дальше уже доводить до ума. Да, результаты Opus / GLM тоже помогли бы мне, но они слишком сырые — даже чтобы просто потыкать, нужно довольно многое починить / доделать. А тут готовый продукт, который надо просто слегка подтюнить под себя. ———— То есть, если вы выкатите длинную сумбурную простыню с подробным описанием SaaS своей мечты (не чёткое ТЗ, а именно не структурированный поток своих мыслей), то Fable вполне может сделать готовый продукт. Но это не точно 👍 💅 Можете делить всё, что я говорю, на два, потому что я пока исхожу только из своих первых экспериментов, а также из рассказов других авторов. Просто делюсь впечатлениями. Очень жалею, что его не будет в подписке, это действительно шаг вперёд в развитии современных моделей. 🙃 Постараюсь до 7-го выжать из Фэйбла всё что смогу, попробовать его в других сценариях, и буду делиться результатами здесь. ———— UPD: А что по стоимости? Я прогнал этот промт в двух независимых сессиях Fable (обе справились хорошо). В одной оно обошлось бы в $163, в другой $110 (claude code умеет считать стоимость сессии, даже если у тебя подписка). Дороговато, цены действительно будут кусаться, если платить за токены. #claude #fable
🔸 Fable 5 снова с нами К сожалению, в подписке он будет только до 7 июля, да и то на него можно тратить только половину недельного плана (не очень понимаю, как это вообще реализовано...), а потом только через API с оплатой за токены. Жаль, что он останется игрушкой для богатых, но я и не надеялся 👍
💅 Так ли хороша GLM-5.2 в дизайне? В последнее время слышу восторженные рассказы о том, что GLM-5.2 обогнала Opus 4.8 и даже Fable 5 в дизайне (конкретно в сценарии text prompt to html). Сильное заявление, ведь Опус сейчас очень хорош в дизайне — к слову, во всех сценариях, а не только "text prompt to html", но давайте хотя бы с этим поработаем. Наконец-то у меня дошли руки проверить это на практике. Я дал одинаковый промт моделям: - Opus 4.8 Max effort - GLM-5.2 Max - Codex-5.5 xhigh (забавы ради..) Запрос был на проработку дизайна весьма забористого сервиса, с кучей важных хотелок от меня, немного сумбурно сформулированный. Что ж, Кодекс, ожидаемо, сразу отсеиваем — его дизайн, как обычно, сильно остаёт от коллег по цеху. А вот Клод и GLM справились плюс-минус на одном уровне — у обоих куча косяков (это норм, запрос довольно сложный), но вариант GLM будто бы заметно ближе к тому что мне надо — красивый минималистичный дизайн, без лишней мишуры, удобный ux/ui, почти каждый раздел проработан качественно. Клод в некоторых местах откровенно схалтурил, либо плохо понял мои хотелки. Поэтому я бы взял за основу вариант GLM, и перенёс бы часть фич из варианта Опуса. К сожалению, скриншоты не могу показать, это пока приватный проект. Ну что, подводим итоги? Наконец-то появился достойный конкурент? Увы, нет. Мультимодальность и тулинг Главная ложка дёгтя тут в том, что GLM-5.2 умеет работать только с текстом. Как не сложно догадаться, очень сложно работать с дизайном, когда модель "слепая". Банально, невозможно показать пример "как надо", какие-то референсы. И главное — невозможно показать ей баги вёрстки, приходится описывать словами. Так что, на "убийцу Опуса" в области дизайна оно пока точно не тянет. Такое даже тулингом не исправить. К слову о тулинге — модели Антропиков хороши своей обвязкой. В частности, у них есть шикарный Claude Design, который сильно упрощает работу над дизайном проекта. Если LLM вам нужна не для разового вау-эффекта, а для серьёзной работы, то хороший тулинг с лихвой компенсирует небольшую разницу в качестве самих моделей. Вывод GLM-5.2 действительно хороша в одношаговом text to HTML/UI. Думаю, я буду регулярно использовать его в таком ключе — для подготовки стартового дизайна проекта по первому промту (кроме случае, когда надо показывать много визуальных референсов). А дальше буду прорабатывать с Клодом, потому что без "зрения" работать будет сложно. И да, я знаю про мультимодальную GLM-5V-Turbo, но хайп был не вокруг неё. Насколько я понимаю, в сценарии text prompt to html она слабее. Во всяком случае, никто не заявлял её как "убийцу Опуса". В любом случае, продолжаю внимательно следить за z.ai. Надеюсь, со временем у них появится мультимодальный флагман, который сможет тягаться с Опусом в полную силу. #glm #opus #claude #design
🔸 Самый «агентный» Sonnet https://www.anthropic.com/news/claude-sonnet-5 Claude Sonnet 5 вышел, и уже доступен везде Нам обещают, что теперь намного лучше умеет строить планы, ходить в браузер и терминал, доводить длинные автономные задачи до конца. Главный тезис: по качеству приближается вплотную к Opus 4.8, но заметно дешевле. Что ещё интересного: - Цена. На старте $2/$10 за миллион токенов до 31 августа, потом будет $3/$15. Для сравнения, Opus 4.8 — $5/$25 - Новый токенизатор (который приехал с Opus 4.7) — тот же текст может маппиться в ~1.0–1.35x больше токенов. - Подняли лимиты в подписках. На высоком эффорте модель сжигает заметно больше токенов, и в старые лимиты можно было упереться быстрее. Насколько подняли, не уточняют. Отзывы early-access партнёров (Cursor, Lovable, ClickHouse и др.) — все про одно и то же: модель доводит работу до конца там, где старый Sonnet останавливался на полпути, и сама себя проверяет. Отзыв разработчика из Zed Team: Попросил Sonnet 5 разобраться с багом. Он без подсказок написал воспроизводящий тест, внёс фикс, а потом убрал его в stash, чтобы убедиться — без изменения баг возвращается. Всё за один проход. По безопасности: модель реже косячит, чем Sonnet 4.6 (галлюцинации, подхалимаж, помощь с вредными запросами), а вот в написании эксплойтов и прочем взломе — заметно слабее Opus. Защитные фильтры по кибербезопасности, которые блокируют опасные запросы на лету, включены по умолчанию 🤔 ———— Как по мне, это теперь шикарный кандидат на исполнителя режима workflow (когда десятки-сотни субагентов работают над большой задачей) — наконец-то оно перестанет выжигать весь лимит за один прогон. Опус пишет план и менеджерит, Соннет выполняет. Обязательно буду пробовать в таком формате. Но я думаю, Антропики сами подтюнят workflow режим таким образом. #anthropic #claude #sonnet
🤖 LLM под капотом: трансформер. Часть 2 Серия #llm_internals В прошлом посте мы разобрались, как промт превращается в набор векторов и потом прогоняется через стопку блоков, обновляясь под контекст. На выходе у нас та же последовательность векторов, но числа в каждом — уже совсем другие. Особенно интересен последний — в нём «спрессована» информация обо всём промте. Теперь обсудим самое главное — как из этого вектора рождается следующий токен Шаг 3. Генерация следующего токена Итак, у нас есть исходная последовательность токенов из промта, и мы хотим сгенерировать следующий токен. Как это сделать? На самом деле, у нас уже всё для этого есть — модель просто берёт наш последний вектор (соответствующий последнему токену промта) и сравнивает его со всеми векторами таблицы эмбеддингов. Грубо говоря, она перебирает все известные ей токены, и смотрит насколько близки их вектора к нашему последнему вектору. В итоге, в качестве следующего токена, она выберет какой-то случайный — но чем ближе его вектор к нашему, тем выше его шансы. Чтобы окончательно уложить это в голове, давайте снова упростим картину. Вернёмся к нашему 3-мерному пространству. Представьте, что в нём раскиданы 100 точек — это таблица эмбеддингов модели. А ещё где-то в этом пространстве висит особая точка — это наш последний вектор после всех преобразований. Модель измеряет, насколько он близок к каждой из 100 точек таблицы. И чем ближе точка из таблицы к нашему вектору, тем выше её шансы стать нашим следующим токеном. В реальности — пространство 12000-мерное, точек около 100k, но принцип тот же. Итак, у нас есть оценка близости к нашему вектору для всех токенов словаря. Дальше из этого набора выбирается итоговый токен. По умолчанию — самый вероятный (то есть, ближайший). Но можно специально внести случайность — за это отвечает параметр «температура». На температуре 0 модель всегда берёт самый вероятный токен (детерминированный режим). Чем выше температура — тем чаще модель отклоняется от очевидного варианта в сторону менее вероятного. На 2+ это уже почти полная фантазия — повышается риск генерации полного бреда, зато ответы интереснее и креативнее 👍 Что дальше? А дальше — повторяем цикл: 1. Выбрали следующий токен (генерация) 2. Добавили его в конец промта 3. Снова прогнали всё через все блоки (преобразования) 4. Получили новый последний вектор 5. Возвращаемся к п.1 .... И так до конца ответа. А когда модель решает, что пора заканчивать? В словаре есть специальный токен EOS (end-of-sequence). На каждом шаге модель оценивает вероятности всех токенов словаря — и когда мысль закончилась, EOS оказывается самым вероятным. Модель его выбирает, и генерация останавливается. Этому модель училась в претрейне: в обучающих данных все ответы заканчивались EOS, и она запомнила, где это уместно ставить. Плюс есть страховки снаружи: лимит токенов (max_tokens в API) или стоп-последовательности — если модель сгенерировала заданную строку, генерация прерывается принудительно. ———— То есть, для каждого нового токена ответа модель проделывает колоссальный объём вычислений: 1. Перебирает все токены словаря (генерация — сравнение с последним) 2. Прогоняет новый токен через все 80-120 блоков — это нужно, чтобы подготовить его вектор для следующей итерации. В каждом блоке attention сравнивает его со всеми предыдущими токенами — а их с каждым шагом всё больше. И чем длиннее ответ — тем дороже становится генерация следующего токена. Именно поэтому большие LLM такие дорогие в инференсе. ———— Что ж, вот и весь трансформер. Оказывается, не так уж и сложно 👍 В следующем посте детально разберём сам механизм attention. Та самая операция, ради которой эта серия и пишется. #llm_internals