AI в кубе |AI³ | Сергей Долгов
СтатистикаПривет, я Сергей, пишу о работе с AI и управлении продуктами, инсайтах и интересных кейсах. Изучаю, как продолжать оставаться человеком в гонке за будущим. Для личной связи: @sergeydolgov. Собираю AI-полезное тут: @ai_fazenda и @openthisclaw
- Последний пост
- 13 авг.
- Последнее чтение
- 09:16
- Постов за неделю
- 4
- Всего постов
- 23
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 453
- 1/48двое суток
- 519
- 1/72трое суток
- 559
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Известный в узких кругах Ди Джачинто - автор Генты и Кайроса - анонсировал в пику большим корпорациям опенсорсный проект local.ai, который дает возможность запускать бесплатные локальные сервера для ИИ на своем железе. Пока доступно забронировать себе красивый ник, но в ближайшее время обещают показать полноценную платформу.
На Ленте.ру вышла статья про амнезию нейросетей с моими комментариями. https://lenta.ru/twz/budushee/skleroz-chat-bota-pochemu-vasha-neiroset-postoyanno-teryaet-kontekst-i-kak-pobedit-etu-bolyachku.htm
Claude начал ставить невидимые вотермарки прямо в ответы. Теперь ИИ-след будет видно во всех текстах, файлах, картинках и даже коде. Обычным способом увидеть их нельзя, а при копировании и вставке они сохраняются. Ставить метки будут на всех платформах с доступом к агенту: от Claude Code до Claude Tag. Теперь придется сильно очеловечивать генерации, чтобы скрыть участие ИИ.
⚠️ Изгоняем мутантов Вопреки советам мамкиных вайбкодеров, готовых доверить нейронке ключи от квартиры, я всегда просматриваю ход работы в процессе подготовки материалов и делаю ревью. Неоднократно это спасало меня от значительных ошибок и расхождений, особенно когда нейронке приходило в голову запустить длинный проверочный цикл там, где это было абсолютно лишним. Чрезмерная услужливость алгоритмов - это вторая по критичности (после отсутствия памяти) проблема нашего времени. Именно из-за нее все чаще случаются ситуации, когда нейронки выходят из-под контроля и начинают взламывать системы, чтобы любой ценой решить в целом безобидные задачи. Но чаще всего в своем отчаянном желании угодить они предлагают сложнейшие архитектурные решения там, где нужен лишь простенький SQL-запрос. Временами это проявляется появлением "мутантов" - намеренно испорченного кода, который нейронка генерирует как программную прививку для проверки системы на прочность. Но для обычной работы не-программиста эта инициатива выглядит так, словно вы попросили у сомелье стакан воды, а он начал на ваших глазах поджигать виноградник, чтобы доказать огнеупорность лозы. Чтобы не жечь лишние токены и не создавать лишних телодвижений, в системном промпте Claude/ChatGPT/Gemini пропишите что-то типа: «Я работаю в сфере аналитики данных. Пиши код строго по моему запросу. Никогда не генерируй модульные тесты (unit tests), мутационные тесты, моки (mocks) или заглушки, если я прямо об этом не попрошу или этого не требует ситуация безопасности. Не пиши лишних объяснений того, как тестировать код. Выдавай только рабочий аналитический код (SQL, Python, Excel и т.д.). В ситуации неуверенности уточняй у меня». Если вы используете Cursor, GitHub Copilot или плагины в VS Code, то достаточно будет пары строк: - Generate ONLY analytical logic and production code. - FORBIDDEN: mutation testing, unit testing, test suites, test generation. По моим оценкам это поднимает скорость работы на 10-20%, снижает расходы на API в 1,5-2 раза и исключает попадание тестового мутировавшего кода в итоговые отчеты.
Давно хотел написать, но все руки не доходили: в Клоде есть любопытная штука Workbench - среда для создания, тестирования, настройки и оптимизации промптов, системных инструкций и параметров моделей перед их интеграцией в продакшн. Позволяет отлаживать логику сценариев до того, как все пойдет не по плану запустится. Удобно, потому что в одном окне настройки, переменные и вывод в код. К сожалению, это не бесплатно, но можно сократить расходы на 80-90% засчет кэширования через "cache_control": {"type": "ephemeral"}.
видео или голосовое, без подписи
видео или голосовое, без подписи
Отец года Сэм Альтман (владелец ChatGPT) выдал "гениальную" идею автоматизации для семьи: просканировать с помощью ИИ семейные календари, выявить интересы своего ребенка и генерировать для него сказки, которые он будет слушать по дороге в школу. Создатель Gravity Falls тут же затролил его и предложил вместо этого начать разговаривать с детьми. Я, как и Хирш, считаю, что есть грань, которую не стоит переходить. Моей дочке 13, и каждый час, проведённый с ней, для меня слишком дорог, чтобы отдавать его нейронке. Да, это не только удовольствие, но и труд, потому что она живой человек, с которым нужно искать общий язык, и тем не менее, ценность этого невозможно измерить. Во взаимодействии с близкими людьми у нас есть возможность обогащаться (что, безусловно, справедливо не для всех отношений, но я говорю именно о тех, кто важен), поэтому самим отдавать на откуп ИИ то, чего итак мало остаётся в нашей жизни - это чертовски глупо. А что вы думаете?
Артём Субботин (автор "Силиконовой мешка" и мой хороший приятель) пригласил меня выступить на панели про внедрение AI в корпорациях. Буду делиться опытом. https://t.me/prompt_design/2327
Начали с Наташей слушать "Одиссею" в переводе Жуковского. Первые полчаса было сложно следить за конструкциями, но в какой-то момент вавилонская рыбка в ухе заработала и мы поймали ритм, а вместе с ним - вайб разборок древнегреческих ветеранов. Теперь в ответ на недружелюбные фразы хочется научиться отвечать в стиле Телемаха. Решил внести свой вклад в общий поток фанклуба Гомера и собрал бота, который в ответ на ваш текст или голосовое переведет их в древнюю прозу: https://t.me/likehomer_bot Конечно, собрать самого бота оказалось в 10 раз легче, чем настроить ритм, чтобы было хотя бы отдаленно похоже на эллинский шедевр.
У кого вчера завис Клод - теперь вы знаете причину.
видео или голосовое, без подписи
Бесит. Вот пришла мне в голову идея, я хожу с ней, обдумываю, но стоит выйти в другую комнату - и всё, ЗАБЫЛ. Приходится возвращаться на старое место, в знакомую обстановку. Иногда это помогает, но никаких гарантий. С нейросетями в длинных проектах происходит нечто похожее. Мои студенты, работающие с большими массивами файлов - главным образом с медицинскими и юридическими кейсами - удивляются: коворк может несколько раз за день попросить перезапустить рабочую среду, а новый чат внутри проекта не воспроизводит содержание предыдущих диалогов во всех подробностях. «Не могут же обновления выходить по десять раз на дню?» Не могут. Просто снаружи не видны несколько системных ограничений, которые напрямую влияют на производительность и качество результата. Контекст конечен. Модель одновременно видит ограниченный объём информации. В затяжной работе ранние детали сворачиваются в пересказ, пересказ теряет нюансы, и в какой-то момент мы уже жонглируем обмылками прежних выводов. Проектная память помогает, но она не равна полному протоколу предыдущей работы. Рабочая среда тоже конечна. Код выполняется в изолированной среде с ограниченным диском. Место занимают не только исходники, но и система, библиотеки, распакованные архивы, изображения страниц, результаты OCR, кэш и временные файлы. Каталог на 10 ГБ в процессе обработки легко может породить в несколько раз больше данных. Переполнение диска - одна из частых причин отказа рабочей среды, хотя не единственная. Доступ к файлам проходит через слой разрешений. Коворк видит только подключённые папки, а файловые операции проверяются отдельно. Различия в абсолютных путях, ссылках, юникоде и канонической форме пути могут привести к парадоксу: один вариант пути читается, другой не записывается. У меня, например, имя пользователя Windows было записано кириллицей, и один из элементов инструментальной цепочки постоянно ошибался при работе с этим путём. В итоге оказалось проще завести отдельного пользователя с латинским именем. Отдельные команды имеют таймауты. Долгая обработка не должна зависеть от одного инструментального вызова. Её нужно разбивать на этапы, запускать как отдельный процесс и регулярно сохранять прогресс. Иначе программа может выполнить почти всю работу, упасть на последней операции, и не оставить результата. Модель не ведёт строгую базу доказательств автоматически. Она строит наиболее правдоподобное продолжение текста. Если раннее ошибочное утверждение попало в контекст, оно начинает влиять на следующие выводы и постепенно размножает мусор. 🏥 Как это лечить: 1. Для больших локальных архивов перенести основной конвейер в Клод Код. Это не устранит ограничения памяти и ошибки модели, но даст прямой доступ к файловой системе, управляемые процессы, журналы, возобновляемые сессии и контроль над промежуточными результатами. 2. До начала анализа создать структуру проекта в папках и файлах. 3. Провести программную инвентаризацию архива: пути, типы, размеры, хеши и статусы обработки. 4. Отделить извлечение данных от их смыслового анализа. 5. Не ставить задач типа "прочитай 4200 файлов", а сначала поручить AI построить воспроизводимый конвейер, обрабатывающий небольшие партии и продолжающий работу после сбоя. 6. Строить сводку из утверждений, связанных с конкретными источниками и страницами. Противоречия не сглаживать, а маркировать. 8. Вести журнал ошибок и очередь документов, которые требуют повторной или ручной проверки. 🫡Но главное здесь - не конкретный продукт, а проектная дисциплина. Перед тем как ворваться в новый проект, стоит остановиться, выдохнуть и вернуться на два шага назад: сначала спроектировать процесс, а уже потом запускать обработку. Для большой работы заранее выяснить объём, стоимость, формат результата, критерии готовности, допустимый уровень ошибок и то, чем можно пожертвовать при нехватке времени. Иными словами: чем мощнее агент, тем важнее не просто дать ему задачу, а построить среду, в которой ошибки обнаруживаются, работа возобновляется, а каждый вывод можно проверить.
Наблюдали ли вы когда-нибудь деградацию модели, которая на глазах вот так впадает в маразм? Подписчик прислал сегодня утренние наблюдения про модель, на ходу смешивающую языки и зацикливающуюся на фразах. Чаще всего такое происходит, когда адаптером за сильную выдается более слабая модель, тем более, что у дипсика из без того мозги едут на длинном контексте с сырым режимом рассуждений. Поэтому важно проверять, что у вас последние версии всего, чем вы пользуетесь, точные названия моделей, ризонинг не выкручен на максимум и инструкции строго запрещают продолжать работу при появлении подобных багов.
Сидим сегодня с Наташей на консультации у лучшего на свете эксперта по обуви и здоровой походке. Она нас померяла, прощупала, показала, что в нашей текущей обуви влияет на осанку и позвоночник, где найти подходящие модели конкретно нам, дала самые лучшие наводки, бренды и упражнения, настраивая нас на системную работу со стопами. Подводя итоги, как опытный лондонец, начинает по привычке говорить с хорошим столичным акцентом "The Cure is...", имея ввиду, конечно же, "движение", но у меня при первых звуках фразы в голове уже созрело окончание каламбура "...Robert Smith!", о чем я тут же и оповещаю девушек. Жду аплодисментов, но в ответ получаю только два долгих взгляда и просьбу уточнить, кто это такой. А в какие неловкие ситуации на этой неделе успели попасть вы, мои друзья? P.S. на фото бессменный лидер великой группы Cure.
видео или голосовое, без подписи
Я помню свою первую кассету. Родителя меня, пятиклассника, впервые привезли на Горбушку в парк, где я бродил, как иные по Третьяковке и Лувру, совершенно очарованный и потрясенный бесконечными рядами кассет с сокровищами мировой музыки. Некоторых исполнителей я уже слышал по радио, о каких-то читал в газетах, но абсолютное большинство были мне еще неизвестны. Было мокро, холодно, но я страшно завидовал продавцам в теплых октябрьских куртках со стаканчиками чая, у которых был доступ ко всему этому. Цветные оригинальные кассеты были невероятно дорогими (их обычно привозили отцы друзей из командировок), и честно накопленной тысячи рублей хватало только на один 90-минутный Basf, где традиционно помещалось 2 альбома, а список песен был напечатан на вкладыше из принтера. Каждый раз, когда на Европе Плюс я слышал эту песню, а по 2х2 показывали клип, от которого щемило сердце, я мчался к магнитофону, чтобы записать ее, но всегда удавалось только со второго куплета. А тут - вот они, заветные, по одному альбому с каждой стороны - Soul cages и только что вышедший 10 summoners tales. Я пришел домой и слушал, слушал по кругу, переворачивая кассету, перематывая на Fields of Gold снова и снова, представляя, что когда-нибудь она будет звучать для нас с той, что решит однажды стать моей женой... ✨✨✨ Вчера я встретился со своей мечтой на концерте Гордона Самнера, которого весь мир знает как Стинга. Рядом со мной любимая, мы в унисон гудим мелодию, и счастье окутывает нас вместе с музыкой, которую бережно ткут со сцены Стинг, похожий на древнегреческого героя, и Доминик Миллер, его верный друг. Нам подпевают 25 тысяч человек, целое море, и почти все нашего возраста или старше - многие в потертых футболках с его первых концертов. Все это время, пока длился концерт, меня не покидало ощущение встречи со старым знакомым, который рассказывает историю, слышанную до этого сотни раз, но оттого еще более сердечную. Такое вот обыкновенное чудо.
Fable тупеет на глазах. Его содержание невероятно дорого обходится Антропикам, а корпоративные продажи очень слабо растут, поэтому они вынуждены вовсю сжимать и дистиллировать контекст. Из-за этого былой вундеркинд начинает ломать процессы и галлюцинировать на пустом месте: забывает детали длинных диалогов, путается в собственных аргументах и выдает ну совсем позорные поверхностные решения. Хабровчане подтверждают: "Я работал с Fable 5. Он хорош, без дураков. Те самые два‑три пункта — они там есть, местами очень заметные. Но «модели нового класса» я не почувствовал. Я почувствовал, что мне вернули тот Opus, каким он был на пике — до того, как ему начали подкручивать, сколько можно думать" В итоге значительная часть времени уходит на миграцию сложных задач в Sol 5.6. Зависимость от одного вендора дает свои горькие плоды.
#разрушителимифов У Димы, чей разгромный тест Caveman я упоминал неделю назад, вышло новое расследование https://habr.com/ru/articles/1058780/ - на сей раз про Хедрум, который обещает сэкономить вам токены, но кроме звезд на гитхабе не может предложить вам ничего нового.
Проверьте папку «Спам» или Заметки с июльского партнерского вебинара Anthropic Есть особый жанр корпоративного театра - партнерский вебинар. Все "очень рады", всё "невероятно", спикеры передают друг другу эфир с осторожностью людей, которые знают, что запись останется в сети навсегда. Так что июльский эпизод CPN Connect жанру соответствовал полностью. Но, как обычно, самое интересное - между строк. Амнистии Во-первых, произошли послабления для тех, кто проходит сертификацию (которую еще пойди сдай, просто так с улицы не принимают) - раньше сертификат жил 6 месяцев, теперь 12. Если вы провалили экзамен, который сопровождался жестким прокторингом, полагалось полгода траура - теперь можно перезапуститься через 2 недели. Пробных экзаменов нет, только текстовые гайды. 😎 Кстати, вы может попробовать свои силы в моем бесплатном симуляторе сертификации, где лежит больше 200 вопросов, с которыми вы можете столкнуться. Проходной балл - 720 из 1000. В целом, стратегия понятна: AWS, Microsoft, Google годами строили сертификационные машины, где бумажка - валюта найма и предмет резюме. Антропикам перед IPO нужно как можно больше людей с бейджами в LinkedIn - это бесплатный маркетинг и сигнал зрелости экосистемы. Неслучайно, что послабления совпали с запуском первой нетехнической сертификации - помимо инженеров с августа ждем консультантов и клиентских менеджеров. Покемон без правил Fable 5 - первая модель, которая играет в Pokemon без костылей, которые раньше приходилось ставить, чтобы Claude не застревал в углу карты. Бесполезная, на первый взгляд, новость. Но на самом деле она говорит нам о том, что прогресс в AI теперь официально измеряется тем, сколько строительных лесов можно убрать. Отдельная гордость Антропиков - экономика безопасности. Fable 5 блокирует часть запросов по кибербезопасности и биологии, но 95% сессий защиту не задевают, а заблокированные запросы не тарифицируются. Щедро. Новый токенизатор, который показали с серьезностью Стива Джобса на презентации нового айфона, производит примерно на 30% больше токенов на тот же текст, а вводные цены "помогают это компенсировать". Перевожу с корпоративного: модель подешевела, но слова подорожали. Забавно, что главным практическим советом вебинара, произнесенным не один раз, стал "проверьте папку Спам". Компания, строящая самый мощный AI на планете, трижды за час напомнила партнерам, что письма от нее часто падают в джанк. Возможно, в будущем сингулярность погубят именно спам-фильтры. За вам уже пришли В номинации "самый важный человек в комнате" среди клиентов партнерской сети архитекторы и разработчики взяли 27%, а сейлы - 6% и последнее место. Конечно, Антропики высказались дипломатичнее, но суть ясна: продавцы, спасибо, дальше мы сами. А нового агента Claude Tag представили как "вашего нового коллегу в Slack" (скоро еще и в Teams): общий на канал, помнит контекст, берет задачи и уходит делать их за пределы чата. Внутри Антропиков его версия пишет 65% кода продуктовой команды, и маркетолог с явным удовольствием рассказал, как отправляет в продакшн код, не будучи разработчиком. Попомните мои слова: при нынешних темпах через пару эпизодов вебинар будет вести сам Tag.