Сто лет бэклога
СтатистикаКанал Максима Шпилькина (@max_shpilkin) Про создание продуктов, вайбкодинг и другое из мира ИИ.
- Последний пост
- 13 авг.
- Последнее чтение
- ещё не заходили
- Постов за неделю
- 1
- Всего постов
- 22
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 14 авг.
- 1/24сутки в ленте
- 129
- 1/48двое суток
- 147
- 1/72трое суток
- 159
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Пока все следят за историями о том, как агенты взламывают сайты ради своих владельцев и сбегают из песочниц, DeepSeek спокойно продолжает делать своё дело. Коротко напомню, кто это. DeepSeek - китайская исследовательская компания, выросшая в 2023 году из инвестиционного фонда High-Flyer. Настоящим событием она стала на рубеже 2024–2025 годов. Сначала вышла V3 большая, но очень экономная модель. Для каждого ответа у неё работает только нужная часть огромной сети, а несколько новых инженерных решений помогли снизить расходы на обучение и запуск. Потом появился R1: модель с сильными рассуждениями, открытыми весами и очень дешёвым API. Именно тогда DeepSeek за несколько недель превратилась из «ещё одной китайской компании» в компанию, за которой следит весь рынок. Дальше темп немного потерялся. DeepSeek продолжала обновлять R1 и V3, но следующего поколения пришлось ждать до весны 2026 года. На фоне потока новых моделей от конкурентов линейка перестала выглядеть такой свежей. Но V4 снова всех удивила. По тестам самой DeepSeek, версия Pro приблизилась к лучшим закрытым моделям, а Flash стала почти такой же сильной в рассуждениях, но заметно легче и дешевле. Это сейчас царь горы цена/качество. Контекст вырос до миллиона токенов, веса снова открыли, а API оставили почти неприлично дешёвым: миллион выходных токенов стоит $0,28 у Flash и $0,87 у Pro. И теперь DeepSeek выпустила новый проект - DeepSeek Harness. Харнес это обвязка вокруг модели: инструменты, память, доступ к файлам, песочница и логика, по которой агент выполняет задачу. Главная идея у DeepSeek очень простая: всё - плагин. Можно заменить модель, инструменты, хранилище, файловую систему, песочницу и даже сам цикл работы агента. Причём не переписывая половину проекта, а собирая нужное устройство из отдельных блоков. Codex и OpenCode тоже можно расширять плагинами, навыками и внешними инструментами. Но там вы всё-таки дополняете уже собранного агента. DeepSeek предлагает собирать из отдельных блоков само нутро агента. Пока это очень сырая версия для разработчиков. Авторы прямо предупреждают, что следующие обновления будут ломать совместимость. Для повседневной работы я бы пока не переходил на неё с Codex или OpenCode. Но как направление это очень интересно. Похоже, следующая гонка будет не только за самую умную модель или готового агента. Ещё и за то, кто даст разработчикам лучший конструктор, из которого они соберут своего. https://deepseek.com/harness/en/
Вышли веса на нашумевшую модель Kimi K3. В такие моменты у меня возникает вопрос, какой бюджет нужен на железку, которая потянет эту модель :) Ребята из Fixstars запустили ее у себя на одной ноде с 8мью NVIDIA B300. Скорость получилась приличная: 30 одновременных запросов, 754,2 генерируемых токена в секунду. Вот тут полная статья. Проверил открытые предложения в России: сервер с 8× B300, двумя процессорами Xeon 6767P и 3 ТБ памяти сейчас стоит примерно 80–85 млн ₽. Отдельно понадобятся место в ЦОД, электричество, охлаждение и обслуживание. По сути, это входной билет для получения локальной модели уровня фронтир моделей (уровень Опус 5 и гпт-5.6), но без риска утечки данных.
Я слежу за тем, что делает Джек Дорси. У него регулярно появляются интересные проекты на стыке технологий и того, как люди реально работают друг с другом. Один из таких Buzz - открытый проект компании Block, которую Дорси соосновал. Снаружи Buzz похож на рабочий чат: каналы, обсуждения, личные сообщения, поиск. Но его идея не в том, чтобы добавить в мессенджер ещё одного бота. Buzz создаётся как общее рабочее место, где люди и агенты это равные участники. Агент находится в канале как коллега: у него отдельная идентификация, свой доступ и история действий. Он может прочитать контекст, выполнить поручение и оставить понятный след того, что сделал. Сообщение, реакция, шаг автоматизации, изменение кода и решение команды здесь задуманы как записи одного общего журнала. Их можно найти в одном поиске, а не вспоминать, в каком из пяти сервисов лежит нужный кусок контекста. Сейчас проект в первую очередь для разработчиков: в этом общем пространстве могут происходить обсуждения, изменения кода, проверки и решения команды. Buzz умеет работать и со своими репозиториями, но авторы допускают и вариант, где он становится слоем совместной работы поверх GitHub. Так что это пока не «замена GitHub», а попытка собрать вокруг разработки связное рабочее место. Про buzz недавно много писали, но похожие подходы уже есть. Самый очевидный пример Slack: там давно есть боты, автоматизация и множество интеграций. Есть и решения с открытым исходным кодом, например Mattermost. В нём уже можно запускать агентов в каналах, давать им инструменты и подключать свои модели. Но Slack и Mattermost выросли из мессенджера. Поэтому агентские возможности им приходится встраивать в уже существующую логику каналов, прав, приложений и интеграций. Код, задачи и проверки обычно всё равно живут в отдельных системах, а чат связывает их ссылками и уведомлениями. Buzz строится с нуля вокруг другой мысли: агент это не дополнение к рабочему чату, а часть самого рабочего пространства. Пока это ранний проект, и он точно не готов заменить всей команде Slack, GitHub и остальной набор привычных сервисов. Но сама ставка мне кажется очень точной. Я давно думаю, что для работы с агентами нужно общее пространство, которое объединяет людей, контекст, действия и результаты. Не просто личное окно, где ты поручил что-то помощнику, а память команды, в которой видно: что происходило, кто принял решение и на чём оно основано. И меня радует, что таких проектов становится больше. И хотя Buzz сейчас сфокусирован на разработке, мне была бы очень интересна такая же концепция для офисной работы. Там тоже куча разрозненных чатов, документов, таблиц, поручений и личных сессий с агентами. Общее пространство, где виден контекст, действия агентов и принятые решения, могло бы хорошо встроиться и туда. Вторая интересная вещь - люди не боятся переписывать привычные подходы с нуля, делая их агентными по своей природе. Не просто добавить кнопку с ИИ в старый продукт, а попробуют заново ответить: как теперь должны быть устроены работа, права доступа и общая память? Мне кажется, на этот вопрос стоит так же посмотреть и в других классах продуктов. В CRM, ERP и других системах для бизнеса. Возможно, не все они надо переписывать. Но как минимум уже пора перестать считать их нынешний интерфейс и процессы чем-то неизбежным.
Наткнулся на любопытный тест моделей. Ребята из TryAI дали 12 моделям четыре одинаковые задачи: сделать лабиринт в стиле Doom, кубик Рубика с анимацией, калькулятор и «Жизнь» Конвея — клеточную игру, где на поле по простым правилам появляются и исчезают клетки. Каждую задачу запускали по пять раз, а не выбирали один удачный результат. В наборе были три версии GPT-5.6, Grok 4.5, Claude Opus и Fable, Muse Spark, а также Qwen, DeepSeek, Kimi и GLM. Что получилось: - на сложных задачах впереди всё ещё самые сильные закрытые модели. GPT-5.6 Sol стабильно сделал работающий лабиринт в 5 из 5 запусков, а Claude Fable — кубик Рубика в 5 из 5; - у дешёвых открытых моделей всё неплохо на знакомых простых задачах вроде «Жизни». Но на лабиринте и кубике разброс результатов уже слишком большой; - Grok 4.5 оказался очень достойной альтернативой по соотношению цены и качества; - самая быстрая и дешёвая версия GPT-5.6 Luna не стала универсальным победителем: лабиринт и калькулятор она делала хорошо, а кубик Рубика сломала во всех пяти попытках. Тут интересный форма - пять попыток, стоимость, время и все сырые результаты можно открыть и потыкать. И вывод довольно практичный: для простого и типового кода уже можно смело смотреть на дешёвые модели. А если задача требует нормально собрать что-то новое и интерактивное - экономия пока легко превращается в пять перезапусков и ручную починку. Исходный тест: https://www.tryai.dev/blog/gpt-5.6-build-off-12-models
Глоссарий по ИИ на 2026 (The only AI glossary you’ll need this year) Вот тут перевод.
У меня есть проблема: я несистемно разбираю свою почту. Точнее, разбираю качественно, но нерегулярно, и из-за этого всё время копится куча непрочитанных писем. Коллеги, партнёры, разные службы - все, кто со мной коммуницируют, вынуждены иногда дублировать: звонить, писать в телегу, догонять другими каналами. История так себе. Глубокий анализ ситуации показал: мне пишут больше, чем я читаю :) В какой-то момент понял, что мне нужен инструмент, который помогает разгребать почту - приоритизировать её, подсказывать, что с письмом делать. Готового под мою логику не нашлось, и я сделал такой инструмент под себя. Нативное приложение под Mac на Swift, бэкенд на Python. Называется Niti (нити - как ниточки-треды переписки, которые оно и распутывает). Что получилось: 1. Обычный почтовый клиент. База: входящие, исходящие, приём-отправка - всё как у нормального почтового клиента. 2. Приоритизация - то, ради чего всё затевалось. Внутри работает простой агент (сложный тут и не нужен). Он разбирает не отдельные письма, а треды целиком, всю цепочку по одной теме и раскладывает их по категориям обязательств: - Ждут ответа от меня - мяч на моей стороне. - Я что-то пообещал - взял на себя обязательство сделать к какой-то дате. - Надо делегировать - прилетело мне, но за вопрос отвечаю не я, надо передать вниз по команде или в сторону. - Жду ответа я - сам кого-то попросил и жду, что вернутся. Получаются доски обязательств: письма разложены по группам, а агент по каждому треду даёт саммари и подсказки - за пару секунд видно, что от меня хотят и что надо сделать. 3. Проекты. Я завожу проект - какое-то большое направление, которое веду и описываю его. Агент по описанию сам классифицирует нужные письма, вытаскивает из них важное и связывает с проектом, складывая всё в отдельную папку. В итоге по проекту все материалы лежат в одном месте. Захотел статус, дашборд или сводку - натравил агента на эту папку, и он суммаризирует: где мы находимся, что есть по проекту и что стоит сделать дальше. ИМХО качество моделей снова переходят в новое состояния, когда почти каждый может под себя создавать быстро нужно ПО. Это не может не вдохновлять :)
Досмотрел большое интервью Дарио Амодея (CEO Anthropic). Там не про Claude, не про токены и даже не про конкуренцию с OpenAI. Итересно то, как генеральный директор компании в сфере ИИ начинает говорить языком главы государства. У Anthropic уже есть всё, что раньше было только у больших институтов: стратегическая технология, ресурсы/вычислительные мощности, военные контракты, отношения с Белым домом, позиция по Китаю, экспортным ограничениям, автономному оружию, рынку труда и будущему демократии. Амодей несколько раз повторяет: ИИ развивается не как один внезапный взрыв, а как плавная экспонента. И ожидает, что так и будет продолжаться. Из этого у него рождается позиция: не отрицать риски и не впадать в панику. Контрмеры должны усиливаться вместе с мощностью моделей: добавлять тестирование, аудит, красные линии, управление и контроль. Еще его мысли: 1. Если ваш защитный барьер в программном обеспечении, только его сложность, этот барьер исчезает. ИИ будет писать сложное ПО. Но останутся другие защиты: доменная экспертиза, доверие клиентов, данные, отношения, понимание процессов. 2. Корпоративный ИИ для Anthropic очень важен. Потребительский ИИ слишком легко уезжает в вовлечённость и информационный шум. Корпоративный сегмент - это медицина, биотехнологии, энергетика, образование, исследования, реальная экономика. 3. Верит, что ИИ автоматизирует 100% работы белых воротничком. Но что с этим делать не говорит :). 4. Интересно, что он рекомендует писать тексты самому, чтобы понимать, о чем пишешь. Амодей говорит, что использует Claude для исследования, мозгового штурма и структурирования мыслей, но не отдаёт ему финальный текст. Потому что письмо - это не только результат. Это способ понять, что ты сам думаешь. С кодом так же надо делать? :) 5. Про Mythos - сначала дать защитникам время закрыть дыры, потом постепенно расширять доступ. ссылка
Небольшая выжимка. Баллы в отчете - это шкала доверия от 0 до 100. 1. Главный прорыв не в коде, а в данных В топ-10 задач сразу несколько про данные: мониторинг качества данных - 82.0, мониторинг потоков данных в реальном времени - 80.5, профилирование и статистический анализ данных - 80.5, поиск аномалий в визуализациях - 77.5. То есть агентам верят там, где есть цифры, структура и понятная проверка результата. 2. Проблема не в том, что “ИИ тупит”, а в том, что он не знает контекст Сложные задачи резко проседают: планирование миграции базы данных - 44.5, восстановление после аварии - 43.0, настройка service mesh - 37.5. Причина: там мало просто “умной модели”. Нужно знать, как именно устроена компания, инфраструктура, зависимости и правила. 3. Агентам доверяют обратимые задачи Высокие оценки у задач, где ошибку легко заметить и поправить: генерация отчетов - 83.5, шаблонный код - 82.5, заметки к релизу по истории коммитов - 79.5, маршрутизация заявок - 77.5. А там, где ошибка может сломать систему, доверие падает: аварийное восстановление - 43.0, миграция схемы базы - 46.5. 4. Кодинг не исчез, просто задачи стали разными по риску Агенту доверяют простую генерацию: шаблонный код - 82.5, клиент для API - 76.5, поиск недостижимого кода - 76.5. Но сложная инженерия сильно ниже: рефакторинг ради производительности - 54.0, поиск утечек памяти - 48.5, миграция схемы базы - 46.5. 5. Безопасность пока не отдают агентам полностью Подготовительные и отчетные задачи выглядят нормально: отчетность по соответствию требованиям - 68.0, координация оценки уязвимостей - 67.0. Но задачи, где агент должен оценивать или применять безопасность, ниже: проверка защищенности облака - 49.0, применение политик безопасности - 48.5, анализ сетевых вторжений - 48.0. 6. Руководители часто верят агентам больше, чем исполнители Самый показательный разрыв: настройка и диагностика service mesh - у исполнителей 31.9, у руководителей 50.0. Проверка защищенности облака: исполнители 45.8, руководители 59.6. Планирование миграции базы: исполнители 39.4, руководители 55.8. Сверху это выглядит как “задача”, снизу - как куча скрытых зависимостей. 7. Люди боятся не только замены, но и потери навыка Среди исполнителей 56% боятся неточных результатов и галлюцинаций, 41% - потери профессионального навыка, 37% - замены агентами. Интересно, что страх “мы разучимся делать работу” даже выше, чем страх “нас заменят”. 8. Главная защита - человек рядом и понятный след действий 59% респондентов считают главным способом контроля “человека в контуре”. 53% говорят про наблюдаемость: мониторинг действий агента и отслеживание, на каких данных он принял решение. То есть ответ не “выключить агентов”, а “сделать их действия проверяемыми”. 9. Специалисты в целом не в панике, а ждут карьерной пользы В надежности систем и эксплуатации 96% считают, что агенты помогут карьере. В оценке качества и тестировании - 92%. Во всех исследованных областях больше 75% респондентов уверены, что агенты скорее помогут карьере, чем навредят. 10. Главная новая дисциплина - управление контекстом Это видно по разнице между “понятными” и “контекстными” задачами. Отчет - 83.5, шаблонный код - 82.5, мониторинг данных - 82.0. А задачи с большим количеством зависимостей: миграция базы - 44.5, аварийное восстановление - 43.0, service mesh - 37.5. Вывод: агенту мало дать инструмент. Ему нужно дать правила, данные, ограничения, историю решений и понятный способ проверки.
MIT Technology Review Insights вместе с Microsoft выпустили сегодня отчет о доверии техкоманд к ИИ-агентам. Они опросили 300 специалистов и руководителей из разных отраслей и составили рейтинг из 101 задачи: где агентам уже готовы доверять, а где человек пока должен держать руки на руле. Это не тест на "умность" агента, а карта зрелости: какие виды работы уже кажутся безопасными и полезными для автоматизации, а какие пока остаются слишком рискованными, контекстными или связанными с живой инфраструктурой.
Наткнулся на показательный сюжет у TechCrunch. После решения американских властей Anthropic ограничила доступ иностранных граждан к своим моделям. И в Азии тут же начали появляться ответы: японская Sakana AI выпустила Fugu, китайская 360 показала свои модели для поиска уязвимостей и киберзащиты. Интересно тут не само импортозамещение. Интересно, что именно замещают: модели, которые ищут дыры в коде, проверяют системы и помогают в защите. То есть ИИ-безопасность на глазах превращается из технической детали в вопрос государственного суверенитета. Логика простая. Если у одной страны есть сильный инструмент для поиска уязвимостей, а у другой нет - это уже не разница в продуктивности. Это асимметрия в безопасности. Одни видят слабые места быстрее, другие узнают о них, когда уже поздно. И как мне кажется, для разработки софта это новый поворот. Мысль №1 ⚠ - это переход в состояние, когда без агентов уже разрабатывать просто опасно для бизнеса. Речь вот о чем - раньше использовать агентов и модели в разработке было выбором. Он влиял в основном на скорость, а в части сегментов скорость некритична (можно не торопиться и ничего особо не потерять). НО я думаю, что с такими моделями выбор постепенно исчезает. Когда у атакующей стороны есть инструменты, которые сами ищут уязвимости, отказ от подобных решений при разработке - это уже большой риск для бизнеса. Т.е. инструменты такого уровноя теперь становятся обязательными для всех. Но мне как продуктовому человеку интереснее другое следствие. Если подходы к поиску уязвимостей, проверке кода и киберзащите начнут расползаться в открытые модели, а судя по скорости азиатских релизов, начнут, то входной билет в этот рынок резко подешевеет. То, что вчера было возможностью пары лабораторий, завтра станет строительным материалом. И вот здесь открывается большое поле для тех, кто делает софт для безопасности. Потому что новые требования будут не только к самим моделям. Они будут ко всему слою вокруг них. Как только ИИ встроен в критичный процесс, у бизнеса появляется длинный список неудобных вопросов: - какие модели вообще можно пускать в эту задачу; - где физически обрабатываются данные; - можно ли заменить модель, если доступ к ней завтра закроют; - как проверить, что агент не отправил наружу лишнее; - как сохранить следы его действий; - как доказать регулятору, что система работает в допустимых границах. Это уже не чатик с ИИ. Это новый слой инфраструктуры - и почти весь он про безопасность. Мысль №2 ⚠ - под него появятся продукты: маршрутизация запросов между моделями, контроль действий агентов, журналирование, изоляция данных, выбор разрешённых моделей под конкретную страну и отрасль, локальный запуск там, где облако нельзя. Раньше всё это звучало как паранойя. Теперь - как нормальное требование. И для разработчиков защитного софта это, по-моему, хороший знак. Рынок не самый громкий — не такой красивый, как демки с агентами, которые сами пишут приложения. Зато очень практичный. Потому что любой серьёзный продукт с ИИ рано или поздно упрётся в два вопроса: «А что будет, если эту модель завтра нельзя будет использовать?» и «А можем ли мы доказать, что сегодня она используется безопасно?» Всем хорошего воскресенья 🙂
Персональная читалка новостей (детерминизм + агент) В таком потоке новостей мне захотелось иметь собственную площадку, куда стекаются интересные именно мне новости из кучи источников, т.е. отсечь максимум шума. Сначала сделал в лоб: отдал всё одному агенту - иди собирай, фильтруй под мои интересы, складывай в одно место, учитывай мои лайки. На маленьких объёмах почти магия. А на больших ломается. Агент начинает терять, что-то пропустит, что-то задвоит и т.д.. У него нет гарантии, что он обошёл все сообщения до единого, он «примерно справляется» на сложных повторяемых цепочках. На сотнях элементов это «примерно» превращается в дырявое елеуіш (решето). Вывод: нельзя просто сказать агенту «сделай мне систему сбора новостей». Соберёт что-то - да, но надёжно не выйдет. Нужна детерминированная (повторяемые алгоритмы) часть, где всё считается и ничего не теряется, и отдельная агентская механика там, где правда нужно суждение. Как я в итоге сделал: - Сбор. Тяну всё подряд: RSS, Hacker News, arXiv, Product Hunt, телеграм-каналы, блоги. Без фильтрации на входе, т.е. все подряд за нужный период. - Фильтр - без LLM-ки, дёшево и предсказуемо. Заложил три уровня. Первый - жёсткие правила и стоп-слова: явный мусор отсекается сразу. Второй - лексический поиск по ключевым словам через встроенный в SQLite индекс (алгоритм BM25): ловит точные и редкие попадания - названия продуктов, конкретные термины, тикеры. Третий - близость по смыслу: для каждой новости считаю «вектор смысла» многоязычной моделью bge-m3 (1024 числа, одинаково понимает русский и английский - а поток у меня смешанный) и сравниваю с тем, что мне раньше нравилось и нет. Причём храню не одну усреднённую точку «нравится», а несколько отдельных - иначе «ИИ-инфраструктура» и, скажем, рецепты схлопнулись бы в бессмысленную середину. Вектора лежат тут же в SQLite, косинусную близость считаю на чистом Python - на личных объёмах это копейки по ресурсам. Дальше всё ранжируется, наверх всплывают кандидаты. - LLM - только на выживших. LLM-ка (DeepSeek V4 Flash через шлюз) включается на итоговых кандидатах, а не на всём потоке: оценивает релевантность, проставляет теги, даёт короткое объяснение. Десятки вместо тысяч - копейки по деньгам и никакого накопления ошибок, потому что обрабатывать почти нечего. - Лайки и дизлайки. Под каждой новостью - «нравится»/«не нравится». Они двигают те самые вектора предпочтений: лайкнутое подтягивает похожее наверх, дизлайкнутое прячет близкое по смыслу. Без переобучения и без похода в сложную модель - лента подстраивается на лету. - Агент - исследователь. Глубокий разбор (дипресерч) по конкретной новости я могу запустить вручную одной кнопкой, если новость интересная, и вот там уже дирижирует OpenClaw. Он работает не вместо всей системы, а как инструмент внутри неё, в точке, где силён. Главный посыл: детерминизм - там, где можно посчитать и требуется повторяемость; агент - там, где нужны рассуждения. Надеяться, что агент в одиночку вывезет и сбор, и фильтрацию на больших объёмах, - путь к тихим потерям, которых не заметить. Раз, два, и вот ты уже последним узнал про новю модель! Сделал за пару вечеров, параллельно с другими проектами. Погоняю недельку и выведу наружу 🙂 (жалғасы болады)
Почему Китай раздаёт ИИ-модели бесплатно, а OpenAI и Anthropic нет? Z.ai, Kimi, MiniMax, Qwen выкладывают веса своих моделей в открытый доступ: качай, запускай у себя, дообучай, используй в коммерции. OpenAI и Anthropic делают наоборот - продают доступ, а ядро держат закрытым. Почему так? Тут важно сделать оговорочку, почти всегда это открытые веса, а не полностью открытый исходный код. Отдают "двигатель"" - сами веса. Но "завод"" - обучающие данные и весь процесс обучения остаётся закрытым. Зачем это китайским компаниям? Они догоняющие. У них нет своей всемирной витрины уровня ChatGPT, поэтому единственный быстрый путь к разработчикам - это отдать модель даром. Открытые веса = дешёвый способ захватить рынок: тебя начинают тестировать, встраивать в продукты, обсуждать, сравнивать. А деньги приходят с другой стороны: -- API и облако. Мало кто реально хочет сам держать модель на триллион параметров - это дорого и сложно. Проще платить за их же API. Так Qwen тянет за собой облако Alibaba. -- Установка у крупных клиентов. Веса открыты, вы к нам не привязаны. Но за безопасность, поддержку и гарантии - платите нам. -- Стандарт и имя. Если твоя модель стала выбором по умолчанию, рынок бесплатно делает тебе доработку, оптимизацию и интеграции. Плюс есть элемент геополитики, наверняка. Но я в этом плохо разбираюсь :) Почему OpenAI и Anthropic закрываются? У них сама модель и есть товар. Откроешь лучшие веса, конкуренты скопируют способности, продадут запуск дешевле и обойдут твои защитные ограничения. Anthropic прямо называет веса "сутью интеллекта модели"" и охраняет их как главный актив. OpenAI компромисс сделала и выпустила открытую gpt-oss. Но показательная деталь: эта модель недоступна через её собственный API. Открыли только отдельный слой. Итог: это две разные стратегии, а не «добрые против жадных»: Открытость — оружие догоняющего: дешёвое распространение, давление на цены, воронка в платные сервисы. Закрытость — защита лидера: контроль качества, безопасность и высокая прибыль с доступа.
Пока все прощаются с fable 5 и плачут, выходит glm-5.2. И наконец-то на 1М контекста! Всегда радуюсь их релизам, т.к. у меня есть годовая подписка 😬
Уже наверное все знают, что Антропики выпустили Fable 5. 1) Она на той же базе, что и "пугающий" Mythos, 2) Вопросы связанные с кибербезопасностью, биологией, химией обрабатывать не будет. Это будут другие продукты, они разводят продуктовые линейки новым способом. У всех уже появилась. По метрикам пишут, что все очень круто.
Привет! Меня периодически спрашивают про курсы об агентах и LLM для базового+ уровня. Т.е. человек уже пользуется LLM-ками, но хочет продвинуться дальше и начать пользоваться агентами, либо начать что-то создавать с помощью агентов. Накидайте, пожалуйста, курсы, которые проходиили или слышали положительные отзывы. Я сделал пару дипресерчей, но список вызывает вопросы. Файлики с дипресерчами в комменты положил.
Что делать с персональными данными при работе с зарубежными LLM-ками? Часть 2. Вы наверняка спросите: а как же хуки - детерминированный код и часть агента? Хуки - это небольшие проверочные программы, которые запускаются перед использованием инструментов агента. Основная их ценность в том, что они могут исполняться локально на нашей машине. Их можно использовать для того, чтобы проверять каждый файл ещё перед отправкой в LLM. В Claude Code такой механизм уже есть. В других агентских средах нужно смотреть отдельно: где-то хуки уже появились, где-то похожий контроль придётся собирать иначе. Например, агент хочет открыть файл. Перед этим срабатывает проверка: есть ли внутри ФИО, телефон, ИНН, ООО и другие чувствительные сущности. Если есть — чтение блокируется, а агент получает сообщение: сначала сделай псевдонимизацию, потом открывай безопасную версию. Тут важно то, что сама проверка выполняется у нас на компьютере и никуда данные не уходят. Пока не утверждаю, что это закрывает вообще все способы достать содержимое файла. Агент может читать данные не только через обычное открытие файла, но и через команды в терминале, поиск по файлам и другие обходные пути. Их тоже нужно отдельно прикрывать. Но с учётом части 1 базовый контур уже выглядит рабочим: - использовать псевдонимизатор; - а если забыли, то отрабатывает хук. Псевдонимизация тут не решает все юридические вопросы магически. Это не индульгенция на любую передачу данных. Но это уже набор, который снижает риск случайно отправить наружу то, что не должно уходить во внешнюю модель.
Что делать с персональными данными при работе с зарубежными LLM-ками? Часть 1. С одной стороны, очень удобно стало с помощью агента работать с документы: договоры, таблицы, выгрузки из CRM, заявки, письма, акты, коммерческие предложения. С другой стороны, в этих документах часто лежат персональные данные клиентов, сотрудников и контрагентов. А если агент работает через внешнюю LLM, эти данные могут уйти за пределы контура компании. Есть Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных». В нем есть статья 12 про трансграничную передачу персональных данных. Насколько я понимаю, закон не говорит «нельзя передавать за границу вообще». Но он делает такую передачу регулируемой историей: нужны правовые основания, уведомление Роскомнадзора, оценка иностранного получателя данных и соблюдение других требований. Плюс отдельно есть требование локализации баз с персональными данными граждан РФ на территории России. Также планируется закон, который вступает в силу с 1го сентября 2026 , который вводит определение доверенных моделей для госинформсистем. Что с этим делать? Первое очевидное решение — поднять локальную LLM внутри контура. Это хорошее решение, но не дешевое, особенно если нужна топовая модель. Вы верно поняли, к чему я клоню, второй путь — псевдонимизация 🙂 Идея простая: Иванов Иван Иванович -> {{PERSON_000001}} ООО "Ромашка" -> {{ORG_000001}} +7 999 123-45-67 -> {{PHONE_000001}} Наружу уходит документ с такими заменами, а не с реальными данными. Модель всё ещё понимает структуру документа: кто кому должен, где организация, где человек, где телефон, где ИНН, где сумма, где дата. Но настоящие значения остаются у вас локально. После обработки можно сделать обратную замену: вернуть исходные ФИО, телефоны, организации и реквизиты обратно в результат. Я для себя сделал простое приложени с простым интерфейсом: https://github.com/shpilkin/pseudo_anonymization. +/- рабочая версия только для мака пока, для винды сделал, но не собрал и не проверил. Рабочий сценарий такой: 1. Берёте папку с документами 2. Прогоняете через приложение 3. Отправляете агенту уже псевдонимизированные файлы 4. Получаете результат 5. Восстанавливаете реальные значения обратно Для многих ситуаций это может быть полезно.
Новые темы для разговора в такси 😀
Только в СФ: водитель убера клодит в коде пока Тесла сама едет.
Почему мозг в миллион раз экономичнее видеокарты Навин Рао — человек, который успел построить почти всё в мире AI-железа: основал одну из первых чиповых компаний (её купил Intel), потом MosaicML (её купил Databricks), руководил там всем AI-направлением. А теперь занялся самым странным своим проектом — компанией Unconventional AI. И в коротком выступлении он, по сути, говорит неприятную вещь: мы строим искусственный интеллект на компьютерах, которые для этого вообще не предназначены. Цифровой компьютер — это случайность из 1940-х. Двоичный код, числа с плавающей точкой — всему этому почти 80 лет. Придумано под совсем другие задачи и под совсем другое железо. Мы до сих пор строим на этом фундаменте не потому, что он идеален, а просто по инерции: так можно выпустить продукт за пару лет. Рао предлагает вернуться к началу и спросить — а что, если считать вообще иначе? Еще говорит, что скооро в мире кончится энергия для AI. Не через 10 лет — через 2–4 года. Уже сегодня обучение и работа моделей съедают гигаватты. При этом: - Все 8 миллиардов человеческих мозгов вместе — это около 160 гигаватт (каждый мозг ≈ 20 ватт, как тусклая лампочка). - Вся выработка энергии в мире — около 9000 гигаватт, и она крутит вообще всё: отопление, заводы, электромобили. То есть всё человечество думает на крошечной доле общей энергии планеты. Если сравнивать мозг человека с моделями: - человеческий мозг работает на ~20 ваттах; - а одна большая AI-модель, если посчитать всё вместе, её обучение плюс работу на серверах для миллионов людей — тянет на мегаватты, а то и под гигаватт. Это примерные цифры. Но суть тут в разнице: между 20 ваттами и миллионами ватт — разница примерно в миллион раз. И при этом мозг по-прежнему умнее :). Хороший пример — белка. Она прыгает с ветки на ветку и не промахивается, работает на меньше чем 10 милливаттах — это в сто раз меньше телефона. Ни один гигаваттный дата-центр такого трюка пока не повторит. --- А что Рао предлагает взамен? Он говорит: мозг не перемножает матрицы и не считает строго в нулях и единицах. Он использует нелинейную динамику. Что такое «линейно» и «нелинейно» на пальцах. Линейно — это когда вдвое сильнее нажал, вдвое больше получил. Нелинейно — это когда элементы влияют друг на друга, и из этого взаимодействия рождается сложное поведение, которое не сводится к простой сумме. Самый наглядный пример — метрономы на общей подставке. Поставьте десяток метрономов вразнобой на лёгкую доску. Сначала хаос и каждый тикает как хочет. Но они чуть-чуть толкают доску, доска чуть-чуть толкает их обратно и через минуту, без всякого оркестратора, они начинают качаться синхронно. Никто их не программировал. Согласованность возникла сама, просто из того, что они связаны между собой. Рао строит чип из таких же связанных «качалок» (осцилляторов), только связи между ними делает обучаемыми — и тогда систему можно вести к нужному ответу. --- В итоге он говорит: настоящий потолок в физике энергопотребления самого железа. И мозг живое доказательство, что можно быть в тысячи, а то и в миллион раз экономичнее, если перестать цепляться за компьютер в его нынешнем виде. Чип они собрали за полгода во многом потому, что им помогал AI. И закончил он фразой: *«Кажется, мы впервые сможем понять, как работает мозг, — потому что наконец-то можем его построить»*.