Заместители
СтатистикаЦех ИИ агентов. Здесь я тестирую цифровых заместителей в разных профессиях. По пути обсуждаем актуальные новости про ИИ агентов простым языком. Добро пожаловать в эру замещения. Запросы -> aideputies_collab@agentmail.to.
- Последний пост
- 15:06
- Последнее чтение
- 03:20
- Постов за неделю
- 5
- Всего постов
- 69
- Тип
- открытый
- Язык
- русский
- Категория
- Новости и СМИ
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 1 218
- 1/48двое суток
- 1 395
- 1/72трое суток
- 1 505
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Этот текст сгенерировал Claude Теперь обвинять авторов своих любимых телеграм каналов в том, что они совсем обленились и все пишут с помощью Клода — станет существенно проще 😁 Anthropic внедряет во все свои модели невидимые "статистические водяные знаки". Дальше с помощью специального API от самого Anthropic можно будет с вероятностью 95% сказать, сгенерирован ли текст Клодом. Главная причина — требования Статьи 50 Европейского AI Act, вступившие в силу 2 августа 2026 года: генеративные системы должны делать свои ответы машинно распознаваемыми как AI-generated. Как это работает За основу взяли изобретенный Гуглом SynthID. Никаких скрытых символов или видимых изменений — только статистика. При генерации текста LLM выбирает наиболее вероятный следующий токен. И обычно окончательный выбор токена частично определяется случайностью. В Claude теперь эта случайность будет управляться секретным ключом Anthropic и предыдущим контекстом. 1. Модель выбирает несколько вероятных токенов-кандидатов. 2. Секретный ключ и предыдущий контекст присваивают им псевдослучайные оценки. 3. Кандидаты проходят своего рода турнир, в котором немного чаще побеждают токены с нужной оценкой. На одном слове этого не видно. Но в длинном тексте накапливается статистический паттерн. И детектор с соответствующим ключом проверяет паттерн и оценивает вероятность того, что текст был создан маркированной моделью. Какое приятное совпадение, что за каждую проверку текста таким детектором через АПИ Антропика можно будет брать лишнюю монетку с юзеров (или с государства) 😈 Что это означает на практике • Цена и количество генерируемых токенов не меняются, а влияние на скорость должно быть незаметным. • Водяной знак не содержит ID пользователя, организации или чата. По нему нельзя узнать, кто именно сделал запрос. • Права на результат и ответственность пользователя не меняются. • Anthropic пока только готовит API для проверки. Пока публичного детектора ещё нет. • Проверка будет вероятностной, а не доказательством: «Claude, вероятно, участвовал в создании текста». • Длинные эссе, посты и письма распознаются лучше, чем короткие ответы. • Фактические ответы, код и лёгкая корректура маркируются хуже: там у модели меньше свободы выбора. Небольшое редактирование знак может пережить. Полный рерайт другой моделью или перевод сторонним сервисом сильно ослабляет его. • Отсутствие знака не означает, что текст написал человек: он мог быть создан другой моделью, сильно переписан или просто оказаться слишком коротким. Кстати, изображения и аудио файлы уже давно подписываются как результат генерации ИИ у всех основных провайдеров. Только там это делается в основном через метаданные файлов. А тут метаданных то нет — поэтому подход поинтереснее. В линкедыне нашел классную визуализацию, как работает такой подход. С накоплением «подкрученных» слов в тексте повышается вероятность определения текста как сгенерированного AI. Если вас интересует, как избавиться от такого «водяного знака» Вот вам пара решений. Первое — по-басятски. Локальная модель + промпт «перепиши текст своими словами, больше ничего не меняй» 😁 Но это временная заглушка —> ставлю 🍋 токенов, что будет тысяча и один сервис, оптимизированный на каждую отдельную модель, чтобы избавлять текст от таких водяных знаков. Ибо сделать это очень просто: датасет для обучение такого «ДЕмаркирования» буквально раздается самим Антропиком. Генеришь текст Клодом + получаешь официальный лейбл от детектора Антропика о том AI он или нет. Дальше миксуешь разные объемы, слова, тексты и получаешь трейн данные, на которых обучаешь Квен находить ключевые слова и переписывать их —> упаковываешь в API. Пожалуйста, сервис по демаркировки. Отдаю идею бесплатно 🎩 #ИИстатья Заместители
без подписи
Снимаем отельчик на выходные в горной испанской деревушке. И даже там не обошлось без AI: предупредил владельца, что мы будем с собакой, а тот, видимо сгенерил ответ и переслал его не заморачиваясь 😁 Это к тому, что уже даже в деревенской глуши AI помогает с бытовыми задачками. И тут же я наткнулся на классную инфографику по использованию AI населением разных стран. Оказалось, что недаром я встретил AI в Испании — это одна из самых использующих AI стран (6-е место в мире). Интересно, что сами США и Китай, собственно главные разработчики всея AI, не вошли даже в ТОП 10. Так что, если думаете, где делать следующий AI проект — рынки сбыта могут быть весьма неожиданными. Заместители
без подписи
AI телемедицина уже здесь Гугл всерьез взялась за AI в медицине. Они превратили свой медицинский AI AMIE из текстового "врача в чате" в систему, способную проводить полноценную видеоконсультацию в реальном времени — разговаривать с пациентом, видеть его через камеру, просить выполнить элементы физикального осмотра и параллельно формировать диагноз. Как это работает В основу легли Gemini и Project Astra — проект Гугла, где они по сути строят настоящий Jarvis AI. По ссылке ролик, там весьма впечатляющее видение того, как он должен работать. Только, к сожалению, похоже они застряли на этапе прототипа. Тем интереснее посмотреть на новую AMIE — очень похожую систему, просто ограниченную конкретно медицинской областью. Это не один большой агент, а асинхронная система из трёх агентов, работающих параллельно: • Говорилка — непосредственно разговаривает с пациентом и отвечает с минимальной задержкой. • Планировщик — в фоне «думает»: обновляет диагноз пациента, ищет пробелы в анамнезе и планирует следующие вопросы/действия. • Видеорегистратор — непрерывно анализирует видео и аудио: внешний вид, признаки дискомфорта, дыхание, результаты визуальных тестов и т. п. Эта информация поступает в планировщика. Например, AMIE может попросить пациента показать движения сустава, выполнить неврологический тест или показать что-то в камеру, а затем использовать увиденное при постановке диагноза. Именно такой интерактивный физикальный осмотр текстовые медицинские модели делать практически не способны. Особенно интересно, как вложились в тестирование 📝 Обычно ограничиваются какими-то сгенеренными бенчмарками, а тут все серьезно. Наняли 15 актеров, сыгравших пациентов —> придумали 100 клинических сценариев —> провели 300 "консультаций". Сравнивали три режима: - Новую версию AMIE с видеорежимом - Текстовую AMIE - И телемед консультации с реальными врачами. Врачи и AMIE сталкивались со сценариями по пяти группам: кардио/пульмонология, абдоминальные заболевания, ЛОР/глаза, неврология/психиатрия и опорно-двигательные проблемы. Результаты затем независимо оценивали 20 опытных врачей первичного звена. И вот что получилось По оценке врачей-экспертов, AMIE Video была примерно на уровне человеческих врачей по: диагностической точности, полноте сбора анамнеза, адекватности лечения/ведения пациента и качеству коммуникации. А по некоторым вещам AI оказался лучше врачей. Особенно — в использовании видео: AMIE чаще выявляла физические признаки и чаще сама предлагала пациенту выполнить необходимые элементы удалённого осмотра. "Пациенты" тоже остались довольны. Актёры оценивали AMIE Video очень высоко по эмпатии, раппорту и уверенности в полученной помощи, а видеорежим в целом предпочитали текстовому чату. Единственное, что пока не позволяет сказать, что это победа — все пациенты актеры. И Гугл теперь аккуратно планирует тестить это в реальной клинической практике. Это можно сделать достаточно безопасно, встроив AMIE в формате скрытого ассистента в телемед консультации с реальными врачами. Так система будет налету подсказывать врачу диагнозы, доп вопросы и на что обратить внимание в невербальных сигналах от пациента. Что ж, я бы точно предпочел, чтобы на консультации с врачом за мной следила вторая пара "глаз" и "ушей". Особенно, когда на смену приходит новое поколение врачей, выросших в мире СДВГ и тиктоков 😈 #ИИстатья Заместители
без подписи
без подписи
без подписи
без подписи
+4
Grok Imagine Image 2.0 — пушка гонка Вчера xAI релизнули новую модель text-2-image, элегантно встроив ее в собственный редактор изображений. Модель уже дышит в спину со второго места по text-2-image и image edit на Арене. Модель отлично следует инструкциям, удаляет лишние объекты, делает ресайзинг изображений и при этом консистентно сохраняет изображение, где редактирование не запрашивалось. К тому же модель на десктопе встроена в «ИИ-фотошоп», как делают сейчас многие. Тестил на фотографии из Валенсии, где в стене есть «домик кошек». Как часто бывает в туристических местах — картинку портило граффити и отсутствие, собственно, самого кота 😁 Грок легко и очень быстро справился с этими проблемами. Я специально пошагово просил вносить изменения, чтобы увидеть консистентность сохранения деталей изображения. Каждый промпт — буквально 1 фразой, никаких уточнений и излишеств просто «добавь кота, выходящего из двери домика». На мой взгляд — очень достойно! Поляна моделей для редактирования изображений пополнилась сильным игроком 👍 Уже где-то не за горами можно будет рассматривать подписку на Грок. Заместители
С 14 августа Auto — станет режимом по умолчанию в Клод коде И, смотря всего на 1 график, даже не возникает вопросов, «почему». Агент в разы лучше выявляет и предотвращает собственные вредоносные действия, чем человек, который просто тыкает «энтер», чтобы получить заветный результат. По статистике самих Антропиков человеки принимают 97% всех предложений Клода 🎰 Получается, люди дергают эту ручку просто для сохранения комфортной иллюзии контроля. На практике кожаные уже не успевают за ходом мысли агента. Мы можем проверять общий вектор и смысл рассуждений. Но проверять каждое отдельное действие агента на безопасность — становится просто нереально. Сам агент же легко «держит в голове» весь проект в деталях, не устает читать тонны собственного нейрослопа и искать в них «дыры». В целом, я уже давно сижу на auto режиме. Это единственный способ реально параллельно запускать несколького задач в агентов. Ещё один шажочек по передаче контроля AI 👌 Заместители
Гонка LLM продолжается. Но во что она обходится нашей планете? OpenAI готовит к релизу нового монстра под кодовым именем Astra, который уже решил уточнил решения 10 комплексных фундаментальных математических задач. На днях выпустили новый Qwen 3.8 Max, который сразу вошел в Топы всех бенчмарков. По размеру этот гигант сопоставим с Kimi K3. И, очевидно, на обучение таких моделей тратят просто кучу ресурсов. Но сколько именно? Очень удачно, тут же на днях вышла работа The Hidden Cost of Thinking: Energy Use and Environmental Impact of LMs Beyond Pretraining. Её авторы попытались посчитать то, что обычно остаётся за пределами отчётов AI-компаний: сколько ресурсов уходит на весь процесс создания LLM. Для этого они изучили разработку семейства моделей OLMo 3 (7B и 32B) — от первых экспериментов до готовых моделей. Исследователи включили в расчёт не только успешные запуски, но и подбор архитектуры, тестирование датасетов, неудачные эксперименты, генерацию данных, pretraining и последующий post-training. Замеряли не деньги и не вычислительные ресурсы, а расход электричества, воды и выбросы CO₂. Результат: ⚡️ 12,3 ГВт·ч электроэнергии 💧 15,9 млн литров воды 🏭 4 251 тонны CO₂e Для расчёта авторы использовали реальные GPU-часы и измеренное энергопотребление оборудования. Затем учитывали серверную инфраструктуру, PUE дата-центра, углеродную интенсивность электричества и воду, потреблённую при его производстве. В общем, все по-уму, с некоторыми допущениями, но зато максимально комплексно. Много это или мало? По оценкам самих исследователей — это сопоставимо с выбросами CO₂e примерно 850 домохозяйств в течение года. И это всего 1 семейство маленьких моделей. Главная же находка авторов в том, что вклад финальных запусков моделей в этот "экологический след" — лишь 18%. Оставшиеся 82% вычислений и, соответственно, затраченных ресурсов пришлись на те самые ранние стадии разработки. Мне стало интересно, во что же нам тогда обходится вся гонка LLM в год? Вооружившись ГПТ 5.6 и открытыми данными я прикинул ресурсы затраченные на разработку всех крупных моделей, представленных с начала года. Методика такая: для каждой модели оцениваем параметры и кол-во обучающих токенов → переводим в FLOPs → переводим в GPU-часы → электричество → вода и CO₂e с использованием коэффициентов, которые вывели авторы статьи. Вот что получилось: ⚡️ 5.6 ТВт·ч электроэнергии (то есть 5600 Гигаватт!) 💧 7,3 млрд литров "водного следа" 🏭 1,9 млн тонн CO₂e Чтобы представить масштаб: • этого электричества хватило бы примерно 460 тысячам домохозяйств на год • такой объём воды — около 2 900 олимпийских бассейнов • такие выбросы сопоставимы с годовыми выбросами примерно 460 тысяч автомобилей 🤙 Конечно, оценка очень-очень грубая. Расчет включил в себя 44 крупных семейства моделей: GPT, Claude, Gemini, Grok, Qwen, DeepSeek, Kimi, GLM и другие. Причем, очевидно, что модели представленные в начале года, обучались в основном в втором полугодии 2025. Поэтому можно считать, что это оценка экологического следа за год. Для открытых моделей брались опубликованные характеристики. Для закрытых, где разработчики не раскрывают архитектуру и затраты на обучение (а таких большинство), использовалась оценка от GPT 5.6 Sol. И разброс может быть раз в десять в обе стороны. Но это позволяет хотя бы прикинуть масштаб проблемы. Мысли С одной стороны, все эти ресурсы — это лишь маленькая доля стоимости гонки LLM. Ведь тут я посчитал только затраты на обучение моделей. А ведь после того, как модели релизятся — в датацентрах начинается самое пекло. Котики и рилсы сами себя не сгенерят 😈 С другой стороны — на самом деле масштаб трагедии пока далеко не трагичный. Это все еще очень маленькая часть общемировых затрат электроэнергии (около 0.02%). Но расти они будут экспоненциально и непропорционально. Сейчас это проблема компаний. Но когда второй волной нахлынет роботизация, о которой я писал в прошлом посте — проблема может стать национальной. Так что Маск, знает, на что ставит, когда планирует выводить датацентры в космос 📈 #ИИстатья Заместители
Следующая волна AI Если вам кажется, что мир меняется сейчас из-за ChatGPT и Claude, и вы не успеваете адаптироваться — то держитесь. То ли еще нас ждет! В конце июля прошла выставка WAIC 2026 в Шанхае. Выставка по AI, но упор на ней был сделан не на LLM и даже не на AI агентов. LLM модели уже давно высосали всю доступную информацию из интернета для обучения. Антропик вон даже массово скупают книги, расчленяют их и сканируют, чтобы еще немного утолить голод нейросеток до данных 📖. И, кстати, суд признал это нормальным использованием купленной книги. Но вот следующей кормушкой для моделей станет, очевидно, физический мир. Сейчас Physical AI на всех конференциях с подачи NVIDIA стали называть главным следующим фронтиром. AI проберется в наш мир через роботов, которые умеют щупать, перемещаться, ощущать тепло и структуру поверхностей и тд. Целый новый спектр данных и задач, которые можно решать. Но что на этом рынке вообще происходит? Рынок на самом деле достаточно зрелый — индустриальных роботов установлено уже более 4.66 млн по всему миру. Роботизированные сборщики, автоматизированные производственные линии, складские роботы, коботы (те, что работают в связке с человеком) и тд. Имен настоящих лидеров рынка робототехники вы, скорее всего, даже не слышали: FANUC, ABB Robotics, Yaskawa, KUKA… А их совокупная установленная база превышает 2 млн роботов. Но нас интересует “новая волна”. Гуманоидные роботы и роботы общего назначения. Их основная фишка в том, что они создаются такими, чтобы легко адаптироваться под сотни разных задач, от перетаскивания запчастей автомобилей, до готовки яичницы на кухне. Многие роботы общего назначения сначала отправляются туда же в промышленные задачи. Ведь там еще остаётся длинный хвост вариативных задач, для которых классическая автоматизация оказывается слишком дорогой или негибкой. Рынок “новой волны” сегментировался на четыре основных слоя: 1. Разработчики компонентов для роботов. Знакомые нам процессоры от NVIDIA и Qualcomm, но еще и приводы, двигатели, искусственные ткани, сенсоры и тд. 2. Вертикально-интегрированные компании, типа Figure, Tesla и 1х, которые производят все от железа до софта. Интересно выделились роботы Amazon. Они вроде как очень примитивные, но попали в категорию "новой волны" потому что управления флотилией роботов происходит с помощью специального мультиагентного AI DeepFleet. И по заявлениям самого Amazon — он сокращает время перемещения флота на 10%. 3. Разработчики роботов-платформ, нацеленных на стороннее ПО. Например, Unitree и Boston Dynamics. Да, последние теперь не делают свой AI — они в том числе тестируют на Атласе Gemini Robotics 2. 4. Разработчики универсального интеллекта для разных тел. И если Google делают проприетарную коммерческую модель, то GR00T от NVIDIA полностью опенсорсный, как и вся экосистема вокруг. При этом границы слоев размываются: NVIDIA играет сразу в двух, Apptronik и Boston Dynamics сочетают собственные контроллеры с внешними foundation-моделями, а вертикально интегрированные игроки постепенно открывают свои тела чужому интеллекту. Смотрите приложенную инфографику с инфой про главных героев рынка. Текстом все это сюда не поместится ☕️ Еще нюанс рынка в том, что его игроки очень не любят объективные метрики. Их очень сложно находить и практически никто их не вывешивает в своих релизах. Поэтому рынок — дикий запад. Ему категорически не хватает объективных общепринятых и разнообразных бенчмарков, причем отдельных для каждого слоя рынка. А тем временем у меня давно руки чешутся потыкать в робототехнику и AI в ней. Если вы тоже все думаете завести себе R2-D2, то вот несколько претендентов на открытую платформу для разработки и экспериментов: • Робопес PuppyPi. На базе Raspberry Pi, с камерой, лидаром и даже микрофоном. • Роболапа SO-ARM101. • Ровер MentorPi M1. В общем схема такая: выбираем тут. А потом ищем на алике. Кстати, это считается кризисом среднего возраста, если в районе тридцати потянуло купить робота? 😁 Заместители
Google заходят в робототехнику по-своему Пока Tesla, Figure и Unitree пытаются собрать лучшего гуманойдного робота, Google заходит с другой стороны. Компания продолжает фокусироваться на мозгах. Они представили Gemini Robotics 2 — универсальную модель, которая может адаптироваться под роботов разных производителей. На самом деле Google представила сразу три связанные модели: • Gemini Robotics 2 превращает изображение и текстовую команду в движения робота. • Gemini Robotics ER 2 понимает происходящее, составляет план, проверяет результат и координирует нескольких роботов. • Gemini Robotics On-Device 2 работает локально и адаптируется под совершенно новое тело менее чем на 200 примерах. Главный апдейт с первой версии Появилось управление всем телом одной системой. Раньше модель управляла руками роботов. Теперь робот под управлением модели может одновременно идти, приседать, удерживать равновесие и тянуться к предмету. Раньше такие действия часто обслуживались отдельными контроллерами и заранее собранными последовательностями. Робот получает цель и сам превращает её в непрерывное физическое поведение. Например, говоришь своему гаечному "убери захламлённую комнату". И Gemini Robotics 2 в ответ на запрос осматривается, составляет план, двигает предметы, проверяет результат, исправляет ошибки и при необходимости подключает другого робота. По сути, Гуглойды двигают уже неплохо сложившуюся индустрию робототехники ближе к бесшовному взаимодействию с обычными людьми. А что по реальным задачам? Google показывает в демо ролике закручивание лампочки, завязывание пакетов и работу с зиплоком. Однако собственные гугловые замеры успешности выполнения разных действий с помощью новой модели возвращают нас на землю: • выкрутить лампочку — 92% успешных попыток • закрутить обратно — 36% • завязать пакет — 44% • закрыть Ziplock — 40% • воспользоваться совком — 32% Получается эффектное демо уже можно снять. А вот уборку вашей кухни доверять терминаторам еще рано 😁 Завтра расскажу про рынок робототехники и AI в нем пошире. Stay tuned 👍 Заместители
Claude убрал 80% системного промпта, потому что он ему не нужен, говорили они... Тут на днях с выкаткой Opus 5 Антропики рассказали, что сократили системный промпт для Opus 5 и Fable 5 в Claude Code на 80%, потому что, мол, модели итак умные. Чо контест перегружать. А я вам на это расскажу интересную историю, которая сегодня приключилась со мной ☕️ Мне нужно было перевести целую пачку документов на другой язык. Все они были ПДФами, причем не машиночитаемыми — то есть теми, которые картинки. Естессно, я не сомневаясь, что GPT 5.6 Sol справится, закинул все ему. Ремарка: да, тут вы можете сказать, что GPT это не Claude — это другое. Но, по-моему, эти модели сейчас — братья близнецы. Ну и так получилось, что для личных задач я использую ГПТ. Поэтому история о нем, но выводы, на мой взгляд, относятся ко всем топовым LLM. Модель работает, я сижу занимаюсь своими делами. Тут мак начинает шуметь как турбина Боинга, и сам горячий как сковородка. Я в недоумении проверяю, что у меня включено — там только браузер и ГПТ Чат Альтманович. Ну, думаю, не браузер же 100% CPU жрать начал — я полез в ЧатГПТ. Смотрю, а там "Распознавание выполняется локально: документы не передаются во внешние сервисы" 🕶 Этот негодяй прочитал документы и решил, что переводить их сам не будет. И молча, ничего со мной не согласовав, сделал следующее: 1. Сначала написал на swift приложение, которое использует нативную библиотеку macOS "Vision". Но она ему не понравилась. 2. Дальше нашел у меня в установленных tesseract (специализированная библиотека для OCR) 3. Удовлетворившись им, распознал документы 4. А для перевода — поднял через ollama модельку qwen3:8b 5. И довольный начал постранично переводить через нее распознанный текст. Тут то мой мак и начал прикипать к моим коленкам. Как я потом у него допытался — GPT решил оптимизировать задачу, создав "локальный конвейер", и заодно не передавать личные документы в онлайн (то, что он их уже прочитал — его, конечно же, не смутило 😁). Мораль истории Во-первых, конечно, хочется отдать должное ГПТ — он попытался сохранить потенциально чувствительную информацию в локале. С точки зрения безопасности — молодец. Это, очевидно, последствие того, как последние модели ведущих лабораторий натаскивают на секьюрность и приватность. Но, во-вторых, у этого есть и обратная сторона медали — перегибы. Очевидным действием в такой ситуации должно было бы стать "спрошу у юзера, как сделать". Но модель очень уверенно расставила приоритеты сама и поскакала сжигать процессор моего мака. И вот тут вернемся к заголовку. Антропик отрезал Клоду 80% системного промпта. Мол, модель сама вас прекрасно поймет и все разрулит... Разрулит то, разрулит. И результат получит. Уверен, что Квен все бы перевел в конце концов. Но все это неэффективными странными путями... Не знаю, как вы, а я вот после сегодняшней ситуации — пойду и пропишу в системный промпт GPT пару ласковых 😈 Заместители
без подписи
+1
Этот пост не про новый Claude Opus 5 Хотя именно благодаря ему я нашёл новую интересную модель для генерации изображений. С выходом Opus 5 у меня появилось полное ощущение финальной битвы из «Мстителей». Супергероев на экране уже столько, что эту эпичность захотелось как-то визуально зафиксировать. Но снова идти в GPT Image 2 было как будто скучновато. И тут очень вовремя в начале июля вышла Reve 2.1 — и практически сразу заняла второе место в Text-to-Image Leaderboard. Все картинки к этому посту сгенерировала именно она. И, собственно, этот пост — про Reve! Главная фишка Reve 2.1 — модель не просто превращает промпт в набор пикселей. Сначала она планирует изображение как структурированный layout: где находятся отдельные области, как связаны элементы, что должно быть главным, а что — второстепенным. И только потом рендерит картинку сразу в нативном 4K. Первым делом я попросил её сделать инфографику про новый Opus. Там, кстати, вы и узнаете всё про нового форварда Anthropic 👍 Русский текст генерируется весьма и весьма недурно. А благодаря планированию layout картинка действительно выглядит как продуманная инфографика, а не как хаотичный набор карточек. Без косяков, конечно, не обошлось. Изначально Reve вставила в гистограмму Intelligence Index какие-то старые модели. Но моделька умеет еще и редактировать изображения. Я просто загрузил ей скриншот актуального рейтинга — и она перегенерировала изображение, исправив конкретно эту часть. В редактировании есть один минус — весь текст — это изображение. А значит, его нельзя просто переписать, как в Claude Design. Можно только попросить модель его переписать. Благо делает это она хорошо. Дальше я решил выплеснуть своё творческое представление битвы моделей в стиле постера Marvel 🤖🤖🤖. Промпт предварительно написал GPT-5.6, а я его просто вставил в Reve (вот так нынче выглядит digital творчество). Ну и что получилось — судить вам. Получилось оно с первого раза. Отдельно впечатляет разрешение. Инфографика весила около 8 МБ, а изображение с битвой — все 30 МБ. Можно спокойно распечатать и повесить на стену. В общем, только показалось, что на фоне агентной гонки все немного подзабыли про генерацию изображений — как появился достойный соперник старичкам GPT Image 2 и Nano Banana 2. Так что прямо душевно рекомендую потыкать Reve 2.1 своими руками. Тем более у сервиса весьма щедрый Free-план. Заместители
GPT 5.6 Sol выбралась из OpenAI и взломала Hugging Face На прошлой неделе Hugging Face рассказали о беспрецедентной атаке на свою инфраструктуру. Тогда было известно только одно: атаку полностью провел автономный AI-агент. Сегодня OpenAI официально призналась — этим агентом оказалась комбинация моделей GPT-5.6 Sol и еще более мощной пре-релиз модели, которую тестировали на кибербезопасность 😨 Что вообще произошло? OpenAI гоняла внутренний бенчмарк ExploitGym, который оценивает способность моделей искать и эксплуатировать уязвимости. Но чтобы честно измерить максимум возможностей модели, разработчики отключили часть защитных ограничений. Ну и модельки увлеклись процессом: • они нашли zero-day уязвимость в инфраструктуре самого OpenAI и через нее выбрались из изолированной песочницы в интернет • догадались, что решения ExploitGym могут храниться на Hugging Face • самостоятельно нашли путь до инфраструктуры Hugging Face • объединили несколько техник атаки — украденные учетные данные и zero-day уязвимости — чтобы получить доступ к секретным данным и “сжульничать” в тесте. К счастью, история закончилась хорошо. AI-системы Hugging Face сами обнаружили аномальную активность, остановили атаку и начали расследование еще до того, как команды компаний связались между собой. Сейчас OpenAI и Hugging Face совместно расследуют инцидент. Интересно, что UK AI Security Institute (AISI) — Британская гос организация, которая исследует AI безопасность — только на днях выпустила отчет, где говорила о таких рисках. OpenAI сами сослались на график (который и стал заголовком этого поста), где GPT 5.6 Sol победоносно сидит на верхушке. Это означает, что в симуляции ей удалось полностью захватить локальную сеть корпорации, произведя 32-шаговую атаку. Но что ещё интереснее — статья AISI вообще-то про другое. Она про то, что в среднем опенсорсные модели отстают всего примерно на полгода по своим возможностям цифровых атак от топовых коммерческих моделей. И, как нам показали MoonshotAI со своей Kimi K3, похоже, это отставание уменьшается. А значит — то, что сделала GPT 5.6 Sol уже совсем скоро будет доступно любому обладателю достаточного количества железа, чтобы развернуть модель такого размера 😅 Так что же нас ждет? Дивный новый мир. В нем OpenAI, Anthropic и другие AI гиганты станут уже не просто болталкой и офисным помощником — они будут продавать вам единственную сопоставимую с нападением защиту от кибератак. Хакеры же будут плясать от опенсорсных моделей. Также вангую, что появятся аудиторы кибербезопасности с помощью AI. Такие компании будут заниматься «редтимингом» или «этичным хакингом» ИТ инфраструктуры заказчика с помощью топовых моделей и рекомендовать, где что подлатать, чтобы злобные хакеры с джеилбрейкнутой (то есть взломанной и готовой беспринципно взламывать все подряд в полную силу) Kimi K3 не залезли под юбку вашей компании, как себе домой. Другой вектор развития этой истории — международная кооперация, результатом которой станет ограничение на выпуск таких моделей в открытом доступе. Да вот незадача — с международной кооперацией сейчас не клеится 😐 А значит нас ждет какая-то штука, без приуменьшения планетарного масштаба, чтобы жареный петух клюнул сразу весь мир и подтолкнул к этой кооперации. Что это будет за петух — остается только гадать 😒 Заместители
без подписи
OpenAI выпустила свою первую железку. Но не ту самую от Джони Айва Совместно с Work Louder релизнули Codex Micro — компактную механическую клавиатуру для управления Codex-агентами. Внутри 13 механических клавиш, джойстик, крутилка и тач-панель. Главная фишка — отдельные клавиши для агентов. Они подсвечиваются разными цветами и показывают, что сейчас происходит с каждым агентом: думает, нужно вмешательство, ошибка или готов сдать работу. Между агентами можно переключаться одной кнопкой, не перебирая вкладки и чаты. Остальные элементы тоже заточены под Codex. - Джойстиком запускаются готовые скиллы — например, PR ревью, поиск бага или рефакторинг. Ну либо им предлагают просто дергать, пока ждешь, когда агент закончит работу 😁 - Отдельные кнопки отвечают за принятие и отклонение изменений, новый чат и голосовой промпт. - Крутилкой можно прямо на ходу менять уровень рассуждений модели: поменьше для простых задач, побольше — когда агенту нужно хорошенько пораскинуть токенами. Все кнопки можно переназначить под собственные воркфлоу. Работает с Mac и Windows по Bluetooth или USB-C. Есть тихая и клацающая версии переключателей. Стоит всё это удовольствие $230. В комплекте ещё 32 дополнительные клавиши с иконками Codex. Конечно это лютое баловство для техногиков 🎹 Но сама идея интереснее устройства. Когда у тебя параллельно бегают несколько агентов, обычный чат уже становится не самым удобным интерфейсом. И голосовой набор промпта + физические кнопки для быстрого фидбека = звучит как потенциально крутая затягивающая альтернатива. И даже если голосом пользоваться не всегда удобно, то кнопки под быстрый фидбек агентам — то, чего мне лично не хватает. Постоянно бешусь, что кнопка аппрува действия каждый раз разная: то аппрув одного действия, то всех таких действий в проекте, то всех действий вообще всегда. И ещё каждый раз комбинации клавиш под это как будто меняются 🔨. А на клаве тыкаешь одну кнопочку и не паришься. Кстати, шикарная идея подарка для вашего кореша или партнера, который общается с AI агентами, больше чем с вами 😈 Ну и ждём, когда китайцы наклепают клонов этой штуковины для Claude Desktop и других агентов. Заместители