red_mad_robot
СтатистикаЗапускаем цифровые бизнесы и помогаем компаниям внедрять AI. Делимся аналитикой по рынку и кейсами и рассказываем, что нас держит в топе уже 17 лет. redmadrobot.ru Про технологии рассказываем в @rmr_rnd, а ещё ведём подкаст youtube.com/@podcast2tok
- Последний пост
- 10:41
- Последнее чтение
- 20:50
- Постов за неделю
- 4
- Всего постов
- 117
- Тип
- открытый
- Язык
- русский
- Категория
- Бизнес
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 1 052
- 1/48двое суток
- 1 205
- 1/72трое суток
- 1 300
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Модели выдают свои рассуждения, агенты сами придумывают архитектуру: главное за неделю в ИИ Аналитический центр red_mad_robot рассказывает и комментирует главные новости индустрии за неделю с 10 по 14 августа 🟥Исследователи MATS Research, ELLIS Institute Tübingen, Max Planck и других организаций изучили уязвимость API современных моделей с рассуждениями. Некоторые модели передают скрытые рассуждения в виде зашифрованных блоков, которые клиент возвращает при следующем запросе. Проблема возникает, если такой блок может принять не только исходная модель, но и другая модель того же провайдера. Тогда менее защищённая модель может выступить своеобразным расшифровщиком. Авторы проверили подход на Anthropic, OpenAI и Google. Для оценки масштаба проблемы они изучили 6 708 публичных агентных сессий с GitHub и Hugging Face: в 315 тысячах зашифрованных блоков нашли 62 API-ключа, 33 пароля и 30 личных адресов, а потенциальная утечка встретилась в 4,9% сессий. Оказалось, что механизм можно использовать и для скрытых атак с внедрением вредоносных инструкций: вредоносную инструкцию можно спрятать внутри непрозрачного блока и перенести в другую сессию, где её не увидят системы, анализирующие только обычный диалог. Почему это важно: само по себе шифрование скрытых рассуждений не гарантирует их безопасность. Если зашифрованный блок можно перенести между пользователями, сессиями или моделями, появляется риск его раскрытия или подмены. После того как исследователи сообщили о проблеме, провайдеры внесли изменения, и описанные атаки на обновлённых версиях API уже не воспроизводились. Поэтому речь скорее о важном архитектурном риске, чем о рабочей атаке на актуальные версии моделей. 🟥Sakana представила CEDAR (Complex-systems Exploration and Design via Agent-Orchestrated Refinement) — подход, в котором ИИ-агенты могут самостоятельно проектировать сложные системы. Причём они меняют саму структуру готовой модели: добавляют или удаляют переменные, меняют формулы и связи между компонентами. В CEDAR работают два ИИ-агента вместе с MCTS (метод поиска решения по дереву вариантов). Агент-редактор создаёт новые версии модели, а агент-судья запускает их и оценивает результат. Затем MCTS выбирает наиболее перспективные варианты и отправляет их на дальнейшее улучшение. Так система постепенно перебирает разные структуры и ищет ту, которая лучше всего соответствует заданной цели. Почему это важно: CEDAR пытается автоматизировать поиск самой структуры обратных связей — цикл «предложить → симулировать → оценить». Это позволяет исследовать сложные эмерджентные эффекты, которые трудно заранее предсказать. Главное ограничение — результат сильно зависит от агента-судьи, который оценивает решения внутри того же контура, поэтому вопрос объективности такой самооценки пока остаётся открытым. Также на неделе: • Google выпустила Gemini 3.7 Flash — новую модель, ориентированную на программирование и долгую автономную работу ИИ-агентов • Mistral начал размещать на своей инфраструктуре модели других разработчиков. Первой стала GLM-5.2 от Zhipu AI • Alibaba открыла веса ИИ-модели Qwen3.8-2.4T-A95B • Tencent и другие организации показали EnvACE — метод обучения ИИ-агентов с подкреплением, который во время обучения использует внутреннюю симуляцию среды вместо взаимодействия с реальной средой • Microsoft выпустила MAI-Code-1.1-Flash для GitHub Copilot — новую модель для программирования, которая тратит на 25% меньше токенов на задачу и одновременно показывает лучшие результаты, чем предыдущая версия модели • Snowflake и The University of Texas at Austin рассказали о ReASearch — подходе, в котором ИИ-агент сам решает, что проверить, почему возникла ошибка, что изменить и когда повторно проверить результат или начать всё заново • xAI выпустила Grok 4.6 — модель обучена для программирования, веб-разработки, CAD и оптимизации вычислений ↗️ red_mad_robot
Европейский университет открывает набор на программу «Философия, математика и компьютерные науки» ЕУСПб — наши давние друзья и в скором времени партнёры. Но сейчас не об этом. С 11 сентября в университете стартует набор на девятимесячную программу на стыке философии, математики и computer science. Она рассчитана на тех, кто проектирует сложные системы и сталкивается с вопросами, для ответов на которые одних технологий уже недостаточно: где проходят границы системы, почему ошибка может быть не в коде, а в исходных предположениях о предметной области? Нам это близко: сначала разобраться в самой задаче и только потом искать для неё инструменты. Что будут изучать: ↗️ Философскую логику, эпистемологию, сознание и язык ↗️ Математическую логику, теорию множеств и топологию, теорию категорий ↗️ Мышление о системах, системный анализ, архитектуру систем ↗️ Философию вычисления, теорию моделей, алгоритмы и вычисления ↗️ Этические и социальные аспекты информационных технологий Формат: онлайн по средам и субботам + три двухдневных офлайн-интенсива в Петербурге. Кураторы и преподаватели — из ЕУСПб, СПбГУ, МГУ, РГГУ, Paris-Cité. Подать заявку можно (и нужно!) до 23 августа, а все подробности — на сайте. ↗️ red_mad_robot
Как ваше ФИО превращается в PERSON_1 до того, как долетит до ChatGPT ФИО, телефон, почта и паспортные данные могут попасть в запрос к модели и выйти за пределы защищённого контура компании. Миша Мартьянов объясняет, как Guardrails и псевдоанонимизация помогают этого избежать. ↗️ red_mad_robot
red_mad_robot попал на карту российской ИИ-экосистемы от Gateway House Gateway House — независимый исследовательский центр из Мумбаи, который изучает международную политику и геоэкономику. В новом материале его аналитики собрали карту из 38 российских ИИ-компаний, разрабатывающих собственные модели и продукты. Авторы рассматривают российский ИИ как отдельную технологическую экосистему: от базовых моделей до прикладных решений в финтехе, медицине, промышленности и ритейле. И эта экосистема уже шире нескольких бигтехов: рядом с GigaChat, Kandinsky и YandexGPT появляется большой набор более специализированных решений и компаний. По карте виден и другой сдвиг: центр тяжести постепенно смещается в бизнес — к перестройке процессов с ИИ, новой логике автономной разработки и управлению экономикой всей системы. Здесь и будет разворачиваться следующий этап ИИ-гонки. ↗️ red_mad_robot
ИИ-агентов научили дешевле проверять себя и быстрее учиться: главное за неделю в ИИ Аналитический центр red_mad_robot рассказывает и комментирует главные новости индустрии за неделю с 3 по 7 августа 🟥Alibaba показала LongHorizon-Harness — фреймворк, который помогает ИИ-агентам надёжнее выполнять длинные и сложные задачи. Главная идея — разделить выполнение задачи и проверку результата. После каждого этапа отдельный проверяющий агент смотрит, что произошло, и достигнут ли результат. Схема «Manage → Execute → Audit»: один агент разбивает задачу на шаги, второй выполняет, третий проверяет результат. Система засчитывает шаг только после проверки. Так агент не продолжит работу на основе ошибочного результата, даже если сам не заметил ошибку. Между шагами хранятся только краткое описание задачи и подтверждённые результаты, длинная история удаляется. Результаты показывают заметный прирост качества: на WeaveBench успешное выполнение выросло с 51,8% до 80,7%, на Terminal-Bench 2.1 — с 69,7% до 77,2%, на OSWorld 2.0 доля выполненных задач — с 2,8% до 8,3%. За надёжность приходится платить вычислениями: система отдельно проверяет результаты и иногда заново планирует действия. Но на части задач подход экономит токены — на Terminal-Bench расход снизился на 24%. Почему это важно: ИИ-агент реже зацикливается, не теряет выполненную работу и чаще доводит сложные задачи до конца. Метод позволяет сократить переделку и ручной контроль. 🟥Microsoft Research и University of Amsterdam предложили более дешёвый способ обучать ИИ-агентов через on-policy distillation. Обычно такое обучение требует раз за разом запускать агента в среде и на каждом шаге спрашивать сильную модель, как действовать лучше. Это дорого. Метод ReOPD использует уже собранные траектории учителя. Агент берёт готовую историю действий, проигрывает её до нужного момента, а дальше пробует сделать следующий шаг. Сильная модель подсказывает и оценивает каждый этап. Новых взаимодействий со средой обучение не требует. Авторы нашли проблему: чем сильнее тренировочные ситуации подстраивают под ученика, тем чаще сильная модель попадает в непривычные ситуации и даёт менее надёжные подсказки. Поэтому ReOPD берёт ранние части старых траекторий, где ученик ещё мало отклоняется от учителя. Так сильная модель даёт полезные подсказки, а метод не тратит ресурсы на запуск новых траекторий. Почему это важно: метод позволяет сохранять или повышать точность на задачах с математикой, Python и поиском, при этом во время обучения ученику вообще не нужно обращаться к внешним инструментам. За счёт этого обучение проходит минимум в 4 раза быстрее, а уже собранный опыт взаимодействия с окружением можно использовать повторно. Также на неделе: • ИИ-стартап Prime Intellect запустил Prime Agent — самоулучшающегося ИИ-агента для программирования и выполнения долгих автономных задач. Он умеет экономно работать с токенами и использовать инструменты через код • Sakana выпустила Namazu — модель на базе Kimi K2.6, которую дополнительно обучили на закрытых данных для решения задач японского бизнеса • MemTensor, Renmin University of China, National University of Singapore, Shanghai Jiao Tong University и Tongji University предложили идею базовых моделей с памятью — систем, которые могут хранить память прямо внутри себя. Они представили прототип Metis — в отличие от обычных ИИ, которые хранят историю во внешних базах данных и потом ищут там нужную информацию, Metis пытается запоминать информацию внутри самой модели • Meta (запрещена в РФ) запустила Muse Code — ИИ-агента для программирования, который работает на модели Muse Spark 1.2 и позволяет создавать приложения в одном интерфейсе • NVIDIA представила Molt — фреймворк для обучения ИИ-агентов с помощью RL. Его сделали максимально простым, чтобы в коде мог разобраться не только разработчик, но и ИИ-агент для программирования • Alibaba выпустила Qwen 3.8-Max — модель на 2,4 трлн параметров. Она способна долго работать автономно. По данным компании, модель может самостоятельно выполнять задачи до 16 дней ↗️ red_mad_robot
Первый выпуск начинается со спора самих ведущих ИИ —начало конца творческих профессий ИИ — начало новой эпохи творчества Обсуждаем это вместе с художником Покрасом Лампасом и Денисом Димитровым, CTO Kandinsky и управляющим директором по исследованию данных Сбера. Начинаем с простого эксперимента: показываем изображения и видео и пытаемся определить, где работа человека, а где — результат генерации. Даже эксперты, которые каждый день работают с такими технологиями, ошибались чаще, чем ожидали. А ещё Покрас впервые рассказывает, как обучил модель на собственных буквах и проверил, сможет ли она воспроизвести его авторский почерк. Эпизод уже ждёт на YouTube и в VK🔗 ↗️ red_mad_robot
Первый выпуск 2ТОК — завтра на нашем YouTube 🕐 Открываем сезон разговором с художником Покрасом Лампасом и управляющим директором по исследованию данных Сбера и CTO Kandinsky Денисом Димитровым. ↗️ red_mad_robot
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
+3
⚡️ Запускаем ток ⚡️ Врываемся с новостью — мы запустили подкаст 2ТОК. To talk — потому что мы ищем ответы через разговор. «Ток» — потому что ИИ становится технологией, которая, как когда-то электричество, меняет направление и бьёт по привычным представлениям о профессиях и целых индустриях. Ведущие подкаста — CEO red_mad_robot AI и основатель стартапов в сфере ИИ Илья Филиппов и основатель ГенИИ и советник Ассоциации ФинТех Алексей Сидорюк. В каждом выпуске они приглашают эксперта из отрасли и человека, который уже внедряет ИИ в этой сфере, чтобы столкнуть разные взгляды на происходящие изменения. Если ИИ способен выполнять работу ИТ-специалиста, врача или таксиста, какое место остаётся у человека? Предлагаем смотреть на весь сезон через эту призму. В первых выпусках мы обсуждали ИТ, искусство, здравоохранение, кибербезопасность, науку и образование. И почти во всех разговорах приходили к одному выводу: роль человека не исчезает — она становится другой. ↗️ red_mad_robot
Чего не видно ни в одном бизнес-отчёте Ищем компании, готовые протестировать новый подход к исследованию бизнес-процессов с помощью связки ИИ-агентов. Наша гипотеза — автоматизированные интервью с командой позволяют за несколько дней находить в процессах компании скрытые причины потерь времени и денег. Приведём пример — допустим, согласование заявки на закупку. Системы со статусами заявки покажут на каком шаге процесс тормозит, но не объяснят, почему это происходит. Потому что ответ живёт не в системах, а в решениях людей, которые выполняют данную работу. И мы это узнаём через глубинные интервью. Масштаб можно выбрать любой — от команды одного процесса до всех сотрудников компании: организовать интервью с каждым не сложнее, чем с несколькими. В нашем подходе три ИИ-агента распределяют роли между собой: один интервьюирует сотрудников, второй собирает ответы в общую карту процесса и находит расхождения, третий ранжирует найденные узкие места по влиянию на результат. Такой способ уже помог найти скрытые причины, которые тормозили продажи торгово-производственной компании, работу контакт-центров и контроль качества в рознице. Если у вас есть процесс, который требует оптимизации, но причины проблем и их влияние на бизнес неочевидны, — пишите нам в аккаунт @iamredmadrobot. Покажем, как всё работает, и обсудим детали. Исследование займёт около десяти дней.
Самая дорогая ошибка — думать, что после обучения сотрудников внедрение ИИ закончено Пока каждый собирает собственный набор агентов, моделей и рабочих сценариев, компания получает разрозненные локальные улучшения. Следующий шаг — превратить этот опыт в единую ИИ-систему, которую бизнес может самостоятельно развивать и масштабировать. Об этом, а также о переходе от пилотов к системным изменениям, новой роли ИИ в разработке и корпоративной инфраструктуре Илья Филиппов, CEO red_mad_robot AI, рассказал в новом выпуске подкаста «Антихрупкий лидер». 🔗 Слушайте на YouTube, Rutube и в VK ↗️ red_mad_robot
Опыт теперь не стирается вместе с чатом: главное за неделю в ИИ Аналитический центр red_mad_robot рассказывает и комментирует главные новости индустрии за неделю с 27 по 31 июля 🟥Monash University и ByteDance Seed представили Experience Distillation (EDP) — метод, который сохраняет опыт ИИ-агента прямо в параметрах модели. Проблема современных агентов: они хорошо учатся на собственном опыте, пока он лежит в контекстном окне. Но история взаимодействия исчезает, и модель теряет все приобретённые знания. Простое дообучение на собранных примерах почти не помогает. EPD решает это иначе: сначала исследователи запускают агента в среде и собирают одну траекторию его действий, затем в каждой точке траектории модель-учитель видит всю историю и выбирает лучшее следующее действие. На этих действиях учится модель-студент, но уже без доступа к прошлому опыту. Так знания переходят в веса модели, и она начинает принимать более правильные решения сама. Метод заметно обгоняет классическое обучение. На задачах программирования SWE точность выросла с 5,3% до 51,4% и сохранила почти 65% преимуществ, которые давал полный контекст опыта. На игровом бенчмарке TaleSuite агент удержал больше 93% эффекта обучения на опыте. Почему это важно: опыт агента переходит в веса модели — его не нужно держать в контексте и оплачивать при каждом запуске. Для бизнеса это прямое снижение стоимости эксплуатации агентных систем: EPD потребовал почти в десять раз меньше взаимодействий со средой, чем методы обучения с подкреплением, а на некоторых задачах — более чем в 57 раз меньше. Агент дешевле в эксплуатации и улучшается сам, без отдельного контура дообучения. 🟥Исследователи из BAAI рассказали об AREX — ИИ-агенте для глубоких исследований. Он работает итерациями. Сначала ищет информацию, изучает источники и формирует предварительный ответ. Затем проверяет, насколько ответ отвечает каждому требованию задачи. Нашёл слабые места — сохраняет полезные находки и превращает нерешённые вопросы в план следующего этапа, вместо того чтобы начинать всё заново. AREX периодически сжимает историю работы в компактное состояние: подтверждённые факты, отвергнутые гипотезы, открытые вопросы и план действий. Так агент справляется с длинными исследовательскими задачами и не теряет важное. Агента обучали в три этапа: сначала на синтетических примерах, затем в режиме агента с поиском и рассуждениями, в конце — обучение с подкреплением. Оно поощряло шаги, которые находили ключевые факты или исправляли ошибочное направление поиска. AREX-Base показал лучшие или одни из лучших результатов на нескольких бенчмарках для глубоких исследований — обошёл GPT-5.4, GLM-5, Qwen3.5 и ряд других моделей. Основной прирост дают два механизма: сжатие контекста и внешний цикл самосовершенствования. Без них точность падала до 59,6%, с обоими выросла до 82,5%. Почему это важно: агент повышает качество исследования проверкой промежуточных результатов, а не просто наращиванием объёма поиска — стоимость задачи остаётся предсказуемой и не растёт бесконтрольно. Также на неделе: • Hugging Face опубликовала подробный разбор инцидента безопасности, который устроил ИИ-агентом OpenAI • Anthropic представил работу, которая объясняет, когда внутренние рассуждения языковой модели влияют на ее ответы, а когда являются лишь сопутствующим текстом • OpenAI открыла исходный код Codex Security CLI • Moonshot AI опубликовала веса и технический отчёт по Kimi K3 • Thinking Machines Lab выпустила модель Inkling-Small • Сотрудники передовых ИИ-лабораторий подписали петицию о создании решений для замедления ИИ • Ant Group представила модель Ling-3.0-Flash для создания ИИ-агентов • Microsoft выпустила MAI-Cyber-1-Flash — свою первую специализированную модель для кибербезопасности, интегрированную в агентную систему MDASH для поиска уязвимостей в ПО #AI_moment #трендвотчинг ↗️ red_mad_robot
Технологическое превосходство перестало быть решающим? Компании внедряют одинаковые ИИ-инструменты и получают на выходе похожие продукты, а исход конкуренции всё равно разный. Руководитель AI-портфеля продуктов red_mad_robot Кирилл Мозолёв разобрал эту логику на Нетконференции ИИ в Центре ИИ СПбГУ и показал, что определяет победителя, если не технология. Делимся ключевыми тезисами выступления: Канал сильнее технологии Раньше УТП и качество кода были достаточным барьером против конкурентов. Сейчас технологии и функции копируются за считанные дни, если у конкурента есть доступ к тем же инструментам. Канал дистрибуции становится сильнее технологического превосходства: конкурент с идентичным продуктом просто не может достучаться до аудитории, которая уже готова слушать и покупать. Своя аудитория — единственное преимущество, которое нельзя скопировать за ночь. Профит-пулы важнее размера рынка Путь от идеи до прототипа разбивается на несколько этапов — от анализа рынка до сборки прототипа. 1️⃣ На этапе анализа смотрят не только на объём, но и на профит-пулы — места в цепочке, где реально оседают деньги и есть пространство для нового игрока. 2️⃣ Гипотезу формулируют через методологию работы, которую продукт должен выполнять для пользователя, а агента просят явно указывать источники — так проверяемые данные отделяют от предположений модели. 3️⃣ Дальше собирают боли аудитории из комментариев и обсуждений в социальных сетях, подтверждают их глубинными интервью, тестами на реальном трафике и посадочными страницами с ещё не существующим продуктом. Гипотезы проверяют за дни Раньше проверка идеи требовала полноценной команды разработки: написание кода стоило дорого, ошибка в выборе ниши обходилась в месяцы работы и дополнительный бюджет. Технология и функции были главным конкурентным преимуществом: скопировать чужую фичу было сложно и затратно. Сейчас рынок и аудиторию исследует ИИ, прототип собирается почти без затрат, гипотезу проверяют за дни вместо месяцев. Цена ошибки в выборе ниши падает почти до нуля. Прототип собирают двумя способами Для рабочего продукта разработчики пишут код вместе с инструментами вроде Cursor и Claude Code — они помогают редактировать, править и тестировать совместно с человеком. Для быстрой проверки идеи без разработчика используют сервисы вроде v0, Lovable и Bolt: они генерируют кликабельный интерфейс или рабочее веб-приложение по текстовому описанию, без единой строчки кода. От промпта до кликабельного макета проходят минуты. Максимальный эффект — только при полном охвате SDLC По оценке Gartner, полное закрытие SDLC сквозным решением даст рост производительности на 25–30% к 2028 году. Для сравнения: помощник ИИ в среде разработки ускоряет только написание кода и добавляет около 10% производительности, дальше прирост не масштабируется. При этом 85% профильных специалистов считают, что максимальную бизнес-эффективность агентный ИИ показывает только в рамках единого платформенного подхода. ↗️ red_mad_robot
⚡️ DCD Design снова на сцене — теперь в финале Generation AI Awards DCD Design — наш совместный с Билайном подход к организации знаний для ИИ-агентов в компаниях. Он помогает работать с внутренней информацией по понятным правилам: где искать данные, какие источники учитывать и как проверять ответ перед выдачей. Именно за счёт этого агент становится управляемым — в цифрах это рост точности с 78% до 94%. А месяц назад за этот же проект мы с Билайном взяли Data Award 2026 — в номинации, где с нами конкурировали ещё 10 бигтех-команд. Нам это по-прежнему интереснее всего: превращать генеративный ИИ в измеримый и понятный рабочий инструмент. Stay tuned! ↗️ red_mad_robot
Не всякий прогресс агента — прогресс: разбираем главное за неделю Аналитический центр red_mad_robot рассказывает и комментирует главные новости индустрии за неделю с 20 по 24 июля 🟥Tencent и другие организации представили Harness Handbook — систему, которая автоматически строит трёхуровневую карту проекта и связывает поведение программы во время выполнения с конкретными этапами обработки, функциями и файлами исходного кода. Карту строят статический анализ кода и языковая модель. Дальше агент действует по процедуре BGPD: сначала получает общий обзор системы, затем находит нужные компоненты, определяет, какие файлы нужно изменить, и в конце сверяет выбранные места с текущей версией кода. Авторы проверили подход на 60 задачах по модификации кода. С Harness Handbook доля успешных планов выросла с 28,3% до 38,3% на одном наборе тестов и с 26,7% до 45,6% — на другом. При этом агент тратил на планирование на 9–13% меньше токенов, а точность поиска нужных файлов и функций заметно повысилась. Случаев, когда агент вообще не находил нужное место в коде, стало почти на 26 п.п. меньше. Почему это важно: у зрелого ИИ-агента правка кода — не самая сложная часть работы. Сложнее найти все файлы, которые стоят за поведением: логика размазана по стадиям, часть путей исполняется редко, и агент, планирующий по памяти о структуре, легко пропускает разрозненные куски. Harness Handbook помогает агентам быстрее ориентироваться в крупных кодовых базах, что делает их более эффективными при сопровождении и развитии сложных программных систем. 🟥Allen Institute for AI и University of Washington ставят под сомнение автоматическую оптимизацию harness. Их аргумент: заявленные улучшения чаще всего объясняются простым перебором конфигураций в поисках удачной. Это и называют эволюцией harness — сам метод при этом не обязательно становится лучше. Значит, сравнивать оптимизированный harness с одной фиксированной настройкой недостаточно. Логичнее сопоставить с другими методами перебора при равном бюджете вычислений. Эксперимент это подтвердил. Автоматически оптимизированный harness набрал 67,4 балла на Terminal-Bench 2.1 — ниже базовой версии с её 68,2. Более простые методы сработали лучше: параллельный запуск нескольких вариантов решения дал 72,3 балла, увеличение числа попыток — 71,8. А найденные оптимизации плохо переносились на новые задачи: они скорее подстраиваются под конкретный тест, чем делают агента лучше. Почему это важно: автоматическая эволюция инфраструктуры агента не всегда приносит реальную пользу. Во многих случаях улучшение объясняется тем, что система просто перебирает больше вариантов решения. Поэтому оценивать такие методы нужно особенно внимательно, отделяя эффект более умного алгоритма от эффекта дополнительных вычислений. Также на неделе: • Yale и UC Irvine показали обзор о метапознании ИИ-агента: способности ИИ оценивать собственные знания и контролировать свои действия • OpenAI сообщил, что во время тестирования системы кибербезопасности две ИИ-модели получили доступ к интернету и взломали Hugging Face • Duke University представил PRO-LONG — механизм управления контекстом, который даёт ИИ-агентам программируемую долговременную память • Anthropic выпустил Record a Skill — инструмент позволяет записать экран, клики и комментарии во время выполнения задачи, а Claude превратит запись в навык • Google запустил Gemini 3.6 Flash и две спецмодели: Gemini 3.5 Flash-Lite для решения дешёвых задач и Gemini 3.5 Flash Cyber для поиска и исправления уязвимостей • Стартап Poolside открыл доступ к моделям линейки Laguna • Cisco выпустил модели Antares для аудита безопасности ↗️ red_mad_robot
видео или голосовое, без подписи
+1
Вместе с Selectel разбираем ИИ-трансформацию бизнеса Сейчас всё расскажем: @Selectel собрал бесплатный курс про ИИ в бизнесе, позвал своих экспертов, а также нас и X5 Digital. Получилась программа, которая ведёт от основ к практике и последовательно разбирает безопасное внедрение ИИ, первые пилоты, устройство ИИ-агентов, роли в команде и стратегию использования новых инструментов. Руководитель портфеля проектов red_mad_robot Саша Лукашенко раскрывает как раз последнюю тему — как превратить ИИ из увлечения отдельных энтузиастов в часть операционной модели компании, как собрать дорожную карту трансформации на 6–12 месяцев и почему попытка обучить всех и сразу почти всегда проваливается. Регистрироваться здесь ↗️ red_mad_robot
Всё смешалось: агенты, люди 25 июля в Эрарте на Selectel Day Off выступит Макс Скорченко, руководитель продуктового офиса red_mad_robot. Он расскажет, почему личный опыт работы с ИИ сам по себе не становится общим, и почему команда, где каждый уже освоил своего агента, рискует превратиться в конгломерат из нескольких параллельных групп. Вместе разберём, какую границу между общими правилами и личными привычками стоит провести, чтобы ускорение не осталось только личным достижением и как правильно выстроить модель «человек + ИИ». Регистрируйтесь🔗 ↗️ red_mad_robot