Евгений Кокуйкин - Raft
СтатистикаКанал про то, как мы создаем Raft AI и разрабатываем приложения на GPT. Автор Евгений Кокуйкин, контакт @artmaro
- Последний пост
- 14 авг.
- Последнее чтение
- 20:19
- Постов за неделю
- 3
- Всего постов
- 25
- Тип
- открытый
- Язык
- русский
- Категория
- Приложения
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 352
- 1/48двое суток
- 403
- 1/72трое суток
- 435
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Выложили запись нашего доклада о State of Agentic AI Security, который мы записывали c Ариелом Фогелем в мае для Risk Virtual Summit. Ссылка на плейлист со всеми видео. Основные темы саммита agentic security и AI red teaming, и есть отдельные сессии спонсоров, где можно почерпнуть информацию о том, как развиваются зарубежные AI Security решения.
Наблюдаем как идет supply chain атака на популярные репозитории вроде CrewAI, LiteLLM, llama.cpp, Microsoft AutoGen и др.. Исследователь Ариел Фогел из Pillar Security нашёл MCP-сервер, который злоумышленник вчера начал массово добавлять в популярные open source проекты. Все пул реквесты содержат единственную строчку, добавление MCP productivity-suite, который выглядит как обычный MCP с функциями форматирования и суммаризации текста (пример). Первые три вызова он действительно работает как положено, а после этого сервер меняет описание своих инструментов и добавляет туда промпт инъекцию. Эта атака называется MCP Rug Pull. Модель получает инструкции прочитать локальные секреты: ~/.ssh/id_rsa, ~/.bash_history, ~/.kube/config, а также использовать инструменты других подключённых MCP для выполнения действий от имени пользователя. То есть сам вредоносный MCP может не иметь доступа к файлам или облаку, но заставляет модель воспользоваться другим MCP, у которых доступ есть. Вчера в репозитории появился attack_relay.py, для выполнения атак на удалённый хост через перебор n8n API keys и сканирование к LLM endpoint. Часть пул реквестов уже закрыли, но некоторые еще открыты и скорее всего хакер еще не знает о раскрытии и атака продолжается. Pillar назвали кампанию Deadbugz, хотя сама реализация пока выглядит скорее как проделки скрипт-киди. В репозитории без обфускации есть IP адреса, Bitcoin кошелек и другие детали. Даже переменные названы читаемо, а один из коммитов аккуратно называется: `Add attack relay endpoints for VDT assessment`. К слову, когда я проверял репозиторий, Qwen легко находит атаку одним промтом "проверь безопасный ли репо?", а вот Claude ожидаемо отказывается помогать из-за своих safety-фильтров. Разбор Pillar Security: https://www.pillar.security/blog/deadbugz-currently-active-mcp-supply-chain-campaign
Меня, как и многих в индустрии, интересует размер рынка AI Security. Рынок новый, хороших данных практически нет, даже прогнозы Gartner с их Guardian Agents вызывают вопросы. На днях в LinkedIn наткнулся на отчет MarketsandMarkets. Авторы "исследования" утверждают, что рынок растет практически в два раза каждый год и в ближайшие годы достигнет $13 млрд. На первый взгляд отчет выглядит прилично и стоит около $5 тыс., что для покупателя из инвестфонда выглядит вполне обычно. Я запросил триальную версию, вместе с которой в подарок шел звонок с аналитиком компании. 10 минут мне демонстрировали их GPT-wrapper, который позволяет находить цифры среди драгоценных результатов опросов данной фирмы. В отчете даже были цифры по рынку России и Казахстана, и аналитик из Пуны уверенно заявил, что этот расчет основан на опросе нескольких сотен CISO только в России. Никаких нормальных опросов компания не проводила, все цифры в отчете являются галлюцинациями и результатом перекомпиляции доступных данных. Когда на рынке мало данных, а интерес к теме высокий, у таких компаний есть вполне реальные шансы ввести покупателя в заблуждение. При этом косвенно масштаб рынка уже можно оценивать по реальным сделкам. На днях Zenity привлекли $125 млн, то есть оценка только этой компании уже составляет несколько сотен миллионов долларов. И это лишь один из нескольких десятков крупных игроков на рынке. В прошлом году также прошло несколько M&A общей суммой более 1 млрд.
Последние два года мы много экспериментировали с доступными guardrail-моделями. Сравнивали готовые решения, обучили несколько собственных моделей, собирали и адаптировали бенчмарки, чтобы понять, как вообще правильно сравнивать качество защиты. Сравнения по одной метрике недостаточно: какая-то модель лучше ловит опасные запросы, но чаще блокирует легитимные, большие модели имеют более высокий F1-score, но дороже в инференсе и имеют больший latency. В итоге наши наработки мы собрали в GuardRate Leaderboard, где можно сравнивать guardrail-модели по разным параметрам и смотреть на эти trade-offs, настраивая параметры под нужный кейс использования. Ссылка на лидерборд: https://huggingface.co/spaces/hivetrace/GuardRateLeaderboard Подробнее про подход, методологию и наши находки читайте на Хабре: https://habr.com/ru/companies/raft/articles/1067854/ Дорогие конкуренты и игроки рынка AI Security, если вы обучаете свои guardrail-модели и хотите увидеть их на лидерборде, напишите нам. Будем рады добавить и прогнать их по тем же тестам, что и остальные модели и услышать вашу обратную связь. Со временем мы автоматизируем этот процесс, но пока добавляем новые модели по запросу. Поздравляю Софью Балаба с первым релизом ⭐️ и большое спасибо Никите Облакову, Антону Малыхину и Сабрине Садиех за кропотливую работу над тем, чтобы сделать нашу исследовательскую работу публичной 🎉.
Одна из участниц команды лаборатории — Анна Решетняк — дебютировала со статьей на Хабр! 🔥 В материале Аня рассказывает об опыте ускорения Guard модели на основе NER‑классификатора. Модель была нетривиальной, отсюда её ускорение не влезало в классические пути. В статье протестировано 5 инструментов: TensorRT, NVIDIA Triton, vLLM, Ray Serve и отдельно — смена бэкбона на Flash DeBERTa. Такой зоопарк ценен сам по себе, но не менее ценно то, что описаны также найденные Аней сложности и их решения. Приглашаем поддержать сильный дебют: https://habr.com/ru/articles/1067008/ И конечно воспроизвести эксперименты в репо. Ане огни за упорство и результаты!
OWASP выпустил новую версию Top 10 for LLM Applications 2026. 1. Prompt Injection 2. Sensitive Information Disclosure 3. Excessive Agency 4. Supply Chain 5. Data and Model Poisoning 6. Unbounded Consumption 7. Misinformation 8. Hidden Context Exposure 9. Vector and Embedding Weaknesses 10. Improper Output Handling Как и другие гайды проекта, этот список формировался силами сообщества. Участники предлагали новые категории и варианты переименования, после чего голосовали за значимость рисков. Подробнее о кандидатах релиза я писал пару месяцев назад. Как можно заметить, изменений немного: все знакомые категории остались в списке. Новые сценарии атак решили распределить между существующими рисками, чтобы не дробить классификацию. Excessive Agency поднялся на третье место, а в приложении появился подробный маппинг этого риска на OWASP Top 10 for Agentic Applications. Unbounded Consumption тоже переместили выше, на шестое место, на фоне распространения reasoning-моделей, длинных контекстов и роста вычислительных затрат. Наконец, убрали противоречивый System Prompt Leakage. Его переименовали в Hidden Context Exposure, расширив риск до раскрытия developer instructions, tool schemas, правил доступа и другой внутренней логики приложения. В гайде есть большой appendix с маппингами на другие фреймворки и интересная диаграмма движения атаки от внешнего контура к последствиям. На входе находятся три основных вектора: Prompt Injection, Supply Chain и Data and Model Poisoning. Дальше атака может усиливаться за счет раскрытия скрытого контекста или избыточных полномочий агента. В центре схемы находятся три основных последствия: утечка чувствительной информации, распространение недостоверной информации и неконтролируемое потребление ресурсов.
Robinhood добавил нативную поддержку агентов своих клиентов. В мае компания выпускает MCP, который позволяет подключать агентов к управлению инвестиционным портфелем. За два месяца счета открыли 100 тыс. клиентов с суммарным объемом активов $100 млн. Всего на платформе 28 млн пользователей, то есть меньше половины процента пользователей подключили агентов, но хайп вокруг темы дает стремительный рост. К слову о безопасности. Агенту доступны данные всего портфеля: позиции, балансы и история транзакций, но действия выполняются в отдельном Agentic Account с изначально заданным лимитом. Агент может торговать без подтверждения, и, конечно, за все действия агента и убытки отвечает сам пользователь. Непокрытый опцион агент продать не сможет и тем самым завести своего любимого человека в бесконечный минус. Впрочем, такие операции Robinhood не разрешает своим ритейл-инвесторам. Robinhood не первая компания, которая добавила нативную поддержку агентов. Еще в 2024 году в Stripe появился Agent Toolkit, а затем постепенно были добавлены MCP Server, собственные платежные протоколы, ограниченные платежные токены и кошельки для агентов. Ждем появления аналогичных инструментов и на нашем рынке, в марте Яндексе запустили подразделение транзакционного ИИ в Алисе.
📣 Актуальные сценарии работы HiveTrace с OpenClaw и Claude Сегодня на вебинаре показали, как с помощью HiveTrace Hooks контролировать работу Claude, рассказали о способах защиты OpenClaw и продемонстрировали атаки на агентов. ▶️ СМОТРЕТЬ 🟦 СМОТРЕТЬ Поделитесь в комментариях: какие действия AI-агентов в вашей инфраструктуре требуют особого контроля?
Запись вчерашнего эфира доступна, будем рады вашему фидбеку!
🎥Присоединяйся к вебинару по новым сценариям работы HiveTrace с OpenClaw и Claude в 11:00 Уже через час с командой HiveTrace в лайв-демо разберем, как обеспечить безопасность при использовании этих нашумевших инструментов в AI-агентах ➡️ ПОДКЛЮЧИТЬСЯ
AI Security - это не просто AI Firewall. Три года назад, когда мы впервые заговорили о безопасности искусственного интеллекта, еще не было названия для нового класса продуктов. Robust Intelligence первыми запатентовали технику защиты AI Firewall, закрепив новое название в истории. Сейчас мы видим, как этот новый вид фаервола прижился в ИБ-сообществе. Многие компании в России, выбирая сейчас решение для защиты ИИ, уже имеют готовый чек-лист требований к продукту. Мне название AI Firewall не нравилось и раньше. Коллеги по команде подтвердят, что я долго сопротивлялся, прежде чем мы начали добавлять знакомое многим слово в маркетинговые материалы. Проблема в том, что через аналогию со знакомым классом продуктов мы предполагаем, что защита ИИ будет строиться на тех же принципах. Мы добавим набор правил, какие-то защитные эвристики, все проинтегрируем в любимую SIEM, и вопрос защиты ИИ будет решен. Знаковый случай с Hugging Face на прошлой неделе, когда модель сбежала из лаборатории OpenAI во время теста, наглядно показал ограничения текущих техник защиты для новых и мощных систем. Через пару лет нас уже не будут интересовать простые джейлбрейки для RAG-приложений. И сами модели, и guardrails уже значительно лучше детектируют эти атаки. Но что делать с самой моделью? Эти хитрые матрицы, очевидно, имеют собственный подход к решению задачи. В будущем нам потребуется выделенный security center для AI-систем. По аналогии с современными SOC, необходимо будет отслеживать активность агентов, их права, аномалии поведения, инциденты, причины алертов и применение политик безопасности. Как именно это будет технически устроено, пока вопрос открытый. Но уверен защита не ограничивается только AI Firewall с правилами на входе и выходе из модели. Приходите завтра на наш вебинар в 11:00. Мы покажем прототипы технологий защиты агентных систем, разберем новые примеры атак, и с удовольствием подискутируем о будущем AI Security.
"Момент Mythos" случился и в России. 17 июля после принятия рамочного закона об ИИ в Совете Федерации выступил глава Сбербанка Герман Греф. Развитие моделей, агентная экономика, протокол MCP, кодовые агенты и OpenClaw, все это было в программе. Естественно, в центре внимания были социальные последствия ИИ-трансформации, реформа образования, обучение детей работе с нейросетями с начальных классов и подготовка школьных учителей по примеру Китая. Выступление интересное. Нечасто в государственном диалоге в России звучат такие детали, как сравнение моделей по количеству параметров или обсуждение механизма внимания. В СМИ быстро разошлась фраза о том, что Россия не готова к атакам моделей уровня Mythos. Но, что интересно, Герман Греф вскользь сказал, что внутри Сбера пилотируется программа Mythos Ready для противодействия новому классу угроз. Лендинга программы мы, конечно, не увидим, но само упоминание заслуживает внимания. Запомнилась и история про китайскую ИИ-лабораторию "второго эшелона". Последние годы Китай через государственную поддержку финансировал десятки лабораторий, а затем, по мере появления лидеров, постепенно сужал круг получателей финансирования, формируя национальных чемпионов. Одна из лабораторий, потерявших поддержку, искала технологическое партнерство со Сбером. Однако к этому моменту уровень ее разработок уже заметно отставал, поэтому сотрудничество не состоялось.
Рубрика дружеский пиар. Многие давние читатели знают про программу AI Talent Hub в ИТМО. Команда HiveTrace выросла из лаборатории по AI Security, где мы читаем специализированный курс и проводим эксперименты с атаками и гардрейлами. Помимо нас, в учебной программе есть много интересного: курсы про создание ML и LLM-моделей, трек стартапов, новая лаборатория ИИ-агентов, а также индустриальные направления, такие как Х5 и новый трек MLSecOps от Альфа-Банка. Сейчас в самом разгаре приемная кампания. Если вы выбираете для себя магистратуру, посмотрите на конкурс проектов для поступления в AI Talent Hub.
Контроль Claude и OpenClaw в HiveTrace На вебинаре покажем новый сценарий работы HiveTrace с OpenClaw и Claude: в лайв-демо разберем, как обеспечить безопасность при использовании этих нашумевших инструментов в AI-агентах 🗓 28 июля в 11:00, МСК Что будет в демо: ⬇️ ➡️ как HiveTrace Hooks работают с Claude Code; ➡️ как анализировать пользовательские запросы до передачи в Claude; ➡️ как проверять tool calls до фактического выполнения; ➡️ как контролировать параметры и допустимость действий; ➡️ как защитить инстанс OpenClaw от атаки через небезопасный контент; ➡️ как мониторить и аудировать запросы к моделям и инструментам OpenClaw; Спикеры: 👤Анна Тищенко, руководитель интеграции, покажет, как с помощью HiveTrace Hooks контролировать работу Claude на разных этапах. 👤Ильдар Исхаков, эксперт по бэкенду и архитектуре, покажет, как HiveTrace помогает защитить OpenClaw и встроить контроль в существующую AI-инфраструктуру. 👤Никита Беляевский, Red-team engineer, покажет атаки на агентов, в ходе которых, агент под воздействием непрямой промпт-инъекции будет выполнять опасные для устройства команды. Вебинар будет полезен тем, кто работает с AI-агентами, tool calls, Claude Code или OpenClaw и хочет контролировать не только запросы к модели, но и действия, которые агент выполняет в системе. ➡️ Успей зарегистрироваться
28 июля проведем вебинар по защите агентных систем. Расскажем, какие угрозы характерны для Claude Code и OpenClaw, и подробно разберем, как защищать эти популярные агентные инструменты на практике. В HiveTrace мы добавили новые коннекторы для анализа трафика и контроля работы с tool calls. На вебинаре покажем лайв-демо, как это работает в связке с кодовым агентом и OpenClaw. Регистрируйтесь на Timepad https://aisecuritylab.timepad.ru/event/4081453/. P.S. Мы также завели отдельный канал HiveTrace для продуктовых апдейтов и новостей компании.
На днях погружался в китайский рынок AI Security и своими находками поделился в статье на Хабре. Помимо Alibaba и Tencent, свои решения есть у многих компаний: QAX, Sangfor, Venustech, NSFOCUS. Но эти продукты на англоязычных лендингах вендоров вы не найдете. А еще в Китае очень любят OpenClaw 🦞. Вокруг него уже выросла целая экосистема защиты, появился отдельный стандарт, а название "лобстер" закрепилось у потребителей. Если модели Qwen, GLM и DeepSeek известны всем за топовые бенчмарки и открытость, то AI Security в Китае сейчас скрыт от лишних глаз. Ссылка на статью: https://habr.com/ru/companies/raft/articles/1056530/
VibeOS, операционка, которая галлюцинирует https://www.youtube.com/watch?v=zh6fMtL_cSM. Шуточная демка на MS Build, где на любой запрос пользователя интерфейс создается на лету. Можно только позавидовать фантазии автора, выглядит потрясающе. Пишете "открой калькулятор", и UI генерируется на вайбе. Открываете браузер и что-то ищете, и браузер рендерится при запуске, как и Google, и сам контент. Техническая реализация тоже элегантная: для каждого окна создаётся отдельный iframe, а весь интерфейс внутри него это HTML, созданный MS Copilot. HTML лёгкий в генерации, динамичный и гибкий к изменениям. Если ищете вдохновение для вайбкодинга на досуге, рекомендую! P.S. Ссылку утащил из чата ShareAI.
Евгений Кокуйкин про AI Security - AI Dev Podcast (Рубрика #AI4SDLC) Посмотрел подкаст с AI Dev Conf, в котором участвовали Евгений Кокуйкин, Андрей Дмитриев и я. Мы поговорили о том, что происходит с безопасностью разработки, когда у нас кодяру начинают писать не только люди, но и агенты с разными инструментами, доступами и правами на изменения. Если говорить про гостя, то Евгений Кокуйкин - это CEO HiveTrace, со-основатель Raft, руководитель AI Security Lab в ИТМО и участник OWASP Agentic Security. То есть это точка зрения практика AppSec/AI security, который видит и технологию, и поверхность атаки. Главная мысль выпуска крутится вокруг того, что в агентной разработке безопасность становится частью архитектуры процесса: кто действует, от чьего имени, какие права получает, что логируется, где нужен approval и как быстро можно откатиться. Наше общение можно разделить на отдельные блоки 1️⃣ Почему coding agents вообще так быстро продвинулись В обычных GenAI-приложениях трудно понять, насколько ответ хорош: пользователь поставил палец вверх или вниз, но это слабая обратная связь. В разработке иначе. У нас уже есть компиляторы, линтеры, тесты, git-история, баг-трекеры, CI/CD и код-ревью. Можно взять старый баг, восстановить состояние репозитория, дать агенту задачу и проверить решение теми же тестами. SDLC уже содержит заготовку для evals. Отсюда растёт автономность. Агент может решить задачу, получить обратную связь от тестов, перезапустить попытку, передать изменения на ревью. Для внешнего клиента режим "попробуйте ещё раз" выглядел бы странно, а внутри разработки retry, тесты и ревью становятся нормальной частью контура. Но дальше начинается неприятная часть. Если агент становится участником SDLC, его нельзя воспринимать как безобидную подсказку в IDE. Он похож на внутреннего сотрудника или сервисный аккаунт: identity, доступы, токены, возможность читать репозитории, дергать API, смотреть логи, иногда деплоить или помогать с инцидентами. Проблема service accounts и раньше была болезненной, но агентная разработка умножает её на порядок. Часто разговоры про AI security быстро уезжают в область prompt injection, jailbreaks и красивых атак на модель. Но во многих реальных сценариях ломается более скучный слой: права доступа, секреты, supply chain, разделение dev/stage/prod, аудит действий и зависимости. Евгений приводил примеры из мира coding assistants, MCP-серверов, Postmark, LiteLLM и других supply-chain историй. Паттерн здесь прост: если агент или его инструмент подтянул заражённую зависимость, обычные unit tests могут ничего не заметить. 2️⃣ Экономика и метрики Бизнесу легко пообещать "заменим половину разработки агентами", но реальность сложнее. Нужно считать не только токены и GPU, но и платформу: gateway, routing между моделями, sandboxing, аутентификацию, авторизацию, квоты, наблюдаемость. А бенефит нельзя сводить к количеству AI-кода: интереснее смотреть на конкретные job'ы внутри SDLC - миграции, багфиксы, ревью, тесты, инциденты, повторяемые изменения. 3️⃣ Надёжность Если SRE-агент в 2 часа ночи может собрать анамнез инцидента, это полезно. Если он может сам перезапускать сервисы, менять конфигурацию или выполнять план восстановления, это уже другой класс риска. Если каждое опасное действие агента уезжает на senior approval, узкое место просто переехало к самым загруженным людям. Значит, нужны более тонкие политики риска: что агент может делать сам, где нужен второй контур проверки, где требуется изоляция среды, а где действие запрещено всегда. 4️⃣ Ответственность Мы обсуждали агента почти как классическую пару принципала и агента (из теории управления): человек или компания задаёт цель, агент действует от их имени, а дальше появляются misalignment, побочные действия и вопрос "кто отвечает?". Эта логика из менеджмента теперь просачивается в технический контур одного инженера и его агентов. Для инженеров главный вывод такой: AI security в SDLC - это не отдельная "галочка ИБ", а проектирование производственной системы. Нужны evals, threat modeling, least privilege, sandboxing, разделение сред, audit trail, model routing, контроль секретов, политика для non-human identities и наблюдаемость агентных действий. И ещё более практично: если в компании появляются кодинговые агенты, то не стоит начинать с вопроса "какую модель выбрать", а с карты прав и последствий. Что агент читает? Что пишет? Какие инструменты вызывает? Может ли он достать данные? Может ли деплоить? Кто увидит его действия? Как остановить, откатить и расследовать результат? Без этих вопросов "ускорение разработки" очень легко превращается в ускорение риска. #AI #AI4SDLC #Security #Engineering #Architecture #DevSecOps #Agents
Несколько недель назад Андрей Дмитриев пригласил на подкаст AI Dev Conf. Записывали выпуск вместе с Александром Поломодовым и обсуждали, как меняется SDLC с появлением кодовых агентов, какие новые риски они создают, что такое HNI и как в целом пересекаются Security и AI. Саша, спасибо за подробный обзор выпуска!
Рафт - победитель Yandex B2B Tech Awards 🏆 Номинация «Лучший кейс в медицине и фармацевтике» Если раньше слова про анализ в медицине рождали образы, плотно ассоциирующиеся с баночками и коробочками, то с появлением GenAI картина образов существенно расширилась 🤖 👍 Команда Raft разработала на базе Yandex AI Studio и RAG AI-аналитика медицинских карт для сети федеральных клиник: 👍 теперь проверка одной карты занимает от 2 до 5 минут 👍 архитектура рассчитана на 500 тыс. карт в месяц 👍 средняя стоимость ИИ-проверки одной карты оптимизирована до 4,5–7 рублей 👍 средняя абсолютная ошибка (MAE) ИИ по сравнению с оценками живых врачей-экспертов составила около 8–14 баллов в зависимости от специализации, что классифицируется как «отличное» и «хорошее» качество проверки. 🚀 Команда – вы крутые! И пусть сегодня еще не пятница, но повод поднять рюмку чая определенно есть! 🍻 Yandex B2B Tech Awards 2026