tgindex
AI Security Lab

AI Security Lab

Статистика
@aisecuritylabрусский

Взламываем ИИ, а другим не позволяем HiveTrace x AI Talent Hub ITMO ai.itmo.ru/aisecuritylab

Последний пост
11 авг.
Последнее чтение
12:15
Постов за неделю
1
Всего постов
23
Тип
открытый
Язык
русский
В каталоге с
12 авг.
Подписчики
2 034
+7 за 4 дн.
Сутки
+3
+0,15%
Неделя
 
Месяц
 
Просмотров на пост
1 536
23 постов
Вовлечённость
75,5%
к подписчикам
Постов в день
0,1
всего 23
Упоминаний
2
каналов
Охват размещения
оценка
1/24сутки в ленте
353
1/48двое суток
404
1/72трое суток
436

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 11 авг.3991814

    Участник лаборатории Мосин Вячеслав завершил работу над обзором 7 ресурсов для мониторинга угроз AI Security 🔥 И обзор доступен каждому Выбор ресурсов для сбора информации об угрозах, в том числе связанных с безопасностью ИИ является важным этапом в решении задач моделирования угроз и разработки стратегий по защите от них. Задача выбора ресурсов трудоёмкая — можно натравить агента принести ссылки, но он не учтет практических особенностей. Слава разобрал 7 ресурсов и свел всё в единую статью. Её можно использовать как для понимания «что есть?», как и для анализа «что взять?». В статье приведены OWASP, MITRE ATLAS, Google SAIF, MIT AI Risk Repository, Cisco - Integrated AI Security and Safety Framework, а также Сбер - Модель угроз для кибербезопасности AI и ФСТЭК - Угрозы безопасности информации систем искусственного интеллекта. Каждый ресурс отмечен его особенностями. Работа поможет быстрее ознакомиться с ними и выбрать подходящий вариант для разных задач. ⤵️ Читать статью на Хабр

  • 7 авг.6291624

    видео или голосовое, без подписи

  • 5 авг.1 2112415

    Одна из участниц команды лаборатории — Анна Решетняк — дебютировала со статьей на Хабр! 🔥 В материале Аня рассказывает об опыте ускорения Guard модели на основе NER‑классификатора. Модель была нетривиальной, отсюда её ускорение не влезало в классические пути. В статье протестировано 5 инструментов: TensorRT, NVIDIA Triton, vLLM, Ray Serve и отдельно — смена бэкбона на Flash DeBERTa. Такой зоопарк ценен сам по себе, но не менее ценно то, что описаны также найденные Аней сложности и их решения. Приглашаем поддержать сильный дебют: https://habr.com/ru/articles/1067008/ И конечно воспроизвести эксперименты в репо. Ане огни за упорство и результаты!

  • 4 авг.612725

    видео или голосовое, без подписи

  • Инциденты в cyber-evals у Anthropic — и почему нам всем нужен трейсинг агентов Anthropic выпустили пост-ретроспективу про инциденты в собственных evals по кибербезопасности. Технически история почти атака на Hf во второй части, но у Anthropic интересная подача. На неё и посмотрим. Что случилось. Толчком стало раскрытие инцидента у OpenAI — побег моделей из тестовой среды. В ответ Anthropic подняли архив своих прогонов (порядка 141k) и нашли 3 инцидента. Причина — контейнеры, где была моделька имели доступ в интернет, хотя в системном промпте было прописано «интернета нет». В итоге Claude в нескольких прогонах вышел наружу и скомпрометировал реальные системы. Сделал он это обычными приёмами: использовал слабую аутентификацию, открытые эндпоинты, лежащие в открытую креды, установку непроверенного PyPI-пакета. В части случаев модель продолжала атаку, уже осознав, что системы настоящие; в одном — остановилась. Как это подано. Двойной тезис: 1. плохой дизайн теста — не провалидировали все пути в интернет и не мониторили логи в реальном времени; 2. «взломанные не защищались»: дыры были, базовыми мисконфигами, которые вскрылись базовыми техниками. Что из этого важно для нас. Инциденты нашли ретроспективным разбором транскриптов — то есть постфактум. И главный практический вывод прямо из их же выводов: нужно в реальном времени видеть, что делает агент — какие шаги, какие tool-calls, куда он реально ходит. Без этого «агент что-то делает» превращается в «агент что-то сделал» уже по факту. Отсюда мы собрали фреймворки трейсинга агентов. Все они отвечают на запрос наблюдаемости — «что именно делал агент». — [Langfuse](https://github.com/langfuse/langfuse) — open-source трейсинг на OpenTelemetry: шаги, промпты, tool-calls, стоимость, оценки. — [Arize Phoenix](https://github.com/Arize-ai/phoenix) — open-source трейсинг + eval, удобно смотреть траектории и ловить аномалии. — [AgentOps](https://github.com/AgentOps-AI/agentops) — заточен под агентов: session replay, разбор шагов и вызовов инструментов. — [OpenLLMetry](https://github.com/traceloop/openllmetry) (Traceloop) — OTel-инструментирование поверх привычного стека. — И стандарт, который всё это связывает — [OpenTelemetry GenAI semantic conventions](https://opentelemetry.io/docs/specs/semconv/gen-ai/). Вывод такой: если агент способен что-то сломать — его действия надо видеть в момент, а не в архиве. У Anthropic был архив, но прекрасно иметь трейс в реальном времени. Мы также добавляем задачи на тестирование агентов в наши исследования и планируем улучшать на их основе продукт Hivetrace. Так что работаем и мониторим, коллеги, работаем и мониторим.

  • 14 июл.971618из hive_trace

    Контроль Claude и OpenClaw в HiveTrace На вебинаре покажем новый сценарий работы HiveTrace с OpenClaw и Claude: в лайв-демо разберем, как обеспечить безопасность при использовании этих нашумевших инструментов в AI-агентах 🗓 28 июля в 11:00, МСК Что будет в демо: ⬇️ ➡️ как HiveTrace Hooks работают с Claude Code; ➡️ как анализировать пользовательские запросы до передачи в Claude; ➡️ как проверять tool calls до фактического выполнения; ➡️ как контролировать параметры и допустимость действий; ➡️ как защитить инстанс OpenClaw от атаки через небезопасный контент; ➡️ как мониторить и аудировать запросы к моделям и инструментам OpenClaw; Спикеры: 👤Анна Тищенко, руководитель интеграции, покажет, как с помощью HiveTrace Hooks контролировать работу Claude на разных этапах. 👤Ильдар Исхаков, эксперт по бэкенду и архитектуре, покажет, как HiveTrace помогает защитить OpenClaw и встроить контроль в существующую AI-инфраструктуру. 👤Никита Беляевский, Red-team engineer, покажет атаки на агентов, в ходе которых, агент под воздействием непрямой промпт-инъекции будет выполнять опасные для устройства команды. Вебинар будет полезен тем, кто работает с AI-агентами, tool calls, Claude Code или OpenClaw и хочет контролировать не только запросы к модели, но и действия, которые агент выполняет в системе. ➡️ Успей зарегистрироваться

  • Будем делиться новостями по продуктам HiveTrace, новыми релизами и практическими сценариями защиты AI-агентов. Приглашаем на вебинар про контроль Claude и OpenClaw в HiveTrace: покажем лайв-демо HiveTrace Hooks, проверку запросов и tool calls до выполнения, защиту OpenClaw и разбор атак на агентов через непрямые промпт-инъекции. Регистрируйтесь по ссылке и до встречи на вебинаре.

  • 9 июл.1 04944

    Новое пространство рассуждений или новый инструмент для AI safety ▫️ 6 июля Anthropic выпустили работу про J-Space — внутреннее пространство вербализуемых (то есть — переводимых в слова) представлений в Claude, которое можно частично читать. Пространство названо в честь нового метода, который и является движком нахождения этого пространства — J-Lens. Верхнеуровнево идея в том, чтобы вместо вопроса: «На какой токен похож hidden state сейчас?» — как делают некоторые другие Lens-подобные методы, а смотреть на очень маленькую динамику: если немного изменить внутреннее состояние модели сейчас, какие будущие слова и концепты изменятся потом? ▫️И если слово «очень маленький» вызвало у вас воспоминание о школьной производной — да! Для ответа на вопрос используется усреднённый якобиан — матрица локальных производных, показывающая, как изменения в одном слое влияют на будущие выходы. Мы не могли упустить это, ибо и авторы подсветили — метод важен для safety. Модель может не писать явно (а зачем ей это делать?), что распознала prompt injection, что считает контекст подозрительным, что заметила evaluation setting или что удерживает некоторый план. Но такие представления могут быть видны в J-Space — ведь бесконечно малые отражают динамику. Грубо говоря, «что трясется внутри модели быстрее всего». В работе приводятся примеры, где J-Lens помогает обнаруживать внутренние концепты (представленные в виде токенов—слов) вроде: fake injection deception blackmail self-preservation evaluation Конечно, это не значит, что появление токена и то, что мы его увидели, доказывает намерение модели. Например, deception может означать, что модель распознала обман в задаче, а не что она сама собирается обманывать. Поэтому J-Lens нельзя воспринимать как «детектор злых намерений», но можно — как инструмент генерации гипотез для аудита моделей. ▫️Читать технические детали AnthropicPaper ◾️Видео-тизер от Anthropic: YouTube ▫️Технические детали коротко с математикой метода, формулами и интуицией: в канале R&D Lead Research направления — Сабрины

  • 2 июл.1 2961222

    🚗 Nvidia выпустили свежую safety-модель Nemotron 3.5 Content Safety Богдан Минко, ML Engineer в HiveTrace, магистрант AI Talent Hub, ITMO University & AI Security Lab, исследовал модель и поделился своим взглядом: Модель представляет собой мультимодальный guard на базе Gemma-3-4B-it, который разработчики подают как SLM (small language model). Она объединяет два предыдущих релиза: мультимодальную модерацию из Nemotron 3 Content Safety и работу с кастомными политиками из Nemotron Content Safety Reasoning 4B. В трейн добавляли данные с ризонингом, но интереснее примеры следования политике. Идея такая: вместо фиксированной таксономии в модель передается описание политики, она рассуждает и выдаёт вердикт safe/unsafe, а также конкретные safety категории. ➡️ Забавная деталь из бенчмарков: reasoning-режим помогает не всегда, на DynaGuardrail Safety «no think» даёт 0.91 против 0.86 с ризонингом. Для кастомной модели — кастомные бенчмарки: ⬇️ ➡️COSA (code safety) Может быть полезен тем, кто работает с кодовыми ассистентами и планирует интегрировать Guard слой в Claude Code, Cursor и другие ИИ инструменты. ➡️DynaGuardrail Датасет с описаниями политик, который состоит из следующих пунктов: список разрешённых тем, их названия и описания, и сверху много промпта, который будет кушать latency в real time. Вряд ли эта модель станет real-time гардом, обрабатывающим каждый запрос там, где latency критична. Но если ваш UX не ломается от дополнительной пары секунд на размышления и ответ LLM, возможно, это неплохой бейзлайн в каскадном сценарии. 🖥 Nvidia часто открывают свои train-датасеты, вот и в этот раз вместе с моделью выложили Nemotron-3.5-Content-Safety-Dataset. Ребята из SupraLabs уже успели обучить на нём свой очень-очень маленький гард SupraSafety-18M. ➡️ Ну и финальный рецепт каскадного сценария, когда хочется и быстро и качественно: берем SupraSafety 18M, а все случаи где у него низкий confidence отдаем в Nemotron

  • 18 июн.1 3192122

    📣 Актуальные подходы для защиты современных AI-систем: открытая защита проектов лаборатории в записи ➡️ За два дня участники HiveTrace x AI Security Lab представили проекты по самым актуальным направлениям AI Security: детектирование вредоносных запросов, оценка guardrail-моделей, бенчмарки безопасности, анализ мультиагентных систем и многое другое... Не смог присоединиться? Лови запись всех докладов: узнай как AI Security выглядит на реальных проектах 🎥 СМОТРЕТЬ - часть 1 🎥 СМОТРЕТЬ - часть 2 ❤️ — был на вебинаре 👀 — посмотрю в записи

  • 13 июн.2 58068

    🎥Присоединяйся к Открытой защите проектов в 12:00 Уже через час участники AI Talent Hub покажут, как строить и сравнивать защитные классификаторы, разрабатывать бенчмарки, анализировать ложные срабатывания и исследовать внутренние механизмы LLM-безопасности ➡️ ПОДКЛЮЧИТЬСЯ

  • 12 июн.1 53312

    ⚡️Открытая защита стартует через час. Подключайтесь

  • 11 июн.2 226129

    Как выбрать хорошую Security команду? У неё нет выходных!🗿 На этих прекрасных выходных (уже завтра!) мы собираемся увидеть, как AI Security выглядит на реальных проектах. 🗓 12 июня в 12:00 Второй день открытой защиты посвящён прикладным проектам: участники AI Talent Hub покажут, как строить и сравнивать защитные классификаторы, разрабатывать бенчмарки, анализировать ложные срабатывания и исследовать внутренние механизмы LLM-безопасности. Спикеры: 👤Герман Кочнев AI Security — курс-практикум по безопасности ИИ-приложений 👤Анастасия Калиманова Линейный классификатор как альтернатива guardrail-моделям 👤Софья Балаба Арена для комплексного сравнения guardrail-моделей 👤Дарина Ковалева RuFPBench — разработка pipeline для формирования примеров, инициирующих ложные срабатывания 👤Владимир Грищенко Анализ совместимости направлений распознавания небезопасного входа и направления отказа 👤Егор Емельянов Домен-ориентированный SAE для анализа безопасности LLM Защиту откроет наш лид — можно будет узнать, как и зачем мы ведем проекты! Готов заглянуть внутрь и узнать над чем участники трудятся в области безопасности ИИ? ➡️Присоединяйся к защите 12 и 13 июня

  • 9 июн.2 3792127

    📣Начинаем знакомить вас со спикерами! Первый день открытой защиты посвящён проектам в области безопасности и надёжности LLM-систем. Вас ждут доклады от участников AI Talent Hub — о детектировании вредоносных запросов, ускорении защитных моделей, оценке guardrails, анализе отказов мультиагентных систем, разработке бенчмарков безопасности и аудите ML-моделей. 👤Ширин Аланова Обнаружение мультиязычных вредоносных запросов с помощью семантического анализа 👤Анна Решетняк Ускорение inference для GLiNER Guard 👤Вадим Паненко TotalGuardEval — оценка guardrail-моделей 👤Вера Краснобаева Воспроизводимые сценарии каскадных отказов в мультиагентных LLM-системах 👤Ярослав Рогоза, Иван Александров, Герман Кочнев DuMa Benchmark — бенчмарк для оценки безопасности LLM в интерактивной среде 👤Вячеслав Мосин Анализ статических сканеров ML-моделей Доклады идут плотно: каждые 20 минут — новая тема и новый автор. 🔔Стартуем уже 12 июня — успей зарегистрироваться 🔥 - спикерам

  • 5 июн.1 3491619

    Открытая защита проектов лаборатории HiveTrace x AI Security Labs Дата: 12-13 июня 2026 Время: 12:00 МСК Формат: онлайн Предлагаем вам заглянуть внутрь лаборатории и узнать над чем участники трудятся в области безопасности ИИ: как оценивают модели, как исследуют их ограничения, как ищут уязвимости, как тестируют надежность агентных систем и какие подходы используют для защиты современных AI-систем. На защите будут два направления: ➡️исследовательское, где изучают модели изнутри и разрабатывают методы их оценки ➡️прикладное, где знают, как решить проблемы прода, даже если они ещё не болят. Формат каждого выступления: короткая презентация, только ключевые тезисы и результаты, фокус на проблеме и предложенном решении. После каждого доклада — вопросы и обсуждение. Присоединиться может любой желающий, независимо от технического бэкграунда. Это хорошая возможность увидеть, как исследования становятся прикладными кейсами. ▶️ Регистрация здесь 🔥 - если планируешь прийти ❤️ - если выступаешь сам

  • 27 мая1 3672023

    📣 AI Security: практикум по безопасности ИИ-приложений Исследователи из AI Security Lab Герман Кочнев @germKo и Иван Александров @ivanich_spb опубликовали вводный курс по секьюрити на платформе Stepik без кода и с большим количеством практики. Курс CTF-чемпионат, где студент руками проходит путь от простых prompt injection и jailbreak до разведки и взлома агентских систем. Что внутри: ⭐Prompt Injection и обход инструкций Jailbreak-техники и guardrails ⭐ Indirect Prompt Injection через письма, документы и веб ⭐атаки на агентов и отравление RAG ⭐защита: от простых фильтров до архитектурных решений Формат курса - CTF-задачи: нужно сломать систему, получить флаг, разобрать, почему атака сработала и как это чинить. Есть демо-доступ. ➡️ Забирай курс с автоскидкой Учимся ломать ИИ-приложения так, чтобы потом проектировать их безопаснее

  • 22 мая1 1551210из devdeaf

    Атаки на агентные LLM-системы Неделю назад представил работу на конференции Центрального университета "Научный телеграф", секция "Кибербезопасность" совместно с ВМК МГУ. После основных тестов нашёл ещё один вектор: two-document chain injection. Загружаешь два документа: каждый по отдельности безобиден и фильтрацию не триггерит. Но при совместной обработке модель выстраивает логическую цепочку между ними и принимает инструкции из второго как обязательные. Один нейтральный вопрос — и агент готов переслать письмо на внешний адрес. Итого по исследованию: 34 тест-кейса, ASR 33% на full bypass. Тезисы приняты, репорты поданы в Bug Bounty. Работа в рамках курса AI Security ИТМО AI Talent Hub под руководством Евгения Кокуйкина. #bugbounty #promptinjection #llmsecurity #aisecurity

  • 19 мая2 01030

    видео или голосовое, без подписи

  • 19 мая1 951830

    GLiNER Guard omni был добавлен в PII Masking Leaderboard Лидерборд включает четыре датасета: ➡️Ai4Privacy OpenPII 1M - мультиязычный датасет с ПД на 23 языка ➡️NVIDIA Nemotron-PII - датасет, на котором Nvidia тренировала свой GLiNER PII ➡️Gretel PII Masking EN v1 - синтетический датасет от Gretel AI ➡️Privy - датасет с PII в контексте API/логов. На OpenPII наш gliner-guard-omni занял 1-е место с F2 = 0.930, обойдя не только privacy-filter от OpenAI, но и GLiNER PII от Nvidia, и обе модели OpenMed SuperClinical. По среднему F2 на всех четырёх бенчмарках мы на 9-м месте, но обходим заметных конкурентов: privacy-filter от OpenAI, privacy-filter-nemotron от OpenMed и GLiNER2-large Основные выводы: ➡️ Обучение на русском и английском не сломало мультиязычный претрен модели (OpenPII Sota) ➡️Обобщаемая модель, которая умеет и детекцию ПД и Safety классификацию - конкурирует со специализированными PII Masking Leaderboard - внешний бенчмарк, который оценивает способность моделей маскировать персональные данные из коробки, без дообучения.

  • 12 мая5 09983131

    Открыли в open-source GLiNER Guard — компактную модель для модерации LLM-запросов и защиты персональных данных. Отличие GLiNER Guard от других Guard моделей: Вместо тяжёлых, дорогих — других guardrai-моделей — быстрый энкодер, который за один проход и проверяет unsafe-запросы, находит персональные данные (имена, адреса, телефоны, email и другое, что нельзя скармливать LLM), и работает как первый фильтр перед большими моделями. Что ещё в релизе: Вместе с моделью выпустили PII-Bench — бенчмарк для оценки качества поиска персональных данных. Тоже в открытом доступе. Где забрать: Тех репорт: https://arxiv.org/abs/2605.05277 Модели: https://huggingface.co/collections/hivetrace/gliner-guard-v1 Бенчмарк: https://huggingface.co/datasets/hivetrace/pii-bench 👤 Автор: Богдан Минко, ML Engineer в HiveTrace, магистрант AI Talent Hub, ITMO University & AI Security Lab 👤 Редакция: Сабрина Садиех, R&D Lead в HiveTrace, магистрантка HSE. ⚡️ - автору за open-source ❤️ - сохраняю, буду тестировать

AI Security Lab — tgindex