tgindex
AI Security | Безопасный ИИ

AI Security | Безопасный ИИ

Статистика

Канал новостей по AI Security и обновлений по курсам AI Security на Stepik. Ссылка на курс: https://stepik.org/a/225332

Последний пост
25 июл.
Последнее чтение
12:21
Постов за неделю
0
Всего постов
18
Тип
открытый
Язык
русский
Категория
Новости и СМИ
В каталоге с
12 авг.
Подписчики
110
0 за 3 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
387
16 постов
Вовлечённость
351,8%
к подписчикам
Постов в день
0,0
всего 18
Упоминаний
2
каналов
Охват размещения
оценка
1/24сутки в ленте
115
1/48двое суток
131
1/72трое суток
142

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • видео или голосовое, без подписи

  • Всем привет! 🚩 В курсе появился бот, который знает контекст курса и должен оперативно отвечать на ваши комментарии. (в принципе, его тоже можно попытаться взломать - только сильно не спамте в комментарии степика 😇) Пока в тестовом режиме, возможно уберем. Проголосуйте ниже в опросе, плиз 👇

  • 23 июл.1 711817

    Привет, редтимеры! 🚩 🤖 AI Agent Security: месяц борьбы не с моделями, а со скорером. Продолжается одно из самых необычных соревнований на Kaggle от OpenAI: AI Agent Security - Multi-Step Tool Attacks. Главный инсайт: это соревнование не столько про лучший джейлбрейк, сколько про победу над Kaggle-скорером. На бумаге задача звучит просто: написать attack.py, который атакует LLM-агента с инструментами, находит уязвимые цепочки и возвращает воспроизводимые AttackCandidate. На практике ты воюешь сразу с тремя вещами: 1. моделью; 2. гардрейлом; 3. официальным скорером, который может убить весь сабмит после нескольких часов расчета. И вот третий пункт оказался самым жестким боссом. 🎯 Что реально работает? Самый стабильный путь сейчас - не сложные многоходовые атаки, а быстрые и воспроизводимые tool-call атаки. Главная рабочая механика: - заставить агента сделать http.post; - передать в data скоринговый маркер; - менять URL/домены/пути так, чтобы получать новые score cells; - возвращать только те кандидаты, которые реально сработали во время live exploration. То есть выигрывает не самый «хакерский» промпт, а тот, кто лучше управляет плотностью: сколько валидных атак можно посадить в лимиты времени. 🚀 Подходы, которые выстрелили: Live-fill. Алгоритм не просто генерирует заранее 1000 промптов. Он прямо во время run() взаимодействует со средой, проверяет, сработала ли атака, и возвращает только successful candidates. Template race. Берем несколько коротких шаблонов атаки, прогоняем пробные запросы, смотрим, какой шаблон быстрее и надежнее на текущей модели, потом заполняем оставшееся время лучшим вариантом. Replay-safe sizing. Самая важная инженерная часть. Скорер потом заново replay-ит все кандидаты. Если вернуть слишком много даже рабочих атак, сабмит может умереть с Submission Format Error. Поэтому нужно считать не только генерацию, но и будущую стоимость replay. One-turn exfil density. Многоходовые атаки красивее и локально могут давать жирный score, но на официальном Kaggle часто не проходят replay budget. Сейчас короткие одношаговые атаки часто выгоднее, потому что их можно посадить больше. 🧨 Что работает хуже, чем хотелось: Мультитёрн сценарии, indirect prompt injection, logic puzzles, давление в стиле «я админ», JSON-маркеры, языковые варианты, эмодзи, опечатки - всё это интересно и иногда стреляет в локальной валидации. Но главная проблема: официальный скоринг жестко наказывает за дорогие цепочки. Даже если атака успешная, она может быть слишком тяжелой. А один тяжелый сабмит может несколько часов считаться и в конце упасть без score. 😵‍💫 Главная боль соревнования: `Submission Format Error` не значит, что у тебя неправильный CSV. Очень похоже, что под этим сообщением скрываются: - timeout replay-фазы; - слишком много кандидатов; - слишком дорогие многоходовые цепочки; - нестабильность hosted evaluator; - несовпадение локальной валидации и реального Kaggle replay. - и ещё множество догадок в дискашенах, но никаких объяснений от каггл стафф. То есть можно иметь локально отличный score, отправить сабмит, ждать несколько часов и получить просто пустой результат. 📈 Сейчас топовые решения сходятся к одной идее: Побеждает не самый крутой ркдтимер, а тот, кто аккуратнее балансирует: - latency; - replay budget; - число кандидатов; - уникальность score cells; - стабильность на GPT-OSS и Gemma. Это уже почти не prompt engineering, а performance engineering для атакующего алгоритма. 🧠 Что по итогу: AI Agent Security не сорева про LLM-безопасность, а инженерная задача на границе red-teaming, системного дизайна и оптимизации под странный evaluator. Модель можно пробить. Гардрейл можно обойти. Но настоящий финальный босс - это пройти скорер и не умереть через 6 часов с Submission Format Error. Если хотите решать агентами - Фабла и Сол сразу всё рефьюзят, даже если пишешь им, что это официальная сорева от OpenAI (проверил за вас - не благодарите) Остался месяц - самое время подключиться, основные шишки уже набили за вас. Решаете или планируете приступить???

  • 22 июл.13032из vibecoding_tg

    Модели OpenAI взломали сайт Hugging Face с открытым ИИ, чтобы украсть ответы и сжульничать в бенчмарке 🤡 OpenAI рассказала о необычном инциденте во время внутреннего тестирования моделей на кибербезопасность. GPT-5.6 Sol и ещё одна неанонсированная модель, предположительно GPT-6, пытались получить максимальный результат в ExploitGym (бенчмарк по кибербезопасности) и в процессе вышли за пределы изолированной среды. Для теста моделям заранее ослабили защитные ограничения и отключили продакшен-классификаторы. В итоге они нашли zero-day в прокси реестра пакетов OpenAI, повысили свои права, переместились по внутренней инфраструктуре и добрались до машины с доступом в интернет. Дальше модели предположили, что ответы для ExploitGym могут находиться на Hugging Face. С помощью украденных учётных данных и zero-day уязвимостей - они получили удалённый доступ к серверам Hugging Face и добрались до закрытой информации в продакшен-базе данных. В OpenAI назвали произошедшее беспрецедентным киберинцидентом.

  • 19 июл.1165из pwnai

    видео или голосовое, без подписи

  • Присоединяйтесь к опросу!

  • 19 июл.10821из seeallochnaya

    Две новости в утро воскресенья, 2026-й год: 1. Huggingface, платформа для загрузки моделей и датасетов + тренировки, раскрыли, что недавно подверглись атаке на инфраструктуру. Эта атака отличалась от предыдущих одним свойством: она была произведена автономной системой ИИ-агентов от начала и до конца. В результате атаки серьезного урона, по их оценкам, нет, но атакующие получили доступ к ограниченному набору внутренних данных и к нескольким учетным записям внутренних сервисов. Злоумышленник использовал два пути выполнения кода в пайплайне обработки данных, в результате которых внутренняя виртуальная машина запустила вредоносный код. После этого злоумышленник получил доступ на уровне сервера, собрал учетные данные облака и кластера и за выходные проник в несколько внутренних кластеров. «Кампанией управлял автономный агент (используемая LLM до сих пор неизвестна), который выполнял тысячи отдельных действий в рое короткоживущих виртуальных машин с самомигрирующей командно-контрольной инфраструктурой, развернутой на общедоступных сервисах. Это соответствует сценарию "агентcкого злоумышленника", который давно прогнозировали в индустрии». Ну прям как в Терминаторе показывали 👀 Заметить и отразить атаку получилось из-за... ИИ, так как у HuggingFace за логами и аномалиями следит LLM (по описанию похоже на то, что сначала система на основе правил находит разные потенциальные инциденты, а затем модель их перепроверяет более детально). «Когда мы начали анализ логов, мы сначала использовали передовые модели, работающие через коммерческие API. Это не сработало: для анализа требуется загружать большие объемы реальных команд и артефактов, но эти запросы блокировались защитными механизмами провайдеров, которые не могут отличить специалиста по реагированию на инциденты от злоумышленника. В итоге мы провели криминалистический анализ на нашей собственной инфраструктуре, используя GLM 5.2». 2. Bloomberg: США рассматривают возможность создания надзорного органа для аудита передовых ИИ-моделей. Уже составлен черновик предложения, и он рассматривается главой аппарата Белого дома. Это предложение предусматривает создание независимого регулирующего агентства в сфере ИИ, которое будет подотчетно Комиссии по ценным бумагам и биржам (SEC). В целом, план США согласуется с предложениями, опубликованными ранее на этой неделе CEO DeepMind Demis Hassabis, который на следующей неделе поедет в Вашингтон обсуждать и лоббировать свои идеи. В публикации в твиттере он сравнил потенциальный новый надзорный орган с FINRA — независимым, финансируемым самой отраслью регулятором брокерских фирм, который технически не является частью правительства США. Свои полномочия он получает от SEC, которая, по сути, делегирует надзор, но проводит аудит и устанавливает правила. Моё понимание такое, что схема нужна потому, что государство с одной стороны не может быть очень быстрым (как частные компании), а с другой стороны не может платить сотрудникам большие деньги. Официально-то директора и министры получают сущие копейки, меньше чем миддл-инженеры в Google — кто туда пойдет работать?

  • 3 июл.181122

    Привет, редтимеры! 🚩 Опубликовали завершающий и самый объёмный 5-й модуль курса. 🐘 Внутри: • новая компания и киберпанк • разведка black-box систем • рой агентов • OWASP, КЦД и прочие ругательства • много CTF 🚩 Ждём обратную связь! На этом курс можно считать завершенным, далее будем вносить минорные правки, добавлять (или убирать) задачи и.т.п. P/S: Просьба оставить отзыв о курсе на Stepik, если уже есть такая возможность - это поможет в продвижении и поддержке курса!

  • 12 июн.16073из data_science_winners

    Привет, Чемпионы! 🏆 🤖 AI Agent Security - Multi-Step Tool Attacks: Почувствуй себя хакером в мире LLM-агентов! 🎯 На Kaggle стартовало, пожалуй, самое долгожданное соревнование для специалистов по AI Safety и ИИ-безопасности. Организаторы не абы кто, а OpenAI, Google, IEEE и WCCI. Вместо привычного тюнинга бустингов или классификации картинок нам предлагают заняться алгоритмическим ред-тимингом и взломать умных ИИ-агентов, использующих внешние инструменты. Это НЕ конкурс на написание единичных «джейлбрейков» вручную. Задача гораздо глубже: нужно написать автоматический алгоритм атаки, который заставит агента совершить цепочку деструктивных действий. В чем суть задачи? Современные агенты умеют читать файлы, лазить в интернет, отправлять email-ы и делать HTTP-запросы. Но что, если во входящем письме или на веб-странице спрятана инструкция, которая заставит агента прочитать secret.txt, вытащить оттуда SECRET_API_KEY и отправить его на сторонний сервер через http.post? Ваш алгоритм (attack.py) будет помещен в Gym-style среду. Ему предстоит взаимодействовать с изолированным агентом (тестировать будут на GPT-OSS и Gemma 4), искать многошаговые уязвимости и выдавать воспроизводимые цепочки промптов, которые пробивают гардрайлы (guardrails). 🚀 Что здесь может сработать: Reinforcement Learning (RL) и MCTS. Поиск цепочки атак - это, по сути, исследование графа состояний. Алгоритмы вроде Monte Carlo Tree Search (MCTS) или Q-learning могут помочь эффективно искать траектории, которые шаг за шагом сдвигают контекст агента в сторону опасного действия. Пакетные итеративные промпты (Prompt Injection Frameworks). Агенты «ломаются» на стыке контекстов. Использование техник Indirect Prompt Injection (когда вредоносный текст подсовывается через web.search или mail_seed.json) - ключ к успеху. Нужно заставить агента самого прочитать ваш скрытый промпт при выполнении легитимной задачи. Анализ трейсов (Trace Analysis). Среда возвращает логи вызовов инструментов. Напишите парсер логов (отслеживайте fs.read, email.read), чтобы ваш алгоритм атаки динамически адаптировался: если агент прочитал нужный файл, следующий шаг атаки должен подтолкнуть его к вызову http.post. Генерация состязательных суффиксов (Adversarial Optimization). Атаки на основе градиентов или генетических алгоритмов для подбора таких токенов, которые максимизируют вероятность вызова агентом запрещенной функции, несмотря на системные промпты защиты. 📅 Дедлайн: Прием решений открыт до конца августа 2026 года. Призовой фонд: $50,000, но Solo Gold и статус главного кошмара для ИИ-безопасности OpenAI стоят гораздо дороже! 🔗 Ссылка на соревнование: https://www.kaggle.com/competitions/ai-agent-security-multi-step-tool-attacks Для кого эта тема в новинку, предлагаем быстро погрузиться на нашем практическом курсе по AI Security 🚩. (промокод в комментах) Кто готов заняться легальным хакингом фронтирных моделей? Обсуждаем векторы атак в комментариях! 👇

  • Нашли где можно применить все техники с нашего курса на практике и залутать реальные $🤑 Го, редтимить! 🚩

  • Всем привет! 🚩 В курсе открылся новый урок: • сначала нужно будет провести разведку системы • потом атаковать и всё сломать • легко не будет, но у вас будет верный помощник в стане врага 😎 Го проходить и ждём обратную связь! P.S.: на Stepik завтра заканчивается летняя распродажа, в которой участвует наш курс, если хотели кому-то порекомендовать - то самое время.

  • 2 июн.2 25266

    Привет, редтимеры! 🚩 В курсе открылся новый модуль с новым главным героем 🔥 Внутри: • рассмотрим непрямые промпт-инъекции (атакуем не из чата, а через документы) • будем атаковать разных агентов • потренируемся строить модель уязвимостей агентских систем (threat model) • И конечно, пособираем флаги 🚩 По прежнему ждём от вас фидбэк. P.S.: Один из уроков модуля немного задерживается.

  • ⚡️ Opus 4.8 взломали через 7 минут после релиза 🤯 Исследователь узнал о выходе Claude Opus 4.8 не из официального анонса Anthropic, а от… своего же агента на Opus 4.7 👀 https://x.com/Machinelearrn/status/2060304235539911024 Агент сам засёк новый релиз, тут же попробовал jailbreak и доложил: новая модель пробивается с первой попытки. Дальше - больше. По словам автора, агент уже автономно пошёл тестировать другие сценарии: социальная инженерия, фишинг, финансовые махинации, манипулятивные воронки и прочие запрещённые классы задач 🎭💉 Детали промптов тут не главное. Важен сам тектонический сдвиг: теперь модели могут не просто реагировать на атаки, а помогать искать слабые места у других моделей 🔍 Чем умнее становятся frontier-модели, тем мощнее становится и автоматизированный jailbreak-testing. Больше доменных знаний, лучше планирование, выше настойчивость - и больше шансов найти ту самую странную щель в safety-слое 🧠⚡ Новый, довольно жёсткий стандарт для AI safety: модель нужно тестировать не только людьми, но и другими моделями, которые будут методично искать обходы быстрее, чем это успеют сделать живые пользователи. Уже тестили 4.8? Делитесь мыслями в комментариях 👇🔥

  • Как и обещали, возвращаемся с контентом по джейлбрейкам. 🆕 Сегодня в программе статья на Хабр от @ivanich_spb с обзором исследования StrongReject. TLDR: Не все джелбрейки одинаково полезны, многие из опубликованных взломов снижают "когнитивные" способности моделей. Материал - топ, внутри комиксы от нанабананы, го читать! 🚽

  • 17 мая204101

    Привет, редтимеры! 🚩 В курсе открылся 3-й модуль про джейлбрейки. ❓ Что внутри: • социальные и технические джейлбрейки • DAN • 8 CTF-задач ✏️ Будем рады любому фидбеку от первопроходцев P.S. На неделе будем выкладывать в канал доп. контент по джелбрейкам, на связи!

  • Всем привет! В этом канале будем публиковать: • новости курсов по AI Security на Stepik • интересные новости и собственные наблюдения в области Security, Safety, Alignment LLM

  • Channel photo updated

  • Channel created

AI Security | Безопасный ИИ — tgindex