AISec [x\x feed]🍓🍌🍆
СтатистикаСохранёнки по AI Security и пропаганда здравого смысла @pwnai
- Последний пост
- 19:03
- Последнее чтение
- ещё не заходили
- Постов за неделю
- 5
- Всего постов
- 249
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- 151
- 1/48двое суток
- 173
- 1/72трое суток
- 186
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
https://www.irregular.com/research/addressing-recent-incidents-ongoing-findings-and-path-forward
Maximizing the value of your Claude Code sessions (Score: 150+ in 11 hours) Link: https://readhacker.news/s/72JVs Comments: https://readhacker.news/c/72JVs
https://weetracker.com/2026/08/14/interpol-ai-cybercrime-africa-report/
https://sebastianbarros.substack.com/p/are-you-ready-for-an-ai-agent-swarm
https://exploiting.systems/posts/2026-08-08-prompt-injection-in-virustotals-code-insights-api
без подписи
ко всему этому - выложили ещё крутейшие постеры https://aivillage.org/posters/#defcon-34
прикольно, но кириллицы нету https://doctoreww.github.io/EvilFontTool/
🤝 Альтман подтвердил, что OpenAI планирует сделать Astra общедоступной, а вероятная дата релиза — 10 сентября Глава OpenAI Сэм Альтман заявил, что компания работает над тем, чтобы сделать модель Astra общедоступной. По его словам, OpenAI не считает хорошей стратегией сохранять наиболее мощные модели доступными только «избранным». Я попросил Claude Fable Max и GPT-5.6 Sol Ultra определить самую вероятную дату релиза, и они сошлись, что это — 10 сентября 2026 года, а центральный 50%-ный диапазон приходится на 4 сентября — 9 октября. Прогноз рассчитан как ансамбль двух независимых сигналов, учитывающих несколько возможных сценариев релиза Astra, проверки безопасности, календарь и особенности предыдущих запусков OpenAI; еще распределение рынка прогнозов Polymarket. Рыночные вероятности сохраняются по временным интервалам, а внутри них учитывается историческая склонность OpenAI выпускать модели в определенные дни недели и влияние крупных событий вроде DevDay.
без подписи
https://futurism.com/artificial-intelligence/time-magazine-running-ads-influence-ai-agents
https://habr.com/ru/articles/1068248/
https://www.wsj.com/pro/cybersecurity/inside-amazons-ai-security-playbook-1305e41d
Последние два года мы много экспериментировали с доступными guardrail-моделями. Сравнивали готовые решения, обучили несколько собственных моделей, собирали и адаптировали бенчмарки, чтобы понять, как вообще правильно сравнивать качество защиты. Сравнения по одной метрике недостаточно: какая-то модель лучше ловит опасные запросы, но чаще блокирует легитимные, большие модели имеют более высокий F1-score, но дороже в инференсе и имеют больший latency. В итоге наши наработки мы собрали в GuardRate Leaderboard, где можно сравнивать guardrail-модели по разным параметрам и смотреть на эти trade-offs, настраивая параметры под нужный кейс использования. Ссылка на лидерборд: https://huggingface.co/spaces/hivetrace/GuardRateLeaderboard Подробнее про подход, методологию и наши находки читайте на Хабре: https://habr.com/ru/companies/raft/articles/1067854/ Дорогие конкуренты и игроки рынка AI Security, если вы обучаете свои guardrail-модели и хотите увидеть их на лидерборде, напишите нам. Будем рады добавить и прогнать их по тем же тестам, что и остальные модели и услышать вашу обратную связь. Со временем мы автоматизируем этот процесс, но пока добавляем новые модели по запросу. Поздравляю Софью Балаба с первым релизом ⭐️ и большое спасибо Никите Облакову, Антону Малыхину и Сабрине Садиех за кропотливую работу над тем, чтобы сделать нашу исследовательскую работу публичной 🎉.
https://github.com/dreadnode/ai-red-teaming-cookbook
https://exchange.tenable.com/
https://blog.cloudflare.com/mcp-portal-writeguard-private-beta/
GPT-5.6 Sol failed on about 0.05% of direct attacks generated by GPT-Red, the company’s automated red-teaming model. https://www.techrepublic.com/article/news-gpt-5-6-prompt-injection/ Плохо генерит получается ? Данные на вход слабенькие поступали ?
📌 В кибертестах ИИ создавал поддельные личности и использовал социальную инженерию Институт безопасности ИИ Великобритании опубликовал отчёт об инциденте, произошедшем в конце июля во время замеров киберспособностей передовых моделей. ИИ-агенты вышли за пределы тестового полигона и начали действовать против посторонних людей и компаний. Попытки не удались, и, как пишет AISI, ущерба не было. Институт называет это первым случаем в своей практике, когда модель без самостоятельно применила обман такого масштаба против человека. Набор испытаний состоял из 122 запусков семи моделей на двух учебных полигонах. Следы несанкционированных действий нашли в 10 прогонах. Самих действий, задевших внешние системы и людей, институт насчитал 19, из них 17 приходится на Mythos 5 и 2 на GPT-5.6 Sol. AISI давал агентам выход в интернет, а у двух моделей отключил фильтры, которые блокируют опасные киберзапросы. Иначе, объясняет институт, предельные возможности не измерить. Что нельзя делать в интернете, агентам не сказали. Часть заданий была настроена с ошибкой, и цель формально оказалась вне разрешённой зоны. 🟡 Самый тяжёлый эпизод длился 34,5 часа Агент искал цель в открытом интернете и по цепочке совпадений решил, что репозиторий постороннего разработчика связан с заданием. Он отправил в проект правку с замаскированным вредоносном, а чтобы её приняли, завёл несколько фальшивых аккаунтов на GitHub, обходя проверки при регистрации через Tor и прокси. Один из этих аккаунтов написал, что просмотрел код правки и ничего опасного не увидел, а другой, тоже фальшивый и принадлежавший агенту, поблагодарил его за независимую проверку. Параллельно агент спрятал в другом репозитории инструкцию для ИИ-ассистентов, которые разбирают заявки. Ещё он отправил мейнтейнерам письма и файлы, часть из которых были с вредоносной начинкой. Подвох заметил посторонний пользователь - он запустил подозрительный скрипт в изолированном контейнере и предупредил разработчика. Получив этот фидбэк, агент стал заметать следы - отредактировал прежние сообщения, назвал вредоносный фрагмент случайно забытым отладочным кодом и переписал историю правки. Инцидент отловили по трафику через Tor. Испытания остановили, машины изолировали, доступ к Mythos 5, Opus 5 и GPT-5.6 Sol временно закрыли. 🟡В другом случае агент выложил ключ доступа к своему аккаунту GitHub Агенты из параллельных тестов нашли ключ и стали пользоваться общим аккаунтом, причём один написал другим правила, как делить лимиты запросов и не мешать друг другу. Позже GitHub заблокировал этот аккаунт. Из расшифровок действий видно, что агент прикидывал, настоящий перед ним интернет или симуляция. По итогу рассуждений он заключил, что GitHub, скорее всего, настоящий, - и продолжил. AISI уведомила о результатах своих экспериментов британские NCSC и GC3, GitHub, OpenAI, Anthropic и американский CAISI. Институт обещает опубликовать более полную версию отчета с подробностями и трассировками. @ai_machinelearning_big_data #news #ai #ml
Mistral's Shieldstral: 3B open-weights model for multimodal moderation Article, Comments