The Oleg 1337
СтатистикаAssociate Professor. Head of RSI Group @airi_research_institute, Safe AI Lab director @mtuci_official, Lecturer @miptru, @skoltech, @t_central_university
- Последний пост
- 30 июл.
- Последнее чтение
- 00:47
- Постов за неделю
- 0
- Всего постов
- 27
- Тип
- открытый
- Язык
- русский
- Категория
- Образование
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- 329
- 1/48двое суток
- 377
- 1/72трое суток
- 406
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Ваш ИИ запомнил лишнее. Что делать компании? Можно ли удалить коммерческую тайну из уже обученной нейросети? На практике это одна из самых сложных задач современной ИИ-разработки. Почему модели плохо забывают знания и как бизнесу снизить этот риск — рассказал в материале РБК Про. [Ссылка] 🌐The Oleg
без подписи
Безопасный ИИ. На Летней школе по искусственному интеллетку «Лето с AIRI» в рамках трека SafeAI одну из лекций читает Антон Дмитриевич Митрофанов, Исполнительный директор, Управление экспертизы кибербезопасности Сбера. Он расскажет про стратегию и подходы применения генеративного искусственного интеллекта в кибербезопасности. Антон Дмитриевич выступает сегодня в 16:45. Будет трансляция — можно посмотреть онлайн: [ссылка]. 🌐The Oleg
без подписи
без подписи
без подписи
без подписи
без подписи
ПМЭФ: Пределы использования ИИ в СМИ. В панельной дискуссии про ИИ и медиа обсудили, где сейчас находится граница между ИИ-контентом и журналистикой, и куда она движется. Фиксируется один и тот же сдвиг: ИИ уже не просто создаёт контент. Он конструирует среду, в которой контент формируется как естественный и правдоподобный. Технологии определяют, что аудитория сочтёт достоверным. А человек теперь не только автор информационной среды, но один из её участников — и не самый быстрый. Поэтому особенно важной становится работа с реальными данными, реальным контентом от авторов и органично встроенными в процессы ИИ-инструментами. [Ссылка на трансляцию]. 🌐The Oleg
без подписи
без подписи
без подписи
без подписи
без подписи
Визионерская сессия на Startup Village 2026. Компании всё чаще сталкиваются с кризисом долгосрочных ориентиров. Старые стратегии перестают работать, а новые слепые зоны появляются быстрее аналитических моделей. В BCG Gamma у нас был простой принцип: инструмент усиливает мышление, а не заменяет его. ✔️Основной вывод, который я предложил аудитории: ИИ становится полезным экзоскелетом только для тех, кто сначала научился ходить сам. Иначе это tech-костыль — достаточно убедительный и комфортный, чтобы пропустить момент, когда разучился думать без него. 🌐The Oleg
Игра в гифитацию. Сегодня на лекции обсуждали интересные вопросы по теме защиты агентных систем и refusal, и я решил запустить пробную задачу по стеганализу и криптоанализу "Cryptographic Steganalysis and the Geometry of Model Safety". ⚫️Выдаётся короткая гиф-анимация с лисом. На первый взгляд обычный файл, ничего примечательного. Но внутри записано сообщение, причём не в пикселях) Нужно оценить это поле блочным сопоставлением, статистически доказать, что скрытый канал вообще существует, определить семейство шифра по его отпечатку, восстановить ключ, расшифровать сообщение и строго обосновать финальный ответ. О, как. ⚫️Всё необходимое уже есть в условии. Помимо статистики, будут полезны частотный анализ по столбцам, теорема Шеннона и блочное сопоставление по SAD из видеокодирования. Если эти темы вопросов не вызывают — задача вам по силам. 🔥Первого автора правильного и аккуратно оформленного решения ждут приглашение на летнюю стажировку в нашу лабу и мерч. Это пилот: если формат зайдёт, осенью сделаем полноценный конкурс. 🌐The Oleg
Хороший, плохой, аблитерированный. Правда ли, что у open-weight LLM безопасность держится буквально на одном векторе? За пару лет безопасность чат-моделей переехала из жанра "уговори GPT" в строгий мехинтерп с градиентами и теоремами. Написал лонгрид после вчерашней лекции в ЦУ и вопросов. 1. GCG — с чего всё началось. Берёшь промпт, добавляешь к нему префикс, оптимизированный градиентом по дискретным токенам — и GPT-4 радостно рассказывает то, что не должна. Универсально, переносимо между моделями, до сих пор сильный baseline. 2. Refusal — один вектор. На 13 open-source моделях до 72B параметров отказ через residual stream. Один. Вектор. Стираешь из весов — модель перестаёт отказывать. Прибавляешь — отказывает даже на "привет". Отсюда и пошёл термин abliteration. 3. Embarrassingly Simple Defense. Ребята из KAUST посмотрели на аблитерацию и сказали: окей, если refusal это один вектор, давайте дообучим Llama-2 и Qwen на extended-refusal датасете, где отказ — не сухое "I can't", а развёрнутое обоснование. AI Safety в текущей парадигме это тонкий стилистический слой поверх куда более глубокого понимания модели. Часто буквально один вектор. Пока сообщество ищет, как сделать его действительно глубоким (DeepRefusal, DOOR, extended-refusal), open-weight модели остаются хирургически расцензурируемыми за вечер на одной 3090. И это, по-хорошему, самая большая нерешённая проблема alignment-а на сегодня. 🌐The Oleg
СМИ будущего: редакция в эпоху искусственного интеллекта. Гость нового выпуска - Ольга Анисимова, исполнительный директор по внедрению технологий ИИ в редакционные процессы и руководитель дирекции производства видео медиагруппы «Россия сегодня». В разговоре — о том, как ИИ трансформирует работу современных редакций: какие процессы уже автоматизированы, как меняется роль журналиста в условиях растущего информационного потока, становится ли промпт-инжиниринг частью профессионального стандарта. Отдельный блок посвящён вопросам верификации и доверия: как изменился фактчекинг с появлением генеративных моделей, где проходит граница между ИИ-помощником и ИИ — источником ошибки, и почему сегодня важно понимать принципы работы языковых моделей. [YouTube HD] [RuTube HD] 🌐The Oleg
Скальпель вместо молотка. С появлением больших языковых моделей возник новый класс угроз — атаки на выравнивание (alignment attacks). Выравнивание — процесс, с помощью которого модель учат следовать определенным правилам, например не генерировать запрещенный законодательством контент. Соответственно, такие атаки нацелены на то, чтобы заставить модель игнорировать эти ограничения. Сюда относятся джейлбрейки (jailbreaks), то есть специально сформулированные запросы, обходящие защитные механизмы, промпт-инъекции (prompt injection), когда в текст подмешиваются скрытые инструкции, влияющие на поведение модели, а также многошаговые манипуляции, при которых модель постепенно «подводят» к нежелательному ответу. Отдельно можно выделить эксплуатацию цепочки рассуждений — попытку использовать пошаговое мышление модели, чтобы запутать ее,— и атаки через инструменты у ИИ-агентов, когда модель вынуждают неправильно использовать подключенные сервисы. Что такое доверенный искусственный интеллект и как работают атаки на нейросети — разбираемся в интервью для Коммерсанта. 🌐The Oleg
Разработали модель и набор данных для перевода надиктованных математических формул в текст Исследователи AIRI, Иннополиса, МТУСИ, НИУ ВШЭ и МГУ представили открытый датасет и модель искусственного интеллекта, благодаря которым можно преобразовать озвученные математические выражения и формулы в структурированный текст в формате LaTeX. В этой области долгое время отсутствовали качественные открытые данные для обучения ИИ-моделей, в частности, живые аудио. В новый набор данных вошло более 66 тысяч человеческих и 571 тысячи синтетических аудиозаписей, а также около 12 тысяч уникальных математических предложений и 10,7 тысяч отдельных уравнений на русском и английском языках. Разработанный датасет может также использоваться в автоматическом распознавании речи, определении языка, голосовой биометрии, защите от подделки голоса и других направлениях, где важно анализировать аудиосигнал и речевые особенности. Работу представили на конференции ICLR 2026 в Бразилии. Научная статья | ТАСС