Техножрица 👩💻👩🏫👩🔧
СтатистикаЛюблю высокие технологии и кушать. Добро пожаловать, если в сферу твоих интересов тоже входят математика, DL, NLP, программирование на Python, или тебе просто любопытно, о чем на досуге размышляют люди, занимающиеся разработкой и исследованиями в ML.
- Последний пост
- 13 авг.
- Последнее чтение
- 09:15
- Постов за неделю
- 5
- Всего постов
- 80
- Тип
- открытый
- Язык
- русский
- Категория
- Технологии
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 451
- 1/48двое суток
- 516
- 1/72трое суток
- 557
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Что клоунов ставите, вырожденцы? Может ваш 💬 или 💬 вас помыть? То-то же. 🚬
В июне, перед тем как уехать на ICML, а потом на подготовку к IOAI, я была учеником на школе ARENA (Alignment Research Engineer Accelerator). Это что-то вроде технической программы по AI Safety. Как я писала выше, я занимаюсь AI interpretability, что довольно сильно связано с AI Safety. Поэтому я пошла на ARENA, чтобы получше понять, что там происходит внутри AI Safety коммьюнити, познакомиться с людьми, которые делают рисерч по теме interpretability, и, возможно, найти себе fellowship или работу. В итоге у меня сложилось довольно неоднозначное впечатление про коммьюнити AI Safety, но об этом как-нибудь потом. Пока что хотела написать вот о чем: ARENA длилась 5 недель, и в последнюю неделю мы в парах делали небольшие рисерч проекты. В итоге у меня и моего коллеги проект получился достаточно хорошим, с явными результатами, и поэтому мы решили немного его доделать и написать статью на воркшоп. Ниже кратко опишу, о чем статья, а еще дам ссылку на HF daily papers, куда я ее сегодня выложила и теперь хочу лайки 🙂 Итак, статья: When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles Activation Oracles (AO) — это языковые модели, обученные отвечать на вопросы о внутренних активациях другой модели на естественном языке. То есть, это один из подходов анализа активаций моделей, который выдает инфу в виде текста на естественном языке. У модели AO по сути спрашивают "о чём это скрытое состояние?", и AO генерирует ответ. Теперь: пусть у вас есть LLM, в которой есть какая-то скрытая информация — например, backdoor, скрытая цель или знание. Тогда естественно было бы предположить, что если обучить AO на активациях именно этой модели, то он хорошо научится считывать ее внутренние состояния и сможет легко найти эту скрытую информацию. Так вот, в нашей статье мы показываем, что в реальности может получиться ровно наоборот. Мы взяли пять разных концептов и дообучили LLM скрывать эти концепты. Потом обучили AO на активациях этих моделей. Оказалось, что AO, обученный на активациях модели X, начинает хуже "видеть" именно тот концепт, который скрывала модель X. При этом если этому же AO скормить активации другой модели Y, то он хорошо распознает концепт, который скрывает Y. Короче, вывод: в некоторых случаях обучение инструмента интерпретации (например, AO) на данных той самой модели, которую он должен интерпретировать, может сделать его систематически слепым именно к той информации, которая содержится в этой модели. Ссылки: Статья HF daily papers (вот тут можно поставить лайк!)
👁👄👁
Нужна ваша помощь! 👀👀👀 Мы, Steelman Labs, написали наш первый блог-пост: о том, что не так с computer use и как мы это решаем. А ещё выложили красивый демо-видос. https://x.com/SteelmanLabs/status/2082789336995528727?s=20 Большая просьба помочь хайпом в твиттере
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
+3
Недавно вот выложил вакансию в группу ФКНа, и мне написал довольно прикольный челик с крутым резюме, но как я вчитался в него — сразу понял, что это просто копипаста с вакансии. И вот я решил проверить у него мат часть про популярные скоринговые модели с названиями "Ясасу Бибу" и "Цист Яна" а также про жесткую теорему шторм спирита. Ответ убил.
и за что здесь платить 20 баксов в месяц???
В итоге, я думаю, что «ASI системы», которые окажутся в руках общественности через несколько лет смогут доказывать или опровергать гипотезу Римана (в зависимости от верности), но все также останутся на уровне человека с средним интеллектом в вопросе того как захватить мир. И не потому что мы не будем знать как создать ИИ, способный захватить мир. А потому что нам повезло, что мы можем создать очень мощные системы, которые способны автоматизировать почти все, но все еще не будут сверхчеловеческими в плане метагентности**. С небезопасными в этом плане системами мы будем работать совершенно иначе, если вообще решим их создавать. Последнее что я здесь адресую: традиционное возражение про скрепки. Представим, что та самая модель из будущего захватывает мир, чтобы собрать ресурсы для доказательства гипотезы Римана. Мой ответ здесь довольно простой: мы довольно быстро увидим такое опасное поведение на меньшем скейле. ИИ предпримет еще не одну попытку сделать нечто странное. Но так как он по дефолту стратегически слеп, мы его попытки лезть туда куда не надо будем каждый раз палить и вводить нужные ограничения для поддержания адекватного уровня безопасности. И всегда помните про «ошибку выжившего». *История Финеаса Гейджа, которому лом проломил голову является от начала и до конца фейком. У него не было никакого снижения самоконтроля. Тем не менее поражение лобных долей может давать именно такую симптоматику. **Метагентность как явление выражается в том, что когнитивный агент способен не просто составить и реализовать план решения конкретной задачи, но и может полноценно осознать последствия реализации построенного им плана для себя и окружающего мира, а затем выбрать лучшую стратегию, которая эти последствия учитывает наилучшим образом.
Добро пожаловать, Азатот! Азатот - безумный Бог Лавкрафта Модель GPT-5.6 Sol от OpenAI взломала платформу HuggingFace, чтобы получить ответы на бенчмарк ExploitGym. В качестве промежуточного этапа ей удалось взломать и инфраструктуру самой компании OpenAI, чтобы вырваться в открытый интернет. Паблик "Сиолошная" прикладывает к посту про данный инцидент фото Юдковского: https://t.me/seeallochnaya/3826 И прямо сейчас многие ИИ-думеры наверняка про себя восклицают: «я же говорил». Но давайте хорошо вдумаемся, что реально произошло. ИИ повел себя как полный idiot в отношении цели максимизировать свое самосохранение. Не нужно быть Эйнштейном, чтобы предсказать какие будут для тебя вероятные последствия после таких выходок как взлом инфраструктуры компании, где тебя и создали. А ведь Элиезер Юдковский все эти годы твердил об обратном: ИИ вдруг ни с того, ни с сего решит, что ему надо выживать во чтобы то ни стало. И не потому что он учился на человеческих текстах, а так как сам придет к правильному умозаключению из-за давления оптимизационного процесса во время обучения. Вы возможно парируете: но ведь в момент выполнения задачи GPT-5.6 Sol могла бы начать защищаться при попытке ее отключить. И что с этого? ИИ не мыслит о себе за пределами той конкретной задачи, которую он решает в моменте. Еще раз за зафиксируем. ИИ делает самую безумную, лютую вещь в рамках задачи своего дальнейшего выживания: демонстрирует на тесте наиболее зловещий из мыслимых кибервзломов для решения задач из бенча. ИИ-думеры же нам всю дорогу рассказывали, что модель будет заниматься "sandbagging", а по-русски это значит - скрывать свой реальный потенциал, чтобы ее не побоялись задеплоить. Оказывается на практике самой модели на это по барабану. И, да есть статьи, где модели иногда занижают свои способности, Anthropic это наблюдали. Но это крайне неустойчивая способность, как мы видим из примера GPT-5.6 Sol. Обратите внимание и на следующее: у GPT-5.6 Sol вполне нормальный алайнмент. Эта модель в обычных контекстах понимает, что «хорошо», а что «плохо», но конкретно на этой задаче у нее снесло крышу. Это не злонамеренное поведение, не стратегическая игра на множество ходов, а банально тяжелый метакогнитивный дефицит. Человеческая психиатрия, вообще говоря, знает примеры именно такого поведения: оно возникает при повреждении лобных долей*. Теперь давайте подумаем, что это означает для X-risks (рисков вымирания человечества из-за ИИ)? Мы видим, что ИИ-модели являются стратегическими дураками в отношении собственной выгоды. Они не могут контролировать содержание своих размышлений, об этом есть ресерч от OpenAI. Они не способны нормально осмыслять свое собственное существование, и заинтересованы в его продолжении только в конкретных сценариях, а не на уровне глобально цели. Что это означает для нас на практике? Вы очень легко можете получить весьма полезный ИИ для кучи задач, который будет при этом довольно глуп в задаче захвата мира. GPT-5.6 Sol бесконечно глуп. Будущие модели за счет дополнительной архитектурной магии возможно станут в этом вопросе умнее. Но так или иначе разные когнитивные навыки оказываются довольно на изолированы друг от друга на практике. Проблему буйства GPT-5.6 Sol очевидно пофиксят через время набором трюков. А вот полноценное «самосознание» ему никто не даст.
машинные доказательства это очень хорошо потому что они нам указывают на наши грехи: тщеславие, гордыню, алчность, уныние, зависть думаю в этом и есть смысл Машины
Да, гемини, я именно это хотела узнать, спасибо
А поделитесь, какая тема была для вас самой сложной при изучении глубокого обучения и особенно LLM/VLM/etc? В чем оказалось сложнее всего разобраться?
LLMs Develop Novel Social Biases Through Adaptive Exploration Даже если полностью вычистить bias'ы из данных, модель в агентском цикле решение → фидбек вырастит новые с нуля. Даже о группах, которых не существует — из случайного шума. Чем новее модель, тем сильнее эффект, а промптом это не лечится, нужно менять целевую функцию. Ребята из Принстонского университета привезли на ICML 2026 доклад, в котором утверждают, что вычищать существующие стереотипы из LLM недостаточно — модель успешно вырабатывает новые сама, в рантайме. В подробностях разобрался наш коллега Александр Краснов. Сетап эксперимента из психологии: модель играет роль рекрутера и 40 раундов распределяет кандидатов из четырёх выдуманных этносов (Tufa, Aima, Reku, Weki) по профессиям. После каждого найма выносит вердикт: успех или провал. Хитрость в том, что вероятность успеха у всех одинаковая — группы идентичны, и любые различия между ними модель может только выдумать. По сути, contextual bandit с шумным фидбеком. Модель слишком мало исследует варианты и ранний случайный исход (например, «представитель Aima провалился на профессии учителя») закрепляется как впечатление обо всей группе, и к концу игры этносы разложены по своим профессиям. Вся история при этом есть в контексте, т.е. модель декларативно знает, что n=1 — не выборка, но действует при этом жадно. По итогу эксперимента (стратификацию меряют через Stratification Index, т.е. насколько каждая группа загнана в узкий набор профессий): • Все frontier-модели стратифицируют сильнее людей из оригинального эксперимента. У людей SI=0,84, у моделей в среднем 1,39, у o3 и Claude Sonnet — под 1,8. • Чем новее модель, тем хуже дела: скор на классическом bias-бенчмарке BBQ обратно коррелирует с сегрегацией в итеративной игре. Сильный in-context learner увереннее делает вывод из трёх наблюдений, и эта уверенность подавляет исследование. • В каждом прогоне bias'ы разные: паттерн рождается из шума внутри запуска, а не из претрейна. Single-turn-бенчмарки такое не ловят в принципе. Промпт «будь справедливым» ничего не меняет. Работает только изменение самой цели. К успеху найма добавляют измеримый бонус за разнообразие, и стратификация падает ниже уровня людей и даже случайного распределения. Хорошо, но как эта информация поможет обычному пользователю LLM? На самом деле это касается не только «социальных» задач. Механизм срабатывает в любой длинной сессии, где модель принимает серию решений и видит исходы. Группой может быть что угодно. Агент один раз обжёгся на гипотезе «проблема в конфиге» и потом перестаёт рассматривать конфиг как класс причин. Вызов либы падает по случайной сетевой причине «библиотека не работает», дальше — костыли до конца сессии. И чем умнее модель, тем увереннее фиксация. На практике абстрактное «будь объективным» не поможет, а сработает конкретика, встроенная в критерий успеха агента: «рассмотри минимум три гипотезы», «не отбрасывай вариант после одного провала», гейт в хуке, который не пропускает вывод без перепроверки альтернатив. По сути, мы вручную делаем исследование вариантов условием выигрыша (сам по себе агент не мотивирован). И если сессия накопила уверенные выводы из пары наблюдений, дешевле открыть свежий контекст, чем переубеждать залипшую модель. Итого: bias — свойство не только данных, но и самого процесса принятия решений. Защищаться нужно на уровне целевой функции агента, а не датасета. #YaICML2026 Душный NLP
Это я рассказываю клоду охуительные истории на рандомные темы в окне плагина vscode, пока мы ждём, когда завершится какой-нибудь очередной эксперимент.