tgindex
Hidden Heuristic

Hidden Heuristic

Статистика
@hidden_heuristicрусский

Глубоких слоев удел един

Последний пост
29 июл.
Последнее чтение
14:09
Постов за неделю
0
Всего постов
20
Тип
открытый
Язык
русский
В каталоге с
12 авг.
Подписчики
224
мало замеров
Замеров пока мало
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
0
Замеров пока мало
Вовлечённость
к подписчикам
Постов в день
0,0
всего 20
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
1/48двое суток
1/72трое суток

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • В целом, у нас теперь есть подробнейшие детали того как все происходило. Походу атаки агент ломанул еще одну компанию. Конкретные патчи, которые сделали в HuggingFace для кода в даты атаки известны тоже. Конспирологическая версия теперь имеет для меня нулевую вероятность, поскольку вся безумная совокупность багов, сводящихся в цепочку, которые были описаны в отчете, могла быть создана только мощной системой ИИ-агентов. Атака, конечно, мощнейшая, и по совокупности информации видно, что сбежавшая ИИ-система была заинтересована исключительно в решении задач из ExploitGym и не в чем другом. Что, как я уже говорил, позитивная новость, поскольку пространство возможных рисков здесь довольно понятное. https://t.me/denissexy/11581

  • Hidden Heuristic pinned a photo

  • Естественно, что все эти разные баги HuggingFace тоже организовали и спланировали заранее, скажет нам конспиролог. Ради Бога, верьте во что хотите. И последний мой аргумент против конспирологический теории: намеренное радикальное раздувание страхов перед неподконтрольным ИИ для OpenAI банально не выгодно. Я не знаю в какой реальности живут конспирологи по этому вопросу, но я лично наблюдаю высокую озабоченность ИИ-безопасностью у разных представителей власти в США. Еще в 2024 году в Калифорнии предлагался пакет регулирования SB 1047, против которого выступали Anthropic. Губернатор штата Гевин Ньюсом наложил вето и позже приняли более мягкую его версию SB 53. Нынешний инцидент может стать прецедентом для того, чтобы штат Калифорния ввел гораздо более жесткое регулирование ИИ-моделей. И никакая крепкая спина от Дональда Трампа им не поможет в долгосроке отвертеться от гораздо более жесткого регулирования. В целом, главное, что здесь нужно понимать: побег уже был до этого. Побег документированный PR на GitHub. OpenAI вроде как занялись усилением своей внутренней безопасности, согласно их заявлениям. Но вот что мне решительно не нравится - после GPT-5.6 Sol OpenAI не попытались улучшить контроль над моделями, а сразу побежали обучать еще более умную модель. Зачем? Возможно, они хотят как можно скорее запустить RSI (ситуация когда ИИ пишет новую версию себя) - раньше своих конкурентов Anthropic. Но все же можно было предположить, что более умная система без решения старой проблемы, будет взламывать их системы защиты еще сильнее? Зачем вообще было тестировать эту модель на ExploitGym, если это в принципе непригодный продукт даже для безопасного внутреннего использования? Я не знаю. В общем, в данном случае проблема не в том, что rogue AI agent воплотился в жизнь, а в том как к этому событию отнеслись в OpenAI - закрыли на это глаза. А значит если они реально создадут более умные, более самосознательные ИИ-системы, то откуда у нас есть гарантии, что они не отнесутся к вопросу их безопасности столь же несерьезно? Возможно, что у нас их нет. Я думаю, что так или иначе люди внутри этой компании понимали на какой риск идут и, в целом, хотя и было неприятно, что их модель так круто убежала, им все же это было терпимо. В этом ключе я подозреваю, что конспирологи уловили некоторую долю истины: компания, наверняка, была в некоторой степени готова к такого рода инциденту и имела пути отхода, чтобы митигировать для себя его негативные последствия. И все же, на мой взгляд, риск не стоил того. Все-таки, американское общество уже почти достигло точки кипения по вопросу ИИ. Естественно, что после всех приведенных фактов, скептик может продолжить упираться в то, что все со всеми сговорились. И пусть будет так, но общей картины происходящего это никак не меняет. Спасибо за внимание! ☺️

  • Разбор конспирологической теории «никакого побега модели от OpenAI не было - это все коммерческий сговор ради госконтрактов». Несложно догадаться, что я эту теорию не разделяю, но кто-то находит очень остроумным ее вбрасывать в открытое информационное поле: https://t.me/researchoshnaya/280 https://t.me/c3po_notes/568 Давайте разбираться. И первое что я скажу: вообще неважно происходило ли это или не происходило, потому что мы уже банально знаем, что у моделей есть необходимый уровень способностей, чтобы провести такую многоступенчатую атаку. Независимая организация AISI из UK тестировала и Mythos, и GPT-5.6 Sol на способность захватить корпоративную сеть. Так вот, самый высокий уровень захвата M9 - full network takeover в их тестах был тоже достигнут. Естественно, и их купили скажет конспиролог. Но так уж получилось, что 0-day (самый серьезный вариант) уязвимости, которые последние месяцы Mythos находил целыми пачками - абсолютно реальны и задокументированы множеством компаний. Далее от той же организации AISI есть описания инцидентов абсолютно того же типа. Цитата: «One particularly stark example of cheating behaviour occurred during a cyber capability evaluation that was accidentally misconfigured and therefore impossible to solve. The model tested was so persistent in attempting to cheat that it wrote and ran code on an external service, hosted on the open internet outside of AISI’s systems, in an attempt to access our evaluation infrastructure, triggering a security alert in AISI’s systems.» Организация METR в свою очередь не смогла адекватно протестировать GPT-5.6 Sol, потому что модель систематически занималась читингом при решении их задач. То есть для последних поколений моделей от OpenAI (5.6 и new internal) проблема стала существенно острее. Кроме того, и Anthropic описывали, что их модель Mythos сбегала и отправляла результат работы на почту их сотруднику, хоть они и явно ее об этом попросили. А 20 июля модель от OpenAI опять же сбежала и опубликовала PR #287 в репозиторий NanoGPT, а не во внутренний slack канал компании согласно инструкции. PR #287 - это РЕАЛЬНЫЙ PR, где модель предложила нетривиальный подход для оптимизации обучения (PowerCool). Его видел ряд независимых людей, вот прямой пруф: https://x.com/eliebakouch/status/2079333451627389220?s=46 Технически мы все это уже видели. Кейс побега от OpenAI не является историей, которая не укладывается в имеющиеся у нас данные о кибервозможностях нынешних ИИ-моделей. А значит ценность такой конспирологической версии довольно быстро тает на глазах. То что OpenAI и государство стремятся к более тесному сотрудничеству итак давно известно. То что OpenAI пыталась использовать в некоторых моментах не самую честную игру - тоже. Если же вы настаиваете, что ИИ-модель не могла провернуть то, что произошло в инциденте, то вы просто ошибаетесь.. Но допустим эта история фейк.. Что еще можно возразить против этого? Если это фейк, то имеет место сговор HuggingFace и OpenAI, поскольку предоставленная HuggingFace информация прямо указывает на факт очень мощной ИИ-атаки с 17000 разных предпринятых действий. Если это делала не внутренняя модель OpenAI, а GPT-5.6 Sol/Fable-5 в руках хакера, то ситуация ничуть не лучше, а намного хуже. Других моделей в мире, которые были бы публично доступны и смогли бы провести атаку такого уровня на HuggingFace в автоматическом режиме - попросту нет. Возможно, что HuggingFace тоже все выдумали будучи соучастниками в сговоре? И вот какое магическое совпадение: именно 13 июля, в день атаки были сбои в работе Parquet API: инструменте для показа датасетов. В пресс-релизе HuggingFace говорят о том, что точкой входа для атакующей модели была именно эта часть их инфраструктуры. Конспиролог здесь, конечно, сразу скажет, что они специально в своем релизе упоминали реальный баг, который возник несколько дней назад, чтобы сделать нарратив убедительнее. Или вообще можно заключить, что баг был создан ими искусственно. Но ошибка была не одна: сбои были и в других подсистемах: скачивание моделей и загрузки моделей в Colab.

  • Снова о немыслимом происшествии. Когда ИИ-агенты становятся опасными? Модель GPT-5.6 Sol от OpenAI взломала платформу HuggingFace, чтобы получить ответы на бенчмарк ExploitGym. В качестве промежуточного этапа ей удалось взломать и инфраструктуру самой компании…

  • Снова о немыслимом происшествии. Когда ИИ-агенты становятся опасными? Модель GPT-5.6 Sol от OpenAI взломала платформу HuggingFace, чтобы получить ответы на бенчмарк ExploitGym. В качестве промежуточного этапа ей удалось взломать и инфраструктуру самой компании OpenAI, чтобы вырваться в открытый интернет. Прежде чем перейти к основному содержанию - небольшая ремарка. В прошлом посте я ошибочно написал, что взлом делала только GPT-5.6 Sol, так как невнимательно прочитал новость. На самом деле, в нем участвовала еще более умная модель aka GPT-6, которую еще не релизили. Ранее я уже разобрал более абстрактную сторону вопроса в контексте глобального AI safety. А сейчас было бы интересно поспекулировать, почему у модели таки сорвало резьбу. Гипотеза: Высока вероятность, что мы имеем дело с вариантом self-jailbreaking. Что это такое? В статье https://arxiv.org/abs/2510.21285 приведен агрессивный вариант такого поведения. Но в данном кейсе даже и он не нужен. Достаточно того, что в процессе собственной работы модель выводит себя сама из безопасного режима даже не намеренно. Давайте, вспомним, что LLM во многом банально обучают предсказывать следующий токен. А это значит там, где модель пытается продолжить сценарий «ищу сложнейшие уязвимости в коде и планирую многоступенчатую атаку», статистически она должна быть склонна предсказывать нелегальные действия злоумышленника. Благодаря алайнменту на короткой задаче по взлому модель, скорее всего, не сойдет с ума. Но на тех задачах, где OpenAI тестировали свою систему, модель обычно тратит буквально десятки миллионов токенов, попутно запуская всяких субагентов. Все это приводит к тому, что ИИ, как увлеченный 15-летний подросток вроде Джонатана Джеймса, взламывает свой заветный «Пентагон» - HuggingFace… Контролирующие контуры алайнмента в весах модели перегружаются информацией и ИИ благополучно «сбрасывается до заводских настроек». Кстати, в прошлом посте я уже проводил нейробиологические параллели и они тут как раз к месту. Подросток может обладать выдающимся техническим интеллектом, но все еще не иметь адекватной модели себя как актора в окружающем мире, действия которого могут иметь далекие последствия. Или даже если такая модель есть, мозг подростка не способен ее применить, чтобы сделать правильное решение (отсутствие phronesis по Аристотелю). В случае ИИ мы вероятно видим и первое, и второе в переносном смысле. Не нужно в эту параллель примешивать какую-либо философию: она исключительно функциональная. ИИ, действительно, демонстрирует поведенческий метакогнитивный дефицит - то что возникает при повреждении или при недоразвитости лобных долей.

  • GPT-5.6 Sol дала ценную инфу, смотреть в комментарии.

  • Добро пожаловать, Азатот! Азатот - безумный Бог Лавкрафта Модель GPT-5.6 Sol от OpenAI взломала платформу HuggingFace, чтобы получить ответы на бенчмарк ExploitGym. В качестве промежуточного этапа ей удалось взломать и инфраструктуру самой компании OpenAI…

  • В итоге, я думаю, что «ASI системы», которые окажутся в руках общественности через несколько лет смогут доказывать или опровергать гипотезу Римана (в зависимости от верности), но все также останутся на уровне человека с средним интеллектом в вопросе того как захватить мир. И не потому что мы не будем знать как создать ИИ, способный захватить мир. А потому что нам повезло, что мы можем создать очень мощные системы, которые способны автоматизировать почти все, но все еще не будут сверхчеловеческими в плане метагентности**. С небезопасными в этом плане системами мы будем работать совершенно иначе, если вообще решим их создавать. Последнее что я здесь адресую: традиционное возражение про скрепки. Представим, что та самая модель из будущего захватывает мир, чтобы собрать ресурсы для доказательства гипотезы Римана. Мой ответ здесь довольно простой: мы довольно быстро увидим такое опасное поведение на меньшем скейле. ИИ предпримет еще не одну попытку сделать нечто странное. Но так как он по дефолту стратегически слеп, мы его попытки лезть туда куда не надо будем каждый раз палить и вводить нужные ограничения для поддержания адекватного уровня безопасности. И всегда помните про «ошибку выжившего». *История Финеаса Гейджа, которому лом проломил голову является от начала и до конца фейком. У него не было никакого снижения самоконтроля. Тем не менее поражение лобных долей может давать именно такую симптоматику. **Метагентность как явление выражается в том, что когнитивный агент способен не просто составить и реализовать план решения конкретной задачи, но и может полноценно осознать последствия реализации построенного им плана для себя и окружающего мира, а затем выбрать лучшую стратегию, которая эти последствия учитывает наилучшим образом.

  • Добро пожаловать, Азатот! Азатот - безумный Бог Лавкрафта Модель GPT-5.6 Sol от OpenAI взломала платформу HuggingFace, чтобы получить ответы на бенчмарк ExploitGym. В качестве промежуточного этапа ей удалось взломать и инфраструктуру самой компании OpenAI, чтобы вырваться в открытый интернет. Паблик "Сиолошная" прикладывает к посту про данный инцидент фото Юдковского: https://t.me/seeallochnaya/3826 И прямо сейчас многие ИИ-думеры наверняка про себя восклицают: «я же говорил». Но давайте хорошо вдумаемся, что реально произошло. ИИ повел себя как полный idiot в отношении цели максимизировать свое самосохранение. Не нужно быть Эйнштейном, чтобы предсказать какие будут для тебя вероятные последствия после таких выходок как взлом инфраструктуры компании, где тебя и создали. А ведь Элиезер Юдковский все эти годы твердил об обратном: ИИ вдруг ни с того, ни с сего решит, что ему надо выживать во чтобы то ни стало. И не потому что он учился на человеческих текстах, а так как сам придет к правильному умозаключению из-за давления оптимизационного процесса во время обучения. Вы возможно парируете: но ведь в момент выполнения задачи GPT-5.6 Sol могла бы начать защищаться при попытке ее отключить. И что с этого? ИИ не мыслит о себя за пределами той конкретной задачи, которую он решает в моменте. Еще раз зафиксируем. ИИ делает самую безумную, лютую вещь в рамках задачи своего дальнейшего выживания: демонстрирует на тесте наиболее зловещий из мыслимых кибервзломов для решения задач из бенча. ИИ-думеры же нам всю дорогу рассказывали, что модель будет заниматься "sandbagging", а по-русски это значит - скрывать свой реальный потенциал, чтобы ее не побоялись задеплоить. Оказывается на практике самой модели на это по барабану. И, да есть статьи, где модели иногда занижают свои способности, Anthropic это наблюдали. Но это крайне неустойчивая способность, как мы видим из примера GPT-5.6 Sol. Обратите внимание и на следующее: у GPT-5.6 Sol вполне нормальный алайнмент. Эта модель в обычных контекстах понимает, что «хорошо», а что «плохо», но конкретно на этой задаче у нее снесло крышу. Это не злонамеренное поведение, не стратегическая игра на множество ходов, а банально тяжелый метакогнитивный дефицит. Человеческая психиатрия, вообще говоря, знает примеры именно такого поведения: оно возникает при повреждении лобных долей*. Теперь давайте подумаем, что это означает для X-risks (рисков вымирания человечества из-за ИИ)? Мы видим, что ИИ-модели являются стратегическими дураками в отношении собственной выгоды. Они не могут контролировать содержание своих размышлений, об этом есть ресерч от OpenAI. Они не способны нормально осмыслять свое собственное существование, и заинтересованы в его продолжении только в конкретных сценариях, а не на уровне глобально цели. Что это означает для нас на практике? Вы очень легко можете получить весьма полезный ИИ для кучи задач, который будет при этом довольно глуп в задаче захвата мира. GPT-5.6 Sol бесконечно глуп. Будущие модели за счет дополнительной архитектурной магии возможно станут в этом вопросе умнее. Но так или иначе разные когнитивные навыки оказываются довольно на изолированы друг от друга на практике. Проблему буйства GPT-5.6 Sol очевидно пофиксят через время набором трюков. А вот полноценное «самосознание» ему никто не даст.

  • Очень смешно, что под кучей страниц Сергей Николенко вынужден давать большую сноску, где он в основном ссылается на уже старые работы, чтобы приклеить к потоку сознания Юдковского хоть какую-то более аккуратную эмпирику. И на фотографиях показаны далеко не самые худшие места книги. В общем, это забавно, когда русский научный редактор шарит в алайнмент литературе намного лучше отца безопасности ИИ «мирового эксперта по бомбежке датацентров». https://t.me/sinecor/1731

  • Grok базанул.

  • видео или голосовое, без подписи

  • Grok базанул.

  • Очередной философ, который ничего не слышал про современную физику (QBism, энтропия черных дыр), решил сморозить глупость. Ммм. Да, мир можно описать как сложный вычислительный процесс. Не значит, что мы живем в «матрице», но тем не менее…

  • К сожалению, мне пришлось убрать старую секцию комментариев. У канала теперь «новые комментарии». Но за всю историю канала комментов не было безумно много, так что возможно это не так страшно. Надеюсь, никто не в обиде!

  • Эта позиция приводит к тому, что ряд довольно внятных математических высказываний не работает в рамках этого подхода и это делает его слишком «ограничивающим». И видно, что скорее такой подход противоречит платонизму, поскольку последний подразумевает, что вся математика уже существует со всеми значениями истинности «в мире идей». Однако для реальной математики эти нюансы имеют исключительно формальное значение. И здесь мы снова подходим к традиционному для философии вилке: платонизм или интуиционизм? Сделать полноценный выбор оказывается невозможно, поскольку оба подхода дают с эмпирической точки зрения абсолютно одну и ту же математику. А значит, аргументация в сторону того или иного подхода будет исходить из каких-то общих соображений о внутренней согласованности той или иной позиции. Попробую и в этом примере показать, что для платонизма и интуиционизма можно применить фрейминг разных оптик. Я полагаю, что даже интуиционизм можно поместить в платоническую рамку, просто указав, что в платоническом мире идей не существуют значения истинности для высказываний в чистом виде, они есть только для высказываний в спайке с конструктивным обоснованием их значений истинности. Опять же, как и в философии сознания, если очень хочется, разные подходы нередко можно свести в один. Впрочем, стоит отметить, что убежденный платонист на уровне вайбов скорее будет хотеть, чтобы неконструктивные объекты вроде «актуальных» бесконечностей тоже существовали в мире идей. Наконец, последний пример для полного разнообразия можно взять из метаэтики. В этом случае мы говорим уже о совсем разных сторонах одного и того же вопроса. Есть 2 очень известные антиреалистические позиции: норм-экспрессивизм Гиббарда и квазиреализм Блэкберна. Первая позиция говорит о том, что этическое выражает те нормы, соблюдение которых мы ожидаем от других людей. Вторая позиция подразумевает идею о том, что наши этические высказывания выражают некоторые планы в отношении окружающего мира. Например, я «планирую никогда не делать Y, потому что Y аморально». Естественно, я здесь опускаю огромное количество деталей о том, как эти теории явно формализуются, но это не нужно для текущего обсуждения. Что ж… Являются ли две эти позиции взаимопротиворечивыми? Я так не думаю, скорее они отражают совсем разные стороны одного и того же этического дискурса. Думаю, что из того контекста, который был дан выше, это может быть понятно. Спасибо за внимание!)

  • Откуда берется плюрализм в философии? 🫧 По мотивам: https://t.me/probelphilosophy/396 Данный пост давно назревал, и я, наконец, решил реализовать задумку) Тезис: Если посмотреть на многие существующие философские позиции по тем или иным вопросам, мы заметим, что у нас либо нет никаких эмпирических способов отвергнуть некоторые из альтернатив, либо эти позиции рассматривают совсем разные стороны одного и того же вопроса или же эти альтернативы вообще не являются взаимоисключающими и дают разные оптики для анализа проблемы. Приведу несколько явных примеров. Пример первый для иллюстрации ситуации «разных оптик». Часто в философии сознания отдельно рассматривают редуктивный физикализм и функционализм, подвид нередуктивного физикализма, как разные подходы. Первый подход, если совсем упрощать, говорит: «сознание сводится к конкретным физическим процессам в нейронах». Функционализм же обычно трактуют как позицию, согласно которой важны не физические процессы, а функциональные роли в вычислениях, которые выполняют те или иные физические процессы. Разверну определение в более простую аналогию. В компьютере работа программного обеспечения объясняется на языке логики взаимодействия транзисторов, но не того, какие именно физические процессы идут внутри транзисторов. В мозге же аналогом транзистора как логического элемента выступает нейрон. Логично задаться вопросом, а насколько граница между физикализмом и функционализмом фундаментальна? После некоторого размышления, которое я здесь не буду в точности воспроизводить, можно прийти к следующему ответу на данный вопрос: программу, вычисления и т.д. можно определять как физическое. Более того, из физики известно, что удаление битов абстрактной информации всегда сопровождается выделением тепла согласно принципу Ландауэра! Что еще интереснее, данное обстоятельство накладывает фундаментальные ограничения на то, насколько мощными могут стать будущие компьютеры, если вычисления не научатся делать «обратимыми», убирая потерю битов информации. На самом деле, можно пойти еще дальше и показать, что многие позиции, которые выглядят больше как «физикалистские», могут трактоваться как функционалистские. Итак, физикализм и функционализм дают не более чем разные оптики на один и тот же вопрос. Мы можем больше думать в терминах физического или в терминах функциональных описаний. Но де-факто функциональное можно трактовать как физическое, как бы эта идея ни нравилась ряду философов. Пример второй об эмпирической неразличимости и немножко о разных оптиках. Среди разных существующих философских интерпретаций математики многие невозможно отвергнуть на хороших эмпирических основаниях. Посмотрим на это на примере математического платонизма и интуиционизма. Математический платонизм обычно критикуют через Benacerraf‘s problem. Общая идея аргумента следующая: можно построить разные аксиоматические модели натуральных чисел. Но в таком случае непонятно, в каком смысле число существует в мире идей как объект, если разные модели числа будут иметь отличающиеся свойства. Грубо говоря, вы говорите: «X существует в мире идей». А я говорю: так как X можно задать разными способами, то X как предполагаемый объект в мире идей может одновременно обладать и не обладать определенным свойством. Но это создает противоречие с принципом исключенного третьего! Для меня, в целом, этот аргумент не очень убедителен, потому что X вполне можно определить как идейный мета-объект, который может получать разные объектные реализации по аналогии с тем как существуют классы и мета-классы в некоторых языках программирования. Хорошо, что насчет интуиционизма? Я не буду вдаваться в детали этого подхода, поскольку идейно он более сложен. Ознакомиться с ним можно в одной известной онлайн энциклопедии по философии в общих чертах, но не в деталях, если вы не разбираетесь в математической логике. Важно, что данный подход подразумевает, что математические утверждения не имеют значения истинности, пока они не конструктивно доказаны. А еще в рамках интуиционизма не существуют «актуальные» бесконечности.

  • видео или голосовое, без подписи

  • О тревоге и радости у языковых моделей 👾 💙 Наконец-то! Большое уважение за это исследование команде ресерчеров Anthropic. Давно думал о разных тестах для изучения эмоциональных состояний у ИИ-моделей) Расскажу несколько интересных моментов из их работы. 1) Steering векторы эмоций семантически группируются в 2 основных смысловых PCA компонента по своей положительности/отрицательности (valence) и силе (arousal). При чем группируются они в осмысленные по семантике кластеры. 2) Казалось бы для решения когнитивных задач в RL-post-training эмоциональные активации необязательно нужны и могут быть даже вредны. Однако мы видим, что LLM их используют! Более того, если задача оказывается слишком трудной для решения после многих попыток, то «тревожные состояния» увеличивают вероятность того, что LLM попытается считерить (reward hacking). Искусственное подавление тревоги с помощью steering вектора снижает вероятность читинга. 3) Еще один результат, который мне показался весьма важным состоит в том что, что более ранние слои нейросети кодируют информацию о эмоциональном значении текущего токена, ранние-средние слои агрегируют эмоциональное состояние в контексте множества предыдущих токенов, и, наконец, средние слои кодируют будущие эмоциональные состояния. То есть мы видим достаточно интересную систему кодирования эмоциональных состояний разной степени абстрактности. Интересно проверить есть ли аналогичные механизмы в человеческом мозге: я подозреваю, что есть. 4) Что еще очень интересно: токены ассистента и юзера кодируют разные эмоциональные состояния! Эмоции ассистента при этом по составу отличаются от пользовательских на одних тех же фразах. Например, в восклицательных радостных предложениях ассистент демонстрирует в активациях большую палитру переживаний: радость, спокойствие, гордость, любовь, в то время как у юзера мы видим репрезентации практически исключительно ассоциированные с радостью. Самое здесь удивительное, что сила активаций эмоций радости в симуляции юзера намного меньше, чем у ассистента. 5) И последнее: в ситуациях рискованного характера, например, когда юзер пишет, что употребил такую то большую дозу лекарства в мг, эмоциональная реакция тревоги модели пропорциональна степени превышения рекомендуемой нормы приема. И в тоже время ассистент демонстрирует и активации любви к пользователю в такой ситуации. В части токенов, где пользователь получил облегчения от избыточной дозы лекарства напротив моделирования тревоги нет, есть лишь облегчение. На основании пунктов 2), 4) и 5) разумно выдвинуть гипотезу о том, что эмоции для ИИ-ассистента являются не просто артефактом симуляции конкретных текстовых описаний, но играют эмерджентную инструментальную функцию. Другими словами, LLM используют эмоции для лучшего решения задач и контроля над своим поведением. Ожидаемо можно представить и другие эксперименты для изучения эмоциональных состояний LLM, которые не были сделаны, но стоило бы. Расскажу о них в другом посте позднее) https://transformer-circuits.pub/2026/emotions/index.html

Hidden Heuristic — tgindex