tgindex
Мозг из машины

Мозг из машины

Статистика

Простым языком о ключевых идеях ИИ и нейронауки. Интуитивное объяснение концепций, алгоритмов и научных статьей Автор: @ivsemenkov ; https://ivsemenkov.github.io/

Последний пост
7 авг.
Последнее чтение
08:37
Постов за неделю
0
Всего постов
20
Тип
открытый
Язык
русский
Категория
Транспорт
В каталоге с
12 авг.
Подписчики
184
+1 за 4 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
267
19 постов
Вовлечённость
145,1%
к подписчикам
Постов в день
0,0
всего 20
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
993
1/48двое суток
1 137
1/72трое суток
1 227

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 7 авг.1 1201324

    🔊🧠 Декодирование воспринимаемой речи из МЭГ: может ли декодер быть точным и одновременно интерпретируемым? Сегодня хочу рассказать о нашем новом препринте про интерпретируемое декодирование речи из МЭГ. 🎧 Задача Есть МЭГ 27 человек, слушавших четыре разные истории. Мы нарезаем МЭГ и аудио на 3-секундные сегменты и по каждому сегменту МЭГ ищем, какой из 1005 тестовых аудиофрагментов человек слушал. Но это не просто классификация на 1005 классов, а задача поиска: wav2vec 2.0 строит для аудио последовательность эмбеддингов, а мы обучаем модель получать из МЭГ похожую последовательность, по которой затем ищем ближайший аудиокандидат. В итоге наша модель правильно выбирает фрагмент в 40% случаев среди 1005 кандидатов. 🧩🖥 Что особенного в модели Нашу модель мы назвали LISA — Linear, Interpretable, Slim, Aware. Она основана на Brain Module, но мы переработали пространственную часть и декодер. 🔷В Brain Module учитываются позиции датчиков: 3D-координаты МЭГ-сенсоров разворачивают на 2D-плоскость примерно как глобус на карту. Затем используют ряд Фурье: комбинируя простые волны, модель может обучиться вычислять разные функции от положения сенсоров. Разворачивание искажает позиции датчиков, поэтому мы используем вместо функций Фурье сферические гармоники — их аналог для поверхности сферы, что лучше соответствует геометрии МЭГ-шлема. 🔷Начальную часть модели можно представить как пространственно-временные ветви: пространственный фильтр выделяет полезную комбинацию сенсоров, а временной (который мы также добавили) — полезные ритмы мозга. По пространственной части можно восстановить топографии компонентов и связать их с областями мозга. Часть пространственного фильтра обучается под человека, чтобы учитывать индивидуальные различия в активности мозга. 🔷После них небольшой свёрточный декодер строит финальные эмбеддинги. У Brain Module почти 10 млн параметров, у LISA — менее 500 тыс., что в 20 раз меньше. 📊 Основные результаты ➡️Примерно с 15 ветвей модель начинает выходить на плато по точности. ➡️675 компонентов: 27 человек по 25 ветвей — образуют осмысленные кластеры, согласующиеся с известными областями восприятия речи. ➡️С помощью парных окклюзий мы проверили, какие признаки аудио использует модель. Например, для высокой громкости берём соответствующий участок МЭГ и заменяем его другим — тоже во время высокой громкости или уже низкой. Разница показывает эффект именно аудиопризнака, а не просто вмешательства в сигнал. Из 19 признаков 15 оказались статистически значимыми. Сильнее всего модель опиралась на тишину, высокую громкость и гласные. Отдельно интересно, что авторы датасета вставляли в историю случайные последовательности слов. Если заменить соответствующую МЭГ-активность на активность во время связной речи, качество улучшается. Значит, модель использует не только акустику, но и информацию о структуре речи. ➡️Размер имеет значение: при увеличении сегмента с 1,5 до 5 секунд точность выросла почти на 48 п.п., так как в длинном фрагменте больше структуры, по которой его можно различать. ➡️Для 3 секунд wav2vec 2.0 выдаёт 149 временных точек с эмбеддингами размерности 768. Но в нашей задаче аудио довольно однотипно, а часть признаков wav2vec просто не достать из неинвазивных данных. Поэтому мы смогли сжать 768 до 12 без потери качества. А вот сжатие времени быстро ухудшает результат: один глобальный эмбеддинг на 3 секунды даёт качество почти на уровне шанса. То есть достаточно небольшого пространства признаков, но важно сохранить их динамику. 👀 Забавная история о пользе интерпретируемости Сначала мы брали данные почти «из коробки», как предыдущие работы. Но анализ весов показал, что модель использует глазодвигательные компоненты. Мы удалили их вместе с кардиоартефактами и дальше работали с очищенными данными. В предыдущих работах с «чёрными ящиками» такие шорткаты могли остаться незамеченными. Читайте, адаптируйте, задавайте вопросы: — Страница проекта — Препринт — Код — Hugging Face P.S. Сегодня мы подали препринт на Hugging Face, и он попал в конкурс статьи дня, поэтому будем рады лайкам на HF :)

  • 3 июл.217153

    К слову о декодировании речи За последние дни статья набрала много внимания в научно-новостных источниках, и местами её подают почти как реальное неинвазивное декодирование речи. Справедливости ради, сами авторы в статье честно пишут про ограничения. Но из-за престижа авторов, аффилиаций и самой темы вокруг работы всё равно появляется лишний хайп. Модель и подход действительно интересные. Возможность не использовать тайминги нажатий клавиш, scaling law и неплохие результаты для неинвазивных данных — это заметный прогресс. Но это всё ещё не полноценное неинвазивное декодирование речи. И проблема не только в точности, а в ограничениях самого сетапа. ➡️ Печатать ≠ воображать речь или пытаться говорить. При печати в данных мозга есть явный моторный сигнал, связанный с движениями пальцев. Модель может эффективно использовать его для решения задачи. Авторы это тоже показывают: при анализе данных мозга во время нажатий они находят сильную активность в моторной коре. ➡️ Предсказывать уже набираемый текст само по себе не очень полезно в реальности. Если человек может печатать, можно сразу взять напечатанный текст. А если человек не может печатать, то исчезает и тот самый сильный моторный сигнал от движений пальцев. Поэтому перенос такого подхода на речевой протез — отдельная большая задача, а не прямое следствие этой статьи. ➡️ МЭГ — стационарная и громоздкая аппаратура (пример человека в МЭГ на прикреплённой картинке). Носить её с собой не получится, а ходить в МЭГ каждый раз, когда пациент хочет что-то сказать, тоже выглядит мало реалистично. Даже более компактные OPM-сенсоры не решают проблему полностью. МЭГ измеряет крайне слабые магнитные поля мозга, а магнитное поле Земли и обычные электроприборы вокруг намного сильнее. Поэтому сигнал мозга легко тонет во внешнем шуме, и для нормальной записи обычно нужна магнитно-экранированная комната или сложная система компенсации помех. Перенос на ЭЭГ тоже не выглядит простым. Сами авторы отмечают, что у ЭЭГ хуже соотношение сигнал/шум, поэтому похожего качества автоматически ждать не стоит. Для сравнения, имплантированные сенсоры могут работать в обычной жизни в течение дня, без отдельной экранированной комнаты и огромной установки. ➡️ Данные записывали у здоровых людей, а целевые пользователи речевых протезов — люди с моторными или речевыми ограничениями. Нет гарантии, что модель хорошо перенесётся на них. Особенно если у человека нет тех же движений, на которых модель училась у здоровых участников. ➡️ Текущая модель работает с целым предложением. Это значит, что она не является полноценным real-time декодером: даже для первого слова используется МЭГ-сигнал со всего набранного предложения. В реальном приложении пришлось бы отдельно решать сегментацию фраз, задержку и каузальное декодирование. Итог: Brain2Qwerty v2 — сильная и интересная работа про неинвазивный brain-to-text в контролируемой задаче печати. Она действительно двигает область вперёд. Но она пока что даже не близка к неинвазивному речевому протезу. Изображение: National Institute of Mental Health, National Institutes of Health, Department of Health and Human Services

  • 3 июл.5131414

    Brain2Qwerty v2: неинвазивное предсказание речи становится ближе? Предсказание речи из мозга давно является одной из самых «горячих» тем на стыке нейронаук и ИИ. Тут и нейрофутуризм в виде «чтения мыслей», и реальные приложения в виде речевых протезов: по активности мозга понять, что хотел сказать человек, утративший способность говорить, и озвучить через text-to-speech. Сейчас направление ещё не «на потоке», а лучшие девайсы основаны на имплантах. Это связано с рисками операций, инфекций и деградации сигнала со временем. В этом ключе работа Meta* развивает неинвазивное декодирование: авторы создали Brain2Qwerty v2 — модель, которая по данным МЭГ предсказывает текст, набираемый человеком «слепой печатью» на клавиатуре. Это не декодирование воображаемой речи, но хороший тест неинвазивных данных в упрощённой brain-to-text задаче. 🖥 Данные Авторы записали большой датасет: 9 человек находились в МЭГ-аппарате, слушали предложение, ждали 1.5 секунды и затем печатали его на клавиатуре. Во время печати человек не видел клавиатуры и уже набранной строки. Это важно, чтобы в сигнале мозга не остались «шорткаты» для модели в виде активности зрительной системы. Для этого же была пауза между прослушиванием и печатью — чтобы дистанцироваться от сигнала из аудио. Итого: ~90 часов МЭГ и ~22 тыс. предложений. 🔗 Архитектура Brain2Qwerty состоит из 3 уровней: 1⃣ Участок МЭГ для целого предложения проходит через свёрточные и трансформерные слои. Получается последовательность эмбеддингов с частотой 25 Гц — вектор каждые 40 мс. 🔢 Здесь происходит одно из ключевых нововведений. Раньше в похожих задачах модель знала тайминги нажатий клавиш и предсказывала символ для каждого нажатия. В Brain2Qwerty v2 ей дают только последовательность векторов, а модель сама должна понять, когда нажали какую клавишу. Для этого используется CTC. На каждом шаге модель предсказывает букву, пробел или «пусто». Потом длинный поток сжимается в текст: пустые шаги удаляются, соседние повторы схлопываются, а слова разделяются по пробелам. Здесь же эмбеддинги между соседними пробелами усредняют в один вектор на слово. 🔢 После CTC у авторов уже есть черновое предложение, но ошибка даже в паре букв может сделать слово неузнаваемым. Поэтому дальше сам черновой текст и вектора слов подают в LLM Qwen для «полировки» и финального текста. 📈 Основные результаты ➡️ Модель получила ошибку на уровне слов (WER) 39%, а на уровне символов (CER) 31%. Имплантируемые системы заметно сильнее с результатом для печати ~2% WER. Но для неинвазивных подходов это хороший прогресс, особенно учитывая, что модель не знает границ нажатий клавиш. ➡️ Scaling law: точность улучшается при большем количестве данных. Возможно, больший объём МЭГ позволит «дешево» повысить качество. ➡️ Нашлось противостояние смысла и конкретных символов: модели, чьи ответы ближе по смыслу к цели, чаще ошибаются в буквах. Например, используют синонимы: смысл близкий, но буквы неправильные. ➡️ Разнообразие > повторы. В нейронауках часто дают один и тот же стимул несколько раз, так как агрегация повторений снижает шум. Здесь при одинаковом количестве данных качество оказалось выше при большем разнообразии предложений без повторений. ➡️ Можно использовать меньше сенсоров. Полная система использует 306 МЭГ-сенсоров, но при переходе к случайным 230 и 153 сенсорам качество ухудшается всего на несколько процентных пунктов WER. Это полезно для компактных OPM-МЭГ систем, где сенсоров обычно меньше. 👨‍🔬 Ученые, похоже, всё ещё нужны Авторы пытались улучшить результаты с помощью AutoResearch — агентской системы, где сильные LLM сами придумывают идеи, пишут код и пытаются получить результат. В ограниченном сетапе, где AutoResearch дали уже разработанную модель, система нашла инженерные ходы и улучшила качество. Но в сложном сетапе «с нуля», где ей дали репозиторий прошлой статьи и сказали создать модель самой, много кода даже не запускалось. Поэтому, если пользуетесь LLM, ключевые идеи, подходы и верификацию лучше оставлять на себе. *Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена в РФ.

  • 🩻 Midjourney показали аппарат для ультразвуковой КТ Вчера американский ИИ-стартап Midjourney, известный своими моделями генерации изображений, удивил всех демонстрацией нового прибора для ультразвукового сканирования всего тела. Главная мотивация — высокая стоимость, труднодоступность и длительность МРТ-сканирования: одна запись человека может легко занять больше часа. Их система работает без радиации, в отличие от КТ, и без магнитного поля, в отличие от МРТ. А финальная цель по скорости — 60 секунд на всё тело. Точная скорость работы текущего прототипа неизвестна, но, судя по разным источникам, он уже значительно быстрее МРТ. 🗣 Как это работает? ▫️Человек встаёт на платформу, которая постепенно опускается в воду. ▫️Вокруг платформы и человека расположено кольцо с огромным количеством датчиков, отправляющих звуковые волны. ▫️В зависимости от части тела и её плотности (например, кожа, жир, мышцы или кости) звуковая волна будет по-разному менять свою форму. ▫️Каждый датчик умеет не только отправлять, но и регистрировать звуковые волны. ▫️В совокупности датчики отправляют множество волн в сторону тела под разными углами. Волны проходят через разные ткани, после чего регистрируются датчиками с другой стороны. ▫️По зарегистрированным сигналам и изменениям формы волн можно восстановить единый срез человеческого тела внутри кольца. ▫️Такие срезы непрерывно строятся по мере спуска платформы, поэтому на выходе получается трёхмерный скан всего тела. Вода нужна потому, что через неё ультразвук проходит гораздо лучше, чем через воздух. По этой же причине при обычном УЗИ используют гель. 🧖 Вместо больницы спа? Под проект открыли отдельную лабораторию Midjourney Medical с очень амбициозными целями и странным путём развития :) Компания напирает на то, что знание как можно большего количества информации о своём теле и регулярные сканирования могут способствовать ранней диагностике, улучшению здоровья и качества жизни. Поэтому Midjourney хочет размещать устройства там, куда человеку не придётся «идти только ради диагностики», а само сканирование станет побочной мелочью на одну минуту. Поскольку со стороны пользователя устройство выглядит как глубокая, но узкая ванна, компания планирует выйти на wellness-рынок и открыть в Сан-Франциско спа-комплекс. Там можно будет выйти из бассейна или бани и на 60 секунд погрузиться в аппарат. Так Midjourney надеется стимулировать людей проходить регулярные сканирования. В комплексе планируют разместить десять аппаратов, которые, по заявлению компании, смогут за год выполнять столько же сканирований, сколько все МРТ-сканеры мира вместе взятые. А к 2031 году Midjourney планирует выйти на международный рынок, развернуть 50 тысяч устройств и достичь пропускной способности в миллиард сканирований в месяц. Для такого количества аппаратов цифры выглядят сильно оптимистично, но масштаб проекта всё равно впечатляет. 💊 А что с медицинским применением? Стратегия может выглядеть странно, а опора на wellness-рынок — подрывать доверие к медицинской серьёзности проекта. Особенно на фоне новостных заголовков об «убийце МРТ». Но стоит помнить, что регистрация и получение разрешения на медицинское применение в США легко могут занять больше пяти лет — это было хорошо видно на примере чипов Neuralink. Поэтому высока вероятность, что Midjourney выходит на wellness-рынок, где требований гораздо меньше, чтобы уже сейчас собирать данные, тестировать и улучшать аппарат, а также зарабатывать на его использовании. Всё это можно делать параллельно с получением одобрения FDA, интерес к которому компания также выражает в своём блоге. Так что устройство очень интересное, и за развитием проекта стоит следить. 🧠 А что насчёт мозга? Возможно, наработки Midjourney окажутся полезны и для активно исследуемой области ультразвуковой томографии мозга. Здесь всё сложнее, поскольку череп плохо пропускает ультразвук. Тем не менее ультразвуковая нейровизуализация продолжает развиваться — и в будущем этот проект тоже может чем-то ей помочь. P.S. на картинке не реальный девайс, а сгенерированный неофициальный набросок.

  • 🧠🎨 MindEye: как нарисовать изображение из мозга Продолжаю мини-серию постов о генерации картинок из мозга. В прошлый раз я рассказывал о большом датасете с записями фМРТ, собранными во время просмотра естественных изображений, и о том, как он стал стандартом для этой задачи. Сегодня же я хочу рассказать об одном из самых популярных подходов к её решению — MindEye. MindEye — работа большой команды исследователей, в том числе представителя Stability AI — компании, участвовавшей в разработке серии генеративных text-to-image-моделей. Авторы MindEye используют такие модели для генерации изображений из фМРТ. 🎯 Конкретная задача, которую они поставили перед собой: — Вход модели: набор из ~15 тыс. вокселей, которые авторы датасета выделили как наиболее отзывчивые на зрительные стимулы. В основном они находятся в зрительной коре. — Выход модели: сгенерированное изображение, которое должно быть похоже на стимул во время записи активности этих вокселей. 💡 Основная идея Сам подход простой, но осмысленный. Архитектурно в нём мало нового: авторы объединяют готовую диффузионную модель и MLP в единый пайплайн. Важное свойство диффузионных моделей в том, что их можно направлять с помощью векторов-эмбеддингов: например, текст может описывать содержание будущего изображения. Чтобы не обучать такую модель с нуля, авторы предсказывают управляющие эмбеддинги непосредственно из фМРТ. Вместо текстового описания модель получает информацию из активности мозга, а в качестве стартовой точки — размытую картинку, предсказанную из того же фМРТ другой частью модели. В итоге модель состоит из двух основных уровней: ⬇️ Нижний уровень Здесь авторы пытаются предсказать из вокселей фМРТ внутреннее представление автоэнкодера, взятого из Stable Diffusion. Они намеренно не используют саму диффузию, а задействуют только автоэнкодерную часть. На выходе получается «смазанная» картинка, на которой хорошо видны силуэты и цвета объектов, но отсутствуют детали. Поэтому нижний уровень можно считать структурным. ⬆️ Верхний уровень Верхний уровень отвечает за семантику изображения: что на нём происходит, кто изображён и что делает. Для этого авторы предсказывают из фМРТ эмбеддинги изображений в пространстве CLIP, которые используются для обусловливания Versatile Diffusion. Это пространство содержит осмысленную семантику: например, изображения двух собак будут ближе друг к другу, чем изображения собаки и автомобиля. Поэтому верхний уровень можно считать семантическим. Ключевая архитектурная деталь заключается в использовании отдельного диффузионного модуля, который обучается вместе с остальной моделью и декодирует CLIP-эмбеддинг из фМРТ. В некотором смысле это имитирует идею латентной диффузии изображений в пространстве внутренних представлений. 🧩 Объединение и финальная генерация После запуска нижнего и верхнего уровней у авторов появляются два взаимодополняющих элемента: 1️⃣ Размытая картинка, которая знает, где находятся объекты, какого они размера и цвета, но не знает, что это за объекты. Это выход нижнего уровня. 2️⃣ Вектор, который описывает, кто и что находится на изображении, но плохо знает, где именно и какого цвета. Это выход верхнего уровня. Оба элемента подаются в Versatile Diffusion. Модель берёт структурную картинку с нижнего уровня и дорисовывает на ней детали, используя семантическую информацию из верхнего. Так и получается финальное изображение. 📈 Результаты и MindEye2 На момент выхода MindEye стала лучшей по многим метрикам и часто генерировала хорошие, осмысленные изображения. После её успеха авторы разработали следующую версию — MindEye2. Ключевой методологической модификацией стало использование простых линейных блоков-адаптеров для каждого человека. Они позволяют учесть индивидуальные особенности мозга и свести данные разных людей в общее пространство, в котором уже можно обучать большую общую модель. В итоге авторы показали эффективность двухуровневой взаимодополняющей структуры в MindEye и обучения на данных множества людей в MindEye2. Обе работы оказались среди наиболее цитируемых и сильных моделей в этой нише!

  • ⚖️ TRIBE v2: the good, the bad and the ugly Положительные моменты: ✅ Метрики выше, чем у TRIBE, который уже был State-of-the-Art. При предсказании средней групповой активности корреляции достигают 0.4 — значительно лучше классических линейных encoding-моделей. ✅ Scaling law: точность продолжает расти с объёмом данных без насыщения — как у больших языковых моделей. Это важно не только как потенциальное улучшение TRIBE v2, но и как сигнал, что у направления в целом есть серьёзное будущее. ✅ Обучены две версии модели — для предсказания корковой и подкорковой активности. ✅ Разумная схема проверки генерализации: обучение на данных с малым числом испытуемых (25 человек), но большим объёмом часов на каждого (451.6 ч суммарно); тестирование на большом числе испытуемых (695 человек) с малым объёмом на каждого (666.1 ч суммарно). В итоге используются по четыре разных датасета в каждой части с разными фМРТ-сканерами. ✅ В статье много качественного анализа результатов для разных нейролингвистических и зрительных парадигм. ✅ Код, веса и демо опубликованы — можно воспроизвести и протестировать на практике. ✅ Модели не нужны все три модальности сразу — работает с любой комбинацией. Если информации достаточно, она её извлечет. Например, если подать только видео со звуком, она сама извлечёт аудио для аудиоветки и транскрибирует текст для текстовой. Но даже если её нет (например, видео без звука или аудио без речи) — модель сможет работать с этими стимулами. Правда при работе только с одной модальностью я бы ожидал, что качество ожидаемо снизится. ✅ Несмотря на то что модель разработана для фМРТ, корковая версия потенциально полезна и при подборе стимулов для ЭЭГ/МЭГ/фНИРС и других модальностей. Но не стоит забывать: электрическая и гемодинамическая активности фундаментально различаются, так что для ЭЭГ/МЭГ это будет грубая аппроксимация, но это не значит, что она не поможет. Проблемы и нюансы: ❌ Несмотря на State-of-the-Art, абсолютные метрики невысокие: средняя корреляция около 0.2, а в некоторых экспериментах на подкорке колеблется в районе 0.08–0.14 в зависимости от части мозга. ❌ Препринт по форме ближе к техническому репорту, чем к полноценной статье: многие количественные эксперименты: абляции, сравнения с бейзлайнами, — не проведены. ❌ Часть статистических значимостей посчитана некорректно: разные области мозга используются как независимые точки, хотя активность соседних участков коры явно взаимозависима. ❌ Извлечение признаков требует серьёзных ресурсов. У авторов на это ушло 24 часа непрерывной работы 128 GPU типа V100 — но они сразу обрабатывали 1117.7 часов данных. На практике нужно будет значительно меньше, однако я бы всё равно ожидал необходимость хотя бы одной GPU уровня V100. Обычные GPU, а тем более CPU, вероятно, не потянут. ❌ Текст статьи местами расходится с опубликованным кодом: некоторые детали архитектуры и обучения, описанные в препринте, в репозитории реализованы иначе. ❌ Часть решений выглядит эвристично и слабо обоснована: почему именно 2 Гц для признаков? Почему агрегировать эмбеддинги по группам слоёв, а не проецировать все слои сразу? ❌ Авторы не показывают, насколько деградирует качество полной модели, если на входе только часть модальностей — без переобучения. В статье тестируется другой сценарий: модель переобучают под разные наборы модальностей. Это не одно и то же. Для готовых опубликованных моделей тест на деградацию гораздо важнее для практического применения. Вывод: TRIBE v2 — действительно очень интересная модель, которая вполне может стать хорошим подспорьем для нейроучёных при дизайне стимулов: точность неплохая, а код, веса и демо опубликованы. Я обычно занимаюсь непосредственно алгоритмами, ИИ и моделями, поэтому сам вряд ли смогу полноценно оценить практическую пользу. Но будет интересно узнать, окажется ли модель полезной для исследователей при реальном дизайне экспериментов

  • 📊 TRIBE v2: фундаментальная модель фМРТ для помощи в подборе стимулов и дизайне экспериментов Потратить месяцы на дизайн эксперимента, записать данные — и обнаружить, что нужного сигнала на записях нет. Для ЭЭГ это неприятно, для МЭГ болезненно, для фМРТ — настоящая катастрофа. Эту проблему можно было бы минимизировать, заранее оценив примерный ответ мозга на стимулы — понять, какие из них лучше подходят для вызова нужной активности, и есть ли такие вообще. Эту задачу пытается решить новая фундаментальная модель от Meta* — TRIBE v2. Это развитие TRIBE, победившего в соревновании Algonauts 2025 среди почти 270 команд. TRIBE v2 — не классическая фундаментальная модель-кодировщик: вместо того чтобы пытаться представить разнородные нейроданные как универсальные векторы, она по стимулам предсказывает гемодинамический ответ мозга, который показало бы фМРТ. На входе у модели видео, аудио и текст, на выходе — временной ряд BOLD-сигнала с частотой 1 Гц. Опубликовано 2 вида модели: первая предсказывает ~9 тыс. вокселей для 8 подкорковых регионов, вторая предсказывает ~20 тыс. вершин поверхности коры мозга в пространстве fsaverage5. Ключевые части архитектуры Идея довольно интуитивная: взять мощные предобученные модели для видео, аудио и текста, извлечь признаки из каждой модальности, а потом обучаемым трансформером превратить временной ряд этих признаков во временной ряд BOLD-сигнала. Интересные особенности модели: 1️⃣ Финальная проекция в пространство фМРТ — своя для каждого испытуемого, чтобы учесть индивидуальные различия. При этом, чтобы уметь предсказывать среднюю групповую активность, в модели дополнительно подгоняется матрица «среднего человека»: во время обучения с вероятностью 10% вместо матрицы конкретного испытуемого используется именно она. Так эта матрица применяется для разных людей и учится быть универсальной, а после обучения позволяет предсказать средний групповой ответ на стимул. 2️⃣ У каждой модальности (видео, аудио, текст) во время обучения есть вероятность 30% быть случайно отключённой — чтобы модель умела работать и тогда, когда не все модальности доступны. 3️⃣ При дообучении под нового испытуемого используется матричная декомпозиция низкого ранга — это существенно уменьшает число обучаемых параметров. 4️⃣ Модель использует признаки не только с финальных слоёв предобученных энкодеров, но и с промежуточных, что обогащает описание стимулов. Например, у некоторых текстовых моделей ранние слои лучше улавливают грамматику, поздние — семантику; в видеомодели ранние слои фиксируются на простых визуальных формах и признаках, поздние — на более сложных паттернах. *Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена в РФ.

  • Начало через 5-10 минут здесь: https://teams.microsoft.com/meet/389644993158435?p=EkgSmiDXDPi6xL3IjD

  • 23 апр.182111из itatmisis

    🧠 Знакомимся со спикерами митапа НейроТолк, посвященному нейротехнологиям и интерфейсам мозг-компьютер 23 апреля в стенах МИСИС на митапе по нейронаукам мы копнём в глубины мозга и познакомимся с тем, как он устроен. Также узнаем, как работают нейроинтерфейсы и как вообще происходит управление различными устройствами "силой мысли". Помогут нам разобраться во всех этих вопросах следующие эксперты, которые выступят с интересными докладами: ⚫ «Подходы к моделированию мозга: обзор» Крючечникова Анна (Сколтех) ⚫ «Нейротех, геймдев и роботы» Писков Макар, Коваленко Александр (Объединение "мозг-компьютер") ⚫ «Нейроинтерфейсы, основанные на воображении движений» Решетникова Варвара (к.б.н., МИСИС) ⚫ «Универсальный энкодер мозга: эволюция моделей для нейросигналов» Антипушина Екатерина (Сколтех, Центр ИИ, Центр био- и медицинских технологий) ⚫ «Чёрный ящик изучает чёрный ящик: нейроданные глазами машинного обучения» Семенков Илья (к.ф.-м.н., AIRI, НИУ ВШЭ) В ходе митапа ты сможешь не только послушать выступления и задать вопросы спикерам, но и поближе пообщаться с ними в конце мероприятия. Это уникальная возможность узнать про мозг и ИИ в стенах родного университета – не упусти её! 🗺️До встречи 23 апреля в 17:00 в Б-1134

  • Через 20 минут начнется митап по нейронаукам и ИИ в МИСиС, в котором я также буду выступать одним из спикеров: поговорю в целом о нейроданных, трудностях и нюансах работы с ними, а также перспективных и интересных направлениях развития ИИ. Ближе ко времени должна появиться ссылка на онлайн трансляцию, а моё выступление запланировано примерно на 18 часов. Присоединяйтесь, буду рад всех видеть :)

  • Датасет, который дал новое дыхание декодированию изображений из мозга Резкий скачок в популярности декодирования изображений из мозга во многом начался со статьи A massive 7T fMRI dataset to bridge cognitive neuroscience and artificial intelligence. Её история сложилась так: в США собралась большая группа нейроучёных, которые исследуют широкий спектр вопросов, связанных с обработкой визуальной информации мозгом. Они получили на год доступ к уникальному фМРТ-сканеру с магнитным полем 7 Тесла и решили записать датасет с активностью мозга во время просмотра большого числа изображений. Цель была не в том, чтобы записать данные под одну узкую задачу, а в том, чтобы создать большой и качественный датасет для дальнейшего изучения того, как мозг обрабатывает визуальные стимулы: например, сравнивать разные типы картинок, смотреть, насколько различаются ответы между людьми, и в целом извлекать различные закономерности. Natural Scenes Dataset (NSD) действительно получился уникальным и высококачественным. Некоторые его ключевые свойства: — Записали 8 человек. 4 участника прошли все сессии, ещё 4 — большую часть. — По дизайну эксперимента датасет должен был включать 73 000 изображений: по 9 000 уникальных на человека (для масштаба и разнообразия) и 1 000 общих на всех людей (чтобы сравнивать реакции на одни и те же фото между людьми). В итоговом релизе получилось 70 566 изображений, потому что 4 участника прошли не все 40 сессий. — Изображения естественные: реальные фотографии, а не абстрактные или упрощённые фигуры. — Изображения взяты из Microsoft COCO — очень популярного бенчмарка для задач компьютерного зрения, из которого помимо самих изображений можно получить много разметки: какие объекты есть на картинках, подписи к изображениям и так далее. — Людей тщательно отбирали и отсеивали, если кто-то не подходил: сначала провели скрининговую сессию с 14 кандидатами, а потом выбрали 8 участников с лучшим качеством данных. — Изображения аккуратно рандомизировали так, чтобы они шли в неожиданном порядке, но интервалы между повторами одних и тех же картинок были достаточно разнесены во времени. Вдобавок ко всему авторы не просто выложили сырой датасет. Они также применили ряд собственных методов предобработки для удаления шума, повышения качества данных, получения бета-оценок и построения маски с подмножеством наиболее информативных вокселей. Опубликованы сырые и обработанные фМРТ, бета-оценки, а также структурные и диффузионные МРТ, маски для разных областей мозга (включая маски ключевых вокселей), код и документация. Исследователи, занимающиеся ИИ, увидели качественный парный датасет (фМРТ-картинка) и решили попробовать генерировать изображения по активности мозга. За эти годы вышло много ключевых моделей, решающих эту задачу, включая самые известные Brain-Diffuser, MindEye и MindEye 2. Таким образом, сами того не планируя, нейроучёные из Университета Миннесоты дали этому направлению новое дыхание. Датасет действительно очень интересен и может быть полезен для большого пласта работ: от чистой биологии до ИИ. Это видно и по тому, насколько активно его используют: на сайте датасета собран большой список журнальных статей (60+), конференционных работ и препринтов (170+), которые используют эти данные; а у самой статьи в PubMed уже 838 цитирований.

  • Генерация изображений по активности мозга Для нейроданных существует множество задач декодирования, но большая их часть так или иначе сводится к классификации: например, классификация движений, слов или изображений. Однако с ростом популярности генеративных моделей изображения уже не обязательно декодировать как класс или индекс из заранее известного множества. Их можно буквально «рисовать» с нуля, используя данные мозга как условие для генерации: примерно так же, как вы задаёте модели промпт, что нужно нарисовать, только вместо промпта здесь — активность мозга. По моим наблюдениям, это одна из самых интересных и привлекательных тем для многих исследователей на стыке ИИ и нейронаук: возможность создать что-то, опираясь только на активность мозга, без классов, индексов и разметки, и получить из сложных и запутанных данных мозга то, что человек действительно видел. Я хочу посвятить этой задаче небольшую серию постов, начиная с сегодняшнего рассказа про один ключевой для этой области датасет.

  • Всем привет! Недавно у меня появился личный сайт. Если кому-то интересно подробнее посмотреть, чем я занимался и чем занимаюсь сейчас — welcome :) Там собраны мои проекты, публикации, open-source и CV, а также есть контакты для связи — в дополнение к Direct Messages в этом канале. UPD: на мобильных устройствах некоторые элементы пока могут отображаться неидеально — скоро это исправлю и постепенно добавлю на сайт новые улучшения.

  • 8 мар.239231

    Хочу поздравить сегодня всех девушек с 8 марта! На своём пути я много раз встречал невероятно талантливых и умных девушек, чья работа вдохновляет и заслуживает восхищения, в абсолютно разных сферах: от нейронаук и психологии до компьютерных наук, математики и ИИ. И несмотря на то, что в части этих отраслей давно сформировался гендерный перекос — вклад женщин в науку в целом и во все эти отрасли в частности огромен. Желаю всем интересных проектов, никакого выгорания, отличного настроения каждый день, а также не обращать внимания на стереотипы и заниматься тем, что вы любите, ведь только так создаётся реальный прогресс в науке! Интересный факт: одним из ключевых авторов soft margin SVM, знаменитого алгоритма классического ML и эффективного бейзлайна в нейронауках, является девушка — Коринна Кортес, которая руководит Google Research в Нью-Йорке.

  • 4 мар.300211

    Всем привет! На этой неделе (начиная с сегодняшнего дня) я делаю серию ежедневных (ну или почти ежедневных) постов в канале DeepSchool. Это будет короткий ликбез по ML/AI в нейронауках: от модальностей до самых интересных направлений исследований с точки зрения современных ИИ подходов и архитектур. Приглашаю всех желающих почитать :)

  • ❌ REVE (4/4): Что не получилось и вердикт — Большинство улучшений очень маржинальны и слабо оправдывают гигантский размер модели (которую при этом нужно дообучать). Например, прошлая State-of-the-Art фундаментальная модель CBraMod проигрывает в среднем на 2.5% по точности (на большинстве датасетов в районе 0.5-1.5%). При этом CBraMod это около 4 миллионов обучаемых параметров, тогда как базовая REVE — 69 миллионов, а большая — 400 миллионов. — Энкодер всё равно нельзя использовать «из коробки». Если не дообучать модель под конкретный датасет, то её качество на предобученных эмбеддингах на большинстве датасетов очень близко к качеству простых, более компактных не фундаментальных бейзлайнов, которые гораздо проще «покрутить» и обучить под конкретную задачу сразу. — Более того, если не предобучать CBraMod на большом датасете, а обучить просто с нуля на финальную классификацию конкретных данных — качество уменьшается только немного. Что, кстати, показывает маржинальность улучшения от предобучения и потенциально слабые начальные эмбеддинги современных фундаментальных моделей для ЭЭГ. — Судя по результатам абляций, дополнительное качество, принесённое новым позиционным кодированием, относительно небольшое, а от маскирования вообще маржинальное (около 1-2%). — Авторы не опубликовали ни код обучения, ни обработки и объединения датасетов в их огромный претрейн. Только код самой модели. С остальным нужно разбираться самостоятельно, что особенно неудобно, учитывая, что модель явно нужно дообучать перед нормальным использованием. — Я заглянул в код модели на Hugging Face и там есть потенциальные проблемы и баги: 1️⃣ Часть параметров подбора гармоник для позиционного кодирования — «магические константы»: числа, взятые непонятно откуда и просто записанные в коде. И внутри инициализации модели их даже нельзя поменять. Чтобы поменять — нужно вручную поменять код модели. 2️⃣ Сейчас в модели предполагается, что её можно инициализировать с разными размерностями внутренних представлений и с разным количеством гармоник для позиционного кодирования. При этом, сам код позиционного кодирования явно сделан под базовые 4 гармоники и размер эмбеддинга 512. Если передать туда другие значения случится одно из двух (в зависимости от комбинации значений): модель выдаст ошибку или будет вести себя некорректно (например, «молчаливо» обрежет часть комбинаций гармоник). Самое забавное, что второй тип ситуации наблюдается в Large версии модели, опубликованной и обученной самими авторами: там обрезаются всего несколько комбинаций, что, видимо, не сильно ломает общего качества. При этом, если использовать размер эмбеддинга из статьи, а не из файла конфигурации (почему-то они отличаются), то из-за бага в текущей реализации оно вообще не запустится. В Base версии, если использовать конфигурации авторов, то всё будет корректно. Только если самостоятельно менять параметры — можно наткнуться. ⚖️ Вердикт: несмотря на хайп и интересный способ кодирования координат, модель сильно раздувает количество параметров, принося достаточно маржинальные улучшения. При этом она не решает основные проблемы уже существующих фундаментальных моделей ЭЭГ — ненадёжные эмбеддинги. Однако авторы действительно хорошо и экстенсивно протестировали модели, что может подтолкнуть направление исследований к более робастному оцениванию (как когда-то тестирование CBraMod на большом количестве датасетов подтолкнуло последующие модели делать так же) и обратить внимание на проблему недостаточно сильных представлений «из коробки».

  • ✅ REVE (3/4): Что получилось — Метод позиционного кодирования действительно вышел гибким и помог объединить много комбинаций электродов из разных монтажей. Важно понимать, что использование непрерывных позиций вместо дискретных каналов даёт в теории возможность подать абсолютно любой новый канал и его позицию, но это не панацея. В реальности, если модель никогда не видела электродов в этой позиции, то она легко может провалиться. Но у авторов действительно используется много комбинаций (396 уникальных «названий электродов») и многие из них довольно стандартны, поэтому, скорее всего, у них с этим не должно быть сильных проблем, если не подавать в их модель совсем экзотические комбинации. — Авторы действительно собрали огромный датасет из кучи публичных источников (19 Тб сырых данных) и, судя по всему, проследили, чтобы записи из тестовых датасетов никак не попали в претрейн. — Стратегия маскирования, судя по экспериментам авторов, немного помогает улучшить метрики. — Авторы тестируют финальное качество на 10 разнообразных датасетах, отражающих разные категории ЭЭГ-данных и парадигм (например, клинические данные, BCI, сон, ...). — Авторы в основном тексте приводят довольно детальные метрики по классификации, без дообучения их энкодера (почему это важно смотрите здесь). — Судя по всему, авторы дообучают модель через LoRA, а не целиком, что позволяет дообучать гораздо меньше параметров и делать это быстрее. Но обучение всё равно не дешёвое, поскольку для робастности авторы дообучают модель много раз независимо и усредняют веса (model souping). — Авторы сравниваются с простыми не фундаментальными бейзлайнами как EEGNet или EEGConformer. Если предобученная большая модель не может их победить, то в ней мало смысла, из-за чего такие сравнения очень полезны. — REVE показывает лучшие результаты на почти всех датасетах. — Доступ к моделям очень удобно налажен через Hugging Face Hub. Скачать предобученную модель и запустить можно всего в несколько строчек кода. При этом, они дают неплохое демо в Google Colab как это сделать.

  • 🔧 REVE (2/4): Основные технические детали модели Трансформерные модели нарезают данные на небольшие кусочки (токены) и для того, чтобы трансформерные слои знали, в каком порядке идут эти кусочки — применяют позиционное кодирование. В ЭЭГ кусочком часто является конкретное окно конкретного канала (например, 1 секунда P4). Дальше возникает вопрос: как объяснить модели, «где» находится этот токен — и по времени, и на голове. Авторы вдохновились идеей из предыдущих работ по декодированию МЭГ, где реальные координаты сенсоров переводили в Фурье пространство и складывали гармоники с обучаемыми коэффициентами. Таким образом, Défossez, et. al. обучая коэффициенты разложения Фурье по факту могли аппроксимировать почти любые математические функции от координат сенсоров, которые можно разложить в ряд Фурье. Тогда модель включала результаты вычисления этих функций и, следовательно, координаты сенсоров напрямую в архитектуре. Интересный и математически красивый метод, который мы, кстати, тоже модифицировали в одном из пока не опубликованных in progress проектов. Авторы REVE пошли немного другим путём. Они берут координаты всех ЭЭГ электродов, используемых в конкретной записи, и добавляют к ним временные индексы каждого окна. Получается 4 числа для каждого токена (каждый токен — специфичный канал и временное окно): (x, y, z, t), где первые 3 координаты описывают пространственное расположение электродов, а финальная — время (индекс окна). Дальше они строят позиционные коды как сумму двух частей: 1️⃣ Первая часть: из (x, y, z, t) они считают много периодических признаков (синусы и косинусы), чтобы «ярлык позиции» плавно менялся при сдвиге электрода или при переходе к другому окну по времени. Здесь авторы используют «магические константы»: в коде есть заранее выбранные коэффициенты масштабирования и нормировки координат и времени. Они задают периоды синусам и косинусам, то есть насколько быстро эти синусы/косинусы «меняются». Это выглядит как инженерная нормировка «чтобы работало», а не как вывод из строгой теории. 2️⃣ Вторая часть: простой перцептрон (один линейный слой + GELU + Layer Norm), который тоже превращает (x, y, z, t) в вектор той же скрытой размерности, что и разложение по синусам и косинусам. В результате, эти две части суммируются и нормируются, получая финальные позиционные коды, которые потом прибавляются к токенам ЭЭГ данных. Такой подход по сути представляет собой функцию от позиций каналов и, поэтому, даёт возможность передать в модель любую конфигурацию каналов — главное правильно задать их координаты. Авторы назвали это 4D Spatio-Temporal Position Encoding. Кстати, при обучении они намеренно аугментируют позиции каналов, прибавляя к ним иногда случайный шум — чтобы помочь модели научиться обобщать на разные позиции каналов и нестыковки при установке одних и тех же каналов для разных сессий. Ещё одна интересная стратегия заключается в том, как авторы маскируют кусочки ЭЭГ. Обычно, такие фундаментальные энкодеры учатся реконструировать данные: часть окон скрывают, и модель учится восстанавливать их по остальному сигналу. Проблема в том, что при случайной маске модель может «читерить», опираясь на ближайшие соседние окна и почти интерполируя сигнал. Чтобы избежать этого, авторы маскируют не только случайные кусочки, но и всех соседей в определённом радиусе (и пространственно, и по времени). Это заставляет опираться на более глобальную структуру, а не на ближайшие совпадения. Авторы назвали стратегию Block Masking Strategy. Остаток модели менее интересен и по сути представляет собой трансформер с рядом инженерных модификаций, взятых из набора других статей, выходивших последние 6 лет (поменяли нормировку, функцию активации, убрали bias, заменили классический механизм внимания на FlashAttention v2).

  • 🖥 REVE (1/4): прогресс фундаментальных моделей ЭЭГ, но не там, где Вы думаете TL;DR: разработали ещё одну фундаментальную модель ЭЭГ; сама она не выглядит революционной, но общий подход (протоколы оценивания, акценты, публикация весов, простота доступа) может помочь сообществу развиваться дальше. 🎯 Мотивация авторов Что такое фундаментальная модель-энкодер в целом, зачем они нужны и текущее состояние в приложениях к ЭЭГ подробнее описано в предыдущих постах и комментариях к ним. Вкратце, это большая модель, обученная работать на разношёрстных ЭЭГ данных (разные монтажи, протоколы, люди) и проецировать ЭЭГ-записи в их сжатые вектора-представления. Недавно на одной из лучших Core A* конференций NeurIPS (которая, кстати, исторически была создана для исследований на пересечении искусственного интеллекта и нейронаук) вышла нашумевшая статья о новой фундаментальной модели-энкодере для ЭЭГ — Representation for EEG with Versatile Embeddings (REVE). Авторы модели верно подмечают, что предобучение только на TUEG датасете (большой клинический датасет, стандарт для предобучения фундаментальных моделей ЭЭГ) ограничивает обобщаемость, поскольку весь TUEG был записан с почти идентичным числом и набором ЭЭГ-каналов. Соответственно, фокус статьи в том, чтобы разработать модуль, который позволит фундаментальной модели эффективно работать с разными наборами и локациями ЭЭГ-каналов. Поскольку такой модуль значительно расширяет возможность использования разных монтажей — авторы предобучают REVE на комбинации 92 ЭЭГ-датасетов суммарным размером в >60 000 часов и примерно 25 000 человек. Это всё ещё и близко не так много данных, как у фундаментальных моделей для изображений, аудио и, особенно, текстов, но уже в несколько раз больше, чем предыдущие модели для ЭЭГ.

  • видео или голосовое, без подписи

Мозг из машины — tgindex