neuronauts | on a way to PhD in AI
Статистикастуденты сколтеха рассказывают о жизни в phd, ml и нейронауке 🧠 автор: @utoprey
- Последний пост
- 26 мар.
- Последнее чтение
- 13 авг.
- Постов за неделю
- 0
- Всего постов
- 21
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- —
- 1/48двое суток
- —
- 1/72трое суток
- —
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
некоторое время назад админила в канале DeepSchool и писала про стажировки и летние исследовательские школы - и решила сделать небольшое дополнение в виде списка площадок, которые могут быть дополнительно интересны девушкам in tech&ml 👩 честно говоря, пока мне показалось, что большинство из них скорее для школьниц и тех, кто только начинает путь в профессию. но если вы уже уверенный специалист, можно попробовать заявить о себе на менторских программах 💫Girls Who Code Один из самых узнаваемых проектов в этом пространстве. Летние интенсивы, кружки в школах и университетах, сеть выпускниц из более чем 300 тысяч человек. Работает и как первая точка входа, и как долгосрочное сообщество ⭐️Girls Who ML Объединение для женщин и девушек, интересующихся машинным обучением: встречи, учебные группы, наставничество. Поддержка есть на разных уровнях — от самого начала до более продвинутых направлений ⭐️Rewriting the Code Большое сообщество для студенток технических специальностей с доступом к мероприятиям, ресурсам, учебным группам, возможностям для развития и контактам с компаниями
⏺Продолжение истории про подкаст Keep in Touch Во время записи произошёл технический сбой, из-за которого восстановить звук, к сожалению, не удалось даже с помощью специалиста. Теперь подкаст вышел в новом формате, с интервью можно ознакомится тут
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
〰️В субботу нас пригласили на T-Sync Conf осветить проекты лаборатории - мы с ребятами рассказывали про наши наработки и показывали VR-сетап для оценки когнитивных функций Каждый делился: кто чем занимается, какие планы дальше и сколько лет в науке 😅. Приятно было видеть так много людей, аудитория была огонь, совсем разная: инженеры-разработчики, айтишники, студенты и ещё куча людей, которые когда-то сталкивались с нейро в каком-то её проявлении. Все подходили, общались - атмосфера была очень живая. Было интересно послушать мнения из разных сфер и подумать, как улучшить стратегию коммерциализации продукта 📈 Я рассказывала про ИИ в нейровизуализации: как модели обрабатывают ЭЭГ- и фМРТ-данные, вычленяют паттерны активности мозга и какие интересные задачи сейчас появляются в этом домене, немного обсуждали анализ временных рядов для банковских прогнозов С Лизой ещё заскочили на стенд T-Географии - там Оля✌ показала нам интерактивную игру по кластеризации: нужно было так сгруппировать регионы в маршрут доставки, чтобы переиграть алгоритм, который оптимизирует путь и показывает прибыль за неделю (мы проиграли…) На таких мероприятиях, конечно, челлендж - рассказать простым языком про свою работу и её смысл. Но тут всё срослось, было приятно пообщаться со всеми 🧚🏼♂️
видео или голосовое, без подписи
видео или голосовое, без подписи
🎤На прошлой неделе рассказывала на курсе ISP «Roadmap to Career Success» в Сколтехе про карьерный путь в науке - для меня это был немного личный разговор, а не просто карьерная лекция. Хотелось честно показать, как выглядит жизнь в исследовании изнутри, с её удачами, провалами, сомнениями и маленькими победами. ISP (Independent Study Period) - это особенный период в учебном году Сколтеха, когда обычные пары почти не идут, а вместо них появляются более свободные форматы и курсы, многие из которых придуманы и подготовлены самими студентами; меня позвали выступить на одном из таких курсов от карьерного центра. Особенно приятно было увидеть среди спикеров Сашу Разорёнову ✌ - мы работаем в одном центре, и для меня она такой спокойный ориентир в мире науки: опытный исследователь, который давно и серьёзно занимается ЭЭГ/МЭГ и решением обратной задачи. Мне очень откликнулось, как мы смотрим на одни и те же вещи с разных этажей опыта: Саша как бывалый учёный, я с позиции PhD второго года, который ещё во многом только нащупывает свой путь. В итоге у нас получился живой диалог, а не две разрозненные презентации. В основу моей части легла книжка “How to Get a PhD”, которую мне когда‑то привёз из‑за границы Риккардо - постдок в моей лаборатории. На первом году я опиралась на неё очень часто: что-то выписывала, применяла, анализировала и возвращалась к тем же главам после непростых разговоров с PI. Больше всего меня зацепили вещи не про «как всё делать правильно», а про человеческую сторону PhD - как договориться с собой, чего вы хотите от этой степени; как выстраивать отношения с научным руководителем так, чтобы это был диалог, а не зависимость; как переживать периоды, когда ничего не работает и кажется, что «все вокруг умнее». И ещё - про то, что право на ошибки и на изменение траектории во время PhD есть у всех, и это нормально. Эту книжку мы в конце лекции разыграли среди ребят, потому что мне хотелось, чтобы она стала для кого‑то таким же тихим, но очень поддерживающим голосом, как когда‑то для меня. Если хочется почитать её самостоятельно - вот PDF. Ещё один ресурс, который я нашла недавно - сайт профессора Имрана Раззака с его длинным, очень честным текстом про то, стоит ли вообще идти в PhD, как выбирать супервизора и чего ожидать от этой дороги. Там без романтики, но с большой заботой о читателе. Если вы задумываетесь о PhD или у вас есть друзья, которые сейчас в этом размышлении, искренне советую дать им почитать Пишите, если тема близка - буду рада поговорить 💬
🫨REVE: A Foundation Model for EEG Adapting to Any Setup with Large-Scale Pretraining on 25,000 Subjects TL;DR REVE (Representation for EEG with Versatile Embeddings) - foundation‑модель для ЭЭГ на базе пространственно‑временного трансформера с 4D позиционным кодированием (x,y,z,t), которая работает с произвольными длинами записей и любыми конфигурациями электродов. 💛Модель предобучена в парадигме MAE на >60 000 часов ЭЭГ из 92 датасетов и 25 000 субъектов - это крупнейший проект предобучения для ЭЭГ 💜Благодаря геометрическому 4D позиционному кодированию, а не фиксированным/адаптивным эмбеддингам каналов, REVE устойчиво переносится между монтажами и показывает SOTA на 10 downstream‑задачах (motor imagery, судорожная активность, сон, эмоции и др.) при минимальном дообучении В CV и NLP фундаментальные модели давно стали стандартом: один энкодер обслуживает десятки задач без доработки под каждый случай. С электроэнцефалографией ситуация иная - крупные публичные датасеты собирались на разных устройствах с различным числом каналов и монтажом электродов. В результате модели обычно "зашиты" под конкретный сетап: переход с 64-канального больничного монтажа на 19-канальную гарнитуру даёт падение точности на 15–20%. Попытки создать универсальные foundation models для ЭЭГ предпринимались неоднократно, но все столкнулись с проблемой переноса между различными конфигурациями оборудования. BENDR (2021) заложил основу контрастного обучения для нейросигналов. TFM-Tokenizer (2023) предложил дискретные представления через VQ-VAE с хорошей сжимаемостью, но столкнулся с проблемами переноса между конфигурациями. BIOT (2024) разбивает временные ряды на патчи и обучает маскированные автоэнкодеры, достигнув SOTA на многих задачах, однако требует fine-tuning при смене монтажа. BrainLM (2024) применил подход GPT к сигналам мозга, показав впечатляющие результаты в zero-shot сценариях для задач классификации. CBraMod (2024) усилила пространственное моделирование через criss-cross attention и ACPE (Adaptive Channel Positional Encoding) - адаптивное позиционное кодирование каналов) на бейзлайн датасете TUH. EEG-GPT (2024) развил генеративный подход с достойными результатами генерации, но не справился с вариативностью электродов. NeuroBOLT (2024) предложил мультимодальную архитектуру, однако жёстко привязанную к конкретным паттернам пространственного расположения электродов. LaBraM (2024) масштабировался до 2.1B параметров, став крупнейшей моделью, но жестко привязан к фиксированным 20 каналам, обучая отдельные эмбеддинги для каждого конкретного канала. Все они имеют ограничения при переносе между монтажами - большинство требует fine-tuning при смене монтажа. REVE решает эту проблему через 4D позиционное кодирование на основе преобразований Фурье (x,y,z,t), которое работает с произвольными монтажами и длинами записей. Координаты электродов проецируются в мультичастотное пространство через синусоидальные и косинусоидальные функции, формируя позиционные эмбеддинги напрямую из физической геометрии. В отличие от выученных эмбеддингов каналов (LaBraM) и адаптивных схем позиционного кодирования (CBraMod), REVE кодирует именно геометрию электродов на поверхности головы, а не структуру датасета, что позволяет естественно интерполировать представления для новых пространственных конфигураций без переобучения. Предобучение проведено на 60k+ часах ЭЭГ из 92 датасетов и 25k субъектов 💥, включая клинику (TUH, Sleep‑EDF), BCI (3–118 каналов), эмоции (SEED, DEAP) и конфигурации от 4‑канальных гарнитур до 256‑канальных сеток. 💭Архитектура выглядит многообещающе, но поднимает вопросы по вычислительным затратам: кодирование пространственных координат для каждого токена добавляет накладные расходы. Отдельно интересно, как модель ведёт себя на биполярных монтажах. 💡Примечательно, что последний автор статьи - Giulia Lioi, одна из первых, кто работал над предсказанием фМРТ из ЭЭГ и повлиял на pyOpenNFT. Всегда любопытно видеть, как авторы, стартовавшие в классическом нейроимиджинге, со временем переходят к проектам в области AI4Science
Открыт набор менти в программу Skoltech Mentorship Друзья, делюсь новостью: второй год выступаю ментором в программе менторства Skoltech, и снова приглашаю на сессии! В прошлом году не все сессии проходили по плану — случались накладки, неожиданные повороты, но именно это делало процесс живым и честным. Обсуждали переход из академии в индустрию, разбирали конкретные офферы и выбор между ними, работали над тем, как упаковать research experience для tech компаний. Параллельно еще вела менти в программе Women in Tech, где фокус был на старте карьеры в айти. Особенно горжусь одной участницей — вместе работали над её позиционированием, CV и подготовкой к собеседованиям, и ей удалось успешно выйти на рынок труда! 😍 Какие запросы рассматриваю • CV и личный бренд — разберём, как презентовать ваш опыт, какие проекты выделить, как говорить о своих достижениях понятным языком • Карьерная стратегия — обсудим ваш запрос, будь то переход в индустрию, смена направления, выбор между офферами или планирование следующих шагов • Хот-топики — поговорим о том, что сейчас актуально в вашей области, какие навыки прокачивать, куда смотреть 🤩 О себе Мой исследовательский опыт находится на стыке ИИ и медицины. Работала с генеративными моделями для медицинских данных (ЭЭГ, фМРТ, омиксы), занималась разработкой ML/DL решений для табличных данных и биомедицинских сигналов. 🤩 Для кого это будет полезно - Студенты магистратуры и выпускники Skoltech (и других вузов), которые думают о карьере в tech - Исследователи, рассматривающие переход в индустрию - Люди на старте карьеры в ML/AI/Data Science - Те, кто хочет сменить направление или понять, куда двигаться дальше - Просто любопытные люди, которым интересно поговорить о карьере с разных сторон Формат свободный, можем встречаться онлайн, обсуждать то, что действительно актуально для вас. Регистрация уже открыта на сайте программы до 8.12. Буду рада видеть вас на сессиях!
🧠 Мультимодальные эмбеддинги Whisper для предсказания кортикальной активности при обработке естественной речи (Nature Human Behaviour '25) Исследователи из Принстона, Google и Еврейского университета представили метод изучения мозгом обработки естественной речи. Используя модель Whisper и электрокортикографию (ECoG), они предсказали нейронную активность во время 100+ часов реальных разговоров. 🌟Данные В исследовании участвовали 4 пациента с эпилепсией, у которых записывали более 100 часов непрерывной ECoG-активности. Собрали 520,000 слов из спонтанных разговоров с врачами, семьей и друзьями. Использовались 654 электрода в левом полушарии с полным покрытием языковых зон. Данные разделили примерно поровну: 50 часов (290k слов) для понимания речи (слушание) и 50 часов (230k слов) для произношения речи (говорение). 👍Архитектура Исследователи извлекли три типа эмбеддингов из Whisper для каждого слова. 💛Акустические эмбеддинги взяли из нулевого слоя энкодера размерностью 3,840 (10 × 384, 200 мс аудио) — это чистый акустический сигнал без контекста. ❤️Речевые эмбеддинги получили из 4-го слоя энкодера — они содержат контекстуализированные речевые признаки и лучше всего захватывают фонетическую структуру. 💜Языковые эмбеддинги извлекли из 3-го слоя декодера — они несут семантическую и синтаксическую информацию. ❤️Результаты❤️ 💋Модель достигла корреляции Пирсона до 0.50 между предсказанными и реальными сигналами. 💋Речевые эмбеддинги показали 274 значимых электрода при произношении речи и 186 при понимании. 💋Обнаружилась четкая иерархия обработки: слуховая кора (STG) и моторная кора лучше выравнивались с речевыми эмбеддингами (r до 0.5), тогда как зона Брока (IFG) и угловая извилина (AG) показали лучшее выравнивание с языковыми эмбеддингами (r до 0.25). При этом каждая область демонстрировала смешанную селективность — все зоны кодируют и речь, и язык, но с разными предпочтениями. 💋Анализ временной динамики показал интересные закономерности. Когда человек говорит, мозг начинает планировать слово заранее (примерно за 300 миллисекунд до произнесения). При слушании всё иначе: обработка начинается с началом слова и растягивается во времени по мере его произнесения. Интересно, что после того как человек сам что-то сказал, возникает второй пик активности — мозг обрабатывает собственный голос. 🥰 Интересные находки 📌Языковые эмбеддинги в сочетании с речевым вводом улучшили предсказания даже в языковых зонах мозга. Это показывает, что мозг, как и Whisper, интегрирует речевую и лингвистическую информацию. 📌Whisper научился распознавать лингвистические структуры без специального обучения: модель классифицирует фонемы с точностью 54% и части речи с точностью 67%, хотя её никогда этому не учили. 💫Почему это важно Для нейронауки это первая демонстрация того, что единая мультимодальная модель может предсказать активность мозга на всех уровнях языковой иерархии в условиях отличных от лабораторных протоколов. Для ИИ исследование подтверждает, что современные STT модели обрабатывают информацию способами, поразительно похожими на мозг 🤓
видео или голосовое, без подписи
видео или голосовое, без подписи
📎MICCAI part 2. review on selected posters 💜 BrainAlign: EEG-Vision Alignment via Frequency-Aware Temporal Encoder and Differentiable Cluster Assigner Decoding visual semantics from EEG faces high signal-to-noise ratios, complex inter-channel dependencies, and semantic misalignment with visual-language models. Architecture: BrainAlign's Frequency-Aware Temporal Encoder resolves the tension between spectral decomposition and temporal fidelity. The hybrid architecture transforms EEG signals 𝐗 ∈ ℝ^(C×T) via FFT, applies learnable bandpass filtering (1-50 Hz for α, β, θ oscillations), processes through cluster-aware MLPs, then reconstructs via inverse FFT: 𝐙 = irFFT(𝐙̂). Differentiable Cluster Assigner (DCA): DCA learns K soft cluster embeddings where channels dynamically group based on stimulus content. Gumbel-Softmax reparameterization enables gradient optimization of soft assignments, driving mask-based cross-attention to update cluster centers. The loss balances within-cluster similarity, between-cluster dissimilarity, and entropy regularization. 💕MOST: MR Reconstruction for Multiple Tasks via Continual Learning Clinical MRI workflows require reconstruction networks for multiple tasks (segmentation, classification, quantification). MOST enables sequential fine-tuning of a single network under limited storage and heterogeneous task structures. Technical Innovation: Replay-based continual learning for heterogeneous tasks. A fixed buffer (ℳ) stores samples from completed tasks. During training on task t, round-robin replay every K=3 iterations trains one iteration on previous task data. This cannot use unified mini-batches (2D segmentation masks ≠ 3D classification labels). Downstream networks remain frozen; only the reconstruction network 𝑓_R is fine-tuned. Image-Guided Loss: For segmentation, ℒ_IG = ℒ_R(𝑓_R(𝐱_t; θ), 𝐲_t) leverages reference images 𝐲_t providing structural supervision complementary to task loss. 🩵Forget-MI: Machine Unlearning for Forgetting Multimodal Information in Healthcare Settings Forget-MI addresses multimodal medical unlearning where patients have multiple studies and narrow embedding distributions make isolated point removal ineffective. Loss: Unimodal unlearning ℒ_UU = -Dist([𝐅_ul(𝐈_f), 𝐅_ul(𝐓_f)], [𝐅_og(𝐈̃_f), 𝐅_og(𝐓̃_f)]) pushes unlearning model embeddings away from original model representations on noisy versions (𝐈̃_f, 𝐓̃_f) of forget pairs. Multimodal unlearning ℒ_MU targets joint embeddings to break cross-modal correlations. Retention losses ℒ_UR and ℒ_MR keep retain set embeddings close to original. Noise perturbation (Gaussian σ=0.1 for images, character-level for text) creates neighborhoods around forget points. Verification via MIA: An SVM classifier trained on retain/test losses attempts to identify forget samples. MIA = 1.0 indicates failed unlearning; MIA = 0.0 indicates success. The approach reduces MIA from 1.000 to 0.571-0.810 (3%-10% forget)
видео или голосовое, без подписи
видео или голосовое, без подписи