tgindex
Машин лернинг

Машин лернинг

Статистика

О буднях ученого и моей любви к текстам (NLP, обзоры на книги и писательские практики), а также про AI in education Для связи @zlatamaria NLP Researcher AIRI & PhD 3d year Skoltech HSE, NES and Skoltech graduate

Последний пост
17 окт. 2025 г.
Последнее чтение
15 авг.
Постов за неделю
0
Всего постов
29
Тип
открытый
Язык
русский
Категория
Книги
В каталоге с
14 авг.
Подписчики
1 124
0 за 3 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
1 173
29 постов
Вовлечённость
104,4%
к подписчикам
Постов в день
0,0
всего 29
Упоминаний
0
каналов
Охват размещения
оценка
1/24сутки в ленте
1/48двое суток
1/72трое суток

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • ✨На конфе было большое количество трэков и соответствующих дедлайнов. Я сабмитила эбстракты и делала withdraw, пока не наступил последний дедлайн, — Late Breaking Results — и капс локом в голове "Маша, или сейчас пишем, или никогда". Где-то за неделю я собрала нужные инсайты и соответствующие ссылки и за 3 для написала. ✨Далее меня очень позабавило, что я фактически no name для этого community, но они написали "очень срочно нужны ревьюеры, спасите". Я отревьюла 3 статьи, и дисперсия качества работ была очень похоже на то, что я увидела впоследствии на большем срезе на самой конференции. Одна была про federated learning для образования, хорошо написана, но как будто ничего нового, вторая была для меня интересная - ребята строили марковские цепи для моделирования перехода со слайда на слайд, где корреляция со временем просмотра, порядком, правильностью выполнения задач позволяла выявлять трудные для понимания слайды. С последней работы я поорала знатно, чуваки для своей задачи обучили несколько ML моделей, а в конце вставили "neural net", но смотрелось это так, будто они этим очень гордились - какая сетка, сколько эпох учили, какие гиперпараметры - об этом ни слова. ✨На саму статью было 3 рецензии, метаревью так и не было))) Учитывая мои оценки (weak reject, borderline conference, strong accept) и оценки тех статей, которые я ревьюила, ребята как будто убирали самую худшую оценку или оставляли только самую лучшую — в общем, при всей предвзятости процесса рецензирования как такового — к этому было уже слишком много вопросов. ➡ Но я правда была очень рада, когда сова принесла мне письмо счастья с accept'ом (видите сколько эмоций в одном посте)! История эта вся к чему (помимо летописи ярких моментов моей научной жизни) — меньше думайте, больше доверяйтесь своим импульсам и решайтесь. Эту статью должны были принять ну с очень маленькой вероятностью (итоговый acceptance rate - 35%), но мне просто было очень интересно (в крайнем случае вам бы тут рассказала про свои великие идеи). И манифестации работают — фотка с venue конфы была в сохраненных в телефоне еще в прошлом году. P.S. Не переключаемся, про саму статью и фоточки из Италии в следующих постах (если жизнь еще не втянет меня в какой-то бесконечный поток событий). И спасибо, что все еще читаете меня :) #conferences #ai_education

  • без подписи

  • /AIED: part1/ Уже пора уезжать на следующую конференцию, а я еще не рассказала про две предыдущие:) Мое вливание в мир DL из экономики началось примерно тогда, когда я увидела на Kaggle вот эту сореву и поняла, что этой задачей я занималась бы с горящими глазами, а не тем, что я делаю на работе. Помню примерно тогда же у меня был one-to-one с начальником, где он недоумевал, почему я не проявляю достаточно инициативы и энтузиазма, чтобы забрать на себя все направление. На что я про себя думала "чувак, ну очевидно же почему — мне в глубине души абсолютно все равно заработает больше наш заказчик или его конкурент". Так вот, сорева была тесна связна с концепцией knowledge tracing — это когда мы трекаем всю историю взаимодействия студента с обучающими материалами, знаем связь между ними и предсказываем на этой основе, как он справится со следующей задачей или наоборот,  что ему может в этом помочь. И ниточка за ниточкой, я добралась до конфы AIED - Artificial Intelligence in Education. Было мечтой туда попасть, но в лабе мы занимаемся совсем другими вещами, а если очень долго отодвигать в сторону то, чем тебе хотелось бы заниматься больше всего, то можно легко словить выгорание. Так как я понимала, что "нормальную" статью я точно написать не успею, мозг бесконечно итерируя сошелся к идее писать "position paper". ⬆Что такое position paper? Для position paper необязательно придумывать новые теории и даже проводить новые эксперименты, важно подсветить проблему для community, которую ты считаешь важной (выглядит как тренд, position tracks есть и на ICML, и на NeurIPS ввели в этом году). Моя идея выкристаллизовалась вокруг невозможности AI text detection и последствий этого для обучения. Забавно, что сама идея собралась вокруг постов в тг-каналах и блог-постах, за которые мой глаз цеплялся и постепенно эту информацию аккумулировал.

  • /Will It Still Be True Tomorrow? Multilingual Evergreen Question Classification to Improve Trustworthy QA/ Одна из задач, которой мы занимаемся в команде, - задача адаптивного ретривала. Замечали когда-нибудь, когда использовали ChatGPT, "searching the Web"? Когда и как алгоритм решает, что можно положиться исключительно на параметрические знания, а когда необходимо поискать релевантный контекст? Одним из возможных аспектов является темпоральность. В нашей новой работе мы вводим понятие 🌿 Evergreenness. Вопрос является 🌿 evergreen, если ответ на него не меняется с течением времени (а значит и искать для него никакой контекст скорее всего не нужно, модель и так знает на него ответ). Давайте посмотрим на два вопроса: 🔺 «Кто сейчас президент США?» — это изменчивый факт 🍂, президетнами были и Джо Байден, и Дональд Трамп, и Барак Обама; и вообще "сейчас - это когда для модели?" 🔺 «Кто был первым президентом США?» — а это уже стабильный 🌿, evergreen fact, он не изменится с течением времени Чтобы обучить модель различать такие вопросы, мы дообучили классификатор EG-E5 на датасете EverGreenQA — 4,757 реальных пользовательских вопросов на 7 языках. Что мы узнали? 1⃣ Если вопрос 🌿 evergreen, модель, скорее всего, ответит правильно и без необходимости запускать пайплайн RAG, но если вопрос изменчивый — прогнозировать результат сложнее. 2⃣ Аспект evergreenness позволяет улучшить калибрацию, то есть корреляцию уверенности модели в ответе и действительной корректности ответы 3⃣ Фильтрация изменчивых вопросов отличная идея для фильтрации QA датасетов и бенчмарков, где "золотые" ответы на вопросы уже давно перестали быть таковыми (см картинку 2) 4⃣ Фича сильно коррелирует с кейсами, когда GPT4о ходит в ретрив 5⃣ Анализ ошибок выявляет интересные кейсы для будущих исследований. Например, вопрос "Какая жена у актера Х?" в общем случае изменчивый. Но если человек умирает, все вопросы о нём становятся evergreen. Также модель начинает теряться касательно вопросов про недавние годы (2023-2024), ведь у неё нет «чувства времени». (см картинку 3) P.S. Считаю эту работу одной из лучших, в которой я участвовала. Обычно датасет это просто датасет без конкретных идей о том, для каких задач его можно применить. Метафора с листочками - топ! Ну и сама подача (визуализация) - вау) P.P.S. Мой коллега, соавтор этой статьи, завел замечательный канал с замечательным названием - Рандомные галлюцинации - присоединяйтесь! 📄 Статья 💻 GitHub 📊 Датасет 📢 Понравилось исследование? Поддержите нашу папиру лайком на Hugging Face в daily papers! #nlp

  • без подписи

  • без подписи

  • без подписи

  • How much did your paper co-authors work? They didn't work et al. (c) Maria Ulyanova

  • без подписи

  • без подписи

  • без подписи

  • /Можно ли использовать галлюцинации с пользой? Разбираемся/ Мои коллеги разработали новый метод - 🔍Through the Looking Glass (TLG) - который позволяет детектить странные картинки. Пингвины, собирающие бананы? Воробей, солирующий на рок-концерте? Снеговик в пустыне? Или тень от кошки, которая вдруг стала собачьей? Все это кажется нам странным, хотя каждая часть по отдельности выглядит нормально. Мы, люди, улавливаем эту странность почти мгновенно. Почему? Потому что мозг сочетает зрительное восприятие с common sense — знанием о мире, его логике и правилах. TLG делает то же самое немного иначе: сочетает большие LVLM модели (мультимодальные модели, работающие с текстом и картинками) с легковесным attention-классификатором, чтобы уловить внутренние противоречия в изображении. Как это работает: Интуитивно: Когда изображение противоречит здравому смыслу, модель начинает "галлюцинировать" и выдает противоречивые факты. Остается лишь измерить согласованность этих фактов — если они противоречат друг другу, скорее всего, изображение не имеет смысла. Технически: Шаг 1⃣: LVLM + Diverse Beam Search → генерируем много текстовых описаний (фактов) по картинке Шаг2⃣: Attention-poling классификатор: 🔷кодируем факты 🔷применяем average pooling для каждого 🔷присваиваем внимание (attention) каждому факту 🔷объединяем взвешенные вектора в один 🔷классифицируем изображение как "нормальное" или "странное" Чем работа хороша? 🔺Достигает наилучших результатов на датасете WHOOPS! (204 картинки) на открытых моделях, превосходя clip-based, open llm-based, linear probing решения 🔺Превосходит GPT 4o на новом бенчмарке WEIRD, который сделали ребята и описали методологию создания (824 картинки) 🔺 Сам классификатор весьма легковесный (8B параметров) 📄 Статья 💻 GitHub Если статья или картинки понравились — поддержите ребят в Daily Papers ❤️ #nlp

  • как привлечь зумеров)

  • Буду рада, если поддержите нас и поставите Upvote ⬆️ на HuggingFace! 💥 https://huggingface.co/papers/2502.14502

  • /How Much Knowledge Can You Pack into a LoRA Adapter without Harming LLM?/ Long time no see! Но как не вернуться и не рассказать про собственную статью) Первую статью, которую опубликовали в Core A, где ты один из первых авторов, и которую писала в ночь перед дедлайном до 5 утра. Незабываемые все ощущения, особенно рада, что хвалила себя и праздновала сразу после отправки и до вердикта, потому что хвалить надо за приложенные усилия. Давайте про статью) Когда мы дообучаем модель под конкретную задачу, то, как правило, мы трекаем метрики качества этой задачи, но не знаем, что мы сломали в этой модели по дороге. Давайте проанализируем это на конкретной задаче. Возьмем Llama 3.1 8b Instruct, LoRA и постараемся дообучить модель знаниям, которые она не знала до этого. Знания в этом случае — это правильные ответы на вопросы. Как мы трекаем, что модель чему-то разучается? Во-первых, внутренние метрики. Я писала про категории знаний, и мы пытаемся проверить, сколько ответов на вопросы из теста модель из HighlyKnown перевела в Unknown (отрицательный сдвиг), и из Unknown в HighlyKnown (положительный сдвиг). Во-вторых, внешние метрики, мы проверяем, на сколько модель теряет reasoning skills на MMLU и ThruthfulQA после дообучения модели. 💥 Что мы узнали? Модель может выучить до 3000 новых знаний, при этом подмешивание в обучении парафраз или HighlyKnown знаний на каждое знание, которое модель не знает, может помочь модели не растерять ее способности. При этом подмешивание HighlyKnown знаний помогает увеличить положительный сдвиг, уменьшая отрицательный сдвиг. В противовес подмешивание парафраз на каждое знание, которое модель не знает, меньше ухудшает reasoning на MMLU и TruthfulQA. 👀 Что было неожиданным? 💥При обучении новым знаниям модель выучивает не только то, чему ее учили, но и дополнительные знания. Что это за знания такие? Как правило, это знания из того же домена (по структуре графа знаний): например, если мы учили модель правильно называть столицу штата, она выучивает и другие столицы штатов. 💥После обучения убивается способность модели быть неуверенной и говорить "я не знаю ответ на вопрос". 💥Если количество парафраз или HighlyKnown знаний в ответ на вопрос было небольшим на каждое новое знание, модель может выродиться всего в несколько ответов. Например, если в обучении несколько раз встречался ответ "Moscow", то на тестовых вопросах этот ответ встретится в 60% случаев, хотя на самом деле встречается всего в 2% случаев. Важно! Модель училась и тестировалась на вопросах, которые были сгенерированы из троек графов знаний, то есть не попадали в обучение той же Llama 3.1 8b Instruct. Статья, GitHub #nlp

  • Пока радость в моменте, чуть позже про саму статью: Dear Maria Lysyuk, Congratulations! We are delighted to inform you that your submission to NAACL 2025, How Much Knowledge Can You Pack into a LoRA Adapter without Harming LLM?, has been accepted to the NAACL Findings.

  • /AI & лингвистика & нейронауки/ Наткнулась на интервью трех ученых из MIT, которые работают на пересечении лингвистики, нейронаук и компьютерных наук. Каждый из них закончил одно из соответствующих PhD. Показались нетривиальными направления исследований, которыми они занимаются: 🔺 Правда ли что язык связан с мышлением? Если это так, то соответствующие участки в мозге будут активироваться даже при выполнении не лингвистических задач. Но это неправда как минимум для арифметики, обработки музыки и общей рабочей памяти. Язык не является необходимым условием для развития сложного мышления, в том числе символического. 🔺По движениям глаз во время прохождения теста можно предсказать, насколько хорошо человек сдаст английский как неродной (второй) язык. 🔺Как твой родной язык может исказить восприятие того, что тебе говорит собеседник? 🔺 Как и почему язык, которым пишут юристы, как правило, настолько сложен для понимания не юристами? 🔺Какие слова являются наиболее запоминающимися для нас? Один из выводов — у слова не должно быть синонимов и оно должно быть однозначным. 🔺Набор тестов для возможностей моделирования мира LLM Одна из этой троицы, Эвелина Федоренко переезжала учиться в штаты в 90-ых из СССР, вот тут много про ее путь, в том числе как родители на год отправляли жить в другую семью в штатах. Но мой глаз как всегда зацепился за трогательное: "My mom raised me telling me that I can do anything, be anyone if I wanted to and worked hard. This powerful notion became and remains deeply embedded in my brain. It’s really a very American way of thinking, and I still don’t quite know how my mom (born in the 1950s in the USSR) had this idealism in her, this vision; but I will be forever grateful to her for what she enabled me to become." #science

  • /Book challenge'2025/ Посмотрела видео у Саши Митрошиной, что ей дал challenge 52 книг в год. Вынесу из видео то, что понравилось мне, и сама решила публично закоммититься на 30 книг в 2025. Зачем? Любой игровой формат добавляет в жизнь осмысленность, плюс у меня хромает дисциплинированность и системность, хочется ее прокачать. Почему 30? "Важно задать себе адекватный темп и с собой договориться". Мне кажется, мне комфортно читать по 1 книге в 2 недели, но раз это challenge, то пусть будет 30 до красивого числа. Tips and tricks: 🟣 Читать интересное, бросать неинтересное. Простой совет, но иногда как будто жалко, особенно если уже купил книгу или вроде как много кому она понравилась. 🟣 Утром читать что-то более сложное (научпоп), вечером перед сном художку. Прикольный совет, не читала 2 книжки одновременно, хочу попробовать. Вечером действительно уже хочется расслабиться и не читать сильно нагруженный текст, а в метро утром как раз можно почитать что-то более сложное. 🟣 Почему читать художку полезно? Оказывается, это развивает эмпатию. Мне особенно откликается, когда герой испытывает какие-то чувства, которые не испытывали твои близкие или ты не готов ими поделиться. Чувствуешь себя не таким одиноким. Плюс, хочешь научиться хорошо писать — читай классику, замечено, что по крайней мере в моменте твой слог становится лучше. 🟣 Важно создать себе среду и вести reading lists. Сейчас может быть неинтересна книга, но если ты ее сохранил, потом глаз зацепится за важное. Тема должна быть по запросу в текущий период . Пару дней назад заметила, что знакомая нахваливает книгу, которую я купила 2 года назад и так не прочитала. И в голове щелкнуло — о, вот сейчас зайдет! 🟣 Фиксация прочитанного. Я не могу кощунственно выделять в книге главное маркерами, но читаю с карандашом. После прочтения делаю конспект, чтобы в памяти больше отложилось. Это все немного утомительно. Думаю перейти к формату, где делаю конспекты только на книги, которые прям как-то сильно что-то во мне поменяли, в остальном сохранять пару цитат. Что может дать челлендж? 🟣 Удовлетворенность собой (поставил себе задачку и не слился с длинной дистанции) 🟣 Поддерживающая рутина (время наедине с собой) 🟣 Попробовать внедрить полезную привычку — книга вместо телефона перед сном. У меня проблемы со сном, так что выглядит как то, что надо попробовать Мой reading list для вдохновения. #literature

  • /Рефлексия/ Думаю внутри себя, какие каналы интересно читать мне, таким образом формулируя критерии, которым мне хотелось бы, чтобы соответствовал мой канал. Мне все же кажется, что интересные для меня телеграм-каналы, ютуб-каналы, инстаграмы — это такой сериал про реального человека. Раз сериал, то должна быть смесь экспертного и личного. Только личное мне в общем-то интересно только от друзей, а только экспертное превращается в поток непрочитанных сообщений от канала, которые можно отправить в reading list когда-нибудь на потом. Хороший сериал хоть и держит просматривающего в напряжении до следующей серии, но должен быть регулярным, чтобы киноман о нем не забыл. С регулярностью у меня проблемы и пока осознала такие причины: 1⃣ Экспертные посты писать сложнее, так как хочется, чтобы это была какая-то агрегированная и переработанная информация; если писатель выливает неструктурированный поток информации, я как читатель считываю это как неуважение 2⃣ Любой регулярный блоггинг превращается в какую-то непрерывную необходимость делать что-то с оценкой того, а превратится ли это в контент (про это Ольга Макарова очень классно недавно написала, strongly recommend), и это утомляет. Как знаете, поехал в путешествие и вместо того, чтобы наслаждаться моментом, начинаешь фоткать все подряд, а потом еще умираешь, отбирая лучшие кадры 3⃣ Мы как общество осуждаем консьюмеризм, но информационный консьюмеризм меня лично уже утомляет сильнее. Хочется более редкого, но более качественного и тебе лично откликающегося контента, но как будто это уже противоречит той самой регулярной сериальности Надеюсь, найду свой формат и пойму, как комфортнее писать мне, не предавая при этом то, что считаю правильным. А в связи с наступлением грядущего года, хочу посоветовать еще один пост Ольги (топ-3 психологов, которые концентрированно и метко подают информацию, на мой вкус) о том, что важнее всего. О том, что мы всегда внутри знаем, что нам нужно на самом деле. #personal

  • Все итоги подводят, а канал тоже должен подводить)* Несмотря на завидную нерегулярность моего постинга, вы все еще тут, почти 1000 раз что-то переслали, а значит нашли это ценным, спасибо вам, дорогие подписчики, мне приятно! * (сделать свою можно через @TGStat_Bot по запросу "2024 @username")