tgindex
Хроники ботки

Хроники ботки

Статистика
@botka_chronicsрусский

Пишу интересные вещи, с которыми сталкиваюсь по работе над диссером (обобщение keypoints detection с помощью дифференциальной геометрии) и работой над работой (ML и матстат в основном) Вопросы и т.п. писать в чат или @shpacman

Последний пост
18 февр.
Последнее чтение
13 авг.
Постов за неделю
0
Всего постов
20
Тип
открытый
Язык
русский
В каталоге с
13 авг.
Подписчики
598
+1 за 3 дн.
Сутки
+1
+0,17%
Неделя
 
Месяц
 
Просмотров на пост
985
20 постов
Вовлечённость
164,7%
к подписчикам
Постов в день
0,0
всего 20
Упоминаний
0
каналов
Охват размещения
оценка
1/24сутки в ленте
1/48двое суток
1/72трое суток

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 18 февр.551616из gonzo_ML

    Ещё вам работ про геометрию! Диффузионки на эмбеддингах DINO работают не очень, в недавней работе про RAE предлагали для этого расширять DiT. Но оказалось, что дело в неевклидовой геометрии и надо сделать правильные лоссы и двигаться по геодезическим, чтобы не уходить с многообразия. В каком-то смысле перекликающаяся работа была не так давно про FAE (https://t.me/gonzo_ML_podcasts/2013), но там не в самом пространстве DINO работали, а учились его сжимать так, чтобы DiT с ним хорошо работал. Теперь научились пространство не сжимать, а сам DiT при этом не расширять (как в RAE). Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders Amandeep Kumar, Vishal M. Patel Статья: https://arxiv.org/abs/2602.10099 Код: https://github.com/amandpkr/RJF Ревью: https://arxiviq.substack.com/p/learning-on-the-manifold-unlocking # TL;DR ЧТО сделали: Предложили метод Riemannian Flow Matching with Jacobi Regularization (RJF). Он позволяет обучать стандартные диффузионные трансформеры (DiT) напрямую в пространстве признаков предобученных энкодеров (DINOv2, SigLIP). Суть метода в замене евклидовой линейной интерполяции на геодезические пути на гиперсфере (S^{d-1}) и взвешивании лосса с учётом кривизны пространства. ПОЧЕМУ это важно: Работа опровергает гипотезу о «бутылочном горлышке ёмкости» (capacity bottleneck), выдвинутую в недавней статье про RAE (https://arxiv.org/abs/2510.11690). Ранее считалось, что DiT не справляются с высокоразмерными латентами без колоссального увеличения ширины модели (width scaling). Авторы доказывают: проблема не в размере модели, а в геометрии. Учёт топологии многообразия позволяет обычному DiT-B (131M параметров) выдавать SOTA-уровень (FID 3.37 на ImageNet-256), обходя куда более тяжеловесные бейзлайны. Читать тут: https://t.me/gonzo_ML_podcasts/2458

  • 22 окт.4 7591333

    23 октября, чт, в 17 00 (gmt+3) Александр Червов (Институт Кюри) выступит на семинаре Центра практического искусственного интеллекта Сбера (Sber AI Lab) с рассказом о библиотеке CayleyPy и статье по ней CayleyPy — библиотека на базе ИИ для теории графов и групп (NIPS 2025 Spotlight) Будут представлены новые ИИ-подходы для задач классической теории групп и графов, которые значительно превосходят существующие системы компьютерной алгебры по производительности. С помощью библиотеки предложено около 200 новых математических гипотез, а также даны решения на вопросы, остававшиеся открытыми более 50 лет. Статья по одному из применений библиотеки принята на spotlight NIPS 2025 - A Machine Learning Approach That Beats Large Rubik's Cubes По поводу ссылки на онлайн подключение обращайтесь @Alexander_V_C или @Shpacman

  • 19 сент. 2025 г.976208из qdiag

    Нашу статью взяли на NeurIPS 2025! arxiv:2502.13266 Статья "A Machine Learning Approach That Beats Large Rubik's Cubes" про то как находить путь на больших графах в принципе, и про то как with zero human knowledge собирать Кубик Рубика 3x3, 4x4, 5x5, пятнашки до 6x6, ... и другие перестановочные пазлы в частности. Для понимания масштаба: кубик 5x5 это 10⁷⁴ состояний, а мы там находим достаточно короткий (лучший из опубликованных) путь сборки. Код к статье доступен на git cayleypy-cube. Забавно что для меня это началось с этого поста 2 года назад, а потом списались с @Alexander_V_C (огромное ему спасибо) и как-то так и пошла интернет коллаборация. Собственно про метод писал здесь, и потом ещё подробнее напишу. Красиво, что просто немного случайно блуждая по графу, можно обучить модель очень хорошей эвристике, достаточной для ориентирования на широком классе графов. Мне очень давно хотелось, чтобы какой-нибудь такой сюжет существующий из любопытства в рамках хобби добрался до рецензий. А тут не просто добрался, но и на A* конференцию, ещё и выдвинули на spotlight (топ 15% от принятых работ). Воот)

  • 19 сент. 2025 г.748105из sberlogabig

    Первую статью нашего проекта CayleyPy приняли на NIPS (наиболее престижная конференция и публикация в области машинного обучения) https://openreview.net/forum?id=31CaYYw1Xz Более того это spotlight - что примерно 3% от всех представленных статей (688 из 25000+). Продолжаем и присоединяйтесь ! Все кому интересен МЛ, математика, биоинформатика... См. предыдущий пост: https://t.me/sberlogabig/581 А также пост одного из соавторов:

  • Ребята чисто на опенсорсе и энтузиазме, в свободное время двигали проект и попали в топ работ НИПСа, куда, казалось, вообще невозможно попасть если ты не фул тайм ресерчер, желательно с большим количеством компьюта. Очень круто!

  • 17 февр. 2025 г.1 085629из smalldatascience

    #видео Доклады прошлого года семинара "Математические основы искусственного интеллекта", который проводит Математический институт им. В.А. Стеклова. Выложены записи выступлений Бурнаева, Гасникова, Ветрова, Наумова, Оселедца, Разборова и многих других. https://www.mathnet.ru/conf2402 П.С. Рисунок взят из доклада Димы Ветрова, когда он объясняет, как попадать в широкие минимумы функций потерь.

  • 18 сент. 2024 г.1 29112из sberlogabig

    🚀 @SBERLOGASCI webinar on mathematics and data science: 👨‍🔬 Sergei Gukov "What makes math problems hard for reinforcement learning: a case study" ⌚️ 19 September, Thursday 19.00 Moscow time Add to Google Calendar Can AI solve hard and interesting research-level math problems? While there is no mathematical definition of what makes a mathematical problem hard or interesting, we can provisionally define such problems as those that are well known to an average professional mathematician and have remained open for N years. The larger the value of N, the harder the problem. Using examples from combinatorial group theory and low-dimensional topology, in this talk I will explain that solving such hard long-standing math problems holds enormous potential for AI algorithm development, providing a natural path toward Artificial General Intelligence (AGI). The talk is based on a recent paper: https://arxiv.org/abs/2408.15332 О докладчике: Сергей Гуков - профессор КалТех, выпускник МФТИ и Принстона, один из наиболее известных специалистов по теории струн и математической физике, в последние годы занимающийся применением методов Reinforcement Leaning к задачам математики и физики. Zoom link will be in @sberlogabig just before start. Video records: https://www.youtube.com/c/SciBerloga and in telegram: https://t.me/sberlogasci/19688 - subscribe ! Анонс на твиттер: https://x.com/sberloga/status/1835702457260765359 Ваши лайки и репосты - очень welcome !

  • 10 авг. 2024 г.1 104217из smalldatascience

    #книга Каждая книга — кража у собственной жизни. // Марина Цветаева И ещё одна моя книжка... когда-то я придумал игру для студентов "Что здесь изображено?". В последний год довольно много взаимодействовал со школьниками, им она тоже "зашла", как и учителям. Меня спросили, есть ли какой-то сборник заданий по этой игре... пришлось его срочно составить.

  • 20 июл. 2024 г.1 1631из quant_prune_distill

    Метод Общий фреймворк выглядит следующим образом: ▶️ Функция преобразования данных f_X (X - входные данные) ▶️ Функция конструкции смешивающей матрицы f_M L x L, которая может быть постоянной или зависеть от входов ▶️ Результат sequence mixing имеет вид f_M(f_X (X)) Далее авторы вводят термин Sequence Aligned Matrices (SAM, еще один… 🥱) означающий, что матрица смешивания зависит от входных данных. Такие sequece миксеры хороши с одной стороны тем, что более адаптивно подстраиваются под входы, и, кроме того, работают с последовательностями разной длины. Авторы рассматривают разные механизмы из литературы: ⭐️ MLP-Mixer, S4, H3, Monarch, Vandermonde и Cauchy миксеры - не SAM ⭐️ Attention, Linear Attention, S6, SSD - SAM Потому хороший двунаправленный sequence mixer должен быть SAM, и представлять собой некоторую структурированную матрицу. В частности, предлагаются способы сделать Vandermonde и Cauchy миксеры зависящими от входов, но основной упор делается на прокачку SSD (не твердотельного жесткого диска, а механизма в Mamba-2!) под двунаправленность. Напомним, что SSD во второй мамбе является полуразложимыми (semi-separable) матрицей - каждый блок является низкоранговой матрицей. Для двунаправленности можно было бы чередовать слои SSD (один бегущий слева направо, другой справа налево), но здесь предлагают использование одной матрицы смешивания, такой что любой ее блок в верхне-треугольной и нижне-треугольной части является низкоранговой матрицей. Иначе говоря, получается нечто типа суммы исходной SSD из Mamba-2 (нижнетреугольной матрицы) и транспонированной по длине последовательности (верхнетреугольной матрицы) и диагональной части. Такие матрицы называют квазиразложимыми (QS). Данная модификация требует всего пары дополнительных строчек в реализации по сравнению с исходным SSD слоем (shift - сдвиг на один элемент, flip - разворот последовательности задом наперед, DX - диагональная добавка). QS(X) = shift(SS(X)) + flip(shift(SS(flip(X)))) + DX Называют гидрой, потому что много голов, как в SSD, и звучит красиво 😹. Эксперименты Метод валидируют на задаче Masked Language Modelling, где в качестве бейзлайнов берется BERT, обученный по рецепту от MosaicML, и иные варианты sequence mixerов из литературы. Для оценки качества моделей смотрят на валидационную кросс-энтропию на C4 (на train set которого обучают) и точность на бенчах из GLUE. Все модели имеют размер порядка 70M параметров (несколько меньше, чем BERT-Base), так что хрен вам SOTA на LMSYS. Hydra модели глубже трансформеров примерно в 2️⃣ раза при примерно том же числе параметров. SAM модели стабильно опережают свои не SAM версии (Toeplitz, Cauchy, Vandermonde с параметрами, зависящими от входа, заметно точнее версии с обучаемыми, не зависящими). Hydra (естесна), лучше всех, и на втором месте любимый нами трансформер. Однако, памятуя о недавнем результате MobileLLM, где более глубокие и тонкие трансформеры, оказываются лучше по качеству более коротких и жирных при том же числе параметров, задаешься вопросом - можно ли устранить разрыв в качестве за счет изменения конфигурации трансформера 🤔? Исходная Mamba-2 не очень сильна в MLM, так как умеет обрабатывать информацию только в одном направлении, и предложенный способ (Hydra) лучше вариантов с суммой, конкатенацией, и перемножением результатов двух мамб-2. Далее метод проверяют на задаче классификации ImageNet-1k, где обучают модели размера порядка ViT-Base (87-91M параметров) и Hydra опережает ViT-B, Hyena и S4. Однако, ViT бейзлайн вызывает вопросы, ибо согласно их результатам ViT-B имеет top-1 точность 78.8%, а его EMA 80.6%, в то время, как c рецептом обучения из Swin, на который они ссылаются (унаследованный в свою очередь из DeiT) выдает 81.8% (их лучший результат 81.6%)

  • 20 июл. 2024 г.7002из quant_prune_distill

    Hydra: Bidirectional State Space Models Through Generalized Matrix Mixers [Статья][Код] Современные нейронные сети, обрабатывающие пространственно-временные данные различной природы будь то текст 📝, изображения 📷, аудио 🎵 и видео 📹 так или иначе обладают механизмом перемешивания каналов (channel mixing), обрабатывающим независимо признаки для каждого элемента последовательности, и механизмом обработки последовательности (sequence mixing), использования взаимосвязей между элементами. В сегодняшнем рассказе речь пойдет про sequence mixing. Существуют разнообразные опции sequence mixing. Операция смешивания может не зависеть от входа, как например свертка или обучаемая матрица L x L (L - длина последовательности) в MLP-Mixer, S4 и H3 state-space модели, или зависеть - attention механизм в трансформерах или Mamba (Selective State Spaces). Кроме того, разные механизмы обладают разной сложностью от длины последовательности. Sequence mixing в Attention или MLP-Mixer требует квадратичного по длине последовательности числа элементарных операций с плавающей точкой (FLOPs), так как используют матричную операцию довольно общего вида. Sequence mixers, обладающие некоторой структурой (низкоранговые, Toeplitz матрицы, DFT, бабочки) позволяют добиваться субквадратичной сложности (обычно с некоторой просадкой в качестве). И sequence mixing может быть как причинным (causal attention, большинство SSM, в частности, модная нынче Mamba 🐍), где текущий элемент последовательности может смотреть только в прошлое, и двунаправленным (как в masked language modelling, и большинстве задач с ViTами), где элементы последовательности могут изменять свое состояние, как глядя как на прошлые, так и на будущие токены. И задача, которую, перед собой ставят авторы в данной работе - получение эффективного механизма двунаправленного sequence mixing, такого, чтобы он был с одной стороны субквадратичным (в идеале линейным по длине последовательности) и в то же время выразительным.

  • 20 июл. 2024 г.606413из junkyardmathml

    Недавно прошла ICLR 2024. Собрал запоминающиеся и важные статьи по интересным мне темам. Knowledge Graph Reasoning and Question Answering - рассуждение и генерация ответов на графах знаний. 1. Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning - ответим на вопрос "Кто ребенок Алисы?". Сначала на стадии планирования генерируем LLMкой путь отношений z = {marry to → father of}, затем накладываем его на граф знаний wz = (Alice) marry to → (Bob) father of → (Charlie), из структуры графа получаем ответ Charlie. Т.е. в каком-то смысле паттерн-матчинг. LLM знает про структуру графа и через Planning optimization учится создавать все более релевантные пути отношений. LLM и все, что в них обитает: 1. Unveiling the Pitfalls of Knowledge Editing for Large Language Models - авторы исследуют проблемы, возникающие в процессе редактирования знаний внутри LLM, более подробно в прошлом посте. Из-за запутанной структуры знаний внутри LLM после редактирования появляются необратимые изменения (метастазы), отражающиеся на множество других сопряженных знаний. Даже если измененный факт отредактировать обратно, то на последствия исходного изменения это не повлияет. Еще рассматриваются логические противоречивые хирургий знаний и их следствия. Тема очень важная в контексте Safety AI. 2. The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets - геометрия правды и лжи. По моему мнению, самая интересная статья на конфе. Авторы показывают, что истинные и ложные утверждения образуют разделимые линейные структуры во внутренних представлениях LLM World Modeling - задача изучения богатого представления, которое учитывает динамику среды, что позволяет агенту прогнозировать будущие состояния и последствия своих действий. Классическое поле тестирования агентов - Minecraft. 1. Mastering Memory Tasks with World Models - продолжение и развитие идеи DreamerV3, В Статье улучшает структуру памяти агента из DreamerV3 и позволяет учитывать более долгосрочные зависимости в Модели Мира, может предсказывать на большее кол-во шагов вперед. На свободную тематику: 1. Talk like a graph: Encoding graphs for large language models - идея крайне простая, но любопытная: как можно энкодить графы внутрь LLM? Спойлер: если в промпте граф описываешь не просто перечислением вершин и ребер: "G граф с нодами 0...8, и ребрами: (0,1),(0,2)…(7,8).", а через структуру отношений в терминах Игры Престолов: "G граф взаимоотношений разных персонажей Ned, Cat, Daenerys...Jaime. В этом графе: Ned and Cat дружат...Cersei and Jaime дружат.", то LLM лучше воспринимает граф, и может больше про него сказать всякой чисто графовой инфы, типа сколько компонент связности, какая степень вершины итд. Всего Тестировалось 9 способов промптить граф. 2. Interpreting CLIP's Image Representation via Text-Based Decomposition - интерпретация внутренней структуры ViT из CLIP. Авторы определяют, какая голова ViT за какой смысловой аспект отвечает. То, что на головах происходит диверсефикация фичей, т.е. разные головы смотрят на разные объекты и уровни абстракции - это известно еще со статьи, где саму архитектуру ViT предлагали, но в данной работе конкретизируется, какая голова отвечает за форму, какая за цвета, итд. Статья - существенный вклад в explainable AI. 3. ULTRA Towards Foundation Models for Knowledge Graph Reasoning - предлагается архитектура фундаментальной модели GNN. Более подробно в этом посте. 4. Neural Network Expressive Power Analysis Via Manifold Topology - оценивается верхняя граница длины FC сети в терминах топологической сложности (сумма чисел Бетти) обучающих данных. В статье все строго доказывается, и это была бы очень хорошая работа, если бы не ограничение на размерность многообразия = 3, но мб это хороший старт для обобщения на произвольную размерность. Ну и все оценки, завязанные на сумму чисел Бетти для облаков точек тоже достаточно спекулятивные. Статья реджектнута.

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • 20 июл. 2024 г.716712из junkyardmathml

    В середине июля в Лондоне прошла летняя школа, для аспирантов и пост-доков - LOGML (London Geometry and Machine Learning). Тематика школы - применение методов геометрии и топологии в глубинном обучении, организатор Imperial College London. В 2021 и 2022 годах она была онлайн, в этом году все сделали очно. Направление школы идеально совпадает с темой моей диссертации, я участвовал в школе во все прошлые итерации, и в этот раз решил провести незабываемую неделю в Лондоне, работая над релевантным мне проектом. Структура школы включает лекции приглашенных спикеров, командные работы над проектами под руководством менторов (профессора, постдоки) и презентации результатов, всё мероприятие проходило в самом Imperial College. Из интересных, запомнившихся проектов были следующие: Stability or Collapse: Topological Properties of Deep Autoencoders (2021) - применения ТДА для исследования внутренних представлений автоэнкодеров Pretraining GNN with ELECTRA (2021) - предварительное обучение GNN для задач хим-информатики, но с применением техники предобучения ELECTRA, используемой в NLP Platonic CNNs (2021) - применение CNN для сигналов со сложной геометрической структурой, например климатические особенности на поверхности Земли (сфере, которую предлагается приблизить икосаэдром - получается архитектура Icosahedral CNNs). Platonic - потому что икосаэдр платоническое тело. Characterizing generalization and adversarial robustness for set networks (2022) - по мотивам этой статьи, ментором был проф Толга Бирдал; проект по улучшению его подхода для предсказания обобщающей способности CNN на основе геометрии траектории пространства весов в процессе обучения. В этом году среди постерной сессии на школе была работа, которая критиковала статью Толги. Geometric tools for investigating loss landscapes of deep neural networks (2022) - анализ геометрических свойства ландшафта функции потерь On the Geometry of Relative Representations (2024) - улучшение подхода к вычислению без дополнительного дообучения новых внутренних представлений нейросеток для более эффективного их последующего использования. Powerful Graph Neural Networks for Relational Databases (2024) - применение GNN для реляционных графов (k-partite graph), построенных по реляционным базам данных. Self-supervised learning for Topological Neural Networks (2024) - разработка Self-supervised learning режима обучения для топологических GNN (более подробно про них в этом посте). Отдельное подробное описание этого проекта будет у Паши на канале. Это далеко не полный список проектов. Как правило, по завершению проектов на школе команды пишут статьи. Впечатлений и новых знакомств море, все подавайтесь на след год тоже. Прикладываю фото со школы

  • 8 июл. 2024 г.671415из datafunk

    В своей работе "Теорема о невозможности кластеризации" Клейнберг доказывает что никакой алгоритм кластеризации не может удовлетворять одновременно трем названным условиям. Масштабная инвариантность нарушается когда для определения принадлежности точки к кластеру используются относительные расстояния с заданным порогом. Насыщенность нарушается, если заранее фиксируется количество кластеров. Согласованность нарушается когда для объединения точек в кластеры используются абсолютные расстояния не превышающие некоторый порог. С другой стороны указанные критерии это субъективное представление о красивом/полезном разбиении множества на группы, с которым необязательно соглашаться. Максимально понятно, без математики, теорема описана тут.

  • 8 июл. 2024 г.66518из datafunk

    Желание разложить что-угодно по группам на основе схожести - естественная черта человека, но задача кластеризации данных, почти всегда как плохое ТЗ для дизайнера - делай красиво, а не красиво не делай. Какой алгоритм кластеризации хороший, а какой плохой если сравнивать результат их работы не с чем? Джон Клейнберг из Корнеллского университета в 2002 году сформулировал три критерия хорошего алгоритма кластеризации: - Масштабная инвариантность. Если все расстояния между точками умножить на положительное число, это не должно менять результат работы хорошего алгоритма. - Насыщенность/разнообразие. Хороший алгоритм способен создать любую произвольную комбинацию разбиения входных данных. - Согласованность. Если уменьшаем внутрикластерные расстояния и/или увеличиваем межкластерные, алгоритм должен возвращать то же разбиение на кластеры.

Хроники ботки — tgindex