gonzo-обзоры ML статей
СтатистикаАвторы: Гриша Сапунов, ранее руководитель разработки Яндекс-Новостей, ныне CTO Intento. Области интересов: AI/ML/DL, биоинформатика. Лёша Тихонов, ранее аналитик в Яндексе, автор Автопоэта, Нейронной Обороны... Области интересов: discrete domain, NLP, RL.
- Последний пост
- 20:17
- Последнее чтение
- 16:46
- Постов за неделю
- 29
- Всего постов
- 37
- Тип
- открытый
- Язык
- русский
- Категория
- Новости и СМИ
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 1 772
- 1/48двое суток
- 2 605
- 1/72трое суток
- 2 809
Медиана по постам, которые мы застали свежими и померили через сутки.
Посты
Прикольная работа про экономию памяти для работы с длинными последовательностями. Использует то же наблюдение, что и недавняя работа про новый BERT — семантика стабилизируется уже к середине сети, слои позже работают больше на предсказание следующего токена (или какая там у вас задача). Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory Hanzuo Liu, Xuan Qi, Chunyu Liu, Haotian Zhong, Yulong Wang, Rayying, Key, Alex Lamb, Mingyu Gao Paper: https://arxiv.org/abs/2607.28263 Code: https://github.com/liuhanzuo/COMem # TL;DR ЧТО сделали: Авторы представляют CoMem (Comprehension Memory) — архитектуру контекстной памяти с разделением по глубине, которая перестраивает обработку длинного контекста вдоль оси слоёв, а не токенов. Во время потоковой записи (WRITE) чанки контекста прогоняются через нижние слои трансформера [0:j], чтобы сохранить единое промежуточное состояние резидуального потока (residual state) для каждого токена. Это требует всего 1/18 объёма памяти по сравнению с полным KV-кэшем на Qwen3-8B. Во время чтения (READ) внешний BM25-ретривер выбирает ограниченный пак релевантных чанков, и верхние слои [j:L] пересчитываются над этим паком с использованием полного cross-chunk причинного внимания (causal attention). Самодистиллированный LoRA адаптер с рангом 32, обученный на обычном тексте, восстанавливает точность считывания верхних слоёв без изменения весов основной модели (backbone). ПОЧЕМУ это важно: Стандартный инференс длинного контекста упирается в квадратичную сложность префилла и линейный рост KV-кэша. Существующие методы удаления токенов урезают долговременные зависимости, а подходы с полным перерасчётом требуют линейного роста памяти. Используя разделение труда по слоям — когда семантическое понимание стабилизируется на ранних слоях, а верхние специализируются на предсказании — CoMem отключает зависимость онлайн-вычислений и памяти GPU от общей длины сохранённого контекста. На 128k контекста на GPU NVIDIA H20 CoMem даёт ускорение префилла в 7.83 раза и снижает пиковую память с 89.36 ГБ до 18.26 ГБ, при этом превосходя полноконтекстные бейзлайны на бенчмарках длинных диалогов. Для практиков: Сохранение контекста безграничной длины больше не требует удержания глубоких KV-кэшей на миллионы токенов в памяти GPU. Предварительный расчёт промежуточных резидуальных векторов оффлайн и выполнение онлайн-запросов над извлечённым паком фиксированного размера через верхние слои трансформера строго ограничивают затраты на инференс. Эта архитектура обеспечивает бесконечную контекстную память для диалоговых агентов и систем поиска по документам с субсекундной задержкой префилла и минимальным расходом VRAM. Экономить память тут: https://t.me/gonzo_ML_podcasts/4791
По заявкам читателей. FLEX-$\pi$: A Multi-Stream World-Action Model with Compute Flexibility Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox Статья: https://arxiv.org/abs/2608.10860 Проект: https://flex-pi.github.io/ # TL;DR ЧТО сделали: Представили FLEX-$\pi$ — модель мира и действий (world-action model, WAM) на 6B параметров, которая одновременно предсказывает непрерывные действия робота, будущие RGB-кадры, 3D-карты точек (pointmaps) и семантические представления DINOv3. Ключевая находка: 3D-карты точек из Depth Anything 3 можно напрямую кодировать в латентное пространство замороженного RGB-видеоавтоэнкодера (Wan-2.2) вообще без специализированного 3D-предобучения. Благодаря дропауту визуальных потоков и межмодальному форсированию (cross-modality forcing) в бэкбоне Mixture-of-Transformers, один и тот же чекпоинт гибко переключается между быстрым инференсом только действий (~60 мс) и полноценной совместной генерацией мира и действий (~193 мс). ПОЧЕМУ это важно: Обычные универсальные политики роботов вынуждены выбирать между быстрой реакцией VLA-моделей и богатой предиктивной регуляризацией WAM, предсказывающих только RGB. FLEX-$\pi$ устраняет этот компромисс, доказывая, что физический граундинг в 3D-геометрию и семантику можно добавить в генеративные политики без дополнительных датчиков глубины, без кастомных 3D-архитектур и без неизбежных задержек на инференсе. Модель показывает прирост успешности в 2–6 раз по сравнению с современными SOTA-бейзлайнами на субмиллиметровых и деформируемых задачах двуручной манипуляции. Для практиков: Чтобы робот уверенно манипулировал предметами, ему нужно понимать глубину сцены, семантику объектов и предвидеть визуальные последствия своих действий. Современные модели обычно генерируют только будущие пиксели с камер — они передают цвет и текстуру, но плохо улавливают точную 3D-геометрию. FLEX-$\pi$ генерирует 3D-формы и высокоуровневые семантические признаки параллельно с траекториями робота. При этом не требуется дорогое железо: геометрия и семантика извлекаются из обычных RGB-камер готовыми моделями. Во время работы робот может динамически переключаться: генерировать полную симуляцию будущего для максимальной точности или предсказывать только действия на высокой частоте для управления в реальном времени. Роботы тут: https://t.me/gonzo_ML_podcasts/4790
90%
90%
Любопытный результат про работу LLM с табличными данными, где LLM довольно хреновы и сильно уступают классике ML. Предположительные источники проблем в виде перекрытия классов, проблем парсинга CSV, токенизации чисел и размера батча оказались неважными. Зато размерность данных очень важна, из-за неё все проблемы. Вроде как на подходе новые фундаментальные табличные модели, та же свежая гугловая TabFM. С другой стороны, я не уверен, что будущее всё же за прямой работой LLM/FM с таблицами. Оно конечно удобно с точки зрения универсальности, но там где важен реальный перформанс нужны специалисты. Сгенерить специализированную RF/GDBM может быть быстрее и эффективнее, уж с генерацией такого кода LLM-то справится. Why Large Language Models Fail at Tabular Prediction Marta Garnelo, Wojciech M. Czarnecki Paper: https://arxiv.org/abs/2608.02412v1 Review: https://arxiviq.substack.com/p/why-large-language-models-fail-at Code: N/A Model: N/A # TL;DR ЧТО сделали: Авторы проверили пять популярных гипотез о причинах провала больших языковых моделей (LLM) на задачах классификации табличных данных в режиме чистого инференса. Используя жёсткую проверку на заучивание данных из предобучения (memorisation probe), контролируемые манипуляции с признаками и проекции случайными матрицами, исследователи опровергли четыре традиционных объяснения — перекрытие классов, текстовый CSV-формат, токенизацию чисел и число тестовых запросов за раз. Единственной реальной причиной деградации качества моделей вроде claude-opus-4-6 оказалась высокая размерность признакового пространства. ПОЧЕМУ это важно: Работа даёт первое причинно-следственное объяснение тому, почему универсальные языковые модели до сих пор проигрывают классическому ML на таблицах. Способности LLM катастрофически деградируют с ростом числа колонок — даже если объём полезной информации в них остаётся неизменным. Это устанавливает чёткие архитектурные ограничения для табличного ризонинга, доказывает бесполезность банального промпт-инжиниринга и подтверждает необходимость специализированных табличных фундаментных моделей. Для практиков: Разработчики часто замечают, что топовые LLM уступают алгоритмам полувековой давности на простых числовых таблицах. Вместо того чтобы обвешивать модель сложными агентскими пайплайнами и промптами, авторы протестировали «голую» модель. Выяснилось, что проблемы вовсе не в «неудобном» форматировании CSV, специфической токенизации чисел или зашумлённых границах классов. LLM отлично работают как локальные классификаторы на основе расстояний в 2D-пространстве, но их работа рушится, как только размерность признаков выходит за рамки нескольких измерений. Попытки починить это промптингом бесполезны — нужны специализированные архитектуры. Работать с таблицами тут: https://t.me/gonzo_ML_podcasts/4788
Вот это вот особенно прекрасно: Even Claude was surprised by its own finding—it was skeptical at first, possibly because it has learned from its training about the difficulty of open problems in mathematics and about the limitations of AI models. But after some encouraging prompts, it arrived at the result we’ve described. Perhaps Claude, like many of us, underestimates the rate of AI progress.
К гипотезе Римана подступаются... https://www.anthropic.com/research/riemann-zeta