Concise Research
СтатистикаИсследования AI глазами исследователя Автор: @snk4tr Сергей Кастрюлин
- Последний пост
- 4 авг.
- Последнее чтение
- 18:16
- Постов за неделю
- 0
- Всего постов
- 20
- Тип
- открытый
- Язык
- русский
- Категория
- Технологии (по похожим)
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 337
- 1/48двое суток
- 386
- 1/72трое суток
- 416
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Наука или инженерия Мысли после ICML'26 [2/2] В первой части обсуждали критерии научности и 10% работ, которые им соответствуют. Теперь про остальные 90%. Чему они соответствуют? Roberto Pieraccini называет такие работы translational имея ввиду “перевод” общих методов в плоскость прикладных задач. По смыслу это ближе всего к тому что ML сообществе называют RnD: • Составление бенчмарков • Добавление к общему методу inductive bias конкретной модальности или задачи • Локальные трюки и хаки То есть высокая специфичность решений может не обобщаться, а знания и трюки — устаревать еще до появления на конференции. Сразу отмечу, что не считаю такие работы менее интересными или ценными. Они часто проверяют полезность общих методов и закрывают актуальные вопросы, волнующие сообщество здесь и сейчас. Давайте рассмотрим на примерах. Beyond Confidence: Adaptive and Coherent Decoding for Diffusion Language Models Инференс DLM опирается на потокенные confidence и энтропию. Их независимость может приводить к несогласованным траекториям (одновременно размаскируем sunny и rainy в разных частях одного предложения). Авторы предлагают доп верификацию противоречивности уже после диффузионного семплинга. Это дает ускорение, метод training-free. Полезно? Сейчас точно да. Научно? Со сменой генеративного стека и общим прогрессом качества метод может обесцениться. CUARewardBench: Benchmark for Evaluating Reward Models on Computer-using Agent Trajectories Первый бенчмарк сразу для outcome- и process-reward моделей, оценивающих computer-using агентов. По сути, сделали метрику (human judges) на метрику (VLM as a judge), прогнали 7 VLM и описали наблюдения. Например, что общие модели судят траектории лучше специализированных CUA, а Qwen2.5VL-72B проиграл своей же 32B 🌚 Полезно? Да, очень. Научно? Паттерн работы агентов может поменяться и бенч станет не актуален. ❗️Описанные работы ценны, но важно относиться к ним по-другому. В чем же ценность? Для меня — в возможности понять общее направление проблем и их решений. Если обозреть их на более высоком уровне, то можно заметить интресные факты. В диффузии, например, из DLM всё больше делают авторегрессию. Нам повезло с JustGRPO из прошлого поста — outstanding paper говорит о неоднозначности полезности произвольного порядка семплирования явно. Можно ли было понять это без той работы? Да, можно, подумав о том что стоит за Beyond confidence в этом посте и десятком аналогичных работ. В агентах другая проблема — им никто не доверяет. FormalJudge, SERA, MAS-ProVe, ReSeek, тот же CUARewardBench: в десятках статье к агенту приделывается верификатор потому что агенты не могут оценить себя сами. Возможно, прогресс области ограничен сигналом верификации, а не способностями модели. Практический вывод №2: translational статьи полезны, особенно если смотреть глубже частных трюков и стараться обобщать. И снова, не важно где вы изучаете работы. Надеюсь, кому-то подобный подход к разбору статей хотя бы немного упростит жизнь.
Наука или инженерия Мысли после ICML'26 [1/2] Не важно ходишь ли по постерам в Сеуле или пытаешься читать по заверениям дедов фид arxiv cs.ai 👴: твой контекст не бесконечен и не очевидно на что его тратить. Есть такой Roberto Pieraccini, я бы его описал как Шмитхубера здорового человека: много чего сделал и понял, но не пытается причислить себе все ключевые находки в ML. У него есть блог The voice in the machine, в котором он много рефлексирует и обсуждает прогресс. В эссе Prompting Is Not AI Research он на примере статей, про, собственно, промтинг предлагает для определения научности использовать критерии: 1. Механизм. Работа объясняет, почему объект исследования ведет себя определенным образом или только фиксирует поведение? 2. Долговечность. Знание накапливается или обесценивается с очередным релизом модели? Идея не нова, но заставила задуматься. Дальше я решил посмотреть на статьи с ICML: грепнул все работы, разметил LM’кой, вышло ~10% науки против ~90% всего остального. Разметка автоматическая, да и граница между категориями размытая, так что это скорее порядок величины. Дальше я решил взять две области, за которыми следил на конфе: диффузионки и агентов. По ним было примерно по 450 статей, всего около 15% конференции. Дальше повторил классификацию, получил по диффузии порядка 11% научных работ (чуть выше среднего), а по агентам (ожидаемо) всего 3%. Ситуация со статьями по агентам ожидаема потому что в сообществе сейчас популярно мнение, что это вообще не область и науки в ней нет, но так ли это? Ниже примеры по-настоящиму научных работ в каждой из областей. The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models [код, веса] Одна из двух Outstanding Papers этой конфы. Интуиция такая: произвольный порядок генерации в DLM включает left-to-right как частный случай и кажется, он должен делать всё строго лучше. Но авторы показывают, что на математике и коде выходит обратное: DLM пользуется свободой порядка, чтобы избегать токенов с высокой неопределенностью, те самые forking tokens, где ветвятся пути решения. В результате генерация коллапсирует. Лечат JustGRPO: left-to-right форсят только на RL-фазе. The Crowded Embedding Space: A Mean-Field Mechanism for Emergent Marginalization in Retrieval-Augmented Agents RAG-агентов оценивают по одному запросу, и это прячет главное: запросы геометрически связаны в общем эмбеддинг-пространстве. Плотность документов по широкой теме (например, фильмы-боевики) выдавливает из top-k соседнюю узкую категорию (Film Noir 🧐). Это фундаментальная проблема RAG-систем, корень которой в самом лоссе на обучении поисковых агентов. Для решения проблмы переформулируют задачу и делают так чтоб агент сам двигал эмбеддинги, оптимизируя свою же точность поиска. Практический вывод №1: больше внимания действительно научным статьям. Их, в действительности, не так много. В следующем посте - про остальные 90%, их ценность, которая видна только при чтении множества работ.
видео или голосовое, без подписи
Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появилась обновлённая модель — Alice AI ART 2.0. Пользователи уже сейчас могут протестировать два базовых сценария её работы: Text-to-Image и Image-to-Image. Для Яндекса этот релиз — первый шаг к тому, чтобы получить unified-модель с едиными метриками и стеком, которая одинаково хорошо умеет и в T2I, и в I2I. Команда генеративных моделей в компьютерном зрении рассказала на Хабре об экспериментах на этом пути, которые сработали и не сработали. Делимся основным. С чего начали Стартовали, имея две сущности. С одной стороны, картиночный генератор Alice AI ART 1.0 — свёрточная модель с текстовым энкодером на базе LLM. С другой — редактирование с отдельной базовой моделью и пайплайном инференса. Это разделение было дорогим и приносило много сложностей. Каждое обновление приходилось дважды переносить, данные готовились по-разному, метрики T2I и I2I было тяжело сравнивать между собой, стадии обучения были рассогласованы. Что хотели от релиза Цели было две: свести две модели в одну и при этом поднять качество каждой. В T2I целились на рост релевантности и отрисовки текста на картинке. В I2I старались поднять общее качество, но с акцентом на важных для наших пользователях задачах: любые изменения с участием людей и стилизация. Критически важно было, чтобы объединённая модель не уступала по качеству раздельным, а лучше — превосходила их. Главный герой этого обновления — unified-претрейн Он включает данные обоих типов: «текст → картинка» и «картинка + инструкция → картинка». Была гипотеза, что общий визуальный и текстовый контекст перетекает между задачами и улучшает качество. Например, концепты (объекты, предметы, действия, стили), выученные на T2I, становятся доступны в I2I без дополнительного сбора данных. И это действительно подтвердилось. Мы также унифицировали архитектуру, перейдя на single-stream MMDiT с VLM в качестве текстово-картиночного энкодера, и увеличили размер генератора по сравнению с Alice AI ART 1.0. Важным оказалось использовать: 🔴Joint attention — текстовые и визуальные токены идут через общий аттеншн, а не двумя раздельными ветками. 🔴U-RoPE — позиционное кодирование, дружелюбное к разным разрешениям и к конкатенации картинка + текст (что особенно важно для I2I). Результаты Alice AI ART 2.0 стала намного более качественной в обеих задачах и по нашим замерам заметно отстаёт только от Gemini 3.1 Flash. Но главный показатель — это реакция пользователей. Скачивание результатов генерации и редактирования выросло на 37 %, а запросов на генерацию с персонажем стало больше на 23 %. В обзоре мы пробежались по верхам. В основном посте — подробно об аналитике и замерах, динамике обучений. Есть также таблицы с результатами и рассказ о том что у нас не сработало. ML Underhood
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужие. Чтобы спорить у постеров, слушать доклады, искать неожиданные идеи и пытаться понять, куда сейчас движется область Но не только Ещё — чтобы увидеться с командой не через календарь и созвоны. Поговорить с исследователями и инженерами за пределами своего ежедневного круга. Потолкаться на экспо и в секции постеров про RL, случайно встретить знакомых и сопоставить имена из статей с живыми людьми И, конечно, чтобы немного прикоснуться к культуре другой страны: к улицам, еде, ритму города и маленьким деталям, которые запоминаются не меньше, чем лучшие доклады
Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла унификация? В прошлом посте закончили на том, что агент-оркестратор с двумя специализированными моделями решает те же задачи, что и BAGEL-стайл унификация. За те же 14 месяцев это направление тоже не стояло на месте. Разберём, где мультимодальность нужна по существу задачи, где агенты её вытягивают. Где мультимодальность реально нужна и агенты её вытягивают ▶️ Знание-ориентированная генерация. Чистые T2I не знают счёта NBA-финала, курса акций на дату, как выглядит малоизвестное лого. Gen-Searcher через web- и image-search даёт Qwen-Image +16 пунктов на KnowGen и +15 на WISE. Mind-Brush вытягивает Qwen-Image с 0.02 до 0.31 на своём Mind-Bench. ▶️ Reasoning-heavy генерация. Задачи, где ответ надо сначала посчитать, а потом отрендерить — математика, лабиринты, геометрия. Mind-Brush +27.3% на RISEBench. GenAgent поверх FLUX.1-dev — +23.6 на GenEval++ и +14 на WISE. ▶️ Композитный редактируемый выход. Слайды, баннеры, инфографика. BannerAgency — 4-агентный пайплайн, отдающий готовый Figma/SVG вместо растра. Ни одна T2I этого не умеет и не будет. ▶️ Multi-reference блендинг и multi-turn. Qwen-Image-Agent с фидбек-луп и памятью на IA-Bench вытягивает Qwen-Image-2.0 с IA-score 17.4 до 45.4, обгоняя Nano Banana Pro 42.6 и GPT-Image-1.5 35.7. Что делает западный бигтех Все они катят агентские фичи (tool use, реальный поиск, ризонинг, оркестрация приложений), а не BAGEL-стайл единую модель. - Google. Nano Banana Pro: grounding through Google Search as a tool плюс thinking-режим — модель генерирует до двух промежуточных картинок и уточняет композицию, прежде чем выдать финальную. До 14 референсных изображений в одном шоте. - OpenAI. Responses API документирует явную tool-архитектуру. Основная модель сама решает, когда позвать GPT-Image-1.5/2 — это буквально генератор как тул. - ByteDance. Seedream 5.0 официально позиционируют как "Real-Time Web Search + Intelligent Logical Reasoning", запуск в Jimeng AI, Jianying, CapCut. - Adobe. Firefly AI Assistant описан самим Adobe как "creative agent" и оркестрирует Photoshop, Premiere, Lightroom, Illustrator, Express и Firefly из одного промта, используя 60+ инструментов пакета. То есть ни одна BAGEL-стайл унифицированная модель как будто в прод не отгружена. На мой вкус Разрыв, который не закрывала унификация, агенты закрыли. Выигрыш достаётся там, где мультимодальность нужна по существу задачи (граундинг знаниями, композитный выход, референс-блендинг, многотуровое редактирование). Ботлнек сместился: раньше "модель не умеет", теперь "оркестратор всё решает, но он платный и закрытый". Интересно, что случится с этим балансом, когда открытые MLLM догонят GPT-5.5.
Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия? В мае 2025 BAGEL и близкие по времени работы продавали унифицированные модели с одним набором весов на понимание и генерацию картинок. Мотивационный тезис — модальности взаимно усиливают друг друга. Экспериментальных подтверждений тогда было немного, но авторы смотрели в светлое будущее. Прошло 14 месяцев. Посмотрим, что реально измерили за это время. Что говорит литература ▶️ Are Unified VLMs Necessary (май 2025). Единственная известная мне работа, где синергию померили чисто и на изолированной задаче. На синтетическом UI-датасете VQA-точность растёт с 76.6 до 98.7, FID падает с 210.9 до 190.2 при совместном обучении. Валидация на реальных данных (ShareGPT4V) сделана в куда меньшем масштабе, и там эффект уже скромнее. ▶️ FAIR Beyond Language Modeling (март 2026). Смесь текста и видео в претрене совместима с чисто текстовым бейзлайном, а иногда даже его обыгрывает по перплексити. А вот добавление картиночно-текстовых кепшенов (MetaCLIP) в тот же микс даёт худшую текстовую перплексити среди всех рассмотренных смесей. Тот самый налог за мультимодальность теперь измерен на пре-трейне. ▶️ Do Understanding and Generation Fight? (март 2026). Диагностика прямо на Janus-Pro (7B и 1B): попытка одновременно улучшить понимание и генерацию через DPO. На 7B ни один метод не двигает генерационный CLIPScore, на 1B все методы генерацию ухудшают. Градиенты двух задач почти ортогональны (cos ~ 0), а их магнитуды различаются в 11-14 раз — сигналы буквально дерутся между собой. Причина по мнению авторов в дисбалансе информации (~576 токенов на картинку против 30-100 на текст). ▶️ Сам BAGEL — это Mixture-of-Transformer с раздельными параметрами и общим self-attn. С точки зрения весов это уже частичное разделение, спрятанное под словом "унифицированная". ▶️ BLIP3-o и UniFork. Первая показывает, что последовательный претрен (сначала понимание, потом генерация) сохраняет понимание лучше, чем полностью совместный. Вторая ловит, что две задачи хотят противоположных траекторий алаймента модальностей по глубине модели, то есть полностью общий бэкбон противоречит обеим. Замечания Во-первых, чистого аблейшена (тот же датасет, та же архитектура, совместно против пары специализированных) на большом скейле за 14 месяцев так и не появилось. Зато появился анализ градиентов, показывающий, что сигналы двух задач ортогональны на уровне обновлений весов. Синергия не опровергнута окончательно, но её измеряют всё хуже, а интерференцию — всё лучше. Во-вторых, все успешные "унифицированные" системы явно или неявно прячут разделение: в энкодерах (Janus), в раздельных параметрах и MoT (BAGEL), в порядке обучения (BLIP3-o), в отдельных ветках (UniFork). Возможно, это тихое признание сообществом того, что базовое совместное обучение скорее вредит, чем помогает. В-третьих, параллельно расцвела агентская парадигма: оркестратор берёт две сильные специализированные модели (VLM для понимания, T2I/T2V для генерации), пользуется ими как инструментами и склеивает результаты. На сквозных задачах агентский подход зачастую бьёт унифицированные модели, не сражаясь ни с какой интерференцией между модальностями. На мой вкус Обещанное майскими работами 2025-го светлое будущее пока не наступило. Взаимное усиление модальностей реально существует в узких сетапах и на уровне представлений, но не превращается в убедительный практический выигрыш на скейле, а именно этот выигрыш и продавали. Инфраструктурная сложность унифицированных моделей выше, чем у пары специализированных плюс роутер, поэтому бо́льшая часть прод-систем идёт агентским путём. Пока не появится независимой аблейшн на большом скейле — разговор так и будет крутиться вокруг архитектурных уловок.
Результаты На IA-Bench Qwen-Image-Agent даёт IA-score 45.4. Для контекста: • Nano Banana Pro — 42.6 • GPT-Image-1.5 — 35.7 • Чистый Qwen-Image-2.0 без агента — 17.4 То есть агентский обвес поверх собственной модели даёт ~+28 пунктов и выводит её выше топовых закрытых рендереров на этом бенче. На WISE-Verified, более старом бенче на world knowledge ситуация аналогичная. В работе аблейтят влияние поиска (IA-score падает на 11 пунктов), ризонинга (минус 10 нуктнов). Удаление памяти и промежуточной оценки влияет меньше, но суммарно еще -8. А еще при замене GPT-5.5 на Qwen-Plus + Qwen-VL-Max IA-score падает с 45.4 до 27.8. То есть около половины прироста сидит в качестве закрытой VLM, а не в инженерии агента. Замечания Во-первых, цена. Один запрос — это: planning-проход на GPT-5.5, несколько ризонинг вызовов на каждый вопрос, до пяти хитов поиска с VLM реранкером, рендер на Qwen-Image-2.0, оценка качества через GPT-5.5, и так до трёх раундов фидбека Во-вторых, зависимость от качества VLM. Падение IA-score с 45.4 до 27.8 при смене GPT-5.5 на Qwen-Plus говорит, что для качества системы важнее доступ к топовой закрытой VLM, чем конкретный дизайн агента В-третьих, чувствительность к качеству поиска. Плохие результаты иногда полностью ломают рендеринг В-четвёртых, как и у всех агентов есть проблема с разбуханием контекста и памятью, а из-за того что в этом пайплайне много дорогих по токенам картинок, эта проблема стоит еще острее
Тексты для T2I, второй акт: переписывание промтов, агенты и Context Gap [кода нет, новый бенч] Ранее в Тексты для T2I претрена разбирали две работы про тренировочные кепшены — Structured Captions и Design Choices for Synthetic Captions. Если коротко, обе пришли к выводу, что для T2I-претрена выгодно использовать структурированные кепшены: длинные , с заданным порядком пунктов и единым форматом. Чем плотнее и регулярнее текст в обучении, тем лучше модель учит соответствие текст-картинка. Побочный эффект - модель ждёт на входе огромную портянку, а пользователь приходит с "make a cool poster". Между распределением тренировочных текстов и распределением реальных юзер-запросов появляется разрыв. И это только первый род проблем. Второй в том что юзер часто опускает в промте контекст, без которого задачу в принципе нельзя решить. Свежий тех-репорт от Qwen называет суммарный разрыв между предоставленным и необходимым контекстом и предлагает закрывать его не одним репромтером, а агентом. Почему так? Потому что простые репромтеры уже давно делаются и у них есть предел качества Baseline В DALL-E 3 учили собственный кепшенер на парах картинка-длинный детальный кепшен. Потом в CogView3 повторили схему на своём датасете. Схема никак не адресует разрыв между распределениями промтов, поэтому в DALL-E 3 API между юзером и моделью используют GPT-4, который ту же короткую фразу расширяет до длинного промта. Работало zero-shot, давало хорошие результаты для своего времени. Обученный ризонящий rewriter (PromptEnhancer) Вместе с тех репортом по генеративной модельке команда Hunyuan выкладывала отдельную папиру про PromptEnhancer (обе разбирали тут). Эта модель сначала рассуждает в свободной форме о том, чего в промте не хватает и где проблемы у конкретного T2I, потом выдаёт переписанный промт. Учат через RL: на 24 аспектах (биндинг атрибутов, отрицания, композиция, счёт и т.д.). Получается промтилка, заточенная под слабые места одного конкретного генератора. Минус в переносимости: при смене T2I надо переобучать промтилку и пересобирать реворд модель. Полноценные агенты с тулами (GenSearcher, MindBrush, GEMS, SCOPE, T2I-Copilot) Параллельно вышли несколько систем, которые навешивают на генератор агентский слой и расширяют действия за пределы переписки • В GenSearcher делают упор на RAG: если промту нужен реальный референс (лицо знаменитости, лого, конкретный продукт), агент идёт в поиск и подсовывает топ-найденное в генератор • В MindBrush добавляют ризонинг перед генерацией . Они же сделали MindBench в котором запрос требует промежуточного вывода • SCOPE про планирование сложных сцен. Напоминает работу про расписание с увеличением сложности промтов и добавлением деталей по ходу генерации • В T2I-Copilot пытаются сделать агентную систему (без дообучений) разделением ролей (интерпретатор, генератор, оценщик) Каждая работа хороша в своём кусочке, но ни одна не покрывает целиком все действия: планирование / ризонинг / поиск / памать / фидбек. Команда Qwen называет их фрагментированными и говорит, что унификация назрела Qwen-Image-Agent Авторы формализуют генерацию как условный рендеринг: у нас есть контекст пользователя (промт + опционально доп картинки-кондишены), а нужен генеративный контекст, то есть именно то что нужно для генерации. Чтобы ее устранить агент строит траекторию и на каждом шаге выбирает одно из пяти описанных выше действий. К моменту вызова генератора у системы есть детальный промт + при необходимости визуальные референсы + чек-лист желаемых атрибутов. В работе есть много технических деталей про то как именно устроить каждое действие. Важно, что они ничего не тренируют, всё работает зеро шот поверх GPT-5.5 для агентской обвязки и Qwen-Image-2.0 как генератора. К фреймворку отдельно сделали бенч IA-Bench. IA-Bench Фишка бенча — специально убраны запросы, которые модель может решить мемоизацией (например, исключают слишком известных персонажей), плюс есть замеры промежуточных состояний, по которым можно смотреть правильно ли модель рассуждает.
Qwen-Image-2.0 Technical Report Вышел-таки, красивое. Модельку так и не выложили, не красивое. Понравилось, что число авторов не исчисляется сотнями. Не понравилось, что страниц всего 30 и то половина картинки. Оч не подробно для команды Qwen.
видео или голосовое, без подписи
UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer [ссылка на код, а кода нет ☔️] Очередная unified MM-модель от Nanjing + ByteDance Seed с декаплингом диффузионного декодера от LLM-бэкбона в духе DDT/RAE/PixNerd. Авторы атакуют две знакомые проблемы UMM: конфликт understanding и generation лоссов и фрагментированное виз пространство. Архитектура Noisy ViT → LLM-бэкбон (Qwen3-VL-4B для VLM-UniDDT) → отдельный diffusion decoder (~1B). Ключевая фишка — Noisy ViT учат принимать вход на любом таймстепе шума, поэтому один энкодер обслуживает и понимание (t=0), и генерацию (t>0). Инициализируют дистилляцией из SigLIP2 / Qwen-NaViT. Виз пространство — латенты Flux VAE. Пиксели чуть лучше для understanding, но скейлятся в генерации хуже, поэтому остановились на латентах. Обучение 1️⃣ Warmup: отдельно греют ViT и декодер, чтобы не словить коллапс при joint-тренинге с нуля 2️⃣ Joint: размораживают всё, учат на duality — из одной пары (картинка, текст) собирают и generate, и семплы. Без таск-специфичных датасетов 3️⃣ Post-training: фризят ViT+LLM, дотюнивают декодер, скармливая шумные промежуточные семплы из генерации в understanding-голову для максимизации правдоподобия Результаты На 16×A100, ~70М картинок: VLM-UniDDT — GenEval 0.87, DPG-Bench 86.9, MME 1699.5, SEEDBench 76.5 при ~5B параметров. На уровне или лучше BAGEL (14B). NativeUniDDT-XL — GenEval 0.89. Замечания Без файнтюна на 4o-данных GenEval всего 0.72, основной прирост на финальной 8К-стадии. NativeUniDDT на understanding не репортят: текст в датасете — машинные кепшены от Qwen2.5-VL-7B. С JiT не сравнились, эксперименты ставили до его релиза. На мой вкус, ценное — честно разобранный trade-off латент/пиксель и duality на данных.
SpecEdit: Training-Free Acceleration for Diffusion based Image Editing via Semantic Locking [код пока нет, обещают] Работа про ускорение диффузионного редактирования изображений без дообучения. Не новая модель, а надстройка над уже существующими редакторами вроде Qwen-Image-Edit и FLUX.1-Kontext. Проблема При редактировании не все области картинки одинакого важны. Не важные регионы можно сначала редактированть в низком разрешении, а потом апсемплить. При этом, стандартные методы динамического разрешения обычно решают, какие токены апсемплить, по низкоуровневым признакам: границам, дисперсии каналов и т.п., что работает плохо. Метод Авторы вдохновляются LLM спек деком и делают пайплайн: 1. Сначала запускают дешёвое редактирование в сильно пониженном разрешении (16х downsampling). 2. Сравнивают фичи драфта с исходным изображением. 3. Находят токены, где возникло семантическое изменение. 4. Только эти токены поднимают в высокое разрешение для дальнейшего денойзинга. 5. Остальные области оставляют в низком разрешении, плюс добавляют разреженную равномерную сетку токенов для глобальной стабильности. Это они называют semantic locking: не просто “сэкономить токены”, а зафиксировать именно те области, где правка должна/не должна произойти. Драфт при этом не участвует в финальной траектории денойзинга, он нужен только как дешёвый способ понять, где нужно сделать изменение. Результаты: • Qwen-Image-Edit: 3–6х при близком качестве. • FLUX.1-Kontext-dev: до 7× ускорения. • В комбинации с дистилляцией по шагам — до 13×. • На GEdit-Bench и ImgEdit-Bench качество в целом держится, хотя на самых агрессивных режимах ожидаемо проседают сложные категории вроде замены и стилизации. В целом, идея работы логичная: давайте найдем регион для изменения и будем работать только с ним. Для редактирования это важнее, чем для обычной генерации, потому что часто бОльшая часть изображения должна остаться неизменной. Ограничения тоже понятные. Метод сильно зависит от качества драфт: если дешёвый проход неправильно понял инструкцию, фичи будут шумными. В статье нет отдельного раздела с failure cases, но по аблейшенам видно, что результаты могут быть не стабильными.
За последнюю неделю вышли две довольно любопытные работы по мультимодальной генерации. Первая рассматривает UMM в контексте нынче модных pixel-space картиночных диффузионок. Вторая — тех репорт про то как запихнуть аж 7 разных модальностей в одну модель. Representation Forcing for Bottleneck-Free Unified Multimodal Models Новелти работы в том что делают мультимодалку с генерацией картинок без использования VAE. Для этого: • Общая тушка сначала авторегрессионно предсказывает семантические картиночные токены, • Та же тушка, но уже в режиме пиксельной диффузионки догенерирует картинку. По заявлению авторов, в t2i их pixel-space RF догоняет SOTA мультимодальные генеративки использующие VAE, а по VLM бенчам даже лучше VAE-based варианта. Archon: A Unified Multimodal Model for Holistic Digital Human Generation Лютые китайцы взяли и обучили модельку с 72 задачами в 7 модальностях (text/audio/motion/visual/…) на входе и выходе. Минус в том что все сетапы игрушечные (CELEB-A для генерации картинок и тд). Ключевой инженерный трюк — сильно ужали представление видео (4× меньше токенов) + сделали семантический декодер для сохранения консистентности генерации. Еще понравилась часть про разложение неоднозначной мультимодальной генерации в пошаговую цепочку по модальностям для контроля/фиделити. Выглядит как будто модель для каждой модальности делает ризонинг в этой модальности. Метрик в абстракте нет, но заявляют сопоставимое качество на наборе генеративных задач. Отдельно хочется отметить показанный в аблейшене буст качества от кросс-модального взаимодействия. Утверждается, что модель умнеет от того что учится на все модальности сразу, но сетап для проверки этого утверждения не особо расписан, что уменьшает уверенность в нем.
Lance: Unified Multimodal Modeling by Multi-Task Synergy [код и веса на странице проекта] ByteDance продолжают заниматься мультимодальной генерацией, выпуская один техрепорт за другим. При этом, очередная модель под названием Lance имеет не так много отличий от своих предшественников: • Задачи: к стандартным задачам i2i, t2i, VLM и LLM генерации добавляют генерацию и редактирование видео; • Размер: при этом, модель буквально микроскопическая - всего 3В параметров; • Архитектура: в стандартную для мультимодалок dual-stream архитектуру добавили новый Modality-aware Rotary Positional Encoding блок, позволяющий более легковесно и, при этом, однозначно кодировать весь зоопарк мультимодальных данных, еще и закодированных разными энкодерами; • Обучение: сравнительно нестандартно учат на мультимодальных данных сразу, то есть не делая более простого претрена на одну, заранее выбранную модельность. Основной фокус работы Синергия между задачами. Авторы подобрали данные и сетап обучения, позволяющие улучшить качество относительно обучения на отдельные задачи. Другие детали • В выборе авторегрессия против диффузии авторы делают пока что стандартный выбор: AR для генерациий текстов, диффузия для генерации картинок и видео • Энкодеры для генерации и понимания картинок берут отдельно (никаких RAE-подобных унифицированных представлений) • Унификацию бекбона авторы избегают. Следуя примеру Bagel и HunyuanImage 3.0 они разделяют ветки понимания и генерации изображений, обосновывая это наблюдениями о разнонаправленной оптимизации для этих двух задач. Последний пункт кажется особенно интересным, поскольку он как будто не вяжется с экспериментальными результатами. С одной стороны, аблейшены показывают, что между задачами есть синергия и учить одну модель для мультимодальной генерации полезно. С другой стороны, кодировать всё в единую тушку оптимизационно сложная задача и все успешные архитектуры разделяют стримы генерации и понимания. Вывод: По всей видимости, существует некий баланс раннего и позднего фьюзинга задач, обеспечивающий синергию знаний, но не мешающий оптимизации, поиском которого сейчас занимаются на практике. И кажется, что скорее всего именно это является лимитирующим фактором роста качества, а не скейлинг размера моделей и данная 3В моделька тому подтверждение.