tgindex
ML Underhood

Рассказываем, чем живёт ML в Яндексе, и обсуждаем важные новости индустрии. Вопросы и предложения > @yandex_ml_brand

Последний пост
14 авг.
Последнее чтение
15:01
Постов за неделю
8
Всего постов
34
Тип
открытый
Язык
русский
Категория
Новости и СМИ
В каталоге с
12 авг.
Подписчики
4 733
+53 за 4 дн.
Сутки
+3
+0,06%
Неделя
 
Месяц
 
Просмотров на пост
3 752
34 постов
Вовлечённость
79,3%
к подписчикам
Постов в день
1,1
всего 34
Упоминаний
10
каналов
Охват размещения
оценка
1/24сутки в ленте
780
1/48двое суток
893
1/72трое суток
964

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • 14 авг.7912134

    Обзор подходов по uplift-моделированию на KDD 2026 KDD 2026 в Южной Корее подошла к концу. Разберём несколько работ, связанных с uplift-моделированием, которые представили на конференции. Все они — от китайских бигтехов и с подтверждёнными онлайн-экспериментами. Cross-Treatment Effect Estimation for Multi-Category, Multi-Valued Causal Inference via Dynamic Neural Masking (XTNet) Работа от DiDi о том, как оценивать uplift, когда у нас несколько категорий воздействий и у каждой — своя градация интенсивности. Вместо отдельной головы под каждую комбинацию авторы разделяют эффект на базовый и кросс-эффект, а веса под конкретную комбинацию генерируют масками — архитектура не раздувается экспоненциально. Отдельно предлагают cost-aware-метрику MCMV-AUCC, учитывающую стоимость воздействий и убывающую отдачу, с доказательством меньшей ошибки ранжирования, чем у Qini и AUUC. A/B-тест в 32 городах дал +2,43% GMV — идею декомпозиции на базовый и кросс-эффект вполне можно брать на вооружение. Scalable and Traceable Joint Uplift Modeling for Multi-Lever Online Marketing (M-DLRI) Продолжение той же истории от Xidian и Alibaba, но с упором на экономический здравый смысл: большая скидка не должна предсказывать меньше продаж. Монотонность зашивают структурно через изотонное кодирование с интерполяцией. Экспоненциальный рост параметров лечат CP-разложением тензора взаимодействий — сложность становится линейной по числу рычагов. А слагаемые заодно дают атрибуцию: видно, какой именно рычаг тянет совместный эффект. Месяц A/B на Alimama: +5,35% GMV и +7,26% Sales. Takeaway: структурные приоры работают как регуляризация и вытягивают качество там, где комбинаций много, а данных мало. Heterogeneous Multi-treatment Uplift Modeling for Trade-off Optimization in Short-Video Recommendation (HMUM) Работа от конкурента TikTok — Kuaishou — рассматривает случай, когда воздействия — это не скидки, а разные стратегии ранжирования, чьи эффекты на метрики прямо конфликтуют: время в приложении против числа просмотров. Офлайн-модель — отдельные ветви под каждое воздействие, чтобы не ловить конфликт градиентов, но с общей надстройкой для синергии. Понравился аккуратный трюк: контрольные предсказания разных ветвей стягиваются KL-дивергенцией, ведь распределение «без воздействия» обязано быть одинаковым. Онлайн-часть убирает ручные константы при взвешивании конфликтующих метрик и предсказывает персональные веса ценности каждого отклика в реальном времени. Приросты в промилле, зато трейд-офф действительно снимается, и всё уже в проде с околонулевым оверхедом. CanniUplift: A Holistic Framework for Mitigating Seller and Incentive Cannibalization in E-commerce Uplift Modeling И, наконец, Taobao и Tmall показывают, что в маркетплейсе SUTVA нарушается сразу с двух сторон. 1. Каннибализация между продавцами: купон переключает пользователя с дорогого товара на дешёвый, локальный аплифт вырос, GMV платформы упал — лечат сверкой суммы предсказаний по всем магазинам с общим GMV пользователя, так что рост за счёт соседа штрафуется на уровне лосса. 2. Каннибализация стимулов: человек купил, но не активировал купон, и модель записывает органический спрос себе в заслугу — здесь исход раскладывают на пути с погашением и без. Baseline переоценивал суммарный эффект примерно на 35%, а после исправлений A/B дал +4,08% инкрементального GMV при −2,45% затрат. Takeaway: если оптимизируете локальную метрику в экосистеме с конкуренцией, стоит хотя бы раз просуммировать свои же предсказания и сравнить с реальностью. #YaKDD26 Увидел интересное ❣ Денис Ишков ML Underhood

  • 13 авг.1 61653

    видео или голосовое, без подписи

  • 13 авг.1 4704053

    Выкатили Sona Technical Report — о модели, которая заменила весь рекомендательный стек Яндекс Музыки В этом месяце у службы рекомендательных технологий Яндекса произошли сразу два больших релиза. Сначала показали вторую версию Gryphon — unified-архитектуры, которая объединяет в себе кандидатогенерацию и ранжирование. Это альтернативный OneRec подход к построению рекомендательных end-to-end-моделей. А сегодня представили Sona — итог целого года работы команды, в результате которого удалось заменить весь стек рекомендаций Яндекс Музыки на единую модель. Внутри репорта — много деталей об архитектуре, инфраструктуре, многочисленные аблейшны. Это лучшее внедрение трансформеров в истории А/B-тестов в Яндекс Музыке. Три основные вещи, благодаря которым это получилось. 1. Масштабируемая архитектура Encoder-decoder, обучающийся хронологически на задачу Next Token Prediction без единой ручной фичи. Одной из самых сложных частей было сделать рецепт токенизации, который бы обеспечивал рост качества при росте словаря и числа токенов на документ. 2. Единая модель кандидатогенерации и ранжирования OneRec ранжирует кандидатов отдельной моделью, причём с использованием ручных фич. Мы же стремились к совместному рецепту обучения и инференса. Проблема в том, что задача ранжирования слишком спарсовая и модель просто не обучается выполнять её достаточно хорошо. Решение — сжать год данных в ранжирующую модель, обучающуюся авторегрессивно, дистиллировать эти знания в совместную модель. 3. Инфраструктура обучения и инференса Любые большие изменения в ML приводят к настолько же большим изменениям в инфраструктуре. Нам пришлось фактически построить новый движок рекомендаций с нуля. Очень важной компонентой стало онлайн-обучение: end-to-end-путь события от возникновения до обновления модели в инференсе укладывается в 1 час в 99% случаев. Чтобы лучше понять, что именно в модели поменялось между двумя А/B-тестами — который показывали в Gryphon-v2 и который репортим в Sona, — посмотрите табличку с масштабированием слоёв ранжирующего модуля и контекста и компрессией истории (картинка №2). По сравнению же с текущей продакшен-системой в Sona получили статзначимый рост главных метрик: 🔴+4,53% Active Users — основной метрики эксперимента; 🔴+6,30% Total Listening Time — общего времени прослушивания; 🔴+11,42% Likes — количества лайков. Причём это прирост поверх улучшений от предыдущих внедрений, которые оставались в контрольной выборке в продакшне. Рост Active Users оказался в 2,35 раза выше прироста, который ранее дала Argus — самая сильная модель, использовавшаяся на этой поверхности до Sona. Главный результат работы — получили одну совместно обучаемую модель, которая заменяет собой многоступенчатый рекомендательный каскад и при этом повышает качество рекомендаций на реальном пользовательском трафике. Подробнее о том, как всё устроено и как к этому пришли, руководитель службы рекомендательных технологий Николай Савушкин расскажет на Practical ML Conf. ML Underhood

  • 11 авг.1 0883416

    видео или голосовое, без подписи

  • 7 авг.1 6954818

    Выложили препринт второй части Gryphon о рекомендациях в Яндекс Музыке О первой статье Gryphon мы уже рассказывали. Теперь вышла вторая работа, Gryphon-v2: One Model in Place of a Cascade, где мы попробовали заменить одной моделью весь рекомендательный каскад. В первой версии Gryphon уже объединял Semantic-ID generation и item-level scoring. Пользовательская история кодировалась один раз, а дальше модель генерировала кандидатов и сама их скорила. Но финальное ранжирование всё ещё оставалось за отдельным production ranker. Gryphon-v2 делает всё внутри одной модели: декодер генерирует 1024 Semantic ID, из которых набирается до 1200 треков, и Ranking Module сразу ранжирует выдачу для пользователя. Компактный Ranking Module мы обучаем дистилляцией: в роли учителя выступает большой трансформер, проученный на годе таргетов без единой ручной фичи. Чтобы Gryhon-v2 качественно решал задачу полного каскада, мы разработали Rollout Distillation: во время обучения текущая версия декодера генерирует кандидатов через beam search, учитель их оценивает, а Ranking Module тренируется воспроизводить эти оценки. Так модель лучше ранжирует кандидатов, похожих на тех, с которыми встретится на инференсе. Больше 90% уникальных кандидатов для дистилляции приходят именно из таких rollout’ов. В A/B-тесте на Яндекс Музыке Gryphon-v2 поставили вместо полного production-каскада. Число активных пользователей выросло на 1,41%. Total listening time выросло на 1,62%, лайки — на 7,12%, доля недослушанных треков снизилась на 9,65%. Это первый эксперимент в Яндексе, где одна модель смогла заменить собой полный каскад, прирастив метрики. Над статьёй работали коллеги из нескольких команд рекомендательных технологий Яндекса: Анна Липкина, Дарья Тихонович, Виктор Януш, Мария Ульянова, Олег Сорокин, Владислав Додонов, Илья Мурзин, Денис Бурштейн и Николай Савушкин. ML Underhood

  • 31 июл.1 8442917

    Registers Matter for Pixel-Space Diffusion Transformers Сегодня разбираем свежую статью от команды Visual GenAI в Yandex Research на тему регистров в картиночных диффузионках. Немного контекста Изначально регистры придумали для визуальных трансформеров. В self-supervised-моделях вроде DINO обнаружили «артефакты»: некоторые патч-токены получали слишком высокие нормы, а CLS-токен начинал смотреть не на основной объект, а, например, на фон. Такие аутлайеры появлялись на разных слоях и портили внутренние фичи модели. В статье Vision Transformers Need Registers нашли изящное решение: добавить к последовательности несколько пустых токенов — регистров. После прохода модели их просто выбрасывают. При этом аутлайеры переезжают из патчей в регистры, а внутренние представления становятся чище. Техника хорошо сработала на классификации, сегментации и оценке глубины и постепенно стала стандартной для self-supervised ViT. Регистры в диффузионных трансформерах Авторы решили проверить, что происходит с регистрами в диффузионных трансформерах. Для этого посмотрели на несколько pixel-space- и latent-space-моделей и обнаружили, что привычных для ViT аутлайеров в них нет. Нормы патч-токенов распределяются равномерно, и из-за этого кажется, что регистры диффузионкам не нужны. Но если всё-таки добавить несколько пустых токенов, качество стабильно растёт. При этом эффект не такой, как в ViT. В обычном визуальном трансформере регистры просто забирают уже существующие аутлайеры из патчей. В DiT аутлайеров изначально нет, и они появляются только после добавления регистров, причём именно в этих пустых токенах. Зачем же DiT регистры Авторы сделали вывод, что диффузионным трансформерам выгодно иметь аутлайеры, но без регистров их некуда поместить. В диффузионном лоссе участвуют все патчи, поэтому лосс ограничивает их нормы. Регистры же в лоссе не участвуют и становятся свободными слотами для аутлайеров. Интересно, что после добавления регистров уменьшаются нормы самих патч-токенов, а внутренние фичи становятся чище и содержат меньше высокочастотного шума. Сильнее всего эффект на высоких уровнях шума. Сами регистры делятся на две группы: 1) Одни содержат семантическую информацию и отвечают за разные части изображения (объект, фон или передний план). 2) Другие имеют высокую норму, но почти ничего не говорят о классе: они нужны скорее для сброса высокочастотного шума из патч-токенов. Где регистры работают лучше Лучше всего регистры работают в pixel space. VAE- и RAE-энкодеры уже сжимают изображение и убирают часть высокочастотного шума, делая пространство более удобным для диффузии. В пиксельном пространстве такой обработки нет, поэтому польза от регистров максимальная. Ещё важный момент: добавлять их лучше не с первого слоя, а примерно с середины модели. На ранних слоях регистры могут набрать бесполезную информацию и протащить её дальше. Register guidance В результате работы исследователи предлагают решение в виде register guidance. Одна и та же модель умеет работать с регистрами и без них: вариант без регистров используют как слабую модель, от предикта которой отталкиваются при генерации. Такой guidance улучшает визуальные детали, а в сочетании с classifier-free guidance даёт прирост качества. Код доступен на GitHub, веса моделей — на Hugging Face, а все материалы — на странице работы. Рассказал о работе ❣ Никита Стародубцев ML Underhood

  • 24 июл.2 1227

    видео или голосовое, без подписи

  • 24 июл.2 1307

    видео или голосовое, без подписи

  • 24 июл.2 1137

    видео или голосовое, без подписи

  • 24 июл.2 046237

    Конференция за конференцией — мы на SIGIR 2026! В эти дни в Мельбурне проходит конференция по исследованиям и разработке информационного поиска. И мы уже там, чтобы посмотреть (и вам показать) интересное, а также представить собственную работу — Gated Bidirectional Linear Attention for Generative Retrieval. В рекомендательных системах generative retrieval обычно строится по схеме «энкодер–декодер». Энкодер обрабатывает историю взаимодействий пользователя, после чего авторегрессионный декодер генерирует рекомендуемые объекты. В крупных стриминговых сервисах активные пользователи со временем накапливают очень длинные истории. По мере их роста энкодер становится одним из основных узких мест с точки зрения задержки, поскольку вычислительная сложность внимания с softmax квадратично зависит от длины последовательности. В статье предлагают Gated Bidirectional Linear Attention (GBLA) — слой двунаправленного аттеншена с линейной вычислительной сложностью, который расширяет линейное внимание тремя компонентами: локальным каузальным смешиванием с помощью Conv1D, гейтингом ключей на уровне последовательности для мягкого забывания и выходным слоем gated RMSNorm. На крупномасштабном датасете «Яндекс Музыки» гибридный энкодер, в котором блоки self-attention (SA) и GBLA чередуются в соотношении 1:2 — один блок SA, за которым следуют два блока GBLA, — достигает качества двунаправленного self-attention. Бонусом держите фото с места событий и фотографию крутого зубастого участника конференции. #YaSIGIR26 ML Underhood

  • 23 июл.1 7544419

    Scalable Keyword Spotting via Modular Network Expansion Сегодня рассказываем о статье от команды технологий голосового ввода Яндекса. Работу приняли на конференцию Interspeech 2026, которая пройдёт с 27 сентября по 1 октября в Сиднее. Авторы предложили новый способ обновлять набор голосовых команд в умных устройствах без забывания уже известных. Наш коллега Виктор Хаймоненко рассказал о методе подробнее. Чтобы расширить набор команд, поддерживаемых устройством с голосовым управлением, нужно дообучить модель распознавания речи. Но есть проблема: часто такие модели забывают команды, которые уже знали, или начинают хуже понимать их. Это называют catastrophic forgetting. Есть методы непрерывного обучения, например EWC (elastic weight consolidation), которые уменьшают эффект, но не устраняют его полностью. В работе предложили другой подход — модульное расширение модели. Он хорошо решает проблему и при этом требует меньше вычислительной мощности, чем те же LoRA и адаптеры. Предлагается не менять всю работающую нейросеть, а просто добавлять к ней компактный модуль, отвечающий за распознавание новых команд. Эта ветка использует промежуточные признаки, которые извлекает основная модель, но имеет собственный классификатор для новых команд. При этом параметры базовой модели остаются неизменными, поэтому результаты её работы для старых команд не страдают. Новый метод требует небольшого увеличения размера нейросети. Общее количество дополнительных параметров — не больше 10% от числа параметров изначальной модели. Эффективность проверили на открытом датасете Google Speech Commands. В экспериментах модель должна была выучить новые пары команд и при этом продолжить поддерживать старые. Метод снизил среднюю долю пропущенных новых команд (FRR) с 6,46% до 4,37% по сравнению с отдельной моделью аналогичного размера и превзошёл методы адаптеров и LoRA. Для сравнения, при обычном полном дообучении всей модели она хорошо усваивала новые команды, но гораздо хуже распознавала старые: средняя доля пропущенных известных команд выросла с 2,71% до 69,08%. Об особенностях процесса обучения и том, как обходили ограничения, рассказали на Хабре. ML Underhood

  • 14 июл.2 73012

    видео или голосовое, без подписи

  • 14 июл.2 7623511

    Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появилась обновлённая модель — Alice AI ART 2.0. Пользователи уже сейчас могут протестировать два базовых сценария её работы: Text-to-Image и Image-to-Image. Для Яндекса этот релиз — первый шаг к тому, чтобы получить unified-модель с едиными метриками и стеком, которая одинаково хорошо умеет и в T2I, и в I2I. Команда генеративных моделей в компьютерном зрении рассказала на Хабре об экспериментах на этом пути, которые сработали и не сработали. Делимся основным. С чего начали Стартовали, имея две сущности. С одной стороны, картиночный генератор Alice AI ART 1.0 — свёрточная модель с текстовым энкодером на базе LLM. С другой — редактирование с отдельной базовой моделью и пайплайном инференса. Это разделение было дорогим и приносило много сложностей. Каждое обновление приходилось дважды переносить, данные готовились по-разному, метрики T2I и I2I было тяжело сравнивать между собой, стадии обучения были рассогласованы. Что хотели от релиза Цели было две: свести две модели в одну и при этом поднять качество каждой. В T2I целились на рост релевантности и отрисовки текста на картинке. В I2I старались поднять общее качество, но с акцентом на важных для наших пользователях задачах: любые изменения с участием людей и стилизация. Критически важно было, чтобы объединённая модель не уступала по качеству раздельным, а лучше — превосходила их. Главный герой этого обновления — unified-претрейн Он включает данные обоих типов: «текст → картинка» и «картинка + инструкция → картинка». Была гипотеза, что общий визуальный и текстовый контекст перетекает между задачами и улучшает качество. Например, концепты (объекты, предметы, действия, стили), выученные на T2I, становятся доступны в I2I без дополнительного сбора данных. И это действительно подтвердилось. Мы также унифицировали архитектуру, перейдя на single-stream MMDiT с VLM в качестве текстово-картиночного энкодера, и увеличили размер генератора по сравнению с Alice AI ART 1.0. Важным оказалось использовать: 🔴Joint attention — текстовые и визуальные токены идут через общий аттеншн, а не двумя раздельными ветками. 🔴U-RoPE — позиционное кодирование, дружелюбное к разным разрешениям и к конкатенации картинка + текст (что особенно важно для I2I). Результаты Alice AI ART 2.0 стала намного более качественной в обеих задачах и по нашим замерам заметно отстаёт только от Gemini 3.1 Flash. Но главный показатель — это реакция пользователей. Скачивание результатов генерации и редактирования выросло на 37 %, а запросов на генерацию с персонажем стало больше на 23 %. В обзоре мы пробежались по верхам. В основном посте — подробно об аналитике и замерах, динамике обучений. Есть также таблицы с результатами и рассказ о том что у нас не сработало. ML Underhood

  • 10 июл.15,8 тыс56

    видео или голосовое, без подписи

  • 10 июл.16,2 тыс56

    видео или голосовое, без подписи

  • 10 июл.15,4 тыс56

    видео или голосовое, без подписи