tgindex
DS League
@ds_leagueрусский

Be curious, not judgmental Канал про RecSys и авантюрный DS Author: @dr_slink Head of Core ML VK ex-Yandex.Dzen

Последний пост
15 окт. 2025 г.
Последнее чтение
08:47
Постов за неделю
0
Всего постов
18
Тип
открытый
Язык
русский
В каталоге с
13 авг.
Подписчики
415
0 за 2 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
1 154
18 постов
Вовлечённость
278,1%
к подписчикам
Постов в день
0,0
всего 18
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
1/48двое суток
1/72трое суток

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • #news #dataset #competition VK RecSys Challenge 2025 Как и обещал, запускаем соревнование по рекомендациям на базе VK-LSVD. В этом году хотелось сделать что-то для тех, кто заскучал от типичных рекомендательных соревнований. Поэтому здесь все немного наоборот. Ранжируем не клипы, а пользователей Для каждого клипа из теста нужно предсказать 100 наиболее релевантных пользователей. Метрика — NDCG, но не per-user, а per-item. Доступность пользователей ограничена Каждого пользователя можно задействовать не более чем для 100 клипов. Это делает задачу сложнее и ближе к реальности: мы можем показать один клип миллиону людей, но не миллион клипов одному пользователю. Клипы полностью холодные В тесте только новые клипы, которых не было в трейне. Поэтому классическими коллаборативными моделями залететь в топ уже не выйдет. Много данных Для задачи доступен самый большой индустриальный датасет рекомендаций клипов - VK-LSVD. Важный вызовом будет понять, что действительно нужно, а что лишнее для холодного старта. Призовой фонд Основной трек 🥇850 000 ₽ 🥈600 000 ₽ 🥉400 000 ₽ Трек для студентов и аспирантов 🥇350 000 ₽ 🥈200 000 ₽ 🥉100 000 ₽ Дедлайн принятия решений 15 декабря 2025 года в 23:59 (МСК) @ds_league

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • #recsys2025 #news The 19th ACM Recommender Systems Conference Что изменится? Уже достаточно долго на ACM конференциях организаторы рассказывают, что статьи станут бесплатными для читателей. Это важно, ведь не каждый может позволить себе подписку за сотни долларов. Однако, очевидно, они станут платными для чукчей писателей. В этот раз показали, как изменится система оплаты. Призвали подключать к ней свои организации, чтобы авторам не платить тысячи долларов за каждую статью из своего кармана. Стоимость подключения организации к ACM Open уже можно найти на сайте. К сожалению, есть опасность, что некоторые организации не допустят (ведь даже призовые за второе место в RecSys Challenge не выплатили). Два следующих RecSys будут в США (Миннесота, потом Гавайи). Это обычно снижает разнообразие авторов по странам, так как по правилам ACM конференций At least one author must attend the conference in person to present the paper. Papers that are not presented may be removed from the proceedings. Так что в следующий раз встретимся на RecSys 2028 в Порто. P.S. Хотя конференция не избежала наплыва LLM статей, были и оригинальные. К примеру, у постеров был целый стенд с демонстрацией рекомендаций терапии по сигналам напрямую из мозга (неинвазивные EEG и fNIRS - это вам не клики на показы делить). Слайды и записи выступлений уже доступны. А статьи можно найти в комментариях. @ds_league

  • #papers #news #industry OneSearch: A Preliminary Exploration of the Unified End-to-End Generative Framework for E-commerce Search AB results ✅, Source code ❌ Проблема Многостадийность поисковых систем увеличивает фрагментацию вычислений и несогласованность таргетов. Результат статьи End-to-End генеративная поисковая модель в маркетплейсе Kuaishou показала рост CTR на +1.67% и покупок на +2.40% в AB. При этом повысила утилизацию GPU с 3.26% до 27.32%. Как достигли 1. Базовый контентный эмбеддер обучается на коллаборативный таргет (q2i, q2q, i2i) и LLM-разметку релевантности. Из контентного эмбеддинга товара генерируются три семантических ID с помощью RQ K-means, оставшаяся невязка аппроксимируется двумя OPQ ID (для устранения коллизий между айтемами). 2. В энкодер подается запрос пользователя, долгосрочная история покупок, краткосрочная история кликов и RSU (Relevance Search Unit). Эти данные также представляются в виде семантических ID, агрегированных с затуханием по времени. 3. Все компоненты объединяются в предобученной архитектуре BART. Модель проходит несколько стадий дообучения на простые задачи (предсказать семантические ID по запросу, восстановить текст из ID, классифицировать категорию товара по ID, ...). После дообучается на реальный фидбек пользователей и предсказания reward модели со скором релевантности. Предобучение происходит раз в неделю, DPO дообучение near real-time. P.S. Конечно, к статье остаются вопросы. Например, разметка асессоров, по которой выдача OneSearch на 1-2% релевантнее многостадийной, производилась всего на 200 случайных запросах. А итоговый алгоритм раскатили только на 20% трафика домашней страницы. В любом случае, статья OneSearch продолжает One-линейку: OneRec, OneSug, OneRec TR, OneLoc, OneRec-V2 TR. Ваши ставки, что дальше? OneAds? OneOne? @ds_league

  • #papers #news #industry Leveraging Generative Models for Real-Time Query-Driven Text Summarization in Large-Scale Web Search AB results ✅, Source code ❌ Проблема Классические многостадийные системы резюмирования текста на каждом этапе воронки теряют информацию и целостность текстов. А End-to-End LLM модели слишком тяжелые для онлайн-инференса в поиске. Результат статьи LLM-модель авторов генерирует резюме сайтов на 20.68% лучше по асессорской разметке (GSB) и на 0.81% кликабельнее (CTR) в АБ, чем прошлая многостадийная система. И чтобы выдержать 50k QPS поисковика Baidu с 78ms latency хватает 334 NVIDIA L20. Как достигли 1. ERNIE-Lite-8K (10B) дообучается на 1000 человеческих саммари; 2. GPT-2-like (0.1B, с кодовым названием Hamburger) дистиллирует ERNIE на 14M саммари (130B токенов) сайтов из поисковой выдачи; 3. Далее Hamburger дообучается (SFT) на 6160 человеческих саммари, чтобы уменьшить искажение фактов; 4. После дообучается (DPO) на клики из онлайн трафика, периодически повторяя SFT, чтобы не уйти в кликбейт; 5. Финальная модель полностью квантуется в FP8 (веса, активации, KV-кэш) и деплоится на TensorRT-LLM со стратегией Lookahead Decoding, что позволяет ей работать в 68 раз быстрее, чем ERNIE почти без потери качества. P.S. Картинка из статьи — мечта любого продакта @ds_league

  • #recsys #dataset #news VK-LSVD: Large Short-Video Dataset Особенный домен Я пришел в RecSys из CV, где публичным бенчмаркам можно было доверять: результаты из научных статей хорошо коррелировали с продом. Поэтому, возглавив RecSys R&D, я предложил стратегию экспериментов с SotA моделями из академических статей, но практически на все предложения услышал: “уже пробовали, на нашем масштабе прироста нет”. Различия в методах валидации и доступности данных в академии и индустрии оказались внушительными. И хотя сейчас ситуация чуть лучше, RecSys всё ещё сильно отстаёт от CV/NLP. Что предлагает сообщество? Многие из выкладываемых датасетов содержат только то, что можно спарсить самостоятельно (например, отзывы и контент, как в Amazon Reviews, MovieLens или MicroLens). Однако ключевые сигналы для рекомендаций индустриальные системы получают вовсе не из отзывов. Netflix, сильно забустивший индустрию, после знаменитого соревнования погряз в судебных процессах и перестал публиковать свои данные. Интересные датасеты выкладывают Tencent (Tenrec) и Kuaishou (KuaiRec). Но несмотря на сотни миллионов DAU их сервисов, эти данные все еще очень далеки от индустриальных масштабов. Что решил сделать я? Я опубликовал самый близкий к индустриальным масштабам рекомендательный датасет VK-LSVD с 40В взаимодействий. Второй по размеру сейчас MLHD с 27B взаимодействий, а замыкает тройку свежая Yambda на 4.79B записей логов. Ключевые отличия VK-LSVD 40B взаимодействий. Упорядоченные по времени данные за 6 месяцев, которые включают и просто показы без реакций. 7 видов фидбека. Кроме привычного таймспента есть лайки, открытия комментов, шэры, закладки, дизлайки, клики на автора. 3 вида контекста. Место взаимодействия (лента, поиск, группы,…), платформа (десктоп, тв, смартфон,…), агент (тип браузера, клиента в приложении,…). 20M айтемов. Для каждого клипа известен автор, длительность и контентный эмбеддинг (недавно рассказывали, как их варим). 10M пользователей. С возрастом, полом и гео. Кастомный сабсемплинг. В индустрии часто приходится решать задачу согласованности оффлайн-метрик с онлайн-результатами для ускорения проверки гипотез. Академия может помочь нам с исследованием стратегий семплинга, результаты которых хорошо соотносятся с метриками на больших выборках. Почему именно клипы? В работе мне доступно много форматов (от музыки до знакомств), но именно клипы выглядят самыми подходящими для бенчмаркинга. Во-первых, в один момент времени на экран помещается один клип, что сильно упрощает атрибуцию фидбека: скип в клипах более осознанный сигнал, чем на витрине из 9 длинных видео, часть которых пользователь даже не заметил. Во-вторых, в этом формате практически отсутствует фоновое потребление, которое добавляет шум в других видах контента: например в музыке, действительно ли дослушанный пятый из десяти трек в сессии это позитивный сигнал? В-третьих, удобный интерфейс и десятки просмотров за сессию дают системе много фидбэка. Все это повышает точность оффлайн-оценки алгоритмов и позволяет добиваться лучшей корреляции с онлайном. Кроме того, выводы, полученные на клипах, хорошо обобщаются и на другие форматы (что мы наблюдали с DB&NWT). Что дальше? Датасет готов к вашим экспериментам, впереди еще статья и масштабное соревнование, так что stay tuned. @ds_league

  • #recsys #news Путеводитель по RecSys каналам Важно помнить, что, как научные пейперы, так и статьи в блогах больших технологических компаний не всегда раскрывают важные и неочевидные детали. Поэтому я внимательно слежу за каналами моих коллег, в которых можно узнать факты из первых рук: • @inforetriever Кирилл – legit специалист в рекомендательных системах с большим индустриальным опытом в RnD Яндекса. Часто сам мониторит arXiv и собирает для вас лучшее. Никакого булщита, четко подмеченные утечки в пейперах и строгая терминология. • Хороший взгляд на рекомендации от людей из компании Х можно найти у @WazowskiRecommends и @knowledge_accumulator. • Из Wildberries у @wildrecsys и @ml4value. • @mlvok коллеги из ОК проводят регулярные ридинг-клабы, в которых можно самим поучаствовать. Порой затрагивают более широкие темы, чем просто рекомендации. • @ru_recommender_systems – канал от Саши Петрова (ex-Amazon). Чуть больше активности в сопутствующем чате @ods_recommender_systems. Productivity tip Сегодня очень легко утонуть в информации, поэтому (пока вам не разработали рекомендательную систему постов про рекомендательные системы) лучше подписаться на 2-3 канала, которые вы действительно будете читать, чем на папку с десятком каналов, в которую вы не будете заходить. Если кого-то несправедливо забыл – пишите в комментариях. @ds_league

  • #recsys #news Путеводитель по RecSys Меня часто спрашивают, за кем следить, чтобы оставаться в курсе последних разработок. Делюсь с вами подборкой источников, которые я регулярно читаю, чтобы иметь самые свежие знания в области RecSys. Академия • Один из первых ресурсов в арсенале любого STEM специалиста – это arXiv. В разделе Information Retrieval ежедневно выходит десяток-другой статей, существенная часть из которых про RecSys. • Свежие результаты бенчмарков рекомендательных алгоритмов на популярных toy-датасетах можно найти на Papers With Code в разделе Latest papers. • Материалы большинства конференций есть на ACM DL. Релевантные: RecSys, CIKM, SIGIR, SIGKDD, UMAP, WSDM и WWW. Индустрия Чтобы не выискивать индустриальные статьи на arXiv, можно напрямую читать блоги компаний о рекомендательных системах: • Netflix Research – легендарная компания в рекомендательных системах. В свое время дала большой буст не только RecSys, но и соревновательному DS. • Spotify R&D – всё, вплоть до социальных исследований, о рекомендациях музыки, аудиокниг, подкастов. • Amazon Science – гигант e-commerce, который не нуждается в представлении. Последнее время активно экспериментируют с LLM в рекомендациях. • LinkedIn Engineering – рассказывают про работу с социальными графами на собственном примере. Имеет смысл просматривать и блоги других корпораций: Х Engineering, Google Research и DeepMind, Pinterest Engineering, Criteo Engineering, Nvidia Technical. Однако будьте готовы приложить чуть больше усилий для поиска, так как они пишут не только про RecSys. @ds_league

  • #career #recsys Анализ рынка RecSys в России Мне всегда нравилась аналитика вакансий от Хабра, но область Data Science там представлена достаточно слабо, что уж говорить о RecSys. Чтобы лучше понимать, как устроен рынок Data Scientist-ов в рекомендательных системах, я мониторю вакансии из телеги и одс. За последний год я накопил выборку из сотни вакансий, которые мне стало интересно проанализировать. В серии постов я поделюсь выводами, которые получилось сделать из этого анализа. Кто нанимает? Чаще всего специалистов в рекомендательных системах ищут VK, MTS, Sber, Wildberries, Yandex, Avito, Tinkoff и HeadHunter. Кого ищут? В большинстве случаев ищут, конечно же, синьеров (41% вакансий). На втором месте по востребованности – мидлы (34%), которые с большим отрывом обгоняют лидов (всего 20%). Исчезающе мало вакансий джунов (5%), что можно объяснить тем, что от хорошего джуна не требуется специфичных знаний, важнее хорошая DS база. Можно ли рекомендовать дистанционно? В 43% вакансий указана возможность полностью дистанционной работы. Любопытно и не удивительно, что почти всегда она отсутствует у вакансий на лидов. Сколько платят? Фан факт 1: если в вакансии и есть данные про деньги (что случается не так уж часто), то нередко указан только один из порогов вилки. А иногда пороги указаны сразу для Middle/Senior специалистов. Поэтому я решил анализировать пороги для каждого уровня отдельно. Фан факт 2: часто вилки указываются в гросс и это не только потому что так солиднее выглядит, но и из-за прогрессивного налога, под который с такими вилками достаточно легко попасть. Фан факт 3: почти у всех вакансий дополнительно указана возможность получения годовых\полугодовых бонусов в среднем 20% от оклада за этот период. Медианы для каждого уровня: Junior 187k-262k Middle 200k-325k Senior 325k-460k Lead 400k-500k @ds_league

  • Channel created