- Последний пост
- 23 окт.
- Последнее чтение
- 15 авг.
- Постов за неделю
- 0
- Всего постов
- 21
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- —
- 1/48двое суток
- —
- 1/72трое суток
- —
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
📸 Как работает «Поиск по фото»? На Wildberries можно загрузить любое изображение — и сервис почти мгновенно подберёт похожие товары из каталога. Это особенно удобно, когда сложно описать вещь словами или нужно найти «точно-такую-же-и-никакую-другую» В новой статье наш коллега Никита Романов, техлид продуктов «Поиск по фото» и «Похожие по фото», подробно разбирает, как устроен сервис — какие модели используются, как достигается высокая скорость отклика и какие решения лежат под капотом 📝 Если вам интересно: - как устроен продовый пайплайн поиска по фото, - как обучается модель распознавания и зачем ей MRL - при чем здесь LLM, и как их можно использовать для уточнения запроса текстом для реализации мультимодального поиска, то стоит прочитать статью! 🤓
🤔 Неочевидные подробности обучения двухбашенных моделей Все, кто работает с рекомендациями, наверняка сталкивались с pop-bias — эффектом, при котором чем популярнее товар, тем выше вероятность, что модель снова его порекомендует. Наш коллега Андрей Атаманюк из R&D команды подготовил статью на Хабре, где (очень) подробно разбирает эту тему. Статья обзорная и не столько про практические советы, как бороться с popularity bias, сколько про фундаментальное раскрытие причин его появления. В материале много математики, но она спрятана под каты, так что можно легко пройтись только по основным тезисам! 🙂
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
Привет! Делимся видеозаписями докладов после RecSys Meetup 🤘 1️⃣ «Трансформеры в персональных рекомендациях: от гипотез до AB-тестирования» | Иван Ващенко, DS Team Lead в команде персональных рекомендаций VK | YouTube | Презентация 2️⃣ «Semantic IDs: архитектура и наш опыт внедрения» | Александр Тришин, DS Stream Lead в команде персональных рекомендаций VK | YouTube | Презентация 3️⃣ «Как мы обучаем CLIP-ы для текстовых тегов» | Михаил Киндулов, Stream Lead в команде Поиск по фото VK | YouTube | Презентация 4️⃣ «Счастье пользователя vs счастье продавца. Онлайн-доранжирование и байесовская оптимизация в товарных рекомендациях» | Андрей Ветров, Data Scientist в команде товарных рекомендаций VK | YouTube | Презентация Смотрите фото, чтобы оценить атмосферу. И до встречи на следующих митапах! 🌟 @wb_space
🪄 Как мы тестировали увеличение разнообразия в рекомендациях В прошлый раз мы поделились нашими способами контроля разнообразия в рекомендациях. Теперь рассказываем, что получилось на практике! Мы попробовали новый способ формирования ленты и доработали исходную гипотезу. В текущей статье — все подробности! 👌
Приглашаем на RecSys Meetup! Когда? 28 августа, старт в 18:00 Где? Москва + онлайн-трансляция Обсудим актуальное из мира рекомендаций: от передовых архитектур для построения Semantic IDs и их внедрения в продуктивные системы, до тонкостей балансировки интересов пользователей и продавцов маркетплейса с помощью онлайн-доранжирования и байесовской оптимизации. В программе: 🚩 «Semantic IDs: архитектура и наш опыт внедрения» | Александр Тришин, Data Scientist в команде персональных рекомендаций 🚩 «Счастье пользователя vs счастье продавца. Онлайн доранжирование и байесовская оптимизация в товарных рекомендациях» | Андрей Ветров, Data Scientist в команде товарных рекомендаций 🚩 «Как мы обучаем CLIP-ы для текстовых тегов» | Михаил Киндулов, CV Engineer в команде Поиска по фото 🚩 «Трансформеры в Wildberries & Russ: от гипотез до AB-тестирования» | Иван Ващенко, DS Stream Lead в команде персональных рекомендаций Регистрация уже открыта! PS: для участия в офлайне регистрация обязательна. 🌟 @wb_space
📊 Продуктовая аналитика в рекомендациях Исторически, в этом канале мы рассказывали в основном про различные DS/ML-подходы к построению рекомендаций, не акцентируя внимание на самом продукте. Именно поэтому, для полноты картины, мы запускаем цикл аналитических статей. В них мы расскажем про особенности в проведении A/B-экспериментов и аналитических исследований, построении и визуализации CJM, разработке метрик, специфичных для рекомендаций, а также о других задачах продуктовой аналитики, помогающих бизнесу принимать решения на основе данных! Сегодня эстафетная палочка у Лёши Кузнецова - лида аналитики персональных рекомендаций. Он расскажет о своём пути и особенностях работы продуктовым аналитиком.
❤ Negative sampling в рекомендательных системах Негативное сэмплирование - один из ключевых инструментов обучения моделей на большом каталоге. В сегодняшнем обзоре расскажем про основные стратегии сэмплирования: ❤ In-Batch Negative Sampling ❤ Random Negative Sampling ❤ Frequency based Random Negative Sampling ❤ Adaptive mixed strategy ❤ Adaptive mixed strategy с линейной комбинацией
⚙ Векторное доранжирование В сегодняшней статье рассказываем про техническое решение, которое позволяет использовать WildBERT для персонализации произвольной поюзерной выдачи без дополнительного переобучения. Про подход, модель и инфраструктуру - тут. С праздником!
видео или голосовое, без подписи
🎤 Декомпозиция юзера на кластерные сущности На прошлой неделе прошла конференция Data Fusion, где в кейс-сессии рекомендательных систем мы рассказали как не разориться на инфраструктуре при постоянном росте количества пользователей ➡ Запись сессии ➡ Презентация…
видео или голосовое, без подписи
🎤 Декомпозиция юзера на кластерные сущности На прошлой неделе прошла конференция Data Fusion, где в кейс-сессии рекомендательных систем мы рассказали как не разориться на инфраструктуре при постоянном росте количества пользователей ➡ Запись сессии ➡ Презентация ❓ Описание При построении персональных рекомендаций зачастую подразумевается, что мы должны получить для каждого пользователя свою, уникальную подборку товаров. Однако в случае, когда пользователей становится слишком много, а в инфраструктуре товары хранятся с обогащением бизнес-факторами, такая схема становится все менее масштабируема. Расскажу о том, как мы без просадки в качестве существенно сократили затраты на инфраструктуру за счет кластеризации пользователей и товаров. 💬 Основные тезисы: - кластеризация пользователей (эмбеддинги WildBERT), создание агрегированной выдачи для кластера - кластеризация товаров (e5) - выделение интересов, отображение пользователя в пространство интересов - сравнение АБ-тестов для схем "храним подборку для каждого пользователя" и "храним только кластера, юзера описываем как набор кластеров и интересов" в разрезе ранжирующих метрик и затрат на инфраструктуру - как в такой схеме не просадить качество - доранжирование по эмбедингам в онлайне в момент формирования выдачи ⏱ Скоро расскажем как выступили на Стачке в Ульяновске, которая также прошла на прошлой неделе