tgindex
For AI2
@forlogkmrрусский
Последний пост
16 янв. 2025 г.
Последнее чтение
14 авг.
Постов за неделю
0
Всего постов
20
Тип
открытый
Язык
русский
В каталоге с
13 авг.
Подписчики
16
0 за 2 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
212
20 постов
Вовлечённость
1325,0%
к подписчикам
Постов в день
0,0
всего 20
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
1/48двое суток
1/72трое суток

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • Разбор тренда: графовые нейросети в индустрии Начинаем год с взгляда в будущее! Некоторое время назад Кирилл Хрыльченко написал на Хабре пост о главных трендах в рексис. Практически все эти тренды будут актуальны и в 2025-м — в науке и индустрии ещё много чего можно сделать в этих направлениях. Сегодня разберём подробнее один из трендов, который точно не потеряет актуальности в мире рекомендательных систем, — графовые нейросети. Посмотрим, какие подходы существуют и с какими интересными статьями стоит ознакомиться, чтобы лучше разобраться в теме. Классификация подходов: 1. End-to-end — обучаем графовую нейросеть вместе с последующей моделью. 2. Frozen — переиспользуем уже выученные графовые представления в замороженном виде: ◦ трансдуктивные — не обобщаемся на новых юзеров или айтемы; ◦ индуктивные — можем получать представления для новых юзеров или айтемов; ◦ промежуточные подходы — для юзеров получить представления можем, а для айтемов — нет. End-to-end Etsy — (2023) Unified Embedding Based Personalized Retrieval in Etsy Search. Особенности статьи: retrieval для поиска, графовое представление как дополнительная фича документа. SearchQuery-Product граф, семплирование соседей и усреднение в качестве агрегации. Taobao — (2023) Graph Contrastive Learning with Multi-Objective for Personalized Product Retrieval in Taobao Search. Аналогичное предыдущей статье применение подхода, item-item граф, attention в качестве агрегации. Amazon — (2021) Graph-based Multilingual Product Retrieval in E-Commerce Search. Идея, похожая на работу от Etsy. Авторы делают multilingual модель. Alibaba Group — (2022) Multi-level Contrastive Learning Framework for Sequential Recommendation. На обучении графовое представление пользователя сближается с тем, что получено из sequential модели. На инференсе графовая часть откидывается. Трансдуктивные X/Twitter — (2022) TwHIN. Embedding the Twitter Heterogeneous Information Network for Personalized Recommendation. Обучаемые ID для каждой сущности, TransE на BCE (link-prediction). Промежуточные Amazon — (2023) Multi-Task Knowledge Enhancement for Zero-Shot and Multi-Domain Recommendation in an AI Assistant Application. Авторы создают кросс-доменный граф: музыка, видео, книги. Юзеры кодируются индуктивно, а айтемы = обучаемые ID. Индуктивные Pinterest — (2022) MultiBiSage: A Web-Scale Recommendation System Using Multiple Bipartite Graphs at Pinterest. Исследователи получают графовые представления для пинов, которые потом переиспользуют везде. Используют контент. Spotify — (2021) Multi-Task Learning Of Graph-Based Inductive Representations Of Music Content. Мультитаск, BCE — пара вершин принадлежит одному плейлисту (link-prediction), либо пара вершин имеет один и тот же жанр, регрессия основана на близости по контенту. Spotify — (2020) Podcast Recommendations and Search Query using GNNs at Spotify. Graph Learning Workshop 2022. Рассказ о собственных графовых сетках Spotify. KuaiShou — (2023) A Unified Model for Video Understanding and Knowledge Embedding with Heterogeneous Knowledge Graph Dataset. Авторы получают индуктивные представления для видео и тегов к ним. Основные выводы 1. Используя графовые нейросети, многие авторы статей наблюдают улучшение метрик на long-tail айтемах. 2. Такие сетки удобно использовать для данных из разных доменов. 3. Также графовые нейросети используются как один из источников генерации кандидатов или фич в ранжировании. @RecSysChannel Обзор подготовил ❣ Артем Матвеев

  • Статьи и публикации Стэнфордского университета про LLM *LLM-модели, способные распознавать, переводить, прогнозировать или генерировать текст или другой контент

  • Сейчас занимаюсь написанием научной статьи про анализ распознавания речи для управления компьютером (управление компьютером голосом). Изучаю материалы по данной теме, скоро выложу много полезной информации

  • Про призовое место на хакатоне по кроссдоменным рекомендациям📌 За основу была взята идея статьи, что на непохожих доменах построение общих моделей, объединяющих эти домены строить нет смысла. Даны были два датасета, бейзлайн ALS и метрика NDCG. Решение было таковым: разделили ALS на каждый датасет отдельно, сделали рескор предиктов и получили 1 место на лидерборде среди 100 команд на протяжении 3х дней. Про ALS: модель на основе матричной факторизации. Если коротко, то берем матрицу взаимодействий пользователя с товарами, делим на две плотные матрицы U и X. Фиксируем матрицу U, оптимизируем X, потом наоборот фиксируем X, оптимизируем матрицу U и выполняем это действие поочерёдно. Нейросети на данной задаче дали худший результат, чем эта идея с использованием базовой модели 📊

  • Как задачу распознавания речи решать методом решения задач компьютерного зрения📌 Многие модели ASR принимают на вход спектрограмму, мы можем рассматривать её как изображение и извлекать из него признаки с помощью моделей CV. Спектрограмма — это визуальное представление частотного спектра звукового сигнала, отображаемое в виде графика, где по оси X откладывается время, а по оси Y — частота. Цвет или яркость пикселей в изображении спектрограммы обычно соответствует амплитуде (интенсивности) звука на данной частоте в конкретный момент времени.

  • Кросс-доменные реки статья 2

  • Кросс-доменные реки статья 1

  • Взяли призерство в хакатоне сбера по кросс доменным рексисам среди 100 команд. С решением помогли вот эти две статьи

  • видео или голосовое, без подписи

  • Тема, которую необходимо освоить перед тем, как вникать в рекомендательные системы -ранжирование Ранжирование от ВШЭ Ранжирование от Яндекса Основные подходы ранжирования Ранжирование с нуля

  • Материалы по рекомендательным системам Учебник Яндекса Курс ВШЭ

  • Участвую в создании курса по мл продвинутого уровня, делаю блок кластеризации. Вот подборка интересных материалов по методам кластеризации 1) Сравнение различных методов кластеризации 2) Random Swap алгоритм 3) Алгоритмы оптимизации в кластеризации

  • Следующий хакатон будет по рек системам, но тимлидить уже буду не я. Может быть тоже распишу короткие инсайты с решением задачи 🤔

  • Promt engineering

  • видео или голосовое, без подписи

  • Про подготовку датасета для нейронных сетей 🖥 Один из шагов предобработки- токенизация. Для обучения модели нужно предварительно преобразовать текст в токены. Это делается токенизатором. Также он преобразует токены в соответствующие им идентификаторы в предобученном словаре. from transformers import AutoTokenizer # Model id to load the tokenizer model_id = "bert-base-uncased" # Load Tokenizer tokenizer = AutoTokenizer.from_pretrained(model_id) # Tokenize helper function def tokenize(batch): return tokenizer(batch['text'], padding='max_length', truncation=True, return_tensors="pt") # Tokenize dataset raw_dataset = raw_dataset.rename_column("label", "labels") # to match Trainer tokenized_dataset = raw_dataset.map(tokenize, batched=True,remove_columns=["text"]) print(tokenized_dataset["train"].features.keys()) # dict_keys(['input_ids', 'token_type_ids', 'attention_mask','lable']) Большинство моделей Transformer используют алгоритм токенизации подслов . Чтобы определить, какие подслова представляют интерес и встречаются чаще всего в рассматриваемом корпусе, токенизатор должен внимательно изучить все тексты в корпусе — этот процесс мы называем обучением . Точные правила, которые управляют этим обучением, зависят от типа используемого токенизатора.

  • Достаточно мало материалов по рекомендательным системам, поэтому мы собрали несколько советов от мидлов: 📚Какие темы необходимо изучить, чтобы понять рексис? - бейзлайны, они прикольные, не очень сложные и бьют в том числе нейронки - метрики, очень важная тема тут, их много разных - последовательные модели, в том числе нейронки, тут же сейчас сота - остальные типы моделей 📚 Советы Важно хотя бы раз для себя построить полностью пайплайн для обучения и тестирования модели - это будет не просто, особенно учитывая что готовых библиотек хороших мало и они по своему пишутся

  • Материалы для изучения статистики и Data Science

  • Введение в NLP , канал с полезными ликбезами по нейросетям и машинному обучению

  • Тренировки по алгоритмам

For AI2 — tgindex