For AI2
Статистика- Последний пост
- 16 янв. 2025 г.
- Последнее чтение
- 14 авг.
- Постов за неделю
- 0
- Всего постов
- 20
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- —
- 1/48двое суток
- —
- 1/72трое суток
- —
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Разбор тренда: графовые нейросети в индустрии Начинаем год с взгляда в будущее! Некоторое время назад Кирилл Хрыльченко написал на Хабре пост о главных трендах в рексис. Практически все эти тренды будут актуальны и в 2025-м — в науке и индустрии ещё много чего можно сделать в этих направлениях. Сегодня разберём подробнее один из трендов, который точно не потеряет актуальности в мире рекомендательных систем, — графовые нейросети. Посмотрим, какие подходы существуют и с какими интересными статьями стоит ознакомиться, чтобы лучше разобраться в теме. Классификация подходов: 1. End-to-end — обучаем графовую нейросеть вместе с последующей моделью. 2. Frozen — переиспользуем уже выученные графовые представления в замороженном виде: ◦ трансдуктивные — не обобщаемся на новых юзеров или айтемы; ◦ индуктивные — можем получать представления для новых юзеров или айтемов; ◦ промежуточные подходы — для юзеров получить представления можем, а для айтемов — нет. End-to-end Etsy — (2023) Unified Embedding Based Personalized Retrieval in Etsy Search. Особенности статьи: retrieval для поиска, графовое представление как дополнительная фича документа. SearchQuery-Product граф, семплирование соседей и усреднение в качестве агрегации. Taobao — (2023) Graph Contrastive Learning with Multi-Objective for Personalized Product Retrieval in Taobao Search. Аналогичное предыдущей статье применение подхода, item-item граф, attention в качестве агрегации. Amazon — (2021) Graph-based Multilingual Product Retrieval in E-Commerce Search. Идея, похожая на работу от Etsy. Авторы делают multilingual модель. Alibaba Group — (2022) Multi-level Contrastive Learning Framework for Sequential Recommendation. На обучении графовое представление пользователя сближается с тем, что получено из sequential модели. На инференсе графовая часть откидывается. Трансдуктивные X/Twitter — (2022) TwHIN. Embedding the Twitter Heterogeneous Information Network for Personalized Recommendation. Обучаемые ID для каждой сущности, TransE на BCE (link-prediction). Промежуточные Amazon — (2023) Multi-Task Knowledge Enhancement for Zero-Shot and Multi-Domain Recommendation in an AI Assistant Application. Авторы создают кросс-доменный граф: музыка, видео, книги. Юзеры кодируются индуктивно, а айтемы = обучаемые ID. Индуктивные Pinterest — (2022) MultiBiSage: A Web-Scale Recommendation System Using Multiple Bipartite Graphs at Pinterest. Исследователи получают графовые представления для пинов, которые потом переиспользуют везде. Используют контент. Spotify — (2021) Multi-Task Learning Of Graph-Based Inductive Representations Of Music Content. Мультитаск, BCE — пара вершин принадлежит одному плейлисту (link-prediction), либо пара вершин имеет один и тот же жанр, регрессия основана на близости по контенту. Spotify — (2020) Podcast Recommendations and Search Query using GNNs at Spotify. Graph Learning Workshop 2022. Рассказ о собственных графовых сетках Spotify. KuaiShou — (2023) A Unified Model for Video Understanding and Knowledge Embedding with Heterogeneous Knowledge Graph Dataset. Авторы получают индуктивные представления для видео и тегов к ним. Основные выводы 1. Используя графовые нейросети, многие авторы статей наблюдают улучшение метрик на long-tail айтемах. 2. Такие сетки удобно использовать для данных из разных доменов. 3. Также графовые нейросети используются как один из источников генерации кандидатов или фич в ранжировании. @RecSysChannel Обзор подготовил ❣ Артем Матвеев
Статьи и публикации Стэнфордского университета про LLM *LLM-модели, способные распознавать, переводить, прогнозировать или генерировать текст или другой контент
Сейчас занимаюсь написанием научной статьи про анализ распознавания речи для управления компьютером (управление компьютером голосом). Изучаю материалы по данной теме, скоро выложу много полезной информации
Про призовое место на хакатоне по кроссдоменным рекомендациям📌 За основу была взята идея статьи, что на непохожих доменах построение общих моделей, объединяющих эти домены строить нет смысла. Даны были два датасета, бейзлайн ALS и метрика NDCG. Решение было таковым: разделили ALS на каждый датасет отдельно, сделали рескор предиктов и получили 1 место на лидерборде среди 100 команд на протяжении 3х дней. Про ALS: модель на основе матричной факторизации. Если коротко, то берем матрицу взаимодействий пользователя с товарами, делим на две плотные матрицы U и X. Фиксируем матрицу U, оптимизируем X, потом наоборот фиксируем X, оптимизируем матрицу U и выполняем это действие поочерёдно. Нейросети на данной задаче дали худший результат, чем эта идея с использованием базовой модели 📊
Как задачу распознавания речи решать методом решения задач компьютерного зрения📌 Многие модели ASR принимают на вход спектрограмму, мы можем рассматривать её как изображение и извлекать из него признаки с помощью моделей CV. Спектрограмма — это визуальное представление частотного спектра звукового сигнала, отображаемое в виде графика, где по оси X откладывается время, а по оси Y — частота. Цвет или яркость пикселей в изображении спектрограммы обычно соответствует амплитуде (интенсивности) звука на данной частоте в конкретный момент времени.
Кросс-доменные реки статья 2
Кросс-доменные реки статья 1
Взяли призерство в хакатоне сбера по кросс доменным рексисам среди 100 команд. С решением помогли вот эти две статьи
видео или голосовое, без подписи
Тема, которую необходимо освоить перед тем, как вникать в рекомендательные системы -ранжирование Ранжирование от ВШЭ Ранжирование от Яндекса Основные подходы ранжирования Ранжирование с нуля
Материалы по рекомендательным системам Учебник Яндекса Курс ВШЭ
Участвую в создании курса по мл продвинутого уровня, делаю блок кластеризации. Вот подборка интересных материалов по методам кластеризации 1) Сравнение различных методов кластеризации 2) Random Swap алгоритм 3) Алгоритмы оптимизации в кластеризации
Следующий хакатон будет по рек системам, но тимлидить уже буду не я. Может быть тоже распишу короткие инсайты с решением задачи 🤔
Promt engineering
видео или голосовое, без подписи
Про подготовку датасета для нейронных сетей 🖥 Один из шагов предобработки- токенизация. Для обучения модели нужно предварительно преобразовать текст в токены. Это делается токенизатором. Также он преобразует токены в соответствующие им идентификаторы в предобученном словаре. from transformers import AutoTokenizer # Model id to load the tokenizer model_id = "bert-base-uncased" # Load Tokenizer tokenizer = AutoTokenizer.from_pretrained(model_id) # Tokenize helper function def tokenize(batch): return tokenizer(batch['text'], padding='max_length', truncation=True, return_tensors="pt") # Tokenize dataset raw_dataset = raw_dataset.rename_column("label", "labels") # to match Trainer tokenized_dataset = raw_dataset.map(tokenize, batched=True,remove_columns=["text"]) print(tokenized_dataset["train"].features.keys()) # dict_keys(['input_ids', 'token_type_ids', 'attention_mask','lable']) Большинство моделей Transformer используют алгоритм токенизации подслов . Чтобы определить, какие подслова представляют интерес и встречаются чаще всего в рассматриваемом корпусе, токенизатор должен внимательно изучить все тексты в корпусе — этот процесс мы называем обучением . Точные правила, которые управляют этим обучением, зависят от типа используемого токенизатора.
Достаточно мало материалов по рекомендательным системам, поэтому мы собрали несколько советов от мидлов: 📚Какие темы необходимо изучить, чтобы понять рексис? - бейзлайны, они прикольные, не очень сложные и бьют в том числе нейронки - метрики, очень важная тема тут, их много разных - последовательные модели, в том числе нейронки, тут же сейчас сота - остальные типы моделей 📚 Советы Важно хотя бы раз для себя построить полностью пайплайн для обучения и тестирования модели - это будет не просто, особенно учитывая что готовых библиотек хороших мало и они по своему пишутся
Материалы для изучения статистики и Data Science
Введение в NLP , канал с полезными ликбезами по нейросетям и машинному обучению
Тренировки по алгоритмам