tgindex
AI VK Hub

Рассказываем и показываем AI в VK 🔉

Последний пост
13 авг.
Последнее чтение
06:19
Постов за неделю
4
Всего постов
55
Тип
открытый
Язык
русский
Категория
Технологии (по похожим)
В каталоге с
12 авг.
Подписчики
2 427
+9 за 4 дн.
Сутки
+2
+0,08%
Неделя
 
Месяц
 
Просмотров на пост
1 084
40 постов
Вовлечённость
44,7%
к подписчикам
Постов в день
0,6
всего 55
Упоминаний
9
каналов
Охват размещения
оценка
1/24сутки в ленте
487
1/48двое суток
558
1/72трое суток
601

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • Weak Semantic Reasoning: проблема понимания Semantic ID Даже согласованный токенизатор не отвечает на главный вопрос: понимает ли LLM структуру каталога или просто запоминает популярные переходы? Это вторая из трёх фундаментальных проблем генеративных рекомендаций: разрыв между заложенным в Semantic ID (SID) смыслом и тем, что модель фактически выучила. ➡️ Часть 1 ➡️ Часть 2 Рассуждения в стиле «LLM не видела SID на претрейне» логически ошибочны. Отсутствие кода в обучающих данных не исключает, что модель выучит его роль после адаптации. Эксперименты с произвольными символьными метками подтверждают: трансформер осваивает искусственные знаковые системы при достаточном объёме адаптационных данных. Четыре рассогласованных пространства SID создают 4 потенциально несовместимых геометрии: 🟣Item geometry: непрерывные эмбеддинги айтемов 🟣SID geometry: дискретные кодовые последовательности 🟣LLM representation: скрытые состояния и эмбеддинги токенов внутри модели 🟣Autoregressive likelihood: условные вероятности последующих токенов Нет причин ожидать, что эти пространства изоморфны Общий префикс в SID может отражать устройство токенизации, а не понятие, которое модель интерпретирует как категорию. Так, иерархия RQ-VAE остаётся свойством кодировщика: первый код грубо приближает эмбеддинг, последующие корректируют остатки. Каузальное внимание не знает, что первая позиция соответствует родительскому кластеру, а четвёртая — листовому узлу: позиционные эмбеддинги кодируют порядок, но не роль в онтологии. Три уровня понимания 🟣Token recognition: модель генерирует и валидно декодирует SID 🟣Structural understanding: модель использует префикс как иерархию 🟣Semantic reasoning: модель выводит корректные отношения для незнакомых комбинаций атрибутов и доменов Рост метрик ранжирования после SID-aware обучения не доказывает структурного понимания. Если большинство пользователей после айтема A выбирают B, модель предсказывает SID(B) без знания о том, что A и B из одной категории. Recall@K и NDCG не различают зазубривание, интерполяцию и рассуждение. Три направления решения 1️⃣ Совместная оптимизация токенизатора и рекомендателя. Например, DIGER делает квантование дифференцируемым через Gumbel exploration: градиент от рекомендательного лосса пробрасывается в токенизатор, и кодбук корректируется под итоговую задачу 2️⃣ SID-языковое выравнивание. Так, SIDReasoner строит двунаправленную связь между кодами и естественным языком, переводя SID в заголовок и обратно, а PLUM расширяет словарь SID-токенами и проводит continued pre-training на доменных данных до fine-tuning 3️⃣ Семантико-коллаборативное выравнивание. Например, DAS объединяет квантование контентных признаков с коллаборативным сигналом, очищенным от популярностного смещения. Такой подход особенно полезен в сценариях холодного старта, где контентные признаки покрывают новые айтемы, а коллаборативные фильтруют поведенческий шум. Методологический пробел Бенчмарка для оценки рассуждения над SID не существует. Для проверки нужны: 🟣Prefix intervention: заменить префикс, сохранив суффикс, и измерить эффект 🟣Random-SID control: переставить SID между айтемами, сохранив частоты 🟣Held-out composition split: исключить комбинации пар атрибутов и проверить обобщение 🟣Faithfulness test: изменить промежуточный reasoning trace и проверить, меняется ли рекомендация Без этих тестов улучшение NDCG остаётся инженерным результатом, но не доказательством семантического рассуждения. #aivkhub #genrecsys #recsys

  • 12 авг.4 5461442

    📢 Исследователи AI VK Research научили двухбашенный трансформер над историей оптимизировать удовлетворённость пользователя за всю сессию. Работа принята на воркшоп конференции KDD 2026, которая проходит сейчас в Южной Корее. Большинство современных рекомендательных моделей решает локальную задачу — предсказать следующее взаимодействие или следующий положительный фидбэк. Мы сформулировали задачу как RL на уровне сессии и обучили кандидатогенератор через off-policy REINFORCE на логах. На индустриальных данных такая модель выигрывает у next-item и next-positive prediction по всем оценкам награды за сессию, сохраняя качество кандидатогенерации по recall-метрикам. ➡️ Подробнее в статье на Хабре. #aivkhub #ml #recsys

  • Продолжаем разбирать, как работают генеративные рекомендательные системы и какие задачи в этом направлении сейчас решают ведущие AI-команды мира. ➡️ Здесь начало статьи. Tokenizer Dissociation: разрыв оптимизации Токенизатор обучается отдельно от рекомендательной модели. После заморозки кодбука Semantic ID градиенты целевой задачи перестают поступать в токенизатор. Это первая из трёх фундаментальных проблем генеративных рекомендаций, обозначенных в прошлом посте. Стандартный пайплайн Из контентных и коллаборативных признаков энкодер строит непрерывные эмбеддинги айтемов, далее их превращают в дискретные Semantic ID через иерархическую кластеризацию или векторное квантование. Получившийся кодбук замораживается, рекомендательная модель учится на фиксированных токенах: предсказывает следующий Semantic ID или сразу ранжированный список Semantic ID. На инференсе сгенерированные токены сопоставляются с айтемами через кодбук. Где возникает разрыв Токенизатор оптимизирует компактность кодового пространства, а рекомендательная модель минимизирует проксирующий лосс для Recall@K и NDCG. После заморозки кодбук изолируется от градиентов рекомендательной функции потерь. Дрейф и деградация Токенизатор группирует айтемы на основе близости их исходных эмбеддингов, стремясь минимизировать ошибку квантования кодового пространства. Рекомендательная же модель перестраивает это пространство под задачу ранжирования. Эти две геометрии неизбежно расходятся, так как компактное представление кодов конфликтует с оптимальным ранжированием. В процессе обучения модель удаляется от исходного распределения и статическая дискретизация теряет свою дискриминативную силу, переставая быть оптимальной для финальной задачи ранжирования. Из-за недифференцируемости операции дискретного выбора градиенты не могут пройти сквозь слой квантования и модель теряет способность корректировать границы токенов. В результате система не может адаптироваться к новым айтемам или изменившимся поведенческим паттернам. Направления решений 1️⃣ ETEGRec (SIGIR 2025) объединяет токенизатор и рекомендатель в единую архитектуру. Градиенты от ранжирующего лосса проходят в токенизатор через sequence-item alignment и preference-semantic alignment. Попеременная EM-like оптимизация стабилизирует совместное обучение. Это самый прямой подход к проблеме, но и самый сложный в стабилизации 2️⃣ OneRec (2025) подмешивает коллаборативный сигнал к контентным признакам ещё до квантования, формируя Semantic ID на основе совместных просмотров товаров пользователями. PLUM (2025) развивает эту логику, внедряя многоэтапную схему с непрерывным предобучением на логах взаимодействий. COSETTE (2025) насыщает токенизатор сигналом непосредственно на этапе построения, заставляя токены одновременно реконструировать контент и максимизировать релевантность для рекомендации через контрастивную цель. Во всех случаях двухэтапный пайплайн сохраняется, но кодбук перестаёт быть слепым к задаче ранжирования 3️⃣ DAS (CIKM 2025) объединяет квантование и выравнивание в единый сквозной этап обучения. Contrastive alignment и dual learning синхронизируют квантованные представления пользователей и айтемов 4️⃣ Инженеры AI VK под руководством Владимира Байкалова совместно с ИТМО решали смежную задачу: пересчёт Semantic ID на свежих логах ломает совместимость с уже обученным ретривером. Предложенный метод выравнивает новые токены под старое пространство через биективный матчинг, после чего ретривер дообучается без полного переобучения Полностью совместная, стабильная при масштабе обучающая процедура пока не разработана. Продакшен-системы сохраняют гибридный дизайн: замороженный кодбук с alignment-слоями. #aivkhub #genrecsys #recsys

  • 📢 Инженеры AI VK запустили единую ИИ-модель для анализа всех типов взаимодействий с контентом внутри разных продуктов. Она формирует нейропрофиль — представление об интересах человека. Нейропрофиль решает главную проблему больших экосистем — изоляцию данных между разными сервисами. Вместо того, чтобы копить историю пользователя по кусочкам, трансформер объединяет все его действия в один поток. Что это дало: 🟣Связь между разными форматами контента 🟣Масштабирование для новых продуктов 🟣Реальный буст на проде Подробнее в статье на Хабре.

  • без подписи

  • без подписи

  • без подписи

  • без подписи

  • без подписи

  • без подписи

  • без подписи

  • 6 авг.787126

    Легковесная full-band модель для шумоподавления и дереверберации Большинство моделей speech enhancement решают только шумоподавление и работают с аудио 16 кГц. Исследователи НИУ ВШЭ и VK адаптировали архитектуру FSPEN для одновременного шумоподавления и дереверберации full-band аудио (48 кГц) — 95 тыс. параметров, RTF 0.11, качество шумоподавления на уровне ground truth. В карточках кратко разбираем, что изменили в архитектуре, на каких данных обучали модель и каких результатов добились. Подробную статью читайте на Хабре. #aivkhub #ml #звук

  • 🟣Alibaba: 3 релиза за 2 недели 3 августа компания анонсировала флагманскую Qwen3.8-Max, MoE на 2.4 трлн параметров (~95 млрд активных), контекст 1M токенов, модель позиционируют как «вторую после Fable 5». 27 июля тихо, без техотчёта и бенчмарков, вышла бюджетная vision-language Qwen3.7 Flash ($ 0,03 — $ 0,13 за 1M токенов, контекст 1M). 21 июля представили Qwen-Image-3.0, генерация изображений с промптом до 4 500 токенов и рендером текста от 10px, но впервые в линейке без открытых весов, бенчмарков и техотчёта. 🟣DeepSeek: Flash выходит из preview 31 июля DeepSeek перевёл DeepSeek-V4-Flash из preview в стабильную версию (билд 0731), архитектура не менялась, пересобран только пост-трейнинг — заметный рост на агентных бенчмарках (Terminal-Bench 2.1: 82.7, DeepSWE: 54.4), нативная поддержка Responses API и Codex. Цены и название в API прежние. 🟣Thinking Machines Lab: младшая модель обгоняет старшую 30 июля Thinking Machines Lab выпустила Inkling-Small — открытую MoE на 276B параметров (12B активных), которая по эффективности и части reasoning/agentic бенчмарков обгоняет старшую Inkling (975B/41B, релиз 15 июля). Обе модели доступны на Hugging Face. 🟣Agnes AI: бюджетный reasoning с сильным кодингом 24 июля сингапурская Agnes AI представила Agnes 2.5 Pro Alpha — бюджетную reasoning-модель (39 баллов по Artificial Analysis Intelligence Index, контекст 1M, $ 0,45 — $ 0,90 за 1M токенов) с неожиданно сильным coding-скором (58,8) при скромном расходе токенов на рассуждения. 🟣Anthropic: Opus 5 приближается к Fable 5 24 июля Anthropic выпустила Claude Opus 5 — по цене и скорости на уровне Opus 4.8, но по интеллектуальным бенчмаркам (Frontier-Bench, ARC-AGI 3, OSWorld 2.0) приближается к Fable 5, по внутренним оценкам — самая согласованная (aligned) модель компании на сегодня. 🟣Black Forest Labs: единая модель для видео, изображений и звука 23 июля Black Forest Labs анонсировала FLUX 3 (Early Access) — мультимодальную flow-модель, обучаемую совместно на видео, изображениях и аудио в единой архитектуре. Поддерживает генерацию видео с нативным звуком до 20 секунд и первые эксперименты с action-prediction для робототехники. 🟣Google: три Gemini для агентных сценариев 21 июля Google выпустила три модели линейки Gemini: 3.6 Flash (на 17% эффективнее по токенам, чем 3.5 Flash, $ 1,50 — $ 7,50 за 1M), сверхбыстрый 3.5 Flash-Lite (350 ток/с, $ 0,3 — $ 2,5) и специализированный 3.5 Flash Cyber для поиска и патчинга уязвимостей в связке с автономным агентом CodeMender, доступ ограничен госорганизациями и партнёрами. 🟣Poolside: компактная модель против гигантов 21 июля Poolside выпустила Laguna S 2.1 — компактную MoE (118B/8B активных), обученную менее чем за 9 недель, которая на Terminal-Bench 2.1 (70,2) и других long-horizon coding-бенчмарках конкурирует с моделями на порядок крупнее. Веса открыты на Hugging Face. 🟣Moonshot AI: первая открытая модель класса 3T 16 июля Moonshot AI представила Kimi K3 — первую открытую модель класса 3T (2,8 трлн параметров) на архитектуре Kimi Delta Attention, с нативным зрением и контекстом 1M токенов. По собственным данным компании, модель уступает только Claude Fable 5 и GPT-5.6 Sol. Новые статьи от AI VK на Хабре 🟣Как создавали нейропоиск Discovery AI — технологию для крупнейшей контентной базы в РФ 🟣Как мы подружили LLM с А/Б‑тестами: от сломанного BI до HTML‑отчётов с ИИ‑аналитиком внутри 🟣LLM и психолингвистика: HELPER 🟣Как мы ускорили разметку видеопоиска в десятки раз и не потеряли качество: опыт внедрения VLM-асессора #aivkhub #дайджест

  • 3 авг.7723117

    Наш коллега, ведущий исследователь AI VK Research Владимир Байкалов, вернулся из Мельбурна с конференции SIGIR 2026 и подготовил обзор интересных работ, по которым виден главный тренд 2026 года: генеративные end-to-end модели не отменили каскадные пайплайны, а нашли своё место на стадии отбора. Ранжирование всё ещё делает отдельная модель. Помимо этого, видны ещё три тенденции: рекомендательные системы уходят в мультимодальные сценарии и учатся обдумывать свой ответ. Также исследователи начинают использовать в ранжирующей модели раннее связывание с историей пользователя. OxygenREC: An Instruction-Following Generative Framework for E-commerce Recommendation OxygenREC построена по принципу Fast-Slow Thinking, при котором ресурсоёмкий анализ интересов пользователя и быстрый онлайн-инференс разделены на два контура: 🟣 Slow: LLM в фоновом процессе анализирует историю поведения, контекст и недавние запросы пользователя, после чего формирует инструкции, которые описывают его текущие интересы 🟣 Fast: во время онлайн-обработки запроса encoder-decoder модель использует подготовленную инструкцию с историей пользователя и генерирует рекомендуемые товары с помощью Semantic ID Это близко к test-time scaling, но реализовано асинхронно: дополнительные вычисления расходуются не во время конкретного запроса, а фоном. Полученные инструкции модель использует без вызова LLM. M²GR: Generative User Interest Modeling via Multi-Granularity Multi-Objective CoT for Industrial Recommendation В этом исследовании модель учится предсказывать будущие интересы пользователя по истории взаимодействий. Вместо одного прямого прогноза она сначала определяет главные характеристики следующего объекта (категорию, бренд, цену и ключевые слова). Затем модель предсказывает, например, товар, по которому пользователь, вероятнее всего, кликнет, и на основе этого решения показывает товар, который пользователь может заказать. Получается своеобразная цепочка рассуждений, но без перехода к текстовым объяснениям: промежуточными шагами служат атрибуты товаров и прогнозы действий пользователя. Авторы называют свой подход implicit reasoning: модель выполняет промежуточные рассуждения во внутреннем пространстве представлений. При этом в M²GR каждому шагу заранее задан понятный смысл, поэтому такая цепочка остаётся вполне управляемой и интерпретируемой. Во время выдачи модель строит несколько возможных цепочек интересов пользователя, а их соответствие товарам-кандидатам передаётся основной модели ранжирования как дополнительный сигнал. Pin-SCALE: Semantic Cascading and Alignment Learning for Engagement-Aware IDs in Cold-Start Recommendations Интересной оказалась работа Pinterest об использовании Semantic ID для рекомендаций новых объектов. Здесь они применяются не для авторегрессивной генерации, а внутри классической двухбашенной модели поиска кандидатов. Поскольку отдельные Semantic ID разделяются между множеством похожих объектов, новый пин может получить часть поведенческого сигнала от уже известных системе объектов. Авторы предлагают последовательно объединять SID-токены от более общих к более точным, учитывать при их построении не только содержание объектов, но и пользовательские взаимодействия, а также дополнительно сближать представления в башнях запроса и кандидата. #aivkhub #recsys #конференция #sigir

  • 29 июл.1 0072218

    Исследователи AI VK Research представили большой датасет VK-LSVD на The Web Conference 2026 — одной из ключевых международных конференций в сфере web science. О датасете можно почитать подробнее в нашем канале и на Хабре. Мы подготовили обзор нескольких интересных статей, отмеченных программным комитетом конференции. 🏆 Best paper award From Retrieval to Generation: Unifying External and Parametric Knowledge for Medical Question Answering Работа посвящена медицинским вопросно-ответным системам на базе LLM. В стандартном Retrieval-Augmented Generation (RAG) ответ строится с опорой на найденные в корпусе документы, тогда как Generation-Augmented Generation (GAG) использует сгенерированные LLM контекстные документы. Авторы предлагают многостадийный метод MedRGAG, который объединяет внешние и сгенерированные знания: после информационного поиска сжать его результат, определить недостающие знания, заполнить пробелы — сгенерировать соответствующие документы, выбрать из найденных и сгенерированных документов мини-корпус для контекста LLM для генерации ответа. Авторы продемонстрировали преимущество подхода в медицинском домене, но метод очень дорогой и при замене вспомогательной языковой модели GPT-4o-mini на меньшие качество падает. 🏆 Best Short Paper Award DualGR: Generative Retrieval with Long and Short-Term Interests Modeling Авторы усовершенствовали генеративный retrieval для рекомендаций коротких видео и предложили три модификации стандартного генеративного пайплайна. 🟣Dual Branch Router. История пользователя делится на два окна: длинное хранит устойчивые интересы, короткое окно ловит новые. При обучении модель выбирает окно, которое точнее совпадает с coarse semantic ID целевого видео. При инференсе кандидаты генерируются сразу по обеим ветвям и объединяются в список. 🟣Search based SID Decoding. После генерации первого (грубого) semantic ID модель фильтрует историю: оставляет только действия с таким же первым ID. Например, чтобы рекомендовать видео о спорте, анализируется история просмотров только спортивных роликов, и остальная история не мешает. 🟣Exposure aware NTP Loss. Модель штрафуется за высокую вероятность первого semantic ID у показанных, но непрокликнутых видео. Штраф вводится только на первом грубом уровне: неактуальные интересы затухают быстрее, а точные semantic ID не перекрываются лишними отрицательными метками. 🏆 Seoul Test of Time Award LINE: Large-scale information network embedding В этой работе исследователи предложили строить embedding для вершин больших графов по методу LINE. Метод хорошо масштабируется и учитывает два типа близости: первого порядка (по рёбрам графа) и второго порядка (по схожести соседей). Оба представления обучаются отдельно и конкатенируются. Есть инженерные приёмы реализации negative sampling и edge sampling — ребро выбирается с вероятностью, пропорциональной его весу, после чего обрабатывается как бинарное. Награда Seoul Test of Time Award особенная: её вручают за статьи, значимость которых со временем подтвердилась. Обзор подготовил руководитель AI VK Research Александр Дьяконов. #aivkhub #обзор #конференция

  • 24 июл.1 42818

    без подписи

  • 24 июл.1 50719

    без подписи

  • 24 июл.1 37718

    без подписи

  • 24 июл.1 3183518

    ⚡️ AI VK Research на SIGIR Прямо сейчас в Мельбурне проходит SIGIR 2026 — одна из ключевых конференций в области информационного поиска, ML и RecSys. Ведущий исследователь AI VK Владимир Байкалов вместе с коллегами из ИТМО представляет работу Mitigating Collaborative Semantic ID Staleness in Generative Retrieval. Подробнее о статье — здесь. Скоро мы разберем самые интересные исследования с SIGIR 2026. #aivkhub #recsys #конференция

  • 23 июл.1 0171613

    Generative Recommender Systems Классические рекомендательные системы работают по двухстадийной схеме: retrieval сужает множество кандидатов, ranking ранжирует их по релевантности. Генеративные рекомендательные системы (Generative RecSys) переосмысливают эту задачу: вместо скоринга готовых кандидатов модель генерирует представление следующего релевантного объекта. Semantic ID — основа подхода Обычно идентификаторы айтемов — это произвольные числа, которые не несут смысла, но в генеративном подходе их заменяют на Semantic ID — иерархические дискретные коды, полученные из кластеризации контентного и коллаборативного представлений. Семантически близкие айтемы разделяют префиксы: похожие коды отражают похожие айтемы, что позволяет переносить знания на длинный хвост и помогает при холодном старте. Например: 03.11.22.01.85.60.01.10 — стиральная машина, фронтальная загрузка, 8 кг, 1 200 об/мин, белая 03.11.22.01.10.65.02.15 — стиральная машина, фронтальная загрузка, 10 кг, 1 400 об/мин, серебристая 03.45.10.12.00.45.01.00 — микроволновая печь, объём 20 л, мощность 800 Вт, чёрная Как рекомендация становится генерацией GenRecSys решают задачу рекомендаций как задачу генерации последовательностей. Существует 3 основные постановки: 🟣 Next-item prediction — модель предсказывает следующий Semantic ID из истории взаимодействий 🟣 Slate generation — модель генерирует упорядоченный список рекомендаций одной выдачей, учитывая взаимное влияние айтемов в списке 🟣 Explanation generation — модель генерирует текстовое объяснение рекомендации Генеративный retrieval как ключевой механизм Декодер последовательно генерирует токены Semantic ID, полученный код разрешается через ANN (Approximate Nearest Neighbor) или trie-индекс в конкретный айтем или кластер кандидатов. Sequence-to-sequence рекомендации трактуют историю пользователя как входную последовательность токенов и предсказывают следующий токен. Трансформеры здесь стали архитектурой по умолчанию: self-attention обрабатывает дальние зависимости и гетерогенные токены, декодер совмещает next-item prediction, классификацию интента и генерацию объяснений в одном backbone. Но есть и сложности. Генерация требует гибкости, retrieval требует детерминизма и покрытия. Коллизии токенизации и ошибки декодирования резко снижают recall. Exposure bias и накапливающаяся ошибка при авторегрессивном декодировании приводят к расхождению между офлайн-метриками и реальным поведением. Гибридный паттерн в продакшене В промышленных системах генеративные компоненты встраиваются в существующие пайплайны как дополнительный слой. Retrieval сужает кандидатов, генеративная модель уточняет интент или переранжирует, классический ранкер обеспечивает скорость и стабильность. Чистая end-to-end генерация проигрывает обученному ранкеру на доменах с плотными историческими данными, она дороже в обслуживании и подвержена галлюцинациям. Три фундаментальные проблемы Полностью генеративные рекомендательные системы упираются в три открытые задачи: 1️⃣ Двухэтапный процесс оптимизации, при котором генерация Semantic ID и обучение рекомендательной модели разнесены во времени, приводит к семантическому рассинхрону между идентификаторами и финальными эмбеддингами 2️⃣ Semantic IDs отсутствуют в обучающей выборке языковых моделей на этапе претрейна, поэтому модели хуже улавливают заложенную в них семантику, что ухудшает способность к рассуждению над кодами, ограничивает обобщение и кросс-доменный перенос 3️⃣ Существует фундаментальный компромисс между экспрессивностью Semantic ID и вычислительной сложностью генерации: недостаточная длина снижает специфичность репрезентации, в то время как избыточная длина негативно влияет на стабильность декодирования и скорость инференса Эти фундаментальные проблемы рассмотрим подробнее в следующих постах. ➡️ Часть 2 #aivkhub #recsys #genrecsys