tgindex
Data Secrets

Главный по машинному обучению Сотрудничество: @veron_28 РКН: clck.ru/3FY3GN

Последний пост
14 авг.
Последнее чтение
07:58
Постов за неделю
40
Всего постов
47
Тип
открытый
Язык
русский
Категория
Образование
В каталоге с
12 авг.
Подписчики
92 163
+136 за 4 дн.
Сутки
+38
+0,04%
Неделя
 
Месяц
 
Просмотров на пост
15 тыс
40 постов
Вовлечённость
16,3%
к подписчикам
Постов в день
5,7
всего 47
Упоминаний
110
каналов
Охват размещения
по 7 постам
1/24сутки в ленте
15 900
1/48двое суток
17 948
1/72трое суток
19 357

Медиана по постам, которые мы застали свежими и померили через сутки.

Посты

  • 14 авг.12,9 тыс288

    видео или голосовое, без подписи

  • 14 авг.12,9 тыс288

    видео или голосовое, без подписи

  • 14 авг.12,4 тыс223295

    Независимые исследователи нашли способ полностью восстанавливать скрытый ризонинг фронтирных моделей https://arxiv.org/abs/2608.09867 В статье они показывают, что зашифрованный ризонинг любой модели OpenAI, Anthropic и Google можно декодировать буквально 1:1, при этом без джейлбрейка модели. Авторы нашли архитектурную дыру: зашифрованные блоки ризонинга полностью совместимы и взаимозаменяемы между разными сессиями, пользователями и моделями внутри экосистемы одного провайдера. Например, если взять зашифрованный ризонинг Opus и подсунуть его менее умному Haiku, то тот может прочитать эти «мысли» и вывести их дословно в открытом виде. Вот так просто 🤷‍♂️ Последствий пропасть. Во-первых, с помощью такой уязвимости можно обходить анти-дистилляционные меры. Во-вторых, в открытых репозиториях куча таких скрытых блоков ризонинга, в которых могут оказаться чувствительные данные (в статье в выборке из 315 320 блоков обнаружили 367 артефактов PII и 182 учетки). В-третьих, это упрощает джейлбрейки и промпт-инъекции. Вот такой анекдот. Исследователи уже передали свои изыскания в лабы и говорят, что работа по ним ведется.

  • 14 авг.14 тыс429

    видео или голосовое, без подписи

  • 14 авг.14,3 тыс213437

    Вышел Qwen-3.8 27B! https://huggingface.co/Qwen/Qwen3.8-27B Бенчмарки на уровне Claude Opus 4.6, даже чуть лучше. Скачок значительный. Хорошие результаты на агентных задачах и в кодинге. В комплекте: мультимодальность, контекст 262к токенов (расширяется до 1М), настраиваемый бюджет ризонинга, лицензия Apache 2. Можно запустить на несложном железе после квантизации.

  • 14 авг.13,4 тыс208

    видео или голосовое, без подписи

  • 14 авг.13,4 тыс209

    видео или голосовое, без подписи

  • 14 авг.11,5 тыс231217

    Вышел технический репорт о Sona – модели, которая заменила весь рекомендательный стек Яндекс Музыки https://arxiv.org/abs/2608.11015 Эта модель – итог целого года работы. И это лучшее внедрение трансформеров в истории А/B-тестов в Яндекс Музыке. Но главное здесь, что Sona – это одна модель. До этого продакшн-каскад рекомендаций Яндекс Музыки включал в себя 15+ генераторов кандидатов плюс ранжирование на сотнях ручных фич. И это все заменили единой моделью, обучаемой end-to-end. Это даже звучит сложно, а на деле несет за собой еще больше проблем и нюансов, чем может показаться на первый взгляд. Вот три центральных момента: 1️⃣ Раньше, в подходах типа OneRec, ранжирование считала отдельная модель на ручных фичах. Sona же должна была стать единым рецептом обучения и инференса, то есть декодер (который генерирует кандидатов) и ранкер (который их ранжирует) должны использовать один и тот же энкодер user-эмбеддингов, которые рассчитываются один раз за запрос. А значит – надо обходиться без ручных фич. Но проблема в том, что явный сигнал (лайки, репиты) довольно редок, чтобы выучить ранжирование напрямую. Поэтому тут встроена дистилляция. Сначала обучали Teacher Ranker. Это большая, медленная, но очень умная модель, которую тренили аж на годе логов. Она не используется в проде и нужна для того, чтобы научить шустрый Ranking Module воспроизводить ее скоры. 2️⃣ Так как Sona – это encoder-decoder, обучаемый хронологически на Next Token Prediction, каждый трек нужно представить в виде токенов. Это называется Semantic ID. И тут кроется парадокс: чем больше растет словарь токенов, тем модель должна быть умнее, но на самом деле она просто не успевала эффективно использовать возросшее пространство и деградировала. Поэтому одной из самых сложных частей было сделать рецепт токенизации, который бы обеспечивал рост качества при росте словаря. Дьявол кроется в деталях. 3️⃣ Ну и, конечно же, инфраструктура. Переход на одну модель потребовал фактически нового движка рекомендаций, включая сложный online learning pipeline. Кроме того, авторегрессивная генерация с длинными историями – это дорого, и поэтому пришлось прорабатывать отдельные архитектурные трюки (History Compression, кастомные CUDA-кернелы, radix top-k), просто чтобы уложиться в приемлемую латентность. Ради чего была вся эта огромная работа? На этот вопрос хорошо отвечают метрики. Sona принесла: +4,53% Active Users, +6,30% Total Listening Time и +11,42% Likes. Причем это прирост поверх улучшений от предыдущих внедрений, которые оставались в контрольной выборке в продакшне. В планах у команды – масштабирование, добавление RL и, конечно, раскачивание Sona на полный трафик. Поздравляем ребят с грандиозными результатами!

  • 14 авг.13,7 тыс217213

    WSJ выпустили скандальный материал про жену Дарио Амодеи Журналисты прозрачно намекают, что Кэми Кларк может быть настоящим серым кардиналом Anthropic: якобы она постоянно ведет переговоры с инвесторами, присутствует на всех ключевых встречах и участвует в принятии решений. При этом известно о ней крайне мало. Ни Google, ни даже Claude не могут толком сказать, кто она. Журналисты утверждают, что материалы о ней удалялись намеренно. Возможно, из-за ее прошлого. Около 10 лет назад она якобы просила Джеффри Эпштейна, который в тот момент уже был один раз осужден, вложиться в ее стартап. Примерно тогда же она встречалась с CEO Google Эриком Шмидтом. А потом он стал одним из первых инвесторов Anthropic. Утверждается, что именно Кларк познакомила их с Амодеи. До сих пор она не имеет формальной должности в стартапе. Пишут, что одно время она пыталась создать внутри компании собственный фонд Mother of AGI Fund, но это ничем не закончилось. Статья получилась разгромной. Занятно, что вышла она именно сейчас, когда компания в преддверии IPO

  • 14 авг.13,8 тыс185

    видео или голосовое, без подписи

  • 14 авг.13,9 тыс160188

    Вышла GLM-5.3 https://z.ai/blog/glm-5.3 Прогресс относительно 5.2 очень заметный, хотя это та же базовая модель: масштабировали только пост-трейнинг. На Terminal Bench скачок х6, на DeepSWE – почти x1.5. При этом на сложные рассуждения модель теперь тратит меньше токенов. Очень близко подобрались к Fable и Sol. На CyberGym даже обогнали. В API пока не завезли, только GLM Coding Plan и ZCode: https://zcode.z.ai/en. Веса тоже будут позже, но будут.

  • 14 авг.14,4 тыс168351

    X опенсорснули рекомендательный алгоритм платформы – For You https://github.com/xai-org/x-algorithm Выложили ядро ранжирования, конфигурацию моделей, фильтры, и, главное, параметры весов сигналов в ленте. По сравнению с прошлым релизом, объем кода вырос в 10-15 раз. И если ранее это был просто скелет, то сейчас можно смотреть на точные веса действий, скоринг аккаунтов, модели анализа медиа и все остальное. Не раскрыли только системы, определяющие, нарушает ли пост правила, но это сделано осознанно. Короче, есть в чем покопаться. Кроме того, теперь репа открыта для контрибьютов.

  • 14 авг.14,1 тыс4847

    До 20 августа открыт прием заявок в магистратуру «Машинное обучение» в Центральном университете! У каждого абитуриента есть шанс получить грант до 75% на весь срок обучения. «Машинное обучение» — это направление с несколькими форматами и треками. В офлайн-формате (пары по вечерам и в выходные в центре Москвы) можно выбрать один из трех треков: 1️⃣Индустриальный — сильная база в ML, современные инструменты, реальные задачи от партнеров 2️⃣Научный (AIRI × ЦУ) — сложные модели, исследования, подготовка к аспирантуре и работе в передовых лабораториях 3️⃣ML в электронной коммерции × Lamoda — работа с реальными данными Lamoda, применение ML для бизнес-задач и возможность попасть на стажировку в компанию Для тех, кто хочет учиться из любой точки мира, есть онлайн-формат: основной трек и продвинутый — для специалистов с опытом в ML. Это полноценная альтернатива офлайну с теми же преподавателями и курсами. Магистратура в ЦУ — это 2 года обучения, которое можно совмещать с работой, и диплом государственного образца. Карьерная поддержка начинается еще во время учебы: консультации, тренировочные собеседования и помощь с трудоустройством. Студенты уже в процессе обучения выходят на новые позиции или повышаются в грейде в Яндексе, Авито, Т-Банке и других компаниях. 🏆Поступление проходит через грантовый конкурс — это одновременно способ попасть на программу и возможность выиграть финансовую поддержку на все время обучения: грант покрывает до 75% стоимости. В 2026 году доступно 550 грантов на все программы магистратуры. Подробнее о программах и условиях участия в конкурсе — по ссылкам: ➡️Офлайн программа ➡️Онлайн программа

  • 14 авг.18,9 тыс227304

    Дождались: OpenAI превьюит Ultrafast mode для GPT-5.6 Sol Это тот самый инференс на Cerebras. Ускорение обещают в 14 раз (!), модель сможет генерировать до 750 токенов в секунду. Для такого гиганта как Sol это просто грандиозная скорость. Достигается она за счет того что Wafer-Scale Engine архитектура Cerebras держит веса модели прямо на огромных чипах, и их не приходится гонять между памятью и хранилищем. На видео спидран HLE. На весь бенчмарк ушло чуть больше 11 часов. У Claude Fable тот же прогон занял почти 80. Пока мод будет доступен только избранной группе пользователей в API, но может и до обычных юзеров скоро доберется (но платить придется почку, не меньше). https://openai.com/index/previewing-ultrafast/

  • 13 авг.17,9 тыс219

    видео или голосовое, без подписи

  • 13 авг.18 тыс218

    видео или голосовое, без подписи

  • 13 авг.17,4 тыс169224

    Google выпустили Gemini 3.7 Flash (Где-то тихонько плачет Gemini 3.5 Pro, выход которой, похоже, вообще отменили) Теперь это самая сильная модель Google для кодинга и агентов. Бенчмарки на уровне GPT-5.6 Terra и в среднем чуть лучше Sonnet 5. На Deep SWE, например, берет 65.3%. До конца года модель будет стоить вдвое меньше Gemini 3.6 Flash: $0.75/1M input и $3.75/1M output (но при этом она, видимо, расходует чуть больше токенов на рассуждение и планирование). https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/ P.S. Модель также доступна в API DS Lab

  • 13 авг.17,5 тыс138

    видео или голосовое, без подписи

  • 13 авг.17,5 тыс138

    видео или голосовое, без подписи

  • 13 авг.17,5 тыс138

    видео или голосовое, без подписи