Data Portal | DS & ML
СтатистикаВсё самое интересное из мира LLM, Data Science и машинного обучения adds: @devmangx Автор: @ScienceLLM
- Последний пост
- 18:10
- Последнее чтение
- 23:23
- Постов за неделю
- 34
- Всего постов
- 39
- Тип
- открытый
- Язык
- русский
- Категория
- Образование
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- 569
- 1/48двое суток
- 652
- 1/72трое суток
- 703
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Python может помочь инженерам-механикам автоматизировать рабочие процессы, анализировать данные и решать сложные инженерные задачи. В этом курсе разбирается Python именно для машиностроения — от базовых концепций программирования до практического применения в инженерных задачах. В программе NumPy, Pandas и Matplotlib, работа с ИИ в инженерных процессах и несколько практических кейсов. https://freecodecamp.org/news/python-for-mechanical-engineering/
Каждая модель машинного обучения, которую вы когда-либо обучали, в конечном счёте опирается на 62 страницы, написанные ещё в 1933 году. Речь о «Основах теории вероятностей» Колмогорова. Шесть аксиом. На них фактически построена современная теория вероятностей, и всё это умещается в небольшой книге. Особенно забавно сравнивать это со средней статьёй по глубокому обучению, которая может быть длиннее, но при этом ничего не доказывать. Книга бесплатно доступна в подборке Awesome Math Books. https://github.com/valeman/Awesome_Math_Books
Transformers – The Definitive Guide — официальный репозиторий с кодом к книге, построенный вокруг практических Jupyter-ноутбуков для изучения и применения трансформерных моделей. Материал ведёт от базовых принципов до развёртывания через 12 глав. Ноутбуки разбиты по темам, и каждый можно сразу открыть в Google Colab. https://github.com/Nicolepcx/transformers-the-definitive-guide
Отличная серия лекций по аппаратному обеспечению и системам для машинного обучения. Разбирается, как модели машинного обучения переносят на современное железо, оптимизируют и ускоряют — от алгоритмов до эффективного проектирования систем. Хороший материал, чтобы понять, что происходит под капотом современных ИИ-систем.
Генерирует высокодетализированные 3D-формы с помощью масштабируемого диффузионного подхода, который последовательно уточняет грубую геометрию с использованием воксельных методов. Репозиторий UltraShape-1.0 описывает задачу как генерацию высокоточных 3D-форм через масштабируемое геометрическое уточнение. https://github.com/PKU-YuanGroup/UltraShape-1.0
«Natural Language Processing and Large Language Models» — новая книга в открытом доступе от Springer, написанная Chengqing Zong, Yang Zhao и Yanjun Ma. Почти 400 страниц с введением в современную обработку естественного языка и большие языковые модели. Внутри: нейросети, распределённые представления, языковые модели, Transformers, BERT, GPT, токенизация, классификация тональности, извлечение информации, суммаризация текста, машинное понимание текста, машинный перевод, ответы на вопросы и RLHF. На мой взгляд, это хороший справочник для тех, кто хочет разобраться в этих темах без слишком высокого порога входа. Я бы сохранил. https://link.springer.com/book/10.1007/978-981-92-0682-7
видео или голосовое, без подписи
«Introduction to Machine Learning» Лорана Юнеса. Если вы уже знакомы с основными концепциями машинного обучения, этот учебник — хороший следующий шаг, чтобы глубже разобраться в лежащей за ними математике или освежить её. В книге разбираются: — оптимизация, SGD и Adam — компромисс смещения и дисперсии — регрессия, SVM и ядерные методы — деревья решений — нейронные сети — графические и генеративные модели — кластеризация — оценки границ обобщающей способности Несмотря на то что книга в первую очередь математическая, по ходу изложения она охватывает и ключевые методы машинного обучения. https://arxiv.org/abs/2409.02668
27-миллиардный агент обошёл Claude Opus 4.8 и GPT-5.5 в воспроизведении научных исследований на отложенном наборе задач. Replica превращает воспроизведение научных работ в масштабируемую среду для обучения с подкреплением. Попытка повторить результаты статьи требует того же исследования через гипотезы, эксперименты и поиск недостающих деталей, с которым приходится сталкиваться в реальной науке. Сигнал награды формируется автоматически созданной системой критериев, которая даёт стабильные оценки и хорошо совпадает с человеческой оценкой качества воспроизведения. Получившийся агент Faraday на 27 млрд параметров может использовать агентов для программирования как инструменты. Анализ его траекторий показывает, что он действует более научно и последовательно, а не просто пытается подстроиться под критерии оценки. Авторы считают, что это указывает на возможность обучать долгосрочные научные способности непосредственно в весах модели без необходимости строить вокруг неё сложную агентную инфраструктуру. Статья - https://arxiv.org/abs/2608.13331
https://github.com/patchy631/time-to-first-token Это дорожная карта по запуску и обслуживанию инференса LLM, где всё строится вокруг одного сервиса, а не разбросано по отдельным демо. Сначала вы разбираетесь в базовой модели работы системы, затем запускаете модель, подключаете метрики, проводите нагрузочное тестирование с более чем 1000 одновременных запросов и начинаете оптимизацию. В конце у вас остаётся самостоятельно настроенный стек и воспроизводимый бенчмарк, который уже не стыдно опубликовать.
Одно из ЛУЧШИХ видео от data_adventurer. Глубина разбора здесь просто невероятная. Очень хорошо объясняются основы обработки звука — от представления сигнала до спектрограмм и других фундаментальных вещей, на которых потом строятся современные аудио-модели. После этого намного проще понимать, откуда берутся реальные сложности в задачах распознавания речи, шумоподавления и обработки звука, например внутри автомобильного салона. Очень рекомендую посмотреть! https://youtu.be/55QWsm1itKo
Все шесть тригонометрических функций — это просто длины на одной окружности.
«Transformer с полной пропускной способностью» Обычно Transformer передаёт на следующий шаг только выбранный токен, хотя сама модель только что вычислила гораздо более богатое скрытое состояние. В этой работе скрытое состояние тоже подаётся обратно в модель. За счёт этого она может продолжать внутренне развивать идею, не расписывая всё токен за токеном. На масштабе 1 млрд параметров подход улучшает результаты в математике, программировании и тестах языковых моделей, добавляя менее 1% к стоимости декодирования. При этом модель может показывать результаты на уровне моделей, обученных примерно на вдвое большем объёме данных. https://alphaxiv.org/abs/2608.08888
Бесплатный PDF новой книги по оптимизации: http://faculty.washington.edu/sbrunton/OptimizationBootcamp.pdf
Awesome Math — огромная подборка материалов по математике в одном репозитории. Там собраны Khan Academy, MIT OpenCourseWare, конспекты лекций, учебники и другие бесплатные материалы по разным разделам математики. Проект живой и довольно популярный: сейчас у него больше 16 тысяч звёзд на GitHub. https://github.com/rossant/awesome-math
Ещё один отличный плейлист по структурам данных и алгоритмам от pmavrin. https://youtube.com/playlist?list=PLrS21S1jm43igE57Ye_edwds_iL7ZOAG4&si=4mS5lXn3uxI-V2LM
«Beginning in Algebraic Geometry» — ещё один бесплатный учебник с открытым доступом, который даёт строгий, но при этом довольно доступный вход в алгебраическую геометрию. Книга объёмом более 400 страниц. Из предварительных знаний нужны только вводные курсы по абстрактной и линейной алгебре. Она начинается с колец многочленов, а затем постепенно переходит к аффинной алгебраической геометрии: многообразиям и идеалам, координатным кольцам, полиномиальным отображениям, теореме Гильберта о нулях, размерности, гладкости и произведениям. После этого разбираются проективные и квазипроективные многообразия и более продвинутые темы. На мой взгляд, это очень интересный ресурс, если хочется относительно мягко войти в алгебраическую геометрию. https://link.springer.com/book/10.1007/978-3-031-88819-9
Исследователи Tencent и Университета Цинхуа представили CALM — языковую модель, которая генерирует текст не по одному токену, а сразу целыми фрагментами. Автоэнкодер сжимает четыре токена в один непрерывный вектор, а затем восстанавливает исходный текст с точностью более 99,9%. В результате модели требуется в четыре раза меньше последовательных шагов генерации. В экспериментах CALM с 371 млн параметров показала результат на уровне обычного трансформера, использовав на 44% меньше вычислений при обучении и на 34% меньше при генерации. Это ещё не смерть предсказания следующего токена. Исследование проводилось на моделях до 1,82 млрд параметров, а при сжатии восьми токенов качество заметно снижалось. Однако сама идея чрезвычайно важна. Если она масштабируется, будущие модели смогут генерировать язык не по одному маленькому фрагменту, а сразу смысловыми блоками. https://arxiv.org/pdf/2510.27688
Как научить рекомендации думать не о следующем лайке, а о всей сессии? Обычно рекомендательные системы оптимизируют ближайший сигнал: клик, лайк или дослушивание. Но каждое действие меняет состояние пользователя, поэтому локально хорошая рекомендация не обязательно улучшает всю сессию. В новой работе AI VK Research рекомендации формулируются как задача обучения с подкреплением. Модель рассматривает пользователя как среду, рекомендацию — как действие, а реакцию пользователя — как награду. Главная проблема — обучение на логах старой модели. Авторы используют REINFORCE с многошаговой off-policy коррекцией, чтобы учитывать различия между старой и новой политиками и контролировать рост дисперсии. В экспериментах подход улучшил оценку долгосрочной сессионной награды без существенного ухудшения стандартных метрик. Получается интересный сдвиг: модель оптимизирует не отдельное взаимодействие, а последствия рекомендации для всей сессии. https://habr.com/ru/companies/vk/articles/1068050/
Исследователи впервые в больших масштабах извлекли настоящие скрытые рассуждения из закрытых моделей OpenAI, Anthropic и Google. Затем они использовали эти данные для изучения Kimi K3, GLM-5.2, DeepSeek и других открытых моделей. OpenAI, Anthropic и Google всё реже показывают пользователям полные цепочки рассуждений. Итоговый ответ можно скопировать, но гораздо ценнее понять, как именно модель к нему пришла. Если получить большое количество полных рассуждений, их можно использовать для дистилляции и обучения собственной модели. Поэтому программные интерфейсы шифруют рассуждения и возвращают их клиенту. Пользователь не видит содержимое, но при следующем запросе зашифрованные данные можно снова передать модели, чтобы она продолжила с того же места. Исследователи обнаружили, что зашифрованные рассуждения совместимы между разными пользователями, сессиями и даже моделями одного разработчика. Сначала самая мощная модель создаёт рассуждение. Затем его зашифрованную версию передают более слабой и менее защищённой модели того же разработчика. После обхода ограничений маленькая модель расшифровывает и воспроизводит мысли старшей модели. Например, скрытые рассуждения Claude Opus 4.8 можно передать Haiku и заставить её прочитать содержимое. Взламывать саму Opus для этого не требуется. Исследователи успешно извлекли скрытые рассуждения из Claude, GPT и Gemini, обойдя защиту от дистилляции. Авторы получили настоящие рассуждения GPT-5.6 Sol и Claude Opus 4.8, после чего передали их моделям Kimi-K3, Kimi-K2.6, Kimi-K2.5, GLM-5.2, DeepSeek-V3.1 и Inkling. Стиль рассуждений Kimi-K3, Kimi-K2.6, Kimi-K2.5 и GLM-5.2 заметно изменился. В тесте AIME модели Kimi-K3 передали небольшой фрагмент рассуждений GPT-5.6 Sol. После этого она начала генерировать ответы с формулировками, очень близкими к ответам GPT-5.6 Sol. Анализ вероятностного распределения текста также показал, что среди внешних рассуждений, наиболее похожих на собственное распределение GLM-5.2, оказались рассуждения четырёх последовательных поколений моделей Anthropic. Авторы подчёркивают, что эти результаты не доказывают дистилляцию одной модели из другой. Раньше для дистилляции можно было задать Claude миллион вопросов, собрать пары "вопрос — ответ" и использовать их для обучения собственной модели. Теперь гораздо более ценным набором данных становится полная последовательность: вопрос → рассуждение → ответ. Из общедоступных журналов работы агентов на GitHub и Hugging Face исследователи расшифровали 315 320 скрытых блоков рассуждений. В них обнаружились 367 фрагментов персональных данных и 182 ключа, пароля и других учётных данных. Полная цепочка рассуждений — это почти готовый материал для обучения другой модели. Если её можно массово извлекать через более слабую модель того же разработчика, то одной защиты весов уже недостаточно. Закрытая модель может не показывать, как она думает. Но это больше не означает, что никто не сможет это прочитать. Статья: https://arxiv.org/abs/2608.09867 Примеры извлечённых рассуждений: https://stolen-thoughts.com/