tgindex

Data Portal | DS & ML

описание

Всё самое интересное из мира LLM, Data Science и машинного обучения adds: @devmangx Автор: @ScienceLLM

8 366
подписчиков

Лучшие посты

за три месяца
  • 22 июн.1 321 просмотров3 реакций47 пересылок

    RAG даёт LLM доступ к вашим данным. Agentic RAG добавляет способность принимать решения о том, что с этими данными делать. Разница особенно заметна в ситуациях с неопределённостью. Классический RAG работает по фиксированному пайплайну: → Кодирует запрос → Ищет похожие данные в векторной базе → Извлекает релевантные документы → Генерирует ответ Такой подход хорошо работает, когда запрос сформулирован корректно, а нужный контекст уже находится в доступных источниках. Agentic RAG добавляет слой рассуждений практически на каждом этапе: → Переформулирует запрос перед поиском → Оценивает, достаточно ли найденных данных → Выбирает источник информации (векторная БД, API, веб-поиск и т.д.) → Проверяет качество и релевантность ответа перед выдачей Если на любом этапе результат оказывается неудовлетворительным, система может вернуться назад и повторить поиск или изменить стратегию. Именно этот цикл обратной связи делает Agentic RAG качественно другим подходом, а не просто улучшенной версией обычного RAG. Стандартный RAG не понимает, что сейчас может выдать плохой ответ. Agentic RAG хотя бы способен задать себе этот вопрос. #agenticai #rag #agenticrag #aiengineering 👉 @DataSciencegx

  • 9 июл.1 277 просмотров78 пересылок

    без подписи

  • 10 авг.806 просмотров13 пересылок

    Новое исследование Meta. Сегодня агентные harness-системы всё ещё в основном собираются вручную. Из-за этого сложно настраивать устойчивые harness-системы для длинных задач. В новой работе агенты офлайн обучаются политике работы с harness, а затем во время выполнения задачи используют её, чтобы создавать и обновлять внешнее состояние harness. EvoHarness-RL обучает именно такую политику. В качестве состояния harness агенту доступны Belief, Progress и Experience, с которыми политика может работать. Сначала supervised fine-tuning обучает пространство действий harness, затем cost-aware GRPO учится, когда во время длинного запуска нужно читать состояние, обновлять его и объединять накопленную информацию. Qwen3-8B достигает 96,9% на ALFWorld. В ходе обучения проявляются два эффекта. Harness annealing. Повторяющиеся паттерны использования harness постепенно встраиваются в политику самой модели, и агент переходит от частых обращений к более выборочному доступу. Harness evolution. Обновления прогресса и консолидация опыта сжимают рабочее пространство в компактное состояние, адаптированное под текущую задачу. Работа показывает, что агентам на длинных задачах больше даёт обучаемая политика координации, чем просто более мощные инструменты или больше памяти. Статья: https://arxiv.org/abs/2608.05446

  • 10 авг.806 просмотров2 пересылок

    Пожалуй, лучшее объяснение ChatGPT Work, которое я видел.

  • 11 авг.803 просмотров30 пересылок

    Из архивов — курс Machine Learning Hardware and Systems 2022 года от профессора Мохамеда Абдельфаттаха из Корнеллского университета. https://youtube.com/playlist?list=PL0mFAhrXqy9CuopJhAB8GVu_Oy7J0ery6

  • 13 авг.779 просмотров37 пересылок

    Бесплатный PDF новой книги по оптимизации: http://faculty.washington.edu/sbrunton/OptimizationBootcamp.pdf

  • 9 авг.774 просмотров32 пересылок

    «A Recipe for Training Neural Networks» от Андрея Карпати. Материал уже не новый, но набор тем в нём до сих пор ощущается очень актуальным. Это практическое руководство по обучению нейросетей: как выстраивать процесс, находить ошибки, отлаживать обучение и постепенно улучшать модель без хаотичных экспериментов. https://karpathy.github.io/2019/04/25/recipe/

  • 13 авг.764 просмотров26 пересылок

    Awesome Math — огромная подборка материалов по математике в одном репозитории. Там собраны Khan Academy, MIT OpenCourseWare, конспекты лекций, учебники и другие бесплатные материалы по разным разделам математики. Проект живой и довольно популярный: сейчас у него больше 16 тысяч звёзд на GitHub. https://github.com/rossant/awesome-math

  • 11 авг.752 просмотров22 пересылок

    Ещё один отличный ресурс — LLM Inference Handbook от Modular. https://handbook.modular.com

  • 13 авг.741 просмотров16 пересылок

    Ещё один отличный плейлист по структурам данных и алгоритмам от pmavrin. https://youtube.com/playlist?list=PLrS21S1jm43igE57Ye_edwds_iL7ZOAG4&si=4mS5lXn3uxI-V2LM

  • 14 авг.736 просмотров16 пересылок

    Все шесть тригонометрических функций — это просто длины на одной окружности.

  • 14 авг.718 просмотров12 пересылок

    «Transformer с полной пропускной способностью» Обычно Transformer передаёт на следующий шаг только выбранный токен, хотя сама модель только что вычислила гораздо более богатое скрытое состояние. В этой работе скрытое состояние тоже подаётся обратно в модель. За счёт этого она может продолжать внутренне развивать идею, не расписывая всё токен за токеном. На масштабе 1 млрд параметров подход улучшает результаты в математике, программировании и тестах языковых моделей, добавляя менее 1% к стоимости декодирования. При этом модель может показывать результаты на уровне моделей, обученных примерно на вдвое большем объёме данных. https://alphaxiv.org/abs/2608.08888

  • 11 авг.711 просмотров22 пересылок

    «The Mathematics of Bitcoin» — короткая работа, которая разбирает Bitcoin с математической точки зрения. В ней используются теория вероятностей, случайные процессы, мартингалы, комбинаторика и специальные функции, чтобы исследовать механизмы протокола Bitcoin. В частности, авторы разбирают вероятность двойной траты, прибыльность майнинга, генерацию блоков, стратегии майнеров и устойчивость протокола. Если хочется копнуть глубже, ещё рекомендую «Bitcoin and Cryptocurrency Technologies» от Принстонского университета. Это уже гораздо более широкое введение в криптографические хеш-функции, цифровые подписи, консенсус, Proof of Work, майнинг, транзакции, анонимность, безопасность и систему стимулов в криптовалютах. Сохраните обе работы в закладки. Это хорошие материалы, если интересно разобраться в математике и технических механизмах Bitcoin. The Mathematics of Bitcoin: https://arxiv.org/pdf/2003.00001 Bitcoin and Cryptocurrency Technologies: https://d28rh4a8wq0iu5.cloudfront.net/bitcointech/readings/princeton_bitcoin_book.pdf

  • 13 авг.695 просмотров16 пересылок

    «Beginning in Algebraic Geometry» — ещё один бесплатный учебник с открытым доступом, который даёт строгий, но при этом довольно доступный вход в алгебраическую геометрию. Книга объёмом более 400 страниц. Из предварительных знаний нужны только вводные курсы по абстрактной и линейной алгебре. Она начинается с колец многочленов, а затем постепенно переходит к аффинной алгебраической геометрии: многообразиям и идеалам, координатным кольцам, полиномиальным отображениям, теореме Гильберта о нулях, размерности, гладкости и произведениям. После этого разбираются проективные и квазипроективные многообразия и более продвинутые темы. На мой взгляд, это очень интересный ресурс, если хочется относительно мягко войти в алгебраическую геометрию. https://link.springer.com/book/10.1007/978-3-031-88819-9

  • 12 авг.687 просмотров40 пересылок

    «Introduction to Probability» — отличный бесплатный учебник MIT по теории вероятностей. В книге разбираются вероятностные модели, условная вероятность, независимость, формула Байеса, дискретные и непрерывные случайные величины, распределения вероятностей, математическое ожидание, дисперсия, ковариация, корреляция, условное ожидание, преобразования и свёртки, процессы Бернулли и Пуассона, цепи Маркова, закон больших чисел и центральная предельная теорема. Объяснения очень понятные, математика строгая, но без лишнего усложнения. Плюс внутри много примеров и задач с полными решениями. Особенно полезна для самостоятельного изучения или как справочник, когда нужно быстро освежить конкретную тему по вероятностям. Для машинного обучения это уже прямо фундаментальная база. Теория вероятностей нужна почти везде: от статистики и байесовских методов до обучения моделей, оценки неопределённости и генеративных моделей. Сохраняйте в закладки. Пригодится. https://vfu.bg/en/e-Learning/Math--Bertsekas_Tsitsiklis_Introduction_to_probability.pdf

  • 12 авг.666 просмотров8 пересылок

    Исследователи Tencent и Университета Цинхуа представили CALM — языковую модель, которая генерирует текст не по одному токену, а сразу целыми фрагментами. Автоэнкодер сжимает четыре токена в один непрерывный вектор, а затем восстанавливает исходный текст с точностью более 99,9%. В результате модели требуется в четыре раза меньше последовательных шагов генерации. В экспериментах CALM с 371 млн параметров показала результат на уровне обычного трансформера, использовав на 44% меньше вычислений при обучении и на 34% меньше при генерации. Это ещё не смерть предсказания следующего токена. Исследование проводилось на моделях до 1,82 млрд параметров, а при сжатии восьми токенов качество заметно снижалось. Однако сама идея чрезвычайно важна. Если она масштабируется, будущие модели смогут генерировать язык не по одному маленькому фрагменту, а сразу смысловыми блоками. https://arxiv.org/pdf/2510.27688

  • 14 авг.664 просмотров24 пересылок

    Одно из ЛУЧШИХ видео от data_adventurer. Глубина разбора здесь просто невероятная. Очень хорошо объясняются основы обработки звука — от представления сигнала до спектрограмм и других фундаментальных вещей, на которых потом строятся современные аудио-модели. После этого намного проще понимать, откуда берутся реальные сложности в задачах распознавания речи, шумоподавления и обработки звука, например внутри автомобильного салона. Очень рекомендую посмотреть! https://youtu.be/55QWsm1itKo

  • 11 авг.664 просмотров43 пересылок

    «Patterns, Predictions, and Actions» — бесплатная книга по математическим основам машинного обучения. Она сочетает понятное изложение с математикой, на которой построен современный ML. В книге разбираются предсказание, обучение с учителем, оптимизация, обобщающая способность моделей, глубокое обучение, датасеты, причинность, последовательное принятие решений и обучение с подкреплением. Отдельно авторы объясняют, как предсказания превращаются в решения, какую роль играют данные и бенчмарки, а также где у машинного обучения есть ограничения и какие последствия возникают при его использовании на практике. По уровню это примерно вводный курс магистратуры. Нужна рабочая база по линейной алгебре, матанализу и теории вероятностей. Хорошая книга для тех, кто хочет не просто научиться запускать модели, а начать понимать ML от математического фундамента до практических последствий. https://mlstory.org/pdf/patterns.pdf

  • 12 авг.645 просмотров26 пересылок

    Теорема Байеса — одна из фундаментальных концепций в Data Science. Но мне понадобилось два года, чтобы по-настоящему понять её важность. За 2 минуты расскажу самое полезное, что узнал за последние два года изучения байесовской статистики. Поехали. 1. Предыстория Работа «An Essay towards solving a Problem in the Doctrine of Chances» была опубликована в 1763 году, через два года после смерти Томаса Байеса. В ней Байес рассматривал задачу обратной вероятности — основу того, что сегодня известно как байесовская вероятность. 2. Теорема Байеса Теорема Байеса даёт математическую формулу, позволяющую обновлять вероятность гипотезы по мере появления новых данных. Она описывает, как пересматривать существующие предположения с учётом новых свидетельств. Этот процесс называется байесовским выводом. 3. Байесовская статистика Байесовская статистика рассматривает вероятность как меру уверенности в событии, а не только как частоту его появления. Эта уверенность может основываться на уже имеющихся знаниях об условиях, связанных с рассматриваемым событием или экспериментом. Благодаря этому можно делать вероятностные выводы о неизвестных параметрах. Например, вместо одного конкретного значения параметра байесовский подход даёт распределение возможных значений, тем самым отражая неопределённость. 4. Байесовский и частотный подходы Байесовский вывод основан на обновлении вероятностей по мере поступления новых данных. Это довольно естественно и во многом соответствует тому, как мы рассуждаем в реальной жизни. В частотной статистике вероятность интерпретируется как частота события при большом количестве повторений. Проблема, которую я вижу в частотном подходе, заключается в том, что часто используются заранее выбранные распределения, например нормальное, хотя это не всегда имеет смысл. 5. Байесовское машинное обучение Когда нужна реальная оценка уверенности и принятие решений на основе вероятностей, байесовские методы особенно полезны. Например: Моделирование неопределённости. В отличие от многих традиционных методов машинного обучения, которые выдают одну оценку, байесовские методы работают с распределениями. Анализ временных рядов. Байесовские методы особенно полезны там, где важно учитывать неопределённость будущих значений. 6. Применение в бизнесе Компании могут использовать теорему Байеса для оценки различных рисков: рыночных, кредитных или операционных. По мере появления новой информации вероятность каждого риска можно постоянно обновлять, принимая на этой основе более обоснованные решения.

  • 12 авг.635 просмотров26 пересылок

    без подписи