Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
СтатистикаВсе самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @proglib_adv Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9
- Последний пост
- 14 авг.
- Последнее чтение
- 14:09
- Постов за неделю
- 7
- Всего постов
- 735
- Тип
- открытый
- Язык
- русский
- Категория
- Образование
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 782
- 1/48двое суток
- 896
- 1/72трое суток
- 966
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
🙂🙂 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #развлекалово
🙂 AI-агентов отправили в настоящий багфикс В CyberGym-E2E собрали 920 реальных уязвимостей из open-source проектов. Задача агента звучит почти как тикет от сурового тимлида: самому найти баг, воспроизвести его, написать фикс — и при этом ничего не сломать рядом. То есть мало выдать правдоподобный патч. Нужно ещё доказать, что уязвимость действительно закрыта, а проект после этого жив. И вот это уже гораздо ближе к реальной разработке, чем «напиши безопасный код» в промпте 😅 На курсе «ИИ для разработчиков» похожая логика применяется к работе со своими проектами: агентам задают границы, проверки и quality gates. А доступ к курсу теперь можно взять вместе со всей библиотекой Proglib Academy по подписке 😮 🔗 Посмотреть, что входит в подписку 🏃♀️ Proglib Academy
Новый уровень проверки AI-кодера: вот тебе уязвимый проект, дальше разбирайся сам 👇
🧠 MLU-Explain — бесплатный интерактивный учебник по Machine Learning У Amazon Machine Learning University есть отличный ресурс для тех, кто изучает базу ML или хочет быстро освежить её перед собеседованием. Внутри разборы: ⬆️ линейной и логистической регрессии ⬆️ нейросетей и деревьев решений ⬆️ Random Forest ⬆️ bias-variance tradeoff и double descent ⬆️ ROC/AUC, precision и recall ⬆️ cross-validation и разбиения train/test/validation ⬆️ reinforcement learning ⬆️ fairness в ML 💡 Главная фишка — материал подается не как обычный учебник. Статьи сделаны в формате scrollytelling: по мере чтения можно взаимодействовать с графиками и наглядно смотреть, как меняется поведение моделей и метрик. 🔗 Ссылка 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
🚀 Устойчивые очереди в Postgres PgQue предлагает универсальную архитектуру очередей для PostgreSQL, основанную на проверенной модели PgQ. Это решение без лишних зависимостей, работающее на любом управляемом Postgres, обеспечивая нулевое бремя и стабильную производительность под нагрузкой. Основные моменты: — Никаких внешних демонов или расширений — Использует SQL и PL/pgSQL для установки — Обеспечивает ACID-транзакции и долговечность — Никакого накопления «мертвых» кортежей — Подходит для высоконагруженных систем 🖥 GitHub 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
😑 Что такое object-centric в машинном обучении В машинном обучении есть подход, который заставляет модель смотреть на данные «по-человечески» — object-centric. Это когда модель не видит картинку как груду пикселей. Она видит отдельные объекты — стол, кружку, кота — и работает именно с ними. ❓ Зачем это нужно: — Лучшее обобщение. Если модель понимает, что такое «объект», она легче переносит знания на новые сцены. — Объяснимость. Модель фактически говорит: «объект №1 — куб», «объект №2 — шар». — Манипуляции объектами. Важно в робототехнике, моделях мира, генерации сцен: можно двигать объекты, комбинировать их, прогнозировать взаимодействия. Где используется: — безучительское обучение (Slot Attention, MONet) — модели мира (Dreamer, Genesis) — генерация изображений — робототехника и video understanding Проще всего: — обычная нейросеть → «вижу пиксели» — object-centric сеть → «вижу вещи» 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
📌 Шпаргалка: виды матриц и операции 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #развлекалово
🧩 Тонкости гиперпараметрического тюнинга Хотите ускорить обучение XGBoost в 5–15 раз и при этом находить лучшие гиперпараметры? В видео показывают: ➡️ как использовать Optuna для автоматического тюнинга XGBoost, ➡️ почему кросс-валидация критична для реальных задач, ➡️ какие приёмы тюнинга реально работают, ➡️ и как визуализации Optuna помогают выявлять самые важные гиперпараметры. Особый акцент — на GPU-ускорении XGBoost 3.0, которое радикально сокращает время экспериментов в табличных задачах. 🔗 Ссылка на туториал 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
📌 DeepFabric — генерация синтетических датасетов на новом уровне Для ML-инженеров, исследователей и AI-разработчиков появился инструмент, который упрощает создание высококачественных и разнообразных датасетов для обучения моделей в масштабе. Что делает DeepFabric: 🔜 Легко превращает идеи и темы в структурированные данные, готовые к обучению моделей. 🔜 Избавляет от проблем с Tool Calls и неструктурированными формами — данные сразу консистентные и стандартизированные. 🔜 Подходит как для fine-tuning, так и для оценки моделей. Идеально подходит для: 🔜 Быстрой генерации больших объемов обучающих данных. 🔜 Создания синтетических датасетов для NLP, диалогов, reasoning и function-calling задач. 🔜 Исследований и экспериментов с ML-моделями без ручного коллекшена данных. 📱 Репозиторий 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
🤔 У большинства разработчиков уже есть подписки на IDE, GitHub Copilot, Claude, ChatGPT или облачные сервисы. Логично, что обучение тоже постепенно приходит к той же модели: не покупать отдельный курс под каждую новую тему, а иметь доступ ко всей библиотеке и выбирать, что актуально именно сейчас. Такой формат недавно появился и в Proglib Academy. Вместо одного курса — доступ сразу ко всей библиотеке и новым материалам, которые появляются в подписке 😎 🔗 Подробнее 🏃♀️ Proglib Academy
Кажется, у онлайн-обучения появился формат, которого давно не хватало 👇
⭐️ Интерактивный гайд по 4 ключевым задачам с Transformers Мы нашли мощный материал, который объясняет, как использовать модели ViT, DETR, BLIP и ViLT для самых базовых, но фундаментальных задач Computer Vision: — Image Classification — классификация изображений с помощью Vision Transformer (ViT). — Image Segmentation — точное выделение объектов на изображении с DETR и Mask2Former. — Image Captioning — генерация описаний изображений с BLIP. — Visual Question Answering (VQA) — ответы на вопросы по изображению с ViLT и BLIP. ℹ️ Гайд показывает, как трансформеры постепенно вытесняют CNN и становятся универсальным решением — от анализа пикселей до генерации текстов и ответов. ➡️ Полный разбор и демо-приложение 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
🤯 Наконец-то понятен self-attention Одна из самых сложных частей понимания LLM — это self-attention. Формула выглядит простой — её можно быстро выучить. Но что на самом деле означают Q, K и V и как они взаимодействуют — совсем другая история. ✅ Эта визуализация делает всё очень наглядным и понятным — видно, как queries обращаются к keys и получают нужные values. 🤨 Чтобы лучше понимать, как работают модели на математическом уровне, советуем курс Математика для Data Science. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
🚀 Почему AI перестал полагаться только на Vector Search Ещё недавно почти все RAG-системы строились одинаково: документы разбивали на чанки, создавали эмбеддинги, сохраняли их в Vector Database и по ним искали контекст для LLM. 🔴 Это был большой шаг вперёд по сравнению с обычным поиском по ключевым словам. Но по мере роста корпоративных баз знаний стало понятно: семантического поиска недостаточно. Например, пользователь ищет: — конкретную функцию или класс; — номер ошибки; — API-метод; — документ определённой версии; — информацию, связанную сразу с несколькими сущностями. В таких случаях одного поиска по embeddings уже недостаточно. Поэтому современные AI-системы переходят к гибридному retrieval — вместо одного алгоритма используют несколько, каждый из которых решает свою задачу. 💡 На схеме показано, как изменилась типичная архитектура RAG за последние годы. Что обычно добавляется: 🔹 Keyword Search (BM25) — лучше находит точные совпадения. 🔹 Metadata Filtering — ограничивает поиск по версии документа, автору, проекту, дате и другим атрибутам. 🔹 Reranker — заново оценивает найденные документы и оставляет наиболее релевантные для модели. 🔹 Knowledge Graph — позволяет искать не только документы, но и связи между сущностями: пользователями, сервисами, API, событиями и объектами предметной области. Такой подход уже используют современные AI-инструменты. Например, Graphiti сочетает граф знаний, семантический поиск и дополнительные механизмы retrieval вместо того, чтобы строить систему только вокруг embeddings 😧 Команда Anthropic тоже описывает похожую эволюцию. При разработке Claude Code инженеры отказались от идеи заранее формировать весь контекст через классический RAG. Вместо этого агент во время работы самостоятельно использует инструменты поиска и постепенно собирает нужную информацию по мере выполнения задачи. Такой подход лучше масштабируется для больших кодовых баз и постоянно меняющегося контекста. 🔗 Anthropic — Seeing like an agent 🔗 Graphiti (Knowledge Graph for AI Agents) 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
⚡️ Open Source: локальная память для AI-агентов и ваших файлов Constella — open-source приложение, которое превращает локальные файлы в персональную базу знаний для поиска, RAG и AI-агентов. Что под капотом: 🔘 индексирует папки, заметки Obsidian, PDF, DOCX, Markdown и изображения; 🔘 хранит эмбеддинги в LanceDB, а метаданные и граф знаний — в SQLite; 🔘 строит семантический поиск по локальным данным; 🔘 автоматически связывает документы, темы и концепции в knowledge graph; 🔘 поддерживает локальные и облачные LLM; 🔘 предоставляет MCP-интерфейс, чтобы Claude Code и другие агенты могли работать с вашей базой знаний. 🔤 По сути, это готовая основа для personal AI memory: Файлы ↓ Chunking + Embeddings ↓ LanceDB + SQLite ↓ Knowledge Graph ↓ RAG / MCP / AI-агенты 👩💻 GitHub Изучить подобные архитектуры на практике поможет курс «Разработка ИИ-агентов» 💡 📍 Навигация: Вакансии • Задачи • Собесы Библиотека дата-сайентиста #буст
видео или голосовое, без подписи
🐸 Библиотека задач по Data Science
Полезная шпаргалка: как выбрать правильное распределение для данных 1️⃣ Начните с гистограммы — Простая, но мощная визуализация. — Помогает понять форму данных: колоколообразная (Normal), быстро падающая (Exponential), ровная (Uniform), с несколькими пиками (Mixture). import matplotlib.pyplot as plt import numpy as np data = np.random.normal(50, 15, 1000) plt.hist(data, bins=30, color='skyblue', edgecolor='black', alpha=0.7) plt.xlabel('Values'); plt.ylabel('Count'); plt.title('Гистограмма данных') plt.show() 2️⃣ Протестируйте разные распределения — Используем библиотеку distfit для подбора распределений. — Проверяет ~90 типов распределений автоматически: from distfit import distfit import numpy as np my_data = np.random.normal(25, 8, 2000) fitter = distfit(method='parametric') fitter.fit_transform(my_data) print("Лучшее распределение:", fitter.model['name']) print("Параметры:", fitter.model['params']) 3️⃣ Визуализируйте подгонку — Всегда проверяй глазами! — Используй PDF (распределение) и CDF (кумулятивное распределение): fig, (ax1, ax2) = plt.subplots(1, 2, figsize=(15,6)) fitter.plot(chart='PDF', ax=ax1); ax1.set_title('PDF') fitter.plot(chart='CDF', ax=ax2); ax2.set_title('CDF') plt.show() 4️⃣ Не забывайте про нестандартные данные — Дискретные счётные данные → binomial, Poisson. — Сложные или многопиковые данные → non-parametric (quantile, percentile). Пример: from scipy.stats import binom count_data = binom(20, 0.3).rvs(1000) discrete_fitter = distfit(method='discrete') discrete_fitter.fit_transform(count_data) discrete_fitter.plot() 5️⃣ Проверяйте стабильность — Бутстрэпинг помогает проверить, насколько выбранное распределение устойчиво к случайным выборкам: fitter.bootstrap(my_data, n_boots=100) print(fitter.summary[['name','score','bootstrap_score','bootstrap_pass']]) 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
Percentify: 80% проверок датасета в 20% кода Каждый раз при старте нового проекта повторяем одно и то же: смотрим пропуски, считаем перекос классов, проверяем мультиколлинеарность, строим корреляции. Percentify упаковывает это в одну строку. Работает с pandas и Polars — нативно, без конвертации. 🔍 profiler — главная функция from percentify import profiler report = profiler(df, target="churn") report.to_frame() # все проблемы, от худшей к лучшей, с советом как починить report.errors # только блокирующие проблемы report.health # скор качества данных от 0 до 100 Можно прямо в CI: assert not report.errors assert report.health >= 80 📋 Остальные функции · missing(df) — процент пропусков по колонкам · outliers(df) — процент выбросов по колонкам · skew_report(df) — перекос и рекомендованное преобразование (log1p, sqrt...) · vif(df, flag=5.0) — мультиколлинеарность, возвращает список колонок для дропа · correlate(df) — корреляции с p-value, можно сортировать по значимости · imbalance(df, target="label") — дисбаланс классов · pca_variance(df) + pca_loadings(df) — дисперсия и интерпретация PCA Пример рабочего воркфлоу from percentify import skew_report, vif, profiler import numpy as np # 1. Проверить качество данных report = profiler(df, target="churn") # 2. Найти колонки под логарифм plan = skew_report(df) for feat in plan[plan.skew > 1]["feature"]: df[f"{feat}_log"] = np.log1p(df[feat]) # 3. Убрать мультиколлинеарные признаки to_drop = vif(df, flag=5.0)["feature"].tolist() df = df.drop(columns=to_drop) pip install percentify 📍 Навигация: Вакансии • Задачи • Собесы Библиотека дата-сайентиста #буст