Data Science 🧑💻
СтатистикаСамое большое сообщество Data Science на русском языке. — обучающие материалы — последние новости из мира DS — обзоры компаний, подборки вакансий и многое другое 💬 Общий чат по DS: https://t.me/+07y76A3cSdk4ZDEy Админ: @anothertechrock
- Последний пост
- 18 нояб.
- Последнее чтение
- 20:06
- Постов за неделю
- 0
- Всего постов
- 20
- Тип
- открытый
- Язык
- русский
- Категория
- Новости и СМИ
- В каталоге с
- 14 авг.
- 1/24сутки в ленте
- —
- 1/48двое суток
- —
- 1/72трое суток
- —
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
📖 The Little Book of Deep Learning Книжка-шпаргалка для быстрой подготовки к собеседованиям по DL. Скачать
ML-генерация шрифтов #почитать История о том, как я с нуля осваивал создание генеративных моделей МО, попутно обучая компьютер создавать шрифты. Да, настоящие типографские шрифты, состоящие из набора заглавных глифов. Созданная мной модель получает на входе описание шрифта и создаёт на выходе файл с их готовым набором. Читать статью
Вопросы на собеседовании ML Team Lead #почитать Если вы читаете это, значит, вы, как и я когда‑то, собираетесь пройти собеседование на позицию ML Team Lead. Или возможно, вы просто интересуетесь тем, что происходит по ту сторону баррикад. В любом случае, давайте поговорим о том, какие вопросы могут задать на таком собеседовании, и как на них отвечать так, чтобы у интервьюеров не осталось сомнений в вашей компетенции. Читать статью
Дообучаем языковую модель GPT2 с помощью Torch #почитать В качестве данных я возьму dataset QuyenAnhDE/Diseases_Symptoms с Huggiface. Этот dataset представляет собой небольшой (400 строк) набор болезней, их симптомов и лечение. Я буду использовать только заболевание и его симптомы. То есть на вход модели будет подаваться заболевание, на выходе модель должна написать симптомы. Вы можете использовать обратную логику ввода/вывода, добавить в обучение столбец с лечением. Читать статью
▫️ Intuitive SQL for Data Analytics #посмотреть 11 часов теории и практики (PostgreSQL) - freeCodeCamp. Смотреть на YouTube ⏱️11 часов
Тестируем LLM для русского языка: Какие модели справятся с вашими задачами #почитать YandexGPT: Показала высокую связность и грамматическую правильность текста. Текст был логичным, стилистически правильным и без ошибок. Модель не использовала вставки английских слов, что сделало её результат почти идеальным для русскоязычных проектов (2 балла за выполнение). Saiga-Mistral-7b-Lora: Также показала отличные результаты, генерируя текст высокого качества с хорошей структурой и минимальными ошибками. Текст был креативным и полностью соответствовал заданной теме (2 балла за выполнение). OpenChat3.5: Результаты были удовлетворительными, однако встречались вставки английских слов и недочеты в структуре текста. Текст мог быть связанным, но не всегда соответствовал стилю или контексту (1 балл за выполнение). GigaChat: Модель показала хорошие результаты. Текст был менее структурированным и встречались ошибки в согласовании предложений, но все равно модель заслужила высокий балл (2 балла за выполнение). Mistral: Генерация текста была неплохой, но в некоторых случаях модель допускала синтаксические ошибки и не всегда удачно выбирала стиль текста (2 балла за выполнение). Saiga-Llama3-8b: Текст был грамматически правильным, но менее связным по сравнению с лидерами. Иногда наблюдались небольшие несоответствия в стиле (1 балл за выполнение). Лучшими моделями для генерации связного текста оказались YandexGPT и Saiga-Mistral-7b-Lora, обе модели обеспечили высокий уровень грамматической точности и стилевого соответствия. Читать статью
Мультимодальные модели тотально страдают селективным восприятием Проводя свои текущие исследования для задач сегментации и распознавания объектов на изображениях, я задал простой вопрос многим мультимодальным моделям с целью оценить их способности к интерпретации деталей изображения. Результат был, мягко говоря, странным. С одной стороны, общее описание простой, на первый взгляд, картинки радует подробным и содержательным ответом. Но, с другой стороны, наблюдаются просто вопиющие утверждения, которые ни как нельзя оставить без внимания. Читать статью
Создаем воспоминания. Осваиваем FLUX, LoRA и ComfyUI Разбираюсь на праздниках с дообучением моделей для генерации изображений. Было интересно, насколько сложно дообучить модель для генерации изображений по тексту в домашних условиях, сколько нужно обучающих данных и как затем генерировать качественные фотографии и иллюстрации. Чтобы через время не забыть про особенности процесса и как-то его зафиксировать, решил поделиться наработками. Читать статью
Вкатываемся в Machine Learning с нуля за ноль рублей Подробный гайд на тему того, как можно изучать Machine Learning самостоятельно, не тратя деньги на платные курсы. Читать статью
ClickHouse: полезные лайфхаки ClickHouse - это колоночная СУБД для OLAP (online-analytical processing). Большинство аналитиков, которых я знаю, в восторге от ClickHouse, хотя его администрирование имеет свои нюансы и подводные камни. В этой статье я расскажу, что такое ClickHouse и почему я считаю его идеально подходящим мощным инструментом для аналитики, а также поделюсь tips & tricks из моего опыта. Поехали. Читать статью
MLOps. Зачем он нужен и как с ним работать? Обзор полезных инструментов MLOps — это ответвление от DevOps, ряд практик и инструментов, характерных для ML-сферы. По ссылке гайд, рассказывающий о том, что это такое и зачем это нужно.
VRT: A Video Restoration Transformer Github: https://github.com/jingyunliang/vrt Paper: https://arxiv.org/abs/2201.12288
PyTorch - Creating Custom Layers Кроме внушительного набора стандартных слоёв в модуле torch.nn, у нас есть возможность делать свои слои. А как именно это делать, смотрите в видео. Смотреть на YouTube
Как сделать вашего телеграм-бота умнее и приятнее? Конечно, прокачать его ML-аналитикой #почитать Успешное использование телеграм-ботов требует не только технической грамотности, но и понимания того, как пользователи взаимодействуют с ботом. Практикум: ▫️Создание телеграм-бота на Python ▫️Сбор данных для аналитики ▫️Разработка функциональности аналитики ▫️Интеграция сторонних инструментов ▫️Автоматизация анализа ▫️Улучшение пользовательского опыта ▫️Защита данных и приватность (соблюдение правил Telegram API и законодательства о защите данных) Очень большой подробный практикум. Читать статью
3 способа выбрать СУБД Рекомендуем полезную статью по выбору СУБД на Хабре — без воды, только самое главное: немного теории и полезная шпаргалка, которую стоит сохранить себе. ▫️Классификация СУБД по типам с примерами и указанием, для каких задач они подходят, а с какими справляются плохо. ▫️Технические параметры разных систем: структура данных, масштаб, характер обращений, сертификация, тип лицензии и так далее. ▫️Теорема САР. Согласованность данных, доступность, устойчивость к разделению — выберите два и найдете подходящую СУДБ. Но самое крутое — это, конечно, схема, которую нарисовали авторы, чтобы все эти знания было удобнее применять на практике. Они предлагают аж три способа подбора подходящей СУБД. Самый простой из них — отвечаете на 5 вопросов и тут же получаете рекомендацию, какая система оптимально подойдет под ваш запрос. Можно придраться, что не упомянули какую-нибудь СУБД или, наоборот, что пытались объять необъятное и предложили слишком много вариантов, когда можно было ограничиться самыми популярными. Но не будем — идея хорошая и исполнение тоже.
Прорыв в технологии оценки позы человека. Модели YOLO-NAS Pose #почитать ▫️Оценка позы играет решающую роль в компьютерном зрении, охватывая широкий спектр важных задач таких как мониторинг движений пациентов в медицинских учреждениях, и анализ результатов спортсменов в спорте. ▫️YOLO-NAS Pose работает иначе, чем традиционные модели оценки позы. Вместо того, чтобы сначала обнаруживать человека, а затем оценивать его позу, она может обнаружить и оценить человека и его позу одновременно, за один шаг. Читать статью
0️⃣💸 Вкатываемся в Machine Learning с нуля за ноль рублей Подробный гайд на тему того, как можно изучать Machine Learning самостоятельно, не тратя деньги на платные курсы. Читать статью
💼 Как получить работу в области Data Science - этапы обучения, роли и нюансы #почитать Переводная статья на Хабре, но вполне релевантна для РФ. Читать статью
Data Science в повседневной жизни #посмотреть Первым и самым заметном применением DS в повседневной жизни стали рекомендательные системы. Для клиентов сетевых магазинов, любителей музыки определенных жанров (первыми это начали делать в Яндекс.Музыке), и так далее. Подбор товаров и услуг под каждого клиента индивидуально - первое и до сих пор главное практическое применение. Смотреть видео на YouTube ⏱1 час
📚 Python Data Science Handbook Автор: Jake VanderPlas Год издания: 2023 Скачать книгу