tgindex
DataSciencePRO

DataSciencePRO

Статистика
@ds1proрусский

Все нужное и полезное из мира дата сатанистов)

Последний пост
2 авг.
Последнее чтение
08:37
Постов за неделю
0
Всего постов
20
Тип
открытый
Язык
русский
В каталоге с
13 авг.
Подписчики
750
0 за 3 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
605
20 постов
Вовлечённость
80,7%
к подписчикам
Постов в день
0,0
всего 20
Упоминаний
0
каналов
Охват размещения
оценка
1/24сутки в ленте
162
1/48двое суток
185
1/72трое суток
200

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • видео или голосовое, без подписи

  • 22 июл.23144из python2day

    😰 Python-шпаргалка по работе с датой и временем! Модуль datetime — твой лучший друг, если нужно работать с датами, временем или таймзонами. 🔥 Форматы путают все. Держи удобный список, который точно пригодится: 📅 Форматирование дат и времени: * %a → короткий день недели (Mon) * %A → полный день недели (Monday) * %b → короткий месяц (Jan) * %B → полный месяц (January) * %d → день месяца (01–31) * %m → месяц (01–12) * %y → год без века (23) * %Y → год с веком (2023) * %j → день в году (001–366) ⏰ Форматирование времени: * %H → час (24ч, 00–23) * %I → час (12ч, 01–12) * %M → минуты (00–59) * %S → секунды (00–61, да, 61! 😅) * %f → микросекунды (000000–999999) * %p → AM/PM * %z → UTC-смещение (+0300) * %Z → таймзона (если есть) * %U → номер недели (с воскресенья) * %W → номер недели (с понедельника) * %x → локальная дата * %X → локальное время * %% → просто знак % Примеры: from datetime import datetime now = datetime.now() print(now) # 2025-09-03 13:41:30.123456 Примеры форматирования даты: print(now.strftime("%A, %d %B %Y")) # Wednesday, 03 September 2025 print(now.strftime("%a, %d.%m.%y")) # Wed, 03.09.25 print(now.strftime("День года: %j")) # День года: 246 Примеры форматирования времени: print(now.strftime("%H:%M:%S")) # 12:45:30 print(now.strftime("%I:%M %p")) # 12:45 PM print(now.strftime("Микросекунды: %f")) # Микросекунды: 123456 👍 Сохрани, чтобы не гуглить каждый раз! 😁 Лайф | 📲 Зеркало Max #python #doc #cheatsheet

  • 1 июн.34916из data_analysis_ml

    Lakehouse — новый подход к данным, который убивает DWH и Data Lake - Высокая вероятность, что массовый переход на Lakehouse начнётся в ближайшие 1-2 года — после того как первые игроки (Т-банк, Магнит, Ламода) уже доказали экономию и масштабируемость. Об этом в интервью «Коммерсанту» рассказал Леонид Савченков, руководитель продуктовой архитектуры платформы данных Yandex Cloud. - Классические DWH на объёмах от 100 ТБ начинают тормозить: единственный способ — докупать серверы целиком, потому что хранение и вычисления сцеплены. - Data Lake решал проблему объёма, но не давал нормального управления данными — отчёты строить было сложно. - Lakehouse разделяет хранение и вычисления: можно нарастить мощности под «Чёрную пятницу» и не платить за лишнее место весь год. - В отличие от Data Lake, здесь появляются строгие табличные форматы и управление данными как в СУБД. - Узкое место — нужны спецы по Trino и Spark. Чудес не бывает. - Для ИИ это идеально: вычисления можно выделить в отдельные мощности, не роняя основные отчёты. X5 уже построил бота по трендам молока в регионах. - Через пять лет, вероятно, появится новая концепция. Если данных мало — старый DWH всё ещё дешевле и проще. https://www.kommersant.ru/doc/8691430

  • Немного классики!)

  • 19 мая3749из pythonbooks

    Exploratory Data Analysis with Python Cookbook Автор: Ayodele Oluleye Год издания: 2023 #python #en Скачать книгу

  • 2 февр.63369из rpuropu

    pandas 3.0 — самый крупный релиз за годы: новый str dtype по умолчанию вместо object, с поддержкой Arrow‑бекенда (если установлен PyArrow), более предсказуемой типизацией и лучшей экономией памяти. ​ Весь фрейм переведён на Copy‑on‑Write: любой срез/результат операции ведёт себя как копия, chained assignment больше не работает, SettingWithCopyWarning уходит в историю, а лишние df = df.copy() можно выкидывать. ​ Появился pd.col() как выражения поверх колонок: теперь вместо lambda df: df["a"] + df["b"] в assign/loc можно писать pd.col("a") + pd.col("b"), с поддержкой операторов и .str/.dt методов. ​ Для экосистемы важны Arrow PyCapsule/from_arrow()/arrow_c_stream для нулекопийного обмена (передача данных между библиотеками без физического копирования в памяти) с другими датафрейм‑движками, обновлённая политика депрекейтов с семейством PandasChangeWarning, а также пачка I/O‑улучшений (Iceberg, SQL DatabaseError, доработки Excel/Parquet/CSV).

  • 29 дек.6493из monitorim_it

    Анализ проекта VictoriaMetrics Мальчишки и девчонки, а также их родители, как устроена VictoriaMetrics узнать не хотите ли? В этой статье вы узнаете структуру каталогов проекта и о предназначении различных файлов. А ещё там описаны некоторые проектные решения при разработке продукта. Эту статью можно назвать продолжением цикла. Есть еще одна похожая, которую я уже публиковал в канале. Но там рассмотрено все немного под другим углом.

  • 10 дек.62935из dsproglib

    🆕 CUDA 13.1 переворачивает GPU-программирование Наконец-то NVIDIA выпустила CUDA 13.1, и это не просто очередное обновление — это настоящий сдвиг парадигмы. Если вы когда-то пытались объяснить GPU, что делать с тысячами маленьких потоков (да-да, тот самый SIMT-модель), то знаете, что это сродни попытке управлять тысячью муравьёв одновременно. 💡 Что нового CUDA 13.1 вводит tile-based programming. Вместо того чтобы двигать песчинку за песчинкой, теперь можно управлять целыми плитками данных. Представьте: вместо того чтобы таскать каждую песчинку в отдельности, вы берёте целый холм и переносите его за один раз. Магия, правда? Что это значит для нас, Python-разработчиков и исследователей AI: ✔️ Прощай, C++ барьер: с CuTile можно писать высокопроизводительные ядра на чистом Python. Не нужен диплом магистра по C++. ✔️ Синхронизация с железом: современные тензорные ядра уже «думают» блоками данных, а софт теперь догнал железо. ✔️ Будущее уже здесь: поддержка Blackwell архитектуры и новых FP4/FP6 форматов ускоряет и делает эффективнее LLM. Иными словами, программировать ускорители стало логичнее, чище и мощнее. 🔗 Ссылка на новость 🔹 Курс «Специалист по ИИ» 🔹 Получить консультацию менеджера 🔹 Сайт Академии 🔹 Сайт Proglib 🐸 Библиотека дата-сайентиста #свежак

  • 27 сент. 2025 г.69758из data_secrets_career

    Кажется, Google готовится объединить SQL, Python и Spark в рамках Colab Enterprise По слухам, поисковый гигант намерен создать единую среду для специалистов по машинному обучению, объединив SQL, Python и Apache Spark в одном месте. Ясмин Ахмад, управляющий директор Google Cloud по обработке данных, отметил, что главным препятствием для эффективности в ML является необходимость переключаться между средами: получать данные с помощью SQL в базах данных и хранилищах, затем экспортировать их, загружать в блокнот и настраивать отдельный кластер Spark. Как вы понимаете, это крайне неудобно. Поэтому Google представляет ряд улучшений для своих блокнотов Colab Enterprise в BigQuery и на платформе Vertex AI. Кроме того, компания анонсировала следующие преимущества для разработчиков в блокнотах Colab Enterprise: ➖ Предварительный просмотр собственных ячеек SQL. ➖ Интеграцию собственного Data Science Agent, призванного помогать в анализе и разработке моделей.

  • 23 сент. 2025 г.62115из data_analysis_ml

    📢 NVIDIA представила nvmath-python — библиотеку для Python, которая открывает доступ к возможностям фирменных математических библиотек (например, cuBLASLt) через удобный API. Что умеет: - работает с массивами из NumPy, CuPy, PyTorch и других экосистем; - поддерживает тонкую настройку вычислений (precision, режимы умножений, epilog-операции); - позволяет использовать расширенные оптимизации NVIDIA для ускоренной математики и ML-задач. Проект пока в бета-версии, но уже можно попробовать: https://github.com/NVIDIA/nvmath-python

  • Айтишники, забираем: open-source программу для просмотра таблиц В ТЕРМИНАЛЕ нашли в сети. Она открывает файлы CSV, JSON, Excel и других таблиц прямо в терминале. Кроме того, у нее есть встроенный SQL-движок для фильтрации, джойнов и анализа прямо в терминале. И быстрый поиск с мульти-табличными операциями. Пользуемся тут. DevHub

  • Просто ГИГАНТСКУЮ коллекцию ИИ-агентов выгрузили на GitHub: это не просто шаблонные сервисы, а реальные, готовые к запуску инструменты. С ними можно: — Автоматизировать соцсети. — Создавать CRM-системы и базы данных. — Настраивать чат-боты. — Генерировать картинки и тексты. Забираем — ТУТ

  • 21 июл. 2025 г.7201019из ai_machinelearning_big_data

    🐼 Pandas тормозит на больших данных? NVIDIA показала, как ускорить его в 40 раз — без переписывания кода. Команда NVIDIA провела эксперимент с 18 миллионами строк данных с фондовых рынков: они выполнили типичный анализ данных с помощью pandas на CPU, а затем тоже самое — на GPU, используя cudf.pandas. Для примеры были взяты: 📉 Скользящие средние (50D и 200D) 📅 Недельная статистика закрытия рынков 🧊 В общей сложности ~18M строк Результат впечатляет : удалось добиться**ускорения обработки данных в 20–40 раз Код скрипта не менялся вообще — тот же pandas, но на GPU. Это один из примеров, где ускорение достигается без переписывания логики кода. 🟡 Потестить самому можно в Colab 🟡 Другие примеры с кодом — здесь @ai_machinelearning_big_data #datasckience #ml #nvidia #gpu #pandas #python

  • 23 апр. 2025 г.741732из maschinelearn

    Книга Kaggle Автор: Конрад Банахевич Год издания: 2024 #ml #ru Скачать книгу

  • 26 мар. 2025 г.805318из ai_machinelearning_big_data

    ✔️ СuML от NVIDIA: Scikit-learn на скорости GPU – без единой строчки нового кода! Все мы любим scikit-learn за его простоту и мощь. Но что если ваши модели обучаются слишком долго на больших данных? 🤔 NVIDIA предлагает решение! Вы берете свой обычный скрипт cо scikit-learn, добавляете всего две строки в начало, и он начинает работать в 10, 50, а то и 100+ раз быстрее на NVIDIA GPU! 🔥 ✨ Как это работает? Библиотека cuml от NVIDIA содержит супероптимизированные для GPU версии многих алгоритмов машинного обучения. С помощью простого вызова cuml.patch.apply() вы "патчите" установленный у вас scikit-learn прямо в памяти. Теперь, когда вы вызываете, например, KNeighborsClassifier или PCA из sklearn: ▶️Патч проверяет, есть ли у вас GPU NVIDIA. ▶️Проверяет, есть ли в cuml быстрая GPU-версия этого алгоритма. ▶️Если да – запускает ускоренную версию на GPU! 🏎️ ▶️Если нет (нет GPU или алгоритм не поддерживается) – спокойно запускает обычную CPU-версию scikit-learn. Ключевые преимущества: ✔️ Нулевые изменения кода: Ваш scikit-learn код остается прежним. Добавляете только 2 строчки: import cuml.patch и cuml.patch.apply(). ✔️ Колоссальное ускорение: Получите прирост производительности на порядки для поддерживаемых алгоритмов (KNN, PCA, линейные модели, Random Forest (инференс), UMAP, DBSCAN, KMeans и др.) за счет мощи GPU. ✔️Автоматическое переключение между GPU и CPU. Ваш скрипт будет работать в любом случае. Топ инструмент для всех, кто работает с scikit-learn на задачах, требующих значительных вычислений, и у кого есть GPU от NVIDIA. 👇 Как использовать: Установите RAPIDS cuml (лучше через conda, см. сайт RAPIDS): python conda install -c rapidsai -c conda-forge -c nvidia cuml rapids-build-backend Добавьте в начало скрипта: import cuml.patch cuml.patch.apply() Используйте scikit-learn как обычно! Попробуйте и почувствуйте разницу! 😉 ▪Блог-пост ▪Colab ▪Github ▪Ускоряем Pandas @ai_machinelearning_big_data #python #datascience #machinelearning #scikitlearn #rapids #cuml #gpu #nvidia #ускорение #машинноеобучение #анализданных

  • 9 февр. 2025 г.7401744из data_analysis_ml

    🐼 Pandas умирает медленной и мучительной смертью. Это самая популярная в мире библиотека обработки данных, но она медленная, и многие библиотеки значительно превзошли ее. Проблема альтернатив Pandas в том, что никто не хочет изучать новый API. Давайте посмотрим правде в глаза: люди не будут переносить свои проекты, га другие фреймворки, без особой причины. Я уже давно работаю с FireDucks 🦆 Эта библиотека в разы быстрее Pandas, и вам не придется менять код старых проектов для перехода на нее. Вы можете изменить *одну* строку кода и весь остальной код будет работать на FireDucks : import fireducks.pandas as pd Вы также можете запустить свой код *не* изменяя ни одной строки, используя хук: python $ python -mfireducks.imhook yourfile[.]py FireDucks — это многопоточная библиотека с ускорением компилятора и полностью совместимым с pandas API. Она быстрее, чем Polars. Ниже приведена ссылка на некоторые бенчмарки, сравнивающие Pandas, Polars и FireDucks. FireDucks побеждает с отрывом. ⛓️Здесь находится репозиторий FireDucks на GitHub: https://github.com/fireducks-dev/fireducks ⛓️Если вы хотите пощупать либу, откройте этот пример: https://github.com/fireducks-dev/fireducks/tree/main/notebooks/nyc_demo ⛓️Если вы хотите сравнить FireDucks с Polars и Pandas, вот еще один блокнот: https://github.com/fireducks-dev/fireducks/blob/main/notebooks/FireDucks_vs_Pandas_vs_Polars.ipynb ⛓️И наконец, бенчмарки, с которыми стоит ознакомиться: https://fireducks-dev.github.io/docs/benchmarks/ ⭐️ Подписаться: @data_analysis_ml #fireducks #Pandas #dataanalysis #datascience #python #opensource

  • PandasGUI — графический интерфейс для работы с DataFrame PandasGUI — это удобный инструмент, который предоставляет графический интерфейс для работы с Pandas DataFrame. Он позволяет визуализировать, фильтровать и редактировать данные прямо в интерактивном окне, что делает анализ данных более интуитивным и быстрым. Python Education | #Python

  • 8 дек. 2024 г.42153из dsproglib

    🐼Сложная агрегация в Pandas с MultiIndex В новой статье на «Хабре» объясняется, как ▫️создать мультииндекс и управлять его уровнями; ▫️проводить агрегацию данных с его помощью; ▫️работать со срезами данных по уровням. 🔗 Читать статью

  • 28 нояб. 2024 г.704511из dsproglib

    🐼Сложная агрегация в Pandas с MultiIndex В новой статье на «Хабре» объясняется, как ▫️создать мультииндекс и управлять его уровнями; ▫️проводить агрегацию данных с его помощью; ▫️работать со срезами данных по уровням. 🔗 Читать статью

  • Коллеги, вижу что пришло много новых людейтю. Наберём нового и полезного материала) будет интересно, не переключайтесь

DataSciencePRO — tgindex