tgindex
Наука и данные

Наука и данные

Статистика

Дайджест по полезным и интересным инструментам в науке о данных, машинному обучению и визуализации данных. Создан как записная книжка, которая дополняет страницу https://naukaidannye.netlify.app/

Последний пост
13 июл.
Последнее чтение
12:46
Постов за неделю
0
Всего постов
29
Тип
открытый
Язык
русский
Категория
Образование
В каталоге с
12 авг.
Подписчики
2 461
−3 за 6 дн.
Сутки
−1
−0,04%
Неделя
 
Месяц
 
Просмотров на пост
834
29 постов
Вовлечённость
33,9%
к подписчикам
Постов в день
0,0
всего 29
Упоминаний
11
каналов
Охват размещения
оценка
1/24сутки в ленте
1/48двое суток
1/72трое суток

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 13 июл.5991216

    Vellumverse (David Schoch) Vellumverse — это семейство библиотек R для создания графики, построенных на основе общей модели сцены и общего дизайна. Суть в том, что vellum — это низкоуровневый графический фреймворк для R, созданный по аналогии с Grid, но рендеринг PNG/SVG/PDF выполняются на основе языка Rust. В частности, библиотека vellumplot — это грамматика графики, которая компилирует график в сцену в формате vellum, а vellumwidget превращаает график в HTML-виджет. За счет использования Rust можно рендерить большие объемы (например, картографических) данных. Кроме того, рендеринг детерминирован в vellum и одна сцена рендерится в PNG, SVG или PDF с одинаковой геометрией и формой текста + все компоненты используют общую модель сцены, что позволяет экспортировать один и тот же график как в статический PDF, так и превращать его в интерактивный элемент. Примеры vellum можно посмотреть в галерее.

  • 8 июл.8051621

    Broken Chart: откройте для себя 9 вариантов визуализации Как из плохого графика сделать эстетичный и информативный? Ежемесячно испанское экологическое Министерство публикует график среднемесячной температуры, который использует неподходящие типы диаграмм (например, столбчатые диаграммы для измерения температуры) и содержит визуальные несоответствия, что снижает ясность читаемость. Dominic Royé предлагает сразу 9(!) альтернативных ggplot2-графиков для этих же метеорологических и климатических данных. Каждый из графиков имеет свои сильные и слабые стороны, при этом их эффективность во многом зависит от цели и аудитории. Получилась очень познавательная статья, к тому же содержащая код для визуализаций. Просто в рамочку и на стеночку! Кстати, у автора есть вот такая климатическая панель.

  • 7 июл.1 93223124

    Байесовский спринт Для тех, кто пропустил интенсив Байесовский спринт, который проводил Георгий Алексеевич Мороз: 🔗 материалы спринта 📺 видео 1-й части 📺 видео 2-й части

  • 6 июл.7531623

    Reintroducing shinyelectron Как превратить приложение Shiny в автономное настольное приложение, работающее на Windows, macOS или Linux? James Balamuta в 2025 году представил shinyelectron, который на тот момент компилировал приложение Shiny на R в WebAssembly и упаковывал его в оболочку Electron. Новая версия shinyelectron позволяет создавать приложения на R и теперь и на Python, предлагает несколько способов их запуска (от автономной сборки WebAssembly до контейнера Docker или Podman), а также позволяет подписывать приложения с помощью сертификатов. Подробно почитать можно в статье Reintroducing shinyelectron, а начать работу с shinyelectron на странице библиотеки. Теперь не нужно никакого веб-сервера либо инфраструктуры развертывания, Shiny app можно преобразовать в дистрибутив .exe, .app или .dmg.

  • 3 июл.1 1971214

    Устали от каталогов графиков? Вот так Michael Friendly в шутку создал "каталог видов бабочек", каждый график которого представляет собой идеи графичеких визуализаций. Кстати, Майкл недавно открыл целое направление в науке: Beach Science, BS! Хороших выходных! 👋

  • 3 июл.870718

    Reuters Climate Monitor В Reuters создали климатический монитор, который в режиме реального времени показывает, где наблюдаются необычно высокие или низкие температуры, сравнивая сегодняшние условия с типичными показателями прошлого. Конечно, при этом они в пояснениях определяют, что такое климатическая норма. Визуально выглядит прекрасно, можно посмотреть, что происходит в ближайшем окружении. Скажем, видно, что в Западной Европе температура много выше нормы, а на западе США — ниже нормы.

  • 2 июл.7021121

    Data dictionaries, parquet, & Claude | Hadley Wickham | Data Science Lab Крайне рекомендую к просмотру видео Data dictionaries, parquet, & Claude, в котором Hadley Wickham показывает, как он использует LLM (в его случае это Claude) + MCP + parquet (формат для эффективной обработки и хранения данных). Кроме того, для описания данных Hadley использует интересную концепцию data-dict.yaml. Здесь все описания: столбцы, типы, ограничения, связи и необходимый для их понимания словарь предметной области, хранятся в одном YAML-файле. Интересный подход, который видимо придется брать на заметку.

  • Working Smarter with {dplyr} 1.2.0 by Isabella Velásquez Isabella Velásquez сделала хороший познавательный скринкаст по функциям dplyr версии 1.2.0, все очень неплохо расписано. Увы, не нашлись актульные слайды презентации, только предыдущего доклада. Аналогичную версию с разбором функций, пришедших в dplyr 1.2.0, можно посмотреть у Алексея Селезнева.

  • 2 июл.5891017

    tidymodels, animated Мы уже встречали раньше такую забавную штуку, как tidyexplain — анимацию функция из tidyverse с использованием R, tidyverse и gganimate, что очень неплохо ложится в различные курсы обучения. Emil Hvitfeldt также сделал замечательную вещь! Это tidy-animations — анимированные пояснения к концепциям tidy-анализа данных и машинного обучения, созданные с помощью Quarto RevealJS и anime.js. Для каждой "объяснялки" есть отдельная Quarto-презентация, которую можно вставить в свою или можно скачать GIF или MP4.

  • 1 июл.1 1181027

    Graticule Еще один любопытный веб-инструмент, точнее даже MVP (минимально жизнеспособный продукт) представил Will Cahse, который много лет занимается дизайном [у него просто шикарные проекты] и картографией. Graticule — это небольшое веб-приложение, которое содержит множество базовых элементов для отрисовки карт: сохранение проектов, загрузка данных, отмена/повтор действий, изменение проекций и экспорт файлов. Ключевой особенностью является сглаживание границ с учетом топологии, а также скорость отрисовки. В дальнейшем автор добавит: поддержку растровых изображений, поддержку большего количества систем координат, пользовательские проекции, и т.д. Посмотрим!

  • 1 июл.669813

    mapsf.gui: a shiny app to make maps with R Timothée Giraud, Matthieu Viry и Hugues Pecout представили mapsf.gui — приложение shiny как интерактивный интерфейс для создания тематических карт с использованием библиотеки mapsf. Приложение одновременно автоматически генерирует соответствующий код на языке R и позволяет управлять различными элементами карты, такими как легенда, заголовок, масштаб и т.д. Здорово то, что авторы решили разработать это приложение в большей мере в образовательных целях, чтобы можно было и самостоятельно сформировать карту в приложении и сгенерировать код на R. Подробнее можно ознакомиться в статье авторов в блоге R Geomatic.

  • 1 июл.6661014

    geovizr 1.0.0 Для отображения интерактивных тематических карт существует очень хорошая (D3) JavaScript-библиотека geoviz. Nicolas Lambert создал R-"обертку" для geoviz, которая называется geovizr. Библиотеку можно использовать для создания широкого спектра интерактивных масштабируемых векторных карт. Это чудесная библиотека с очень качественными возможностями, что не может не радовать простых картографов. Автор особо подчеркивает, что geovizr не предназначен для конкуренции с другими картографическими библиотеками в R, такими как mapsf или tmap, поскольку ориентирован в основном на HTML/интерактивную геовизуализацию.

  • 1 июл.724813

    Rethinking Validation for Spatial Machine Learning Jakub Nowosad сделал доклад Rethinking Validation for Spatial Machine Learning на ML4EO – Machine Learning for Earth Observation, в котором сосредоточился на пространственном машинном обучении и переосмыслении предположений, которые мы делаем в пространственном ML: определении области прогнозирования, адаптации стратегии валидации и перевзвешивании оценки при перекрывающимся распределении предикторов.

  • 1 июл.588714

    Robin Lovelace Тем, кто занимается задачами, связанными с планированием транспортной инфраструктуры на основе данных, известно, кто такой Robin Lovelace: Professor of Transport Data Science at the University of Leeds Institute for Transport Studies 🚶🚴🚲🚗🚌🚆. Он создает множество интересного софта, пишет книги (см. geocompx), а также обучающие материалы, используя R и Python, т. е. это такой же "классик" как, скажем, Qiusheng Wu, Edzer Pebesma, Geoff Boeing, Jakub Nowosad или Самсонов Т. Е. Недавно веб-страничка Робина с материалами переехала на Quarto.

  • 30 июн.6411029

    Bayesian Workflow 1. Для специалистов в области прикладной байесовской статистики не так давно вышла книга Bayesian Workflow, предлагая понимание малоизученных аспектов статистических рабочих процессов и раскрывая какие-то неочевидные вещи. На сайте книги есть множество практических примеров с кодом. 2. Rami Krispin обратил внимание на такой инструмент как NumPyro Forecast — Bayesian time-series forecasting with JAX and NumPyro (это Numpy + Pyro), можно посмотреть примеры. 3. Г.А. Мороз проводит интенсив 2 июля Байесовский спринт для анализа лингвистических данных. Онлайн будет, будет ли запись запись пока обсуждается.

  • 30 июн.1 7991162

    Why Adjusted Regression Coefficients Are Less Descriptive Than They Look Kristoffer Magnusson (исследователь в области клинической психологии) ведет любопытный блог, который называется R Psychologist. У него можно посмотреть множество интересных статистических визуализаций, в частности, как-то у нас упоминалась визуализация по доверительным интервалам. У автора вышла еще одна интерактивная визуализация: Why Adjusted Regression Coefficients Are Less Descriptive Than They Look. Здесь автор утверждает, что сначала нужно определить цель исследования в линейной множественной регрессии (прогноз или причинно-следственный вывод, описание), а затем рассматривать корректировки как отдельный анализ. Главный вывод автора: исследовательский вопрос определяет метод, а не наоборот.

  • worldcup26 ⚽️ Для тех, кто следит за футбольными баталиями на ЧМ 2026, Sharon Machlis создала R-библиотеку для отслеживания результатов и HTML-страницу с турнирной таблицей, сгенерированную в Quarto (+ Observable JavaScript для просмотра данных), которая отображет текущие результаты матчей из [платного] API football-data.org. Например, на R запрос может выглядеть так: library(worldcup26) list_teams() team_schedule("USA") team_next_match("Brazil") team_past_results("Argentina") На самом деле Sharon здесь активно использует LLMs, и, если подключить свой API, вопросы можно задавать и на естественном языке через Querychat.

  • TidyTuesday Gallery by Mickaël CANOUIL Бессменный проект TidyTuesday существует уже с... 2018 года, сложно поверить! Люди создают на основе еженедельно выклвдываемых данных их визуальные представления (например, Cédric Scherer или Georgios Karamanis), строят можели данных как когда-то в скринкастах David Robinson или Julia Silge. Mickaël Canouil создал персональную страничку со своими визуализациями (включая код), причем теперь это Typst + Gribouille <-- собственный инструмент, который Mickaël разрабатывает как аналог ggplot2. Получился очень хороший формат блога с пояснениями.

  • Resources Nicola Rennie объединила все свои странички со свободно доступными ресурсами, связанными с данными, в довольно симпатичном виде с категоризацией по темам. Напомню, что Joscelin Rocha Hidalgo также создала список ресурсов, которые помогали и продолжают помогать ей в процессе изучения/преподавания языка R. Ну и, конечно, есть еще такая подборочка.

  • Лето. Отпуск. Пишем код на R. Хороших выходных! 👋