tgindex
Культурный датасайнс (Даня Скоринкин)

Культурный датасайнс (Даня Скоринкин)

Статистика
@fckndhрусский

Культурная аналитика, Digital Humanities, количественный анализ культурных данных, вычислительная филология, бытование культуры и языка в эпоху чат-гопоты, умных машин и безумных людей. Ведёт @skorinkin Ранее назывался “Цифровой филолог” и “Ебаный DH”

Последний пост
6 авг.
Последнее чтение
18:08
Постов за неделю
0
Всего постов
21
Тип
открытый
Язык
русский
В каталоге с
12 авг.
Подписчики
1 988
+1 за 4 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
1 341
20 постов
Вовлечённость
67,5%
к подписчикам
Постов в день
0,0
всего 21
Упоминаний
8
каналов
Охват размещения
оценка
1/24сутки в ленте
1 004
1/48двое суток
1 150
1/72трое суток
1 240

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • 6 авг.5722934из rationalnumbers

    Возраст, в котором люди перестают открывать новую музыку (StatSignificant) По опросу сервиса Deezer, пик открытия новой музыки приходится на 24 года, а к 31 году вкусы начинают застывать. Анализ данных Spotify, сделанный в 2014 году, даёт близкую границу — 33 года. На первой картинке то же самое в поведении: среднее число исполнителей в ротации максимально у группы 25–34 года и дальше падает Сильнее всего на вкус влияет подростковый возраст. Разбор The New York Times на второй картинке показывает пик влияния на 13 годах у женщин и на 14 у мужчин, причём у женщин влияние детства выражено сильнее Опрос YouGov 2021 года на третьей картинке показывает тот же перекос со стороны поколений: лучшим десятилетием для музыки поколение X называет 1980-е (38%), миллениалы — 1990-е (23%), зумеры — 2010-е (17%). Каждое поколение выбирает десятилетие своего взросления Причины застоя, которые называли сами респонденты Deezer: слишком большой выбор — 19%, требовательная работа — 16%, маленькие дети — 11% Отдельное исследование на выборке более 250 000 человек показало, что с возрастом меняется не только новизна, но и роль музыки: молодые слушают заметно больше и в самых разных обстоятельствах, взрослые — в основном наедине Стоит помнить, что источники меряют разное: часть из них — опросы о самоощущении, часть — поведение в стриминге. Совпадение границ в районе 30 лет говорит о согласии оценок, а не о найденной константе Ещё мы писали про музыку: — Эволюция параметров музыки, 1920–2010 — Сколько прослушиваний необходимо на различных музыкальных стримингах, чтобы заработать 1000$, 2022 — Как связаны популярные исполнители Яндекс Музыки

  • 6 авг.581452

    Тут вот ниже сообщают, что плейлист человека обычно застывает в районе 31-33 лет... А у вас как? Мой, кажется, застрял ещё в 16 😅 *удаляется, напевая Мёртвого анархиста*

  • 28 июл.1 00920

    видео или голосовое, без подписи

  • 28 июл.98417120

    Расходящиеся с друзьями тропки 💔💔 (и новая книга по количественному анализу эволюции литературы в открытом доступе) У меня есть в Потсдаме коллега и друг — итальянец Лука. Мы сидим в одном кабинете уже 4 года, съели вместе не один пуд столовской картошки с огурцами (Немецкая Кухня™ 😅), а когда он полтора года назад защитил свою PhD про количественное исследование эволюции европейской драмы раннего нового времени на 5-ти языках — я с удовольствием сбросил на него свою тогдашнюю работу в роли Digital Humanities Coordinator. Теперь эта самая PhD вышла в виде книги с завлекательным названием Forking Paths: Evolution and Divergence in Early Modern European Drama. Кстати, за название Лука долго бился с издательством, они хотели что-то скучное типа Quantitative Analysis of Early Modern European Drama... Но, конечно, итальянское стремление к яркому и красивому победило немецкую тягу к скучному и предсказуемому!💅😎 Обложку Лука тоже продвигал свою (ну то есть как свою... задизайненную им в Клоде) — и тоже добился успеха. А теперь вот я получил персональный экземпляр книги с дарственной надписью. И господи, вы только посмотрите на это 🥰 Этот текст вывел своей рукой человек, не знающий русского! Да, понятно, что перевод, но эта каллиграфия, эта тщательность выписывания незнакомых кириллических буковок... Я сейчас расплачусь от умиления 🥰 Особенно учитывая, что дни нашей с Лукой совместной работы сочтены и уже осенью мы окажемся в разных местах. И не спрашивайте, кто и где — этого я и сам до конца не знаю сейчас; но явственно чувствую, что нашей с ним совместной работе в Потсдаме, нашему соавторству и прочему выходит срок💔 Все проходит. Все не вечно. Энтропия, друг ты мой! Даня, а МНЕ-ТО ЧТО до твоих сентиментальностей?! — спросит здесь в недоумении читатель. Ну — как минимум новая книжка с количественным исследованием эволюции литературы, лежащая совершенно бесплатно в открытом доступе 💁 Встречайте: https://www.transcript-open.de/isbn/11688 Прямая ссылка на PDF: https://www.transcript-verlag.de/shopMedia/openaccess/pdf/oa9783839441640.pdf Там, кстати, в методологической части неоднократно упоминается Ярхо и русский формализм. Лука как-то заявил мне, что русский формализм — это вообще лучшее, что Россия дала миру. И я даже не стал спорить (гордиться ракетами нынче как-то не с руки).

  • 19 июл.1 2812112

    P.S. Пекин, Мордор, Аляска и другие крайности Ещё в статье про формулу «от А до Б» есть кусочек про экзотические места, которыми взгляд поэтов кончается, но никогда не начинается. Например, ни одна формула в датасете не начинается с Пекина — но 6 заканчиваются…

  • 19 июл.1 2039

    видео или голосовое, без подписи

  • 19 июл.1 133349

    P.S. Пекин, Мордор, Аляска и другие крайности Ещё в статье про формулу «от А до Б» есть кусочек про экзотические места, которыми взгляд поэтов кончается, но никогда не начинается. Например, ни одна формула в датасете не начинается с Пекина — но 6 заканчиваются в нём. Для поэтов Запада это какая-то крайняя точка Востока. It is significant, then, that no single formula starts with Beijing: it always ends there (n=6). The symbolic and semantic origin point of the soaring perspective lies in the West. А вчера мой друг Слава, замечательный историк и гид (то есть буквально практик преодоления культурно-значимых расстояний от А до Б — он даже как-то делал тур по маршруту героев Ремарка из Оснабрюка в Лиссабон) заставил Клода наресерчить аналог статьи Мартыненко, Шели и Плехача — но по тексту «Властелина колец» и карте Средиземья (см. PDF ниже). И там полным аналогом Пекина оказался Мордор*. Пути героев всегда идут туда, и никогда — оттуда**. (ну правильно: про оттуда можно не думать, орлы довезут 🦅🤣) Ключевой же осью, вдоль которой расположена большая часть направлений во «Властелине колец», если верить Клоду, оказывается диагональ Северо-Запад — Юго-Восток. Но это все, конечно, нуждается в sanity check от кого-то, кто разбирается в географии Средиземья. Возвращаясь к оригинальному исследованию про европейских поэтов: кроме Пекина есть и другие экзотические места, которые вообще ни разу не оказываются в позиции «от А» (т.е. никогда не являются для поэтов начальной точкой), но неоднократно становятся концом маршрута («до Б»). Я скачал данные статьи (благо авторы разместили их в открытом доступе 🙏 ) и нашёл все локации, встречающиеся 0 раз «от» — и больше 3 раз «до». Кроме Пекина это Перу (6 раз «до», 0 раз «от»), Аляска, польский пограничный город Цешин, речки Западный Буг, Тайн, По и Бояна (все 5 раз «до», 0 раз «от»; о естественной пограничности рек уже было сказано выше в первом посте), Каспийское море, Бургундия, город Ванн в Бретани, речка Тара на Балканах, район Ротерхайт на востоке Лондона и, внезапно, Капитолийский холм в Риме (все 4 раза «до», 0 раз «от»). * На всякий случай скажу, что я не любитель дурацких дискуссий на тему того, кого имел в виду Толкин под Мордором. Ну, и Китай там в любом случае не фигурирует обычно. ** «Конечная» позиция Мордора во «Властелине колец» явно выводит нас на анализ фокализации и поветствовательной перспективы, столь любимый филологами; как тут не вспомнить «Последнего кольценосца» и прочие популярные на постсоветском пространстве фанфики, рассказывающие историю с перспективы не-такого-уж-и-плохого-Мордора😈, который щемят ужасные снобы-колонизаторы эльфы🧝🏻‍♀️. Наверняка там «начала» и «концы» географии распределятся иначе.

  • 18 июл.2 56938

    видео или голосовое, без подписи

  • 18 июл.2 17538

    видео или голосовое, без подписи

  • 18 июл.1 94038

    видео или голосовое, без подписи

  • 18 июл.1 7806238

    От Перми до Тавриды, от Мааса до Мемеля: где кончаются империи по версии поэтов (и как вы можете исследовать это сами) Вернёмся к культурным сюжетам. Недавно у нас в Потсдаме прошла ежегодная Conference of Computational Literary Studies. Там замечательная Тоня Мартыненко рассказывала про их с Артёмом Шелей и Петром Плехачем ресерч поэтической формулы «от А до Б», где А и Б — географические объекты. Т.е. всякое типа «от Перми до Тавриды» у Пушкина, «Von der Maas bis an die Memel» в одной там немецкой песне, которая плохо состарилась в XX веке, или «от тайги до британских морей» в советском марше. 🪶Сама формула — наследница оды, жанра высокого в буквальном смысле. Одический поэт «воспаряет» над землей и озирает пространства (авторы статьи напоминают, что взгляд с высоты, знакомый нам по пролетам камеры в фильмах, изобретен литературой за много веков до кино, дронов и аэрофотосъёмки). Причем поэты часто летают «от Арарата до Эвереста» не просто так, а с политическим прицелом: очертить границы державы, воспеть размах походов полководца и т.п. Это такой поэтический инструмент экспансивной картографии (например, в упомянутой выше немецкой песне, ставшей гимном, пограничными точками выступают локации, целиком никогда не входившие ни в одно, даже самое большое немецкое государство¯\_(ツ)_/¯). 💻 Что и как исследовали? Авторы взяли корпуса поэзии PoeTree на шести языках (чешский, немецкий, английский, французский, русский, словенский; суммарно 66 млн токенов, XVI–XX века), распознали в них топонимы, привязали их к координатам через Wikidata и извлекли все конструкции вида «предлог + топоним + предлог + топоним». После ручной чистки осталась 1061 формула из 881 стихотворения 380 разных авторов. Дальше каждую формулу превратили в вектор на карте: точка «от» — начало вектора, точка «до» — конец. Получились стрелки, по которым видно, откуда и куда смотрит «поэтический взгляд». И что узнали? 🔭 Империи смотрят далеко, молодые нации — близко. В поэтических традициях больших империй (французская, английская, русская) много «дальнобойных» формул на тысячи километров: медианная дистанция в русском корпусе — 1478 км, а рекорд всего датасета — «от Анд до Тибета» в стихотворении француза Гюго (18 209 км). А вот в «не-имперских» и более локальных чешском и словенском корпусах медианные дистанции — 436 км и 91 км соответственно. В этих культурах, долго не имевших политического суверенитета, поэты пытаются оградить своё национальное пространство. Чешские поэты мыслили себя «от Шумавы до Крконош» (два горных массива), и вообще горы у них — 2-й по популярности тип локаций после городов. 🧭 Ось Запад–Восток. Длинные вектора «от А до Б» часто идут с Запада на Восток и наоборот. В русской поэзии таких 82% — что соответствует форме России на карте и ключевому направлению, в котором она расширялась. Но ось Запад–Восток заметна во всех 6 корпусах: и у французских, и у немецких поэтов больше половины «дальних» взглядов — «горизонтальные». Габариты стран с севера на юг интересуют поэтов меньше (хотя как минимум для немцев это исторически бывало важным). 🗺 Центры — политические, границы — природные. В статье предложена мера «граничности»: если вектора в/из какой-то точки направлены во все стороны света — это центр. А если в одном направлении — это граница. Оказалось, что центры поэтической карты — чаще города, столицы (чемпионы Рим и Париж), а границы — реки, моря и горы (португальская речка Тахо смотрит только на восток, а Балтика — только на юг, т.е. это типичная северная граница). 🧑‍💻Как поискать такое самому Пока я писал этот пост, решил сам поискать примеры в поэтическом НКРЯ — там это легко. Задаёте 4 леммы подряд: от + топоним + до + топоним — и вуаля. Жуковский сообщает, что «От Камчатки до Дуная / Наше все и все поет», у Лермонтова «от Урала до Дуная» движутся полки, Тютчев расширяет границы «русской географии» до предела: «От Нила до Невы, от Эльбы до Китая». В XX веке формула продолжает жить: Ахматова сетует, что её 30 лет клянут «от Либавы до Владивостока», а поэтическому взгляду Вознесенского «видно от Москвы до Хабаровска».

  • 16 июл.9163814из adel_and_ml

    Насколько же сильно меняется работа, когда есть ИИ агенты. Мой коллега, биоинформатик, увидел статью, в которой хитрым образом находят специфичные гены в картошке. Понял, что это может быть полезно для нашего отдела по селекции клубники. Потому что и то, и другое распространяется вегетативно - то есть не через семена, а усы и клубни - они не родня, конечно, но в генетическом плане есть о чем поговорить, так сказать. Он дал эту статью агенту, который вооружен до зубов скиллами нашего собственного приготовления, и поставил задачу воспроизвести методы из статьи на наших данных клубники. Агент прочел работу, скачал с гита код, подтянул наши данные из бд, адаптировал что-то по мелочи, собрал контейнер, создал джобу на кластере и вот оно там бодро считается на нескольких Н100. По сути это задача интерна/джуна - “вот тебе статья, вот данные, через неделю покажешь, не надо плакать, все будет хорошо, соберись уже” Прогресс, как это часто бывает, выглядит немного несправедливо. И это, заметьте, не задачи кодинга, это по сути своей - applied research. Ведь агент не просто пишет код (если вообше пишет), а таскает за собой весь исследовательский контекст, внутреннюю кухню по данным и инфре. До сих пор не верится, что это все настолько хорошо работает. Ощущение, что оно где-то да вот вот зафейлится - но оно раз за разом хорошо отрабатывает. Магия 🤷‍♂️

  • Кстати, у настоящих сварщиков серьёзных учёных из серьёзных наук™ опыт с делегированием научно-компьютерных задачек ИИ-агентам примерно такой же отрадный, как у меня. Ну, с той разницей, что там труба сильно повыше и дым куда гуще: Агент прочел работу, скачал с гита код, подтянул наши данные из бд, адаптировал что-то по мелочи, собрал контейнер, создал джобу на кластере и вот оно там бодро считается на нескольких Н100. По сути это задача интерна/джуна - “вот тебе статья, вот данные, через неделю покажешь, не надо плакать, все будет хорошо, соберись уже” Прогресс, как это часто бывает, выглядит немного несправедливо.

  • 10 июл.1 253319из llm_under_hood

    Когда электричество только появилось, его использовали для освещения, розеток не было. Но потом сообразили, что можно от электричества дома можно запитывать много других девайсов. На фотке (если присмотреться) видно, что провод к утюгу идет прямо из лампочки. Потребовалось какое-то время, прежде чем места подключения электричества переместили в более привычные для современного взгляда места - розетки на стенах. Современное использование AI/LLM ощущается аналогично. Электричество подвели к лампочкам и станкам, как это кажется логичным. Но индустриальная революция внедрений ещё впереди, а паттерны использования AI ассистентов, агентов и демонов будут отличаться от того, о чем вещают из каждого утюга. Ваш, @llm_under_hood 🤗

  • 10 июл.1 0857722

    В последние месяцы моя работа процентов на 95 состоит из того, что я получаю какую-то задачу (исследовательскую ли, инфраструктурную ли) — и затем иду в Claude Code / Claude Cowork накидывать ему контекст в духе "вот письмо профессора, в котором он просит то-то и то-то, ты сейчас в репозитории / папке, где лежат все наши прошлые эксперименты и тобой же написанный отчёт по ним, давай разберись, что он там хочет, и выдай результат"). И он её решает уже более-менее автономно. Изучает файлы, пишет код, запускает, тестирует, правит, перезапускает, визуализирует... И в итоге делает ХОРОШО. Попутно еще выявляет косяки, которые мне были не очевидны, и предлагает классные дополнительные форматы анализа/выдачи результатов, до которых я бы не додумался. Короче, примерно вся моя псевдо-интеллектуальная деятельность свелась к подвозу словесной содержательной руды для умных (в отличие от меня🤪) агентов. И вот сегодня случилось смешное и предсказуемое: из-за какого-то сбоя не прошла оплата нашего университетского Team-аккаунта Claude (см. скриншот, который прислал мне наш профессор) — и моя работа ВСТАЛА 😅 ¯\_(ツ)_/¯ Я буквально ощутил себя так, как 10 лет назад ощущал себя в офисе, где вырубилось электричество. То есть ЧТО-ТО поделать, конечно, можно, но большую часть задач — разве что для тренировки, чтобы вспомнить, как это делается руками и размять ленивые мозги. Вообще умные люди говорят, что надо теперь устраивать hands-only дни без LLM, чтоб не отупеть в конец... но как же ЛЕНИВО! 😶🐱🐱 В общем, впервые ощутил на себе, как LLM-ный компьют может играть роль нового электричества/интернета... Отключили — и работа встаёт / замедляется на порядок. Сразу вспомнился вот этот пост ниже, где проводилась та же историческая параллель на красивом примере с розеткой в лампе:

  • 30 июн.2 49455

    видео или голосовое, без подписи

  • 30 июн.2 4238954

    Тем временем удав проглотил слона главный текстовый корпус всея Руси НКРЯ🦆с суммарным объемом в 2,2 млрд словоупотреблений присоединил к себе корпус ВК-текстов из ГИКРЯ размером в 11,3 млрд, т.е. в пять раз больше🦆🦆🦆🦆🦆 Теперь в этом новом НКРЯ-ГИКРЯ можно, например, найти и исследовать больше 7 тыс употреблений слова "имба" (см. скриншоты выше). Для сравнения, в старом 166-миллионном "корпусе соцсетей" НКРЯ у "имбы" было всего 127 вхождений. А великое наше междометие "пупупу" (как бы мы вообще выжили без него последние 4.5 года??) в НКРЯ, кажется, вообще раньше не встречалось... Теперь же с присоединением ГИКРЯ есть как минимум 73 вхождения "пупупу" (или пупупы? 🤔)

  • 29 июн.1 37723

    видео или голосовое, без подписи

Культурный датасайнс (Даня Скоринкин) — tgindex