tgindex

Системный Блокъ

описание

«Системный Блокъ» — издание о цифровых технологиях в культуре, искусстве, образовании и обществе. Финалист премии «Просветитель» sysblok.ru vk.com/sysblok fb.com/sysblok instagram.com/sysblok/ Присоединяйтесь к команде: sysblok.ru/join

11 527
подписчиков
Охват к подписчикам
25,4%
ERR
Реакции к просмотрам
1,09%
956 на 25 постов
Пересылки к просмотрам
0,99%
864
Постов в день
0,3
всего 25

Где отзываются чаще

доля реакций к просмотрам
  • 09:31От переводчика до AI-тренера: как меняются профессии в эпоху больших языковых моделей В новом материале рассказываем, как меняются привычные профессии и какие новые роли появляются на рынке труда. А еще бонус — интервью с AI-тренером. Паниковать или готовиться к переменам? Регулярно выходят исследования о том, как ИИ меняет рынок труда. По данным отчета Future of Jobs 2025, к 2030 году из-за автоматизации исчезнет 92 миллиона рабочих мест — но появится 170 миллионов новых. Аналитики Anthropic говорят не о полной автоматизации, а о гибридизации: ИИ берет на себя сбор данных, поиск опечаток и генерацию шаблонов, человек отвечает за фактчекинг, этический контроль и творческие решения. Около 80% компаний планируют обучать сотрудников работе с ИИ, а не увольнять их. Как меняются привычные профессии Привычные специальности не исчезают — они адаптируются. Например, переводчик все больше занимается локализацией и культурной адаптацией текста. Технический писатель отвечает за структуру, логику и понятность документации, но готовит текст с помощью ИИ. Программист делегирует написание кода языковым моделям, сосредотачиваясь на архитектуре и тестировании. Новые профессии Вместе с ИИ появились роли, которых раньше не существовало. Промпт-инженер проектирует запросы для языковых моделей, создает масштабируемые инструкции и настраивает работу моделей с внешними источниками данных. AI-тренер — «учитель» нейросети: пишет эталонные ответы на сложные запросы, оценивает и ранжирует выводы модели по степени полезности, безопасности и достоверности. ИИ-копирайтер выстраивает алгоритм генерации через ИИ-агентов, проводит фактчекинг и адаптирует результат под конкретную аудиторию. Лингвист-аналитик оценивает качество генерации, выявляет системные ошибки нейросетей и разрабатывает метрики оценки. Специалист по этике данных следит за безопасностью и ответственностью ИИ-систем: снижает предвзятость алгоритмов, контролирует атрибуцию источников и фильтрует токсичный контент. Как это выглядит изнутри: AI-тренер Андрей Мужщинский тренирует ИИ уже 2,5 года — до этого около 20 лет работал в журналистике и спичрайтинге. По его словам, навыки работы с информацией оказались напрямую применимы: «Найти данные, проанализировать их, профактчекать, написать текст понятным языком — все это пригодилось и в работе AI-тренером». О будущем профессии Андрей рассуждает без паники: «Нейросеть уже сейчас хорошо творит, складно и красиво пишет, и многие рутинные задачи будут автоматизироваться еще больше. Но без участия человека всё равно никак не обойтись. Кто-то должен контролировать работу, вовремя замечать сбои, оперативно вмешиваться и исправлять ошибки». Больше о новых профессиях и о том, как и чему учиться, когда меняется рынок труда, — в полной версии материала. Время чтения: 10 минут 🤖 «Системный Блокъ» @sysblok4,96%
  • 27 июл.Сад расходящихся рейтингов: почему книжные топы в России почти никогда не совпадают Почему лидеры продаж на маркетплейсах почти не встречаются в рейтингах библиотек? Почему Пушкин — самый востребованный автор в электронных архивах, но не в книжных магазинах? Мы исследовали книжный ландшафт России в четырех сегментах — магазины, библиотеки, самиздат и онлайн-архивы — и выяснили, что в каждом из них свой читательский мир. Что мы исследовали В выборку вошли данные за 2025 год о лидерах продаж или читательских запросов. Мы собрали топы Book24, Ozon, Wildberries, «Буквоеда», «Лабиринта», «Литреса», «Строк», «Читай-города», 120 библиотек из 38 регионов, сайтов Author.Today, «Литрес.Самиздат», а также архивов az.lib.ru, ImWerden, Ru.Wikisource и Национальной электронной библиотеки. Рейтинги показывают не само чтение, а транзакции — покупку, выдачу или скачивание книги. Поэтому каждый сегмент отражает свой этап пути текста к читателю: в магазинах работают алгоритмы и маркетинг, в библиотеках — доступность фонда и региональные особенности, в цифровых архивах — возможность получить текст. Книжные сети: от фэнтези к саморазвитию Коммерческие рейтинги оказались самым «сфокусированным» сегментом: около трети топовых позиций занимают фантастика и фэнтези, а на втором месте — литература о психологии и саморазвитии. Современная зарубежная литература заметно опережает российскую, а классика почти не появляется в верхних строчках. Среди лидеров разных площадок — Лоран Гунель, Ребекка Яррос, Гэнки Кавамура, Аллен Карр, Анна Джейн, Виктор Дашкевич и Вадим Зеланд. При этом топы магазинов почти не пересекаются: рейтинг Ozon не повторяет рейтинг Wildberries, а «Читай-город» живет по другим правилам, чем «Литрес». Библиотеки: православный роман и местные авторы Библиотечные рейтинги устроены иначе: здесь первое место занимает не самый активно продаваемый автор, а тот, чьи книги доступны конкретным читателям. Абсолютным лидером стала Ирина Богданова — автор православных романов. Ее книги заняли 38 первых мест в библиотечных рейтингах, хотя ни одна из них не попала в топы маркетплейсов. На выбор читателей влияют регион, фонд библиотеки, школьная программа, рекомендации сотрудников и даже физические характеристики книги. В национальных республиках в топы часто попадают произведения на местных языках. Например, в якутских библиотеках половина популярных книг написана локальными авторами. Самиздат: мир фантазий В самиздате книга сразу попадает к аудитории, а автор может менять развитие сюжета в зависимости от реакции читателей. Такой формат создает отдельную литературную экосистему: на Author.Today 100% топа занимают фантастика, фэнтези и их поджанры. Еще одна особенность — сериальность: 79% популярных позиций на платформе входят в книжные серии, тогда как в магазинах таких книг 27%, а в библиотеках — 21%. Электронные библиотеки: общедоступная классика В онлайн-архивах лидирует классика: в Национальной электронной библиотеке первое место занимает «Анна Каренина» Льва Толстого, а в библиотеках вроде lib.ru и Wikisource — произведения Александра Пушкина. Причина не только в популярности классики: открытые цифровые архивы в основном работают с текстами, перешедшими в общественное достояние. Однако скачивание не всегда означает чтение. Пользователями таких архивов могут быть студенты или исследователи, которые собирают корпуса текстов для анализа. Кроме того, часть запросов сегодня создают не люди, а боты — например, системы, которые используют тексты для обучения ИИ. Что же читают в России? Единого рейтинга «самых читаемых книг России» не существует: разные топы измеряют разные отношения между книгой и читателем. Коммерческие списки показывают работу рынка, библиотечные — инфраструктуру доступа, самиздат — прямую связь автора и аудитории, а цифровые архивы — использование текста как ресурса. Больше подробностей об исследовании с таблицами и графиками — в полной версии материала. Время чтения: 15 минут 🤖 «Системный Блокъ» @sysblok2,98%
  • 11 авг.«Обучая ИИ — мы учимся»: о чем говорили на главной мировой конференции по цифровым гуманитарным наукам Что сегодня находится в фокусе цифровых гуманитарных наук? Как ученые используют ИИ-агентов в исторических и литературоведческих исследованиях? Наш постоянный автор Дмитрий Пронин побывал на DH2026 и делится наблюдениями. 404 доклада, 88 постеров и 111 секций DH2026 проходила с 27 по 31 июля в Тэджоне — корейском городе университетов и исследовательских центров. Это 36-я ежегодная конференция, которую проводит Alliance of Digital Humanities Organizations. Темой конференции стало Engagement — вовлечение, взаимодействие и сопричастность. Обсуждали как классические направления DH — оцифровку исторических данных, корпуса, TEI-разметку и графы знаний, — так и использование ИИ в исследованиях. ИИ как историк и литературовед На мини-конференции Playing Heaven исследователи из Гонконга и Сингапура демонстрировали ИИ-инструменты для изучения раннего Нового времени в Восточной Азии. От языковой модели требовалось связывать людей, места, тексты и философские школы, то есть частично воспроизводить работу историка. В докладе Simulating the Unlived Past Яо Сун и Ваньцзин Цзян превратили 334 китайских поэта эпох Тан и Сун в автономных агентов. В модель вошли более 16 млн записей и почти 99 тыс. датированных произведений. Исследователи убрали из симуляции восстание Ань Лушаня VIII века, ставшее самым масштабным военным конфликтом эпохи, и посмотрели, как изменилась бы литературная история. Однако авторы подчеркнули — модель не доказывает, что события развивались бы именно так. Чему ИИ учит человека В лекции Teaching AI, Training Ourselves профессор Ким Хён предложил считать ИИ не просто инструментом, а интеллектуальной средой, в которой люди ищут информацию, создают тексты и учатся. Он обратился к понятию jiaoxue xiangzhang — преподавание и обучение, взаимно усиливающие друг друга. Например, человек может несколько раз перерабатывать созданное ИИ сочинение — исправлять его или уточнять промпт. В результате он не только получает текст, но и формулирует собственную позицию, а взаимодействие с моделью становится частью обучения. Большие проекты начинаются с маленьких действий Мацей Эдер, разработчик пакета stylo и лауреат премии Антонио Замполли, рассказал о создании Computational Stylistics Group. Сообщество возникло без единого гранта, бюджета или формальной структуры — исследователи встречались на конференциях, проводили семинары, обменивались данными, писали открытый код и подключали новых участников. DH2026 показала, что классические методы цифровых гуманитарных наук неожиданно возвращаются в центр внимания. Но еще заметнее другое изменение — вопрос о будущем человека в эпоху ИИ уже трудно списать на тревогу техноскептиков. ИИ уже способен обработать миллионы текстов и смоделировать неслучившееся прошлое. Но сам масштаб вычислений не создает знания — для исследования по-прежнему нужны идея и вопрос, который стоит задать. О чем еще говорили на конференции, читайте в полной версии материала. Время чтения: 9 минут 🤖 «Системный Блокъ» @sysblok2,76%
  • 28 июл.«Технологии для чтения»: представляем новый проект «Системного Блока» Цифровые технологии давно стали частью читательского опыта. Они помогают находить книги, обсуждать их с другими читателями и анализировать тексты. Мы запускаем проект о том, как технологии меняют читательский опыт. На одной странице мы собрали материалы для тех, кто любит книги и хочет узнать, как цифровые инструменты помогают внимательнее читать , глубже анализировать литературу и по-новому смотреть на знакомые произведения. В проекте рассказываем, как работают цифровые читательские клубы, почему выбор шрифта влияет на восприятие текста и какие книжные трекеры действительно помогают не потеряться среди прочитанного. Мы также собрали материалы о цифровой филологии. Вы узнаете, как компьютерный анализ помогает исследовать стиль писателей, искать языковые особенности стихов Маяковского и Есенина, определять автора средневекового текста, строить сети персонажей «Войны и мира» и изучать звуковую атмосферу романов. А еще мы собрали тесты и интерактивные материалы. Угадайте писателя по любимым словам или проверьте, насколько хорошо вы знаете методы дальнего чтения. Подробнее — на странице проекта. 🤖 «Системный Блокъ» @sysblok2,59%
  • 28 окт. 2024 г.🌸Про ABBYY и будущее лингвистики🌸 #nlp #про_nlp По тг разошёлся текст Системного Блока про ABBYY, да и правда, после истории массовых увольнений очень хотелось подвести какую-то черту. Напишу свои 5 копеек, потому что можно сказать, что вокруг ABBYY начиналась моя карьера. ABBYY долгое время считалась самой лучшей компанией, куда мог бы устроиться лингвист. Когда я только поступала на ОТиПЛ, туда шли работать лучшие выпускники. При этом ходило мнение, что вот, дескать, интеллектуальная эксплуатация — забирают лучших выпускников, которые могли бы быть успешными учёными, и фуллтайм заставляют писать правила на Compreno. (Ну и правда, в 2012 году там 40-60к платили, а в академии меньше.) Помимо прочего, ABBYY оранизовывала самую большую NLP конференцию — Диалог, а также создала интернет-корпус русского языка, спонсировала кучу NLP-соревнований и shared tasks, которые распаляли многих проверить свои гипотезы на практике. 🟣Что же теперь делать лингвистике? Лингвистика разберётся! Я думаю, текущий вызов даже не самый серьёзный за историю существования кафедры. Да, последние годы приходилось работать под давлением общественного мнения, хайпом LLM...ну так он пройдёт. Аналитическая, теоретическая лингвистика нужна самой себе и другим наукам: — как понять и описать происхождение языка, — как определить биологические ограничения, повлиявшие на язык — как язык влияет на мышление и обратно, — как смоделировать максимально общую теоретическую модель языка, описывающую процессы в языках мира, — как проверить и описать, что находится в корпусе. Все эти вопросы остаются нужны, и остаются ключевыми вопросами лингвистики. А языковые модели и NLP потихоньку поглощают уже другие науки: — OpenAI нанимает филдсевских лауреатов в т ч для составления SFT датасета по математике — они же нанимают PhD в разных дисциплинах для разметки и валидации данных. Так что в жернова ИИ пойдут уже выпускники других специальностей. А лингвистика будет заниматься делом.2,31%
  • 3 авг.Три шага до «Hello, world!»: как научиться программировать самому Программирование постепенно превращается из узкоспециального навыка в универсальный: оно требуется аналитикам, маркетологам, преподавателям — для обработки текстов, сбора данных или создания простых приложений. Несмотня на бум ИИ-кодинга, понимание основ программирования не обесценивается, а становится ещё актуальнее. Научиться можно самостоятельно, если двигаться поэтапно: сначала разобраться в логике, и только потом — в синтаксисе. Публикуем гайд, который поможет вам начать осваивать создание кода. Шаг 1. Собрать программу из блоков Визуальное программирование позволяет начать с алгоритмов, не изучая синтаксис языка. Пользователь соединяет готовые блоки, как детали конструктора, и сосредотачивается на логике программы. Освоить это можно на двух платформах: ✔️ Scratch — здесь можно делать игры, интерактивные истории и комиксы, изучая циклы, условия и переменные. Блоки перетаскиваются на рабочее поле и складываются в простые игры, интерактивные истории или комиксы; ✔️ MIT App Inventor — в этой среде можно создавать полноценные мобильные приложения для Android и iOS: работать с кнопками, формами ввода, базами данных и сетевыми сервисами. Проект помогает освоить принципы разработки и даже создавать приложения для анализа больших массивов данных Шаг 2. Перейти к настоящему коду Когда логика уже понятна, можно переходить к написанию настоящего кода, то есть к тексту команд, а не к блокам. Один из инструментов для мягкого перехода к текстовому программированию — Ri IDE, среда разработки для учебного русскоязычного языка Ri. Благодаря синтаксису на русском языке можно сосредоточиться на логике, а не на запоминании английских команд. В Ri IDE создают анимации, игры и графические проекты, одновременно изучая базовые конструкции программирования — переменные, функции, условия и циклы. Шаг 3. Закрепить через игру Когда азы освоены, главной задачей обучения становится регулярная практика. Здесь помогают приложения, которые превращают тренировку кода в игру с заданиями и прогрессом. Например: ✔️ Coding Dojo — приложение с более чем 70 задачами на программирование разного уровня сложности и отдельным режимом тренировки алгоритмического мышления; ✔️ Fibu — позволяет пошагово собрать собственную игру на Python, HTML/CSS и JavaScript: каждый урок добавляет новую работающую часть игры; ✔️ Coddy Tech — короткие ежедневные уроки (15–20 минут) с реальным кодом, оформленные как в приложениях для изучения языков. Подробнее о каждом инструменте рассказываем в полной версии материала. Время чтения: 8 минут 🤖 «Системный Блокъ» @sysblok2,09%
  • 2 авг.Исторические личности в русской прозе: кто, почему и где упоминается чаще всех? Пушкин, Шекспир, Гоголь или Наполеон, Суворов и Александр I? Кто из них в русской литературе XIX века упоминался чаще? Дарья Герасименко из НИУ ВШЭ решила выяснить это с помощью библиотеки SlovNet. Она проанализировала больше пятисот прозаических произведений и обнаружила, что главными «героями» русской прозы были вовсе не императоры и полководцы. Кто же оказался в топе? Наполеон Наполеону рознь — отбор материала В исследование вошли только прямые упоминания исторических личностей в разных вариантах написания имен. Иносказания не учитывались, а исторические деятели, ставшие персонажами произведений, исключались: толстовский Наполеон не вошел в выборку, зато Наполеон из теории Раскольникова — вошел. Всего исследовательница проанализировала 571 имя. Техническая сторона исследования Для анализа использовалась библиотека SlovNet, которая распознает именованные сущности (NER), Navec для автоматизированной обработки текста и корпус русской нарративной прозы XIX века Олега Собчука и Евгении Лекаревич. В него входят 506 прозаических произведений, опубликованных в XIX — начале XX века. Пики частотности Первые пики упоминаний исторических личностей приходятся на 1830-е годы — время расцвета исторического романа после выхода «Юрия Милославского» Михаила Загоскина и «Дмитрия Самозванца» Фаддея Булгарина. Новые всплески наблюдаются в 1860–1870-х и 1880–1890-х годах — их исследовательница связывает с ростом числа публикаций и переломными общественно-политическими событиями. Самые упоминаемые исторические личности Неожиданно восемь из десяти самых часто упоминаемых персоналий в прозе 1860–1890-х годов — литераторы. Из нелитераторов в десятку вошли только Александр Суворов и Емельян Пугачев. Суворова вспоминают как образец воинской доблести, цитируют его высказывания и используют для характеристики персонажей, а Пугачев чаще появляется как символ бунта и в разговорах о политике. Самые упоминаемые литераторы С огромным отрывом лидирует Александр Пушкин. За ним следуют Уильям Шекспир, Николай Гоголь, Вольтер, Виссарион Белинский, Иван Тургенев, Михаил Лермонтов и Фридрих Шиллер. Их произведения цитируют, а книжные предпочтения героев становятся способом характеристики персонажей — это подтверждает литературоцентричность русской прозы XIX века. Писатели как лица эпохи Чаще всего исторические личности встречаются у Петра Якубовича, Ивана Кущевского, Сергея Максимова, Ивана Гончарова и Александра Эртеля. Исследование показывает, что в русской прозе XIX века именно писатели становятся главными культурными ориентирами, а обращения к историческим личностям помогают героям осмыслять прошлое и говорить о настоящем. О деталях исследования читайте в полной версии материала. А если вы хотите знать больше, как цифровые инструменты помогают глубже понимать и анализировать текст, читайте наш новый проект «Технологии для чтения». Время чтения: 10 минут 🤖 «Системный Блокъ» @sysblok2,04%
  • 11 июл.Искусственный интеллект помог обнаружить сотни геоглифов в пустыне Наска Мы продолжаем тематическую неделю, посвященную цифровым технологиям в истории. Всего за шесть месяцев искусственный интеллект помог археологам найти 303 новых геоглифа в пустыне Наска — почти столько же, сколько было открыто за предыдущее столетие исследований. Рассказываем, как ИИ изменил изучение одного из самых загадочных памятников древнего мира. От спутников к нейросетям Геоглифы — гигантские изображения на поверхности Земли — в пустыне Наска изучают почти сто лет. Их искали с помощью аэрофотосъемки, спутниковых снимков, дронов и LiDAR — технологии лазерного сканирования местности. Но небольшие рельефные изображения часто оставались незаметными, а проверка снимков занимала тысячи часов. Исследователи из Университета Ямагаты решили ускорить процесс и обучили нейросеть распознавать отдельные элементы геоглифов. После анализа изображений ИИ выделил перспективные участки, которые археологи проверили в экспедициях. Что удалось найти В результате ученые подтвердили существование 303 новых геоглифов с изображениями людей, животных и других фигур, а также десятков геометрических рисунков. Благодаря этому число известных рисунков Наски почти удвоилось. Новые находки показали, что многие небольшие геоглифы располагались вдоль древних маршрутов и, вероятно, были частью продуманной системы передвижения по пустыне. Их создавали так, чтобы человек видел следующую фигуру только после того, как подойдет к предыдущей. При этом исследователи уверены, что ИИ помог найти лишь часть скрытых памятников. Подробнее — в полной версии материала. Время чтения: 10 минут 🤖 «Системный Блокъ» @sysblok1,91%
  • 5 авг.От Пикуля к ИИ: как создавалась и на чём держится книжная империя «Эксмо-АСТ» Как студент авиационного института стал главным книжным издателем страны? Из чего вырос самый большой издательский холдинг? Почему на российском книжном рынке растут цены и падают тиражи? Чем он отличается от мирового и чем похож? Рассказываем историю холдинга «Эксмо-АСТ» от первых томиков Пикуля до сегодняшней империи — и делимся самыми интересными выводами. Как строилась империя Олег Новиков начал с экспедирования книг из Москвы в Харьков на третьем курсе МАИ. Постепенно компания выросла в издательство, нашла первый хит — «Антикиллер» Корецкого — и выстроила собственную розницу. Стратегия Новикова — вертикальная интеграция: контролировать всю цепочку от поиска автора до продажи. В 2013-м он купил АСТ, позже — «Азбуку-Аттикус» и «ЛитРес». Сегодня на четыре крупнейших издательства холдинга приходится более 50% тиража художественной литературы и нон-фикшна в России. Обороты растут — тиражи падают В 2025 году оборот книжной розницы вырос на 2,7% — но только в деньгах. Количество проданных в России книг упало на 9%, средний тираж за 20 лет сократился вдвое — с 7 тысяч до 3,5 тысячи экземпляров. Средняя цена книги осенью 2025-го — 559 рублей, за год она выросла на 12%. Это порочный круг: маленькие тиражи подстегивают цены, высокие цены снижают продажи, продажи падают — тиражи вместе с ними. Монополия на ярмарке Книжные ярмарки переживают подъем — для небольших издательств это главный способ выйти к читателю напрямую. «Эксмо-АСТ» подхватил этот тренд: на одну ярмарку нередко заявляются сразу несколько брендов, принадлежащих холдингу. Мы посчитали участников нескольких региональных ярмарок: доля издательств холдинга может быть от 1 до 22%. Монополии есть не только в России Консолидация книжного рынка — глобальный процесс. Пять крупнейших мировых издателей контролируют сегодня более 60% академических публикаций — против 20% в 1973 году. В 2022-м американский суд заблокировал слияние Penguin Random House и Simon & Schuster: объединённая компания контролировала бы 49% рынка бестселлеров США. Подробная хронология развития «Эксмо-АСТ», скандалы на фоне качества изданий и графики, иллюстрирующие состояние книжного рынка — в полной версии исследования. Время чтения: 20 минут 🤖 «Системный Блокъ» @sysblok1,69%
  • 19 июл.Цифровая охота: как «поймать» всех животных в тексте Зачем литературоведам нужно корпусное исследование? Оказывается, с его помощью можно изучать особенности разных жанров. Например, в детских ужастиках чаще всего пугают змеями, а в фантастике неожиданно много морских обитателей. В рамках тематической недели, посвященной анализу языка через данные, рассказываем, как с помощью корпуса детской литературы посчитать, каких животных и почему писатели выбирают для разных типов произведений. Зачем считать животных в детских книжках Литературовед Кирилл Маслинский, сотрудник Пушкинского дома и создатель Деткорпуса, изучает, как формируется содержание произведений. Он опирается на идею доступности концепта — вероятности того, что определенный объект, например животное, хотя бы один раз появится в тексте. На выбор животных влияют два типа факторов. Внутренние — литературная традиция и законы жанра: в сказках, например, часто встречаются лесные звери. Внешние — опыт самого автора: у Михаила Пришвина, который был охотником, в прозе особенно много птиц. Как исследовались тексты Деткорпус — это корпус русской детской литературы за 1900–2020 годы. В него вошли тексты разных жанров: сказки, ужастики, детективы, фантастика, любовные повести, анималистическая и реалистическая проза. Исследователь собрал словарь из 1906 названий животных, дополнив его уменьшительными формами и исключив метафорические употребления. Упоминания животных были разделены на два типа: «фоновые», когда животные служат частью привычного мира, и «специфические», когда они становятся важными героями или темой произведения. Какие животные встречаются в разных жанрах Оказалось, что набор животных в разных жанрах во многом совпадает: чаще всего встречаются виды, хорошо знакомые человеку. Но у каждого жанра есть свои предпочтения. В ужастиках чаще других появляются змеи. В научной фантастике заметно больше морских животных, амфибий и даже вымерших видов. В детективах и любовных повестях преобладают домашние животные, реалистическая проза изобилует сельскохозяйственными, а в анималистической литературе особенно много птиц и лесных зверей. Такой подход к исследованию позволяет увидеть, как литературные традиции влияют определяют устройство художественного мира больших групп произведений. Подробнее о том, как проходило исследование, — в полной версии материала. Время чтения: 7 минут 🤖 «Системный Блокъ» @sysblok1,57%
  • 16 июл.Брюхоногие моллюски, пептид и редкие фамилии: как сделать языковой корпус репрезентативным Из-за одного журнала по гастроэнтерологии слова пептид и эндоскопия неожиданно оказались среди самых частотных слов в языковом корпусе английского языка. Редкие слова вдруг могут показаться самыми распространенными в языке, если составить корпус текстов неудачно. Рассказываем, почему при создании языковых корпусов важнее не количество текстов, а то, как именно они отобраны. Что значит «репрезентативный корпус» Языковой корпус — это размеченное собрание текстов, которое помогает исследовать язык: выяснять, когда появилось новое значение слова, как отличаются жанры или какие языковые особенности характерны для разных групп говорящих. Чтобы выводам такого исследования можно было доверять, корпус должен быть репрезентативным — то есть отражать язык таким, каким он используется в реальной жизни, а не только в отдельных типах текстов. Для этого его делают сбалансированным: включают произведения разных жанров, тексты разных эпох, авторов и тематик. Иначе особенности одной группы текстов могут исказить общую картину языка. Проблема моллюсков и гастроэнтерологов Лингвисты называют один из таких эффектов проблемой букцинумов. Если добавить в корпус целую монографию о брюхоногих моллюсках, редкое слово букцинум начнет встречаться непропорционально часто и создаст ложное впечатление о своей распространенности. Похожая история произошла при создании Британского национального корпуса. В него целиком включили специализированный журнал по гастроэнтерологии, из-за чего слова пептид и эндоскопия неожиданно оказались в числе самых частотных слов английского языка. Позже этот перекос пришлось исправлять вручную. Почему редкие слова любят повторяться Есть и другая проблема — проблема Норьеги. Если редкая фамилия уже встретилась в тексте, вероятность увидеть ее снова гораздо выше, чем если бы слова распределялись случайно. То же относится и к другим ключевым словам: текст обычно развивает уже начатую тему, а не перескакивает между случайными сюжетами. Именно поэтому при создании больших корпусов исследователи предпочитают собирать множество сравнительно небольших фрагментов из разных источников, а не несколько длинных специализированных текстов. Такой подход позволяет лучше отразить языковое разнообразие и избежать тематических перекосов. Подробнее о том, каким должен быть хороший корпус, читайте в полной версии материала. А если вы хотите больше знать про то, как изучать язык с помощью данных, загляните в наш новый проект. Время чтения: 9 минут 🤖 «Системный Блокъ» @sysblok1,54%
  • 10 июл.Жизнь и связи древних римлян: о чем могут рассказать просопографические базы данных? Мы продолжаем неделю материалов о цифровых технологиях в исторических науках. Сегодня рассказываем о Древнем Риме и просопографии: оказывается, базы данных могут восстановить не только биографии людей двухтысячелетней давности, но и круг их знакомств, маршруты путешествий и даже семейные трагедии. Что такое просопография Историки собирают сведения о людях, живших в древности, в просопографические базы данных — каталоги, где фиксируются имена, происхождение, должности, родственные связи и упоминания в источниках. Благодаря этому исследователи могут изучать не отдельных людей, а целые сообщества и сети знакомств. Раньше эта информация публиковалась в многотомных справочниках, а сегодня создаются цифровые базы. Если представить такую базу в виде графа, где люди — это вершины, а связи между ними — линии, становятся заметны закономерности, которые трудно увидеть, читая надписи одну за другой. Как цифровые инструменты помогают историкам Одна из таких баз — проект Romans1by1 — объединяет более 20 тысяч записей о жителях римских провинций, известных по латинским надписям на камне, металле и керамике. Превращая данные в графы, исследователи обнаруживают, как были устроены сообщества, семейные связи, куда переезжали люди и как складывалась их судьба. Что можно узнать о связях римлян Графовый анализ помог обнаружить в римской Дакии целую диаспору выходцев из Малой Азии, существование которой было трудно заметить по отдельным надписям. Другой граф показал почти полное отсутствие личных связей у проконсула Гая Овиния Тертуллия — в источниках он окружен коллегами, но почти нигде не упоминается вместе с семьей. Еще одна история касается торговца Аврелия Аквилы. По данным из разных надписей исследователи восстановили часть его жизни: после смерти жены и дочери он покинул Дакию, перебрался в Далмацию, где потерял сына и двоих друзей. Все эти сведения удалось собрать из разрозненных надписей, найденных в разных частях Римской империи. Цифровые базы данных позволяют увидеть античный мир не только как историю императоров и войн, но и как историю тысяч обычных людей, чьи жизни удалось соединить спустя почти две тысячи лет. Разобраться в сети римских связей и рассмотреть графы можно в полной версии материала. Время чтения: 10 минут 🤖 «Системный Блокъ» @sysblok1,50%