Цифровой филолог👩💻
СтатистикаКанал об электронных филологических ресурсах: словарях, проектах, текстовых корпусах,базах данных, лингвистических программах. Автор канала — Рогожина Елена Игоревна (@Elena_Rechnaya), канд.филол. наук Чат: t.me/digital_philologist_chat
- Последний пост
- 29 июл.
- Последнее чтение
- 11:58
- Постов за неделю
- 0
- Всего постов
- 143
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 162
- 1/48двое суток
- 185
- 1/72трое суток
- 200
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
В Синтаксическом корпусе теперь можно отбирать тексты, для предложений которых доступна семантическая структура. Функция доступна при создании подкорпуса. #НКРЯ@digital_philologist
Древнерусский корпус пополнен 129 тематическими комплексами экстратекстов на восточнославянских рукописях XII–XIV вв. — добавлено больше 230 записей общим объемом 5 тысяч слов. Учтены современные лингвистические публикации. Тематическая метаразметка позволяет выбрать отдельный подкорпус молитв, бытовых заметок или литературных миниатюр. В корпусе появилось 200 «новых» древнерусских лексем, в том числе предки таких привычных нам слов, как крючок, любитель, мешать, связать, непременный, горский, снова, грубо.
😉 LLM + R 🔜 10 августа в 16:00 (msk) Ольга Алиева проводит трёхчасовой мастер-класс по работе с большими языковыми моделями для гуманитариев. 🖥 Опыт программирования не требуется, но нужно базовое знакомство с основами языка R. 🕓 Подробное описание и запись на Timepad. ❗️ Для подписчиков нашего канала действует промокод на скидку: DHRI 🔜 Приходите, это не страшно и очень полезно 💻
Настоящая книга готовилась к 2001 г. — юбилейному "году Даля", но вышла только в 2007 году, поскольку подготовка к печати рукописных офенских словарей оказалась делом сложным и потребовала большего времени. В книге четыре части: 1. Словари народного тайноречия (об истории изучения русских арго в ХVIII—XIX вв. и роли В.И. Даля в создании первого свода лексики "офенских" языков); 2. "Словарь языка шерстобитов" (о "жгонском" языке); 3. Условный язык петербургских мошенников; 4. Арготическая лексика в словарях русского языка; и собственно сами словари (Словарь мазуриков, шерстобитов, офенского языка). Символично, что в этом году отмечается год Даля: 225 лет со дня рождения лексикографа. #словари@digital_philologist
Как и обещала, делюсь ссылкой на компьютерную программу с рукописными словарями. Папку нужно скачать, разархивировать. Программа не требует установки. Вам нужен файл "CDBook_2x". После этого запустится программа. Ее можно читать как обычную электронную книгу, передвигаясь по оглавлению (см. слева вкладку "Тексты"). При нажатии на "+" раскроются главы и параграфы. Также можно пользоваться вкладкой "Поиск". Инструменты Сверху на панели инструментов есть стрелки « и » для переключения с одного раздела на другой. Можно скопировать любой фрагмент текста (для этого нужно предварительно выделить необходимый текст) и нажать на кнопку 📄, подготовить для печати 🖨, оставить заметку📝, справа есть возможность отрегулировать шрифт и ознакомиться с информацией о программе и об издании. #словари@digital_philologist
Рукописные словари Даля (Офенские, шерстобитов, мазуриков) Когда я готовилась к радиоэфиру о Владимире Ивановиче Дале, я открыла для себя много удивительных фактов. Конечно, мне было интересно узнать и об электронных ресурсах, связанных с Далем. Оказывается, еще в 2007 году была создана электронная книга в формате компьютерной программы с рукописными словарями Даля. В этой книге впервые были опубликованы четыре словаря В.И. Даля, составленные в 40—50-е годы XIX столетия параллельно с подготовкой его знаменитого "Толкового словаря". 1 и 2. "Словарь офенского языка" и "Русско-офенский словарь". Словари включают более 5 тысяч слов торговцев-коробейников — офеней. 3. "Словарь тайных слов шерстобитов" 4. "Словарь петербургских мазуриков". В основу работы была положена книга Василия Даниловича Бондалетова "В.И. Даль и тайные языки в России" (делюсь ссылкой на библиотеку Klex). В следующем посте прикреплю саму программу, расскажу о поисковых возможностях. #словари@digital_philologist
Как самостоятельно разметить тексты для параллельной книги? На этот вопрос есть ответ в "Градиентном блоге" Сергея Аверкиева. В одном из постов он рассказывает, какие теги в txt сделают разметку удобнее. Если авторизоваться на его платформе Lingtrain, то можно воспользоваться выравнивателем (см. скриншот в посте). #программы@digital_philologist
О том, как составлялся датасет, читайте здесь: https://t.me/doomgrad/1211
🔺 Сделал датасет Выложил небольшой датасет на языках России. 🟢 22 языка: алтайский, башкирский, бурятский, горномарийский, дигорский, кабардино-черкесский, калмыцкий, карачаево-балкарский, коми, кубачинский, марийский (луговой), мокшанский, орокский, осетинский (иронский), русский, татарский, удмуртский, хакасский, чувашский, чукотский, эрзянский, якутский. 🟢 По 1565 предложений в каждом. 🟢 Сделан по всем редакциям Маленького принца, которые собирали последние несколько лет + 3 новые (чукотский, карачаево-балкарский и дигорский). 🟢 Выравнивалось вручную при помощи lingtrain-aligner. Выверялось и корректировалось при помощи Fable. Посмотрели несколько редакций с носителями, одобряют. 🟢 В некоторых редакциях предложений не хватало, такие предложения были допереведены Fable на основе имеющейся лексики и помечены в отдельных колонках. Также была исправлена пунктуация на концах предложений для единообразия. Даёшь больше языковых датасетов! 👉 HF
Курс "Лингвометодические ресурсы НКРЯ в практике РКИ" на портале "Открытое образование" снова открыт для записи. Старт курса с 7 сентября.
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
🌲 20 тысяч голосов костромской деревни — в одном цифровом архиве Что получится, если соединить полевые экспедиции, фольклор, диалектологию и цифровой поиск? Получится Костромской архив этнолингвистических материалов — проект кафедры русского языка, общего языкознания и речевой коммуникации УрФУ, где собрано уже больше 20 тысяч записей о традиционной жизни крестьян XX века. Внутри — фольклорные тексты, рассказы местных жителей, этнографические описания, воспоминания о быте, обрядах, праздниках, приметах и деревенской повседневности. 🔎 Искать можно не только по слову, но и по жанру, теме и ключевым словам. Например: народная медицина, свадьба, похороны, работа, семья, запреты, приметы. Каждый текст снабжён «паспортом»: где записан, от кого, к какой теме и жанру относится. То есть это не просто архив, а настоящая поисковая система по народной памяти. И это отличный пример цифровой гуманитаристики: полевые записи не лежат мёртвым грузом в картотеках, а становятся доступными для новых исследований 🤓
Костромской архив этнолингвистических материалов
Язык через призму данных — новый проект «Системного Блока» Как проследить, менялось ли значение слова со временем? Как сравнить между собой тексты разных авторов? И зачем лингвисты считают миллионы слов вместо того, чтобы читать книги? Мы запускаем новый проект о корпусной лингвистике — направлении, которое изучает язык с помощью больших коллекций текстов. На одной странице мы собрали материалы, которые помогут разобраться, как устроены языковые корпусы, что можно узнать с их помощью и как самостоятельно анализировать тексты — даже без опыта в программировании. Вы узнаете, что такое Национальный корпус русского языка и почему им пользуются не только лингвисты, но и журналисты, учителя и литературоведы. Мы рассказали, как корпус создается, как нейросети помогают размечать слова, зачем нужны поэтические и драматургические корпусы и почему одного НКРЯ недостаточно для всех исследовательских задач. Мы собрали реальные примеры исследований: как алгоритмы определяют сюжеты в песнях — от рок-баллад до Тейлор Свифт, как на текстах корпуса stihi.ru изучать наивную поэзию, как анализ текстов помогает исследовать орфографию и даже искать животных в детской литературе. Для тех, кто хочет попробовать корпусный анализ самостоятельно, есть практические руководства. А еще — тесты, с помощью которых можно узнать что-то неожиданное о русском языке. Например, какие ругательства встречаются в НКРЯ или что значат редкие слова в произведениях Льва Толстого. Изучить проект — по ссылке. 🤖 «Системный Блокъ» @sysblok
Была сегодня в программе "Гостиная вселенной" в гостях у Олега Юрьевича Клишина. Беседовали о жизни и творческом пути В.И. Даля. В эфир запись выйдет примерно через 3 недели.
Друзья, сегодня на радио я буду участвовать в записи эфира о Владимире Ивановиче Дале, составителе "Толкового словаря живого великорусского языка".
Друзья, сегодня на радио я буду участвовать в записи эфира о Владимире Ивановиче Дале, составителе "Толкового словаря живого великорусского языка".
А сегодня, в этот пятничный летний день, привнесём в вашу жизнь немного рока🤘 🎸 Студенты ФиПЛ создали корпус текстов уральского рока В рамках проектного практикума студенты 2 курса программы «Фундаментальная и прикладная лингвистика» исследовали тексты известных групп уральского рок-клуба. ☝С помощью цифровых методов в лингвистике они выявляли устойчивые темы в песнях, строили облака слов и выполняли разметку корпуса текстов с использованием библиотек Python. В результате работы: 🔹 созданы аннотированные корпуса текстов уральских рок-групп с морфологической, семантической и метатекстовой разметкой; 🔹 методами Digital Humanities проанализированы основные темы уральской рок-музыки; 🔹 построены облака слов для каждого музыкального альбома выбранной группы. Познакомиться с корпусами можно тут