tgindex
Национальный цифровой архив

Национальный цифровой архив

Статистика

Всё о цифровой архивации, спасении digital-born контента, архивации гибнущих сайтов и иных цифровых объектов. Сайт: https://ruarxive.org/ Чат @ruarxivechat Проект Информационной культуры @infoculture Контакт @ibegtin Иван Бегтин

Последний пост
8 авг.
Последнее чтение
12:56
Постов за неделю
0
Всего постов
30
Тип
открытый
Язык
русский
Категория
Новости и СМИ (по похожим)
В каталоге с
12 авг.
Подписчики
2 381
0 за 4 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
1 581
30 постов
Вовлечённость
66,4%
к подписчикам
Постов в день
0,0
всего 30
Упоминаний
3
каналов
Охват размещения
оценка
1/24сутки в ленте
307
1/48двое суток
351
1/72трое суток
379

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 8 авг.347109из begtin

    Для тех кому интересна веб архивация, свежий релиз моего хобби инструмента metawarc для глубокого анализа WARC архивов используемых в Интернет Архиве и многочисленных национальных и частных веб-архивных инициативах. Инструмент позволяет индексировать веб-архивы для глубокого анализа и задач data science, а также извлекать метаданные из документов, изображений, видеофайлов и иных имеющих метаданные внутри файлов. В версию 2.0 добавлена возможность проигрывать веб-архивы через библиотеку pywb и исправлены многие ошибки. Инструмент может быть полезен для всех кто интересуется цифровым сохранением и OSINT, поскольку эти метаданные полезны при анализе слепков веб-сайтов. Внутри работа с данными идет с использованием DuckDB с хранением метаданных в файлах Parquet. DuckDB выступает как универсальный инструмент запросов для аналитических задач, дедубликации и тд. #opensourc #webarchives #digitalpreservation

  • 28 мая716119

    Я все забываю написать что у меня "висит" давняя задача по сбору метаданных из НЭБа (Национальная электронная библиотека) rusneb.ru Там, с одной стороны, почти 5.5 миллионов материалов, а с другой стороны нет открытого API или массовой выгрузки (bulk download), а для многих гуманитарных/окологуманитарных проектов нужны метаданные оттуда. Как вы понимаете написать сейчас парсер с помощью ИИ несложно, сложно и требует времени на то чтобы собрать все имеющиеся там метаданные в сохранить их. Поэтому нужен не просто парсер НЭБа, а кто-то кто с его помощью сможет все метаданные по всем публикациям собрать и сохранить в сжатый/сжатые JSON lines файлы и передать их. Хорошо если есть волонтер под такое, а если кто-то готов, но за деньги, то напишите мне о том сколько денег и сколько времени нужно - если ценник не безумный я их найду. Что необходимо собрать: все метаданные с карточки описания каждой публикации включая автора, название, описание, дату и место публикации, тематики, каждый атрибут блока "Детальная информация", запись MARC21, ссылку на PDF файл. Сами файлы выкачивать не нужно! Систематизировать атрибуты метаданных и сделать также файл Parquet с ними будет большим плюсом. Итоговый датасет будет открытым, выложу его на одном из порталов открытых данных. #opencall #datasets

  • В рубрике закрытых данных в РФ из открытого доступа исчезли данные судебной статистики с сайта Судебного департамента. По ссылке теперь сообщение Информация временно не доступна. Доступна страница в Интернет-архиве с последней копией 7 марта 2026 года и пока еще работают прямые ссылки на Excel файлы. Но, возможно, ненадолго. Это данные небольшого объема, но значимые для исследователей правоохранительной системы России и журналистов. #opendata #closeddata #russia #courts

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • В рубрике как это устроено у них в Ирландии позавчера национальный архив опубликовал данные переписи 1926 года и эти данные можно посмотреть наглядно на карте или в виде огромного архива 2 972 451 поименных записей (чуть менее 3 миллионов файлов и переписных карточек) Как повезло ирландцам, столько исторических материалов. Есть же страны с работающими архивами и статслужбами. Для полного счастья нехватает только получения этих данных как датасета, но его несложно создать. #opendata #ireland #census

  • 16 апр.2 4511624

    Ведомости пишут что Более 50% библиотечных фондов может быть изъято при буквальной трактовке законов из за закона об иноагентах и из-за признания многих организаций как нежелательных. Пора ли начинать архивировать такую литературу или исходим из того что она не исчезает, а только недоступна в России? Но в других странах, не-российских онлайн библиотеках и в пиратских библиотеках эта литература останется? Практически все эти книги находятся под авторским правом и их распространение почти наверняка нарушит копирайты и многие архивные проекты будут не готовы хранить такие материалы именно по причине нарушения авторского права и рисков блокировки в России. #questions #digitalpreservation

  • 2 апр.2 28778

    видео или голосовое, без подписи

  • 2 апр.887484

    Несмотря последние блокировки Telegram в России этот телеграм канал Ruarxive остается и никуда не исчезнет, на других российских ресурсах вроде VK или MAX его клона не будет в виду непредсказуемости их цензурных правил даже при нейтральности ведения архивных проектов, риски цензуры в их отношении всегда присутствуют. Также все заархивированные сайты организаций и проектов заблокированных в РФ сохраняются и ух удаление не планируется, если какое-либо давление на проект возникнет, то архивные копии сайтов останутся, в любом случае, на ресурсах Интернет Архива (archive.org). Для тех же кому будет сложно читать далее материалы в телеграм думаем над тем как сделать альтернативную площадку для сообщества. Как варианты: - рассылка на substack и обсуждения в комментариях - онлайн форум Если будут другие идеи и мысли, пишите в чате @ruarxivechat Следующей публикацией сделаю опрос по тому где развернуть альтернативную площадку для телеграм канала. #telegram #digitalpreservation #archival

  • Хронология удаления администрацией Дональда Трампа данных из открытого доступа опубликовано в журнале Passport Общества историков Американских внешних отношений (SHAFR) Подозреваю что список будет больше, здесь лишь часть систематизации. Единственные исключения там это приказы о раскрытии данных об убийстве Кеннеди и раскрытие данных о Джеффри Эпштейне. И, кстати, как я и предполагал США официально вышли из Open Government Partnership (OGP). Это не означает закрытие проектов по открытости внутри США, они всегда были отвязаны от международных обязательств, кроме малого числа случаев. Это означает, в первую очередь, прекращение финансирования OGP со стороны США и потенциальный кризис организации если страны ЕС и др. не компенсируют выпадающие средства. #opendata #closedata #trump #usa

  • 30 мар.4 1712078

    Для тех кто интересуется где можно найти материалы многих, в том числе закрытых, Wiki проектов в мире. Команда Wikiteam из ArchiveTeam регулярно архивирует вики сайты и результаты их архивации доступны в одноименной коллекции Wikiteam и Интернет Архиве. Контент сохраняется в форматах XML и в виде архивов с изображениями. Для тех кто хотел бы архивировать сайты на базе MediaWiki самостоятельно, существует открытый код инструмента wikiteam3. Учитывая что контент вики сайтов публикуется в виде дампов в XML пригодных для машинной обработки, можно сказать что эта коллекция в Интернет Архиве не только каталог архивов, но и каталог открытых данных. Важно что многие исчезнувшие русскоязычные вики проекты и те что могут исчезнуть в очень скором времени могут быть найдены именно там. #opendata #digitalpreservation #wiki #archiveorg

  • 24 февр.1 2792828

    Пишут что Microsoft продвинулись в Project Silica с сохранением данных в стекле и обещают что потенциально это может позволить сохранять данные до 10 тысяч лет. На кусок стекла 12x12x0.2 сантиметра записали 4.8TB данных. Запись идет долго, около 150 часов. Про то когда это будет доступно для кого-то кроме исследователей Microsoft пока нет новостей. #storage #digitalpreservation

  • 5 февр.1 6051640из blognot

    ЦРУ закрыло The World Factbook — справочник по странам мира, который существовал с 1971 года и был одним из самых полезных публичных ресурсов агентства. Никаких объяснений не последовало. Решение выглядит странно не только по сути, но и по исполнению. Все страницы сайта, включая архивы предыдущих версий, теперь перенаправляют на страницу с объявлением о закрытии. При этом Factbook всегда распространялся как public domain — ничто не мешало оставить архивную версию с пометкой о прекращении обновлений. Саймон Уиллисон скачал последний официальный архив за 2020 год и выложил его на GitHub Pages. Полные архивы также сохранились в Internet Archive. https://simonwillison.net/2026/Feb/5/the-world-factbook/#atom-everything

  • 20 янв.5 48016109

    Где узнать больше о цифровых архивах, цифровой архивации, инструментах, курсах и так далее? Подборка каталогов ресурсов: - Awesome Digital Preservation - список инструментов и ресурсов посвященных цифровой архивации, преимущественно ссылки на открытый код и открытые сервисы и наиболее известные платформы (от Ruarxive) - Awesome Digital Preservation аналогичный список от Digipress сообщества по цифровой архивации, множество ссылок на существующие инструменты и сервисы - Awesome Web Archiving - список инструментов и ресурсов по веб-архивации, созданы и поддерживается Международным консорциумом сохранения интернета (IIPC) - ArchiveTeam Wiki большой вики проект от команды ArchiveTeam посвященный веб архивации и архивационным кампаниям для сохранения гибнущих онлайн ресурсов. - База знания Ruarxive база знаний по цифровой и веб архивации на русском языке от проекта Ruarxive, инструкции по использованию инструментов и сервисов #webarchives #digitalpreservation #readings

  • 22 дек.1 6154549из piratepartyru

    Anna’s Archive решила создать резервную копию Spotify 🎵Проектом заархивированы метаданные и музыкальные файлы платформы Spotify. Архив занимает ~300 ТБ, распространяется через торренты и включает около 86 миллионов музыкальных файлов Это первый подобный открытый «архив сохранения» музыки такого масштаба, доступный для зеркалирования и резервирования любым пользователем с достаточным дисковым пространством. https://annas-archive.li/blog/backing-up-spotify.html 🏴‍☠️ Anna’s Archive - некоммерческая метапоисковая система для теневых библиотек с открытым исходным кодом, созданная командой анонимных архивистов Pirate Library Mirror и запущенная как прямой ответ на усилия правоохранительных органов по закрытию Z-Library в 2022 году. Проект ставит себе целью «каталогизацию всех существующих книг и отслеживание прогресса человечества на пути к тому, чтобы сделать все эти книги легкодоступными в цифровой форме». В статье «Критическое окно теневых библиотек» они объяснили , что делают это потому, что текст обладает самой высокой плотностью информации. Но их миссия (сохранение знаний и культуры человечества) не делает различий между типами носителей. Иногда появляется возможность работать вне текстовой среды. Копирование Spotify - это именно такой случай.

  • 15 дек.1 1402014из begtin

    К вопросу про российский мессенжер Max, помимо достаточно очевидных проблем с тем что он "как бы государственный, но не государственный", с его довольно бесцеремонным продвижением используя административный ресурс и массой других уже написанных многими проблем, я подниму ещё одну тему о которой не пишут. Это архивация. В сравнении с телеграмом у Max'а есть два очень существенных отличия: 1. Отсутствует возможность просматривать содержание каналов онлайн без авторизации 2. Отсутствует возможность делать data takeout хотя бы для своих данных, а в идеале и для любых каналов и чатов Первое влияет на то что содержание из Max не индексируется поисковиками и Интернет Архивом (они собирают только общедоступные матералы доступные через https/http). К примеру, в телеграм можно смотреть без авторизации, вот так выглядит там мой телеграм канал https://t.me/s/begtin Второе на то что невозможно сделать архив ни своих чатов, ни своих каналов, ни читаемых каналов. Просто не предусмотрено. В итоге Max - это закрытое контролируемое не архивируемое пространство где даже чтение постов прошедших авторизацию каналов идет только под контролем (только после авторизации) даже в веб клиенте. Вопрос остается в том будет ли там хоть что-то полезное, не продублированное в Телеграм'е? Насколько реально велик риск блокировки телеграма в ближайшее время и переход части авторов каналов туда? Если велик, то видимо надо заморачиваться придумыванием организации архивации материалов в Max'е для чего документированного API не наблюдается и нужен дотошный разработчик готовый такой инструмент разработать. #digitalpreservation #thoughts

  • 15 дек.2 5321467

    Большое обновление сайта Ruarxive.org. Добавили много новых статей, лучше структурировали сам сайт, добавили поиск, обновили до последней версии Docusaurus'а (движка на котором сайт построен). В том числе можно обратить внимание на статьи: - Быстрый старт: архивация за 5 минут - Как создать цифровой архив сайтов - Экстренная архивация: когда счет идет на часы - Курс по цифровой архивации И многие другие, включая статьи по использованию конкретных инструментов и обзоры наиболее известных сервисов. Новое содержимое сайта собрано из публикаций в телеграм канале @ruarxive, других публикаций об исчезновении интернет-ресурсов, презентаций курса по цифровой архивации и других материалов. Среди других изменений: - обновлена главная страница для большей понятности содержания сайта - добавлен поиск по контенту Да, структура сайта ещё не идеальна, а поскольку многие статьи преобразованы из презентаций, то там больше буллетов чем текста, и они ещё будут обновляться. Если у Вы найдете какие-либо ошибки, если возникли идеи или если Вы готовы дополнить и расшрить материалы, пишите в @ruarxivechat и в issues на github P.S. Сейчас в работе систематизация всех собранных ранее сайтов и других результатов архивных кампаний. Все это будет собрано в единый набор данных с базой архивов и далее доступно или через специальный интерфейс или на hubofdata.ru (там уже есть раздел с архивами сайтов и другими архивами). #digitalpreservation #webarchives #knowledgebase

  • 11 нояб.1 093146из infoculture

    Объявлен приём заявок на Премию «Открытый доступ к данным в гуманитарных науках» АНО «Инфокультура» приглашает студентов, аспирантов, преподавателей, исследователей и сотрудников вузов и научных организаций принять участие в конкурсе проектов, способствующих развитию открытой науки в гуманитарной сфере. 📌 Что можно подать: – результаты научных исследований, – цифровые проекты, связанные с гуманитарными дисциплинами, – дипломные и курсовые проекты, – иные работы, представляющие гуманитарные данные в открытом доступе. 📚 Номинации Премии: • История • Филология • Культура • Искусство • Иные гуманитарные науки Номинировать проект может как сам автор (или коллектив авторов), так и любой человек или организация, знакомые с проектом. Год публикации работы не имеет значения. 🏅 Лауреаты получат памятные награды, сертификаты и специальные призы от организаторов и партнёров Премии. 📝 Приём заявок уже открыт! 🔗 https://humawards.ru #opendata #openaccess #humanitarian #contest

  • видео или голосовое, без подписи

  • 1 нояб.1 088115из begtin

    Кстати, как человек любящий не только цифровые архивы, но и исторические книжки тоже не могу не упомянуть про очень интересный проект от Банка России с виртуальной выставкой по истории Банка. Мало какие центральные банки в мире делают такие проекты, так что это хорошо что такое появляется (если знаете аналогичные проекты в других странах, то напишите плз). Я знаю только Federal Reserve History в США. Но интересность материалов и их доступность омрачает то что материалы есть, а можно ли их использовать? В основном нет. Вот самые очевидные проблемы: 1. Нет нигде явным образом указанных условий использования материалов. Можно ли использовать их на своём сайте? Можно ли на их основе писать учебные материалы? Можно ли цитировать и тд. Понятно что у разных материалов может быть разный статус, но не надо забывать насколько это важно можно ли использовать такие материалы. 2. Просмотр материалов только на сайте - это никуда не годится. Возможность скачать исторические книжки нужна для бесконечного числа задач: внутренних библиотек университетов, таких проектов как Цифровой архив госфинансов и госуправления, возможность почитать книги оффлайн, возможность обучить на них ИИ, возможность создать наборы данных и многое другое. Если делать хорошо, то делать до конца, не надо останавливаться на полпути. #digitalpreservation #books #finances #digitalhumanities #openaccess

Национальный цифровой архив — tgindex