DataTalks
СтатистикаОбразовательный проект DataTalks. Рассказываем про управление данными на конференциях, митапах и марафонах. #datatalks #безграниц #безрекламы #безводы Контакты: dataoffice@rt.ru datatalks.rt.ru rutube.ru/channel/25367326/
- Последний пост
- 18 июн.
- Последнее чтение
- 06:44
- Постов за неделю
- 0
- Всего постов
- 21
- Тип
- открытый
- Язык
- русский
- Категория
- Карьера (по похожим)
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- —
- 1/48двое суток
- —
- 1/72трое суток
- —
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
⚡️Приглашаем на бизнес-завтрак T1 и TData 26 июня на встрече расскажем, как эффективно применять передовые отечественные технологии и методики управления данными для достижения стратегических целей. Своим опытом поделятся представители АО «Объединённая двигателестроительная корпорация» и ЕВРАЗ. Для всех участников подготовлено уникальное предложение пилотного проекта с использованием данных технологий, что позволит оценить целесообразность внедрения. *Количество мест ограничено. Необходима предварительная регистрация. Зарегистрироваться
без подписи
без подписи
без подписи
📝 На Хабре вышла интересная аналитика по информационной безопасности. Согласно исследованию, количество и мощность DDoS-атак растут, ставя под угрозу доступность публичных и корпоративных сервисов. ⚡️ Мы поговорили о том, что такое DDoS-атака, что означают цифры из аналитического отчета для отрасли в целом, и для Ростелекома в частности, и о том, какие угрозы информационной безопасности стоят перед Централизованным хранилищем данных (ЦХД) Ростелекома со Станиславом Поповым. DDoS-атака – эффективный, простой и дешевый способ провести атаку. Стоимость атаки начинается от 10 долларов на небольшую организацию и пользуется большим спросом. С учетом того, что ботнет сети растут, а большая часть устройств в них – это IoT-устройства с низкой защитой, цифры будут только расти – в начале года самая большая атака - 6 Тбит/с, в конце 2025 года достигала 29 Тбит/с. Это говорит о том, повышается эффективность защиты от DDoS-атак. Именно это заставляет атакующих наращивать мощности атак. Кроме этого появляются эффективные способы защиты от одних атак (например, UDP Flood) и вектор смещается на более сложные и соответственно дорогие атаки (TCP SYN Flood и TCP PSH/ACK Flood). Это постоянная эволюция щита и меча. Я бы обратил внимание, что цифры звучат внушительно –количество атак 140 628 и длительность 22 743 часов в 2025 году, но средняя продолжительность – 9,8минут. Средняя продолжительность в 2024 году – 7,3 минуты. Средняя продолжительность атаки выросла на 2,5 минуты. Атаки носят разведывательный характер – проверяют есть ли защита от DDoS-атак и длятся атаки меньше минуты. Много это или мало? Например, у одного из крупнейших маркетплейсов – средняя выручка в 2025 году составила практически 6 миллионов в минуту (выручка wildberries в 2025 году 3,1 триллиона рублей). Если маркетплейс будет недоступен из-за DDoS-атаки в течении 10 минут, покупатели пойдут заказывать товары к конкурентам – убытки составят около 60 миллионов рублей. Конечно это примерные цифры. Естественно, что маркетплейс будет вкладывать большие средства в обеспечение доступности своих сервисов. ➡️ И мы переходим к оценке критичности DDoS-атаки для команды Центра управления данными Ростелекома. Централизованное хранилище данных (ЦХД) Ростелекома – это внутренний сервис и напрямую не связан с интернетом. Опосредованно, DDoS -атаки могут повлиять на работу VPN-шлюза для пользователей, получение данных для наполнения ЦХД из внешних источников, получения обновлений. С учетом непродолжительности атак – это не очень критично. Но DDoS-атаки могут быть не только внешними, но и внутренними. Если пользователи или другие системы нагружают ЦХД неправильно настроенными запросами или большим количеством запросов, это влияет на работоспособность ЦХД. Для балансировки нагрузки на БД у нас используются Keepalived, Pgbouncer, Haproxy, которые контролируют нагрузку на сервисы с помощью мониторинга и распределяют нагрузку. Но и этого может быть недостаточно. Для контроля работы со SPILL-файлами команда ЦХД разработала систему контроля – Демократизатор. Подробнее о ней читайте в статье. Есть и другие критичные вектора атак для ЦХД – атака на цепочку поставок и выгрузка данных недобросовестным пользователем. Атака на цепочку поставок – это атака через подрядчика. Зачем атаковать напрямую, преодолевать выстроенную систему защиты, если можно взломать подрядчика, у которого намного меньше ресурсов для создания полноценной системы защиты? Этот тип атак актуален и для Ростелекома, и для ЦХД. Второй тип – это даже не атака. Пользователь может выгрузить себе на компьютер данные и потом вынести эти данные. Если большой объем данных можно заметить с помощью того же Демократизатора, то выгрузка небольших объемов в течении некоторого времени останется незаметной. Эти угрозы можно нейтрализовать с помощью дополнительных средств, таких как PAM или IDM, но кроме того, что эти системы дорогие, их необходимо эксплуатировать и реагировать на их оповещения.
⚡️️️️ Новый релиз RT.ClusterManager 2.9.0 Новая версия — это не просто технический апдейт, а шаг к более зрелому и автоматизированному управлению распределёнными СУБД и аналитическими системами. Что изменилось: 🟣при создании кластера теперь можно сразу выбрать контур: PROD, UAT, DR, DEV или TEST — меньше рисков, чётче разделение сред; 🟣появился встроенный планировщик событий для автоматизации регулярных операций; 🟣добавлен конструктор YARN Scheduler для пользователей RT.DataLake (Hadoop) — полный контроль над распределением ресурсов; 🟣полностью переработан интерфейс; 🟣обновлены Java (до 23) и Spring Boot (до 3.4), устранены уязвимости; 🟣усилены механизмы стабильности и защиты от ошибок. Отдельное внимание уделено соответствию требованиям импортозамещения: платформа продолжает поддерживать российские ОС, включая Astra Linux, RedOS и ALT Linux. Ссылка на релиз tdata.tech / RUTUBE
Возможно вы не знали, но у Ростелекома есть ДЗО TData. И ребята делают очень крутые продукты управления данными (знаем, потому что сами пользуемся этими продуктами). Сегодня мы расскажем вам про один из продуктов - RT.ClusterManager 📌 Что такое RT.ClusterManager ? RT.ClusterManager –централизованная платформа оркестрации, через единый интерфейс обеспечивающая развертывание, конфигурирование, мониторинг и обновление кластеров. Кластера для хранения и обработки данных представляют из себя сложные системы. Для управления кластерами требуются большие технические навыки. Но даже с техническими навыками ручное управление создает риски. Со временем кластеров становится больше, среды разделяются, операционная нагрузка растёт и ручное управление становится невозможным. RT.ClusterManager берёт это под контроль👌 Платформа позволяет: 🟣автоматизировать регулярные операции по управлению кластером и снижать влияние человеческого фактора, 🟣управлять несколькими кластерами из одного интерфейса, 🟣контролировать состояние и нагрузку. При этом сохраняется соответствие требованиям информационной безопасности и импортозамещения. Проще говоря, это инструмент для DBA и DevOps-команд, который делает инфраструктуру управляемой, а процессы — воспроизводимыми. ➡️ Результат — меньше операционных рисков, больше предсказуемости и устойчивости в работе с данными. Кстати, уже вышла версия RT.ClusterManager 2.9.0, скоро расскажем что в ней есть
6. Количество проектов по внедрению генеративного ИИ увеличится Да, хайп еще не остыл, многие компании из числа не самых пионеров еще не распробовали ИИ в бизнес процессах, им это еще предстоит. Причем я уверен, что не все сценарии эффективного применения еще открыты, и нас ждет еще некоторое количество интересных открытий и способов применения этих технологий в бизнесе. В Ростелекоме, кроме Нейрошлюза, существует и собственная платформа ИИ, на которой можно размещать и пробовать различные гипотезы. 7. Большинство организаций будет вести системную работу по управлению данными Не ожидал наткнуться именно такой заголовок в 2026 году. В то время, в котором казалось бы необходимость в управлении данными уже всем очевидна и доказана, но да, с одной стороны ИИ подталкивает всех начать управлять данными там, где этого еще не сделали, и с другой стороны тренд цифровизации мог до кого-то еще не докатиться. Я лично давно уверен, что системная работа с данными это основа развития ИТ и бизнес процессов в целом, а путь дата-центричности позволит развиваться компаниям гораздо быстрее конкурентов. Прямо сейчас мы разрабатываем и презентуем обновленную стратегию по управлению данными в компании и даже группе компаний, которая как раз призвана и зафиксировать все успехи и удачные идеи предыдущей стратегии, и внести важные обновления в процессы и подходы, которые в том числе будут стимулировать развитие ИИ решений на базе данных компании. 8. Заказчики будут чаще отдавать предпочтение мультиоблачной модели Мультиклауд, на мой взгляд, весьма сложен. А на российском рынке не выстроена еще системам из игроков, на которых можно складывать решения и гибко использовать одного или другого. Плюс поддержу мнение, что это серьезная инженерная задача для команд инфраструктуры: сделать такую конфигурацию прозрачной для работы приложений и для разработчиков. Тем более, что с растущей активности киберугроз многие будут стремиться уйти в более контролируемый онпремис, чем развивать сложную конфигурацию с несколькими облаками. 9. Российские компании расширят применение локальных дата-центров Как я уже говорил в предыдущем пункте – реалии в ИБ толкают компании в собственные ЦОД. Но не только это. ИИ тенденции требуют создания новых ЦОДов, с другими характеристиками по питанию и охлаждению и в принципе по организации пространства и распределению мощностей. Но строить такие ЦОДы могут далеко не все. Это очень сложная, дорогая, энергоемкая задача. Поэтому локальность будет у немногих, кто сможет – у очень крупных игроков, к которым, к счастью, группа РТК тоже относится. 10. Острая нехватка российских электронных комплектующих сохранится Мы давно не слышали о новых успехах микроэлектроники. Производство чипов очень сложная, многослойная задача, и мало кто в мире вообще смог решить задачу локализации всех слоев. Отсюда и у нас сохранится общая зависимость от мировых тенденций, например, как текущий кризис нехватки оперативной памяти. Однако мы видим уже немало российских игроков - производителей железа, которые стабильно наращивают уровень локализации в своих продуктах. Будем ждать новых прорывов! ➡️ Тренды 1–5 в первой части ——— #аналитика #экспертное_мнение
CNews опубликовал ТОП-10 ИТ-трендов в России на 2026 г., и мы обсудили их с Борисом Емельяновым – техническим директором Центра управления данными Ростелекома, и.о. Директора по управлению данными. 1. Цены на российское ПО вырастут С одной стороны – да. Факторы роста объективны: инфляция, подкрепленная налоговыми изменениями. Однако, нужно учитывать и другие факторы. Например, то, что косты российских вендоров – это в основном ФОТ. А ситуация на рынке труда для ИТ специалистов сейчас объективно сложная. К тому же в компаниях заказчиках может снижаться активность инвестпрограмм, а значит за клиента вендорам еще придется побороться. В такой ситуации, возможно, удобней будет где-то снизить маржу, а не потерять клиента. В таком случае рост цен на ПО может быть и не таким крупным, как прогнозируют. 2. Темпы импортозамещения ИТ сохранятся на текущем уровне Тоже верю в этот тезис. Некоторые компании, например, как Ростелеком, уже прошли самые сложные этапы и заместили многие ключевые компоненты своих информационных систем, что должно, замедлять общий темп. Замещение ключевых инструментов в аналитической платформе мы завершили еще несколько лет назад, и продолжаем использовать наш пакет инструментов: RT.Warehouse, RT.Datalake, RT.Widestore, RT.Data Governance, RT.Data Vision и другие. Однако, знаю не мало и таких компаний, которые долго занимали выжидательную позицию, и их ИС на иностранных решениях уже подходят к концу своего жизненного цикла, морально устаревают и требуют обновления. Вот за счет таких игроков темп вполне вероятно будет сохраняться. 3. Спрос на начинающих программистов существенно сократится Вот тут интересно. Действительно LLM и нейросети ведут нас к тому, что в простой работе джуна заменит Copilot, но откуда тогда будут браться новые миддл и синьор программисты? Очевидно, что спрос на кадры не исчезнет, но возможно преобразятся требования и ожидания к начинающим специалистам, да и к работе с LLM в целом. Вот этот навык точно всем желающим остаться в отрасли нужно в себе тренировать. У нас в Ростелекоме всем внутренним сотрудникам доступен замечательный инструмент – Нейрошлюз: дверь в мир LLM и агентских цепочек. А также активно проводится обучение по использованию ИИ и нейросетей в рабочих процессах. 4. Количество кибератак и масштабных публичных инцидентов будет расти Тревожный, но важный тренд. Сложно не согласиться с аргументами и еще сложней аргументировать важность затрат на ИБ в эпоху фокуса на эффективности. Но если представить себе возможные потери от остановки бизнес процессов или утечки пользовательских данных – все встает на места. В этом месте хочется отдельно напомнить всем коллегам, и нашим инженерам, что ИБ – это не прихоть отдельных архитекторов, а базовая необходимость во всех ИТ системах. Это же важно доносить и до заказчиков, которым иногда скорость может быть важнее внимания к рискам. 5. Бюджеты компаний на ИБ-аутсорсинг возрастут Здесь мы отлично видим, как щит не успевает за мечом. Волна популярности нейросетей и публичных сервисов накрыла компании так быстро, что многие просто не успевают адаптироваться. Конечно важно давать пользователям возможности: защищенные внутренние ресурсы для общения с LLM и использования в своих проектах с минимальными рисками. Иначе данные компании через обычных пользователей будут утекать во внешние сервисы. Отдельный пласт возможных проблем – это те риски, которые несет компания, встраивая в рабочие процессы модели (так называемое агентское использование). Многие просто не предусматривают возможных вариантов поведения такого агента, а OWASP недавно выпустил отдельный отчет о том, какие основные угрозы скрываются в таком сценарии. Аудит и защита бизнеса от потенциальных проблем ИБ в этой области действительно открывает новый рынок для ИБ профессионалов. К счастью, в Ростелекоме есть Блок информационной безопасности и РТК.ИБ,, которые помогут нам защититься от этих проблем. ➡️ Продолжение в части 2 ——— #аналитика #экспертное_мнение
Вам надоели новости про ИИ? Честно, нам тоже. Казалось бы, уже всё: новые версии моделей, генеративные котики, дипломы на ChatGPT, компании, внедрившие ИИ-агента в процесс № 234. ИИ-новости, написанные с помощью ИИ. ✨ Но мы нашли три статьи, которые вернут вам веру в ИИ. Потому что это технология, которая реально спасает людей в тех задачах, где человек уже не справляется. ➡️ Читайте: раз, два, три. ——— #Подборка_статей #Искусственный_интеллект
✏️ Коллеги из TData опубликовали 2 статьи (раз и два ) на Хабр, посвященные практическому применению LLM в инструментах DataGovernance. В статьях описывается, как внедрение решений ИИ в DataGovernance упрощает жизнь аналитикам и коллегам, отвечающим за безопасность данных. 📞 Мы поговорили про эффекты внедрения обновленного инструмента RT.DataGovernance с Артемом Трофимовым - Директором направления организации управления данными через развитие инструментов и процессов в РТК ИТ. Реализованы две важные функции ИИ, которые мы можем наблюдать в инсталляции RT.DataGovernance Ростелекома уже сейчас: 1. разметка персональных данных (ПДн) 2. описание объектов БД. Решение этих задач вручную, без инструментов ИИ, никогда бы не было сделано, потому что заняло бы в разы больше времени. Разметка ПДн в 20 раз увеличила скорость классификации данных по сравнению с ручной разметкой (при выполнении ручной проверки ресурсам в 3 ШЕ по фиксированному количеству объектов). Описание объектов БД повысила доступность и понятность данных. Это позволяет аналитикам тратить на 15-30% меньше времени на задачи изучения данных (особенно когда речь идет о "сырых" данных систем-источников). Спойлер! Скоро будет внедрено и описание атрибутов, что сильно поможет в анализе тех таблиц, где сейчас нет никакого описания. Все описанные функции доступны для любого подключенного ХД в датакаталоге DG. Поэтому будут полезны не только существующим пользователям DG, но и новым участникам. ➡️ Хотите узнать про DataGovernance в Ростелекоме больше – пишите свои вопросы в комментариях. Ну и ставьте лайки, подписывайтесь на канал:)
➡️ Статья про подготовку данных для дэшбордов. ➡️ Статья о том, как делать дэшборды, понятные всем сотрудникам компании, независимо от их уровня погружения в продукт. ➡️ Статья о важности критического мышления при анализе графиков ➡️ И самая лучшая (на наш взгляд) книга про визуализацию данных ——— #Полезная_подборка #Аналитика_данных #Визуализация_данных
💬 Хабр и сайт «Грамота.ру» подвели итоги голосования за фразу или слово 2025 года. В категории «Информационные технологии» победил «вайбкодинг». На втором месте «ИИ‑агент», на третьем — Max. При выборе "слова года" используются следующие критерии: новизна, актуальность, частота употребления, освоение в языке. Подробнее о том, как проходит исследование и какие слова победили в отраслях психологии, экономки и финансов читайте здесь. 📞 А какое слово года у вас? Делитесь в комментариях!
🟣Термодинамический способ ИИ-генерации — разработан прототип чипа для машинного обучения, который сможет потреблять в 10млн раз меньше электроэнергии 🟣Gemini 3 научили анализировать изображения как человек — приближать и отдалять изображение чтобы рассмотреть детали 🟣Adobe обновила Photoshop — улучшения в Generative Fill и новая бета-функция для работы с текстом 🟣Статья про аугментацию данных — как "испортить" картинки (повороты, шум, вырезание фрагментов, искажения), чтобы нейросеть обучалась лучше. ——— #Подборка_статей #Генерация_изображений
🟣 Ландшафт киберугроз 2025 года — масштабная аналитика от Positive Technologies. Спойлеры → рост атак на 6%, основные жертвы — госсектор (15%) и промышленность (15%), популярные методы — вредоносное ПО (71%) и социальная инженерия (51%). В России за 8 месяцев утекло 13 млрд строк персональных данных 🟣 Как сайты вычисляют мошенников — детальный технический разбор антифрод-систем 🟣 Киберпреступные форумы — интересная статья о том, как устроена информационная безопасность на "темной стороне" интернета ——— #Подборка_статей #Информационная_безопасность
Продолжаем тему Data Governance полезной ссылкой на мероприятие. Пройдет онлайн 19 февраля в 11:00 - регистрируйтесь здесь #Мероприятие #Data_Governance
🟣 Статья Авито про автоматическую проверку качества дэшбордов 🟣 Островок рассказал про интеграцию DataHub с нейросетями. Спойлер ➡️ Теперь искать владельцев таблиц и анализировать связи можно через простой диалог с ботом. 🟣 Статья о том, как и почему Лемана про переходила с проприетарного каталога данных на Open Source и что из этого получилось. Спойлер ➡️ Пошли ва-банк, выбрав вариант с собственной разработкой ——— #Подборка_статей #Data_Governance
🟣 Статья о новом законопроекте об уголовной ответственности за автоматизированную обработку персональных данных 🟣 Обзор штрафов за утечки данных в России и мире 🟣 Статья о практике работы с ПДн — судебные кейсы 2025 года 🟣 Разбор методов сбора данных онлайн-сервисами — от явных до скрытых способов: cookies, анализ поведения, интеграции с партнерами ——— #Подборка_статей #Персональные_данные
🟣Статья о том, как выбирать метрики для анализа и почему не все метрики одинаково хороши 🟣 Статья с 2 кейсами по анализу данных - глубокий анализ производственных потерь, оптимизация ассортимента и поиск «золотых» товаров, и кейс по геоаналитике 🟣Статья про важные навыки аналитика данных, содержит упражнения для прокачки «аналитической интуиции» 🟣И на закуску про инструмент для аналитики потоков данных - данных, которые меняются во времени. ——— #Подборка_статей #Аналитика_данных
RT.DataLake (решение для построение корпоративных озер данных от TData) получил сертификат ФСТЭК 4 уровня доверия. А значит его можно безопасно внедрять на значимых объектах критической информационной инфраструктуры. Поздравляем коллег с этим значимым событием. ➡️ Подробности можно прочитать здесь