Данные на стероидах
СтатистикаКоманда Дата сервисов VK Tech о практиках и подходах для извлечения максимальной пользы из работы с данными. Мы в MAX: https://max.ru/stereodata
- Последний пост
- 14 авг.
- Последнее чтение
- 14:57
- Постов за неделю
- 5
- Всего постов
- 25
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 436
- 1/48двое суток
- 499
- 1/72трое суток
- 538
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
видео или голосовое, без подписи
🧠 Память агентов на VK AI Space превращает знания сотрудников в масштабируемый актив компании. Корпоративный ИИ делает профессиональный опыт многократно используемым: при запуске продукта или внедрении системы агент фиксирует не только итоговый результат, но и контекст, принятые решения и аргументацию. Эти данные сохраняются как применимый кейс для будущих задач. О том, как она работает и в каких сценариях будет полезна, директор по ИИ-продуктам VK Tech Роман Стятюгин рассказал РБК. Читайте 👉 по ссылке. 📬 Мы в МАХ
Ассоциация больших данных объединяет ведущих участников российского рынка и занимается отраслевыми инициативами в сфере данных и ИИ — от исследований и стандартов до диалога бизнеса, государства и научного сообщества. Роман Стятюгин, директор по ИИ-продуктам VK Tech и член Стратегического комитета АБД: «Важную роль играет обмен практикой между компаниями: он помогает быстрее вырабатывать общие стандарты и подходы для реальной бизнес-среды. Экспертный совет как раз дает такую площадку — он делает накопленную экспертизу участников рынка доступной для всей отрасли». Подробнее про Ассоциацию больших данных и Экспертный совет читайте 👉 по ссылке. 🔗 Мы в MAX
🤔 Как совместимость VK Object Storage и SIEM поможет сэкономить на инфраструктуре? VK Tech и «Лаборатория Касперского» подтвердили совместимость Kaspersky Unified Monitoring and Analysis Platform (KUMA) и VK Object Storage, протестировав ее на промышленной нагрузке. Суть решения — не хранить весь объем логов внутри SIEM на дорогих быстрых SSD. Такая схема позволяет разделить данные по классам: 🔹 горячие логи для оперативной работы остаются на локальных SSD 🔹 холодные и архивные данные уходят по S3 в VK Object Storage на HDD. При этом KUMA продолжает обрабатывать, коррелировать и агрегировать события в реальном времени, а емкость холодного слоя можно наращивать горизонтально без остановки сервисов и перестройки архитектуры SIEM. Связку проверили на 3 ПБ данных, ежедневном приросте 10 ТБ и нагрузке более 6 000 RPS. В тестовой конфигурации было свыше 30 серверов и две независимые инсталляции в разных ЦОД. 🚀 По оценке VK Tech, такая схема снижает общие расходы на инфраструктуру примерно на 25% без падения скорости обработки событий. Увеличьте глубину хранения логов, не масштабируя вместе с ней дорогой SSD-слой. 📬 Мы в МАХ
📣 Приглашаем на наш первый Data Meetup с кейсами крупных компаний! 18 августа эксперты VK Tech, Авито и RWB разберут архитектурные задачи, с которыми сталкиваются инженерные команды при развитии современных платформ данных. В программе два технических доклада: 🔹 Павел Кутаков, эксперт-архитектор VK Tech, покажет, как устроена гиперконвергентная VK Data Platform на Kubernetes: управление СУБД и сервисами, отказоустойчивость, сеть, безопасность и наблюдаемость. 🔹 Дмитрий Листвин, Big Data Engineer Авито, расскажет, что делать, когда узким местом Lakehouse становится объектное хранилище. Также пройдет круглый стол с экспертами RWB и VK Tech. Разберем подготовку кастомных сегментов для таргетинга на Trino и DataFusion и обсудим, как меняется сама архитектура платформ данных — какую роль в ней играет Kubernetes и что меняют ИИ-агенты. Завершится митап пиццей и приятным нетворкингом. 📆 18 августа, сбор гостей в 17:30 📍 Москва, БЦ «Скайлайт» 💻 Офлайн и онлайн 🔜 Посмотреть программу и зарегистрироваться Мы в МАХ
От пилота к прибыли: как ИИ перестает быть экспериментом ИИ в бизнесе часто выглядит эффектно на старте, но далеко не каждый пилот доходит до продакшена. В интервью «Эксперту» Роман Стятюгин, директор по ИИ-продуктам VK Tech, объяснил, на каких этапах компании теряют результат и что важно заложить еще до запуска. 1️⃣Сначала — цель, потом — пилот Если не задать сроки, бюджет и метрики, пилот легко превращается в бесконечные доработки. Проект нужно сразу переводить из R&D в инженерную задачу с понятным бизнес-результатом. 2️⃣ Пилот и реальная эксплуатация — не одно и то же Сильный результат в тесте не гарантирует успеха в реальной эксплуатации: там появляются сырые данные, сложные сценарии и нагрузка. Нужны зрелая инфраструктура, контроль качества данных и готовность к нестандартным кейсам. 3️⃣ Модель — это не вся система Языковая модель сама по себе не автоматизирует предприятие. Решает вся обвязка: интеграции, инструменты, безопасность, наблюдаемость и доступы. 4️⃣ Безопасность — не финальный этап, а основа проекта Чем выше автономность агента, тем важнее контроль его действий. Агенту нужно предоставлять доступ только к тем системам, интеграциям и функциям, которые необходимы для конкретной задачи. 5️⃣ Экономика проекта Агент может работать эффективнее сотрудника, но обходиться дороже. Поэтому перед внедрением нужно сопоставить стоимость решения с тем, как оно влияет на скорость, качество и объем работы. 🔜 Полный текст интервью Романа читайте здесь. 📬 Мы в МАХ
📋 Как проверить данные, на которых основаны ответы и действия ИИ? Чем сильнее результаты работы модели влияют на действия бизнеса, тем важнее понимать, откуда они взялись. Несмотря на то, что больше половины руководителей используют ИИ для принятия решения, 61% отмечают растущую проблему с качеством и достоверностью данных о рабочих процессах и сотрудниках. Только 5% сообщают, что их компании предпринимают значимые меры для ее решения. Если нельзя восстановить путь от источника данных до ответа ИИ, невозможно понять, отражает он реальную закономерность или ошибку, возникшую при сборе и обработке информации. Что делать? 🔹 Отслеживать происхождение данных: фиксировать источник, время и способ сбора, охват, а также все фильтры и преобразования. 🔹 Сверять выводы: сопоставлять их с независимыми источниками, а новые данные — с историческими показателями. 🔹 Закреплять ответственность: определять владельцев данных, критерии их пригодности для конкретных задач и порядок действий при обнаружении ошибок. Бизнес может полагаться на результат работы ИИ только при сквозной проверяемости: когда можно установить, какие данные использовала система, что с ними сделала и как получила результат. Также важно проводить аудит действий агента с данными и контролировать доступы ИИ. О том, как качество данных связано с их бизнес-смыслом, читайте в статье VK Tech на Хабре 🔹 📬 Мы в МАХ
🤔 Все хотят надежную базу данных. Но что именно делает систему устойчивой? Наши эксперты объяснили, как измерить фактическую надежность своей системы, какие угрозы чаще всего приводят к потере данных и почему тестовое восстановление важнее самого факта наличия бэкапа. 🔏Защита базы данных строится в несколько слоев: 🔹 RPO и RTO определяют, сколько данных можно потерять и как долго сервис может быть недоступен. От них зависят частота бэкапов, тип репликации и сценарий восстановления. 🔹 Бэкапы и PITR позволяют восстановить PostgreSQL на нужный момент, например за секунду до ошибочного DROP TABLE. 🔹 Репликация и автоматический failover сокращают простой при отказе сервера. Синхронная репликация защищает подтвержденные транзакции, а размещение реплики в другой зоне — от аварии целого ЦОД. 🔹 Внешняя неизменяемая копия сохраняет данные, даже если основная инфраструктура скомпрометирована. 🔹 Тестовое восстановление показывает, пригоден ли бэкап и укладывается ли команда в заданный RTO. Без такой проверки наличие копии ничего не гарантирует. 👉 Подробный разбор каждого уровня, сравнение self-hosted PostgreSQL с DBaaS VK Cloud и чек-лист для проверки безопасности своих баз данных смотрите по ссылке. 📬 Мы в МАХ
🤖 ИИ-агенты научились пользоваться базами данных не хуже людей До сих пор базы данных проектировали прежде всего для аналитиков и инженеров. Но что, если доступ к базам получат ИИ-агенты — причем не как интерфейсы для text-to-SQL, а как самостоятельные пользователи платформы? Хорошие новости: это уже выяснили. Исследователи из C3 AI представили систему для работы с базами данных Data Intelligence Agents. Она состоит из трех агентов — Data Interpreter, Schema Creator и Query Generator. Модуль протестировали на 4 187 заданиях на четырех диалектах SQL — в семи бенчмарках он сравнялся с лучшими опубликованными решениями или превзошел их. Какие проблемы остались Большинство ошибок, которые допустила модель, были смысловыми. SQL выполнялся, но агент мог неправильно выбрать связь между таблицами, фильтр или способ расчета показателя. Технически корректный запрос не всегда давал правильный ответ. Что это значит для бизнеса? Если подобные решения получат распространение, проектировать дата-платформы придется так, чтобы они были удобными для агентов, то есть добавлять: ✅ машиночитаемые схемы и каталог данных ✅ определения метрик и бизнес-правил ✅ явно заданные ключи, связи и ограничения ✅ доступ к безопасному выполнению пробных запросов ✅ проверки качества, логи и возможность восстановить ход работы. 🗂 Важная деталь: дата-каталог теперь нужен не просто для галочки. Без него корпоративных AI-агентов будет невозможно масштабировать, так как это основа семантического слоя. Как выстроить слой данных, на который смогут опираться и модели, и AI-агенты, разобрали в статье VK Tech о роли дата-платформ в развитии ИИ. 📬 Мы в МАХ
🤓 Воркшоп 6 августа: разворачиваем локальную LLM и подключаем агента на OpenClaw За 90 минут онлайн-кодинга развернем языковую модель на облачной GPU и настроим агента, который будет работать с вашими документами внутри периметра. Что нужно для создания LLM на воркшопе: 🔹аккаунт VK Cloud с Cloud GPU, 🔹 SSH-клиент, 🔹 базовый Linux. 🔐 Актуально для команд, у которых внешние API закрыты политикой ИБ или документы под NDA нельзя загружать в сторонние сервисы. ✍️ Будет полезно ML/MLOps-инженерам, дата-инженерам, ИБ-командам, платформенным командам, техлидам и всем, кто хочет создать свою LLM. Когда: 6 августа, 16:00 Зарегистрироваться → 🔗 Мы в MAX
Все правила доступа к бакету — в одном JSON-документе В VK Object Storage появилась поддержка Bucket Policy. Теперь права на работу с данными можно описать одной политикой, привязанной к бакету. Каждое правило определяет: 🌟кому выдать доступ — конкретному пользователю или роли 🌟что разрешить или запретить — просмотр, загрузку, удаление объектов или получение их списка 🌟к каким данным применить правило — ко всему бакету, отдельной папке или файлу 🌟при каких условиях оно действует, например только при подключении с определенного IP-адреса. Так, разработчикам можно разрешить загружать файлы только в папку dev/, приложению — читать данные из prod/, а удаление объектов запретить для всех пользователей. При этом обе команды продолжат работать с одним бакетом, но каждая — только со своей частью данных. В JSON-политике этим действиям соответствуют операции GetObject, PutObject, ListBucket и DeleteObject. Правила можно применять ко всему бакету, отдельному объекту или префиксу — части пути, которая в объектном хранилище выполняет роль папки. Bucket Policy заменяет множество отдельных настроек доступа. А поскольку VK Object Storage поддерживает модель AWS S3, при миграции существующие политики можно перенести без переработки их логики. Добавить политику к бакету можно через консоль VK Cloud или S3-совместимый API. 👉Узнайте больше по ссылке. 📬 Мы в МАХ
видео или голосовое, без подписи
🔥 VK AI Space представил многоуровневую память для AI-агентов. Она позволяет агентам запоминать прошлые задачи, проекты и диалоги с пользователями и переиспользовать эту информацию. ❔ Как это работает? Многоуровневая память включает четыре настраиваемых слоя: 🔹 Сессионная память сохраняет диалог и текущие задачи 🔹 Пользовательская — запоминает профиль и предпочтения сотрудника 🔹 Проектная — накапливает материалы, правила и решения в рамках проектов 🔹 Память самого агента — опыт конкретного агента. Он запоминает, какие подходы сработали, какие правки вносил сотрудник, и со временем все точнее справляется с задачей 🚀 Что это дает бизнесу? Такая память AI-агента ускоряет подготовку сложных ответов. Например, при работе над тендером или отчетом по проекту агент формирует ответы из базы знаний, сотрудник дорабатывает их и фиксирует в памяти проекта. Для следующей задачи не нужно будет собирать контекст в разных диалогах — агент сам вспомнит похожий случай из проектной памяти. По данным VK Tech, это сокращает долю повторно решаемых задач на 40–50%, в зависимости от зрелости процессов. 🛡 Это безопасно? Да. Многоуровневая память не открывает доступ к новой информации, агент видит только те данные, которые доступны сотруднику в соответствии с его ролью. Любой сотрудник может проверить, что помнит о нем агент, и удалить лишнее. Все данные остаются в корпоративном контуре компании. Подробности — по ссылке. 🔗 Мы в MAX
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
Чтобы ИИ приносил компании пользу, важно не просто открыть команде доступ к агентам, а собрать их в единую систему: с общими правилами, централизованным управлением и контролем над данными. Сделать это можно на VK AI Space — платформе для разработки и запуска ИИ-агентов, мультиагентных систем и цифровых сотрудников в защищенном контуре компании. На VK Cloud Conf 2026 Роман Стятюгин, директор по ИИ-продуктам VK Tech, подробно рассказал, как она устроена, а также представил новую функцию — поддержку мультиагентных систем. Подробности — в карточках. ➡️ А чтобы запустить и протестировать своего агента, отправьте заявку. 🔗 Мы в MAX
Как восстановить данные, если ошибка случилась между бэкапами 💾 Полный бэкап фиксирует состояние базы только в момент создания копии. Если он сделан в 00:00, а в 15:00 администратор случайно удалил документ, откат вернет нужный элемент — и заодно сотрет все операции за 15 часов. В базах данных PostgreSQL в VK Cloud поддерживается инструмент PITR (Point-in-Time Recovery). Он позволяет откатиться к выбранной дате и времени, даже если готовой копии за этот период нет. Вот конкретный пример: ➡️00:00 — система создала полный бэкап ➡️в течение дня все изменения сохранялись в WAL (Write-Ahead Logging) ➡️15:00 — администратор удалил документ ➡️пользователь выбрал восстановление на 14:59:59 ➡️VK Cloud создал новую базу со всеми изменениями до этого момента. 📌Важно учитывать дату создания полной резервной копии: PITR восстанавливает базу от последнего полного бэкапа и затем последовательно применяет изменения из WAL до нужного момента. Полные копии хранятся в S3, поэтому их объем не ограничен локальными дисками базы. Как настроить восстановление? Чтобы восстановить базу с помощью PITR, перейдите в раздел Cloud Backup → Резервное копирование → Point-in-time recovery. Выберите расписание, нажмите «Восстановить», укажите дату и время — сервис создаст новую базу в нужном состоянии. Посмотреть техническую документацию можно здесь, а больше рекомендаций по настройке резервного копирования найдете 👉 по ссылке. 🔜Мы в МАХ