DevOps Portal | Linux
описание
Присоединяйтесь к нашему каналу и погрузитесь в мир DevOps Сотрудничество, реклама: @devmangx Менеджер: @Spiral_Yuri РКН: https://clck.ru/3P8kFH
13 082
подписчиков
Охват к подписчикам
15,4%
ERR
Реакции к просмотрам
0,36%
240 на 27 постов
Пересылки к просмотрам
2,06%
1 368
Постов в день
0,6
всего 26
Где отзываются чаще
доля реакций к просмотрам- 11 апр. 2025 г.без подписи1,06%
- 31 июл.🍻 Сегодня отмечается день системного администратора 🍻 Ежегодно в последнюю пятницу июля мир отмечает праздник людей, благодаря которым компьютеры работают, сети не падают, а проблемы решаются до того, как мы о них узнаем. В 2026 году этот день выпал на 31 июля. Поздравляем всех сисадминов с праздником! @linuxos_tg0,81%
- 10 авг.20 Kubernetes-челленджей Итак, вот 20 вопросов (и ответов): 1. Подсчёт endpoints 2. Ждём чуда 3. Я сказал стоп 4. Проектирование shared-кластеров 5. Kernel panic 6. Прыгай, кролик 7. Сколько — это слишком много 8. Держим свет включённым 9. Прожорливый etcd 10. Умножение pod’ов 11. В одиночку 12. Rollin’ 13. All you can eat 14. Bounce 15. В кроличью нору 16. Throttled 17. Липкий бардак 18. Жив или мёртв 19. Связанный по рукам 20. Один, чтобы связать их всех Вы можете использовать эти задания, чтобы прокачать свои знания, как (очень сложные) вопросы на собеседованиях или чтобы подготовиться к интервью 👉 DevOps Portal0,51%
- 11 авг.KubePlumber проверяет работу сети Kubernetes изнутри кластера, тестируя: * внутренний DNS, * трафик между подами, * внешний DNS, * пропускную способность между нодами. ➤ https://github.com/David-VTUK/KubePlumber 👉 DevOps Portal0,50%
- 31 мая 2025 г.без подписи0,50%
- 7 авг.Gang Scheduling в Kubernetes Это одна из ключевых концепций в MLOps Фреймворки для deep learning (TensorFlow, PyTorch и т. д.) требуют, чтобы во время обучения были запущены все воркеры. Допустим, training job требует 8 воркеров, каждый из которых запрашивает по 1 GPU. В Kubernetes-кластере свободно только 5 GPU. Без gang scheduling стандартный scheduler обрабатывает каждый Pod независимо. В результате 5 worker Pod'ов будут запланированы, а ещё 3 останутся в статусе Pending. При этом 5 запущенных воркеров фактически не смогут начать обучение. GPU будут заняты, пока система ждёт оставшиеся воркеры. При использовании gang scheduling scheduler сначала проверяет, достаточно ли ресурсов для запуска всего training job. Если ресурсов хватает, все worker Pod'ы планируются одновременно. Если нет — не планируется ни один Pod. Пять свободных GPU остаются доступными для других job'ов. Это можно назвать подходом – «всё или ничего». В первую очередь gang scheduling позволяет избежать неэффективного использования GPU из-за частично запланированных распределённых workload'ов. Kubeflow Trainer поддерживает gang scheduling из коробки через podGroupPolicy. Он работает с установленными в кластере плагинами для gang scheduling, например Coscheduling. 👉 DevOps Portal0,48%
- 4 нояб. 2024 г.без подписи0,45%
- 6 авг.Kubernetes Job и JobSet: в чём разница Разбираемся Job/CronJob запускает одну конкретную batch-нагрузку. Например: ETL-задачу, резервное копирование, генерацию отчётов и т. д. JobSet, в свою очередь, запускает несколько скоординированных Job как единую распределённую нагрузку. Каждая Job в наборе может иметь собственный шаблон Pod и связанные с ним настройки, но весь набор при этом работает как единое целое. Под капотом JobSet запускает дочерние Job в индексированном режиме. Это означает, что каждый Pod получает стабильный индекс и hostname, например worker-0, worker-1 и т. д. Кроме того, JobSet создаёт headless-сервис, через который Pod могут обнаруживать друг друга. Основной сценарий использования JobSet — нагрузки AI/ML и HPC. Например, в Kubeflow Trainer JobSet используется для запуска распределённого обучения моделей. 👉 DevOps Portal0,45%
- 8 авг.KEDA GPU Scaler — это внешний scaler для KEDA, который получает метрики NVIDIA GPU через NVML и автоматически масштабирует vLLM, Triton, training jobs и кастомные inference-нагрузки без необходимости использовать Prometheus. https://github.com/pmady/keda-gpu-scaler 👉 DevOps Portal0,42%
- 7 авг.Xata — Kubernetes-native платформа для Postgres, предназначенная для запуска большого количества баз данных. Поддерживает copy-on-write ветвление, scale-to-zero, автоскейлинг, высокую доступность (HA), бэкапы, REST API, CLI и RBAC. https://github.com/xataio/xata 👉 DevOps Portal0,41%
- 12 авг.Как обученная AI-модель превращается в production API в Kubernetes? KServe — это проект CNCF на стадии Incubating для развёртывания и обслуживания AI-моделей в Kubernetes. Проще говоря, KServe берёт обученную модель и превращает её в масштабируемый inference-сервис в Kubernetes. Он берёт на себя деплой, сеть, автоскейлинг и health checks модели. Важно понимать, что KServe уже давно работает не только с классическими ML-моделями. Как inference-платформа, он поддерживает две категории AI/ML-нагрузок: - Predictive AI (классический ML): например, модели на scikit-learn, XGBoost, модели, упакованные через MLflow, и другие. - Generative AI (LLM): например, запуск и обслуживание LLM через backend vLLM с поддержкой GPU. Если хотите разобраться, как устроена inference-платформа KServe, можно прочитать свежий выпуск MLOps-рассылки. В нём разбираются: - Model Servers и runtimes в KServe - Как KServe разворачивает AI-модели в Kubernetes - Деплой MLflow-модели в KServe на практике - Как выкатывать новые версии моделей - Rolling Updates, Canary, A/B Testing и Shadow Deployments И многое другое. Читать здесь: https://newsletter.devopscube.com/p/kserve 👉 DevOps Portal0,37%
- 24 окт. 2024 г.без подписи0,34%