Машинное обучение в облаке

Специальность / Speciality: 6-05-0533-07 Математика и компьютерные науки / Mathematics and computer science

Профилизация / Profiling: Веб-программирование и интернет-технологии / Web Development and Internet Technologies  /   / 

Учебная дисциплина, модуль / Academic discipline, module: Машинное обучение в облаке, модуль «???» / , module «???»

 

Краткое содержание учебной дисциплины, модуля / Brief summary

Основы облачного ML и работа с данными. Введение в концепцию облачного машинного обучения и обзор архитектуры ведущих облачных платформ. Изучение специфики хранения данных в облаке: масштабируемые объектные хранилища (S3), форматы данных для эффективного анализа. Реализация пайплайнов обработки данных (ETL/ELT) в облачной инфраструктуре и применение систем централизованного хранения признаков (Feature Store).

Разработка и масштабирование моделей. Организация облачных сред разработки и проведение экспериментов. Обучение классических моделей машинного обучения и глубоких нейронных сетей с использованием облачных графических процессоров (GPU). Принципы и методы распределенного обучения на больших массивах данных. Внедрение инструментов автоматического отслеживания, логирования и сравнения результатов экспериментов.

Версионирование и DevOps для ML. Применение практик управления версиями данных и конфигураций моделей с помощью специализированных инструментов (DVC). Подготовка моделей к промышленной эксплуатации и организация эффективного деплоя (Model Serving). Использование контейнеризации (Docker) для изоляции зависимостей ML-компонентов. Изучение принципов оркестрации и развертывания контейнеризированных моделей в кластерах Kubernetes.

Production ML, MLOps. Развертывание полноценных автоматизированных конвейеров непрерывной интеграции и доставки для машинного обучения (CI/CD pipelines для ML). Непрерывный мониторинг качества работы моделей, деградации метрик и концептуального дрифта данных в production. Применение low-code решений и инструментов автоматического машинного обучения (AutoML) для ускорения разработки. Рассмотрение вопросов безопасности, этики и правовых аспектов использования искусственного интеллекта в облачной среде.

Fundamentals of Cloud ML and Data Management. Introduction to the concept of cloud machine learning and an overview of the architecture of leading cloud platforms. Studying the specifics of data storage in the cloud: scalable object storage (S3), data formats for efficient analysis. Implementation of data processing pipelines (ETL/ELT) in cloud infrastructure and the application of centralized feature stores.

Model Development and Scaling. Organization of cloud development environments and conducting experiments. Training classic machine learning models and deep neural networks using cloud graphics processing units (GPUs). Principles and methods of distributed training on large datasets. Implementation of tools for automatic tracking, logging, and comparing experiment results. 

Versioning and DevOps for ML. Applying data version control and model configuration management practices using specialized tools (DVC). Preparing models for production environment and organizing efficient model serving. Utilization of containerization (Docker) to isolate dependencies of ML components. Studying the principles of orchestration and deployment of containerized models in Kubernetes clusters.

Production ML, MLOps. Deployment of full-scale automated continuous integration and continuous delivery pipelines for machine learning (CI/CD pipelines for ML). Continuous monitoring of model performance, metric degradation, and conceptual data drift in production. Application of low-code solutions and automated machine learning (AutoML) tools to accelerate development. Consideration of security, ethics, and legal aspects of using artificial intelligence in a cloud environment.

Формируемые компетенции / The formed competences

Специализированная компетенция:

Понимание ключевых аспектов жизненного цикла моделей машинного обучения в облачной инфраструктуре, архитектуры платформ и методологии MLOps. Проектирование и реализация масштабируемых пайплайнов обработки данных, Feature Store и распределенного обучения моделей (включая использование GPU). Настройка процессов версионирования данных и артефактов (DVC), контейнеризации (Docker) и оркестрации (Kubernetes) для промышленного развертывания (Model Serving).

Построение автоматизированных конвейеров CI/CD для ML, непрерывный мониторинг моделей в production на предмет дрифта данных, а также применение инструментов AutoML с учетом требований безопасности и этики ИИ.

Specialized competence:

Understanding the key aspects of the machine learning model lifecycle in cloud infrastructure, platform architecture, and MLOps methodology. Designing and implementing scalable data processing pipelines, feature stores, and distributed model training (including GPU utilization). Configuring data and artifact versioning (DVC), containerization (Docker), and orchestration (Kubernetes) for industrial model serving. Building automated CI/CD pipelines for ML, continuous monitoring of models in production for data drift, and applying AutoML tools while considering AI security and ethical requirements.

Результаты обучения (знать, уметь, владеть) / Learning outcomes (know, can, be able)

В результате освоения учебной дисциплины студент должен знать:

– Ключевые концепции и архитектуру платформ облачного машинного обучения (Cloud ML)

– Специфику хранения, форматы данных в облаке и принципы работы Feature Store

– Методы и паттерны распределенного обучения классических моделей и глубоких нейронных сетей (GPU)

– Способы и инструменты автоматического отслеживания и логирования экспериментов (MLflow)

– Принципы версионирования данных, кода и артефактов моделей (DVC)

– Методы контейнеризации и деплоя ML-моделей в промышленную среду (Docker, Model Serving)

– Концепции оркестрации контейнеров для задач машинного обучения в кластерах Kubernetes

– Архитектуру и компоненты сквозных MLOps-конвейеров (CI/CD pipelines для ML)

– Подходы к непрерывному мониторингу моделей и детекции дрифта данных в production

– Возможности low-code инструментов и AutoML, а также вопросы безопасности и этики ИИ

уметь:

– Проектировать и реализовывать облачные пайплайны обработки данных (ETL/ELT)

– Разворачивать облачные среды разработки и настраивать трекинг экспериментов

– Конфигурировать распределенное обучение моделей с использованием облачных GPU

– Версионировать большие массивы данных и веса обученных моделей с помощью DVC

– Контейнеризировать ML-приложения и развертывать их в инфраструктуре Kubernetes

– Настраивать автоматизированные пайплайны CI/CD для тестирования и доставки ML-моделей

– Организовывать логирование, сбор метрик и мониторинг качества моделей в production

владеть:

– Навыками работы с инструментами облачных платформ для поддержки жизненного цикла ML

– Навыками контейнеризации ML-компонентов и управления инфраструктурой Model Serving

– Навыками построения автоматизированных MLOps-конвейеров и систем трекинга

– Навыками эффективного управления ресурсами облака для оптимизации стоимости обучения и инференса моделей.

As a result of mastering the academic discipline, the student must:

know:

– Key concepts and architecture of Cloud Machine Learning (Cloud ML) platforms

– Specifics of cloud data storage, formats, and the principles of Feature Store functioning

– Methods and patterns of distributed training for classic models and deep neural networks (GPU)

– Approaches and tools for automated experiment tracking and logging (MLflow)

– Principles of data, code, and model artifact versioning (DVC)

– Containerization methods and production deployment techniques for ML models (Docker, Model Serving)

– Container orchestration concepts for machine learning tasks within Kubernetes clusters

– Architecture and components of end-to-end MLOps workflows (CI/CD pipelines for ML)

– Approaches to continuous model monitoring and data drift detection in production

– Capabilities of low-code tools, AutoML, as well as AI security and ethical considerations

can:

– Design and implement cloud data processing pipelines (ETL/ELT)

– Deploy cloud development environments and configure experiment tracking

– Configure distributed model training using cloud GPUs

– Version large datasets and trained model weights utilizing DVC

– Containerize ML applications and deploy them within Kubernetes infrastructure

– Set up automated CI/CD pipelines for ML model testing and delivery

– Organize logging, metric collection, and performance monitoring for production models

be able to:

– Skills in working with cloud platform tools to support the ML lifecycle

– Skills in containerizing ML components and managing model serving infrastructure

– Skills in building automated MLOps pipelines and tracking systems

– Skills for effective cloud resource management to optimize model training and inference costs.

Семестр изучения учебной дисциплины, модуля / Semester of study

7

7

Пререквизиты / Prerequisites

Основы облачных технологий 

Cloud Basics

Трудоемкость в зачетных единицах (кредитах) / Credit units

1 зачетная единица

1 credit unit

Количество аудиторных часов и часов самостоятельной работы / Academic hour of students’ class work, 

hours of self-directed learning

Всего 90 часов, из них 54 аудиторных часа и 36 часов самостоятельной работы.

A total of 90 hours, of which 54 academic

hours of students’ class work and 36 hours

of self-directed learning.

Требования и формы текущей и промежуточной аттестации / Requirements and forms of current and interim certification

Опрос, письменный отчет с устной защитой по лабораторной работе, письменный отчет с устной защитой по домашнему заданию, письменный отчет с устной защитой по решению лабораторных работ.
Зачет.

Survey, written report with oral defense on laboratory work, written report with oral defense on homework, written report with oral defense on laboratory work solutions.

Credit.