# Инфраструктура обучения

← [Раздел](README.md) · [Главная](../README.md)

## Цель

Понять роль **Инфраструктура обучения** в MLOps-стеке и связь с MLflow.

## Предварительно

- [Оркестрация пайплайнов](orkestraciya-pajplajnov.md)

## Время

**2–3 ч**

---

## Зачем

GPU, распределённое обучение, очереди задач.

## Варианты

- Локальная GPU workstation
- Облачные notebooks (SageMaker, Vertex)
- Kubernetes + GPU node pool
- Slurm HPC

## MLflow

Все воркеры логируют в один tracking server. Указывайте tag `node: gpu-3`.

## Cost control

- Spot instances для экспериментов
- Автоshutdown idle GPU
- Лимит runs на пользователя

---

## Самопроверка

1. Какую проблему решает «Инфраструктура обучения»?
2. Какой инструмент вы бы выбрали для старта?
3. Что логировать в MLflow из этого компонента?

---

## Дальше

→ [Валидация моделей](validaciya-modelej.md)
