# 4.5 Облачная инфраструктура

{% toc %}

&nbsp;

![облачная инфра.png](/homepage/proekty/9ced263120ad/glava-4.-komponenty-physical-ai/4.5-cloud-infra/.files/oblachnajainfra.png =1155x600) &[ТЗ](963695)

&[**О**](1029102)**блачная инфраструктура** — это слой, который связывает Cloud и Edge Physical AI в единый цикл. Сама она не обучает модели и не запускает их на роботе. Её задача — следить за процессом обучения, проверять качество моделей и передавать их роботам.

За отслеживание экспериментов отвечают такие платформы, как W&B и ClearML. Они сохраняют метрики, гиперпараметры и веса для каждого прогона обучения. Доставку кода и моделей автоматизирует CI/CD. Каждое изменение проходит через пайплайн сборки, тестов и выкатки. Перед релизом модель дополнительно проверяют контролем на срезах. Это проверка качества по отдельным важным подвыборкам данных, например по бликам или слабому освещению.

Дальше разберём каждый из этих компонентов&[.](968614)

### W&B

**Weights & Biases (W&B)** — платформа для отслеживания экспериментов при обучении нейросетей.

Для обучения инженеры запускают десятки и сотни прогонов с разными настройками. Без учёта легко забыть, какой запуск дал лучший результат и почему. W&B автоматически сохраняет метрики, гиперпараметры, версии данных и код для каждого прогона.

Потом платформа рисует интерактивные графики и сравнивает запуски между собой — в Physical AI это особенно важно. Одна итерация обучения VLA-модели может длиться несколько недель и тратить много GPU-часов на дорогие A100 или H100. W&B помогает не потерять результаты и быстро увидеть, какая конфигурация работает лучше.

{% cut "**Интересный факт**" %}

В 2025 году облачный провайдер CoreWeave купил W&B примерно за 1,7 млрд долларов. Инструмент, который «всего лишь» рисует графики обучения, оценили как крупный стартап.

Причина — W&B стал стандартом де-факто. Платформой пользуются более 1 млн инженеров, а среди клиентов — OpenAI и NVIDIA.

{% endcut %}

**Практика.** W&B подключается к коду в несколько строк. Сначала ставим пакет командой `pip install wandb` и логинимся через `wandb login`.

В начале обучения вызываем `wandb.init()`, а метрики отправляем через `wandb.log()`. Дальше всё видно в веб-интерфейсе. Для перебора гиперпараметров есть встроенный инструмент W&B Sweeps — &[аналог ](958433)уже знакомой вам &[Optuna](968632)&[ (см. [карточку](https://wiki.yandex.ru/homepage/proekty/9ced263120ad/glava-4.-komponenty-physical-ai/4.4-cloud-physical-ai/#optuna-hyperparameter-optimization))](968631). W&B работает с PyTorch, TensorFlow и другими фреймворками.

**Изучить подробнее:**

* [wandb.ai/site](https://wandb.ai/site) — официальный сайт

* [docs.wandb.ai/quickstart](https://docs.wandb.ai/quickstart) — быстрый старт с примерами кода

* [github.com/wandb/wandb](https://github.com/wandb/wandb) — исходный код и примеры интеграций

### ClearML

**ClearML** — открытая MLOps-платформа для управления полным циклом обучения моделей.

Прежнее название — Allegro Trains. При обучении Physical AI инженеры запускают сотни прогонов с разными настройками. Без учёта легко забыть, какой запуск дал лучший результат.

ClearML автоматически сохраняет метрики, гиперпараметры, версию кода и веса модели для каждого запуска. Главное отличие от инструментов вроде Weights & Biases заключается в том, что ClearML не только рисует графики, но и управляет вычислениями.

Её агент запускает задачи на удалённых GPU-узлах и ставит их в очередь. Это особенно ценно для обучения VLA-моделей. Одна итерация может длиться неделями и занимать кластер из дорогих A100 или H100. И ещё ClearML — это опенсорс. Сервер можно развернуть на своих машинах и не отправлять данные во внешнее облако.

{% cut "&[**Интересный факт**](958434)" %}

Раньше ClearML называлась Trains (полное имя — Allegro Trains). Название имело двойной смысл.

С одной стороны, trains — это обучение моделей. С другой — поезда. Некоторые писали его как trAIns, выделяя AI. Но двоякое толкование сыграло злую шутку.

Поисковики считали trains обычным глаголом и не находили сам продукт. Из-за этого в 2021 году команда переименовала инструмент в ClearML. Название выбирало само сообщество путём голосования.

{% endcut %}

**Практика.** ClearML подключается к коду в две строки на Python. Сначала ставим пакет командой `pip install clearml`. Затем в начале обучения вызываем `Task.init()`. После этого платформа сама логирует параметры, метрики и веса. Отдельные вызовы для логирования писать не нужно. ClearML работает с PyTorch, TensorFlow и другими фреймворками.

**Изучить подробнее:**

* [clear.ml](https://clear.ml/) — официальный сайт

* [clear.ml/docs](https://clear.ml/docs/latest/docs/) — документация и быстрый старт

* [github.com/clearml/clearml](https://github.com/clearml/clearml) — исходный код и примеры интеграций

### CI/CD

**CI/CD (Continuous Integration / Continuous Delivery)** — это практика автоматической сборки, тестирования и доставки кода.

Каждое изменение в репозитории запускает пайплайн. Пайплайн собирает проект, прогоняет тесты и готовит сборку к выкатке. Так команда находит ошибки рано и выпускает обновления часто, а не раз в несколько месяцев.

В обычной разработке пайплайн проверяет только код. В Physical AI появляется ещё одна сущность — обученная модель. Поэтому пайплайн проверяет код и модель вместе, а заодно и качество самой модели.

Главная сложность в том, что реальные тесты дороги и опасны для железа. Поэтому код и политику сначала прогоняют в симуляторе, например в Isaac Sim, и только потом отправляют на стенд и на робота. Этот же пайплайн отвечает за релиз моделей — выкатку модели на робота после всех проверок.

{% cut "**Интересный факт**" %}

CT вместо CI — в ML привычный CI часто превращается в Continuous Training: пайплайн запускается не от изменения кода, а от появления новых данных и переобучает модель сам, даже когда &[никто не меняет модель.](958436)

{% endcut %}

**Практика.** Пайплайн описывают в конфигурационном файле прямо в репозитории. Популярные инструменты — GitHub Actions, GitLab CI и Jenkins. Тяжёлые шаги, например обучение модели и симуляцию, выносят на отдельные GPU-раннеры.

**Изучить подробнее:**

* [Яндекс Практикум: CI/CD в разработке](https://practicum.yandex.ru/blog/ci-cd-v-razrabotke/) — понятное введение на русском языке

* [CI/CD для чайников (Хабр)](https://habr.com/ru/articles/895946/) — практическая серия с настройкой пайплайна на GitLab

* [Документация GitHub Actions](https://docs.github.com/actions) — официальный справочник по самому популярному инструменту

### Контроль на срезах

**Контроль на срезах (slice-based evaluation)** — это проверка качества модели не в среднем по всем данным, а отдельно на важных подвыборках.

Такие подвыборки называют срезами. Срез — это подмножество данных с общим признаком. Например, «предметы с бликами», «слабое освещение» или «прозрачные объекты». Идея следующая — средняя метрика бывает высокой, но при этом скрывает провалы на редких ситуациях.

Поэтому для каждого важного среза задают свой порог качества. Перед релизом модели проверяют, что качество на этих срезах не упало. В Physical AI такой контроль критичен для безопасности. Например, робот всегда должен уметь схватить предмет с бликами, а беспилотник — распознать пешехода ночью.

{% cut "**Интересный факт**" %}

Средняя точность умеет врать. Модель может показывать, например, 99% точности в среднем и при этом полностью проваливать редкий, но критичный срез.

Хорошие примеры просто «растворяют» эти ошибки в общей массе. Этот эффект впервые назвали скрытой стратификацией (англ. hidden stratification) в медицинском ML, где модели с высокой общей точностью пропускали редкие, но опасные диагнозы.

{% endcut %}

**Практика.** Заранее выпишите критичные срезы для своей задачи, например блики, ночь, новые объекты. Считайте метрики по каждому срезу отдельно, а не только в среднем.

Для каждого среза задайте порог качества, ниже которого модель нельзя выпускать. Срезы можно искать и автоматически — инструментом SliceFinder. Метрики по срезам удобно логировать в Weights & Biases.

**Изучить подробнее:**

* [Data-Centric AI: Evaluation](https://github.com/HazyResearch/data-centric-ai/blob/main/evaluation.md) — обзор fine-grained-оценки и ссылки на инструменты SliceFinder и SliceLine

* [SliceTeller (IEEE)](https://ieeexplore.ieee.org/abstract/document/9906903) — система валидации модели по срезам перед релизом, с примерами из беспилотного вождения

В следующем разделе мы подробно расскажем про железную инфраструктуру.