Краткий ответ: Центр обработки данных для ИИ — это с высокой плотностью размещения оборудования, где электропитание, охлаждение, коммутационная инфраструктура и хранилище данных ориентированы на обучение и обслуживание моделей, а не серверная комната с дополнительными графическими процессорами. Известность получают чипы; здания зависит от его функциональности. Если изображения невозможно вывезти за пределы центра, следует переоборудовать его в небольшую ячейку; большинству команд следует арендовать такое помещение.
Основные выводы:
Микросхемы против здания: от мощности, охлаждения, архитектуры и хранилища зависит, будут ли работать ускорители.
Места, а не дворцы: модернизируйте две стойки, когда данные не могут покинуть помещение; не покупайте целый кампус.
Среднее значение против медианы: при восьми запусках медиана сбрасывается; используйте среднее значение за 18 часов.
Устойчивость к неправильному использованию: Не указывайте показатель PUE для двух стоек в смешанном зале.
Примерные результаты: Восемь запусков — это небольшая карта, а не 50% экономия производства.

Статьи, которые могут вас заинтересовать после этой:
🔗 Насколько надёжен ИИ? Видео и викторина.
Изучите надёжность ИИ с помощью увлекательного видео и интерактивной викторины.
🔗 Как использовать ИИ в повседневной жизни.
Узнайте о практических способах, с помощью которых ИИ может упростить повседневные задачи и рутины.
🔗 Как использовать ИИ на работе.
Узнайте о практических способах применения ИИ для повышения производительности труда.
🔗 Может ли ИИ мыслить самостоятельно?
Необходимо понять, способен ли искусственный интеллект действительно мыслить независимо или рассуждать.
Чем он отличается от «обычного» центра обработки данных?
Традиционные залы оптимизированы для смешанных нагрузок и обеспечения бесперебойной работы множества небольших сервисов. Конечно, важна избыточность, а также концепция PUE — дополнительная энергия, потребляемая зданием для обеспечения вычислительной мощности в один ватт. Как правило, не проектируют каждый коридор вокруг стойки, которая функционирует как портативный обогреватель.
На сайтах, использующих ИИ, соотношение меняется местами. Плотность возрастает. Сеть становится неразрывной структурой, без которой процесс обучения не может продолжаться. Хранилище должно обеспечивать постоянное обновление контрольных точек, иначе ускорители простаивают, как скаковые лошади в пробке.
Есть и культурные различия. В корпоративной операционной деятельности мыслите категориями заявок и временных окон для внесения изменений. В операционной деятельности, связанной с искусственным интеллектом, мыслите категориями очередей заданий и неприятным чувством, когда узел выходит из строя на поздней стадии длительной работы. Думаю, оба варианта можно назвать «центрами обработки данных», потому что они ими и являются. Просто название скрывает внутреннюю структуру.
| Тип | Для чего он построен | Выдающееся оборудование | Характеристики мощности/охлаждения | Кому это подходит | Почему это существует |
|---|---|---|---|---|---|
| Традиционный корпоративный центр обработки данных | Смешанная ИТ-инфраструктура: базы данных, виртуальные машины, электронная почта, файлы | Процессоры, обычные серверы, привычные системы хранения данных | Воздухопроницаемый; умеренная плотность застройки; показатель PUE как важный аргумент | Компании, управляющие повседневными системами | Продолжайте поддерживать работоспособность бизнес-приложений |
| кластер для обучения ИИ | Длительные, тесно связанные между собой стажировки | Плотная застройка ускорительных стоек; межсоединения для графических процессоров | Высокая плотность; жидкостное охлаждение или [теплообменники задней двери](https://datacenters.lbl.gov/sites/default/files/rdhx-doe-femp.pdf) | Лаборатории и производители моделей, стоящие в очередях на выполнение работ | Завершите забег, не оставив чипсы без еды |
| средство для выполнения выводов ИИ | Модель обслуживания; ответы в реальном времени и пакетные ответы | Ускорители; балансировщики нагрузки, которые имеют значение | Всё ещё жарко, просто... менее театрально; задержка важнее грубой силы | Товары, которые должны ответить прямо сейчас | Разместите модель рядом с пользователем |
| Зал гибридного искусственного интеллекта | Обучение и служение под одной крышей; ну, почти | Смешанные стеллажи; огороженные бассейны; общая ткань | Две "охладительницы" в одном котельном помещении; получается неловко | Команды, которые не могут позволить себе два кампуса | Капитал конечен; жизнь полна беспорядка |
Это не моральный рейтинг. Разные машины, но одна и та же марка.
Графические процессоры, ускорители и энергоемкая стойка
Пройдитесь по традиционному приподнятому этажу, и стеллажи покажутся почти вежливыми. Пройдитесь по ряду стеллажей с искусственным интеллектом, и создастся впечатление, что они хотят поглотить здание.
Главная особенность аппаратной части — это не какой-то хитроумный центральный процессор. Это ускорительный блок: графические процессоры или другие чипы для ИИ, размещенные в серверах, затем в стойках, а затем в рядах, которые используют общую высокоскоростную сеть. Межсоединения графических процессоров объединяют чипы в нечто, что может имитировать один гигантский ускоритель; кластерная сеть делает то же самое на уровне рядов. Параллельное обучение работает только в том случае, если эти связи остаются надежными и предсказуемыми. Потеряв это, ваш «кластер» превратится в кучу дорогих рабочих станций, объединенных одним почтовым индексом.
Электроэнергия поступает вместе с чипами. Не громоздкий офисный распределительный щит. Мегаватты ИТ-нагрузки, как только зал заполняется — я не буду придумывать цифры. Плотность размещения на стойку — вот в чем загвоздка. Меньше стоек. Каждая из них — маленькая печь. Ограничивающим фактором часто является подстанция, а не список желаемых графических процессоров. Вы знаете, как это бывает: отдел закупок хочет больше ускорителей; энергокомпания хочет долгих переговоров и очень большого чека.
Одна слегка нелепая метафора, от которой я никак не могу избавиться: ясли — это голодное животное. Можно вывести более быстрое, но его все равно нужно кормить и убирать за ним. Если пренебречь и тем, и другим, оно превратится в очень дорогой пресс-папье.
Проблема электроснабжения, отопления и охлаждения
Электричество поступает. Тепло выходит. В этом вся суть религии.
Стеллажи высокой плотности отводят тепло таким образом, с которым воздух никогда по-настоящему не справлялся. Можно создавать более интенсивную нагрузку на воздух — теплообменники в задних дверях, более горячие проходы, продуманные системы изоляции — и это работает до определенного момента. Затем появляется жидкость:
-
Контуры системы охлаждения, из-за которых котельная выглядит как химическая установка
-
Погружение в несколько проектов, которые до сих пор удивляют людей, считающих, что вода и серверы не должны находиться в одном предложении
Всё это не выглядит привлекательно. Всё это — продукт, потому что педаль газа, которая ограничивает скорость, — это то, за что вы уже заплатили и чем не можете в полной мере пользоваться.
Показатель PUE по-прежнему важен. Это коэффициент, а не личностные качества. Операторы стремятся к нему, потому что каждый ватт, затраченный на вентиляторы и насосы, — это ватт, который не был использован для работы графического процессора. Я не буду приводить «типичные» цифры; климат и способ определения границ влияют на него, а ложная точность хуже, чем её отсутствие. Вода тоже играет свою роль. Некоторые растения пьют небольшими глотками, другие — большими объемами. Испарительное охлаждение эффективно до тех пор, пока река или засуха не сделают его политизированным.
Сетевые технологии: почему структура сети так же важна, как и микросхемы
Люди фотографируют видеокарты. Им следовало бы фотографировать переключатели.
Обучение — это диалог. Тысячи ускорителей обмениваются градиентами, параметрами, фрагментами модели в тесной синхронизации. Если сеть зависает, вся работа переходит к самому медленному звену. Именно поэтому в центрах разработки ИИ уделяют особое внимание высокоскоростным сетям, низкой задержке и топологиям, которые не разрушаются при сбое связи. Сети, подобные InfiniBand, Ethernet в той же роли, межсоединения для графических процессоров внутри корпуса, кабельная разводка, которая должна быть выполнена правильно с первого раза.
Вывод результатов — это совсем другая тема. При развертывании моделей важна задержка в хвосте распределения — медленный ответ, а не средний. Пакетная обработка и обработка в реальном времени — это два разных подхода. Обучающий кластер нуждается в быстром, коллективном перемещении запросов практически ко всем. Обслуживающий кластер хочет получать множество небольших запросов и обеспечивать изоляцию, без заторов на балансировщике нагрузки.
Упущение, раз уж я здесь, заключается в следующем: люди относятся к сети как к водопроводу, а к чипам — как к ресторану. В этом здании водопровод и есть ресторан. Упустите это, и вы купите кухню, которая не сможет принимать доставку.
Обучение против вывода: два здания, иногда в буквальном смысле
Обучение — это целая кампания. Вы собираете кластер, загружаете в него данные, неукоснительно сохраняете контрольные точки, запускаете его на часы или недели и молитесь, чтобы всё прошло гладко. Пакетная обработка, высокая пропускная способность, тихое терпение — до тех пор, пока отказ одного из узлов не нарушит ход выполнения. Один вышедший из строя ускоритель в тесно связанной задаче может остановить весь процесс.
Процесс вывода данных — это витрина магазина. Модели уже обучены и теперь отвечают на вопросы, классифицируют изображения, генерируют текст. Задержка имеет значение. Немного устаревший акселератор, расположенный рядом с клиентом, может превзойти по качеству высокотехнологичный акселератор, находящийся на другом континенте.
Таким образом, происходит разделение. Тренировочные кампусы стремятся к мощности, земле и плотности размещения оборудования. Площадки для обработки инференции стремятся к низкой задержке и высокой степени присутствия. Существуют также гибридные залы, потому что капитал не бесконечен. Ну, не всегда два здания. Иногда один зал с бархатной веревкой и двумя контурами охлаждения.
Здесь также возникают проблемы с размещением оборудования в центрах обработки данных, гипермасштабными кампусами и локальными ветвлениями. Гипермасштабные компании строят сети в таких масштабах, что на их фоне все остальные выглядят так, будто просто расставляют мебель. Центры обработки данных продают плотность размещения по стойкам. Локальные решения по-прежнему используются, когда данные не могут покинуть инфраструктуру.
Пропускная способность хранилища, контрольные точки и энергоёмкие микросхемы.
Никто не размещает информацию о системе параллельного хранения файлов на обложке брошюры.
Данные для обучения должны поступать достаточно быстро, чтобы графические процессоры не работали на пределе своих возможностей. Контрольные точки должны срабатывать, чтобы сбой не отнял целую неделю. Веса модели должны быть загружены до того, как будет запущена реплика для обслуживания. Незаметным узким местом является пропускная способность хранилища — не просто его емкость. Можно потратить целое состояние на ускорители и при этом ограничивать их производительность с помощью «приличного» массива, предназначенного для виртуальных машин.
Схема знакома: блестящий кластер, очередь заданий и ожидание ввода-вывода, смотрящие на вас, словно невежливый счет. Кластеризация вычислительных ресурсов без кластеризации пути передачи данных приводит к очень дорогостоящему простою. Поддерживайте работоспособность микросхем или признайте, что купили скульптуру.
Программное обеспечение, оркестровка и непривлекательный операционный уровень
Главное здесь — оборудование. Планировщики выполняют работу.
Центр обработки данных для ИИ бесполезен, если задачи не могут найти графические процессоры, если две команды не могут совместно использовать кластер без драки, если неудачно пройденный этап невозможно восстановить, если прошивка постоянно меняется, пока сеть не выйдет из строя в замедленном темпе. Оркестрация, наблюдаемость, ограничение энергопотребления — непривлекательный операционный уровень, по которому и определяется его важность.
У меня есть слабость к этому уровню. К тому же, когда неправильно настроенная сетевая карта целый день имитирует проблему с охлаждением... это понимаешь на собственном горьком опыте.
Когда узел выходит из строя в середине выполнения программы
Узел выходит из строя. Окна внесения изменений по-прежнему сталкиваются с запусками обучения, которые не обращают внимания на ваш календарь. Вы планируете большие задачи группами, изолируете пулы вывода, пишете руководства по устранению неполадок, которые выглядят как «задача работает медленно», пока не станут выглядеть как «задача полностью завершена». Избыточность по-прежнему важна — электропитание, охлаждение, пути передачи данных, хранилище — но режим отказа менее упорядочен, чем старый слайд о девятках времени безотказной работы. Вывод: реплика, отключение неисправного узла, продолжение обработки ответов. Обучение требует контрольных точек, а не оптимизма.
Местоположение, водоснабжение, электросети и соседи
Такую штуку не сажают рядом с коттеджем ради вида.
Подключение к электросети часто является настоящим процессом выбора места. Земля — это проще по сравнению с подстанцией и коммунальным предприятием, имеющим других потребителей. Вода для охлаждения, если вы её используете, становится проблемой соседей, как только начинается сильный дождь. Шум. Визуальная громоздкость. Тепло у забора. Планировочные комитеты узнают о мнениях по поводу «облачной электростанции» в тот момент, когда ей требуется поле и река.
Задержка играет обратную роль. Для вывода данных лучше находиться рядом с пользователями и межсетевыми соединениями. Обучение может проходить в регионах с более дешевой электроэнергией и более прохладным климатом. В отрасли говорят так, будто существует одно идеальное место. Но его нет. Приходится идти на компромисс, используя пресс-релизы.
Остаточное тепло и незваная гостья печи
В брошюрах этот фрагмент просто восхитителен. Направляйте отработанное тепло в дома, бассейны, теплицы — это прекрасная фраза. Иногда система централизованного теплоснабжения действительно работает. Иногда же кампус расположен не в том месте, и тепло всё равно уходит в воздух. Я скептически отношусь к версии из брошюр; но я не скептически отношусь к физике этого процесса.
Кому он нужен (а кому лучше арендовать)?
Большинству людей не нужно владеть одним из таких залов.
Краткий список:
-
Крупные облачные провайдеры, потому что их продуктом является весь парк оборудования
-
В лабораториях, когда причиной является время ожидания в очереди или невозможность передачи данных, возникают проблемы
-
Банк, группа больниц, правительство или производитель, имеющие секретный набор данных — будь то локальные данные или данные из частного центра обработки данных — могут действовать рационально, даже если это сопряжено с определенными хлопотами
Всем остальным следует арендовать. Размещение оборудования в дата-центре с высокой плотностью, готовой к использованию ИИ. Резервирование облачных ресурсов. Управляемый кластер. Вы получаете ускорители, не становясь при этом оператором электростанции. Романтика угасает, когда кто-то в 3 часа ночи спрашивает, кто дежурит по системе охлаждения.
Признаю, тут есть доля гордости. Владение кластером ощущается как владение средствами прогнозирования. А потом приходит счет за электроэнергию, и гордость утихает.
Для чего предназначено это здание?
Итак, что же такое центр обработки данных для ИИ? Это специализированный, высокоплотный кампус, где ускорители, электропитание, охлаждение, коммутационная инфраструктура и хранилища организованы вокруг обучения и обслуживания моделей, а не универсальная ИТ-инфраструктура с графическим процессором в углу. Он выглядит как склад. Он функционирует как электростанция, которая выполняет математические вычисления.
Если ничего больше не запомните: славу получают микросхемы; а вот подстанция, система охлаждения и сеть определяют, были ли эти микросхемы хорошей идеей. Обучение и вывод могут работать под одной крышей; но для них всё равно нужны разные подходы. Большинству организаций следует арендовать помещения. Некоторым — строить. Соседи всё равно это заметят.
В облаке всегда было здание. А сегодня у здания есть своё мнение.
Пример из реальной жизни: двухстоечная тренировочная ячейка, когда изображения не могут покинуть помещение
Сценарий
Томос — руководитель отдела инфраструктуры в компании Kestrel Precision, производителе с численностью персонала 400 человек в Уэст-Мидлендсе. У них уже есть небольшой локальный цех: ERP-система, файловые ресурсы, виртуальные машины — тот самый смешанный коллектив, с которого началась эта статья. Воздушное охлаждение. Обычный Ethernet. SAN, который идеально подходит для офисных дисков.
Команде специалистов по машинному зрению необходимо обучить модель контроля качества на заводских перегонных аппаратах. Аппараты не могут покидать территорию предприятия. Они демонстрируют процесс, который компания не будет размещать на облачном диске, даже частном. Решение отдела закупок — четыре сервера с двумя ускорителями и слайд под названием «Наш центр обработки данных с использованием ИИ». Серверы устанавливаются в две существующие стойки, поскольку есть место, а ограниченность пространства стала определяющим фактором.
Это не так. Через две недели графические процессоры начинают работать с перебоями, а затем тихо снижают производительность. Задания замедляются, когда контрольная точка достигает SAN. Один из узлов выходит из строя на одиннадцатом часу, и выполнение задачи просто... прекращается. Томос не забыл купить чипы. Он купил кучу дорогих рабочих станций, расположенных в одном почтовом районе. Здание тогда еще было бизнес-центром.
Им не нужен кампус, новая подстанция или река. Им нужна небольшая ячейка, которая функционирует как миниатюрный центр обработки данных для ИИ: мощность, которую стойки могут реально выдержать, тепло, которое отводится без перегрева чипов, сеть, по которой может передаваться обучающий процесс, хранилище, способное сохранять контрольные точки, и руководство по действиям в случае выхода из строя узла. Поскольку изображения не могут покидать систему, аренда колокационного центра в сорока минутах езды — не решение. Модернизация двух стоек — вот что действительно подходит.
Что нужно клетке
-
Измеренный энергетический бюджет для этого ряда, исходя из блоков распределения питания (PDU), а не из списка пожеланий к графическим процессорам. Если резервной мощности недостаточно для обеспечения четырех серверов при обучающей нагрузке, на этом обсуждение заканчивается, и они рассматривают более плотную систему размещения оборудования, а не чудо
-
Для охлаждения воздуха при такой плотности никогда не требовалось использовать теплообменники на задней двери, если это позволяет пространство зала, или небольшой жидкостный контур, если это возможно. Если ни то, ни другое, серверы не устанавливаются
-
Между четырьмя узлами должна быть выделенная высокоскоростная коммутационная сеть, а не офисная сеть Ethernet. Если в каталоге поставщика есть только коммутатор 10 Гбит/с, это не кластер
-
Быстрое локальное хранилище для контрольных точек и обучающих фрагментов, а не SAN виртуальных машин
-
Планировщик, интервал контрольных точек и записанный путь перезапуска. Аппаратная часть — главная звезда. Задача этого уровня — обеспечить корректную работу
-
Огороженная зона для проведения инференции на производственной линии, отделенная от обучающих разговоров, потому что для обслуживания важна задержка и изоляция, а не коллективный шум
-
Разрешение на регистрацию параметров питания, тактовой частоты графического процессора, событий ограничения скорости и времени выполнения задания. Если они не смогут проверить эти данные, они сфотографируют графические процессоры и пропустят переключатели
Пример инструкции
В техническом задании на предоставление услуг Томос изложил это простым языком:
Не называйте это кампусом ИИ. Постройте в существующем зале двухстоечный тренировочный модуль для четырех серверов с двумя ускорителями. Заводские образы хранятся на месте. Успех заключается в следующем: четыре узла завершают 12-эпоховый алгоритм обучения с проверкой без перегрева, записывают контрольную точку за минуты, а не за десятки минут, и возобновляют работу с этой контрольной точки, когда мы намеренно отключаем какой-либо ранг. Охлаждение должно поддерживать тактовую частоту графических процессоров на уровне обучения. Сеть должна представлять собой общую инфраструктуру для этих четырех устройств, а не путь через офисную сеть. Хранилище данных должно обеспечивать работу чипов. Если теплообменники на задней дверце не помещаются, скажите об этом и остановитесь. Не указывайте показатель PUE для двух стоек в смешанном зале. Это будет показуха.
Затем он включает это в саму программу обучения:
Сохраняйте контрольные точки каждые 30 минут в локальном пуле быстрых серверов. Если ранг падает, перезапустите с последней завершенной контрольной точки. Не ждите на SAN. Не продолжайте тренировку, пока время на часах упало из-за перегрева. Запишите это и остановите, чтобы мы могли увидеть причину задержки.
Хороший час выглядит так: все восемь графических процессоров работают на тактовых частотах обучения, файл контрольной точки загружен, задача выполняется синхронно. Плохой час выглядит так: вентиляторы работают на полную мощность, тактовые частоты снижены, контрольная точка записана на 2% через десять минут, и кто-то в офисе говорит: «Кластер запущен». Запущен — это не значит, что он не работает на тактовых частотах.
Как это проверить
Тестирование проводится до начала модернизации, и в этом вся суть недоверия к демонстрационной версии.
-
Та же самая 12-этапная методика, те же 120 000 контрольных снимков, восемь циклов производства
-
Отсчет времени ведется по часам до завершения выполнения задания, включая любой перезапуск, и измеряется от момента отправки задания до последней контрольной точки эпохи 12
-
Прохождение теста на перегрев: тактовая частота графического процессора остается на целевом уровне на протяжении всего выполнения. Событие, связанное с ограничением частоты, считается неудачей, даже если задача в конечном итоге завершается
-
Анализ хранилища: время записи контрольной точки, медианное и худшее значения, из журнала заданий
-
Проверка качества ткани: работа не должна простаивать в коллективном ожидании, пока ситуация улучшается. Если они не видят этого ожидания, значит, работа не выполнена
-
В двух из восьми запусков на определенном этапе намеренно уничтожается ранг, чтобы проверить возможность перезапуска игры
-
Вывод результатов — это отдельный тест из 200 изображений, проведённый на заводской линии и в огороженном боксе для подачи. Успех обучения не засчитывается как успех подачи
-
Они записывают потребляемую мощность от блоков распределения питания с интервалом в 15 минут, так что никому не нужно изобретать мегаватт
Принятие решения о присвоении ячейке статуса «готовой к ИИ»: 8 из 8 рецептов выполнены; 0 из 8 показывают перегрев; оба прерванных запуска возобновляются; контрольные точки сохраняются в минутах. Если они этого не сделают, у них всё ещё есть серверная комната с мощными видеокартами.
Результат
Приведенный результат является иллюстративным и получен в ходе вымышленного теста из восьми запусков, а не опубликованными данными Kestrel.
Предположения: четыре сервера с двумя ускорителями в двух стойках; одна модель контроля качества; 120 000 неподвижных изображений; восемь запусков фиксированного 12-эпохного алгоритма; время выполнения включает перезапуски до завершения алгоритма; ограничение скорости означает регистрируемое снижение времени обучения; время контрольной точки — это время записи, а не желаемое; мощность стойки — это количество выборок PDU, а не показатель PUE кампуса.
До модернизации видеокарты располагались в обычных стойках с воздушным охлаждением, подключенных к офисной сети Ethernet и сети хранения данных виртуальных машин (VM SAN):
-
Пять из восьми попыток завершились с первой попытки. Среднее время выполнения среди этих пяти попыток: 14 часов
-
Из 8 попыток 3 пришлось начинать заново после зависания примерно через 11 часов (две после выхода из строя узла из-за устаревшей контрольной точки, одна после того, как контрольная точка заполнила SAN). Повторная попытка была немедленной, без ожидания в течение ночи: 11 часов потрачено впустую плюс 14 часов на вторую попытку, или 25 часов до завершения выполнения рецепта для этих трех попыток
-
Среднее время приготовления всех восьми блюд, включая перезапуски, составило 18 часов. (Пять блюд — 14 часов, три — 25. Медиана по всем восьми рецептам по-прежнему равна 14 часам, что скрывает перезапуски. Поэтому здесь в качестве базового значения используется среднее значение.)
-
Перегрев приводил к срабатыванию терморегулирования в 7 из 8 запусков. Среднее время работы на пониженной тактовой частоте: 3 часа в 14-часовой попытке
-
Запись контрольной точки: медиана 22 минуты
-
Проверка навыков убийств была для них невыполнимым испытанием. У них не было плана действий. Две случайные смерти стали результатом этого открытия
-
Максимальная нагрузка на два тренажерных блока во время тренировки: около 18 кВт. Тренажерный блок имел достаточную мощность. В нем отсутствовали система охлаждения и тканевая обивка
После теплообменников на задних дверях этих двух стоек, выделенной коммутационной сети между четырьмя узлами, небольшого пула NVMe для контрольных точек, 30-минутного режима создания контрольных точек и сценария перезапуска:
-
8 из 8 выполнили задание с первой попытки. Среднее время выполнения: 9 часов
-
Терморегулирование: 0 из 8
-
Запись контрольной точки: медиана 90 секунд. Наихудшее время в серии: 3 минуты
-
Оба преднамеренных убийства с целью уничтожения противника возобновились с последнего 30-минутного контрольного пункта. Дополнительное время на эти два заезда: около 40 минут каждый, включая диагностику, поэтому общее время составило около 9 часов 40 минут. В среднем по восьми раундам это составило 9 часов
-
Пиковая нагрузка на ИТ-оборудование по-прежнему составляет около 18 кВт. Используются те же чипы. Однако поведение здания изменилось
В этой выборке среднее время до завершения рецепта сократилось с 18 часов до 9 часов, или по 9 часов на каждый, что в сумме составляет 72 часа за восемь запусков. Показатель завершения с первого раза снизился с 5 из 8 до 8 из 8. Показатель эффективности управления двигателем снизился с 7 из 8 до 0 из 8. Последнее число говорит о том, купили ли они ускорители или пресс-папье. Они не назовут это изменение времени 50-процентной экономией производства. Восемь запусков — это небольшой и простой набор данных.
Эти цифры представляют собой примерную оценку, основанную на заявленном тестировании, небольшой выборке, одной модели и одном смешанном зале. Это не показатель PUE, не мегаватт кампуса и не доказательство того, что Kestrel следует строить учебный полигон в поле. Анализ журналов проводился в течение 9 часов; они этого не скрывали. Показатель 18 кВт — это округленное значение PDU, а не счет за электроэнергию. Они не перевели 72 часа в расчет затрат, потому что использование смешанного тарифа на электроэнергию на заводе создало бы ложное обоснование целесообразности проекта.
Проверка подачи была отдельной и меньшей по объему: 200 линейных изображений в огороженном ящике, все на месте. Это вывод, а не обучение. Смешивание этих двух методов было бы ошибкой, подобной гибридному залу в миниатюре.
Что может пойти не так?
-
Отдел закупок продолжает называть четыре сервера «центром обработки данных для ИИ». Эта маркировка скрывает внутреннюю начинку, а следующая покупка – это ещё больше видеокарт для того же самого отдела с ужасными комплектующими
-
Теплообменники задней двери установлены, и никто не вводит в эксплуатацию водопроводную часть. Вентиляторы по-прежнему кричат. Часы по-прежнему отсчитывают время
-
В сети используется один коммутатор без резервного канала. Один обрыв соединения — и "кластер" снова состоит из четырех рабочих станций
-
Контрольные точки остаются в SAN, потому что пул NVMe находился на «второй фазе». Вторая фаза не наступает до тех пор, пока не выйдет из строя следующий узел
-
Они указывают показатель PUE для двух стоек в смешанном зале. Климат, границы зала и остальные параметры ERP-системы делают это соотношение искусственным
-
Обучение и обслуживание неразрывно связаны. Перегрузка контрольных точек заставляет производственную линию ждать. Результатом является задержка, а не плотность
-
Узел выходит из строя, и кто-то обрабатывает это как заявку на восстановление работоспособности, а не как перезапуск контрольной точки. Специалисты по эксплуатации предприятия и специалисты по ИИ целый день не понимают друг друга
-
Они могли бы арендовать клетку, но изображениям нельзя покинуть её пределы. Забыв об этом ограничении, они погружаются в облачный диалог, который им придётся завершить
Практический вывод
В таком виде центр обработки данных для ИИ — это не склад и не счет за графический процессор. Это ячейка, позволяющая ускорителям завершить работу: достаточное количество энергии, тепло, выделяемое системой, контрольная точка и ответственный сотрудник в случае сбоя одного из ускорителей. Kestrel не нуждался в кампусе. Им понадобилось всего две стойки, чтобы перестать притворяться. Большинство команд должны арендовать такое помещение. А вот немногие, имея секретный набор данных и помещение, способное выдержать жару, должны построить ячейку и отказаться от спуска.
Часто задаваемые вопросы
Что такое центр обработки данных для ИИ?
Это высокопроизводительная вычислительная площадка, где электропитание, охлаждение, сети и хранилища ориентированы на параллельное обучение и запуск моделей, а не на аккуратные ряды универсальных серверов. Она спроектирована таким образом, чтобы огромное количество ускорителей могло обучать и запускать модели без перегрева, зависания в сети или ожидания на диске. Обычный корпоративный зал — это смешанный район. Зал искусственного интеллекта — это монокультура, единицей ценности которой является ускоритель, например, графический процессор или чипы типа TPU. Он выглядит как склад и функционирует как электростанция, выполняющая математические вычисления.
Чем отличается центр обработки данных для ИИ от обычного центра обработки данных?
Традиционные центры обработки данных оптимизированы для смешанных нагрузок и обеспечения бесперебойной работы множества небольших сервисов. В центрах обработки данных для ИИ эти соотношения меняются местами: плотность увеличивается, сеть становится основой, без которой не может функционировать процесс обучения, а хранилище должно обеспечивать бесперебойную работу контрольных точек, иначе ускорители простаивают. В корпоративной операционном управлении мыслит категориями заявок и временными окнами изменений. В управлении ИИ мыслит категориями очередей заданий и неприятным чувством, когда узел выходит из строя на поздней стадии длительной работы. Оба центра обработки данных можно по-прежнему называть центрами. Название просто скрывает внутреннюю структуру.
Почему центры обработки данных, использующие искусственный интеллект, потребляют так много энергии?
Наиболее примечательным аппаратным элементом является не какой-то умный центральный процессор, а ускорительная платформа: графические процессоры или другие чипы для ИИ, размещенные в серверах, затем в стойках, а затем в рядах, объединенных высокоскоростной сетью. Главная особенность – плотность размещения на стойку: меньше стоек, каждая из которых представляет собой небольшую печь. Когда зал заполняется, возникают мегаватты ИТ-нагрузки, хотя придумывать типичную цифру не стоит. Часто ограничивающим фактором является подстанция, а не список желаемых графических процессоров.
Как охлаждаются центры обработки данных для ИИ?
Стеллажи высокой плотности отводят тепло таким образом, с которым воздух никогда по-настоящему не справлялся. Можно усилить воздушный нагрев с помощью теплообменников на задних дверях, более горячих проходов и продуманной системы изоляции. Затем появляется жидкость: прямое охлаждение чипов, контуры охлаждения и иммерсионное охлаждение в некоторых конструкциях. Ускоритель, который снижает производительность, — это тот, за который вы уже заплатили и который не можете использовать в полной мере. Показатель PUE по-прежнему важен, потому что каждый ватт, потраченный на вентиляторы и насосы, — это ватт, который не был использован для работы графического процессора. Вода тоже играет свою роль: некоторые растения пьют воду, другие — пьют её в больших количествах.
Почему сетевые возможности так же важны, как и графические процессоры?
Обучение — это диалог: тысячи ускорителей обмениваются градиентами, параметрами и фрагментами модели в тесной синхронизации. Если сеть зависает, вся задача переходит к самому медленному узлу. Именно поэтому в центрах ИИ уделяют особое внимание высокоскоростным сетям, низкой задержке, сетям, подобным InfiniBand, или Ethernet, и топологиям, которые не разрываются при сбое канала связи. В задачах вывода важна задержка на хвосте распределения, множество мелких запросов и изоляция. В этом здании водопровод — это ресторан.
Для чего используется центр обработки данных для ИИ: для обучения или для вывода результатов?
Обучение — это кампания: собрать кластер, загрузить в него данные, неукоснительно сохранять контрольные точки и запускать в течение нескольких часов или недель. Вывод результатов — это витрина магазина: модели уже обучены, теперь отвечают, и задержка имеет значение. Тренировочные кампусы стремятся к мощности, земле и плотности размещения. Площадки для вывода результатов стремятся к задержке и присутствию. Гибридные залы существуют потому, что капитал не бесконечен, иногда один зал с двумя контурами охлаждения. Немного более старый акселератор рядом с клиентом может превзойти роскошный акселератор на другом континенте.
Почему хранилище данных имеет значение в центре обработки данных для ИИ?
Данные для обучения должны поступать достаточно быстро, чтобы графические процессоры не работали на пределе своих возможностей. Контрольные точки должны срабатывать, чтобы сбой не отнял целую неделю. Веса модели должны быть загружены до того, как будет запущена реплика для обслуживания. Не просто емкость хранилища, а его пропускная способность — это скрытое узкое место. Можно потратить целое состояние на ускорители и при этом ограничивать их производительность с помощью «приличного» массива, предназначенного для виртуальных машин.
Что происходит, когда узел выходит из строя в середине выполнения программы?
Один вышедший из строя ускоритель в тесно связанной задаче обучения может остановить весь процесс. Для обучения нужны контрольные точки, а не оптимизм. Вывод же загружает неисправный узел, поддерживает работоспособность реплики и обеспечивает бесперебойную работу. Окна внесения изменений по-прежнему конфликтуют с запусками обучения, которые не учитывают ваш календарь. Избыточность по-прежнему важна для электропитания, охлаждения, путей передачи данных и хранения, но режим отказа стал менее аккуратным, чем старый слайд о девятках времени безотказной работы.
Каково влияние центра обработки данных, использующего искусственный интеллект, на электросети, водоснабжение и жителей окрестных районов?
Подключение к сети часто является настоящим процессом выбора площадки. Земля — это проще по сравнению с подстанцией и энергоснабжающей компанией, у которой есть другие клиенты. Вода для охлаждения, если вы её используете, становится проблемой соседей, как только начинаются сильные дожди, наряду с шумом, визуальным беспорядком и нагревом у забора. Обучение может проходить на более дешевых рынках электроэнергии и в более прохладном климате. Вывод предпочитает находиться рядом с потребителями. Идеального места не существует. Есть компромисс, связанный с пресс-релизом.
Мне нужно владеть собственным центром обработки данных для ИИ или лучше арендовать его?
Большинству людей не нужно владеть одним из этих залов. Крупные компании строят их, потому что продуктом является их парк оборудования. Лаборатории строят, когда узкое место — время ожидания в очереди или невозможность передачи данных. Банк, больница, правительство или производитель, имеющие секретный набор данных, могут сделать целесообразным размещение оборудования на собственных серверах или в частном центре обработки данных. Всем остальным следует арендовать: готовые к использованию в ИИ центры обработки данных, резервирование облачных ресурсов или управляемый кластер. Вы получаете ускорители, не становясь при этом оператором электростанции.
Ссылки
-
МЭА - www.iea.org
-
LBNL - datacenters.lbl.gov
-
Зелёная энергосеть - www.thegreengrid.org
-
LBNL - datacenters.lbl.gov
-
LBNL - datacenters.lbl.gov
-
Uptime Institute - journal.uptimeinstitute.com
-
NVIDIA - developer.nvidia.com
-
NVIDIA - docs.nvidia.com
-
NVIDIA - docs.nvidia.com
-
NVIDIA - docs.nvidia.com
-
Google Cloud - docs.cloud.google.com