SSD Nodes Learn
Руководства Matt ConnorАвтор: Matt Connor · Обновлено 2026-07-24

Как построить самый неэффективный дата-центр

Гипотетический гайд по созданию системы с PUE выше 4.0. Узнайте, как использовать тепло и RAID 0 для достижения максимальной неэффективности оборудования.

Что вы строите

Каждый гайд на этом сайте учит делать что-то правильно: команды в нужном порядке, описание корректного результата и перечисление возможных ошибок. Этот гайд другой. Сегодня, чисто гипотетически, мы спроектируем самый неэффективный дата-центр, который могут создать деньги, электричество и самонадеянность.

Нам нужна метрика, поэтому мы возьмем отраслевую: PUE, Power Usage Effectiveness — общее энергопотребление объекта, деленное на мощность, которая фактически доходит до вычислительного оборудования. Гипермасштабируемый дата-центр работает с показателем около 1.1: почти каждый ватт идет на полезную работу. Приличный корпоративный серверный зал имеет показатель 1.5. Наша цель — 4.0 или выше. Это означает, что на каждый ватт вычислений приходится еще три ватта, уходящих в никуда. Мы будем часто обращаться к этому числу, так же как серьезные руководства обращаются к резервным копиям.

Выбор площадки: тепло — это цель

Охлаждение — это самая большая статья расходов в реальном дата-центре, поэтому наш будет бороться с термодинамикой на ее поле. Идеальное место — чердак. С южной стороны. В идеале — со световым люком, направленным прямо на сервер, чтобы машина получала и собственное тепло, и солнечное — результат сотрудничества вашего счета за электричество и звезды.

Зимой охлаждение осуществляется путем открывания окна. В реальных дата-центрах используют наружный воздух — этот метод называется free cooling, он спроектирован, отфильтрован и контролируется по влажности. Мы будем использовать его случайно, через окно, через которое также попадают дождь, пыльца и как минимум одна заблудшая птица в квартал.

Для истинного мастерства установите кондиционер, а затем поместите обогреватель в двух футах от его термостата, установив температуру на два градуса выше целевой температуры кондиционера. Теперь оба устройства будут работать непрерывно, вечно, в состоянии полного несогласия. Электросеть пришлет вам открытку на Рождество.

Один сервер, большой и любимый

Избыточность размывает приверженность делу. В нашем дата-центре ровно один сервер, и он огромный, потому что одна машина с 512 GB RAM ощущается как инфраструктура, тогда как четыре маленькие — как список дел.

У сервера есть имя. Не hostname, а именно имя. Обычно Gandalf или Odin. Вы не можете вывести Odin из эксплуатации. Odin работает уже пять лет:

$ uptime
 09:14:02 up 1847 days,  3:22,  1 user,  load average: 6.41, 6.38, 6.40

Это число — предмет гордости, поэтому вы делаете скриншот и выкладываете его. Любой атакующий, увидев этот скриншот, также сочтет его впечатляющим: 1,847 дней аптайма означают 1,847 дней уязвимостей ядра, которые никто не исправил. Перезагрузка в любом случае не рассматривается — именно при перезагрузке вы обнаружите, какие службы были запущены вручную в 2021 году и так и не были прописаны в unit-файлах systemd. Никто не помнит, какие именно. Теперь сервер является несущей конструкцией в организационной структуре.

Хранилище: скорость и другие способы потери данных

Диски настроены в RAID 0 для производительности. Ноль означает количество дисков, которые могут выйти из строя. Для максимального эффекта объедините массив из носителей разного происхождения: два полноценных SSD, один старый HDD и USB-флешку с конференции. Надежность массива будет в точности равна надежности флешки с конференции — в этом и заключается проект.

Резервное копирование осуществляется в директорию на том же массиве под названием backup_final_v2_REAL, которая содержит tar-архив предыдущей схемы именования. Внешнее резервное копирование представлено стикером с надписью «настроить off-site бэкапы», который технически хранится вне площадки, когда вы забираете его домой на крышке ноутбука.

Корректный результат выглядит так: df сообщает о 97% использования, и есть план по решению этой проблемы в следующем спринте.

Сеть: одна нить всего

DNS-сервер работает на самой машине, поэтому, когда сервер упадет, он заберет с собой DNS-запись, с помощью которой вы пытались выяснить причину падения. Это называется консолидацией.

Брандмауэр был отключен в 2021 году — временно, для отладки чего-либо. Отладка завершилась; брандмауэр не вернулся. Все порты на роутере проброшены на сервер «чтобы сэкономить время позже», а панель администратора роутера доступна из WAN со стандартным паролем для удобного удального управления. Вашего и других.

В последнее время сервер работает необычно тепло даже по меркам чердака, и top показывает, что самым загруженным процессом является нечто под названием xmrig. Мы предполагаем, что это инструмент мониторинга, который мы используем. Мы его не устанавливали — он появился сам собой вскоре после проброса портов, что мы считаем признаком процветания экосистемы. Он ведет мониторинг круглосуточно.

Питание поступает через цепочку потребительских сетевых фильтров, общая длина которых превышает расстояние до электрощитка — что в некотором смысле эффективно, так как вам придется часто посещать электрощиток.

Избыточность через сложность

Отказываясь от избыточности там, где она важна, мы добавляем ее там, где она не нужна. Домашняя страница компании — один статический HTML-файл — обслуживается кластером Kubernetes из двенадцати узлов. Это достигает того, что инженеры называют «архитектурой ради резюме»: страница загружается за те же сорок миллисекунд, которые обеспечил бы nginx, но теперь она может выйти из строя так, что для исправления потребуется консультант.

Для изоляции сам кластер запущен внутри виртуальной машины внутри виртуальной машины внутри виртуальной машины, где каждый слой добавляет безопасности так же, как каждый слой блюда turducken добавляет птицы. Форма обратной связи состоит из девяти микросервисов. Два из них никогда не вызывались. Один из них является несущим, и никто не знает, какой именно.

Нагрев как услуга

Современный сервер преобразует электричество в вычисления и тепло, и мы намерены максимизировать второй результат. медиасервер без GPU — это классический прием: CPU-транскодирование одного 4K-потока загрузит шестнадцать ядер и нагреет небольшую спальню — обогреватель, который также проигрывает фильмы. Амбициозный оператор переходит к запуску большой языковой модели на CPU — обогревателю с 70 миллиардами параметров и API, выдающему токены со скоростью, которую лучше измерять сезонно.

Монитор наблюдает за собой

Наблюдаемость (observability) важна, поэтому мы развертываем self-hosted монитор аптайма — на том же сервере, который он мониторит. Когда Odin умирает, монитор умирает вместе с ним, и вот здесь начинается элегантность: оповещения не срабатывают. Отсутствие оповещений означает отсутствие инцидентов. Отсутствие инцидентов означает идеальный аптайм согласно измерениям. Ежемесячный отчет еще никогда не выглядел так хорошо.

Для полноты картины электронные письма с оповещениями пересылаются через почтовый сервер, который также запущен на Odin. Таким образом, конвейер оповещений полностью автономен, подобно тому как змея, пожирающая свой хвост, полностью сыта.

Неприятная часть

Вот раздел, который я постоянно откладывал. Все это не вымысел. Любимый незаменимый сервер, RAID 0 с бэкапами на том же томе, брандмауэр, отключенный «временно», кластер Kubernetes для одной страницы, монитор, наблюдающий за собой, — я видел все это в продакшене. Некоторые из этого я видел в этом году. Один или два объекта я сам построил в начале своей карьеры.

Настоящая эффективность выглядит скучно, поэтому она проигрывает в моменте, но побеждает в долгосрочной перспективе: PUE, о котором вы никогда не задумываетесь, потому что его спроектировал кто-то другой. Машины, подобранные под рабочую нагрузку, а не под самоощущение владельца. Радиус поражения, просчитанный до взрыва. Резервные копии, которые проверяются путем восстановления по расписанию, с напоминанием в календаре и без героизма. Избыточность, которая скучна — две дешевых вещи побеждают одну великолепную в каждом сбое, о котором мне когда-либо приходилось сообщать.

И самый эффективный дата-центр, который вы можете запустить, — это тот, который вы не запускаете. VPS передает управление питанием, охлаждением, избыточностью и сбоями оборудования в 3 часа ночи людям, которые делают это масштабно и монотонно, что является высшим комплиментом для инфраструктуры. Это оставляет вам по-настоящему интересную часть: запуск собственных сервисов поверх нее на машине, которую вы можете позволить себе потерять, — а это единственный тип машин, на которых стоит экспериментировать.

FAQ

Стоит ли мне на самом деле это делать?

Нет. Каждый раздел этого гайда — это документированный антипаттерн, стоивший кому-то кучи выходных. Если ваша текущая конфигурация напоминает более двух разделов, переходите к последнему вопросу в этом FAQ — в порядке очереди, так как порядок определяет приоритетность действий.

Какой PUE на самом деле является хорошим?

Гипермасштабируемые дата-центры работают с показателем около 1.1, хорошо управляемый корпоративный зал работает в диапазоне от 1.4 до 1.6, а неохлаждаемый шкаф с обогревателем может реально превысить 3. Вы не сможете эффективно конкурировать с 1.1 дома, что является веским экономическим аргументом в пользу аренды вычислительных мощностей у тех, кто это умеет.

Является ли нагрев здания серверами реальным процессом?**

Да, если делать это правильно. Проекты централизованного теплоснабжения в нескольких странах улавливают отработанное тепло дата-центров через теплообменники и по инженерным планам и контрактам подают его в жилые дома. Сатира выше заключается не в том, что тепло сервера может нагреть комнату; а в том, что это происходит случайно, и этот случай называют стратегией.

Мой сервер уже выглядит так. Что мне делать в первую очередь?

Резервные копии — сегодня же, куда-нибудь, кроме самого сервера, а затем тестовое восстановление — непроверенный бэкап — это просто слух. Второе: патчи и перезагрузка, которую вы избегали, в запланированное окно, чтобы вы увидели, что сломается, пока вы наблюдаете. Третье: устраните единую точку отказа: перенесите DNS и мониторинг с сервера. Все остальное может подождать более спокойной недели; эти три вещи — нет.

#satire#datacenter#efficiency#self-hosting