SSD Nodes Learn Hosting plans →
Руководства Matt ConnorАвтор: Matt Connor · Обновлено 2026-08-01

Как построить самый неэффективный дата-центр

Гипотетическое руководство по дата-центру с PUE 4.0+: один любимый сервер, RAID 0, нагрев вместо охлаждения и мониторинг, который следит за собой.

Что мы строим

Каждое руководство на этом сайте учит правильно выполнять определённую задачу: содержит команды в нужном порядке, описывает корректный результат и перечисляет известные варианты отказа. Это руководство отличается от остальных. Сегодня мы полностью гипотетически спроектируем самый неэффективный дата-центр, который можно создать за деньги, электричество и самоуверенность.

Нам нужна метрика, поэтому воспользуемся отраслевым показателем: PUE (Power Usage Effectiveness) — отношением общей мощности объекта к мощности, которая фактически поступает на вычислительное оборудование. В дата-центре гиперскейл-класса этот показатель составляет около 1.1: почти каждый ватт используется с пользой. В обычной серверной корпоративного уровня показатель достигает 1.5. Наша цель — 4.0 или выше. Это означает, что на каждый ватт, используемый вычислительным оборудованием, приходится ещё три ватта, расходуемых впустую. Мы будем часто обращаться к этому числу, как серьёзные руководства обращаются к резервным копиям.

Выбор размещения: тепло — это главное

Охлаждение — самая крупная статья расходов в настоящем дата-центре, поэтому наш объект будет бороться с термодинамикой на ее собственной территории. Идеальное место — чердак. С окнами на юг. В идеале там должен быть световой люк, расположенный так, чтобы солнечный свет падал прямо на сервер. Тогда машина будет получать и собственное отработанное тепло, и солнечное тепло — результат совместной работы вашего счета за электроэнергию и звезды.

Зимой охлаждение обеспечивается открытым окном. Настоящие дата-центры действительно используют наружный воздух. Эта технология называется free cooling. Она требует проектирования, фильтрации и контроля влажности. Мы будем использовать ее случайно — через окно, которое также пропускает дождь, пыльцу и как минимум одну дезориентированную птицу в квартал.

Для полного эффекта установите кондиционер, а затем поставьте обогреватель на расстоянии двух футов от его термостата. Настройте обогреватель на температуру на два градуса выше целевой температуры кондиционера. Теперь оба устройства будут работать непрерывно, всегда, находясь в полном противоречии друг с другом. Энергетическая компания пришлет вам открытку на Рождество.

Один сервер, большой и любимый

Избыточность ослабляет привязанность. В нашем дата-центре ровно один сервер, и он огромный, потому что одна машина с 512 GB RAM выглядит как инфраструктура, а четыре небольшие — как список задач.

У сервера есть имя. Не имя хоста, а именно имя. Обычно Gandalf или Odin. Odin нельзя вывести из эксплуатации. Odin работает уже пять лет:

$ uptime
 09:14:02 up 1847 days,  3:22,  1 user,  load average: 6.41, 6.38, 6.40

Этим показателем гордятся, поэтому его снимают на скриншот и публикуют. Любой атакующий, увидевший этот скриншот, тоже оценит его по достоинству: 1,847 дней непрерывной работы означают 1,847 дней уязвимостей ядра, которые никто не устранял. Перезагрузка всё равно исключена: именно после неё выясняется, какие службы были запущены вручную в 2021 и никогда не были описаны в модуле systemd. Никто не помнит, какие именно. Теперь сервер является критически важной частью организационной структуры.

Хранилище: скорость и другие способы потерять данные

Диски объединены в RAID 0 ради производительности. Ноль обозначает количество дисков, которые могут выйти из строя. Для максимального эффекта распределите данные массива по хранилищам разного происхождения: двум исправным SSD, одному изношенному жесткому диску и USB-накопителю с конференции. Надежность массива будет ровно такой же, как у накопителя с конференции. Такова конструкция.

Резервные копии хранятся в каталоге на том же массиве с именем backup_final_v2_REAL. В нем находится tar-архив предыдущей схемы именования. Резервные копии на внешнем узле представлены листком с надписью «настроить резервное копирование на внешнюю площадку». Формально он хранится на внешней площадке, если вы забираете его домой на крышке ноутбука.

Корректный результат выглядит так: df сообщает об использовании 97%, а план устранения проблемы назначен на следующий спринт.

Сеть: единая точка отказа

DNS-сервер работает на самом компьютере. Поэтому при отказе сервера вместе с ним становится недоступной DNS-запись, которую вы бы использовали, чтобы выяснить причину. Это называется консолидацией.

Брандмауэр временно отключили в 2021 году для отладки. Отладка завершилась, но брандмауэр не включили обратно. Все порты на маршрутизаторе перенаправлены на сервер «чтобы сэкономить время в будущем», а панель администрирования маршрутизатора доступна со стороны WAN с заводским паролем для удобного удалённого управления. Вашего маршрутизатора и маршрутизаторов других пользователей.

В последнее время сервер работает необычно горячо даже для чердака, а top показывает, что больше всего ресурсов потребляет процесс с именем xmrig. Мы предполагаем, что это используемый нами инструмент мониторинга. Мы его не устанавливали. Он появился сам вскоре после перенаправления портов, и мы воспринимаем это как признак того, что система развивается. Он работает круглосуточно.

Питание поступает через цепочку бытовых удлинителей, общая длина которой превышает расстояние пешком до электрического щита. В определённом смысле это эффективно, потому что вам часто придётся посещать электрический щит.

Избыточность за счёт сложности

Отказавшись от избыточности там, где она важна, теперь добавим её там, где она не нужна. Главная страница компании, один статический HTML-файл, обслуживается кластером Kubernetes из двенадцати узлов. Это реализует то, что инженеры называют архитектурой для резюме: страница загружается за те же сорок миллисекунд, за которые её отдал бы nginx, но теперь она может выходить из строя способами, для устранения которых требуется консультант.

Для изоляции сам кластер работает внутри виртуальной машины внутри виртуальной машины внутри виртуальной машины, причём каждый слой добавляет безопасность так же, как каждый слой блюда turducken добавляет птицу. Контактная форма состоит из девяти микросервисов. Два из них ещё ни разу не вызывались. Один из них критически необходим для работы, но никто не знает, какой именно.

Отопление как услуга

Современный сервер преобразует электричество в вычисления и тепло. Мы намерены максимально использовать второй результат. Классический вариант — медиасервер без GPU: перекодирование одного потока 4K на CPU может полностью загрузить шестнадцать ядер и прогреть небольшую спальню. Это обогреватель, который также воспроизводит фильмы. Более амбициозный оператор запускает большую языковую модель на CPU — обогреватель с 70 миллиардами параметров и API, генерирующий токены со скоростью, которую лучше измерять по сезонам.

Мониторинг наблюдает за собой

Наблюдаемость важна, поэтому мы развертываем самостоятельно размещаемый мониторинг доступности на том же сервере, за которым он наблюдает. Когда Odin выходит из строя, мониторинг выходит из строя вместе с ним. И вот что особенно удобно: оповещения не отправляются. Нет оповещений — нет инцидентов. Нет инцидентов — идеальная доступность по результатам измерений. Ежемесячный отчет еще никогда не выглядел так хорошо.

Для полноты отметим, что уведомления по электронной почте пересылаются через почтовый сервер, который также работает на Odin. Таким образом, конвейер оповещения полностью замкнут на себе: система отправляет уведомления через собственный сервер.

Неприятная часть

Ниже приведен раздел, который я долго откладывал. Все это происходило на самом деле. Незаменимый сервер, RAID 0 с резервными копиями на том же томе, «временно» отключенный firewall, кластер Kubernetes, обслуживающий одну страницу, monitor, отслеживающий самого себя, — все это я видел в production. Что-то из этого я видел в этом году. Одну или две такие системы я создал в начале своей карьеры.

Настоящая эффективность выглядит скучно. Поэтому в конкретный момент она проигрывает спор, но побеждает на протяжении десятилетия: PUE, о котором вы никогда не думаете, потому что его спроектировал кто-то другой. Машины, рассчитанные на свою рабочую нагрузку, а не на представление владельца о себе. Радиус поражения, оцененный до возникновения аварии. Резервные копии, которые регулярно проверяют восстановлением по расписанию, с напоминанием в календаре и без героизма. Скучная избыточность: два недорогих компонента всегда лучше одного великолепного — при каждом отказе, для устранения которого мне когда-либо приходилось подключаться.

А самый эффективный дата-центр — тот, которым вам не приходится управлять. VPS передает электропитание, охлаждение, резервирование и аппаратные отказы в 3 a.m. людям, которые занимаются этим в большом масштабе и без лишнего шума. Это высшая похвала, которую может получить инфраструктура. А вам остается действительно интересная часть — запуск собственных сервисов поверх нее на машине, которую вы можете позволить себе потерять. Экспериментировать следует только на таких машинах.

FAQ

Действительно ли стоит делать что-либо из этого?

Нет. Каждый раздел этого руководства описывает документированную антишаблонную практику с последствиями в виде потерянных выходных. Если текущая конфигурация соответствует более чем двум разделам, перейдите к последнему вопросу этого FAQ и выполняйте действия в указанном порядке: это порядок устранения критических проблем.

Какое значение PUE действительно считается хорошим?

В гипермасштабируемых центрах обработки данных этот показатель составляет около 1.1, в хорошо организованном корпоративном машинном зале — от 1.4 до 1.6, а в неохлаждаемом шкафу с конфликтующим обогревателем может действительно превышать 3. Дома невозможно добиться сопоставимого значения 1.1. Это служит наглядным экономическим аргументом в пользу аренды вычислительных ресурсов у поставщика, который способен обеспечить такую эффективность.

Действительно ли можно отапливать здание серверами?

Да, если всё организовано правильно. В нескольких странах проекты централизованного теплоснабжения используют теплообменники для отвода избыточного тепла из центров обработки данных и по трубопроводам подают его в жилые дома. Для этого предусмотрены соответствующие инженерные решения и договоры. Сатира выше не в том, что серверное тепло может обогревать помещение, а в том, что это происходит случайно и случайность объявляется стратегией.

Мой сервер уже выглядит именно так. Что делать в первую очередь?

Сегодня ночью создайте резервные копии в месте, не связанном с сервером, а затем выполните тестовое восстановление: резервная копия без проверки восстановления — это лишь слух. Во-вторых, установите обновления и выполните перезагрузку, которую Вы откладывали, в запланированное окно обслуживания. Так Вы увидите, что именно выходит из строя. В-третьих, устраните единственную точку отказа: перенесите DNS и мониторинг с этого сервера. Всё остальное может подождать более спокойной недели; эти три действия — нет.