SSD Nodes Learn
Panduan Matt ConnorOleh Matt Connor · Dikemas kini 2026-07-24

cara bina pusat data paling tidak cekap

Panduan hipotetikal membina pusat data dengan PUE melebihi 4.0 menggunakan RAID 0 dan strategi haba ekstrem untuk mencapai tahap ketidakcekapan tertinggi.

Apa yang anda bina

Setiap panduan di laman ini mengajar anda untuk melakukan sesuatu dengan betul: arahan mengikut turutan, rupa hasil yang betul, dan mod kegagalan yang dinamakan. Panduan ini berbeza. Hari ini, secara hipotetikal, kita akan mereka bentuk pusat data yang paling tidak cekap yang boleh dihasilkan oleh wang, elektrik, dan keangkuhan.

Kita memerlukan metrik, jadi kita akan meminjam metrik industri: PUE, Power Usage Effectiveness — jumlah kuasa fasiliti dibahagi dengan kuasa yang benar-benar sampai ke peralatan pengkomputeran. Pusat data hyperscale beroperasi sekitar 1.1: hampir setiap watt melakukan kerja yang berguna. Bilik pelayan perusahaan yang baik menguruskan 1.5. Sasaran kita ialah 4.0 atau lebih tinggi, bermakna bagi setiap watt pengkomputeran, tiga watt lagi terbuang begitu sahaja. Kita akan merujuk nombor ini dengan kerap, seperti panduan serius merujuk kepada sandaran (backups).

Pemilihan tapak: haba adalah intipatinya

Penyejukan adalah kos overhead tunggal yang terbesar dalam pusat data sebenar, sebab itulah pusat data kita akan melawan termodinamik di kawasannya sendiri. Lokasi ideal ialah loteng. Menghadap ke selatan. Idealnya dengan tingkap skylight yang diletakkan untuk menyinari pelayan secara terus, supaya mesin menerima haba sisanya sendiri dan juga haba matahari, satu kerjasama antara bil elektrik anda dan sebuah bintang.

Pada musim sejuk, penyejukan dikendalikan dengan membuka tingkap. Pusat data sebenar memang menggunakan udara luar — teknik ini dipanggil free cooling, dan ia direka, ditapis, dan dikawal kelembapannya. Kita akan menggunakannya secara tidak sengaja, melalui tingkap yang juga membenarkan masuk hujan, debunga, dan sekurang-kurangnya seekor burung yang keliru setiap suku tahun.

Untuk seni yang sebenar, pasang penyaman udara, kemudian letakkan pemanas ruang dua kaki dari termostatnya, tetapkan dua darjah lebih panas daripada sasaran penyaman udara tersebut. Kedua-dua mesin kini akan berjalan secara berterusan, selamanya, dalam ketidaksetujuan yang sempurna. Syarikat utiliti akan menghantar kad kepada anda pada waktu Krismas.

Satu pelayan, besar, kesayangan

Redundansi mengurangkan komitmen. Pusat data kita mengandungi tepat satu pelayan, dan ia sangat besar, kerana satu mesin dengan 512 GB RAM terasa seperti infrastruktur, manakala empat mesin kecil terasa seperti senarai tugasan.

Pelayan itu mempunyai nama. Bukan hostname — tetapi sebuah nama. Biasanya, Gandalf, atau Odin. Anda tidak boleh menamatkan perkhidmatan Odin. Odin telah menyala selama lima tahun:

$ uptime
 09:14:02 up 1847 days,  3:22,  1 user,  load average: 6.41, 6.38, 6.40

Nombor itu adalah satu kebanggaan, sebab itulah anda mengambil tangkapan skrin dan memaparkannya, dan sebab itulah setiap penyerang yang melihat tangkapan skrin itu juga mendapatinya mengagumkan: 1,847 hari uptime bermakna 1,847 hari kerentanan kernel, yang tidak ditambal oleh sesiapa. Memulakan semula (rebooting) adalah mustahil — reboot adalah cara anda mengetahui perkhidmatan mana yang dimulakan secara manual pada tahun 2021 dan tidak pernah ditulis ke dalam unit systemd. Tiada siapa ingat yang mana satu. Pelayan itu kini menjadi penyokong beban dalam carta organisasi.

Storan: kelajuan, dan cara lain untuk kehilangan data

Disk dikonfigurasikan dalam RAID 0, untuk prestasi. Sifar merujuk kepada jumlah disk yang boleh gagal. Untuk kesan maksimum, buat striping array merentasi storan daripada pelbagai sumber: dua SSD yang betul, satu hard disk lama, dan satu pemacu USB dari persidangan. Array tersebut adalah setepat kebolehpercayaan pemacu persidangan tersebut, itulah reka bentuknya.

Sandaran (backups) dikendalikan oleh satu direktori pada array yang sama bernama backup_final_v2_REAL, yang mengandungi tarball bagi skema penamaan sebelumnya. Sandaran luar tapak (off-site backups) diwakili oleh nota pelekat bertulis "set up off-site backups," yang secara teknikalnya disimpan di luar tapak apabila anda membawanya pulang pada penutup komputer riba anda.

Hasil yang betul kelihatan seperti: df melaporkan penggunaan 97%, dan satu pelan untuk menanganinya pada sprint seterusnya.

Rangkaian: satu jalur untuk segalanya

Pelayan DNS berjalan pada mesin itu sendiri, supaya apabila pelayan terhenti, ia turut membawa bersama rekod DNS yang anda gunakan untuk mencari tahu puncanya. Ini dipanggil konsolidasi.

Firewall telah dinyahaktifkan pada tahun 2021 — buat sementara waktu, untuk menyahpepijat sesuatu. Proses penyahpepijatan telah tamat; firewall tidak kembali. Setiap port pada penghala (router) telah di-forward ke pelayan "untuk menjimatkan masa kemudian," dan panel admin penghala boleh dicapai dari sisi WAN dengan kata laluan kilangannya, untuk pengurusan jauh yang mudah. Milik anda, dan orang lain.

Pelayan telah berjalan dengan suhu yang luar biasa panas kebelakangan ini, walaupun mengikut piawaian loteng, dan top menunjukkan proses paling sibuk adalah sesuatu yang dipanggil xmrig. Kami mengandaikan ini adalah alat pemantauan yang kami gunakan. Kami tidak memasangnya — ia muncul sendiri sejurus selepas port di-forward, yang kami anggap sebagai tanda bahawa ekosistem ini sedang berkembang pesat. Ia memantau sepanjang masa.

Kuasa sampai melalui rangkaian penyambung kuasa pengguna yang panjang keseluruhannya melebihi jarak berjalan ke panel pemutus litar — yang mana adalah cekap, dalam erti kata tertentu, kerana anda akan kerap melawat panel pemutus litar tersebut.

Redundansi melalui kerumitan

Setelah menolak redundansi di tempat yang penting, kita kini menambahnya di tempat yang tidak penting. Laman utama syarikat — satu fail HTML statik — dilayani oleh kluster Kubernetes dua belas nod. Ini mencapai apa yang dipanggil jurutera sebagai seni bina didorong resume: halaman dimuatkan dalam masa empat puluh milisaat yang sama seperti yang akan dihantar oleh nginx, tetapi ia kini boleh gagal dengan cara yang memerlukan perunding.

Untuk pengasingan, kluster itu sendiri berjalan di dalam sebuah mesin maya di dalam sebuah mesin maya di dalam sebuah mesin maya, setiap lapisan menambah keselamatan seperti setiap lapisan turducken menambah burung. Borang hubungan adalah sembilan mikroperkhidmatan. Dua daripadanya tidak pernah dipanggil. Satu daripadanya adalah penyokong beban dan tiada siapa yang tahu yang mana satu.

Pemanasan sebagai perkhidmatan

Pelayan moden menukar elektrik kepada pengkomputeran dan haba, dan kita berniat untuk memaksimumkan hasil kedua. pelayan media tanpa GPU adalah taktik klasik: CPU-transcoding untuk satu aliran 4K tunggal akan membebankan enam belas teras dan memanaskan bilik tidur kecil, sebuah pemanas ruang yang juga memainkan filem. Pengendali yang bercita-cita tinggi beralih kepada menjalankan model bahasa besar pada CPU — sebuah pemanas ruang dengan 70 bilion parameter yang mempunyai API, menghasilkan token pada kadar yang paling baik diukur secara bermusim.

Pemantau memerhati dirinya sendiri

Kebolehan pemerhatian (observability) adalah penting, jadi kami memasang pemantau uptime hos sendiri — pada pelayan yang sama yang dipantau. Apabila Odin mati, pemantau mati bersamanya, dan inilah bahagian yang elegan: tiada amaran (alert) berbunyi. Tiada amaran bermakna tiada insiden. Tiada insiden bermakna uptime yang sempurna, mengikut ukuran. Laporan bulanan tidak pernah kelihatan lebih baik.

E-mel amaran, untuk melengkapkan, dihantar melalui pelayan mel yang juga berjalan pada Odin. Saluran amaran oleh itu adalah sepenuhnya kendiri, seperti seekor ular yang memakan ekornya sendiri adalah sentiasa kenyang.

Bahagian yang tidak selesa

Inilah bahagian yang saya tangguhkan. Semua ini bukan fiksyen. Pelayan kesayangan yang tidak boleh diganti, RAID 0 dengan sandaran pada volum yang sama, firewall yang dinyahaktifkan "buat sementara waktu," kluster Kubernetes yang melayani satu halaman, pemantau yang memerhati dirinya sendiri — saya telah melihat setiap satu daripada ini dalam pengeluaran (production). Beberapa daripadanya saya telah lihat tahun ini. Satu atau dua daripadanya, pada hari-hari awal saya, saya telah membinanya.

Apa rupa kecekapan sebenar adalah membosankan, sebab itulah ia kalah dalam hujah pada saat itu tetapi menang dalam tempoh sedekad: PUE yang anda tidak pernah fikirkan kerana orang lain telah mereka bentuknya. Mesin yang bersaiz mengikut beban kerja mereka dan bukannya mengikut imej diri pemiliknya. Radius letupan, yang dipertimbangkan sebelum letupan berlaku. Sandaran yang diuji dengan memulihkannya, mengikut jadual, dengan peringatan kalendar dan tanpa kepahlawanan. Redundansi yang membosankan — dua unit barang murah lebih baik daripada satu unit barang hebat, setiap kali, dalam setiap kegagalan yang pernah saya terima notifikasi paginya.

Dan pusat data paling cekap yang boleh anda jalankan ialah yang anda tidak jalankan. VPS menyerahkan kuasa, penyejukan, redundansi, dan kegagalan perkakasan pada jam 3 pagi kepada orang yang melakukannya pada skala besar, secara membosankan, yang merupakan pujian tertinggi yang boleh diterima oleh infrastruktur — dan ia meninggalkan anda bahagian yang benar-benar menyeronokkan, iaitu menjalankan perkhidmatan anda sendiri di atasnya, pada mesin yang anda mampu jika ia hilang, iaitu satu-satunya jenis mesin yang patut anda eksperimenkan.

FAQ

Patutkah saya melakukan mana-mana perkara ini?

Tidak. Setiap bahagian dalam panduan ini adalah anti-corak (anti-pattern) yang didokumentasikan dengan mangsa hujung minggu. Jika tetapan semasa anda menyerupai lebih daripada dua bahagian, lompat ke soalan terakhir dalam FAQ ini — mengikut turutan yang diberikan, kerana turutan itu adalah triage.

Berapakah PUE yang baik, sebenarnya?

Pusat data hyperscale beroperasi sekitar 1.1, bilik perusahaan yang diurus dengan baik menguruskan 1.4 hingga 1.6, dan almari tanpa penyejukan dengan pertelingkahan pemanas ruang boleh benar-benar melebihi 3. Anda tidak boleh bersaing secara bermakna dengan 1.1 di rumah, yang merupakan hujah ekonomi senyap untuk menyewa pengkomputeran daripada mereka yang mampu melakukannya.

Adakah memanaskan bangunan dengan pelayan adalah perkara sebenar?

Ya — jika dilakukan dengan betul. Projek pemanasan daerah di beberapa negara menangkap haba sisa pusat data melalui penukar haba dan menyalurkannya ke dalam rumah, melalui reka bentuk, kejuruteraan, dan kontrak. Satira di atas bukanlah tentang haba pelayan boleh memanaskan bilik; ia adalah melakukannya secara tidak sengaja dan memanggil ketidaksengajaan itu sebagai strategi.

Pelayan saya sudah kelihatan seperti ini. Apa yang perlu saya lakukan dahulu?

Sandaran, malam ini, ke tempat yang bukan pelayan tersebut, dan kemudian lakukan pemulihan ujian — sandaran yang tidak diuji hanyalah khabar angin. Kedua, tampalan (patches) dan reboot yang anda telah elakkan, dalam slot masa yang dirancang, supaya anda belajar apa yang rosak semasa anda memerhatikannya. Ketiga, pecahkan titik kegagalan tunggal (single point of failure): pindahkan DNS dan pemantauan keluar dari mesin tersebut. Segala-galanya yang lain boleh menunggu minggu yang lebih tenang; tiga perkara ini tidak boleh.

#satire#datacenter#efficiency#self-hosting