ソウル永登浦区(ヨンドゥンポ)にあるNHN FactoryX(エヌエイチエヌ・ファクトリーエックス)ソウルデータセンターの6階データホールに入ると、黒色のグラフィック処理装置(GPU)ラックが一定の間隔を空けて長く並んでいる様子がまず目に入った。数多くの製造装置が稼働する「ウィーン」という音が空間を満たし、壁面からはひんやりとした風が絶え間なく吹いていた。
今月6日に訪問したNHN FactoryXは、NHN Cloud(エヌエイチエヌクラウド)のAIインフラ運営のための核心拠点であり、高性能コンピューティングインフラを運営する人工知能データセンター(AIDC)だ。政府事業を通じて造成されたAIインフラで、NVIDIA(エヌビディア)のB200 GPU計7,656枚を基盤に構築された。
グローバルインフラ投資会社Actis(アクティス)が投資したデータセンター内に位置し、データセンター全体の半分にあたる3階から6階までを活用する。NHN FactoryXの3~5階は政府AIコンピューティング資源を運営する空間であり、6階はNHN Cloud独自のAIクラウドサービスとGPUインフラ運営に活用する。全体のIT負荷は13MW規模だ。
特に3・4階にはB200 GPU4,080枚(510ノード)を一つの演算環境として連結したクラスター1が構築された。このクラスター1は、世界のスーパーコンピュータ性能ランキング「TOP500」で世界20位を記録した。5階には2,040枚(255ノード)規模のクラスターが設置されている。6階は192ノード規模だ。

NHN FactoryXソウルGPUサーバー前面部
このデータセンターは、大規模なNVIDIAのB200 GPUを運用するために水冷方式を活用している点が特徴だ。全フロアに直接水冷式(DLC)冷却方式を適用した。GPUと中央処理装置(CPU)などにコールドプレートを直接接触させ、液体冷媒を循環させて熱を排出する方式だ。
イ・イルジュンNHN Cloud理事は「大規模なGPU資源を水冷ベースで運営するのは、韓国内ではNHN Cloudが初めてだろう」とし、「サーバーで発生する熱の約70~80%をGPUとCPUが占めるだけに、これらの部品は水冷で冷却し、メモリやネットワークカード、InfiniBand Switch(インフィニバンドスイッチ)、ストレージなどは空冷で冷やす方式」と説明した。
イ理事は、水冷適用によりGPUサーバーの電力消費を減らせると強調した。B200製造装置は空冷方式では約14.3kWの電力を要するが、水冷適用時には約12.3kWまで下がるとの説明だ。
一角に設けられたデータセンター管制室では、職員がGPUとネットワークの状態などを大型モニターで実時間確認・管理していた。製造装置の使用率や障害の有無をはじめ、ネットワーク、ストレージ、データセンター環境などを監視する。GPUが長時間稼働するため、データセンター管制室は24時間運営される。
イ理事は「冷却水が適時に供給されなかったり、温度が過度に上昇したりすると、GPUの発熱を十分に冷やせず性能が低下する恐れがある」とし、「温度がさらに上がるとGPUが自らシャットダウンするため、冷却水の温度と圧力、流量、漏水の有無まで別途モニタリングしている」と説明した。
セキュリティ体系も徹底して整えた。政府事業のセキュリティ要件を反映するため、ネットワークを既存のNHN Cloud環境とは別に構成し、ファイアウォールとDDoS対応装置、攻撃パターン検知・遮断(IPS)、管理UTMなどを基盤に階層的防御体系を構築した。

NHN FactoryXソウル管制室
<画像=NHN FactoryXソウル内部全景>

