簡潔に言うと、 AIデータセンターとは、 高密度な 施設です。チップは注目されますが、 建物の 決まります。画像データを外部に持ち出せない場合は、スモールセルを後付けで設置する必要があります。ほとんどのチームはレンタルで十分でしょう。
重要なポイント:
チップ対構築:電力、冷却、ファブリック、ストレージが、アクセラレータが機能するかどうかを決定づける。
宮殿ではなく場所を:データが外部に持ち出せない場合は、ラックを2つ後付けする。キャンパスを購入する必要はない。
平均値と中央値:8回の実行で中央値がリセットされるため、18時間平均値を使用します。
誤用防止:混合ホールで2つのラックに対してPUEを算出しないでください。
具体例:8回の実行は小さなマップであり、50%の生産削減を意味するものではありません。

この記事の次に読むとよい記事:
🔗 AIは信頼できるのか?動画とクイズで
AIの信頼性を探ってみよう。魅力的な動画とインタラクティブなクイズを通してAIの信頼性を探ります。
🔗 日常生活でAIを活用する方法
AIが日常のタスクやルーチンを簡素化できる実践的な方法をご紹介します。
🔗 職場でAIを活用する方法
職場での生産性を向上させるためのAIの実践的な活用方法を学びましょう。
🔗 AIは自ら考えることができるのか?
人工知能が本当に独立して考えたり、推論したりできるのかどうかを理解しましょう。
「通常の」データセンターとの違い
従来のホールは、多数の小規模サービスにおける多様なワークロードと稼働時間を最適化します。冗長性はもちろん重要ですし、PUE( 1ワットのコンピューティング能力を提供するために建物が消費する余分なエネルギー)。しかし、通常は、移動式ヒーター群のように振る舞うラックを中心にすべての廊下を設計することはありません。
AIサイトは比率を逆転させる。密度が上昇する。ネットワークは、トレーニング作業が滞りなく進むために不可欠な基盤となる。ストレージはチェックポイントを常に稼働させ続けなければならず、そうでなければアクセラレータは交通渋滞に巻き込まれた競走馬のように遊休状態となる。.
文化的な違いもある。エンタープライズ運用担当者はチケットと変更ウィンドウを重視する。一方、AI運用担当者はジョブキューと、長時間実行中にノードがダウンしたときの不安感を重視する。どちらも「データセンター」と呼ぶことはできるだろう。なぜなら、実際どちらもデータセンターだからだ。ただ、ラベルが内部構造を隠しているだけだ。.
| タイプ | 何のために作られたのか | 際立ったハードウェア | 電力/冷却特性 | 誰に適しているか | なぜそれが存在するのか |
|---|---|---|---|---|---|
| 従来のエンタープライズデータセンター | 混合IT:データベース、仮想マシン、電子メール、ファイル | CPU、一般的なサーバー、馴染みのあるストレージ | 空気主導型;適度な密度;PUEが話題の中心; | 日常的なシステムを運用する企業 | ビジネスアプリを稼働させ続ける |
| AIトレーニングクラスター | 長期間にわたり、密接に連携した研修業務 | 高密度アクセラレータラック、GPUインターコネクト | 高密度、液冷式または[リアドア熱交換器](https://datacenters.lbl.gov/sites/default/files/rdhx-doe-femp.pdf) | 研究室や模型製作者たちは、仕事待ちの列に並んでいる。 | チップを飢えさせずに実行を完了する |
| AI推論機能 | モデルによるサービス提供、リアルタイムおよびバッチ応答 | アクセラレータ、重要なロードバランサー | 相変わらず熱いが、以前ほど劇的ではなく、圧倒的な密度よりも遅延が重視されている。 | 今すぐ答えを出さなければならない製品 | モデルをユーザーの近くに置く |
| ハイブリッドAIホール | 訓練と勤務を同じ場所で行える。まあ、ある意味では。 | 混合ラック、フェンス付きプール、共有ファブリック | 同じ機械室に冷淡な性格の人が二人いると、気まずい雰囲気になる。 | 2つのキャンパスを所有する余裕のないチーム | 資本は有限であり、人生は混沌としている。 |
これは道徳的な順位付けではありません。異なる機械でも、同じファミリーネームです。.
GPU、アクセラレータ、そして電力消費の激しいラック
従来の二重床を歩くと、棚はどこか礼儀正しく見える。しかし、AI(自動棚)の列を歩くと、棚は建物を飲み込もうとしているように見える。.
際立ったハードウェアは、高性能なCPUではなく、アクセラレータトレイです。GPUやその他のAIチップがサーバーに詰め込まれ、ラックに配置され、高帯域幅ファブリックを共有する列へと構成されます。GPUインターコネクト チップをつなぎ合わせて巨大なアクセラレータのように見せかけます。クラスタファブリックは、列規模で同様の役割を果たします。並列トレーニングは、これらのリンクが太く予測可能な状態を維持している場合にのみ機能します。それが失われると、「クラスタ」は、同じ郵便番号を共有する高価なワークステーションの山になってしまいます。
電力はチップに追随する。分厚いオフィス用PDUではない。ホールが満杯になると、メガワット級のIT負荷が発生する。具体的な数字はここでは挙げない。ラックあたりの密度が重要なポイントだ。ラックの数は少なく、それぞれが小型の炉となる。制限要因はGPUの希望リストではなく、変電所であることが多い。よくある話だが、調達部門はアクセラレータをもっと欲しがり、電力会社は長々とした話し合いと高額な小切手を要求する。.
ちょっと馬鹿げた比喩かもしれませんが、どうしても頭から離れないのが、鶏小屋は飢えた動物だということです。より速い鶏を繁殖させることはできますが、それでも餌を与え続けなければなりませんし、暑さをしのぐための掃除も必要です。どちらかを怠れば、ただの高価な文鎮になってしまいます。.
電力、熱、そして冷却の問題
電気が入ってきて、熱が出てくる。それが宗教のすべてだ。.
高密度ラックは、空気が本来処理すべきではない方法で熱を放出します。後部ドアの熱交換器、高温通路、巧妙な封じ込めなど、空気をより強力に制御することはできますが、それにも限界があります。そして、液体が問題となるのです。
-
冷却ループがプラント室を化学工場のように見せている
-
いくつかのデザインに没頭すると、水とサーバーが同じ文章に出てくるべきではないと考える人々をいまだに驚かせる。
どれも華やかなことではない。すべてが製品そのものなのだ。なぜなら、スロットルが制限されるアクセルは、すでに代金を支払ったにもかかわらず、十分に活用できないものだからだ。.
PUEは依然として重要です。これは比率であって、人格ではありません。オペレーターがPUEを追い求めるのは、ファンやポンプに費やされる1ワットは、GPUに使われなかった1ワットだからです。「典型的な」数値は引用しません。気候や境界線の引き方によって数値は変動し、偽の精度は全くないより悪いからです。水もこの話に関わってきます。植物の中には少しずつ水を吸い上げるものもあれば、ごくごくと水を吸い上げるものもあります。 蒸発冷却は、 川の水位や干ばつによって政治的な問題になるまでは効率的です。
ネットワーク:チップと同じくらいファブリックが重要な理由
人々はGPUを撮影するが、スイッチも撮影すべきだ。.
トレーニングは対話です。何千ものアクセラレータが、勾配、パラメータ、モデルの断片を緊密に同期させながら交換します。ファブリックが不安定になると、ジョブ全体が最も遅いホップで待機状態になります。そのため、AI開発チームは、高帯域幅ネットワーク、低遅延、そしてリンク障害時にネットワークが崩壊しないトポロジーにこだわるのです。InfiniBand のようなファブリック、同じ役割を担うイーサネット、筐体内部のGPUインターコネクト、そして最初から正しく配線されなければならないケーブル配線。
推論はまた別の話です。モデル配信では、平均応答ではなく、応答の遅い方の遅延、つまりテールレイテンシが重要になります。バッチ処理とリアルタイム処理では、性質が異なります。トレーニングクラスタは、 規模で集団的な、ほぼ全対全の通信を。一方、配信群は、ロードバランサーでのトラフィック渋滞を防ぎつつ、多数の小規模なリクエストと分離性を必要とします。
私がここにいる間に気づいたのは、人々がネットワークを配管設備、チップをレストランのように扱っている点です。この建物では、配管設備こそがレストランなのです。その点を理解していないと、デリバリーに対応できないキッチンを買ってしまうことになります。.
トレーニングと推論:2つの建物、時には文字通り
トレーニングは一大作戦だ。クラスターを構築し、データを入力し、定期的にチェックポイントを設定し、数時間から数週間実行し、ファブリックが何事もなく動作し続けることを祈る。バッチ処理が多く、帯域幅を大量に消費し、静かに辛抱強く待つ――しかし、ノードの障害が発生すると、実行に大きな影響が出る。密結合ジョブにおいて、アクセラレータが1つ故障するだけで、システム全体が停止してしまう可能性がある。.
推論は、いわば店頭のようなものだ。既に学習済みのモデルが、質問に答えたり、画像を分類したり、テキストを生成したりする。レイテンシは重要だ。顧客の近くに設置された少し古いアクセラレータが、遠く離れた大陸にある最新鋭のアクセラレータよりも優れた性能を発揮することもある。.
つまり、二極化が進むわけです。トレーニングキャンパスは電力、土地、そして高密度化を追求し、推論サイトはレイテンシとプレゼンスを追求します。資本は無限ではないので、ハイブリッド型のホールも存在します。ただし、必ずしも2つの建物とは限りません。時には、ベルベットのロープで仕切られた1つのホールに2つの冷却ループが設置されていることもあります。.
ここは、コロケーション、ハイパースケールキャンパス、オンプレミスが分岐する地点でもあります。ハイパースケーラーは、私たちが家具を配置しているように見えるほどの規模で構築を行います。コロケーションは、ラック単位で密度を販売します。オンプレミスは、データが外部に持ち出せない場合に依然として使用されます。.
ストレージのスループット、チェックポイント、そしてハングリーチップ
誰もパンフレットの表紙に並列ファイルシステムを載せたりはしない。.
トレーニングデータは、GPUが処理に追われることなく、十分な速さで到着する必要があります。チェックポイントは、クラッシュが発生しても1週間分のデータが無駄にならないように、確実に取得されなければなりません。モデルの重みは、サービスレプリカが稼働する前にロードされる必要があります。ストレージのスループット(容量だけでなく)こそが、静かなボトルネックなのです。アクセラレータに莫大な費用をかけても、仮想マシン向けに設計された控えめなアレイでは、アクセラレータの性能を十分に引き出せません。.
見慣れたパターンだ。ピカピカのクラスタ、ジョブキュー、そしてまるで無礼な請求書のようにじっと見つめ返すI/O待機。データパスをクラスタ化せずにコンピューティングをクラスタ化すると、非常にコストのかかるアイドル状態が発生する。チップに常に電力を供給し続けるか、彫刻を買ったことを認めるかのどちらかだ。.
ソフトウェア、オーケストレーション、そして地味な運用レイヤー
主役はハードウェア。実際の作業はスケジューラーが行う。.
ジョブがGPUを見つけられなかったり、2つのチームがクラスターを共有しようとして衝突したり、故障したランクを交換できなかったり、ファームウェアが徐々に劣化してファブリックがゆっくりと故障したりするような状況では、AIデータセンターは役に立ちません。オーケストレーション、可観測性、電力制限――地味な運用レイヤーこそが、その重要性を物語るのです。.
私はこの層に特別な思い入れがあります。それに、設定ミスのあるNICが冷却系の問題であるかのように装って丸一日もかかるなんて…そういうことは、苦労して初めて気づくものですよね。.
ノードが実行中に故障した場合
ノードがダウンする。変更ウィンドウは、カレンダーを気にしないトレーニング実行と依然として衝突する。大規模なジョブをまとめてスケジュールし、推論プールをフェンスで囲み、「ジョブが遅い」ように見える障害に対する実行手順書を作成し、最終的に「ジョブが停止した」ように見えるまで続ける。冗長性(電源、冷却、パス、ストレージ)は依然として重要だが、障害モードは、かつての9分の1の稼働率のスライドほど整然とはしていない。推論:レプリカを作成し、故障したノードをドレインし、応答を続ける。トレーニングには、楽観主義ではなくチェックポイントが必要である。.
立地、水、電力網、そして近隣住民
景色を楽しむために、こんなものをコテージのそばに置くべきではない。.
送電網への接続こそが、真の立地選定プロセスとなることが多い。変電所や、他の顧客を抱える電力会社に比べれば、土地の確保は容易だ。冷却用の水を使用する場合、大雨が降るとすぐに近隣住民との問題になる。騒音、景観上の問題、境界フェンス付近の熱問題。計画委員会は、発電設備に土地と川が必要になった途端、「クラウド」に関する様々な意見に直面する。
レイテンシは逆の方向に作用します。推論はユーザーや相互接続に近い場所を好みます。トレーニングは電力価格の安い地域や涼しい気候の地域に隠れることができます。業界では、まるで完璧なサイトが一つだけ存在するかのように語られますが、そんなものはありません。プレスリリースには妥協点が示されています。.
余熱と招かれざる暖房器具
パンフレットにはこの部分がよく出てくる。「廃熱を住宅、プール、温室に供給する」――実に魅力的な文章だ。地域循環が実際に機能する場合もある。しかし、キャンパスの位置が悪く、熱が大気中に放出されてしまう場合もある。私はパンフレットの記述には懐疑的だが、物理的な原理には疑念を抱いていない。.
誰が必要とするのか(そして誰がレンタルすべきなのか)
ほとんどの人は、このようなホールを所有する必要はない。.
率直なリスト:
-
ハイパースケーラーは、製品がフリートであるため
-
ラボでは、待ち時間がボトルネックになっている場合、またはデータが送信できない場合
-
銀行、病院グループ、政府、または秘密データセットを持つ製造業者にとって、オンプレミス環境やプライベートコロケーションケージは、手間がかかるとしても合理的な選択肢となり得る。
他の人はレンタルすればいい。AI対応の高密度なコロケーション。クラウド予約。マネージドクラスター。発電所のオペレーターにならずともアクセラレータを利用できる。午前3時に冷却ループのオンコール担当者は誰かと聞かれた瞬間、そのロマンは消え失せる。.
正直に言うと、プライドの問題もある。クラスターを所有することは、予測手段を所有しているような気分になる。ところが、電気料金の請求書が届くと、そのプライドはたちまち崩れ去る。.
この建物は何のためにあるのか
では、AIデータセンターとは何でしょうか?それは、アクセラレータ、電源、冷却装置、ファブリック、ストレージが、モデルのトレーニングとサービス提供を中心に構成された、高密度で特殊なキャンパスです。隅にGPUが置いてあるような汎用IT施設ではありません。見た目は倉庫のようですが、動作は計算を行う発電所のようです。.
他に何も覚えていなくても、これだけは覚えておいてください。名声を得るのはチップですが、変電所、冷却装置、そしてネットワークが、そのチップが本当に良いアイデアだったのかどうかを左右するのです。トレーニングと推論は同じ屋根の下で行うことができますが、それでもそれぞれ異なるマナーを求めています。ほとんどの組織は賃貸で済ませるべきです。ごく一部の組織は自社ビルを建てるべきでしょう。いずれにせよ、近隣住民は気づくでしょう。.
雲には昔から建物があった。今では、その建物が意見を持つようになった。.
実例:画像が外に出られない2ラックのトレーニングセル
シナリオ
トモスは、ウェスト・ミッドランズにある従業員400名の製造会社、ケストレル・プレシジョンのインフラ責任者です。同社は既に小規模なオンプレミス環境を所有しており、ERP、ファイル共有、仮想マシン、そしてこの記事の冒頭で紹介したような様々な機器が混在する環境が整っています。空調設備、一般的なイーサネット、そしてオフィス用ディスクに最適なSANも備えています。.
マシンビジョンチームは、工場の静止画を使って検査モデルをトレーニングする必要がある。静止画は現場から持ち出すことができない。静止画は、会社がプライベートクラウドであってもクラウドに保存しない工程を示している。調達部門の解決策は、デュアルアクセラレータサーバー4台と「当社のAIデータセンター」と題されたスライドである。サーバーは既存のラック2台に設置される。スペースに余裕があり、スペースが制約要因だと感じられたためだ。.
そうではない。2週間も経たないうちにGPUはビジー状態になり、その後静かにスロットリングする。チェックポイントがSANに到達するとジョブは遅くなる。11時間目にノードがダウンし、実行は…消えてしまった。トモスはチップの購入に失敗したわけではない。彼は同じ郵便番号を共有する高価なワークステーションを山ほど購入したのだ。その建物は依然として企業向けホールだった。.
彼らに必要なのは、キャンパスも、新しい変電所も、川もない。必要なのは、ミニチュア版AIデータセンターのような小型セルだ。ラックが実際に保持できる電力、チップを加熱することなく熱を逃がす仕組み、トレーニングジョブが通信できるファブリック、チェックポイントを保存できるストレージ、そしてノードがダウンした時のためのランブック。イメージは外部に持ち出せないため、40分も離れたコロケーションケージを借りるのは解決策にならない。2つのラックを改造するのが正解だ。.
細胞が必要とするもの
-
その列の電力予算は、GPUの希望リストではなく、PDUから測定した値です。予備容量がトレーニング負荷時に4台のサーバーに電力を供給できない場合、そこで話は終わり、奇跡ではなく、より高密度なコロケーションを検討します。
-
空気の冷却は、この密度に対応する必要はこれまでありませんでした。ホールに余裕があれば背面ドアの熱交換器、余裕があれば小型の液冷ループを使用します。どちらもできない場合は、サーバーは設置されません。
-
4つのノード間には、オフィスイーサネットではなく、専用の高帯域幅ファブリックが必要です。ベンダーのカタログに10Gbスイッチしかない場合、それはクラスタではありません。
-
チェックポイントとトレーニングシャード用のローカル高速ストレージ(VM SANではない)
-
スケジューラ、チェックポイント間隔、および書き込まれた再起動パス。ハードウェアは主役。このレイヤーが仕事です。
-
工場ライン用のフェンスで囲まれた推論ボックスは、トレーニングの雑音とは分離されている。なぜなら、サービス提供にはテールレイテンシと分離が必要であり、集団的な雑音は必要ないからである。
-
電力、GPUクロック、スロットリングイベント、ジョブ実行時間を記録する権限。これらを検査できない場合、GPUの写真を撮影するだけで、スイッチを見落としてしまう可能性がある。
指示例
トモスはこれを施設概要書の中で、平易な言葉で次のように述べている。
これをAIキャンパスとは呼ばないでください。既存のホールに、デュアルアクセラレータサーバー4台用の2ラック構成のトレーニングセルを構築してください。工場出荷時のイメージは現場に残しておきます。成功の条件は、4つのノードがサーマルスロットリングなしで12エポックの検査トレーニングレシピを完了し、チェックポイントを数分で書き込み(数十分ではなく)、意図的にランクを終了させたときにそのチェックポイントから再開することです。冷却はGPUをトレーニングクロックで動作させる必要があります。ネットワークは、オフィススタックを通る経路ではなく、4台のボックスが共有するファブリックである必要があります。ストレージはチップに電力を供給する必要があります。リアドアの熱交換器が収まらない場合は、その旨を伝えて中止してください。混合ホールの2ラック構成のPUEを引用しないでください。その数値は劇場のようなものです。.
そして彼はこれを研修業務そのものに盛り込んだ。
30分ごとにローカルの高速プールにチェックポイントを設定してください。ランクが死亡した場合は、最後に完了したチェックポイントから再開してください。SANで待機しないでください。熱でクロックが低下している間はトレーニングを続けないでください。ログを記録して停止し、停止状況を確認できるようにしてください。.
良い1時間はこんな感じです。8つのGPUすべてがトレーニングクロックで動作し、チェックポイントファイルが書き込まれ、ジョブは同期を保っています。悪い1時間はこんな感じです。ファンがフル回転し、クロックが低下し、10分経ってもチェックポイントの書き込みが2%しか進まず、オフィスの誰かが「クラスターが起動しました」と言っています。起動しているということは、トレーニングしているという意味ではありません。.
テスト方法
彼らは改修工事の前にテストを作成する。それがデモを信用しない理由の核心だ。.
-
同じ12エポックのレシピ、同じ12万枚の検査静止画、8回の実行
-
タイミングは、ジョブの投入からエポック12の最後のチェックポイントまでの時間で計測され、再起動も含めたレシピ完了までの実時間です。
-
熱に関する合格基準:GPUクロックは実行中、トレーニング目標値に維持されます。スロットリングが発生した場合は、ジョブが最終的に完了しても失敗とみなされます。
-
ストレージに関する検証:ジョブログからのチェックポイント書き込み時間、中央値、および最悪値
-
生地の通過:ランクが健全な間は、仕事は集団待機状態にならない。彼らがその待機状態を認識できない場合、計装は完了しない。
-
8回の試行のうち2回は、再起動パスをテストするために、意図的に特定のステップでランクが倒される。
-
推論は、工場ラインからフェンスで囲まれたサーブボックスまでの200枚の画像による独立したテストです。トレーニングの成功はサーブの成功とはみなされません。
-
彼らはPDUからラック電力を15分間隔で記録しているので、誰もメガワットを発明する必要はありません。
セルを「AI対応」と認定するための条件:8つのレシピすべてが完了、8つのうち0つでサーマルスロットリングが発生、停止した両方の実行が再開、チェックポイントは分単位で維持される。もしこの条件を満たせなくても、高性能グラフィックカードを備えたサーバー室は健在だ。.
結果
これは、架空の8回の試験による例示的な結果であり、公表されているケストレル社の数値ではありません。.
前提条件: 2 つのラックに 4 台のデュアル アクセラレータ サーバー。1 つの検査モデル。12 万枚の静止画像。固定された 12 エポック レシピを 8 回実行。実時間には、レシピが完了するまでの再起動が含まれます。スロットルとは、トレーニング クロックからのログに記録されたドロップを意味します。チェックポイント タイムは書き込みであり、希望ではありません。ラック パワーは、キャンパス PUE ではなく PDU サンプルです。.
改修前は、オフィスイーサネットとVM SAN上の通常の空冷ラックに設置されたGPUは以下のとおりでした。
-
8回の挑戦のうち5回は初回で完走した。その5回の平均所要時間は14時間だった。
-
8つのうち3つは、約11時間後に停止したため、やり直さなければなりませんでした(2つは古いチェックポイントでノードがダウンした後、1つはチェックポイントがSANをいっぱいにした後)。すぐに再試行し、一晩待つことはありませんでした。11時間が無駄になり、さらに14時間の2回目の試行が必要となり、その3つのレシピを完成させるまでに合計25時間かかりました。
-
全8レシピ(再開を含む)の平均完成時間:18時間。(5レシピは14時間、3レシピは25時間。8レシピ全体の中央値は14時間であり、再開分が隠れてしまう。そのため、ここでは平均値を基準値としている。)
-
8回の試行のうち7回でサーマルスロットリングが記録された。クロック速度が低下した時間の平均:14時間の試行で3時間。
-
チェックポイント書き込み:中央値 22分
-
ランクキルは彼らが合格できるテストではなかった。彼らにはマニュアルがなかった。2人の偶発的な死が発見された。
-
トレーニング中の2つのラックのピークIT負荷は約18kWでした。この列にはワット数がありましたが、冷却機能やファブリックはありませんでした。
これら2つのラックの背面ドア式熱交換器、4つのノード間の専用ファブリック、チェックポイント用の小型NVMeプール、30分ごとのチェックポイント処理、および再起動手順書に続いて:
-
8人中8人が初回で完走。平均所要時間:9時間
-
サーマルスロットリング: 8件中0件
-
チェックポイント書き込み時間:中央値90秒。最悪時間:3分
-
意図的なランクキル2回は、いずれも最後の30分チェックポイントから再開された。その2回のプレイには、診断を含めてそれぞれ約40分余計にかかったため、合計で約9時間40分かかった。8ラウンドの平均は9時間。
-
IT負荷のピークは依然として約18kW。チップは同じ。建物の挙動が異なる。
このサンプル全体で、レシピ完成までの平均時間は18時間から9時間(各9時間、8回の試行で合計72時間)に短縮されました。初回で完成した回数は8回中5回から8回中8回に増えました。スロットルは8回中7回から8回中0回に減りました。最後の数字は、彼らが加速剤を買ったのか文鎮を買ったのかを示しています。彼らは時間の変化を生産量の50%削減とは呼ばないでしょう。8回の試行は小さくて簡単なセットです。.
これらの数値は、記載されたテスト、小規模なサンプル、1つのモデル、および1つの混合ホールに基づいた推定例です。これらはPUEでも、キャンパスのメガワットでもなく、ケストレルが野外にトレーニングサイトを建設すべきであるという証明でもありません。ログのレビューは9時間以内に行われ、彼らはそれを隠蔽していません。18kWという数値は、PDUの読み取り値を丸めたものであり、電力会社の請求書ではありません。72時間をコストに変換しなかったのは、工場の混合電力料金では偽のビジネスケースになってしまうからです。.
サービングチェックは別々に行われ、規模も小さかった。フェンスで囲まれたボックスに200ラインの画像が表示され、すべてその場で行われた。これは推論であって、訓練ではない。この2つを混ぜてしまうと、ハイブリッドホールの失敗を縮小したようなものになっていただろう。.
何が問題になる可能性があるか
-
調達部門は4台のサーバーを「AIデータセンター」と呼び続けている。その名称は内部の配線を隠蔽しており、次の購入品は同じような問題を抱えた機器のためのGPUの追加購入だ。
-
後部ドアの熱交換器が設置されるが、誰も水側の試運転を行わない。ファンは相変わらず鳴り響き、時計は相変わらず下降する。
-
このファブリックは予備経路のない単一のスイッチで構成されています。リンクが1つ故障すると、「クラスタ」は再び4台のワークステーションになってしまいます。
-
NVMeプールが「フェーズ2」であるため、チェックポイントはSAN上に残ります。フェーズ2は次のノードが停止する前には到達しません。
-
彼らは混合ホールの2つのラックのPUEを提示している。気候、境界、およびERP列の残りの部分は、その比率をコスチュームにする。
-
トレーニングとサービスは同じ基盤を共有している。チェックポイントの洪水は工場ラインを待たせる。テールレイテンシは密度ではなく、そこにある製品である。
-
ノードがダウンしたのに、誰かがチェックポイント再起動ではなく稼働状況チケットとして処理する。エンタープライズ運用チームとAI運用チームは午後いっぱい、互いに話が噛み合わない。
-
彼らは檻を借りることもできたはずだが、映像は外に出ることができない。その制約を忘れると、彼らはクラウド上の会話に陥り、それを解きほぐさなければならなくなる。
実践的な教訓
この形態のAIデータセンターとは、倉庫でもなければGPUの請求書でもありません。それは、アクセラレータが処理を完了できるセル、つまり、保持できる電力、放出される熱、ファブリック、チェックポイント、そしてランクが停止したときに責任を負う担当者を備えた場所です。Kestrelはキャンパスを必要としませんでした。彼らが必要としたのは、見せかけをやめるための2つのラックでした。ほとんどのチームは、そのような行動をレンタルすべきです。秘密のデータセットと熱に耐えられるホールを持つ少数のチームは、セルを構築し、スライドを拒否すべきです。.
よくある質問
AIデータセンターとは何ですか?
電力、冷却、ネットワーク、ストレージが、汎用サーバーが整然と並ぶのではなく、並列トレーニングとモデル提供を中心に設計された高密度コンピューティングサイト。膨大な数のアクセラレータが、過熱したり、ネットワークが停止したり、ディスク待ちになったりすることなく、モデルをトレーニングおよび提供できるように設計されています。一般的な企業向けホールは、様々な業種が混在する地域です。一方、AIホールは、GPUやTPUのようなアクセラレータを価値単位とする単一文化の空間です。倉庫のような外観を持ち、数学演算を行う発電所のように機能します。.
AIデータセンターは、通常のデータセンターとどのように異なるのでしょうか?
従来のデータセンターは、多数の小規模サービスにわたる多様なワークロードと稼働時間を最適化します。AIサイトではその比率が逆転します。密度が高まり、ネットワークはトレーニングジョブに不可欠な基盤となり、ストレージはチェックポイントを常に稼働させ続けなければ、アクセラレータはアイドル状態になります。エンタープライズ運用ではチケットと変更ウィンドウが重要視されますが、AI運用ではジョブキューと、長時間の実行中にノードがダウンしたときの不安感が重要になります。どちらもデータセンターと呼ぶことができますが、ラベルは内部構造を隠しているだけです。.
AIデータセンターはなぜこれほど多くの電力を消費するのか?
際立ったハードウェアは、高性能なCPUではなく、アクセラレータトレイ、つまりGPUやその他のAIチップがサーバーに詰め込まれ、ラックに配置され、高帯域幅ファブリックを共有する列になっている点です。特筆すべきはラックあたりの密度です。ラックの数は少なく、それぞれが小型の炉のような役割を果たします。ホールが満杯になると、メガワット級のIT負荷が発生しますが、典型的な数値を考案する価値はありません。制限要因となるのは、多くの場合、GPUの希望リストではなく、変電所です。.
AIデータセンターはどのように冷却されるのですか?
高密度ラックは、空気が本来処理すべきではない方法で熱を放出します。リアドアの熱交換器、高温通路、巧妙な封じ込めによって、空気をより強力に送ることができます。次に液体が登場します。チップへの直接冷却、冷却ループ、いくつかの設計での浸漬です。スロットリングが発生するアクセラレータは、すでに支払ったのに完全に使用できないものです。ファンとポンプに費やされたワットはすべてGPUに使われなかったワットなので、PUEは依然として重要です。水もこの話に登場します。植物の中には少しずつ吸うものもあれば、ごくごく飲むものもあります。.
ネットワークはなぜGPUと同じくらい重要なのでしょうか?
トレーニングは対話のようなものだ。何千ものアクセラレータが、勾配、パラメータ、モデルの断片を緊密に同期させながら交換する。ファブリックが不安定になると、ジョブ全体が最も遅いホップで待機してしまう。だからこそ、AI開発部門は、高帯域幅ネットワーク、低遅延、InfiniBandのようなファブリックやイーサネットといった役割、そしてリンク障害時にネットワークが分断されないトポロジーにこだわるのだ。推論では、テールレイテンシ、多数の小さなリクエスト、そして分離性が重要となる。この建物では、配管設備がレストランのような役割を果たしている。.
AIデータセンターは、トレーニングと推論のどちらに使用されますか?
トレーニングはキャンペーンのようなものだ。クラスタを組み立て、データを与え、定期的にチェックポイントを設定し、数時間から数週間かけて実行する。推論は店頭のようなものだ。すでにトレーニング済みのモデルが、重要なレイテンシを伴いながら応答する。トレーニングキャンパスは電力、土地、密度を追い求める。推論サイトはレイテンシとプレゼンスを追い求める。資本は無限ではないため、ハイブリッドホールが存在する。時には1つのホールに2つの冷却ループが設けられることもある。顧客に近い少し古いアクセラレータが、大陸を隔てた華やかなアクセラレータに勝ることもある。.
AIデータセンターにおいて、ストレージが重要な理由とは?
トレーニングデータは、GPUが処理に追われることなく、十分な速さで到着する必要があります。チェックポイントも確実に取得されなければ、クラッシュによって1週間分のデータが無駄になることはありません。モデルの重みは、サービスレプリカが稼働する前にロードされなければなりません。ストレージの容量だけでなく、スループットも、実は静かなボトルネックなのです。アクセラレータに莫大な費用をかけても、仮想マシン向けに設計された控えめなアレイでは、その性能を十分に引き出せません。.
実行中にノードが故障した場合、どうなりますか?
密接に連携したトレーニングジョブにおいて、アクセラレータが1つでも故障すると、処理全体が停止してしまう可能性があります。トレーニングには楽観主義ではなく、チェックポイントが必要です。推論は故障したノードの負荷を軽減し、レプリカが応答し続けることで、稼働状態を維持します。変更ウィンドウは、カレンダーを気にしないトレーニング実行と依然として衝突します。冗長性は、電力、冷却、パス、ストレージにおいて依然として重要ですが、障害発生時の状況は、かつての9割稼働率のスライドほど整然とはしていません。.
AIデータセンターは、電力網、水資源、そして近隣住民にどのような影響を与えるのでしょうか?
送電網への接続こそが、真の立地選定プロセスとなることが多い。変電所や、他の顧客を抱える電力会社に比べれば、土地の確保は容易だ。冷却用水を使用する場合、豪雨時には騒音、景観上の問題、境界フェンス付近の熱問題などとともに、近隣住民との問題となる。電力市場が安く、気候が涼しい地域に拠点を構えることも可能だ。一方、電力会社は利用者に近い場所を好む。完璧な立地など存在しない。プレスリリースには、妥協点が示される。.
AIデータセンターは自社所有する必要があるのか、それともレンタルで十分なのか?
ほとんどの人は、このようなホールを所有する必要はありません。ハイパースケーラーは、製品がデータ群そのものであるため、構築します。ラボは、キュー時間がボトルネックになっている場合や、データが外部に持ち出せない場合に構築します。銀行、病院、政府機関、または機密データセットを持つ製造業者は、オンプレミスまたはプライベートコロケーションケージを合理的に利用できます。それ以外の人は、AI対応コロケーション、クラウド予約、またはマネージドクラスターをレンタルするべきです。発電所の運営者になることなく、アクセラレーターを利用できます。.
参考文献
-
IEA - www.iea.org
-
LBNL - datacenters.lbl.gov
-
グリーングリッド - www.thegreengrid.org
-
LBNL - datacenters.lbl.gov
-
LBNL - datacenters.lbl.gov
-
アップタイム・インスティテュート - journal.uptimeinstitute.com
-
NVIDIA - developer.nvidia.com
-
NVIDIA - docs.nvidia.com
-
NVIDIA - docs.nvidia.com
-
NVIDIA - docs.nvidia.com
-
Google Cloud - docs.cloud.google.com