バックエンドは「ジョブを終えるため」のネットワークである
AIのバックエンドネットワークは、学習や推論の途中でアクセラレータ間のデータ交換をつなぐ。分析の単位は曖昧な「AIネットワーク」ではなく、一つの経路である。NICが電気信号を出し、leafが転送し、spineが別経路を選び、遠隔leafとNICが受け取る。リンクはパッシブ銅線、AEC、または両端の光トランシーバーとファイバーになり得る。媒体の選択は、ポート数、モジュール端点数、電源、現場で交換する部品の数を変える。
Arista は 7800R4 を、accelerated computing 向けを含むモジュラーuniversal spineとして示し、800G/400Gの高密度を掲げる。公開された36ポート800G line card表では、該当カードのスイッチ容量は28.8 Tb/s、バッファは32 GBである。製品ページはEOSのテレメトリ、EVPN-VXLAN、ルーティング、暗号化も挙げる。これらは利用可能なプラットフォーム属性の一次情報である。どの顧客がどのトポロジーを導入したか、何ポートを実装したか、どの光モジュール供給者を使うかまでは示さない。
- 1アクセラレータ -- NIC -- 800G leafポート
- 1 |\
- 1 | \ uplink:ファイバー + 両端のトランシーバー
- 1 | \
- 1 spine A spine B
- 1 | |
- 1 800G leafポート -- NIC -- アクセラレータ
- 1運用:EOSテレメトリ
- 2カウンター、キュー状態、損失、リンク健全性
市場規模の前にリンクを数える
2階層Closでは、選んだ設計に従って各leafは各spineへuplinkを持つ。まずポート算術をする。8台のleaf、4台のspine、各leafにアクセラレータ側800Gポート32本という教材用ファブリックを考える。各leafにspineごとに1本、計4本の800G uplinkを置くと、アクセラレータ側leafポートは 8 × 32 = 256 本、leaf-to-spineリンクは 8 × 4 = 32 本となる。その32本が光リンクなら、予備品、breakout、管理ポートを数える前のトランシーバー端点は 32 × 2 = 64 個である。
この数字は意図的に不完全である。ポートは未使用かもしれず、breakoutされるかもしれず、将来増設用に残るかもしれず、別の媒体で結ばれるかもしれない。シャーシの容量表示は、ポート実装率の報告ではない。次に問うべきなのは、トポロジー、速度、距離、運用方針が明記されているかである。それがなければ、スイッチ仕様をモジュール数や売上へ変換することは推測になる。
リンクの背後にあるハードウェア選択
800Gでは、ホスト側電気レーン、モジュールのフォームファクター、ファイバー種別、到達距離が、どの部品が認定対象になるかを決める。光リンクにはDSP、ドライバー、レーザー、受光素子、コネクター、ファイバー経路が加わり、スイッチとモジュール双方に熱予算がある。銅線やAECは短い経路を単純にできるが、到達距離とケーブル配線が制約になる。deep bufferのspineはトラフィック挙動やルーティング規模で選ばれることがあり、固定型は別の密度や設置面積で選ばれることがある。どちらも全ての設計に通用する規則ではない。
事業上の取り分も層で分ける。スイッチプラットフォーム側は、シャーシ、line card、EOS、保守の価値を取り得る。光エコシステム側は、モジュール、DSP、レーザー、組立、試験、ファイバーの価値を取り得る。システム統合側には据付と受入の仕事がある。ポート速度の上昇は層のミックスを変え得るが、誰が利益を得るかは自動的には決まらない。アーキテクチャ、供給者認定、出荷、会計上の売上認識は、調査表の別行に置く。
図だけで終わらせずに運用する
一つの明示したトラフィックパターンで、範囲を絞った実験をする。最初にトポロジー、ポート速度、リンク媒体、距離、モジュール温度、FEC/エラーカウンター、キュー占有、輻輳イベントを記録する。反復可能なcollectiveに似た負荷に対して、訂正不能エラーなし、損失または遅延が閾値内、といった受入条件を決める。次に変数を一つだけ変える。一部のleaf-spineリンクで認定済みopticsを替える、または負荷分散方針を替える。前後のカウンターとジョブの挙動を比べる。変化が出たら、変えた条件を書く。「800Gだから」または筐体のロゴのせいだと自動的に帰属させない。
障害と拡張の作業を先に設計する
ポート密度は、障害時の作業量も決める。一本のリンクが不安定なとき、原因はNIC、DAC/AEC、トランシーバー、コネクター、ファイバー、leaf、spine、設定、輻輳のどこにでもあり得る。交換部品を先に決めるのではなく、光レベル、FEC訂正数、CRC、温度、キュー、対向ポートを同じ時刻に採取して切り分ける。EOSのテレメトリを使えるという公開仕様は、この観測を設計に入れる理由になるが、特定顧客の障害率を示す資料ではない。
増設も同じ規律で扱う。新しいleafを増やす前に、各spineの空きポート、uplink本数、光配線経路、電源・冷却、breakout方針、予備モジュールを表にする。800Gのポートを400Gへ分割できるとしても、リンク数と端点数は変わる。容量が倍に見えても、ケーブル経路や光パネルが先に制約になることがある。従って「高密度だから需要が何倍」とは書かず、どのポートがどの速度・距離・媒体で実装されたかを観測可能な単位に戻す。
証拠の境界
Aristaの公式資料は、ここで挙げたline card密度とプラットフォーム機能を支える。顧客の発注、導入XPU数、利用率、光モジュール台数、供給者売上を支えるものではない。提供者のアーキテクチャは問いを作るための地図として扱う。導入と財務の問いには、日付を持つ別の一次記録を対応させる。
NETWORK / 仮想的な入力
ポートの名前と、役に立つ速度は違う。
800 Gb/sのポートに選んだ有効割合を掛けた仮想例。停止時間やオーバーヘッドを一つにまとめ、実測やプロトコルのモデルではありません。遅延、接続構成、再送、集団通信は別に測定が必要で、供給者の売上は予測しません。
出典
01自分のノート