表示速度だけではリンクを決められない

800Gというポート表示は、ケーブル、ホスト基板、光配線、ソフトウェアのどれでも同じ仕事量を運べるという約束ではない。1.6Tは合計速度を二倍にする表示だが、レーン数を増やす場合、電気レーンを高速化する場合、光の波長当たりの速度を上げる場合がある。難しさはスイッチASIC、パッケージからの配線、モジュールDSP、光エンジン、コネクタ、ファイバーの間で移動する。速度ロードマップは出荷予測からでなく、インターフェース予算から始める。

並列光通信では、合計速度はレーン数とレーン当たり速度の積として最初に考えられる。8本の100Gb/sレーンで800Gb/s、8本の200Gb/sレーンで1.6Tb/sになる。ただしこれは会計上の等式にすぎない。フレーミング、FEC、符号化、ブレークアウト、選んだ光規格が実際のペイロードと相互接続性を決める。OIFの実装合意一覧は名前の付いた電気・光インターフェースを確認する場所であり、任意のモジュールが特定のスイッチで認定済みだという証拠ではない。

アクセラレータからスイッチへ向かう光パスの模式図

信号予算を追う

ホストはASICからパッケージ配線、基板配線、コネクタを経てモジュールへ高速電気信号を送る。各境界で減衰、反射、クロストーク、雑音が受信波形の余裕を減らす。PAM4は四つの振幅レベルで一シンボルに二ビットを載せるので、二値方式より同じシンボル速度で多く送れる一方、振幅の余裕は小さい。受信側には等化、誤り訂正、許容チャネル損失の定義が必要になる。高速レーンは旧来のレーンを速くしただけではなく、より短い電気経路や別の再整形を求めることがある。

プラガブル光モジュール内では、電気レーンを回復・整形してレーザーまたは変調器を駆動する。光はファイバーを通り、反対側で検出、増幅され、電気レーンに戻る。データシートはこの連鎖を到達距離、ファイバー種、コネクタ、温度範囲、FEC条件と結び付けなければならない。800Gだけでは短距離マルチモード、単一モードのデータセンター接続、ブレークアウトかを区別できない。

具体例:表示速度を二重に数えない

800Gを32ポート持つリーフスイッチなら、前面ポートの生の合計は25.6Tb/sである。全ポートを1.6Tに替える案では51.2Tb/sになる。しかし、それはASICの実効転送能力、アップリンク構成、サーバー側NICの終端能力が二倍になったことを示さない。ASICのradixとレーン電気仕様、対応する分割モード、実際の配線長とファイバー、許容するFECカウンタ・リンク訓練・温度警報・再試行を順に確認する。

旧設計が8本の100Gで新設計が8本の200Gなら、本数は同じでも信号品質の課題が移る。16本の100Gなら、前面密度、ファイバー本数、コネクタが変わる。どちらが常に優れるわけでもなく、製造と運用の制約が違う。

限界とラボ

移行時は速度だけでなく試験計画が変わる。低温起動、繰り返し挿抜、リンク訓練、持続トラフィック中のエラーカウンタ、熱平衡、障害時の交換手順を確認する。スイッチ、NIC、ファームウェア、モジュール改版、ケーブルかファイバー、FEC、周囲温度を記録する。短時間の無エラー実演は、本番列の動作範囲を証明しない。

一つの候補リンクについて、ホストとポートモード、レーン数と速度、フォームファクタ、光規格、ファイバーと長さ、FEC、カウンタ、温度、交換手順を一枚にまとめる。不明は不明のまま残し、ラック図へ実配線を書く。これは設計レビューであり、到達距離や消費電力の測定結果ではない。最後に、採用可否の根拠と未確認事項を分け、後者を売上や性能の主張へ変えない。

さらに、レーン数を決める時には物理的な接続数だけでなく、どの場所でクロック回復と誤り訂正を行うかを記録する。FECが訂正した回数と訂正不能だった回数は違う信号である。前者が増えても直ちに停止とは限らないが、余裕が減っている仮説になる。リンクが起動するかだけでなく、長時間負荷、温度上昇、再起動、隣接ポートの稼働時に同じ観測を繰り返す。ポートのラベルをラック全体の有効帯域と読むには、オーバーサブスクリプション、アップリンク、集団通信のパターンも別途測定する必要がある。

実務では、候補モジュールの資料を一枚だけ読んで決めない。スイッチの対応表、NICの対応表、光規格、ケーブル配線図、運用チームの交換手順を突き合わせる。仕様が同じ速度を名乗っていても、フォームファクタ、ファイバー極性、ブレークアウト向き、ソフトウェア版が違えば、そのまま接続できない。設計変更の承認記録には、何を確認したかだけでなく、どの条件をまだ試験していないかも残す。

導入後には、当初の設計カードを実測記録で更新する。どのポートで何回再訓練したか、どの温度で訂正数が増えたか、交換した部材は何かを日付付きで残す。これにより、次の速度世代で同じ表示だけを比べず、実際に余裕を失った境界を追える。製品世代の違いと施設固有の配線問題も分けて記録する。

容量計画では、最も長いリンクと最も高温になるラックを先に選び、そこで合格条件を決める。平均的な短いリンクだけを根拠にすると、設置後に例外が集中する。計画上の数字、対応表に載る構成、施設で測った値を別欄に置く。

NETWORK / 仮想的な入力

ポートの名前と、役に立つ速度は違う。

560 Gb/s

800 Gb/sのポートに選んだ有効割合を掛けた仮想例。停止時間やオーバーヘッドを一つにまとめ、実測やプロトコルのモデルではありません。遅延、接続構成、再送、集団通信は別に測定が必要で、供給者の売上は予測しません。

出典

01
NVIDIA optical transceivers and cables ↗www.nvidia.com · unknown
02
NVIDIA XDR switch cable installation and CPO topology ↗networking-docs.nvidia.com · unknown
03
OIF implementation agreements ↗www.oiforum.com · unknown
04
AAOI 2025 Form 10-K ↗www.sec.gov · 2026-02-26

自分のノート