階層はdata movementの地図である
「AIにはmemoryが必要」という言い方は、重要な判断を隠す。どのbyteが、どこで待っているかである。registerはexecutionに最も近いが小さい。cacheはcapacityと低いaccess latencyを交換する。HBMと通常DRAMはacceleratorが実行中に必要とするactive tensor、model weight、key/value(KV)stateを保持する。SSDはその瞬間にactiveでないcheckpoint、training shard、index、datasetを保持する。networked storageとnetwork fabricは、byteがhostに届く前に別のqueueを加え得る。各層は補完関係にある。遅いSSDを速くしてもHBM待ちのattention kernelは終わらず、HBMを増やしてもremote storageで飢えたtraining input pipelineは直らない。
- 1SSD/object store
- 2host DRAM
- 3accelerator HBM
- 4cache/registers
- 5arithmetic unit
- 1cold checkpoint active batch active tensors immediate reuse
- 1queue time を測る
- 2transfer を測る
- 3bandwidth を測る
- 4compute を測る
最初の問いは「HBMはNANDより良いか」ではない。「applicationはどのedgeで進行を止めているか」だ。model loadingではstorage read、decompression、host-to-device transfer、allocator時間を分ける。inferenceではtime to first token(prompt ingestionとKV-cache構築)とdecode tokens/secを分ける。trainingではdataloader stall、collective communication、kernel executionを分ける。profiler traceと固定workloadは広告上のpeak bandwidthより強い証拠になる。
境界のある例で考える
32k-token prompt、四requestの固定batch、latency budgetを持つRAG serviceを考える。model revision、precision、prompt token、output limit、device数、retrieval payloadを記録する。まずlocalでwarmなindexを使う。次にindexだけをremoteにする。time to first tokenだけが上がりdecode速度が変わらなければ、HBMでなくstorage/networkの境界を見つけたことになる。input pathを固定してcontext lengthだけを変える。decode前にallocation failureやtail latencyが出れば、KV-cache residencyとfragmentationを調べる。この結果をtraceなしに「AI memory shortage」と呼んではいけない。
この演習は財務上の誤りも防ぐ。accelerator deploymentの増加は複数層の需要を増やし得るが、どのsupplierがeconomicsを取るかは示さない。accelerator当たりのHBM、server当たりのNAND、SSDのcontroller、packaging yield、contract price、capital spendingは別変数である。byte countが増えても、price低下、supply ramp、競合componentによりrealized revenueは下がり得る。
issuer disclosureが示せること、示せないこと
Micronのfiscal Q3 2026資料は自社productとfinancial resultを説明し、HBM white paperはAI data-center memoryに関する自社見解を説明する。SK hynixの2025年HBM4ページはdevelopment/preparationのclaimを示す。これらは各issuerが各日付で述べたことの一次資料である。customer workload、market share、競合yieldの独立測定ではない。Micronのmaterialにproduct/business unit情報があっても、non-GAAPやcash-flowをmodelへ使う前に添付filingとreconcileする。
実務用worksheetには、measured system boundary、影響し得るcomponent、company evidence、disconfirming evidenceの四列を置く。「time to first tokenはdevice allocationが支配する」はHBM capacityを関連付け得るが、特定supplierがdesignを取る証拠ではない。反証は低capacity model configuration、別packaging、KV memoryを減らすsoftware変更になり得る。price targetでなく条件分岐として残す。
演習:正直なbottleneck statementを作る
- warm-up後に固定promptを二回実行しtraceを保存する。
- context length、batch、storage locality、precisionの一つだけを変える。
- 最も遅いboundaryと診断を反証するmetricを一つ書く。
- supplier thesisは「このboundaryが続き、このproductがqualifiedならrevenue exposureが変わり得る」とだけ書く。
- utilization低下、競合package、ASP低下、active memoryを減らすsoftwareをinvalidation conditionにする。
こうしてsystem engineering、issuer disclosure、financial inferenceを正しい層に置く。
ROOFLINE / 仮想的な入力
メモリは計算装置へ十分にデータを送れるか。
上限 = min(計算の上限, 帯域 × 演算密度)。TBは10¹² byte。キャッシュ、アクセスの形、通信、実際の稼働率を省いた上限で、製品の測定ではありません。容量を増やしても帯域が増えるとは限りません。
出典
01自分のノート