Memory stack

階層はdata movementの地図である

「AIにはmemoryが必要」という言い方は、重要な判断を隠す。どのbyteが、どこで待っているかである。registerはexecutionに最も近いが小さい。cacheはcapacityと低いaccess latencyを交換する。HBMと通常DRAMはacceleratorが実行中に必要とするactive tensor、model weight、key/value(KV)stateを保持する。SSDはその瞬間にactiveでないcheckpoint、training shard、index、datasetを保持する。networked storageとnetwork fabricは、byteがhostに届く前に別のqueueを加え得る。各層は補完関係にある。遅いSSDを速くしてもHBM待ちのattention kernelは終わらず、HBMを増やしてもremote storageで飢えたtraining input pipelineは直らない。

  1. 1SSD/object store
  2. 2host DRAM
  3. 3accelerator HBM
  4. 4cache/registers
  5. 5arithmetic unit
  1. 1cold checkpoint active batch active tensors immediate reuse
  1. 1queue time を測る
  2. 2transfer を測る
  3. 3bandwidth を測る
  4. 4compute を測る
順序と役割を、ひとつずつ分けて考える

最初の問いは「HBMはNANDより良いか」ではない。「applicationはどのedgeで進行を止めているか」だ。model loadingではstorage read、decompression、host-to-device transfer、allocator時間を分ける。inferenceではtime to first token(prompt ingestionとKV-cache構築)とdecode tokens/secを分ける。trainingではdataloader stall、collective communication、kernel executionを分ける。profiler traceと固定workloadは広告上のpeak bandwidthより強い証拠になる。

境界のある例で考える

32k-token prompt、四requestの固定batch、latency budgetを持つRAG serviceを考える。model revision、precision、prompt token、output limit、device数、retrieval payloadを記録する。まずlocalでwarmなindexを使う。次にindexだけをremoteにする。time to first tokenだけが上がりdecode速度が変わらなければ、HBMでなくstorage/networkの境界を見つけたことになる。input pathを固定してcontext lengthだけを変える。decode前にallocation failureやtail latencyが出れば、KV-cache residencyとfragmentationを調べる。この結果をtraceなしに「AI memory shortage」と呼んではいけない。

この演習は財務上の誤りも防ぐ。accelerator deploymentの増加は複数層の需要を増やし得るが、どのsupplierがeconomicsを取るかは示さない。accelerator当たりのHBM、server当たりのNAND、SSDのcontroller、packaging yield、contract price、capital spendingは別変数である。byte countが増えても、price低下、supply ramp、競合componentによりrealized revenueは下がり得る。

issuer disclosureが示せること、示せないこと

Micronのfiscal Q3 2026資料は自社productとfinancial resultを説明し、HBM white paperはAI data-center memoryに関する自社見解を説明する。SK hynixの2025年HBM4ページはdevelopment/preparationのclaimを示す。これらは各issuerが各日付で述べたことの一次資料である。customer workload、market share、競合yieldの独立測定ではない。Micronのmaterialにproduct/business unit情報があっても、non-GAAPやcash-flowをmodelへ使う前に添付filingとreconcileする。

実務用worksheetには、measured system boundary、影響し得るcomponent、company evidence、disconfirming evidenceの四列を置く。「time to first tokenはdevice allocationが支配する」はHBM capacityを関連付け得るが、特定supplierがdesignを取る証拠ではない。反証は低capacity model configuration、別packaging、KV memoryを減らすsoftware変更になり得る。price targetでなく条件分岐として残す。

演習:正直なbottleneck statementを作る

  1. warm-up後に固定promptを二回実行しtraceを保存する。
  2. context length、batch、storage locality、precisionの一つだけを変える。
  3. 最も遅いboundaryと診断を反証するmetricを一つ書く。
  4. supplier thesisは「このboundaryが続き、このproductがqualifiedならrevenue exposureが変わり得る」とだけ書く。
  5. utilization低下、競合package、ASP低下、active memoryを減らすsoftwareをinvalidation conditionにする。

こうしてsystem engineering、issuer disclosure、financial inferenceを正しい層に置く。

ROOFLINE / 仮想的な入力

メモリは計算装置へ十分にデータを送れるか。

512 TFLOP/s制約:メモリ。計算の上限は1,000 TFLOP/s。

上限 = min(計算の上限, 帯域 × 演算密度)。TBは10¹² byte。キャッシュ、アクセスの形、通信、実際の稼働率を省いた上限で、製品の測定ではありません。容量を増やしても帯域が増えるとは限りません。

出典

01
Micron HBM white paper ↗www.micron.com · unknown
02
Micron Q3 FY2026 quarterly results ↗investors.micron.com · 2026-06-24
03
SK hynix HBM4 development ↗news.skhynix.com · 2025-09-12

自分のノート