期待のネット新技術

「UALink」と「SUE」、Scale-upで持ちきりだった2025 OCP Global Summitの注目講演

Scale-up Network(4)

 前回は2025 OCP APAC SummitにおけるAstera Labsの講演の内容をScale-up Networkの定義に対する包括的な解として紹介した。そのOCP APAC Summitから2カ月後となる2025年10月に開催された2025 OCP Global Summitのスケジュールを確認すると、いきなりScale-up全盛である。

 とりあえずTitleに"Scale-up"が入ってる講演だけまとめても、次のように14本もある。

  • Server Scale-Up Interconnect Technologies - UALink SuperNode and CXL Memory Pool(Alibaba)
  • Scale-Out Networks and Scale-Up Architectures with CPO(Broadcom)
  • The Scale-Up Ethernet (SUE) Framework for AI/ML Accelerators(Broadcom, Arista Networks)
  • Performance Evaluation of Interconnect Technologies for AI Scale-Up Computing: UAL vs UALoE/SUE vs RoCE(Upscale AI)
  • Unleashing AI Scale-Up: UALink and OCP Collaboration(AMD)
  • Applications and Use Cases for UALink: Enabling Efficient, Open Networking for AI Scale-Up Systems(Astera Labs, AMD, Intel, Synopsys, UpscaleAI
  • Copper Interconnect In 200G Scale-Up Networks(Lotes Tech)
  • Optical Opportunities for the AI Scale-up Fabric(Dell Technologies)
  • Interconnect Options for Ethernet Scale-Up Networks(Broadcom)
  • Energy Efficient Photonic Interconnects for AI scale-up(Ranovus)
  • Resolving Operational Barriers to AI Scale-Up with Co-Packaged Copper/Optics Sockets(Nubis Communications)
  • Infinite HBD: Scale-up Outside the Box(Lightelligence)
  • Empowering Scale-Up and Scale-Out Networking with Samtec CPX Architecture (CPC/CPO)(Samtec)
  • Management and Control of UALink Scale-Up Pods(AMD, Google)

 もちろん、中にはScale-upそのものというよりは、Scale-upにも使える自社のOptical Solutionを説明しているだけのものもあるし、"Applications and Use Cases for UALink: Enabling Efficient, Open Networking for AI Scale-Up Systems"はPanel Discussionだったりするのだが。

 ちょっと今回は、この中からAMDの"Unleashing AI Scale-Up: UALink and OCP Collaboration"と、Broadcom/Arista Networksの"The Scale-Up Ethernet (SUE) Framework for AI/ML Accelerators"の話題を取り上げたいと思う。

最大1024台の接続が目標、標準化を進めるUALinkのロードマップ

 さて、まず1本目はAMDのKurtis Bowman氏による"Unleashing AI Scale-Up: UALink and OCP Collaboration"だが、Bowman氏はUALink ConsortiumのBoard Chairでもある。なので、AMDというよりはUALink Consortiumとしての説明である。

 UALink Consortiumの話はこちらでちょっとだけ触れたが、Scale-upの標準化を目指して(図01)、2024年5月にPromoter 8社(AMD、Broadcom、Cisco、Google、HPE、Intel、Meta、Microsoft)で結成されたのが、UALink Consortiumである。

図01:AIモデルが巨大化し、これに向けてpod(複数枚のAI Acceleratorを束ねた塊。ラック1本をPodと称するケースが多いが、もっと大規模な場合もある)内のAI Acceleratorの数が増えるため、スケールするNetworkが必要、というのが動機。これをProprietaryで構築するのではなく、標準化しようというわけだ

 ちなみに現在はPromoterにAlibaba、Amazon、Apple、Astera Labs、Synopsysが加わり、Broadcomが外れて(現在はContributor Member)、合計12社になっている。2024年にはメンバー企業の一般公募を開始、2025年4月には最初のSpecificationをリリースし、2025年10月には128G Data Link and Physical Layers 1.0 Specificationもリリースされた(図02)。ちなみに現状リリースされているのは、次の5つとなっている。

図02:このグラフが何を意味しているのかは不明。メンバー企業の数というわけではなさそう
  • UALink 200G 1.0 Specification
  • UALink Common 2.0 Specification
  • UALink 128G Data Link and Physical Layers 1.0 Specification
  • UALink Chiplet 1.01 Specification
  • UALink Manageability 1.0 Specification

 UALinkそのものの詳細には回を改めて触れるとして、UALinkの目標は、複数のRackに跨る最大1024 Acceleratorを接続するScale-up接続方式の標準化である(図03)。まず最初に標準化されたUALink 200Gでは、UALink Switchを経由して2つのAcceleratorがお互いのMemoryを直接アクセスできるという、シンプルだが判りやすい構成を実現するためのSpecificationとしてまとめられた(図04)。

図03:広帯域・低Latency・省電力・低コストをかなえる、というのがUALinkの目標である。ただここでは"Single-tier Switching"が原則。2-Tierに拡張されたNVLinkをどう考えるのだろう?
図04:"Initial focus"は共有メモリを実現することで、そのためにはLoad/Store Semanticが必要(つまりHost側からの操作なしに、AI AcceleratorがあるMemory Addressをアクセスすると、その先はUALink経由の別のAI AcceleratorのMemoryになる)という話だが、流石に排他制御は必要と思ったようでAtomicsが加わっている

 ちなみにこの当時はまだUALink 128G Data Link and Physical LayersやIn-Network Collectives、128G&200G UCIe PHY SpecificationなどのSpecificationは作業中であったが、現在では全てSpecificationがリリースされている。

 このUALinkとはまた別に、EthernetベースのScale-up Networkとして検討されているのがSUE(Scale-Up Ethernet)である。Broadcomは2025年9月に"Scale-Up Ethernet Framework Specification"(https://docs.broadcom.com/doc/scale-up-ethernet-framework)をリリースしており、これはOCPでも"Scale Up Ethernet(SUE)"としてSpecificationが承認された(https://ocpstagingweb2.opencompute.org/documents/ocp-sue-spec-final-pdf-1)。2025 OCP Global SummitではArista Networksも共同で説明を行っている。

図05:In-Network CollectivesはUALink Common Specificationとして、128G&200G UCIe PHY SpecificationはUALink Chiplet Specificationとして、それぞれリリース済み

SUE/ESUNがアピールする広帯域・高効率・高信頼性と、その課題

 さてSUEの方だが、ターゲットを広帯域と効率、信頼性に絞り込んでいる(図06)。どうもLatencyに関しては潔く諦めたらしい。というか次に説明するが、物理層はESUN(Ethernet for Scale-up Networking)を利用することにして、その上のTransport層を標準化する形でSUEは構築される。

 なので、この時点でLatency云々はESUNである程度決まってしまうことになる。であれば考慮しても無駄だし、将来ESUNがLatency Optimizedな形になれば、自動的にSUEもその恩恵を受けるという考え方もできる。ESUNのInitial CompaniesにもBroadcomは名前を連ねており、なのでLatencyはESUNの側で頑張る、ということかもしれない。

図06:図中の"⑨"は多分"="のフォントが化けたのではないかと思う。それはともかく、リモートからHBM3E/HBM4のフル帯域を使うケースは流石に稀だとは思うが
図07:ESUNは2025年10月に、やはりOCPのProjectとしてスタートした。この辺の比較は稿を改めて

 SUEが提供するオプションが図08だ。Ordering ModelとかLoad Balancingなども含まれているが、これはベースがEthernetであることに起因する。Scale-up Networkとは言うが、NVLinkにしてもUALinkにしても基本はPeer-to-Peerで、たまたまそこにSwitchが入っているだけという感じである。対してSUEというかESUNというかはEthernetをベースとしたNetworkであり、その上にPeer-to-PeerのChannelを仮想的に構築しているという格好である。

 このため、Networkに対する配慮がそれなりに必要となる。もう少しこれを明確に示したのが図09だ。2024年にUltra Ethernetを解説したが、あれはあくまでScale-out Network向けであり、Scale-upにはいろいろ向いていない。かといって物理層から全部作り直すのはコストがかかりすぎるので、Transport層だけでなんとかしよう、というわけだ。

図08:SUEはあくまでもTransportであり、ほかのEthernetベースのプロトコルと共存するため、あまり下層に注文を付けられない、という問題もある
図09:例えばScale-outの場合、Node毎にNetworkの口が用意される格好だが、Scale-upの場合そのNodeに含まれる1~16個のAI Accelerator毎に口が用意される。もうこの時点でScale-upのままでは行かれないというわけだ

 そのSUEであるが、簡単なTransaction Packing(図10)とかReliabilityへの配慮(図11)などが実装されるとしている。Reliability Headerに加え、32bitのCRC(R-CRC)もデータの最後に付加されることで信頼性を担保するという話だが、もうこの辺は先月説明したScale-up Networkの定義(こちらの図に出てくる"Reliable links with FEC and link-level retries are a must")に思いっきり反している気がする。

図10:ただ、ここでSchedulerが入ることでのLatencyは無視できるほどなのか?というのは率直に言ってちょっと疑問。"Optimistic, work-conserving packing"というあたり、相当簡略化したSchedulerであると思われるので、大した問題にならないのかもしれないが
図11:このReliability Headerのサイズは全部で64bitほど

 ちなみに、BroadcomによるSUEのSpecificationによれば、RTTは2μs未満が要求として挙がっているが、流石にこれはScale-upとしてはちょい大きすぎる気がしなくもない。なお、UALink 200Gでは1μs未満を目標に掲げている。

 そのあたりも関係しているためだろうか、スライドにはないが、SUEにはSUE Liteと呼ばれるサブセットも定義されている(図12)。Broadcomの説明によれば、SUE LiteではIPのサイズを半分にすることが可能であり、その代わりCore Side InterfaceからAXI4のサポートが削られ、End-to-End Reliabilityの保証とCongestion Controlはなし、Partitionの機能もないとされる。ただそのぶん若干高速になるとは思うが、RTTの数字は明確には示されていない。

図12:上半分がSUE、下半分がSUE Liteである。要するにTransport層がない。BroadcomのSUE Specificationより抜粋して作成

 今回簡単にUALinkとSUE(とESUNの名前)をご紹介したが、10月の定義から大分外れた感じになっているのは、やはりEthernetを流用することに起因する問題がいろいろとあるから、というのは否めないだろう。次回、もう少し細かく説明したい。

大原 雄介

フリーのテクニカルライター。CPUやメモリ、チップセットから通信関係、OS、データベース、医療関係まで得意分野は多岐に渡る。ホームページはhttp://www.yusuke-ohara.com/