Upgrade to Pro — share decks privately, control downloads, hide ads and more …

【ShowNet 展示会場内セミナー 2026】分散AIデータセンター技術と水冷インフラ

Avatar for ShowNet ShowNet PRO
September 07, 2026
120

【ShowNet 展示会場内セミナー 2026】分散AIデータセンター技術と水冷インフラ

2026年6月に幕張メッセで実施されたInterop Tokyo 展示会場内セミナーでのNOCチームメンバーによる講演資料

AI需要の高まりから、GPUサーバを主としたデータセンター整備が急務となっています。
一方で、大規模なGPU資源確保は確保難しく、複数の拠点に分散したGPUを組み合わせて活用する分散データセンタ技術が注目されています。
また、GPU/CPUの発熱量増加に伴う消費電力の高まりから、電力の大部分を担う冷却を空冷方式から、より省電力で冷やすことができる水冷方式への期待が高まっています。水冷方式のサーバに加えて、サーバ間を繋ぐスイッチにも水冷対応のものが登場しています。
本講演では、ShowNetで取り組んだ分散AIデータセンタ技術の取り組みと、インフラを支える水冷技術の検証に関して紹介します。

Speaker
ShowNet NOCチーム
DC・クラウド担当
織 学

Speaker
ShowNet NOCチーム
エナジー担当
岡田 和也

Avatar for ShowNet

ShowNet PRO

September 07, 2026

More Decks by ShowNet

Transcript

  1. 4

  2. GPU Over APN Testbed GPU基盤 800G/1.6T RoCEv2 ネットワーク 分散推論コンテナ基盤 SRv6

    によるマルチテナント コンテナサービス DPUスイッチ サービス仮想化基盤 5
  3. 800G/1.6T DC ネットワーク 1.6T 相互接続検証 1.6T 水冷スイッチ テスター機器との相互接続 1.6T負荷試験 800G

    IPファブリック 800G Breakout • 1x800G • 2x400G (800G-DR8 to 2x400G-DR4) • 8x100G (400G-DR4 to 100G-DR1) Fiber: 2xMPO12 / MPO-16 Transceiver: OSFP(RHS/IHS), QSFP 800G Spine/Leaf SW 6
  4. 長距離RoCEv2検証  ShowNetのSRv6バックボーンを経由したRoCEv2 通信を検証  Inner IPv4ヘッダのECN bitがOuter IPv6 SRHにコ

    ピーされることを確認  RDMAパフォーマンスの確認  チューニングなしでも帯域: 50Gbps 遅延: 500usec程 度でRDMA自体は成立  最適化のためにはチューニングが必要 GPU over APN Testbed (札幌, 三鷹, 横浜, 福岡) Inner IPv4 Header ECN bit = 11 輻輳検知 RoCEv2通信 RoCEv2 UDP/IB ヘッダ IOWN APN ShowNet SRv6 Backbone Outer IPv6 Header ECN bit = 11 輻輳検知 ECN: 11 Congestion Experienced CNP Congestion Notification ShowNet DC NW GPU基盤 8
  5. ShowNetサービスを支える仮想化基盤&NW Apstraによる統合管理 EVPN/VXLAN による L2/L3 VPN VRFごとにサービスを提供 HCI 仮想化基盤 

    Nutanix: Cisco UCS C240 M7 x 3台のクラスタ SD-WAN によるクラウド連携  Cisco 8550  NTTドコモビジネスSDPF NW機器の可視化  Nexus Dashboard NTPサーバ  ShowNet全機器の時刻同期元
  6. 分散推論コンテナ基盤 GoAT: GPU over APN Testbed 札幌、三鷹、横浜、福岡のデータセンター をIOWN APNで接続 Sterna:

    RDMA加速装置 HPE VM Essentialsによる仮想化基盤 Proliant DL380 Gen12 x 3 Alletra Storage MP 推論サービス ShowNetのGPUサーバと各データセンター のGPUサーバをまとめて一つのOpenShiftク ラスタを構築 vLLM/llm-dによる分散推論基盤 12
  7. 分散推論基盤のGPU  ShowNetのGPUサーバと遠隔拠点のGPUサーバにまたがって広域 OpenShiftコンテナ基盤を構築  ShowNetのGPUサーバ  NEC ExpEtherサーバ: GPUを搭載したIO

    BoxとExpEtherホストアダプタを 搭載したサーバをPCIe over 100G Ethernetで接続 • NVIDIA L40S GPU over APN Testbed (札幌, 三鷹, 横浜, 福岡) IOWN APN ShowNet SRv6 Backbone  HPE Proliant DL380 Gen12: 仮想マシンに対してGPUとRoCE NICをPCI Passthroughで接続 • NVIDIA L40S  GoATのGPUサーバ  横浜拠点: NVIDIA B200 x 10, ConnectX-7 x 10  福岡拠点: NVIDIA RTX PRO 6000 x 2, ConnextX-7 x 2 ShowNet DC NW
  8. vLLM + llm-dによる分散推論  オープンソースの推論エンジン  主要なオープンモデルの実行をサポート  最新の推論技術を統合 

    幅広いアクセラレーターのサポート  推論に関する様々な機能を網羅:  Text, Embeddings, Multimodal, Reward Modeling  Quantization: INT8, FP8, GPTQ, AWQ, KV Cache  Chunked Prefill, Automatic Prefix Caching, Multi LoRA, Speculative Decoding, Disaggregated Prefill  Tool/Function Calling, Structured Outputs  Tensor Parallelism, Pipeline Parallelism  Prefill/decode disaggregation  KV Cache distribution, offloading and storage hierarchy  AI-aware router 14
  9. PrefillとDecodeの分離 LLMの推論時の処理は大きくPrefillとDecodeに分かれる Prefill 入力されたプロンプトを元に出力に必要な モデルの中間状態(KV Cache)を計算する 大量の入力をまとめて処理するため アクセラレーターの計算能力が重要 (=Compute Bound)

    PrefillとDecodeを一 つのGPUで処理 Decode 保存されたKV Cacheを元に、逐次的にトー クンのアウトプットを行う アクセラレーターのメモリに保存された KV Cacheを効率的に利用することが重要 (=Memory Bound) PrefillとDecodeを別 々のGPUで処理 15
  10. 生成AI Agentの利用デモ@ShowNet 2026 AI Agent (OpenClawベース)をShowNetにて提供 OpenClaw: オープンソースのAI Agentのいち実装 Local

    LLM OpenClawへのExtension 人間はCisco Webex経由でAIとやりとり Cisco NSOとNOC作成MCPサーバ経由で ShowNet機器のCLIを操作できる Stella Cyber MCPでセキュリティ ケースの確認 Guardrailによる AI Agentへの攻撃対策 ShowNet側装置 Inference Engine REST API AI Guardrail StellaCyber Cloud Prompt/ Tool Result Agent (Gateway) Cisco NSO CLI MCP Servers Response/ Tool Call Tool Call IDENTITY, SOUL, SKILL OpenClaw Shell Webex 16
  11. 17

  12. 仮想化基盤  Nutanix: Cisco UCS C240 M7 x 3台のクラスタ 

    モニタリング、セキュリティ等の様々なVMが稼働  144コア, メモリ1.5TB, ストレージ287TB, VM48台  HPE Morpheus VM Essentials: ProLiant DL380 Gen12 x 3台のクラスタ  Nvidia GPUを搭載し、分散推論基盤としても稼働  NutanixやAzure、OpenShiftのリソースも統合管理  144コア, メモリ1.5TB, ストレージ29TB, VM18台 19
  13. 多様なサービスを支えるセキュリティ製品 Paloalto Cortex Cloud: コンテナの脆弱性検査や アノマリ検知 VM-Series: 各種サービスへの通信の フィルタリング Cisco

    N9348Y2C6D-SE1U DPU 搭載: HyperShield連携によるFW ルールの適用 HPE CX10000 DPU搭載: 仮想マシン間のマイクロ セグメンテーション 20
  14. SRv6バックボーンと一体化したマルチテナント コンテナサービス基盤 SRv6 uSIDバックボーンとコンテナ基盤 が直接接続 cisco8711-32fh ISIS で SID を広告

     マルチテナントサービス Cilium/JCNRによるマルチベンダー構成 いろんな技術で相互接続  ISIS: frr/JCNR(crpd)  BGP: Cilium/JCNR(crpd)  データプレーン: Cilium/JCNR(vRouter)  コンテナ基盤: OpenShift DHCP/DNS サービスを展開 Ptx10002-36qdd cilium crpd xrd BGP で VPN 経路を広告 BGP で VPN 経路を広告 jcnr ucs-c240-m5-1..3  VRF ごとにサービスを提供  JCNR: DHCP, DNS Authority  Cilium: DNS cache, Speedtest 21
  15. 水冷システム構成図 (cont’d) 冷水 冷却液:PG25 温水 fhs-x440350 (CDU) mnc2dlc 冷却液:純水 二次側

    一次側 nidec-cdu-u01 (CDU) n1380 冷却液:純水 冷却水循環装置 (チラー) 冷却液:PG25 qfx5250-64oe-l nidec-cdu-u07 (CDU) CDU: Coolant Distribution Unit PG25: プロピレングリコール25% 28
  16. 水冷システム構成図 冷水 CDU 機器から戻ってきた温水と一次側 の冷水との間で熱交換 冷却液:PG25 温水 fhs-x440350 (CDU) mnc2dlc

    冷却液:純水 二次側 一次側 nidec-cdu-u01 (CDU) n1380 冷却液:PG25 qfx5250-64oe-l nidec-cdu-u07 (CDU) 冷却液:純水 冷却水循環装置 (チラー) チラー 一次側の冷却水を冷やす装置 NOCラック裏側に隠れてます CDU: Coolant Distribution Unit PG25: プロピレングリコール25% 29
  17. D-4ラック 冷水 冷却液:PG25 温水 fhs-x440350 (CDU) mnc2dlc 冷却液:純水 二次側 一次側

    nidec-cdu-u01 (CDU) n1380 冷却液:純水 Lenovo Neptune N1380 冷却水循環装置 (チラー) 冷却液:PG25 qfx5250-64oe-l Nidec CDU nidec-cdu-u07 (CDU) CDU: Coolant Distribution Unit PG25: プロピレングリコール25% 30
  18. D-5ラック 冷水 冷却液:PG25 温水 fhs-x440350 (CDU) mnc2dlc 冷却液:純水 二次側 一次側

    PFN MN-Core2サーバDLC nidec-cdu-u01 (CDU) n1380 冷却液:純水 冷却水循環装置 (チラー) 冷却液:PG25 チラー一体型CDU qfx5250-64oe-l nidec-cdu-u07 (CDU) CDU: Coolant Distribution Unit PG25: プロピレングリコール25% 31
  19. D-6ラック 冷水 冷却液:PG25 温水 HPE QFX5250-64OE fhs-x440350 (CDU) mnc2dlc 冷却液:純水

    二次側 一次側 nidec-cdu-u01 (CDU) n1380 冷却液:純水 冷却水循環装置 (チラー) 冷却液:PG25 Nidec CDU (ORV3) qfx5250-64oe-l nidec-cdu-u07 (CDU) CDU: Coolant Distribution Unit PG25: プロピレングリコール25% 32
  20. ORV3ラック (D-6) OCP ORV3規格のラック(日東工業) を設置 電源供給 ラリタンのパワーシェルフからバスバー を経由したDC 48Vによる給電 ORV3規格の機器

    • QFX5250 (HPE) , CDU(ニデック)、Nexus 9348(シスコシステムズ) Nexus9348 QFX5250 パワーシェルフ 19インチ規格機材の搭載 Nexus 9348をORV3変換トレーに載せてマ ウント・バスバー給電 Nidec CDU ORV3 ORV3: Open Rack Version 3 33
  21. 水冷システム可視化 各機器の情報をまとめ、一つの系として可視化 対象情報 一次・二次側流量/水温/圧力、周辺気温・湿度、装置内漏水セン サー情報など 取得方法 SNMPに加えてRedfish, Modubs TCPを利用 •

    Redfish:DMTFにより策定されたサーバ機器等を管理するためのREST API規格 • Modbus TCP:産業用ネットワークで広く利用されるModbusをTCP/IPネ ットワーク上で動作 35
  22. 1.6Tイーサネット相互接続・負荷試験 ORV3ラック搭載の QFX5250-64OE (HPE) と INPT-1600GE(キーサイト) 液冷スイッチ (QFX5250-64OE) 純正トランシーバとSiPhxトラ ンシーバ

    (OSFP224 RHS) を搭 載 1.6Tテスター (INPT-1600GE) テスターとQFX間で常時双方 向1.6Tbpsトラフィック負荷試 >show interface diagonostics optics et-0/0/32 負荷なし 験を実施中 Module temperature: 36 degrees C モジュール温度変化なし!(冷えてる) 負荷試験中も空冷と比べてト ランシーバの温度が低く上昇 負荷あり Module temperature: 36 degrees C しにくい 参考:空冷の1.6Tモジュールは約64℃で28℃低温!! 41