NTTコミュニケーションズが、分散データセンターでの生成AIモデル学習を遅延ほぼゼロで実現したことは、AIの学習効率を飛躍的に向上させる可能性があります。
この技術は、将来的なAIアプリケーションの発展や、ネットワークの最適化に大きな影響を与えるでしょう。
記事の概要
NTTコミュニケーションズは、2024年10月7日に分散データセンターで生成AIモデルの学習を行う実証実験に成功したと発表しました。
実験では、約40km離れた三鷹と秋葉原の2つのデータセンターに分散したGPUサーバーを接続し、生成AIモデル「Llama-2-7b」の事前学習を行いました。
この際、次世代通信基盤IOWNを利用したネットワーク技術「APN」と、NVIDIAの生成AIソフトウェアスタックを組み合わせ、異なるデータセンター間の学習でも遅延を最小限に抑えることができました。
結果として、学習にかかる時間は単一データセンターでの学習よりわずか1.006倍に留まり、効率的なデータ処理が実現されました。
これにより、AIモデルの処理能力を柔軟に増強できる可能性が示されました。
記事のポイント
- 分散学習の成功: NTTコムが複数のデータセンターで生成AIモデルの学習を実施し、成功を収めました。
- 高速通信技術の利用: 次世代通信基盤IOWNとAPNを活用し、データセンター間の接続を最適化しました。
- 世界初の取り組み: 異なるデータセンター間での生成AIモデル学習は世界で初めての試みとして注目されています。
詳しい記事の内容はこちらから(引用元)
NTTコミュニケーションズは2024年10月7日、2つのデータセンターに分散配置したGPU(画像処理半導体)サーバー間…
https://xtech.nikkei.com/atcl/nxt/column/18/00001/09836/