GetUSBが人工知能専門サイトになるわけではありません。そういうサイトはすでに十分ありますし、たいていの日には「AIがすべてを変える」と説明する記事がもう1本増えても、世の中はそれほど困らないでしょう。
私たちが気になったのは、もう少し実用的な部分です。
人工知能が実際にどう動いているのかを深く見ていくほど、話の内容がどんどん聞き慣れたものになってきます。メモリ帯域幅が重要。ストレージが重要。NANDフラッシュが重要。DRAMが重要。PCIeが重要。大量のデータをある場所から別の場所へ移動することも重要です。これらは、あらゆる製品発表の最初の段落に「AI」の2文字を入れる必要が出てくるずっと前から、私たちが何年も追いかけてきたテーマです。
ここ数か月、私たちはAIをこのハードウェア側の視点から見る記事をいくつか書いてきました。新しいモデルやソフトウェアの発表を片っ端から追うのではなく、その裏側で実際に何が起きなければならないのかに興味を持ってきたわけです。
振り返ってみると、特に8本の記事が驚くほどきれいにつながっています。
ポータブルAIアクセラレータ vs クラウドAI:小規模企業は実際にどちらを選ぶべきか?
AIで起きている興味深い変化のひとつは、AIワークロードを実行するからといって、必ずしもすべてを巨大なデータセンターへ送る必要がなくなってきたことです。小型のAIアクセラレータによって、巨大なクラウドモデルほどの計算能力を必要としない用途では、ローカル推論が現実的な選択肢になりつつあります。
ポータブルAIアクセラレータとクラウドAIについて扱った記事では、2つのアプローチのトレードオフを見てきました。クラウドAIは膨大な計算リソースを提供しますが、ローカルAIにも、プライバシー、予測しやすい運用コスト、低いレイテンシ、インターネット接続がなくても動作を続けられることなど、興味深い利点があります。
大事なのは、どちらか一方が勝つという話ではありません。AI処理そのものが分散し始めているということです。クラウドで行うべき仕事もあります。ローカルPCやエッジデバイス上で処理したほうが、はるかに理にかなっている仕事もあります。
AIコンピュータの内部:なぜ現代のAIシステムはこれほど多くのメモリを消費するのか
AIコンピュータではGPUがほとんどの注目を集めますが、どれほど強力なプロセッサでも、データを待ってばかりではそれほど役に立ちません。
そこで私たちはAIコンピュータの内部を見て、なぜ現代のAIシステムはこれほど多くのメモリを消費するのかを説明しました。AIモデルには膨大な数のパラメータが含まれており、それらのパラメータは計算が進む間に保存され、読み込まれ、システム内を移動しなければなりません。
これはAIハードウェアについて繰り返し出てくるテーマのひとつです。計算能力は劇的に向上しましたが、その計算能力へ十分な速度でデータを供給すること自体が、別の問題になっています。プロセッサには仕事をこなす能力があっても、システムの残りの部分が追いつかなければ意味がありません。
NANDはなくならないが、AIサーバーはもはやフラッシュだけに依存していない
私たちのこれまでの分野を考えれば、NANDフラッシュから掘り下げ始めるのは自然な流れでした。
AIがNANDを時代遅れにしているわけではありません。むしろ逆です。モデル、学習データ、データベース、生成された情報はすべて永続的なストレージを必要とし、フラッシュは今でも非常に重要です。ただし、AIサーバーはいまやNANDフラッシュだけでは成り立たないというのも事実です。なぜなら、ストレージ容量は問題の一部分にすぎないからです。
SSDは膨大な情報を保存できますが、プロセッサがSSD上にあるすべてのデータを直接フルスピードで計算に使えるわけではありません。データはメモリ階層のさまざまなレベルを移動する必要があり、それぞれのレベルには容量、速度、コストのバランスがあります。
AIによって、その階層構造がはるかに見えやすくなりました。
High Bandwidth Memoryとは何か、そしてなぜAIはそれに依存するのか?
High Bandwidth Memory、一般にHBMと呼ばれる技術は、かなり専門的なメモリ技術だったものから、AIハードウェアの話題で日常的に出てくる存在へと変わりました。
それにはちゃんと理由があります。
High Bandwidth Memoryとは何か、そしてなぜAIはそれに依存するのかを解説した記事では、HBMが解決しようとしている問題を見ました。現代のGPUは途方もない数の計算を実行できますが、プロセッサへ大量のデータを継続的に供給しなければならない状況では、従来型のメモリアーキテクチャがボトルネックになることがあります。
HBMは非常に高速なメモリをプロセッサのすぐ近くに配置し、従来のメモリ構成よりはるかに高いメモリ帯域幅を提供します。高価で複雑な技術ですが、AIアクセラレータへデータを途切れなく供給しようとする場合、帯域幅は純粋な計算速度と同じくらい重要になることがあります。
とても速い工場を持っていると考えてください。工場の中の機械だけをさらに速くしても、搬入口から原材料を十分な速度で運び込めなければ、大して意味はありません。
なぜDRAMだけでは、もはやAIに追いつけないのか
DRAMもなくなるわけではありません。ただ単に、データが多すぎるのです。
私たちはなぜDRAMだけでは、もはやAIに追いつけないのかという記事でこの問題を取り上げました。メモリ不足の単純な解決策は、メモリをもっと増やすことのように思えます。しかしAI規模になると、それはあっという間に高額になり、それでもすべての帯域幅や容量の問題を解決できるわけではありません。
ここでAIストレージの複数の層が意味を持ち始めます。HBMはプロセッサの近くで非常に高い帯域幅を提供できます。DRAMはより大容量の高速ワーキングメモリを提供します。NANDフラッシュは、はるかに大きな永続容量を提供します。それぞれの技術には、他の技術では経済的に実現しにくい役割があります。
AIは、ある種類のメモリを別の種類のメモリに置き換えているわけではありません。むしろ、コンピュータにより多くの種類のメモリを同時に使わせていると言ったほうが正確です。
AIインフラにおいてハードドライブが今も重要である理由
これは、AIハードウェア全体の話の中でも、私がいちばん好きな矛盾かもしれません。
私たちは高度なGPU、HBM、NVMeストレージ、先端半導体製造について散々話しています。それなのに、その少し先には回転する磁気プラッタを使う技術がまだしっかり存在しています。
ハードドライブは、まったく死んでいません。
AIインフラにおいてハードドライブが今も重要である理由では、AI企業が保持しなければならない膨大な情報量を見ました。学習データセット、モデルのチェックポイント、バックアップ、アーカイブ、その他の大量データをすべて高価な高性能フラッシュストレージ上に置く必要はありません。
あるところから、経済性の話になります。
ペタバイト単位で情報を保存するようになると、1TBあたりのコストがかなり重要になります。ハードドライブは今でも、膨大なオンラインストレージを提供するうえで最も経済的な方法のひとつです。AIは私たちがこれまで作ってきた中でも最先端のコンピューティング技術のひとつですが、どうやら全部しまっておくための非常に大きな物置は、まだ必要なようです。
なぜAIはコンピュートをストレージの近くへ移動させているのか
何十年もの間、一般的なコンピュータアーキテクチャはかなり単純でした。データをどこかに保存し、それをメモリへ移動し、プロセッサへ送り、そこで何か処理をする。
移動するデータ量が巨大になるまでは、それで実にうまくいきます。
なぜAIはコンピュートをストレージの近くへ移動させているのかという記事では、この問題に対する興味深い解決方法を取り上げました。巨大なデータセットをシステム内で何度も往復させる代わりに、一部のアーキテクチャでは計算処理そのものを、データがすでに存在している場所の近くへ移動させ始めています。
考え方は単純です。データを移動すると、時間、帯域幅、電力を消費します。データが移動する距離を減らせれば、単により速いプロセッサを投入することなく、システム全体の効率を改善できる場合があります。
これもAIが従来のコンピュータ性能の定義を変えている部分です。最も速い部品が必ずしも答えとは限りません。場合によっては、より大きな改善は「移動するデータを減らす」ことで生まれます。
KV Cache:GPUを息切れさせないAIメモリの貯水池
KV Cacheは、無視してもよさそうな専門用語に聞こえます。しかしこれを知ると、AI推論がなぜ驚くほど大量のメモリを消費するのかが理解しやすくなります。
言語モデルが回答を生成するとき、次のトークンを作るたびに、すでに処理した内容をすべて最初から計算し直したくはありません。KV Cacheはメモリの貯水池のように機能し、以前の計算結果を保持して、モデルが再利用できるようにします。
パフォーマンス面では非常に有効です。ただし、無料ではありません。
会話が長くなり、より多くのユーザーがモデルとやり取りするようになると、KV Cacheの必要量は劇的に増える可能性があります。ここでもまた、別の方向から同じAIハードウェアの問題にたどり着きます。これほど大量の情報をどこに置き、どれだけ速くプロセッサへ戻せるのか、という問題です。
KV Cacheは、GPUの仕様だけを見てもAIシステム全体の性能についてはあまり分からない、ということを示す良い例です。
結局のところ、またメモリとストレージの話に戻ってくる
これらの記事を書いたとき、8本構成のAIシリーズを作る予定はありませんでした。ただ、取り上げるテーマが、私たちがもともと追いかけている技術と何度も交差してきただけです。
実はそこがいちばん面白いところなのかもしれません。
チャットボット、生成画像、未来予測を全部取り除いてしまえば、人工知能は巨大なデータ処理問題になります。データは保存しなければならない。移動しなければならない。メモリへ置かなければならない。そして、非常に高価なハードウェアを遊ばせないために、十分な速度でプロセッサへ届けなければならない。
そう考えると、NAND、DRAM、HBM、ハードドライブ、PCIe、ストレージアーキテクチャは脇役には見えなくなります。それらは現代のAIを実現している仕組みそのものの一部です。
そして最近では、私たちはハードウェアのさらに先まで見るようになりました。
最近の記事AI最大のボトルネックはソフトウェアではない。電気技師だでは、話をサーバーの外へ広げています。AIインフラを作るには、膨大な電力、冷却、そして実際の建設作業が必要です。GPUもメモリもストレージも搬入口に届いているのに、まだ問題が残ることがあります。つまり、それらすべての電源を入れられるインフラを誰かが作らなければならないということです。
おそらく今後のAI関連記事も、この方向になるでしょう。新しいAI発表を片っ端から追いかけるのではなく、AIがストレージ、ハードウェア、そしてコンピューティングの物理的な現実とぶつかる場所を追っていく。
なぜなら、私たちが結局いちばん興味を持つのは、たいていそういう部分だからです。