ペパボ研究所 研究員/シニア・プリンシパルエンジニアの三宅(@monochromegane)です。 VRAMに収まらない規模のMixture-of-Experts(MoE)モデルを手元のGPUで動かすために、2つのvLLMプラグインを開発しました。 本記事では、その仕組みと性能について紹介します。
はじめに
高性能なオープンウェイトモデルが相次いで公開され、これを自組織の環境で動かす選択肢が広がっています。
一方で、規模の大きなモデルを動かすためのGPUの確保は難しいままです。 例え...
この記事をもっと読む