
摩爾線程(Moore Threads)、フルスタックでDeepSeek-V4に適合

5月1日付の報道によると、中国半導体メーカーである摩爾線程(Moore Threads)のAI学習・推論統合カード「MTT S5000」は、同社独自開発のMUSAソフトウェアスタックとSGLangオープンソース推論フレームワークを組み合わせることで、DeepSeek-V4の完全な動作検証に成功した。
これにより、Moore Threadsはハードウェアアーキテクチャの中核コンピューティングエンジンの対応、ホットスポット演算子のサポート、エンドツーエンドのデプロイ検証に至る体系的な適合パスを構築し、中国国産GPUが最先端の大規模モデルに対して「フレームワークレベルの互換性」、「導入してすぐに実用可能」を実現できることを証明した。
大規模モデルのアーキテクチャが進化を続ける中、DeepSeek-V4のような先進モデルは、低レベルの精度能力、演算子のカバレッジ、コンパイラの最適化、並列伝送・パラレル通信、推論効率に対して厳しい要件を課している。
Moore Threadsは、S5000のネイティブFP8演算能力、MUSAによるCUDAへの深い互換性、TileLang MUSAコンパイラによるTileLangエコシステムのサポートなどの強みを最大限に発揮し、さらにTileKernelsオープンソースライブラリの再利用、TileLangに基づくカスタムオペレーターの迅速な開発などの手段を用いて、DeepSeek-V4の推論適合パスを迅速に確立した。
注目すべきは、TileLang-MUSAが正式にTileLangの公式メインブランチに組み込まれ、DeepSeek-V4が最新リリースしたTileLang演算子ライブラリ「TileKernels」に対してDay-0のシームレスなサポートを実現している点だ。
これは、MUSAプラットフォームが最先端のLLMオペレーターエコシステムを担うエンジニアリング基盤を備え、今後の先進的なオープンソースモデルの適合に直接再利用可能な演算子パスを提供することを意味する。
▼ TileKernelsオペレーターライブラリのオープンソースアドレス:https://github.com/tile-ai/tilelang-musa/tree/main/tilekernels
▼ TileLang-MUSAオープンソースアドレス:https://github.com/tile-ai/tilelang-musa

3層の技術パスによるDeepSeek-V4のエンジニアリング適合
今回の適合検証により、新モデルの高速推論デプロイを実現する体系的なエンジニアリングパスが確立された。
すなわち、MUSAによるCUDAへのフルスタック互換により中核的なAIフレームワークを迅速に適合させ、オープンソースのTileKernels演算子を標準融合パターンの代わりに再利用し、さらにAI Agentを活用してTileLangベースのモデル固有演算子の迅速な開発と検証を行うというものである。
まず、MUSAソフトウェアスタックは、FlashMLA、DeepGEMM、DeepEPなどDeepSeekオープンソースリポジトリの互換実装を提供しており、これにより推論に必要なAttention、FP8 GEMM、MoE dispatch/combineといった重要かつ通信オペレーターをS5000上で迅速に適合できる。
次に、SwiGLU + FP8 quantなどの標準融合パターンに対して、S5000はDeepSeek TileKernelsのネイティブオペレーターを直接再利用することでDay 0の開封即適合を実現している。Moore ThreadsのMATEオープンソースオペレーターライブラリを通じて、layout、dtype、scale contract、インターフェースレベルでDeepGEMMと深く互換性を持たせ、ホットスポットオペレーターのフォーマットやインターフェース調整のオーバーヘッドを排除している。
MUSAのAIソフトウェアエコシステムに対する良好な互換性のおかげで、DeepSeek-V4はMUSAプラットフォーム上で、コアオペレーターの適合からエンドツーエンドの起動、システムレベルのパフォーマンスチューニングに至るまで、エンジニアリングレベルの高速化を実現できる。
最後に、DeepSeek-V4の高度に特化した計算負荷に対して、Moore ThreadsはAI Agentを活用してTileLangカーネルの自動生成とデバッグを実現。オペレーターのセマンティクス解析、インターフェース適合、カーネル実装、正当性・精度検証などの各段階で開発効率を向上させ、RMSNorm、RoPE、Compress、Topkなど複数のコアカスタムオペレーターの迅速な開発・統合を完了した。
この方式は、計算セマンティクスにゼロの乖離を確保しつつ、カーネルレベルの開発・適合サイクルを大幅に短縮し、さらに重要な演算子のパフォーマンスを引き出す。例えば、RMSNormなど帯域幅がボトルネックとなる演算子では、帯域幅利用率が80%に達する。
ネイティブFP8サポートによる混合精度の推論強化
上記3層のパスが迅速に確立できたのは、Moore Threads S5000のネイティブFP8演算力基盤によるものだ。この基盤は最先端の混合精度モデルの推論要件を完全に受け止め、モデル精度を維持しながら高スループット、低VRAM使用率、VRAM帯域幅の効率的な利用を実現する。
この能力は、DeepSeek-V4などの先進的なMoEモデルの精度進化パラダイムに深く適合しており、DeepGEMM、FlashMLA、DeepEPといったコアオペレーターのMUSAプラットフォーム上での迅速な適合を保証している。
ネイティブFP8能力を中心に、Moore Threadsはアクティベーション量子化(SwiGLU FP8 quant)、MoEルーティング(routing)、アテンションプリプロセス(attention-prep)、キャッシュ管理(FlashMLA cache store / paged metadata)、デコード圧縮(compressor decode/prefill)を含む主要モジュールの適合を完了し、多層の回帰テストを通じて重要パスの正確性と安定性を検証済みだ。
FlashMLA DSAの極限最適化による長文脈推論性能の開放
完全なモデルチェーン適合を基盤として、Moore ThreadsはS5000上でFlashMLA DSAのPrefillとDecodeシナリオに対して特別な最適化を実施し、一貫した低レベル最適化ロジックを採用した。
DeepSeek-V4のKVキャッシュのデータ編成パターンに密着し、スパースKV読み取り、Cache Layout解析、Attention計算、結果の書き戻しを直接実行。これにより余分なキャッシュ再配置のオーバーヘッドを効果的に排除し、Original + ExtraのデュアルパスKVキャッシュ機構と動的Top-k長を同時サポートする。TileLangによるDSAオペレーターの深層最適化を通じて、長文脈およびスパースアテンションシナリオでの計算効率を著しく向上させた。その結果、DSA PrefillおよびDecodeオペレーターのBF16 Tensor演算能力の利用率は50%に達しており、今後もさらなる最適化を進める予定だ。
4層の検証システムによる実運用レベルの安定性と確実性の確保
完全な推論チェーンを対象に、Moore ThreadsはMUSAカーネル検証、演算子レベルの精度一致、最適化パスの選択、エンドツーエンドのシナリオ回帰検証という4層の検証システムを確立し、重要なオペレーターの実際の動作における正確性と安定性を確保している。
現在、Moore ThreadsはDeepSeek-V4に基づく作業を、パフォーマンスチューニング、長文脈機能の拡充、実運用レベルの安定性検証の段階に進めている。
▼ DeepSeek-V4推論サービスデプロイガイド:
(原文:https://www.icsmart.cn/104592/)

