エンジニア
AN-4020
GPUクラスター基盤構築支援(NVIDIA AI Enterprise※NVAIE)
月額単価
100万円~
稼働率
50〜100%
稼働環境
リモート併用(週2出社)
職種
エンジニア
業務内容
背景:
大手SIerでは、NVIDIA Blackwellアーキテクチャーを採用した「NVIDIA DGX SuperPOD(DGX B200)」を自社データセンターに設置し、プライベート環境で利用可能な大規模機械学習向け基盤「GPU as a Service(GPUaaS)」を提供している。
また、液冷GPUを搭載したコンテナ型データセンターの展開や、NVIDIA AI Enterprise(NeMo、NIM等)を組み込んだエンタープライズ向け「AIファクトリー」の推進、グループ全体でのAIネイティブインフラ構想など、GPU基盤事業を急拡大させている。
作業内容:
今回、GPUaaS/AIファクトリー案件の増加に伴い、GPUクラスターのサーバー・ソフトウェアスタック領域の技術者として、下記業務(一例)を担当いただき、プロパーと共に構築・導入をリードいただく。
・GPUサーバー(NVIDIA DGX/HGX、各社OEMサーバー)を用いたGPUクラスターの要件定義・基本設計・詳細設計
・GPUサーバーのキッティング、OS(Ubuntu/RHEL)・GPUドライバ・CUDA・ファームウェアの導入および構築自動化
・NVIDIA AI Enterprise(NIM、NeMo、Triton Inference Server等)の導入・ライセンス設計・動作検証
・ジョブスケジューラ(Slurm)/Kubernetes(NVIDIA GPU Operator等)によるGPUリソース管理・マルチテナント環境の構築
・NVIDIA Base Command Manager等によるクラスター管理基盤の構築、監視(DCGM等)・運用設計
・NCCLテスト・ベンチマーク等による性能評価、障害切り分け・チューニング
・顧客向け提案・技術支援(構成検討、見積根拠作成、技術QA対応)
求めるスキル・経験
(必須)
・NVIDIA AI Enterprise(NIM NeMo Triton Inference Server GPU Operator等)の導入・運用経験
・GPUクラスターまたはHPCクラスターの設計・構築の実務経験(サーバー領域)
・Linux(Ubuntu/RHEL等)サーバーの設計・構築・運用の実務経験
・NVIDIA GPUドライバ CUDA コンテナランタイム(NVIDIA Container Toolkit等)の導入・トラブルシュート経験
・Slurm Kubernetes等を用いたGPUリソース管理基盤の構築経験
・インフラ構築プロジェクトにおけるリーダーまたはサブリーダーとしての推進経験
(尚可)
・NVIDIA DGX SuperPOD/DGX BasePOD HGX系サーバーの構築経験
・NVIDIA Base Command Manager(旧Bright Cluster Manager)の利用経験
・大規模分散学習(PyTorch分散 NCCL MPI)の性能検証・チューニング経験
・NVIDIA認定資格(NVIDIA-Certified Professional: AI Infrastructure等)
・GPUaaS/プライベートクラウドの商用サービス立ち上げ経験
案件詳細
開始:11/1
働き方:リモート併用(週2出社)
場所:豊洲
単価:〜130万円(100%稼働時)
稼働率:50〜100%
募集人数:1名
面談:2回
- FIND PROJECT
