無料登録はこちら
無料登録する
エンジニア AN-4020

GPUクラスター基盤構築支援(NVIDIA AI Enterprise※NVAIE)

月額単価 100万円~
稼働率 50〜100%
稼働環境 リモート併用(週2出社)
職種 エンジニア

業務内容

背景: 大手SIerでは、NVIDIA Blackwellアーキテクチャーを採用した「NVIDIA DGX SuperPOD(DGX B200)」を自社データセンターに設置し、プライベート環境で利用可能な大規模機械学習向け基盤「GPU as a Service(GPUaaS)」を提供している。 また、液冷GPUを搭載したコンテナ型データセンターの展開や、NVIDIA AI Enterprise(NeMo、NIM等)を組み込んだエンタープライズ向け「AIファクトリー」の推進、グループ全体でのAIネイティブインフラ構想など、GPU基盤事業を急拡大させている。 作業内容: 今回、GPUaaS/AIファクトリー案件の増加に伴い、GPUクラスターのサーバー・ソフトウェアスタック領域の技術者として、下記業務(一例)を担当いただき、プロパーと共に構築・導入をリードいただく。 ・GPUサーバー(NVIDIA DGX/HGX、各社OEMサーバー)を用いたGPUクラスターの要件定義・基本設計・詳細設計 ・GPUサーバーのキッティング、OS(Ubuntu/RHEL)・GPUドライバ・CUDA・ファームウェアの導入および構築自動化 ・NVIDIA AI Enterprise(NIM、NeMo、Triton Inference Server等)の導入・ライセンス設計・動作検証 ・ジョブスケジューラ(Slurm)/Kubernetes(NVIDIA GPU Operator等)によるGPUリソース管理・マルチテナント環境の構築 ・NVIDIA Base Command Manager等によるクラスター管理基盤の構築、監視(DCGM等)・運用設計 ・NCCLテスト・ベンチマーク等による性能評価、障害切り分け・チューニング ・顧客向け提案・技術支援(構成検討、見積根拠作成、技術QA対応)

求めるスキル・経験

(必須) ・NVIDIA AI Enterprise(NIM NeMo Triton Inference Server GPU Operator等)の導入・運用経験 ・GPUクラスターまたはHPCクラスターの設計・構築の実務経験(サーバー領域) ・Linux(Ubuntu/RHEL等)サーバーの設計・構築・運用の実務経験 ・NVIDIA GPUドライバ CUDA コンテナランタイム(NVIDIA Container Toolkit等)の導入・トラブルシュート経験 ・Slurm Kubernetes等を用いたGPUリソース管理基盤の構築経験 ・インフラ構築プロジェクトにおけるリーダーまたはサブリーダーとしての推進経験 (尚可) ・NVIDIA DGX SuperPOD/DGX BasePOD HGX系サーバーの構築経験 ・NVIDIA Base Command Manager(旧Bright Cluster Manager)の利用経験 ・大規模分散学習(PyTorch分散 NCCL MPI)の性能検証・チューニング経験 ・NVIDIA認定資格(NVIDIA-Certified Professional: AI Infrastructure等) ・GPUaaS/プライベートクラウドの商用サービス立ち上げ経験

案件詳細

開始:11/1 働き方:リモート併用(週2出社) 場所:豊洲 単価:〜130万円(100%稼働時) 稼働率:50〜100% 募集人数:1名 面談:2回

あなたに最適な案件を見つけませんか?

無料登録で、あなたのスキルや希望にマッチした案件情報をお届けします。専任コーディネーターが、キャリアプランのご相談にも対応いたします。