
都市

送信後、メールに届くリンクを開いてください




都市

正社員
英語必須
リモート
アーキテクト
DevOps
大手企業
大規模AI/HPCクラスターの運用・自動化を担い、ネットワーク、システム設計、監視、CI/CD、障害対応を推進するポジションです。顧客・パートナー・社内チームと連携し、インフラ環境の導入や改善にも取り組みます。
NVIDIA Infrastructure Specialist Teamの一員として、大規模なAI/HPCクラスターおよび関連インフラの設計、導入、運用、自動化を担当します。顧客、パートナー、社内チームと協働し、大規模ネットワーク案件の分析、要件定義、実装を進めます。顧客に対する技術窓口として、ネットワーク、システム設計、運用自動化を横断して支援します。
主な業務は、HPC/AIクラスターの監視、ログ管理、アラート運用、Linuxのジョブ/ワークロードスケジューラーおよびオーケストレーションツールの管理です。サーバー、ネットワーク、ストレージ向けの監視基盤を導入し、ベアメタル、OS、ソフトウェアスタック、アプリケーションの各層から障害を切り分けます。大規模インフラの配備・管理、運用監視・通知、利用者によるリソース利用を自動化するツールを開発・保守します。ソフトウェア導入と自動化のためのCI/CDパイプラインも構築・維持します。
また、標準的な技術手法を整備・文書化して社内チームと共有し、研究開発活動の支援や、将来の改善に向けたPOC/POVにも参画します。
応募には、コンピュータサイエンス、電気・コンピュータ工学、物理学、数学、または関連分野の学士・修士・博士号、もしくは同等の経験が求められます。ネットワークの基礎、TCP/IPスタック、データセンターアーキテクチャに関する8年以上の実務経験が必要です。CPU、GPU、高速インターコネクトおよび支援ソフトウェアを含むHPC・AIソリューション技術の知識、大規模HPCクラスターの導入、最適化、トラブルシューティング経験を要します。
Kubernetesについて、AI/MLワークロードのコンテナオーケストレーション、リソーススケジューリング、スケーリング、HPC環境との統合を含む実践的な経験が必要です。Slurm、Kubernetes、Singularityなどのジョブスケジューリング/オーケストレーション技術、Python、bashスクリプト、CI/CDに関する知識が求められます。Jenkins、Ansible、Puppet、Chefなどの自動化・構成管理ツールの利用経験も対象です。
WindowsおよびLinux(Redhat/CentOS、Ubuntu)の内部構造、ACL、OSレベルのセキュリティ保護、TCP、DHCP、DNSなどのプロトコルに精通していることが必要です。Lustre、GPFS、ZFS、XFSを含む複数のストレージソリューションの経験も求められます。CPU/GPUアーキテクチャ、コンテナ関連のマイクロサービス技術、DGXやCUDAなどGPU向けハードウェア/ソフトウェア、RDMA(InfiniBandまたはRoCE)ファブリックの知識・経験は歓迎されます。日本語話者の顧客へ技術的内容を伝え、効果的に協働できることが必要です。
雇用形態はフルタイム、勤務地は日本国内のリモートです。
求人詳細
NVIDIAについて
NVIDIAは米国のテクノロジー企業で、GPUとAIコンピューティングプラットフォームを設計しています。これらは、世界各地のゲーム、データセンター、機械学習を支えています。
NVIDIAの求人と企業プロフィール →企業情報
AIが作成した概要です。情報が不完全または誤っている可能性があるため、企業の公式情報もご確認ください。
これは企業の公式求人情報をもとにAIで作成した要約です。情報が不完全、古い、または誤っている可能性があります。応募前に必ず公式の求人情報ですべての内容をご確認ください。