
都市

送信後、メールに届くリンクを開いてください




都市

正社員
英語必須
ML
AI
Python
スタートアップ
NVIDIAとAMDのGPUを対象に、CUDAやROCm/HIPによるカスタムカーネルを開発し、AI推論・学習基盤の性能をプロファイリングと実装改善で高めます。
ai&のEngineering部門で、AI推論・学習基盤のカーネル最適化を担当します。フレームワークの下層でCUDAおよびROCm/HIPのカスタムカーネルを設計・実装し、プロファイリングから本番導入までを担います。NVIDIAとAMDのGPUアーキテクチャ、メモリサブシステム、スケジューラ、キャッシュ階層の違いを踏まえ、各ハードウェアに適した処理を開発します。GEMM、attention、normalization、convolution、Flash Attention系・MLA・paged attention、量子化処理、融合演算、マルチGPU間の通信カーネルなどが対象です。FP16、BF16、FP8、e5m2、確率的丸めを含む精度形式を評価し、精度と性能のバランスを検討します。Nsight Compute、rocprof、Perfetto、VTune、独自計測を使ってボトルネックを分析し、メモリ帯域、warp divergence、occupancy、キャッシュ利用などの課題を改善します。勤務地は横浜または東京都です。
求人詳細
これは企業の公式求人情報をもとにAIで作成した要約です。情報が不完全、古い、または誤っている可能性があります。応募前に必ず公式の求人情報ですべての内容をご確認ください。