
都市

送信後、メールに届くリンクを開いてください




都市

正社員
英語必須
バックエンド
ML
AI
スタートアップ
異種ハードウェアを活用するマルチテナント推論基盤を設計・最適化し、LLM、動画生成、マルチモーダルモデルの低遅延・高スループット提供を実現します。
ai&のEngineeringチームで、異種ハードウェアを効率的に活用する高性能なマルチテナント推論サービング基盤を構築します。LLMに加え、動画生成やマルチモーダルシステムを対象に、推論フレームワークやエンジンを評価・統合し、ワークロードに応じたランタイムの選定と継続的な最適化を担います。モデルライフサイクル全体の性能を改善し、disaggregated prefill/decode、speculative decoding、continuous batchingなどを用いてTTFTを抑え、スループットを高めます。小規模な実験用クラスタから大規模なマルチノード環境へ拡張できるサービングアーキテクチャを設計し、KV-cacheの再利用やメモリ管理も最適化します。新しいモデルのリリース時から安定した高性能サポートを実現する方針づくりにも関わります。Backend/Gateway、Compute Orchestrationの各チームと連携し、テレメトリ、障害領域、ライフサイクル管理をロードバランサーやAPI層と整合させます。プロダクションコードの実装、分散システムの複雑な停止・ハングのデバッグなど、スタック全体に手を動かして取り組む役割です。勤務地は横浜または東京。雇用形態は正社員です。
求人詳細
これは企業の公式求人情報をもとにAIで作成した要約です。情報が不完全、古い、または誤っている可能性があります。応募前に必ず公式の求人情報ですべての内容をご確認ください。