
都市

送信後、メールに届くリンクを開いてください




都市

正社員
英語必須
SRE
DevOps
クラウド
スタートアップ
Sakana AIのマルチエージェントシステム「Fugu」を支えるインフラ・プラットフォームの信頼性向上を担当します。GCP、GKE、Vertex AI、Terraformを用い、性能、可用性、運用コストを改善します。
Sakana AIの研究開発・インフラおよびプラットフォーム信頼性エンジニアとして、マルチエージェントシステム「Fugu」の安定運用と拡大に携わります。Fuguの実際の挙動や障害点、運用コストを把握し、研究開発チームおよびプロダクトチームと密に連携しながら、高い自律性と責任を持って改善を進めます。
GKEクラスター、ゲートウェイ、データベースなどのGCPリソースをTerraformでコード管理します。Vertex AIのモデルサービング基盤、GPUの割り当て・利用効率、増加する需要に合わせたサービング費用を管理します。監視ダッシュボードやアラートの整備、しきい値の調整、過剰な通知の削減、未把握領域の監視追加も担当します。
インシデント発生時には、トリアージ、原因調査、修正またはロールバック、ポストモーテムの作成まで行います。オンコールローテーションに参加し、BigQueryジョブ、利用量・費用の同期、DLPパイプライン、インフラ・モデル・アプリケーションリポジトリのCI/CDにも関わります。リソースの適正化による支出管理や、インフラに起因する顧客向け問題の調査も業務範囲です。
GKE、ネットワーク、監視、ロギングを含むGCP運用の実務経験、プレッシャー下でのKubernetesおよびインフラ障害のデバッグ能力、Terraformで既存コードを読み新しいモジュールを作成する経験が必要です。障害対応で冷静に行動し、関係者以外にも理解できるインシデント概要を文書化できること、アプリケーションやモデルのコードを読み、症状から根本原因を追えることも求められます。Vertex AIなどのAIサービング基盤、Cloud ArmorやDLP、SLO・エラーバジェット・ランブックを含むSREの経験は歓迎されます。
勤務地は東京で、雇用形態は正社員です。業務上の技術的な国際協働に必要な英語力が望まれ、日本語力は歓迎されますが必須ではありません。応募書類は英語で提出します。
求人詳細
これは企業の公式求人情報をもとにAIで作成した要約です。情報が不完全、古い、または誤っている可能性があります。応募前に必ず公式の求人情報ですべての内容をご確認ください。