生成AIやLLMを活用し、顧客の業務課題に対するAIソリューションの提案から導入、効果検証までを担当します。要件定義や見積もり、顧客折衝、進行・リスク管理を行い、開発チームと連携して案件を推進します。
この求人について
JAPAN AIのエンタープライズ向けAIエージェント群を対象に、出力品質・安全性・信頼性を科学的に評価する基盤の設計、構築、運用を担います。LLM-as-Judgeの校正、rubric設計、バイアス検出、評価ベンチマークの構築と妥当性検証、報酬モデリングやpreference learningの評価への応用、win rate・task success・factuality・harm detectionなどのメトリクス設計を行います。合成データや実ログによる評価セットを整備し、マルチターン、ツール利用、ロングコンテキストに対応した評価ハーネスを構築します。研究成果をCI/CDに組み込み、品質ゲート、回帰テスト、品質トレンドの可視化、回帰検出を自動化します。さらに、自動レッドチーミング、adversarial testing、ポリシー準拠検証、ハルシネーション検出、プロンプト・ツールの回帰テストを実装し、A/Bテストや有意差検定によってモデルやプロンプト変更の効果を検証します。評価結果をResearch Engineer、Agentic Product Engineer、Agent Harness Engineer、AI PlatformのSoftware Engineer、Product Managerへ共有し、改善提案につなげます。開発組織は約120名です。関連分野の修士号以上または同等の実務経験、MLエンジニア・データサイエンティスト・リサーチエンジニアなどの経験3年以上、LLM・生成AI評価、統計学・実験計画法、Pythonによる評価パイプライン、PyTorch・JAX・TensorFlowなどの実務経験が必要です。日本語で製品開発の議論ができる、または英語がビジネスレベルであることが求められます。NeurIPSなどでの発表、RLHF・DPO、AI安全性、ベンチマーク、Spark・BigQuery、CI/CDへの組み込み経験は歓迎されます。技術環境はPython、TypeScript、React、Next.js、pytest、LangSmith、Weights & Biases、BigQuery、Spark、Pandas、GCP、Kubernetes、Docker、Terraform、GitHub Actionsなどです。正社員、想定年収800万~1600万円。勤務地は東京都新宿区。10:00~19:00、土日祝休み、週3日出社・週2日リモートのハイブリッド勤務です。書籍購入、AI・開発ツール、語学学習、資格取得、リフレッシュ、家賃などの支援制度があります。
これは企業の公式求人情報をもとにAIで作成した要約です。情報が不完全、古い、または誤っている可能性があります。応募前に必ず公式の求人情報ですべての内容をご確認ください。