AIバイオデータ解析・モデル開発エンジニア
基本情報
単価
140万円/月
勤務地
東京都 / 港区
リモート
フル常駐
職種
データサイエンティスト、機械学習エンジニア
スキル
データ分析ハイパーパラメータ調整分散学習前処理可視化基盤モデル探索的データ分析特徴量設計自己教師あり学習表現学習
案件詳細
AI × バイオデータ研究開発プロジェクトにおいて、以下の業務を担当します。
1.データ解析・研究開発
•大規模オミクス / 医療データの前処理・品質評価
•探索的データ分析(EDA)・可視化・仮説検証
•特徴量設計・データ表現の設計
•学習用データセットおよび評価用データセットの整備
2.機械学習 / 深層学習モデル開発
•機械学習モデルの設計・実装・評価
•ベースライン構築およびモデル改善
•表現学習 / 自己教師あり学習 / 基盤モデル開発
•GPU環境を用いたモデル学習・実験運用
•モデル性能評価、誤差分析、改善提案
3.大規模学習・開発基盤
•分散学習ジョブの設計・運用・最適化
•学習パイプライン / 開発基盤 / 実験管理基盤の構築
•大規模データI/Oや再現性を考慮した研究開発フローの整備
•MLOps / ML Systems 観点での改善
4.研究プロセス・チーム連携
•評価指標設計・ベンチマーク設計
•実験の再現性担保、ログ管理、ドキュメント化
•分析結果のドキュメント化・社内共有
•研究者・データサイエンティスト・エンジニアとの協働
MUST要件
1.アーキテクチャ設計と事前学習の実務経験
•Transformerベースのモデル、またはState Space Models (SSM) を用いた大規模モデルの設計・実装経験。
•基盤モデルのScaling Lawsに基づき、1兆トークン級の学習に必要な計算リソースを定量的で見積もる能力
•数B〜数十B規模のモデルにおける事前学習のハイパーパラメータ・チューニングおよび学習安定化の経験
2.大規模分散学習のエンジニアリング
•PyTorch FSDPやDeepSpeed等のライブラリを、モデルの規模やネットワーク帯域に合わせてカスタマイズ・チューニングした経験
•マルチノード環境におけるGPU間の通信ボトルネックの解消、および1兆トークン規模のデータに対する効率的なI/Oパイプラインの設計経験
•Ring Attentionまたはシーケンス並列(Sequence Parallelism)の実装を通じた、単一GPUメモリをに収まらないコンテキストの学習最適化
WANT要件
•チーム開発の経験(Git運用、レビュー文化)
•クラウドの利用経験
•表現学習 / 自己教師あり学習 / Transformer / Autoencoder / 大規模言語モデルの研究開発経験
•GPU環境でのモデル学習の経験
•分散トレーニング / HPC環境の利用経験
•統計モデリング / 因果推論 / ベイズ統計などの知識
•不均衡データ / 時系列 / マルチモーダルデータ解析の経験
•論文実装・研究再現・ベンチマーク構築
•Pythonによるデータ分析・機械学習の実務経験
•機械学習または統計モデリングの経験
(分類 / 回帰 / 時系列 / 異常検知など)
•データ分析結果を整理し、仮説・改善案まで言語化できる能力
•論理的に課題を分解し、実装・検証まで進められる力
関わるプロジェクトについて
企業名
***********
募集背景
************************************
課題感
*****************************
プロジェクト規模
***********
チーム人数
*****
現場の雰囲気
********************
作業開始/終了時間
***************
平均稼働時間
*********
詳しくはカウンセラーにお聞きください。
カウンセラーに詳細を聞く