GenRLを1から訓練するとどのくらいのGPUが必要か…
(以下論文に記載内容)
計算リソース。我々はすべての実験に16GBのVRAMを持つV100のクラスターを使用しています。
効率的なトレーニングを可能にするために、画像およびビデオ-CLIPの埋め込みは事前に計算され、データセットと共に保存されます。
MFWMを500kの勾配ステップでトレーニングするのに約5日かかります。
MFWMの事前トレーニング後、50kの勾配ステップのためにアクター-クリティックをトレーニングするのに5時間未満かかります。
データフリーモードでは、3時間未満です。
どちらの場合も、収束は通常10kの勾配ステップ後に達しますが、トレーニングを続けます。
モデルフリーのベースラインは、500kの勾配ステップのトレーニングに約7時間かかります。
単一のGPUでは、モデルフリーRLは少数のランのトレーニングが速くなります。
GenRLは、60回以上のランのトレーニングに世界モデルを使用する際に有利になります(これは、ランの数 = Nシード x Mタスク/ドメインを考慮すると、しばしば当てはまります)。
データフリーポリシー学習戦略を採用する際、GenRLはデータセットに全く依存しません。これにより、トレーニングに必要な時間が半分になります。なぜなら、トレーニングのためにCPU(通常データセットがロードされる場所)とGPUの間でデータ転送がないからです
結果:
MFWM(Multimodal Foundation World Model)の事前学習
→ 500k ステップ = 約5日(クラスタ環境)
→ **単一V100だと5倍程度かかる可能性あり → 約25日
Actor-Critic の学習(50k ステップ)
結論:
単一 V100 では フル学習に 25日程度
複数使うとおそらく5日