GenRLを1から訓練するとどのくらいのGPUが必要か…

(以下論文に記載内容)

計算リソース。我々はすべての実験に16GBのVRAMを持つV100のクラスターを使用しています。

効率的なトレーニングを可能にするために、画像およびビデオ-CLIPの埋め込みは事前に計算され、データセットと共に保存されます。

MFWMを500kの勾配ステップでトレーニングするのに約5日かかります。

MFWMの事前トレーニング後、50kの勾配ステップのためにアクター-クリティックをトレーニングするのに5時間未満かかります。

データフリーモードでは、3時間未満です。

どちらの場合も、収束は通常10kの勾配ステップ後に達しますが、トレーニングを続けます。

モデルフリーのベースラインは、500kの勾配ステップのトレーニングに約7時間かかります。

単一のGPUでは、モデルフリーRLは少数のランのトレーニングが速くなります。

GenRLは、60回以上のランのトレーニングに世界モデルを使用する際に有利になります(これは、ランの数 = Nシード x Mタスク/ドメインを考慮すると、しばしば当てはまります)。

データフリーポリシー学習戦略を採用する際、GenRLはデータセットに全く依存しません。これにより、トレーニングに必要な時間が半分になります。なぜなら、トレーニングのためにCPU(通常データセットがロードされる場所)とGPUの間でデータ転送がないからです

結果:

結論:

単一 V100 では フル学習に 25日程度

複数使うとおそらく5日