マルチモーダル世界モデル論文サーベイ
世界モデルと言語モデルの接地の先行研究モデル
WorldGPT
- マルチモーダルエンコーダ、LLM、マルチモーダルデコーダの3つのコンポーネントから構成
Dynalang
- 世界モデルに言語と画像を突っ込む
- 特定のベンチマークで性能発揮
Socraticmodel
SayCan
- LLMを用いて、タスクに関連するスキルを提案し、それらが高次の目標達成にどの程度貢献するかを評価する。
- 特定のスキルが現在の環境でどの程度成功可能かを予測
GenRL
- 「マルチモーダル基盤モデル」MFWM
- ビジョンと言語モデルの特徴を「生成的な世界モデル」に接続し、タスクを視覚または言語プロンプトで指定して学習可能にする
- これにより、従来のRLが必要とする報酬設計を回避し、シミュレーション内でタスクを学習する「データフリーRL」を実現
InternVideo2
- ビデオ基盤モデル
- 3段階のトレーニング(マスクされたビデオトークン再構築、クロスモーダルコントラスト学習、次トークン予測)