GenRLの絵…
コネクタによってVLMからの入力を世界モデルの潜在表現にしている
アライナは言語表現を視覚表現に直す
数式
encoder,decoder,vlmは上図
sequencemodel,dynamicsmodelは下図
を見るとわかりやすいです