نسخة أولية وصول مفتوح
World Potential Model: Pretrained World Knowledge as Progress Potentials
Long-horizon language agents often receive supervision only from terminal task outcomes, leaving little signal for distinguishing productive intermediate behavior from stagnation or even regression. Rather than learning a separate value function or process reward model for every task, we ask whether pretrained models c …