نسخة أولية وصول مفتوح
Revealing After Overwriting: An Exponential POMDP OPE Lower Bound under History-Dependent Logging
Multi-step revealing can make off-policy evaluation tractable under memoryless logging. With history-dependent logging, state decodability and target-relevant evidence can separate. For every horizon $H\ge3$, we construct two exactly realizable POMDPs with four actions, at most four states per layer, a known logger, an …