arxivcs.LG2026-07-21
Conservative Query and Adaptive Regularization for Offline RL Under Uncertainty Estimation
Li-Rong Zhou, Qin-Wen Luo, Sheng-Jun Huang
Offline reinforcement learning (RL) aims to learn an effective policy from a static dataset, but its performance is fundamentally limited by dataset coverage. Action preference queries leverage expert feedback without additional environment interaction, enabling policy improvemen…