Publications

† denotes a co-first author and * denotes the corresponding author.

Compress the Easy, Explore the Hard: Difficulty-Aware Entropy Regularization for Efficient LLM Reasoning

Qin-Wen Luo, Sheng Ren, Xiang Chen*, Rui Liu, Jun Fang, Naiqiang Tan, Sheng-Jun Huang*

KDD 2026 (CCF-A)

Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL

Qin-Wen Luo, Ming-Kun Xie, Ye-Wen Wang, Sheng-Jun Huang*

ICML 2025 (CCF-A)

Conservative Query and Adaptive Regularization for Offline RL under Uncertainty Estimation

Li-Rong Zhou, Qin-Wen Luo, Sheng-Jun Huang*

ECAI 2025 (CCF-B)

Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL

Qin-Wen Luo, Ming-Kun Xie, Ye-Wen Wang, Sheng-Jun Huang*

NeurIPS 2024 (CCF-A)