1.
Huang C, Zhang Z, Cardie C. HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization. AAAI [Internet]. 2026 Mar. 14 [cited 2026 Jul. 22];40(37):31122-30. Available from: https://ojs.aaai.org/index.php/AAAI/article/view/40373