[1]
C. Huang, Z. Zhang, and C. Cardie, “HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization”, AAAI, vol. 40, no. 37, pp. 31122–31130, Mar. 2026.