(1)
Huang, C.; Zhang, Z.; Cardie, C. HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization. AAAI 2026, 40, 31122-31130.