(1)
Zhang, C.; Chong, D.; Jiang, F.; Tang, C.; Gao, A.; Tang, G.; Li, H. Aligning Language Models Using Follow-up Likelihood As Reward Signal. AAAI 2025, 39, 25832-25841.