Zhang, Y., Zhang, M., Yuan, H., Liu, S., Shi, Y., Gui, T., … Huang, X. (2024). LLMEval: A Preliminary Study on How to Evaluate Large Language Models. Proceedings of the AAAI Conference on Artificial Intelligence, 38(17), 19615–19622. https://doi.org/10.1609/aaai.v38i17.29934