[1]
Y. Zhang, “LLMEval: A Preliminary Study on How to Evaluate Large Language Models”, AAAI, vol. 38, no. 17, pp. 19615–19622, Mar. 2024.