机器智能研究MIR
25-07-07 18:03 微博认证:中科院自动化所主办Machine Intelligence Research官方微博

在自然语言处理领域,大语言模型(LLM)的快速发展日益受到关注。大语言模型在各种任务中都展现出了较强的创造力。然而,评估这种创造力的方法尚不完善。对大语言模型创造力的评估需考虑模型与人类的差异,要求兼顾准确性与效率,同时进行多维度衡量。来自中国科学技术大学与中国科学院计算技术研究所的研究者们搭建了一个高效评估大语言模型创造力水平的框架。本研究通过改良Torrance创造思维测验,评估了多种大语言模型在7项任务中的创造力表现,重点关注其流畅性、灵活性、原创性和精进性这四项标准。在此背景下,本研究开发了一个包含700个问题的综合测试数据集,以及一种基于大语言模型的评估方法。此外,本研究还对大语言模型面对不同提示词和角色扮演情境时的反应进行了新的分析。本研究发现,大语言模型的创造力主要在原创性方面表现不佳,而在精进性方面表现出色。同时,提示词的使用和模型角色扮演的设置能明显影响其创造力。实验结果表明,多个大语言模型之间的协作能够提升原创性。值得注意的是,本研究发现,在影响创造力的人格特质方面,人类评估与大语言模型评估结果存在共识。这些发现表明了大语言模型的设计对其创造力有重要影响,并在人工智能与人类创造力之间架起了桥梁,为理解大语言模型的创造力及其潜在应用提供了深刻见解。欢迎阅读 http://t.cn/A6DsDLA0 #人工智能[超话]##机器学习[超话]##大语言模型#

发布于 北京