麻省理工科技评论
24-12-01 18:50 微博认证:《麻省理工科技评论》杂志官方微博

#大模型训练# 【研究人员阐明语言模型在不同算术场景中的泛化机制,可指导大模型训练优化】

尽管#大语言模型# 已经在许多任务中表现出色,但它们在超出训练集分布泛化方面的能力仍然未被充分理解。例如,在自然语言处理中,大语言模型在某些泛化任务中的确表现优异,但在其他任务中可能会产生事实性错误或误导性信息。

近日,上海人工智能实验室徐兴成研究员与包括#上海科技大学# 张海鹏、赵梓博以及复旦大学杨燕青在内的合作者,通过一套统一的理论框架阐明了基于 Transformer 的语言模型在不同算术场景中的泛化机制,并揭示了任务属性和训练数据对于模型表现的决定性作用。这能帮助人们更好地理解模型泛化行为,还为更高效的数据训练以及更优的人工智能对齐提供指导。

首先,本次成果将能指导模型训练优化。通过对训练数据质量和覆盖范围加以分析,可以更好地理解向内和向外泛化的影响,从而优化训练数据的选择和使用,同时还能节省数据资源。此外,通过对任务属性进行分析,可以帮助设计与模型属性相容的结构,从而提升模型的向外泛化能力。

其次,本次成果将能用于自然语言处理研究。即将泛化理论用于自然语言处理中的复杂任务分析,使其能够更准确、更高效地处理各种语言任务。

再次,本次成果将能用于人工智能对齐与安全提升。通过深入理解大语言模型在不同任务中的泛化机制,可以设计出更加安全、更加可控的人工智能系统。

戳链接查看详情:http://t.cn/A6mfmdJc