AMiner学术头条
24-11-27 10:30 微博认证:北京智谱华章科技有限公司AMiner项目官方微博

Qwen-Audio: Advancing Universal Audio Understanding Via Unified Large-Scale Audio-Language Modelshttp://t.cn/A6mUBQgY
这篇论文介绍了一种名为Qwen-Audio的统一大规模音频语言模型,旨在通过扩大音频语言预训练范围,涵盖超过30个任务和各种音频类型,如人类语音、自然声音、音乐和歌曲,以实现通用音频理解能力。为了解决多个任务和数据集之间的直接共同训练可能导致干扰的问题,作者设计了一个基于层次标签序列的多任务训练框架,以鼓励知识共享并避免干扰。Qwen-Audio在多样基准任务上实现了显著的性能,无需进行任务特定微调。基于Qwen-Audio的能力,作者进一步开发了Qwen-Audio-Chat,它允许各种音频和文本输入,支持多轮对话和各种音频中心场景。#每日AI动态##人工智能[超话]##硕士论文[超话]##大语言模型#

发布于 北京