清新研究
26-06-08 12:01 微博认证:清华大学新闻学院、人工智能学院双聘教授

我们团队向安玲、杨钰雯使用 自进化 AI 研究算法 AutoTail-BSFGM,详情发在 arxiv 上了,代码部署在 GitHub 上了,这也是我们用 AI 研究出来的第二个新的好算法,用于改善中文学术文本分类中“大类更容易被识别、小类更容易被忽略”的问题。方法在训练阶段加入尾部类别补偿、平衡 Softmax(Balanced Softmax)和快速梯度法对抗训练(Fast Gradient Method,FGM),但不增加模型上线后的推理成本。实验显示:在 67 类摘要分类任务中,相较标签平滑基线,RoBERTa-WWM 验证集准确率提升 1.42 个百分点、锁定测试集提升 0.49 个百分点;MacBERT-base 验证集提升 0.83 个百分点,且达到统计显著水平(p = 0.023)。在 13 类标题分类任务中,验证集宏平均 F1 值提升 1.33 个百分点、平衡准确率提升 2.64 个百分点,锁定测试集平衡准确率提升 1.22 个百分点。核心价值在于:在不更换大模型、不增加部署成本的前提下,提高模型对小众学科和边界类别的识别能力。http://t.cn/AXXEc3jk,,#新媒沈阳聊ai#

发布于 北京