#每日一篇学术文章# 【CateSift:一种面向大规模文本分类的交互式引导方法】(CateSift: An interactive steering approach for classifying large scale text)
http://t.cn/AXJmc6XM
CateSift:人机协同可视分析,破解大规模文本层次分类难题
在医疗、新闻、电商、舆情等场景中,大规模文本的层次化分类是数据治理与知识组织的关键环节。但传统自动化模型依赖大量标注、难以适配领域定制需求;纯人工分类效率低、成本高;现有系统又缺少直观交互与迭代优化能力,导致分类精度与结构合理性难以兼顾。
南开大学王叙萌团队近期发表于Visual Informatics的CateSift,提出一套融合提示学习、层次建模与可视分析的交互式框架,用 “模型自动生成 + 可视化引导 + 专家知识注入 + 迭代优化” 的闭环,高效解决海量文本层次分类痛点。
一、核心设计:人机协同,各司其职
CateSift 不追求完全自动化,而是让AI 做基础分类,人做关键决策,通过可视化打通协作链路:
领域知识打底:结合领域概念树,用多层提示模型自动生成初始层次分类树,保证父子节点语义一致;
可视化直观呈现:用矩形树图看全局分布、径向树看细粒度结构,以颜色与置信度标记低置信可疑节点;
交互式快速修正:支持节点增删、合并、拖拽调整,一键修正结构与分类错误;
迭代式持续优化:专家标注实时注入模型,增量微调、全局更新,越用越准。
二、关键创新:三大能力提升效率与精度
多层提示学习:将复杂层次分类拆解为二分类任务,适配任意深度结构,支持新标签快速接入;
置信度感知可视化:自动聚焦高风险节点,减少无效检查,大幅降低用户认知负荷;
人在回路迭代:一次修正带动全量优化,用少量专家操作实现模型持续升级。
三、实战效果:高效可靠,落地可行
在新闻实体、电商文本、社交媒体推文三类场景验证:
分类F1 值可达 0.89–0.94,显著优于传统模型;
单任务交互仅需7–14 分钟,远低于纯人工标注;
有效解决标签冗余、粒度不均、语义歧义、误分类等实际问题。
四、核心价值
CateSift 提供了可视分析 + 大模型 + 专家知识的通用方案,兼顾自动化效率与领域定制需求,既适合学术研究参考,也可直接用于医疗、舆情、电商、政务等工程落地,为大规模文本知识组织提供轻量化、高效率的新范式。
附图片摘要。
来源:Visual Informatics
