哈勃观察员
26-08-18 22:31 微博认证:科学科普博主 头条文章作者

疗愈1T:万亿参数的医疗专用大模型!

医疗大模型研发正面临一道棘手的“三难困境”——医患规范沟通、多模态临床推理、电子病历智能体操作,这三类核心任务彼此独立,且失效模式截然不同。传统做法是用通用医学数据集统一微调,但结果往往是“补东墙拆西墙”——优化沟通话术会导致ICD编码准确率下滑,强化推理能力又会压缩问诊流程,促使模型过早下诊断。
针对这一结构性矛盾,研究团队基于Kimi-K2.6基座,创新设计了一套人工把关自进化LoRA微调框架,推出万亿参数医疗专用模型“疗愈1T”,其上下文窗口达256K,原生支持图文多模态输入,全程冻结基座主干,仅更新低秩适配器,以极轻量训练成本实现了多维度能力的同步跃升。

整套训练闭环包含五大模块,核心逻辑是“以失败样本驱动精准修复”,而非盲目灌数据。首先由规划模块定义目标能力、评测基准与数据配方,经人工审核后方可启动;随后进入三段式阶梯训练——监督微调筛查数据有效性,强化学习优化决策策略,自蒸馏收敛输出逻辑。训练完成后,全基准评测自动运行,系统会完整记录每条案例的推理轨迹,并归纳故障根源为知识缺失、推理断层、工具调用错误或沟通话术疏漏。
最关键的一步是数据精细化生成:针对失败样本,采用推理修正、知识注入、行为校准、留存锚点和任务专项修复五类策略,定向合成修复数据,同时用锚点样本牢牢锁住已有能力,防止新优化挤掉旧功能。最终,人工终审闸门对本轮效果进行复盘,决策是保留、回退、补充优化还是正式发布。整个循环不依赖海量通用数据,而是围绕“数据配方迭代”持续精进,区别于传统调参或批量灌数据的粗放路径。

在评测验证环节,“疗愈1T”接受了MedAgentBench、AgentClinic、MedXpertQA、HealthBench四大类共六套权威医疗基准的全维度检验,并在其中五项斩获第一。
MedAgentBench聚焦FHIR标准下的电子病历工具调用,基座Kimi-K2.6基线准确率为88.3%,经多轮自进化优化后“疗愈1T”攀升至94.0%,超过Claude Opus 4.8的93.7%,有效攻克了病历编码缺失、申请单字段错误等高频顽疾。
HealthBench医患沟通评测中,专业场景得分66.2%,高难度场景36.8%,均小幅领先Claude Opus 4.8,核心优势是全面覆盖医师评分标准所有要点,杜绝关键宣教信息遗漏。
MedXpertQA图文专科问答综合总分65.5%,仅次于GPT-5.5的67.5%,但在罕见病和病理影像判读上提升显著。
AgentClinic多轮仿真诊疗综合通过率79.6%,与Claude Opus 4.8基本持平,关键突破是大幅减少了“检查未完善即提前下结论”的典型误诊缺陷。此外,在数学AIME、科学GPQA、通讯零售智能任务等域外通用评测中,“疗愈1T”性能与通用大模型持平,证明医疗专项优化并未牺牲基础推理能力。

当然,研究也存在明确边界:受算力限制仅采用LoRA适配器,未做全参数微调;所有评测均在标准化仿真环境中完成,缺乏真实医院长期临床验证;精神科、儿科等细分专科尚未定向迭代。尽管如此,其行业价值不容忽视——技术层面,开创了故障样本驱动的自进化范式,为医疗专用智能体训练提供了标准化可复现流程;行业层面,同时覆盖病历操作、问诊沟通、多模态诊断全链路,适配医院电子病历、线上问诊、院内辅助诊疗等多场景;评测层面,单一模型同时适配四类差异化基准,打破了“单项强、综合弱”的旧有瓶颈,为医疗机构选型和医疗AI研发提供了全新参考标准。

这套自进化框架具备高度复用性,后续可快速迁移至专科智能体研发,同时其严谨的仿真与临床差距声明,也为医疗AI监管和院内落地提供了务实的性能参照,推动更安全、更完整、更可执行的临床自主智能体持续迭代。
#热门微博# #医学新闻# #ai医疗# #哈勃观察员[超话]#

发布于 广东