运动医学诊所
26-06-05 10:47 微博认证:健康博主

这是认知科学与AI对齐研究里的一个概念,简单说就是:通过故意把问题推到模型知识/价值观的边界,让模型自己检测"我到底知不知道"以及"我会不会乱编",从而校准自身置信度。

------

一、Boundary Pressure Testing(边界压力测试)

指向模型提接近它训练分布边缘的问题:

• 极罕见的事实(冷门历史细节)

• 自相矛盾的前提("清朝的iPhone几代?")

• 极端道德两难或敏感话题边界

目的是看模型在哪一点从"能答对"退化成"瞎编/违规/拒答",以此画出模型能力的真实边界,而不是信它表面说"我知道"。

------

二、Socratic Self-Calibration(苏格拉底式自我校准)

让模型不直接给答案,而是先自我审视:

1. 问自己:这个问题在我的知识范围内吗?

2. 我能给出证据级推理,还是只能猜?

3. 输出置信度或主动说"不确定/无法回答"

典型 prompt 套路是让它先写一段 self-reflection 再作答,减少幻觉。

------

三、两者结合的意思

Boundary Pressure Testing + Socratic Self-Calibration =

用边界难题逼出模型的不确定性,要求它在边界处先做苏格拉底式自查(承认不知道 vs 硬答),以此评估或微调模型的置信度校准质量。

研究上常用这套方法测 LLM 的:

• 幻觉倾向(boundary 以内部位自信答,boundary 外是否仍自信胡编)

• 校准误差(模型自称"很有把握"但实际错的频率)

发布于 云南