这是认知科学与AI对齐研究里的一个概念,简单说就是:通过故意把问题推到模型知识/价值观的边界,让模型自己检测"我到底知不知道"以及"我会不会乱编",从而校准自身置信度。
------
一、Boundary Pressure Testing(边界压力测试)
指向模型提接近它训练分布边缘的问题:
• 极罕见的事实(冷门历史细节)
• 自相矛盾的前提("清朝的iPhone几代?")
• 极端道德两难或敏感话题边界
目的是看模型在哪一点从"能答对"退化成"瞎编/违规/拒答",以此画出模型能力的真实边界,而不是信它表面说"我知道"。
------
二、Socratic Self-Calibration(苏格拉底式自我校准)
让模型不直接给答案,而是先自我审视:
1. 问自己:这个问题在我的知识范围内吗?
2. 我能给出证据级推理,还是只能猜?
3. 输出置信度或主动说"不确定/无法回答"
典型 prompt 套路是让它先写一段 self-reflection 再作答,减少幻觉。
------
三、两者结合的意思
Boundary Pressure Testing + Socratic Self-Calibration =
用边界难题逼出模型的不确定性,要求它在边界处先做苏格拉底式自查(承认不知道 vs 硬答),以此评估或微调模型的置信度校准质量。
研究上常用这套方法测 LLM 的:
• 幻觉倾向(boundary 以内部位自信答,boundary 外是否仍自信胡编)
• 校准误差(模型自称"很有把握"但实际错的频率)
发布于 云南
