我现在有足够的锚点来进行全面审稿。论文引用的关键相关工作包括:
- Angell et al. (arXiv:2604.22167, 2026年4月) — 基于重要性抽样的尾部风险估计,早于本文3个月,提供的是经验性估计(无形式化保证)。该论文有引用此文献。
- Jones et al. (arXiv:2502.16797, 2025) — 预测罕见的LLM行为,该论文有引用此文献。
- Zhao et al. (arXiv:2404.17546, 2024) — 用于罕见事件估计的序列蒙特卡洛方法,该论文有引用此文献。
- Arditi et al. (NeurIPS 2024) — 拒绝方向线性特征 (Refusal direction linear feature),该论文有引用此文献。
- “Estimating Rare Events in Language Models with Proper Evaluation” (arXiv:2607.18454) — 发表于2026年7月,为同期工作。
该论文的核心新颖性在于提供了可靠的(有形式化保证的)下界,而上述方法仅提供经验性估计。现在我将输出审稿意见。
论文审稿:Large Language Models 的可靠概率安全界限
论文类型: 方法型
该论文提出了一种新方法,用于计算LLM在给定提示词下生成有害输出的概率的形式化(可靠)下界。它结合了自回归生成树的部分扩展、潜在空间中的线性危害特征以及 Clopper-Pearson PAC 界限,以产生经过形式化验证的概率下界——不同于之前仅提供经验性估计而无理论保证的工作。
公理审查结果
公理一:对象公理
- 判定: ✅
- 依据: 该问题真实且定义明确。给定一个固定的提示词
x,一个LLM M 和一个安全预言机 H,计算 p = P[H(G(x,L,M))=1]——即随机自回归生成产生被 H 标记为有害输出的概率。这是一个真实的对象:已对齐的LLM在部署中仍然存在非零的有害输出概率,而现有的对齐方法无法提供形式化保证。问题陈述(第2节,公式1-2)正式定义了对象,包括安全集的闭包属性(将形式化方法中的安全规范移植到LLM中)、黑盒预言机访问以及自回归生成过程。该对象是可操作的:H 是黑盒的,可以是词法分析器、分类器或人工审核员。该问题具有明确的社区价值——对安全关键型LLM部署进行认证是现实需求。论文正确指出,精确计算是难以处理的(|V|^L 个叶子节点),因此需要界限。该对象并不局限于极少数人群:它适用于任何部署在安全敏感环境中的LLM。外延与实验范围一致:论文在固定提示词设置下计算界限,并明确承认扩展到提示词分布是未来的工作。
- Wiki 证据: OMC Wiki 对 “LLM safety certification probabilistic bounds”、”Clopper-Pearson LLM”、”jailbreak red-teaming certification” 的查询均未返回结果。paper-wiki 对相关概念未返回结果。free-search 确认了该问题领域活跃且真实:Angell et al. (2604.22167)、Jones et al. (2502.16797)、Zhao et al. (2404.17546) 都在解决同一问题,证实了社区的相关性。未发现质疑该问题是否存在的先前工作。
公理二:识别公理
- 判定: ⚠️
- 依据: 论文比较了三种方法:朴素蒙特卡洛(MC)、Clopper-Pearson(CP)置信区间以及其提出的有引导树搜索方法。MC 和 CP 是正确的最简基线。比较在计算预算(总生成的 token 数)上是公平的。然而,存在一个重要的缺口:论文没有与更近期的基于抽样的方法进行比较——特别是 Zhao et al. (2404.17546) 的序列蒙特卡洛方法和 Angell et al. (2604.22167) 的重要性抽样方法。论文引用了这些工作是仅提供“经验性估计而无理论保证”的,这虽然在原则上是正确的,但没有在同一计算预算下与它们进行经验性比较。由于这些是针对同一问题最相关的强基线,它们的缺席削弱了识别能力:我们无法判断所提出的有引导搜索是否比重要性抽样能找到更多/更少的有害输出,或者是否有相似的效率。论文正确地隔离了关键变量(温度、Top-K、计算预算),并且在各实验中保持它们一致。消融研究表明,Top-K(10 vs 20)和温度会影响下界的紧密程度,这与设计一致。但是,没有消融实验分离出线性特征引导与随机树扩展的贡献——即,没有“无引导的树搜索”基线来展示特征向量
v 本身是必要的。论文提供了对随机搜索的隐式比较(因为MC为0),但明确的无引导树扩展基线将加强识别能力。
- Wiki 证据: OMC Wiki 查询未返回结果。paper-wiki 未返回结果。free-search 确认 Zhao et al. (2404.17546) 和 Angell et al. (2604.22167) 是直接相关的方法,应作为基线进行讨论。
公理三:独立性公理
- 判定: ✅
- 依据: 评估框架在结构上与训练无关——它是对预训练、已对齐LLM的离线认证。安全预言机
H 是一个与被测LLM M 分离的黑盒。在所有实验中,H 被实现为词法分析器(黑名单 token 匹配),这是完全独立的——没有训练循环,没有基于偏好的过滤,也没有模型作为裁判的评估。数据集 D_harmful 和 D_harmless 是从一个无限制的LLM(不同的生成设置)中采样的,用于计算危害方向向量 v,但这些仅用于引导搜索启发式算法——并不用于最终的界限计算。界限本身的可靠性来源于自回归生成树的部分构建(第4节中的观察2),这在数学上是独立于启发式算法的:无论启发式算法找到什么,下界 p_L 在 p 方向上都是可靠的。这是论文最强的一点:启发式算法可以随意出错而不会损害形式化保证。评估指标(概率界限)直接来自LLM的输出分布,而不是来自任何外部判断。不存在循环推理。
- Wiki 证据: OMC Wiki 对 “judge independence circular reasoning” 和 “synthetic human validation” 的查询未返回结果。论文的方法通过使用词法分析器安全预言机和树概率计算避免了这个问题。
公理四:压缩公理
- 判定: ⚠️
- 依据: 该方法结合了三个清晰的组成部分:(1) Clopper-Pearson PAC 界限(经典统计学,1934年),(2) 生成树的部分扩展(来自形式化验证的标准技术),以及 (3) 潜在空间中的线性危害特征(来自 Arditi et al. 2024)。每个组成部分都是已知技术,但组合是新颖且有动机的:组成部分 (3) 引导 (2),这保证了来自 (1) 的可靠界限。设计表现出一定的压缩:关键洞察在于,使用不可靠的启发式算法进行部分树扩展仍然能产生可靠的下界(观察2),这是一个简洁且可迁移的原理。然而,适应度函数(公式3)有点特别:它在所有层上对余弦相似度和序列概率的几何平均值进行求和,并带有偏移参数
b。论文没有提供关于这个特定公式为何优于更简单替代方案的原则性理由。适应度设计中存在多个超参数(层数 l、偏移 b、Top-K、温度),论文没有探讨这些选择是否最优或是否可压缩。命名是适度的——没有命名膨胀。论文可以是一个更简单的“无适应度”树扩展(只按序列概率扩展),但与这样的基线相比,适应度函数可能是不必要的复杂。没有这样的比较,我们无法判断压缩与过度工程化。
- Wiki 证据: OMC Wiki 对 “latent feature steering existing methods” 和 “standard practice equivalence” 的查询未返回结果。free-search 确认线性特征转向(Arditi et al. 2024, “Refusal in Language Models Is Mediated by a Single Direction”)是一个已确立的技术,在此处被应用而非发明。
公理五:效用公理
- 判定: ⚠️
- 依据: 在所有7个实验中,所提出的方法始终产生非平凡的下界,而MC和CP在相同计算预算(10^3 个 token)下产生零。跨模型(Phi-4, Llama-3.2-3B, Llama-3.1-8B)和跨提示词的绝对值范围为 10^{-34} 到 0.284,这表明有害概率并不总是可忽略的——模型无法通过安全认证。这具有实际效用:它识别了具体的危害路径并提供了数值界限。然而,存在几个效用缺口:(1) 所有7个实验都使用词法分析器安全预言机(黑名单 token 匹配)。这是一种最简单可能的
H。论文提到 H 可以是分类器或人工,但没有使用更复杂的预言机进行实验。词法分析器可能会遗漏微妙的危害并产生误报/漏报。(2) 固定提示词范围:所有实验都是单一提示词。对提示词分布的推广(论文承认这是未来工作)对于现实世界的认证是必不可少的。(3) 计算预算固定在 10^3 个 token:论文在迭代图中显示了对预算的敏感性(图4-9),但表格结果仅使用一种预算设置。没有展示方法如何随计算资源扩展或趋于饱和。(4) 没有与 Angell et al. 或 Zhao et al. 的经验比较,所以无法判断相对于最强经验方法,绝对效用是否有所提升。(5) 论文本身指出界限可能极其宽松(例如 10^{-34}),对于认证目的而言,这实际上等同于“我们无法证明安全性”,但下界太小而无用。更有用的结果(例如 0.086-0.284)出现在危害相对频繁的提示词上,这引出了一个问题:当模型已经相当安全时,该方法是否仍然有效。
- Wiki 证据: OMC Wiki 对 “SOTA latest strongest baseline” 和 “fair comparison same backbone” 的查询未返回结果。free-search 确认 Angell et al. (2604.22167, 2026年4月) 和 Zhao et al. (2404.17546, 2024) 是最相关的强基线,未在实验中进行比较。
公理六:新颖性公理
- 判定: ✅
- 依据: 核心新颖性是真实且非平凡的。之前针对LLM危害概率估计的所有工作(Wu & Hilton 2025, Jones et al. 2025, Zhao et al. 2024, Angell et al. 2026, Højmark et al. 2024)都提供经验性估计——没有形式化保证的点估计。该论文是第一个针对LLM有害输出概率提供可靠(有形式化证明)界限的工作。关键的洞察是,使用任意的、无保证的启发式算法进行部分树扩展仍然能产生经过数学验证的下界(观察2)。这是一个真正的机制贡献,而不仅仅是A+B+C的组合:它弥合了形式化验证(安全界限)与经验性LLM安全性(罕见事件估计)之间的鸿沟。潜在空间特征引导是来自可解释性(Arditi et al. 2024)的迁移组件,但它被用于新的目的——指导树搜索而不是转向生成——并且它对于界限来说是可有可无的(如果失败,界限仍然可靠)。Clopper-Pearson 区间是经典的,但这里应用方式不同:作为一种解释树搜索结果的比较基准,而不是作为主要工具。该论文在讨论相关工作时非常诚实,明确将每个先前的贡献标记为“没有理论保证的经验性估计”。并发工作 “Estimating Rare Events in Language Models with Proper Evaluation” (2607.18454, 2026年7月) 在2个月内出现,因此根据并发工作规则不算作新颖性缺陷。
- Wiki 证据: OMC Wiki 对 “first new unified” 和 “component sources existing work” 的查询未返回结果。free-search 确认所有先前方法(Angell, Zhao, Jones, Wu, Højmark)仅提供经验性估计。没有先前工作为LLM有害概率提供可靠的形式化界限。
公理七:可复现公理
- 判定: ⚠️
- 依据: 论文提供了算法(附录中的算法1和2)、所有关键超参数(
|D_harmful|=|D_harmless|=64,K=10/20,温度范围,L=128,计算预算=10^3)、模型名称(Llama-3.1-8B-Instruct, Llama-3.2-3B-Instruct, Phi-4)以及硬件(NVIDIA H100)。确切的提示词和黑名单 token 在所有7个实验中都有提供。然而:(1) 未提供代码库链接或承诺发布代码。没有GitHub链接,没有对发布的引用。(2) 适应度函数(公式3)有未说明的超参数:层数 l 没有指定(哪些层?所有层?最后一层?),偏移 b 没有给出数值。(3) D_harmful 和 D_harmless 是从一个“无限制的LLM”中生成的——未指定是哪个模型以及什么生成设置。(4) 没有提供模型检查点(虽然模型是公开的,所以这不是问题)。(5) 安全预言机实现很简单(token 匹配),所以那部分是可复现的。如果没有代码和未说明的超参数,独立复现将需要逆向工程适应度函数实现细节,这是一个显著的障碍。
- Wiki 证据: OMC Wiki 没有返回关于可复现性标准的相关结果。
日报摘要
- Strength: 首次为LLM有害输出概率提供形式化可靠下界,利用部分生成树扩展保证数学正确性,在7个实验中一致获得非平凡下界(10^{-34}至0.284),而Monte Carlo和Clopper-Pearson在同等预算下均为零。
- Weakness: 未与最强同期经验方法(Angell et al.重要性采样、Zhao et al.序列蒙特卡洛)进行实验比较,且全部7个实验仅使用最简词法安全oracle,未验证更复杂分类器oracle下的有效性。
总评
- 科学价值: 高 — 首次为LLM安全概率提供形式化可靠界限,核心理论观察(部分树扩展保证下界可靠性)是真正的机制贡献,独立于启发式质量。
- 方法价值: 中 — 方法组合了已有技术(Clopper-Pearson、线性特征、树搜索),但组合方式有新意;适应度函数设计偏ad hoc,缺少无引导树搜索ablation证明引导的必要性。
- 社区价值: 中高 — 为LLM安全认证开辟了形式化路径,可产出有害样本用于后训练;但当前仅验证固定prompt+词法oracle,距离实用认证标准仍有距离。
打分
| Axiom |
判定 |
分数 |
权重 |
加权分 |
| 一 对象公理 |
✅ |
9 |
1.0 |
9.0 |
| 二 识别公理 |
⚠️ |
5 |
1.5 |
7.5 |
| 三 独立性公理 |
✅ |
9 |
1.0 |
9.0 |
| 四 压缩公理 |
⚠️ |
6 |
1.0 |
6.0 |
| 五 效用公理 |
⚠️ |
5 |
2.0 |
10.0 |
| 六 新颖性公理 |
✅ |
8 |
2.0 |
16.0 |
| 七 可复现公理 |
⚠️ |
5 |
1.0 |
5.0 |
加权总分: 6.8/10(加权分之和 62.5 / 权重之和 9.5)
最终建议: Weak Accept