我现在有足够的锚点来进行全面审稿。论文引用的关键相关工作包括:

  1. Angell et al. (arXiv:2604.22167, 2026年4月) — 基于重要性抽样的尾部风险估计,早于本文3个月,提供的是经验性估计(无形式化保证)。该论文有引用此文献。
  2. Jones et al. (arXiv:2502.16797, 2025) — 预测罕见的LLM行为,该论文有引用此文献。
  3. Zhao et al. (arXiv:2404.17546, 2024) — 用于罕见事件估计的序列蒙特卡洛方法,该论文有引用此文献。
  4. Arditi et al. (NeurIPS 2024) — 拒绝方向线性特征 (Refusal direction linear feature),该论文有引用此文献。
  5. “Estimating Rare Events in Language Models with Proper Evaluation” (arXiv:2607.18454) — 发表于2026年7月,为同期工作。

该论文的核心新颖性在于提供了可靠的(有形式化保证的)下界,而上述方法仅提供经验性估计。现在我将输出审稿意见。


论文审稿:Large Language Models 的可靠概率安全界限

论文类型: 方法型

该论文提出了一种新方法,用于计算LLM在给定提示词下生成有害输出的概率的形式化(可靠)下界。它结合了自回归生成树的部分扩展、潜在空间中的线性危害特征以及 Clopper-Pearson PAC 界限,以产生经过形式化验证的概率下界——不同于之前仅提供经验性估计而无理论保证的工作。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

日报摘要

总评

打分

Axiom 判定 分数 权重 加权分
一 对象公理 9 1.0 9.0
二 识别公理 ⚠️ 5 1.5 7.5
三 独立性公理 9 1.0 9.0
四 压缩公理 ⚠️ 6 1.0 6.0
五 效用公理 ⚠️ 5 2.0 10.0
六 新颖性公理 8 2.0 16.0
七 可复现公理 ⚠️ 5 1.0 5.0

加权总分: 6.8/10(加权分之和 62.5 / 权重之和 9.5) 最终建议: Weak Accept