所有 Wiki 查询均未返回结果。OMC Wiki 不包含有关软件验证主题的知识。paper-wiki 数据库侧重于音频/语音领域,因此没有匹配项。我已经阅读了完整的论文。现在我将输出审阅结果。

论文审稿:Partial Contracts Suffice: Sound, LLM-Inferred Regression Verification

论文类型: 方法型

本文提出了一种新的回归验证方法,将基于 LLM 推断的部分契约与基于假设-保证(assume-guarantee)的模块化等价性检查相结合,并附带一个语义契约紧密度比较器。核心工件是一个三工具流水线 (CONTRACTOR/SCRIBE/REGVER) 以及两个定理 (T1, T2),属于方法型论文,但也具有很强的分析成分 (RQ2 紧密度饱和度)。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

RQ1 (契约推断):在 Frama-C-Problems 上,SCRIBE 达到了 70.6%/85.7% (Opus), 78.4%/85.1% (Kimi), 70.6%/81.8% (Qwen) 的决定性/保守成功率,而 AutoSpec 为 60.8%,Preguss 为 79.7% (三次平均值)。这相当具有可比性,但 Preguss 的数字是基于三次运行的平均值,而 SCRIBE 是单次确定的运行。在 X509 上:5/6, 5/6, 3/6 对比 AutoSpec 的 6/6——SCRIBE 并未明确超越 AutoSpec。因此,在契约推断方面,SCRIBE 具有可比性但不卓越

EqBench-C 健全性:在 272 对中,仅决定了 70 对 (25.7%)——这是一个低到达率。契约将决定数量提高到 105/106/102 (38.6%),但代价是高误报率 (40/39/38 FP 对比 65/67/63 正确)。因此,契约扩展了范围,但在约 38% 的恢复决策中是误报繁重的。作者将其描述为“可分拣的过度近似而非回归”,这很诚实,但这意味着该方法在等价性检查方面的实际效用是有限的——大多数对超时或产生误报。

RQ2 (紧密度):一个严重的警告是,约 40% 的轮次比较涉及 JUDGE 无法排序的量化或指针解引用后置条件。因此,饱和度声明仅适用于约 60% 的可比较目标。在那些可比较的目标中,部分契约与强化契约的等价性很高 (18/20, 13/15, 14/18),但外部的 40% 是未知的,而非已验证的等价。

基准非常小:Frama-C-Problems (~17 LoC),X509 (六个函数),EqBench-C (精心构造的例子,非生产代码)。作者在“外部有效性”中诚实地指出了这一点。在实际规模上的效用尚未证明。

公理六:新颖性公理

  1. “第一个基于契约的回归验证工具”——经过交叉验证:相关工作调查 (§III-A) 涵盖了 RVT, Reve/LLREVE, SymDiff, DAC, ARDiff, PEQcheck, PEQtest, PASDA,以及基于 LLM 的测试工具 (Mokav, UnitTenX)。这些工具中没有一个使用 LLM 推断的契约作为被调用者抽象来进行回归等价性证明。基于影响摘要的回归验证 (Backes et al. [26]) 通过路径条件约束将证明限制在更改相关的行为上,但需要全程序符号执行并生成与特定差异绑定的摘要,而非可重用、可强制执行的契约。

  2. 单边部分契约 (定理 T1):先前的工作需要被调用者的完整特征(RVT 使用未解释函数,Reve 使用耦合谓词,SymDiff 使用关系摘要)。对旧版本进行单边、属性相对、调用者足够的抽象——在新版本上具体运行——是一个真正的重构,直接实现了 LLM 推断(契约保持足够小以供模型猜测)。

  3. 语义契约紧密度比较器 (JUDGE, C3):先前的 LLM 契约工具按验证成功或语法注解数量进行评估。JUDGE 通过在允许集上使用带有反例见证的决策过程定义了集合包含的紧密度——这是一个真正的新评估贡献。

  4. 来自验证器反例的自动契约推断:CE 引导循环本身是建立的 (CE-GIS [44-47], 用于不变量的 LLM 循环 [36-43]),但将其应用于回归验证环境中的函数级帧条件,并由 BMC 追踪反馈而非 WP 级别的 VC 失败驱动,是一个有意义的改编,而非简单的重命名。

由 LLM 提出并由验证器认证的组件并非微不足道的 A+B+C 组合:定理 T1 将契约可靠性专门与回归等价性证明的调用者充分性联系起来,这是使得部分(而非完整)规范足够的关键见解。

公理七:可复现公理

日报摘要

总评

打分

公理 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 ⚠️ 6 1.5 9.0
三 独立性公理 8 1.0 8.0
四 压缩公理 8 1.0 8.0
五 效用公理 ⚠️ 6 2.0 12.0
六 新颖性公理 8 2.0 16.0
七 可复现公理 ⚠️ 5 1.0 5.0

加权总分: 6.6/10(加权分之和 66.0 / 权重之和 9.5) 最终建议: Weak Accept 6.5-8