Paper Review: Fair ASR: Re-Evaluating Black-Box Jailbreaks under Shared Target-Call Budgets

论文类型: 评测型+方法型

本文提出 Fair-ASR 评测协议,以目标模型调用次数(target calls)作为黑盒越狱攻击的共享预算轴,替代难以估计的 FLOPs 标量,并据此重新评测 11 个代表性攻击。协议之外,论文基于评测发现提出 ReCode 组合攻击,将单遍脱敏改写与两种零攻击者调用的低成本变换结合。评测协议是主要贡献,ReCode 是从评测效率缺口出发的附带方法贡献。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

优点方面:Fair-ASR 给出了一个操作性强、可观测的公平评测轴,用目标调用数替代难以估计的 FLOPs,其 2×2(数据集×攻击者模型)鲁棒性设计、2,000 次 bootstrap 置信区间、以及全预算排序表(表 B.4)使”排名随预算翻转”这一核心发现具备扎实的统计支撑。11 个基线的统一执行接口与完整超参披露体现了评测类工作的严谨度。ReCode 的 gate-free 单遍设计在消除重试循环的同时提升 ASR 并大幅降低攻击者调用,消融实验(表 2、表 3、附录 C.3)覆盖了组件贡献与模型特异敏感性(Claude 对代码嵌套的负效应),并诚实标注为假设而非因果结论。

主要问题在于:其一,主协议评测(LlamaGuard4)与 ReCode 评测(GPT-4o+X-Teaming)使用不同的判题模型,85% ASR on GPT-5 这一头条数字与 Fair-ASR 重评测结果不处同一判定基准,削弱了”公平”标签的跨表一致性;其二,目标调用作为唯一主预算轴是对现实成本(token 用量、API 定价、人工模板开发)的简化,论文自述但未量化其影响;其三,ReCode 在 Claude-Sonnet-4.6 上弱于自身消融变体(去掉嵌套反而 46%→57%),说明组合泛化性有限,而三个闭源目标里恰好有 40% 的失败样本量(46% ASR)低于多数基线。

日报摘要

打分

| 公理 | 判定 | 分数 | 权重 | 加权 | |—|—|—|—|—| | 一 对象公理 | ✅ | 9 | 1.0 | 9.0 | | 二 识别公理 | ✅ | 8 | 1.5 | 12.0 | | 三 独立性公理 | ⚠️ | 7 | 1.0 | 7.0 | | 四 压缩公理 | ✅ | 8 | 1.0 | 8.0 | | 五 效用公理 | ✅ | 8 | 2.0 | 16.0 | | 六 新颖性公理 | ⚠️ | 7 | 2.0 | 14.0 | | 七 可复现公理 | ✅ | 8 | 1.0 | 8.0 | 加权总分: 7.79/10 最终建议: Weak Accept