Paper Review: Beyond the pale: Assessing prevalence and contents of extremist speech in LLM training data

论文类型: 评测型

本文对 Dolma 开放预训练语料(约 3 万亿 token、约 50 亿非代码文档)中极端主义言论的占比进行评测,采用”多模型零样本抽取 → GPT 4o mini 复核 → 领域专家人工编码”的三阶段保守流水线,对 20 万文档的随机样本给出 1/2000 的极端主义内容占比下界。其评测对象(LLM 训练语料中的极端主义内容)真实且此前几乎无人系统研究,评测方法以人工编码为准绳但样本极小。文章兼具方法贡献与数据事实贡献,属于以量化评测为核心的类型。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

本文的贡献集中于三点:一是以三条权威定义系统评测了开放预训练语料中的极端主义内容占比,填补了 arXiv 上几乎空白的细分方向;二是给出保守流水线与量化下界(约 1/2000,外推至数十万篇潜在有害文档,且允许 10 倍高估容错),这个数字对数据策展决策有直接价值;三是诚实的实验设计,包括对 Llama 3 高假阳性的明确识别、对 Berger 定义高方差的解释、以及人工编码对 10 类内容的细致刻画,附录中完整公开了 prompt 与人工分析文档,展现出较好的研究透明度。

主要问题在于三点。其一,评测独立性不足:两层 LLM 分类/复核构成主要评测链,唯一独立的人工验证只有 30 篇文档,且论文自身承认评审模型可能与训练语料共享信号,循环评估风险未被量化处理。其二,效用缺乏对照:全文没有与关键词匹配等最小基线的对比,也没有基于黄金标注集的精确率/召回率数值,导致”流水线优于廉价方法”的结论缺乏证据支撑。其三,可复现性不达标:抽样脚本、推理流水线与完整抽取结果均未发布,非确定性 LLM 推理又放大了复现难度,附录给出的 prompt 与 30 篇样例不足以让他人复现或扩展该评测。

日报摘要

打分

公理 权重 分数
一 对象公理 1.0 8
二 识别公理 1.5 5
三 独立性公理 1.0 4
四 压缩公理 1.0 6
五 效用公理 2.0 6
六 新颖性公理 2.0 7
七 可复现公理 1.0 3

加权总分: 5.74/10

最终建议: Borderline 5-6.5