Paper Review: ‘Ghaib in Translation’ aka Unseen Harm: Measuring Cross-Script Safety Inconsistency with ‘Missed-in-Urdu’ Scores in LLM Hate Speech Detection

论文类型: 评测型(多语种 LLM 安全/内容审核基准)

论文属于”评测型”——在六组乌尔都/英语/代码切换语料上对五个 LLM 做零样本分类,量化跨文字(script)和跨语种的一致性。贡献集中在两个新指标(Label Instability、Missed-in-Urdu rate)、一份 WOAH/ALW 文献审计,以及一对开源脚本与 CSV 复现包。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

优点:

  1. 选题正当且论文 WOAH/ALW 九年 205 篇文献审计(论文 §1, 附录 A)是真正稀缺的实证贡献——揭示一个长期被边缘化的语言盲点。
  2. 评测方法极简、零样本、无自评循环,符合评测型论文该有的克制——所有复杂度都外包给现成翻译 API 与 LLM API。
  3. 代码与数据完整发布:FuzzyLogic9/WOAHJul26 仓库含 5 个 Python 脚本 + 9 MB 原始 CSV + 4 张 figure PNG,可被任何研究者下载重跑。
  4. 数字本身有信号:Missed-in-urdu 中位 4.3%(5 模型,5 数据集),开源 Qwen/Llama 比闭源 GPT/Claude 严重 ~3–4 倍,与社区观察一致。
  5. Figure 5 timeline 提前把”模型版本漂移”和”数据集年份”显式标出,是评测型论文应做的卫生。

缺点: 主要问题在于 (a) 评测深度不足——没有把现成 MultiJail、Mu-SHROOM、PURE 等跨语种安全基准作为 baseline head-to-head,导致”模型间差异”无法与已有 benchmark 直接比较;(b) 指标设计偏向叙事——”Missed-in-Urdu”只算单边(放行乌尔都有害),没有对称的”错杀乌尔都正常”指标,无法区分模型在乌尔都上的系统性弱势和翻译敏感性;(c) 没有任何 actionable mitigation——prompt engineering、back-translation 验证、system-prompt 调整、生产 guardrail 集成均未触及,论文止于”指出问题”,效用对工程团队几乎为零;(d) 商业闭源 LLM 用温度=0单次采样而非多次,缺乏置信区间与温度敏感性测试;(e) 引用方法的可信度受 arXiv API 当前不可达限制——基线对比所依赖的 MultiJail / PURE / Mu-SHROOM 论文细节只能依赖本论文 §5 自述,无法独立验证。

日报摘要

打分

公理 判定 分数 权重 加权分
一 对象公理 ⚠️ 6 1.0 6.0
二 识别公理 ⚠️ 5 1.5 7.5
三 独立性公理 9 1.0 9.0
四 压缩公理 8 1.0 8.0
五 效用公理 3 2.0 6.0
六 新颖性公理 ⚠️ 4 2.0 8.0
七 可复现公理 8 1.0 8.0

加权总分: 5.53/10