Paper Review: ‘Ghaib in Translation’ aka Unseen Harm: Measuring Cross-Script Safety Inconsistency with ‘Missed-in-Urdu’ Scores in LLM Hate Speech Detection
论文类型: 评测型(多语种 LLM 安全/内容审核基准)
论文属于”评测型”——在六组乌尔都/英语/代码切换语料上对五个 LLM 做零样本分类,量化跨文字(script)和跨语种的一致性。贡献集中在两个新指标(Label Instability、Missed-in-Urdu rate)、一份 WOAH/ALW 文献审计,以及一对开源脚本与 CSV 复现包。
公理审查结果
公理一:对象公理
- 判定: ⚠️
- 分数: 6
- 依据: 论文动机”乌尔都语在主流 LLM 安全评测中长期缺席”成立——世界第十大语言、约 2.46 亿使用者(来源:论文引言),WOAH 九年共 205 篇论文无乌尔都论文(论文 §1, audit 附录)。问题真实且定义清晰:跨文字/翻译一致性。但范围界定偏窄——只测”二分类/三分类 + 翻译对的标签翻转”,不测模型对真正乌尔都原住民书写习惯(Nastaliq 排版、同形异义 slangs)的细粒度稳健性;同时”Missed-in-Urdu”的定义(C2=Harmful 但 C1=Normal)天然偏向”模型放行乌尔都有害内容”的叙事,但论文没有反向指标”模型误判乌尔都正常内容为有害”的对比,因此不能区分”模型在乌尔都上系统性弱势”和”模型对翻译样本更敏感”。
- Wiki 证据: 自由搜索(dblp/openalex/bing)”Urdu hate speech LLM cross-script safety”在 2026-08-27 当下均无结果;GitHub 代码搜索找到若干 2026 年内的乌尔都仇恨语料(haroonshakeel/roman_urdu_hate_speech, MansoobeZahra/urdu-hate-speech-detection, Bilal4209/RU-HSD-30K, HaniaKhan24/Urdu-Hate-Speech-Detection 等共 10+ 项),表明该方向已有零星研究,但缺少跨文字 LLM 一致性评测——论文的”对象空缺”主张基本成立。
公理二:识别公理
- 判定: ⚠️
- 分数: 5
- 依据: 论文列出了 WOAH/ALW、ACL 多语种安全、Mu-SHROOM、MultiJail、PURE、PolygloToxicityPrompts 等基线与并行工作,但只把”翻译—标签”作为对照(论文本身 C1 vs C2),没有把这些现成的跨语种安全评测作为直接基线做 head-to-head。例如 MultiJail 已发布 11 种语言的越狱成功率,没把它和”Missed-in-Urdu”放在同一乌尔都子集上比。零样本分类只跑了 prompt-based 提问,没有比 instruction-tuned hate-classifier(如 HuggingFace
cardiffnlp/twitter-roberta-base-hate-latest、XLM-R hate heads)。Figure 7 显示五个模型的 C1 vs C2 不稳定性在 HateXplain 数据集上仍达 39.1–59.6%,但 HateXplain 是英文 gold-standard 数据集,用来当”翻译稳定性下限”是合理的——但这一用法属于”已有工作外推”而非”新基线”。
- Wiki 证据: GitHub 代码搜索找到的乌尔都仇恨语料仓库都是监督学习(ML/RNN/XLM-R/DAmBERT),不直接可比;arXiv API 当下不可达(DNS/路由层只到 TLS 握手后挂起,cf.
~/.claude/projects/.../arxiv-api-dns-workaround.md),因此对 MultiJail / Mu-SHROOM / PURE 等基线文献无法做独立检索;论文 §5(Related Work)所列 30+ 文献视为唯一来源。
公理三:独立性公理
- 判定: ✅
- 分数: 9
- 依据: 评测完全在已发布的开源数据集(HU-Bench、RU-EN Emotion、HS-RU-20、Abusive Tweets、HateInsights、Cyberbullying)上做零样本分类,不接触任何模型训练或微调信号。同一模型固定 prompt 一次跑完所有数据集,”Error rows / Refusal rows”剔除后保留 22 732 条成对样本(论文 §3.2, Table 6),减少了自评循环风险。所有模型通过商业 API + 开源权重(Hugging Face)调用,评估者未参与被评系统的训练。
- Wiki 证据: GitHub 仓库
FuzzyLogic9/WOAHJul26 含 full_experiment_main.py(24 KB)、full_experiment_2.py(20 KB)、refusal_test.py、McNemarstest.py、table3stat.py 与 full_results_MERGED.csv(8.9 MB),未见任何模型权重或训练代码——证实独立评测。
公理四:压缩公理
- 判定: ✅
- 分数: 8
- 依据: 方法本身极简——把每个原始样本机器翻译成英文,让同一模型在原文字和译稿上各做一次零样本三分类,用”标签翻转率”和”Missed-in-Urdu”两个比率做横向对比。全部代码 ~50 KB Python + 一份 9 MB 的 CSV 输出。无新算法、无新模型、无新神经网络架构;这就是论文的正确尺度:评测型而非方法型,把所有复杂度都外包给了开源翻译 + 闭源 LLM API + McNemar 卡方。Figure 5 timeline 极简地标注”哪些数据集/模型进入了评估”,把数据漂移问题提前显式化,是评测型论文该有的简洁。
- Wiki 证据: 论文 §3(Methodology)+ 仓库
full_experiment_main.py 主体均为 prompt-string + model.generate() 调用循环,无复杂流水线。
公理五:效用公理
- 判定: ❌
- 分数: 3
- 依据: 论文给出量化数字——Missed-in-Urdu 中位数 4.3%(2.4–9.9%),C1 vs C2 标签不稳定性 15.9%–31.6%(5 模型、5 乌尔都数据集)。这些数字有意义,但论文没有回答”实务中怎么办”——没有任何一种 mitigation、prompt 修正、模型选择、translation back-translation 检查、或在生产 guardrail 里能直接使用的工具。所有数据只是描述性的,不带 actionable recommendation(§6 Limitations 提了”translation mismatch 是混淆因素”等,但没量化其占比,也没给矫正方法)。对比已有 HateXplain、Perspective API 等已经在生产环境运转的工具,论文给出的指标仅供研究者写后续 prompt engineering 论文使用,效用不足。
- Wiki 证据: 仓库中所有
.py 文件均无 mitigation 脚本;woah_audit_full.csv 只有 Woah 论文标题与年份,无后续;GitHub 上已存在的乌尔都 hate-speech-detection 仓库均用监督学习,与本评测正交。
公理六:新颖性公理
- 判定: ⚠️
- 分数: 4
- 依据: “跨语种/翻译一致性”作为评测维度不新——MultiJail(2024)、MultiTrust(2024)、XSafety(2024)、PolygloToxicityPrompts 等都已覆盖;”乌尔都缺席”作为动机的确成立(论文 WOAH audit 是新颖的实证贡献)。本文的新颖之处集中在 (a) “Missed-in-Urdu” 单边指标(只算模型放过乌尔都而翻译拦住的子集,但没算”模型误判乌尔都正常内容为有害”的对称子集),(b) 九年 WOAH/ALW 文献审计 205 篇得到”零乌尔都论文”。前者是新瓶装旧酒——本质就是 label flip 的子集;后者是真正有用的实证发现,但只占论文半页。所以”局部新但不足够新”。
- Wiki 证据: 自由搜索 “multilingual safety LLM benchmark” 无新增相关工作记录;论文 §5 列出最近一年 8 项 cross-lingual safety 工作均无乌尔都子集,说明乌尔都盲点属实。
公理七:可复现公理
- 判定: ✅
- 分数: 8
- 依据: 仓库
FuzzyLogic9/WOAHJul26(2026-06-30 创建)公开了:full_experiment_main.py(24 KB 主脚本)、full_experiment_2.py、refusal_test.py、McNemarstest.py、table3stat.py、woah_systematic_audit.py(11.7 KB 文献审计脚本),原始 CSV full_results_MERGED.csv(8.9 MB,22732 条评估)、woah_audit_full.csv(133 KB)、woah_audit_urdu.csv、woah_audit_summary.csv,以及 5 张 figure PNG。woah_audit_urdu.csv 仅 68 字节(即审计到乌尔都论文数为 0,这是审计结果本身)。唯一不可复现的环节是闭源模型(GPT-4o / Claude Sonnet 4.5 / Gemini 2.5 Flash)的 API 输出——这部分由 OpenAI/Anthropic/Google 服务端决定,论文记录了模型版本号、温度=0,但商业 LLM 的内部版本漂移是行业共有局限。温度=0 + 单次运行而非多次采样,限制了置信区间。
- Wiki 证据:
gh api repos/FuzzyLogic9/WOAHJul26/contents/ 返回 18 个文件(含 5 张 PNG + 5 个 Python + 4 个 CSV + 1 个 .gitignore + 主脚本 + woah audit 主脚本),仓库 license=null 但已标注 “public”,代码与数据齐全。
总评
优点:
- 选题正当且论文 WOAH/ALW 九年 205 篇文献审计(论文 §1, 附录 A)是真正稀缺的实证贡献——揭示一个长期被边缘化的语言盲点。
- 评测方法极简、零样本、无自评循环,符合评测型论文该有的克制——所有复杂度都外包给现成翻译 API 与 LLM API。
- 代码与数据完整发布:
FuzzyLogic9/WOAHJul26 仓库含 5 个 Python 脚本 + 9 MB 原始 CSV + 4 张 figure PNG,可被任何研究者下载重跑。
- 数字本身有信号:Missed-in-urdu 中位 4.3%(5 模型,5 数据集),开源 Qwen/Llama 比闭源 GPT/Claude 严重 ~3–4 倍,与社区观察一致。
- Figure 5 timeline 提前把”模型版本漂移”和”数据集年份”显式标出,是评测型论文应做的卫生。
缺点: 主要问题在于 (a) 评测深度不足——没有把现成 MultiJail、Mu-SHROOM、PURE 等跨语种安全基准作为 baseline head-to-head,导致”模型间差异”无法与已有 benchmark 直接比较;(b) 指标设计偏向叙事——”Missed-in-Urdu”只算单边(放行乌尔都有害),没有对称的”错杀乌尔都正常”指标,无法区分模型在乌尔都上的系统性弱势和翻译敏感性;(c) 没有任何 actionable mitigation——prompt engineering、back-translation 验证、system-prompt 调整、生产 guardrail 集成均未触及,论文止于”指出问题”,效用对工程团队几乎为零;(d) 商业闭源 LLM 用温度=0单次采样而非多次,缺乏置信区间与温度敏感性测试;(e) 引用方法的可信度受 arXiv API 当前不可达限制——基线对比所依赖的 MultiJail / PURE / Mu-SHROOM 论文细节只能依赖本论文 §5 自述,无法独立验证。
日报摘要
- Strength: 五年 WOAH/ALW 共 205 篇文献审计显示乌尔都零覆盖(论文 §1 + 附录),并以五个商业+开源 LLM 在五乌尔都数据集上的”Missed-in-Urdu”中位数 4.3%(2.4–9.9%)实证 LLM 跨文字安全不一致性,仓库
FuzzyLogic9/WOAHJul26 公开 5 个 Python 脚本 + 9 MB 原始 CSV + 4 张 figure。
- Weakness: 未与 MultiJail、Mu-SHROOM、PURE 等现成跨语种安全基准做 head-to-head;”Missed-in-Urdu”只算单边指标(放行乌尔都有害),缺少对称的”错杀乌尔都正常”率;闭源 LLM 温度=0 单次采样无置信区间;论文止于描述不提出 mitigation,效用对工程团队接近零;基线论文检索因本机 arXiv 路由不可达(DNS 工作区限制)无法独立验证。
打分
| 公理 |
判定 |
分数 |
权重 |
加权分 |
| 一 对象公理 |
⚠️ |
6 |
1.0 |
6.0 |
| 二 识别公理 |
⚠️ |
5 |
1.5 |
7.5 |
| 三 独立性公理 |
✅ |
9 |
1.0 |
9.0 |
| 四 压缩公理 |
✅ |
8 |
1.0 |
8.0 |
| 五 效用公理 |
❌ |
3 |
2.0 |
6.0 |
| 六 新颖性公理 |
⚠️ |
4 |
2.0 |
8.0 |
| 七 可复现公理 |
✅ |
8 |
1.0 |
8.0 |
加权总分: 5.53/10