近期,一款名为 Pangram 的 AI 检测工具声称其误报率极低(万分之一),引发了关于其是否仅靠“记忆”训练数据而非学习真实特征的质疑。为了验证其真实能力,一位言情小说社区运营者进行了一项独特的实证测试。测试旨在验证 Pangram 是否通过记忆训练集中已知的人类文本(如旧文学奖得主作品)来维持高准确率,从而在新出现的未知文本上失效。为了提供 Pangram 模型从未见过的“纯净”人类文本,实验者在 eBay 购买了 45 本从未被数字化的绝版旧书。他手动拆解书籍,使用扫描仪将其转化为数字文本,共处理了约 290 万个单词,包含约 8000 个文本片段。测试结果显示,绝大多数文本被正确识别为人类撰写。极少数被标记为“AI”的片段,经查证并非 Pangram 的误判,而是源于所使用的 Mistral OCR 服务在处理空白页时产生了“幻觉”,凭空生成了包含中文表格的内容。这一发现不仅证实了 Mistral OCR 在特定场景下的缺陷,更意外地验证了 Pangram 的检测逻辑:它能够敏锐地捕捉到 AI 生成的异常文本特征。作者据此推断,Pangram 并非单纯依靠记忆训练集来判定文本,而是确实具备区分人类与 AI 写作模式的能力,其声称的低误报率在这一极限测试中得到了有力支持。
事件分析
💡 核心观点:AI检测工具正从“死记硬背”向“特征泛化”进化,但AI预处理环节的幻觉污染将成为内容信任认证的新盲区。
原文链接:Hacker News





