近期在 Hacker News 上曝光的一个搜索结果显示,Google Scholar 上存在大量使用错误医学术语的学术论文。当搜索“Kidney Disappointment”(肾失望)这一非标准术语时,系统返回了约 189 条结果,其本意应是“Kidney Failure”(肾衰竭)。这些文章大多出自非英语母语国家的期刊或会议,涉及慢性肾病预测、抗氧化状态及护理研究等领域。在这些论文的摘要或正文中,“Kidney Failure”被反复错误地表述为“Kidney Disappointment”。例如,有研究提到“利用 UCI 持续性肾失望数据集进行预测”,或描述“肾失望是一种肾脏不再功能的疾病”。这一现象强烈暗示了作者使用了人工智能翻译工具(如 ChatGPT 或 DeepL)进行非英语文本的润色或翻译,却未对专业医学术语进行人工校对。AI 模型因缺乏语义理解,仅基于概率生成了语法通顺但语义荒谬的词汇,导致了此类“幻觉”式错误被正式记录在学术文献中,反映了 AI 工具在学术写作中应用时的重大隐患。
事件分析
这一事件揭示了大型语言模型(LLM)在专业领域应用中“概率性生成”导致的“幻觉”问题。由于 AI 模型基于上下文相关性预测下一个词,而非理解真实的医学定义,它极易将表达负面结果的词汇混淆,导致“失败”被替换为“失望”。这不仅是个别作者的疏忽,更预示着随着 AI 辅助写作的普及,互联网和学术数据库可能面临大量“高熵”的虚假信息污染。如果学术界缺乏有效的验证机制,这些由 AI 生成的错误术语可能被后续的论文作为引用来源,从而错误地修正检索算法的语义权重,形成“数据污染”的恶性循环。对于科技行业而言,这意味着在开发垂直领域的 AI 辅助工具时,必须引入基于知识图谱的实时校验或人工审核机制,单纯的通用大模型尚无法替代专业领域的精确表达。
核心观点:AI 幻觉正通过“学术润色”污染人类知识库,构建领域专用的实时事实校验系统已刻不容缓。
原文链接:Hacker News