一位开发者在使用 AI 模型辅助审查本地化更新时,意外发现了一个令其感到“心碎”的现象:当前主流的大语言模型及推理模型,在面对被严重污染的提示词时,竟然完全丧失了识别能力。该事件源于开发者使用的本地更新脚本(被称为“哈基米”)在更新提示词时,引入了大量的中英混杂现象,例如将高频中文词“和”替换为英文“and”,将“[到]”替换为“to”,将“我可以说”替换为“I can say”。这份被严重污染的万字长文作为上下文提交给多个 AI 模型进行审查时,尽管有足够的上下文长度和逻辑关联,但包括 DeepSeek、GLM 5.2 等在内的顶尖模型均未能发现这些显而易见的中英文混杂错误。在测试中,DeepSeek 未能发现任何问题并进行了胡编乱造,GLM 5.2 则错误地将字母“w”作为英文错误对象进行过度分析。唯独 Claude 因读取了未被污染的旧版提示词而避开了陷阱,但这并非其主动发现问题的能力。这一实验不仅暴露了模型在多语言混合环境下的感知盲区,也引发了对于 AI 辅助代码审查和提示词工程可靠性的深层担忧。
事件分析
💡 核心观点:连基础的中英混杂都无法识别,暴露了当前大模型在“细节感知”层面的认知盲区,提示词工程的稳定性仍需人工兜底。
原文链接:Linux.do





