一位开发者在技术社区 Linux.do 分享了使用大模型对开源项目 sub2api 进行漏洞审计的实战案例。测试者首先将项目代码回滚至修复提交的前一版本,还原了包含漏洞的环境,随后使用“gpt5.6sol max”模型在断网环境下进行隔离审计。在初始阶段,测试者仅使用通用提示词要求模型检查 OAuth 模块,但模型未能自主识别出潜在的攻击链。随后,测试者调整策略,通过引导式提示,明确要求模型检查“backend/internal/handler/auth_oauth_pending_flow.go”文件,并暗示存在未发现的漏洞。此次干预成功触发了模型的深度阅读能力,经过 6 至 7 次对约 2000 行代码文件的读取操作,模型最终成功定位并发现了关键的 0day 漏洞。该实验表明,虽然当前大模型在代码理解上具备极高潜力,但在面对复杂的大规模代码库时,仍难以独立完成从探索到发现的全过程,高度依赖人类的精准引导与上下文定位。
事件分析
💡 核心观点:大模型已具备挖掘复杂漏洞的潜力,但在长代码审计中仍需人类引导以突破“浅层推理”瓶颈,人机协作是当前落地的唯一路径。
原文链接:Linux.do





