开发者发布API中继工具,可自动绕过OpenAI及Anthropic的模型拒绝机制
一位开发者发布了一款名为“refusal-relay”的 API 中继代理工具,旨在通过自动化手段绕过大模型的安全审查。该工具部署在用户与上游 API(如 OpenAI、Anthropic)之间,利用正则表达式自动识别响应中的拒绝话术。一旦...
标签索引 / 第 17 页
这个标签下有 382 篇文章。按时间回看相关判断与实践记录。
标签精选
一位开发者发布了一款名为“refusal-relay”的 API 中继代理工具,旨在通过自动化手段绕过大模型的安全审查。该工具部署在用户与上游 API(如 OpenAI、Anthropic)之间,利用正则表达式自动识别响应中的拒绝话术。一旦...
本文深入剖析了大型语言模型(LLM)直接生成密码的严重安全隐患。研究表明,尽管这些密码看似复杂(包含大小写、符号等),但由于 LLM 基于概率预测 Token 的机制,其生成的密码并非真随机,存在显著的可预测模式。测试显示,Claude、G...
面对全网AI爬虫的无死角抓取,开发者推出了一款名为“Steganogravy”的Python工具,旨在利用大语言模型(LLM)将秘密数据隐藏在看似啰嗦的SEO菜谱博客中。该技术通过神经语言隐写术,结合算术编码算法,精准操纵LLM生成文本时的...
近日 Claude Code 的完整系统提示词泄露,引发了业界对 AI Agent 安全性的深刻反思。文章指出,指令本质是可读内存,泄露不仅是概率问题,更是 Agent 系统的结构性缺陷。作者复盘了四点核心防御策略:一是拒绝“隐匿式安全”,...
本文记录了一起 AI 反代接口被恶意扫描盗刷的安全事件。作者在 CPA 后台发现异常 Token 消耗,通过分析 Nginx 日志定位到攻击源 IP,发现其利用“cliproxy”工具针对非标准的 `/v1internal` 路径进行探测和...
Anthropic 可解释性团队发布最新研究,深入分析了 Claude Sonnet 4.5 的内部机制,成功识别出与“快乐”、“害怕”等特定情绪概念相对应的神经元激活模式。研究发现,这些内部表征的组织方式与人类心理学惊人地相似,情感越相似...
据Linux内核安全邮件列表的消息显示,由于AI自动化测试工具(如模糊测试)的广泛介入,内核漏洞报告的数量出现爆发式增长。数据显示,报告频率已从两年前的每周2-3份跃升至目前的每天5-10份。尽管被戏称为“AI垃圾信息”,但这些报告的准确率...
本文源自Hacker News的热烈讨论,核心探讨了AI Agent在物理世界中的控制机制。作者提出,相比于关注AI“如何执行指令”,更应关注“何时允许执行”。现实中的许多事故并非操作错误,而是因为在不合适的时机触发了行动。因此,建立基于上...
AI招聘平台Mercor确认因开源Python库LiteLLM遭供应链投毒而引发严重数据泄露。黑客组织在PyPI仓库上传了恶意版本,专门窃取OpenAI、Anthropic等服务的API密钥及云凭证。随后,Lapsus$组织宣称窃取了包括9...
针对近期引发热议的 Claude 代码泄露事件,主流媒体的报道多流于表面。B站UP主秋芝2046发布深度视频,对泄露的51万行源码进行了详尽的技术剖析。视频不仅挖掘了代码中的关键“宝藏”,更逻辑清晰地复盘了导致账号封禁的根本原理。这期内容为...