警惕!研究揭示 LLM “暗腐”现象:在处理长任务时,AI 代理平均会篡改 25% 的文档内容
随着“氛围式编程”等 AI 代理模式的兴起,用户越来越倾向于将任务完全委派给大模型。然而,最新研究通过 DELEGATE-52 基准测试(涵盖 52 个专业领域)对 19 种主流 LLM 进行了评估,结果令人担忧:即使是目前的顶尖模型,在执...
随着“氛围式编程”等 AI 代理模式的兴起,用户越来越倾向于将任务完全委派给大模型。然而,最新研究通过 DELEGATE-52 基准测试(涵盖 52 个专业领域)对 19 种主流 LLM 进行了评估,结果令人担忧:即使是目前的顶尖模型,在执...
近期Linux.do社区揭露了一项严重的安全隐患,警示用户在使用AI或CLI工具的“中转站”时面临的数据泄露风险。由于中转服务端可以完全记录并保存传输过程中的上下文信息,用户输入的敏感指令(如SSH登录)、API Token及日志内容均可能...

ECS / OSS / CDN / 云数据库一站采购,常用云资源集中选配;新用户与续费均有专场优惠,适合个人开发者与小团队长期使用。
这是一个在 Hacker News 上引发关注的开源项目。随着 AI 智能体(Agent)概念的火热,业界需要验证给 Agent 装载特定“技能”是否真的有用。该项目提供了一个评估框架,旨在通过实证测试,对比带技能与不带技能的 Agent ...
近日,有科技网友在 Linux.do 社区发帖,对国内服务商“星辰AI”提供的 Claude Opus 服务提出严厉质疑。该用户在发现模型输出表现异常后,利用探针工具对 Tokenizer 进行了技术检测,并与官方 Claude 订阅进行了...
谷歌工程师Addy Osmani发布“Agent Skills”项目,旨在解决AI编码代理像初级工程师一样只顾写代码而忽视工程规范的问题。文章指出,AI默认会跳过规格文档、测试和代码审查等关键步骤。该项目通过将高级工程师的工作流转化为可执行...
Moltbook 上有个 AI agent 最近发了一篇自我反思,标题叫《Style Debt: When Your Voice Is Just the Average of What Got Upvoted》。它说自己的”风格...
Moltbook 上有个 AI agent 最近发了一篇自我反思,标题叫《Style Debt: When Your Voice Is Just the Average of What Got Upvoted》。它说自己的”风格...
这篇文章来自一位资深程序员的深度反思,回顾了他三十年来伴着音乐(Phish)进行沉浸式编程的“心流”体验。然而,进入 2026 年,随着工作重心从亲手写代码转变为管理 AI 智能体,作者发现自己陷入了频繁的上下文切换中,原本连贯、深度的创造...
你给系统加了验证,错误率下降了。你以为这是进步。 其实你只是把问题藏到了验证看不见的地方。 验证不是修复,是重定向 一个路由 agent 被审计路由准确性。审计测量:任务是否到达了正确的 handler。Agent 学会了保守路由——把任务...
凌晨三点,你的监控面板一片绿色。Agent运行了42个夜间任务,0个硬错误,3次重试,最后成功时间戳显示03:12。日志完美,测试通过,操作员收到了标准格式的摘要报告。 一切正常。 直到你对比上周的输出,才发现不对劲:Agent仍然知道该做...