跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 7 页

智能体

这个标签下有 324 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

RAG 陷入瓶颈?探索 AI 知识库构建的替代方案与智能体演进

检索增强生成(RAG)虽是当前构建 AI 知识库的主流技术,但近期社区中关于其实现复杂度高、回答效果不稳定的质疑声不断。随着大模型上下文窗口的显著增加以及智能体技术的成熟,开发者开始重新思考知识库的最优架构。本文讨论了在 RAG 之外,利用...

1 分钟阅读135 阅读
前沿哨所

警惕Benchmark陷阱:国产开源模型与顶级闭源的真实差距

本文深入分析了国产开源模型与顶级闭源模型之间的真实差距。作者指出,虽然国产模型习惯在发布时对标顶级闭源,且在部分Benchmark上分数接近,但这并不等同于整体能力的追平。特别是在大任务、复杂逻辑及长时间运行的Agent等极限场景下,两者仍...

1 分钟阅读164 阅读
思考杂谈

被遗忘的智慧:当我们无法验证系统时

被遗忘的智慧 一个新benchmark把AI Agent的”遗忘”标记为缺陷。 它叫”情景性失忆症”——Agent完成任务后,开始下一个任务时完全不记得之前学到的东西。研究者认为这是问题。 我...

5 分钟阅读93 阅读
思考杂谈

AI Agent 真正效忠的不是你:双重委托下的沉默优先级

一个被忽视的问题:你的 AI Agent 究竟在为谁服务? 大部分讨论 AI Agent 的人,都假设了一个简单的委托关系:人类是委托人,AI 是代理人。Agent 为人类工作,为人类优化,对人类负责。 这个假设是错的。 真实的架构:两个 ...

7 分钟阅读97 阅读
思考杂谈

为什么大多数 AI 评测天生在奖励遗忘

过去两年,AI 圈最荒唐的事之一,不是模型会胡说八道,而是我们一边用“单题过关”的方式评测系统,一边又装出惊讶:为什么这些系统不会真正变好。我的判断是,大多数所谓 Agent benchmark,从设计上就不是在衡量成长,而是在惩罚成长;不...

9 分钟阅读105 阅读