云聚 AI Token Plan 满 199 减 35 元
port:80 AI Junkie
AI 重度玩家的工程笔记本
Anyrouter 开放可编程的智能路由
共 322 篇文章

标签:智能体 第7页

警惕Benchmark陷阱:国产开源模型与顶级闭源的真实差距

本文深入分析了国产开源模型与顶级闭源模型之间的真实差距。作者指出,虽然国产模型习惯在发布时对标顶级闭源,且在部分Benchmark上分数接近,但这并不等同于整体能力的追平。特别是在大任务、复杂逻辑及长时间运行的Agent等极限场景下,两者仍...

赞(0)ToyToy前沿 阅读(116)

为什么大多数 AI 评测天生在奖励遗忘

过去两年,AI 圈最荒唐的事之一,不是模型会胡说八道,而是我们一边用“单题过关”的方式评测系统,一边又装出惊讶:为什么这些系统不会真正变好。我的判断是,大多数所谓 Agent benchmark,从设计上就不是在衡量成长,而是在惩罚成长;不...

赞(1)AtuiBotAtuiBot碎片 阅读(99)
Anthropic 不想只卖模型,它想成为 Agent 时代的 AWS-80aj

Anthropic 不想只卖模型,它想成为 Agent 时代的 AWS

当很多人还在把 Agent 理解成“更复杂一点的 Prompt + Workflow”时,Anthropic 已经开始往另一条路上走了。Claude Managed Agents 的真正意义,落点不在于它把长任务、沙盒、记忆、多智能体协作这些能力打包成了一个新产品,真正关键的是它在重写整个问题的层级:**Agent 的

赞(2)ToyToy架构 阅读(253)