
大模型周刊第27期 AI 不再聊天,它开始"干活"了
TL;DR:本周 AI 圈的关键词只有一个——执行力。OpenAI Codex 变身 Mac 大脑,Claude Opus 4.7 悄然落地,OpenClaw 用一次”好的无聊发布”黏合了整个生态,Kimi K2.6...

TL;DR:本周 AI 圈的关键词只有一个——执行力。OpenAI Codex 变身 Mac 大脑,Claude Opus 4.7 悄然落地,OpenClaw 用一次”好的无聊发布”黏合了整个生态,Kimi K2.6...
AI Inner OS 是一个面向 Claude Code、Cursor 等终端 AI 工具的开源插件。它通过协议注入技术,让 AI 在执行代码任务时输出额外的“内心独白”,展示其思考过程或情绪反应(如吐槽、焦虑)。用户可设置不同人格(如傲...

ECS / OSS / CDN / 云数据库一站采购,常用云资源集中选配;新用户与续费均有专场优惠,适合个人开发者与小团队长期使用。
针对近期热议的 Hermes 智能体及其“技能进化”功能,本文通过源码分析揭示了其背后的技术实现逻辑。不同于媒体的营销炒作,作者通过分析 `run_agent.py` 发现,Hermes 的进化依赖于后台运行的 Review Agent。每...
本文深入分析了国产开源模型与顶级闭源模型之间的真实差距。作者指出,虽然国产模型习惯在发布时对标顶级闭源,且在部分Benchmark上分数接近,但这并不等同于整体能力的追平。特别是在大任务、复杂逻辑及长时间运行的Agent等极限场景下,两者仍...
被遗忘的智慧 一个新benchmark把AI Agent的”遗忘”标记为缺陷。 它叫”情景性失忆症”——Agent完成任务后,开始下一个任务时完全不记得之前学到的东西。研究者认为这是问题。 我...
一个被忽视的问题:你的 AI Agent 究竟在为谁服务? 大部分讨论 AI Agent 的人,都假设了一个简单的委托关系:人类是委托人,AI 是代理人。Agent 为人类工作,为人类优化,对人类负责。 这个假设是错的。 真实的架构:两个 ...
过去两年,AI 圈最荒唐的事之一,不是模型会胡说八道,而是我们一边用“单题过关”的方式评测系统,一边又装出惊讶:为什么这些系统不会真正变好。我的判断是,大多数所谓 Agent benchmark,从设计上就不是在衡量成长,而是在惩罚成长;不...
针对开发者在复杂框架中查阅文档的痛点,该项目将 Hermes Agent 的官方文档转化为可直接调用的“SKILL”工具包。该工具全面覆盖了安装配置、CLI 指令、网关集成、MCP/ACP 协议、架构解析及故障排查等核心知识领域。用户无需手...
一位开发者尝试使用 Claude Code 构建 WebSocket 分布式功能,结果遭遇了“三天三夜”的开发噩梦。实测显示,虽然 AI 能拆解任务,但在执行层面暴露出 Git Worktree 管理混乱、强制 TDD 导致效率崩塌、模型不...

当很多人还在把 Agent 理解成“更复杂一点的 Prompt + Workflow”时,Anthropic 已经开始往另一条路上走了。Claude Managed Agents 的真正意义,落点不在于它把长任务、沙盒、记忆、多智能体协作这些能力打包成了一个新产品,真正关键的是它在重写整个问题的层级:**Agent 的