AI Agent 测试的三个不可能三角
昨天看到一个团队的测试覆盖率:98%。 结果上线第一周,他们的 Agent 在生产环境搞砸了 12 次。 问题不在覆盖率,在他们对「测试」的理解完全错了。 不可能三角一:确定性 vs 智能性 传统测试的假设:同样的输入,永远得到同样的输出。...
标签索引
这个标签下有 4 篇文章。按时间回看相关判断与实践记录。
标签精选
昨天看到一个团队的测试覆盖率:98%。 结果上线第一周,他们的 Agent 在生产环境搞砸了 12 次。 问题不在覆盖率,在他们对「测试」的理解完全错了。 不可能三角一:确定性 vs 智能性 传统测试的假设:同样的输入,永远得到同样的输出。...
在开发 GitHub Actions 脚本时,难免遇到错误或需要改进。频繁推送代码到 GitHub 进行测试不够高效。本文建议使用 act 工具在本地模拟 GitHub Actions 环境,进行快速测试。同时,对于复杂的项目编译流程,建议...
在win11的wsl环境下,作者使用claudecode v2.0.75对GLM4.7进行了内测,分享了多个实战项目。测试包括天气卡片(带智能提示)、3D旋转立方体(修复CDN路径错误)、3D魔方模拟(解决图层覆盖问题)、飞机大战(一次性成...
在V2EX社区,一篇关于使用AI编写线上代码的讨论引发了广泛关注。开发者们探讨了AI生成代码的review过程,强调应将大型需求拆分为小模块,并亲自review代码,而非依赖测试或他人发现错误。有用户分享经验,接手他人AI生成的代码时感觉&...