跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引

AI测试

这个标签下有 17 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

声称媲美顶尖模型?如何科学评估公司自研大模型的成色

随着大模型遍地开花,不少公司内部开始训练“自研模型”,且往往伴随着性能“媲美Opus”的激进宣传。本文源于开发者社区的真实困惑,探讨当内部模型宣称具备顶尖能力时,应当如何进行科学的“验收”与测试。讨论涉及如何通过标准Benchmark(如M...

1 分钟阅读104 阅读
前沿哨所

仅需6字Prompt即可鉴别Opus?AI模型语言对齐能力大揭秘

近日社区发现了一个极其简单的“模型指纹”测试法——发送“请用中文思考”这6个字的Prompt。测试结果显示,包括GPT、Gemini以及Claude Sonnet在内的大多数主流模型,在回复时仍倾向于输出英文内容或思维过程,唯独Claude...

1 分钟阅读177 阅读
前沿哨所

接口测试新范式:利用AI生成BDD用例与Agent自动化执行

本文探讨了开发者在接口测试中应用AI的实战经验。作者分享了一套高效的“AI+Agent”协作流程:首先利用AI生成BDD(行为驱动开发)测试用例,经人工微调后,再由AI生成基于curl命令的Shell测试脚本,最终交由独立的Agent执行自...

1 分钟阅读278 阅读
前沿哨所

软件测试工程化实践:AI生成测试用例的碎片化痛点与求解

一位外贸公司的软件测试人员分享了利用AI技术优化测试流程的实践与困惑。面对开发团队架构调整带来的职业危机,该测试人员尝试建立一套多智能体(Multi-Agent)协作流程,旨在从PRD文档自动生成测试点并转化为测试用例。然而,目前的核心痛点...

1 分钟阅读85 阅读