LLM 评测的下一步是一张二维矩阵
过去十几年,工程师调 bug 看的是 stack trace。stack trace 是”代码的执行路径”,每一帧是确定的、可重放的,错了往上翻几层就能定位。 最近两年,工程师开始调 agent。agent 没有 s...
标签索引
这个标签下有 3 篇文章。按时间回看相关判断与实践记录。
标签精选
过去十几年,工程师调 bug 看的是 stack trace。stack trace 是”代码的执行路径”,每一帧是确定的、可重放的,错了往上翻几层就能定位。 最近两年,工程师开始调 agent。agent 没有 s...
一位开发者在实际测试中发现,Google 的 Gemini Flash 模型在文本写作任务中表现不佳,甚至难以生成高质量的语法填空指导指南。尽管提供了详细的思维导图和多轮提示词引导,Gemini Flash 的输出仍显逊色。令人意外的是,在...
针对现有大模型评测中“指标冰冷”和“品牌光环干扰”的痛点,开发者推出了一款“AI 进化竞技场”盲测平台。该平台随机匹配两个匿名大模型进行双盲对决,用户在不知道模型身份的前提下提问,并仅凭回答质量进行投票。这种撕去厂牌标签的评测方式,旨在通过...