跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 3 页

基准测试

这个标签下有 32 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

AI量化新前沿:BioTradingArena基准测试挑战LLM预测生物科技股

这是一个针对大语言模型在垂直领域应用能力的全新测试基准。由于生物科技股交易高度依赖临床数据解读等特定“催化剂”,传统分析面临较高门槛。该项目收集了317个历史案例,旨在评估LLM在仅拥有事前信息的情况下,解读新闻并预测股价反应的能力。有趣的...

1 分钟阅读158 阅读
前沿哨所

浏览器Agent基准测试:谁才是网页自动化的最强LLM?

Browser Use团队发布了一项开源基准测试,旨在对比不同LLM在网页自动化任务中的性能。该测试集精选了100个高难度任务,涵盖信息检索与复杂交互。团队使用LLM作为裁判,实现了87%的人工判断一致性。结果显示,最新模型在困难任务上的成...

1 分钟阅读275 阅读
前沿哨所

Cua-Bench:开源AI智能体GUI基准测试平台

Cua是一个开源平台,用于构建、基准测试和部署能够控制计算机的AI智能体。其核心组件Cua-Bench支持在OSWorld等数据集上评估智能体性能,并集成Lume实现macOS和Linux的高性能虚拟化。该项目为开发者提供了从代码执行到UI...

1 分钟阅读289 阅读
前沿哨所

Kaggle每日10美元积分实测:AI模型评估与对比新玩法

最近Kaggle推出了每日10美元的模型积分福利。实测发现,这笔积分并非直接用于调用Claude等模型,而是用于构建自定义任务和基准测试。用户可以通过引入Wiki题库,创建涵盖逻辑、知识储备、识图、编码等多种类型的评估任务,进而利用Benc...

1 分钟阅读378 阅读
前沿哨所

忽略基准测试,你的LLM账单可能虚高10倍

文章指出,盲目使用GPT-5等顶尖模型会导致高昂成本,作者通过实际案例展示了如何将LLM API账单降低80%。方法包括收集真实提示词、定义预期输出、利用OpenRouter测试上百个模型,并采用“大模型裁判”进行评分。通过综合考量质量、成...

1 分钟阅读220 阅读
前沿哨所

Exasol推出个人版,却禁止公开基准测试结果

Exasol推出了Personal版本,号称要让大数据分析更加普及。虽然这解决了过去难以在自定义虚拟机镜像中运行的问题,使得用户能更容易地将其集成到ClickBench等基准测试项目中,但其许可证条款引发了巨大争议。条款明确规定,未经Exa...

1 分钟阅读211 阅读
前沿哨所

MiniMax发布OctoCodingBench基准,规范AI代码代理开发标准

面对AI代码代理可能生成无用代码甚至污染代码库的风险,MiniMax正式发布了OctoCodingBench基准测试规范。该基准专注于评估AI Agent在编码过程中的规范性,旨在填补当前AI编程缺乏工程化标准的空白。通过引入更严格的测试维...

1 分钟阅读344 阅读
前沿哨所

Square Minus Square:AI代理性能基准测试

近日,Hacker News发布了Square Minus Square,这是一个专注于AI代理(coding agents)的基准测试工具。该基准测试旨在为开发者提供标准化的方法来评估和比较不同AI代理在代码生成、任务执行等场景中的性能。...

1 分钟阅读197 阅读