谷歌 Gemini 3.2 Pro 惊现 3D 基准测试,空间推理能力或迎重大突破
谷歌尚未正式发布的下一代模型 “Gemini 3.2 Pro” 近期在 VoxelBench 基准测试库中短暂曝光。VoxelBench 专注于评估大模型根据指令生成 3D 体素结构的能力,这不仅是文本生成的延伸,更...
标签索引
这个标签下有 13 篇文章。按时间回看相关判断与实践记录。
标签精选
谷歌尚未正式发布的下一代模型 “Gemini 3.2 Pro” 近期在 VoxelBench 基准测试库中短暂曝光。VoxelBench 专注于评估大模型根据指令生成 3D 体素结构的能力,这不仅是文本生成的延伸,更...
近日,Artificial Analysis (AA) 的多模态科学幻觉基准测试引发社区热议。DeepSeek在该项测试中得分极低,而小米Mimo、Grok、Qwen及GLM等模型得分异常高涨,引发关于“刷分”和基准公正性的质疑。尽管高分模...
针对近期业界热议的大模型“越更新越笨”或“主动降智”现象,一款全新的AI基准测试工具提供了客观的监测方案。该平台能够实时追踪并排名OpenAI GPT、Anthropic Claude及Google Gemini等主流大模型的性能指标。其核...
在ARC-AGI-3基准测试发布的首日,一项技术演示引发了热议:通过利用特定的Agent“Harness”(连接框架/工具套件),开发者成功将系统得分从0%提升至36%。尽管该成绩因使用了辅助工具而不具备官方“裸模型”排行榜的入围资格,但H...
研究人员利用全球命理师大赛的真题构建了 AI Benchmark,发现 DeepSeek、Gemini 等顶尖大模型在八字推理任务上准确率约 36%,显著高于随机猜测,但仍落后于人类专家。研究指出,八字推演涉及复杂的结构化逻辑,容易导致大模...
针对当前大语言模型(LLM)在代码生成基准中可能利用海量预训练数据进行“作弊”而非真实推理的问题,研究人员推出了EsoLang-Bench基准测试。该测试选取了Brainfuck、Whitespace等五种训练数据极度稀缺的深奥编程语言,其...
这本书深入剖析了机器学习领域最核心却又常被误解的环节——基准测试。作为现代AI的基石,基准测试通过将数据划分为训练集与测试集,确立了模型竞争的规则。然而,研究界长期对基准的局限性持批评态度。本书旨在从科学视角重新审视这一机制,探讨如何在推动...
本文分享了超越官方基准测试的两种大模型实测方法。一是“Juice值”测试法,通过特定提示词获取模型数值,对比标准参考表判断其推理深度是否达标;二是“知识截止日期”探测法,通过询问截止时间点附近的重大突发新闻,区分模型是基于训练数据回答还是凭...
据科技社区实测反馈,DeepSeek最新的V4lite检查点在性能上取得显著突破。基准测试显示,该模型已具备冲击国内开源模型SOTA(最佳状态)的实力,展现出缩小与闭源模型差距的巨大潜力。具体功能方面,新版本首次实现了带有第一人称视角、方块...
根据Artificial Analysis发布的最新全知指数排行榜,谷歌Gemini模型在处理“幻觉”问题上取得了突破性进展。新版本Gemini 3.1 Pro在维持知识准确率不变的前提下,将全知幻觉率从前代3.0 Pro的88%大幅降至3...