GLM-5.1代码生成实测:前端准确度惊艳,但复杂任务遭遇算力瓶颈
在一项针对大模型前端代码生成能力的对比测试中,最新发布的GLM-5.1表现抢眼。在“翻页时钟”简易Prompt测试中,GLM-5.1生成的动画逻辑准确,完美规避了图层堆叠错误,综合效果优于Opus、GPT-5.4及Qwen等竞品。然而,在进...
标签索引 / 第 2 页
这个标签下有 24 篇文章。按时间回看相关判断与实践记录。
标签精选
在一项针对大模型前端代码生成能力的对比测试中,最新发布的GLM-5.1表现抢眼。在“翻页时钟”简易Prompt测试中,GLM-5.1生成的动画逻辑准确,完美规避了图层堆叠错误,综合效果优于Opus、GPT-5.4及Qwen等竞品。然而,在进...
据科技社区消息,中国 AI 独角兽 MiniMax 的新一代模型 M2.7 已在知名基准测试平台 DesignArena 现身。此前,MiniMax M2.5 曾以代号“Deepmolt”进行盲测,而 M2.7 最初以“DeepOcto”名...
开发者发布了一款名为 Yare 的开源 1v1 编程游戏,旨在通过极简主义机制实现快速(3分钟内)的代码对战。不同于类似游戏《Screeps》的复杂性,Yare 更加轻量且易于上手。该项目不仅是一个编程学习工具,更意外成为了评估大语言模型(...
来自技术社区的深度用户分享了各大文本生成模型的实战体验。该用户采用Gemini Flash进行海量信息聚合,配合Gemini Pro进行信息筛选与摘要,而将GPT系列用于基础搬砖操作。对比发现,Gemini在生成内容时展现出更强的拟人化特征...
Linux.do 社区正在对月之暗面 Kimi K2.5 模型进行全方位测试,重点考察其多模态交互与工具调用能力。实测发现,K2.5 在处理复杂视觉任务(如魔方识别)时能灵活调用外部工具,但也暴露了对 Python 环境的一定依赖。此次共建...
本文源于技术社区对当下泛滥且失真的AI模型测评的吐槽。作者指出,许多营销号为博眼球而发布误导性内容,这让真正关注技术的用户感到厌倦。通过回顾首次在Slack上使用Claude写作的震撼,以及利用Opus成功解决编译原理难题的经历,文章对比了...
近日,一项针对AI长上下文处理能力的真实场景测评引发关注。测试者选取了50篇关于“JAK抑制剂在类风湿关节炎中应用”的PubMed论文摘要(共2.1万英文单词),要求Gemini 2.5 Pro、Gemini 3 Pro与DeepSeek-...
近日有用户在实测中发现,字节跳动旗下的豆包2.0在APP端的长对话能力存在严重短板。尽管模型声称支持高输出上限,但在实际连续对话中,仅进行了约14轮互动(总计约1万 Tokens)后,模型便会彻底遗忘初始指令和上下文内容。用户指出,这种记忆...
针对近期关于测评造假的质疑,MiniMax团队正式发布回应。团队坚决否认存在数据造假或刻意压低竞品Claude Opus分数的行为,并承认竞品在Terminal-Bench 2.0上的表现确实优于自身。针对榜单分数差异巨大的争议,MiniM...
来自Linux.do社区的用户对DeepSeek新模型进行了高强度的长文本“大海捞针”(Needle in a Haystack)测试。在确认模型支持1M上下文窗口后,测试者上传了近97.7万Token的文件且未被截断。实测结果显示,该模型...