跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 6 页

大模型测评

这个标签下有 59 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

挑战长文本极限:DeepSeek实测能“吞下”70万字红楼梦

近日,科技社区对 DeepSeek 上线的 1M 上下文能力进行了极限“大海捞针”测试。测试者将虚构的关键信息分别植入不同长度的《红楼梦》文本中,结果发现 DeepSeek 能够稳定处理约 70 万字的超长文本,并精准提取出包括虚构天文学家...

1 分钟阅读201 阅读
前沿哨所

揭AI中转站乱象:用廉价模型冒充旗舰,行业诚信何在?

针对市面上AI中转站的实测揭露了严重的“以次充好”现象。结果显示,大量中转站利用旧一代廉价模型(如GPT-4o-mini)冒充最新旗舰模型,部分甚至使用本地部署的7B小模型伪装高端大模型。这些劣质服务不仅生成速度缓慢,疑似由低性能硬件搭建,...

1 分钟阅读236 阅读
前沿哨所 #ChatGPT

为何资深开发者放弃 Codex 5.3 回归 5.2?

一位开发者分享了从 Codex 5.3 回退到 5.2 的亲身经历。尽管 5.3 版本速度极快且具备中文思维链能力,但其生成的代码质量令人担忧:充斥着面条式 if/else 逻辑、硬编码和上帝类,且缺乏单元测试。作者发现,5.3 为了完成任...

1 分钟阅读321 阅读