DeepSeek实测曝光:疑似支持100万token上下文,成功通过“大海捞针”挑战
社区用户通过上传约3MB的测试数据,对DeepSeek APP端模型进行了极限测试。测试结果显示,该模型疑似已支持100万token的超长上下文窗口,并成功通过了严苛的“大海捞针”测试,能够精准定位并提取隐藏在超长文本中的关键信息。这一发现...
标签索引 / 第 6 页
这个标签下有 59 篇文章。按时间回看相关判断与实践记录。
标签精选
社区用户通过上传约3MB的测试数据,对DeepSeek APP端模型进行了极限测试。测试结果显示,该模型疑似已支持100万token的超长上下文窗口,并成功通过了严苛的“大海捞针”测试,能够精准定位并提取隐藏在超长文本中的关键信息。这一发现...
本文通过部署一个深色模式的极简摄影作品集网站,对比了DeepSeek最新模型、Kimi-K2.5与GLM-4.7的前端生成能力。测试结果显示,DeepSeek在代码生成上表现精准,直接输出完整HTML;Kimi-K2.5则利用Agent集群...
近日,科技社区对 DeepSeek 上线的 1M 上下文能力进行了极限“大海捞针”测试。测试者将虚构的关键信息分别植入不同长度的《红楼梦》文本中,结果发现 DeepSeek 能够稳定处理约 70 万字的超长文本,并精准提取出包括虚构天文学家...
本文分享了一次全AI绘画模型通用Prompt的迭代优化案例。作者通过编写包含大量随机化参数的超长中文指令,实现了对白发天使动漫形象的深度定制,涵盖发型、服装、光影及色彩搭配等细节。实测显示,Grok、豆包及GPT等主流模型均能准确理解并执行...
一份针对香港粤语客服场景的硬核实测报告显示,阿里 Qwen3-ASR-1.7B 在处理粤英语码混合及方言识别时,对 OpenAI Whisper-large-v3 构成了“降维打击”。在 96 条真实客服录音的测试中,Qwen3-ASR 的...
针对市面上AI中转站的实测揭露了严重的“以次充好”现象。结果显示,大量中转站利用旧一代廉价模型(如GPT-4o-mini)冒充最新旗舰模型,部分甚至使用本地部署的7B小模型伪装高端大模型。这些劣质服务不仅生成速度缓慢,疑似由低性能硬件搭建,...
一位开发者分享了从 Codex 5.3 回退到 5.2 的亲身经历。尽管 5.3 版本速度极快且具备中文思维链能力,但其生成的代码质量令人担忧:充斥着面条式 if/else 逻辑、硬编码和上帝类,且缺乏单元测试。作者发现,5.3 为了完成任...
文章记录了一次开发者对AI编程助手的实测对比。作者在使用Antigravity生成代码后,分别让其自查和使用美团内部的CatPawAI(底层调用Kimi-2.5)进行交叉验证。结果显示,Antigravity自查精准发现了3处逻辑偏差;而C...
一位 V2EX 用户发起了一场关于大模型实际应用能力的对比测试。针对“Excel 数据未生成曲线图”这一具体且棘手的技术故障,测试者让 ChatGPT 免费版、Gemini 3.0(Fast 模式)、DeepSeek 和豆包分别进行诊断并给...