DeepSeek V4疑似灰度测试:成功攻克魔方难题,推理时长超121秒
科技社区有消息指出,DeepSeek疑似正在进行下一代模型V4的灰度测试。在最新的测试中,该模型成功解决了被视作逻辑推理难题的“魔方题”,成为首个做对该题的国内模型之一。数据显示,其解题思考时间长达121秒,显示出极强的深度推理能力。这一表...
标签索引 / 第 56 页
这个标签下有 2415 篇文章。按时间回看相关判断与实践记录。
标签精选
科技社区有消息指出,DeepSeek疑似正在进行下一代模型V4的灰度测试。在最新的测试中,该模型成功解决了被视作逻辑推理难题的“魔方题”,成为首个做对该题的国内模型之一。数据显示,其解题思考时间长达121秒,显示出极强的深度推理能力。这一表...
针对当前AI编程助手常出现的逻辑混乱与代码冗余问题,GitHub上新项目“andrej-karpathy-skills”将AI大牛Andrej Karpathy的工程哲学提炼为CLAUDE.md指南。该配置旨在强制Claude Code在编...
近日,有科研用户反馈Claude网页端(特别是Opus模型)近期出现严重的性能退化。主要问题表现为推理能力显著下降、回复冗长且充满“AI味”、对指令的遵循度变差,且不再主动思考。此外,系统频繁错误提示Token不足,迫使用户不断开启新窗口,...
受Andrej Karpathy关于LLM知识库观点的启发,开发者推出了Graphify工具,并将其应用于故障管理领域。传统的运维工具往往只能展示发生了什么,而Graphify通过语义技术,将报警、服务和团队成员转化为知识图谱中的节点和边。...
文章将AI的发展阶段与移动流量的演变进行了深度类比。作者认为,当前对Token价格和算力限制的关注,如同早期对流量的焦虑,未来随着技术突破,算力将像Wi-Fi一样成为廉价的基础设施。更关键的观点在于,AI正在重构社会的信任链条,人们获取信息...
本文通过一场深度对话,从技术哲学与产业经济角度探讨了AI发展的三个核心议题。首先是AI的本质之争:它是基于冯·诺依曼体系的概率统计机器,还是因系统复杂度涌现而出的认知雏形?其次是语言与认知的边界:计算机的形式逻辑能否无限逼近人类无法言说的“...
近期,科技社区热议国内大模型 API 资源紧缺问题。有开发者反馈,目前国内多家厂商的高性价比大模型方案长期处于“售罄”状态,导致开发者在应用落地时面临“无米之炊”的窘境。受限于 GPU 算力成本高昂及供应链紧张,厂商不得不收紧免费额度或暂停...
针对Opus API高昂使用成本,作者分享了利用M5 Max 128G设备进行本地模型部署的优化实测。文章指出,通过放弃LM Studio转用原生MLX框架的OMLX工具,并配合TurboQuant KV Cache技术,可显著解决系统提示...
据用户反馈,智谱AI官方APP在流畅度和稳定性上表现优异,基本实现秒回响应,且具备联网、绘图及代理模式等丰富功能。有趣的是,用户发现对于感性话题,非思考模式的回答有时反而优于深度思考模式。不过,该应用在模型版本透明度上存在瑕疵:网页端已显示...
一位资深用户分享了从OpenClaw迁移至Hermes的心得体验。尽管使用了三个月,但OpenClaw在记忆机制上的短板(无法跨窗口记忆、依赖文档全量加载导致Token成本过高)令人失望。反观Hermes,在底层模型(如GLM系列)相同的情...