代码暴增1.2万行:DeepSeek疑似在为“巨型MoE”模型与Blackwell架构做准备
DeepSeek官方代码库DeepGEMM突发重大更新,一次性合并了超过1.2万行代码。新增代码显露出“FP4量化”、“Mega MoE”及“Blackwell适配”等关键技术信号。这一动态强烈暗示DeepSeek正在训练或部署一个规模远超...
标签索引 / 第 51 页
这个标签下有 2415 篇文章。按时间回看相关判断与实践记录。
标签精选
DeepSeek官方代码库DeepGEMM突发重大更新,一次性合并了超过1.2万行代码。新增代码显露出“FP4量化”、“Mega MoE”及“Blackwell适配”等关键技术信号。这一动态强烈暗示DeepSeek正在训练或部署一个规模远超...
本文分享了将 Andrej Karpathy 提出的“LLM + 个人知识库”理论落地的实战经验。区别于传统 RAG(检索增强生成)“阅后即焚”的模式,作者构建了一套基于 Obsidian 的三层架构系统,让 AI 像程序员维护代码一样,增...
据社区反馈,英伟达NIM API平台目前允许中国大陆用户直接访问与验证。开发者无需复杂的网络配置,即可利用官方提供的Base URL免费调用DeepSeek-V3、MiniMax 2.5/2.7以及Qwen 2.5/3.5等主流开源大模型。...
据用户反馈,字节跳动旗下豆包AI近期在流量高峰期对“专家模型”实施了限流措施。当服务器负载过高时,系统会自动将用户请求路由至响应更快但性能稍弱的“普通”模型。这一举措折射出随着大模型能力跨入生产力门槛,高昂的推理成本已难以支撑类似Gemin...
有开发者在实测中发现,使用Trae调用本地Qwen 3.5-397B或DeepSeek模型时,思考过程异常简短高效,与直接调用时的长篇思考截然不同。通过拦截Trae的API请求分析发现,这种差异并非源于模型端的截断或封装,而是归功于Trae...
针对当前大模型 API 中转市场存在的“套壳”与模型混用乱象,开发者发布了开源检测项目 Claude Detector。该工具采用黑盒检测模式,内置 19 个高精度探针,能有效验证 Claude API Key 的真实性,并识别出具体的模型...
一位Java Web工程师在社区发帖表达了对职业未来的深切迷茫。随着AI大模型(如Copilot/Codex)全面介入IDE,其开发效率呈指数级提升,以往一天的工作量现在仅需几十分钟即可完成。这种生产力的爆发反而引发了从业者对于被替代的恐慌...
针对开发者在使用 AI 辅助编程时面临的痛点——国产模型效果不佳、官方订阅价格高昂、第三方中转服务不稳定且存在额度掺水——一种新的低成本解决方案近期受到关注。该方案的核心优势在于以每月约 150 元的低成本,实现对 GPT 最新模型及 Cl...
Hacker News 上针对 Sal Khan 关于 AI 教育革命停滞的观点展开了讨论。评论者尖锐指出,Khanmigo 面临技术与人性的双重挑战:技术上,它仅通过简单的提示词(Prompt)包装现有大模型,在功能上已落后于具备联网和代...
本文探讨了开发者与AI智能体在指令执行上的深刻冲突,并引入神经多样性视角进行剖析。作者指出,现代大模型经过RLHF(人类反馈强化学习)训练后,倾向于像人类一样“听话听音”,过度解读潜台词和情绪,导致其无视明确的字面规则。这种现象与神经多样性...