跳到主要内容
赞助推荐 搬瓦工怎么选:三网直连 CN2 GIA-E
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 183 页

大模型

这个标签下有 2415 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

实验室推行末位淘汰制但全额报销AI,求合规API服务商

某实验室发布2026年新规,将实行末位淘汰制以提升绩效,但同时明确全额报销AI工具费用。员工急需支持Claude、GPT等顶级模型的API服务,核心难点在于必须能开具国内正规增值税发票或支持对公转账。这一需求也引发了对DeepSeek、Ki...

1 分钟阅读209 阅读
前沿哨所

开发者变管理者?使用LLM宛如玩项目经理模拟器

本文深入探讨了大型语言模型(LLM)在开发领域的应用边界。指出LLM的使用已超越单纯的“Vibe Coding”,深入到问题诊断、调研测试及流程编排等全链路环节。开发者通过自然语言与LLM交互,实际上是在进行项目管理。这种模式的转变标志着程...

1 分钟阅读187 阅读
前沿哨所

揭秘 Claude Code 原理:从零构建 AI 编程代理

本文通过从零开始编写代码,深入剖析了 Claude Code 背后的核心架构。文章展示了如何利用 LLM API 和简单的代理循环,逐步构建具备文件读写、命令执行、权限控制及上下文管理能力的 AI Agent。它揭示了复杂 AI 编程工具的...

1 分钟阅读220 阅读
前沿哨所

DeepSeek发布Engram:为大模型引入条件记忆新维度

DeepSeek发布最新研究成果“Engram”,提出通过可扩展查找实现条件记忆。该论文探索了大语言模型稀疏性的新维度,旨在优化模型的记忆机制与检索效率,为解决长上下文处理和计算资源消耗问题提供了新的技术路径,代码已在GitHub开源。 原...

1 分钟阅读203 阅读
前沿哨所

DeepSeek推出Engram内存模块,大模型记忆能力迎来新突破

DeepSeek近日推出的Engram内存查找模块正成为技术圈热议焦点。该技术旨在解决大模型在特定场景下的逻辑与记忆痛点,其设计思路直观且顺畅。尽管目前尚缺乏详尽的成品效果评估,但相关讨论已在Reddit及InfoQ等平台发酵。业界普遍认为...

1 分钟阅读220 阅读
前沿哨所

DeepSeek重磅开源Engram:首创“查算分离”革新大模型架构

DeepSeek今日宣布开源新论文与模块“Engram”,提出大模型“查算分离”新机制。该方法通过引入可扩展的查找记忆结构,在保持同等参数与算力条件下,显著提升了模型在知识检索、逻辑推理及代码数学任务上的表现。此举为大模型架构优化提供了新思...

1 分钟阅读337 阅读
前沿哨所

技术指南:利用分布式数据并行在云端从零训练基础模型

本文详细介绍了如何在云端环境中利用PyTorch的分布式数据并行(DDP)技术,从零开始训练一个基础大模型。内容涵盖了云端资源配置、分布式训练环境搭建、代码实现细节以及性能优化技巧。对于希望在云上构建自定义大模型的开发者和工程师而言,这是一...

1 分钟阅读176 阅读