尚硅谷教程:从零搭建DeepSeek智能体与知识库
尚硅谷推出的《从零搭建DeepSeek+智能体&知识库》教程提供了完整的AI智能体学习资源,包含16个视频教程和多个PDF文档。教程从智能体的基本概念、核心要素讲起,逐步深入到个人知识库搭建、RAG技术理解,并详细介绍如何使用Che...
尚硅谷推出的《从零搭建DeepSeek+智能体&知识库》教程提供了完整的AI智能体学习资源,包含16个视频教程和多个PDF文档。教程从智能体的基本概念、核心要素讲起,逐步深入到个人知识库搭建、RAG技术理解,并详细介绍如何使用Che...
近日,科技社区 Linux.do 发布了截至 2026 年 7 月的最新大语言模型写作能力评测数据。此次更新标志着模型评估基准的一次重要迭代,项目组全面废弃了此前已停止维护的旧测试数据,转而采用更贴合当前模型能力的评测体系,确保了数据的有效性和时效性。新的评测结果重点整合了 EQ-Bench 排行榜(Creative Writing & Long-form Writing)以及 GitHub 上的 `lechmazur/writing` 开源项目测试成绩。
在具体的评测维度上,该基准特别针对 LLM 的创意写作和长篇写作能力进行了深度剖析。其中,GitHub 上的 `lechmazur/writing` 测试标准极具参考价值,它要求模型在创作短篇故事时,必须准确且自然地融入 10 个强制性故事要素,涵盖人物设定、关键物品、核心概念、角色属性以及深层动机等。这种“强制要素整合”的测试方法,有效过滤掉了单纯的语言堆砌,真正考验了模型在复杂指令遵循、长程逻辑连贯性以及创意要素整合方面的硬实力,而非仅仅是流畅度。对于关注 AI 应用落地、提示词工程以及模型选型的开发者与研究者而言,这份榜单提供了极具价值的参考依据,客观展示了当前头部 AI 模型在文学创作领域的真实水平。
同时,引入 EQ-Bench(情商基准)强调了“人味”和情感智商的重要性。随着 LLM 从单纯的问答工具向内容创作助手转型,单纯的语言流畅度已不再是核心指标,能否理解人类情感、动机并进行连贯的长篇叙事变得至关重要。废弃旧基准也侧面说明了部分早期针对小模型或简单文本生成的测试已无法满足当前参数量级 SOTA 模型的评估需求,行业正迫切需要更高难度的“图灵测试”标准。
💡 核心观点:写作基准的迭代表明,AI 竞赛焦点已从单纯的文本生成转向指令遵循与复杂逻辑构建的深度融合。
原文链接:Linux.do
科技媒体 The Information 于 8 月 1 日发布重磅博文,披露 OpenAI 首席执行官萨姆·奥尔特曼本周在美国国会山向多位参议员展示了代号为“Astra”的全新 AI 系列模型。据悉,奥尔特曼在 7 月 29 日会见了参议员拉斐尔·沃诺克和伯尼·莫雷诺,并计划与情报委员会成员马克·华纳进行沟通,这些闭门会议成为了 Astra 模型的首次亮相舞台。报道强调,Astra 模型的核心优势在于显著提升了长周期任务的处理能力。该系统引入了多智能体协同架构,能够将复杂的大型任务拆解为多个子任务,并调度不同的 AI 智能体分工合作,以此攻克单一智能体难以处理的复杂逻辑与长链条工作。这一展示标志着 OpenAI 正加速从对话式交互向具备自主规划与执行能力的系统级 AI 进化。
💡 核心观点:竞争焦点正从单一模型能力转向多智能体协作架构,AI 正从对话工具进化为具备长期执行力的协同系统。
原文链接:Linux.do
Google 正式推出了 Gemini Robotics ER 2,这是目前最强大的机器人“具身推理”模型。该模型被定位为机器人的高级大脑,旨在赋予机器人与人类自然交流、深度理解物理世界以及自主规划多步骤任务的能力。与传统的端到端控制模型不同,ER 2 采用了分层架构,专注于高层逻辑推理,将具体的运动执行移交给底层的视觉-语言-动作(VLA)模型,实现了认知与执行的解耦。在技术升级方面,ER 2 能够原生调用 Google 搜索及自定义功能以获取实时信息,并支持机器人在执行动作的同时持续“思考”后续步骤。相比前代 ER 1.6,新模型通过持续视频理解追踪任务进展,实现了更强的自我纠错能力。此外,谷歌还引入了多机器人协作技术,使机器团队能在共享空间中协同完成复杂工作流。目前,该模型已通过 Gemini API、Google AI Studio 及企业级智能体平台开启私密预览。
💡 核心观点:谷歌 ER 2 将“慢思考”与“快执行”分层,标志着具身智能正从单一的感知驱动迈向具备复杂规划与协作能力的“推理时代”。
原文链接:Linux.do
开发者 XeanYu 近日对开源项目 Grok2API-rs 进行了重要迭代更新。该项目是基于原 Grok2API 的 Rust 语言重构版本,旨在解决旧版本性能开销过大的问题,特别是让内存仅为 256MB 的小型 VPS 也能流畅运行。本次更新中,项目将上游请求链路统一迁移至 wreq 库,彻底清理了旧版本中依赖 curl-impersonate 的痕迹,不仅降低了第三方工具的依赖门槛,还显著提升了请求行为的一致性。备受关注的功能更新在于图像生成能力的突破。项目组利用 imagine2api 的思路,成功为 Grok-2 模型集成了 NSFW(敏感内容)图像生成接口。尽管开发者强调该功能仅供学习参考且需承担相应法律责任,但这标志着社区在探索大模型边界能力方面的技术尝试。此外,新版还新增了后台“对话”页面,支持 Chat、Responses、普通图像及 NSFW 图像的联调,并集成了 Markdown 渲染与多图自适应网格展示功能,优化了开发调试体验。部署方面,项目现已配置 GitHub Actions Workflows,并提供 Docker 部署方案,进一步降低了使用门槛。
💡 核心观点:Rust 重构践行降本增效,API 侧的“解禁”能力折射出开源社区对模型边界探索的极致追求。
原文链接:Linux.do
近期,技术社区对于 DeepSeek 即将发布的“DeepSeek-Harness”工具表现出高度关注。这款工具被定位为公共代码 Agent 任务的评测框架,旨在通过标准化测试来衡量 AI 模型的编程与开发能力。根据透露的信息,DeepSeek 的 V4-Flash 模型已经过该框架的“极简模式”测试。测试配置设定为 Max Tier 层级,Top-p 值为 0.95,Temperature 为 1.0。为了全面评估模型的实际开发水平,DeepSeek 引入了内部专用的基准测试集:DSBench-FullStack(全栈开发)和 DSBench-Hard(编码 Agent 挑战)。这两个基准集分别对应复杂的全栈项目构建和高难度的智能体编码任务,被视为检验 AI 编程实战能力的重要指标。此次曝光不仅证实了 DeepSeek V4-Flash 在代码领域的强劲表现,也预示着 DeepSeek 正在积极构建完善的开发生态,为开发者提供更专业的模型评估手段。
💡 核心观点:专用的 Code Agent 评测框架正在成为衡量大模型实战能力的新标尺,DeepSeek 此举意在重塑代码生成的行业测试标准。
原文链接:Linux.do
近日,在开发者社区 Linux.do 上,有技术用户报告在使用 Anthropic 推出的 Claude Code 命令行工具(CLI)时遇到了严重的稳定性问题。据反馈,该工具在运行过程中频繁弹出 "API Error: Connection closed mid-response" 的错误提示,导致 AI 编程任务被迫中止。问题的焦点集中在 Opus 系列模型(用户提及 opus-5)上,这表明在使用算力消耗最大、推理能力最强的高端模型时,系统后端面临的压力更为显著。不同于常规的网络波动导致的暂时性故障,该用户指出即便执行重试操作,连接中断的问题依然持续且无法自动恢复,严重影响了工作流。Claude Code CLI 是 Anthropic 近期为了强化终端开发体验而推出的重要工具,旨在让开发者能直接在命令行中通过自然语言控制代码库。此次报错指向了技术层面的流式传输(Streaming)处理机制或 API 网关的超时限制可能存在短板,特别是在处理需要长上下文思考和复杂代码生成的 Opus 模型请求时,服务端维持长连接的能力显得捉襟见肘。
💡 核心观点:AI 编程工具正从“拼模型智力”进入“拼工程稳定性”的阶段,基础设施的连接鲁棒性已成为制约高端模型在生产环境落地的关键瓶颈。
原文链接:Linux.do