跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 编辑器里贴身的 AI Coding 助手
赞助推荐 编辑器里贴身的 AI Coding 助手

AI 情报局 / 第 6 页

AI 大模型

大模型、AI Agent、模型评测与产业动态。

本栏重点

正在发生

AI 大模型 #AI 模型横评

强化学习这十年,走的是一条不断"删东西"的路

监督学习像一次考试,你答一道题,老师立刻给分。强化学习不是。强化学习是你下一整盘棋,走了几十步,最后才知道这盘赢没赢,而且没人告诉你哪一步是关键的。这个差别看起来只是”反馈给得晚一点”,但它把整套训练范式都拧到了另一...

19 分钟阅读100 阅读
AI 大模型 #MIT《How to AI (Almost) Anything》:多模态 AI 逐讲精读

数据稀缺的模态,要靠别的模态来养

做机器人的人都熟悉一种处境:你想训一个新传感器上的模型,真实数据只有几千条,但同一个场景下,摄像头数据有几百万条、激光雷达数据有几千万条。你眼睁睁看着隔壁模态躺着金山,自己手里却只有沙子。 这不是你一个人的问题。医疗数据、生理传感器、嗅觉信...

16 分钟阅读132 阅读
AI 大模型 #MIT《How to AI (Almost) Anything》:多模态 AI 逐讲精读

研究是设计一个能失败的实验,不是想一个聪明点子

我以前一直觉得”做研究”是个挺玄的事:你得有灵感,得有品位,得在某天洗澡的时候突然冒出一个别人没想到的想法。后来在工程里摸爬几年,慢慢意识到大部分研究并不长这样。它更像一台机器,你按一个流程一圈一圈地转,转得快、转得...

17 分钟阅读70 阅读
AI 大模型

Cowork 五条规则背后的同一件事

最近这半年,Anthropic 在做一件不太显眼但方向很清楚的事:把原本只有开发者会写的 CLAUDE.md、MEMORY.md、skills 这一整套工程化写法,整体搬到 Web 端给非开发者用。这个新产品叫 Claude Cowork,...

14 分钟阅读195 阅读
AI 大模型 #ChatGPT

Codex 在自己的执行历史里找补丁

最近社区在传一个”自我蒸馏”的提示词,源头是 OpenAI Codex 团队成员 @VB。意思是让 Codex 回看你最近 30 天的执行记录,把里面反复出现的工作流打包成 Skill,把固定角色封成 Sub-age...

8 分钟阅读142 阅读
AI 大模型 #AI 模型横评

LLM 排行榜的另一条轴

你打开任何一个 LLM 编码排行榜,看到的都是一排数字:82、84、86。看上去越高越好,对吧? 但如果你真把”得分最高”的那个模型搬进公司里写代码,运维很可能在周末打电话骂你。因为榜单只回答了”能不能跑...

8 分钟阅读125 阅读
AI 大模型

Claude Code Routines:把 Agent 从等待模式变成主动干活

去年,Anthropic 的文档工程师 Sarah 遇到了一个没法靠加班解决的问题:Claude Code 团队的 PR 合并量比年初增加了 200%,但维护文档的人只有她一个。每次有代码改动,她都要手动比对源码和文档有没有偏差,再开 PR...

7 分钟阅读206 阅读
AI 大模型

GPT-5.5 的提示词,从流程控制变成了结果验收

我注意到一件有意思的事:同样是用 GPT-5.5 或者 Codex,有的人能稳定跑完复杂任务,有的人则反复拿到跑偏的结果。差距不在模型能力,在于提示词的写法有没有跟上模型的进化方向。 灵姐(灵姐说AI)最近结合 OpenAI 官方的 Pro...

6 分钟阅读155 阅读
AI 大模型 #AI Agent 框架

把 Agent 送上生产:RAG、工程、安全、评测

作者:toy 一、为什么最后一篇要把这四件事放在一起 这个系列到了第九篇,前八篇依次拆解了 Agent 的基础理论、规划推理、开发框架、工具调用、记忆模块、微调方案、推理服务、显存优化。每一篇都可以单独成立,但如果你真的要把 Agent 推...

76 分钟阅读207 阅读
AI 大模型

榨干每块显存:LLM 底层显存优化

作者:toy GPU 显存是 LLM 推理与训练的硬约束,不是软性资源。当一个 70B 参数模型以 BF16 格式加载时,光是参数本身就需要约 140GB,单张 H100 的 80GB 显存根本装不下。工程师的任务不是抱怨硬件贵,而是理解显...

106 分钟阅读304 阅读