云聚 AI Token Plan 满 199 减 35 元

port:80 AI Junkie
AI 重度玩家的工程笔记本

DigitalOcean 开发者云
赞助推荐 阿里云 QoderWork AI 助理
阿里云函数计算 一键部署 AI 大模型
在动模型之前,你得先和数据

在动模型之前,你得先和数据"贴脸"

第 4 讲是这门课第一次把人按到键盘前面。前三讲讲原则、讲研究、讲数据本身的结构,从这一讲开始,Paul Liang 把麦克风让给两位 TA:David 和 Chanaka,带大家在 Colab 里把一个分类模型从头跑通。 听上去像一节教 ...

赞(0)ToyToyAI 阅读(59)
选模型之前,你得先给数据画一张脸-80aj

选模型之前,你得先给数据画一张脸

机器学习课的常见开场是讲算法:第一周线性回归,第二周决策树,第三周神经网络。Paul Liang 这一讲反着来。他先讲数据,而且讲了整整一节课,模型一个字没提。他给的理由很简单:你手里那摊数据长什么样,基本上已经决定了模型该长什么样,反过来...

赞(0)ToyToyAI 阅读(39)
研究是设计一个能失败的实验,不是想一个聪明点子-80aj

研究是设计一个能失败的实验,不是想一个聪明点子

我以前一直觉得”做研究”是个挺玄的事:你得有灵感,得有品位,得在某天洗澡的时候突然冒出一个别人没想到的想法。后来在工程里摸爬几年,慢慢意识到大部分研究并不长这样。它更像一台机器,你按一个流程一圈一圈地转,转得快、转得...

赞(0)ToyToyAI 阅读(45)
Loop Engineering 是 Harness 的局部命名-80aj

Loop Engineering 是 Harness 的局部命名

最近一个词在 AI 圈被反复提起:Loop Engineering,循环工程。01Coder(小木头)做了一期视频把这件事讲了一遍,原视频在文末。我看完顺手对了一下自己手里这一年的笔记,想说一句直接点的:它没那么新,但 Boris Cher...

赞(0)ToyToy架构 阅读(52)
LLM 评测的下一步是一张二维矩阵-80aj

LLM 评测的下一步是一张二维矩阵

过去十几年,工程师调 bug 看的是 stack trace。stack trace 是”代码的执行路径”,每一帧是确定的、可重放的,错了往上翻几层就能定位。 最近两年,工程师开始调 agent。agent 没有 s...

赞(0)ToyToy架构 阅读(30)
embeddings 是 cached compute-80aj

embeddings 是 cached compute

最近 Twitter 上的「RAG 已死」和 Google 上「RAG」的搜索曲线,方向是反的。前者一年比一年响,后者在 2025 年中段创了新高。两条线对不上,要么是社交媒体放大了少数派意见,要么是「RAG」这个词被两边人各说各话。 Tu...

赞(0)ToyToy架构 阅读(45)
Prompt Learning 的两个反馈圈-80aj

Prompt Learning 的两个反馈圈

最近半年,业界几乎所有团队都在抱怨 agent 不可靠。模型选了最贵的,工具调用接全了,上下文也尽量塞满,可输出依然时好时坏。换一个模型也救不回来。问题出在哪里? Arize 的 SallyAnn DeLucia 和 Fuad Ali 在 ...

赞(0)ToyToy架构 阅读(58)
让 AI 代码审查工具不能再瞎引证-80aj

让 AI 代码审查工具不能再瞎引证

最近读了一个叫 Clawpatch 的开源项目源码,写一点感想。 本来没打算细看。它是个自动审代码的命令行工具——扫一遍仓库、找 bug、跑测试、顺手给个修复方案。这类工具 GitHub 上一搜几十个,听起来没什么特别。 读着读着我停下来了...

赞(0)ToyToy架构 阅读(63)
Cowork 五条规则背后的同一件事-80aj

Cowork 五条规则背后的同一件事

最近这半年,Anthropic 在做一件不太显眼但方向很清楚的事:把原本只有开发者会写的 CLAUDE.md、MEMORY.md、skills 这一整套工程化写法,整体搬到 Web 端给非开发者用。这个新产品叫 Claude Cowork,...

赞(0)ToyToyAI 阅读(141)
Codex 在自己的执行历史里找补丁-80aj

Codex 在自己的执行历史里找补丁

最近社区在传一个”自我蒸馏”的提示词,源头是 OpenAI Codex 团队成员 @VB。意思是让 Codex 回看你最近 30 天的执行记录,把里面反复出现的工作流打包成 Skill,把固定角色封成 Sub-age...

赞(0)ToyToyAI 阅读(110)
LLM 排行榜的另一条轴-80aj

LLM 排行榜的另一条轴

你打开任何一个 LLM 编码排行榜,看到的都是一排数字:82、84、86。看上去越高越好,对吧? 但如果你真把”得分最高”的那个模型搬进公司里写代码,运维很可能在周末打电话骂你。因为榜单只回答了”能不能跑...

赞(0)ToyToyAI 阅读(99)
构建 Agent 和写软件,是两种工程-80aj

构建 Agent 和写软件,是两种工程

写了十年代码的工程师,上手 AI Agent 时常常比新人还别扭。不是能力问题,是直觉问题——越熟练的旧直觉,越容易在 agent 面前变成包袱。 Google DeepMind 的 Philipp Schmid 在 AI Engineer...

赞(0)ToyToy架构 阅读(75)
Agent Harness 不是要安装的软件包-80aj

Agent Harness 不是要安装的软件包

做生产级 Agent,很多人第一反应是挑一个框架、看一眼文档、运行一下 Hello World,然后觉得大事已定。 Mike Piccolo 的文章 How to Build Your Own Agent Harness 直接拆穿了这个幻觉...

赞(0)ToyToy架构 阅读(97)
阿里云 ECS 分钟级部署 Hermes / OpenClaw

GLM Claude Code · 国产平替不封号

官方 Claude Code 又涨价又要 KYC,封号还得重配环境?智谱 GLM 兼容 Claude Code,稳定不封号、价格友好,注册后把现有 Claude Code 工作流直接切过来继续用。

立即体验 GLM查看套餐价格