云聚 AI Token Plan 满 199 减 35 元
AI编程 · 架构思考 · 技术人生
DigitalOcean 开发者云
Anyrouter 开放可编程的智能路由
共 436 篇文章

标签:AI开发

榨干每块显存:LLM 底层显存优化-Toy's Tech Notes

榨干每块显存:LLM 底层显存优化

作者:toy GPU 显存是 LLM 推理与训练的硬约束,不是软性资源。当一个 70B 参数模型以 BF16 格式加载时,光是参数本身就需要约 140GB,单张 H100 的 80GB 显存根本装不下。工程师的任务不是抱怨硬件贵,而是理解显...

赞(0)ToyToyAI 阅读()
搭 Agent 的脚手架:主流开发框架-Toy's Tech Notes

搭 Agent 的脚手架:主流开发框架

作者:toy 一、为什么需要 Agent 框架 从”手写循环”到框架 构建一个最简单的 ReAct Agent,大概需要五十行 Python:一个 while 循环,调 LLM,解析输出,调工具,把结果塞回上下文,再...

赞(0)ToyToyAI 阅读()
Claude Code 合租,4 人车 400 一个月,KYC 封号都不用你管

Claude Code 合租,4 人车 400 一个月,KYC 封号都不用你管

官方 Claude Code 又涨价又 KYC,封号了还得自己重新折腾环境?ReClaude 拼车了解一下——200 / 400 / 800 / 1600 四档随便挑,账号、风控、切换全平台托管,触发风控自动换号不计次。本地 daemon 三行命令装好,Claude Code / Codex / Cursor / MCP 原来怎么用还怎么用。我自己跑 4 人车那档,性价比最平衡。

Multi-Head Attention:一句话有歧义怎么办?多看几遍-Toy's Tech Notes

Multi-Head Attention:一句话有歧义怎么办?多看几遍

自然语言天生有歧义。 "The detective followed the spy with binoculars." 这句话有两个完全合理的理解:侦探拿着望远镜跟踪间谍,或者间谍带着望远镜刚好被侦探跟上了。人脑能瞬间意识到两种可能,但早期的 AI 模型做不到——它只会 picks up 其中一种,另一种直接丢掉。

赞(0)ToyToy架构 阅读()
Harnesses 让 AI Agent 变得可靠-Toy's Tech Notes

Harnesses 让 AI Agent 变得可靠

软件开发里,大家最熟悉的词可能还是 agent。 但最近两年,另一个词开始频繁冒出来:harness。 这个词不好翻。按字面,它是“安全带”或者“束具”。不过放到 AI 工程里,我觉得它更像一层“驯化外壳”——不是替代模型,而是把一个不稳定、不可预测、还经常会撒谎的模型,拴到一个稳定、可验证、可以控的运行环境上。 这篇

赞(1)ToyToy架构 阅读()

Claude Code 合租 · KYC 封号全托管

官方又涨价又 KYC,封号还得自己重新折腾?ReClaude 拼车了解一下——200 / 400 / 800 / 1600 四档随便挑,账号、风控、切换全平台托管,触发风控自动换号不计次。

上车 4 人车 400/月查看四档套餐