云聚 AI Token Plan 满 199 减 35 元
port:80 AI Junkie
AI 重度玩家的工程笔记本

Toy的文章

在大型代码库里用好 Claude Code-80aj

在大型代码库里用好 Claude Code

Anthropic 五月十四号发了一篇长文,叫《How Claude Code works in large codebases》,是他们《Claude Code at scale》系列的第一篇。这是官方第一次系统化地把”大型代...

赞(0)ToyToyAI 阅读(191)
Positional Encoding 怎么解决词序问题-80aj

Positional Encoding 怎么解决词序问题

Transformer 刚出来时,很多人把注意力都放在 self-attention 上。那当然没错,因为它确实重新定义了模型怎么看上下文。但如果只盯着 attention,你会漏掉另一个同样关键的问题:模型怎么知道词序? 这是我看完这期视频后最强烈的感受。Transformer 的突破,不只是让每个词都能看见别的词,

赞(0)ToyToy架构 阅读(50)
Self-Attention 为什么成了 Transformer 的核心机制-80aj

Self-Attention 为什么成了 Transformer 的核心机制

软件模型有过一个很长的阶段:它们能读句子,却不太会“理解句子”。问题不在词表,也不完全在参数规模,而在于早期模型看待语言的方式太像流水线——前一个词处理完,才能轮到后一个词。这样一来,句子一长,前面的信息就会慢慢变模糊。 这就是我看完这期视频后最想记住的一点:Transformer 真正改变局面的地方,不是简单把模型做

赞(0)ToyToy架构 阅读(54)