复古与AI的极致碰撞:开发者在1MHz Commodore 64上成功运行Transformer模型
近日,名为“Soul Player C64”的开源项目展示了软件优化的极致潜力。开发者成功将现代AI核心架构Transformer移植到了1982年发布的Commodore 64古董计算机上。尽管该硬件仅有1MHz主频和64KB内存,但通过...
标签索引 / 第 2 页
这个标签下有 60 篇文章。按时间回看相关判断与实践记录。
标签精选
近日,名为“Soul Player C64”的开源项目展示了软件优化的极致潜力。开发者成功将现代AI核心架构Transformer移植到了1982年发布的Commodore 64古董计算机上。尽管该硬件仅有1MHz主频和64KB内存,但通过...
这是一个面向实践的深度学习实验项目,旨在为初学者和开发者提供“训练-部署-体验”一体化的完整工作流。该项目最大的亮点在于“拒绝黑盒”,开发者纯手工从零构建了 Transformer 和 RNN 等核心模型,强调代码即教程,每一行逻辑都清晰可...
开发者Sean Lavigne在1989年的Macintosh SE/30上,完全使用HyperCard的脚本语言HyperTalk编写并运行了一个Transformer神经网络“MacMind”。这个仅有1216个参数的微型模型,通过自注...
本文深入解读了由苏剑林提出的旋转位置编码技术,该方法目前已被LLaMA、Qwen、DeepSeek等全球主流大模型广泛采用。文章详细回顾了RoPE诞生的技术背景:即如何在保持线性注意力机制兼容性的同时,引入相对位置信息以提升模型性能。作者通...
本文深入探讨了大型语言模型(LLM)内部处理“情绪”的机制。研究者通过分析 Transformer 架构的电路图,发现模型并非仅仅是简单地模仿人类的情绪语言,而是真的在内部形成了特定的“情绪概念”神经元。这些情绪特征在模型处理对话、角色扮演...
GuppyLM 是一个仅拥有约 900 万参数的微型语言模型,其独特之处在于它通过扮演一条名叫 Guppy 的小鱼,以此揭开大模型训练的神秘面纱。该项目旨在向大众证明,构建一个 AI 模型并不需要博士学位或昂贵的 GPU 集群。借助谷歌 C...
ll-34 项目通过逆向工程原理图和微代码,使用 C 语言完整重写并模拟了 1976 年的 PDP-11/34A 计算机。不同于普通模拟器,它采用电路级建模,能精确复现硬件时序甚至故障,并内置了逻辑分析仪进行调试。令人惊叹的是,这台虚拟老式...
一位开发者通过手写PDP-11汇编语言,在1976年的小型机上成功实现并训练了一个单层Transformer模型。该项目名为ATTN/11,在仅有32KB内存且无浮点单元的硬件限制下,通过精心设计的定点运算和查找表技术,仅耗时5.5分钟便完...
本文是“LLM神经解剖学”系列的续作,作者通过数学探针和大规模实验,在Qwen3.5-27B上验证了RYS(重复特定层)方法的有效性。研究发现,Transformer内部存在清晰的“三阶段”结构:早期层负责编码,晚期层负责解码,而中间层则在...
本文深入解读了何恺明团队的ResNet论文,这是深度学习领域的里程碑之作。文章详细剖析了深层网络面临的“退化问题”,并解释ResNet如何通过引入残差连接,将学习目标从完整映射转化为残差映射,从而有效解决了梯度消失和优化难题。这一创新不仅让...