极致性能:零依赖C语言版GPT问世,训练速度暴涨4600倍
该项目将知名AI专家Andrej Karpathy的Python版GPT语言模型重写为纯C99代码(MicroGPT-C)。通过移除Python和PyTorch依赖,并利用编译器自动向量化(SIMD),其在相同任务下的训练速度相比原版Pyt...
标签索引 / 第 4 页
这个标签下有 60 篇文章。按时间回看相关判断与实践记录。
标签精选
该项目将知名AI专家Andrej Karpathy的Python版GPT语言模型重写为纯C99代码(MicroGPT-C)。通过移除Python和PyTorch依赖,并利用编译器自动向量化(SIMD),其在相同任务下的训练速度相比原版Pyt...
本文回顾了AI从AlphaGo到GPT-3.5再到DeepSeek-R1的演进历程,指出强化学习虽提升了模型可用性,但也带来了“走捷径”等缺陷。作者认为,当前所谓“思考模型”的突破本质上是通过消耗更多Token来提高概率匹配的准确性,而非真...
Stanford 大学 Jurafsky 和 Manning 团队发布新论文,提出用“Tversky 投射层”替代神经网络中传统的 Linear 层。研究指出,现有深度学习基于几何相似度的对称性假设不符合人类认知的“不对称性”。该团队将心理...
作者为解决中文声调学习难题,基于Conformer和CTC技术训练了一款小型语音模型。通过数据优化与架构调整,模型参数从7500万压缩至900万,量化后仅11MB,可在浏览器端流畅运行,验证了边缘AI在特定教育场景下的高性价比与实用性。 原...
字节跳动Seed团队推出KEEL新架构,解决了大模型深度扩展的技术瓶颈。该架构通过引入高速公路式连接改进Post-LN结构,在不依赖复杂优化技巧的情况下,首次成功实现了超过1000层超深层神经网络的稳定训练。这一突破证明深度扩展比单纯加宽更...
马斯克团队正式开源了X平台全新的推荐算法,核心亮点在于完全基于Transformer架构,取代了旧版的手工特征工程。新算法采用与Grok相同的结构,通过Phoenix Scorer直接处理实时互动序列进行排序。技术栈全面采用Rust语言重写...
本文介绍了名为Tauformer的新型拓扑Transformer架构,它通过图拉普拉斯导出的标量替代传统的点积注意力,将域结构直接注入模型。这种设计使KV缓存只需存储值和标量流,而非完整的键张量,实现了约50%的逐层缓存缩减。在H100上的...
自2016年以来,无论是GPT-5、Claude还是Gemini,所有主流Transformer模型均沿用单一残差连接设计 $x + F(x)$。本文深入探讨了DeepSeek提出的mHC架构,该设计大胆挑战了这一传统范式,通过拓宽残差连接...
indexTTS 2.5已在arXiv发布技术报告,显著提升了多语言覆盖范围、推理速度和语音合成整体质量。该模型基于Transformer架构,包含文本到语义(T2S)模块和非自回归语义到梅尔(S2M)模块,实现零样本神经文本到语音功能。实...
一项最新研究揭示,65%的Hacker News帖子带有负面情绪,这些帖子平均得分35.6分,比整体平均高出27%。研究基于32,000个帖子和340,000条评论,使用多个AI模型(包括DistilBERT、BERT、RoBERTa和Ll...