突破数据瓶颈:利用神经元胞自动机实现语言模型“预预训练”
针对自然语言文本数据即将耗尽且包含偏见的行业难题,最新研究提出了一种利用神经元胞自动机(NCA)进行“预预训练”的创新方案。该方案假设语言模型训练的关键在于数据结构而非语义,通过将NCA生成的复杂时空动态转化为令牌序列,强迫模型在语境中推断...
标签索引 / 第 3 页
这个标签下有 60 篇文章。按时间回看相关判断与实践记录。
标签精选
针对自然语言文本数据即将耗尽且包含偏见的行业难题,最新研究提出了一种利用神经元胞自动机(NCA)进行“预预训练”的创新方案。该方案假设语言模型训练的关键在于数据结构而非语义,通过将NCA生成的复杂时空动态转化为令牌序列,强迫模型在语境中推断...
图灵奖得主杨立昆等人联合发布论文,指出当前AI系统过度依赖人类筛选的静态数据,如同处于“软垫房”中,缺乏在动态环境中的适应能力。论文提出引入受生物认知启发的“系统M”(元控制),试图通过整合观察与主动学习模式,打破“数据墙”限制。然而,社区...
本文深入剖析了大模型算法中至关重要的Seq2Seq(序列到序列)架构及编码器-解码器机制。文章详细讲解了模型如何通过RNN/LSTM处理输入输出长度不等的对齐任务,分析了固定长度上下文向量带来的信息瓶颈问题。此外,文中对比了训练时的“教师强...
Linux.do社区分享了知名讲师唐宇迪的深度学习PyTorch全套视频课程。该资源内容详实,系统涵盖了神经网络原理、CNN、RNN、Self-Attention机制、Transformer、BERT及Vision Transformer等...
Yuan3.0 Ultra多模态大模型正式发布并开源。该模型采用统一架构,结合视觉编码器与103层Transformer语言主干网络,基于混合专家(MoE)技术构建。通过创新的LAEP方法,模型参数规模优化至1010B,激活参数为68.8B...
本文基于Andrej Karpathy的开源项目“MicroGPT”,通过交互式可视化深度拆解了大语言模型(LLM)的底层架构。文章利用仅200行的纯Python代码,不依赖任何深度学习框架,从零实现了GPT的完整训练流程。内容涵盖了从字符...
AI权威专家Andrej Karpathy发布“microgpt”项目,仅用200行纯Python代码(无第三方依赖)完整实现了GPT的训练与推理。该项目包含数据集处理、分词器、自动求导引擎、Transformer架构及Adam优化器等核心...
本文详细记录了构建并训练一个极简Transformer模型以完成10位数加法任务的全过程。作者通过实验探索了神经网络如何在不预先编程的情况下,仅通过数据学习掌握复杂的算术逻辑。文章深入剖析了模型架构设计、训练曲线以及注意力机制在其中的运作方...
AdderBoard 挑战赛旨在寻找能够对两个10位数进行加法运算且准确率超过99%的最小Transformer模型。该项目源于对 Claude Code 和 Codex 代码生成能力的对比,随后引爆社区热情。目前的排行榜显示,通过手工设计...
文章批评了Google DeepMind近期关于利用Transformer实现“无搜索大师级下棋”的论文。作者指出,虽然该模型在快棋中表现优异,但其架构并未超越AlphaZero范式。更重要的是,文章认为DeepMind刻意忽视了开源项目L...