云聚 AI Token Plan 满 199 减 35 元
port:80 AI Junkie
AI 重度玩家的工程笔记本

对标Anthropic前沿梯队:字节跳动已开训10万亿参数大模型

云聚 AI Token Plan 满 199 减 35 元

据英国《金融时报》援引三名知情人士消息,字节跳动已正式启动代号为“未知”的下一代大模型预训练项目,其目标参数规模最高可达 10 万亿。若按此上限完成训练,该模型体量将超过 Moonshot AI(Kimi)K3 模型的三倍以上,成为中国团队中参数规模最大的模型。从全球视角看,字节此举直接对标美国顶尖闭源模型团队。行业估算 Anthropic 的旗舰模型 Mythos 5 参数约为 8 万亿,字节新模型若达到 10 万亿,将在参数规模上跻身世界最前沿梯队。目前该项目仍处于预训练初期,预计需 3 至 6 个月完成基础能力训练,随后进入后训练阶段。值得注意的是,张一鸣近期在内部明确反对通过“蒸馏”竞争对手模型来快速追赶,而是要求团队接受暂时的落后,坚持自研路径冲击第一梯队。尽管参数规模是提升模型能力的重要维度,但业界普遍认为,最终表现仍取决于模型架构、训练数据质量及训练方法。此次字节跳动的激进投入,标志着国内大厂在 AI 竞赛中进入了“暴力美学”与“自研深度”并重的全新阶段。

事件分析

此次事件标志着中国科技巨头在大模型竞赛策略上的重大转折。过去一年,行业普遍存在通过“蒸馏”技术以小博大、快速追赶的捷径倾向,而字节跳动此次明确禁止蒸馏、并直接将参数规模推至 10 万亿量级,显示出其试图通过“大力出奇迹”的物理算力路线打破现有格局的决心。在技术层面,10 万亿参数已远超现有主流架构的高效区间,这意味着必须采用全新的稀疏架构或 MoE(混合专家)技术来平衡推理成本与性能,对数据配比、分布式训练稳定性提出了极高要求。产业层面,字节此举可能迫使其他厂商跟进提升训练规模,从而引发新一轮算力军备竞赛。然而,高参数并不直接等同于高智商,Anthropic 等前沿厂商已在数据合成算法和推理链上构建壁垒,字节的新模型仍需在最终效果上接受“缩放定律”的考验。

💡 核心观点:拒绝捷径转向暴力美学,字节跳动试图以绝对的参数规模豪赌,换取通往AGI的技术代差。

阿里云 OPC 一人公司创业装备库

原文链接:Linux.do

阿里云函数计算 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » 对标Anthropic前沿梯队:字节跳动已开训10万亿参数大模型
赞助推荐 FreeModel.dev Claude Code 中转
阿里云函数计算 一键部署 AI 大模型