Trinity Large 登场:400B 稀疏 MoE 模型,宣称超越 Llama 4
Trinity 团队发布 4000 亿参数稀疏 MoE 模型 Trinity Large,采用 4-of-256 架构,仅激活 13B 参数,推理速度提升 2-3 倍。该模型提供 Base、Preview 和 TrueBase 三个版本,其...
标签索引
这个标签下有 2 篇文章。按时间回看相关判断与实践记录。
标签精选
Trinity 团队发布 4000 亿参数稀疏 MoE 模型 Trinity Large,采用 4-of-256 架构,仅激活 13B 参数,推理速度提升 2-3 倍。该模型提供 Base、Preview 和 TrueBase 三个版本,其...
Qwen团队即将发布下一代模型Qwen3-Next,采用创新的混合注意力架构和高达1:50的高稀疏MoE技术。首款模型Qwen3-Next-80B-A3B虽总参数800亿,但仅激活30亿,性能超越Qwen3-32B且训练成本不到十分之一。得...