抛弃CLIP与VAE,商汤联合NTU推出原生像素多模态大模型NEO-unify
商汤科技与南洋理工大学联合推出NEO-unify模型,该模型最大的创新在于摒弃了传统多模态架构中的Vision Encoder(如CLIP)和VAE组件。其采用Mixture-of-Transformer(MoT)架构,直接从原始像素出发,...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
商汤科技与南洋理工大学联合推出NEO-unify模型,该模型最大的创新在于摒弃了传统多模态架构中的Vision Encoder(如CLIP)和VAE组件。其采用Mixture-of-Transformer(MoT)架构,直接从原始像素出发,...