跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 4 页

transformer

这个标签下有 60 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

仅9M参数!作者训练浏览器端小模型精准纠正中文声调

作者为解决中文声调学习难题,基于Conformer和CTC技术训练了一款小型语音模型。通过数据优化与架构调整,模型参数从7500万压缩至900万,量化后仅11MB,可在浏览器端流畅运行,验证了边缘AI在特定教育场景下的高性价比与实用性。 原...

1 分钟阅读149 阅读
前沿哨所

字节跳动发布KEEL架构:首次实现超千层大模型稳定训练

字节跳动Seed团队推出KEEL新架构,解决了大模型深度扩展的技术瓶颈。该架构通过引入高速公路式连接改进Post-LN结构,在不依赖复杂优化技巧的情况下,首次成功实现了超过1000层超深层神经网络的稳定训练。这一突破证明深度扩展比单纯加宽更...

1 分钟阅读264 阅读
前沿哨所

马斯克开源X新算法:全Transformer架构,Rust重写

马斯克团队正式开源了X平台全新的推荐算法,核心亮点在于完全基于Transformer架构,取代了旧版的手工特征工程。新算法采用与Grok相同的结构,通过Phoenix Scorer直接处理实时互动序列进行排序。技术栈全面采用Rust语言重写...

1 分钟阅读215 阅读
前沿哨所

拓扑Transformer问世:KV缓存减半,突破传统注意力机制

本文介绍了名为Tauformer的新型拓扑Transformer架构,它通过图拉普拉斯导出的标量替代传统的点积注意力,将域结构直接注入模型。这种设计使KV缓存只需存储值和标量流,而非完整的键张量,实现了约50%的逐层缓存缩减。在H100上的...

1 分钟阅读174 阅读
前沿哨所

indexTTS 2.5发布:语音合成速度与质量飞跃

indexTTS 2.5已在arXiv发布技术报告,显著提升了多语言覆盖范围、推理速度和语音合成整体质量。该模型基于Transformer架构,包含文本到语义(T2S)模块和非自回归语义到梅尔(S2M)模块,实现零样本神经文本到语音功能。实...

1 分钟阅读433 阅读
前沿哨所

Hacker News研究:负面情绪帖子表现更佳

一项最新研究揭示,65%的Hacker News帖子带有负面情绪,这些帖子平均得分35.6分,比整体平均高出27%。研究基于32,000个帖子和340,000条评论,使用多个AI模型(包括DistilBERT、BERT、RoBERTa和Ll...

1 分钟阅读204 阅读