跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 6 页

transformer

这个标签下有 60 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

Transformer模型Web端TTS:延迟挑战与优化探索

在Linux.do社区,用户讨论使用transformers.js运行Kokoro-82M模型实现离线Web端TTS(文本转语音)功能。用户反馈模型运行延迟较高,虽可用但体验不佳,寻求更高效的替代方案。这反映了在浏览器环境中部署大型Tran...

1 分钟阅读174 阅读
前沿哨所

Gemini 3.0优化:论文抽象方法拆解指南

本文探讨了如何利用Google Gemini 3.0人工智能模型拆解学术论文中的抽象方法,将其转化为具体的工程操作,以促进深度学习领域的理解。作者发现,传统论文解读方式易受原文表述影响,导致注意力分散且难以直观掌握核心概念。通过优化提示词,...

1 分钟阅读163 阅读
前沿哨所

通用推理模型URM刷新AI推理基准

该论文系统分析了通用Transformer在复杂推理任务中的性能表现,发现其优势主要源于循环归纳偏置和强非线性组件,而非复杂架构设计。基于此,作者提出通用推理模型(URM),通过集成短卷积和截断反向传播技术,显著提升了推理能力。实验显示,U...

1 分钟阅读188 阅读
前沿哨所

图解Transformer模型:AI核心技术的深度解析

本文详细解析了Transformer模型的工作原理,包括自注意力机制、多头注意力、位置编码和编码器-解码器结构。文章通过可视化方式,帮助读者理解如何通过Query、Key和Value向量实现序列建模,以及Transformer如何优化并行训...

1 分钟阅读192 阅读
前沿哨所

谷歌创新神经记忆模块,突破大模型长序列瓶颈

谷歌研究人员推出神经长期记忆模块(titan),针对Transformer架构在长序列处理中的注意力稀释、性能下降和显存依赖问题。该模块作为深层神经网络,在运行时动态更新权重,通过“惊奇度”机制选择性记忆信息,类似人脑功能。谷歌设计了三种集...

1 分钟阅读164 阅读
前沿哨所

私有大模型训练全攻略:企业抢占AI先机

本文提供了一套完整的’从0到1训练私有大模型’课程资源,涵盖词向量原理、Transformer架构、BERT系列、强化学习及RLHF训练实战等核心技术。课程从基础概念入手,逐步深入到模型开发与训练,包括使用Paddl...

1 分钟阅读178 阅读
前沿哨所

谷歌AI军备竞赛:全方位优势难以撼动

谷歌在AI竞赛中展现出全方位领先优势。模型层上,谷歌拥有第一梯队多模态闭源和开源模型,并在生物学领域通过AlphaFold实现垄断。应用层中,谷歌全家桶、搜索引擎及AndroidOS已集成AI overviews,提供无缝体验。数据来源方面...

1 分钟阅读207 阅读
前沿哨所

AI模型突破:224倍压缩Llama-70B,精度提升

研究人员开发了一种创新方法,通过低秩’意义场’技术替换完整Transformer推理,将冻结的Llama-3.3-70B模型压缩224倍,同时实现256维场表示,并在多个基准测试上略微提高准确性。该方法引入小型学生模...

1 分钟阅读201 阅读