GitHub新项目AutoKernel:利用AI实现GPU内核的自动化研究与优化
近日,GitHub上的AutoKernel项目引发了技术社区关注。该项目致力于利用人工智能技术实现GPU内核的“自动研究”。GPU内核的编写与优化是高性能计算和AI模型推理中的核心难题,通常依赖专家进行繁琐的手工调优,效率低下。AutoKe...
标签索引 / 第 2 页
这个标签下有 15 篇文章。按时间回看相关判断与实践记录。
标签精选
近日,GitHub上的AutoKernel项目引发了技术社区关注。该项目致力于利用人工智能技术实现GPU内核的“自动研究”。GPU内核的编写与优化是高性能计算和AI模型推理中的核心难题,通常依赖专家进行繁琐的手工调优,效率低下。AutoKe...
ZSE是一款全新的开源大语言模型推理引擎,主打极致的内存效率与高性能。其核心创新包括自研的zAttention注意力机制、INT2-8混合精度量化以及zStream层级流式传输技术,允许在仅24GB显存的消费级显卡上运行700亿参数模型。实...
NTransformer 是一款高效能 C++/CUDA 推理引擎,通过创新的 PCIe 流式传输和 NVMe Direct I/O 技术,成功在单张 RTX 3090(24GB 显存)上流畅运行 Llama 3.1 70B 大模型。该技术...
本文提出了一种在浮点运算环境下高效计算大有限域矩阵乘法的新方法。现有技术因浮点尾数限制,通常只能处理较小的素数位宽。该研究创新性地采用多字分解技术,成功将双精度算力支持的素数位宽上限从26位提升至52位。在CPU和GPU上的实验表明,该方法...
一个不太一样的开源模型 2026年1月6日,Lightricks 开源了 LTX-2 模型。这不是又一个”能生成视频”的 AI 工具,而是第一个在统一架构下同时生成视频和音频的开源基础模型。 大多数 AI 视频工具的...