英特尔推出AutoRound算法:让大模型在2-4比特超低精度下保持高性能
英特尔发布了一款名为AutoRound的先进大模型(LLM)与视觉模型(VLM)量化工具包。该技术利用符号梯度下降,能在2-4比特的超低精度下实现近乎无损的模型压缩,极大降低显存与计算需求。AutoRound不仅兼容Transformers...
标签索引
这个标签下有 4 篇文章。按时间回看相关判断与实践记录。
标签精选
英特尔发布了一款名为AutoRound的先进大模型(LLM)与视觉模型(VLM)量化工具包。该技术利用符号梯度下降,能在2-4比特的超低精度下实现近乎无损的模型压缩,极大降低显存与计算需求。AutoRound不仅兼容Transformers...
针对 DeepSeek API 近期展现出的极高缓存命中率,有开发者深入挖掘其官方文档,发现其背后的技术路线颇具颠覆性。不同于业界普遍依赖昂贵的内存进行分钟级缓存,DeepSeek 创新性地采用了“上下文硬盘缓存”技术。虽然硬盘读写速度理论...
本文详细介绍了在 `newapi` 和 `sub2api` 架构下,如何通过参数覆盖精准配置 Claude 模型的高级特性。作者分享了针对 Claude Code(codex)的 Fast 模式配置,以及针对不同模型版本(Opus、Sonn...
一位开发者通过编写基于PyTorch的XPU自定义算子,成功在Intel Arc A770/A750显卡上优化了Qwen 3.5多模态大模型。该项目将复杂的递推状态更新与RMSNorm计算融合为单一SYCL内核,显著降低了中间张量的调度开销...