跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 3 页

GPU

这个标签下有 80 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

Perplexity新技术:1.3秒完成万亿参数模型权重同步

Perplexity发布技术突破,将万亿参数模型(Kimi-K2)的强化学习微调权重同步时间缩短至1.3秒。通过利用RDMA点对点通信技术,该方案实现了从256张训练GPU到128张推理GPU的零拷贝传输。相比传统数分钟级的同步耗时,新方法...

1 分钟阅读177 阅读
前沿哨所

新工具让AI Agent自主调度Lambda H100实例

该项目为Lambda云GPU实例提供了一个非官方的CLI工具及MCP服务器。其核心价值在于打通了AI代理与底层算力的连接,使Claude Code、Cursor等AI工具能够自主寻找、启动和销毁GPU实例。用户只需简单指令,Agent即可自...

1 分钟阅读216 阅读
前沿哨所

vLLM完成V1引擎迁移,DeepSeek推理速度突破2.2k tok/s

vLLM团队宣布完成向V1引擎的全面迁移,通过集成Wide-EP、双批次重叠(DBO)及专家并行负载均衡(EPLB)等优化,在H200集群上实现每GPU 2.2k tokens/s的吞吐量。这一显著性能提升解决了DeepSeek等稀疏MoE...

1 分钟阅读185 阅读
前沿哨所

Modal推出GPU内存快照技术,实现AI模型亚秒级启动

Modal 发布了 GPU 内存快照技术,致力于在 2025 年实现亚秒级启动。这一突破对 AI 和 LLM 部署至关重要,能显著降低模型加载延迟,提升云端推理效率。社区讨论了其底层实现可能涉及 gVisor 或 Firecracker,并...

1 分钟阅读230 阅读
前沿哨所

深度解析高通下一代Adreno X2 GPU架构

本文深入探讨了高通即将发布的Adreno X2 GPU架构,由前AMD图形架构师、现任高通首席架构师Eric Demers亲自解析。文章详细分析了新架构在能效比、渲染性能及AI计算方面的技术突破,探讨了高通在移动端及汽车芯片领域的图形战略。...

1 分钟阅读203 阅读
前沿哨所

DeepDream视频生成新突破:时间一致性优化

开发者分叉PyTorch DeepDream实现,新增视频支持并确保时间一致性,显著减少闪烁。该工具采用光流扭曲技术将先前的幻觉融合到当前帧,通过遮罩掩码防止对象移动时的鬼影,同时支持高级参数调整。兼容GPU、CPU和Apple Silic...

1 分钟阅读231 阅读