云聚 AI Token Plan 满 199 减 35 元
port:80 AI Junkie
AI 重度玩家的工程笔记本

YC初创公司Cedana推GPU实时迁移技术,通过内核级方案解决AI算力中断与成本难题

云聚 AI Token Plan 满 199 减 35 元

YC S23批次初创公司Cedana正在招聘“前沿部署工程师”,该公司致力于通过内核级技术解决AI和高性能计算(HPC)领域的资源稀缺与高成本问题。Cedana的核心技术是一套自动化的GPU检查点基础设施,能够在内核/操作系统层面实现GPU工作负载的透明、快速迁移。该方案无需修改代码或配置,即可在硬件故障或节点维护时无缝迁移工作负载,确保不丢失计算进度,从而最大化集群的利用率和吞吐量。目前,该系统已支持Kubernetes、SLURM和NVIDIA Dynamo等主流环境。此次招聘的岗位主要负责端到端的技术客户对接,要求候选人具备3-10年软件工程经验,拥有深厚的Linux基础(包括systemd、cgroups v2、内核模块等)以及在生产环境中部署和管理SLURM集群的丰富经验。候选人需能够深入客户环境(如大学研究集群、云原生推理平台或大型药企),负责从操作系统层面到应用层的全栈集成与调试。该职位提供14万至18万美元的年薪及早期股权,要求全职远程(美国),并伴有约25%的客户现场差旅。Cedana的创始团队拥有超过十年的高性能计算经验,曾在Shopify负责机器人集群控制,并拥有医疗AI领域的创业退出经历,其研究成果曾发表于NeurIPS和CVPR等顶级会议。

事件分析

Cedana的技术切入点直击当前AI基础设施的关键痛点:训练成本高昂与故障恢复困难。在AI大模型训练中,GPU故障往往导致数小时甚至数天的计算成果付诸东流。Cedana提出的“GPU实时迁移”类似于虚拟机的热迁移,但针对的是更复杂的GPU显存和计算状态。这涉及到对Linux内核、CRIU(Checkpoint/Restore In Userspace)以及NVIDIA驱动底层的深度修改与优化。从产业角度看,这种“容错”能力是实现“弹性AI训练”的基石,它允许云厂商和企业在不中断服务的前提下进行硬件维护或动态调度资源,从而大幅降低GPU的闲置时间。能够无缝集成SLURM(超算主流调度器)和Kubernetes(云原生主流调度器),显示了该技术旨在打通传统高性能计算与现代AI云原生架构之间的壁垒,具有极高的工程价值。

💡 核心观点:通过内核级技术实现GPU工作负载的“热迁移”,是将AI算力从静态僵化资源转变为动态可调度资产的关键一跃。

阿里云 OPC 一人公司创业装备库

原文链接:Hacker News

阿里云函数计算 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » YC初创公司Cedana推GPU实时迁移技术,通过内核级方案解决AI算力中断与成本难题
赞助推荐 FreeModel.dev Claude Code 中转
阿里云函数计算 一键部署 AI 大模型