YC S23批次初创公司Cedana正在招聘“前沿部署工程师”,该公司致力于通过内核级技术解决AI和高性能计算(HPC)领域的资源稀缺与高成本问题。Cedana的核心技术是一套自动化的GPU检查点基础设施,能够在内核/操作系统层面实现GPU工作负载的透明、快速迁移。该方案无需修改代码或配置,即可在硬件故障或节点维护时无缝迁移工作负载,确保不丢失计算进度,从而最大化集群的利用率和吞吐量。目前,该系统已支持Kubernetes、SLURM和NVIDIA Dynamo等主流环境。此次招聘的岗位主要负责端到端的技术客户对接,要求候选人具备3-10年软件工程经验,拥有深厚的Linux基础(包括systemd、cgroups v2、内核模块等)以及在生产环境中部署和管理SLURM集群的丰富经验。候选人需能够深入客户环境(如大学研究集群、云原生推理平台或大型药企),负责从操作系统层面到应用层的全栈集成与调试。该职位提供14万至18万美元的年薪及早期股权,要求全职远程(美国),并伴有约25%的客户现场差旅。Cedana的创始团队拥有超过十年的高性能计算经验,曾在Shopify负责机器人集群控制,并拥有医疗AI领域的创业退出经历,其研究成果曾发表于NeurIPS和CVPR等顶级会议。
事件分析
💡 核心观点:通过内核级技术实现GPU工作负载的“热迁移”,是将AI算力从静态僵化资源转变为动态可调度资产的关键一跃。
原文链接:Hacker News





