挑战30亿向量检索:从代码优化到工程思维的本质转变
本文详细记录了作者受Jeff Dean启发,尝试实现30亿规模向量搜索的技术探索过程。通过利用NumPy向量化操作和Float32数据类型,作者成功将查询速度提升了数百倍。然而,当数据规模扩展至30亿时,系统遭遇了高达8.6PB的内存墙瓶颈...
标签索引 / 第 6 页
这个标签下有 83 篇文章。按时间回看相关判断与实践记录。
标签精选
本文详细记录了作者受Jeff Dean启发,尝试实现30亿规模向量搜索的技术探索过程。通过利用NumPy向量化操作和Float32数据类型,作者成功将查询速度提升了数百倍。然而,当数据规模扩展至30亿时,系统遭遇了高达8.6PB的内存墙瓶颈...
一位开发者在技术社区发布了其自主研发的 AaaS(Agent as a Service)部署中间件,该工具专为管理复杂的 AI 智能体生态系统设计。通过创建一个独立的沙盒环境,该中间件支持运行多种 Agent Runtime,有效解决了不同...
本文记录了一位致力于转型AI基础设施(AI Infra)的大四学生在寒假期间的自学清单与课程评测。作者在面试某公司AI Infra岗位后,系统复习了包括伊利诺伊大学的GPU编程入门、斯坦福经典的CS231n与CS229机器学习课程、MIT的...
近日,有开发者在技术社区反馈,调用 Gemini CLI 及相关 API 时持续出现“No capacity available”错误,且持续时间超过一小时。虽然部分用户起初担心账号被风控,但多方反馈证实这更多是谷歌服务器端的算力瓶颈。这一...
Anthropic 官方状态页面显示,Claude.ai 聊天机器人、开发者平台以及 Claude Code 编程工具目前均出现较高的错误率。技术团队正在积极调查此次故障的根本原因。此次中断波及网页端及控制台,可能对依赖 Claude AP...
近日,部分用户反馈 Google Gemini 服务出现异常,无法正常响应或连接超时。据社区讨论推测,该现象可能是由于服务器负载达到上限,或者是 Google 正在进行紧急的开发调优与部署。作为对标 GPT-4 的重量级产品,Gemini ...
Hacker News 社区正在热议“每个程序员都应知道的延迟数字”这一经典技术话题。讨论并未止步于 Jeff Dean 早年总结的基础数据,而是深入到了现代硬件的性能对比与验证。社区成员不仅探讨了原始数据的误差范围,更将关注点延伸至当今 ...
YC 孵化的 AI 开源网关项目 LiteLLM 正在招聘其首位“创始级”性能与可靠性工程师,年薪高达 27 万美元。作为拥有 3.6 万 GitHub 星标的项目,LiteLLM 每日处理数亿次 LLM API 调用,服务客户包括 NAS...
一位开发者尝试通过Nginx反向代理结合阿里云ESA(边缘安全加速)来优化海外CPA节点对Claude/GPT API的访问速度。尽管配置了全球及国内加速,且Ping值显示网络连接良好,但在实际高吞吐量的Claude Code应用中,响应速...
这篇文章详细记录了Linum团队历时四个月训练图像视频变分自编码器(VAE)的技术历程与核心发现。他们打破了行业内的普遍误区,指出VAE的重建质量越高,并不代表下游扩散模型的生成效果越好。过度追求像素级还原会导致模型过拟合于数据中的压缩噪点...