Kapa.ai在构建技术文档AI助手时发现,处理数百万张图像(截图、架构图等)若采用传统的“查询时多模态”方案,会导致成本激增27%-51%且触及模型上下文窗口上限。为此,团队提出了一种在索引阶段而非查询阶段处理图像的优化架构:利用视觉语言模型一次性生成图像的文本描述,将图像内容转化为文本块进行存储和检索。这种方法将视觉处理的计算成本从每次查询转移为一次性索引开销,使得单次查询的额外成本仅增加1%至6%。工程实践中,图像被分为“辅助说明”和“承载核心数据”两类,必须通过零样本分类器过滤无用的装饰图。研究表明,结合图像周围文本上下文能显著提升描述质量,且将描述作为独立块存储比嵌入原文更具成本效益。该方案在三个客户项目中验证,不仅大幅降低了推理成本,更显著提升了答案的可操作性和引用准确性。
事件分析
💡 核心观点:将视觉算力从实时推理转移至索引阶段,通过图像文本化实现RAG架构的高效与低成本规模化。
原文链接:Hacker News





