开源项目 llm-tap 是一款专注于本地透明代理与大语言模型(LLM)交互数据采集的开发工具,旨在解决 AI 开发者在进行模型微调(SFT)时面临的高质量数据获取难题。该项目能够兼容 Claude Code、Codex、CherryStudio 等主流客户端,将用户的请求透明转发至真实的服务提供商,并在本地完整地保存请求内容、响应结果及相关元数据。在技术实现上,llm-tap 具备“零上游配置”特性,Host 信息直接从 URL 路径提取,API Key 由客户端透传,代理本身不保存上游服务凭证,确保了使用的安全性。它能自动识别 Anthropic、OpenAI Chat Completions 等多种协议,并整合流式响应数据。此外,该工具提供了一个基于 Web 的管理界面,允许开发者按照 Host、模型、协议、状态及时间范围对采集到的调用记录进行多维筛选和详情查看。在数据导出方面,llm-tap 支持多种主流训练数据格式,包括 canonical、ShareGPT、tool_sft、OpenAI 及 OpenAI windowed 格式。同时,它支持限制单条记录的上下文长度,保留完整的工具调用链,并按预算压缩过长内容。针对数据安全,系统会对 Authorization、x-api-key 等敏感请求头进行自动脱敏处理,并将数据默认存储在本地用户目录中。
事件分析
💡 核心观点:降低私有 SFT 数据集构建门槛,助力开发者利用日常交互实现“数据飞轮”,推动垂直领域模型微调普及。
原文链接:Linux.do





