让Codex拥有Opus的“脑子”:开发者分享规范指令与中转站优化实战
面对Opus高昂的使用成本,作者通过自建API中转站并嵌入精简的规范指令,成功将Codex的指令遵循度提升至Opus的60%~70%。该方案利用类似LiteLLM的预处理逻辑,有效解决了模型发散、输出结构混乱等痛点。目前作者已开放少量测试名...
面对Opus高昂的使用成本,作者通过自建API中转站并嵌入精简的规范指令,成功将Codex的指令遵循度提升至Opus的60%~70%。该方案利用类似LiteLLM的预处理逻辑,有效解决了模型发散、输出结构混乱等痛点。目前作者已开放少量测试名...
针对Claude Code在长对话中出现的“上下文衰退”问题,Morph-compact插件提供了一种高效的解决方案。该插件能在发送给LLM前,以每秒数万Token的速度压缩聊天记录与代码上下文,去除问候语、失败尝试等无关填充内容。实测显示...

ECS / OSS / CDN / 云数据库一站采购,常用云资源集中选配;新用户与续费均有专场优惠,适合个人开发者与小团队长期使用。
一位开发者在尝试利用LLM从试卷文本中切割题目时遭遇了性能瓶颈。为了应对不规范的输入格式,他编写了长达4k token的Prompt以确保解析质量,但这导致处理速度极慢,因为所有内容都需要一次性输入模型。目前的讨论集中在分片并行处理和聚合上...
针对AI Agent在处理长上下文时面临的高昂成本和准确率下降问题,Context Gateway推出了一款开源代理工具。它部署在编码Agent与大模型之间,利用小型语言模型(SLM)智能识别并过滤掉工具输出中的无效噪音,仅将高价值信号传递...
本文记录了作者尝试将基于GPU Triton编写的Flash Attention算法移植到Google TPU (JAX)上的失败与顿悟过程。起初,直接移植的性能不仅没有提升,反而比标准的XLA融合内核慢了数十倍。通过深入剖析TPU架构和J...
新项目Aventos试图以低成本追踪公司在LLM中的提及,挑战当前AI SEO工具的高价现状。作者指出,市面上许多同类产品仅是简单的API封装,却收取高昂费用。Aventos实验性地采用接近成本的定价模式,提供AI引用分析和内容生成功能,旨...