由Rui和Michael创立的EdotEnv(YC S26批次)致力于构建基于量化交易工作流的自适应强化学习(RL)环境,旨在训练大型语言模型(LLM)的研究能力。针对当前AI领域基准测试被过度优化(benchmaxxing)而导致评估失效的难题,该团队指出,有效的基准应具备随模型进步而增加难度的特性。他们发现金融市场具有这种理想属性:市场效率随着套利者的介入而提高,使得旧策略失效,新策略更难寻找,从而形成一个持续进化的挑战系统。EdotEnv将专业的量化工作流转化为可靠的训练环境,要求Agent处理真实市场数据,完成构建预测特征、设计投资组合、回测策略以及适应市场机制等任务。初步测试显示,现有的SOTA模型倾向于进行广泛但浅显的搜索,在深度迭代研究方面表现挣扎;更高的推理能力并不直接转化为更好的交易表现;且Agent缺乏基本的交易常识,例如在亏损时选择停止交易而非调整策略。该项目旨在通过这种高保真的环境,教授Agent可转移的长期规划和持续学习能力,而非特定任务的答案。目前,EdotEnv已在GitHub开源了样本任务库,并计划向AI实验室和企业销售持续进化的训练环境。
事件分析
💡 核心观点:将具备自适应难度的量化交易环境作为LLM的“考场”,为解决静态基准饱和提供了新路径,同时也暴露了当前Agent在长程规划和动态决策上的短板。
原文链接:Hacker News





