从静态 benchmark 到活的 eval:Vincent Koc 这场分享,真正戳中的不是评测,而是 agent 软件的变形速度
很多人现在一提 eval,脑子里冒出来的还是老三样:题库、benchmark、离线跑分、回归测试。这个思路在过去不是错的。问题是,今天的 agent 系统已经越来越不像“一个发布后基本不动的程序”了。它会接工具、会吃上下文、会随着用户习惯漂...
标签索引 / 第 12 页
这个标签下有 2415 篇文章。按时间回看相关判断与实践记录。
标签精选
很多人现在一提 eval,脑子里冒出来的还是老三样:题库、benchmark、离线跑分、回归测试。这个思路在过去不是错的。问题是,今天的 agent 系统已经越来越不像“一个发布后基本不动的程序”了。它会接工具、会吃上下文、会随着用户习惯漂...
一位开发者在社区反馈,长期使用 OpenAI 的 Codex 编写代码,发现其生成的代码风格往往存在“过度工程化”的问题,函数嵌套层级过深,即使通过提示词限制也难以改善。为了优化代码质量,该开发者计划借鉴 Cursor 的编排思路(CCG)...
随着大模型应用的深入,AI回答“车轱辘话”多、输出冗长的问题日益凸显。近日在技术社区Linux.do,有用户吐槽ChatGPT回答重复且篇幅过长,导致难以快速捕捉核心信息。这一话题引发了广泛共鸣,反映出用户对AI交互效率的焦虑。目前,通过优...
随着大模型频繁更新,用户常怀疑模型变“笨”或受到更多限制。该项目通过可视化图表记录了各大 AI 模型的 ELO 评分历史,旨在揭露潜在的“暗中削弱”现象。文章指出,模型更新可能引入过度审查、过度量化以节省算力或行为退化。此外,项目还区分了 ...
近日,有社区用户爆料,其公司通过监控“llm-proxy”代理服务,实现了对员工AI交互记录的实时抓取。该系统能够详细记录每一条Prompt指令、生成的代码量以及具体的操作时间段。这种“全景式”的监控手段被批评为“数字监工”,引发了职场人对...
一位开发者在测试中发现,启用MCP(模型上下文协议)及大量Skills后,仅一句简单的“你好”初始对话就消耗了近5万个Token。经分析,消耗“大头”主要来自固定的系统提示词、上百个技能描述、30多个工具的JSON Schema定义以及复杂...
针对 NewAPI 等现有工具对于小团队或个人共享场景过于臃肿的问题,开发者推出了开源项目 CPA-Helper。这是一款基于 CLIProxyAPI (CPA) 的轻量级管理面板,采用 FastAPI 与 Vue 3 构建。它支持多用户 ...
一位开发者通过协调OpenAI Codex和Claude,仅用5周时间和约40英镑的成本,成功复刻了原本需耗时数年的RAR压缩算法(Rust版)。该项目展示了AI在处理复杂逆向工程、文档生成及大规模代码编写(5.5万行)上的惊人能力。尽管最...
为了解决现有语音服务“黑盒”和不透明的问题,开发者推出了开源平台 Feros.ai。该平台定位为“开源版的 Vapi/Retell + n8n”,底层采用 Rust 构建,以确保高性能和低延迟。它允许用户完全自托管,掌控数据隐私,并支持灵活...
随着国内大模型应用落地的加速,合规性成为产品上线的关键门槛。然而,许多开发者面临一个棘手的技术难题:如何在保持AI回复“流式输出”带来的低延迟体验的同时,实时监控并拦截违规内容?目前主流大厂的审核方案多为非流式,难以直接适配。该话题深入探讨...