跳到主要内容
赞助推荐 搬瓦工怎么选:三网直连 CN2 GIA-E
前沿哨所

Workbuddy对决Codex实测:同题数据筛选,交付形态决定体验差距

3 分钟阅读阅读()
赞助推荐 团队协作里的 AI 办公工作台

一位开发者在整理历年岗位数据时,将Workbuddy(搭载DeepSeek-V4.1-Flash)与Codex(搭载GPT-6 Astra轻度思考模式)进行同题对比测试,两者接收完全相同的原始样本和筛选要求。结果显示,Workbuddy几乎一轮即输出结果,并在未被要求的情况下自动生成单文件HTML页面与xlsx表格:页面顶部设有统计数据,附带筛选入口和可滚动的岗位信息列表,结构清晰直观。Codex则经过三轮迭代:第一轮仅输出普通xlsx表格,数据正确但缺乏交互;第二轮生成的HTML配色怪异、信息密度偏低;第三轮以Workbuddy的成品为参考修改后才明显改善,但作者认为仍不及前者。作者指出两侧数据均准确,中间各有小错误,差距主要体现在呈现效果上,根源在于客户端harness调教差异而非模型能力,测试期间未添加任何额外提示词或限制。此外,Workbuddy默认以图文卡片、流程图形式呈现回答,并自动在markdown文件中记录错误、要求与注意点,办公场景适配较好。作者坦言此次对比为单次样本、单一场景,严谨性有限,Codex表现同样出色只是审美不合,Workbuddy在办公交付形态上更胜一筹,并提及该产品每日可领取100积分。

事件分析

此次对比的价值不在评判模型高下,而在于揭示AI工具竞争重心的转移:当底层模型能力日趋接近,客户端harness的设计水平、默认交付形态与反馈机制成为体验差异的主要来源。Workbuddy将回答默认呈现为图文卡片,并自动沉淀注意事项至markdown文件,说明其产品假设围绕办公交付物构建;Codex则延续开发者优先的代码逻辑,在无人工干预时交付偏工程化风格。随着DeepSeek、OpenAI等模型被越来越多第三方客户端集成,同一模型在不同harness下的表现分化将愈发明显,模型接入与客户端调教的组合有望成为新的产品壁垒。后续可关注此类办公向Agent工具在复杂任务中的稳定性、错误率以及积分模式的可持续性。

核心观点:模型能力趋同后,交付形态与harness调教正取代参数规模,成为AI工具体验分化的决定性变量。

赞助推荐 一人公司 · 创业装备库
赞助推荐 一人公司 · 创业装备库

原文链接:Linux.do

赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » Workbuddy对决Codex实测:同题数据筛选,交付形态决定体验差距
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型