企业 Agent 失败,不是因为模型不够大
Tesla 机器学习工程师 Ishita Daga 在这段 12 分钟分享里,把企业数据 Agent 的失败原因压到三个词:歧义、腐败、偏好。本文结合我自己的 Harness / 企业记忆笔记,讨论为什么加模型、加上下文、加知识库都不是根治...
标签索引
这个标签下有 15 篇文章。按时间回看相关判断与实践记录。
标签精选
Tesla 机器学习工程师 Ishita Daga 在这段 12 分钟分享里,把企业数据 Agent 的失败原因压到三个词:歧义、腐败、偏好。本文结合我自己的 Harness / 企业记忆笔记,讨论为什么加模型、加上下文、加知识库都不是根治...
第37期大模型周报,记录2026年7月11日至17日这一周的几个关键信号:OpenAI把GPT-5.6推向企业代理,Anthropic继续押注开发者生态,Google走企业集成路线,中国开源模型则用Kimi K3和GLM系列把成本压力重新打...
Pablo Castro 来自 Microsoft,是 CVP 和 Distinguished Engineer。他这场 “On AI and Knowledge” 很适合作为第一天的开篇,因为 software f...
4 月最后一周,大模型圈没有出现像新旗舰模型发布那样的超级大新闻,但行业方向反而更清楚了。 一边是 OpenAI、Anthropic、Google 继续把重点压在企业能力、Agent 工作流和安全治理上;另一边是 DeepSeek、Moon...
本文探讨了一家初创公司在采购国外AI模型(如GPT和Claude)用于代码开发时所面临的真实痛点。作者基于使用体验,对比了Gemini、GPT和Claude在编码能力上的差异,并指出因担心Claude的封号风险,更倾向于选择官方渠道的GPT...
尽管市场上 Agent 工程师招聘火热,简历中充斥着“赋能提效”,但实际企业落地情况却不容乐观。业内观察发现,目前体验最好的 AI 产品多是 Cursor、墨刀等允许“幻觉”存在的创意生成类工具。相比之下,企业核心业务对错误的容忍度极低,大...
随着企业开始报销 AI 使用费用,一位开发者分享了主流工具的实战反馈。在编程辅助领域,OpenAI Codex 因修改额度计算方式导致资源紧张,而 Claude Code 虽功能强大,却面临较高的封号风险。此外,文中还探讨了即梦、扣子等创作...
某项目在使用Qwen32B大模型进行工单纠错时,尽管用户认可效果,但响应速度过慢成为阻碍业务落地的关键瓶颈。面对厂商将原因归咎于提示词设计的说法,引发了业界对于大模型优化方向的深层思考。这暴露了当前企业级AI应用中普遍面临的困境:模型精度与...
我的判断是:2026 年大多数 AI Agent 产品卖不动,不是因为模型还不够聪明,而是因为它们没有把“责任界面”设计清楚。 什么叫责任界面?很简单:当系统做对了,功劳算谁的;做错了,谁来承担;出现歧义时,谁有最终裁决权;跨过风险阈值时,...
随着AI深入企业办公场景,国产大模型的选型成为关键议题。近期有技术团队在V2EX发帖求助,对比Kimi、智谱GLM与MiniMax的企业订阅方案。该团队核心需求集中在Agent办公能力,要求AI能处理PDF/图片转Excel并生成分析报告,...