阿里发布Qwen3.6-Max-Preview:智能体编程能力暴涨,大模型竞速进入新阶段
阿里正式推出 Qwen3.6-Max-Preview 模型,相较于 Qwen3.6-Plus,新模型在智能体编程、世界知识及指令遵循方面取得显著突破。数据显示,其在 SkillsBench 和 SciCode 等编程基准测试中分别提升 9....
标签索引 / 第 47 页
这个标签下有 2415 篇文章。按时间回看相关判断与实践记录。
标签精选
阿里正式推出 Qwen3.6-Max-Preview 模型,相较于 Qwen3.6-Plus,新模型在智能体编程、世界知识及指令遵循方面取得显著突破。数据显示,其在 SkillsBench 和 SciCode 等编程基准测试中分别提升 9....
近期,科技社区关于主流AI大模型“变笨”的讨论日益增多。不少资深用户反馈,无论是Google的Gemini Pro还是OpenAI的GPT系列,近期在使用过程中均出现了明显的“降智”现象,表现为回答质量下降、逻辑能力变弱。用户质疑这是否源于...
随着大模型应用加速落地,AI Agent 技术已成为科技行业求职的新焦点。近日,有开发者在技术社区发帖求助,寻找关于 AI Agent 的“八股文”(系统化面试题库)。该用户指出,当前市面上关于 Agent 的学习资料多为零散的面经分享,缺...
有开发者在整理 NewAPI 渠道时意外发现,Anthropic 相关渠道新增了一个代号为“claude-jupiter-v1-p”的模型。经初步试用,该模型性能强悍,被外界猜测可能是尚未发布的 Claude Opus 4.7 版本。尽管目...
权威第三方评测机构 Artificial Analysis 最新更新的榜单显示,阿里云通义千问最新模型 Qwen3.6-Max-Preview 性能表现卓越。在激烈的竞争中,该模型超越了智谱 GLM5.1 和 MiniMax-M2.7 等强...
一位Claude Code高级订阅用户发现,SubAgent功能导致Token消耗异常,短时间内耗尽大额配额。通过分析用量日志,他发现SubAgent在跨项目逻辑同步时极其“吃资源”,即便强制使用廉价模型Haiku也无法有效缓解。最终,通过...
一位开发者在尝试利用AI进行长篇小说创作时发现,虽然初期章节剧情连贯,但随着篇幅增加,AI频繁出现逻辑断裂和凭空捏造剧情的“幻觉”现象。这一痛点引发了关于大模型上下文窗口(Context Window)限制的热议。目前,单纯依赖增加上下文长...
随着大模型API中转服务市场的爆发,各平台纷纷通过赠送免费额度争夺用户。有技术极客提出一种低成本调用方案:通过搭建CLI代理服务聚合各家中转站的免费Key,并结合论坛监控工具实时获取新额度。该构想进一步探讨了实现自动注册、自动领取及自动配置...
随着AI需求激增,国内算力资源正面临紧缺现状。近期,智谱GLM、MiniMax、阿里百炼等多家主流大模型厂商纷纷实施“限购”或周额度限制,DeepSeek仅提供API,Kimi的额度也大幅缩水。与此同时,受身份验证加强影响,OpenAI及其...
一位AI开发者在技术论坛发帖吐槽了当前LLM Agent开发面临的低效困境。在优化Agent技能(Skill)时,开发者陷入了痛苦的反馈循环:每次微调Prompt后,都需要等待Agent运行20分钟至1小时才能看到结果,而有效的调整时间往往...