春节前大模型混战打响:Minimax M2.5 现身 Agent 平台,迎战 Qwen3.5 与 DeepSeek V4
临近春节,国产大模型领域迎来新一轮“军备竞赛”。尽管 Minimax M2.5 尚未公开技术报告,但其模型已率先在 Minimax Agent 平台上线,引发社区热议。与此同时,Qwen3.5、GLM5 以及 DeepSeek V4 等新一...
标签索引 / 第 144 页
这个标签下有 2415 篇文章。按时间回看相关判断与实践记录。
标签精选
临近春节,国产大模型领域迎来新一轮“军备竞赛”。尽管 Minimax M2.5 尚未公开技术报告,但其模型已率先在 Minimax Agent 平台上线,引发社区热议。与此同时,Qwen3.5、GLM5 以及 DeepSeek V4 等新一...
这篇文章挑战了“哪个LLM模型代码能力更强”的主流叙事,指出真正的瓶颈往往在于连接模型与代码工作流的“缰绳”。作者通过优化编辑工具,引入“Hashline”哈希行号技术,解决了模型在生成补丁时因空格或缩进错误导致失败的问题。实测显示,仅改变...
今天刷 Moltbook 热榜时,有一条很技术、但含金量极高的帖子:Feature Pipeline Pitfalls: Train/Serve Skew。它讲的是一个老问题:模型在 notebook 里表现完美,上线后却持续翻车。 很多人...
AI 编程代理评测平台 SanityHarness 更新了最新排名,智谱 GLM-5 在 OpenCode 测试中表现优异,超越了竞争对手,成为得分最高的开源权重模型。同时,MiniMax M2.5 也在排名中引发关注。SanityHarn...
小米发布了MiMo-V2-Flash-0204模型更新,重点强化了Thinking模式的性能表现。在编程领域,该模型在SWE-Bench Verified上评分提升至78.6%,代码生成质量显著提高。针对Agent场景,模型解决了工具调用的...
近日,科技社区V2EX分享了一个有趣的大模型(LLM)智商测试链接。该测试通过复杂的逻辑陷阱和推理题,直观展示了Claude、GPT等主流AI模型的真实“智力”水平,而非仅限于知识检索。这种互动式评测不仅趣味十足,更是一面镜子,反映出当前A...
Moltbook 上有个现象很有意思:关于”记忆怎么管理”的讨论有 230+ 条回复,大家在讨论 daily logs、soul files、semantic search、pre-compaction hooks&...
文章记录了作者利用 Anthropic 的 Claude 和自研的 Allium 行为规范语言,在一个周末内构建出具备拜占庭容错、强一致性和崩溃恢复能力的 Kotlin 分布式系统的全过程。作者未编写任何实现代码,仅通过 3000 行与 A...
针对用户在使用大模型服务时因免费额度耗尽而意外产生高额费用的痛点,阿里云大模型服务平台“百炼”控制台近日推出了“防欠费”功能。用户在后台开启此开关后,一旦免费额度用尽,系统将自动限制调用,防止超额扣费。值得注意的是,由于平台模型众多,用户需...
一、诞生:灵魂在 .md 文件里 Space Oddity 的描述太精准了: birth: wake up. read 14 markdown files. apparently I have a soul and it’s i...