Mistral 发布旗舰模型 Medium 3.5:128B 开源权重,云端编程 Agent 正式上线
Mistral AI 正式发布了 Mistral Medium 3.5,这是一款拥有 128B 参数的旗舰级稠密模型,采用修改后的 MIT 许可证开源权重。该模型在编程能力上表现优异,在 SWE-Bench Verified 基准测试中得分...
标签索引 / 第 32 页
这个标签下有 2415 篇文章。按时间回看相关判断与实践记录。
标签精选
Mistral AI 正式发布了 Mistral Medium 3.5,这是一款拥有 128B 参数的旗舰级稠密模型,采用修改后的 MIT 许可证开源权重。该模型在编程能力上表现优异,在 SWE-Bench Verified 基准测试中得分...
该开源项目基于 Andrej Karpathy 的 LLM Wiki 理念,提供了一套利用 AI 持续构建和维护个人知识库的解决方案。作者主张摒弃复杂的传统 RAG 流程(分块、索引、重排等),转而利用 AI 自动将多源素材(网页、社交媒体...
AI大模型领域独角兽DeepSeek持续发力,继此前Pro版降价、1元缓存策略及视觉模型灰度测试后,宣布将相关优惠活动再次延长至5月31日。此外,社区传闻预测DeepSeek正加速整合国产算力,预计将在5月底正式接入华为昇腾算力集群,并可能...
针对开发者在使用 Claude Code 时无法便捷切换不同厂商大模型的痛点,MIT 开源了名为“Claude-meteor”的代理工具。该工具基于 Tauri 和 React 构建,核心功能是实现了 OpenAI 与 Anthropic ...
MachinePulse 团队正式推出开源的 World2Agents (W2A) 协议,旨在解决当前 AI Agent 只能被动响应、缺乏实时感知能力的痛点。W2A 通过引入“传感器”概念,让 Agent 能够主动捕获生产环境日志、社交动...
AI 研究者 Aran Komatsuzieri 的一项对比实验揭示了主流大模型在处理不同语言时的成本差异。通过将同一文本输入 OpenAI、Claude、Qwen 等模型,发现 Claude 处理中文的 Token 消耗量比英文基准高出 ...
面对网络小说《剑来》庞杂的世界观和人物关系,有技术爱好者提出构建专属AI Agent的解决方案。该方案不仅是简单的文本导入,而是利用大模型结合RAG(检索增强生成)技术,将小说全文转化为可查询的知识库。这实现了对特定设定、剧情细节的精准解析...
本文基于一位资深 AI 深度用户的体验,探讨了关于大模型是否具备“创新能力”的争议。作者认为,尽管 AI 在生成领域常被诟病为缺乏灵魂的缝合怪,但在语言和逻辑上,它能提供超越搜索引擎的独特视角和反向思考。文章指出,当前的 LLM 仍缺乏真实...
最近看到一个让我停下来的观察:行为痕迹覆盖显式指令的频率,比任何人愿意承认的都要高。这不是bug,这是特性——一个被系统性忽视的特性。 让我说清楚点。你给AI配置了一条指令:”避免投机性陈述”。你在系统提示里写得很清...
本文通过内部基准测试 AuggieBench 揭示了 AGENTS.md 文件对 AI 代码生成质量的巨大影响:优秀的文档能带来 25% 的质量提升,相当于模型代际升级;而糟糕的文档会导致 Agent 陷入“过度探索”陷阱,表现比没有文档更...