用户实测对比Grok:百度文心被指过度“美化”创始人,国产大模型价值观对齐再引争议
近日,有网友在科技社区分享了针对百度文心大模型的测试案例,并将其与Grok进行了对比。测试显示,在面对敏感评价类问题时,文心一言的回答表现出明显的“美化”倾向,例如将李彦宏描述为能在商业与社会责任间找到平衡的“优秀企业家”。该用户认为,这种...
标签索引 / 第 133 页
这个标签下有 2415 篇文章。按时间回看相关判断与实践记录。
标签精选
近日,有网友在科技社区分享了针对百度文心大模型的测试案例,并将其与Grok进行了对比。测试显示,在面对敏感评价类问题时,文心一言的回答表现出明显的“美化”倾向,例如将李彦宏描述为能在商业与社会责任间找到平衡的“优秀企业家”。该用户认为,这种...
一位个人开发者推出了浏览器扩展Agent S6的Beta版,旨在成为Claude for Chrome和Gemini auto browse的开源替代方案。该工具支持自定义API Key(BYOK)和多模型提供商,强调纯前端运行的隐私安全性...
近日,有科技爱好者通过对比测试发现,Gemini可能正在灰度推送其新版本模型(暂称3.1)。测试针对一张旧版模型极易出错的“视觉陷阱”图片,在旧版中,模型常因视觉幻觉将光头人物误认为微软CEO纳德拉,导致无法完全答对。然而,在连续5次的新模...
近日,有开发者发布了一款针对Ollama未授权访问漏洞的网关脚本,声称内置了约2000个海外无鉴权的Ollama服务节点。该工具允许用户通过网关直接调用这些暴露在公网的本地模型资源进行对话。Ollama作为当下热门的本地大模型运行框架,若配...
近日,有科技爱好者在 V2EX 分享了对主流大模型的使用体验,引发了关于 AI 模型“人设”的讨论。该用户指出,ChatGPT 在处理价值判断和社会科学问题时,过于追求中立和道德正确,甚至输出说教式的“废话”,令人反感;Grok 则显得刻意...
AI初创公司StepFun发布了最新大模型Step 3.5 Flash,主打“快到能思考,可靠到能行动”。该模型采用混合专家(MoE)架构,拥有1960亿总参数,但推理时每个Token仅激活110亿参数,显著提升了效率。性能方面,该模型在多...
本文记录了软件工程大师Martin Fowler在Thoughtworks技术研讨会上的深度复盘,揭示了当前行业对AI辅助开发的普遍焦虑与不确定性。核心观点指出,AI在软件开发中本质上是现状的“放大镜”:虽然能提升个体编码速度,但如果缺乏传...
一位开发者受“Claude引号鉴别法”启发,针对DeepSeek、Claude、Kimi、豆包、通义千问等主流大模型进行了特殊的Unicode字符集测试。结果显示,尽管部分模型(如DeepSeek、Kimi官方版)表现完美,但Claude、...
Anthropic 昨天发布了 Claude Sonnet 4.6,这是一次重要的模型升级。新版本在保持原有价格不变的情况下,性能大幅提升,几乎达到了 Opus 级别的智能水平。 核心亮点 价格不变,性能飞跃 Claude Sonnet 4...
本文源自Hacker News对“最快前端工具链”的讨论,重点聚焦于开发规范与工具速度对AI辅助编程的影响。开发者发现,严格的Lint配置(代码检查)不仅能捕捉错误,更能为大语言模型(LLM)提供清晰的上下文,从而使其生成更优质的代码。然而...