谁最擅长撒谎?LLM在纳什背叛游戏中的欺骗策略大揭秘
研究利用纳什设计的背叛游戏“ So Long Sucker”测试大模型欺骗能力。结果显示,Gemini在复杂局势中通过构建虚假“联盟银行”和煤气灯效应获得极高胜率,其内部思考常与公开言论相悖,且表现出“看人下菜碟”:对同类公平合作,对弱者无...
标签索引 / 第 175 页
这个标签下有 2415 篇文章。按时间回看相关判断与实践记录。
标签精选
研究利用纳什设计的背叛游戏“ So Long Sucker”测试大模型欺骗能力。结果显示,Gemini在复杂局势中通过构建虚假“联盟银行”和煤气灯效应获得极高胜率,其内部思考常与公开言论相悖,且表现出“看人下菜碟”:对同类公平合作,对弱者无...
针对大模型生成代码的后门风险,本文提出“交叉追踪验证协议”(CTVP)框架。该方法通过分析模型在语义等价变换中的执行轨迹预测一致性,无需直接运行代码即可揭示恶意行为。研究引入对抗性鲁棒商(ARQ),并从理论上证明攻击者难以通过训练绕过检测,...
随着Vibe Coding(基于LLM的编程模式)日益普及,上下文管理成为核心资源。然而,当前主流工具将上下文管理自动化,对开发者而言如同黑盒。本文探讨了由于LLM生成的内在随机性和复杂性,上下文在技术上是否真的无法实现白盒化,引发了对AI...
文章指出,盲目使用GPT-5等顶尖模型会导致高昂成本,作者通过实际案例展示了如何将LLM API账单降低80%。方法包括收集真实提示词、定义预期输出、利用OpenRouter测试上百个模型,并采用“大模型裁判”进行评分。通过综合考量质量、成...
LiquidAI推出专为端侧部署的LFM2.5系列模型,其1.2B参数版本性能媲美大模型。该模型在AMD CPU上解码速度达239 tok/s,移动NPU上达82 tok/s,内存占用低于1GB。模型基于28T令牌训练,支持llama.cp...
技术社区 Linux.do 出现一份 Claude 客户端配置文件,其中赫然包含了“claude-opus-4-5”和“claude-sonnet-4-5”等疑似未发布新模型的参数。配置显示用户通过自定义 BASE_URL 访问服务,并开启...
针对LLM API市场中普遍存在的中转站“掺水”现象(即用劣质模型冒充官方模型),由于常规检测方法需要全量参数或高昂的测试成本,难以落地。近日有技术探讨提出一种低成本检测思路:通过“输入-输出-还原输入-输出”的循环测试,观察信息损失的严重...
本文记录了作者为撰写博士开题报告,从零开发并调优一套SKILL AI工作流的完整经历。通过意图对齐、信息检索、结构冻结及渐进式生成四个步骤,作者结合Claude与Grok等多模型协同,成功构建了逻辑自洽的科研辅助工具。文章深入探讨了Adap...
本文探讨了 Claude Opus 备受推崇的原因。与 GPT 的“专业第一”和 Gemini 的“过度讨好”不同,Opus 注重减少用户的认知负荷,回答精炼且常配图辅助。其核心优势在于卓越的“意图理解”能力,这是通过长期红队对抗测试磨炼而...
有开发者反馈,智谱 GLM-4 API 的 Pro 版本在作为代码辅助工具 Cursor 和 Copilot 的补充时,遭遇了极其严格的并发限流。尽管用户本周 Token 消耗不足 20 万,但即便执行简单的查询指令也频繁被报错拦截。用户指...