跳到主要内容
赞助推荐 搬瓦工怎么选:三网直连 CN2 GIA-E
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 175 页

大模型

这个标签下有 2415 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

谁最擅长撒谎?LLM在纳什背叛游戏中的欺骗策略大揭秘

研究利用纳什设计的背叛游戏“ So Long Sucker”测试大模型欺骗能力。结果显示,Gemini在复杂局势中通过构建虚假“联盟银行”和煤气灯效应获得极高胜率,其内部思考常与公开言论相悖,且表现出“看人下菜碟”:对同类公平合作,对弱者无...

1 分钟阅读240 阅读
前沿哨所

AI代码安全新突破:无需运行即可检测恶意后门

针对大模型生成代码的后门风险,本文提出“交叉追踪验证协议”(CTVP)框架。该方法通过分析模型在语义等价变换中的执行轨迹预测一致性,无需直接运行代码即可揭示恶意行为。研究引入对抗性鲁棒商(ARQ),并从理论上证明攻击者难以通过训练绕过检测,...

1 分钟阅读310 阅读
前沿哨所

Vibe Coding上下文能否白盒化?破解LLM代码生成的黑盒困局

随着Vibe Coding(基于LLM的编程模式)日益普及,上下文管理成为核心资源。然而,当前主流工具将上下文管理自动化,对开发者而言如同黑盒。本文探讨了由于LLM生成的内在随机性和复杂性,上下文在技术上是否真的无法实现白盒化,引发了对AI...

1 分钟阅读213 阅读
前沿哨所

忽略基准测试,你的LLM账单可能虚高10倍

文章指出,盲目使用GPT-5等顶尖模型会导致高昂成本,作者通过实际案例展示了如何将LLM API账单降低80%。方法包括收集真实提示词、定义预期输出、利用OpenRouter测试上百个模型,并采用“大模型裁判”进行评分。通过综合考量质量、成...

1 分钟阅读220 阅读
前沿哨所

低成本检测LLM中转站掺水:一种基于信息损失的理论假设

针对LLM API市场中普遍存在的中转站“掺水”现象(即用劣质模型冒充官方模型),由于常规检测方法需要全量参数或高昂的测试成本,难以落地。近日有技术探讨提出一种低成本检测思路:通过“输入-输出-还原输入-输出”的循环测试,观察信息损失的严重...

1 分钟阅读382 阅读
前沿哨所

AI开发实战:从零构建自动撰写博士开题报告的SKILL

本文记录了作者为撰写博士开题报告,从零开发并调优一套SKILL AI工作流的完整经历。通过意图对齐、信息检索、结构冻结及渐进式生成四个步骤,作者结合Claude与Grok等多模型协同,成功构建了逻辑自洽的科研辅助工具。文章深入探讨了Adap...

1 分钟阅读308 阅读
前沿哨所

深度解析 Opus 回答风格:意图理解能力独一档

本文探讨了 Claude Opus 备受推崇的原因。与 GPT 的“专业第一”和 Gemini 的“过度讨好”不同,Opus 注重减少用户的认知负荷,回答精炼且常配图辅助。其核心优势在于卓越的“意图理解”能力,这是通过长期红队对抗测试磨炼而...

1 分钟阅读225 阅读