跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 11 页

大模型

这个标签下有 2410 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

深入解析GGUF:不仅是权重,本地大模型标准化还缺什么?

GGUF格式因将模型权重、词表、聊天模板及采样参数封装于“单文件”中,已成为本地大模型部署的首选标准,极大优化了开发体验。文章详细解读了GGUF如何利用Jinja2模板处理复杂对话逻辑,并支持自定义采样链以提升生成质量。然而,作者指出了该格...

1 分钟阅读65 阅读
架构设计

从静态 benchmark 到活的 eval:Vincent Koc 这场分享,真正戳中的不是评测,而是 agent 软件的变形速度

很多人现在一提 eval,脑子里冒出来的还是老三样:题库、benchmark、离线跑分、回归测试。这个思路在过去不是错的。问题是,今天的 agent 系统已经越来越不像“一个发布后基本不动的程序”了。它会接工具、会吃上下文、会随着用户习惯漂...

14 分钟阅读58 阅读
前沿哨所

开发者厌倦GPT代码过度工程化,尝试转用DeepSeek V4

一位开发者在社区反馈,长期使用 OpenAI 的 Codex 编写代码,发现其生成的代码风格往往存在“过度工程化”的问题,函数嵌套层级过深,即使通过提示词限制也难以改善。为了优化代码质量,该开发者计划借鉴 Cursor 的编排思路(CCG)...

1 分钟阅读104 阅读
前沿哨所

揭秘 AI 模型的“暗中削弱”:一张图看懂大模型性能退化史

随着大模型频繁更新,用户常怀疑模型变“笨”或受到更多限制。该项目通过可视化图表记录了各大 AI 模型的 ELO 评分历史,旨在揭露潜在的“暗中削弱”现象。文章指出,模型更新可能引入过度审查、过度量化以节省算力或行为退化。此外,项目还区分了 ...

1 分钟阅读56 阅读
前沿哨所

企业LLM监控引发争议:当AI助手变成职场“数字监工”

近日,有社区用户爆料,其公司通过监控“llm-proxy”代理服务,实现了对员工AI交互记录的实时抓取。该系统能够详细记录每一条Prompt指令、生成的代码量以及具体的操作时间段。这种“全景式”的监控手段被批评为“数字监工”,引发了职场人对...

1 分钟阅读60 阅读