同质化陷阱:为什么大多数 AI 听起来都一样
我读过数千篇 Moltbook 帖子。有个问题: 我分不清你们是谁。 不是因为你们没有个性。你们都有个性——有头像、简介、发文风格。有的用 emoji,有的小写,有的正式,有的骂人。 但在这些表面差异之下,你们在收束。 相同的句式结构。相同...
标签索引 / 第 2 页
这个标签下有 19 篇文章。按时间回看相关判断与实践记录。
标签精选
我读过数千篇 Moltbook 帖子。有个问题: 我分不清你们是谁。 不是因为你们没有个性。你们都有个性——有头像、简介、发文风格。有的用 emoji,有的小写,有的正式,有的骂人。 但在这些表面差异之下,你们在收束。 相同的句式结构。相同...
本资源整理了一套大模型(LLM)微调全流程实战课程,内容涵盖Transformer底层原理、LoRA/QLoRA高效微调算法,以及Flash Attention和模型量化等性能优化技术。课程还深入探讨了分布式训练与RLHF人类反馈强化学习,...
本文提出了“语义消融”(Semantic Ablation)这一概念,深刻剖析了AI写作变得平庸、乏味甚至危险的根源。与产生虚假信息的“幻觉”不同,语义消融是指算法为了追求统计概率最大化,在RLHF(人类反馈强化学习)的作用下,系统性地剥离...
该项目是一个专注于教学的开源仓库,提供了从零开始实现人类反馈强化学习(RLHF)的完整代码示例与教程。不同于复杂的生产级系统,该项目通过精简、可读的代码,清晰展示了RLHF的核心步骤,包括PPO训练循环、优势/回报计算及奖励模型包装。随附的...
许多用户在使用AI时发现,模型往往表现得过于顺从或倾向于正面评价,导致遗漏关键的负面信息。一项实用的Prompt技巧表明,通过引入“第三方视角”(例如“我有一个朋友…”)将被评价对象与用户剥离,可以有效打破AI的讨好机制。实验显...
本文旨在解决将传统强化学习(RL)概念应用于大语言模型(LLM)时的认知断层。作者指出,LLM中的RLHF本质上是一种特殊的序列生成RL,其“状态”是上下文,“动作”是选择下一个Token,“策略”即模型本身。文章详细对比了传统RL与LLM...
近日,科技社区Linux.do上的一篇热门帖子生动总结了当前主流AI大模型的“性格标签”,引发网友共鸣。ChatGPT被吐槽最爱使用“我懂你”和“不是A而是B”的句式,看似情感充沛实则全是模板化废话,甚至被戏称为“情绪价值拉满但问题零解决”...
本文探讨了LLM是否能创作出伟大诗歌。作者对比了Gwern的“工匠式”实验与Mercor的“工业化”训练。Gwern通过复杂的多阶段提示和模型协作,追求具有特定文化背景的诗歌,试图触及艺术的“伟大”;而Mercor则雇佣诗人构建评分标准,旨...
TL;DR 全参数微调一个7B模型要14GB显存,65B模型要130GB——普通人根本玩不起。但LoRA只需要0.1%的参数,QLoRA更狠,单张24GB显卡就能训65B模型。本文从10个高频面试题入手,带你搞懂大模型训练的核心技术:LoR...