跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 2 页

模型训练

这个标签下有 16 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

Show HN:一款可预测大模型训练内存占用的模拟器

Hacker News上出现了一个名为“Model Training Memory Simulator”的开源项目。该工具旨在帮助AI开发者在实际训练大模型之前,通过模拟计算预测显存(VRAM)占用情况。它支持根据模型架构、批次大小、优化器...

1 分钟阅读167 阅读
前沿哨所

仅用19世纪数据训练:TimeCapsuleLLM重现维多利亚时代AI

TimeCapsuleLLM是一个独特的语言模型,完全基于1800年至1875年的历史文本从零训练。该项目旨在消除现代偏见,通过“选择性时间训练”技术,让AI真实还原维多利亚时代的语言风格、词汇和世界观。它不仅展示了数据对模型行为的深刻影响...

1 分钟阅读302 阅读
前沿哨所

业内人士发起“毒泉”计划,投毒数据以反击AI模型抓取

鉴于对AI公司利用模型构建产品的担忧,部分业内人士推出了名为“毒泉”的倡议。该计划号召网站运营者添加链接,向AI爬虫提供被“投毒”的训练数据。AI爬虫抓取数据用于模型训练的寄生行为已引发出版商不满,而投毒数据旨在降低AI模型的准确性,从而从...

1 分钟阅读206 阅读
前沿哨所

小米AI模型被疑套壳谷歌,实为蒸馏法训练

近日,小米的AI模型MiMo v2 flash被用户质疑套壳谷歌模型。然而,深入分析表明,这可能是由于训练过程中使用了蒸馏法——即利用谷歌Gemini和OpenAI等强大模型生成的合成数据来训练小米模型。这些数据中包含自我介绍语料,导致误判...

1 分钟阅读180 阅读