FinePDFs是一个专注于PDF文档的数据集项目,爬取了2013至2025年间的PDF文件,经过数据清洗与标记后,构建了一个包含1733种语言、规模达4.75亿文档的数据库。团队发现当前AI模型训练内容中PDF文档占比仅0.6%,但大量技术文档和理论文件以PDF格式存在,因此该项目旨在填补这一空白。该数据集对AI模型训练有重要帮助,相关技术说明和数据库可在Hugging Face平台访问。
FinePDFs:3TB数据库赋能AI训练,覆盖4.75亿PDF文档
未经允许不得转载:80aj » FinePDFs:3TB数据库赋能AI训练,覆盖4.75亿PDF文档
相关推荐
Hugging Face 背书的 Reachy Mini 机器人引热议:具身智能的“平价”尝试仍显昂贵
消费级显卡的逆袭:开源框架 RoundPipe 突破 PCIe 瓶颈,4090 多卡训练提速 25 倍
你的价值观也是被训练出来的,只是你不知道
100% 全栈开源:Seeed 发布 reBot 机械臂,全面适配英伟达与 Hugging Face 生态
“打脸”现场?Anthropic承认Claude使用了“其他模型”生成的合成数据
MiniMax M2.7 正式开源:迟到的大模型终于上线,Hugging Face现已上线
LLM开发痛点:国内如何解决Hugging Face上xetHub的下载加速难题?
GitHub 新规默认开启 Copilot 数据用于 AI 训练,开发者需手动退出