FinePDFs:3TB数据库赋能AI训练,覆盖4.75亿PDF文档
FinePDFs是一个专注于PDF文档的数据集项目,爬取了2013至2025年间的PDF文件,经过数据清洗与标记后,构建了一个包含1733种语言、规模达4.75亿文档的数据库。团队发现当前AI模型训练内容中PDF文档占比仅0.6%,但大量技...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
FinePDFs是一个专注于PDF文档的数据集项目,爬取了2013至2025年间的PDF文件,经过数据清洗与标记后,构建了一个包含1733种语言、规模达4.75亿文档的数据库。团队发现当前AI模型训练内容中PDF文档占比仅0.6%,但大量技...