云聚 AI Token Plan 满 199 减 35 元
port:80 AI Junkie
AI 重度玩家的工程笔记本
DigitalOcean 开发者云

GigaToken:狂飙 1000 倍速度,用 Rust 极致优化 LLM 数据预处理

云聚 AI Token Plan 满 199 减 35 元

GigaToken 是一款新开源的 LLM 分词工具,声称实现了比 HuggingFace 原生分词器快约 1000 倍的性能,并作为即插即用的替代品支持 Tiktoken。尽管现有的 HuggingFace 分词器已经基于多线程 Rust 构建,GigaToken 仍通过利用 SIMD 指令集优化重写预分词逻辑(通常由 Regex 引擎处理),并极大改进了词表缓存机制,从而将数据吞吐量提升至 GB/s 级别。

在兼容性方面,GigaToken 提供了两种模式:一种是与 HuggingFace 或 Tiktoken API 兼容的“兼容模式”,只需极少的代码修改即可迁移;另一种是专有的“GigaToken API”,通过最小化 Python 交互开销和最大化并行性来提供极致性能。该项目支持几乎所有主流的开源大模型,包括 Llama 系列、Qwen、DeepSeek、GPT 系列、Phi、GLM 等。

阿里云 OPC 一人公司创业装备库

性能测试数据显示,在 AMD EPYC 9565 服务器(144核)上处理 11.9GB 数据时,GigaToken 的吞吐量达到 24.53 GB/s,而 HuggingFace 仅为 24.8 MB/s,提速近 1000 倍;在 Apple M4 Max 上也达到了 8.79 GB/s。按照此速度计算,单台 EPYC 服务器处理整个 Common Crawl 数据集(130 万亿 tokens)仅需约 6.5 小时,这大幅降低了大模型训练前的数据预处理时间和算力成本。

事件分析

从技术层面看,GigaToken 的核心价值在于“底层算力榨干”。它证明了即便是在已高度优化的 Rust 基础设施之上,针对现代 CPU 的 SIMD 指令(AVX-512/NEON)进行精细化重构仍能带来数量级的性能飞跃。它将通常被 Regex 引擎接管的预分词过程和缓存机制进行了底层重写,解决了 AI 训练流程中容易被忽视但极其耗时的“IO bound”瓶颈。

对于 AI 行业而言,数据清洗和分词往往是模型研发初期最枯燥且耗时的环节。GigaToken 将海量文本的处理周期从数天压缩至数小时,显著降低了硬件时间成本,使得更多研究者和中小型企业具备处理大规模数据集(如全网语料)的能力。这不仅是单一工具的迭代,更是推动 AI 基础设施平民化和高效化的重要一步,加速了开源大模型训练与迭代效率。

💡 核心观点:极致榨干 CPU 性能,GigaToken 将 LLM 数据预处理成本压缩三个数量级,打破了大规模训练的工程瓶颈。

原文链接:Hacker News

阿里云函数计算 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » GigaToken:狂飙 1000 倍速度,用 Rust 极致优化 LLM 数据预处理
赞助推荐 FoxCode Claude Code 稳定中转
阿里云函数计算 一键部署 AI 大模型

GLM Claude Code · 国产平替不封号

官方 Claude Code 又涨价又要 KYC,封号还得重配环境?智谱 GLM 兼容 Claude Code,稳定不封号、价格友好,注册后把现有 Claude Code 工作流直接切过来继续用。

立即体验 GLM查看套餐价格