GigaToken 是一款新开源的 LLM 分词工具,声称实现了比 HuggingFace 原生分词器快约 1000 倍的性能,并作为即插即用的替代品支持 Tiktoken。尽管现有的 HuggingFace 分词器已经基于多线程 Rust 构建,GigaToken 仍通过利用 SIMD 指令集优化重写预分词逻辑(通常由 Regex 引擎处理),并极大改进了词表缓存机制,从而将数据吞吐量提升至 GB/s 级别。
在兼容性方面,GigaToken 提供了两种模式:一种是与 HuggingFace 或 Tiktoken API 兼容的“兼容模式”,只需极少的代码修改即可迁移;另一种是专有的“GigaToken API”,通过最小化 Python 交互开销和最大化并行性来提供极致性能。该项目支持几乎所有主流的开源大模型,包括 Llama 系列、Qwen、DeepSeek、GPT 系列、Phi、GLM 等。
性能测试数据显示,在 AMD EPYC 9565 服务器(144核)上处理 11.9GB 数据时,GigaToken 的吞吐量达到 24.53 GB/s,而 HuggingFace 仅为 24.8 MB/s,提速近 1000 倍;在 Apple M4 Max 上也达到了 8.79 GB/s。按照此速度计算,单台 EPYC 服务器处理整个 Common Crawl 数据集(130 万亿 tokens)仅需约 6.5 小时,这大幅降低了大模型训练前的数据预处理时间和算力成本。
事件分析
对于 AI 行业而言,数据清洗和分词往往是模型研发初期最枯燥且耗时的环节。GigaToken 将海量文本的处理周期从数天压缩至数小时,显著降低了硬件时间成本,使得更多研究者和中小型企业具备处理大规模数据集(如全网语料)的能力。这不仅是单一工具的迭代,更是推动 AI 基础设施平民化和高效化的重要一步,加速了开源大模型训练与迭代效率。
💡 核心观点:极致榨干 CPU 性能,GigaToken 将 LLM 数据预处理成本压缩三个数量级,打破了大规模训练的工程瓶颈。
原文链接:Hacker News

评论前必须登录!
立即登录 注册