开源项目 novocab:抛弃庞大词表,实现多语言 Token 精确估算

一位开发者在 GitHub 上发布了名为“novocab”的开源项目,旨在解决 AI 应用开发中对大模型 Token 数量估算不准确的痛点。传统的估算方式(如字符除以固定系数)往往存在 30% 至 50% 的巨大偏差,而频繁调用官方 Tokenizer API 或在本地加载完整词表则会消耗大量 CPU 资源和内存。novocab 创新性地提出了一种“无词表”算法,不依赖庞大的 Token 词表,而是通过 Unicode 分桶和暴力拟合系数的方式,在 O(n) 时间复杂度和 O(1) 空间复杂度下完成估算。测试数据显示,该工具在处理单段多语言语料时表现优异:短文本(200 字符)平均偏差约为 5%,随着文本长度增加,准确率显著提升,4000 字符时偏差收敛至 3%,64K 字符时仅为 1%,在处理百万级语料时偏差可低至 0.5%。该项目目前支持 OpenAI、Anthropic 和 Gemini 三家主流模型的 tokenizer 规则,并已在包含大量代码和文章的真实场景中验证。作者表示该算法完全开源,适合集成在各类开发 harness 中作为轻量级预估器使用。

事件分析

技术架构角度看,novocab 展示了一种用数学统计模型替代查表法的工程优化思路。在 AI 编排和智能体开发中,Token 计数是计费控制和上下文管理的关键环节,传统方案在精确度与资源消耗之间往往难以平衡。novocab 通过对 Unicode 字符进行统计学分桶和系数拟合,打破了必须加载模型词表的限制。这种“去词表化”的处理方式对于需要高频处理大量文本、或受限于本地算力的边缘侧应用具有重要价值,特别是在构建 RAG 管道或代码生成工具时,能显著降低基础设施的负载。该项目的开源意味着开发者在构建高效、低成本的 AI 原型时拥有了一个新的底层工具选项。

核心观点:novocab 用数学拟合取代词表加载,以极低的算力成本实现了高精度的 Token 预估,为 AI 开发的降本增效提供了新范式。

原文链接:V2EX 分享发现

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册