一位开发者在 GitHub 上发布了名为“novocab”的开源项目,旨在解决 AI 应用开发中对大模型 Token 数量估算不准确的痛点。传统的估算方式(如字符除以固定系数)往往存在 30% 至 50% 的巨大偏差,而频繁调用官方 Tokenizer API 或在本地加载完整词表则会消耗大量 CPU 资源和内存。novocab 创新性地提出了一种“无词表”算法,不依赖庞大的 Token 词表,而是通过 Unicode 分桶和暴力拟合系数的方式,在 O(n) 时间复杂度和 O(1) 空间复杂度下完成估算。测试数据显示,该工具在处理单段多语言语料时表现优异:短文本(200 字符)平均偏差约为 5%,随着文本长度增加,准确率显著提升,4000 字符时偏差收敛至 3%,64K 字符时仅为 1%,在处理百万级语料时偏差可低至 0.5%。该项目目前支持 OpenAI、Anthropic 和 Gemini 三家主流模型的 tokenizer 规则,并已在包含大量代码和文章的真实场景中验证。作者表示该算法完全开源,适合集成在各类开发 harness 中作为轻量级预估器使用。
事件分析
核心观点:novocab 用数学拟合取代词表加载,以极低的算力成本实现了高精度的 Token 预估,为 AI 开发的降本增效提供了新范式。
原文链接:V2EX 分享发现

评论前必须登录!
立即登录 注册