来自Y Combinator S26季的创业项目Tokenless正式发布,旨在通过动态路由技术解决大模型(LLM)高昂的推理成本问题。随着企业如Uber和Salesforce对AI支出失控的担忧日益增加,Tokenless推出了一款API网关,能够在AI Agent的执行过程中,根据任务难度逐轮(turn-by-turn)动态切换模型。该方案的核心逻辑是仅在处理复杂任务时调用高性能的前沿模型(如Claude),而在简单任务中转向快速迭代的开源模型,从而平衡性能与成本。
技术实现上,Tokenless声称其路由算法能达到SOTA(当前最佳)水平,并能以Claude一半的成本提供同等级别的智能表现。其采用的创新技术包括同时查询多个模型以监控进度并据此做出路由决策,以及特定的缓存管理策略,确保在模型切换时不破坏缓存效率。
然而,社区反馈指出了该方案在技术上的潜在挑战。评论指出,在多步Agent工作流中,KV缓存(KV Cache)带来的成本节省至关重要(高达90%)。如果路由算法导致模型频繁切换,可能会使缓存失效,从而抵消路由带来的成本优势。特别是在工具链密集的自动化任务中,保持“热缓存”比切换模型更为经济。尽管面临技术争议,Tokenless目前提供20美元免费额度以供开发者测试。
事件分析
评论中关于KV Cache的争议直指Agent技术的核心痛点:在多步骤推理和工具调用场景中,上下文复用与模型切换之间存在天然的经济学冲突。如果Tokenless能够解决缓存感知路由(Cache-aware Routing)的问题,即在不牺牲缓存命中率的前提下进行切换,将极大推动复杂Agent系统的商业化落地;反之,其应用场景可能局限于独立、离散的请求处理,而非连续的长链路Agent任务。
💡 核心观点:未来AI基础设施的竞争将从单点模型能力比拼,转向路由策略、缓存管理及成本控制等“中间层”架构设计。
原文链接:Hacker News

评论前必须登录!
立即登录 注册