谷歌创新神经记忆模块,突破大模型长序列瓶颈

谷歌研究人员推出神经长期记忆模块(titan),针对Transformer架构在长序列处理中的注意力稀释、性能下降和显存依赖问题。该模块作为深层神经网络,在运行时动态更新权重,通过“惊奇度”机制选择性记忆信息,类似人脑功能。谷歌设计了三种集成方式:MAC将记忆输出作为额外上下文令牌,提升长程召回能力;MAG引入非线性门控机制;MAL将记忆模块直接作为网络层。实验证明,该技术大幅优化“大海捞针”测试结果,有望推动大语言模型在长文本处理、知识库检索等前沿应用场景的突破。尽管Gemini当前1m上下文已够用,但10m扩展潜力巨大,为AI行业带来新机遇。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册