IT资源栈互联网海量AI资源栈

AI 编码 · 烧 token 实录
活跃记录 · code80.ai 聚合多模型
$3.2k
花费
3.1B
tokens
29,806
messages
41
连续
code80.ai
Positional Encoding 怎么解决词序问题-IT资源栈

Positional Encoding 怎么解决词序问题

Transformer 刚出来时,很多人把注意力都放在 self-attention 上。那当然没错,因为它确实重新定义了模型怎么看上下文。但如果只盯着 attention,你会漏掉另一个同样关键的问题:模型怎么知道词序? 这是我看完这期视频后最强烈的感受。Transformer 的突破,不只是让每个词都能看见别的词,

Self-Attention 为什么成了 Transformer 的核心机制-IT资源栈

Self-Attention 为什么成了 Transformer 的核心机制

软件模型有过一个很长的阶段:它们能读句子,却不太会“理解句子”。问题不在词表,也不完全在参数规模,而在于早期模型看待语言的方式太像流水线——前一个词处理完,才能轮到后一个词。这样一来,句子一长,前面的信息就会慢慢变模糊。 这就是我看完这期视频后最想记住的一点:Transformer 真正改变局面的地方,不是简单把模型做

赞(0)易安易安架构 阅读()