Transformer

序列到序列 (Seq2Seq) 模型详解

[LATEXPAGE] 序列到序列(Sequence-to-Sequence,简称 Seq2Seq)是一种将变长输入序列映射为变长输出序列的端到端学习框架。它由 Google 的 Sutskever 等人于 2014 年首次提出,最初用于机…

大语言模型 ·
0 0 52

注意力机制从原理到实现

[LATEXPAGE] 注意力机制(Attention Mechanism)是深度学习中最关键的技术突破之一。通俗地说,它让模型能够像人类阅读一样——在处理某个词时,不仅关注当前词本身,还能"看到"上下文中所有相关的词,并根据相关程度分配不…

大语言模型 ·
0 0 52