标签: LLM
所有包含此标签的文章 "LLM".
Transformer:注意力革命十年回顾与2026年生态全景
Transformer 自2017年《Attention is All You Need》提出以来,彻底改变了序列建模范式。它完全抛弃递归结构,依赖自注意力机制实现全局并行计算,成为现代大语言模型(LLM)、视觉基础模型、多模态AI的统一架构。尽管2024–2026年涌现了Mamba、RWKV、xLSTM等高效后Transformer架构,经典Transformer(尤其是Decoder-only)在2026年仍主导绝大多数生产级模型。本文从核心原理到代码实现,再到当前进化趋势与替代方案,系统拆解Transformer。
深度理解 Softmax:从多分类到现代大模型的概率桥梁(2026 更新)
Softmax 函数是深度学习中最经典的“概率化”组件,将 Logits 转换为有效的概率分布。它不仅是多分类任务的标准输出层激活,更是 Transformer 自注意力机制的核心。尽管在2025–2026年出现了诸多 Softmax-free 注意力替代方案(如线性注意力、多项式激活、Gated DeltaNet 等),Softmax 及其变体仍主导绝大多数生产级模型。本文从数学本质、数值稳定性、与损失函数的协同,到当前研究前沿与工程实践,全面拆解 Softmax。