标签: Attention
所有包含此标签的文章 "Attention".
深度理解 Softmax:从多分类到现代大模型的概率桥梁(2026 更新)
Softmax 函数是深度学习中最经典的“概率化”组件,将 Logits 转换为有效的概率分布。它不仅是多分类任务的标准输出层激活,更是 Transformer 自注意力机制的核心。尽管在2025–2026年出现了诸多 Softmax-free 注意力替代方案(如线性注意力、多项式激活、Gated DeltaNet 等),Softmax 及其变体仍主导绝大多数生产级模型。本文从数学本质、数值稳定性、与损失函数的协同,到当前研究前沿与工程实践,全面拆解 Softmax。