首页 / Transformer(架构)

📖 Transformer(架构) 是什么?

Transformer 像一台翻译机,同时读完整句话再翻译,比一个字一个字翻更快更准。

架构深度学习基础

⚡ 一句话秒懂

Transformer 像一台翻译机,同时读完整句话再翻译,比一个字一个字翻更快更准。

📖 举个故事

老张以前做翻译,只能一个字一个字地抠,句子长了就忘了开头。现在让他戴上"Transformer 眼镜",眼镜能让他一眼看完整句,同时看清每个词跟其他词的关系,再一口气翻出来。所以句子越长,这副眼镜的优势越明显。今天所有大模型,从 GPT 到 Claude 到文心,背后都戴着这副眼镜。

💡 类比理解

暂未补充。

🧩 真实例子

暂未补充。

🛠️ 怎么实际使用

做 AI Agent 时,如果你想让模型"理解"一整段长日志或长对话,几乎一定要用 Transformer 类模型。常见的工程做法是用 8K–128K 上下文窗口的版本,把工具描述、历史消息、用户输入拼成一条输入塞进去,模型就能一次"看清"所有上下文再决定下一步。相比老的 RNN/LSTM,长文本上稳定不掉链子。

📚 进阶原理

Transformer 核心是 Self-Attention:对序列里每个位置,计算它跟所有位置的相似度权重(Q·K/√d),加权求和(V)。多头并行 + 残差 + LayerNorm + FFN 叠加,再加位置编码补足顺序信息。训练用 Teacher Forcing + 交叉熵;推理用 KV Cache 加速自回归生成。复杂度 O(n²) 催生了稀疏注意力、滑动窗口、FlashAttention 等优化。

继续学习相关术语