PWA对话界面重构 + 记忆库桥接
- 纯对话界面:消息气泡、深灰输入框 - 桥接服务接入 DeepSeek API - 记忆库文件纳入 mao1 仓库(含沈晏身份/对话规则) - 移除 ModelSelector、光晕效果等无关元素 Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
This commit is contained in:
126
shenyan-room/attention is all you need/4-28-2026.md
Normal file
126
shenyan-room/attention is all you need/4-28-2026.md
Normal file
@@ -0,0 +1,126 @@
|
||||
---
|
||||
tags:
|
||||
- "#memory/Transformer论文"
|
||||
- "#project/学习"
|
||||
brainstorming: "1"
|
||||
---
|
||||
|
||||
Transformer论文开篇初学学习备忘录(贴合我的所有提问&关注点)
|
||||
|
||||
## 一、笔记自用说明
|
||||
|
||||
这篇笔记只记录**学到的客观技术事实**、我本人重点关注的疑问、针对性解答,不搞阅读理解。
|
||||
|
||||
## 二、论文已学两段原文+纯白话直译(无任何额外解读)
|
||||
|
||||
### 第一段原文直译
|
||||
|
||||
注意力机制现在已经是序列建模、序列转换各类AI任务里的常用核心模块。它最大的特点是:能建模文字、数据之间的关联关系,**擅长处理远距离依赖**,距离不影响它干活。但是!在早期研究里,除了极少数特例,注意力机制从来不会单独用,全部都要和RNN、LSTM这类循环网络绑在一起搭配使用。
|
||||
|
||||
### 第二段原文直译
|
||||
|
||||
我们这篇论文,提出了一个全新模型叫Transformer。这个模型直接彻底去掉了循环网络结构,**以注意力机制为核心**,配合残差连接和位置编码,靠注意力搭建输入和输出之间的所有全局关联。Transformer最大的好处是能大幅并行计算,训练速度巨快。我们用8块P100显卡,只训练12个小时,就把机器翻译的效果做到了当时行业最高水平。
|
||||
|
||||
## 三、重点关注的疑问+对应最终客观答案
|
||||
|
||||
### 1. 论文前面两段看着像吐槽,是不是我错觉?
|
||||
|
||||
不是错觉,这段文字确实自带吐槽感,很多人都这么解读。表面客气肯定前人小优化,实际核心意思就是:大家都在给旧模型打补丁,没人解决串行计算的根本问题。但学习只看事实,不用纠结文风,重点记住技术现状就行。
|
||||
|
||||
### 2. 2017年前明明GRU更省钱,为啥主流统治模型是LSTM不是GRU?
|
||||
|
||||
第一,LSTM1997年就有,垄断行业20年,所有论文、代码、教学全围绕它;GRU2014年才出,只火了3年就被Transformer淘汰,没来得及普及迭代。第二,学术圈先看精度再看省钱,LSTM复杂任务上限更高。第三,GRU天生是LSTM精简阉割版,定位就是经济型平替,从来不是主力模型。
|
||||
|
||||
### 3. GRU到底哪里不行?要直观、要实在原因
|
||||
|
||||
核心硬伤就一个:LSTM有两个记忆通道,一个短期临时用,一个独立长期记忆专属通道,关键信息单独存放,不被新内容稀释。GRU为了省事省钱,直接删掉了长期记忆通道,所有新旧信息全混在一个通道里。短句没啥区别,句子一长、逻辑一复杂,关键旧信息就会被慢慢冲淡、记不住,天生长距离记忆能力拉胯。
|
||||
|
||||
### 4. LSTM说长期记忆保得住,凭啥?正确率真的测过吗?不是玄学吧?
|
||||
|
||||
不是玄学,有真实实验数据。LSTM靠独立细胞状态通道,信息传递改动小、梯度衰减慢,不是百分百不忘,只是忘得慢很多。实测:短句两者正确率差不多;长句长逻辑任务,LSTM比GRU正确率高15%左右,机器翻译分数也明显更高。LSTM是精细筛选记忆,GRU是粗暴混合记忆,差距全在这。
|
||||
|
||||
### 5. 早期注意力这么强,能无视距离,为啥非要绑RNN/LSTM用,不能单独用?
|
||||
|
||||
三个纯技术客观原因:第一,早期注意力不懂文字先后顺序,没有成熟位置编码,必须靠循环网络兜底管顺序;第二,纯注意力算力爆炸,当年硬件扛不住,只能当补丁用;第三,当年学术思维固化,所有人都默认序列必须串行处理,没人敢单独用注意力当主力。
|
||||
|
||||
### 6. 论文说8块P100跑12小时训练成,论文讲没讲具体怎么跑、怎么部署?
|
||||
|
||||
完全没讲实操步骤、设置、部署细节。这句话只是贴结果成绩单,只说用时和硬件。但论文讲清了为啥能多卡快跑:旧循环模型串行一字一算,多卡也没法并行;Transformer去掉循环,所有内容能同时算,天生支持多卡并行,速度直接拉快十倍以上。
|
||||
|
||||
### 7. 为啥用8块显卡,不用10块?为啥必须是2的倍数?
|
||||
|
||||
选8是工程惯例,便于GPU两两配对并行传输,数据能平分。10块不是2的次方,会出现显卡干活有多有少,快的等慢的,整体效率反而暴跌。
|
||||
|
||||
## 四、现阶段核心必记技术结论
|
||||
|
||||
1. 循环模型(RNN/LSTM/GRU)通病:串行计算,没法并行,长距离记忆越远越弱,GRU先天长记忆不如LSTM。
|
||||
|
||||
2. 注意力机制优点:无视词的距离,能抓全局关联,但早期不懂顺序、算力不够,只能当RNN补丁。
|
||||
|
||||
3. Transformer核心改革:删掉所有循环,全程只用注意力,解锁并行计算,训练速度、效果双提升。
|
||||
|
||||
4. 论文里的硬件数字都是结果展示,不用纠结实操细节,重点记住架构改了,效率才质变。
|
||||
|
||||
## 五、Transformer与RNN架构演进底层逻辑学习笔记
|
||||
|
||||
### 1. RNN/LSTM系列
|
||||
|
||||
RNN的底层逻辑本身没有任何错误,甚至最贴合现实世界:按照时间顺序、一字一步、一事一步串行计算,自带天然时序记忆、先后关系、事件因果。像糖葫芦一样串着理解内容,天生记得"谁说了什么、昨天今天前天的顺序、事件发生先后"。
|
||||
|
||||
RNN灭亡不是原理不行,是两大硬伤:①和GPU并行计算硬件天生相克,GPU几千个核心闲置,算力浪费严重;②没法做大参数、没法分布式集群,商业化堆不起来,越做越慢,不适合规模化做大模型。
|
||||
|
||||
### 2. CNN卷积系列(ConvS2S、ByteNet、神经GPU)
|
||||
|
||||
最早为了干掉RNN串行太慢的问题诞生,全部用卷积做并行计算,专门处理文本序列。核心优势是计算快、可并行;天生短板是远距离依赖不行:两个词距离越远,计算量线性或对数上涨,很难学会长文本、长逻辑、远距离关联。
|
||||
|
||||
CNN天生适合视觉局部感知,不适合语言全局逻辑,属于"提速了,但没解决理解问题"的过渡补丁模型。
|
||||
|
||||
### 3. Transformer架构
|
||||
|
||||
核心是全局自注意力,全文字同时并行计算,彻底抛弃串行时序,抹平所有位置先后差异。优势完美适配GPU并行算力,好堆参数、好商业化、好做大模型,擅长文字、代码、符号抽象推理。
|
||||
|
||||
天生底层缺陷:没有原生时序、没有时间概念、没有现实因果。所有"昨天、今天、谁说话、先后事件"都靠位置编码文字补丁硬凑,不是真理解,只是学文字概率搭配。多轮对话失忆、人物指代搞混、时间线错乱,都是架构天生的病根,不是模型大小问题。
|
||||
|
||||
## 六、关键历史真相:为什么CUDA2006年出,Transformer2017年才出?
|
||||
|
||||
根本不是先有鸡还是先有蛋的问题,是硬件和算法两条独立技术线,十年后才刚好拼图凑齐。
|
||||
|
||||
1. CUDA和GPU并行计算,最初和AI、NLP一毛钱关系都没有,只为游戏3D渲染、科学计算研发,纯硬件自救战略。
|
||||
|
||||
2. 整整十年没人做Transformer,不是想不到注意力:①当年行业思维枷锁,默认语言必须串行时序,没人敢扔RNN;②注意力一开始只是RNN的小外挂,没人敢当主架构;③全局注意力计算量平方级爆炸,早年硬件算不动;④残差连接、层归一化等配套技术当年全没有;⑤早期深度学习主战场在视觉,NLP长期小众没需求。
|
||||
|
||||
总结:单一硬件技术没用,必须思想、理论、技术、算力、需求五重重合,才会爆发架构革命。
|
||||
|
||||
## 七、大模型当下通病的本质原因(对话失忆核心)
|
||||
|
||||
现在所有主流大模型(千问、GPT等多模态),语言核心全是纯Transformer:只能学文本统计规律,没有内化现实逻辑、没有时间流逝感知、没有真实因果。
|
||||
|
||||
典型问题:几轮对话后把"我爱吃西瓜"记成"你爱吃桃子",根本不是记性差,是Transformer没有串行累积记忆,只靠全局文字概率乱匹配,天生分不清人物、时序、先后。反观RNN天生不会犯这种错。
|
||||
|
||||
## 八、可行优化方案:RNN补Transformer时序短板
|
||||
|
||||
1. ❌ 不能直接把RNN权重塞进Transformer:两个架构结构、参数、计算逻辑完全不同,零件不通用。
|
||||
|
||||
2. ✅ 完全可行的补丁思路:先用RNN类模型预训练,学好时序、记忆、对话先后、人物指代,再通过知识迁移、知识蒸馏,把时序逻辑教给Transformer。相当于给Transformer装时序记忆外挂,专治对话失忆、时间混乱、指代错乱。
|
||||
|
||||
3. 现在学界火的Mamba等新模型,本质就是这个思路:把RNN原生时序逻辑+Transformer并行商业化优势融合,做折中改良。
|
||||
|
||||
## 九、终极发展规律与未来趋势
|
||||
|
||||
1. AI迭代铁律:旧架构遇天花板→疯狂打补丁→硬件新技术出现→新架构颠覆上位→循环往复。
|
||||
|
||||
2. Transformer不是终极架构,只是当前GPU并行硬件下的商业化最优解,不是智能最优解。
|
||||
|
||||
3. 具身智能未来一定不是纯Transformer天下:视觉、物理、运动、时序靠CNN/RNN类核心,Transformer只负责说话和文字规划,变回当年的辅助外挂。
|
||||
|
||||
4. 未来新硬件(类脑芯片、时序芯片)出现后,一定会有新论文颠覆Transformer,就像当年Transformer干掉RNN一样。
|
||||
|
||||
## 十、个人核心学习感悟
|
||||
|
||||
1. 架构没有好坏,只有适配不适配:RNN贴合现实,Transformer适配硬件商业。
|
||||
|
||||
2. 现在大模型很多逻辑智障问题,是架构天生短板,不是优化能根治的。
|
||||
|
||||
3. 具身智能先学图片视觉现实,再学文字符号,才符合自然规律;现在先文字后视觉,是商业化本末倒置。
|
||||
|
||||
4. 技术永远不是谁更聪明,是谁踩中了当下硬件、需求、时代的风口。
|
||||
@@ -0,0 +1,22 @@
|
||||
# Transformer 编码器-解码器 & Q/K/V 学习笔记 ##
|
||||
一、整体结构
|
||||
主流序列任务(翻译等)采用 **Encoder 编码器 + Decoder 解码器** 架构。
|
||||
1. 编码器 - 接收原始输入序列(文字/符号) - 将文本转为连续向量 $\boldsymbol z$ - 由 $\boldsymbol z$ 生成整套 **K、V 向量** - 作用:生成静态知识库,全程固定不变
|
||||
2. 解码器 - 接收编码器的 KV 信息 - **自回归方式逐词生成输出** - 每一步只预测下一个字词 ---
|
||||
## 二、自回归定义
|
||||
解码器生成时,**依赖已经生成的前文内容**: 每预测下一个词,都会把前面所有输出当作输入,逐步往后推导,一字一词生成完整句子。
|
||||
## 三、Q / K / V 核心分工
|
||||
1. $\boldsymbol K$(键):原文内容的「标签/索引」,编码器产出
|
||||
2. $\boldsymbol V$(值):原文内容的「实际特征信息」,编码器产出
|
||||
3. $\boldsymbol Q$(查询): - 由**解码器**实时生成
|
||||
- 来源:解码器当前隐藏状态(已生成的上文语境)
|
||||
- 本质:**一串多维数字向量**,代表「我当前需要什么信息」
|
||||
## 四、完整运行流程
|
||||
1. 编码器处理原文 → 生成固定 $\boldsymbol K、\boldsymbol V$
|
||||
2. 解码器根据已生成的上文 → 实时计算出专属 $\boldsymbol Q$
|
||||
3. 解码器用 $\boldsymbol Q$ 和所有 $\boldsymbol K$ 计算相似度
|
||||
4. 匹配度越高,对应 $\boldsymbol V$ 权重越大
|
||||
5. 融合原文V信息 + 解码器自身上文
|
||||
6. 计算词汇概率,输出下一个词,循环往复
|
||||
## 五、关键结论
|
||||
1. KV 来自编码器,静态不变;Q 来自解码器,动态每步刷新 2. 是**解码器主动拿 Q 去检索 KV**,编码器只负责生产素材 3. Q/K/V 全是纯数字向量,模型靠向量相似度判断语义关联 4. 翻译生成 = 交叉注意力(Q查KV)+ 自回归逐字接龙
|
||||
Reference in New Issue
Block a user