一些知识点概念
一、configconfig 就是模型的配置文件全称 BartConfig 是专门管理 BART 模型配置的类不存模型中的参数只存模型长啥样、有多大、怎么搭建的所有设置。比如 { vocab_size: 50265, # 词表大小 d_model: 1024, # 词向量维度 encoder_layers: 12, # 编码器层数 decoder_layers: 12, # 解码器层数 encoder_attention_heads: 16, # 注意力头数 max_position_embeddings: 1024, # 最大序列长度 dropout: 0.1, # dropout概率 hidden_act: gelu # 激活函数 }config 模型的建筑图纸模型参数 房子里的家具二、预训练与微调1.预训练上游任务用海量的通用低成本数据训练出一个通用大模型为了满足大规模通用低成本最优选择 无标注文本 自监督任务预训练不强制必须无标注但现代所有主流大模型预训练都用无标注文本 自监督预训练因为这是唯一能低成本、大规模、学通用语言的方式。2.微调下游任务把预训练好的通用大模型在小批量、有标注的任务数据上再训练一点点小小微调一下模型参数。目标让通用模型更加适配你的具体任务本质迁移学习Transfer Learning三、余弦退火学习率余弦退火学习率Cosine Annealing LR学习率从初始值按照余弦函数曲线平滑、缓慢降到接近 0不是直线降也不是突然降。Warmup 余弦退火Warmup前 N 步学习率从 0 线性上升到最大值然后余弦退火下降到结束四、CIDERCIDER 基于 “词频一致性 余弦相似度” 的文本生成自动评价指标。用来衡量模型生成的句子和人类标准答案有多像。核心思想CIDER 只看一件事生成句子 和 参考句子 共享的稀有词关键词多不多原理把句子切成1-gram、2-gram、3-gram、4-gram单词、词组给稀有词更高权重常见词如 “的、是、在” 不算分把两句话变成向量算余弦相似度→ 相似度越高CIDER 分数越高五、Teacher Forcing教师强制机制Teacher Forcing 训练序列模型时解码器的输入不用上一步自己生成的词而是直接用【真实标签标准答案】1.作用1.防止误差累积Error Accumulation自己生成的错词 → 输入下一层 → 更错训练直接崩、不收敛。让模型永远站在正确的历史上学习训练稳定、收敛快、不爆炸2.训练和推理的区别训练Teacher Forcing喂标准答案推理generateStudent Forcing用自己生成的词这就是seq2seq 模型的标准范式。