跳转至

大模型LLMS

来源 PDF:大模型LLMS.pdf
主题:训练 / 微调
页数:103
字符数:56377
索引片段数:142

摘要

大模型 LLMs面试宝典 目录 一、LLMs Tokenizer 篇 ....................................................................................................... 4 Byte-Pair Encoding(BPE)篇 ..............................................................................................

代表性原文片段

片段 1

大模型 LLMs面试宝典 目录 一、LLMs Tokenizer 篇 ....................................................................................................... 4 Byte-Pair Encoding(BPE)篇 ...............................................................................................................4 1 Byte-Pair Encoding(BPE) 如何构建词典?................................................................................ 4

片段 2

如何构建词典?................................................................................ 4 WordPiece 篇.................................................................................................................................... 4 SentencePiece 篇 ..............................................................................................................................4

片段 3

.........................................................................................4 对比篇.......................................................................................................................................................5 1 举例介绍一下不同大模型LLMs 的分词方式?.............................................................................5 2 介绍一下不同大模型LLMs 的分词方式的区别? .................................................................... 5

片段 4

不同大模型LLMs 的分词方式的区别? .................................................................... 5 二、大模型(LLMs)分布式训练面 ..........................................................................................5 1. 理论篇.....................................................................................................................................................5 2. 实践篇 8 3. 并行化策略选择篇 ..........9 4. 问题篇 10

片段 5

..............................................5 2. 实践篇 8 3. 并行化策略选择篇 ..........9 4. 问题篇 10 3. 推理性能方面: ................................................................................................................................ 12 1. 解决方法:....................................................................................................................................... 13 三、【大模型 LLMs 基础面 Plus】 ..................................................................................... 14

片段 6

】 ..................................................................................... 14 Layer normalization-方法篇 ........................................................................................................... 14 1、Layer Norm 篇 .......................................................................................................................... 14 2、RMS Norm 篇 (均方根 Norm) ....................................................................................... 14

片段 7

....................................................................................... 14 3、Deep Norm 篇 .......................................................................................................................... 15 Layer normalization-位置篇 ........................................................................................................... 15 Layer normalization 对比篇 .........................................................................................................16

片段 8

........................................................................................16 LLMs 激活函数篇............................................................................................................................. 17 LLMs 注意力机制 优化篇 ............................................................................................................... 18 1 传统 Attention 存在哪些问题?............................................................................................... 18

片段 9

....................................................................................... 18 2 Attention 优化方向?..................................................................................................................... 18 3 Attention 变体有哪些?................................................................................................................. 18 4 Multi-Query Attention 篇 ........................................................................................................19

片段 10

........................................................................................19 5 Grouped-query Attention 篇 ....................................................................................................20 6 Flash Attention 篇 ........................................................................................................................ 20 7 并行 transformer block ............................................................................................................20

片段 11

........................................................................................20 LLMs 损失函数篇............................................................................................................................. 21 1 介绍一下 KL 散度?...................................................................................................................... 21 2 交叉熵损失函数写一下,物理意义是什么?..............................................................................21

片段 12

下,物理意义是什么?..............................................................................21 3 KL 散度与交叉熵的区别?.......................................................................................................... 21 4 多任务学习各loss 差异过大怎样处理?...................................................................................... 22 5 分类问题为什么用交叉熵损失函数不用均方误差(MSE)?..................................................22

使用建议

  • 这些内容来自授权公开 PDF 的文本抽取结果,网页端会基于同一份静态索引做关键词检索。
  • 面试复习时建议先用网页 PDF 原文检索定位题目,再回到主 notes 学系统化答案。
  • 如果片段出现排版噪声,以原 PDF 语义为准,并优先整理成自己的回答模板。