跳转至

大模型常见面试题及解答2

来源 PDF:大模型常见面试题及解答2.pdf
主题:RAG / 文档问答
页数:22
字符数:20370
索引片段数:50

摘要

AI 大模型常见面试题(及内容解析) 大模型领域包含许多专业术语,以下是一些关键术语的解释: 人工智能(AI):是指使计算机系统能够模拟人类智能行为,以执行任务、解决问题和学习的科学和技术。 大型语言模型(LLM):深度学习的应用之一,是训练有素的模型,能理解和生成自然语言。 多模态大模型(LMM):能够处理和理解多种不同类型的数据输入,例如文本、图像、音频和视频。 词嵌入(Word Embedding):将每个单词映射到一个固定长度的向量,以便在模型中能够进行数学运算。 神经网络(Neural Network):

代表性原文片段

片段 1

AI 大模型常见面试题(及内容解析) 大模型领域包含许多专业术语,以下是一些关键术语的解释: 人工智能(AI):是指使计算机系统能够模拟人类智能行为,以执行任务、解决问题和学习的科学和技术。 大型语言模型(LLM):深度学习的应用之一,是训练有素的模型,能理解和生成自然语言。 多模态大模型(LMM):能够处理和理解多种不同类型的数据输入,例如文本、图像、音频和视频。 词嵌入(Word Embedding):将每个单词映射到一个固定长度的向量,以便在模型中能够进行数学运算。 神经网络(Neural Network):由多个神经元组成的计算模型,可用于学习输入数据之间的复杂关系。 前馈神经网络(Feedforward Neural Network):每个神经元仅与下一层的神经元相连的神经网络。 循环神经网络(Recurrent Neural Network):前一个时间步的输出会被传递给当前时间步的输入,以考虑时间 顺序的信息。 长短时记忆网络(LSTM):一种特殊的循环神经网络,能够更好地处理长期依赖关系。 门控循环单元(GRU):一种轻量级的循环神经网络,类似于 LSTM,但只有两个门控单元。

片段 2

的信息。 长短时记忆网络(LSTM):一种特殊的循环神经网络,能够更好地处理长期依赖关系。 门控循环单元(GRU):一种轻量级的循环神经网络,类似于 LSTM,但只有两个门控单元。 向量数据库 Embedding:将现实世界中的物质向量化到高维空间,向量距离通常代表了自然语言的语义相似度。 召回:通常与向量召回、搜索召回相关,用于从大量数据中找出与查询最相关的项。 Agent:简单来说是具有某个功能的原子能力,可以被大模型调用到。 多 Agent:多个 agent 协同完成一个目标,例如在 metaGPT 等模型中。 Zero-shot Learning:通过利用已有的先验知识和语义信息,将已知的类别或任务与新的类别或任务进行联系, 从而进行预测。 Fine-tuning:在机器学习中对预训练模型进行微调的过程,以适应新的任务或领域。 除此之外,还有 TOKEN 数量、参数级别、prompt、RAG(检索增强生成)等术语也是大模型领域中常见的概念。 参数级别 大模型的参数级别指的是模型训练过程中所需学习和调整的权重和偏置等参数的数量级。这些参数是模型从输入数

片段 3

rompt、RAG(检索增强生成)等术语也是大模型领域中常见的概念。 参数级别 大模型的参数级别指的是模型训练过程中所需学习和调整的权重和偏置等参数的数量级。这些参数是模型从输入数 据中学习特征、进行推理和预测的基础。大模型的参数级别通常用来衡量模型的复杂度和规模,以及它所能表达的 信息量和学习能力。

在描述大模型参数级别时,常用的表达方式是使用“B”作为单位,代表“Billion”(十亿)。例如,175B 表示模 型拥有 1750 亿个参数,60B 表示模型有 600 亿个参数,而 540B 则表示模型具有 5400 亿个参数。这些数字反映 了模型巨大的参数空间,使其能够处理复杂的任务和学习丰富的数据特征。 随着技术的发展,大模型的参数级别不断攀升,从最初的数十亿到如今的数百亿甚至数千亿级别。这种增长不仅提 升了模型的性能,也带来了更强大的表示能力和学习能力。然而,高参数级别也意味着更高的计算需求和存储成本, 因此在实际应用中需要权衡模型的性能与资源消耗。 总之,大模型参数级别是用来描述模型规模和复杂度的指标,常用表达如 175B、60B、540B 等代表模型参数的具

片段 4

算需求和存储成本, 因此在实际应用中需要权衡模型的性能与资源消耗。 总之,大模型参数级别是用来描述模型规模和复杂度的指标,常用表达如 175B、60B、540B 等代表模型参数的具 体数量级。这些数字反映了模型在处理复杂任务和学习丰富特征方面的能力,同时也需要考虑计算资源和存储成本 的限制。 哈~ TOKEN 在大模型领域中,Token(标记)是文本处理的基本构建块。它代表了文本中的一个离散元素,可以是单词、子词、 字符、标点符号、数字或其他语言元素,这些元素被用作训练和生成文本的基本单位。在自然语言处理(NLP)任 务中,模型所使用的输入数据的最小单元就是 Token。 在模型的输入端,通常会使用特定的编码方式将这些 Token 映射为数字表示,以便计算机能够理解和处理。对于大 型语言模型来说,处理的文本通常非常大,因此会涉及大量的 Token。例如,GPT(Generative Pre-trained Transformer)等模型可能会使用数十亿甚至数百亿个 Token 进行训练,以便更好地理解和生成文本。

片段 5

Token。例如,GPT(Generative Pre-trained Transformer)等模型可能会使用数十亿甚至数百亿个 Token 进行训练,以便更好地理解和生成文本。 在大型语言模型的训练和应用中,模型接收一串 Tokens 作为输入,并尝试预测下一个最可能的 Token。对于很多 模型来说,Tokens 还可以通过 embedding 操作转换为向量表示,以便在神经网络中进行处理。由于大型语言模

型处理的文本非常大,因此通常会使用特定的 Tokenization 方法,例如基于字节对编码(byte-pair encoding, BPE)或者 WordPiece 等算法,以优化处理速度和内存占用。 涌现能力 大模型的涌现能力(Emergent Capability)是指模型在未经直接训练的任务上表现出惊人的性能。这种能力不是 通过简单的参数增加或结构变化来实现的,而是在模型达到一定的复杂度和规模后突然出现的。涌现能力使得大模 型能够处理更广泛的任务,展现出超越传统模型的性能。 涌现能力的原因主要有以下几点:

片段 6

简单的参数增加或结构变化来实现的,而是在模型达到一定的复杂度和规模后突然出现的。涌现能力使得大模 型能够处理更广泛的任务,展现出超越传统模型的性能。 涌现能力的原因主要有以下几点: 前向和后向上下文信息:大模型的预训练过程使其能够学习到丰富的上下文信息。这使得模型在处理新任务时能够 利用这些经验进行推理,从而表现出优秀的性能。 概念图谱中的知识:大模型通过训练数据吸收了大量结构化和非结构化知识。这些嵌入在模型中的知识为解答新问 题提供了有力的支持。 模型规模的扩大:随着模型规模的增加,其参数数量和表达能力得到大幅提升。这使得模型能够学习到更丰富的特 征表示,进而提升其性能。 表征学习能力的提升:新型预训练策略如微调等让模型能够学习到更好的语义表征,这有助于模型理解新问题并给 出准确的答案。 推理能力的增强:大模型通过引入更多的随机性(如随机采样)来发现隐含的关联性,从而提高了其推理能力。 训练数据的多样性:更丰富的训练数据涵盖了更多领域的知识,这使得模型能够广泛应用于各种任务。 强化学习技术:通过人工初始问题-答案对进行强化学习,模型不断优化其理解和表达能力,从而进一步提高其性 能。

片段 7

更丰富的训练数据涵盖了更多领域的知识,这使得模型能够广泛应用于各种任务。 强化学习技术:通过人工初始问题-答案对进行强化学习,模型不断优化其理解和表达能力,从而进一步提高其性 能。 此外,从更深层次的角度来看,涌现能力的原因与量变产生质变这一哲学原理相关。当模型的复杂度超过某一阈值 时,其能力会突然涌现。这可能是由于模型内部复杂的相互作用和关联导致的,使得模型在达到一定规模后能够展 现出前所未有的性能。 需要注意的是,尽管大模型具有强大的涌现能力,但其性能仍受到多种因素的影响。因此,在实际应用中,需要根 据具体任务和数据集的特点来选择合适的模型、预训练策略以及微调方法,以充分发挥大模型的潜力。

LLMs(大型语言模型)“复读机”问题 LLMs(大型语言模型)的“复读机”问题,是指模型在生成文本时倾向于重复已经说过的话或相似的短语,导致 输出的内容缺乏多样性和创新性。这个问题在 LLMs 中尤为突出,特别是在处理长文本或进行多轮对话时。 复读机问题的原因主要有以下几点: 模型结构:LLMs 通常采用基于 Transformer 的架构,这种结构在处理长序列时可能存在一些问题。尤其是在多轮

片段 8

理长文本或进行多轮对话时。 复读机问题的原因主要有以下几点: 模型结构:LLMs 通常采用基于 Transformer 的架构,这种结构在处理长序列时可能存在一些问题。尤其是在多轮 对话中,模型可能难以有效地记忆和整合之前的对话内容,导致重复提及相同的信息。 训练数据:LLMs 的训练数据通常包含大量的文本,其中可能存在一些重复的模式或短语。模型在训练过程中可能 会学习到这些重复模式,并在生成文本时表现出来。 优化目标:在训练过程中,LLMs 通常被优化以最大化语言模型的似然性。这可能导致模型倾向于选择更常见或更 安全的输出,即使这些输出在内容上有所重复。 为了解决 LLMs 的复读机问题,可以采取以下策略: 引入多样性损失:在训练过程中,可以引入一个多样性损失项,鼓励模型生成更多样化的输出。这可以通过比较当 前输出与之前的输出或训练数据中的其他输出来实现。 对话历史管理:在处理多轮对话时,可以引入一个对话历史管理机制,帮助模型更好地记忆和整合之前的对话内容。 这可以通过使用额外的上下文向量或记忆网络来实现。 后处理策略:在模型生成输出后,可以采用一些后处理策略来减少重复。例如,可以检测并删除重复的短语或句子,

片段 9

记忆和整合之前的对话内容。 这可以通过使用额外的上下文向量或记忆网络来实现。 后处理策略:在模型生成输出后,可以采用一些后处理策略来减少重复。例如,可以检测并删除重复的短语或句子, 或者通过重新排序或替换同义词来增加输出的多样性。 需要注意的是,虽然这些策略可以在一定程度上缓解复读机问题,但完全消除这个问题仍然是一个挑战。LLMs 的 生成能力仍然受到其训练数据和模型结构的限制,因此在某些情况下可能仍然会出现重复或类似的输出。 深度学习 Norm 各种 Norm 方式在深度学习中都有其独特的应用和优缺点。以下是对几种常见的 Norm 方式的简要分析: Batch Normalization (BN): 优点:能够解决 Internal Covariate Shift 问题,使得每一层的输出都具有适当的尺度,从而加速模型的训练过程。 同时,它还能提高模型的泛化能力,减少过拟合。

缺点:对 batch size 的大小较为敏感,当 batch size 较小时,BN 的效果可能会下降。此外,由于 BN 在训练和推 理时使用了不同的均值和方差,这可能导致模型在推理时的不稳定性。

片段 10

h size 的大小较为敏感,当 batch size 较小时,BN 的效果可能会下降。此外,由于 BN 在训练和推 理时使用了不同的均值和方差,这可能导致模型在推理时的不稳定性。 Layer Normalization (LN): 优点:适用于 RNN 网络,因为它是在每个样本的每个层上计算均值和方差,而不是在 batch 中。这使得 LN 对序 列长度和 batch size 的变化不太敏感。 缺点:相比于 BN,在某些情况下,LN 可能不如 BN 效果好,特别是在需要利用 batch 间统计信息的任务中。 Weight Normalization (WN): 优点:通过重新参数化模型权重,WN 能够加速收敛,提高模型的稳定性。同时,它还能简化超参数的调整过程。 缺点:WN 增加了计算量,因为需要对每个权重进行归一化操作。此外,WN 在某些情况下可能不如其他 Norm 方 式效果好,这取决于具体的任务和数据集。 PreNorm 和 PostNorm: PreNorm:优点在于网络一般比较容易训练,特别是在网络较浅时。然而,对于深层网络,PreNorm 的效果可能 不佳,因为它更偏重于底层的恒等分支。

片段 11

rm 和 PostNorm: PreNorm:优点在于网络一般比较容易训练,特别是在网络较浅时。然而,对于深层网络,PreNorm 的效果可能 不佳,因为它更偏重于底层的恒等分支。 PostNorm:在深层网络中训练效果较好,但可能相对较难训练。 需要注意的是,这些 Norm 方式并不是互相排斥的,有时可以结合使用以获取更好的效果。在选择 Norm 方式时, 应根据具体的任务、模型架构和数据集特点进行权衡和选择。 对于 Transformer 模型为何选择层归一化(Layer Normalization,LN)而不是批归一化(Batch Normalization, BN),主要有以下几个原因: 首先,Transformer 模型需要捕捉样本内部的长距离依赖关系,如图像中不同区域的关系或句子中不同单词的关系。 LN 是对某个样本的所有位置特征做归一化,能够保留同一样本内部特征的大小关系,这有利于 Transformer 模型 (特别是其注意力机制)捕捉全局信息。相比之下,BN 是对相同批次中所有样本的同一位置特征做归一化,这可 能会抹去样本内部特征的原有大小关系,不利于捕捉全局信息。

片段 12

former 模型 (特别是其注意力机制)捕捉全局信息。相比之下,BN 是对相同批次中所有样本的同一位置特征做归一化,这可 能会抹去样本内部特征的原有大小关系,不利于捕捉全局信息。 其次,Transformer 模型处理的通常是变长序列数据,序列之间的长度差异可能比较大。BN 是按样本批量进行归 一化,如果样本之间长度差异较大,可能会影响归一化效果。而 LN 是在同一个样本的不同神经元之间进行归一化,

不受序列长度差异的影响,因此更适合 Transformer 模型。 此外,LN 相比于 BN 在某些情况下可能具有更好的稳定性和训练效率。LN 不需要存储整个 batch 的统计数据,因 此在处理大规模数据集或在线学习场景时,LN 可能具有更低的内存占用和更快的计算速度。同时,LN 对超参数的 调整相对简单,有助于简化模型的训练过程。 需要注意的是,虽然 LN 在 Transformer 模型中表现优秀,但并不意味着它在所有情况下都是最佳选择。对于不同 的模型架构和任务需求,可能需要根据实际情况选择最合适的归一化方式。同时,随着深度学习技术的不断发展,

使用建议

  • 这些内容来自授权公开 PDF 的文本抽取结果,网页端会基于同一份静态索引做关键词检索。
  • 面试复习时建议先用网页 PDF 原文检索定位题目,再回到主 notes 学系统化答案。
  • 如果片段出现排版噪声,以原 PDF 语义为准,并优先整理成自己的回答模板。