大模型基础练习题:Token、上下文与模型幻觉
《Agent 大模型 0 到 1 系统课》 · 程序员 Sunday
本章共 25 道习题,包含单选题、判断题和简答题,覆盖大语言模型基础、Token、Message、模型输入、Context Window、Context Budget、生成随机性、模型幻觉、模型选择和 Transformer 架构。
1
题型: 单选题 难度: 简单
题干: 在同一个聊天窗口中,用户先告诉模型“我是一名前端开发者”,随后要求模型介绍 NestJS。模型改变了讲解方式。这个现象最能说明什么?(复习题)
选项A: 模型已经永久记住了用户的职业 选项B: 模型会根据当前能够看到的上下文生成回答 选项C: NestJS 只能向前端开发者讲解 选项D: 聊天产品重新训练了一个大语言模型
正确答案: B
解析: 模型本轮回答会受到当前上下文的影响。“我是一名前端开发者”被放进本次模型输入以后,模型会据此调整解释方式。这个实验不能证明模型拥有永久记忆,也不代表聊天产品重新训练了模型。
2
题型: 单选题 难度: 中等
题干: 下面哪一项最准确地描述了 AI、机器学习、深度学习和大语言模型之间的关系?(复习题)
选项A: 大语言模型包含深度学习,深度学习包含机器学习 选项B: 机器学习、深度学习和大语言模型是三个互不相关的领域 选项C: AI 是更大的范围,机器学习属于 AI,深度学习属于机器学习,大语言模型通常属于深度学习模型 选项D: Agent 属于大语言模型内部的一层神经网络
正确答案: C
解析: AI 是一个更大的概念,机器学习是实现 AI 的重要方法,深度学习又属于机器学习,大语言模型通常由深度学习技术训练得到。Agent 是组合模型、代码、数据和工具的应用系统,不属于大语言模型内部的网络结构。
3
题型: 单选题 难度: 中等
题干: 使用机器学习训练一个手势识别模型时,如果大量训练图片被标注成了错误的手势,最可能发生什么?(理解题)
选项A: 模型会自动发现并修复所有错误标签 选项B: 模型可能学习到错误规律,最终输出错误结果 选项C: 模型只会记住图片文件名,不会受到标签影响 选项D: 只要训练时间足够长,错误数据就不会影响结果
正确答案: B
解析: 机器学习会从训练数据和标签中寻找规律。如果数据或标签本身存在问题,模型就可能学到错误规律。延长训练时间不能自动修复错误数据,反而可能让模型更充分地拟合这些错误信息。
4
题型: 单选题 难度: 中等
题干: 大语言模型生成一段回答时,下面哪一项更接近真实过程?(复习题)
选项A: 模型先在内部写好完整文章,再一次性返回所有文字 选项B: 模型从训练数据中找到一段完全相同的答案并复制出来 选项C: 模型根据已有上下文预测下一个 Token,新 Token 加入上下文后继续生成 选项D: 模型先把问题转换成数据库 SQL,再从数据库读取答案
正确答案: C
解析: 大语言模型通常按照自回归方式生成内容。模型根据当前上下文计算下一个 Token 的候选结果,选择一个 Token 后将其加入上下文,再继续预测后面的 Token,直到遇到结束条件。
5
题型: 单选题 难度: 中等
题干: 关于 Token,下面哪一项描述是正确的?(复习题)
选项A: 一个 Token 永远等于一个汉字 选项B: 一个 Token 永远等于一个完整英文单词 选项C: Token 是 Tokenizer 根据词表和切分规则得到的模型处理单位 选项D: Token 只会影响回答长度,不会影响调用成本
正确答案: C
解析: Token 是模型处理内容时使用的基本单位,由 Tokenizer 根据自己的词表和切分规则产生。一个 Token 可能是汉字、词语、英文单词的一部分或标点。Token 数量还会影响上下文占用、输入输出长度和调用成本。
6
题型: 单选题 难度: 中等
题干: 关于 Prompt 和 Message 的关系,下面哪一项描述最准确?(复习题)
选项A: Prompt 只指用户最后输入的那一句话 选项B: Message 是模型内部的向量,开发者无法看到 选项C: Prompt 表示一次调用交给模型的全部输入信息,Message 是应用程序组织这些信息的结构 选项D: Prompt 和 Message 完全没有关系
正确答案: C
解析: 一次模型调用中的 Prompt 可以包含系统要求、历史消息、业务资料和当前问题。应用程序通常使用带有 system、user、assistant 等角色的 Message 来组织这些内容,模型服务再把 Message 转换成 Token 序列。
7
题型: 单选题 难度: 中等
题干: 某模型的 Context Window 是 8,000 Token,本次请求的输入已经占用 7,500 Token。在暂时忽略消息模板等额外开销的情况下,理论上最多还剩多少 Token 可以用于输出?(计算题)
选项A: 500 Token 选项B: 7,500 Token 选项C: 8,000 Token 选项D: Context Window 只限制输入,所以输出不受影响
正确答案: A
解析: Context Window 同时容纳输入和输出。输入已经占用 7,500 Token 时,理论上只剩 500 Token。真实调用还可能存在消息模板、工具定义等额外占用,因此应用通常需要提前预留输出空间。
8
题型: 单选题 难度: 困难
题干: Agent 手中有系统指令、当前问题、历史消息、RAG 文档和工具结果,但这些内容无法全部放进模型窗口。Context Budget 最主要的作用是什么?(理解题)
选项A: 扩大模型本身的 Context Window 选项B: 在调用模型以前分配输入和输出空间,并筛选本轮真正需要的内容 选项C: 把所有历史消息永久删除 选项D: 提高模型训练数据的质量
正确答案: B
解析: Context Budget 是应用层的上下文预算策略。它不会改变模型本身的窗口大小,而是在调用模型前为系统指令、当前问题、历史消息、业务资料和输出内容分配空间,再选择本轮需要发送的内容。
9
题型: 单选题 难度: 中等
题干: Temperature 主要控制模型生成过程中的哪一项行为?(复习题)
选项A: 回答是否符合真实世界事实 选项B: 候选 Token 概率分布的集中程度和采样随机性 选项C: 模型能够处理的最大图片尺寸 选项D: 模型训练数据的更新时间
正确答案: B
解析: Temperature 会影响候选 Token 概率分布的集中程度。较低的 Temperature 通常让结果更集中、更稳定,较高的 Temperature 会增加选择低概率候选结果的可能性。但 Temperature 不负责判断内容是否真实。
10
题型: 单选题 难度: 困难
题干: 企业退款规则规定“退款金额超过 2,000 元必须人工审核”。为了降低模型幻觉对业务结果的影响,下面哪种设计更可靠?(实践题)
选项A: 让模型自己猜测订单金额并决定是否审核 选项B: 把 Temperature 调到 0,让模型直接作出业务结论 选项C: 由普通代码读取真实金额并判断审核结果,模型只负责组织用户回复 选项D: 连续调用模型三次,选择出现次数最多的结论
正确答案: C
解析: 金额比较和审核阈值属于确定性业务规则,应该由普通代码基于可信数据执行。模型适合处理语言理解和内容生成,不应该决定可能影响真实资金或业务状态的确定性结论。
11
题型: 单选题 难度: 中等
题干: 用户上传一张损坏商品的照片,并要求判断商品外观是否存在明显破损。优先应该选择哪类处理路线?(场景题)
选项A: 普通文本模型 选项B: 推理模型 选项C: 多模态模型 选项D: 只使用字符串长度判断
正确答案: C
解析: 当前任务需要读取图片内容,因此应该选择支持视觉输入的多模态模型。普通文本模型无法直接读取图片。后续如果还涉及赔付金额、权限或审核阈值,仍应由业务代码继续判断。
12
题型: 单选题 难度: 中等
题干: 关于原始 Transformer 和很多生成式大语言模型使用的结构,下面哪一项描述正确?(复习题)
选项A: 原始 Transformer 采用 Encoder-Decoder,很多生成式大语言模型采用 Decoder-only 路线 选项B: 原始 Transformer 和所有聊天模型都只能使用 Encoder 选项C: Decoder-only 模型无法根据上下文生成下一个 Token 选项D: Encoder-Decoder 只适合处理图片,不能处理文本
正确答案: A
解析: 原始 Transformer 在《Attention Is All You Need》中采用 Encoder-Decoder 架构,适合机器翻译等序列到序列任务。很多生成式大语言模型使用 Decoder-only Transformer,根据已经看到的上下文不断预测后续 Token。
13
题型: 单选题 难度: 中等
题干: Transformer 中 Position Encoding 的主要作用是什么?(复习题)
选项A: 告诉模型每个 Token 在序列中的位置信息 选项B: 判断回答是否存在幻觉 选项C: 把模型回答保存到数据库 选项D: 决定本次调用使用普通模型还是推理模型
正确答案: A
解析: Self-Attention 本身不会天然知道 Token 的先后顺序。Position Encoding 为 Token 表示加入位置信息,让模型能够区分谁在前、谁在后,并理解与顺序有关的语义。
14
题型: 单选题 难度: 困难
题干: Self-Attention 处理“退款金额超过 2000 元时需要人工审核”时,Q、K、V 的关系可以怎样理解?(理解题)
选项A: Q、K、V 分别表示三个固定 Token 选项B: 当前 Token 的 Query 与上下文 Token 的 Key 计算匹配程度,再根据权重汇总对应的 Value 选项C: Query 负责生成最终回答,Key 负责保存聊天记录,Value 负责统计调用费用 选项D: Q、K、V 只在 Tokenizer 切分文本时使用
正确答案: B
解析: 每个 Token 的表示都会经过不同线性变换得到 Query、Key 和 Value。处理当前位置时,模型使用当前位置的 Query 与可见 Token 的 Key 计算注意力权重,再按照权重汇总这些 Token 的 Value。
15
题型: 单选题 难度: 困难
题干: Transformer 为什么要使用 Multi-Head Attention?(理解题)
选项A: 为了让每个注意力头保存一份完整聊天记录 选项B: 为了让多组拥有不同参数的注意力头计算不同注意力分布,并合并多种关系信息 选项C: 为了彻底消除上下文长度限制 选项D: 为了让所有 Token 获得完全相同的注意力权重
正确答案: B
解析: 每个 Attention Head 都有自己的 Q、K、V 参数,可以形成不同的注意力分布。多个头并行工作后再合并结果,使模型有机会同时捕捉同一段上下文中的多种关系。注意力头的分工不一定能被人类清晰解释。
16
题型: 判断题 难度: 简单
题干: 聊天机器人能够在同一个对话中记住用户之前说过的话,说明大语言模型天然拥有永久记忆。(复习题)
选项A: 正确 选项B: 错误
正确答案: B
解析: 聊天产品通常会在模型外保存历史消息,并在下一次调用时把相关内容重新交给模型。跨会话记忆也需要应用程序额外实现。聊天机器人看起来“记得用户”,不能证明模型天然拥有永久记忆。
17
题型: 判断题 难度: 简单
题干: 对所有模型来说,一个汉字一定对应一个 Token,一个英文单词也一定对应一个 Token。(复习题)
选项A: 正确 选项B: 错误
正确答案: B
解析: Token 的切分结果取决于具体 Tokenizer 的词表和规则。同一段内容交给不同模型的 Tokenizer,可能得到不同数量的 Token。因此不能把 Token 简单等同于汉字或英文单词。
18
题型: 判断题 难度: 中等
题干: 输入内容命中模型服务的上下文缓存以后,就不再占用 Context Window。(理解题)
选项A: 正确 选项B: 错误
正确答案: B
解析: 上下文缓存可能降低重复输入的处理成本或延迟,但命中的输入仍然属于本次模型能够看到的上下文,依然会占用 Context Window。缓存优化和窗口容量是两个不同问题。
19
题型: 判断题 难度: 中等
题干: 只要把 Temperature 设置得足够低,模型就不会再产生幻觉。(理解题)
选项A: 正确 选项B: 错误
正确答案: B
解析: Temperature 控制的是生成随机性,不负责验证事实。较低的 Temperature 可能让回答更加稳定,但模型也可能稳定地生成同一个错误答案。降低幻觉还需要可信数据、检索、工具、规则校验和拒答机制。
20
题型: 判断题 难度: 中等
题干: Self-Attention 中的 Query、Key 和 Value 是三个不同的 Token。(复习题)
选项A: 正确 选项B: 错误
正确答案: B
解析: Q、K、V 不是三个 Token。同一个 Token 的向量会经过三组不同的线性变换,得到自己的 Query、Key 和 Value。上下文中的其他 Token 也会分别生成自己的 Q、K、V。
21
题型: 简答题 难度: 中等
题干: 请说明大语言模型、聊天机器人和 Agent 的区别,并各自给出一个例子。(复习题)
参考答案:
○ 大语言模型负责根据当前输入和上下文生成内容,例如 DeepSeek 背后的语言模型。
○ 聊天机器人是在模型外增加聊天界面、历史消息保存、联网搜索等能力形成的产品,例如网页中的 AI 对话助手。
○ Agent 是由模型、应用代码、状态、数据和工具共同组成的任务执行系统。它可以根据目标决定下一步行动,并通过工具查询或修改外部系统。
○ 三者不能直接画成简单的包含关系。模型是核心生成能力,聊天机器人和 Agent 是围绕模型构建的不同应用形态。
22
题型: 简答题 难度: 困难
题干: 用户在聊天页面发送一句话以后,到模型返回回答为止,应用程序和模型服务大致经历了哪些步骤?(流程题)
参考答案:
○ 前端把当前输入和会话标识发送给后端。
○ 后端读取必要的历史消息、系统要求和业务资料,并组装成 Message。
○ 应用根据 Context Budget 筛选本轮需要发送的内容,并为模型输出预留空间。
○ 模型服务把 Message 转换成 Token 序列,模型根据上下文不断预测后续 Token。
○ 新生成的 Token 会继续加入上下文,直到遇到结束标记、长度限制或其他停止条件。
○ 应用接收完整或流式输出,将回答展示给用户,并根据业务需要保存新的 Message 和 Token Usage。
23
题型: 简答题 难度: 困难
题干: 某模型的 Context Window 是 8,000 Token。系统计划为输出预留 1,500 Token,为后续工具结果预留 500 Token。系统指令和当前问题已经占用 2,000 Token,历史消息还有 5,500 Token。请说明本轮输入预算是多少,以及应用应该怎样处理历史消息。(计算与实践题)
参考答案:
○ 本轮能够用于输入的总预算是 8,000 - 1,500 - 500 = 6,000 Token。
○ 系统指令和当前问题已经占用 2,000 Token,因此最多只剩 4,000 Token 可以分配给历史消息。
○ 5,500 Token 的历史消息不能全部发送,应用需要筛选与当前任务有关的消息。
○ 常见处理方式包括保留系统指令和当前问题、优先保留最近的完整对话轮次、保留关键业务事实,并把较早内容压缩成摘要。
○ 不能机械地从中间截断一条 Message,也不能只按时间删除消息,否则可能破坏一轮完整对话或者丢失完成当前任务需要的关键信息。
24
题型: 简答题 难度: 困难
题干: 请为下面四类任务选择合适的处理路线,并说明原因:改写一段通知、分析多个相互影响的业务规则、识别商品破损照片、判断退款金额是否超过 2,000 元。(场景题)
参考答案:
○ 改写一段通知可以使用普通模型,因为任务主要涉及文本理解和语言生成。
○ 分析多个相互影响的业务规则可以使用推理模型,但关键业务结论仍应接受普通代码或规则系统校验。
○ 识别商品破损照片需要使用支持视觉输入的多模态模型。
○ 判断退款金额是否超过 2,000 元应该直接使用普通代码,因为这是确定性的数值比较,不需要模型参与。
○ 模型路由的核心不是永远选择能力最强的模型,而是先判断任务是否需要模型,再选择满足任务要求的处理路线。
25
题型: 简答题 难度: 困难
题干: 请结合 Transformer 的处理流程,回答下面三个问题:模型为什么能够结合上下文?为什么能够判断哪些 Token 更值得关注?为什么 Context Window 变长以后,成本和延迟通常会增加?(综合题)
参考答案:
○ 文本先经过 Tokenizer 变成 Token 和 Token ID,再通过 Token Embedding 转换成向量,Position Encoding 为这些向量补充位置信息。
○ Self-Attention 会使用当前位置的 Query 与上下文 Token 的 Key 计算匹配分数,再根据注意力权重汇总对应的 Value,使当前 Token 的表示融合上下文信息。
○ Multi-Head Attention 使用多组 Q、K、V 参数计算不同的注意力分布,让模型有机会同时捕捉多种上下文关系。
○ MLP 会继续加工 Attention 汇总回来的信息,Residual 和 LayerNorm 帮助信息传递与训练保持稳定,多层 Transformer Block 会不断更新 Token 表示。
○ Context Window 变长后,模型需要处理更多 Token。Self-Attention 还要计算更多 Token 之间的关系,因此计算量、显存占用、输入 Token 费用和响应延迟通常都会增加。
