第二课:大型语言模型如何产生答案
认识token、上下文、训练与推理,理解大型语言模型为什么能写得流畅、为什么会幻觉,以及怎样提高回答可靠度。
Published 2026-08-03 · Updated 2026-08-03

大型语言模型常被简称为 LLM。它能总结、写作、翻译、分析和生成代码,但它不是把一整套“正确答案数据库”储存在脑中。理解它如何逐步产生文字,能帮助你正确使用模型,也能解释为什么它有时非常有用、有时却会自信地答错。
这堂课适合谁
- 经常问 AI 问题,却发现同一问题会得到不同答案的人
- 想理解上下文、token、模型和幻觉这些常见术语的人
- 需要用 AI 写文章、研究资料、客服内容或代码的人
- 想为后续 Prompt 和 Agent 学习打基础的人
从文字切成 Token 开始
模型不会像人一样直接看到完整句子。输入通常会先被切成 token,可以是一个字、词的一部分、标点或其他片段。模型处理的是 token 序列,并根据前面的内容预测接下来较可能出现的 token。
例如,当你输入“马来西亚的首都是”,模型会根据学到的语言与知识模式,提高“吉隆坡”相关 token 的概率。但这仍是预测过程,不是向政府数据库进行即时验证。
训练与使用是两个阶段
训练阶段
模型从大量资料学习语言、结构、关系和任务模式。训练过程会调整大量参数,使模型更擅长预测后续内容。训练资料、截止时间、清理方法和授权范围因模型而异,不能假设所有模型拥有同一知识。
推理阶段
你实际使用模型时,系统会把你的 Prompt、对话、上传资料和工具结果放进当前上下文,再生成答案。这个阶段通常不会自动把你的每次聊天变成即时永久知识;资料是否被保留或用于改进模型,要看产品版本、账户设置和隐私政策。
上下文为什么重要
上下文是模型当前可参考的资料范围。一个好的上下文通常包含目标、读者、事实资料、限制、例子和输出格式。
如果你只说“写一篇产品介绍”,模型只能用一般模式猜测。若你提供官方功能、价格、目标客户、不可承诺事项和示例语气,输出会更接近真实业务需求。
上下文也有容量限制。长对话并不保证每个细节都会被同等重视,因此重要限制应放在清晰位置,并在最终检查时再次确认。
AI 幻觉是什么
“幻觉”指模型产生看似合理、实际上无依据或错误的内容,例如虚构网址、论文、功能、价格、人物引语或计算结果。常见原因包括:
- 问题要求模型提供它没有可靠资料的细节
- Prompt 暗示必须给出答案,模型没有“未知”选项
- 上下文互相矛盾或缺少关键资料
- 模型把语言模式当成事实关系
- 搜索、工具或资料读取失败,但系统仍继续生成
降低幻觉的方法不是叫 AI “绝对不要答错”,而是提供资料、要求标示未知、限制结论范围,并使用外部证据核对。
实际操作:比较无上下文与有上下文的结果
第一步:提出模糊问题
先问:“帮我推荐一个适合马来西亚小商家的 AI 工具。”观察模型是否自行猜测行业、预算和任务。
第二步:补足上下文
说明商家类型、每月预算、主要任务、资料敏感度、使用语言、团队人数和期望结果。
第三步:要求证据与未知项
让模型把“已由你提供的事实”“需要官方网页核实的资料”和“建议”分开,不允许把建议写成事实。
第四步:比较两次输出
检查第二次是否更具体、假设更少、风险更清楚。把仍然需要验证的项目列成清单,而不是继续要求模型肯定回答。
示例 Prompt
请根据我提供的资料比较两个 AI 工具,不要使用未提供的价格或功能。
使用者:马来西亚 3 人电商团队
主要任务:中文商品文案、英文邮件初稿、每周数据摘要
限制:每月预算 RM150;不得上传客户身份证、地址或未公开销售表
资料来源:我会在下一段贴上两个工具的官方功能页内容
输出格式:
1. 适合的任务
2. 不适合的任务
3. 资料隐私检查问题
4. 仍未知、需要访问官方页面确认的项目
5. 试用 7 天的测试计划
若资料不足,请明确写“无法从现有资料确认”,不要猜测。练习:建立事实、推论与建议三栏表
找一项你熟悉的主题,让 AI 产生一份建议。然后把每一句重要结论分成三类:
- 事实:能由官方文件、原始数据或可靠来源验证
- 推论:根据事实作出的判断,但可能有其他解释
- 建议:针对目标提出的行动选项
如果模型无法说明一句话属于哪一类,就先不要对外发布。
注意事项
- 不同模型、版本和设置可能产生不同结果。
- 模型的知识截止时间与联网能力必须查看当前产品说明。
- 更长的答案不一定更准确;应优先要求结构、证据与限制。
- 上传文件后仍要确认模型是否完整读取,而不是只根据文件名猜测。
- 数学、代码和事实结论应使用计算器、测试、原始资料或专业人士复核。
完成检查
- 我能解释 token、训练、推理和上下文的基本意思。
- 我知道语言模型是在生成较可能的后续内容,不是自动查证事实。
- 我能列出至少三种造成幻觉的情况。
- 我会在 Prompt 中允许模型回答“未知”或“资料不足”。
FAQ
模型越大是否一定越准确?
不一定。模型能力还受训练资料、任务类型、工具、提示方式、版本和安全限制影响。特定小模型在固定任务上也可能更快、更便宜或更稳定。
为什么同一个 Prompt 会得到不同答案?
生成过程可能包含随机性,产品版本、系统指令、上下文和工具结果也会变化。需要稳定结果时,应固定输入、格式、模型版本和测试案例。
AI 有真正理解文字吗?
“理解”在技术和哲学上有不同定义。实际使用时,更安全的做法是评估可观察能力和错误,而不是假设模型拥有和人类相同的理解、意图或责任。
上下文越多越好吗?
不是。无关、重复或冲突资料会降低重点。应提供与目标直接相关、来源清楚并经过整理的内容。
官方延伸阅读
- Google:Introduction to Large Language Models
- Google Machine Learning Crash Course
- OpenAI Prompt Engineering Guide
总结与下一课
LLM 根据 token、训练模式和当前上下文逐步生成内容。它可以非常有用,但没有自动保证事实正确。高质量使用方式是提供可靠上下文、允许未知、要求结构,并在模型外进行验证。
下一课:Prompt 基础:把需求说清楚。返回 AI基础学习中心 可查看进度。
Related
相关文章
第一课:认识AI、机器学习与生成式AI
用零基础能理解的方式分清人工智能、机器学习、生成式AI和AI Agent,并学会判断一个任务是否适合交给AI。
第三课:Prompt基础,把需求说清楚
学习用目标、背景、资料、限制和输出格式组成可复用Prompt,并通过两轮修改得到更可靠的AI结果。
第四课:核实AI输出与资料来源
建立事实核查、来源分级、交叉验证和不确定性标记流程,避免把AI生成的错误数字、引语和链接直接发布。