第7篇|必懂术语(下):Token、幻觉、微调、RAG

2026/07/26 AI

本篇目标:上篇讲了 Prompt、对话、上下文窗口。这篇再补四个”圈内黑话”:Token(字数怎么算)、幻觉(AI 一本正经胡说)、微调(给 AI 开小灶)、RAG(让 AI 先查资料再答)。听懂这八个,圈内人聊天你基本能跟上了。

“你刚才说的 Token 是啥?幻觉?我怎么听不懂……”

别慌,这四个词听着唬人,拆开其实都挺好懂。上篇的三个词你懂了,这篇再加四个,术语基础关就算过了。


一、Token:AI 眼里的”字数”

Token 不是”字”,是 AI 把文字切碎后最小的计算单位。

你发一句话给 AI,它不会一个字一个字看,而是先切成一堆小碎块,每个碎块叫一个 Token。

拿中文举例(粗估,不绝对):

  • 一个汉字 ≈ 1~2 个 Token
  • 一个英文单词 ≈ 1 个 Token 左右
  • 连标点、空格也都各算 Token

Token 切片示意

为什么你要懂它? 因为三件和钱、和长度有关的事都跟它挂钩:

  • 收费按 Token 算:你发得多、它回得多,Token 就多,账单就涨(免费档一般有额度上限)。
  • 长度有限制:上篇说的”上下文窗口”,它的真实单位就是 Token 数。窗口能装多少字,本质是能装多少 Token。
  • 中文更”费”:同样一段话,中文比英文切出的 Token 通常更多,所以中文对话更容易触到额度天花板。

一句话记住:Token 就是 AI 记账的”字”。 你不用会算,但要知道”话越长、Token 越多、越容易撞上限(导致AI失忆)、费用也就越高”。


二、幻觉:AI 一本正经地胡说八道

幻觉(Hallucination)= AI 编出了看起来很对、其实根本不存在的内容。

最典型的几种表现:

  • 编了一本不存在的书 / 论文 / 法条,还附上”看起来很真”的引用
  • 把两个不相关的概念硬凑成因果关系
  • 过时、错误的信息当成事实讲,还特别自信
  • 算数算错,错了也不带慌的

重点:幻觉不是 Bug,是 AI 的”出厂特性”。 它的底层逻辑是”根据上下文接龙生成下一个词”,不是在数据库里检索真相。所以它一定会给你答案,只是这个答案未必是对的。

应对三招(先记着,够用很久):

  1. 关键事实自己核对:人名、数据、法规、技术参数、引用出处,照抄之前先核对。
  2. 让它给出处:问”这个说法的来源是?”编的内容往往给不出可靠来源。
  3. 重要场合加一句”请标明你不确定的地方”:逼它自己暴露盲区。

回看第 4 篇”AI 不能做什么”,幻觉就是头号坑。到这里你终于知道它叫什么、长什么样了。

幻觉示意


三、微调:给 AI 开”小灶”

微调(Fine-tuning)= 在通用大模型基础上,用一批专门数据再训练,让它更懂某个领域。

打个比方就清楚了:

  • 通用大模型 = 一个上过九年义务教育、啥都懂点的毕业生
  • 微调 = 派他去进修某个专业(比如医学、法律、你们公司的内部话术)
  • 进修完 = 他在这个领域比旁人更”对口”

微调流程

小白要懂到什么程度?

  • 平时用现成工具,基本碰不到微调,那是厂商和开发者干的事,AI领域,但凡提到训练,那动辄就是几百上千万的成本投入。
  • 但你知道这个词,就能看懂广告里”某产品做了医疗微调”——意思就是它在通用能力上额外专修了医学
  • 很多”公司自己的 AI 助手”,底层就是”通用模型 + 公司私有的数据(微调或 RAG)”。

四、RAG:让 AI 先查资料再开口

RAG(检索增强生成)= 先去你的资料库里查出相关内容,再把查到的东西喂给 AI 一起答。

它是解决”幻觉 + 记不住私有资料”的常用办法。

对比一下就懂:

  • 不用 RAG:AI 凭”自己脑子里的记忆”答 → 可能编、可能过时、没有私有数据
  • 用 RAG:AI 先翻你的数据,找到相关答案,再基于这些段落回答 → 更准、可溯源

RAG 原理

小白记住一句RAG = 让 AI 先翻你的资料再说话。 当你想让 AI 用”你们公司的制度 / 你的读书笔记 / 某份合同”来答时,背后多半就是 RAG。后边会带你深入了解RAG,真正玩一次。


五、四个词串成一句话

  • Token 是 AI 记账的”字”,话越长费得越多、越容易撞上限
  • 幻觉 是 AI 一本正经胡说八道,关键事实要自己核对
  • 微调 是给 AI 开小灶,让它更懂某一行
  • RAG 是让 AI 先查你的资料再答,更准、可溯源

上篇三个 + 这篇四个,八个术语齐了,圈内人聊天你不会再懵。


提示词模板盒子

复制下面这段,发给 AI,让它帮你”揪出幻觉”(检验一段内容靠不靠谱)。

你是一个严谨的事实核查助手。
下面是我从别处(或AI)得到的一段内容:[粘贴内容]。
请帮我:
1. 标出其中哪些事实/数据/引用可能不可靠(疑似"幻觉"或编造);
2. 对每条不可靠内容,说明为什么可疑;
3. 给我 1-2 个可以自行核对的检索方向(不要直接编造答案)。
要求:不确定就明说"无法确认",不要替我下绝对结论。

下篇预告

术语关过了,接下来进入”真刀真枪选工具”:ChatGPT、Claude、通义、文心、豆包、Kimi、DeepSeek……到底该用哪一个?下一篇(国内外 AI 工具大阅兵)给你一张速选表,5 分钟定下来。

Search

    Post Directory