大语言模型:从词元到智能
用"预测下一个词"这一个机制,解释大语言模型的能力从哪来、边界在哪,以及如何正确地把它嵌入系统。
一切从词元开始
大语言模型(Large Language Model, LLM)不认识”字”,也不认识”词”,它认识的是词元(Token)——文本被切分后的最小单位。一个英文单词可能是 1 个 token,一个中文词语通常是 1 到 2 个 token,生僻字甚至要占更多。模型读到的不是句子,而是一串 token 编号;它输出的也不是”答案”,而是逐个 token 生成的序列。
这个切分方式解释了很多日常困惑:为什么按 token 计费时中文和英文成本不同?为什么模型的”字符数限制”要换算成 token 才准确?答案都藏在分词器(Tokenizer)里。对使用者而言,不必深究分词算法,但要建立直觉:token 是模型世界的原子单位,一切输入输出都以它计量。
预测下一个词,为什么能产生”智能”
LLM 的核心机制朴素得近乎简陋:给定前面的所有 token,预测下一个 token 的概率分布,采样一个,拼回去,再预测下一个。如此循环,直到生成结束。
真正的分水岭在于规模。当模型在近乎整个互联网的文本上训练、参数量达到一定量级后,这个简单目标涌现出了意想不到的能力:续写代码、做翻译、推理多步逻辑、进行角色扮演。一个常被引用的直觉是——要把”预测下一个词”做好,模型在内部不得不学会语法、事实、风格,甚至某种推理。比如要准确续写”光在真空中的速度是”,模型必须”记住”这个事实;要续写一道数学题的推导过程,它必须”会做”某种近似推理。
需要诚实说明的是:这是涌现(Emergence)现象,学界对其机制与是否真实存在仍有争议。但工程事实是清楚的:今天的 LLM 在大量任务上表现出了可用的、类智能的行为,尽管其内部原理尚未被完全解释。
能力与三条硬边界
把 LLM 用好,先要接受它的三条结构性局限:
幻觉(Hallucination)。 模型的本职是生成”概率上合理”的文本,而不是”事实上为真”的文本。当训练数据里没有答案时,它倾向于编一个看起来可信的,而不是承认不知道。引用、数字、人物履历是幻觉重灾区。
知识截止(Knowledge Cutoff)。 训练完成的那一刻,模型的世界就定格了。此后发生的事件一概不知。缓解手段是检索增强生成(Retrieval-Augmented Generation, RAG)等外部供给方案,详见《上下文窗口与记忆:大模型的工作记忆之谜》。
推理局限。 模型没有内建的”验算”机制,长链条推理容易在中间步骤出错且不自知。对于确定性要求高的任务,需要外部校验或专门的推理框架,而不是盲目信任。
观点:把 LLM 当”能力极强的实习生”
一个反复被验证的心智模型:LLM 像一位阅读量惊人、上手极快、但会一本正经说错话的实习生。
你不放心让实习生未经审核直接对外发文,同样不该让 LLM 的输出直通用户;你会给实习生明确的任务说明与背景材料,同样应该给模型清晰的指令与上下文;你不会因为实习生偶尔出错就弃用他,而是设计审核流程兜住错误。
据此得出本篇观点:不要把 LLM 当”全知的神”来设计产品,要把它当”能力极强的实习生”来设计系统——围绕它建审核、校验、溯源机制。前者带来失望与事故,后者带来生产力的真实提升。当系统需要实习生去”动手干活”而不仅是”开口说话”时,就进入了 Agent 的领域,参见《什么是 AI Agent:从对话到行动》。
小结
- LLM 以 token 为单位处理文本,其唯一核心机制是”预测下一个 token”。
- 规模化让简单目标涌现出复杂能力,但机制仍未被完全解释,应保持敬畏。
- 三条硬边界:幻觉、知识截止、推理局限,均有工程缓解手段但无法根除。
- 正确姿势:把 LLM 当能力极强的实习生,用系统设计弥补个体不可靠。