当本体遇上大模型:知识工程的文艺复兴
符号主义与连接主义从对立走向融合:GraphRAG、本体约束生成,以及企业知识资产化的新路径。
从对立到融合:两条路线的和解
AI 历史上有两大阵营。符号主义(Symbolism)主张知识显式表示、逻辑推理,知识图谱(Knowledge Graph, KG)与本体(Ontology)是它的巅峰产物;连接主义(Connectionism)主张从数据中学习,神经网络一路演化出今天的大语言模型(LLM)。过去几十年,两派互相看不上:符号派嫌神经网络是黑箱、不可解释;连接派嫌知识工程成本高、扩展难——两个批评都对。
LLM 的成熟让局面发生了变化:双方最好的部分开始融合。LLM 补上了符号系统最难的一环——从非结构化文本中自动提取结构(实体识别、关系抽取);而符号系统补上了 LLM 最难的一环——事实性与一致性。过去构建一个领域本体需要领域专家和知识工程师投入数月逐条录入概念;今天让 LLM 读完全部文档后产出候选概念和关系,人工只做校验与裁剪,构建成本下降了一个数量级——这不需要具体统计数字佐证,任何一个做过老式知识工程项目的人都能直观感受到差距。我们认为,这个成本结构的变化才是两者结合的真正引爆点:不是”LLM 更聪明了”,而是”本体变得便宜了”。
GraphRAG 与结构化检索
融合最落地的形态是 GraphRAG。传统 RAG(检索增强生成)把文档切块、向量化、按相似度检索,缺点是只能回答”某段文档里写了什么”;而企业里大量真实问题是关系型、汇总型的——“A 公司的所有子公司的法人都属于哪些领域”。向量检索对这类问题天然乏力。
GraphRAG 的做法是:先把文档沉淀成知识图谱,检索时既走向量相似度,也走图遍历,把结构化的关系事实作为上下文交给 LLM。本体在这里扮演图 Schema 的角色:它保证了抽取出的实体和关系语义一致,否则不同文档抽取出来的”客户”根本对不上号。关于 RAG 与 LLM 基础机制,可参考《大模型基础:从 Token 到上下文》。
本体约束生成:用 Schema 校验输出
第二个融合点是本体约束生成(ontology-constrained generation)。思路很直接:LLM 负责生成,本体负责验收。例如要求模型输出 JSON 格式的”雇佣关系”时,先定义好本体——雇佣 关系必须连接 公司 和 自然人,雇佣开始时间 必须早于 结束时间——然后在校验环节用这些公理逐条检查模型输出,不合法就打回重生成。
这相当于给生成过程装上了类型系统。LLM 的幻觉不可能根除,但可以被约束在”结构上不可能错”的框架内:它也许会填错一个日期,但绝不会生成”公司雇佣公司”这种结构性胡话。在 Agent 系统里,这套约束同样重要——Agent 调用工具、传递参数时,本体就是接口契约的知识层版本,详见《什么是 Agent》。
从”文档堆”到”知识资产”
对企业来说,这条融合路线指向一个清晰的转型路径。绝大多数企业的知识现状是”文档堆”:文档在,但没人能回答跨文档的问题,更没有系统能消费它们。LLM 时代的知识资产化大致分三步:
- 文本可检索(向量化 + RAG):解决”找得到”,机器开始读文档。
- 知识结构化(抽取 + 本体):解决”读得懂”,文档中的事实变成图谱中可推理的节点与边。
- 知识可消费(Agent + 应用):解决”用得上”,结构化知识被 Agent 在执行任务时直接引用与校验。
第三步正是 Skills 与本体交汇的地方:Skills 封装”怎么做”的程序性知识,本体承载”是什么”的事实性知识,二者合起来才是完整的组织知识资产。这个判断我们在《Skills:把程序性知识交给 AI》中有展开。
小结
- 符号与连接两条路线正在从对立走向互补:LLM 让本体构建成本下降一个数量级,本体让 LLM 输出可校验。
- GraphRAG 解决关系型检索,本体约束生成解决结构化输出,两者都已可工程落地。
- 企业知识资产的路径:从文档堆,到可检索,到结构化,到被 Agent 消费——LLM 让本体第一次有了经济上可行的建法。
延伸阅读:《本体论落地:让知识被机器理解》、《企业本体建设实战:从第一个域开始》、《Skills:把程序性知识交给 AI》