Ontology · 本体
适合 产品经理
本体论落地:让知识被机器理解
本体是关于概念、关系与公理的形式化说明,是让知识摆脱自然语言歧义、被机器可靠消费的地基。
更新于 2026-09-25 # 本体# 知识图谱# 知识工程
什么是本体:概念、关系与公理
在信息科学里,本体(Ontology)指的是对一个领域内概念、概念间关系以及约束规则的形式化、显式的说明。这个词借自哲学中的本体论(研究”存在什么”的学问),但在工程语境下它非常具体:本体回答的是三个问题——
- 这个领域里有哪些概念(类,Class)?如”公司""员工""产品”。
- 概念之间有什么关系(Property / Relation)?如”公司—雇佣—员工""员工—负责—产品”。
- 有哪些公理(Axiom / 约束)?如”一个员工至多被一家公司雇佣为全职""产品必须有归属团队”。
用最经典的三元组(Triple)表示:(公司 A)—[雇佣]→(员工 B)。一条三元组是一个事实,一堆三元组加上本体约束,就构成了知识图谱(Knowledge Graph, KG)的骨架。你可以把本体理解为知识图谱的”Schema + 语法”:它不存储数据,但规定了什么样的数据可以被表达、什么表达是非法的。
本体、数据模型与分类法有什么不同
三个容易混淆的概念,从弱到强排一下:
- 分类法(Taxonomy):只定义”是一种”(is-a)的层级关系,比如”产品经理是员工的一种”。它是一棵树,表达力最弱,但成本最低。
- 数据模型(Data Model):定义实体、字段和表结构,如数据库 Schema。它描述数据的形状,但语义是隐式的——外键
company_id并不天然蕴含”雇佣”这层业务含义。 - 本体(Ontology):在分类法之上,任意关系、公理约束、可推理的语义都是显式定义的。它不只是描述数据长什么样,还规定数据意味着什么,因此可以支撑逻辑推理——比如从”张三被 A 公司全职雇佣”和公理”全职员工至多一人”自动推出”张三不在 B 公司全职任职”。
一句话区分:分类法管归类,数据模型管存储,本体管理解。
为什么 LLM 时代本体反而更重要
有一种流行的看法:大语言模型(LLM)已经”理解”了语言,结构化的知识表示是不是过时了?我们的判断恰恰相反——LLM 越强,本体越重要,原因有三:
- 自然语言是有歧义的,而企业知识需要无歧义。同一个”客户”,在销售系统里指公司、在客服系统里指联系人、在财务系统里指开票主体。LLM 拿到这三份文档时无法自动消歧,本体提供的统一概念层正是跨系统的”翻译协议”。
- LLM 会产生幻觉(Hallucination)。它是按概率生成最像答案的文本,而不是按事实生成正确的答案。要约束它,就需要一个外部的、机器可校验的事实框架——这正是本体的用武之地。
- 企业知识不止是文本。合同条款、库存关系、权限规则,这些本质上是结构化关系,硬塞进非结构化文本里再让模型”阅读理解”,效率与可靠性都远不如直接给出结构化表示。
这也是”词元语宙”这个名字的一个注脚:LLM 在词元(Token)构成的宇宙里生成文本,但企业需要的是可依赖的知识——本体就是从”语言的宇宙”通往”可靠知识”的那座桥。
小结
- 本体 = 概念 + 关系 + 公理的形式化说明,是知识图谱的语义骨架。
- 它比分类法表达力强,比数据模型多一层可推理的显式语义。
- LLM 时代本体不是过时了,而是成了对抗歧义与幻觉的基础设施——本体是给幻觉打的”地基”:模型再会说话,也要踩在明确的事实与规则上。
延伸阅读:《当本体遇上大模型:知识工程的文艺复兴》、《企业本体建设实战:从第一个域开始》、《大模型基础:从 Token 到上下文》